英文题目:FakeSound2: A Benchmark for Explainable, Traceable, and Generalizable Deepfake Sound Detection

会议身份:conference:interspeech:2026:conference-paper-id:xie26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准设计 #可解释性 #鲁棒性 #音频深度伪造检测 #音频事件检测

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Zeyu Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Yaoyun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuenan Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yongkang Yin:机构信息未能从会议 PDF 纯文本可靠映射
  • Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Mengyue Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuexian Zou:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

深度伪造声音检测的输入为通用音频片段,理想输出需同时回答是否伪造、何时伪造、如何篡改与源自何处,难点在于生成器快速迭代导致模型过拟合特定伪影,且相似操纵与同构架构在表征空间高度纠缠。本文构建FakeSound2基准,其方法链为事件定位先确定关键语义片段与掩码位置,元数据处理用大语言模型解析删增事件子句生成目标描述,音频操纵阶段按目标描述调用多生成器与规则脚本合成并拼接回放,最后仅对测试集用对比语言音频预训练相似度过滤保留高质量样本。与仅做片段级二分类的已有基准相比,该机制差异在于显式区分生成、编辑、内补、分离、拼接、添加共6种操纵类型与12种来源,并预设域内域外划分,使定位、可解释溯源与泛化可被独立度量。在域内与域外划分的评测下,基线在域外条件的操纵类型准确率为32.4%,低于域内条件的操纵类型准确率93.1%,暴露了能检出异常却说不清成因的溯源失效。该结论基于以 AudioCaps 为底座的通用声音场景,未验证纯语音伪造与音语音联合篡改。原文未披露训练推理成本与延迟吞吐。

🔗 开源与复现资源

  • 数据相关资源:https://zeyuxie29.github.io/FakeSound2/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?这篇解读要帮你复述什么?

本文解读的输入是 FakeSound2 论文原文与本次收到的 3 张官方原图像素,目标是让刚进入语音、音乐与音频方向的研究生能够不依赖营销式判断,独立复述该基准为什么做、怎么做、怎么测以及得出什么限制。

解读必须保留的关键信息包括 6 种操纵类型与 12 种来源的划分、片段级与帧级的区别、定位、可解释性与泛化 3 个评估维度、自动化构造流水线的 4 个阶段、基线模型的编码器与主干结构、训练轮数与优化器设置、域内与域外划分数量,以及从域内到域外操纵类型精度大幅下降的核心证据。输出形式是按学习依赖展开的连续自然段落,中间穿插可核对的数据表与原图导读,例子会明确标为例子,不把教学假设当作论文报告的数值。

读者可以把本文当作复现清单使用:先理解任务定义,再走通一个样本从原始音频与描述到掩码、改写描述、生成伪造片段与拼接的全过程,然后对照实验条件检查指标方向与适用边界,最后明确该基准没有解决的语音伪造等细分场景。资源状态方面,本次收到的资源证据显示数据集链接状态为可用,因此可以写当前已公开可用,复现时应以该官方页面为准核对版本与下载方式。

已有路线解决了什么?为什么还缺可解释的声音检测?

在视觉与语音伪造检测方向,已有工作把检测做成片段级二分类,即判断整段输入是真还是假,并在特定挑战赛与数据集上取得较强表现。论文把这类路线归纳为只回答真假,不回答何时伪造、如何伪造与伪造内容来自哪里,因此在安全敏感应用与法律取证中价值有限。

另一条相关路线是环境声音伪造检测与伪造痕迹增强检测,它们开始关注非语音音频与细粒度痕迹,但原文指出这些方法仍主要围绕二分类精度,缺少对操纵方法识别、时间定位与来源归属的系统评估。生成侧的快速演进进一步放大了缺口:文本到音频生成、音频编辑、语言查询分离等模型不断出现,检测器若只记住某个生成器的表面痕迹,新生成器出现就会失效。

举例来说,这只是教学例子而非论文数值:若检测器靠某种扩散模型的特定高频噪声判断真假,换一个采用不同声码器或流匹配的模型就可能绕过。FakeSound2 的定位因此不是再提一个更高的二分类分数,而是提供一个诊断工具,稳定地比较不同方法在定位、可追溯与泛化上的行为差异。理解这层关系后,后续的方法全景与实验条件才有意义,否则容易把域内高分误读为真实可用。

要解决的任务是什么?三个维度如何分工?

论文把可解释的声音伪造检测定义为 3 个相互补充的问题。第一是定位,也就是不仅判断整段真假,还要在帧级操纵场景中标出伪造片段的时间起止,例如哪几秒被修复或替换。第二是可解释性与可追溯性,也就是识别操纵方法与追溯操纵内容的来源,前者区分生成、编辑、修复、分离、拼接与叠加 6 类做法,后者区分具体是哪个生成模型或是否来自真实录音拼接。第三是泛化,也就是在训练完全未见的新来源上仍保持可用,而不是只在见过的生成器上表现好。图的上半部分把这种拆分表达得很直接,读图前需要先建立这种三分工的预期,否则会把 3 个任务混成一个真假分数。

片段级操纵 × 帧级操纵: 片段级操纵指整段音频都是合成的,帧级操纵指只改其中选定的时间帧,二者搭配的理由是前者考验全局真伪判断,后者考验时间定位,组合意义是让一个基准同时覆盖整段造假与局部篡改两种取证需求。

可解释性 × 可追溯性: 可解释性分工是回答如何伪造即识别生成、编辑、修复、分离、拼接、叠加中的哪一种,可追溯性分工是回答伪造内容来自哪个生成模型或真实素材,搭配理由是只知道类型不知道来源仍无法定责,组合意义是把检测输出变成可核查的取证链。

看图路径: 1. 先看上半部分三个任务框如何把检测拆成辨别类型、定位起止时间与追溯来源;2. 再看下半部分左右两个频谱示例如何对应伪造与真实的不同输出;3. 注意伪造示例标注的修复类型、2-3 秒区域与回溯模型三行信息;4. 对比真实示例为何三行输出均为无或真实以理解定位与追溯的缺省行为

原论文 Figure 1:The explainable deepfake detection need identify the manipulation method (how), localize the…

论文图 1。原论文 Figure 1:“The explainable deepfake detection need identify the manipulation method (how), localize the temporal positions of forgery (when), and trace the accountable sources (where).”。

从图中可见,上方 3 个任务框分别对应辨别类型、定位区域与追溯来源,下方左侧伪造频谱用红框标出可疑区并输出修复类型、时间区域与回溯模型,右侧真实频谱则输出真实与空区域,这种对照说明检测输出不是单一标签而是一组结构化取证结论。论文进一步把 6 种操纵按时间粒度分为片段级与帧级:生成与编辑属于片段级,整段音频为合成;修复、分离、拼接与叠加属于帧级,只有选定帧被改动并与真实片段拼接。

其中拼接与叠加依赖真实录音而非完全合成,论文保留它们是为了覆盖更多样伪造模式,而不是只测生成模型痕迹。初学者容易误以为真实素材拼接不算伪造,但在此基准中只要时间与内容被人为改变并影响语义,就纳入伪造评估,只是来源标注为真实。

数据集构造全景:一个样本走完全流程

FakeSound2 的构造起点是 AudioCaps 数据集提供的音频与描述对,流水线包含事件定位、元数据处理、音频操纵与质量过滤 4 个阶段。为了便于复述,先沿一个样本走完输入到输出。假设原始描述是有人说话同时喷雾器喷洒,输入音频中包含对应两个事件。第一步用文本到音频 grounding 模型定位语义丰富的关键片段,给出每个事件的开始与结束时间,并按任务需要掩去其中一段。

第二步用大语言模型把原始描述解析为分句,例如拆成有人说话与喷雾器喷洒,再按任务目标删除旧事件并插入新事件,例如删除喷雾器喷洒并插入狗叫,形成目标描述。第三步按目标描述调用生成模型或规则脚本合成新片段:片段级任务直接整段生成或编辑,帧级任务只生成被掩码部分再与真实部分拼接。

第四步在测试集上用对比语言音频预训练模型计算操纵后音频与目标描述的相似度,低于以原始音频与原始描述相似度为阈值的样本会被丢弃,从而得到过滤后的测试子集。

为了理解各阶段如何衔接,需要先看流水线总图的分栏与箭头方向,重点是定位输出的掩码如何流向操纵阶段,元数据输出的目标描述与素材如何同时约束生成与拼接。

看图路径: 1. 沿顶部定位分支看频谱如何经过文本到音频 grounding、红框标定再到掩码留白;2. 看左下元数据分支如何把原始描述改写为目标描述并从事件库取出插入素材;3. 对比右下片段级与帧级两组盒子区分生成模型与规则操作的颜色与连线;4. 跟踪替换箭头如何把新生成片段放回掩码区形成带红框的最终伪造频谱

原论文 Figure 2:Manipulation pipeline: (I) An audio grounding model temporally localizes sound events and masks…

论文图 2。原论文 Figure 2:“Manipulation pipeline: (I) An audio grounding model temporally localizes sound events and masks segments; (II) The LLM generates target captions and inserts event descriptions…”。

从图中可见,顶部定位栏展示频谱从完整到红框标定再到白色掩码留白的过程,左下元数据栏展示原始描述经大语言模型改写为目标描述并从事件库取出插入事件素材的过程,右下操纵栏把片段级生成与编辑放在一侧,把帧级分离、修复、拼接与叠加放在另一侧,并用不同颜色区分生成模型与规则操作,最终通过替换箭头把新片段放回掩码区。

这种设计的好处是每一步都有可追溯标注:何时被改由 grounding 边界决定,如何改由任务名决定,何处来源由调用的模型或真实素材决定。需要注意的是,修复任务的掩码是随机选择以增强泛化,而其他任务更多围绕关键语义事件,这意味着不同操纵类型的定位难度本身就不一致,后续比较定位分数时要考虑这种构造差异。

定位、改写与合成组件各自做什么?

事件定位组件负责找出值得改的关键片段。论文使用文本到音频 grounding 模型,输入是原始音频与事件短语,输出是该事件的时间边界。选择语义丰富片段的理由是改动这些区域最容易被察觉且最具影响,例如把背景喷洒声换成狗叫比改动静音段更有取证意义。元数据处理组件负责生成目标描述与插入素材。论文使用 DeepSeek 模拟人类改写思路,先把描述拆成事件子句,再按任务删除或插入事件,并从全部解析子句与对应定位片段构成的库中挑选插入事件。

这种做法保证插入内容来自真实出现过的事件表达,避免凭空编造不自然的描述。音频操纵组件负责按目标描述执行合成。生成类调用文本到音频模型,编辑类按目标描述修改给定音频,分离类按目标描述移除指定事件后拼接剩余真实片段,拼接类按描述连接真实片段,叠加类按描述把外部真实片段插入原始片段。所有模型均用默认配置运行,目的是减少人工调参带来的不可比性。

质量过滤组件只作用于测试集,用对比语言音频预训练模型衡量操纵后音频与目标描述的一致性,不一致则丢弃。初学者应注意,过滤阈值取自原始音频与原始描述的相似度,这是一种相对阈值而非绝对分数,因此过滤后子集更干净但也可能偏向容易与文本对齐的样本。

音频编码器 × 主干网络: 音频编码器分工是用冻结的自监督预训练模型抽取细粒度声学表示,主干网络分工是用卷积加变换器加双向长短时记忆网络做帧级时序建模,搭配理由是前者提供通用听觉特征后者捕捉伪造的时间边界,组合意义是同时输出帧级真伪、操纵类型与来源 3 路预测。

基线检测模型的结构也遵循这种分工:冻结的音频编码器提供稳定表示,避免在有限伪造数据上过度抖动;后端的卷积、变换器与双向长短时记忆网络负责帧级时序判断与平滑;最后 3 路线性层分别预测帧级真伪、操纵类型与来源。这种一干多头的设计让定位、二分类、可解释与可追溯可以在同一前向中输出,便于后续诊断是定位强但归因弱,还是二分类强但泛化弱。

基线如何训练?哪些参数更新、损失如何加权?

基线训练的输入是构造好的训练集音频及其帧级真伪标签、操纵类型标签与来源标签,输出是每帧的伪造概率以及整段的操纵类型与来源预测。训练过程共进行 10 轮,使用 AdamW 优化器,学习率为 1 乘 10 的负 3 次方,编码器保持冻结,只有后端主干与分类头更新。帧级检测使用二元交叉熵损失,操纵类型与来源分类使用交叉熵损失,总损失是三者加权求和,权重分别为 0.5、0.01 与 0.01。

这种权重安排意味着优化重心明显偏向帧级真伪与定位,而把类型与来源作为辅助监督,复现时不应随意放大后两项权重,否则可能改变论文报告的强定位弱解释的现象。帧级预测后还会经过中值滤波平滑,再按是否所有帧都判为真实来决定片段级真伪标签。

论文未报告批量大小、学习率衰减、早停、随机种子与硬件耗时等细节,因此复现时需要明确记录这些缺项,不能从模型名称推定具体实现,也不能把冻结编码器等同于输出完全确定,因为数据打乱、初始化与滤波仍可能引入波动。若研究目标是无训练的检索或规则方法,该节对应的真实计算就是调用已有 grounding、语言模型与生成模型的推理过程,而非梯度更新,但本基线确实包含梯度训练,需要按上述条件执行。

数据划分、评估指标与公平条件是什么?

实验要回答 3 个问题:能否定位伪造时间,能否说清方法与来源,以及换到未见来源是否仍然有效。数据方面,论文报告训练集与测试集规模,以及测试集中域内与域外子集的划分,域外来源在训练中完全未见,这是检验泛化的关键公平条件。指标方面,片段级真伪准确率衡量整段判断,操纵类型准确率与来源准确率衡量可解释与可追溯,帧级 F1 衡量时间定位精度,数值越高越好。

比较的公平性依赖于划分方式:域内比较只在见过来源上进行,域外比较固定使用未见来源的生成器,例如生成任务的域外来源与编辑任务的域外来源各不相同,因此跨任务的域外分数不能直接比大小,只能分别看下降幅度。

下表整理数据规模问题:训练与测试各有多少样本,测试中多少用于域内与域外,这种划分如何支撑可控泛化评估,阅读时注意单位均为样本数且为原文报告的整数精度。

划分指标训练集测试集评估用途
全部数据样本数369,929 样本5,553 样本总规模核对
测试子集样本数3,896 样本域内部分1,657 样本域外部分泛化对照

表后需要说明主要收益与代价。较大规模训练集让模型有机会见到多种操纵与来源,有利于学习定位边界;明确的域内外切分让泛化评估可控,避免把新生成器混入训练。但代价是测试过滤后样本更少且分布可能偏向易对齐样本,拼接与叠加任务没有设置域外来源,因此不能用它们检验跨生成器泛化。未胜出的边界是论文未充分探索伪造语音与音画联合操纵,复现时不应把结论推广到说话人伪造场景。

域内评估 × 域外泛化: 域内评估分工是测量模型在训练见过的来源上的表现,域外泛化分工是测量在训练完全未见的新来源上的表现,搭配理由是生成器迭代快导致只看域内会高估可用性,组合意义是区分模型是学到伪造本质还是记住特定生成器的表面痕迹。

这种域内与域外的对照设计正是诊断是否记住表面痕迹的核心:若模型真正理解伪造本质,域外下降应较小;若大幅下降,则支持过拟合特定生成器痕迹的判断。

主结果:定位强、解释弱、换新来源大幅下降

论文报告基线在域内定位上表现强,但在可解释性与泛化上表现弱。阅读结果曲线前,应先明确左图按操纵类型着色、右图按来源着色,两图都是降维可视化而非单样本波形,同色代表同类,点云分散程度反映特征可分性,不能把点的疏密直接读成具体准确率数值。

看图路径: 1. 先看左图按操纵类型着色时真实簇与伪造大簇是否分离;2. 再看左图中编辑与生成、修复域内外点是否相互交叠;3. 切换到右图按来源着色观察域外新来源点是否散落而非聚成紧簇;4. 对照图例中域内与域外后缀区分哪些颜色代表未见过的生成器

原论文 Figure 3:The feature distribution of deepfake sound detection model via t-SNE.

论文图 3。原论文 Figure 3:“The feature distribution of deepfake sound detection model via t-SNE.”。

从图中可见,左侧按类型着色的分布中真实样本形成相对独立的簇,支持模型能较好分离真实与伪造,从而获得较高的二分类与定位分数;但编辑与生成、不同修复来源的点云相互交叠,说明相似任务目标或相似模型结构的样本在隐空间中纠缠,这与论文报告的编辑常被误判为生成、类型与来源准确率偏低的现象一致。右侧按来源着色的分布中,域外新来源的点更散乱,支持模型没有学到跨来源稳定的伪造分布,而是依赖训练集特定痕迹。

下表聚焦最关键的可运行对照:域内与域外操纵类型精度的变化,以及基线训练的轮数、优化器、学习率与损失权重,阅读时注意精度方向为越高越好,下降幅度越大泛化越差。

条件指标域内结果域外结果训练配置
操纵类型识别准确率93.1%32.4%10 轮 AdamW
优化目标损失权重0.50.01, 0.011 × 10−3 学习率

表后解释主要收益与具体代价。收益是二分类与时间定位在域内可靠,真实、叠加与拼接等含真实来源的样本特征相对聚集,说明模型在一定程度上学到真实性的概念。代价是可解释性不足:相似操纵之间缺乏语义可分的表示,换到未见来源后类型判断大幅下滑。反例是编辑任务的域外类型准确率更低,分离任务的域外也有明显下降,说明问题不是个别生成器偶发,而是跨来源的系统性脆弱。论文用报告与显示来陈述已测到的下降,用支持来解释可能的原因是记住表面痕迹,初学者应保留这种区分,不把相关性直接写成因果证明。

哪些对照支持脆弱性判断?失败条件在哪里?

论文没有做传统意义的模块消融,而是用域内外对照与特征分布作为反证。第一个对照是同一任务在域内与域外的表现差异:生成、编辑、修复与分离都在域外出现类型准确率下降,其中编辑与生成的混淆最典型,因为二者任务目标相近且都涉及整段语义重写,模型难以捕捉细粒度分布差异。

第二个对照是不同来源的特征交叠:同为修复但来自不同生成器的样本在隐空间中靠近,同为生成但架构相近的模型也纠缠,这支持模型按表面声学痕迹聚类而非按语义操纵聚类。第 3 个对照是真实相关类别的聚集:真实、拼接与叠加因含有真实录音而彼此靠近,这从反面说明模型对真实分布有一定感知,但对伪造分布的刻画仍不稳定。

失败条件主要出现在未见来源与相似操纵组合时,例如新文本到音频模型生成的整段音频,或新编辑模型改写后的音频,类型归属几乎失效,但片段级真伪仍可能维持一定水平。这意味着只看二分类会掩盖解释能力的崩塌,复现时必须同时报告 3 路指标。论文未报告多次随机种子的方差、显著性检验与推理开销,因此不能断言每次运行都得到相同下降幅度,也不能承诺该基线在延迟与成本上可直接部署。

边界与未验证事项:什么还不能下结论?

论文明确承认的局限是聚焦通用音频的可追溯与泛化,尚未充分探索伪造语音或音频与语音联合操纵等细分场景,因此结论不应直接推广到说话人克隆或语音转写伪造。数据层面的局限是质量过滤只在测试集执行且依赖文本音频相似度,可能筛掉难对齐但真实存在的伪造,过滤后子集的分布与原始测试集不完全一致。评估层面的局限是拼接与叠加没有设置域外来源,无法检验这两类依赖真实素材的操纵在新采集设备或新拼接规则下的稳定性。

方法层面的局限是基线只验证了一种编码器加主干的组合,未报告去掉来源监督或改变损失权重后定位与解释如何权衡,因此不能说拿掉某一路监督必然导致某种结果。统计层面的缺项是未给出置信区间与多次运行方差,总体趋势不等于每组样本或每一步训练都成立。资源层面,论文未报告训练硬件、时长与推理帧率,训练资源、推理开销与实际延迟需要分别讨论,不能用精度趋势代替效率结论。

初学者常见误解是把域外二分类仍有一定分数误读为泛化已解决,实际上论文强调的是类型与来源归因的崩塌,这才是可解释检测的核心代价。

复现先做什么?需要保留哪些超参数与信息条件?

复现应先从数据与划分做起,而不是先调模型。第一步访问官方页面核对数据集版本,确认训练集、测试集与过滤后测试子集的下载方式,当前资源证据显示链接可用,若后续不可达应记录访问时间与状态码而非沿用旧缓存。第二步按论文的域内外切分重建评估协议,保证域外来源在训练中完全未见,特别是生成与编辑各自的域外模型、修复的多个域外来源与分离的域外模型不能混入训练。

第三步实现 4 阶段构造或直接使用已构造数据,若自行构造需保留 grounding 模型、语言模型、生成模型默认配置与随机掩码规则,并记录对比语言音频预训练过滤的阈值取法。第四步实现基线时保留冻结编码器、10 轮训练、AdamW 优化器、1 乘 10 的负 3 次方学习率,以及 0.5、0.01 与 0.01 的损失权重,中值滤波与片段级判定规则也要一致。

第五步按片段级真伪准确率、操纵类型准确率、来源准确率与帧级 F1 分别报告域内与域外结果,百分点变化与相对百分比要分开计算,不能把不同指标的差值混入同一模型列。还需补充的验证包括多次种子方差、过滤前后对比、以及在新生成器出现后的持续评估,这样才能判断改进是真正学到真实分布还是又记住一组新痕迹。

何时值得尝试?核心收获与下一步验证

当研究目标是为音频取证提供可核查结论,而不仅是输出真假分数时,FakeSound2 值得尝试,因为它把评估锚定在时间定位、方法识别与来源追溯上,并用可控的域外切分暴露过拟合。核心收获有三点:定位与二分类可以在域内做得较好,但这不代表理解伪造;相似操纵与相近架构的样本容易在特征空间纠缠,需要更细粒度的分布刻画;对真实分布的建模可能比记住伪造痕迹更有助于泛化,但论文只给出方向性支持,仍待验证。

下一步验证应补足伪造语音、联合操纵、多轮种子统计与效率测量,并在新增来源上重复域外测试,观察下降是否可复现。教学上可以记住一个反例:域内操纵类型精度高而域外大幅下降,说明高分可能来自数据集捷径而非本质特征。最终,稳健且可解释的声音伪造检测需要同时回答何时、如何与何处来源,任何只报告单一真假准确率的改进都应回到这 3 维诊断中重新接受检验。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总