英文题目:XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:li26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #多模态学习 #可解释性 #语音伪造检测
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yupei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qiyang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测(Speech Deepfake Detection,SDD)输入为连续语音波形,输出不仅是真伪二分类,还需给出异常时频位置与自然语言理据,难点在于伪造痕迹细微、缺乏接地解释数据且音频大语言模型(Large Language Model,LLM)易幻觉。第一步复用wav2vec 2.0、HuBERT、WavLM三个冻结预训练检测器,对频谱图计算积分梯度(Integrated Gradients,IG)、局部可解释模型不可知解释(Local Interpretable Model-agnostic Explanations,LIME)与显著图(Saliency),得到像素级归因图。第二步将归因图送入视觉语言模型Qwen2.5-VL-7B提炼为时间范围与频率范围区间,同时用openSMILE eGeMAPSv02特征训练的4层多层感知机(Multilayer Perceptron,MLP)经SHAP选出前3重要声学特征,二者打包为可核查证据。第三步由Qwen3-Omni-30B综合原始音频与该证据包,生成包含音频异常、自由文本解释、XAI聚合的三段式结构化解释。与纯音频提示基线相比,差异在于把跨模型归因作为可核查支撑信号并要求模型批判性使用而非复述。在PartialSpoof开发子集上,单模型全XAI配置内部准确率(Inside Accuracy,IA)为0.492,较纯音频基线0.049提升44.3个百分点,单模型LIME的IA达0.811。结论仅适用于被4个模型同时正确分类的伪造片段,真实语音仅做定性试探,跨数据集泛化、延迟成本未验证。跨攻击类型与跨数据集的外推适用边界尚未验证。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要解释伪造?
这篇工作的输入是一段待判定的语音波形,目标不只是输出真或假的二分类标签,还要给出人类能理解的理由,说明哪段时间、哪个频率范围出现了异常,以及异常听起来像什么。研究生刚进入语音伪造检测领域时容易把任务理解为分类准确率竞赛,但原文强调的起点不同:很多检测模型依赖特定合成技术留下的表层统计痕迹,例如水印式伪影,而不是生成机制本身的内在线索,这导致泛化能力受限。如果系统不能说出为什么判假,错误就会以武断的方式累积。
必须保留的信息包括 3 类。第一是决策依据的可追溯性,即解释是否来自检测模型的真实敏感区域,而不是大模型自由发挥的通用描述。第二是定位的可核对性,即给出的时间区间能否与人工标注的伪造段对照。第三是实验条件的可复述性,即用了什么数据划分、什么冻结模型、什么评价口径。本文的输出是 1 篇方法解读加复现指南,不做超出原文的性能承诺。
一个教学例子是:同样一句包含伪造词的句子,分类器可能只输出伪造概率为高,而解释系统需要输出类似在 0.5 秒到 1 秒之间高频出现突变这样的陈述。后者可以被听辨、被标注对照、被扰动实验检验。本文后续按任务与路线、方法全景、组件计算、构造与推理、实验条件、结果与反证、复现收束的顺序展开。
两条解释路线各自解决了什么,又缺了什么?
传统可解释人工智能路线以数学上有依据的归因机制见长。原文提到的积分梯度沿基线到输入的路径归因预测变化,显著性图用梯度敏感性标出最有影响的输入维度,局部可解释模型无关解释在局部用可解释代理近似复杂模型,沙普利值解释用博弈论思想估计特征贡献。这类方法的优点是信号与模型决策紧耦合,缺点是依赖对原决策模型的访问,无论是模型特定还是模型无关方法都需要围绕原模型计算,而且输出多为低层谱图可视化,人读起来费力,还常依赖局部或线性假设。
大语言模型解释路线则相反,它不需要梯度访问或结构透明,可以独立于原检测模型生成自然语言理由,可读性更好。但在音频大模型推理能力尚不成熟、又缺乏语音伪造专用的 grounding 解释数据集时,生成容易停留在高层描述,出现幻觉,无法忠实反映决策过程。原文指出语音伪造领域专门做可解释检测的工作有限,已有工作多用传统归因,少数引入多语言模型迭代自洽检查的做法仍缺乏原则性的启发式质量评估机制。
因此本文的定位不是二选一,而是用传统归因证据约束大模型生成,并建立验证框架。理解这一点对后文很关键:所有跨模型聚合与保真度检验,都是为了解决前者难读、后者不可验证的矛盾。
要解决的具体问题与评测难点是什么?
具体问题可以表述为:在不为每个新解释任务重训专用检测器的前提下,如何生成语义丰富、时频具体、幻觉更少的语音伪造解释,并能用可重复的方式验证其质量。输入是原始音频,辅助输入是多种归因信号,输出是结构化文本解释,包含音频异常的时间范围、频率范围、自由文本解释,以及可解释人工智能聚合说明。
评测难点在于自然语言解释的灵活性。自动指标很难同时抓住忠实度与事实正确性,人工评价又需要控制主观性。原文因此设计了双轨验证:一轨是人工从正确性、证据支持、具体性、遗漏情况和总体偏好 5 个维度打分,另一轨是用定位指标与扰动敏感性做定量保真度检查。只有两轨一致,才能说解释不只是写得像,而是真的指向模型敏感且与标注一致的区域。
还需要明确的是,本文主要关注伪造样本的解释。原文明确说明,真品语音的解释通常信息量低,往往只能说未发现声学不一致,证明不存在异常比指出存在异常更难,类似于证明清白比指认真凶更难。因此后文的数据过滤与评价都围绕伪造段展开,真品只做探索性说明。
训练无关的解释生成全景:一个样本走完全流程
先沿一个伪造样本走一遍全流程,有助于建立整体依赖。假设输入是一段包含短伪造片段的话语,系统先把它送入两条并行支路。上支路是 3 个冻结的预训练检测模型,分别基于 wav2vec 2.0、HuBERT 和 WavLM,直接使用而不做目标数据集微调,目的是保证可扩展性。每个模型对该样本计算积分梯度、局部可解释模型无关解释和显著性图,得到频谱图形式的热力图。下支路是用 openSMILE 抽取 eGeMAPSv02 声学特征集,再用一个轻量 4 层多层感知机做分类,并用沙普利值方法给出特征重要性排序。
随后上支路的热力图交给视觉语言模型 Qwen2.5-VL-7B,任务是把异常区域总结为时间与频率范围,这是语音时频表示的两个核心维度。下支路的前三重要声学特征与上述时频总结一起,连同原始音频,共同交给多模态整合模型 Qwen3-Omni-30B,生成最终结构化解释。原文强调整合模型不是复述可解释人工智能输出,而是被提示要优先关注音频内容,把归因证据当作支持信号并做批判性分析,同时用固定格式约束具体性。
阅读下图时请先把握左右贯通的主路径,再看语义与声学证据在何处汇合,这样才能理解为什么后文要比较纯音频、单归因、单模型全归因与跨模型聚合 4 种设置。
看图路径: 1. 从最左侧原始波形出发,沿蓝色箭头区分上方基础模型支路与下方声学特征支路;2. 观察中间三张归因图与沙普利分析如何分别进入视觉语言模型与整合模型;3. 核对最右侧最终文本解释与定性定量分析的输出关系;4. 注意原始音频直连整合模型的箭头,理解声学内容优先的约束设计
论文图 1。原论文 Figure 1:“XGEG pipeline. Raw audio is processed by multiple deepfake detection models to generate attribution maps, which are interpreted by a multimodal LLM into notion-level explanations.”。
从像素可见,最左侧是原始波形图标,分出 3 路蓝色箭头:一路向上进入基础模型,一路向下进入开放微笑特征提取,一路直接向右进入底部整合大模型。中间粉色框内并列积分梯度、显著性和局部可解释模型无关解释 3 张归因图,其中前两张为红黑时频热力图,第 3 张为橙色条形贡献图,它们向右进入蓝色多模态大模型框,再向右生成各自的文本时间频率解释。下方声学支路经过沙普利分析条形图后同样进入右侧解释列。
最右侧黄色整合大模型框同时接收 3 类文本解释、声学解释与原始音频,向上输出人类可理解文本解释,向更上方输出定性定量分析。示例文本明确写出女性声音、合成语调、0.5 到 1 秒内词级别音高骤降与 5000 到 6000 赫兹频移,这种具体性正是纯音频基线所缺乏的。
时频归因如何变成文字:视觉语言模型做了什么?
时频归因到文字的转换是第一组关键机制。白话说,积分梯度、显著性图和局部可解释模型无关解释原本是图或数值,机器能用但人难读,需要一个能看图的模型把亮区翻译成几点几秒到几点几秒、几千赫兹到几千赫兹。英文名分别是 Integrated Gradients、Saliency Maps、Local Interpretable Model-agnostic Explanations,后文分别简称积分梯度、显著性、局部代理。视觉语言模型在这里的分工是图像理解与区域总结,它不直接判真假,只负责把热力图的高亮位置转写为时频区间。
可解释人工智能归因 × 多模态大语言模型解释: 可解释人工智能归因负责给出与检测模型决策紧耦合的低层证据,例如频谱图上哪段时间哪段频率更影响判假;多模态大语言模型解释负责把这些离散证据转写为人类可读的时频范围加自由文本理由。二者搭配的原因是前者忠实但难读,后者流畅但易幻觉,组合后以前者约束后者的注意力与表述,使生成不再是泛泛的干净或不自然,而是可定位可核对的异常描述。
具体操作上,原文对 3 个预训练模型分别求上述 3 种归因,得到频谱图解释后,用精心设计的提示词要求模型总结异常区域的时间与频率范围。提示词全文放在代码中,正文只说明约束了时频两个维度。需要复述的方法细节是:这些模型是官方 Hugging Face 实现且多轮输出一致,检测性能经 sanity check 被认为足够稳定,才作为后续归因的基础。表格中报告的准确率、F1 与等错误率只是稳定性检查,不是本文要优化的目标。
积分梯度 × 显著性图: 积分梯度负责沿从基线到输入的连续路径累积预测变化,把贡献分摊到时频单元,强调路径积分下的全局归因;显著性图负责用梯度敏感性直接标出最敏感的输入维度,强调局部敏感位置。二者搭配的原因是它们都输出时频热力图但假设与平滑性不同,一起输入给视觉语言模型可以互相印证异常时间频率区间,减少单一梯度噪声带来的误定位。
这里的常见误解是把归因图等同于最终解释。实际上归因图只是中间证据,最终解释还要经过整合模型的批判与声学内容校准,因此单个热力图很亮不等于最终文本一定采信它,后文的聚合说明部分要求模型交代是跨模型一致还是单模型证据。
声学特征与整合模型如何约束幻觉?
第二组机制处理声音性质层面的约束。白话说,光知道何时何频异常还不够,还要说出可能对应什么声学性质,例如斜率、响度或清音段长度统计。英文名是 SHAP 与 openSMILE eGeMAPSv02,前者是基于沙普利值的特征贡献估计,后者是常用声学特征集。后文简称沙普利分析与声学特征。声学支路的分工是提供可命名的特征重要性,整合模型的分工是综合原始音频、时频区间与特征排序,生成结构化文本。
局部可解释模型无关解释 × 沙普利值解释: 局部可解释模型无关解释负责在样本附近用可解释代理模型近似决策边界,给出时频层面的局部贡献;沙普利值解释负责基于合作博弈思想给出声学特征层面的重要性排序,例如斜率或响度相关特征。二者搭配的原因是前者有时间定位但不说是什么声学性质,后者有声学性质但没有时间定位,组合后可以同时回答何时何频异常以及可能对应哪类声学线索。
原文用训练集训练了一个简单的 4 层多层感知机来估计特征贡献,并明确说明保持分类器简单是因为目标是生成高质量解释而非优化检测性能,分类准确率上的潜在数据泄漏不实质影响解释分析的有效性。这种表述初学者容易误读为数据泄漏无所谓,准确理解是:该分类器不用于部署判假,只用于为解释提供特征排序,因此不把它的准确率当作检测主结果。
最终输出被约束为 3 段式结构:第一段音频异常,给出时间范围与频率范围;第二段自由文本解释;第 3 段可解释人工智能聚合,说明贡献来源与跨模型一致性。提示词明确要求优先分析音频内容,把归因证据当支持信号而非定论,并做批判性分析。
交并比 × 内部命中准确率: 交并比负责衡量预测异常时间区间与真值区间的重叠程度,区间越宽越容易刷高;内部命中准确率负责衡量预测区间是否完全落在真值区间内,惩罚靠猜大区间的幻觉式定位。二者搭配的原因是只看交并比会奖励过度扩张的保守预测,只看内部命中会忽略覆盖度,联合使用才能区分真正定位准与靠蒙大范围的解释。
部分伪造数据集 × 训练无关框架: 部分伪造数据集负责提供句内精确到段的真假时间标注,使解释的时间区间可以被客观核对;训练无关框架负责直接复用已有的语音预训练检测模型而不为每个解释任务重训检测器。二者搭配的原因是前者提供了可验证的定位真值,后者保证了可扩展的数据构造流程,只有冻结复用才能在保留约两万五千训练与开发样本和七万余测试样本规模下低成本生成约 65000 条解释实例。
这种设计的搭配理由在后文实验中得到呼应:纯音频输入容易产生表面或幻觉解释,加入轻量归因指导后时间与谱异常的精度提升,而整合模型对声学证据的利用程度需要用注意力可视化与扰动敏感性来验证,不是只看文本流畅度。
本研究训练了什么,冻结了什么,没有训练什么?
本节必须先说清训练边界,因为标题中的训练无关容易被误解为全程无学习。实际情况是:3 个预训练语音伪造检测模型被直接使用,没有在目标数据集上微调,视觉语言模型与整合多模态大模型也是训练无关调用,没有为解释任务做专门训练。唯一训练的是声学支路的轻量 4 层多层感知机,它在训练集上学习从 eGeMAPSv02 特征到真假标签的映射,目的是得到沙普利特征重要性,而不是得到一个部署级检测器。
真实计算过程包括 4 步。第一步是复用检查:在 PartialSpoof 上评估冻结检测模型的准确率、F1 与等错误率,确认预测足够稳定,可作为归因基础。第二步是归因计算:对每个保留样本求积分梯度、显著性与局部代理的时频图,对声学特征求沙普利重要性。第三步是 2 次大模型推理:先用视觉语言模型把每张图转写为时频区间,再用整合模型综合音频、区间与特征排序生成结构化解释。第 4 步是过滤构造:只保留被 4 个模型同时正确分类的伪造样本,以减少错误决策传播误导性归因,聚焦伪造段解释。
原文未报告的内容也要指出:未说明冻结模型的梯度路径细节与归因基线选择,未给出多层感知机的优化器、学习率与早停条件,未报告大模型推理的采样温度与解码约束。这些缺项意味着复现时只能按官方默认实现与 released code 中的提示词补齐,不能从模型名称推定实现细节,也不能把冻结参数等同于输出确定。
数据、划分、基线与指标条件如何保持一致?
数据方面采用广泛使用的 PartialSpoof 数据集,理由是它提供精确的时间标注,能指出哪些段是伪造的。原文给出约两万五千、两万五千和 71000 样本分别用于训练、开发与测试,另有一处写三万五千用于训练、开发与测试,两处数字存在冲突,解读时应明确标注该冲突而不自行编造统一口径。过滤后只保留 4 个模型都判对的伪造样本,得到约一万五千、一万五千与三万五千的构造规模,最终声称构建约 65000 条解释实例。真品样本主要用于探索,解释时不要求输出异常时间段,只解释为何未发现可疑证据。
比较条件设置了 6 种可运行策略:纯音频基线只给原始音频,不给任何归因;单归因 3 组分别只给来自 wav2vec2 的积分梯度、显著性或局部代理;单模型全归因给出同一模型的 4 种信号;跨模型聚合给出 3 个预训练模型的全部证据。原文明确不做纯沙普利对照,因为沙普利只给特征重要性而无显式时频定位,对多模态模型定位异常时间段的指导有限。
人工评价抽取 600 条伪造解释,招募 20 名二十到三十岁 annotators,男女各 10 人,均为流利英语使用者且至少本科学历,其中 5 人有研究生学历,5 人有音频相关背景。每人评 30 条,来自 5 个原始音频各生成 6 种格式,被告知音频均为伪造,要求边听边读,按 5 分制从正确性、证据支持、具体性、遗漏与总体偏好打分。定量方面用交并比与内部命中准确率衡量时间定位,用面积归一化局部 logit 敏感性做保真度检验,扰动量设为正 1% 的最小乘性幅度扰动,以保持结构完整与相位连续,避免破坏性掩蔽引入分布外伪影。
人工评分显示什么,定位指标又揭示什么代价?
人工评分回答的是解释是否更贴合人类听感与观察。比较问题是:在相同音频与评分标准下,加入归因证据是否比纯音频生成更正确、更有证据支持、更具体、遗漏更少。公平条件是同一批音频的 6 种格式由同一组人按相同 5 维标准打分,指标方向为正确性、证据支持、具体性与总体偏好越高越好,遗漏越低越好。下表整理了原文报告的人评均值,纯音频为基线,单模型全归因与 3 模型聚合为主要对照。
| 设置 | 正确性越高越好 | 证据支持越高越好 | 具体性越高越好 | 遗漏越低越好 | 总体偏好越高越好 |
|---|---|---|---|---|---|
| 纯音频基线 | 3.15 | 1.75 | 1.90 | 2.75 | 0.35 |
| 单模型全归因 | 3.90 | 3.75 | 3.55 | 2.45 | 1.05 |
| 3 模型全归因 | 3.85 | 3.60 | 4.30 | 2.30 | 1.50 |
表后解释需要同时说收益与代价。主要收益是证据支持与具体性提升最明显,原文描述为幻觉更少、理由更细,更多归因指导带来更高总体认可,3 模型聚合在具体性与总体偏好上最好。代价与反例是单项并非全胜,例如 3 模型在正确性与证据支持上略低于单模型全归因,说明堆更多证据不等于每维都涨。未胜出项也要指出:纯音频在正确性上为 3.15,并非完全不可读,它的短板主要在证据支持与具体性。
定量定位进一步揭示纯音频高交并比的假象。纯音频交并比最高但内部命中极低,原因是预测区间过度扩张,靠蒙大范围刷重叠。局部代理等单归因常给出过窄不稳定区间。单模型内多源结合在两者间取得更好平衡,而多模型聚合增加推理复杂度反而可能降低稳定性。注意力可视化被用来支持整合模型确实利用了音频而非只复述归因。
下图为生成首步第一层多头平均注意力,用于核对音频标记是否被解码利用,阅读时先看坐标与颜色含义,再看亮线位置。
看图路径: 1. 先确认左右两幅子图的横轴为键、纵轴为查询,颜色条表示归一化注意力权重;2. 观察生成首步时对角线附近与前部音频标记位置的亮线分布;3. 对比左右子图在不同键范围上的垂直条纹,判断音频标记是否被关注
论文图 2。原论文 Figure 2:“First generation step of the attention map for the first layer on average multiple heads”。
从像素可见,该图包含左右两幅深紫底热力图并各带右侧颜色条,刻度从零到 1.0。左图横轴为键、纵轴为查询,呈明显的对角线亮线加左侧垂直亮带,表明自回归解码中查询对历史键与前部标记的关注结构;右图横轴同样为键但范围更大,纵轴为查询,呈现多条细垂直亮纹,分布在约一百、两百、四百余等键位置,说明部分键被持续关注。原文据此报告音频前置标记在解码时被有效关注,支持模型融合了声学证据,但像素本身不能读出精确数值,只能定性判断关注存在。
拿掉归因或换聚合方式时,保真度如何变化?
本节按消融逻辑组织:测的是预测时间频率区域是否对应检测模型真正敏感的区域,与谁比是纯音频基线与不同归因组合,条件一致性在于同一目标区域施加相同的正 1% 幅度扰动,指标是面积归一化 logit 敏感性密度,越高表示该区域对判假影响越大。下表同时给出定位的交并比与内部命中,以及敏感性相对基线的倍数,基线与本方法数字均保留原文写法。
| 设置 | 交并比越高越好 | 内部命中越高越好 | 敏感性密度 | 相对基线倍数 |
|---|---|---|---|---|
| 纯音频基线 | 0.269 | 0.049 | 0.1424 | 1.00× |
| 积分梯度引导 | 0.224 | 0.482 | 1.3382 | 9.40× |
| 显著性引导 | 0.239 | 0.489 | 2.9250 | 20.54× |
| 局部代理引导 | 0.157 | 0.811 | 46.5857 | 327.20× |
| 单模型全归因 | 0.242 | 0.492 | 3.1466 | 22.10× |
表前已提出比较问题与公平条件,表后解释收益与反例。多模态融合一致找到比基线更具影响力的区域,特别是局部代理引导的敏感性最高,原文认为与其基于扰动的局部边界近似与分析框架更对齐有关。单模型四信号融合取得最好综合定位,支持多信号互补。反例是 3 模型聚合在原文报告中并未继续提升,交并比与内部命中反而下降,说明跨模型聚合增加大模型推理负担,稳定性下降,这是值得尝试多证据时的主要代价。
另一个失败条件是纯音频的高交并比伴随极低内部命中,再次证明不能单看重叠率。未评测边界包括真品证明式解释的定量评价、不同扰动幅度下的敏感性曲线,以及聚合推理延迟与成本,这些在原文中没有测量,不能承诺改善。
下图为生成末步的注意力对照,用于检验音频利用是否持续到解码后期,而不是只在首步有效。
看图路径: 1. 先确认该图为生成末步第一层多头平均注意力,与首步图形成对照;2. 观察末步时查询端靠后位置对前部键的关注是否仍然存在;3. 结合正文说法判断音频前置标记在解码全程是否持续被利用
论文图 3。原论文 Figure 3:“Last generation step of the attention map for the first layer on average multiple heads”。
从像素可见,该末步图与首步图在布局与颜色分布上高度相似,同样为左右两幅深紫底热力图,左侧保留对角线与前部垂直亮带,右侧保留多条垂直细亮纹。这支持原文所说的音频标记在解码过程中被持续关注,而非首步偶发。但原文也承认,在聚合多源归因上的推理仍受大模型推理瓶颈限制,图中亮纹不能证明模型正确理解了跨模型分歧,只能证明信息被注意到,语义整合质量仍需人工与定位指标共同判断。
哪些结论有直接证据,哪些只是可能?
直接报告的结论包括:加入归因后人工的证据支持与具体性明显提升,内部命中准确率提升超过 45%,面积归一化敏感性显示归因引导区域比纯音频区域更具影响力,单模型全归因在综合指标上最稳。这些有表格与人工评分支持,可以用报告或显示来表述。
有限解释包括:注意力可视化支持音频被利用,定性案例显示模型能指出文本转语音来源等涌现能力。原文对后者明确说系统评价困难,只能靠定性检查发现多数情况下频繁正确,这属于支持性观察,不是可部署的来源分类能力,应表述为可能或待验证。
未验证推测包括跨模型聚合未来会更好、更强整合与解释感知训练能解决问题。原文把跨模型推理难归因于大模型固有推理瓶颈并留作未来工作,这不是已证明的因果。缺失证据不是技术错误,但解读时要分开:未测量误判率、延迟、算力开销与输出帧率,不能说系统更高效或更实时;总体趋势不等于每组每步都成立,3 模型在部分人工维度回落就是反例。
数据层面的限制也要讲清:只保留 4 模型全对的伪造样本会过滤掉困难与分歧样本,解释质量结论可能高估在难样本上的表现;真品解释缺乏定位真值,难以同等量化;原文两处样本量表述冲突,复现时应以官方划分与 released code 为准并记录实际过滤数。
复现先做什么,需要哪些信息条件?
复现的第一步是按原文交代准备 PartialSpoof 官方划分与时间标注,核对训练、开发与测试的音频数与标注格式,记录与原文两处数字冲突的差异。不要自行编造划分或聚合口径,遇到冲突应标注冲突并以代码实际读取为准。第二步是安装官方 Hugging Face 的 wav2vec2、HuBERT 与 WavLM 检查点,不做微调,先复跑准确率、F1 与等错误率的 sanity check,确认预测稳定后再做归因。第三步是按 openSMILE eGeMAPSv02 抽取特征,训练 4 层多层感知机并计算沙普利排序,注意该分类器仅为解释提供排序,不作为检测主结果。
第 4 步是调用 Qwen2.5-VL-7B 把每张归因图转写为时间频率区间,再调用 Qwen3-Omni-30B 综合原始音频、区间与前三特征生成 3 段式结构化解释,提示词以 released code 为准,保持声学内容优先与批判性分析约束。第五步是复现评价:人工评价需保持 6 种格式同音频对照与 5 维标准,定量评价需实现交并比、内部命中与正 1% 面积归一化扰动敏感性,注意扰动是乘性幅度扰动并除以时间频率面积。
关于开源状态必须准确表述:原文写代码与数据在 GitHub 链接中,但本次收到的资源状态显示没有完成可达验证,因此只能写该链接当前不可用,不应声称代码、模型或数据已公开或可下载。关键超参数中唯一明确的是扰动量为正 1%,其余优化器、阈值与解码参数在原文缺项,需要补验证才能称为完整复现。
何时值得尝试这种解释框架,还需补哪项验证?
当你的任务同样需要可核对的语音伪造理由,而你没有大规模 grounding 解释数据去训练专用解释模型时,这种训练无关加归因约束的路线值得尝试。它的适用条件很具体:你有可用的冻结检测模型与精确时间标注,有能看图的视觉语言模型与能听音频的多模态模型,并且愿意接受 2 阶段推理成本。此时单模型内的多归因融合是优先选项,因为它在人工与保真度上最稳,跨模型聚合虽然具体性更高但稳定性下降,不宜作为默认部署。
复现与应用时要记住论文特有的易错点。第一,不要把纯音频的高交并比当作定位准,必须同时看内部命中。第二,不要把沙普利特征排序当作时间定位,它没有显式时频信息。第三,不要把注意力亮纹当作理解正确的证明,它只证明信息被关注。第四,不要把 4 层感知机的高准确率当作检测突破,它只是解释用的排序器。
还需补的验证包括困难样本与分歧样本上的解释质量、真品证明式解释的量化标准、不同扰动幅度与不同提示词下的稳定性,以及推理开销与延迟测量。只有补齐这些,才能从 1 篇可解释数据集构造工作走向可信赖的部署解释系统。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


