📄 听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验
英文题目:Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution
一句话:为检验被动指纹是否真的持久可复现且与内容无关,论文用 PIPDP 三探针把指纹按人耳可感知性拆开,证明在保持听感透明时位深抖动仍能让溯源准确率下降 48.2%,而改情感只带来约 1.00% 的波动,代价是结论仍受限于 10 类闭集与代理透明度阈值。
标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
👥 作者与机构
- Yupei Li:机构信息未在 arXiv HTML 中可靠披露
- Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露
- Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露
- Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露
- Björn Schuller:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
亮点在于首次把被动指纹(passive fingerprint)按人耳可感知性拆分为可感知与不可感知两类,并用可控扰动与情感提示做了可验证的诊断,视角比单纯测鲁棒性更贴近取证可靠性。短板是核心结论高度依赖闭集 10 分类与 DNSMOS / STOI 代理的可感知阈值,且扰动与情感实验的统计与跨检测器一致性论证不足,难以支撑“不可感知指纹更可信”的强泛化宣称。
📌 核心摘要
为解决语音深度伪造溯源中被动指纹是否持久、可复现且与内容无关这一未验证前提,论文提出可感知-不可感知被动指纹诊断协议 Perceptible-Imperceptible Passive-fingerprint Diagnostic Protocol(PIPDP),通过多证据一致性校验、可感知透明扰动与提示驱动的情感可感知属性消融分别检验两类指纹的可靠性。方法上以 10 个生成器与 3 种跨架构溯源器构成的闭集溯源流水线为载体,用残差能量与 Grad-CAM 显著性验证指纹存在性,再用 5 类频域/时域扰动与情感提示对比两类指纹对溯源的贡献。与以往将指纹视为单一可分类信号不同,该工作显式引入人耳感知轴并设计训练无关的输入消融来解耦两类线索。关键结果显示不可感知扰动在保持感知透明时仍大幅削弱溯源,而情感驱动的可感知变化对溯源影响有限,提示不可感知线索更持久。意义在于为取证级溯源提供了更可信的指纹选择依据,但结论受限于闭集设定、有限的生成器与情感覆盖以及感知透明度的代理指标。
🔗 开源与复现资源
- 代码:https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/
- 模型权重:论文中提供了 HiggsAudioV3 权重链接 https://huggingface.co/bosonai/higgs-audio-v3-tts-4b ,其余 9 个生成器权重链接论文中未提及
- 数据集:使用 VCTK 数据集随机采样 2500 条语音按 1800 / 450 / 250 划分为训练集域内测试集和 OOD 测试集,另从 ESD 数据集选取 10 个说话人各 100 条英文脚本构建 Full-OOD 测试集,全部 25000 条合成数据及处理代码已发布于 https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/ ,论文中未提供 VCTK 与 ESD 的独立下载链接
- Demo:论文中未提及
- 复现材料:论文中提及 10 路闭集归因设置冻结 WavLM 与 w2v-bert 特征提取器训练配置及 Grad-CAM 可视化细节,完整代码与数据已发布于 https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/ ,论文中未提及独立检查点下载链接
- 论文中引用的开源项目:GPT-SoVITS 链接为 https://github.com/RVC-Boss/GPT-SoVITS ,HiggsAudioV3 链接为 https://huggingface.co/bosonai/higgs-audio-v3-tts-4b ,SynthID 链接为 https://deepmind.google/models/synthid/ ,其余提及的 FreeVC kNN-VC CosyVoice2 XTTS-v2 Qwen3-TTS F5-TTS AudioSeal WavLM w2v-bert RawNet2 AASIST 论文中未提供链接
🧭 深度解读
伪造检测之后,为什么还要做溯源?
今天的语音生成已经能以假乱真,检测模型可以回答这是真人还是合成,但法庭和平台更想知道是谁合成的。用哪一个生成器、哪一版模型做的,这叫溯源。溯源的线索通常藏在音频里那些生成器无意留下的痕迹,研究者称之为被动指纹。
想象你收到一段冒充领导的诈骗语音,检测器说它是假的,却说不清来自哪套系统,取证链条就断了。如果不同生成器留下的痕迹真的稳定、与说话人和文本无关,溯源就能像指纹比对一样工作;如果痕迹只是分类器在特定数据集上学到的捷径,换个说话人或换句话就失效,可信度就无从谈起。
被动指纹 × 主动水印: 主动水印是人为嵌入、为了版权追踪而设计的显式标记,比如在生成时加入可解码的比特;被动指纹则是生成器无意留下的固有痕迹,源于模型结构、训练数据和声码器实现的偏差。二者搭配的意义在于:主动水印可控但需要生成方配合,被动指纹无需配合却更难保证持久;论文聚焦后者,就是要回答在没有水印的野外取证场景里,能否靠这些无意痕迹稳定溯源。
论文的起点正是这个可信度缺口:过去证明指纹存在几乎只靠分类准确率高,但高准确率可能来自分类器能力而非生成器痕迹,且从未区分人耳能否感知的部分。而音频是连续信号,大量信息在人耳不敏感区,未来模型迭代一定会优化听感,若指纹恰好落在听感相关部分,就会被顺手抹掉。
前人把指纹当成一个整体来测,这次为什么要拆开?
已有的被动指纹研究有两条主线。一条是把指纹定义为生成样本对真实数据分布的偏差,直接用分类器准确率或残差来证明存在;另一条是测鲁棒性,给音频加噪、压缩、做对抗扰动,看溯源是否还稳。前者回答有没有,后者回答抗不抗外部退化。
但这两条线都没回答 3 个更本质的问题:指纹是否持久、是否可复现、是否与内容无关。更关键的是,它们把指纹当成单一信号,没有按人耳感知轴拆分。语音不同于文本,文本的每个 token 人都看得见,音频却有大量相位、超高频、量化细节是人听不出的。
论文的定位就是补上这个拆分。作者提出可感知与不可感知两类被动指纹的二分框架,并设计一套与模型无关、训练无关的诊断协议 PIPDP,用可控干预来分离两类线索的贡献,而不是再做 1 次加噪鲁棒性报告。
把指纹按人耳能否感知来切,会改变什么判断?
如果指纹落在人能听出的情感、韵律上,它虽然直观,却恰好是生成器最会被优化的部分。今天的 TTS 都在卷自然度和情感可控性,下一个版本很可能就把这类痕迹改掉。相反,落在人耳不敏感区的细粒度偏差,因为不影响主观质量,训练目标不会刻意去压它,反而可能跨版本残留。
可感知指纹 × 不可感知指纹: 可感知指纹是人耳能直接听出的线索,如情感、口音、韵律的偏好;不可感知指纹是人耳不敏感但机器可捕捉的细粒度偏差,如相位、量化噪声、频带能量残差。论文把二者拆开,是因为它们对优化的敏感度不同:可感知线索会被感知质量目标反复打磨而随版本漂移,不可感知线索因不影响主观听感而很少被显式优化,理论上更可能跨版本残留;只有分开检验,才能判断哪类更适合做取证依据。
因此问题被重新表述为:持久可复现的指纹究竟在可感知还是不可感知分量里?要回答它,不能只看准确率,需要做因果检验:一边用保持听感透明的扰动去动不可感知部分,看溯源是否掉;另一边只改可感知的情感而固定其他一切,看溯源是否稳。两边的对比才能给出取证该信哪类指纹的依据。
PIPDP 不是新检测器,而是一套诊断流水线
PIPDP 的输入是受控文本与说话人参考驱动的合成语音,输出是对溯源器依赖哪类指纹的归因判断。整体流程是先用统一的溯源流水线建立基线,再依次执行 3 个探针,用准确率下降和真类概率下降来量化扰动对溯源的因果影响。
溯源流水线本身覆盖 10 个生成器与 3 个跨架构溯源器。生成器按功能与架构分为声码器 HiFiGAN、MelGAN,经典合成 GPT-SoVITS、FreeVC、kNN-VC,基于大语言模型的 CosyVoice2、XTTS-v2、Qwen3-TTS、HiggsAudioV3,以及扩散模型 F5-TTS,全部重采样到 16 kHz。溯源器为 WavLM-AASIST、RawNet2 和 w2v-bert-MLP,其中后两者冻结预训练特征,只训后端分类头,做 10 类闭集归因。
在理解细节前,先看全景图如何把三探针组织在同一条主路径上,这能避免不同实验用不同数据或不同分类器导致不可比。图 1 顶部是归因主路径,底部三探针共享同一段生成音频的输出,箭头颜色区分了数据流与干预点。
看图路径: 1. 沿顶部 Attribution pipeline 看 Ref audio、Text、Prompt 如何进入 Audio generator 再到 Attributor;2. 对比下方三探针的输入与输出:Probe1 做存在性三角验证,Probe2 做五类扰动,Probe3 做情感提示消融;3. 注意 Probe2 中 Bit-depth dither、Band notch、Phase perturbation 等在波形与频谱上的不同作用点

论文图 1。原论文 Figure 1::“PIPDP methodology. Given generated speech from different generators, PIPDP evaluates attribution using cross-architecture attributors in a closed-set setting.”。
图 1 顶部 Attribution pipeline 清晰展示了从左侧 Ref audio、Text、Prompt 进入橙色 Audio generator,生成中间的波形与梅尔频谱,再送入右侧紫色 Attributor 的完整路径。下方 Probe1 用 Input、Generation、XAI 三列组织 Speaker set、Text set 与 Grad-CAM、ΔEnergy 的三角验证;Probe2 在中间对同一段波形施加 Bit-depth dither、Band notch、Phase perturbation、Envelope smoothing、HF dither 5 类操作,图中可见 4 bit 量化后的锯齿波形与 16 bit 原波形的对比;Probe3 则在输入端只改 Prompt with Emotion 而固定 Generator。这种布局保证了后续因果判断的可比性。
Probe 1:先证明指纹真的存在且可复现
Probe 1 要排除一种常见误读:高准确率可能只是分类器强,而不是生成器真的留下了稳定痕迹。为此它用 4 类证据三角验证。第一是溯源准确率本身;第二是基于梅尔功率谱的频域残差能量 ΔE(t),对比合成与真实在各频带的能量偏差;第三是 Grad-CAM 显著性图,看溯源器关注的时频区域是否跨说话人和文本保持重叠;第四是人工听检。
残差能量 × Grad-CAM 显著性: 残差能量是在梅尔功率谱上计算生成语音相对真实语音的频带能量偏差 ΔE(t),回答指纹在频域长什么样;Grad-CAM 显著性则反推溯源器做决策时在时频图上最关注的区域,回答指纹被模型用在了哪里。二者互补在于:前者是信号侧的客观度量,不依赖分类器;后者是模型侧的解释,验证高准确率是否真的落在生成器特有区域;重叠一致才说明指纹既存在又被稳定利用。
具体做法上,残差能量按频带统计同一生成器在不同内容下的 ΔE 曲线是否一致、不同生成器之间是否可分;显著性图取前 15% 高响应区域比较同一生成器内不同样本的重叠与跨生成器的差异;复现性则固定文本、说话人与模型权重,只换随机种子重复生成 10 次,确定性声码器零退化,随机生成器也只有微小波动。
要判断内容无关性,最直观的是看显著性图是否随说话人和文本改变而保持稳定,同时换生成器后显著区是否立刻不同。下图用 HiFiGAN 的四宫格给出这 1 对比,需要重点观察白色重叠区的稳定性。
看图路径: 1. 比较左上 base 与右上同说话人不同文本、左下同文本不同说话人的白色重叠区是否一致;2. 再看右下换成 F5-TTS 后显著区分布是否明显不同;3. 结合右侧色条判断高显著性是否集中在低频带

论文图 2。原论文 Figure 2::“Grad-CAM map for utterances generated by HiFiGAN, with different model using F5-TTS (right bottom).”。
图 2 为 2×2 的 Grad-CAM 时频图,横轴为时间 0-4 秒,纵轴为频率 0-8000 Hz,右侧色条为显著性 0-4.5。左上 base 为 spk=p312、text=T201,右上同说话人换文本 T202,左下同文本换说话人 p306,三者的白色重叠区在底部 0-500 Hz 的连续带与 3.5 秒附近的垂直高亮带高度一致,尽管文本与说话人已变。右下换成 F5-TTS 后,底部黄白色高亮更密集且在 0.1 秒与 3.6 秒处出现更强的峰值,分布明显不同。这种跨内容稳定、跨生成器可分的模式,支持指纹是生成器特有而非内容捷径。
Probe 2:用五种近透明扰动去动不可感知的部分
Probe 2 要回答持久指纹是否藏在人耳不敏感区。它设计了 5 个扰动算子,多数目标是感知透明。相位扰动 PP 保持幅度不变,只给 STFT 相位加均匀噪声;高频抖动 HD 在 6 kHz 以上注入与局部高频能量成比例的复高斯噪声;包络平滑 ES 沿频率轴对幅度做滑动平均。
位深抖动 BD 用三角概率密度抖动把波形重量化到 10 或 8 比特;带阻陷波 BN 用 2 阶 IIR 陷波器随机中心频率并以 Q 值控带宽。
相位扰动 × 位深抖动: 相位扰动只改 STFT 的相位谱而保留幅度,利用人耳对相位不敏感来做近透明攻击;位深抖动则用三角概率密度抖动把波形重量化到 10 或 8 比特,去除低于最低有效位的细节。二者分工不同:前者试探溯源是否依赖相位结构,后者试探是否依赖极细粒度的幅度量化痕迹;组合后能覆盖不可感知指纹在相位与幅度两条轴上的脆弱性,比单一扰动更能定位指纹所在。
透明度用 DNSMOS、STOI 和词错率联合判定,操作阈值为 ΔDNSMOS<0.8 且 STOI>0.95,并辅以 20 人对 40 条样本的听辨,Fleiss κ=0.82。判定逻辑统一为:若扰动在保持透明时仍导致溯源性能下降,说明被扰动的是不可感知指纹分量。
关键公式原样如下。PP 保持幅度、扰动相位:
\[Z^{\prime}(t,f)=|Z(t,f)|\,e^{j\left[\varphi(t,f)+\varepsilon(t,f)\right]},\quad\varepsilon(t,f)\sim\mathcal{U}(-\sigma,\sigma).\]其中 Z(t,f) 为 STFT,φ 为相位,ε 为均匀噪声,σ 取 0.2 或 0.4,输出与输入幅度相同但相位被轻微打散,人耳对此不敏感。
HD 只在高频段加噪:
\[Z^{\prime}(t,f)=Z(t,f)1[f\geq f_{c}]\cdot n(t,f),\]\[\quad n(t,f)\sim\mathcal{CN}\!\left(0,\,r\cdot E_{\text{HF}}(t)\right),E_{\text{HF}}(t)=\frac{1}{|\mathcal{F}_{\text{HF}}|}\sum_{f\geq f_{c}}|Z(t,f)|^{2}.\]fc 固定 6 kHz,r 取 20 或 10 dB,E_HF 为局部高频能量,噪声能量与之成比例,避免在静音段过度加噪。
BD 的重量化形式为:
\[x^{\prime}[n]=\operatorname{round}\!\left(\frac{x[n]+\xi[n]}{\frac{2}{2^{b}}}\right)\cdot\frac{2}{2^{b}},\;\xi[n]\sim\text{TPDF}(-\frac{2}{2^{b}},\frac{2}{2^{b}}).\]b 取 10 或 8,ξ 为三角分布抖动,作用是去相关量化误差、去除低于最低有效位的细节而不引入音调伪影。
Probe 3:只改情感词,看可感知指纹稳不稳
Probe 3 反过来检验可感知指纹的稳定性。它不重训模型,也不改音频处理,只通过提示词改变情感。对支持情感提示的 CosyVoice2 和 HiggsAudioV3,固定文本、说话人参考、模型权重与解码种子,仅把提示中的情感描述词换成 happy、sad、angry,以 neutral 为基线。
情感有效性由基于 HuBERT 的语音情感识别模型客观打分,并辅以人工标注复核。这样就能在输入端做最小化干预,观察溯源是否随可感知属性波动。若准确率基本不变,说明溯源不依赖情感这类可感知线索;若明显下降,则说明可感知指纹参与了决策但不够稳定。
这个设计的巧妙在于训练无关与模型无关:不需要为每种情感重训溯源器,也不需要改生成器内部,只改提示词就能分离可感知分量的贡献,与 Probe 2 的信号层扰动形成互补的因果对。
没有训练新生成器,溯源器只训轻量后端
这篇工作没有训练新的语音生成器,10 个生成器全部复用开源权重,输出统一为 16 kHz。需要训练的是溯源器,但也刻意做得很轻:冻结 WavLM 与 w2v-bert 的特征提取器以保留原始音频表示,只训练后端的 AASIST 或 MLP 分类头,做 10 类闭集分类。
论文未报告损失形式、优化器、学习率、batch size、训练轮数与硬件预算,这部分可复现信息是缺失的。推理与复现性细节更明确:复现性实验对 10 条正确溯源样本各重复生成 10 次,固定一切条件只换随机种子,确定性声码器零退化,Qwen3-TTS 准确率下降 2.00% 且概率下降 1.78%,XTTS-v2 准确率下降 6.00% 且概率下降 3.65%,均为微小波动。
其余扰动与情感实验的推理均在冻结的溯源器上做前向评估,用准确率下降与真类概率下降度量影响,并用 McNemar 检验与配对 t 检验报告显著性。这种轻量后端训练保证了指纹来自生成器而非溯源器新学到的特征。
数据怎么搭,指标怎么算,透明怎么判
数据构造上,从 VCTK 随机采样 10 个说话人共 2500 条语音,按 1800 条训练、450 条域内测试、250 条域外测试划分,每条都用 10 个生成器各合成 1 次得到 25000 条合成语音;另从 ESD 选 10 个说话人各 100 条英文文本构建 1000 条全域外测试集。所有生成器输出为 16 kHz,参考音频与目标文本均来自 VCTK。
闭集溯源 × 开集泛化: 闭集溯源指测试时生成器必在训练见过的 10 个类别内,只做 10 选 1 分类;开集泛化则要求面对未见过的生成器也能判断为未知或正确归因。论文用闭集是为了建立可控的基线来诊断指纹本身,避免未知类干扰;但二者搭配的意义在于,闭集下的高可分性不等于野外可信,真正取证需要开集验证,而论文声明结论与开闭集无关却未做开集实验,这正是外推时必须留意的边界。
评估指标为准确率与宏平均 F1,扰动影响以准确率下降与真类概率下降度量。统计上对扰动前后正确性做 McNemar 检验,对情感条件做配对 t 检验,显著性阈值均为 p<0.001。
DNSMOS × STOI: DNSMOS 是基于神经网络的非侵入式主观质量代理分,反映听感好坏;STOI 是短时客观可懂度,反映语音内容是否仍清晰。二者搭配是因为单一指标会漏判:DNSMOS 可能对细微量化噪声不敏感,STOI 可能对高频失真不敏感;论文用 ΔDNSMOS<0.8 且 STOI>0.95 联合判定感知透明,并辅以 20 人听辨多数投票,才敢说扰动没有改变人耳可感知的部分。
为回答不同扰动与情感是否在同一基线下可比,下表把数据构成、划分、控制变量与指标方向整理在一起,明确透明度与统计判定如何统一执行。
| 维度 | 具体构成 | 规模/划分 | 关键控制变量 | 指标与方向 | 透明/统计判定 |
|---|---|---|---|---|---|
| 生成器 | HiFiGAN、MelGAN、GPT-SoVITS、FreeVC、kNN-VC、CosyVoice2、XTTS-v2、Qwen3-TTS、HiggsAudioV3、F5-TTS | 10 个,覆盖声码器/经典合成/LLM/扩散 | 固定文本、说话人、权重与种子,仅改扰动或情感词 | 溯源准确率↑、Macro-F1↑ | - |
| 溯源器 | WavLM-AASIST、RawNet2、w2v-bert-MLP | 3 个跨架构,冻结前端只训后端 | 同一基线对比不同扰动 | 准确率下降↑、真类概率下降↑ | McNemar p<0.001、配对 t 检验 p<0.001 |
| 训练集 | VCTK 10 说话人 2500 条 | 1800 训练/450 域内测试/250 域外测试 | 每条合成 10 次得 25000 条 | 闭集 10 分类准确率↑ | - |
| 域外集 | ESD 10 说话人各 100 条英文 | 1000 条全域外 | 文本与说话人均跨域 | 同上 | - |
| 扰动 | PP σ0.2/0.4、HD r20/10、ES k5/10、BD b10/8、BN Q40/20 | 每类 2 档参数 | 幅度/相位/高频/量化/窄带 | ΔDNSMOS↓、STOI↑、TR↑ | ΔDNSMOS<0.8 且 STOI>0.95 为透明 |
| 情感 | CosyVoice2、HiggsAudioV3 × happy/sad/angry vs neutral | 5 次重复均值±标准差 | 仅改提示情感词 | 准确率下降↑、概率下降↑ | SER 与 20 人人工复核 |
这张表把可比性说清楚了:所有扰动与情感都在同一批生成器与同一批溯源器上对比,指标方向与统计阈值统一,透明度有客观与主观双重门槛。它的净收益是让 BD 的 48.2% 与情感的 1.00% 可以直接比较。失败项在于闭集与有限情感覆盖本身未被检验,表外仍有开集野外与更多风格维度未覆盖,因此不能由此推出野外可信度。
指纹存在吗?先看残差与显著性给出的两条证据
基线溯源性能显示指纹在闭集下高度可分。域内 VCTK 上 w2v-bert-MLP 准确率 0.9973、Macro-F1 0.9973,WavLM-AASIST 准确率 0.9464、Macro-F1 0.9459,RawNet2 准确率 0.7251、Macro-F1 0.6959;跨域到 ESD 时 w2v-bert-MLP 准确率仍为 0.8571、Macro-F1 0.8587,WavLM-AASIST 降至准确率 0.6415、Macro-F1 0.6240。作者因此选 w2v-bert-MLP 为主溯源器,WavLM-AASIST 为对照。
残差能量图提供了信号侧的直接证据。下图把 10 个生成器对同一条保留样本 p312-T201 的 ΔE 曲线叠在一起,正值表示该频带比真语音能量高,负值表示更低。需要关注的是不同生成器曲线是否分离,以及声码器与 LLM 模型的差异。
看图路径: 1. 看横轴 0-8000 Hz 上 10 条曲线的整体分离度;2. 注意 HiFiGAN 与 MelGAN 接近 0 dB 而 CosyVoice2、XTTS-v2 等在中高频显著偏高;3. 观察 F5-TTS 在 3500-4500 Hz 的负向凹陷与其他模型的差异

论文图 3。原论文 Figure 3::“Δ E(t) as cross-generator distinguishability as evidence, for all 10 generators on a single held-out demo utterance (speaker p312, text T201).”。
图 3 横轴为频率 0-8000 Hz,纵轴为 Delta dB fake-real,图例区分 10 条曲线。可见蓝色 HiFiGAN 与橙色 MelGAN 两条曲线几乎贴在 0 dB 附近,说明声码器残差很小;绿色 CosyVoice2 在 100 Hz 附近冲至约 19 dB,红色 XTTS-v2 在 500 Hz 附近达约 19 dB,青色 kNN-VC 在中高频持续高于 5 dB;而棕色 F5-TTS 在 3500-4500 Hz 出现负向凹陷至 -4 dB 附近。每条曲线形态分离且可区分,支持跨生成器可分性。结合前文图 2 的显著性重叠,Probe1 完成了存在性、跨内容一致性与跨生成器可区分性的三角验证。
为回答基线是否足够稳定以支撑后续因果检验,下表在统一的 VCTK 与 ESD 测试条件下对比 3 类溯源器的准确率与 F1,明确主溯源器与对照的选择依据。
| 比较条件 | 数据集 | 溯源器 | 准确率 | Macro-F1 | 这项数字支持什么 |
|---|---|---|---|---|---|
| 域内基线 | VCTK TestID | w2v-bert-MLP | 0.9973 | 0.9973 | 闭集下指纹高度可分 |
| 域内基线 | VCTK TestID | WavLM-AASIST | 0.9464 | 0.9459 | 同上,次优但仍可分 |
| 域内基线 | VCTK TestID | RawNet2 | 0.7251 | 0.6959 | 容量较小导致可分性下降 |
| 跨域 | ESD Full-OOD | w2v-bert-MLP | 0.8571 | 0.8587 | 跨域仍保持较好可分性 |
| 跨域 | ESD Full-OOD | WavLM-AASIST | 0.6415 | 0.6240 | 跨域退化更明显,选主溯源器依据 |
表中主溯源器在域内接近满分且跨域仍显著高于对照,净收益是为后续探针提供了稳定的基线,让扰动与情感的下降可以直接归因于指纹而非分类器波动。失败项是 RawNet2 在域内仅 0.7251,说明基线高度依赖模型容量,不能推出任意小模型都能捕捉指纹。这张表也不能支持开集结论,因为所有测试仍在 10 类闭集内。
不可感知扰动:听感几乎不变,溯源却可能大跌
Probe 2 的核心问题是在保持人耳透明时,扰动能否显著动摇溯源,且效应是否具有生成器特异性而非通用退化。两溯源器下降趋势一致可排除检测器特异性,而跨生成器方差能区分指纹特异性与通用声学退化。
为检验不可感知扰动在保持听感透明时能否动摇溯源,下表在统一的 VCTK 基线与同一批溯源器上对比 5 类扰动的两档参数,报告准确率下降、透明度与跨生成器标准差的方向。
| 扰动 | 参数 | WavLM 准确率下降(%) | w2v-bert 准确率下降(%) | ΔDNSMOS | STOI | 透明比例(%) | 跨生成器标准差(%) | 支持什么 |
|---|---|---|---|---|---|---|---|---|
| PP | σ=0.2 | 11.3* | 0.8 | 0.231 | 0.9991 | 96.4 | 1.0 | 相位对 w2v-bert 影响小 |
| PP | σ=0.4 | 19.4* | 2.4* | 0.291 | 0.9975 | 95.2 | 4.1 | 相位影响仍有限 |
| HD | r=20 dB | 1.7* | 0.8 | 0.040 | 0.9996 | 99.8 | 1.3 | 高频抖动几乎不影响 |
| HD | r=10 dB | 2.9* | 1.3 | 0.066 | 0.9996 | 99.4 | 2.4 | 同上 |
| ES | k=5 | 41.9* | 6.8* | 0.702 | 0.9800 | 73.0 | 10.0 | 中度平滑已显影响 |
| ES | k=10 | 48.3* | 20.7* | 1.333 | 0.9283 | 2.0 | 23.2 | 但已不可透明,超出检验范畴 |
| BD | b=10 | 29.9* | 48.2* | 0.205 | 0.9909 | 94.4 | 30.3 | 位深抖动在透明时重创溯源 |
| BD | b=8 | 55.4* | 70.5* | 0.681 | 0.9739 | 54.8 | 28.4 | 更强量化破坏更大 |
| BN | Q=40 | 19.7* | 5.2* | 0.081 | 0.9943 | 99.9 | 11.0 | 窄带陷波影响中等 |
| BN | Q=20 | 17.5* | 4.7* | 0.094 | 0.9906 | 99.8 | 10.1 | 同上 |
表中*表示 McNemar 检验 p<0.001。最值得关注的是 BD b=10:对 w2v-bert 准确率下降 48.2%、概率下降 47.5%,而 ΔDNSMOS 仅 0.205、STOI 为 0.9909、透明比例 94.4%,在人耳基本听不出变化时溯源已被大幅破坏。
相反,PP σ=0.2 对同一溯源器准确率下降仅 0.8%,HD 两档均在 1.3% 以内,说明不同不可感知分量的敏感度差异很大。跨生成器标准差进一步区分了指纹特异性:BD 为 30.3%、ES k=10 为 23.2%,而 PP σ=0.2 仅 1.0%,说明 BD 与 ES 的破坏集中在特定生成器而非所有音频。
需要留意的是 ES k=10 虽使准确率下降 20.7%,但 ΔDNSMOS 为 1.333、STOI 为 0.9283、透明比例仅 2.0%,多数投票已判定为可感知,已超出不可感知检验的边界,不能用来证明不可感知指纹的脆弱。这张表的净收益是锁定了位深量化痕迹是当前最可靠的不可感知线索,反例是 HD 几乎无效,说明并非所有不可感知分量都承载指纹。
只改情感:可感知变化对溯源的拉动很小
Probe 3 用情感提示来检验可感知指纹的稳定性。实验固定文本、说话人与权重,仅改提示词中的情感描述,并以 neutral 为基线计算准确率下降与概率下降。
为回答仅改变可感知情感是否同样动摇溯源,下表在 VCTK 与 ESD 两个域上对比 happy、sad、angry 3 类情感,报告 w2v-bert 的准确率下降与 SER 客观准确率的方向。
| 数据集 | 生成器 | 情感 | 准确率下降(%) | 概率下降(%) | SER 准确率(%) | 这项数字支持什么 |
|---|---|---|---|---|---|---|
| VCTK | HiggsAudioV3 | happy | 0.14±0.03 | 0.13±0.03 | 20.29 | 可感知变化影响极小 |
| VCTK | HiggsAudioV3 | sad | 0.00±0.00 | 0.00±0.00 | 0.71 | 同上 |
| VCTK | HiggsAudioV3 | angry | 4.00±0.04 | 4.45±0.05 | 99.57 | 相对最大但仍远小于 BD 的 48.2% |
| VCTK | CosyVoice2 | happy | 0.00±0.01 | 0.16±0.02 | 32.86 | 情感几乎不影响溯源 |
| VCTK | CosyVoice2 | sad | 1.00±0.03 | 1.22±0.03 | 0.00 | 同上 |
| VCTK | CosyVoice2 | angry | 0.43±0.03 | 0.48±0.03 | 72.71 | 同上 |
| ESD | HiggsAudioV3 | happy | 11.90±0.05 | 11.65±0.05 | 13.10 | 跨域后可感知稳定性受生成器影响 |
| ESD | HiggsAudioV3 | sad | 1.22±0.03 | 1.33±0.03 | 3.40 | 同上 |
| ESD | HiggsAudioV3 | angry | 18.45±0.04 | 18.97±0.05 | 99.70 | 同上,域与生成器相关 |
| ESD | CosyVoice2 | happy | -0.60±0.02 | -0.46±0.02 | 41.30 | CosyVoice2 跨域仍稳定 |
| ESD | CosyVoice2 | sad | 0.52±0.03 | 0.63±0.03 | 0.00 | 同上 |
| ESD | CosyVoice2 | angry | -0.39±0.02 | -0.30±0.02 | 74.70 | 同上 |
在 VCTK 上,可感知变化的影响普遍较小,HiggsAudioV3 的 happy 0.14% 与 sad 0.00%,angry 为 4.00%,CosyVoice2 3 类情感均在 1.00% 以内,显著低于 BD b=10 时 48.2% 的破坏幅度。论文还报告 ΔE(t) 在不同情感间高度一致,说明不可感知指纹跨情感稳定。
跨域到 ESD 后出现分化:HiggsAudioV3 的 happy 11.90% 与 angry 18.45%,sad 为 1.22%,提示可感知指纹的稳定性受域与生成器调节;但 CosyVoice2 在 ESD 上 3 类情感分别为 -0.60%、0.52%、-0.39%,均在 1.00% 以内,未呈现一致退化。情感识别的客观准确率偏低,VCTK 上 sad 仅 0.71% 与 0.00%,但同批 200 样本的人工多数投票识别率达 angry 100%、neutral 95%、happy 80%、sad 78%,确认情感是可辨的。
要直观理解为何说不可感知指纹跨情感保留,可以看同一条样本在不同情感下的残差曲线是否重合。下图展示 CosyVoice2 对同一条保留样本在 3 种情感下的 ΔE 轨迹,重点看峰谷位置是否一致。
看图路径: 1. 对比 happy、sad、angry 三条曲线在全频带的走势是否重合;2. 看 4000 Hz 附近的共同谷底和 5000-7000 Hz 的共同峰值是否跨情感稳定;3. 注意 angry 在 1000-3000 Hz 略低但整体轨迹仍与另两条保持同形

论文图 4。原论文 Figure 4::“Δ E(t) between different emotions as evidence of imperceptible fingerprints for CosyVoice2 on a single held-out demo utterance (speaker p312, text T201).”。
图 4 横轴为频率 0-8000 Hz,纵轴为 Delta dB fake-real,3 条曲线分别为橙色 happy、蓝色 sad、红色 angry。可见 3 条曲线在 4000 Hz 附近共同跌入谷底至约 -2 dB,在 5000-7000 Hz 共同隆起为峰,happy 在 6100 Hz 达约 16 dB,sad 在 5500 Hz 达约 13.5 dB;尽管红色 angry 在 1000-3000 Hz 整体低约 5 dB,但整体轨迹与峰谷位置高度一致。这种跨情感的同形性,与 VCTK 上约 1.00% 的微小波动相互印证:改情感没有改掉指纹的频域形态。
哪些结论站得住,哪些还不能外推
站得住的部分是因果分离的思路与可控证据:同一条音频在保持听感透明时被位深抖动重创,准确率下降达 48.2%,而只改情感词时仅约 1.00%,且两类效应在两个溯源器上趋势一致、跨生成器标准差大,支持扰动作用于生成器特有指纹而非通用声学退化。
不能外推的部分也很具体。第一是闭集 10 分类与训练测试同源合成,现实中会遇到未见过的生成器与野外信道,论文声明结论与开闭集无关但未做开集验证。第二是感知透明度的操作定义依赖 ΔDNSMOS<0.8 与 STOI>0.95 阈值及 20 人小样本听辨,阈值选择与样本代表性有限,WER 也仅定性提及。
第三是扰动类型敏感:HD 准确率下降仅 0.8% 而 BD 达 48.2%,结论不能概括为所有不可感知分量都脆弱。第四是情感仅覆盖 happy、sad、angry 3 类且客观 SER 准确率偏低,虽有人标复核但不足以代表全部可感知属性如韵律、口音、语速。第五是统计报告多处 p<0.001 但未报告效应量与多重比较校正,复现性实验样本仅 10 条。这些边界意味着不可感知更可信的判断在当前 10 个生成器与两个域内有证据,但在更丰富的风格变化与真实野外数据上仍需谨慎。
复现需要什么,缺什么
可复现的要素包括:10 个生成器的名单与 16 kHz 重采样、VCTK 与 ESD 的采样与划分、25000 条合成数据的匿名发布链接、HiggsAudioV3 权重链接、扰动的 5 类参数与阈值、情感提示的固定策略、显著性取前 15% 与重复生成 10 次的协议,以及准确率下降与概率下降的度量与检验方法。
缺失的要素集中在训练与部署侧:损失形式、优化器、学习率、warmup、batch size、训练步数或轮数、调度策略、GPU 型号与训练时长、解码温度与 beam size 等均未说明;除 HiggsAudioV3 外其余 9 个生成器权重链接未给,VCTK 与 ESD 也未提供独立下载链接,无 Demo 与独立检查点。这导致他人难以一键复跑完整闭集训练,只能复用已发布代码与合成数据做扰动与情感的验证。
工程价值上,论文提供了覆盖声码器、经典合成、LLM 与扩散的统一溯源流水线与可复用诊断脚本,对取证研究有参考意义,但未报告延迟、吞吐或资源开销,离部署评估还有距离。
为明确复现的可行性与成本,下表把已提供与缺失的要素按训练、扰动、统计与开源 4 类对照,指出各自对复现的影响。
| 复现项 | 论文已提供 | 缺失或待补 | 对复现的影响 | 成本/规模备注 |
|---|---|---|---|---|
| 生成器与数据 | 10 生成器名单、VCTK/ESD 采样、25000 条合成数据链接 | 9 个生成器权重、VCTK/ESD 独立下载、Demo | 可跑扰动与情感验证,难重训全流程 | 25000 条 16 kHz 合成语音 |
| 溯源器训练 | 冻结 WavLM/w2v-bert、10 类闭集、Grad-CAM 细节 | 损失、优化器、学习率、batch、轮数、硬件 | 训练超参需自行探索 | 仅训练后端 MLP/AASIST |
| 扰动与透明度 | PP/HD/ES/BD/BN 参数、ΔDNSMOS/STOI 阈值、听辨 κ=0.82 | WER 定量、阈值敏感性分析 | 透明度判定可复现但边界需自验 | 5 类扰动各 2 档,40 条听辨 |
| 统计与重复 | 准确率下降/概率下降、McNemar/配对 t、5 次重复 | 效应量、多重校正、更大样本复现性 | 显著性可复现,稳健性需补充 | 重复生成 10 次×10 条 |
| 开源 | 匿名代码与数据、HiggsAudioV3 权重 | 长期可维护链接、检查点 | 短期可验证,长期可维护性待加强 | 无部署延迟与吞吐报告 |
这张表的净收益是让读者快速判断哪些实验可直接复跑:扰动与情感的因果检验因参数与数据已公开而成本低,失败项是溯源器训练与权重缺失导致全流程复训不可行。反例是 BD 与 HD 的透明度差异提醒阈值敏感性未被充分检验,因此不能由这张表推出部署级的鲁棒性与可维护性结论。
给刚入坑的你:该怎么用这篇论文
把这篇论文当成一个诊断工具箱来读,而不是一个新模型。它的核心判断是:在当前实验条件下,不可感知指纹比可感知指纹更持久,证据是透明扰动能使准确率下降 48.2% 而情感变化仅约 1.00%。但这个判断是有条件的,条件就是闭集、有限生成器、代理透明度与有限情感。
做研究时,你可以复用它的三探针思路:先用残差与显著性证明指纹存在且与内容无关,再用近透明扰动与提示消融做互补因果检验,最后用跨生成器方差与跨溯源器一致性来排除通用退化。做取证时,则应优先关注那些不影响听感却被溯源器依赖的细粒度线索,同时警惕它们也可能被未来的针对性优化抹掉,论文的未来工作已点出这一风险。
下一步最值得补的,是把闭集扩展到开集野外、把情感扩展到更丰富的韵律与风格、把透明度从代理指标推向更大规模听辨与真实信道,并公开更完整的训练与推理配置,让不可感知更可信的结论在更广的分布上接受检验。
📎 论文与评分元数据
标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性
7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.4/2):将被动指纹按人耳可感知性二分为可感知与不可感知并给出可操作定义,提出 PIPDP 三探针诊断协议,设计 5 类感知透明扰动与提示驱动情感消融的互补因果检验,属于概念框架与方法组合层面的系统性创新。
技术严谨性 (1.1/1.5):三探针判定逻辑统一为扰动导致溯源下降且保持感知透明则归因于对应指纹分量,公式与阈值定义明确,未发现推导错误或算法逻辑漏洞,假设与操作定义均显式说明。
实验充分性 (1.1/1.5):以 3 种跨架构溯源器建立基线并对比 VCTK 域内与 ESD 跨域,覆盖 5 类扰动各 2 档参数与 2 生成器 3 情感的消融并报告 McNemar 与配对 t 检验,但闭集 10 分类同源合成与有限情感覆盖限制了外推充分性。
清晰度 (0.8/1):摘要与方法对 PIPDP 流程与三探针分工表述清晰,给出 5 类扰动算子与阈值定义及流程图,表格保留主溯源器与对照的完整对比口径,整体组织与图表表达较为完整。
影响力 (1.0/1.5):面向语音深度伪造溯源的取证可靠性问题,在 10 个生成器上显示不可感知扰动可致 48.2% 准确率下降而情感变化影响约 1.0%,为音频溯源的指纹选择提供了可复用的诊断思路与实证依据。
开源 (1.0/1.5):代码与 25000 条合成数据及处理代码已发布于匿名链接,仅提供 HiggsAudioV3 权重链接其余 9 个生成器未提供,VCTK 与 ESD 未提供独立下载链接且无 Demo 与独立检查点,属于部分核心产物开放。
可复现性 (0.1/0.5):仅说明冻结 WavLM 与 w2v-bert 特征提取器并训练后端分类头,提及 10 路闭集设置与 Grad-CAM 细节,但损失形式、优化器、学习率、batch size、训练轮数、硬件型号与推理参数等关键配置大量缺失。
工程/实践价值 (0.9/1.5):构建覆盖声码器、传统合成、LLM 与扩散模型的 10 生成器与 3 跨架构溯源器的统一溯源流水线,提供可复用代码与合成数据流水线,但未报告真实延迟、吞吐或资源开销的部署测量。