📄 On the Robustness of Audio Deepfake Detection under Audio Watermarking

标签:#音频伪造检测 #音频水印 #鲁棒性 #模型评估

7.7/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5

7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #音频水印 | #鲁棒性 #模型评估 | arxiv

👥 作者与机构

第一作者:Zi Qian Yong(School of Information Technology, Monash University, Malaysia campus) 通讯作者:正文未明确标注通讯作者 作者列表:Zi Qian Yong、Ajinkya Kulkarni、Julia K. Lau、Hwa Hui Tew、Shu-Min Leong、Raphaël C.-W. Phan、Sébastien Marcel(机构:School of Information Technology, Monash University, Malaysia campus;Idiap Research Institute, Switzerland)

📌 核心摘要

这项工作研究的不是如何生成能骗过指定检测器的最优扰动,而是合法内容保护步骤是否会意外改写 ADD 依赖的真假线索。它把容易被分开采购的系统矛盾摆到台面上:水印要在音频中留下可认证的结构,音频深伪检测(ADD)要从同一波形提取真假线索;前者没有以误分类为目标,也可能改变后者已经冻结的判别表示。

水印在这里承担内容来源与所有权保护,ADD 则判断音频是真实还是合成;2 类机制可能在同一媒体链路中串联。作者因此固定预训练 WavMark,将它置于检测器上游,比较同一音频在 No WM 与 WavMark 条件下的 EER,并从倒数第二层提取嵌入,以 Fréchet Distance、平均余弦距离和平均 L2 距离追踪表示变化。这个设计回答的是组合兼容性,而不是白盒逃逸成功率。

证据呈现出有条件的风险图谱。ASVspoof 2021 LA 与 DF 的 7 个 SSL、GNN、CNN 检测器普遍变差,而 ASVspoof 2024、FoR、ITW 的多数组合只小幅变化,个别还改善。SSL 的 spoof 表示往往移动更大,但 GNN 的小距离仍可伴随 EER 恶化,因而距离指标只能帮助诊断。可证伪的结论是:平台若串联水印与 ADD,必须在自己的水印器、检测器和目标域组合上做回归验收;本文只证明 WavMark 默认设置下的这一风险。

🏗️ 方法概述和架构

先把 2 条责任链分开看。输入可以是 bonafide 或 spoof 的 16 kHz 波形;WavMark 负责在其上嵌入消息,冻结的 ADD 只输出原有的 fake probability。作者不为水印增加分类头,也不把解出的消息喂给检测器,因此比较保持在既有 ADD 决策函数上:差别只来自上游波形是否经过水印。

宿主波形先经带 Hamming 窗的滑动窗口傅里叶变换(SWFT)得到复数频谱,实部和虚部堆成 2 个通道。音频支路与消息支路先在时频域汇合,宿主频谱的实部与虚部堆成 2 个通道,16-bit 消息则经全连接层投影到与波形等长的表示。消息表示再用同一 SWFT 配置转换,得到与宿主频谱可对齐的表示。

随后,2 个时频表示沿通道拼接,送入 WavMark 的可逆嵌入网络。网络输出水印频谱和消息分支;实验只保留水印频谱,经逆 SWFT 还原水印音频,刻意略去消息解码。这里的新增步骤是把现成 WavMark 接到检测器前,不是重新设计水印器或训练新的 ADD。

水印注入后的波形不在水印端重新判别,而是与原始波形分别通过相同的冻结 ADD。原始与水印路径的输出分数保留给 EER,倒数第二层嵌入再配对计算 FD、余弦和 L2 距离;前者检查最终判别是否变差,后者定位水印进入后表示在哪些条件下移动。

水印音频进入保持冻结的 ADD;原始音频则并行进入相同模型。作者没有重训或微调这些检测器;7 个模型都沿用在 ASVspoof 2019 上训练的公开预训练版本,水印也不读取它们的梯度、参数或损失。于是,水印前后 EER 的差异可以归于固定媒体处理链引发的输入与表示变化,而不是联合训练收益。

冻结检测端覆盖 7 个系统:XLSR+SLS、TCM、Nes2Net 属于 SSL 路线,AASIST 与 RawGAT-ST 属于 GNN 路线,RawNet2 与 RawTFNet 属于 CNN 路线。原始与水印音频除产生真假分数外,还各自给出倒数第二层嵌入;EER 检查最终错误,FD、余弦和 L2 检查表示是否移动。图 1 把这个差别画成 2 条并行路径:上方是普通 ADD 推理,下方在 ADD 前加入 Watermark Embedding,并标出被扰动的特征表示。

查看下图的 2 条推理路径,追踪 WavMark 的 Watermark Embedding 位于冻结 ADD 之前的接口。

Overview of normal ADD inference and the proposed watermark-based perturbation framework.

上半部从 Input Audio、Preprocessing、ADD Model 到真假输出;下半部在 ADD 前插入 Watermark Embedding,并把特征表示标作被扰动。该图只呈现 WavMark 前置到 ADD 的串联接口,图中文字“deceived”不能改写正文的非对抗协议,因此不证明主动规避成功。

数据域也是控制轴。ASVspoof 2021 LA/DF 提供相对受控的条件,ASVspoof 2024、FoR、ITW 则增加声学、信道或真实来源差异。固定水印器使检测器和数据域差异较易比较,却也把结论限定在 WavMark;所以图 1 用于定位接口,不证明主动规避成功。

💡 核心创新点

  1. 问题重构在于把“合法处理是否干扰检测”变成可测问题。既有对抗攻击通常围绕目标误分类优化扰动,无法区分攻击能力和媒体链兼容性;本文保持 WavMark 与 ADD 都不接触对方梯度,用同一样本的水印前后差分寻找冲突。EER 的系统性变化支持这类风险确实存在,但图 1 中的 “deceived” 只是视觉措辞,实验没有证明针对性欺骗。

  2. 评测设计让风险不只属于单一前端。7 个检测器覆盖 SSL、GNN、CNN,5 个公开数据集覆盖相对受控和复杂条件;这使“水印会破坏 ADD”变成检测器—数据域矩阵,而不是漂亮的单模型案例。证据同时显示 ASVspoof 2021 的广泛退化与复杂域的多数组合稳定,因而论文提出的是条件性脆弱性,不是普遍定律。

  3. 机制诊断把最终错误与内部状态并置。作者将水印前后的倒数第二层嵌入用 FD、余弦和 L2 描述,再和 EER 对照:SSL 的 spoof 侧常出现大漂移,AASIST 却给出小 FD 仍掉点的反例。这个反例说明表示距离是故障定位线索,而不是可替代检测性能的充分指标。

  4. 最终产出是可用于组合验收的诊断口径:对每个水印器—检测器—目标域组合,同时测 EER 和表示移动。论文没有给出联合训练、水印感知前端或载荷调节策略,故创新止于发现风险和组织证据,而非修复冲突。

📊 实验结果

要比较的是:同一个冻结检测器在水印前后会错多少,且这种差异是否跨 SSL、GNN、CNN 都出现?输出层以 EER 为准,数值越低越好;表示层以 Fréchet Distance、平均余弦距离和平均 L2 距离衡量原始与水印嵌入,距离越大表示迁移越强。表格保留每个模型的 No WM 基线和 WavMark 条件,因此读者看到的是同主干的配对变化。

ADD 模型LA No WM EER↓LA WavMark EER↓DF No WM EER↓DF WavMark EER↓
XLSR+SLS2.86%29.33%1.91%33.90%
TCM2.99%29.83%2.14%34.22%
Nes2Net2.17%29.70%1.49%34.06%
AASIST11.46%30.83%21.07%35.05%
RawGAT-ST10.25%29.77%23.26%36.50%
RawNet29.48%30.19%22.38%36.44%
RawTFNet5.04%29.84%16.82%35.03%

在 ASVspoof 2021 LA,XLSR+SLS 在 WavMark 条件下的 EER↓ 从 No WM 2.86% 升至 29.33%,越低越好的指标明显恶化。在 ASVspoof 2021 DF,XLSR+SLS 在 WavMark 条件下的 EER↓ 从 No WM 1.91% 升至 33.90%,同主干在 2 个受控公开域都失去原先的低错误率。7 个模型在 LA、DF 都向更高 EER 聚集,支持“这个串联接口需要验收”;它不等价于每个样本都被成功攻击。

接着检验复杂公开域是否重复同样的退化:它们并没有统一崩塌。

ADD 模型2024 No WM EER↓2024 WavMark EER↓FoR No WM EER↓FoR WavMark EER↓ITW No WM EER↓ITW WavMark EER↓
XLSR+SLS18.76%18.79%5.07%6.38%7.45%8.11%
TCM18.85%19.06%10.68%11.20%7.80%7.88%
Nes2Net22.05%21.67%6.31%7.01%7.75%8.55%
AASIST35.53%35.59%21.64%22.96%43.00%43.86%
RawGAT-ST40.29%40.41%53.09%53.19%52.53%53.79%
RawNet240.67%41.10%48.54%47.49%49.00%49.82%
RawTFNet44.73%41.37%36.57%41.39%38.72%46.00%

更复杂的数据域给出重要负结果:ASVspoof 2024、FoR 与 ITW 的多数组合变化有限,个别 EER 甚至下降。Nes2Net 在 ASVspoof 2024 从 22.05% 降至 21.67%,RawNet2 在 FoR 从 48.54% 降至 47.49%,而 RawTFNet 在 ITW 从 38.72% 升至 46.00%。这组混合结果阻止把 LA、DF 的崩塌外推为所有公开域的固定规律。

表示柱回答“哪里变了”,而非替代 EER。XLSR+SLS 的 LA spoof 侧 FD 为 419.10,LA bonafide 侧为 37.52;图 2(a) 的蓝橙主体虽有重叠,右下和右上仍出现橙色主导的分支与簇。Nes2Net 在 ASVspoof 2021 LA 的 spoof 嵌入以 No WM embedding distribution 为基线,Fréchet Distance↑ 为 965.67 无量纲,数值越高表示漂移越强;其 EER 从 2.17% 升至 29.70%。这一图形证据只诊断表示分离,EER 仍是性能判断。

查看下图的 XLSR+SLS LA spoof t-SNE,比较蓝橙主体重叠与右下、右上橙色主导分支。

(a) XLSR+SLS — Spoof

散点图 2(a) 的左侧主体有蓝橙混合,右下形成密集橙色簇,右上也有橙色延伸;这些像素结构与 LA spoof 的 FD 419.10 同向。t-SNE 是投影图,适合诊断 WavMark 后的表示分离,EER 仍是性能判断,不能单独给出因果解释。

同一模型的 LA bonafide FD 为 37.52,图 2(b) 的主体蓝橙点更混合,右缘仍有橙色支路,和 spoof 图的大分离不同。真假侧的差异支持敏感性不对称,而非真实侧完全不受影响。反例更关键:AASIST 在 ASVspoof 2021 LA spoof 的水印前后嵌入以 SSL 检测器为强比较对象,Fréchet Distance↑ 为 1.12 无量纲,数值越高表示漂移越强;其 EER 仍从 11.46% 升至 30.83%。因此没有传统组件消融时,最稳妥的机制表述是“表示移动与退化相关”,而不是把 FD 视为原因。

查看下图的 XLSR+SLS LA bonafide t-SNE,比较主体蓝橙混合与右缘橙色支路是否仍存在。

(b) XLSR+SLS — Bonafide

散点图 2(b) 的主体点云中蓝橙交叠更明显,右缘仍有橙色占优的弧形支路和小簇,没有 spoof 图的大块独立橙簇。这与 bonafide FD 37.52 小于 spoof FD 419.10 相呼应,支持真假侧的敏感性不对称;投影重叠不能证明真实侧完全不受影响。

🔬 细节详述

复现这项评测,先固定输入尺度。受控输入按 1 秒片段组织,长度设为 16000 个波形采样点,对应 16 kHz;全部评测音频也重采样到 16 kHz。宿主波形用 Hamming 窗 SWFT 变为双通道复数频谱,K-bit 二进制消息经全连接层投影到波形长度后使用相同变换。

水印端采用预训练 WavMark 与默认 16-bit 载荷。可逆网络从宿主频谱和消息频谱的通道拼接产生水印频谱与消息分支,实验仅将前者逆变换为波形;因为任务只评估 ADD,作者不运行解码支路。检测端保持 ASVspoof 2019 训练得到的模型权重冻结,收集 bonafide 与 spoof 分数计算 EER。

表示分析取最终分类层之前的嵌入,对同一音频的原始与水印版本计算 FD、平均余弦距离和平均 L2 距离;t-SNE 只展示 ASVspoof 2021 LA 的 3 个 SSL 模型真假样本。作者引用 WavMark 的 38.55 dB SNR 与 4.3 PESQ 作为该模型既有的低失真信息,却没有在本篇 5 个数据集重新逐域报告音质,也未给出水印解码成功率。因而这些数值只能说明被选用的预训练水印器在其原始报告中的失真水平,不能替代本篇各数据域中的音质与可解码性验收。

尚未披露的复现条件同样重要:各数据集的样本规模、消息位生成方式、batch size、软件版本、随机种子、置信区间、硬件、运行时间、延迟、吞吐与峰值内存都未说明。真实语音诈骗说明 ADD 的应用压力,但本文的核心证据来自受控水印前后对照。

🚨 局限与问题

直接证据只覆盖 WavMark 默认设置与 16 kHz 输入,未比较 AudioSeal、SilentCipher、Timbre Watermarking 等水印器,也未改变载荷、强度或嵌入位置。论文没有水印解码成功率、逐样本听感、统一音质测量、统计显著性、联合训练或水印感知防御消融;图 1 的主动“deceived”措辞也比正文的非对抗威胁模型更强。

进一步审视

最重要的外推限制是水印轴没有展开:实验只使用 WavMark、默认 16-bit 载荷和 16 kHz 输入。AudioSeal、SilentCipher 与 Timbre Watermarking 只出现在背景中,没有进入同一检测器—数据域矩阵,因此尚不知更弱或更强的载荷、不同嵌入机制是否会保留相同排序。

方法轴也没有直接消融。作者未改变消息长度、嵌入强度或时频位置,未比较关掉支路、联合训练、数据增强或水印感知前端;大 FD 与坏 EER、以及小 FD 仍掉点只能构成相关证据。图 1 的 “make deepfake audio look real” 和 “deceived” 比正文设定更像主动攻击,阅读时应回到没有梯度访问和目标优化的实际协议。

音质、可解码性与检测风险没有被共同验收。本文没有在目标数据重新测 SNR、PESQ、听感或解码率,也没有分开报告水印作用于 bonafide、spoof 或不同类别时的策略。EER 又是总体工作点指标,论文不分解漏检和误报,也未报告样本规模、置信区间或显著性。

部署侧缺少编解码、重采样、噪声、串联水印、延迟与吞吐测试。因此本文能够支持的结论是:WavMark 默认设置暴露了特定数据域下的 ADD 脆弱性;它尚不能给出普适水印风险、线上错误结构或防御收益。

🔗 开源与复现资源

作者在摘要中明确给出本文代码仓库:https://github.com/ziqian0925/wm-ADD-robustness.git。这足以让研究者追踪组合矩阵的实现入口。WavMark 仓库是论文引用的第三方预训练水印依赖,不应误算为本文额外交付的模型或数据。

论文没有声明本文训练权重、新数据集、Docker 环境、版本锁或在线 Demo。代码降低了复建评测路径的门槛,但复现者仍须从仓库核对数据划分、消息生成和依赖版本,并自行补足本文未披露的运行配置。

💡 研究者判断

这篇论文最有价值的选择,是把来源保护与深伪检测之间的接口当成独立研究对象:WavMark 不需要知道检测器,受控域里的低 EER 仍可能被推到很高。它没有把复杂域里稳定、甚至变好的组合藏起来,也没有让漂亮的 SSL 表示图取代 EER。

相应地,论文的证据尺度必须保持克制。1 个水印器、默认载荷、没有统计检验、跨水印比较、机制消融和部署测量,不能推出“水印普遍攻击 ADD”。它更像可操作的风险地图:先在自己的串联链路跑成对 EER,再用表示变化定位问题;修复策略则仍留给后续工作。

⚖️ 评分理由(展开查看)
  • 创新性 (1.3/2):将合法水印视为结构化、非针对性 ADD 压力测试,切入点新颖且直接暴露认证技术之间的冲突;不过核心变换采用现成 WavMark,方法创新主要来自问题设定与评估框架。

  • 技术严谨性 (1.0/1.5):以同一样本水印前后对照,并用 EER、Fréchet、余弦和 L2 从输出与表示 2 层解释现象;但缺少统计检验和因果机制实验,结论仍以相关性为主。

  • 实验充分性 (1.2/1.5):覆盖 7 个检测器、3 类架构和 5 个公开数据集,并报告完整 EER 矩阵与表示距离;没有跨水印、载荷强度、音质—鲁棒性曲线或直接防御消融,按无直接消融上限计分。

  • 清晰度 (0.8/1):任务、流程、表格和图示总体清楚,读者能追踪水印到表示漂移再到 EER 的链条;部分符号排版、SWFT 命名以及图 1 的攻击性措辞与正文设定存在不一致。

  • 影响力 (1.1/1.5):结果对同时部署来源水印与音频深伪检测的内容平台有现实警示,且数据域依赖性避免了过度泛化;单一水印设置和缺少部署链路测量限制其普遍影响。

  • 开源 (1.2/1.5):摘要明确提供本文代码仓库,因此按已发布代码计分;未见本文新模型权重或新数据集交付,第三方 WavMark 仓库不作为额外开源产物加分。

  • 可复现性 (0.3/0.5):论文披露 16 kHz、默认 16-bit WavMark、检测器和数据集组合,足以复现主流程;未说明样本规模、消息抽样、随机种子、硬件与版本锁定,复现实验仍需查代码。

  • 工程/实践价值 (0.8/1.5):无需梯度或目标模型访问的黑盒设置贴近真实媒体处理链,具有实际风险筛查价值;没有延迟、吞吐、资源、在线误报或防御部署测量,因此工程分不超过 1.0。


← 返回 2026-08-26 语音/音乐/音频论文速递