英文题目:VoxWatermark: A Large-Scale Benchmark for Audio Watermark Detection under Perturbations

会议身份:conference:interspeech:2026:conference-paper-id:sedaghati26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #对抗鲁棒性 #语音 #音频水印

评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Farnaz Sedaghati:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuxi Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zicheng Weng:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理音频水印(Audio Watermarking)检测任务,输入为16 kHz单声道5秒语音片段,输出为是否存在水印的二分类判定,难点在于注入方法未知且测试音频经历传输压缩与对抗篡改后分布严重偏移。所提流程先用统一协议在LibriSpeech、Common Voice、VCTK、AISHELL-1多源语料上注入10种传统与神经水印并构造无盒、黑盒与白盒移除与伪造扰动,形成VoxWatermark基准,再训练单查询卷积基检测器对对数梅尔谱打分,接着对同一音频做8次随机变换查询并提取均值与稳定性统计,最后用逻辑回归元分类器融合输出最终判定。相比单次打分的水印检测器(Watermark Detector,WMD)基线,该机制差异在于把判决依据从单点置信改为查询一致性,从而在梯度攻击下更难被单次扰动欺骗。在跨语言测试集Test Set 1上AudioWMD的AUROC为63.8%,高于WMD的57.1%,白盒组达77.2%对48.6%,但无盒平均仅54.3%对51.3%,黑盒HSJA谱图攻击下真阳性率跌至3.9%而WMD保持96.1%。结论仅适用于16 kHz短语音与所列水印和扰动集合,未验证长音频、真实信道录音与未知神经水印的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/wailywang/VoxWatermark — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决哪类现实失败?

本文输入是待测语音片段,目标是判断其中是否存在不可感知水印证据,输出是二分类判决。不可感知水印先用白话说就是人耳听不出区别但机器可查的隐藏标记,英文为 imperceptible watermark,适合大规模生成语音的来源追溯。水印检测英文为 watermark detection,它不解出具体比特也至少要回答有无水印。学习依赖上,读者需要先理解语音合成已经非常逼真带来的冒充与误导风险,再理解水印嵌入与检测是分离的两个环节。

本文必须保留的信息包括基准规模与构成、扰动分类、基线结构与跨分布协议,输出是 1 篇可核对方法与实验条件的解读。论文报告基准总量对应约 126513.89 小时音频,包含干净、加水印与扰动后样本,代码当前可用,地址为公开仓库。

不可感知水印 × 水印检测: 不可感知水印负责把不影响听感的隐藏信号写进音频,水印检测负责从待测音频中判断这种证据是否存在,二者搭配的原因是生成端只管嵌入无法保证传输后可读,必须由检测端在未知水印方法和未知信道下做出二分类判决,组合意义是把评测焦点从嵌入质量转向检测稳定性。

论文要解决的现实失败是实验室里能检出,真实录制传输后就失效。作者把原因归为两层,一是注入方法多样,未知嵌入方法会让检测器在跨方法时排序能力下降,二是分布偏移,语言、口音、压缩、噪声、变速变调都会削弱或抹除嵌入痕迹。已有基准如 AudioMarkBench 和 RAW-Bench 更关注水印算法本身的鲁棒性与听感,而非检测器在未知嵌入下的系统比较,也缺少通用检测基线。因此本文既建基准又给基线,教学例子是快递单号类比仅为例子:单号贴上时清晰不等于运输磨损后仍可扫读,真正要测的是磨损后的扫读率。

已有路线在同输入同目标下做了什么,还缺什么?

同输入同目标的工作是音频水印检测与鲁棒性评测。论文点名的对照路线是 AudioMarkBench,它覆盖 AudioSeal、Timbre 和 WavMark 3 种水印,数据与扰动设置相对有限,且不提供通用检测基线。另一条路线是 RAW-Bench,侧重水印在神经编解码等现实处理下能否存活。

按同输入、同目标、同监督、同运行阶段对照,这些工作与本文输入都是音频片段、目标都涉及水印是否存在或能否恢复,但监督与运行阶段不同:它们多在已知嵌入方法下评估解码正确率与听感,本文则在未知嵌入方法与未知扰动下评估检测器的二分类泛化。论文报告传统方法包括最低有效位、量化索引调制、拼凑算法、回声隐藏、相位编码和直接序列扩频,学习方法包括 AudioSeal、WavMark、Timbre 和 Perth,这种四加六的组合是为了覆盖检测器在不同嵌入范式下的行为。

缺失的一环正是检测导向的大规模跨分布基准,以及一个可复现的统一基线,本文用 VoxWatermark 与 AudioWMD 补上这一环。

检测任务如何形式化,去除与伪造各要优化什么?

论文把检测形式化为二分类,给定音频片段预测是否存在水印证据。符号上用 xw 表示已加水印音频,用 xu 表示未加水印音频,用 eta 表示叠加扰动,用 D 表示水印检测器,用 Q 表示 ViSQOL 等客观质量度量。去除攻击的目标是在保持听感近似的约束下最小化检测响应,使加水印音频被判为无水印,对应漏检风险,允许合成内容绕过过滤。伪造攻击的目标是在同样保真约束下最大化检测响应,使未加水印音频被判为有水印,对应误报风险,可被用来栽赃正常用户。约束写法是质量近似相等,即扰动后质量与扰动前质量基本一致。

水印去除 × 水印伪造: 水印去除负责把已加水印音频中的检测响应压低以逃避过滤,水印伪造负责给未加水印音频加上看似合法的水印响应以嫁祸正常用户,二者搭配的原因是只测一类会高估检测器安全性,组合意义是同时考察漏检和误报 2 个方向的完整性威胁。

攻击者能力进一步分为三档。无盒扰动指不依赖检测器内部信息与输出的通用音频处理,包括压缩、格式转换、重采样、加噪与变速变调等 17 种实现,代表真实传输与后处理。黑盒扰动指把检测器当作可查询预言机,用 HopSkipJumpAttack 估计决策边界或用 Square Attack 在谱域随机搜索。白盒扰动指完全知道解码器与目标比特流,对深层模型最小化二元交叉熵,对传统方法用可微近似再做梯度下降,去除时瞄准比特翻转后的消息,伪造时瞄准指定消息。

AudioWMD 让一个样本走完输入到输出经历了什么?

先沿一个样本走全程有助于建立学习依赖。输入是一段 16 千赫单声道 5 秒音频,先进入左侧的预处理与查询扰动层,原文对一个片段发出 K 等于 8 次查询,1 次是原始音频,另 7 次是随机变换版本,图中所列包括时间拉伸、音高偏移、加性噪声、增益缩放与时间遮蔽。每次查询音频都被转成对数梅尔频谱,再送入中间的卷积编码器得到一个水印置信分数,于是 8 次查询得到 8 个分数。

右侧把这 8 个分数聚合成紧凑的 5 维元特征,包括分数均值、标准差、极差、正例占比与相对原始查询的翻转率,再送入逻辑回归元分类器输出最终是否为水印音频的概率。下图是论文给出的总体结构,阅读时先看主路径再看统计聚合的作用。

看图路径: 1. 先从左栏原始音频沿箭头看到黑盒查询与扰动层列出的五种变换;2. 再看中栏三个卷积块与池化如何把梅尔频谱变成置信分数;3. 最后看右栏 K 个分数如何聚合成五维统计向量再进逻辑回归;4. 对照左右箭头确认一次输入对应 K 次查询再对应一次最终判决

原论文 Figure 1:Overview of AudioWMD. Raw audio is transformed into stochastic variants, scored by a base…

论文图 1。原论文 Figure 1:“Overview of AudioWMD. Raw audio is transformed into stochastic variants, scored by a base detector, and aggre- gated into meta-features for final watermark prediction.”。

从像素可见的结构分为三栏。左栏顶部是原始波形示意,向下是黑盒查询与扰动层,明确写出 K 等于 0 为原始音频,K 大于 0 为时间拉伸等变换,底部汇成梅尔频谱输入。中栏是卷积编码器,含 3 个卷积块,前两块各有两个 3 乘 3 卷积加批归一化与激活再加 2 乘 2 最大池化,第三块后接 1 乘 1 自适应平均池化,箭头指向右侧。右栏是决策融合阶段,上方把 K 个 Sigmoid 分数变成均值、标准差、最大最小差、水印率与翻转率,再压成 5 维统计向量,下方经逻辑回归得到水印概率。这种设计的教学要点是稳定性:单次分数易被扰动拉偏,多次查询的一致性更难同时伪造。

基础检测器与元分类器各自算什么,为何要串起来?

第一阶段基础检测器记为 f,训练在 16 千赫对数梅尔频谱上,用带 logits 的二元交叉熵损失,输出每个片段的水印置信分数。论文还用 WaterMark Detector 作为主要比较基线,该基线是单查询检测器,每个片段转频谱后经 ConvNeXt-V2 主干得到分数,并采用非对称损失拉开水印与非水印响应。第二阶段是查询统计元检测,对每个片段收集 8 次查询分数后计算 5 维特征,再用逻辑回归做最终预测。组合时先冻结或固定第一阶段的打分行为,再在第二阶段学习如何利用波动模式,这种串联使评估可以直接回答稳定性建模是否带来鲁棒性增益。

基础检测器 × 元分类器: 基础检测器负责对每段梅尔频谱输出一个水印置信分数,元分类器负责把多次随机查询得分的统计特征映射为最终判决,二者搭配的原因是单次分数在扰动下波动大而多次查询的一致性更能反映水印是否真实存在,组合意义是用稳定性建模替代单点阈值判决。

需要指出的缺项是原文未完整报告基础检测器的网络层数、梅尔参数、优化器与学习率细节,也未说明元分类器训练时是否对扰动增强数据做过拟合控制之外的处理。论文明确报告训练时不加扰动增强,验证集与训练同域同水印方法,这为后文跨分布下降提供了干净的对照起点。

无盒扰动 × 白盒扰动: 无盒扰动负责模拟不依赖检测器内部信息的通用处理如压缩重采样加噪变速,白盒扰动负责在完全已知解码器和目标比特时用梯度定向改写判决,二者搭配的原因是前者代表日常传输退化而后者代表最强自适应攻击,组合意义是区分鲁棒性不足是来自信道还是来自对抗优化。

三类扰动在构造时如何保证去除与伪造可比?

无盒部分实现 17 种扰动,覆盖时间操作、加性噪声、谱滤波、量化、动态范围、相位抖动与神经编码器等,背景噪声池还细分工业、军事、环境与信道条件,并纳入 EnCodec 与 Opus 以模拟传输失真。关键公平设计是去除与伪造用相同参数设置,分别作用于加水印与未加水印音频,避免因参数不同造成不可比。黑盒部分对每种水印方法的去除攻击取 200 个加水印样本,HopSkipJumpAttack 同时作用于原始波形与时频表示,Square Attack 限于时频域做块更新。

白盒部分对深层模型优化二元交叉熵,对传统方法做可微近似,伪造用 200 个未加水印样本,去除用 200 个对应加水印样本,成功伪造计入误报,成功去除计入漏检。代表性无盒 3 类各选 1 例进入主评测,即 M109 背景噪声、0.9 倍时间拉伸与低码率 EnCodec 压缩,以保证时域、噪声域与编码域都有覆盖。

数据如何切分,训练见过什么,测试刻意藏起什么?

训练与验证承担方法职责的是数据构造而非新优化器。原始训练池含 34000 段干净语音,来自 LibriSpeech、Common Voice 英文中文与 AISHELL-1。最终训练集为 61200 个样本,由 30600 干净加 30600 水印配对构成,水印来自 6 种已见方法,包括最低有效位、量化索引调制、直接序列扩频、AudioSeal、Timbre 与相位编码。验证集取分层 10%,与训练同源同水印方法,属于域内监控收敛用。测试藏起两个维度,一是跨语言测试集取自 Common Voice 中排除英文中文后的语种,二是跨口音测试集基于 VCTK,两者都用 3 种未见水印方法即拼凑算法、回声隐藏与 WavMark。

阈值选择在验证集上完成并冻结后直接用于所有域外测试,避免在测试集上重调阈值带来的乐观偏差。这种安排的理由是部署导向:测试时音频来源与条件未知,检测器不能靠重调阈值作弊。

评测分哪四种场景,指标方向与公平条件是什么?

论文定义 4 种扰动场景。第一是无盒扰动,把时间拉伸、M109 与 EnCodec 作用于两个测试集。第二是黑盒攻击,用两种 HopSkipJumpAttack 变体与 Square 攻击。第三是基于梯度的白盒攻击,含伪造与去除。第四是按组汇总无盒、黑盒、白盒性能。

比较对象是复现的 WaterMark Detector 与新提出的 AudioWMD,两者在同一协议下运行,阈值都来自验证集。指标方向是受试者工作特征曲线下面积越高越好,准确率、精确率、召回率与 F1 越高越好,黑盒表中真阳性率越高越好、假阴性率越低越好。感知与信号层面用 ViSQOL 与信噪比约束保真,攻击必须在听感近似下进行。硬件预算与统计显著性在证据中未报告,这是复现时需要补记的缺项。

主结果显示跨分布下降了多少,谁的排序更稳?

要回答的核心问题是域内强判别能否迁移到跨语言跨方法。论文报告 2 模型在验证集上都强,但域外显著下降,AudioWMD 的排序稳定性更好。下表把跨分布主结果整理为可运行策略的直接对照,比较问题是同阈值冻结下谁的跨分布排序更稳,公平条件是同训练同验证阈值同测试集,指标方向是 AUROC 越高越好。

测试集指标AudioWMDWMD 复现基线基准规模备注
Test2 跨口音AUROC0.6320.579总时长 126513.89 hours
验证集域内定性强判别强判别同域同方法监控收敛
域外总体趋势下降但更高下降更多未见方法加未见分布
适用条件阈值验证集冻结验证集冻结禁止测试集重调

表后解释需要同时给出收益与代价。收益是 AudioWMD 在两个域外集上 AUROC 分别高出约 0.067 与 0.053,支持查询稳定性建模改善排序的判断。代价是绝对值仍从域内高位跌到 0.63 附近,说明注入多样性与分布偏移确实影响稳定性。

未胜出项是部分 F1 与准确率并未同步拉开,论文在无盒平均上也承认 F1 相当,表明排序改善不等于阈值判决全面改善。边界是该表只反映干净域外条件,扰动后的进一步退化需看后文分组结果。

结构化扰动下无盒与白盒各掉了多少,白盒为何拉开差距?

第二个问题测扰动分组下的鲁棒性。下表聚焦白盒分组的可运行对照,比较问题是梯度自适应攻击下稳定性建模是否仍有效,公平条件是同测试集同白盒伪造去除配额,指标方向是 AUROC 与 F1 越高越好。

测试集条件指标AudioWMDWMD 复现基线
Test1White-boxAUROC0.77150.4863
Test1White-boxF10.530.45
Test1攻击配额样本数200200
Test2趋势定性白盒仍显著更高白盒接近随机
无盒平均趋势定性小幅 AUROC 增益接近随机水平

表后解释要区分两类扰动。

无盒下两检测器都明显退化到接近随机,常见信号处理会模糊水印证据并降低分数可分性,AudioWMD 仅有温和 AUROC 增益而 F1 相当,说明非自适应扰动的改善有限。白盒下差距拉大,论文报告 AudioWMD 在 Test1 达 0.7715 对 0.4863,F1 为 0.53 对 0.45,支持稳定性元分类器更能抵抗梯度操纵的解释,因为单次声学分类器易被定向梯度 1 次击穿,而多次查询一致性需要同时操纵多次响应。限制是这只是有限解释而非因果证明,且未测量延迟与误判率随查询次数的变化,不能承诺 8 次查询在部署成本上一定划算。

黑盒攻击为何表现不均,哪种攻击让 AudioWMD 失效?

黑盒结果是本文的反证环节,专门暴露模型特异弱点。论文按攻击类型报告真阳性率与假阴性率,总体上 AudioWMD 在 T1 的 Square 攻击上更强,但在 HSJA 谱域变体上急剧恶化,而复现基线在后者上反而更高。教学上要把同色不同对象的误读放在一边,只按攻击名与测试集核对升降。

黑盒攻击 × 查询统计特征: 黑盒攻击负责把检测器当作可查询的预言机反复试探决策边界,查询统计特征负责记录多次扰动查询下分数的均值方差极差与翻转率,二者搭配的原因是黑盒攻击恰恰利用多次查询的反馈来逼近边界,而统计特征反过来监视这种不一致性,组合意义是把攻击者的查询行为本身变成可检测的线索。

具体机制是 HopSkipJumpAttack 通过二分搜索逼近决策边界并估计梯度,Square Attack 在谱域随机搜索块更新,前者更擅长利用单查询阈值的几何形状,后者产生的块扰动可能被多次查询的统计特征捕捉。论文的数值趋势显示 AudioWMD 在 T1 的 Square 上优于基线,但在 HSJA 谱域上真阳性率跌到极低水平,而基线仍保持较高检出,这构成明确负结果。支持的判断是基准同时覆盖多扰动家族的价值:只看干净或单一攻击会掩盖这种弱点。待验证的推测是谱域边界估计恰好绕过了当前 5 维统计量的敏感方向,但原文未给出消融证明,不能断言去掉某 1 维特征必然如何。

哪些边界未评测,哪些数字不能互相比较?

首先是未评测边界。训练时无扰动增强,验证严格域内,因此所有扰动结果都是零样本鲁棒性,不能推广到已做增强训练的部署系统。黑盒与白盒每种方法各用 200 样本,样本量有限且未报告置信区间,不同攻击间差值不能直接当作显著性。不同指标差值不能混放,百分点与相对百分比不同,AUROC 排序改善不等于 F1 判决改善,自动指标也不能当作人耳听感。其次是表头冲突需要标注。

总量表述中样本数写法为 91190K 量级,若按字面换算会远超小时数对应的片段数,论文同时给出约 126513.89 小时与 5 秒切分,读者复现时应以小时数与切分逻辑为准并核对仓库脚本,不自行编造聚合口径。最后是成本缺项。8 次查询带来约 8 倍前向开销,原文未报告推理延迟、显存与误判率随查询数的曲线,因此不能承诺稳定性增益没有延迟代价。

复现先做什么,需要哪些超参数与信息条件?

复现第一步是取公开代码与数据划分脚本,确认资源状态为可用后再下载。按原文重放数据管线:所有音频统一切为 5 秒并重采样到 16 千赫单声道,Common Voice 取 20000 条覆盖 25 语言并兼顾性别年龄,LibriSpeech 取 20000 条英文,VCTK 取 10000 条多口音英文,AISHELL-1 取 10000 条中文。嵌入时统一用随机载荷,除 Timbre 用 10 比特与 Perth 用隐式签名外其余用 16 比特消息。第二步重训基础检测器并冻结阈值,再为每片段生成 8 次查询并计算 5 维统计特征,最后训练逻辑回归元分类器。

评测时保持阈值冻结,分别跑干净跨语言、跨口音、无盒三代表、白盒伪造去除与黑盒三攻击。关键超参数是查询数 K 等于 8、无训练扰动增强、验证分层 10%、黑白盒每方法 200 样本。信息条件上攻击者能力必须与论文一致,无盒不准访问检测器输出,黑盒只准查询,白盒才准用梯度。若复现白盒传统方法,需实现可微近似并用 Adam 平衡检测误差与保真,否则无法对齐原文条件。

何时值得尝试 AudioWMD,还需补哪项验证?

当部署场景面临未知水印方法与未知传输失真,且更关心排序稳定性而非单阈值精度时,值得尝试 AudioWMD 的 2 阶段思路,因为它在跨语言跨方法与白盒梯度攻击下都显示出比单查询基线更高的 AUROC。当延迟敏感或查询预算受限时要谨慎,因为 8 次查询与 2 次分类必然增加开销,而原文未量化延迟与成本。还需补的验证包括查询数消融、5 维特征各维贡献、不同阈值策略下的 F1 校准,以及更大样本下的黑盒置信区间。

论文的直接报告是基准规模、多方法覆盖与分组退化趋势,有限解释是稳定性建模带来鲁棒性,未验证推测是该思路能否推广到未见过的神经编解码与更强自适应攻击。初学者复述时应先讲任务与威胁模型,再讲 1 次样本的八查询全程,最后讲跨分布与分组结果,避免把比喻当作性质证明。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总