英文题目:Anchor Watermark: Robust Attribution for Diffusion-based Text-to-Audio Model
会议身份:
conference:aaai:2026:conference-paper-id:40561
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#扩散模型 #鲁棒性 #音频生成 #音频水印
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Xianjin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Donghui Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频模型归属需以可疑音频与候选模型预设锚点为输入,输出是否为该模型生成的判定与比特匹配度,难点在于波形-Mel有损转换与DDIM逐步反演累积误差会严重退化直接反演的水印。先用ChaCha20加密水印并经分布保持采样映射为标准高斯初始隐向量作为枢轴锚点,参与常规去噪生成梅尔谱与波形而不改变生成过程。归属时对同一锚点执行无引导扩散生成中间隐轨迹作为优化参照,其分布与带引导扩散轨迹在多数步骤保持统计一致。再以柔性动态时间规整为损失对反演轨迹做梯度对齐修正,并从修正终点经逆映射解码水印后以阈值判定归属。与后处理嵌入、声码器微调和编解码器训练三类路线不同,该机制不修改生成模型且无需额外训练,而是将鲁棒性转化为时间序列对齐问题,仅当锚点匹配时才获得正确对齐路径。在AudioCaps语料上AudioLDM模型的评测设置下,本方法的Bit Acc为0.98,高于GROOT的Bit Acc的0.82。该结论的适用边界是封闭模型且私钥持有者可访问锚点,失败条件包括高强度半音音高偏移下比特准确率降至约0.85,再生攻击评估因使用同模型泄露假设而受限,推理开销为每条音频约4s至17s,硬件为RTX 4090 GPU。
🔗 开源与复现资源
- 代码相关资源:https://github.com/DDAN-LAB/AnchorWM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一个归属缺口?
本文的输入是一段可疑音频和一个候选文本生成音频模型,目标是判断该音频是否由该模型生成,并在多个候选水印中指出归属。输出不是音频质量评分,而是一个二值判定加比特比对结果:若优化后反演潜变量解出的水印与预设锚的比特一致率超过阈值,则判为该模型生成。
学习这篇论文需要先接受一个前提:潜扩散文本生成音频模型先在压缩后的隐空间做扩散,再经解码器得到梅尔频谱,最后经声码器得到波形。这个链条意味着水印可以藏在 3 个不同位置:生成后的波形里、声码器参数里、编解码器附加模块里,或者最初的噪声里。前 3 类是已有路线,本文选择第四类。必须保留的关键信息是:模型参数与水印机制只对模型拥有者可见,用户只能经公开接口调用生成;代码当前可用,地址为官方仓库链接,本次资源状态显示可用。
本文要解决的缺口很具体:直接把水印藏进初始噪声并用确定性反演找回,在图像上可行,在音频上会因波形与梅尔谱之间的有损转换和条件失配而累积误差,导致鲁棒性不足。后续所有设计都是为了减少这部分反演误差,而不是为了提升生成音质。
已有三类水印路线各改了哪里,为何都不够稳?
按论文归纳,已有方法可分为后处理、微调与编解码 3 类。后处理在音频生成后再嵌入水印,做法简单但会损伤音质,且对重采样、变调等扰动敏感。微调类把水印整合进微调后的声码器,例如微调 HiFi-GAN,但换一种声码器结构就难以迁移。编解码类在生成过程中用训练好的编码器解码器嵌入水印,需要额外训练。 下图把 5 条路径并排展示,有助于 1 次性看清改动点的位置差异。
看图路径: 1. 先从上到下看五条横带,区分无水印、后处理、微调、编解码与本文方法的输入起点;2. 观察每条带中高斯噪声、隐向量 z_T、解码器与声码器的位置是否被改动;3. 对比后处理直接改波形与本文只改初始噪声映射的差异;4. 注意编解码分支中训练编码器与本文映射模块的标注区别
论文图 1。原论文 Figure 1:“Existing methods fall into three categories: post- processing, fine-tuning, and codec-based approaches.”。
从像素可见,图中最上方是无水印路径,从高斯噪声随机采样得到 z_T,再经扩散、解码器、可视化的梅尔谱与声码器得到波形。第二条是后处理路径,水印直接作用于已生成的波形。第三条是微调路径,声码器被标注为微调版本。第四条是编解码路径,水印经训练编码器得到附加潜变量再与随机潜变量融合。最下方是本文路径,水印只经映射得到带水印的 z_T,后续解码与声码模块与无水印路径一致。
解释这张图的关键是:只有本文路径没有改动生成模型本身,也没有在波形上做 2 次叠加,因此论文称其为免训练且不影响生成性能。教学例子是:把水印比作信封上的暗记,后处理相当于信写好后再盖章,容易被雨水冲掉;本文相当于用特殊墨水写信,纸张和笔都不换。例子不代表任何数值效果。
同条件对照的意义在于:3 类基线都需要改波形、改声码器或额外训练,而本文的比较优势必须放在相同扰动下看提取准确率,不能只看干净音频上的表现。
为什么直接反演在音频潜扩散模型中会失败?
沿一个样本走一遍有助于理解失败点。设拥有者选定一个 256 比特水印,经加密与分布保持采样得到带水印的初始隐向量,记为支点锚。用文本提示与大于 1 的引导尺度做 50 步去噪,得到 z_0,再经解码器重建梅尔谱,最后经声码器得到 8 秒音频。提取时,拿到可疑音频先转梅尔谱再编码为 z’_0,然后用空提示、引导尺度为 1 做反演得到 z’_T,再经逆映射解出比特。 下图把生成与提取的失配画成了上下两排。
看图路径: 1. 先沿上排嵌入到去噪再到声码器的箭头走完生成路径;2. 再沿下排从波形经梅尔谱与编码器回到反演的箭头走完提取路径;3. 对比上下两排中间标注的条件框与转换框的文字差异
论文图 4。原论文 Figure 4:“The explanation of the failure extraction through direct inversion.”。
从像素可见,上排标注了具体提示与引导值,下排标注为空提示与数值为 1,中间分别标注了条件失配与有损转换。解释是:上排去噪用文本条件与强引导,下排反演没有文本条件且引导为 1,噪声估计公式本来就不一致;同时上下排之间的波形与梅尔谱转换会丢失相位并压制高频,使 z’_0 明显偏离原始 z_0。这两处误差在逐步反演中累积,最终使解出的比特偏离预设锚。论文用均方误差曲线与方差变化说明误差随步数增长,且经过音频转换的路径累积更明显。
因此问题被重新表述为:不是反演公式写错了,而是反演起点已偏且每步条件不同,需要在反演过程中引入与反演同条件的参考轨迹来纠偏。
锚序列优化全景:一个样本如何从嵌入走到判定?
方法全景可分为嵌入、生成、锚序列构造、优化反演与阈值判定 5 步。第一步,拥有者把水印比特整形为与随机潜变量同维度,经 ChaCha20 加密得到伪随机水印,再按比特值从高斯密度的左右等概率区间采样,得到支点锚。第二步,从该锚出发做有条件去噪生成音频,流程与无水印模型完全相同。第三步,归属时对同一支点锚做无引导去噪,得到一条中间潜变量序列作为锚序列。
第四步,对可疑音频做反演得到另一条序列,用软动态时间规整损失逐时间步做梯度下降,使反演序列向锚序列靠拢。第 5 步,从优化后的 z’_T 解出水印,若与锚的比特一致率大于阈值则判为归属成功,否则判为无水印;若有多个候选锚,则取一致率最高者。 下图展示了嵌入在上、归属在中、逐点调优在下的 3 层结构。
看图路径: 1. 先看上半部分两条嵌入分支如何从不同水印得到不同的起始隐向量;2. 再看中部反演优化框如何从同一个 z_0 分出两条候选反演路径;3. 观察下部锚序列与可疑音频反演序列之间的逐点调优箭头方向
论文图 2。原论文 Figure 2:“Overview of the proposed method.”。
从像素可见,上部两条虚线框分别对应两个不同水印的去噪扩散,中部反演优化框从同一个 z_0 分出两条提取路径,下部用圆点序列表示锚与可疑序列,并用红色虚线箭头标注调优方向。解释是:上部说明每个水印对应一条独立的锚轨迹,中部说明 1 次可疑音频要分别用每个候选锚做优化与提取,下部说明优化不是只改终点,而是在每个时间步都计算序列级损失并更新当前反演潜变量,再用于下一步反演。这种设计保证了只有正确锚才能带来有效对齐,错误锚的对齐路径会明显不同。
四个组件各自算什么,为何要这样搭配?
第一个组件是水印到噪声的映射。白话说,就是把 0 或 1 变成仍像高斯噪声的数。英文为分布保持采样。做法是把标准高斯密度按累积概率分成左右两半,比特为 0 从一半采样,比特为 1 从另一半采样,采样公式用百分点函数实现。加密的作用是让比特序列先伪随机化,避免规律性。这样生成的音频天然携带水印,且输入分布未变。
支点锚 × 分布保持采样: 支点锚指携带水印的初始隐向量 zw_T,负责在生成全程携带身份信息;分布保持采样负责把二进制比特映射为仍服从标准高斯的噪声样本,搭配理由是只有保持高斯分布才能不改变扩散模型的输入假设,组合后水印音频的生成路径与无水印模型完全一致。
第二个组件是生成与反演的定义。白话说,生成是从噪声到音频的去噪,英文为去噪扩散;反演是从音频回到噪声的加噪,英文为反演。生成用有条件噪声估计,反演用无条件噪声估计。理想情况下反演应回到支点锚,实际因起点偏差与条件失配而偏离。
去噪扩散 × 反演: 去噪扩散指从 z_T 到 z_0 的有条件逐步去噪生成过程,负责产生音频;反演指从音频重建的 z’_0 反推回 z’_T 的加噪过程,负责恢复水印,二者本应互逆但因波形与梅尔谱的有损转换和条件失配而偏离,组合意义在于把提取问题转化为让反演轨迹向扩散锚轨迹对齐的优化问题。
第 3 个组件是锚序列的构造。白话说,就是用与反演相同的空提示和引导尺度,把支点锚重新展开一遍,得到参考轨迹。英文涉及分类器无关引导与无引导扩散。论文的依据是:在多数时间步上,有引导与无引导的潜变量分布经检验仍统计一致,因此无引导轨迹可作为可靠的优化目标。
分类器无关引导 × 无引导扩散: 分类器无关引导指生成时用文本提示和大于 1 的引导尺度加权条件与无条件噪声估计,负责提升文本一致性;无引导扩散指归属时用空提示和尺度为 1 的设置从支点锚重新展开轨迹,负责给出与反演条件一致的参考序列,搭配理由是反演阶段本来就没有文本条件,只有同条件的锚序列才能作为稳定的优化目标。
第 4 个组件是序列损失与梯度更新。白话说,不只比较同一下标的两个点,而是允许两条序列在时间上弹性对齐后再算代价,英文为软动态时间规整。计算上先构造两两距离矩阵,再用带平滑参数的软最小递归更新累计代价矩阵,最后经反向动态规划得到对齐概率并按链式法则求梯度,用梯度下降更新每个反演潜变量。相比逐点损失,这种损失更适合处理有损变换带来的时间错位。
软动态时间规整 × 均方误差: 均方误差只度量两序列同一下标点的逐点差,遇到时间错位就会放大误差;软动态时间规整负责对所有可能对齐路径做概率化加权求累计代价,允许弹性对齐,搭配理由是扩散与反演轨迹存在有损变换导致的时间错位,只有弹性对齐才能在水印匹配时收敛而在锚错误时给出明显不同的对齐路径。
组合后的新增作用是:单点纠偏只能修一步误差,序列级弹性对齐能同时约束整条轨迹的形状,使正确锚下的优化轨迹逐渐贴近锚序列,而错误锚下无法贴近,从而兼顾鲁棒性与归属准确性。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练生成模型,也没有训练水印编码器解码器。4 个文本生成音频模型、声码器、编码器解码器参数均冻结,直接调用。唯一的计算是归属阶段的反演优化:每个时间步计算锚序列与反演序列之间的软动态时间规整损失,再用 Adam 优化器更新反演潜变量,原文报告学习率为 0.01 且每个时间步做 3 次内迭代。
这意味着复现时不需要准备训练数据或梯度更新生成权重,需要的是可运行的扩散采样、反演、梅尔谱与波形转换,以及优化循环。监督来源不是人工标注,而是预设的支点锚序列本身;梯度路径是从序列损失经距离矩阵反传到当前反演潜变量,再影响下一步反演。重置时机是每个候选锚独立优化 1 次,互不共享更新后的潜变量。
未报告的缺项是:平滑参数的具体取值、Adam 除学习率外的动量参数、以及不同隐变量维度下的显存占用。不能从模型名称推定这些实现细节,也不能把免训练等同于提取是确定性的,因为优化本身受学习率与迭代步数影响。
在哪些模型、数据、扰动与指标下比较,条件是否一致?
实验在 4 个开源潜扩散文本生成音频模型上进行,包括 AudioLDM、AudioLDM2、Tango 与 Tango2,数据集为 AudioCaps、WavCaps 与 MusicCaps 的提示。基线覆盖后处理类、微调声码器类与编解码类,共 8 个左右的可运行方法。每个方法在 AudioLDM 加 AudioCaps 提示下生成 1000 条带水印音频,再施加相同扰动后比较。
扰动共 10 种,强度在原文中有明确定义,涵盖重采样、滤波、幅度缩放、压缩、重编码、中值滤波、高斯噪声、裁剪与变调。指标包括真阳性率、比特准确率,以及用弗雷歇音频距离与 Inception 分数经 t 检验评估的性能偏差,t 值越小表示加水印前后质量差异越不显著。采样设置为 50 步生成 8 秒音频并嵌入 256 比特,归属阈值按极低假阳性率推导。
下表把可逐字核对的配置与判定条件整理在一起,表中数字与单位均保留原文写法。表前的问题是:要复述该方法,哪些配置必须保持一致,判定阈值是如何设定的。公平条件是生成步数、音频时长与水印长度固定,归属时用空提示与引导尺度为 1。指标方向是真阳性率与比特准确率越高越好,t 值越低越好。
| 配置项 | 取值与单位 | 说明 | 适用阶段 | 比较对象 |
|---|---|---|---|---|
| 采样步数与音频时长水印长度 | 50 steps,8s audio,256-bit watermark | 生成配置 | 生成 | 全部基线一致生成 |
| 优化器与内迭代 | lr = 0.01,three iterations per timestep | 反演优化 | 归属 | 直接反演对照 |
| 判定阈值 | FPR at 10−15,N to 1010,τ = 0.8164 | 多锚判定 | 归属 | 非水印音频 |
| 样本量 | 1, 000 watermarked audio samples | 每方法数量 | 评估 | AudioLDM 加 AudioCaps |
表后解释是:该表的主要收益是给出可直接照抄的运行配置,代价是优化内迭代使提取变慢。未胜出项是:若把内迭代从少调多,准确率提升有限但时间明显上升,因此默认的 3 次是兼顾效率的选择。未评测边界是:原文未给出不同音频时长或更长比特下的配置是否仍适用。
主结果在干净与扰动下各胜在哪里,代价是什么?
核心比较问题是:在相同 10 种扰动下,本文方法与可运行基线相比,真阳性率与比特准确率是否更高,音质偏差是否更小。公平条件是同一模型、同一提示集、同一扰动实现,指标方向为前两者越高越好,t 值越低越好。
下表用原文连续句中的平均数与提升数整理主结果,不混入无法逐字核对的宽表数字。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 平均扰动 | average TPR 98% | TPR 16% | average TPR 98% | GROOT |
| 平均扰动 | Bit Acc 99% | Bit Acc 19% | Bit Acc 99% | GROOT |
| 优化相对直接反演 AudioLDM | TPR and bit accuracy by 10% and 7% on AudioLDM | 直接反演 | by 10% and 7% on AudioLDM | 直接反演 |
| 优化相对直接反演 Tango | by 6% and 5% on Tango | 直接反演 | by 6% and 5% on Tango | 直接反演 |
| 干净音频 | TPR reaches 100% on clean audio | 基线亦高 | TPR reaches 100% on clean audio | 全部基线 |
表后解释是:主要收益体现在扰动下仍保持高真阳性率与比特准确率,而次优基线在裁剪、高斯噪声与重编码下退化明显;音质方面本文 t 值最低,支持生成质量得到保持的判断。具体代价是逐时间步优化带来的提取延迟,以及需要为每个候选锚分别优化 1 次,候选越多成本越高。反例是:在高强度变调下性能仍会下降,只是下降幅度小于基线。
比特准确率 × 真阳性率: 比特准确率负责度量提取比特与预设锚比特逐位一致的比例,反映水印保真度;真阳性率负责在固定假阳性率下正确判定为模型生成的比例,反映归属判定能力,二者搭配是因为高比特准确不等于低误判,只有在阈值 tau 下同时报告才能说明可部署的归属性能。
需要区分的是:原文报告的是平均扰动下的高准确,支持鲁棒性更强的判断;但未测量误判率随候选数增长的实际曲线之外的延迟与成本,因此不能承诺在大规模候选下的实时性。
拿掉优化或换掉损失后,哪些条件会先失效?
消融按 3 个问题组织:优化是否必要,损失函数是否必须用弹性对齐,学习率与迭代步数如何取舍。与谁比是直接反演、均方误差、交叉熵与 KL 散度,以及不同学习率与内迭代步数。条件一致指同一模型与同一扰动集合。 下图先给出误差随步数累积与分布一致性的证据。
看图路径: 1. 先看最左均方误差曲线中四条图例随步数上升的快慢差异;2. 再看中间两组小提琴图在不同反演起点下分布宽窄的变化;3. 最后看最右 P 值曲线与 0.05 虚线的交叉位置
论文图 3。原论文 Figure 3:“(a) shows the MSE between latent vectors during inversion and denoising, while (b) and (c) report the corresponding variance changes.”。
从像素可见,最左曲线中代表经过音频转换的误差上升最快,代表优化后误差的曲线明显更低;中间小提琴图显示经过音频转换的起点分布更宽,而优化后分布收窄;最右 P 值曲线随步数下降,但在多数前期步数高于 0.05 虚线。解释是:误差确实随步数累积且音频转换加剧偏离,优化能有效压低误差;同时有引导与无引导分布在多数步数统计一致,这为用无引导锚序列纠偏提供了依据,但一致性随步数减弱,因此不能推广到任意步数都成立。
原文还报告:优化相对直接反演在 2 个模型上均有数个百分点的提升;软动态时间规整在水印音频上更高更稳,而交叉熵鲁棒性差,均方误差与 KL 散度在生成与自然音频上表现不佳;低与中学习率更稳,过高学习率会不稳定;内迭代增加几乎不提升准确率,自然音频上略降,而检测时间随迭代增加而上升,具体为 from approximately 4s to 17s per audio。
下表把扰动强度与迭代代价的原文结论整理为可执行对照。表前问题是:强度加大后哪种扰动先掉,迭代加倍是否值得。公平条件是同一提取流程,指标方向仍为越高越好,时间越低越好。
| 条件 | 指标 | 低强度表现 | 高强度表现 | 代价与边界 |
|---|---|---|---|---|
| pitch shift | bit accuracy and TPR | 高 | a bit accuracy of about 85% and a TPR of 93% | 高强度先掉 |
| the other distortions | bit accuracy and TPR | 高 | remain above approximately 94% even under high-intensity conditions | 保持稳定 |
| increasing inner steps from 2 to 8 | accuracy and time per audio | 稳 | yields little accuracy improvement and slightly worse performance on natural audio | from approximately 4s to 17s per audio |
| ten types distortions | 覆盖种类 | 全覆盖 | 全覆盖 | 以引文原文定义为准 |
表后解释是:主要收益是除变调外多数扰动在高强度下仍稳定,代价是变调高强度下比特准确与真阳性率同时下滑到引文所述水平;未胜出项是增加内迭代并不能换来明确收益,反而增加时间并在自然音频上略降。未评测边界是:超过原文最高强度的扰动未报告,不能外推。
自适应攻击与采样泛化测了什么,还有哪些不能承诺?
自适应攻击测了 3 类擦除:梅尔谱重建、变分自编码压缩与再生攻击,其中后两类在实验中用了与生成相同的模型参数,原文明确指出实际部署中模型参数一般不可得,因此该设置是偏强的模拟。报告的结论是本文方法在 3 类攻击下仍能可靠恢复水印,而多数基线比特准确率明显更低。从安全角度,原文强调若模型泄露,对手可用任意提示生成有害音频,因此防止模型泄露仍关键。
采样泛化测了引导尺度从 4 到 18、采样步数从 10 到 100,以及多种常微分求解器,报告水印在全部配置下均被成功提取,支持泛化能力。但总体趋势不等于每组每步都最优,且原文未报告这些泛化配置下的扰动鲁棒数,因此不能把干净提取成功直接等同于扰动下同样成功。
不能承诺的还包括:未测量大规模候选锚下的检索延迟与存储管理成本,原文结论也承认锚管理在实际部署中可能带来现实顾虑;未测量不同声码器或非潜扩散模型上的适用性;未给出平滑参数与优化超参数的完整敏感性。因此何时值得尝试的回答是:当拥有者能保管模型与锚、且能接受每条数秒级提取成本时,该方法适合对鲁棒性要求高的归属场景。
要复现应先做什么,哪些细节必须照抄?
复现先做三件事。第一,按官方仓库搭建生成与反演链路,确认能用相同模型生成 8 秒音频并完成空提示反演,因为资源状态显示代码当前可用。第二,固定采样 50 步、水印 256 比特、优化器学习率 0.01 且每时间步 3 次迭代,先在干净音频上验证比特准确与真阳性率。第三,再逐个加入 10 种扰动的原文强度,特别注意重采样、滤波截止频率、压缩码率、噪声分贝、裁剪比例与半音变调的数值写法,不要自行四舍五入。
信息条件必须保留:加密密钥与模型参数仅拥有者持有,用户只经接口调用;归属阈值按极低假阳性率与候选数推导,原文为 0.8164 左右,换候选数必须重算。常见误解是把免训练理解为无需任何计算,实际上归属阶段的序列优化是主要计算,且每个候选锚都要独立跑一遍。另一个误解是把平均扰动下的高准确当成每种扰动都满分,实际上变调高强度与重编码是相对弱点,应单独报告。
还需补的验证是:记录单条提取时间随内迭代与候选数的变化,测量自然音频与无水印生成音频的误判率,并在目标部署的采样器与引导尺度下重测扰动鲁棒性,再决定是否上线。
一句话收束:该方法改变了什么,没有改变什么?
该方法改变的是提取方式:不再指望 1 次直接反演就能命中,而是用与反演同条件的锚序列做弹性对齐,把累积误差当作序列优化问题来纠正。没有改变的是生成方式:初始噪声仍服从高斯,扩散、解码与声码流程不变,因此音质偏差最小。证据支持在多个模型与数据集上干净判定稳定、平均扰动下显著高于可运行基线,且对采样配置有一定泛化。代价是提取需要多轮梯度优化,时间与候选数成正比,且锚的保管与高强度变调仍是边界。若目标是可核对的归属,应从复现默认配置与 10 种扰动开始,再补延迟与误判测量后做部署判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



