英文题目:AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS
会议身份:
conference:interspeech:2026:conference-paper-id:tse26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#流匹配 #鲁棒性 #语音 #音频水印
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Timothy Tin-Long Tse:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Aidan Pine:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理流匹配(flow matching,FM)与扩散(diffusion)语音合成中的来源标识问题,输入为待验证音频与预留初始噪声,输出为是否由指定噪声生成的二值判定,难点在于音频变长、裁剪与变速会破坏对齐且频域攻击易抹除弱相关。方法链分为三环:首先固定特殊噪声并在梅尔谱长度上周期重复以覆盖变长音频,其次用冻结生成模型从该噪声合成语音并保留噪声与梅尔谱的配对关系,最后以余弦相似度计算经验p值或以外挂卷积检测器判别来源,前者输出直接进入阈值判定,后者输出进入二分类训练与增强推理。与后处理水印相比,该机制不修改波形而复用生成动力学自带的噪声到输出映射,因而无生成开销且不损伤音质。在F5-TTS相似度阈值评测设置下,余弦相似度分支的准确率为0.988,高于点积分支的准确率0.986。该结论不适用于回声等混响类退化,也未验证多说话人、大规模多样文本与神经编解码器压缩下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么要给合成语音加水印?
本文输入是文本与说话人条件,输出是可听的合成语音,目标是在不降低听感、不重训合成模型的前提下,判断一段音频是否来自受保护的流匹配或扩散语音合成模型。初学者可以这样理解学习依赖:先要知道这类模型是从高斯噪声出发逐步去噪或沿向量场积分得到梅尔频谱图,再经声码器变成波形;再要知道水印有两条路线,一条是生成后再改波形,另一条是在生成时做标记。
论文的默认动作很具体:生成时不再每次随机采样初始噪声,而是使用一段预先固定好的特殊噪声,用它走完原有的合成流程得到音频;检测时拿存档的特殊噪声与待测音频的梅尔频谱图算相似度,再与随机噪声的相似度分布比较。如果待测音频确实由该特殊噪声生成,它的相似度会明显偏高。必须保留的信息是模型本身不改、音频内容不刻意加扰、判别依据是噪声与结果的空间对应关系。
资源状态是正文开源声明的唯一依据,本次没有发现来源绑定且完成安全验证的资源,因此不能声称代码、模型或数据已公开,后文所有复现动作只按论文文字描述组织,不依赖外部仓库可达性。
已有的音频水印路线为什么不够用?
教学任务是把本文放进两类已有路线里。第一类是后处理水印,代表是 AudioSeal,做法是在已生成的音频上嵌入人耳难察觉但可检测的信息,优点是即插即用,缺点是必须改音频、带来额外计算与延迟,而且论文引述了覆盖攻击的风险,即攻击者识别出开源水印模型后可以用同一模型覆盖掉原水印。更关键的是音质改动越大往往越难擦除,形成音质与鲁棒性的折中。
第二类是内生水印,做法是在生成过程中引入可检测性,通常需要重训整个语音合成模型,优点是生成即带标记、不易被简单覆盖,缺点是训练成本高,还可能损伤原有合成质量。图像领域的 NoisePrints 属于特殊的内生路线,它不重训扩散模型,只是固定初始噪声并比较生成隐变量与该噪声的余弦相似度。本文要解决的正是把这一思路搬到音频时,音频长度可变、频域攻击多、梅尔图没有固定隐变量尺寸带来的新困难。
要验证的核心问题是什么?
论文把问题收敛为 3 个可核对的判断。第一,流匹配语音合成与声码器的生成结果是否同样保留了初始噪声的空间排布,使得原始噪声的相似度显著高于随机噪声。第二,能否只靠固定初始噪声加相似度比较完成水印判别,做到生成零额外开销且不改音质。第三,当简单相似度扛不住裁剪、变速与滤波等强增强时,能否用一个不碰合成模型的外挂检测器补强,同时保留不重训合成模型的优点。
举例来说,这里的例子仅为教学:假设固定了一段 100 帧的特殊噪声并周期性平铺,生成一段 5 秒语音,检测时把该语音转成梅尔频谱图再与特殊噪声对齐比较;若音频被变速拉长,对齐就会错位,这正是后文需要滑动窗口或检测器的原因。该例子不附加任何数值承诺。
方法全景:一个样本如何走完生成与判别?
沿一个样本走完全程最清楚。生成端输入文本与参考音频或说话人编号,采样端不再随机采噪声,而是取出存档的特殊初始噪声,按需要的梅尔长度周期性重复拼接,然后送入流匹配语音合成模型得到梅尔频谱图,再经声码器得到波形。整个合成网络参数冻结,求解器统一用欧拉常微分方程求解器,生成流程与原来一致。
判别端有两条分支。免训练分支把待测音频重算梅尔频谱图,计算它与特殊噪声的距离,再计算它与 500 个随机噪声的距离,按排名得到经验 p 值,小于阈值则判为带水印。检测器分支把梅尔频谱图送入一个外部卷积网络,直接输出是否来自特殊噪声的二分类结果。两条分支都不要求改动或重训语音合成模型。
下图是本文总览,左侧讲目标,中间讲生成中加水印的两条判别路径,右侧讲生成后改音频的传统做法,读图时重点看改动点发生在生成前还是生成后。
看图路径: 1. 先从左到右看三栏:目标说明、中间生成中加水印、右侧生成后加水印;2. 看中间栏 engineered initial noise 如何进入流匹配语音合成与声码器;3. 对比中间免训练余弦分支与可训练检测器分支的输入输出;4. 对比右侧水印模型改动波形的做法与中间不改音频的做法
论文图 1。原论文 Figure 1:“General overview of our approach (AudioNoisePrints) comparing to the commonly used post-hoc watermarking schemes.”。
该图显示中间路径只改初始噪声,不改网络与音频内容,右侧路径必须在原始音频与加水印音频之间经过一个水印模型。中间又分出余弦相似度分支与可训练检测器分支,前者标注无需训练,后者需要为特定检测器训练以提高鲁棒性。这直接对应后文实验中余弦方法与检测器方法并列比较 AudioSeal 的安排。
空间相关与距离计算:噪声痕迹藏在哪里?
白话解释空间相关:初始噪声是一个 2 维随机阵列,生成过程像是一步步把它推向语音的形状,但推的过程中没有完全打乱每个位置的相对高低,因此生成梅尔图的明暗纹理与初始噪声的起伏在位置上仍有对应。英文是 spatial correlation。论文引用图像领域发现,即生成结果与原始噪声的余弦相似度明显高于与其他随机噪声的相似度,每个像素或时频点都呈现更高的皮尔逊相关。
流匹配 × 扩散模型: 流匹配与扩散模型分工都是把初始高斯噪声逐步搬运到目标数据分布,前者学向量场速度,后者学噪声残差,搭配理由是两者迭代式都保留了噪声的空间排布,组合意义是同一套噪声相关验算可以同时用于两类语音合成模型。
具体计算时,论文把距离定义为原始噪声与生成音频或梅尔图之间的函数,候选包括余弦相似度、点积、L1 与 L2 距离。与图像原方法直接在隐变量空间比较不同,这里在音频或梅尔频谱图域比较。与原方法用固定阈值不同,这里用经验 p 值,即把原始距离与 500 个随机噪声的距离放在一起排名。阈值是对 p 值的最小要求,论文后续实验固定用 500 个随机噪声。
后处理水印 × 内生水印: 后处理水印分工是在音频生成后再叠加可检测扰动,内生水印分工是在生成过程中固定初始噪声来留下痕迹,搭配理由是前者通用但改音质且怕覆盖攻击,后者不改音频内容,组合意义是论文用内生替代后处理来绕开音质与鲁棒性的折中。
余弦相似度 × 经验 p 值: 余弦相似度分工是度量特殊噪声与重建梅尔频谱图的方向一致程度,经验 p 值分工是把该分数放进 500 个随机噪声分数的分布里看排名,搭配理由是单分数受音频长度与能量影响大,组合意义是用相对排名做阈值判断是否来自该特殊噪声。
需要提醒的是,论文只报告了欧拉求解器下的现象与公式形式,没有给出其他求解器下的对照,因此不能把该相关性推广到所有采样器。
两条判别分支如何搭配?
免训练分支的动作最少:存下特殊噪声,生成时复用它,检测时算余弦相似度与 p 值。它的优点是零训练、推理只多 1 次相似度计算,缺点是音频没有固定尺寸,裁剪会丢掉对齐位置,变速会拉伸时间轴,频域滤波会改变能量分布,都可能让简单相似度失效。
检测器分支就是为这些错位与失真准备的。论文固定特殊噪声按 100 帧梅尔长度周期性采样,长音频就重复拼接直至超过音频长度,这样裁剪后仍有完整周期可匹配。检测器本身是一个 4 层 2 维卷积残差网络,做二分类,输入是梅尔频谱图,标签是是否由指定噪声经特定扩散或流匹配模型生成。训练数据一半来自指定噪声生成,一半来自随机噪声生成,并加入压缩编码等数据增强。
免训练判别 × 外挂检测器: 免训练判别分工是直接算噪声与梅尔图的余弦相似度与 p 值,外挂检测器分工是用卷积网络学习含特殊噪声的梅尔图模式,搭配理由是前者零训练但怕裁剪变速错位,后者能学不变特征,组合意义是生成端都不动,只在判别端按鲁棒需求二选一。
关键边界是检测器分支虽然要训练,但训练对象是外部判别器,不是语音合成模型,因此论文仍称其保留了免重训合成模型、不损伤生成质量的优点。检测器只提高判别速度与鲁棒性,不参与音频生成。
哪些参数训练,哪些参数冻结?
本节承担的教学任务是讲清训练与构造的真实计算过程。论文明确冻结的是语音合成模型与声码器,包括实验用的 F5-TTS 与 Matcha-TTS 主体,以及 Vocos 等声码器,不做任何水印相关的重训。免训练分支没有任何可学习参数,只有存档噪声、相似度函数与 p 值阈值。
实际训练的只有外挂检测器,即 4 层 2 维卷积残差网络,优化目标是二分类交叉熵损失,输入是梅尔频谱图,监督来源是生成时使用的噪声身份,即指定特殊噪声为正类、随机噪声为负类。训练时合成了两类数据,并施加包括 MP3 与 AAC 压缩在内的增强。论文未报告该检测器的学习率、批量大小、训练轮数与早停规则,也未报告梯度是否回传到合成模型,按文字理解梯度只在检测器内部,因为合成模型仅用于离线合成训练数据。因此复现时只能先按描述构造数据,再自行补齐优化超参数并记录下来。
论文没有训练语音合成模型,不能把无重训等同于输出确定,相同特殊噪声在不同文本、参考音频或随机求解细节下仍会生成不同内容,水印依据的是噪声与结果的相对相似度排名,不是逐比特可复现的波形。
实验条件:模型、数据、基线与增强是什么?
模型条件按原文交代。语音合成用 F5-TTS 与 Matcha-TTS,前者是基于 Transformer 的流匹配模型,做文本引导的语音补全,可利用参考音频做非自回归生成,实验用 F5-TTS v1 基础检查点配 Vocos 声码器;后者用残差 U-Net 结构,传统训练目标,用说话人编号做多说话人目标,实验用 VCTK 检查点。声码器对照还用了 DiffWave 扩散声码器,用双向空洞卷积结构,实验用 LJSpeech 检查点。论文称三者架构与目标不同,正好用来检验空间相关的普适性。
数据条件是常用语音合成数据集 LibriTTS 与 LJSpeech,其中 LJSpeech 用于 DiffWave 声码器实验,另用一个短文本情感分类数据集的文本来合成训练检测器的数据。基线是 AudioSeal,用 VoxPopuli 数据集约 4500 小时训练的 16k 预训练检查点,是经典且强力的后处理水印模型。论文强调基线预训练数据远大于本文所用数据,且基线针对部分增强专门训练过,比较时应注意这一不对等。
评价按增强组织,包括白噪声、粉噪声、高通滤波、低通滤波、MP3 压缩、音频裁剪、变速,以及 AAC 压缩与回声。指标方向是准确率越高越好,阈值实验还比较了不同 p 值阈值与距离函数下的准确率。论文未报告误判率分解、听感评分与延迟测量,因此不能从准确率推断音质或速度结论。
主结果:在强增强下谁更稳?
本节回答在同等增强下免训练余弦方法、检测器方法与 AudioSeal 的准确率对比。论文报告的总体形态是 AudioSeal 在无增强或弱增强下可达 1.0 的顶线准确率,而本文方法顶线约 97 到 98%,并未超过基线;但在强增强下本文方法明显更稳,尤其在裁剪与变速上 AudioSeal 跌落严重,论文称变速仅 1% 的拉伸就让基线失效,而本文两条分支保持高位。MP3 压缩是个例外,三者都不太受影响。回声则是反例,本文方法明显不如基线,论文解释为基线预训练见过回声增强而本文方法没有。
下图是多组增强下的准确率曲线,读图时先看横轴增强强度,再看 3 条曲线的走向,不要把单点顶线当成全程结论。
看图路径: 1. 先看每子图横轴增强强度与纵轴准确率,再看三条曲线的图例;2. 重点看变速与裁剪子图中 AudioSeal 曲线是否快速跌落;3. 对比高通与低通滤波两端本方法与基线的相对位置
论文图 2。原论文 Figure 2:“Accuracy comparing the AudioSeal and our approaches.”。
从像素可见,第一排白噪声与粉噪声随信噪比提高三者都上升,但 AudioSeal 在低信噪比起点更低;高通与低通滤波两端 AudioSeal 在截止频率推高或压低后快速跌到低位,而余弦与检测器保持相对平缓。第二排 MP3 压缩随码率变化三者都接近顶部,裁剪随保留时长增加本文方法快速回到高位而基线爬升慢,变速子图在缩放因子偏离 1.0 时基线跌落而本文两条线保持水平。第三排 Matcha-TTS 的噪声与滤波子图呈现类似趋势,说明结论不限于单个合成模型。
下表整理距离函数与阈值选择实验,比较问题是在 F5-TTS 上哪种距离更适合做 p 值判别,公平条件是同模型同阈值网格,指标方向是准确率越高越好。
| 距离函数 | 阈值 0.80 | 阈值 0.85 | 阈值 0.90 | 阈值 0.95 | 阈值 1.00 |
|---|---|---|---|---|---|
| 余弦相似度 | 0.905 | 0.930 | 0.949 | 0.975 | 0.988 |
| L1 距离 | 0.392 | 0.422 | 0.450 | 0.476 | 0.497 |
| L2 距离 | 0.405 | 0.424 | 0.448 | 0.474 | 0.497 |
| 点积 | 0.885 | 0.922 | 0.955 | 0.972 | 0.986 |
该表显示只有余弦相似度与点积达到可用水平,余弦略优且阈值为 1.00 时最高,后续实验因此固定用余弦相似度。代价是 L1 与 L2 在所有阈值下都只有约 0.39 到 0.49 的准确率,基本不可用,这是一个明确的未胜出项,说明不能随意替换距离函数。表后需要强调该结论只在 F5-TTS 与该阈值网格下报告,未验证其他模型是否同样以余弦最优。
另一组对照是压缩与回声,比较问题是常规压缩与回声增强下三者是否都稳,条件是同 F5-TTS 生成音频,指标仍是准确率越高越好。
| 增强类型 | 指标 | 余弦方法 | 检测器方法 | AudioSeal |
|---|---|---|---|---|
| AAC 压缩 | 准确率 | 0.987 | 0.9947 | 1.0 |
| 回声 | 准确率 | 0.504 | 0.499 | 1.0 |
该表的主要收益是 AAC 压缩下三者都接近 1.0,本文方法无需针对压缩专门设计仍能保持,具体代价是回声下本文两种方法都只有约 0.50,接近随机猜测,而基线为 1.0。这支持论文的有限解释,即是否在训练中见过该增强决定了该项结果,不能据此说本文方法整体更强。
相关性是否普适,距离选择是否敏感?
本节承担消融与普适性验证。第一个问题是距离函数敏感性,上表已显示余弦与点积可用而 L1 与 L2 不可用,论文没有进一步分析为何绝对距离失效,初学者可以理解为能量与偏置影响了绝对距离,而余弦只看方向更能保留空间排布,但这只是可能解释,论文未验证。
第二个问题是空间相关是否只属于 F5-TTS。论文用 DiffWave 声码器、Matcha-TTS 与 F5-TTS 各取一个音频样本,画出 500 个随机噪声相似度分布与原始噪声相似度的红线位置,并对 Matcha-TTS 与 DiffWave 各生成 500 条音频,发现每条的原始距离都显著高于随机距离,经验 p 值为 0.0。这支持空间相关是 3 类模型共有现象,为把水印搬到更多流匹配语音合成与声码器提供了依据。
下图是 3 个模型的单样本分布,横轴是余弦相似度,纵轴是频数,蓝色是随机噪声,红色虚线是原始噪声。
看图路径: 1. 先确认横轴是余弦相似度、纵轴是频数,再找红色虚线位置;2. 对比蓝色随机噪声直方体集中区间与红色原始噪声线的距离;3. 从左到右对比声码器与两种语音合成模型的分离程度
论文图 3。原论文 Figure 3:“(Top) Distributions of random noise similarity versus originated noise similarity (red line) for the DiffWave vocoder [Left] and MatchTTS [Middle] and F5TTS models [Right].”。
从像素可见,左图 DiffWave 的蓝色直方集中在 0 附近而红线远在约 0.027 右侧,中图 Matcha-TTS 的蓝色集中在 0 附近而红线接近 1.0,右图 F5-TTS 的蓝色集中在 0 附近而红线在约 0.06 右侧。三图共同点是蓝色分布与红线之间存在巨大空隙,差异只是绝对数值不同,这与论文所称每条音频 p 值为 0.0 一致。但需注意这是单样本可视化加 500 样本计数的报告,不能据此推断任意文本长度下分离度不变。
哪些情况会失效,哪些结论不能推广?
论文直接报告的失败条件包括回声增强、高通与低通滤波的极端截止频率,以及 L1 与 L2 距离完全不可用。回声下两种方法约 0.50 的准确率说明当前检测器训练增强未覆盖回声,余弦方法本身对混响叠加也敏感。滤波曲线显示截止频率推到两端时本文方法也会下滑,只是下滑慢于基线。
未评测边界需要明确。论文未测量误判率随阈值的完整曲线、未做听感主观评价、未报告生成延迟与检测延迟、未测试其他采样器与更大规模多说话人场景,也未验证攻击者已知特殊噪声后的伪造风险。因此不能承诺零音质损失等于主观无差异,也不能承诺零生成开销等于端到端延迟不变,论文所说的零开销仅指生成网络不改、不加后处理模型。
相关性不等于因果,论文显示噪声与结果相关,但未证明是某一步向量场保留了空间信息,也未排除梅尔图重建方式放大的可能,这些都属于待验证的机制解释。
要复现这篇论文,先做什么?
复现的第一步是按原文固定流程跑通生成。准备 F5-TTS v1 基础检查点配 Vocos 声码器,以及 Matcha-TTS 的 VCTK 检查点与 DiffWave 的 LJSpeech 检查点,求解器统一用欧拉方法。构造一段固定长度的特殊初始噪声,对长音频按 100 帧周期重复拼接,文本可用 LibriTTS 与 LJSpeech 的划分,合成两类音频,一类用特殊噪声,一类用随机噪声。
第二步实现免训练判别。把音频转成与论文一致的梅尔频谱图参数,计算待测梅尔图与特殊噪声的余弦相似度,再计算与 500 个随机噪声的余弦相似度并排名得到经验 p 值,阈值网格可从 0.80 到 1.00 扫描。注意对齐方式必须记录,变速与裁剪实验需要滑动窗口或动态时间规整的说明,论文只提示了必要性而未给出完整实现细节,这是复现时最可能产生差异的地方。
第三步训练外挂检测器。按描述搭建 4 层 2 维卷积残差网络,用二分类交叉熵训练,训练数据加入 MP3 与 AAC 压缩增强。由于论文未报告优化超参数与梅尔参数,建议先固定一组可运行配置并做消融记录。代码与权重方面,本次未确认到可用资源,只能按文字重写,不应假设官方仓库可下载。
何时值得尝试这种水印?
当保护目标是自家的扩散或流匹配语音合成模型,且不希望重训模型、不希望在音频里加扰、不希望增加生成延迟时,这种固定初始噪声的路线值得尝试。它的最强证据是在裁剪与变速等强增强下保持高准确率,而 AudioSeal 在这些条件下快速失效;主要代价是顶线准确率略低于基线,且对回声等未见过的增强很脆弱。
实践建议是把免训练余弦方法作为默认基线,把检测器作为强增强场景的升级选项,同时在训练增强里补上回声、混响与极端滤波,并保留 AAC 与 MP3 压缩对照。还需补的验证包括误判率与阈值的关系、主观听感、检测延迟,以及攻击者已知噪声或检测器后的安全性。只有补齐这些,才能把论文报告的准确率优势转化为可部署的水印收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


