英文题目:Phoneme-Aware Mamba Watermark: An Active Defense System Against Purified Speech Deepfakes

会议身份:conference:interspeech:2026:conference-paper-id:shao26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对抗训练 #状态空间模型 #对抗鲁棒性 #语音 #音频水印

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yanda Shao:机构信息未能从会议 PDF 纯文本可靠映射
  • Mengke Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhixin Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Tianyi Yang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理语音主动防御中的可溯源水印任务,输入为 16 kHz 原始波形与 16 位说话人身份码,输出为不可感知的水印语音,要求水印在语音克隆与扩散纯化后仍可被解码溯源,难点在于表层对抗扰动易被 PhonePuRe 类两阶段波形扩散去噪加谱细化擦除。方法链分为三步:冻结 XLS-R 300M 提取语境表征 \(H\) 并经 Mamba 系编码器生成频谱扰动,再由 Montreal Forced Aligner(蒙特利尔强制对齐器,MFA)边界与预计算音素平均谱字典构造的稳定性掩膜 \(M(f,t)\) 约束扰动集中于 100-1000 Hz 共振峰稳态区,最后经可微纯化对抗微调与 8 层 CNN 解码器实现 1 秒分块多数投票溯源。与 AntiFake 与 VoiceGuard 类只破坏合成的不可溯源扰动不同,该机制把载体从易擦除噪声转为克隆为保可懂度必须保留的音素声学结构。在 LibriSpeech train-clean-100 训练、PhonePuRe 纯化评测下,多头 Mamba 对抗微调后原始准确率 91.56%、纯化准确率 84.55%、保持率 92.34%;在 11 名 VCTK 说话人共 165 条 YourTTS 与 sv2TTS 克隆语音上溯源真阳性率约 99.9%-100.0%,未检出伪造长度约 1.0 秒,SNR 超 34 dB、PESQ 高于 3.5。结论仅在英语干净朗读、单一纯化器与旧克隆管线下验证,对扩散声码器新变体、噪声混响与跨语言迁移尚未验证。原文未披露训练与推理硬件成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,防御目标是什么?

这篇论文处理的是语音深度伪造的主动防御。输入是一段原始波形,记为长度为 T 的时域信号,采样率在实验中统一为 16 kHz。目标是学习一个嵌入函数,把与说话人绑定的二进制身份码嵌入到语音中得到加水印语音,同时训练一个解码器能从加水印语音、净化后语音乃至克隆伪造语音中把比特串恢复出来。

初学者可以这样理解:被动检测是事后判断一段语音是真是假,主动水印是事前在受保护语音里埋入可检索的身份标记,即使攻击者拿这段语音去微调合成模型,生成的假语音里仍然带有标记,从而可以回溯泄露源。论文把系统要满足的性质写成 4 条:听感上接近原始语音,可检测到水印,能经受语音克隆迁移,能经受净化操作。

原文用感知距离小于阈值表达不可感知性,用解码器输出等于嵌入码表达可检测性,并分别对克隆模型和净化算子后的输出要求解码仍成立。需要保留的关键信息是水印不是独立于内容的表层噪声,而是被约束在音素稳态区的频谱扰动,解码只看对数幅度谱的特定频带,并按 1 秒块重复嵌入加投票。输出是 1 篇可复述的方法解读,不评价商业价值,只讲论文实际做的任务、计算步骤和实验条件。

被动检测、主动干扰与净化三条路线如何分工?

第一条路线是音频伪造检测。早期用梅尔倒谱系数和韵律特征加浅层分类器,后来用 RawNet2 和 AASIST 直接从波形学习判别表示,近年引入 wav2vec2.0、XLS-R 等自监督预训练模型提取音素与音色特征。原文还提到 XLSR-Mamba 和 XLSR-MamBo 这类 Mamba 变体,动机是利用线性复杂度做长序列建模。这条路线的输入与本文相同都是语音波形,目标是二分类真假,监督来自真假标签,运行阶段在伪造发生后生效。它的局限按原文表述是对未见合成模型泛化有限,尤其面对扩散模型带来的新伪影。

第二条路线是主动语音保护。AntiFake、VoiceGuard 等方法加入不易察觉的对抗扰动来破坏克隆模型,AudioMarkNet 等音色水印方法采用数据投毒思路让水印在模型自适应时被学进去。区别在于前者一般不嵌入可检索信息,只能阻止合成而不能溯源,后者能检索但在音素条件去噪或频谱操作下脆弱。第三条路线是对抗净化。以 De-AntiFake 提出的 PhonePuRe 为代表,先做波形级扩散去噪,再做音素条件频谱精修,既擦除防御信号又恢复听感。

本文的定位是第二条路线中的可检索水印,但把载体从表层扰动换成音素稳定区,并用对抗训练显式见过净化操作。同输入同目标的对照应放在可检索水印之间,而不是把检测准确率与水印保持率直接比较,因为指标定义和攻击阶段不同。

要解决的矛盾是什么,成功标准如何定义?

中心矛盾是隐蔽性与生存性的冲突。水印要足够弱才听不出来,但太弱就会被扩散净化当作噪声去掉,也不会被克隆模型当作音色学走。论文把希望寄托在影子式防御上:让水印成为内禀音色特征的一部分,随说话人自适应一起迁移到伪造语音中,即使经过净化和克隆仍然存在。形式化上,设原始波形为 x,身份码为 K 比特二值串,嵌入函数输出加水印语音,解码器输出估计比特。4 个要求分别是感知透明、可检测、克隆鲁棒、净化鲁棒。

实验把成功标准操作化为 5 类指标。不可感知性用信噪比和语音质量感知评估,信噪比越高失真越小,感知评估分数范围 1 到 5 分越高越好。准确性用比特级准确率衡量逐比特恢复正确比例。防御用真正例率或溯源准确率衡量成功识别源说话人的比例,未检出伪造长度反映加水印条件下伪造被错误接受的程度越低越好。鲁棒性用保持率衡量净化后相对净化前的保留程度越高越好。

举例说明:若某段语音嵌入 36 比特,解码对 30 比特正确,则比特准确率约为 83%,这只是教学例子,不是论文数值。真正的判断必须回到原文报告的表格条件、数据集和聚合对象。

系统让一个样本走完输入到溯源需要哪几步?

先沿一个 1 秒 16 kHz 语音块走完全流程。原始波形同时进入 3 个分支:冻结的 XLS-R300M 提取上下文语音表示,短时傅里叶变换得到原始复数频谱,蒙特利尔强制对齐器给出音素边界。说话人身份先是 16 比特,经汉明编码扩成 36 比特,再经线性层映射为水印嵌入向量,与语音表示和频谱信息一起送入水印编码器。编码器输出频谱扰动,经音素稳定性掩码调制后,只在 100 到 1000 Hz 频带内加到原始频谱上,再经逆短时傅里叶变换得到加水印语音。

解码端不共享编码器参数,直接对接收音频做短时傅里叶变换,取对数幅度谱的相同频带,用 8 层卷积网络加自适应池化和线性分类器输出 36 比特估计。训练时编码器与解码器端到端联合优化,净化环路中加水印语音会以一定概率经过 PhonePuRe 的 2 阶段净化再送入解码器,形成对抗损失。推理时对可疑克隆语音按 1 秒不重叠块独立解码,用汉明相似度与水印池比对,阈值为 0.7,再跨块多数投票决定源说话人。

下面这张总览图把上述 3 段组织在一起,读图时先看主数据流再看红色梯度流。

看图路径: 1. 沿左侧说话人身份与语音输入的三条分支看到 XLS-R、短时傅里叶变换与强制对齐器如何汇入水印编码器;2. 观察音素调制节点如何把稳定性掩码乘到谱扰动上再注入 100-1000 Hz 频带;3. 对比右上红色净化环路与左下灰色解码环路的梯度虚线走向;4. 查看底部推理链中解码、汉明解码与 1 秒块多数投票的串行顺序

原论文 Figure 1:Overview of the proposed Phoneme-Aware Mamba Watermark framework.

论文图 1。原论文 Figure 1:“Overview of the proposed Phoneme-Aware Mamba Watermark framework.”。

该图分为三部分。上方左侧是联合编码解码训练,中间橙色框内 3 种编码器三选一,右侧红色框是净化对抗环路,下方是推理溯源链。蓝色模块表示冻结,红色虚线表示梯度回传。关键细节是扰动只注入 100 到 1000 Hz,解码只看该频带的对数幅度,净化分支以停止梯度方式送入 PhonePuRe 但编码器仍通过净化后解码误差收到优化信号。推理链明确写出未检出伪造长度不大于 2 秒且相似度阈值为 0.7,这与正文多数投票公式对应。

编码器、音素掩码与解码器各自算什么?

编码器有 3 种可互换实现,用于对比长程建模能力。基线双向长短时记忆网络按时间步顺序更新隐状态,直观但捕获全局依赖有限。双列双向 Mamba 用状态空间模型的 selective 更新公式,前向与后向状态拼接融合,复杂度随序列长度线性增长,适合秒级语音。多头 Mamba 采用类似 Hydra 的三并行选择性状态空间头加门控融合,堆叠 4 层,并在状态转移中引入音素嵌入门控,门控由音素表示经线性加 Sigmoid 得到,再逐元素调制状态更新,使编码器自适应强调稳定声学区。

音素引导表示 × 净化攻击: 音素引导表示负责把水印能量约束在蒙特利尔强制对齐器给出的稳态音素内部共振峰区域,净化攻击指 PhonePuRe 先做波形扩散去噪再做音素条件频谱精修来抹除表层扰动,二者搭配的理由是净化器为保可懂度必须保留稳态音素,组合后水印载体与语音语义共存亡从而更难被单独擦除。

音素引导的具体做法是先用强制对齐器得到 ARPAbet 音素边界,精度约 10 毫秒,再预计算音素平均频谱字典,导出每时频点的稳定性掩码。掩码同样限制在 100 到 1000 Hz 共 29 个频点,稳定 bins 与不稳定 bins 取不同权重,扰动乘以掩码和强度系数后注入。思想是增强低方差音素内部、抑制过渡帧,把能量集中在净化器不敢大改的共振峰稳态子空间。

双列双向状态空间模型 × 长程音色依赖: 双列双向状态空间模型分前向与后向两列以线性复杂度更新隐状态并拼接融合,长程音色依赖指分布在秒级语音上的说话人相关频谱模式,前者分工是高效建模全局上下文,后者是需要被携带的目标,搭配后水印扰动不再是局部噪声而是与全局音色绑定的谱形偏移。

解码器是共享的 8 层卷积网络,通道数从 64 到 128 到 256,含批归一化、泄漏修正线性单元和最大池化,最后自适应池化加线性层输出 36 维。输入是对数幅度谱的 100 到 1000 Hz 区域。训练与推理共用同一前端,保证表示空间一致。

频谱扰动注入 × 逆短时傅里叶变换重构: 频谱扰动注入负责在原始复数频谱 100-1000 Hz 频带上做加性修改并乘以稳定性掩码,逆短时傅里叶变换重构负责把修改后频谱变回时域波形,前者决定藏哪里和藏多强,后者保证可试听与可被克隆模型吃入,组合意义是防御信号以可发声的声学形态进入后续所有处理链路。

需要提醒的是,原文未给出全部损失的逐项梯度路径细节,只说明净化以停止梯度方式周期性引入,编码器通过净化后可检索性损失学习抵抗。未报告处不从模型名推定实现。

两阶段训练优化什么,参数如何冻结与更新?

训练分 2 个阶段。第一阶段是编码器训练,在 LibriSpeech train-clean-100 上进行,约 100 小时 253 人,每 100 人分配唯一水印标识。短时傅里叶变换参数为 512 点、跳 128 点、汉窗,嵌入带为 100 到 1000 Hz,音频按 1 秒不重叠块处理。损失由三项组成:扰动二范数约束幅度,解码估计与目标的均方误差保证可检索,加水印与原始波形的均方误差维持波形一致,目标比特被放缩为正负 5。优化器用 AdamW,学习率 1e-4,余弦退火,批量 16,共 200 轮,按验证比特准确率选最优检查点。

XLS-R 保持冻结,编码器与解码器更新。第二阶段是对抗微调,从第一阶段检查点出发,以 0.3 概率施加 PhonePuRe 2 阶段净化,净化分支停止梯度但损失回传到编码器。总目标含五项权重:水印检索权重 1.0,扰动幅度权重 0.1,原始语音误报抑制权重 0.3,净化后可检索权重 0.5,另有重构一致项。优化器换为学习率 1e-5,批量 12,共 50 轮,按净化后准确率选模型。推理没有训练,只做块解码加投票。

汉明纠错与多数投票 × 未检出伪造长度: 汉明纠错与多数投票负责把 16 比特身份先扩成 36 比特再在每 1 秒块重复嵌入并在解码端跨块投票,未检出伪造长度衡量攻击者能逃过溯源的最长连续伪造,前者提供冗余,后者量化冗余是否够用,组合后系统用时间冗余换取局部损坏下的可恢复性,原文称该配置下理论上界至多 2 秒。

原文明确给出汉明编码把 16 比特扩成 36 比特,并在 1 秒块上重复嵌入,解码后多数投票聚合。该冗余是后续低延迟溯源的基础。

数据、攻击链与指标在什么条件下测得?

编码器训练数据为 LibriSpeech train-clean-100,253 人约 100 小时 16 kHz。真实威胁模拟用 VCTK 中挑选的 11 个说话人,下采样到 16 kHz。攻击链是端到端语音克隆:先用对抗训练后的模型对 11 人语音做 1 秒分块加水印,攻击者拿加水印数据微调 YourTTS 和 sv2TTS,再每人生成 15 条克隆语音,共 165 条。防御者在克隆语音上分块解码,用汉明相似度与水印池比对,阈值 0.7,跨块多数投票做源溯源。前端与音素引导条件为冻结 XLS-R300M 提取表示,强制对齐器提供音素级边界,稳定性掩码同样在 100 到 1000 Hz。

解码器结构如前所述。指标方向需记牢:信噪比越高越好,感知评估越高越好,比特准确率越高越好,真正例率与溯源准确率越高越好,保持率越高越好,未检出伪造长度越低越好。统计报告形式为均值加减标准差,样本量在语音质量评估中为每编码器随机 100 对,溯源中为 165 条。硬件预算原文未报告具体型号与耗时,只给出推理延迟约 1 秒的结论性描述,复现时应把延迟拆分为分块解码时间与投票等待时间分别测量,不把总体趋势当作每步保证。

净化前后与克隆溯源的主结果是什么?

先看核心问题:不做对抗微调的水印能否扛住 PhonePuRe 净化,做了对抗微调后提升多少,不同编码器差距多大。下表整理原文报告的原始准确率、净化后准确率与保持率,比较条件是同一净化器、同一训练数据,区别仅在编码器结构与是否经过对抗阶段。表前公平条件是三编码器独立训练但设置相同,每人唯一水印,指标方向均为越高越好。

编码器阶段原始准确率净化后准确率保持率
长短时记忆网络基础训练77.0748.2662.62
长短时记忆网络对抗微调82.5167.1881.42
双列双向 Mamba基础训练84.7775.5389.10
双列双向 Mamba对抗微调89.6880.2589.48
多头 Mamba基础训练89.6780.1989.43
多头 Mamba对抗微调91.5684.5592.34

表后解释:对抗微调对三者都有提升,但幅度不同。长短时记忆网络基础净化后仅 48.26,对抗后到 67.18,保持率从 62.62 到 81.42,说明见过净化显著改善生存,但绝对值仍低于 Mamba 系。双列双向 Mamba 基础已达 75.53,对抗后 80.25。多头 Mamba 最强,对抗后原始 91.56,净化后 84.55,保持率 92.34。代价是结构更复杂,需要 4 层三头加门控融合。

未胜出项是长短时记忆网络,它在净化后明显落后,证明顺序建模在分布式水印任务上不足。接着看真实克隆溯源与听感代价,下表把语音质量与溯源放在一起,但二者指标方向不同,不可互相换算。

编码器信噪比感知评估溯源真正例率未检出伪造长度
长短时记忆网络34.12 ± 4.233.53 ± 0.4199.9 ± 0.21.2 ± 0.4
双列双向 Mamba35.13 ± 3.483.55 ± 0.39100.0 ± 0.11.1 ± 0.2
多头 Mamba35.67 ± 4.543.54 ± 0.5799.9 ± 0.11.0 ± 0.1

表后解释:三编码器信噪比均超 34 分贝,感知评估在 3.5 以上,报告显示声学透明性较好,其中多头 Mamba 信噪比最高为 35.67。

溯源真正例率均接近 100%,双列双向 Mamba 报告 100.0,未检出伪造长度在 1.0 到 1.2 秒,对应约 1 秒的超低延迟主张。但要注意该延迟是在 1 秒分块加投票配置下对 11 人 165 条的测量,不等于任意长度与任意克隆模型下的保证。百分点差与相对百分比不可混淆,保持率是净化后相对原始的保留比例,比特准确率是绝对正确比例。

去掉音素引导后保持率掉多少?

消融要回答音素稳定性掩码是否必要。实验让三编码器分别在有无音素引导下训练,其他条件相同,再经 PhonePuRe 净化后比较保持率。下图是该对照的可视化,横轴为 3 种编码器,纵轴为保持率,蓝色为无引导,橙色为有引导。

看图路径: 1. 先确认横轴三组编码器与纵轴保持率的定义域;2. 对比每组内蓝色无音素引导与橙色有音素引导柱的高度差;3. 记录三组橙色柱顶标注的 0.81、0.89、0.92 的具体取值

原论文 Figure 2:2

论文图 2。原论文 Figure 2:“2”。

从像素可见,3 组橙色柱均显著高于蓝色柱。长短时记忆网络从 0.48 到 0.81,双列双向 Mamba 从 0.50 到 0.89,多头 Mamba 从 0.56 到 0.92。原文文字称该部件在抵御净化中起关键作用,数据支持这一判断。但也要看到即使有引导,长短时记忆网络仍低于 Mamba 系,说明掩码不能完全弥补建模能力的差距。未评测边界是该消融只报告保持率,未同时给出无引导时的信噪比与感知评估变化,因此不能断言去掉掩码一定改善听感。复现时应补测该条件下的质量指标,并固定对齐器版本与字典,否则掩码差异会混入编码器差异。

哪些条件没测,哪些结论不能推广?

首先是攻击覆盖。原文实际运行的克隆为 YourTTS 与 sv2TTS 微调链,净化为 PhonePuRe 的 2 阶段实现,其他扩散净化器与频谱操作方法只在引言中提及,未作为同条件基线给出数字,因此不能把鲁棒性推广到所有净化。其次是数据规模。溯源仅在 11 个 VCTK 说话人 165 条上测量,编码器训练仅在 LibriSpeech train-clean-100 上进行,跨数据集、跨语言与跨采样率的表现未报告。第三是成本缺项。

训练轮数、批量与学习率已给出,但硬件型号、显存占用、训练时长与推理帧率未给出,约 1 秒延迟是结论性描述而非分步计时。第四是指标冲突风险。原文表头与正文对保持率、溯源准确率的命名略有差异,数值相同不能自动视为同一聚合对象,复现时应按数据集、模型、阶段、指标、单位与聚合对象逐项核对。最后是资源状态。本次收到的资源状态为未发现可验证的公开资源,因此不能声称代码、模型或数据已公开。

原文正文写有 GitHub 链接,但本次未能确认可达,复现前需先验证链接与权重是否可下载,不把链接存在等同于系统可运行。

要复现应先准备什么,按什么顺序验证?

第一步准备数据与工具。下载 LibriSpeech train-clean-100 并确认 253 人约 100 小时 16 kHz 划分,准备 VCTK 子集并统一重采样到 16 kHz,安装蒙特利尔强制对齐器并生成 ARPAbet 音素边界,精度约 10 毫秒。冻结 XLS-R300M 不更新,短时傅里叶变换固定 512 点、跳 128 点、汉窗,嵌入带固定 100 到 1000 Hz。第二步实现编解码。身份 16 比特经汉明编码到 36 比特,线性映射到 1024 维,与语音表示拼接送入三选一编码器,扰动乘掩码后加到复数频谱,逆变换重构。

解码器实现 8 层卷积加自适应池化与线性分类,输入为对数幅度谱对应频带。第三步 2 阶段训练。先按 AdamW 学习率 1e-4 批量 16 训练 200 轮选验证最优,再按学习率 1e-5 批量 12 以 0.3 概率加 PhonePuRe 净化微调 50 轮选净化后最优,损失权重按原文 1.0、0.1、0.3、0.5 设置。第四步攻击评估。按 1 秒不重叠块加水印,微调 YourTTS 与 sv2TTS 各生成 15 条每人,用阈值 0.7 与多数投票溯源,同时测量信噪比、感知评估、比特准确率、保持率与未检出伪造长度。

验证顺序建议先复现语音质量与原始准确率,再复现净化后保持率,最后复现克隆溯源,因为前者不依赖重量级合成模型,更易定位掩码与频带错误。

何时值得尝试这种水印,还有什么待验证?

当防御目标不仅是阻止合成而是事后回溯泄露源,且攻击链包含扩散净化与说话人自适应微调时,这种把水印与音素稳态绑定的思路值得尝试。它的可取之处在于载体选择与训练见过攻击:频带与掩码让净化器难以单独擦除,对抗微调让编码器提前适应净化失真,块重复加投票用时间冗余对抗局部损坏。原文报告多头 Mamba 在净化后 84.55 准确率与 92.34 保持率下仍保持 35 分贝以上信噪比与近 100% 溯源,支持该组合在给定 11 人 165 条条件下的有效性。

待验证的是更大说话人池下的误接受率、不同对齐质量下的掩码稳定性、以及净化器更新后的迁移性。初学者复述时应抓住一句话:先对齐找稳态音素,再把身份比特藏进其共振峰频带,最后让解码器在净化与克隆后仍能投票找回身份。不应承诺未测量的误判率、实时性与跨模型泛化已解决,也不应把链接存在当作可运行保证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总