英文题目:DuraMark: Duration-Embedded Watermarking in LLM-based TTS

会议身份:conference:interspeech:2026:conference-paper-id:mou26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #鲁棒性 #语音 #文本到语音 #音频水印

评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhenwei Mou:机构信息未能从会议 PDF 纯文本可靠映射
  • Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
  • Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
  • Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大语言模型文本到语音面临语音克隆滥用,输入为音节文本序列与说话人表征,输出为可溯源合成语音,难点是信号级水印易被神经声码器与音频编解码器重建抹除。所提DuraMark先由带时长预测的自回归语言模型逐音节预测时长分布并按目标奇偶比特编辑时长,再基于编辑后时长生成语音Token并经流匹配解码器合成梅尔谱,最后由时长提取器从语音与文本中恢复音节时长并经余弦映射计算相关性完成检测。与AudioSeal等信号级方法在波形或频谱做重构嵌入不同,该方法将信息藏入韵律层面的时长奇偶性,重建仍需保留可懂韵律与自然节奏因而更难被平滑抹除。在AISHELL-3测试集下,DuraMark-Info的TPR指标为0.993,高于AudioSeal的TPR指标0.701。该结论限于普通话单字单音节、需文本辅助对齐的受控评测,未验证跨语言、短语音与文本缺失下的外推能力。原文未披露推理延迟与部署成本。

🔗 开源与复现资源

  • 演示资源:https://muzw.github.io/duramark_demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么克隆语音越像,水印越难藏?

输入是这篇论文的原文证据与本次收到的官方原图像素,目标是让刚进入语音领域的研究生能复述 DuraMark 的方法与实验条件,必须保留的信息包括任务定义、时长编辑与提取的具体动作、训练监督来源、基线与攻击条件、指标方向与关键数字,输出是 1 篇可核对的技术解读而不做营销式判断。学习依赖是先理解水印要解决的伪造溯源问题,再理解生成式攻击为何专克信号级水印,最后才能理解为何作者转向信息级时长。

论文研究的大语言模型语音合成,是指以语言模型预测离散语音标记再经解码器生成波形的一类系统,白话说就是先把文字变成一串声音单元编号,再把编号还原成波形。它的克隆能力越强,伪造者用重合成抹掉细微水印就越容易。传统做法是在波形或频谱上做微小重建,把比特藏进信号细节,检测器再从重建信号中恢复比特。

问题在于神经音频编解码器与神经声码器这类生成式攻击会按内容、语义和韵律重建语音,把冗余信号细节平滑掉,水印信息随之衰减。另一条信息级路线曾尝试以后处理改基频,但容易造成不自然韵律。DuraMark 的判断是把载体换成音节时长,用白话说就是每个字读多长,以帧数为单位,这个量在重建后仍大体保留,又可由合成模型在生成时精确控制。论文的演示页当前可用,已公开音频示例,可用于听感对照但不能代替表中的可听性与鲁棒性数字。

同目标的三条路线在比什么?

相关工作按同输入、同目标、同运行阶段来对照才公平,输入都是待保护的合成语音或合成过程,目标都是在保持可听性的前提下实现可检测,运行阶段分为后处理与生成时嵌入。第一类是传统时频域方法,依靠领域特征设计嵌入与解码函数,优点是不依赖神经网络,缺点是容量与鲁棒性有限。

第二类是神经网络后处理水印,以嵌入器加检测器架构为代表,嵌入器同时吃水印与语音并重建出带水印波形或谱,检测器再恢复水印,论文比较的 AudioSeal、WavMark 与 MaskMark 属于此类,其中 AudioSeal 是时域局部方法,WavMark 是基于可逆谱编解码的方法,Timbre 是操作幅度谱的频域方法。第三类是生成式水印,把声码器或编解码器架构当作嵌入器,通过替换生成模型内部组件让水印在合成过程中融入,TraceableSpeech 与加水印的 HiFi-GAN 属于此类。

DuraMark 与第三类同阶段但换了载体,它不改波形细节而改音节时长序列,检测也不从波形直接解码比特而是从时长序列比对。信息级前作曾用音高与时长修改做水印,但依赖传统信号后处理改基频值,论文指出这会带来不自然韵律。理解这条谱系后,才能明白实验为何重点比较神经编解码器与声码器攻击,而不是只比高斯噪声这类传统扰动。

任务的形式化输入输出是什么?

论文把任务拆成嵌入与检测两个阶段。嵌入的输入是音节序列 E 等于 e1 到 eI,其中 I 是音节数,在中文实验中一个汉字对应一个音节,还包括说话人嵌入 g 与长度同为 I 的随机水印序列 w 等于 w1 到 wI,每个 wi 取 0 或 1。输出是带水印语音 O 帽,其第 i 个音节的时长 d 星 i 的奇偶性应与 wi 一致,偶数表示 0,奇数表示 1。举例说明,假如某句有 4 个音节,目标水印是 0、1、0、1,则 4 个音节的帧数应分别为偶、奇、偶、奇,这只是教学例子,不代表论文的实际水印值。

检测的输入是待测语音 O、对应转录得到的音节序列 E、候选水印 w 与阈值陶,输出是二值判定。检测先用时长提取器得到估计时长 d 帽,再把 w 与 d 帽映射到负 1 到 1 区间并计算相关分数 T,若 T 大于陶则判为带水印。指标是固定千分之一误报率下的真正率,记为 TPR,越高越好。自然度用字符错误率与平均意见分衡量,字符错误率越低越好,平均意见分越高越好。这个形式化的关键是水印长度随语音长度增长,因此长语音天然携带更多比特,短语音的检测难度更大。

DuraMark 如何走完从文字到判定的全程?

先沿一个样本走完输入、表示、组件、目标与输出。输入一句话的音节序列与说话人嵌入,语言模型先预测每个音节的时长标记与语音标记,时长编辑模块按水印奇偶要求把时长微调 1 帧以内,流匹配解码器再以编辑后时长与语音标记为条件生成梅尔谱并经声码器成波,检测时时长提取器从波形与文本中恢复时长序列并与水印比对。白话说,合成侧负责把比特写进读得稍长或稍短,检测侧负责量出每个字读了几帧再核对奇偶。

大语言模型语音合成 × 时长可控合成: 大语言模型语音合成负责根据音节文本嵌入序列和说话人嵌入自回归地预测时长标记与语音标记,提供内容与音色基础,时长可控合成则要求解码器严格服从外部给定的时长序列,二者搭配的理由是只有解码器真正听从编辑后的时长,水印才能从标记域落实到波形,组合意义是把水印嵌入从后处理叠加变为生成过程的一部分。

下图是论文图 1 给出的时长可控合成与时长提取器的架构,是理解上述分工的唯一像素依据,阅读时先区分左右两个子图再看箭头汇合处。

看图路径: 1. 先找到底部文本与梅尔谱两个输入箭头,确认文本编码器与语音编码器是并行进入 Transformer 的;2. 再看顶部概率方格与虚线框,确认 at 是每帧在音节上的分布而 d 帽 i 是对一行求和得到;3. 对照左侧图例颜色,区分说话人嵌入、文本嵌入、语音标记与时长查询嵌入的输入位置;4. 沿着 Transformer 向上到求和箭头走一遍提取路径,确认检测时只用该分支而不经过合成解码器

原论文 Figure 1:Architectures of the duration-controllable TTS and duration extractor used in DuraMark.

论文图 1。原论文 Figure 1:“Architectures of the duration-controllable TTS and duration extractor used in DuraMark.”。

该图右侧绿色底框为时长提取器,底部有两个并行输入,左侧文本经文本编码器得到 E,右侧梅尔谱 M 经语音编码器得到帧特征,二者拼接后进入 Transformer,对每帧输出在 I 个音节上的概率分布 at,顶部方格可视化了该分布,虚线框出一行求和即得第 i 个音节的估计时长 d 帽 i,训练用帧级交叉熵监督。

左侧未在本次像素中完整显示的部分按正文应为带时长预测的语言模型与带时长控制的流匹配解码器,其要点是语言模型按音节自回归,先由时长查询嵌入触发时长标记再生成对应数量的语音标记,解码器则接受时长与语音标记并受提取器引导。全程的目标是让编辑后时长能被精确执行且能被可靠量出,否则嵌入与检测就会断裂。

嵌入与提取的每一步在算什么?

嵌入按算法 1 第一阶段执行。对第 i 个音节,语言模型在给定说话人嵌入、文本嵌入与历史时长和语音标记的条件下预测时长分布 yi,yi 是时长词表上的向量,每个元素对应一种帧数的概率。从 yi 中采样初始时长 di,若 di 除以 2 的余数等于 wi 则保留为 d 星 i,否则在 di 加 1 与 di 减 1 中选择在 yi 中概率更高者作为 d 星 i。随后以 d 星 i 为条件生成 d 星 i 个语音标记 si。最后把全部 d 星与 S 送入流匹配解码器合成带水印语音。这种只动 1 帧的策略是为了把韵律扰动压到最小,同时利用语言模型自身的概率选择更自然的邻近时长。

音节时长编辑 × 奇偶状态映射: 音节时长编辑负责把采样得到的原始帧数 di 调整为满足目标比特的 d 星,奇偶状态映射负责规定偶数代表比特 0、奇数代表比特 1 的分工,二者搭配是因为时长是整数帧数而水印是二进制序列,需要一个无歧义的量化规则,组合后嵌入操作简化为若 di 除以 2 的余数等于 wi 则保留否则在 di 加 1 与减 1 中选概率更高者。

检测按算法 1 第二阶段执行。给定语音 O 与音节序列 E,提取器按帧预测归属概率 ai,t 并对时间求和得到 d 帽 i。映射时水印侧用 w 撇 i 等于 2 倍 wi 减 1,即 0 映射为负 1、1 映射为正 1,时长侧用 d 撇 i 等于负 cos 派乘 d 帽 i,偶数时长对应负 1、奇数对应正 1,相关分数 T 为两者点乘后除以 I。阈值陶在评估时按固定误报率确定。

时长提取器 × 相关性检测: 时长提取器负责从语音与音节序列中估计每个音节的帧数,相关性检测负责把提取时长与目标水印都映射到负 1 到 1 区间后计算相关分数 T,二者搭配是因为提取值是整数帧数而水印是二进制,需要公共比较空间,组合后检测简化为提取、映射、求相关并与阈值比较的流水线。

这里的术语时长提取器是指以文本与梅尔谱为输入、输出帧到音节归属概率的 Transformer 模型,相关性检测是指在公共区间上算相关的判定方法。初学者易误以为检测是直接解码比特,实际是比对相关性,阈值决定了误报与漏检的权衡。

两个模型用什么监督练出来?

训练分两块独立进行。语言模型的训练目标是时长标记与语音标记的加权交叉熵,权重 wllm 平衡两项,输入包括说话人嵌入、文本嵌入与历史,输出是时长分布与帧级语音标记分布,推理时对语音标记用 top-p 等于 0.8 与 top-k 等于 25 采样,对时长标记用贪心采样。时长提取器的训练目标是帧级交叉熵,让每帧的预测分布逼近强制对齐得到的真实分布,真实边界用蒙特利尔强制对齐器在中文数据上获得。

流匹配解码器采用最优传输条件流匹配,学习从高斯噪声到目标梅尔谱的向量场,条件包括说话人嵌入、语音标记与时长标记,损失为流匹配损失与引导损失的加权和,权重 wflow 平衡。引导损失的做法是单步近似估计梅尔谱,再送入冻结的时长提取器得到预测分布并与真实分布算交叉熵。

流匹配解码器 × 时长提取器引导: 流匹配解码器负责以说话人嵌入、语音标记和时长标记为条件从噪声生成梅尔谱,时长提取器引导负责用冻结的提取器对单步估计谱计算帧级对齐并回传引导损失,二者搭配的理由是仅靠重建损失不能保证时长精确执行,组合意义是用可微的对齐监督迫使解码器把时长控制落实到谱的帧分布上。

论文未报告梯度是否截断到冻结提取器内部以外的细节,只明确提取器在引导时冻结、解码器更新,因此复述时只能说监督来自冻结提取器的对齐预测,不能猜测额外的梯度路径。消融显示去掉解码器输入中的时长标记或去掉引导损失都会大幅掉点,说明显式时长输入与引导缺一不可。训练数据来自 WenetSpeech 约 10000 小时中文语音,框架基于 CosyVoice 开源实现,用 Adam 优化器、学习率 1 乘 10 的负 5 次方,在 8 张 MLU580 上训练,损失平衡权重记为拉姆达 llm 等于 1 与拉姆达 flow 等于 4。原文对 wllm 与 wflow 的具体数值未给出可核对的连续原句,这是缺项,复现时需以开源配置为准而不应臆测。

在什么数据与基线上测鲁棒性?

评估用 AISHELL-3 测试集,包含 214 名说话人的录音,训练与评估均为普通话中文。基线是 3 个信号级方法的可运行官方实现,分别为 AudioSeal、Timbre 与 WavMark,基线施加在生成的无水印语音上再与 DuraMark 比较。DuraMark 分两种检测条件,知情检测用真实文本,盲检测用自动语音识别转录文本,水印序列随机生成。语音长度按音节数分为 17 到 32、33 到 64、65 到 100 三档,每档生成 1000 对带水印与无水印 utterances,用固定千分之一误报率下的真正率评估。

鲁棒性攻击分 5 类,一是神经编解码器,包括 EnCodec 的 6.0k 与 12.0k、DAC 的 3.0k 与 4.5k、SpeechTokenizer 的 4.0k、FACodec 的 2.4k,二是神经声码器,包括 BigVGAN、Vocos 与 HiFiGAN,三是语音增强,包括 Demucs 与 FRCRN,四是有损压缩,包括 MP3 的 32k、Opus 的 16k 与位深量化 26,五是信号处理,包括 20 分贝高斯噪声、20 分贝背景噪声、4.8 千赫低通与窗口平滑 18。自然度用 Whisper 测字符错误率,11 名母语者对 20 句打分得平均意见分及 95% 置信区间。后续主实验采用 33 到 64 音节配置,这个选择与长度实验中长语音更易检的趋势一致。

生成式攻击下谁还检得出?

鲁棒性比较要回答时长载体能否扛住生成式重建,本节以 TPR 为统一口径对比 3 种信号级基线与 DuraMark 知情和盲检两档,下表先看平均与神经编解码器及典型信号处理的分化。

扰动条件AudioSealWavMarkDuraMark-InfoDuraMark-Blind
Average0.7010.4030.9930.978
EnCodec 6.0k0.7730.0150.9910.968
DAC 3.0k0.0960.0070.9940.980
Background Noise 20 dB1.0000.9050.9870.965
Low-pass 4.8 kHz1.0001.0000.9730.961

表后解释是基线在传统信号处理、有损压缩与语音增强下多能保持高 TPR,但在神经编解码器与声码器下分化严重,WavMark 在多数神经扰动下失效,AudioSeal 与 Timbre 时好时坏,例如 AudioSeal 在部分编解码器下掉到 0.004 到 0.013,Timbre 在 EnCodec6.0k 下仅 0.124,而 DuraMark 知情检测始终大于 95%,平均 0.993,盲检测平均 0.978,支持了时长载体抗生成式重建的判断。代价是无攻击时 DuraMark 知情为 0.998、盲为 0.987,略低于基线的 1.000,且低通 4.8 千赫下盲检测为 0.961,是其相对弱点。未胜出项是背景噪声 20 分贝下盲检测 0.965,仍高于 WavMark 的 0.905 但低于 AudioSeal 与 Timbre 的 1.000,说明时长提取仍受噪声影响。

知情检测 × 盲检测: 知情检测使用真实文本得到音节序列 E 进行时长提取,盲检测使用自动语音识别转录文本得到 E 再进行同样提取,二者分工都是为提取器提供文本侧输入,搭配比较的理由是实际部署时不一定有原文,组合意义是能量化转录误差对水印可检性的具体损失。

语音长度决定可嵌入水印序列长度,下表以 TPR@1%FPR 为口径检验 17–32、33–64 与 65–100 三档的检出率,用于说明主实验选用 33–64 档的依据。

长度(音节)DuraMark-InfoDuraMark-Blind样本对数
17–320.9810.9421,000
33–640.9980.9871,000
65–1000.9980.9921,000

表后解释是该长度表显示更长语音对应更长水印序列因而 TPR 更高,33–64 档已知情 0.998、盲检 0.987 已达平台,65–100 档提升有限,后续主实验采用 33–64 档是兼顾时长与性能的选择,短语音 17–32 档盲检测 0.942 是明确的适用边界,短于该范围论文未评测,不能承诺同样鲁棒。

自然度评估要确认时长编辑未损害可懂度与主观质量,下表对比基线与 DuraMark 的客观与主观指标,用于说明鲁棒性增益不以牺牲自然度为代价。

方法CERMOS样本数评估者
Unwatermarked8.734.05 ± 0.092011
WavMark9.253.97 ± 0.082011
DuraMark8.544.04 ± 0.072011

表后解释是该自然度表显示 DuraMark 的 CER 为 8.54、MOS 为 4.04,与未加水印语音的 8.73、4.05 基本持平,也与 AudioSeal 和 Timbre 相当,显著优于 WavMark 的 9.25、3.97,20 句、11 名母语者评估条件下可认为时长嵌入对自然度影响最小,支撑了信息级水印可用性的判断。

拿掉时长控制会发生什么?

消融要回答时长输入与引导损失是否为必要机制。论文设置两个变体,一是解码器输入去掉时长标记,二是训练去掉引导损失,其余条件不变,用知情与盲检测的 TPR 衡量。报告显示完整 DuraMark 知情为 0.998、盲为 0.987,去掉时长输入后掉到知情 0.455、盲 0.473,去掉引导损失后掉到知情 0.327、盲 0.342。这种大幅下降支持了解码器若不显式接受时长并受对齐监督,就不能严格执行编辑后时长,水印信息在生成阶段即丢失的解释。

但这只是该数据与该架构下的有限解释,不能反推任何解码器去掉时长都会掉到同一数值。另一个反证是长度实验中短语音本身 TPR 更低,说明即使机制完整,载体容量不足仍会限制检测。复现消融时应先保证强制对齐与提取器精度,否则无法区分是控制失效还是测量失效。

哪些边界论文没有测?

首先是文本依赖,检测需要音节序列 E,盲检测依赖识别转录,论文用两种条件量化了损失,但未报告识别错误率与时长误差的定量关系,也未评估无文本时的完全盲检,因此不能把方法说成无需文本。其次是语言与粒度,实验只在普通话单字单音节上进行,音节边界来自强制对齐器,多音节语言或无明确音节的语言是否同样有效待验证。

第三是攻击覆盖,虽然包含多种编解码器、声码器、增强、压缩与信号处理,但未测量变速、剪切、重排序这类直接改时长的攻击,而时长载体理论上对这类攻击更敏感,缺失这项即不能承诺抗时间篡改。第四是成本与延迟,论文报告了训练硬件与数据规模,但未报告提取器与解码器的推理开销、实时率与检测延迟,总体 TPR 趋势不等于每步都低延迟。第五是阈值泛化,TPR 固定在千分之一误报率下,实际部署的误报容忍不同,阈值需重标定。

这些缺失不是技术错误,但在选型时必须如实保留。

复现先做什么才能对上数字?

复现的第一步是准备数据与对齐。下载 WenetSpeech 用于训练、AISHELL-3 测试集用于评估,用蒙特利尔强制对齐器得到音节边界,注意中文一字一音节的划分口径要与论文一致,否则时长词表与提取目标会对不上。第二步是跑通 CosyVoice 开源框架的语言模型与流匹配解码器,先复现无水印合成的字符错误率与听感基线,再接入时长编辑。第三步是训练时长提取器,用帧级交叉熵监督,验证指标是帧归属准确率与 d 帽求和误差,只有提取误差足够小,检测相关分数才有意义。

第四步是实现算法 1 的嵌入与检测,嵌入侧注意对时长用贪心采样、对语音用 top-p 与 top-k 采样,编辑只在加 1 减 1 中选概率更高者,检测侧注意映射公式与相关除以 I,阈值按千分之一误报率在配对数据上确定。第五步是对齐攻击条件,用官方实现的 AudioSeal、Timbre、WavMark 与指定的编解码器参数复测,不要用自行重实现的近似参数代替。

关键超参数与信息条件包括学习率 1 乘 10 的负 5 次方、8 卡 MLU580、拉姆达 llm 等于 1 与拉姆达 flow 等于 4、水印随机生成、33 到 64 音节主配置,论文只声明代码基于开源框架,未明确权重是否公开,因此应区分数学复现、系统可运行与权重可下载三件事。

何时值得尝试时长水印?

当部署场景的主要威胁是神经编解码器或声码器重合成,且合成系统允许改时长控制接口时,DuraMark 值得尝试,因为它的平均 TPR 显著高于所比信号级基线,且自然度在报告条件下未见明显损失。当语音很短、文本不可得或应用必须抵抗变速剪切时则应谨慎,因为短语音盲检测已降到 0.942 左右,无文本与时间篡改都超出已验证范围。研究启示是把鲁棒性载体从易被平滑的信号细节移到重建中保留的韵律结构,但代价是引入对文本与对齐的依赖。

下一步最需补的验证是时长攻击下的衰减曲线、跨语言的音节与音素粒度对比,以及检测延迟与误报在真实流量下的标定。回到中心矛盾,越像真人的合成越容易抹掉藏在细节里的水印,而藏进每个字读多长的选择,用 1 帧以内的代价换来了重建后仍可量出的痕迹,这正是论文用大量生成式攻击对照想要说明的一点。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总