📄 SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

标签:#音频水印 #端到端 #语音合成 #语音识别 #音频理解

6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.4/1.5

6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频水印 | #端到端 | #语音合成 #语音识别 | arxiv

👥 作者与机构

  • 第一作者:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC)
  • 通讯作者:未说明
  • 作者列表:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC), Jun-Cheng Chen (CITI, Academia Sinica, Taiwan, ROC), Chun-Shien Lu (IIS, Academia Sinica, Taiwan, ROC)

💡 毒舌点评

亮点在于将水印载体从脆弱的信号层提升到相对稳定的语义层,概念新颖且有洞察力,在AudioMarkBench的多种攻击下展现出极具说服力的平均鲁棒性优势,特别是在面对神经编解码器压缩时表现突出。短板同样明显:该方法严重依赖外部ASR和TTS模型,引入了额外的复杂性、延迟和潜在的单点故障;且基础检测率(No-atk TPR)低于一些信号级方法,表明其在“无攻击”场景下并非最优;此外,对语义攻击(如转述)的脆弱性未被评估,且未讨论多比特水印嵌入能力,限制了其作为通用溯源工具的潜力。

📌 核心摘要

本文要解决的问题是现有语音水印方法在面对信号处理(如噪声、滤波)和压缩(如MP3、神经编解码器)等后处理攻击时,水印鲁棒性不足的问题。其核心思想是观察到攻击虽然会破坏信号级特征,但通常保留了语音的语义内容。因此,作者提出了SSTMark框架,通过将水印嵌入到语音转录后的文本内容中来实现“语义级水印”。该框架是一个三阶段流水线:首先通过ASR模型将预生成的语音转录为文本,然后利用文本水印技术(基于密钥控制的同义词替换)对转录文本进行改写以注入水印,最后通过TTS模型将水印文本重新合成为语音。验证时,将待检测语音转录为文本并检测其中由密钥控制的统计偏差。与信号级方法不同,SSTMark是免训练的,并通过绑定语义来抵抗信号失真。在AudioMarkBench基准测试上的实验表明,在固定的1%误报率(FPR)下,SSTMark在信号处理编辑和压缩编辑上的平均检测率(TPR)分别为90.2%和90.0%,比当前最优基线高4.6%和16.9%,展现出最强的平均鲁棒性。该方法为合成语音提供了一种更稳健的溯源验证新思路。其主要局限性包括对短语音句的检测性能不佳、对核心外部模型(ASR/TTS)的严重依赖、基础检测率相对较低,以及未评估对语义改写攻击的鲁棒性。

关键实验结果表格(部分数据)

表3:信号处理编辑下的鲁棒性(TPR@FPR=1%,平均值)

方法No-atk平均TPR
AudiowMark100.057.1
WavMark100.068.9
Timbre100.085.6
AudioSeal100.078.2
SSTMark (Ours)91.090.2

表4:压缩与神经编解码编辑下的鲁棒性(TPR@FPR=1%,平均值)

方法No-atk平均TPR
AudiowMark100.055.2
WavMark100.025.7
Timbre100.073.1
AudioSeal100.062.6
SSTMark (Ours)91.090.0

表5:对抗攻击(HopSkipJumpAttack)下的保真度

方法查询次数PESQ ↑SI-SNR ↑ViSQOL ↑
SSTMark (Ours)1001.1422.6881.652
AudioSeal1004.08848.4204.696

🔗 开源详情

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及
  • 数据集:论文中未提及数据集链接(使用了LibriSpeech train-clean-100分割,但未提供新链接或获取方式)
  • Demo:论文附录B提及提供匿名演示音频文件(在补充材料中),但未提供直接下载链接
  • 复现材料:论文提供了详细的算法伪代码(附录A)、SpeechGPT生成指令模板(附录B)以及音频扰动设置详情(附录C)用于复现。
  • 论文中引用的开源项目:
    • SpeechGPT: 论文中引用(Zhang et al., 2023),作为语音生成模型𝐆sp。未提供直接链接。
    • Whisper: 论文中引用(Radford et al., 2023),作为STT模型𝐀。论文提及使用“Whisper Large-v3”。未提供直接链接。
    • CosyVoice: 论文中引用(Du et al., 2024),作为TTS模型𝐓。未提供直接链接。
    • AudioMarkBench: 论文中引用(Liu et al., 2024c),作为评估基准。未提供直接链接。
    • WavLM-Base-SV: 论文中引用(Chen et al., 2022),用于计算说话人相似度。未提供直接链接。
    • BERTScore: 论文中引用(Zhang et al., 2019)。未提供直接链接。
    • F5-TTS: 论文中引用(Chen et al., 2025b)。未提供直接链接。
    • Canary-1B-v2: 论文脚注引用(Sekoyan et al., 2025),并注明“arXiv preprint arXiv:2509.14128, 2025.”。链接为:https://arxiv.org/abs/2509.14128
    • SoundStream: 论文中引用(Zeghidour et al., 2021)。未提供直接链接。
    • Opus: 论文中引用(Valin et al., 2016)。未提供直接链接。
    • EnCodec: 论文中引用(Défossez et al., 2022)。未提供直接链接。
    • LibriSpeech: 论文中引用(Panayotov et al., 2015)。未提供直接链接。
    • AudiowMark: 论文中引用(Westerfeld, 2020)。未提供直接链接。
    • WavMark: 论文中引用(Chen et al., 2023)。未提供直接链接。
    • Timbre: 论文中引用(Liu et al., 2024b)。未提供直接链接。
    • AudioSeal: 论文中引用(San Roman et al., 2024)。未提供直接链接。
    • HopSkipJumpAttack (HSJA): 论文中引用(Chen et al., 2020)。未提供直接链接。

🏗️ 方法概述和架构

SSTMark是一个训练免的、基于语义的语音水印框架,其核心是通过文本作为中间媒介来注入和检测水印。整个框架是一个端到端的多阶段流水线,主要包含三个阶段:预语音生成水印注入水印检测

下图展示了SSTMark框架的整体流程,包括预语音生成、水印注入和水印检测三个主要阶段。

Figure 2: Overview of the SSTMark watermark injection and detection pipeline.

从图中可以看到,框架首先通过语音生成模型生成预语音,然后经STT转录为文本,进行文本水印注入,最后通过TTS重合成水印语音;检测时同样经STT转录后进行统计检测。

  1. 整体流程概述:给定一个文本提示 \(p\),语音生成模型 \(\mathbf{G}_{\text{sp}}\) 首先生成一个预语音信号 \(s_{\text{pre}}\)。在水印注入阶段,该信号通过一个语音转文本(STT)模型 \(\mathbf{A}\) 被转录为文本 \(x_{\text{pre}}\)。然后,使用一个基于密钥 \(k\) 的文本水印模块 \(\mathbf{W}(\cdot; k)\) 对该文本进行改写以嵌入水印。最后,通过一个文本转语音(TTS)模型 \(\mathbf{T}\) 将水印文本 \(x_{\text{wm}}\) 重新合成语音,得到最终的水印语音 \(s_{\text{wm}}\)。在检测阶段,待测语音 \(s_{\text{sus}}\) 再次通过STT模型转录为文本 \(x_{\text{sus}}\),然后使用与嵌入时相同密钥 \(k\) 的文本水印检测器 \(\mathbf{D}(\cdot; k)\) 分析该文本,通过统计检验(z-检验)判断水印是否存在,输出一个z分数 \(z\)。

  2. 主要组件/模块详解

    • 预语音生成模型 (\(\mathbf{G}_{\text{sp}}\)):功能是生成初始的、未加水印的语音样本。论文中使用SpeechGPT,其输入是文本提示 \(p\),输出是语音波形 \(s_{\text{pre}}\)。它作为整个水印流程的起点,使得框架能够作为现有语音生成器的后处理包装器。
    • 语音转文本模型 (\(\mathbf{A}\)):功能是将语音信号转换为其语言内容(文本)。论文中使用Whisper Large-v3。输入是语音波形(\(s_{\text{pre}}\) 或 \(s_{\text{sus}}\)),输出是文本转录(\(x_{\text{pre}}\) 或 \(x_{\text{sus}}\))。这使得水印操作得以在文本空间进行。
    • 文本水印模块 (\(\mathbf{W}(\cdot; k)\)):功能是通过受控的文本改写注入水印信息。它基于Yang et al. (2023)的同义词替换方法,并引入了密钥机制 \(k\)。其内部实现包括:
      1. 键控二进制编码:每个词 \(x_i\) 的二进制比特 \(b_i\) 由当前词、前一个词和水印密钥的哈希值异或决定,公式为 \(b_i = \text{RandomBinary}(h(k) \oplus h(x_i) \oplus h(x_{i-1}))\)。这使得同一文本在不同密钥下产生不同编码模式。
      2. 候选筛选与替换:对于被编码为比特0的词,利用BERT生成上下文感知的同义词候选集 \(C\)。候选集需通过句子级相似度阈值 \(\tau_{\text{sent}}\) (固定为0.83) 和词级相似度阈值 \(\tau_{\text{word}}\) (可调,默认0.7) 的筛选,形成 \(C‘\)。在 \(C’\) 中,选择与原始词在密钥下编码为比特1且词级相似度最高的词进行替换。这个过程增加了文本中比特1的比例,形成可检测的统计偏差。
    • 文本转语音模型 (\(\mathbf{T}\)):功能是将水印文本重新转换为语音。论文中使用CosyVoice。输入是文本 \(x_{\text{wm}}\) 和参考音频(通常取自 \(s_{\text{pre}}\)),输出是合成语音波形 \(s_{\text{wm}}\)。
    • 文本水印检测器 (\(\mathbf{D}(\cdot; k)\)):功能是检验文本中是否存在由嵌入步骤注入的统计偏差。它使用与嵌入模块相同的密钥 \(k\) 和编码规则对文本 \(x_{\text{sus}}\) 进行编码,计算文本中比特1的比例 \(\hat{p}\),然后使用z-检验判断该比例是否显著偏离零假设下的预期比例 \(p_0=0.5\)。z-分数计算公式为 \(z = (\hat{p} - p_0) / \sqrt{p_0(1-p_0)/N}\)。分数越高,水印存在的证据越强。
  3. 组件间的数据流与交互:数据在流水线中线性传递。预语音生成模型输出 \(s_{\text{pre}}\) -> STT模型输出文本 \(x_{\text{pre}}\) -> 文本水印模块输出 \(x_{\text{wm}}\) -> TTS模型输出最终水印语音 \(s_{\text{wm}}\)。检测时,待测语音 \(s_{\text{sus}}\) -> STT模型输出文本 \(x_{\text{sus}}\) -> 文本水印检测器输出z分数 \(z\)。整个流程的关键交互点在于水印密钥 \(k\),它被用于文本水印模块和检测器,确保嵌入和检测的编码规则一致,这是安全性和正确性的基础。

  4. 关键设计选择及动机

    • 选择语义层而非信号层:动机是观察到语义内容比底层声学特征更能抵抗常见的信号失真。此设计旨在使水印在语音可懂的前提下保持鲁棒。
    • 采用免训练方式:论文强调其框架不依赖于对抗性训练来模拟攻击,而是通过将问题转化为文本来规避信号失真,这降低了实现的复杂度和对特定攻击的过拟合。
    • 引入水印密钥 \(k\):动机是增强安全性,使得同一文本内容在不同密钥下产生不同的水印模式,防止未授权检测。
    • 模块化设计:STT和TTS模型可以替换,论文的附录D展示了替换为F5-TTS和Canary-1B-v2后仍能保持稳健性能,增加了框架的灵活性和实用性。
  5. 多阶段逐层展开

    • 阶段一(预生成):由外部语音生成模型完成,输入为文本提示,输出为预语音。
    • 阶段二(水印注入):包含“转录 -> 文本改写 -> 重合成”三个子步骤。文本改写是核心,涉及基于密钥的词级编码、基于BERT的同义词生成、基于相似度(\(\tau_{\text{sent}}\), \(\tau_{\text{word}}\))的筛选和替换。
    • 阶段三(水印检测):包含“转录 -> 统计检测”两个子步骤。统计检测基于密钥控制的编码和z-检验的假设检验框架。
  6. 专业术语解释:论文中的核心术语如“键控二进制编码”、“同义词替换”、“z-分数检测”均有清晰的数学定义和解释。它将传统的“信号失真”问题巧妙地重新定义为“语义保留”问题,这是理解其创新性的关键。整个框架的设计哲学是:既然恶意用户在传播伪造语音时必须保留语义内容,那么将水印绑定到语义上就能提供更可靠的保障。

💡 核心创新点

  1. 语义级水印范式:这是最核心的创新。传统方法在波形或频谱上嵌入水印,依赖声学细节的保留。SSTMark创新性地将水印载体绑定到语音的语义内容(文本)上。其洞察在于,在许多攻击下,尽管声学细节被破坏,但语音传递的信息(语义)需要被保留才能达到欺骗目的。此创新使得水印对信号级攻击具有内在的鲁棒性。
  2. 基于文本改写的免训练水印注入:与需要端到端训练或模拟攻击训练的深度学习水印方法不同,SSTMark采用免训练的文本改写方式。它利用成熟的文本水印技术(基于同义词替换和统计偏差注入)作为中间步骤,避免了复杂的训练过程和针对特定攻击的过拟合。
  3. 基于STT-TTS转换的完整流水线:提出并实现了一个完整的、可操作的语义水印框架。它将语音生成、语音识别、文本水印、语音合成四个模块有机串联,为“语义水印”这一概念提供了切实可行的工程实现方案。
  4. 引入水印密钥机制:将密钥(key)引入文本空间的二进制编码规则中,使得同一内容在不同密钥下产生不同水印模式,增强了水印的安全性和所有权验证能力。

📊 实验结果

本部分报告了 SSTMark 在 AudioMarkBench 基准上的全面评估结果,并与四个信号级水印基线方法进行了比较。评估涵盖了语音保真度、在各种信号处理和压缩攻击下的鲁棒性,以及对抗性攻击的抵抗力。所有检测阈值均在干净的无水印语音上校准以满足固定的误报率(FPR)要求,并在所有攻击条件下保持固定。

下图以雷达图形式比较了SSTMark与其他信号级水印方法在AudioMarkBench多种攻击下的鲁棒性。

Figure 1. Robustness comparison under AudioMarkBench attacks (Liu et al., 2024c) at a fixed false positive rate (FPR) of 1%. Our method employs semantic-level watermark manipulation through speech-to-text (STT) and text-to-speech (TTS), whi

图中显示SSTMark在大多数攻击类型上均保持较高的检测率,平均检测率显著优于基线方法,验证了其语义级水印的强大鲁棒性。

首先评估 SSTMark 在语义保留和语音质量方面的保真度。表1对比了 SSTMark 与基线方法在说话人相似度和音频质量(FAD)上的表现。

表1. 语音保真度评估。SSTMark 的结果在固定的文本水印配置 τ_word=0.7 下报告。说话人相似度和 Fréchet 音频距离 (FAD) 分别用于评估说话人一致性和音频质量。↑ 表示越高越好,↓ 表示越低越好。

配置说话人相似度 ↑FAD ↓
AudiowMark0.9990.027
WavMark0.9981.934
Timbre0.9971.578
AudioSeal0.9990.067
SSTMark (Ours)0.9850.001

SSTMark 在 τ_word=0.7 的配置下实现了最低的 FAD (0.001),表明重合成的水印语音具有优异的整体音频质量。其说话人相似度 (0.985) 虽然略低于信号级基线(均接近1.0),但在绝对数值上仍然很高,说明水印注入和语音重合成过程没有引起说话人一致性的严重损失。

进一步分析水印强度阈值 τ_word 对保真度的影响,如表2所示。

表2. 词级相似度阈值 τ_word 对文本保留和重合成语音保真度的影响。较低的 τ_word 放宽了词级相似性约束,通常导致更强的水印强度。↑ 表示越高越好,↓ 表示越低越好。

τ_word说话人相似度 ↑FAD ↓BERTScore ↑BLEU-2 ↑BLEU-4 ↑
0.90.9850.0020.9840.8580.808
0.80.9850.0030.9740.7840.693
0.70.9850.0010.9610.7140.588
0.60.9840.0020.9550.6910.554

结果表明,说话人相似度在不同 τ_word 设置下保持稳定(约0.985),FAD 也保持在极低水平(0.001-0.003)。然而,随着 τ_word 从0.9降低到0.6,BLEU 分数显著下降,这反映了水印强度与文本保真度之间的权衡关系:更灵活的同义词替换会增强水印,但也会引入更大的词汇偏差。基于此分析,论文在后续实验中选择 τ_word=0.7 作为默认设置,该设置在提供强水印的同时保持了高语义相似性和说话人一致性。

鲁棒性评估按照 AudioMarkBench 的“无盒”扰动设置进行,包括信号处理编辑和压缩/神经编解码器编辑。

表3报告了在高斯噪声、滤波、速度扰动、平滑和回声等信号处理攻击下的真实正例率(TPR)。

表3. 信号处理编辑下的水印鲁棒性,报告为 TPR@FPR (%)。检测阈值首先在干净无水印语音上校准以满足1%和0.1%的目标FPR,然后固定用于所有评估条件。No-atk 表示未受任何攻击的原始水印语音。表格报告了每种攻击条件下水印语音的相应真实正例率 (TPR)。越高表示鲁棒性越好。每种条件下,最佳结果加粗,次佳结果下划线。

方法No-atk高斯噪声低通滤波高通滤波速度扰动平滑回声平均
10 dB5 dB0 dB1000 Hz500 Hz250 Hz1000 Hz
TPR@FPR=1%
AudiowMark100.00.00.00.0100.0100.0100.0100.0
WavMark100.017.016.215.499.417.90.0100.0
Timbre100.072.622.94.1100.0100.098.7100.0
AudioSeal100.0100.058.60.0100.083.452.2100.0
SSTMark (Ours)91.091.690.088.389.390.289.391.3
TPR@FPR=0.1%
WavMark100.08.98.08.098.19.30.0100.0
Timbre100.044.15.91.3100.0100.087.6100.0
AudioSeal100.0100.038.00.0100.051.831.6100.0
SSTMark (Ours)84.783.883.076.884.185.684.685.2

表4报告了在 MP3、量化、SoundStream、Opus 和 EnCodec 等压缩攻击下的真实正例率(TPR)。

表4. 压缩和神经编解码器编辑下的水印鲁棒性,报告为 TPR@FPR (%)。检测阈值首先在干净无水印语音上校准以满足1%和0.1%的目标FPR,然后固定用于所有评估条件。No-atk 表示未受任何攻击的原始水印语音。表格报告了每种攻击条件下水印语音的相应真实正例率 (TPR)。越高表示鲁棒性越好。每种条件下,最佳结果加粗,次佳结果下划线。

方法No-atkMP3 32 kbpsMP3 16 kbps量化 16 bits量化 4 bitsSoundStream 16量化器SoundStream 4量化器Opus 48 kbpsOpus 16 kbpsEncodec 24 kHz平均
TPR@FPR=1%
AudiowMark100.0100.00.0100.096.60.00.0100.0100.00.055.2
WavMark100.099.70.0100.017.50.71.32.51.98.025.7
Timbre100.099.3100.099.83.23.23.2100.0100.052.173.1
AudioSeal100.0100.099.8100.0100.031.832.20.00.199.762.6
SSTMark (Ours)91.089.688.990.290.490.288.990.691.490.290.0
TPR@FPR=0.1%
WavMark100.099.60.0100.08.30.20.30.60.53.523.7
Timbre100.081.3100.097.70.70.70.7100.0100.018.466.5
AudioSeal100.0100.090.2100.0100.09.38.70.00.097.056.1
SSTMark (Ours)84.784.080.583.881.481.379.784.485.282.882.6

进一步使用 HopSkipJumpAttack (HSJA) 评估对抗性水印移除攻击的鲁棒性。表5比较了 SSTMark 和 AudioSeal 在不同查询预算下成功对抗样本的保真度指标。

表5. HopSkipJumpAttack (HSJA) 在不同查询预算下生成的对抗样本的保真度评估,指标为 PESQ、SI-SNR 和 ViSQOL。更高的值表示攻击者可以在更少的感知失真下抑制水印检测,反之亦然。

方法查询预算PESQSI-SNRViSQOL
SSTMark (Ours)1001.1422.6881.652
3001.2524.6191.797
5001.2354.1321.785
AudioSeal1004.08848.4204.696
3004.36555.5114.726
5004.41659.4054.756

SSTMark 在所有查询预算下均表现出比 AudioSeal 低得多的 PESQ、SI-SNR 和 ViSQOL 分数。这意味着,为了成功移除 SSTMark 的水印,攻击者必须引入更大的信号失真,表明 SSTMark 具有更强的对抗鲁棒性。

附录D通过替换核心的 STT 和 TTS 模块,研究了 SSTMark 框架的通用性。

将 TTS 模型从 CosyVoice 替换为 F5-TTS 后,SSTMark 的鲁棒性结果如表6和表7所示。

表6. SSTMark 中 TTS 主干网络的消融研究:在信号处理编辑下的水印鲁棒性,报告为 TPR@FPR (%)。对于 SSTMark,原始 TTS 模型 CosyVoice 被替换为 F5-TTS。

方法No-atk高斯噪声低通滤波高通滤波速度扰动平滑回声平均
10 dB5 dB0 dB1000 Hz500 Hz250 Hz1000 Hz
TPR@FPR=1%
AudiowMark100.00.00.00.0100.0100.0100.0100.0
WavMark100.017.016.215.499.417.90.0100.0
Timbre100.072.622.94.1100.0100.098.7100.0
AudioSeal100.0100.058.60.0100.083.452.2100.0
SSTMark (Ours)85.986.584.280.284.084.096.185.6
TPR@FPR=0.1%
WavMark100.08.98.08.098.19.30.0100.0
Timbre100.044.15.91.3100.0100.087.6100.0
AudioSeal100.0100.038.00.0100.051.831.6100.0
SSTMark (Ours)77.173.873.268.475.875.378.878.3

表7. SSTMark 中 TTS 主干网络的消融研究:在压缩和神经编解码器编辑下的水印鲁棒性,报告为 TPR@FPR (%)。对于 SSTMark,原始 TTS 模型 CosyVoice 被替换为 F5-TTS。

方法No-atkMP3 32 kbpsMP3 16 kbps量化 16 bits量化 4 bitsSoundStream 16量化器SoundStream 4量化器Opus 48 kbpsOpus 16 kbpsEncodec 24 kHz平均
TPR@FPR=1%
AudiowMark100.0100.00.0100.096.60.00.0100.0100.00.055.2
WavMark100.099.70.0100.017.50.71.32.51.98.025.7
Timbre100.099.3100.099.83.23.23.2100.0100.052.173.1
AudioSeal100.0100.099.8100.0100.031.832.20.00.199.762.6
SSTMark (Ours)85.986.080.684.682.681.081.686.285.482.583.4
TPR@FPR=0.1%
WavMark100.099.60.0100.08.30.20.30.60.53.523.7
Timbre100.081.3100.097.70.70.70.7100.0100.018.466.5
AudioSeal100.0100.090.2100.0100.09.38.70.00.097.056.1
SSTMark (Ours)77.176.269.078.969.170.272.679.876.471.773.8

将 STT 模型从 Whisper 替换为 Canary-1B-v2 后,SSTMark 的鲁棒性结果如表8和表9所示。

表8. SSTMark 中 STT 主干网络的消融研究:在信号处理编辑下的水印鲁棒性,报告为 TPR@FPR (%)。对于 SSTMark,原始 STT 模型 Whisper 被替换为 Canary-1B-v2。

方法No-atk高斯噪声低通滤波高通滤波速度扰动平滑回声平均
10 dB5 dB0 dB1000 Hz500 Hz250 Hz1000 Hz
TPR@FPR=1%
AudiowMark100.00.00.00.0100.0100.0100.0100.0
WavMark100.017.016.215.499.417.90.0100.0
Timbre100.072.622.94.1100.0100.098.7100.0
AudioSeal100.0100.058.60.0100.083.452.2100.0
SSTMark (Ours)86.088.787.383.586.586.186.585.8
TPR@FPR=0.1%
WavMark100.08.98.08.098.19.30.0100.0
Timbre100.044.15.91.3100.0100.087.6100.0
AudioSeal100.0100.038.00.0100.051.831.6100.0
SSTMark (Ours)75.678.574.667.877.075.975.774.8

表9. SSTMark 中 STT 主干网络的消融研究:在压缩和神经编解码器编辑下的水印鲁棒性,报告为 TPR@FPR (%)。对于 SSTMark,原始 STT 模型 Whisper 被替换为 Canary-1B-v2。

方法No-atkMP3 32 kbpsMP3 16 kbps量化 16 bits量化 4 bitsSoundStream 16量化器SoundStream 4量化器Opus 48 kbpsOpus 16 kbpsEncodec 24 kHz平均
TPR@FPR=1%
AudiowMark100.0100.00.0100.096.60.00.0100.0100.00.055.2
WavMark100.099.70.0100.017.50.71.32.51.98.025.7
Timbre100.099.3100.099.83.23.23.2100.0100.052.173.1
AudioSeal100.0100.099.8100.0100.031.832.20.00.199.762.6
SSTMark (Ours)86.084.585.184.983.584.484.385.283.483.984.4
TPR@FPR=0.1%
WavMark100.099.60.0100.08.30.20.30.60.53.523.7
Timbre100.081.3100.097.70.70.70.7100.0100.018.466.5
AudioSeal100.0100.090.2100.0100.09.38.70.00.097.056.1
SSTMark (Ours)75.674.473.674.272.274.874.874.973.273.674.0

关键结论

综合实验结果,可以得出以下关键结论:

  1. 最强的平均鲁棒性:在 AudioMarkBench 的两种误报率(FPR=1% 和 0.1%)下,SSTMark 在信号处理编辑和压缩编辑中均取得了最高的平均真实正例率(TPR)。具体而言,在 FPR=1% 时,其平均 TPR 分别为 90.2% 和 90.0%,显著优于最优信号级基线 Timbre(分别为 85.6% 和 73.1%),证明了语义级水印在抵御多样化后处理攻击方面的优越稳定性。

  2. 对严重攻击的抵抗力:SSTMark 在面对强高斯噪声(如 0 dB SNR)和神经编解码器(如 SoundStream、EnCodec)等严重攻击时,其检测率下降有限,远优于部分在特定攻击下性能崩溃的基线方法。这表明其核心优势在于避免“灾难性失效”,而非在每种单一条件下都取得最佳。

  3. 更强的对抗鲁棒性:在 HopSkipJumpAttack 对抗攻击下,为移除 SSTMark 的水印,攻击者必须引入显著更大的信号失真(表现为更低的 PESQ、SI-SNR 和 ViSQOL 分数),这表明其水印更难被自适应攻击移除。

  4. 保真度权衡:SSTMark 在说话人相似度上略低于信号级方法,但通过调整词级相似度阈值 τ_word,可以在水印强度和文本保真度(如 BLEU 分数)之间进行灵活权衡。默认配置 τ_word=0.7 在两者间取得了良好平衡。

  5. 框架的通用性:消融实验表明,将 SSTMark 框架中的 TTS 模型(CosyVoice → F5-TTS)或 STT 模型(Whisper → Canary-1B-v2)替换为其他模型后,其平均鲁棒性 TPR 虽然略有下降,但仍远高于多数基线方法,证明了该语义级水印框架不依赖于特定模型,具备良好的通用性和实用性。

🔬 细节详述

  • 训练数据:论文未提及水印模块本身的训练。框架依赖的预训练模型:语音生成使用SpeechGPT;ASR使用Whisper Large-v3;TTS使用CosyVoice。评估数据集使用LibriSpeech train-clean-100作为提示来源。
  • 损失函数:未说明。框架是免训练的。
  • 训练策略:未说明。框架是免训练的。
  • 关键超参数:文本水印模块的关键超参数是句子级相似度阈值τ_sent=0.83(固定)和词级相似度阈值τ_word(用于控制水印强度,默认0.7)。文本长度限制为200个token。
  • 训练硬件:未说明。推理在NVIDIA Tesla V100-SXM2-32GB GPU上进行。
  • 推理细节:STT和TTS模型使用默认解码设置。输入音频重采样至16kHz。
  • 正则化或稳定训练技巧:未说明。

⚖️ 评分理由

  • 创新性 (1.5/2):论文创新性地提出了语义级语音水印范式,通过将水印载体从脆弱的信号层绑定到相对稳定的语义内容(文本)上,为抵御信号失真提供了新思路。同时,该框架集成了预生成、水印注入和检测的完整流水线,并引入了密钥机制,是完整的新系统实现。

  • 技术严谨性 (1.2/1.5):技术设计逻辑严密。键控二进制编码、基于语义相似度的同义词替换以及基于z-检验的统计检测框架均有清晰的数学定义和公式描述(见公式1-11)。流水线设计明确,模块化设计使得核心外部模型(STT/TTS)可被替换(附录D),展示了框架的通用性。

  • 实验充分性 (1.2/1.5):实验评估全面。在AudioMarkBench基准上,评估了保真度、信号处理与压缩攻击下的鲁棒性、对抗攻击抵抗力(表1-5)。进行了详细的阈值敏感性分析(表2)和核心模型的消融研究(表6-9)。不足在于所有评估均使用SpeechGPT作为唯一生成器,未验证在其他生成模型上的泛化性,且未评估对语义攻击(如转述)的鲁棒性。

  • 清晰度 (0.8/1):论文结构清晰,方法描述详尽,配有算法伪代码(附录A)和详细的攻击设置说明(附录C)。图表展示充分。然而,对部分关键设计选择(如为何选择0.83作为句子级相似度阈值)的动机讨论可以更深入。

  • 影响力 (1.1/1.5):该工作为语音水印领域提供了一个全新的、有前景的语义级研究方向,特别是在应对神经编解码器压缩等常见攻击时表现出强鲁棒性。但其对核心外部模型(ASR/TTS)的严重依赖,以及未探讨多比特水印容量,限制了其作为通用溯源工具的即时影响力。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):论文提供了部分复现材料:详细的算法伪代码、关键超参数(如τ_word, τ_sent)和评估设置。然而,缺失了训练数据(训练免框架本身无,但涉及的外部模型)、损失函数、训练策略、关键训练/推理硬件配置等细节([A_METHOD] 中的细节详述部分),使得完全复现存在障碍。

  • 工程/实践价值 (0.4/1.5):系统设计具有实践价值,采用免训练方式降低了实现复杂度,模块化架构便于组件替换和升级。然而,其严重依赖外部的ASR和TTS模型,引入了额外的延迟、复杂性和潜在的单点故障([A_LIMITS]),这在实际部署中是显著的工程挑战。

🚨 局限与问题

论文明确承认的局限:

  1. 对短语音的适用性不足:作者在结论中明确指出,需要进一步研究以将框架扩展到短语音句并改善其鲁棒性和检测性能。
  2. 依赖外部模型:框架的性能受限于所使用的STT和TTS模型的准确性。

审稿人发现的潜在问题:

  1. 基础检测率(No-atk TPR)偏低:在FPR=1%下,SSTMark的初始TPR仅为91.0%,而多个信号级方法在无攻击时达到100.0%。这意味着在无攻击的“理想”情况下,该方法的漏检率相对较高,其优势完全体现在对抗攻击后的稳定性上。这可能限制了其在需要高置信度初始检测场景中的应用。
  2. 攻击模型未覆盖语义攻击:评估仅考虑了信号处理和压缩攻击。一个更严峻的威胁是针对语义的攻击,例如使用另一个ASR-TTS系统对水印语音进行“重述”(paraphrase)。这类攻击可能会直接破坏文本层面的水印证据,而论文未讨论此点,也未评估其对此类攻击的鲁棒性,这是一个重大的安全漏洞。
  3. 评估的片面性:所有实验使用SpeechGPT作为唯一的声音生成器。未测试在端到端语音语言模型(如AudioPaLM、VALL-E)直接生成语音的场景下,该后处理框架的适用性和效果。
  4. 水印的容量和可变性未探讨:论文主要关注二元水印检测(有/无)。作为溯源工具,通常需要嵌入多比特信息(如模型ID、生成时间)。当前基于统计偏差的方法是否支持、以及如何支持多比特水印嵌入和可靠提取,是其走向实用的关键,但论文未涉及。
  5. 对副语言特征的影响:文本改写和语音重合成的过程很可能会改变原始语音的韵律、语调、情感等副语言特征,这可能在需要高度保真的应用(如播客、有声读物)中不可接受。论文仅通过说话人相似度和FAD评估,未对这些方面进行深入分析。

← 返回 2026-07-21 语音/音乐/音频论文速递