CRAW: Codec Robust Audio Watermarking

📄 被编解码器洗掉的水印:CRAW 如何把鲁棒性藏进听不见的地方 英文题目:CRAW: Codec Robust Audio Watermarking 一句话:针对神经编解码器与降噪重合成几乎清零现有音频水印的问题,CRAW 以加宽失真训练打底、注意力池化与感知掩膜回收音质、重复码补回容量,在 FACodec 上达到 0.974 检测 F1 而 PESQ 保持 3.990,代价是约 150 ms 推理延迟与 TiCodec 短板。 标签:#音频水印 | #对抗训练 | #语音编码 | #鲁棒性 评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5 👥 作者与机构 David Chernin:机构信息未在 arXiv HTML 中可靠披露 Ethan Fetaya:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把失真池加宽、池化改注意力、推理加掩膜再用纠错码兜底的四件套分工清晰,对神经编解码器碾压式提升是真贡献。但掩膜依赖可微 PESQ 梯度且只在推理嫁接,训练推理不一致味道很重,最难的 TiCodec 仍是全场最低点,SI-SNR 与 STOI 也弱于最优基线,离真正透明部署还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1267 words

A Training-Free Proactive Defense Against Partial Speech Manipulation via Self-Embedding Steganography

📄 别让检测器猜伪迹:先把原声的压缩记忆藏回去 英文题目:A Training-Free Proactive Defense Against Partial Speech Manipulation via Self-Embedding Steganography 一句话:这篇论文的可证伪判断是:若发布端提前把原声的紧凑表示嵌回波形,局部换词会在收到波形与自重建之间留下可测的结构差异;若这一差异在受控攻击外消失,方案的主动优势也随之消失。 标签:#语音伪造检测 #音频水印 #语音编码 #端到端 评分:6.5/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 💬 毒舌点评 这篇文章最扎实的优点,是把主动认证拆成可读的数据流,而不是把“深伪检测”空喊成单个分类器:SNAC 生成参照,重复 LSB 留住局部破坏后的 payload,DTW 再量化参照重建与收到波形的失配。表 1 把 1 词、2 词与 5 个重合成器摆在同一 EER 口径下,因而受控协议内的优势确有可核对的证据。 但训练自由绝非免费午餐。论文没有报告 stego 音频不可感知性、编码质量、端到端时延、吞吐量或真实链路对 LSB 的影响,也没有让攻击者专门破坏 payload;短于 0.1 s 的 EER 超过 20% 更说明极稀疏替换仍是边界。因此它是固定词替换中的补位方案,应被看作尚待部署压力测试的认证概念验证。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 723 words

Combining Self-Embedding Audio Watermarking with Ultra-Low-Bitrate Neural Codecs

📄 想找回被替换的原话,先接受水印不能再像哈希那样精确 英文题目:Combining Self-Embedding Audio Watermarking with Ultra-Low-Bitrate Neural Codecs 一句话:论文把原语音的超低码率表示重复嵌入自身,用自重建与接收音频的 DTW 失配同时做检测、定位和近似恢复;它因此以理想条件下不完美的鉴别能力,交换了哈希方案所缺的内容找回能力。 标签:#音频水印 #语音伪造检测 #语音编码 #鲁棒性 评分:6.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 💬 毒舌点评 这篇论文最扎实的地方,是它没有拿“水印能检测”掩盖恢复代价:codec representation 的重复写入和 self-reconstruction 让内容找回、检测与定位共享可检查的数据流。完整 Table II 也没有把 TAAE 的差表现藏掉,反而让 codec reconstruction fidelity 成为可研究的瓶颈,而不是用零 bit error 代替最终能力。 但冷水也必须泼足:理想信道下的漂亮闭环还没有经历重编码、噪声、平台转码或真实设备延迟。尤其 deletion 的 AUC score 只有 0.661,而 hash baseline 的上界来自根本不提供恢复的机制;现阶段它是受控的恢复—鉴别交换实验,不是已可部署的内容完整性基础设施。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 672 words

On the Robustness of Audio Deepfake Detection under Audio Watermarking

📄 On the Robustness of Audio Deepfake Detection under Audio Watermarking 标签:#音频伪造检测 #音频水印 #鲁棒性 #模型评估 7.7/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #音频水印 | #鲁棒性 #模型评估 | arxiv 👥 作者与机构 第一作者:Zi Qian Yong(School of Information Technology, Monash University, Malaysia campus) 通讯作者:正文未明确标注通讯作者 作者列表:Zi Qian Yong、Ajinkya Kulkarni、Julia K. Lau、Hwa Hui Tew、Shu-Min Leong、Raphaël C.-W. Phan、Sébastien Marcel(机构:School of Information Technology, Monash University, Malaysia campus;Idiap Research Institute, Switzerland) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 763 words

AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

📄 AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS 标签:#音频水印 #生成模型 #CNN #鲁棒性 7.9/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频水印 | #生成模型 | #CNN #鲁棒性 | arxiv 👥 作者与机构 第一作者:Timothy Tin-Long Tse(National Research Council Canada,加拿大) 通讯作者:正文未明确标注 作者列表:Timothy Tin-Long Tse、Jian Zhu、Aidan Pine、Mengzhe Geng(机构:National Research Council Canada,加拿大;University of British Columbia,加拿大) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 430 words

How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks

📄 How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks 标签:#音频水印 #鲁棒性 #基准测试 7.6/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频水印 | #鲁棒性 | #基准测试 | arxiv 👥 作者与机构 第一作者:Likhith Kumara(Indian Institute of Technology Madras, Chennai, India) 通讯作者:未说明(论文仅有一名作者,未标注通讯作者) 作者列表:Likhith Kumara(Indian Institute of Technology Madras, Chennai, India) 💡 毒舌点评 亮点在于把“先诊断后攻击”做成了一套便宜、可解释、训练无关的结构探针,并在十种音频水印方案上给出了自洽的脆弱/鲁棒分层;但攻击本身仍是已有扰动类的复用,且同步攻击因缺少有效质量指标被整体回避,使“how fragile”的答案对同步失真场景和部分低质量嵌入场景仍不完整。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 720 words

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness

📄 Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness 标签:#音频水印 #音频编码 #鲁棒性 #音频理解 #Transformer 6.4/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频水印 | #音频编码 | #鲁棒性 #音频理解 | arxiv 👥 作者与机构 第一作者:Zi Hu(University of Warwick, UK) 通讯作者:Ming Li(Zhejiang University-UIUC Institute, China;University of Illinois Urbana-Champaign, USA)、Carsten Maple(University of Warwick, UK) 作者列表:Zi Hu(University of Warwick, UK)、Houmin Sun(University of Warwick, UK)、Linxi Li(未说明)、Yechen Wang(未说明)、Liwei Jin(未说明)、Carsten Maple(University of Warwick, UK)、Ming Li(Zhejiang University-UIUC Institute, China;University of Illinois Urbana-Champaign, USA) 💡 毒舌点评 本文精准切中了神经编解码器时代音频水印的核心痛点,提出将嵌入点从波形表面移至连续潜空间内部,提供了有价值的探索方向,实验设计和权衡分析扎实。然而,论文的结论过于保守,仅停留在对一种特定嵌入路径的“调查”和“表征”,未能提出一个在通用性上超越AudioSeal的强基线。其核心声明“潜空间嵌入能减少与编解码器变换的失配”缺乏与强基线的直接主实验对比来验证。此外,论文完全回避了将水印嵌入离散码本(RVQ)这一更贴近真实编解码器核心的难题,使得其研究的实际应用价值打了折扣。 ...

2026-07-24 · 更新于 2026-09-04 · 3 min · 440 words

SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

📄 SSTMark: Robust Training-Free Semantic-Level Speech Watermarking 标签:#音频水印 #端到端 #语音合成 #语音识别 #音频理解 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.4/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频水印 | #端到端 | #语音合成 #语音识别 | arxiv 👥 作者与机构 第一作者:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC) 通讯作者:未说明 作者列表:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC), Jun-Cheng Chen (CITI, Academia Sinica, Taiwan, ROC), Chun-Shien Lu (IIS, Academia Sinica, Taiwan, ROC) 💡 毒舌点评 亮点在于将水印载体从脆弱的信号层提升到相对稳定的语义层,概念新颖且有洞察力,在AudioMarkBench的多种攻击下展现出极具说服力的平均鲁棒性优势,特别是在面对神经编解码器压缩时表现突出。短板同样明显:该方法严重依赖外部ASR和TTS模型,引入了额外的复杂性、延迟和潜在的单点故障;且基础检测率(No-atk TPR)低于一些信号级方法,表明其在“无攻击”场景下并非最优;此外,对语义攻击(如转述)的脆弱性未被评估,且未讨论多比特水印嵌入能力,限制了其作为通用溯源工具的潜力。 ...

2026-07-21 · 更新于 2026-09-04 · 8 min · 1502 words

MusicMark: A Robust Generative Watermarking Framework for Music Generation

📄 MusicMark: A Robust Generative Watermarking Framework for Music Generation 标签:#音频水印 #扩散模型 #音乐生成 #鲁棒性 #音频理解 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频水印 | #扩散模型 | #音乐生成 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Seohwan Yun(高丽大学人工智能系) 通讯作者:Sungwoong Kim(高丽大学人工智能系) 作者列表:Seohwan Yun(高丽大学人工智能系)、Jeeyoung Yun(高丽大学人工智能系)、Yongjin Kim(高丽大学人工智能系)、Juyeon Lee(仁荷大学计算机工程系)、Sungwoong Kim(高丽大学人工智能系) 💡 毒舌点评 论文瞄准了AI生成音乐版权保护的真实痛点,并提出了一套在生成阶段就深度耦合水印的完整框架,其在神经网络编解码器重合成攻击下的鲁棒性提升是显著且令人信服的。然而,论文在方法创新上更多是“组合式创新”——将成熟的生成式水印思路(如在文本生成领域)迁移到复杂的音乐生成扩散模型上,并辅以巧妙的工程设计;同时,论文声称的“第一个生成式音乐水印框架”可能忽略了某些未被充分引用的相关工作,且未开源代码与模型的做法严重削弱了其影响力与可验证性。此外,评估中对“翻唱”攻击的定义与主流理解存在偏差,且评估数据均来自AI生成平台,其结论对真实世界音乐的泛化能力存疑。 ...

2026-07-14 · 更新于 2026-09-04 · 8 min · 1524 words

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

📄 Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio #音频水印 #自回归模型 #鲁棒性 #无监督学习 #理论分析 7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7/10 | 前50% | #音频水印 | #自回归模型 | #鲁棒性 #无监督学习 | arxiv 👥 作者与机构 第一作者:Georgios Milis(马里兰大学帕克分校计算机科学系) 通讯作者:Heng Huang(马里兰大学帕克分校计算机科学系,heng@umd.edu) 作者列表:Georgios Milis、Yubin Qin、Yihan Wu、Heng Huang(均来自马里兰大学帕克分校计算机科学系) 💡 毒舌点评 用图社区发现来减轻重标记化误差的思路确实精简,将水印检测提升了好几个数量级,且全程无需梯度,黑盒友好。但对时间篡改(裁剪、变速)几乎束手无策,且音乐生成任务下 FAD 明显劣于无扰动基线;实验缺少与主流后置水印的直接对标,使“SOTA”声明缺少横向参照。 ...

2026-07-04 · 更新于 2026-09-04 · 6 min · 1087 words