DuraMark: Duration-Embedded Watermarking in LLM-based TTS
📄 DuraMark: Duration-Embedded Watermarking in LLM-based TTS #生成模型 8.7/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.7/10 | 前25% | #生成模型 | #生成模型 | arxiv 👥 作者与机构 第一作者:Zhenwei Mou (zwmu@mail.ustc.edu.cn) 通讯作者:Liping Chen (lipchen@ustc.edu.cn) 作者列表:Zhenwei Mou, Weili Jiang, Liping Chen, Zhen-Hua Ling, Kong Aik Lee, Kai Gao, Boyu Zhao 机构: University of Science and Technology of China, China Institute of Forensic Science, Ministry of Public Security, China The Hong Kong Polytechnic University, China 注:论文明确指出通讯作者为Liping Chen。 💡 毒舌点评 这篇论文抓住了LLM-TTS时代水印安全性的核心痛点——信号级水印在面对神经网络重合成攻击时的脆弱性。思路清晰,将水印信息从脆弱的信号层面提升到相对稳定的语义/信息层面(时长),这是一个聪明的避实击虚策略。论文的实验部分非常扎实,对生成式攻击的鲁棒性优势展示得很有说服力。但它的“信息级”水印本质上是依赖一个极其精细且脆弱的TTS生成流程来“硬编码”信息,一旦攻击者对生成过程进行任何形式的微调或插件式干预,水印的稳定性可能就会崩塌。此外,盲检测场景对ASR的强依赖,在现实世界的对抗中可能成为一个致命弱点。论文在讨论局限性时显得有些轻描淡写,尤其是关于时长编辑对韵律和自然度影响的讨论,这对于一个以“信息级”操作为核心的方法而言,其代价和边界本应被更深入地剖析。总体而言,这是一篇方法扎实、实验充分的强工作,但在对抗设计的深度和方法普适性的论证上还有提升空间。 ...