DuraMark: Duration-Embedded Watermarking in LLM-based TTS

📄 DuraMark: Duration-Embedded Watermarking in LLM-based TTS #生成模型 8.7/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.7/10 | 前25% | #生成模型 | #生成模型 | arxiv 👥 作者与机构 第一作者:Zhenwei Mou (zwmu@mail.ustc.edu.cn) 通讯作者:Liping Chen (lipchen@ustc.edu.cn) 作者列表:Zhenwei Mou, Weili Jiang, Liping Chen, Zhen-Hua Ling, Kong Aik Lee, Kai Gao, Boyu Zhao 机构: University of Science and Technology of China, China Institute of Forensic Science, Ministry of Public Security, China The Hong Kong Polytechnic University, China 注:论文明确指出通讯作者为Liping Chen。 💡 毒舌点评 这篇论文抓住了LLM-TTS时代水印安全性的核心痛点——信号级水印在面对神经网络重合成攻击时的脆弱性。思路清晰,将水印信息从脆弱的信号层面提升到相对稳定的语义/信息层面(时长),这是一个聪明的避实击虚策略。论文的实验部分非常扎实,对生成式攻击的鲁棒性优势展示得很有说服力。但它的“信息级”水印本质上是依赖一个极其精细且脆弱的TTS生成流程来“硬编码”信息,一旦攻击者对生成过程进行任何形式的微调或插件式干预,水印的稳定性可能就会崩塌。此外,盲检测场景对ASR的强依赖,在现实世界的对抗中可能成为一个致命弱点。论文在讨论局限性时显得有些轻描淡写,尤其是关于时长编辑对韵律和自然度影响的讨论,这对于一个以“信息级”操作为核心的方法而言,其代价和边界本应被更深入地剖析。总体而言,这是一篇方法扎实、实验充分的强工作,但在对抗设计的深度和方法普适性的论证上还有提升空间。 ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 517 words

Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

📄 Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity #语音合成 #大语言模型 7.6/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.7/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #大语言模型 | arxiv 👥 作者与机构 作者: Zhenwei Mou (1, †), Liping Chen (1, †, 通信作者), Yajun Hu (2), Zhen-Hua Ling (1), Xin Fang (2), Jianqing Gao (2) 机构: 1. University of Science and Technology of China, Anhui, China; 2. iFLYTEK, Anhui, China. 资助信息: 该工作得到了国家重点研发计划项目2024YFE0217200、香港特区创新科技基金MHP/048/24以及中国国家自然科学基金(Grant 62506349和U23B2053)的部分支持。 💡 毒舌点评 这篇论文的动机是清晰的,指出了现有多数基于LLM的TTS方法在说话人相似度上的一个短板——风格/韵律的静态或隐式建模。提出的动态预测范式在思路上是正确的,且实验设计相对全面(主观+客观,情感+韵律,自有数据+开源模型对比)。然而,作为一篇寻求顶级会议认可的论文,其“新颖性”的边界值得商榷。动态条件生成本身在序列建模中并不新鲜,核心创新点在于将“已生成语音”作为“韵律预测”的一个额外条件输入,这是一个具体的技术改进,但离“范式突破”尚有距离。论文最大的软肋在于缺乏深度分析和理论支撑。例如,动态预测为何比静态预测好?是因为捕捉了更长程的依赖,还是因为避免了错误累积?文中未做任何分析。实验部分虽然全面,但有些结果(如AISHELL-3上偏好测试的微弱优势)显得说服力不足。此外,代码的可复现性依赖于第三方框架CosyVoice,这无疑增加了验证成本。总体而言,这是一篇扎实但缺乏令人眼前一亮洞察的“增量式”工作,在顶会激烈的竞争环境中,可能难以获得最高评价。 ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 535 words

EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

📄 EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning #音频问答 #语音识别 #音频事件检测 #音乐信息检索 #多模态模型 #大语言模型 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | #音频问答 | #语音识别 | #音频事件检测 #音乐信息检索 | arxiv 👥 作者与机构 作者:Siyuan Zhang, Jian Zong, Junyu Wang, Peiyuan Jiang, Jiahao Yan, Jingyu Zhang, Tianrui Wang, Xiaobao Wang, Longbiao Wang, Jianwu Dang 机构:School of Artificial Intelligence, Tianjin University, Tianjin, China 💡 毒舌点评 这篇文章提出了一个听起来很厉害的“证据链编排”框架来解决音频推理问题,思路清晰,系统设计也算完整。但作为一名顶会审稿人,我必须指出几个硬伤:首先,创新性有限,所谓的“证据整合”本质上是用另一个LLM(DeepSeek-V3)来摘要和过滤工具输出,这更像是工程上的Pipeline优化,而非原理上的突破。其次,整个框架严重依赖两个闭源的大型商业模型(DeepSeek-V3 和 Qwen-3-Omni-Instruct),这使得结果的独立性和可复现性大打折扣,更像是在为这些模型做能力演示。实验方面,只在一个基准(MMAR)上测试,且报告的提升幅度(+2.3%准确率,+4.3评分)在绝对值上并不算惊人,尤其是在没有与其他顶尖智能体方法(如文中提到的AudioRAG)进行直接对比的情况下。消融实验虽然做了,但“w/o Observation”和“w/o Evidence Integration”的巨大差距说明,脱离了特定的工具和外部LLM,这个框架本身可能非常脆弱。最后,代码完全未开源,这极大地限制了其在研究社区中的影响力和可复现性。总的来说,这是一个扎实的系统工程工作,但离顶会论文所要求的理论深度和实验说服力还有距离。 ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 616 words

Fast When, Careful Who: Dual-Process Multiparty Turn-Taking with Diffusion Augmentation

📄 Fast When, Careful Who: Dual-Process Multiparty Turn-Taking with Diffusion Augmentation #语音活动检测 #数据增强 #扩散模型 5.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 📝 5.9/10 | 前50% | #语音活动检测 | #数据增强 | #扩散模型 | arxiv 👥 作者与机构 Rutherford A. Patamia, Ming Liu, Wei Luo, Favour Ekong, Akan Cosgun; Deakin University, Griffith University. 💡 毒舌点评 这篇论文提出了一个听起来很“心理学”的双过程框架,解决的是多人对话这个真实的“战场”。想法不错,把“什么时候该说话”和“该谁说话”这两个难题拆开处理,符合工程直觉。扩散增强的点子也挺巧,不是瞎合成新样本,而是保持原标签的声学扰动。但问题也很明显:实验做得不够“硬”。在核心的多说话人场景下,居然没有和最新的多说话人VAP变体正面刚,只在两人设置里自娱自乐了一下,说服力打折扣。作者自己承认的局限性,比如依赖离线说话人名单、在快速交换区的错误分析不足,其实都很要命,但论文里也只是提了一嘴,没深入挖掘。整体感觉是框架新颖有余,但实验验证的深度和与最前沿的对比不足,像一个功能原型而非成熟的解决方案。 ...

2026-06-16 · 更新于 2026-07-31 · 2 min · 380 words

FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

📄 FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing #音频生成 #生成模型 9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 9/10 | 前25% | #音频生成 | #生成模型 | arxiv 👥 作者与机构 Yuxuan Jiang1, Mingyang Han1, Yusheng Dai1, Andong Wang1, Tianhong Zhou2, Jiaxin Ye1, Dongxiao Wang4, Haoxiang Shi5, Boyu Li1, Jun Song3, Cheng Yu2, Bo Zheng2, Weibei Dou1, Zehua Chen2, Jun Zhu1 1 Tsinghua University, China; 2 Alibaba Group, China; 3 Monash University, Australia; 4 Renmin University of China, China; 5 Fudan University, China ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 528 words

From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding

📄 From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding #语音识别 #大语言模型 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.7/10 | 前50% | #语音识别 | #大语言模型 | arxiv 👥 作者与机构 Che Hyun Lee, Heeseung Kim, Sungroh Yoon 机构: 1 ECE and 2 IPAI, Seoul National University, Seoul 08826, Korea 3 Department of AI, University of Seoul, Seoul 02504, Korea ...

2026-06-16 · 更新于 2026-07-31 · 1 min · 168 words

From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

📄 From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation #自监督学习 #数据增强 8.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 🔥 8.2/10 | 前25% | #自监督学习 | #自监督学习 | #数据增强 | arxiv 👥 作者与机构 Fengrui Liu (华东师范大学), Ruiyang Huang (东南大学), Qijian Zheng (复旦大学), Yuanfang Wang (上海交通大学), Feng Liu (上海交通大学) 💡 毒舌点评 这篇论文的idea足够“性感”,用程序化合成音频替代海量真实数据来预训练模型,既规避了数据隐私和版权问题,又提供了极高的可解释性——你的模型学到了频率、强度这些物理概念,这在黑箱般的深度学习里算是个难得的亮点。但“性感”不等于“完美”,实验部分虽然全面,却也暴露了合成数据与真实世界之间的那道鸿沟:语义复杂性缺失导致的混淆(脚步声vs.烟花声)是个硬伤,且长期训练后仍难敌BEATs这类在AudioSet上“泡大”的怪物。开源方面,只扔了个代码仓库链接,没给预训练权重,这就好比卖了个精美食谱但不提供关键酱料包,复现门槛不低。总体而言,它像一个精巧的概念验证,证明了“物理模拟”这条路能走通,但离真正撼动数据驱动范式的统治地位,还差不少火候。 ...

2026-06-16 · 更新于 2026-07-31 · 2 min · 303 words

Geometrically Constrained Decentralized Independent Vector Analysis for Distributed Microphone Arrays

📄 Geometrically Constrained Decentralized Independent Vector Analysis for Distributed Microphone Arrays #语音分离 #盲源分离 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | #语音分离 | #盲源分离 | arxiv 👥 作者与机构 论文标题:Geometrically Constrained Decentralized Independent Vector Analysis for Distributed Microphone Arrays 作者:Changda Chen, Yichen Yang, Wei Liu, Bing Zhu, Gongping Huang, Shoji Makino, Shuai Wang 机构:Waseda University (Japan), Northwestern Polytechnical University (China), Wuhan University (China), Nanjing University (Suzhou) (China) ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 474 words

Interpretable and Frugal Learning Systems Employing Multiresolution Pyramids and Volterra Kernels

📄 Interpretable and Frugal Learning Systems Employing Multiresolution Pyramids and Volterra Kernels 7.8/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.8/10 | 前25% | arxiv 👥 作者与机构 Kishore Kumar Tarafdar, Indian Institute of Technology Bombay, Department of Electrical Engineering. 💡 毒舌点评 这是一篇典型的“集大成”式博士论文,试图将多分辨率分析、Volterra系统、IIR滤波器、Wavelet/Shearlet Transformer等一系列经典信号处理理论“塞进”现代深度学习框架里。想法是好的,目标也是明确的——追求可解释和参数高效(“节俭”)。然而,问题在于它试图覆盖的领域太广(从大气反演到医学分割),导致每个部分的深度和实验说服力都不足。论文更像一个庞大而杂乱的工具箱展示,而不是一个针对特定难题的深刻、聚焦的解决方案。其最大的“卖点”——参数效率,虽然在特定反演任务上通过极端简化(如仅用几百参数)得以体现,但这更像是一个针对该特定数据分布的“特调”结果,而非具有普遍意义的突破。对于语音/音乐领域的读者而言,除了WaveletViT等模块可能作为通用组件借鉴外,其核心应用和大部分创新与自身领域距离较远,直接影响力有限。 📌 核心摘要 本论文的核心是构建一套基于经典信号处理理论的、可微分的深度学习算子库,并将其应用于大气遥感、纹理/音频分类和医学图像分割。主要创新点包括:1)在双正交基中推导了Volterra核的理论表示;2)实现了可训练的高维IIR滤波器;3)提出了两种新的多分辨率视觉Transformer:WaveletViT(利用DWT子带)和ShearViT(利用FDST剪切波子带)。这些算子被组合成具体模型,如用于大气反演的InVeRt模型(结合Volterra核与有理函数头),以及用于MRI分割的WaveNETR/ShearNETR编码器-解码器架构。论文强调这些方法通过引入显式的信号结构(尺度、方向、递归)来提升模型的可解释性和参数效率。 🔗 开源详情 代码:论文声称开发了22个Python库,但具体仓库链接未提供。仅有TFDWT、RamanujanFrame、MRILong、freeview被提及为已公开,但未给出明确的GitHub或PyPI链接。 模型权重:论文中未提及任何训练好的模型权重下载链接。 数据集:论文提及了IBSR V2.0、NFBS、ATLAS R2.0、DTD、ESC-20、MaSTr1325、SUIM、CamVid、DRIVE、HRF等公开数据集,但未提供统一的获取链接或处理脚本。 Demo:未提及在线演示链接。 复现材料:未提及详细的训练配置、超参数设置或检查点文件。 🏗️ 方法概述和架构 论文的方法论遵循一个“算子库构建 -> 算子组合 -> 任务验证”的路径。 ...

2026-06-16 · 更新于 2026-07-31 · 2 min · 250 words

Joycent: Diffusion-based Accent TTS without Accented Phone Prediction

📄 Joycent: Diffusion-based Accent TTS without Accented Phone Prediction #语音合成 #扩散模型 #自监督学习 #数据增强 6.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.8/10 | 前50% | #语音合成 | #自监督学习 | #扩散模型 #数据增强 | arxiv 👥 作者与机构 作者:Xintong Wang, Ye Wang。机构未明确提及。 💡 毒舌点评 这篇论文解决的是一个实际问题:如何更自然地合成带口音的语音,而不是依赖笨拙的两阶段文本转换。想法直接,用扩散模型和端到端的方式绕过口音音素预测,是个合理的思路。WhisAID的设计,特别是加入GRL来解耦说话人信息,显示了作者对问题本质(口音与身份纠缠)的理解。然而,论文的亮点主要集中在“做了这个事”和“在特定任务上比基线好”,而非带来了颠覆性的方法论创新。核心方法(扩散TTS + 条件注入)并非原创,创新主要在于针对口音TTS场景的特定组件整合和应用。实验上,只验证了新加坡华语这一个目标口音,严重限制了结论的普适性。作者自称“显著优于”,但基线选择(MacST依赖第三方GPT生成文本和商业API合成,CosyVoice3仅做了基础微调)使得比较的公平性和说服力打折扣。WhisAID提取的“口音嵌入”到底学到了什么,除了分类和相似度外,缺乏更深入的分析。总的来说,这是一篇扎实的“系统论文”或“应用论文”,但距离顶会所追求的突破性贡献还有距离。 📌 核心摘要 Joycent是一种基于扩散模型的口音语音合成框架,它绕过了传统方法中需要先预测口音音素序列的步骤。系统直接接收标准音素序列、一个说话人参考音频和一个目标口音参考音频,输出带有该目标口音的语音。其核心是两个关键组件:WhisAID(用于从参考音频中提取纯化的口音嵌入)和一个修改后的Grad-TTS文本编码器(通过CLN将口音和说话人信息注入语言表示)。实验表明,该方法在合成新加坡华语口音时,在口音相似度等关键指标上优于基于文本转换或指令的基线方法,同时保持了与基线相当的说话人相似度。 🔗 开源详情 代码:https://github.com/oshindow/Joycent-code 模型权重:论文中未提及单独发布的模型权重链接。预训练模型依赖包括Whisper、FACodec等。 数据集: Magichub Multi-Accents corpus: https://magichub.com/datasets/ (需从平台获取) Magichub-SG dataset: https://magichub.com/datasets/singaporean-chinese-conversational-speech-corpus (需从平台获取) AISHELL-3: 论文未提供链接,为公开数据集。 CSMSC: https://www.data-baker.com/open_source.html Demo:未提及在线演示链接。 复现材料:论文提供了详细的实验设置、超参数和训练步数,结合开源代码,基本可以复现主要实验。复现主要依赖论文描述、代码和公开的预训练模型/数据集。 🏗️ 方法概述和架构 Joycent的整体架构基于Grad-TTS,并包含两个主要部分:口音与说话人信息解耦提取模块(WhisAID)和融合这些信息的口音TTS生成模块(Joycent)。其流程如论文图1所示。 ...

2026-06-16 · 更新于 2026-07-31 · 3 min · 458 words