Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity
📄 Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity #语音合成 #大语言模型 7.6/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.7/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #大语言模型 | arxiv 👥 作者与机构 作者: Zhenwei Mou (1, †), Liping Chen (1, †, 通信作者), Yajun Hu (2), Zhen-Hua Ling (1), Xin Fang (2), Jianqing Gao (2) 机构: 1. University of Science and Technology of China, Anhui, China; 2. iFLYTEK, Anhui, China. 资助信息: 该工作得到了国家重点研发计划项目2024YFE0217200、香港特区创新科技基金MHP/048/24以及中国国家自然科学基金(Grant 62506349和U23B2053)的部分支持。 💡 毒舌点评 这篇论文的动机是清晰的,指出了现有多数基于LLM的TTS方法在说话人相似度上的一个短板——风格/韵律的静态或隐式建模。提出的动态预测范式在思路上是正确的,且实验设计相对全面(主观+客观,情感+韵律,自有数据+开源模型对比)。然而,作为一篇寻求顶级会议认可的论文,其“新颖性”的边界值得商榷。动态条件生成本身在序列建模中并不新鲜,核心创新点在于将“已生成语音”作为“韵律预测”的一个额外条件输入,这是一个具体的技术改进,但离“范式突破”尚有距离。论文最大的软肋在于缺乏深度分析和理论支撑。例如,动态预测为何比静态预测好?是因为捕捉了更长程的依赖,还是因为避免了错误累积?文中未做任何分析。实验部分虽然全面,但有些结果(如AISHELL-3上偏好测试的微弱优势)显得说服力不足。此外,代码的可复现性依赖于第三方框架CosyVoice,这无疑增加了验证成本。总体而言,这是一篇扎实但缺乏令人眼前一亮洞察的“增量式”工作,在顶会激烈的竞争环境中,可能难以获得最高评价。 ...