Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction
📄 从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生 英文题目:Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction 一句话:针对自回归语音合成中重音错位与停顿失当等局部韵律缺陷,LoopTTS 用 Filter-Judge-Refiner 三级离线闭环让 AudioLLM 先打分再开处方,并以约 42K 对比弱标签训练 Refiner 做指令引导重合成,在被判低分的约 7.9% 样本上把 MOS 从 3.2 左右拉回 4.1 以上,代价是仅对疑似缺陷样本生效且依赖闭源 AudioLLM 的弱标签质量。 标签:#语音合成 #自回归模型 #语音大模型 #指令微调 评分:7.0/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zeyang Song:National University of Singapore;Tencent Tianchi Liu:LIGHTSPEED Tianrui Wang:Nanyang Technological University Chenglin Xu:LIGHTSPEED Steven Y. Guo:Independent Researcher Haizhou Li:The Chinese University of Hong Kong, Shenzhen;Shenzhen Loop Area Institute 💬 毒舌点评 把 AudioLLM 从只会打分的裁判升级为能下处方的韵律医生,用约 42K 对比弱标签让 Refiner 学会听懂“重读这个词、在这里停顿”的指令,闭环思路在离线质检场景很务实。短板是闭环只在被 Judge 判为低分的约 7.9% 样本上生效,全量增益被大量已通过样本稀释,且 Gemini 标注的弱标签 F1 仅 0.673/0.532 却直接当真值训练,天花板明显受限于闭源模型的稳定性、成本与漂移风险。 ...