Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer
📄 Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer 标签:#语音合成 #提示学习 #大语言模型 #语音交互 #高效推理 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #提示学习 | #大语言模型 #语音交互 | arxiv 👥 作者与机构 第一作者:Shengfan Shen(所属机构:MiLM Plus, Xiaomi Inc., China 和 HNU – Hunan University,邮箱shenshengfan@hnu.edu.cn) 通讯作者:Shuai Wang(南京大学,邮箱shuaiwang@nju.edu.cn) 作者列表:Shengfan Shen(MiLM Plus, Xiaomi Inc. 和 HNU – Hunan University)、Di Wu(MiLM Plus, Xiaomi Inc.)、Xingchen Song(MiLM Plus, Xiaomi Inc.)、Dinghao Zhou(MiLM Plus, Xiaomi Inc.)、Pengyu Cheng(MiLM Plus, Xiaomi Inc.)、Sixiang Lyu(MiLM Plus, Xiaomi Inc.)、Jian Luan(MiLM Plus, Xiaomi Inc.)、Shuai Wang(南京大学)。其他作者(Di Wu 至 Jian Luan)所属机构均标注为 MiLM Plus, Xiaomi Inc., China。此外,作者列表前注明了 WeNet Open Source Community。 💡 毒舌点评 这篇论文将TTS的风格控制问题成功地简化为一个工程上可解的封闭集路由问题,并在工业界常用的TTS引擎上验证了其可行性和初步效果,工程实用价值突出。然而,其核心创新在于系统集成与问题重构,而非底层算法或模型上的突破;评估体系完全依赖教师模型生成的“真值”,且不开源任何核心组件,使得其学术贡献的可信度与可复现性大打折扣,更像是一个内部技术方案的初步报告。 ...