CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis
📄 CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis 标签:#语音合成 #扩散模型 #语音克隆 #自回归模型 #零样本 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #扩散模型 | #语音克隆 #自回归模型 | arxiv 👥 作者与机构 第一作者:Zhisheng Zheng(德克萨斯大学奥斯汀分校,由邮箱 zszheng@utexas.edu 确认) 通讯作者:未说明(论文正文未标注通讯作者;David Harwath 提供邮箱 harwath@utexas.edu,但未被明确指定为通讯作者) 作者列表:Zhisheng Zheng、Xiaohang Sun、Zhu Liu、Caren Chen、Rohith Kumar、Manoj Aggarwal、Gerard Medioni、David Harwath 机构信息:论文页脚标注两个单位——1. The University of Texas at Austin,2. Amazon;各作者与机构的对应关系未逐人标出。除上述两位由邮箱确认外,其余作者的机构归属无法确认。 💡 毒舌点评 把 DiTAR 的连续潜空间、CAM++ 声纹和逐音素韵律控制信号整合成一套可用的可控 TTS,工程上确实完整,0.6B 在零样本克隆上也略优于复现的 DiTAR。但“可控性”全程只拿对 GT 的 RMSE/MAE 说话,既没有验证对任意给定非 GT 目标韵律的跟随能力,也没有对 pitch/loudness 逐项消融,更没有控制效果的主观听感测试;0.1B 模型在零样本合成中 WER 明显退化也完全未解释。以顶会标准看,这只能证明“显式控制信号能降低与 GT 的声学误差”,还不足以支撑“用户可控表达性语音合成”的强声明。 ...