论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

1. **问题**:现有基于离散token的TTS模型,其“粗到细”的生成范式主要体现在从语义token到声学token的转换,而对语音固有的时间动态(temporal dynamics)缺乏显式建模。 2. **方法核心**:提出Chain-of-Details (CoD)框架,将语音生成分解为多

 · 更新于 2026-09-24 · 约 9 分钟 · 4367 字 阅读 →