论文解读

把情绪当作首要优化目标:AffectCodec 如何在离散量化中留住情绪

针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10128 字 阅读 →
论文解读

没有对齐标注时,如何让笑声叹息出现在情感对的位置

Affectron 针对开放场景下非言语发声数据少且无对齐监督的问题,用解耦小语料上的情感驱动匹配与情感感知路由构造增广样本并微调 VoiceCraft 主干,报告显示非言语真实感与多样性提升而口语自然度基本保持,代价是重叠语音未建模且依赖伪标签与小规模干净语料。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
论文解读

听起来流利不等于可复用:三位朗读者的中库尔德语语音合成核查

该研究复核一篇中库尔德语语音合成公开释放,问题是论文、模型卡与文件三者是否一致,方法是逐项比对配置、评测与许可,最强证据是三系统合成分为 4.08、4.01、4.06 且与各自录音质量同序,主要代价是测试集未标记、识别器兼做转写与评分以及禁改许可限制了公开修正。

 · 更新于 2026-09-24 · 约 18 分钟 · 8871 字 阅读 →
论文解读

把指令翻译成可测量的声音特征:BatonVoice 的指挥家与乐团分工

针对可控语音合成中指令理解与语音生成耦合导致标注昂贵的问题,该文把外部大语言模型定为指挥家生成逐段音高能量音色数值计划、把 BatonTTS 定为乐团按计划合成,最强证据是 1.7B 模型在英文情感准确率 57.6% 并零样本迁移到中文 56.2%,代价是依赖外部大模型生成计划并引入约 20 秒级计划延迟与两阶段推理链条。

 · 更新于 2026-09-24 · 约 18 分钟 · 8791 字 阅读 →
论文解读

只会说还不够:复杂文本如何暴露低资源多语语音合成的系统性失效

该文针对泰语、越南语、斯瓦希里语和印尼语构造六类复杂文本诊断集,用内容一致性、语言一致性和生成稳定性三维指标比较 OmniVoice、VoxCPM2 和 MMS-TTS,发现数字日期与混写输入带来最集中的内容与时长失效,而轻量文本风险分与内容错误呈中等正相关但几乎不能预测语言混淆。

 · 更新于 2026-09-24 · 约 26 分钟 · 12570 字 阅读 →
论文解读

长语音不止读对字:SwanBench-Speech 如何拆开声学、语义与表现力来评测

针对长语音与对话生成的评测缺口,该工作构建 1101 样本、17 场景的 SwanBench-Speech 并提出 7 个解耦指标,用人类一致性验证支撑其发现的混响一致性与表现力层次短板,但高表现力场景与多说话人声场统一仍代价明显。

 · 更新于 2026-09-24 · 约 21 分钟 · 10134 字 阅读 →
论文解读

把人物引文单独切出来:以叙事切分做更可读的表现力语音合成

该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。

 · 更新于 2026-09-24 · 约 20 分钟 · 9568 字 阅读 →
论文解读

时长不只决定贴多少次:用受控微分方程让音素表示随时间演化

针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7997 字 阅读 →
论文解读

不成对也能对准发音:用对比模型找出关键语音 token 再加权优化

针对日语多音字读错且成对偏好样本稀少的问题,论文用两个对比语言模型估计 token 级重要性权重再做加权 KTO,在报告中将日语准确率从 0.668 提升到 0.958 并把可利用样本从 1.5K 扩大到 9K,代价是需要先训练两个对比模型约 10 分钟 8 卡 A100 的额外预计算。

 · 更新于 2026-09-24 · 约 19 分钟 · 9274 字 阅读 →
论文解读

把音色和韵律拆开再拼回去:DisCo-Speech 的两阶段解耦与独立控制

针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9379 字 阅读 →
论文解读

不训练也能加速语音扩散模型:先标出冗余再逐对校准

针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8816 字 阅读 →
论文解读

分开给音色和风格:FC-TTS 用两阶段管线约束解耦的边界

FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。

 · 更新于 2026-09-24 · 约 18 分钟 · 8837 字 阅读 →
论文解读

把说话声放进场景里:语音与环境为何要分流建模再对齐

针对带背景声的语音合成中可懂度与场景一致性难兼顾的问题,ImmersiveTTS 用双流扩散 Transformer 做联合注意力交互并以语音与音频双教师做表示对齐,在 25 步采样下取得更低词错率与更好音频保真度,代价是对双重引导强度敏感且训练依赖人工混合数据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10169 字 阅读 →
论文解读

不做离散量化:KALL-E 以逐帧分布预测实现低帧率连续语音合成

KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

一段话里换情绪又调语速:以后训练如何教会已有 TTS 听懂分段指令

针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。

 · 更新于 2026-09-24 · 约 15 分钟 · 7305 字 阅读 →
论文解读

不用人工偏好标注:用大音频语言模型反馈做连续自回归非言语发声的偏好优化

针对连续自回归语音模型没有显式序列似然而难以直接做直接偏好优化的问题,该工作用大音频语言模型自动构造同提示 chosen-rejected 对,并以拒绝采样微调冷启动加带监督锚的流匹配偏好优化做两阶段对齐,在 1600 句官方测试上把最终分从 73.96 提高到 75.80,而整体质量基本保持稳定。

 · 更新于 2026-09-24 · 约 21 分钟 · 10217 字 阅读 →
论文解读

高唤醒一用力就含糊:用矫正起点与动态引导拉住情感轨迹

针对尖叫哭喊等高唤醒合成中保字准就会丢情感、追情感就会念糊的矛盾,论文提出只改推理的情感矫正噪声先验与似然逆引导,在不重训下把 F5-TTS 词错率从 4.41% 降到 2.53% 并提升情感分,但纯度与截断仍需折中且不适用于非迭代架构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8940 字 阅读 →
论文解读

先松开参考音频的束缚,再用旋钮调风格:ReStyle-TTS 的相对连续控制

针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。

 · 更新于 2026-09-24 · 约 19 分钟 · 9443 字 阅读 →
论文解读

语义与声学分流:SAC 用双路量化兼顾可懂度与可重建性

针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8613 字 阅读 →
论文解读

先定情绪再说话:Self-EmoQ 把情绪当作可规划的动作

针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →