把情绪当作首要优化目标:AffectCodec 如何在离散量化中留住情绪
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
Affectron 针对开放场景下非言语发声数据少且无对齐监督的问题,用解耦小语料上的情感驱动匹配与情感感知路由构造增广样本并微调 VoiceCraft 主干,报告显示非言语真实感与多样性提升而口语自然度基本保持,代价是重叠语音未建模且依赖伪标签与小规模干净语料。
该研究复核一篇中库尔德语语音合成公开释放,问题是论文、模型卡与文件三者是否一致,方法是逐项比对配置、评测与许可,最强证据是三系统合成分为 4.08、4.01、4.06 且与各自录音质量同序,主要代价是测试集未标记、识别器兼做转写与评分以及禁改许可限制了公开修正。
针对可控语音合成中指令理解与语音生成耦合导致标注昂贵的问题,该文把外部大语言模型定为指挥家生成逐段音高能量音色数值计划、把 BatonTTS 定为乐团按计划合成,最强证据是 1.7B 模型在英文情感准确率 57.6% 并零样本迁移到中文 56.2%,代价是依赖外部大模型生成计划并引入约 20 秒级计划延迟与两阶段推理链条。
该文针对泰语、越南语、斯瓦希里语和印尼语构造六类复杂文本诊断集,用内容一致性、语言一致性和生成稳定性三维指标比较 OmniVoice、VoxCPM2 和 MMS-TTS,发现数字日期与混写输入带来最集中的内容与时长失效,而轻量文本风险分与内容错误呈中等正相关但几乎不能预测语言混淆。
针对长语音与对话生成的评测缺口,该工作构建 1101 样本、17 场景的 SwanBench-Speech 并提出 7 个解耦指标,用人类一致性验证支撑其发现的混响一致性与表现力层次短板,但高表现力场景与多说话人声场统一仍代价明显。
该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。
针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。
针对日语多音字读错且成对偏好样本稀少的问题,论文用两个对比语言模型估计 token 级重要性权重再做加权 KTO,在报告中将日语准确率从 0.668 提升到 0.958 并把可利用样本从 1.5K 扩大到 9K,代价是需要先训练两个对比模型约 10 分钟 8 卡 A100 的额外预计算。
针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。
针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。
FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。
针对带背景声的语音合成中可懂度与场景一致性难兼顾的问题,ImmersiveTTS 用双流扩散 Transformer 做联合注意力交互并以语音与音频双教师做表示对齐,在 25 步采样下取得更低词错率与更好音频保真度,代价是对双重引导强度敏感且训练依赖人工混合数据。
KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对连续自回归语音模型没有显式序列似然而难以直接做直接偏好优化的问题,该工作用大音频语言模型自动构造同提示 chosen-rejected 对,并以拒绝采样微调冷启动加带监督锚的流匹配偏好优化做两阶段对齐,在 1600 句官方测试上把最终分从 73.96 提高到 75.80,而整体质量基本保持稳定。
针对尖叫哭喊等高唤醒合成中保字准就会丢情感、追情感就会念糊的矛盾,论文提出只改推理的情感矫正噪声先验与似然逆引导,在不重训下把 F5-TTS 词错率从 4.41% 降到 2.53% 并提升情感分,但纯度与截断仍需折中且不适用于非迭代架构。
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。
针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。