Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS
📄 一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合 英文题目:Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS 一句话:针对指令跟随 TTS 中多情感的时序演变与并发共存难题,HybridEmo 用有监督微调初始化再以样本感知路由的 GRPO 分别优化轨迹一致性与混合密度奖励,在 MultiEmo-Test 上提升轨迹正确性与混合强度且保持 WER 在 2% 以内,代价是奖励与评估同源且切分与锚点仍依赖近似假设。 标签:#语音合成 #强化学习 #语音克隆 #后训练 评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yan Zhou:机构信息未在 arXiv HTML 中可靠披露 Yun Hong:机构信息未在 arXiv HTML 中可靠披露 Yang Feng:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把多情感控制拆成时序轨迹与并发混合两类任务,并为其定制可区分的奖励路由与混合密度打分,问题定义清晰且奖励设计有针对性。短板是轨迹分段依赖文本长度等比切分、混合奖励依赖离线合成锚点与 emotion2vec 判别器,评估高度耦合于同一判别空间且人工偏好样本仅 80 次判断,证据闭环感偏重。 ...