一段话里换情绪又调语速:以后训练如何教会已有 TTS 听懂分段指令
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
SLAP 针对语音中人口学、嗓音质量与健康属性难以零样本推断的问题,选择用大语言模型把异构元数据转写为自然语言描述再与语音做对比学习,最强证据是 38 个二分类任务上零样本平均 F1 达到 62.9%,代价是预训练数据仍不均衡且小测试集任务波动大。
针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。
针对前向加噪加反向去噪带来的旋律失真问题,论文用增量去噪分数直接在数据空间优化音频,并用个性化增量分数加分布偏移正则与时序对比损失引入用户自定义风格,报告显示在内容保持与偏好率上占优,但强风格迁移与原曲保持之间仍需权衡。
TART 把吉他音频转谱拆成音频转 MIDI、九类技巧分类、音频条件弦品指派和 MusicXML 生成四步,用 81.35% 的平均音频转 MIDI F50 与 71.8% 的弦品 Tab F1 实现零样本领先,代价是第一步误差会向后传播约 17.75 个百分点。
针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。
针对粗粒度标注刻画不了语速情感韵律时变的问题,论文用直接听音频写细粒度描述的 FCaps 数据与分两阶段做全局加细粒度对比学习的 CLSP 模型,在检索与人评一致性上报告更强证据,代价是仅英文与大规模算力依赖。
该研究在 13 种语言上比较 6 个系统的零样本意图分类,报告混合架构与强级联相当并更能缓解转写错误,而纯端到端明显落后,且多语言效果同时受大语言模型能力与语音编码器识别质量制约。
针对零样本语音克隆中对齐脆弱、时长不可控和长于训练则崩溃的问题,VoiceStar 用进度监控旋转位置编码与延续加提示混合训练实现时长控制与外推,最强证据是 40s-50s 外推下词错率 11.91 对 F5-TTS 的 52.44,代价是长上下文下说话人相似度略低与自回归推理慢。
针对阿拉伯语标准语与多方言零样本识别落差,论文用解码器提示、编码器加解码器前缀和 CTC 代理引导 n-best 重选三种免训练上下文接入,在十个条件下取得 MSA 相对 22.29% 等词错率下降,代价是首遍解码、检索与合成带来的额外延迟与对辅助信号质量的依赖。
针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。
论文用冻结语音基础模型做表示、图神经网络做已知生成器归因、近邻分支做未知检测并以置信度阈值分流,在 DiffSSD 上 Mamba-B 的联合配置取得 DEV 准确率 98.11% 与等错误率 2.33%,代价是仍依赖固定阈值且不对多个未知源做细粒度区分。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对零样本语音合成中误读、可听噪声与异常停顿导致的不稳定问题,论文用能同时输出错误时间范围、转写文本与整句质量分的 Vox-Evaluator 做局部遮罩重改与细粒度偏好优化,在 Seed-TTS 上把 F5-TTS 的字错率从 1.73% 降到 1.42%,代价是最多两轮迭代改写与偏好训练过久后奖励饱和回落。
HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。
IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。
针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。
M2M 只用英文文本训练 2 个线性层完成多语言到多模态的映射,在 XTD 上英文达到 94.9% 的 Recall@10 而 11 个语言平均为 89.5%,代价是生成保真度和超大检索库上的差距仍然存在。