只调时长就能学会重读吗:EmphTTS 用强化学习对齐时长预测器
针对词级重读控制难的问题,EmphTTS 冻结已微调的 F5-TTS 主体、只用带重读定位奖励的 GRPO 优化时长预测器,在 TinyStress-15k 上取得 StressLM F1 0.75 的最佳客观重读效果,但整体可懂度和说话人相似度仍明显低于大规模基线。
针对词级重读控制难的问题,EmphTTS 冻结已微调的 F5-TTS 主体、只用带重读定位奖励的 GRPO 优化时长预测器,在 TinyStress-15k 上取得 StressLM F1 0.75 的最佳客观重读效果,但整体可懂度和说话人相似度仍明显低于大规模基线。
针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。
针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。
针对多轮多模态对话中风格稀疏且易漂移说话人音色的问题,论文用显式风格指令拆开感知与合成,并用迭代拒绝采样与上下文偏好优化对齐生成器,在保持音色与可懂度的同时提升指令遵循与情境适配,但细粒度句内动态仍未解决。
该研究把固定零向量换成每个条件各学一个无条件嵌入,并在相同训练步数与数据下比较固定与可学习两种做法,最强证据是可学习基线在大引导权重下更稳定,代价是说话人保真提升时绝对质量分可能下降且需要分别调节两个权重。
针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。
CycleSpeech 以结构化声音档案为共享可验证目标,先联合监督微调再用 CycleGRPO 交替优化合成与理解,在中英文指令匹配上相对基座提升 4.50 和 10.06 个百分点,代价是需要 20,046 条对齐语料与多步采样奖励计算。
针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。
针对复杂风格指令一次合成难以兼顾音高、语速与情感的问题,该工作用同一大音频语言模型做草稿生成加文本批评加二次精修,并以组相对策略优化训练精修能力,在 InstructTTSEval 上精修输出相对零样本平均风格一致性提升约 6.5% 至 7.2%,代价是两遍推理与奖励建模依赖。
针对卢旺达语正字法省略声调与音节时长导致端到端合成语调难的问题,该工作用词素编码器加音素到词素交叉编码器替换 VITS 文本编码,在 10 千句可懂度与 21 人主观评测上提升自然度与语调,但以 169M 词素参数与训练时长增加为代价且对未见词素敏感。
针对级联对话中上游大模型流式输出与下游语音合成之间的非标准词歧义,StreamTN 用基于 Qwen3-0.6B 的双轨延迟架构做增量规范化,在 4 帧延迟下报告 Micro-F1 为 0.8937 并以 213 ms 的首包延迟换取流式可用性,代价是复杂数理化表达式仍明显更差且更大延迟才能继续提升精度。
该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。
COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。
针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。
针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。
针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。
针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …
针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。
针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。
针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。