论文解读

只调时长就能学会重读吗:EmphTTS 用强化学习对齐时长预测器

针对词级重读控制难的问题,EmphTTS 冻结已微调的 F5-TTS 主体、只用带重读定位奖励的 GRPO 优化时长预测器,在 TinyStress-15k 上取得 StressLM F1 0.75 的最佳客观重读效果,但整体可懂度和说话人相似度仍明显低于大规模基线。

 · 约 20 分钟 · 9899 字 阅读 →
论文解读

不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘

针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。

 · 约 18 分钟 · 8712 字 阅读 →
论文解读

先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配

针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。

 · 约 18 分钟 · 8807 字 阅读 →
论文解读

把风格决策写成指令:Interactive TTS 如何拆开理解与发声

针对多轮多模态对话中风格稀疏且易漂移说话人音色的问题,论文用显式风格指令拆开感知与合成,并用迭代拒绝采样与上下文偏好优化对齐生成器,在保持音色与可懂度的同时提升指令遵循与情境适配,但细粒度句内动态仍未解决。

 · 约 11 分钟 · 5500 字 阅读 →
论文解读

把无条件分支换成可学习的向量:语音合成中更稳的引导基线

该研究把固定零向量换成每个条件各学一个无条件嵌入,并在相同训练步数与数据下比较固定与可学习两种做法,最强证据是可学习基线在大引导权重下更稳定,代价是说话人保真提升时绝对质量分可能下降且需要分别调节两个权重。

 · 约 21 分钟 · 10440 字 阅读 →
论文解读

从单句朗读到整场演戏:SceneTTS-Bench 如何量角色稳定、演技与节奏

针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。

 · 约 21 分钟 · 10476 字 阅读 →
论文解读

用可恢复的声音档案让合成与理解互相验算:CycleSpeech 的双向对齐

CycleSpeech 以结构化声音档案为共享可验证目标,先联合监督微调再用 CycleGRPO 交替优化合成与理解,在中英文指令匹配上相对基座提升 4.50 和 10.06 个百分点,代价是需要 20,046 条对齐语料与多步采样奖励计算。

 · 更新于 2026-09-24 · 约 22 分钟 · 10988 字 阅读 →
论文解读

俳句的停顿为何难念:HaikuS2S 用两段微调把 5-7-5 念出节奏

针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。

 · 更新于 2026-09-24 · 约 26 分钟 · 12802 字 阅读 →
论文解读

先说一遍再改一遍:让语音模型听见自己的草稿并真正改好

针对复杂风格指令一次合成难以兼顾音高、语速与情感的问题,该工作用同一大音频语言模型做草稿生成加文本批评加二次精修,并以组相对策略优化训练精修能力,在 InstructTTSEval 上精修输出相对零样本平均风格一致性提升约 6.5% 至 7.2%,代价是两遍推理与奖励建模依赖。

 · 更新于 2026-09-24 · 约 19 分钟 · 9272 字 阅读 →
论文解读

声调写不出来时,让词素先把语法说清楚:Morpho-VITS 的形态建模

针对卢旺达语正字法省略声调与音节时长导致端到端合成语调难的问题,该工作用词素编码器加音素到词素交叉编码器替换 VITS 文本编码,在 10 千句可懂度与 21 人主观评测上提升自然度与语调,但以 169M 词素参数与训练时长增加为代价且对未见词素敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8926 字 阅读 →
论文解读

不等整句到齐就开口:双轨延迟如何换来可控的首包文本规范化

针对级联对话中上游大模型流式输出与下游语音合成之间的非标准词歧义,StreamTN 用基于 Qwen3-0.6B 的双轨延迟架构做增量规范化,在 4 帧延迟下报告 Micro-F1 为 0.8937 并以 213 ms 的首包延迟换取流式可用性,代价是复杂数理化表达式仍明显更差且更大延迟才能继续提升精度。

 · 更新于 2026-09-24 · 约 19 分钟 · 9265 字 阅读 →
论文解读

先验证结构再采样:社区感知的语音合成核心集选择

该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8377 字 阅读 →
论文解读

先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。

 · 更新于 2026-09-24 · 约 21 分钟 · 10461 字 阅读 →
论文解读

边听边说还要调工具:NemotronLabs VoiceChat 如何把全双工对话与函数调用装进一个流式系统

针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。

 · 更新于 2026-09-24 · 约 25 分钟 · 12382 字 阅读 →
论文解读

放宽切分、收紧词典:用格子上的条件随机场做日语读音选择

针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。

 · 更新于 2026-09-24 · 约 19 分钟 · 9505 字 阅读 →
论文解读

小容量不靠看得远:固定感受野与梅尔细节约束的紧凑合成

针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。

 · 更新于 2026-09-24 · 约 21 分钟 · 10114 字 阅读 →
论文解读

野外波斯语音不够用:用韵律完整切分与双模型互认造出 2400 小时语料

针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

各层残差变化不同速,为何还要共用同一切分:LACE 的逐层压缩

针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。

 · 更新于 2026-09-24 · 约 17 分钟 · 8057 字 阅读 →
论文解读

不录音也能装上读音开关:用模型自己的声音教它读重音

针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。

 · 更新于 2026-09-24 · 约 15 分钟 · 7184 字 阅读 →
论文解读

先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成

针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9249 字 阅读 →