论文解读

先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配

针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。

 · 约 18 分钟 · 8807 字 阅读 →
论文解读

去掉提示词文本:用合成同说话人提示做微调的跨语言克隆

针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10077 字 阅读 →
论文解读

长文本朗读为何跳字胡言:用对齐头检测回滚的局部约束推理

针对自回归语音模型在长提示下跳过与幻觉导致的最坏词错率飙升,论文提出只在检测到失败时回滚并临时加硬注意力掩码的 LACI,用 10 种子最坏值在 1500 词以上把 35.2% 降到 3.4%,代价是需要保留对齐头与设置重试上限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8071 字 阅读 →
论文解读

长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散

针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9543 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

换词不换声:直接剪贴与编解码器重建哪条路更自然

该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。

 · 更新于 2026-09-24 · 约 18 分钟 · 8616 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

跨语种克隆要在说得对与听得出是谁之间做取舍

该研究以英语参考音频为输入对比四种零样本跨语种克隆系统,报告了以 VoxCPM2 在阿拉伯语上同时取得 0.25 词错误率和 0.72 说话人相似度为代表的权衡证据,而代价是多数系统仍在可懂度与身份保留之间此消彼长且仅两套系统支持阿拉伯语。

 · 更新于 2026-09-24 · 约 18 分钟 · 8918 字 阅读 →
论文解读

把音色和韵律拆开再拼回去:DisCo-Speech 的两阶段解耦与独立控制

针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9379 字 阅读 →
论文解读

长参考切短再选优:跨语言音色克隆如何兼顾内容与音色

针对中法跨语言音色克隆,该工作用 Qwen3-TTS-12 Hz-1.7B-Base 做零样本批量合成,配合 10 秒窗 5 秒步长的滑动切分与 ECAPA-TDNN 余弦选优,在中文 CER 低至 1.39% 至 2.25%、法语 WER 多为 4.40% 至 8.52% 的条件下得到中文最高 0.7052 与法语最高 0.7173 的余弦相似度,代价是保 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

不做离散量化:KALL-E 以逐帧分布预测实现低帧率连续语音合成

KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

英语音色说法语汉语为何走调:语言标签与词项检索如何稳住跨语种克隆

该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7699 字 阅读 →
论文解读

科学口音难克隆:用三教师蒸馏加单语 LoRA 补学术域数据

针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …

 · 更新于 2026-09-24 · 约 17 分钟 · 8174 字 阅读 →
论文解读

时长定多久才好听:DMOSpeech 2 把时长预测也纳入指标优化

针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。

 · 更新于 2026-09-24 · 约 17 分钟 · 8292 字 阅读 →
论文解读

口吃语音先转文字再修语义:STEAMROLLER 为何用多智能体绕开直接语音转换

针对口吃语音直接转流利语音难、转写引入语义失真和实时延迟三难,STEAMROLLER 用转写加多智能体文本修复加音色克隆合成的三段管线,在 FluencyBank 上把词错误率平均降约 10 个百分点并保持语义,代价是约 3.8 秒分段延迟和零样本克隆音色相似度偏低。

 · 更新于 2026-09-24 · 约 20 分钟 · 10004 字 阅读 →
论文解读

扩散克隆打的是多步去噪,VoiceCloak 就从身份与轨迹两端同时设障

针对扩散语音克隆的先验防御梯度消失与动态条件问题,VoiceCloak 用异性中心引导加注意力上下文发散做身份混淆、用分数幅值放大加噪声引导语义破坏做质量降级,在相同扰动预算下报告了更高的防御成功率,但保护音频本身仍需付出可感知性代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8686 字 阅读 →
论文解读

不对齐文本、直接生成双声道:Text-Audiobox 如何做配音与对话

针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9093 字 阅读 →
论文解读

一句里换一种口音:用帧级掩码把全局引导切开

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12956 字 阅读 →