论文解读

一句之内换情绪又变语速:不训练模型只改推理时条件访问

针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10249 字 阅读 →
论文解读

无标签也要会切歌:UniVocal 用语义推断驱动说唱切换

UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9094 字 阅读 →
论文解读

用进度刻度对齐文本与语音:VoiceStar 如何同时做到时长可控与超长外推

针对零样本语音克隆中对齐脆弱、时长不可控和长于训练则崩溃的问题,VoiceStar 用进度监控旋转位置编码与延续加提示混合训练实现时长控制与外推,最强证据是 40s-50s 外推下词错率 11.91 对 F5-TTS 的 52.44,代价是长上下文下说话人相似度略低与自回归推理慢。

 · 更新于 2026-09-24 · 约 16 分钟 · 7959 字 阅读 →
论文解读

一句话生成可玩视觉小说:AniTales 如何用情绪标签对齐故事、立绘与配音

AniTales 针对文本互动故事缺少稳定多模态呈现的问题,用大语言模型生成带说话人与情绪标签的结构化剧本,再以同一标签驱动立绘表情与语音韵律,在 10 名普通用户与 5 名专家的十幕故事试用中获得可用性 84 分与角色对话匹配 4.2 分,但语音适配在两组均为 3.6 分成为最弱环节。

 · 更新于 2026-09-24 · 约 19 分钟 · 9137 字 阅读 →
论文解读

低资源希腊语合成靠确定性提示词稳住说话人:多语先验加两阶段适配

针对希腊语干净单说话人数据稀缺导致音色漂移的问题,论文用 WhisperX 清洗与切分搭建希腊语适配数据,再对 880M 参数 Parler-TTS 做多说话人全量微调加 3.5 小时单说话人 LoRA,并以确定性提示词替代大模型生成提示词,最优配置报告 WER 10.7%、MOS-I 4.00、MOS-C 4.24,但频谱保真与目标说话人相似度仍有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8144 字 阅读 →
论文解读

时长定多久才好听:DMOSpeech 2 把时长预测也纳入指标优化

针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。

 · 更新于 2026-09-24 · 约 17 分钟 · 8292 字 阅读 →
论文解读

先定位错在哪、再只改错段:多层次评估器如何稳住零样本语音合成

针对零样本语音合成中误读、可听噪声与异常停顿导致的不稳定问题,论文用能同时输出错误时间范围、转写文本与整句质量分的 Vox-Evaluator 做局部遮罩重改与细粒度偏好优化,在 Seed-TTS 上把 F5-TTS 的字错率从 1.73% 降到 1.42%,代价是最多两轮迭代改写与偏好训练过久后奖励饱和回落。

 · 更新于 2026-09-24 · 约 18 分钟 · 8984 字 阅读 →
论文解读

自回归也能定长:IndexTTS2 用标记计数与情感解耦做可控零样本合成

IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10400 字 阅读 →
论文解读

视觉对话不够吸引人:用合成语音补情感,再用交错建模学互动

针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9867 字 阅读 →
论文解读

把纠缠的副语言风格拆开学:ParaMETA 的共享空间与任务子空间分工

针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。

 · 更新于 2026-09-24 · 约 23 分钟 · 11052 字 阅读 →
论文解读

信息不均匀时不再平均分配:用聚类定长短、用索引记时长

针对固定帧率对静音与稳态元音浪费而对快速过渡欠分配的问题,VARSTok 用时间感知的密度峰聚类做变长切分并用扩展索引隐式编码时长,在平均 30.95 Hz 下重建 UTMOS 达 3.8949 超过 40 Hz 固定基线,但更低码率与说话人相似度上仍有代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7911 字 阅读 →
论文解读

合成错一个词就够了:用 ASR 交叉注意力的清晰度与单调性做词级奖励

针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8632 字 阅读 →
论文解读

固定模长换可预测性:SphereVAE 把连续语音表示压到球面上治自回归漂移

针对连续语音表示自回归预测中误差沿时间累积导致的隐变量漂移问题,SphereVAE 用单位超球面 Power Spherical 隐空间固定模长只留方向变化,在重建指标低于标准 VAE 的代价下,在 VoxCPM 零样本合成中取得英文 5.305% 词错误率与中文 1.141% 字错误率的最低内容错误并在长文本中保持更高的说话人相似度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9812 字 阅读 →
论文解读

用投票与多维标注把粤语长音频做成可训练语料

针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8914 字 阅读 →
论文解读

解耦分词与多词元预测为何能同时改善语音对齐与合成质量

该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。

 · 更新于 2026-09-24 · 约 22 分钟 · 10835 字 阅读 →
论文解读

用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。

 · 更新于 2026-09-24 · 约 25 分钟 · 12192 字 阅读 →
论文解读

从注视到聆听:LipCoder 把 AI 编程装进语音闭环

LipCoder 针对视障程序员在可视编辑器与 AI 补全中被迫逐行听屏的断裂,用语音输入与听觉输出统一导航理解修改验证,在 5 名视障被试的探索性对照中可用性数值向好但校正后均不显著,且强依赖识别与大模型可靠性。

 · 更新于 2026-09-24 · 约 18 分钟 · 9013 字 阅读 →
论文解读

指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。

 · 更新于 2026-09-24 · 约 17 分钟 · 8092 字 阅读 →
论文解读

先定语义再补声音:TontaubeV1 用分层编解码与有界上下文做流式语音合成

TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。

 · 更新于 2026-09-24 · 约 18 分钟 · 9018 字 阅读 →
论文解读

在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍

GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10716 字 阅读 →