论文解读

把静态 NCERT 课本变成问答式视频:检索接地,生成管讲法与画面

该系统针对 NCERT 课本问答做个性化教学视频,用检索增强生成锁定课本依据并写出多场景脚本,再经 Stable Diffusion 配图、DynamiCrafter 做动效、Google TTS 配音并由 MoviePy 对齐合成,演示显示师生觉得比纯文本更易跟随,但原文只报告定性反馈而未给出可比的定量指标与对照代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10259 字 阅读 →
论文解读

把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音

为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。

 · 更新于 2026-09-24 · 约 20 分钟 · 9653 字 阅读 →
论文解读

长文本朗读为何跳字胡言:用对齐头检测回滚的局部约束推理

针对自回归语音模型在长提示下跳过与幻觉导致的最坏词错率飙升,论文提出只在检测到失败时回滚并临时加硬注意力掩码的 LACI,用 10 种子最坏值在 1500 词以上把 35.2% 降到 3.4%,代价是需要保留对齐头与设置重试上限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8071 字 阅读 →
论文解读

瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐

该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8722 字 阅读 →
论文解读

声调看不见的合成器:DunDun 给约鲁巴语 TTS 补一条声调轴

针对约鲁巴语 TTS 中字符错误率看不见声调错误的问题,论文提出只读输入变音符号作金标、只读基频作预测的 DunDun 指标,用压平基频与翻转答案键验证其声调敏感性,并显示微调主要降低字符错误率而声调早已接近母语锚点,代价是可用区间只到 0.596 且依赖可靠标调文本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9392 字 阅读 →
论文解读

长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散

针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9543 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

对齐不必最锐:用偏好门控把 CTC 约束放进 DPO

针对从零训练的解码器语音合成的内容幻觉问题,论文把只作用于优选样本的轻量 CTC 对齐项折进直接偏好优化,在 Seed-TTS 英文集上把严重幻觉率从 4.4% 降到约 0.6%,代价是需要切到 eager 注意力读图且过强加权会转入自信但错位的过锐区。

 · 更新于 2026-09-24 · 约 20 分钟 · 9655 字 阅读 →
论文解读

字都对,意思却偏了:生成语音为何传达不好信息结构

该研究用同一句 Molly mailed a melon 在四种问答语境下考验七个主流 TTS 能否做出正确且自然的韵律焦点,人类基线仍最稳,最强的 Gemini 也不均衡,而高自然度与高可辨度难以兼得。

 · 更新于 2026-09-24 · 约 18 分钟 · 8564 字 阅读 →
论文解读

问句该升该降:用短篇故事检验合成语音的疑问语调

该研究以同一短篇故事的真人朗读与两种开源合成语音对比疑问句尾音升降,发现较好的 Kokoro 在是非问句升调比例接近真人但在 Wh 问句大量误升,且两系统音高变化范围与自然度均低于真人。

 · 更新于 2026-09-24 · 约 22 分钟 · 10592 字 阅读 →
论文解读

自动韵律切分能代替人工切分吗:巴西葡萄牙语自发语音合成的对照检验

该研究用同一批巴西葡萄牙语自发语音对比人工韵律切分、WhisperX 切分与随机森林韵律切分训练 FastSpeech2 的效果,最强证据是自动韵律切分的 F0 曲线走向接近人工切分,但 70% 合成核轮廓偏离自然语音且焦点位置更分散。

 · 更新于 2026-09-24 · 约 17 分钟 · 8341 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

想让人想买,先让人感到愉悦:用知觉情绪约束合成广告语音

该研究比较有无知觉情绪中间约束的语音嵌入-购买意愿模型,用反向传播改写语音嵌入再做零样本合成,听评显示有约束语音在开放与封闭说话人上都显著提升购买意愿和愉悦感,但 arousal 未拉开差距且语速被推得过快时反而有害。

 · 更新于 2026-09-24 · 约 22 分钟 · 10640 字 阅读 →
论文解读

把七种模态塞进一个自回归模型:Archon 用语义视频与模态链思考做整人生成

Archon 针对文本音频动作视觉碎片化问题,用统一离散词表加自回归语言模型统一七种模态,以语义视频实现约 4 倍 token 压缩并用语义驱动扩散恢复高清视频,最强证据是语音驱动视频与图条件语音任务上与专用模型相当或更优,代价是两阶段训练与推理链更长且本次未能确认代码模型公开。

 · 更新于 2026-09-24 · 约 24 分钟 · 11704 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

先调语言模型还是先调声学解码器:法语德语适配的部件级取舍

该研究以 CosyVoice2 为骨干解决法语和德语零样本段落合成可懂度低的问题,选择只微调文本语音语言模型加流解码器并冻结声码器,最强证据是在 250 小时法语和 500 小时德语下相对词错误率下降 83 到 91%,代价是微调声码器会损害可懂度且超量加长数据会因复杂度多样性失配使词错误率回升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7925 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把机器学习乐器当作会遗忘的档案来演奏

论文以持续一年的生成式广播 In Search of Good Ancestors 为案例,提出再活化框架把数据集制作、迭代再训练与长期聆听当作现场性所在,证据是四层异步系统与四轮工作坊加巩固期的可复述过程,代价是放弃低延迟 virtuosity 式控制与可重复定量评价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9145 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →