论文解读

把病理性语音拉回正常编码:EA-VAE 用三处对齐做重构

针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。

 · 更新于 2026-09-24 · 约 22 分钟 · 10883 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

前缀里藏着计划:用早期打分引导自回归音频走对语义

针对自回归文本到音频在复杂事件上指令跟随下降的问题,论文用前缀隐式计划探测加 Plan-Critic 早期剪枝做引导解码,在相同 token 预算下把 AudioCaps 总体 CLAP 从 26.67 提升到 36.47,代价是需要额外训练一个轻量打分器并依赖 CLAP 作为代理目标。

 · 更新于 2026-09-24 · 约 16 分钟 · 7909 字 阅读 →
论文解读

文本与 MIDI 各走各路:MIDILM 用共享注意力加双路前馈兼顾语义与结构

针对自由文本到 MIDI 语义对齐不足与调号速度拍号结构失配问题,MIDILM 采用前缀条件加共享掩码自注意力与文本 MLP 加 MIDI 混合专家双路前馈,在 MidiCaps 上相对最强基线在 CLAP 到 TB 上提升 6.07% 到 144.77%,代价是调性建模仍弱且复杂转调下降,未公开代码链接当前不可用。

 · 更新于 2026-09-24 · 约 19 分钟 · 9051 字 阅读 →
论文解读

低码率下保真与语义难两全:非对称双量化如何分开处理内容与细节

针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8761 字 阅读 →
论文解读

不只测好听:TTA-Bench 把准确、可靠与责任放在同一张考卷上

TTA-Bench 针对文本到音频生成提出覆盖准确性、效率、泛化、鲁棒性、公平性、偏见与毒性的七维评测,用 2999 条提示与 118314 条人工标注比较十个主流模型,发现 Tango 2 在准确与泛化上领先但毒性率最高,而效率与公平性上各模型分化明显。

 · 更新于 2026-09-24 · 约 19 分钟 · 9218 字 阅读 →
论文解读

语音不只是文字的喇叭:温暖介导伤害为何必须同时审听觉与文本

在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。

 · 更新于 2026-09-24 · 约 20 分钟 · 9684 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 72 分钟 · 35908 字 阅读 →
论文解读

用带噪混合当高噪声步监督:Mix2Morph 如何把加法叠加训练成可控的声音注入

📄 用带噪混合当高噪声步监督:Mix2Morph 如何把加法叠加训练成可控的声音注入 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460386

 · 更新于 2026-09-24 · 约 16 分钟 · 7807 字 阅读 →