把病理性语音拉回正常编码:EA-VAE 用三处对齐做重构
针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。
针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对自回归文本到音频在复杂事件上指令跟随下降的问题,论文用前缀隐式计划探测加 Plan-Critic 早期剪枝做引导解码,在相同 token 预算下把 AudioCaps 总体 CLAP 从 26.67 提升到 36.47,代价是需要额外训练一个轻量打分器并依赖 CLAP 作为代理目标。
针对自由文本到 MIDI 语义对齐不足与调号速度拍号结构失配问题,MIDILM 采用前缀条件加共享掩码自注意力与文本 MLP 加 MIDI 混合专家双路前馈,在 MidiCaps 上相对最强基线在 CLAP 到 TB 上提升 6.07% 到 144.77%,代价是调性建模仍弱且复杂转调下降,未公开代码链接当前不可用。
针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。
TTA-Bench 针对文本到音频生成提出覆盖准确性、效率、泛化、鲁棒性、公平性、偏见与毒性的七维评测,用 2999 条提示与 118314 条人工标注比较十个主流模型,发现 Tango 2 在准确与泛化上领先但毒性率最高,而效率与公平性上各模型分化明显。
在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。
共分析 38 篇语音/AI 论文
📄 用带噪混合当高噪声步监督:Mix2Morph 如何把加法叠加训练成可控的声音注入 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460386