难发的音就多练:按音素误差自适应加权的静音语音重建
针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。
针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。
该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。
ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。
针对人听希望去噪干净而识别前端怕语音失真的问题,论文用源条件与额外标记两类提示扩展统一分离模型并按提示切换标准损失与正则损失,英日噪声实验显示识别分支降低了词错误率与字错误率而高质量分支保持了重建质量,代价是识别分支牺牲客观质量且仍未超过推理期混合基线。
HydraQE 针对语音翻译无参考质量估计,用 Qwen3-ASR 同时编码源语音和译文假设,经稀疏层混合与双向重编码得到共享表示并用 DA、MetricX、xCOMET 三头监督加课程采样训练,在 IWSLT 2026 开发集与测试集段级别上超过级联文本基线,但不同预测头在语种与段级和系统级之间存在权衡且开发集系统级分数不稳定。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
POWSM 用同一注意力编码器解码器结构统一完成音素识别、语音识别、带音频的字转音与音转字四项任务,在未见语言上取得可比最优的音素错误率,但多任务对域内识别的增益并不稳定且仍偏向高资源语言。
针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。
针对约 1 kbps 下语义对齐与波形重建互相冲突的问题,XY-Tokenizer 用语义与声学双编码器加残差矢量量化与先联合对齐后冻结细化的两阶段训练,在英中多数据集上同时取得低识别错误率与高说话人相似度,代价是更大的编码器规模与更重的训练流程。
针对纯文本审核漏掉语气、情绪与语速等副语言毒性的问题,该研究构建带毒性来源标注的 ToxiAlert-Bench 并采用双头加多阶段训练的 ToxiAlert 模型,最强证据是在自建基准上相对最强基线 Macro-F1 相对提升 21.1%、准确率相对提升 13.0%,代价是合成数据依赖 TTS 表现力与细粒度类别仍存在明显短板。
BuzzASR 用单语微调与分词器替换加文本多任务两条路线适配 102 种语言,在 77 种语言上超过 Whisper-large-v3 并在 27 种语言上达到开源最优,代价是逐语维护模型与域内评测带来的可比性限制。
针对对话多模态情感识别中高阶跨模态交互不足与多目标梯度冲突问题,论文用模态特异低秩多项式融合做表示、用三目标帕累托梯度协调做优化,在 IEMOCAP 上报告 75.42% 准确率、在 MELD 上报告 68.47% 准确率,代价是每轮训练比单分支基线多约 0.66s 的小规模二次规划开销。
针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对同声传译需在部分语音下增量输出的问题,EASiST 用多延迟语义分块构造单调交错数据、全单向语音编码器加 LLM 与轻量读写策略头经三阶段训练实现自适应低重算推理,在 MuST-C 与 Europarl-ST 英德英西上取得更好的延迟质量权衡,但自适应增益依赖分块对齐质量与阈值调节。
针对音素到词到语句单向建模不足与分层加深导致初始编码遗忘问题,论文提出双向交互注意力加残差分层的 HIA 框架,在 speechocean762 上以音素词句多指标领先为证据,代价是小数据下增大容量反而难优化。
针对转录标签缺少声学起止时间的问题,该研究用统一 26 类分类体系加四阶段自动时间戳管线构造大规模监督,并用非自回归槽填充模型联合预测词边界与事件边界,在 NVV-TimeBench 上报告 Micro F1 71.0% 与 Macro mMAE 59.6 ms,但短促低能量类别仍明显更难。
针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。