iwslt-2026 论文深度解读
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对 MIDIBERT 做符号音乐情绪识别时调式-情感关联缺失的问题,用 Krumhansl-Kessler 提取大/小调并以 FiLM 注入第一层,在 EMOPIA 达 75.2% 准确率、VGMIDI 达 59.1% 准确率,代价是只用二分类调式并依赖自动调式估计的正确性。
针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。
S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。
DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该文研究冻结语音编码器加冻结大语言模型、只训练轻量连接器的多语言识别中按单语言还是按语系组织训练数据的问题,在近四十种语言上报告家族级连接器多数更低更稳但在内部差异大的语系会失效,并以通用连接器对照说明增益来自亲缘性而非单纯数据量。
针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。
针对全量微调语音自监督基座模型代价高、MLP 适配器表达受限的问题,KanAdapter 以并行瓶颈中的 GR-KAN 可学习有理激活替换固定激活,在说话人验证、情感识别与伪造检测上以减少 94.7% 至 97.5% 可训练参数接近全量微调,并在两阶段持续学习上相对全量微调降低 83.6% 错误率。
共分析 38 篇语音/AI 论文
语音识别 | 8.4/10
共分析 49 篇语音/AI 论文
音乐理解 | 7.2/10
语音识别 | 5.7/10
音频分类 | 7.2/10
共分析 21 篇语音/AI 论文
音视频理解 | 6.5/10
音视频生成 | 6.2/10
共分析 39 篇语音/AI 论文
音视频生成 | 7.1/10