广播满分不等于学会唇读:六条件复测下的视觉泛化断层
该文用统一预处理把六种说话条件接入三种主流架构复测,显示纯视觉在域外全面崩溃、音视融合仅在 Lombard 夸张口型下稳定增益,而发音人清晰度与 90 度侧脸的影响远大于小角度偏移与加数据量。
该文用统一预处理把六种说话条件接入三种主流架构复测,显示纯视觉在域外全面崩溃、音视融合仅在 Lombard 夸张口型下稳定增益,而发音人清晰度与 90 度侧脸的影响远大于小角度偏移与加数据量。
针对纯文本审核漏掉语气、情绪与语速等副语言毒性的问题,该研究构建带毒性来源标注的 ToxiAlert-Bench 并采用双头加多阶段训练的 ToxiAlert 模型,最强证据是在自建基准上相对最强基线 Macro-F1 相对提升 21.1%、准确率相对提升 13.0%,代价是合成数据依赖 TTS 表现力与细粒度类别仍存在明显短板。
针对播报式基准低估真实对话难度的问题,该工作把 1656 段双人视频会议转成 713.5 hours 训练加 60.1 hours 测试的视听识别基准,报告显示纯音频错误率从 LRS3 的 0.74–1.95% 升至 16.83–24.32%,而混合训练可把对话测试集视听错误率压到 9.83% 与干净条件下 8.48%,代价是必须自备原数据许可并复刻多步清洗 …
该文把埃及阿拉伯语 CHILDES 的国际音标转写为全带符 CODA 正字法并加上引理与核心词性,得到约 2.6 万词例的语料,并在形态消歧与语音识别上给出基线,代价是语料规模小且 GPT-4o 初转写准确率低、需大量人工校对。
针对语音、声音、歌声与音乐四类音频造假统一检测问题,论文提出冻结语音自监督模型并只学习提示词的小波提示调优方法,在四类联合训练下以远少于微调的参数取得更低的平均等错误率,但单类训练仍难跨类泛化。
论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
EgoEMS 针对院前急救中多成员协同与强流程性难以建模的问题,用 233 次模拟试验同步采集第一视角视频、音频、手表惯性与按压真值并标注 67 类关键步骤,基准显示监督变换器在分类达 62.3% 而零样本大模型仍明显落后,代价是模拟与真实出警之间仍有分布差距。
论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。
针对韩英混说识别缺乏公开非合成评测的问题,HiKE 以 1121 句自然录音加词/短语/句子三级与借词标注做细粒度评测,报告 10 个多语模型单语转混说时 MER 扩大 3 到 13 倍,而拼接单语合成的句级数据微调也能带来 6.8% 以上改善,但自然句内数据仍更优。
HPSU 针对真实口语中潜在意图与隐含情绪的理解缺口,用三阶段多模态半自动标注构建 2 万余中英样本与 16 个任务,并以 13 个模型与人类基线对比显示最好模型仅 62.6% 而人类达 87.3%,代价是依赖自动裁判与多模型协同标注带来的可复现性核对负担。
针对多模态大模型在以人为中心场景中感知尚可但理解与回应不足的问题,论文用 3882 道真人记录选择题建四层基准并以多阶段全模态强化学习做推理模型,最强证据是人类 87.5% 领先最优模型 29.7 个百分点,而代价是长上下文推理仍是瓶颈且音频任务覆盖不全。
针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。
MAVERIX 用 700 段视频与 2556 道必须联合音视频才能回答的问题,测出以 Gemini 2.5 Flash-Lite 约 54.7% 选择题准确率为代表的模型与 92.8% 人类表现之间的大幅差距,代价是更长的人工标注与多轮去捷径校验流程。
MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。
针对俄语尚无多模态基准的问题,论文用统一技能分类、块式提示、双指标评分与防泄漏机制构建 18 任务基准,最强证据是全覆盖全模态模型的 Total Score 达到 0.5 且提示 формулировка显著改变分数,代价是专家题人类基线仍低且音频视频能力明显弱于图像。
针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。
针对转录标签缺少声学起止时间的问题,该研究用统一 26 类分类体系加四阶段自动时间戳管线构造大规模监督,并用非自回归槽填充模型联合预测词边界与事件边界,在 NVV-TimeBench 上报告 Micro F1 71.0% 与 Macro mMAE 59.6 ms,但短促低能量类别仍明显更难。
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。