论文解读

词级定位而非句级知道:WESR 把笑声哭声放回词的位置

针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。

 · 更新于 2026-09-24 · 约 21 分钟 · 10205 字 阅读 →
论文解读

不靠语义猜声音:用海洋哺乳动物叫声逼模型真正去听

该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。

 · 更新于 2026-09-24 · 约 18 分钟 · 8578 字 阅读 →
论文解读

单个都会、合在一起就不会:ART 要求模型同时听懂语音与声音再推理

论文针对多模态大模型只被单项音频能力考核的问题,构造 9 类 9000 条音频内嵌提问的推理基准,用是否问答与描述问答两种协议测得人类约 92.9% 而开源模型多在 50% 附近,代价是全合成语音与模板化问题限制了声学多样性。

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

转写不等于回答:ACID 用语音输入揭开大音频模型的文化安全假象

该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。

 · 更新于 2026-09-24 · 约 18 分钟 · 8956 字 阅读 →
论文解读

宣称支持不等于可用:AfriVox 测出非洲语言与口音下的转写崩塌与翻译分化

AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

广播满分不等于学会唇读:六条件复测下的视觉泛化断层

该文用统一预处理把六种说话条件接入三种主流架构复测,显示纯视觉在域外全面崩溃、音视融合仅在 Lombard 夸张口型下稳定增益,而发音人清晰度与 90 度侧脸的影响远大于小角度偏移与加数据量。

 · 更新于 2026-09-24 · 约 17 分钟 · 8033 字 阅读 →
论文解读

语音把选择题变难了吗:语言、口音、性别与选项顺序如何动摇语音问答

该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10946 字 阅读 →
论文解读

同一事实换语言换模态就变答案:CCFQA 如何卡住多语言语音问答的一致性

论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。

 · 更新于 2026-09-24 · 约 19 分钟 · 9136 字 阅读 →
论文解读

真实多人对话考验语音自监督表示:CSPB 用单通道与多通道同测内容与说话人

CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。

 · 更新于 2026-09-24 · 约 18 分钟 · 8710 字 阅读 →
论文解读

只转写不倾听:用四种词义声学关系测音频大模型的情绪依据

论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8786 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

藏在声音特征里的后门:语速与情感为何能绕过音频大模型对齐

论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。

 · 更新于 2026-09-24 · 约 16 分钟 · 7640 字 阅读 →
论文解读

单语很强、混着说就错:HiKE 用三级切换与借词标注拆解韩英代码切换识别

针对韩英混说识别缺乏公开非合成评测的问题,HiKE 以 1121 句自然录音加词/短语/句子三级与借词标注做细粒度评测,报告 10 个多语模型单语转混说时 MER 扩大 3 到 13 倍,而拼接单语合成的句级数据微调也能带来 6.8% 以上改善,但自然句内数据仍更优。

 · 更新于 2026-09-24 · 约 16 分钟 · 7799 字 阅读 →
论文解读

从能转写到能听懂言外之意:HPSU 如何检验语音大模型的类人听觉

HPSU 针对真实口语中潜在意图与隐含情绪的理解缺口,用三阶段多模态半自动标注构建 2 万余中英样本与 16 个任务,并以 13 个模型与人类基线对比显示最好模型仅 62.6% 而人类达 87.3%,代价是依赖自动裁判与多模型协同标注带来的可复现性核对负担。

 · 更新于 2026-09-24 · 约 18 分钟 · 8751 字 阅读 →
论文解读

从看见听见到回得得体:HumanSense 把共情拆成可测的四层阶梯

针对多模态大模型在以人为中心场景中感知尚可但理解与回应不足的问题,论文用 3882 道真人记录选择题建四层基准并以多阶段全模态强化学习做推理模型,最强证据是人类 87.5% 领先最优模型 29.7 个百分点,而代价是长上下文推理仍是瓶颈且音频任务覆盖不全。

 · 更新于 2026-09-24 · 约 17 分钟 · 8399 字 阅读 →
论文解读

直播不是更长的短视频:LiViBench 如何测互动理解与评论利用

针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。

 · 更新于 2026-09-24 · 约 19 分钟 · 9418 字 阅读 →
论文解读

MAVERIX:逼模型同时听和看,堵住单模态捷径的音视频理解基准

MAVERIX 用 700 段视频与 2556 道必须联合音视频才能回答的问题,测出以 Gemini 2.5 Flash-Lite 约 54.7% 选择题准确率为代表的模型与 92.8% 人类表现之间的大幅差距,代价是更长的人工标注与多轮去捷径校验流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10185 字 阅读 →
论文解读

野外长音频与多音频并存时,模型为何听得到却答不对

MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。

 · 更新于 2026-09-24 · 约 21 分钟 · 10274 字 阅读 →
论文解读

为俄语补上多模态标尺:MERA Multi 如何把 18 个任务拧成一套可复现评测

针对俄语尚无多模态基准的问题,论文用统一技能分类、块式提示、双指标评分与防泄漏机制构建 18 任务基准,最强证据是全覆盖全模态模型的 Total Score 达到 0.5 且提示 формулировка显著改变分数,代价是专家题人类基线仍低且音频视频能力明显弱于图像。

 · 更新于 2026-09-24 · 约 18 分钟 · 8752 字 阅读 →
论文解读

科学语音助手为何听懂却答不严:识别感知推理发音四段断链诊断

S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7925 字 阅读 →