英文题目:Do Audio LLMs Really LISTEN, or Just Transcribe? Measuring Lexical vs. Acoustic Emotion Cues Reliance
会议身份:
conference:eacl:2026:conference-paper-id:2026.eacl-long.274
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准设计 #音频大模型 #语音 #语音情感识别
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Jingyi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhimeng Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jiyun Chun:机构信息未能从会议 PDF 纯文本可靠映射
- Pichao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew Perrault:机构信息未能从会议 PDF 纯文本可靠映射
- Micha Elsner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感理解输入为携带词汇语义与韵律的语音、输出为离散情感标签,实际难点在于词汇线索常掩盖音高语调节奏等声学线索,导致模型靠转写捷径虚增分数。为此本文构建LISTEN先按词汇-声学关系划分中性文本、匹配增强、对抗冲突与无词旁语四种条件并映射真值,以隔离声学贡献,再基于该条件划分将其实例化到多源情感语料并生成文本、音频与图文结合跨模态可比的多选提示,最后基于可比提示对6个模型做文本、音频与结合的零样本对照以暴露模态依赖。与已有情感基准直接测准确率不同,该设计通过中性隔离、匹配增强与冲突对抗强制检验声学利用,具有诊断真听而非转写的实际意义。在Neutral-Text音频-only设置下,Gemini 2.5-Pro的准确率为34.9%,高于Qwen2.5-Omni-7B的34.0%。冲突下模型能感知不一致却坍缩到少数类,旁语下多偏向中性,表明词汇主导且声学整合脆弱。结论适用边界受限于英语短句孤立评测,尚未验证多轮对话、跨语言韵律与真实部署噪声下的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/DeliJingyiC/LISTEN — 链接可访问(HTTP 200)
- 数据相关资源:https://huggingface.co/datasets/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先保留哪些关键信息?
本文解读的对象是 1 篇评估型论文,输入是语音加文本的情绪判断题,目标是判断大音频语言模型究竟在听声音还是在读转写。读者先固定 3 个要点。第一,情绪理解调用词义与声音两类线索,音高、语调、节奏和音质都会改变含义,讽刺就是字面与声音相反时以声音为准的例子。第二,现有大音频语言模型多由纯文本大模型经由语音文本配对微调得到,天生偏向词汇通道,训练细节待查时由名称推定实现缺少依据。第三,常用情绪数据集里常见情绪词,模型只读转写也能拿高分,所以标准任务高分对应声学理解仍待验证。
输出是一套可复述的诊断流程,讲清 4 种词义声学关系如何构造、3 种输入模态如何对照、基线如何扣除输出偏置。本文只讲论文实际做的任务,例子保持教学示意属性,数值引用以原文为准。后续按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件,然后讲构造与推理过程,最后讲实验条件、结果、佐证与复现。
为保持阅读稳定,这里固定 3 个边界。第一,教学例子用于示意流程,例如题面出现愤怒一词时读词即可答对,这类描述对应流程示意。第二,比较时核对数据集、模型、阶段、指标与聚合对象,数值一致仍需确认指标定义一致。第三,证据范围以论文报告为准,延迟与成本这类缺少测量的条目按缺少测量处理,相关性按相关性解读。
已有评测和模型路线为什么回答不了听还是读?
论文把相关工作分成 3 条路线,每条路线各有擅长,也各有待补的对照。第一条是音频评测,包括多任务问答和整体性评测,覆盖语音、声音和音乐,也包含情绪或讽刺题,题面操纵停留在领域层面,词义与声学一致关系缺少系统操纵,因此转写捷径与声学敏感性依然混在一起。换句话说,题目换了领域,信息通道保持原样,模型调用哪条通道答对依然待查。
第二条是大音频语言模型,包括开放权重与闭源系统,部分报告由文本主干再适配音频,带来词汇主导的担忧,训练细节常常待公开,由名称推定实现缺少依据,由参数规模推定听觉能力同样缺少依据。第 3 条是语音情绪识别,端到端卷积循环结构和注意力结构能从波形或语谱图学习层次声学表示,在单数据集内准确率高,建模集中于声学通道,词义与声学如何共同起作用缺少评估。
论文的判断是,前两条路线缺少诊断设计,第 3 条路线缺少跨条件对照。教学例子是,题面写了开心这个词,模型读词就能答对,这属于例子,归为教学示意,与某模型的实测分数分开存放。LISTEN 的定位是补上缺口,用同一批情绪判断更换词义声学关系,再更换输入模态,观察成绩变化来自哪条通道。这种设计把领域泛化问题转化为通道归因问题。
对初学者而言,关键是记住运行阶段一致。评测都是零样本调用,跳过针对本基准的参数更新;专用情绪识别模型只在附带讨论中出现,因标签空间固定且跨数据集敏感,作为主基线的适合度有限。
要区分的到底是哪两种依据,冲突时以谁为准?
论文把情绪依据分成词汇线索和声学线索。白话说,词汇线索(lexical cues)是转写文字的字面意思,声学线索(acoustic cues)是说话方式,包括语调、音高、强度、节奏和嗓音质量。问题是模型在两者一致、中性、冲突和纯声音时分别依赖哪一个。操作方法是固定题目形式为多选题,改变输入模态。文本条件只给转写,时间与声学标注隐去。
音频条件只给原始音频,转写隐去;图文条件同时给两者。
真值映射按条件事先定好,这是复述时最容易混淆的地方。中性文本条件下文本真值固定为中性,音频与图文用真实声音情绪;对齐条件下三者都用真实情绪;冲突条件下文本用显性情绪,音频与图文用隐性情绪;纯声音条件下只有声音标签。
冲突时的判定原则来自心理语言学发现,即讽刺这类冲突情形下声学线索是决定性信号。论文对模型的要求集中于按信息量自适应加权,模仿人类加工设为参考背景。
沿一个样本走一遍有助于固定指代。输入是一段短语音及其转写,题干按模态换措辞但问同一件事,即说话人处于什么情绪。表示阶段把样本归入中性、对齐、冲突或纯声音之一。组件阶段按条件决定真值来源与选项范围,选项在 5 到 10 个之间并打乱顺序。目标是输出一个选项,评测只看是否与该模态下的真值一致。
LISTEN 用哪四个条件走完一个样本的全程?
LISTEN 的全景是 4 个条件乘 3 种模态。先沿一个样本走完流程。输入是一段短语音及其转写和一道选择题,题干按模态换措辞但问同一件事,即说话人处于什么情绪。表示阶段把样本归入某一条件。组件阶段按条件决定真值来源与选项范围,选项在 5 到 10 个之间并打乱顺序,题干从语义等价的改写池中随机抽一个,缓解位置与措辞偏置。
4 个条件的分工是,中性文本隔离声学贡献,对齐测一致增益,冲突测权重选择,纯声音测缺少词汇时的声音理解。前 3 个条件都做文本、音频、图文 3 种输入,纯声音只做音频。
词汇线索 × 声学线索: 词汇线索指转写文本的字面情绪含义,负责提供语义判断依据;声学线索指音高、语调、节奏和音质等声音实现方式,负责在词义中性或冲突时提供决定性依据;两者搭配的理由是人类听话时按情境加权,LISTEN 把这种加权变成可控对照,组合意义是看模型能否在该听声音时听声音。
这段导读把示例图定位到方法层面,左侧对应词义声学一致的题目形态,右侧对应故意冲突的题目形态,每种形态内部都包含 3 种输入模态,读图时紧扣提问对象与信息通道的变化。
看图路径: 1. 先对比左右两栏标题,确认左侧词义声学一致而右侧故意冲突;2. 再观察每栏内文本音频图文三行的提问对象如何从词义切到嗓音;3. 注意蓝色转写句与橙色正确选项在不同模态下是否指向同一情绪;4. 确认音频行右侧喇叭图标出现位置与文本行缺失的差异

论文图 1。原论文 Figure 1:“Examples from the LISTEN benchmark.”。
这张示例图把方法落到题目层面,左栏词义与声音一致,右栏故意冲突,每栏内部分为只读文本、只听音频、又听又读三行。转写句用蓝色标出,正确选项用橙色标出,音频行带有喇叭图标。可以直接看到的动作是,对比同一转写在各行的提问对象,文本行问词义,音频行问嗓音,图文行要求结合两者。这说明评测核心在于更换信息通道,同一语义内容在各通道下对应各自真值。
条件、模态和真值映射各自负责什么?
条件组件负责定义词义与声学的关系。中性文本用固定中性句配多变韵律,例如十一点了这类句子由各异情绪说出;对齐用词义与韵律大体一致的自然与表演语料;冲突用讽刺语料,字面积极而声音消极;纯声音用笑声、叹息和呼吸这类片段。
模态组件负责控制信息。文本只暴露词汇,音频暴露声学加隐含词汇,图文显式强化词汇。真值组件负责区分能力指向。中性文本的文本真值恒为中性,音频与图文用声音情绪;冲突的文本用显性标签,音频与图文用隐性标签。
题目生成组件用大模型按模态生成平行模板,再人工检查语义等价与模态相关性。
文本模态 × 音频模态: 文本模态只给转写文本,负责测量词汇捷径有多强;音频模态只给原始语音,负责测量声学敏感性;两者搭配再加上图文同时给的联合模态,理由是同一题目换输入才能分离模态依赖,组合意义是判断加文本是帮助融合还是干扰声学判断。
显性情绪 × 隐性情绪: 显性情绪指字面表达的情绪,负责作为文本条件下的真值;隐性情绪指声音表达的真实情绪,负责作为音频和图文条件下的真值;两者搭配的理由是讽刺样本中字面与声音故意相反,组合意义是能量化冲突时模型跟随哪 1 通道。
显隐区分的意义在冲突样本中最清楚。文本答对只要读懂字面积极,音频答对需要听出声音的嘲讽或愤怒,图文答对则要在两者矛盾时压住字面、跟随声音。论文还报告了冲突时的跟随计数,后文结果节用数字表展开。选项打乱与题干随机抽取的作用是缓解位置偏置与措辞偏置,样本标识匿名化用于保护信息隔离。
本研究训练了什么,没有训练什么?
本研究保持零参数更新,所有被测模型按官方设置调用,保证条件可比。真实计算过程是构造与推理两部分。构造部分是 3 阶段流程,先定条件与真值映射,再把已有情绪语音语料映射到条件,最后生成并人工检查多选题模板。推理部分是按模态给输入,匿名化样本标识用于保护信息隔离,随机化选项顺序用于缓解位置偏置,要求模型只按给定输入分类。
需要明确的范围是,论文报告的重点是调用行为,内部梯度路径、参数冻结与更新细节归为待查范围,由模型名称推定音频编码器训练方式缺少依据,零参数更新描述的是本研究未更新参数,调用结果的稳定性另行评估。资源状态方面,代码链接当前可用,已公开;数据集链接本次未能确认可达,按本次未能确认可达处理。复现者把重点放在构造对照与调用流程,训练新模型设为范围之外。
从可复述角度,构造流程承担等价职责。条件设计解决测什么,数据集映射解决用什么样本,题目生成解决怎么问,三者共同保证同一情绪判断可以在各通道下重复测量。
数据规模、被测模型和指标方向如何约定?
数据方面,基准共七千余道评测题,覆盖 4 个任务条件和 3 种模态划分。其中中性文本占比最大,对齐次之,纯声音近 1000 题,冲突仅数百题。题目平均十余词,选项平均八词左右,音频平均 3.5 秒,保证情绪线索显著,同时控制长上下文干扰。来源上中性文本多用固定文本的表演语料,对齐覆盖表演与自然语料,冲突用讽刺语料,纯声音从对话语料中抽取片段。被测模型包括开放权重的 Qwen 系列与 Baichuan 系列,以及闭源的 Gemini 系列,共 6 个大音频语言模型,另有一个纯文本指令模型作对照。
指标方面,主指标是准确率,在单标签多分类下等于微平均 F1,方向是越高越好;同时报告平均召回与宏 F1 以应对类别差异。
预测边际基线 × 准确率: 准确率指判对样本占全部样本的比例,负责报告绝对成绩;预测边际基线指按模型自身预测分布随机猜测的期望准确率,负责扣除输出偏置带来的虚高;两者搭配的理由是数据不均衡且模型偏向中性或少数类,组合意义是差距越大才说明真正用了输入线索。
下面用中性文本的关键落差表固定复现口径,该表比较同一批中性转写下换模态的成绩,公平条件是题目与真值映射保持一致,指标方向是准确率越高越好并对照预测边际基线。
| 条件 | 输入模态 | 代表模型 | 准确率 | 对照含义 |
|---|---|---|---|---|
| 中性文本 | 文本 | Gemini2.5-Pro | 96.6% | 转写全中性时接近满分 |
| 中性文本 | 文本 | Qwen 系列 | 85.4% | 词汇捷径稳定有效 |
| 中性文本 | 音频 | Qwen2.5-Omni-7B | 34.0% | 只听声音时大幅走低 |
| 中性文本 | 音频 | Gemini2.5-Pro | 34.9% | 声学敏感性有限 |
| 中性文本 | 图文 | Gemini2.5-Pro | 41.7% | 加中性文本仅小幅回升 |
| 中性文本 | 图文 | Qwen2.5-Omni-7B | 19.8% | 加文本反而低于纯音频 |
该表显示的主要收益是文本条件的高分证明词汇捷径存在,具体代价是音频分只有 30% 左右,图文带来融合增益的幅度有限。值得关注的一项是 Qwen2.5-Omni-7B 从音频到图文走低约十余个百分点,这是词汇干扰声学的例子,说明加信息对应加成绩仍待验证。
主结果显示模型在何时跟词义,何时听声音?
总体模式是词汇主导,随对齐关系变化。先看中性文本,这是最干净的声学检验。文本条件下转写全中性,模型接近满分;音频条件下需要从声音推断,分数大幅走低;图文条件下闭源最强模型略有回升,而多个开放模型反而低于纯音频,说明加上中性文本会干扰声学判断。
混淆矩阵显示文本条件几乎全判中性,音频与图文出现微弱对角但中性列依然很重。对齐条件下文本与音频成绩相对均衡,图文有小幅提升,说明一致时能用两路信息,但提升有限且中性偏置仍在。冲突条件下模型能感到冲突,但把多种讽刺情绪归到嘲讽和挫折两类,细分类仍有局限。纯声音条件下成绩仅略高于随机猜测与边际基线,且仍偏向判中性。
下面这段导读针对 3 条件柱状图,横轴为 6 个被测模型,纵轴为准确率,虚线为预测边际基线,读图时重点比较同一模型内浅色文本柱与中色音频柱的落差。
看图路径: 1. 先按图例区分浅色文本柱、中色音频柱和深色图文柱的含义;2. 再看中性文本组中文本柱远高于音频柱的具体落差幅度;3. 观察每根柱上虚线基线高度,判断成绩是否真正超过偏置

论文图 2。原论文 Figure 2:“Model accuracy across three LISTEN conditions (Neutral-Text, Emotion-Matched, Emotion-Mismatched) under text-only, audio-only, and text+audio modalities.”。
这张柱状图把 3 个条件的 3 种模态放在一起,可以看到中性文本的浅色文本柱很高而中色音频柱很矮,深色图文柱系统性超过音频柱的幅度有限;对齐栏三柱接近,冲突栏图文略高于音频但仍远离高分。这支持只转写少倾听的判断,也显示对齐与冲突时的行为各异,虚线基线进一步说明部分分数来自输出偏置。
下面这段导读针对九宫格混淆矩阵,行是真值而列是预测,颜色越深表示该真值被判为该预测的比例越高,读图时先找纵向深色竖条再找对角线。
看图路径: 1. 先确认矩阵行为真值列为预测,颜色越深表示该格比例越高;2. 看首行文本条件是否整列深色集中在中性预测列上;3. 对比末行冲突条件音频与图文是否纵向集中在嘲讽列

论文图 3。原论文 Figure 3:“Confusion matrices showing Gemini 2.5 Pro’s emotion recognition performance across three experimental conditions in the LISTEN benchmark.”。
这张九宫格混淆矩阵以 Gemini2.5-Pro 为例,第一行文本条件出现整列集中在中性,第二行对齐条件对角略清晰,第三行冲突条件音频与图文出现纵向集中在嘲讽。可以执行的观察是,先看第一行中性列的深色竖条,再看第三行嘲讽列的深色竖条,最后对比第二行图文的中性列是否变浅。这说明模型在该听声音时仍被中性词拽住,在冲突时能感到冲突但分不清具体情绪。
下面这段导读针对纯声音矩阵,该矩阵只有音频输入,横轴是预测而纵轴是真值,读图时重点看中性预测列是否为多数行的最深格。
看图路径: 1. 先确认该矩阵只有音频输入且横轴为预测纵轴为真值;2. 观察中性预测列是否为多数真值行的最深格;3. 检查惊讶真值行是否在惊讶预测列出现例外深色

论文图 4。原论文 Figure 4:“Confusion matrices showing Gemini 2.5 Pro’s emotion recognition performance in paralinguistic condition”。
这张纯声音矩阵只有音频输入,可以看到中性预测列在多行最深,只有惊讶行在惊讶列有例外深色。这支持缺少词汇锚点时模型退回中性默认的判断,也说明纯声音成绩走低源于系统性默认,偶然误差的解释缺少依据。
标签变粗、冲突跟随和基线比较说明了什么?
论文做了 3 类深入对照,每类回答一个反证问题。第一是粗细标签对照,把细分情绪合并为愤怒、快乐、悲伤、惊讶和中性 5 类。中性与对齐条件下提升不大,相邻混淆只占小部分,说明细分不是主要噪声;冲突条件下粗分提升大,因为讽刺的多种细分都被并入愤怒类,原来判嘲讽或挫折的误差被合并吸收。第二是冲突跟随计数,在数百个冲突样本中统计预测与哪 1 通道一致。
音频条件下跟随声音的数量远多于跟随字面,图文条件下同样如此,说明少数情形能压住字面跟声音,但多数仍未精确解决冲突。第三是与专用语音情绪识别模型的初步对照,在域内数据上专用模型可达高准确率,说明声学信号本身信息充分,差距在通用大模型的利用方式,而专用模型跨数据集域敏感,不适合做主基线。
细粒度标签 × 粗粒度标签: 细粒度标签保留愤怒、厌恶、嘲讽和挫折等细分,负责诊断精确理解;粗粒度标签把相近情绪合并为愤怒、快乐、悲伤、惊讶和中性 5 类,负责对照已有语音情绪识别做法;两者搭配的理由是检验细分是否只是标注噪声,组合意义是发现粗分在冲突条件下的提升主要来自标签合并吸收误差。
下面用对齐与冲突的关键数字表展开比较,该表比较同一冲突集下显隐一致数与准确率,公平条件是样本与选项集合不变,指标方向是准确率越高越好、跟随数需看分布而非单点。
| 条件 | 输入模态 | 代表模型 | 准确率 | 基线对照 |
|---|---|---|---|---|
| 对齐 | 文本 | Qwen3-Omni-30B | 38. 7% | 词汇单独中等 |
| 对齐 | 音频 | Qwen3-Omni-30B | 42. 4% | 声学单独略高 |
| 对齐 | 图文 | Qwen3-Omni-30B | 43. 1% | 融合仅小幅增益 |
| 冲突 | 图文 | Gemini2.5-Pro | 42.6% | 高于边际基线 23.3% |
| 冲突 | 音频跟随 | Gemini2.5-Pro | 96 out of 381 | 远多于跟随字面的 20 out of 381 |
| 冲突 | 图文跟随 | Gemini2.5-Pro | 93/381 | 跟随字面的为 24/381 |
该表显示的主要收益是开放模型在对齐时图文小幅超过单模态,冲突时图文好于纯文本;具体代价是冲突的准确率与边际基线差距小于中性与对齐条件,说明部分成绩来自偏向少数类的偏置。未胜出项是部分开放模型在多处低于同组模型,且图文相对音频无增益,表明融合能力因结构而异,不能把总体趋势推广到每组每步。
哪些边界没有测,哪些推论不能做?
论文明确了范围限制,复述时要把未测边界与已测结论分开。第一,每句独立评测,不含多轮对话历史,因此不能推论在对话上下文中模型会如何重新加权词义与声音。对话历史可能提供新的词汇锚点,也可能放大声学误判,原文没有测量就不能断言方向。第二,仅限英语数据,不能推论跨语言情绪韵律的泛化性,因为不同语言的声学实现方式不同,声调语言与重音语言的线索权重本就不同。第三,专用语音情绪识别模型只作初步对照,因标签空间固定且域敏感,不适合做主基线,不能把专用模型的高分直接当通用模型的上限,也不能把跨数据集下降简单归因于模型能力。
伦理方面,所用数据均为公开数据且按原许可使用,不涉及新的人体数据采集,但情绪识别有隐私与误用风险,需强调透明与负责部署。缺失证据不是技术错误,例如未测量延迟与部署成本,就不能承诺这些量得到改善;相关性也不是因果,图文提升小不能直接断定某一模块失效。总体趋势不等于每组每步都成立,个别模型在个别条件下的例外不能推翻词汇主导的总体判断,也不能反过来用总体判断否定例外。
要复现这套诊断,先做什么,需要什么?
复现先做三件事,每件事都有明确的输入与检查点。第一,按论文的条件定义重建划分,中性文本用固定中性句的多情绪朗读,对齐用词义声学一致样本,冲突用讽刺样本并分别保存显性与隐性标签,非言语只保留无词片段。检查点是真值映射是否与原文一致,中性文本的文本真值恒为中性,冲突的文本与音频真值必须分开保存。第二,按模态写平行题干,文本问词义,音频问嗓音,图文要求结合两者,从等价改写池随机抽题干并打乱选项,样本标识匿名化。
检查点是同一题目换模态时只换信息通道,不换情绪类别集合。第三,用零样本调用可得模型,按官方设置运行,计算准确率、无加权平均召回和宏 F1,并按模型自身预测分布计算预测边际基线,再看准确率与基线的差距。
关键超参数与信息条件是选项 5 到 10 个、音频平均 3.5 秒、题目平均十余词。代码当前可用,数据集链接本次未能确认可达,复现时应先核对本地语料许可,不要默认已公开可下载。还需补的验证是多轮上下文与多语言扩展,以及更细的韵律特征消融,例如只保留语调而去除内容后的成绩变化。复现报告应同时给出准确率与边际基线的差距,并展示混淆矩阵的纵条模式,否则容易把偏置带来的分数误读为听懂。
何时值得尝试这套方法,如何一句话记住结论?
当任务需要模型在词义中性、一致、冲突和无词时都稳定,就值得用这套 4 个条件 3 模态诊断,而不是只看标准情绪识别总分。它能回答 3 个实用问题:词汇捷径有多强,看中性文本的文本与音频落差;融合是否有效,看对齐时图文是否稳定超过单模态;冲突时是真听懂还是塌缩到少数类,看混淆矩阵的纵条与跟随计数。论文报告显示,模型在中性词时偏中性、无词时也偏中性、对齐时提升小、冲突时塌缩到嘲讽与挫折,这支持转写多于倾听的判断,但属于有限解释而非因果证明。
待验证的是更好的韵律建模与图文融合能否在不伤害词汇理解的前提下提升声学敏感性。可能的路径包括显式建模韵律、频谱与时序特征,或在冲突样本上加强 pragmatic 推理,但原文未验证这些改进,因此只能说可能而不能承诺有效。一句话记住,听懂情绪需要按情境加权两条通道,而当前模型权重过于偏向文字,缺文字时退回中性,有冲突时只感到不对却分不清细节。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses