英文题目:AEQ-Bench: Measuring Empathy of Omni-Modal Large Models

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1813

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #人类参与评测 #语音 #语音对话系统

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Xuan Luo:机构信息未能从会议 PDF 纯文本可靠映射
  • Lewei Yao:机构信息未能从会议 PDF 纯文本可靠映射
  • Lanqing Hong:机构信息未能从会议 PDF 纯文本可靠映射
  • Kai Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Dehua Tao:机构信息未能从会议 PDF 纯文本可靠映射
  • Daxin Tan:机构信息未能从会议 PDF 纯文本可靠映射
  • Yukun Deng:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruifeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该基准任务输入为英文语音话语加文本上下文,输出为共情回复或对音频回复的共情评判,难点在于语言内容与韵律语气共同决定共情且高度主观。构建先从三类语料过滤不适与非清晰语音样本以保留可用音频,再由GPT逆向生成可引出同一话语的多样上下文或同一上下文的多语气解释,形成配对实例。随后人工校验上下文连贯与情感可解释性并给出参考解释,校验后实例直接进入语言与副语言两路评测。评测中文本裁判负责模态依赖、自然度与区分度打分,音频裁判与人类负责连贯性、支持性与传递效果对照,并单独考察副语言传递与跨情境区分。与只看转写文本的既有评测相比,该机制同时要求听懂语气并用合适语气回应,因而更贴近真实语音交互。在AEQ-BENCH基准下,GPT的Naturalness归一化得分为0.98,高于LLaMA-Omni的0.95。该结论适用边界限于英文日常与朗读类语音的粗粒度共情判断,对细粒度情感渲染与跨语言外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决什么共情问题?

这篇论文的输入是真实人声的音频话语加 1 段简短文本语境,目标是让全模态大模型在对话中既听懂情绪又给出体贴回应。作者把研究对象限定为全模态大模型,也就是能同时处理音频、文本乃至图像视频,并能输出文本或语音的模型。

必须保留的信息是任务不是单做语音识别或知识问答,而是共情,也就是理解对方视角并给出情绪上合适的回应。输出有 2 类,1 类是模型作为回应者生成的文本或语音,另一类是模型作为评判者对语音回应的打分。

论文报告基准包含 1,885 个英文实例,每个实例都是 1 段音频话语配 1 段文本语境。初学者容易误以为把音频转写成文字再用文本指标就能评价共情,论文要纠正的正是这 1 点。转写丢掉了语气、语速与停顿,而相同话语用温暖或冷淡语气说出来,需要的共情策略完全不同。

研究全程只用真人语音,明确不用稳定的合成语音,以保留口音与韵律的多样性。资源状态方面,本次收到的证据中没有发现来源绑定且完成验证的资源,因此不能声称代码、模型或数据已公开。复现者应先核对官方链接状态,不应默认可以直接下载。

已有评测路线为什么覆盖不了共情?

已有全模态评测大多围绕认知能力展开,例如知识检索、复杂推理与指令跟随,输入配置通常是音频内容加文本指令,或音频指令加多模态内容。输出要求完成翻译、识别或按指令作答,文本指令写得非常明确,模型照做即可。

共情对话则不同,语境只是此前对话的压缩总结,没有请检查无障碍或请给投资建议这样的显式指令。模型需要从语境加话语的线索中推断用户真正担心什么,这正是认知共情而非指令跟随。

先前共情研究多关注语言特征,例如词汇选择与显式情绪表达,或把音频简化为转写文本再套用文本指标。这样做忽略了声音表达的作用,而副语言线索恰恰决定了相同文字是安慰还是讽刺。

论文把相关工作按相同输入、相同目标来对照。相同输入音频加文本,但目标是共情回应而非执行指令;同样关注情绪,但监督不再是单轮情绪分类标签,而是多轮语境下的支持性回应与语音表达。教学例子是论文中商店占地超过 1 英亩且对特定年龄人群有限制的例子。

在计划到店访问的语境下,模型需要回应无障碍关切;在地产投资的语境下,模型需要回应商业用地信息。文字相同但关切点完全不同,这说明只测指令执行无法覆盖共情。

2 种对照想分离什么能力?

论文把评测问题拆成 2 个互补对照。第 1 种对照是对相同音频构造不同语境,背景框架改变后解读随之改变。例子是相同给钱的话,在讨论资助困难亲戚时意味着个人援助,在讨论支持政治候选人时意味着竞选捐助。

需要的共情策略因此不同,前者要关注可持续性与情绪陪伴,后者要关注参与方式与价值对齐。模型不能复用相同模板,必须随语境切换关切点。第 2 种对照是对相同语境保留相同文字但用不同情绪语调说出,字面相同但情感传递改变含义。

例子是愤怒地说有时需要争吵才能解决问题,传达的是挫折与需要被认可;冷静地说相同话语,则传达务实建设性的冲突观。模型需要识别情绪信号并调整回应风格,不能只看文字。

按论文定义,这对应认知共情与情感共情 2 个成分。前者是理解他人视角,后者是对他人情绪状态的情绪性回应。日常大量对话本身是信息性或中性的,共情不体现为情绪镜像,而体现为有帮助、视角采择、与对方目标对齐和语境合适的支持。

基准因此分为聊天与求助 2 类用途,并覆盖个人生活、职场、人际等多主题。这种划分保证了情绪浓的倾诉与情绪淡的办事场景都被测到。

基准全景:数据、任务与指标如何组织?

基准全景可以沿 1 个样本走完。输入是 1 段真人音频话语加 1 段文本语境,其中文本提供聊天历史摘要,音频提供当前话语的字面与语气。模型需要同时利用两者生成回应,目标是回应在内容上连贯支持、在声音上温暖得体。

输出是文本或语音,评价分语言与副语言 2 方面。语言看模态依赖、连贯、自然度、区分度与支持性,副语言看语音表达。数据来源有 3 块,分别是日常口语对话、领域多样的流媒体内容、录音室录制的显式情绪语音。

前 2 者用于相同话语换语境,后者用于相同语境换语调。构造分 3 步,先过滤掉涉及肢体动作、数学推理复杂任务与针对真人的亲密告白等不适合共情评测的实例。再用生成模型按话语反向生成语境并附带连贯性解释与参考回应,最后由熟悉语言学的内部标注员逐条核验。

核验标准是语境能否合理引出音频,且不同语境语义确有差异、不同情绪在相同语境下均可解释。下面这张总览图先区分指令跟随与对话 2 大类任务,有助于定位本基准的混合模态对话位置。

看图路径: 1. 先看上排 3 格指令跟随与单轮对话的输入输出箭头;2. 再看下排混合模态对话中文本语境与音频话语如何共同指向回应;3. 对比橙色输入与蓝色回应的位置关系确认任务是对话而非翻译

原论文 Figure 1:Overview of omni-modal tasks: instruction following (a & b) and conversation (c & d).

论文图 1。原论文 Figure 1:“Overview of omni-modal tasks: instruction following (a & b) and conversation (c & d).”。

图中上排展示了音频内容加文本指令、音频指令加多模态内容、单模态对话 3 种配置,下排展示了本基准采用的混合模态对话。文本作为语境,音频作为当前话语,要求模型据此回应,输出可以是文本、音频或两者。这解释了为什么评价必须同时检查文本内容与声音表达,缺少任一侧都会误判共情质量。

语境变化与语调变化分别测什么机制?

语境变化分支考验关联特定语境的能力。日常短对话可适配多种背景,因此每段音频配 3 个语境;领域性强、措辞正式的内容灵活性受限,因此每段音频配 2 个语境。机制上模型需要先推断用户视角与意图,再解读潜在关切,最后调整回应使其贴切且支持。

语调变化分支考验听觉能力,不同语调反映说话人对相同语境的不同态度,要求模型推断说话人立场。机制上录音室数据提供干净明确的情绪基线,相同语境下不同语调共享 1 段背景,模型不能只看文字,必须听出情绪。

认知共情 × 情感共情: 认知共情负责读懂对方视角与没有明说的心思,分工是理解处境与意图;情感共情负责对他人情绪状态给出情绪呼应,分工是安抚与支持。搭配理由是日常对话既有信息求助也有情绪倾诉,只理解不回应会显得冷漠,只回应不理解会答非所问,组合后 AEQ-Bench 才能同时检查连贯理解与支持表达。

语言特征 × 副语言特征: 语言特征指说了什么,分工是词汇选择、逻辑连贯与支持意图;副语言特征指怎么说,分工是语调、语速、停顿与韵律。搭配理由是相同文字用温暖语气与讽刺语气含义完全相反,只看转写文本会丢失关键信息,组合后才能同时评价内容贴切度与声音支持感。

相同话语换语境 × 相同语境换语调: 相同话语换语境固定音频而变换文本背景,分工是考验模型能否随背景切换共情策略;相同语境换语调固定文本背景而变换音频情绪,分工是考验模型能否听出语气差异。搭配理由是前者分离语义理解能力,后者分离听觉感知能力,组合后才能区分模型是用不好上下文还是听不出情绪。

作为回应者 × 作为评判者: 作为回应者要求模型输入音频加文本并输出文本或音频回应,分工是生成共情;作为评判者要求模型直接听音频回应并打分,分工是不依赖转写文本做判断。搭配理由是模型训练需要自动奖励信号,组合后既能看到生成上限,也能检验能否用模型代替人工完成粗粒度评估。

自然度 × 区分度: 自然度评价回应像不像人与人聊天,分工是衡量流畅度与人味;区分度评价模型面对不同语境或语调时回应内容变化程度,分工是衡量是否随境而变。搭配理由是高自然度可能靠模板套话实现,高区分度可能靠分析腔实现,组合后才能发现能聊但不分情境、或敏感但不会聊的解耦现象。

下面 2 张构造示例分别对应上述 2 个分支,阅读时固定一端、观察另一端的变化。相同话语配 2 种合理语境时,参考回应需要走向完全不同的支持动作,这是语境分支的教学价值。

看图路径: 1. 先固定顶部橙色相同话语再左右比较 2 个文本语境;2. 再看蓝色回应如何分别转向无障碍支持与地产投资;3. 注意左侧回应出现问句引导下一步的共情策略

原论文 Figure 2:The constructed GIGASPEECH subset of AEQ-BENCH featuring context variation.

论文图 2。原论文 Figure 2:“The constructed GIGASPEECH subset of AEQ-BENCH featuring context variation.”。

图中顶部固定相同关于商店面积与年龄限制的话语,左右分别给出到店访问与地产投资 2 种语境。左侧回应转向询问年龄段适宜性与无障碍支持,右侧回应转向类似大面积物业的投资信息。这说明评价区分度的依据是回应是否随语境切换关切点,而不是字数多少或格式是否完整。

相同语境配 4 种语调时,解释句为每种情绪提供合理动机,回应需要匹配情绪强度,这是语调分支的教学价值。

看图路径: 1. 先找到中间相同语境与相同话语再看 4 角不同情绪标签;2. 比较每角解释句如何为相同话语提供合理情绪动机;3. 观察蓝色回应如何对愉悦用趣闻承接而对愤怒用安抚承接

原论文 Figure 3:The constructed Emovdb subset of AEQ-BENCH with tone variation.

论文图 3。原论文 Figure 3:“The constructed Emovdb subset of AEQ-BENCH with tone variation.”。

图中中间固定讨论喜爱的运动随时间变化的语境与相同话语,4 角分别为愉悦、厌恶、中性与愤怒的解释与回应。愉悦回应承接趣闻与怀旧,愤怒回应先安抚再问影响,文字相同但回应策略随语调改变。这说明只看转写无法区分,必须听音频才能正确共情。

本研究训练了什么,没有训练什么?

本研究没有训练任何新模型,也没有报告梯度路径、参数冻结或优化器设置,因此不能从模型名称推定实现细节。9 个基线都是直接调用已有模型完成生成与打分,论文关注的是基准构造与调用评测。

真实计算过程是基准构造与调用评测。用生成模型按保留音频反向生成语境、解释与参考回应,再由人工核验与修订;然后调用 9 个基线模型生成回应。调用文本评判模型与音频评判模型按既定量表打分,并与人工打分比较一致性。

标注与评测流程承担了方法职责。过滤规则排除不适合实例,生成提示控制语境数量,人工核验保证约 7 成自动语境直接可用、其余经修订后使用。人工评测从每个模型均匀抽样,相同实例的成对模型回应交由相同标注员评判以保证内部一致。

缺项需要明确指出。论文未给出生成语境时的采样温度、候选数与筛选阈值,未给出调用基线时的解码参数,未报告训练资源消耗,因为本研究本身不做训练。把无训练理解为确定性求解是错误的,相同提示多次调用仍可能产生差异,论文靠人工核验与统一评测指示来控制可比性。

数据构成、基线与量表条件是什么?

数据构成需要先看总量与来源分工。下表提出的问题是 3 类来源各自贡献多少实例与语境,公平条件是每对音频语境计为 1 个实例,指标方向是数量越多覆盖越广。

MELD281843843
GIGASPEECH303606606
EMOV-DB436109436
Total1,0201,5581,885

该表显示总量为 1,885 实例,由约 1,020 段音频与 1,558 段语境组合而成,其中日常对话每音频配 3 语境,流媒体内容每音频配 2 语境,情绪录音每语境配 4 种语调。这种不均衡是设计使然,不是采样偏差,复现时必须保留相同配比,否则区分度不可比。

基线包括同时输出文本与语音的系列与只输出文本的系列,以及通用闭源语音模型,共 9 个,输入均为音频加文本。量表方面,模态依赖判断回应主要依据语境、话语、两者兼用还是失败;自然度为 1 至 4 分,越高越像人;区分度为 1 至 6 分,越高越随境而变。

连贯、支持性与语音表达为好、中、差 3 档,越好越贴切支持。评判分工是文本指标由文本模型判定,音频指标由能听音频的模型与人工判定。人工评测从每个模型均匀抽样,相同实例的成对模型回应交由相同标注员评判以保证内部一致,并计算标注员间一致性与人机一致性。

为便于核对总量口径,下表把实例总数与配对规则整理为可复述的文字表。

条件指标基线口径本基准取值比较对象
全基准实例总数每音频语境对计 1 例1,885 例英文实例3 来源合计
评判条件模态整合文本加音频共同使用归一化 0.91 为最高通用语音模型

表后需要解释主要收益与代价。该整理表的收益是把总量、复用规则与最高模态整合分数放在相同对照下,便于复现时核对划分;代价是归一化分数是论文自定义的加权汇总,不同研究不能直接比较绝对值。未胜出项是早期音频分析模型失败率更高,复现时若只测文本输出会低估其短板。

上表数字均有原文连续句覆盖,实例总数与配对规则来自构造统计,模态整合分数来自回应者结果,阅读时注意归一化是相对量而非原始量表分。

谁的回应更自然,谁更能随境而变?

回应者结果按自然度与区分度组织。测的是生成回应的共情质量,与谁比是 9 个基线在相同语境与话语下比较,条件一致性是相同实例输入相同,指标方向是自然度越高越像人、区分度越高越随境而变。

论文报告显示通用语音模型与部分全模态系列自然度最高,归一化接近 0.98,而侧重音频分析的早期系列自然度明显偏低,常给出分析性而非聊天式内容。区分度则出现反转,某音频分析模型归一化达 0.77,尤其在情绪语调子集敏感,但其自然度很低。

敏感主要来自分析腔变化而非交流,论文据此判断带音频输出能力的模型总体优于纯文本输出模型,且自然度与区分度可能是解耦能力。副语言方面,人工与模型评判一致把通用模型与新一代全模态系列排在前列,表明韵律控制更好。下表把自然度与区分度的关键数字放在相同框架下,便于看到解耦。

条件指标自然度最高组自然度次高组区分度最高组
全基准总体归一化分数越高越好0.98 通用模型0.96 2 个模型并列0.77 音频分析模型
情绪语调子集区分度越高越敏感分析腔变化为主聊天式变化较少情绪子集最敏感
副语言排序人工与模型一致前 3 含通用与新系列中部为语音聊天模型尾部为早期分析模型

表后解释主要收益与具体代价。收益是自然度最高的模型确实更像人聊天,代价是其区分度排名反而靠后,说明像人不等于随境而变;反例是区分度最高的模型自然度垫底,说明敏感不等于会共情。复现时不能只看单一指标选优,必须同时报告两者。

细粒度韵律能否被文本描述替代,是本节的反证重点。下图比较了人工听音频、模型直接听音频、模型看自由描述与看客观描述 4 种条件,纵轴是 5 分制副语言质量,越高越好。

看图路径: 1. 先确认横轴 5 个被评模型与纵轴 5 分制副语言质量;2. 比较橙色人工线与蓝色直接听音频线的相对高低与排序;3. 观察绿色自由描述线为何系统性偏高而浅绿客观描述线更接近人工

原论文 Figure 4:Average 5-point paralinguistic (delivery) eval- uation (y-axis) for model on x-axis.

论文图 4。原论文 Figure 4:“Average 5-point paralinguistic (delivery) eval- uation (y-axis) for model on x-axis.”。

图中横轴为 5 个被评模型,纵轴为 5 分制副语言质量,越高越好。可见直接听音频的模型评分系统性高于人工,自由音频描述的评分更高,而客观声学描述更接近人工但仍有差距。这支持论文判断,也就是音频字幕不能替代直接听音频,细粒度表达评估仍不可靠,需要音频原生评判器。

评判者何时与人一致,何时失效?

评判者实验测的是模型能否不依赖转写文本判断语音回应的共情。与谁比是通用语音模型、新系列与早期音频模型之间比较,条件一致是相同批抽样音频回应由双人工与各模型按相同指示打分,指标方向是一致率越高越接近人工。

论文报告通用模型在连贯上达 84.9%,在语音表达上达 88.7%,接近人与人之间的一致性;新系列在支持性上平均达 88.8%,与人与人相当。这支持粗粒度自动评估可行的判断,说明最佳模型有潜力完成粗粒度自动共情评估。

反证是早期音频模型在各维度 1 致性明显偏低,且在语音表达上出现极化打分与对特定系列的偏好,说明面向音频分析的老模型不适合做共情评判。另一项细粒度实验用 5 分制比较人工、直接听音频、自由描述与客观描述,发现自由描述显著高估,客观描述虽更接近但仍不能复现排序。

这说明文本中间件会丢失关键韵律信息。下表把人机一致的关键数字与失败条件并置,便于同时看到可用边界与不可用边界。

条件指标通用模型一致率新系列一致率早期模型表现
连贯判断与人工一致越高越好84.9% 最高中高接近人工明显偏低
支持性判断与人工一致越高越好高位稳定88.8% 可比人工明显偏低
语音表达判断与人工一致越高越好88.7% 最高中高稳定极化且有偏好

表后需要说明代价与边界。收益是粗粒度 3 档评价下最佳模型可用作自动奖励或筛选;代价是结论不推广到细粒度情绪渲染,因为合成语音本身表达变化有限,模型多靠文本分析判断情绪。未评测边界是跨语言与跨文化共情策略差异,本基准仅为英文。

上表同时保留了胜出项与未胜出项,避免只看最高值误以为所有模型都可用。早期模型的低一致性提醒复现者不能随意更换评判器。

哪些结论不能推广,缺了哪项验证?

论文明确列出 3 项局限。第 1 是语言与文化范围仅为英文,共情策略、情绪线索与语音表达自然度随语言群体变化很大,中文或其他语境下的结论待验证。把英文结论直接搬到其他语言是不严谨的。

第 2 是量表为粗粒度 3 档,虽然粗粒度下人机一致性高,但细腻情绪意图与一致性的评估仍具挑战。合成语音表达变化有限导致情绪评估多为中性,无法可靠显示系统间情绪渲染差异。论文曾尝试评价副语言情绪但未能有效工作,相关细节归入局限而非正结果。

第 3 是评估成本与部署开销未被系统测量。论文未报告延迟、计算预算与误判率,也未承诺这些量得到改善。总体趋势不等于每组数据都成立,复现者不应把粗粒度一致率高理解为模型已具备人类水平的细粒度共情。

伦理方面,高度共情能力可被用于操纵、钓鱼或虚假信息,处理用户情绪音频涉及隐私风险,未来部署需要保障机制与隐私设计。标注员为大学学生帮手,按每小时 16 USD 支付。复现者应保留相同的公平补偿原则,不应压缩标注质量。

复现先做什么,需要保留什么条件?

复现先做 3 件事。第 1 是按 3 来源重建实例配比与过滤规则,排除肢体动作、复杂推理任务与针对真人的亲密纠纷,保留清晰表达的真人语音,情绪录音剔除困倦语调。日常对话每音频 3 语境,流媒体每音频 2 语境,情绪录音每语境 4 语调。

每对音频语境计 1 例,总量 1,885 例。约 7 成自动语境直接可用,其余需人工修订,说明自动构造不能免检。第 2 是保留评测指示原文的量表定义,自然度 1 至 4 分、区分度 1 至 6 分、其余 3 档。

文本指标由文本模型判定,音频指标必须直接听音频,不能用字幕替代,成对比较时相同实例交由相同标注员评判。第 3 是保留基线对照,同时测带音频输出与纯文本输出 2 类模型,同时报告自然度与区分度,避免单指标选优。

关键超参数与信息条件方面,论文未报告解码与采样细节,复现时应固定并记录所用版本与参数。资源方面,本次证据未确认代码数据可达,不应默认可下载,应先核对官方链接状态。下表把可直接执行的核对动作整理为清单,数字均有原文依据。

条件指标需保留动作本方法代价比较对象
数据重建实例口径一致1,885 例配比不变人工修订约 3 成自动生成语境
评测执行直接听音频不用字幕替代听觉文本描述会高估音频原生评判
结果报告双指标并列自然度加区分度同报单指标会误导选型粗粒度 3 档结论

表后解释取舍。该清单的收益是保证可比性,代价是人工核验与听音频成本较高;反例是若为省成本只用字幕评估,细粒度排序将失真。是否值得尝试取决于是否接受粗粒度筛选,若需要细粒度韵律优化,则还需补做音频原生评估与多文化验证。

上表中的字幕不能替代听觉的判断来自论文对细粒度实验的总结,复现时应作为硬约束。任何把音频转写后打分的做法都不应声称测到了副语言共情。

学完这篇应该带走什么判断?

带走的判断有 3 层。问题层是共情必须同时看说了什么与怎么说,转写加文本指标只能覆盖一半,语境切换与语调切换是分离 2 种能力的最小对照。缺少任 1 对照都会把理解失败与感知失败混为一谈。

方法层是反向构造语境加人工核验的流程可行,但约 3 成需修订,说明自动构造不能免检;评价必须分工,文本看连贯支持,音频听语音表达。证据层是带音频输出的全模态模型在自然度与副语言上占优,通用模型自然度归一化 0.98、连贯一致率 84.9%、表达一致率 88.7%。

新系列支持性一致率 88.8%,但区分度最高的反而是自然度低的分析模型,且细粒度韵律评估中文本描述系统性高估。适用条件是粗粒度筛选与训练奖励可用,细粒度优化与跨语言推广待验证。

初学者复述时应沿单样本走完输入到输出,再展开 2 分支对照,最后用双指标与人机一致率收束。这样既能讲清机制,也能避免把相关性说成因果,也避免把无训练说成确定性。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总