英文题目:HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding

会议身份:conference:aaai:2026:conference-paper-id:40419

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #多语言 #语音 #口语理解

评分:8.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Chen Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Peiji Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yicheng Zhong:机构信息未能从会议 PDF 纯文本可靠映射
  • Jianxing Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhisheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zihao Gou:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenqing Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian Yin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

人类口语理解要求从真实语音中联合推断说话人属性、潜意图与隐含情绪,输入为带噪声的自然对话音频,输出为属性与推理判断,难点在于声学线索微弱、语义含混且跨语言文化差异大。为此作者构建三阶段半自动标注链,先从影视与社交视频采集并做质量增强与转写,再用大语言模型生成先验并分别驱动音频与视觉模型抽取描述并交叉验证,最后经推理模型分层融合成多视角描述并转写为评测三元组。相对已有基准仅覆盖粗粒度分类,该设计以多模态互证替代纯人工标注,以校准干扰项与正负诱导提示显式度量细粒度辨别与鲁棒性。在涵盖16项任务的中英评测中,最强专有模型平均准确率为62.6%,显著低于人类基线的87.3%,尤其在场景与失配推理上差距突出。该结论适用于影视式自然对话的中英口语,深层推理仍受音频质量与文化表达影响,外推至会议或低资源语言尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/Ichen12/HPSU-Benchmark — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的真实口语理解问题是什么?

这篇解读的输入是 HPSU 论文的正文证据与官方原图像素,目标是让刚进入语音与音频方向的研究生能核对关键做法并复述方法流程,必须保留的信息包括数据来源、标注 3 个阶段、任务层级、评测条件与人类差距数字,输出是 1 篇按学习依赖展开的技术讲解。

语音理解在这里不是把声音转成文字就结束。论文把人类听觉拆成两层:先听到说了什么,再听出是谁在说、以什么方式说、在什么场景下说、真正想表达什么。举例来说,同样一句“好消息是人很多”,字面是高兴,语气可能是讽刺,实际情绪可能是失望。自动语音识别只能给第一层,后面几层需要同时用语调、停顿、表情与上下文来判断,这正是语音大模型被期待补上的能力。

已有评测多集中在粗粒度任务或纯文本推理,数据常是非交互或单语,缺少对隐含意图、复杂情绪与多轮动态的系统检验。HPSU 的定位就是补这一块:用真实影视与社交视频中的自然口语,同时考中英文,覆盖从说话人属性到潜台词的多级任务,并用量化的人模差距指出当前模型的短板。代码当前可用,已公开仓库地址见复现节,资源状态为 available 才可如此表述。

已有路线走到哪里:端到端语音模型与评测各缺什么?

模型路线上,早期常用级联做法,先语音识别再接大语言模型,优点是文本语义强,缺点是丢失语气等声学信息。新一代端到端语音大模型把音频直接接入大语言模型,代表包括 Qwen-Audio 系列、Kimi-Audio、SALMONN、Soundwave 与 Audio Flamingo 系列,再向外扩展到处理多模态的全模态模型与强调推理的大音频推理模型。论文认为模型能力已向前走,但评测没有跟上,仍停留在表层任务。

评测路线上,从离散声音事件、场景分类,到 SUPERB 与 HEAR 这类表征通用性框架,再到音频问答与复杂推理评测,以及指令跟随、开放式评测与超言语理解等,逐步走向更难的理解。论文点名的对照包括 MMAU、AIR-Bench、MMAR 与 MMSU 等,指出它们或偏重推理而非真实人际互动,或依赖非对话或合成数据,或缺少对隐含、动态与多语的覆盖。HPSU 与它们是同输入、同目标下的补充关系,不是同条件胜负关系:同样处理语音音频,同样想测理解,但 HPSU 把重点放在真实口语的细粒度感知与深层推断上。

对初学者而言,记住一条分界线即可:转写加推理能解决字面可解的题,声学加视觉加上下文才能解决言外之意与情绪变化的题,后者正是 HPSU 要加压的地方。

任务如何分层:从基本感知到复杂推理考什么?

HPSU 把评测组织成两个认知层级、5 个领域、16 个任务。基本感知层考说话人社会属性与表层情绪识别,复杂推理层考情绪动态、非言语行为与话语上下文。按论文表格列出的任务,社会属性有年龄、性别与口音,情绪识别有主情绪、多情绪与情绪强度,情绪推理有情绪变化的简单与困难版、言行不一致的简单与困难版,非言语行为有说话风格、可视行为与描述判断,话语上下文有意图、场景与潜台词。

题型也按难度匹配:客观题用单选题精确判定,并发情绪等多答案现象用多选题,深层语义偏差如潜台词用是与否判断。主观任务配有分级干扰项,分为相似、中性与相反,用来拉开细粒度辨别力。每个相关任务实例还包含 3 种提示变体:标准无偏提问、带正确答案暗示的正向提示、带误导线索的负向提示,每种各有多套模板以降低提示敏感性。

基本感知 × 复杂推理: 基本感知分工是识别性别、年龄、口音等说话人属性,复杂推理分工是推断意图、场景、言外之意与情绪动态变化,搭配理由是人类听觉同时包含这两层,组合意义是让评测能从接近人类水平的浅层任务一路加压到模型明显落后的深层语义任务。

理解这座桥后,再看论文的判断标准:单选与判断题只有语义等价才得分,多选题出现误选直接零分、无误选但漏选才给部分分。这种严格打分迫使模型不能靠猜测或宽泛回答拿分。

方法全景:一个样本如何走完三阶段流水线?

先沿一个样本走完全程。输入是一段野外视频,附带音频与说话文本。第一步做收集与预处理,评估音质,质量过低则做语音增强去噪,保留视频、音频与转写文本 3 种模态。第二步做信息抽取与交叉验证,先把文本送入大语言模型推测多种可能的说话人状态作为先验,再结合音频与视觉分别送入音频模型与视觉模型抽取各自视角的描述,然后互相校验对方描述中哪些部分得到本模态线索支持。第三步做融合与专家验证,把校验后的多视角信息融合成核心层、细节层与背景层的细粒度描述,再分流成两份用途。

下面这张总览图把上述 3 段画成了从左到右的主路径,是理解全文方法依赖的关键,建议按导读顺序阅读。

看图路径: 1. 先从左栏自上而下看质量评估通过与不通过的两条去向;2. 再看中栏音频模型与视觉模型如何分别产出两路描述并交叉互验;3. 最后看右栏 80% 与 20% 分流如何分别形成语音描述数据与评测题

原论文 Figure 1:Overview of the data construction and annotation pipeline for HPSC dataset and HPSU benchmark.

论文图 1。原论文 Figure 1:“Overview of the data construction and annotation pipeline for HPSC dataset and HPSU benchmark.”。

图中左栏显示质量评估的通过与去噪分支,中栏显示文本先验同时指导音频与视觉两路分析、再交叉互验得到两路描述,右栏显示融合后的描述按 80% 进入语音描述数据集、按 20% 重构成评测题并接受专家检查。右侧粉色示例展示主情绪题的 4 个分级选项,黄色示例展示描述数据的字段形态。看懂分流比例与专家检查的去留分支,就能明白为何同一批融合描述可以同时支撑训练资源与评测基准。

组件如何分工:抽取、校验与融合成题的具体动作是什么?

第一阶段的数据来自数千小时的公开音视频语料,论文点名包括 CelebV-HQ、MAFW、MELD 与 MER 等多源真实场景,覆盖电影片段与社交视频,优点是场景多样、情绪丰富、说话风格自然。预处理用音频质量评估工具打分,低于阈值用语音增强模型去噪,最终每个样本保留视频、音频与转写文本。口音相关任务还用了纯音频来源,包括 VCTK 与内部数据集。

第二阶段模仿人类多模态感知。先用文本推多种状态假设并汇总成先验,再把先验分别与音频、视觉结合输入对应模型,得到听觉与视觉的语义描述。关键动作是单模态交叉验证:把视觉描述喂给音频模型、把音频描述喂给视觉模型,评估相容性与逻辑一致性,从而得到互补的多视角支持。

语音大模型 × 级联系统: 语音大模型分工是把声学信号与语言推理放在同一端到端模型内直接建模语气和情绪,级联系统分工是先由语音识别转写成文字再交给大语言模型做语义推理,二者搭配比较的理由是分离文字可理解部分与必须依赖声音的部分,组合意义在于证明声学细节不可被转写替代。

多模态融合 × 交叉验证: 多模态融合分工是把音频描述、视觉描述与文本先验合成核心层、细节层与背景层的统一描述,交叉验证分工是把视觉描述喂给音频模型、把音频描述喂给视觉模型检查逻辑相容性,搭配理由是防止单一模态幻觉,组合意义是为后续出题提供多视角支撑。

干扰项生成 × 对抗性诱导: 干扰项生成分工是针对主观任务制造语义距离分级的相似、中性与相反选项以考查细粒度辨别,对抗性诱导分工是给同一题目配标准、无偏、正向泄漏与负向误导 3 种提示以考查鲁棒性,搭配理由是一个管选项难度、一个管提示偏差,组合意义是同时暴露分辨力不足与易被文字带偏两类失败。

第 3 阶段用分层融合策略合成开放式多维描述,核心层抓主导属性如情绪或意图,细节层抓微笑、活泼语气等细粒度线索,背景层抓噪声等上下文要素。之后 80% 构成约 50,000 条语音描述对的人类感知语音描述数据集,剩余互不重叠的 20% 用 Gemini 2.5 Pro 结构化为离散评测三元组,再经 3 名训练标注员独立审核,只有 3 人一致同意才保留,最终接受率为 81.26%。这种先机器扩量、再强人工筛选的安排,是控制成本与保证保真度的核心。

有没有训练:本研究训练了什么、冻结了什么?

本研究的主体是基准构建与评测,没有从零训练一个新语音大模型,被评测的 13 个模型是外部已有系统,论文未报告对它们的参数冻结、梯度路径或重置时机的统一控制,因此不能从模型名称推定其内部实现细节。论文明确做的学习动作只有一处经验验证:在所建的 50,000 条语音描述数据上对开源语音大模型做有监督微调,结果显示感知与理解能力有所提升,并指出该数据未来可用于可控语音生成,但原文未给出该微调的完整超参数与训练预算,复现时应视为待补缺项。

真正的计算过程集中在标注流水线而非梯度优化:转写模型产文本,大语言模型产先验,音频与视觉模型产单模态描述,推理模型做分层融合,Gemini 2.5 Pro 做结构化出题与自动裁判,人工做一致性过滤。可以把这条链理解为以模型推理与人工校验为算子的半自动标注,而非 1 次神经网络训练。未报告之处要明确指出:融合模型与出题模型的具体提示、阈值与采样参数在证据中不完整,不能自行脑补。

这也决定了复现的重点不是调参,而是跑通数据链:先复现质量过滤与转写,再复现两路抽取与交叉验证,最后复现融合、分流与 3 人一致过滤。

实验条件:数据划分、基线、指标与裁判如何保证可比?

数据规模上,评测基准包含 2 万余条专家验证的中英样本,英文 11580 条、中文 8786 条,描述数据集约 50,000 条语音描述对。划分上,融合描述的 80% 做描述数据、20% 做评测来源,两部分互不重叠,评测部分再经人工一致过滤。采样上,人类基线是每种语言 10 名母语者、分层抽样 300 题,随机猜测提供机会水平参照,转写加推理级联提供剥离声学后的文本能力参照。

人类基线 × 自动裁判: 人类基线分工是给出每种语言 10 名母语者、分层抽样 300 题的经验性能上限,自动裁判分工是用 Gemini 2.5 Pro 按语义等价而非字面匹配给所有模型统一打分,搭配理由是既要有上限参照又要能处理开放式输出,组合意义是让跨模型比较在可扩展的同时仍锚定人类表现。

指标方向是准确率越高越好,但打分强调语义准确而非字面匹配。单选与二值判断要求与参考答案语义等价,多选误选零分。更深的分析利用分级选项分布与 3 种诱导提示下的表现极差,前者看模型在不确定时是选真值还是退到相似项,后者看模型是否易被提示带偏。硬件与统计方法在证据中未交代,引用时应写未报告,不能把总体趋势推广为每组每步都成立。

下面整理评测规模与判分口径的对照,便于 1 次核对数据集、基线与聚合对象,避免把不同指标的差值混在一起。

条件指标基线本方法涉及模型比较对象
中英真实口语,2 万余专家验证样本平均准确率,越高越好人类 87.3%,随机猜测机会水平Gemini 2.5 Pro 62.6%开源 Qwen2.5-Omni 60.0%
融合描述分流,人工 3 人一致过滤接受率,越高越好未设基线最终接受率 81.26%描述数据约 50,000 条
分级干扰与三提示变体语义等价得分,误选零分人类几乎不受诱导各语音大模型转写加推理级联

上表显示人类上限与最佳模型的绝对差距、分流过滤的严格程度,以及判分对误选的惩罚。它的代价是自动裁判本身可能引入偏差,且人类只测 300 题分层样本,外推到全量 20,000 题时需谨慎。未胜出项在主结果节继续展开,潜台词与场景等深层任务是重点反例。

主结果:人类与模型的差距在哪里拉开?

主结果要回答 3 个问题:测什么、与谁比、条件是否一致。测的是 16 任务上的语义准确率,比的是 11 个开源系统加 2 个闭源系统,外加人类、随机猜测与转写加推理 3 类参照。论文报告人类平均 87.3%,最佳模型 Gemini 2.5 Pro 仅 62.6%,开源 Qwen2.5-Omni 达 60.0%,仅落后 2.6 个百分点,且在部分英文简单情绪变化与中文可视行为任务上反超闭源最佳。原生 GPT-4o 音频模型因多数拒答未纳入比较,这本身就是一个边界条件。 下图是总体准确率的直观对照,建议先看柱高再看参照线。

看图路径: 1. 先确认横轴模型顺序与纵轴平均准确率的含义;2. 再比较蓝色柱与随机猜测虚线和转写加推理虚线的位置;3. 最后找出最高的开源柱与最高的闭源柱并记录差距

原论文 Figure 3:Overall accuracy of different models.

论文图 3。原论文 Figure 3:“Overall accuracy of different models.”。

图中蓝色柱为各模型平均准确率,红色虚线为随机猜测,蓝色点线为转写加推理级联,顶部还有人类线作为上限。可见多数模型明显高于随机线但远低于人类线,只有少数模型超过级联线,其中 Qwen2.5-Omni 柱最高达 60.0%,Kimi-Audio 与 Gemini 系列也相对靠前,而早期音频模型柱明显偏低。像素最右侧被裁剪,最佳闭源数值以正文 62.6% 为准,不从柱高估读。

任务分化上,模型在性别等基本感知任务接近人类,在场景、言行不一致困难版等高层语义任务明显落后。级联方法在多情绪与意图等文字可解任务上可与最佳模型竞争,但在重度依赖声学细节的描述判断与困难情绪变化任务上落后,这支持了声学信息不可或缺的判断,也指出需要更好的多模态融合与更丰富的训练数据。

任务层指标方向人类表现模型最佳表现未胜出反例
基本感知如性别年龄口音准确率越高越好性别接近满分,年龄口音相对低性别接近人类,年龄口音差距大口音任务多模型明显落后
情绪识别与推理准确率越高越好主情绪与强度均高主情绪与强度中等困难情绪变化与言行不一致困难版落后多
非言语与话语上下文准确率越高越好场景潜台词均高意图尚可,场景潜台词差中文潜台词跨语言差距突出
总体平均准确率越高越好87.3%Gemini 2.5 Pro 62.6%开源 Qwen2.5-Omni 60.0% 紧随
参照线准确率越高越好人类上限级联在部分任务竞争声学依赖任务级联落后

表后需要强调代价与限制:百分点差距是绝对差,不是相对百分比;英文 11580 与中文 8786 的题量不同,跨语言比较要考虑音频质量来源差异;人类只测分层样本,不能视为全量真值。论文还报告人类中文得分普遍高于英文,可能与数据来源音质有关,但任务难度排序跨语言一致,这支持难度来自任务本身而非单纯语言因素,可能仍待验证。

反证与诊断:提示诱导与分级错误说明什么?

诱导实验测的是鲁棒性。对每个任务比较标准、正向泄漏与负向误导 3 种提示下的最好与最差之差,差值越大说明越易被提示带偏。论文显示人类几乎免疫,差值接近零,而所有模型都表现出明显易感性,尤其在高歧义任务如年龄、口音与困难言行不一致,以及开放式任务如可视行为、意图与场景上更脆弱。单条低频线索就可能牵引注意力,使模型放弃音频证据。推理更强与原生全模态设计的模型相对更稳,论文据此推测文本中心微调会引入文字偏置,可能仍待验证。

下图是易感性热力图,颜色越深表示极差越大,阅读时不要把深色直接当准确率低,它量的是不稳定性。

看图路径: 1. 先确认行是任务、列是模型、格内数字是三种提示下最好与最差之差;2. 再对比最右侧人类两列与左侧模型列的颜色深浅差异;3. 最后定位年龄口音与复杂情绪行中颜色最深的集中区域

原论文 Figure 4:Susceptibility of models to the biased prompts.

论文图 4。原论文 Figure 4:“Susceptibility of models to the biased prompts. Darker shades indicate a higher degree of susceptibility.”。

图中行是任务、列是模型,最右侧两列为随机与人类,整体明显更浅。左侧模型列在年龄、口音、情绪强度与困难言行不一致等行出现深色块,说明这些任务上提示变化带来大幅波动。人类列数值多为 0 到 3 之间,与模型动辄数十的极差形成对照,这支持了人类认知过滤与模型脆弱性之间的差距判断。

分级错误分析进一步定位失败性质。模型犯错多集中在选相似项而非相反项,说明不是语义完全不懂,而是细粒度辨别不足。Gemini 2.5 Pro 的真值与相似值之比略高于 Qwen2.5-Omni,暗示其消歧稍好。人类也有非零相似率,证实任务本身有主观性,目标不是绝对正确而是类人精度。教学上可以举例:把高兴误判为兴奋是相似错误,把高兴误判为悲伤是相反错误,前者多见说明模型已抓到大致方向但卡在细微差别上。

差距的形状:跨语言与任务难度带来什么限制?

差距不是均匀的。论文用量化图展示每任务上人类与模型最佳的差值,英文在左、中文在右,条越长表示人模差距越大。总体看深层任务条更长,浅层性别任务条最短。跨语言不对称是重要细节:同一任务左右长度不同,例如潜台词中文差距更大,暗示中文含蓄表达对当前模型更难,但论文也提醒音质来源差异可能是混杂因素,因此不能直接断言是语言能力问题。

下图需要按中线零点左右分别阅读,避免把条形方向误读为好坏方向。

看图路径: 1. 先确认中间为零点、左侧绿色为英文、右侧粉色为中文的人模差距;2. 再找出两端最长的条形对应的任务名称与数值;3. 最后比较同一任务左右两侧长度是否对称以判断跨语言差异

原论文 Figure 2:Difference between the best results of the models and those of human.

论文图 2。原论文 Figure 2:“Difference between the best results of the models and those of human.”。

图中可见英文场景任务条最长,中文主情绪与潜台词条也很长,而性别任务两侧都最短。英文意图差距仅 6.7,中文意图差距 11.5,说明意图相对可解。英文情绪强度差距 29.5 与中文 29.3 两侧对称,说明该难度跨语言稳定。这种形状提示后续数据与建模应优先补场景、潜台词与困难情绪推理,而非继续在性别等已解任务上过度优化。

方法局限也要写清:自动裁判用 Gemini 2.5 Pro,出题也用同一系列模型,可能存在自偏好;3 人一致过滤保证精度但可能筛掉合理分歧;未测量延迟、成本与误判率,不能承诺这些量得到改善;训练资源与推理开销未报告,总体趋势不等于每组每步都成立。

复现先做什么:按什么顺序核对才能跑通?

复现应从资源与数据链开始。代码当前可用,仓库为论文给出的公开地址,资源状态为 available 是唯一依据,本次解读不继承其他来源的可用性推断。先核对数据来源清单与题量:英文 11580、中文 8786、描述数据约 5 万、3 人一致接受率 81.26%,再核对 16 任务缩写与题型映射,避免把多选与判断的计分规则混用。

第二步跑通 3 个阶段:用质量评估与增强得到可用音视频,用转写模型得到文本,用大语言模型生成先验,用音频与视觉模型生成两路描述并做交叉互验,用分层融合得到核心、细节与背景描述,最后按 80% 与 20% 分流。第三步复现评测:固定标准、正向与负向 3 类提示模板,用自动裁判按语义等价打分,多选误选零分,人类基线按每语言 10 人、分层 300 题复测小样本上限。

复现步骤需要核对的条件关键数字或动作缺项如何处理
环境与代码公开仓库可达,模型权重另行确认代码可用不等于权重可下载权重缺失则先跑标注链
数据与划分多源视频加纯音频口音源英文 11580,中文 8786,接受率 81.26%题量对不上先查过滤阈值
标注与出题3 阶段加 3 人一致80% 描述数据,20% 评测题提示缺失则记录为待验证
评测与裁判三提示变体加语义裁判人类 87.3%,最佳 62.6%,开源 60.0%裁判偏差需人工抽检
诊断分析极差与分级分布人类极差 0 到 3,模型数十不把极差当准确率

上表把每步的可执行核对点与缺项处理写在一起,目的是让初学者先做出可运行的最小链路,再补超参数与统计细节。特别提醒:不要把无训练等同于确定性求解,融合与裁判都含采样与模型调用,输出不确定,需要固定种子并记录版本。

何时值得尝试:这套做法适合谁、不适合谁?

当你的研究问题是真实口语的言外之意、情绪动态或跨语言场景理解,且已有语音大模型在转写与粗分类上表现尚可但深层任务上不去时,HPSU 值得作为诊断尺与数据起点。它的分级干扰与对抗诱导能快速定位是辨别力不足还是易被提示带偏,它的描述数据可用于微调以补充高阶语料缺口。论文的微调验证支持了这一方向,但超参数与预算缺失,应用时要自己补对照。

当你的场景是低资源语言之外的单语干净朗读、或只关心词错率与指令跟随延迟时,这套重标注、重人工过滤的流程可能过重,且自动裁判与多模型调用成本不低。常见误解有三:把级联在意图任务上的好成绩当成声学无用,实际上声学依赖任务上它明显落后;把平均分差距当成每个任务都差,实际上性别等任务已接近人类;把模型选相似项当成完全不懂,实际上多是消歧精度不够。

收束一句话:先用 HPSU 量出深层差距,再用其描述数据补高阶训练,最后用三提示极差检验鲁棒性是否真正提升,而不是只看平均分涨了多少。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总