📄 FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
标签:#音视频理解 #多模态模型 #音频理解 #Transformer #模型评估
7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5
✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #音频理解 #Transformer | arxiv
👥 作者与机构
- 第一作者:Jeffrey M. Girard (Fluid Concepts Research)
- 通讯作者:Jeffrey M. Girard (Fluid Concepts Research, jeff@fluidconcepts.ai)
- 作者列表:Jeffrey M. Girard (Fluid Concepts Research), Jason Z. Zheng (Fluid Concepts Research), Jacqueline R. Vertino (Fluid Concepts Research), Antony D’Avirro (Fluid Concepts Research), Benjamin Peloquin (Fluid Concepts Research)
💡 毒舌点评
这项工作用一个“反语义泄露”的构建思路将社会感知评测推到了更可控的层面,信号检测理论的引入也巧妙揭露了模型“高分偏心”的表象。但96个dyad的小规模基准让多数模型无法显著脱离随机水平,置信区间宽如门板,削弱了排名比较的笃定性;而声称的“人类-模型统计不可区分”在如此小的样本下更像是一个统计学上的“无罪推定”而非真正的性能对齐。
📌 核心摘要
- 要解决的问题:现有社会智能评测常利用语义或场景信息,难以纯粹衡量从行为线索推断人际熟悉度的能力;同时缺乏零样本条件下多模态LLM与人类在匹配刺激下的直接对比。
- 方法核心:构建FriendBench基准,从Seamless Interaction数据集抽取96个必须依靠互动方式而非谈话内容来判断“熟人vs生人”的20秒冰破对话片段,覆盖文本、音频、视频三模态;收集了90名以上人类评分者的匹配标签,并评估26个来自七家公司的多模态模型。
- 新在何处:通过让所有dyad回答相同的“Either-Or (EO)”类问题,彻底抑制了对话主题差异带来的语义泄露,这是此前关系推断基准中未实现的干净行为分离;同时采用信号检测理论分离判别力(d’)与反应偏向(c),使分析超越单一准确率。
- 主要实验结果(数字与表格):
模态 人类个体平均准确率 人类群体准确率 最佳模型 最佳模型准确率 Text 49.9% 51.0% gpt_text_mini 56.2% Audio 56.3% 63.5% gemini_audio_pro 66.7% Video 60.9% 71.9% gemini_video 66.7% 最佳模型与人类群体在每一模态上准确率统计无显著差异(McNemar检验,p>0.4)。但人类各模态保持均衡回应,而强模型倾向回答“陌生人”(c≈0.77-1.06)。人类从Audio到Video有显著增益,强模型在同一迁移中准确率持平(66.7%→66.7%),表明模型未充分利用视觉通道。 - 实际意义:为多模态社会感知模型提供了一套严格控制语义的基准;揭示当前最优模型虽在准确率上与人类群体比肩,但仍存在非人化的决策偏向和视觉信号利用不足的问题,对陪伴型代理、会议助手等应用有直接警示。
- 主要局限性:仅包含每次会话最初的冰破任务,未覆盖后续互动类型;样本量(96个dyad)限制导致只有少数模型显著超越随机;评估采用零样本单一提示,未考察校准或微调后行为;所有熟悉亚型(朋友、家人等)被合并为单一类别;人类样本仅限于美国居民。
🔗 开源详情
- 代码:论文中未提及代码仓库链接
- 模型权重:论文中未提及模型权重链接(评估了 Qwen2-Audio、Qwen2.5-Omni、Voxtral 等开源模型,但未给出这些模型权重的具体获取链接)
- 数据集:FriendBench 数据集,https://huggingface.co/datasets/fluid-concepts/friend-bench(包含刺激材料、人类评分和模型预测,发布于 HuggingFace,遵循 CC-BY-NC 4.0 许可)
- Demo:论文中未提及
- 复现材料:论文附录中提供了推理配置(各模型 API、温度、种子等)及评分者指导语等细节,但未提供统一的复现代码仓库
- 论文中引用的开源项目:Seamless Interaction dataset(Agrawal et al., 2025),论文未提供该项目链接
🏗️ 方法概述和架构
FriendBench是一个严格构建的多模态零样本评测基准与人类对比研究框架。其整体流程可概括为:刺激构造→人类评分收集→模型预测采集→匹配分析。
刺激构造与质量控制体系 基准刺激从Seamless Interaction数据集中抽取自然交互子集(排除表演性即兴部分),限制在三个录制站点内。核心设计在于只选用“Either-Or (EO)”冰破游戏——一位参与者提出强制二选一假设性问题(如“会飞还是会隐身”),两人共同讨论。此策略使所有dyad(不论熟人或生人)面对同一类无直接关系信息的任务,从源头上抑制了话语文题本身泄露关系标签的可能性。每个dyad截取一个20秒片段,采样自交互早期或晚期(交叉平衡),裁剪边界对齐话轮起始处以避免切断语句。在进入分层抽样前,所有交互和片段需通过五道自动质量过滤器:确保EO提示文字非占位符(F1);保证片段内至少4个合并话轮(F2)且每名说话人至少3秒语音(F3);排除音频轨道重复或不同步的交互(F4);要求整段交互有至少90秒有效语音(F5)。此外,辅助LLM审计检查每次交互的录制提示标签是否与对话内容匹配。最终形成一个完全交叉录制站点×关系类型×性别构成的96个dyad集(每个单元格8个),且参与者互不重叠,避免身份识别泄露线索。
人类评分计划缺失设计 人类评分者通过Prolific平台招募(预设筛选:美国居民、性别均衡、无听力障碍或自闭症诊断),分为文本、音频、视频三个独立实验,各约90人(文本94,音频94,视频92)。采用6块计划缺失(incomplete-block)设计,每位评分者只看32个dyad(每个dyad被25-35人评定),强制选择“familiar”或“strangers”。此设计使每个评分者贡献足够多试验数,便于后续用贝叶斯交叉随机效应模型(bambi/PyMC)分解评分者与dyad的方差分量。评分前,受试者阅读标准指令,明确知晓讨论的是EO游戏。评分后收集TSIS社会信息处理子量表得分和自评线索使用问卷,用于个体差异分析。
模型零样本推理流水线
26个模型(涵盖OpenAI、Google、Anthropic、阿里巴巴、Mistral、Thinking Machines、Meta)在完全相同的刺激集上,按三模态独立运行。使用与人类指令高度一致的文本提示,描述背景并返回结构化的JSON:relationship_label (FAMILIAR/STRANGER)、confidence (0-1) 和简短理由。所有模型均在temperature=0(或等效的greedy解码)下运行以获得确定性输出;API随机种子固定为42,本地模型(Qwen2-Audio, Qwen2.5-Omni, Voxtral)采用确定性推理。对拒绝回答(无有效标签)的试次,计算模型准确率时仅基于已回答试次,并另列覆盖率(coverage)。少数音频模型拒绝率较高,但最佳模型在每模态均回答全部试次,不影响主要比较。部分模型启用思维链推理(如gemini-3.5-flash thinking_budget=-1, Inkling和Muse Spark启用推理),推理预算扩展至8000 tokens。
信号检测分析框架 准确率之外,分析采用信号检测理论将“familiar”视为信号类,计算每模型的d’(辨别力)和判断标准c(c>0表示偏向回答“stranger”)。运用贝叶斯交叉随机效应逻辑模型对人类试次正确性进行模态间对比,用95% HDI进行统计推断。难度分析则通过Rasch风格的dyad随机截距估计,计算跨模态、跨评分者类型的项目难度相关性。
💡 核心创新点
- 反语义泄露的任务设计:通过强制所有dyad回答同一类“EO”冰破问题,使关系判断信号不可能来自对话内容差异,迫使观察者依赖语音韵律、配合、姿态等非言辞行为。这弥补了以往社会关系推断基准(如基于图像的PISC, PIPA或基于对话语义的DDRel)中语义、场景或外表信息泄露的缺陷。
- 完整的人类-模型三模态匹配对比:同时为同一组刺激采集文本/音频/视频下的大规模人类评分(~90人每模态),使得零样本模型与人类可在完全匹配的条件下进行公平、多重测量对比分析,而非与单薄的旧基准或少量人类判断对比。
- 信号检测理论驱动的诊断分析:不以单一准确率论英雄,而是将表现拆分为辨别力(d’)和反应偏向(c)。借此发现强模型实际上是以“偏向回答陌生人”的决策规则与人类群体打平准确率,而人类自身在每模态下决策标准几乎无偏。这一框架为未来所有社会感知评测提供了可复用的诊断工具。
- 揭示视觉通道利用的模型-人类差异:通过模态阶梯比较,首次在基准层面量化展示当前最优多模态模型未能像人类那样从视觉信息中获得显著的额外收益(audio→video准确率66.7%→66.7%),而人类显著提升了11个百分点。
📊 实验结果
人类和最佳模型在每一模态的准确率与信号检测统计已列于核心摘要表格中。下面给出详细的模型层面表现表: 文本模态
| 模型 | 准确率(%) | 95% CI | 覆盖率(%) | 熟人召回(%) | 生人召回(%) | d' | c |
|---|---|---|---|---|---|---|---|
| gpt_text_mini | 56.2 | [46.3,65.7] | 100 | 20.8 | 91.7 | 0.54 | 1.06 |
| gemini_text_thinking | 55.8 | [45.8,65.4] | 99 | 27.7 | 83.3 | 0.36 | 0.76 |
| gemini_text | 55.2 | [45.3,64.8] | 100 | 25.0 | 85.4 | 0.36 | 0.84 |
| gpt_text | 53.1 | [43.2,62.8] | 100 | 29.2 | 77.1 | 0.19 | 0.63 |
| inkling_text | 52.1 | [42.2,61.8] | 100 | 16.7 | 87.5 | 0.17 | 1.03 |
| claude_text | 52.1 | [42.2,61.8] | 100 | 14.6 | 89.6 | 0.19 | 1.12 |
| muse_spark_text_high | 51.0 | [41.2,60.8] | 100 | 8.3 | 93.8 | 0.14 | 1.40 |
| mistral_text | 50.0 | [40.2,59.8] | 100 | 87.5 | 12.5 | 0.00 | -1.11 |
| muse_spark_text | 49.0 | [39.2,58.8] | 100 | 10.4 | 87.5 | -0.10 | 1.16 |
下图展示了人类和模型在不同模态下的准确率对比,直观呈现了核心实验结果。

图中可见,最佳模型(深蓝点)与人类群体(橙星)在每一模态上的准确率接近,但个体人类评分者(绿点)分布广泛。
音频模态
| 模型 | 准确率(%) | 95% CI | 覆盖率(%) | 熟人召回(%) | 生人召回(%) | d' | c |
|---|---|---|---|---|---|---|---|
| gemini_audio_pro | 66.7 | [56.8,75.3] | 100 | 39.6 | 93.8 | 1.21 | 0.86 |
| gemini_audio | 63.5 | [53.6,72.5] | 100 | 81.2 | 45.8 | 0.76 | -0.48 |
| muse_spark_audio | 57.3 | [47.3,66.7] | 100 | 20.8 | 93.8 | 0.67 | 1.13 |
| gemini_audio_thinking | 55.2 | [45.3,64.8] | 100 | 64.6 | 45.8 | 0.26 | -0.23 |
| muse_spark_audio_high | 53.1 | [43.2,62.8] | 100 | 18.8 | 87.5 | 0.25 | 0.99 |
| gpt_audio_1_5 | 53.1 | [43.2,62.8] | 100 | 87.5 | 18.8 | 0.25 | -0.99 |
| qwen_audio | 51.5 | [39.8,62.9] | 71 | 0.0 | 100.0 | 0.02 | 2.19 |
| inkling_audio | 51.0 | [41.2,60.8] | 100 | 41.7 | 60.4 | 0.05 | 0.23 |
| voxtral_audio | 50.0 | [40.2,59.8] | 100 | 100.0 | 0.0 | 0.00 | -2.32 |
| gpt_audio | 48.8 | [34.6,63.2] | 45 | 100.0 | 4.3 | 0.45 | -1.76 |
| gpt_audio_mini | 48.1 | [30.7,66.0] | 28 | 25.0 | 81.8 | 0.18 | 0.72 |
| qwen_omni | 47.9 | [38.2,57.8] | 100 | 16.7 | 79.2 | -0.15 | 0.87 |
下图分析了人类和模型判断难度的相关性。

图中显示,人类与模型的每dyad准确率在音频和视频模态上呈正相关,表明双方对哪些dyad更难判断存在共识。
视频模态
| 模型 | 准确率(%) | 95% CI | 覆盖率(%) | 熟人召回(%) | 生人召回(%) | d' | c |
|---|---|---|---|---|---|---|---|
| gemini_video | 66.7 | [56.8,75.3] | 100 | 41.7 | 91.7 | 1.12 | 0.77 |
| gemini_video_thinking | 58.3 | [48.3,67.7] | 100 | 27.1 | 89.6 | 0.62 | 0.91 |
| gemini_video_pro | 57.3 | [47.3,66.7] | 100 | 18.8 | 95.8 | 0.77 | 1.25 |
| muse_spark_video | 54.2 | [44.2,63.8] | 100 | 14.6 | 93.8 | 0.44 | 1.24 |
| muse_spark_video_high | 53.1 | [43.2,62.8] | 100 | 10.4 | 95.8 | 0.42 | 1.42 |
下图展示了人类群体投票准确率随人数增加的变化,验证了“群体智慧”效应。

图中可见,音频和视频模态的准确率随人数增加显著提升,而文本模态几乎不变,证实了音视频信号中存在可聚合的群体智慧。
统计显著性
- 仅gemini_audio_pro、gemini_audio和gemini_video的准确率显著高于随机(二项检验p<0.05)。所有其他模型无法排除随机水平。
- 人类群体准确率在Audio和Video上显著高于随机,Text上不显著。模态效应:人类的贝叶斯GLMM表明Audio>Text(Δ6.5pp, HDI[4.1,8.9]),Video>Audio(Δ4.5pp, HDI[1.9,6.8]),Video>Text(Δ10.9pp, HDI[8.5,13.3]),后验概率均>0.999。
信号检测分析与偏向
- 人类准则c在每一模态均接近0(绝对|c|≤0.23),即无偏向。
- 强模型存在显著“生人”偏向(c>0.7),如gpt_text_mini c=1.06,gemini_audio_pro c=0.86,gemini_video c=0.77,直接导致其对熟人dyad的高漏报率。部分模型则完全趋近单一答案(如voxtral_audio 100%回答熟人,qwen_audio 100%回答生人)。
- 最佳模型与人类群体在辨别力d’上相近(Video: 模型1.12 vs 人类1.16),但决策基准截然不同。
智慧群体效应
人类群体投票准确率随投票人数增加在Audio和Video中显著提升(Audio单人到群体+7.2pp,Video+11.0pp),而Text中几乎不增长(+1.1pp),证实Audio和Video中含有真实可聚合的信号,Text中信号极弱。
项目难度跨主体一致性
人类和模型共享dyad难度信号。在控制真实类后,人的群体准确率与所有模型平均准确率的相关性为:Text r=0.61,Audio r=0.58,Video r=0.44(均p<0.001),表明哪些对话难判得到双方共识,只是双方以不同决策规则应对。
🔬 细节详述
- 训练数据:不适用(零样本基准评测),但构建基准的数据来源于Seamless Interaction数据集(Agrawal et al., 2025),限制在naturalistic子集,三个录制站点。
- 损失函数:未涉及。
- 训练策略:未涉及。
- 关键超参数:模型推理采用temperature=0、seed=42,回答长度150-300 tokens(推理模型扩至8000)。严格强制JSON输出格式。本地模型采用greedy decoding(do_sample=False)。部分模型启用或禁用思维链。
- 训练硬件:未涉及训练;模型推理通过各供应商API与本地运行7B模型解决,未报告具体推理硬件和延迟。
- 推理细节:所有模型输出规定JSON关系标签与置信度,拒绝回答的试次被单独标注coverage。对于不返回有效标签的回复,视为这一试次未回答,不参与准确率计算。
- 正则化或稳定训练技巧:未涉及。
⚖️ 评分理由
创新性 (1.3/2):通过强制所有dyad回答相同的“Either-Or”冰破问题彻底抑制语义泄漏,首次在关系推断基准中实现干净的行为分离;引入信号检测理论分离辨别力(d’)与反应偏向(c),超越单一准确率;同时构建了人类与模型在文本/音频/视频三模态完全匹配的对比框架,揭示模型视觉通道利用不足,这些设计均具有鲜明的原创性。
技术严谨性 (1.2/1.5):基准构建过程及其质量控制方法严谨:五道自动质量过滤器结合LLM审计确保刺激无语义泄漏与低质量片段,分层交叉采样平衡站点、关系类型与性别;人类评分采用6块计划缺失设计,模型推理统一温度、种子与JSON输出格式,信号检测分析框架应用合理,整体方法无逻辑或推导错误。
实验充分性 (0.8/1.5):基准评估了26个模型与约90人/模态的人类评分,并提供了详细的准确率、d’、c等统计。但实验充分性受限于:样本量仅96 dyad,致使绝大部分模型无法显著超越随机,置信区间过宽,支撑“人类-模型统计不可区分”结论的统计效力不足;仅用单一零样本提示,未考察提示稳健性;未分析已收集的置信度数据;部分模型在音频模态覆盖率较低,导致不同覆盖率下准确率比较不够公平;对模型系统性偏向成因缺乏进一步的实验探究。这些缺陷削弱了部分结论的确定性与可比性。
清晰度 (1.0/1):文章结构清晰,方法、实验设置、结果与局限性均得到详尽描述,图表与表格直观展示模型性能、信号检测参数及人类分布,关键设计理由(如反语义泄漏、计划缺失设计)均予以明确说明,表达准确易懂。
影响力 (0.9/1.5):FriendBench为多模态社会感知提供了一个严格控制语义的基准,揭示了当前最优模型虽在表面准确率上与人类群体持平,但存在非人化的决策偏向和视觉通道利用不足的实质差异,对陪伴型代理、会议助手等应用具有直接警示意义。然而任务仅限于冰破场景且人类样本为美国居民,文化通用性有限,影响范围相对聚焦。
开源 (1.5/1.5):核心产物FriendBench数据集已在HuggingFace完整开放,包含刺激材料、人类评分和所有模型预测,并采用CC-BY-NC 4.0许可证,附有基本文档,开源程度满足核心产物完整开放且文档完整的标准。
可复现性 (0.5/0.5):论文详细披露了所有模型推理的关键配置(temperature=0、种子42、greedy解码、JSON输出格式、部分模型推理预算)以及人类评分收集的完整流程和指导语,基准构建的质量过滤器阈值亦在附录中给出。尽管未提供统一复现代码仓库,但上述信息足以使他人独立复现主要结果,复现条件充分。
工程/实践价值 (0.7/1.5):基准为多模态模型的社会感知能力提供了标准化的零样本评测管道与诊断工具(信号检测分解、跨模态难度分析),可直接用于后续模型的快速审计与对比,但本身不涉及系统部署或端到端工程优化,工程价值主要体现在评测框架的实用性与复用性上。
🚨 局限与问题
- 论文明确承认的局限:基准仅包含“Either-Or”冰破任务,结果可能不适用于其他交互类型;所有熟人亚型合并为单一“familiar”类,忽略了亚类内的异质性;只涉及二元互动,群体情境下的关系判断可能涉及不同线索;样本量96 dyad使单模型置信区间宽,仅最强模型显著超过随机;人类样本仅限于美国居民,可能存在文化偏倚;录制环境为固定相机和领夹麦克风,非完全自然场景;模型经单一提示评估,对措辞可能敏感。
- 审稿人发现的潜在问题: a) 核心结论的统计基础薄弱:论文最引人注目的结论是“最佳模型与人类群体准确率在统计上不可区分”(p>0.4)。鉴于只有3个模型能显著超越随机水平,此结论极有可能是样本量过小导致的II类错误。在一个96个dyad的测试集上,统计效力的缺乏使得任何“性能等同”的声明都不可靠。论文混淆了“未能证明存在差异”和“证明了不存在差异”。 b) 模型偏向成因未被探究:所观察到的模型偏向“stranger”可能是训练数据中“陌生人”对话片段更常见所造成的先验,但实验未控制或分析此类预训练偏差。不同的模型家族表现出截然不同的偏向(如Mistral偏向熟人,GPT/Claude偏向生人),论文仅描述了现象,未探究成因,使得“有效先验”的解释仍停留在假设阶段。 c) 零样本评估的局限性:零样本评估仅用单次提示,模型可能对措辞敏感,且未探究提示工程(如指导模型“假设两类人数相等”)能否减少偏向或提升视觉通道利用,削弱了关于模型具有“结构性缺陷”这一论断的强度。 d) 覆盖率的公平性问题:部分模型在音频中大量拒绝回答而不强制回答,使得准确率的比较基础不一致。虽然排名模型未受此影响,但对其余模型的比较存在偏差。一个拒绝回答的模型比一个尝试后答错的模型得分更高,这可能不公平。 e) 未充分利用置信度数据:虽然要求模型输出置信度评分,但论文没有对这些数据进行任何分析。置信度校准是研究模型元认知和决策规则的重要窗口,这一缺失是实验设计的一个遗憾。 f) 缺乏对个体评分者能力的控制:图1中个体评分者的准确率分布非常宽,但论文承认这主要是采样噪声,且TSIS评分与任务表现基本无关。这表明实验未能筛选出或识别真正的“专家评分者”,使得个体差异分析流于形式,未能加深对人类社会感知机制的理解。