英文题目:StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

会议身份:conference:interspeech:2026:conference-paper-id:wang26fa_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #音频大模型 #语音 #语音属性识别

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Yuzhe Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Thomas Thebaud:机构信息未能从会议 PDF 纯文本可靠映射
  • Jennifer Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jesús Villalba-Lopez:机构信息未能从会议 PDF 纯文本可靠映射
  • Venkatesh Ravichandran:机构信息未能从会议 PDF 纯文本可靠映射
  • Georgi Tinchev:机构信息未能从会议 PDF 纯文本可靠映射
  • Najim Dehak:机构信息未能从会议 PDF 纯文本可靠映射
  • Laureano Moro-Velázquez:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该基准输入为双人对话语音,输出为目标说话人在9个人际立场维度上的极性选择与置信度,难点在于立场依赖韵律与轮次语境且感知真值难以定义。流程先从Seamless Interaction语料固定种子抽取对话并把角色提示映射到正负极,其输出的角色极性标签进入片段构造步骤。接着构造无上下文单人声片段与有伙伴上下文的转向目标片段,其输出的待评音频进入法官评测步骤。然后由音频大语言模型法官在两种极性顺序下输出结构化JSON并聚合为会话分数以计算鲁棒性与可分性指标。与已有口语对话评测相比,该工作把评价对象从内容正确性转向社会意图,并显式分离输出可靠性与判别能力。在StanceBench基准任务下,Gemini在同情心维度S1的AUROC为0.96,高于其在权力取向维度S7的AUROC 0.86。结论仅适用于角色扮演的英语主导短对话与短片段证据,不支持稳定特质推断与长程互动外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,要解决的评测缺口是什么?

本文的输入是双人面对面会话语音,来自大规模双人互动语料。目标不是转写准不准,也不是合成自然不自然,而是评价语音对话中持续出现的互动行为,例如是否听起来温暖、共情、礼貌、果断、真诚、专注,以及在有来有往时是否投入、是否主导、是否能调节冲突。

初学者容易把这类任务理解为情绪识别,区别在于情绪常常可以落在单句上,而人际立场是说话人朝向对话伙伴的社会性定位,白话说就是你这句话是摆出亲近还是疏远,是接住对方还是压住对方,它同时依赖用词、韵律、音质和对话时机。论文把立场操作化为量表式两极对照,白话说就是每个维度都写清楚正极像什么、负极像什么,裁判每次只判断目标说话人更靠近哪一极。

必须保留的关键信息是基准名称是 StanceBench,数据基础是 Seamless Interaction 语料的即兴子集,评估对象是具备音频能力的语言模型作为自动裁判,输出是结构化判断而非开放评论。

人际立场 × 两极对照: 人际立场负责定义要评什么,即说话人相对对话伙伴的社会性定位,例如温暖相对冷漠、共情相对冷酷;两极对照负责把这种定位变成可操作的判断题,即每个维度固定正极与负极并给出可听定义,搭配理由是立场本身是知觉性和语境依赖的,直接打分容易漂移,而两极对照把裁判输出约束为二选一加置信度,使跨模型比较和阈值分析成为可能。

本解读的输出是一套可核对的方法复述:先讲与已有路线的区别,再走完一条样本的完整处理链,然后交代实验条件、主结果、反证与复现要点。阅读时请记住一个学习依赖:只有先接受角色提示只是意图明确的弱标签,才能理解后文所有可分性数字的含义,即数字衡量的是裁判能否找回角色设计制造的对照,而不是裁判读出了人耳公认的真值。

已有路线在评什么,StanceBench 补哪一块?

第一条相关路线是语音识别与语音合成的传统指标,关心转写保真、可懂度和自然度。它们能回答内容有没有传对,但不能回答对话给人的互动感受,例如投入感和支配感。第二条路线是文本对话自动评价,已有工作指出自动指标很难反映互动质量,把文本指标搬到语音会丢失韵律与时机信息。

第三条路线是固定标签的副语言挑战与口语对话理解套件,例如话语级情绪或共情标签预测、口语对话评测集。它们多用固定类别做分类,而 StanceBench 用的是量表式两极对照加裁判理由,更接近对生成式对话系统的持续评估。第四条路线是语音语言模型的音频感知裁判,已有工作探索用模型评价合成语音的说话风格或转写质量,但主要关注内容正确或宽泛风格控制。

StanceBench 的增量是把人际立场写成 9 个可复用的维度,并在受控扰动下检验音频裁判的鲁棒性。

音频裁判 × 级联基线: 音频裁判负责直接听原始语音并结合措辞与副语言线索做判断,级联基线负责先把语音转成文本再用同一量表打分,二者搭配的原因是只有对照才能分离声学信息的增量贡献,组合意义在于若端到端显著优于纯文本,则说明韵律、音质和互动时序携带了文本之外的立场证据。

举例说明这种对照的教学价值:同一个礼貌用词,用温和语气说和用阴阳怪气说给人的立场完全不同,纯文本裁判只能看到用词,音频裁判还能听到语气,这正是后文做音频去掉对照的原因。需要提醒的是类别差异不能当成同条件胜负,例如把单句情绪分类准确率直接拿来比较多轮立场可分性是不公平的,因为输入长度、语境和标签定义都不同。

为什么立场的真值很难定义,论文如何绕开?

论文要回答的问题是音频裁判在什么立场维度上可靠,在什么维度上失效。难点有 3 层。第一层是信号纠缠,立场同时藏在词汇选择、韵律、音质和轮替时机里,孤立单句往往证据不足。第二层是语境依赖,同一个简短回应放在安抚语境和挑衅语境里含义不同,因此互动维度必须给裁判看到对话伙伴。

第 3 层是标签有效性,立场是知觉性的,多个人可能给出都合理的判断,不存在天然真值。论文的绕行办法是利用即兴子集的角色提示,例如 1 位扮演狡黠顾客想找借口退费,另 1 位扮演亲切店主接待并共情倾听,这类成对提示明确制造了对照。于是研究把角色提示映射为弱监督的两极标签,评测裁判能否恢复这种预期的对照。

同时论文承认这只是弱标签,后文用小规模人类排序相关性来检验模型排序是否贴近人耳,而不是把角色标签当成感知真值来辩护。

方法全景:一条样本走完哪些步骤?

先沿一个样本走完全程有助于建立依赖关系。假设有一个双人会话,通道是按人分开的。系统先对每个通道做语音活动检测,切出停顿间单元,白话说就是被足够长静音切开的单人连续语音块。接着按评测类别构造输入。单人评测只取目标说话人的多个单元拼接成一段,互动评测则在话轮切换边界附近取语境侧与目标侧各一段,并明确告诉裁判只评目标,用语境消歧。

然后裁判在给定立场问题与正负极定义下输出结构化判断,包含选择、置信概率和 2 到 4 条可观察依据。每个片段跑 2 次,2 次只调换正负极定义的先后顺序,用来探测位置偏置。最后把 2 次输出聚合成片段分数,再聚合成会话分数,并计算鲁棒性与可分性指标。

下面这段导读帮你按官方流程图自上而下核对 5 个阶段,以及中间分叉和右侧检查分支的位置关系,请对照像素中的箭头与方框逐项确认。

看图路径: 1. 沿从上到下主链确认数据集、预处理、输入构造、评测、指标的顺序;2. 对比输入构造分支中单人类别与互动类别的音频与文本输入差异;3. 找到评测框右侧的一致性检查分支并确认其为两次运行调换极性顺序

原论文 Figure 1:StanceBench evaluation pipeline.

论文图 1。原论文 Figure 1:“StanceBench evaluation pipeline. The pipeline be- gins with role-prompted conversations, followed by audio pre- processing and input construction for two evaluation settings.”。

该图可见的关键教学点是分工明确:数据集层负责提供角色提示到两极标签的映射,预处理层负责分通道语音活动检测与停顿间单元切分,输入构造层负责按类别组装目标与语境音频加问题文本,评测层负责量表推理与严格 JSON 输出,指标层负责把输出分成鲁棒性与可分性两类。右侧一致性检查不是事后装饰,而是与评测并列的可靠性探针,直接决定后文哪些会话会被过滤。

停顿间单元 × 目标与语境片段: 停顿间单元负责提供客观的切分原子,即由静音间隙界定的单人连续语音段,目标与语境片段负责规定裁判到底评谁以及参考谁,搭配理由是互动立场必须把被评语音局部化同时保留对话位置,组合后单人评测只给目标段,互动评测再拼接话轮切换前后的语境段,使裁判只评目标而用语境消歧意图。

9 个维度与两类输入是如何构造的?

9 个维度编号为 S0 到 S8。前 6 个属于单人评测,不给伙伴语境。S0 人际温暖问目标听起来是温暖亲和还是冷漠疏离,正极角色包括热情、亲切类,负极包括冷漠、疏远类。S1 共情与同情问是体贴支持还是冷酷无情。S2 礼貌与尊重问是礼貌尊重还是粗鲁无礼。

S3 果断问是自信坚定还是犹豫退缩。S4 真诚问是直率真诚还是狡黠操纵。S5 认知专注问是警觉投入还是迷糊分心。后 3 个属于互动评测,给伙伴语境。S6 社会投入问是与对方积极互动还是退缩脱离。

S7 权力取向问是顺应退让还是试图控制主导。S8 冲突调节问是保持冷静避免对抗还是敌对攻击。每个维度每极只保留 3 到 4 个代表性角色,目的是在计算可负担的前提下覆盖该极的语义范围,避免极端角色主导。

音频构造细节决定复现是否一致。单人片段先排除过短的回馈声和有效语音超过 45 秒的超长单元,然后按人拼接单元并在单元之间插入 0.25 秒静音,同时控制总有效语音不超过 45 秒且插入静音占比不超过 25%,最后保证每段有效语音在 30 到 45 秒之间。互动片段围绕话轮切换构建,对每个切换边界生成 2 个方向样本,切换前目标用切换后做语境,切换后目标用切换前做语境。

扩展时每次加与切换相邻的同人单元,要求语境侧有效语音至少 1 秒、目标侧至少 2 秒,且单侧最多加 6 个单元并限制在切换点 30 秒墙钟范围内,若中间隔着对方超过 0.8 秒有效语音的实质插话则停止扩展,避免跳过对方去取远处语音。最后语境截取为 1 到 10 秒有效语音,目标截取为 2 到 15 秒有效语音,切换前取靠后部分,切换后取靠前部分,保持局部性。

裁判提示分两套逐字模板。单人模板说明只会听到一段目标音频,互动模板说明会听到两段音频并明确哪段是语境、哪段是待评目标,要求只评目标而用语境理解意图。输出被严格约束为只含选择、概率和依据的 JSON,选择只能是正极或负极,概率是 0 到 1 之间自报的把握,依据是 2 到 4 条关于语气、韵律、用词和投入度的短语。论文明确这些自报概率不被当作校准过的置信度,只用作连续分数来衡量偏向强度。

本研究训练了什么,没有训练什么?

本研究没有训练任何裁判模型,也没有微调声学编码器或语言模型,因此不存在梯度路径、参数冻结与更新、学习率或早停等训练事项。5 个裁判都是现成调用:Qwen2.5-Omni-7B 是端到端全模态开源基线,Kimi-Audio-7B-Instruct 是面向音频理解与交互的开源音频专用模型,Granite 语音模型是把语音转成文本表示后再用同一量表打分的级联基线。

GPT 音频模型与 Gemini-2.5-Flash 是闭源商用接口裁判。所有模型共用同一立场量表与同一输入构造管线,区别只在模型相关的推理适配器。运行时关闭采样以保证确定性,每个片段每个极性顺序各尝试 1 次,若输出不是合法 JSON 则丢弃并计入失败率。

缺项需要明确指出:原文未报告各模型的内部解码温度之外的细节,也未报告重试策略之外的纠错机制,因此不能从模型名称推定其内部如何融合声学与文本,也不能把无训练等同于输出天然稳定,稳定性必须靠后文的失败率与顺序分歧率来实测。

数据抽样、过滤与指标如何保证可比?

数据来自 Seamless Interaction 已发布的 4000 多小时双人互动,论文只用即兴子集,因为该子集给每人单独发放了明确指定立场行为的角色提示。由于运行与计算约束,论文用固定随机种子 1 次性抽取 25% 即兴会话,得到 2431 个会话和 484 位不重复说话人,所有裁判评同一子集。

公平比较的关键是取交集:只保留所有被比较模型都返回合法结构化判断的会话实例,避免某个模型在难例上失败反而显得分数高。进一步过滤规则是若一个会话内超过 20% 片段在两种极性顺序下选择不一致,则整个会话被移除,后续指标都在过滤后集合上计算。

分数聚合分两步。每片段有 2 次输出,先把每次的选择与自报概率转成带符号概率,正极取加概率、负极取减概率,再对 2 次取平均得到片段分数,降低顺序影响。然后对会话内所有可用片段取平均得到会话分数,范围在负 1 到正 1 之间,越大表示越偏向正极。指标分 3 组。鲁棒性组包括已评实例数、失败率和平均片段分歧率。分类组包括固定阈值 0 的极性一致率、在会话分数上扫阈值得到的最优 F1、等错误率和 ROC 曲线下面积。

人类对齐组是对 122 个实例做小规模人评,每组 3 人标注同一子集,人先选极再给 0 到 1 步长 0.05 的把握,按人与模型实例分数算 Spearman 相关,只用于检验排序对齐,不用于验证角色标签为真。代码与数据资源状态需要如实交代:本次收到的资源清单显示代码与数据集链接当前可用,状态码均为 200,因此可以写当前已公开,但复现仍应以固定种子抽样与交集过滤为准。

主结果:哪些维度可分,哪些裁判更稳?

要回答的核心问题是裁判在角色预期的两极上能分开到什么程度,以及这种分开是否伴随高失败或高顺序敏感。比较必须在同一过滤后交集上进行,指标方向是极性一致率、最优 F1 与 ROC 面积越高越好,等错误率、失败率与分歧率越低越好。总体模式是共情与礼貌最易分,温暖与果断中等可分但有正向偏斜,诚实最难且顺序偏置高,专注可分但与人对齐弱。

下表提出一个可核对的比较问题:在共情维度上闭源裁判的可部署固定阈值表现与排序上限各是多少,公平条件是同一交集会话与同一弱标签,指标方向为一致率与 ROC 面积越高越好而失败率与分歧率越低越好。

维度与模型失败率分歧率极性一致率ROC 面积等错误率
S1 GPT0.000.020.880.940.09
S1 Gemini0.020.040.930.960.06
S1 开源区间0.03-0.300.01-0.440.67-0.890.66-0.930.13-0.41

表后解释需要同时看到收益与代价:共情维度的收益来自显性声学与词汇标记,例如韵律与明确安抚语,两闭源模型在固定阈值下已达 0.88 与 0.93 的一致率且 ROC 面积达 0.94 与 0.96。代价是开源端到端裁判失败率明显更高,区间达 0.03 到 0.30 与 0.01 到 0.44,直接减少可用覆盖。至少一个未胜出项是部分模型在温暖与诚实上的上漂与重叠,说明稳定不等于判得准,必须分开报告鲁棒性与可分性。

极性顺序一致性 × 可分性: 极性顺序一致性负责衡量裁判自身的稳定性,即把正负极定义顺序调换后选择是否改变,可分性负责衡量裁判信号能否把角色提示预期的两极分开,二者必须分开报告的原因是稳定不等于判得准,组合意义在于只有同时通过低顺序敏感和高的排序指标,才能说该裁判在该维度上既可靠又有效。

下面这段导读帮你读小提琴分布图的行列结构与纵轴含义,再对比各维度 2 极的集中、重叠与拖尾形态,请先确认行列再看中位数横线的位置。

看图路径: 1. 先按行确认五个裁判模型,再按列确认左为正极右为负极;2. 对比共情与礼貌列的两极分布是否分别集中在正负两端;3. 观察诚实与温暖列的负极分布是否上移并与正极重叠

原论文 Figure 2:Half-violin distributions of conversation-level signed- probability scores for judge models…

论文图 2。原论文 Figure 2:“Half-violin distributions of conversation-level signed- probability scores for judge models (rows) and stance dimen- sion (x-axis).”。

该图可见的内容支持上述判断:共情与礼貌列的两极分别聚在正负两端,分离干净。温暖与诚实列的负极明显上移,与正极重叠。果断列的正极在负 1 到 1 之间铺开,负极更集中,说明果断角色包含坚定与温和坚定多种风格。互动列中社会投入重叠大,权力取向拖尾重,冲突调节在显性攻击处有强负分但大量片段堆在中性附近。像素不能精确读出每个中位数数值,因此本段只做形态判断,具体数值以上表与原文区间为准。

去掉音频会怎样,证据类型是否随维度而变?

消融要回答的是声学通道的增量作用。做法是固定 Qwen 裁判与全部实例、平衡位置变体、打分与过滤流程,只改变输入:基线给原始音频并允许使用措辞与副语言线索,对照组先用语音识别转写再只给纯文本并限制只能用文本可见线索。比较问题是去掉音频后可分性与人类对齐是否下降,公平条件是只在两种管线都输出合法的交集上计算。

下表提出第二个可核对的比较问题:在固定 Qwen 与固定交集下,去掉音频后各维度 ROC 面积下降多少,公平条件是同一打分与过滤流程,指标方向为 ROC 面积越高越好而等错误率越低越好。

设置变化方向基线 ROC 面积去音频后 ROC 面积适用条件与代价
S4 真诚下降最大0.710.63单人维度最依赖副语言
S0 温暖下降0.740.69社会规范下弱线索需听感
S5 专注下降0.730.70时机与应答需韵律
S1 共情小幅下降0.850.82显性措辞可部分补偿
S2 礼貌小幅下降0.910.87显性措辞可部分补偿

表后解释需要区分直接报告与有限解释:论文报告去掉音频后单人维度多数下降,真诚维度从 0.71 降到 0.63,温暖从 0.74 降到 0.69,专注从 0.73 降到 0.70,共情从 0.85 降到 0.82,礼貌从 0.91 降到 0.87,人类对齐也多数下降。支持的判断是声学证据在多数维度有帮助。未胜出或反例是冲突调节去掉音频后反而从 0.62 升到 0.67,该文解释为剩余误差更可能来自互动歧义与语境不足而非缺听感,可能但待验证。

模型层面比较同样要保留可运行策略。GPT 失败率最低且在 5 个维度上 ROC 面积最优,但在权力取向上顺序敏感达 0.18。Gemini 在共情与权力取向上最优且接近零失败,但在专注与温暖诚实上弱于 GPT。开源 Qwen 顺序最稳但失败率高且互动维度弱,Kimi 在温暖专注上有亮点但失败率最高可达 0.44。Granite 接近零失败但在诚实上接近随机,这正是级联路线代价的直接证据。

哪些结论不能推广,误用风险在哪里?

第一个限制是弱监督。角色提示是意图明确但不是感知真值,演员可能没有演到位,裁判也可能靠刻板印象猜对,因此高可分不等于高感知准确,低可分也不等于模型无能,可能只是标签噪声。第二是抽样与片段长度。只评了 25% 会话且片段被截到数十秒,长程互动现象会被欠指定,诚实与冲突这类需要跨轮证据的维度受影响最大。

第三是人类覆盖有限。只有 122 个实例进入人评,每个实例 3 人标注,专注维度的低相关可能部分来自标注噪声与覆盖不足,不能直接断言模型与人用了不同代理。第四是可靠性与部署成本未被完整测量。失败率与顺序分歧是在单次尝试加丢弃非法输出的协议下测得的,没有报告重试开销、延迟与费用,因此不能承诺加重试后一定改善,也不承诺总体趋势在每组每步都成立。

弱监督标签 × 人类一致性: 弱监督标签负责提供大规模但不完美的期望对照,即演员拿到的角色提示所意图的立场,人类一致性负责检验模型排序与人耳感知的对齐程度,搭配理由是角色意图不等于实际听感,组合后可以用角色标签算可分性,再用小规模人评检验该可分性是否对应人的排序,避免把标签噪声误读为模型能力。

误用风险需要单独强调。论文明确指出该框架可能被误用于未经同意从声音推断人格特质,而现有结果不支持稳定个体层面特质推断。初学者常见误解是把某次高置信判断当成对人的定性,正确理解是裁判输出只是在给定量表与给定片段下的相对排序信号,换量表、换片段长度或换语境都可能改变结论。

要复现这套流程,先做什么?

复现的第一步是拿到数据与代码并固定抽样。用公开仓库中的脚本按固定随机种子抽取相同的 25% 即兴会话,确认得到 2431 个会话量级,并记录说话人划分,避免自己重新随机导致与原文交集不一致。第二步是复现语音活动检测与停顿间单元参数:25 毫秒窗、10 毫秒跳、0.3 秒静音切分、有效语音不足 0.2 秒记为回馈声,单元长度按有效语音而非墙钟计算。

第三步是按类别构造输入,特别注意单人拼接的 0.25 秒间隔与 25% 边界占比上限,以及互动扩展时遇到对方实质插话即停止的规则。第四步是调用裁判时关闭采样,要求严格 JSON 并跑 2 次极性顺序,非法输出计失败而非人工修复。第五步是先做交集与超过 20% 分歧的会话过滤,再算带符号概率、会话平均与四项可分性指标,最后在小规模人评子集上算排序相关。

还需补的验证包括更大规模人评、分层覆盖、分歧会话的人工复听,以及重试与模式约束对失败率的成本分析,这些在原文中未充分报告。

何时值得尝试这套方法,还缺哪项验证?

当你的任务是评估语音对话系统的互动观感而非内容正确性时,这套方法值得尝试,例如比较两个语音助手哪个听起来更共情、更礼貌、更不具压迫感。它的可复用部分是 9 个维度的提问与正负极定义、两类输入构造规则、2 次极性顺序的一致性探针,以及把鲁棒性与可分性分开报告的习惯。

若你的场景是长对话或多人会议,需要先补长语境与轮替特征,否则直接套用短片段模板会低估需要跨轮证据的维度。若你的场景涉及高风险决策或对个人的特质判断,则不应直接使用,因为弱标签与小规模人评不足以支撑个体层面的结论,且误用风险已被明确指出。

未来工作按论文规划是扩展维度与角色、扩大人评并报告一致性、引入更长上下文与轮替线索,同时把基准做成模块化开放框架以便接入新裁判。对初学者而言,最关键的带走信息是先看失败率与顺序分歧,再看 ROC 面积与等错误率,最后看人类排序相关,三者缺一都会误读裁判能力。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总