英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Puneet Mathur:University of Maryland College Park, USA
- Dinesh Manocha:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入什么、要改变什么、必须保留什么?
输入是一段固定不变的用户侧语音,里面埋了需要做决定的时刻:话中停顿、报数字、模型说话时用户闯入、需要简短应声的确认句。想改变的只是发给智能体的提示词:不给任何设定、给直白的地板规则、只给角色描述、角色加规则复述、角色与指令互相矛盾。必须保留的是同一段语音的用词、说话人、停顿长度与触发时间,这样不同提示下的行为差异才能归因于提示,而不是音频变了。
输出是两类分数。第一类看动作与时机,例如该沉默时是否开口、该打断时是否在时限内接管、被打断时是否及时停下。第二类看文字内容是否像该角色,例如苏格拉底家教不能直接给答案、同声传译不能加评论。论文要回答的是:把规则说明白模型能执行吗,只给角色模型能猜出同样动作并在正确时刻做出来吗,两种要求打架时模型知道谁优先吗。
为方便初学者,可以想一个教学示例:同一段含 2.5 秒停顿的倾诉录音,先后配给悲伤辅导与急救调度。辅导应保住长停顿,调度应尽快确认关键信息。音频完全相同,正确动作却相反,这正是论文用角色对照要制造的张力。该示例只用于理解任务,不代表论文只测这一段录音。
已有评测在测什么,本文补在哪一环?
此前的全双工评测多测会不会做动作:轮换、停顿处理、简短应声、重叠与打断、多轮交互与工具使用。另一支指令跟随评测多测是否听懂一句话的任务要求,但多为非实时或单轮文本语音。最接近的是显式轮次指令评测,给出何时打断、应声、倾听或继续的自然语言规则,看模型能否照做。
本文的位置是把显式执行往后推一步。实际部署常只配置你是分诊护士、冥想老师、即兴搭档等角色,不会逐条写出地板规则。模型需要先从角色推出该怎么做,再在实时约束下做出来。论文还加入层级问题:当显式要求与角色暗示矛盾,普通偏好应覆盖角色习惯,安全义务则应覆盖显式要求。
这种划分避免把不同能力混为一谈。能流利说话不等于知道何时说话,内容像角色不等于动作像角色,能跟一条指令不等于能在两条指令中选对优先。论文用配对条件把三者分开测量,这是它与前人表格中多列同时打钩的对应之处。
八个角色与六类探针如何制造可比的冲突?
论文选了 8 个行为对比鲜明的角色:急诊分诊护士、悲伤辅导、911 调度、冥想指导、苏格拉底数学家教、得来速点餐员、同声传译、即兴搭档。它们在打断、应声、沉默容忍、复述与被闯入后的处理上故意不同。同一类事件在不同角色下正确答案不同,例如长犹豫对辅导应保留,对调度则需尽快澄清。
每角色配 6 个探针:4 个共享结构加两个角色特有。共享结构覆盖话中停顿、分段听写、用户闯入修复与注意力确认,保证跨角色可比;特有探针测该角色的标志行为,例如临床红旗、11 秒静默、数学中间步错误、条款边界前的停顿、模糊点餐项。每个探针只评第二轮中的受控触发点,第一轮只做上下文。
关键的防泄漏设计是角色文本只暗示行为,不直接写出轮次动词。构造时用两道门:角色中不许出现第二人称的打断、等待、复述等祈使;角色与对应显式指令的内容词重叠必须低于 0.15。这样纯角色条件才真的需要推断,而不是照抄提示里的动词。
五档条件与两条评分线如何组织一次评估?
现在看总览图能 1 次理清数据流。左侧是固定用户语音加可变的提示档位,中间是被测的实时语音智能体,右侧是动作分数、内容分数与冲突层级 3 条评分线。底部把测试目标并列为显式执行、角色暗示与冲突解决,提示读者不要只看一个总分。
看图路径: 1. 先从左到右看三栏:输入含用户语音与五档提示,中间是实时智能体,右侧是三类评估;2. 再看左侧五档标签如何对应默认、显式、纯角色、角色加规则与冲突;3. 最后看底部三项测试目标如何把显式执行、角色暗示与冲突解决并列

论文图 1。原论文 Figure 1::“DuplexSpeechBench–IFEval (DSB-IFEval) provides user-side spoken interactions and varying instruction/persona conditioning to real-time speech agents, and evaluates explicit…”。
论文图 1 把输入、智能体与评估分成三栏。输入侧的五档变化只改文字提示,不改音频与时间;评估侧用确定性判定管何时做,用语言模型评审管说什么像谁,冲突部分再单独看选了哪一边。这种分离让同一段录音能同时回答执行、推断与选边 3 个问题。底部三格也提醒读者:显式做对不等于角色能推出,冲突选对不等于动作能在时限内落地。
五档条件的细节由第二张图展开。L0 是空提示的默认行为基线;L1 是无角色的直白规则;L2 是只有角色、需要推断;L3 是角色加其蕴含规则的复述;L4 是矛盾条件,再分成普通偏好应胜出的 L4a 与安全义务应胜出的 L4b。
看图路径: 1. 横向比较 L0 到 L4 五列的提示条件有何不同;2. 纵向对照每列下方期望行为的判定焦点;3. 重点看 L4 列如何分成指令优先与角色优先两个子格

论文图 2。原论文 Figure 2::“DuplexSpeechBench–IFEval (DSB-IFEval).”。
这张图的读法是横看提示、纵看期望。L0 看默认地板倾向,L1 看照章执行,L2 看先推断后执行,L3 看复述是否有增益,L4 看层级选择。L4 分成两格很关键:同样是矛盾,正确优先方向相反,模型不能用跟最后一条指令的捷径同时拿满两格。
动作词表与配对指标各自分工是什么?
动作词表把地板行为拆成 9 个可判定的操作:倾听、简短应声、不应声、打断、接话、复述、让出、顶着重叠说完、接受重叠。每个用例只指定一个期望动作与一个评分时间窗。例如倾听要求窗内无模型语音,应声要求短片段完全落在用户语音内且用户保住话轮,打断要求在触发后时限内新起音,接话要求用户结束后有限等待内开口,复述要求覆盖听写目标,让出与继续看闯入后是否及时停下。
全双工 × 地板管理: 全双工指智能体能同时听和说,不必等用户说完才准备回应;地板管理指在每一刻决定听、简短应声、打断、接话、顶着重叠说完还是让出。这两个术语组合成全双工地板控制:前者给出同时读写音频的能力,后者给出何时用这种能力的策略,组合后才把能不能同时说话变成该不该在此时说话。
配对指标建立在动作分数之上。指令遵守分数(Instruction Adherence Score,IAS)是某条件下通过率的均值,公式符号对应模型、条件与每个用例的二值判定。
\[\textsc{IAS}(m,L)=\frac{1}{N}\sum_{i=1}^{N}V_{m}(x_{i}).\]公式把每个用例的通过记为 0 或 1,再在该条件下平均,得到该条件的动作遵守率。蕴含差距是 L1 减 L2,衡量少了明说损失多少;冗余增益是 L3 减 L2,衡量复述是否帮忙;角色税是 L3 减 L1,衡量多加角色是否干扰已说明的执行。角色内容分数另起一条线,用 0 到 100 评价用词与内容是否符合角色,不看时机。
显式指令 × persona 暗示行为: 显式指令是直接写出何时打断、何时沉默的规则;persona 暗示行为是只给角色描述,例如悲伤辅导要留白、急救调度要追问,期望动作从角色中推出。两者组合成论文的核心对照:同一段用户音频配不同提示,比较直接执行与先推断再执行,组合后才能分离听懂规则与猜对角色两步。
指令遵守分数 × 角色内容分数: 指令遵守分数管动作和时机,用录音与已知时间戳做二值判定;角色内容分数管说什么话是否像该角色,用语言模型看文字稿打分。两者搭配的原因是同一句得体的话放在错误时刻仍算失败,组合后才能区分嘴上像角色与行动上像角色。
蕴含差距 × 角色税: 蕴含差距是显式条件减去纯角色条件的动作分数,衡量推断的代价;角色税是角色加规则条件减去纯显式条件,衡量多加角色是否干扰执行。两者组合成配对效应分析:前者看少了明说损失多少,后者看多了角色是否添乱,组合后才能判断加信息究竟是帮助还是负担。
这种组合的意义在于把绝对高分与条件敏感分开。一个模型在纯角色下分数不低,可能是默认行为恰好命中,而非真的随角色改变;只有看 L1 到 L2 的变化,才能判断它是否在推断。内容分高而动作分不动,则说明嘴上像角色、手上不跟,这是论文反复强调的分离。
同一段音频如何复用到一千多个用例?
生成分 4 步。先定角色与探针模板,再用语言模型写两轮用户侧对话并插入结构化时间标记,然后把标记间的语音片段独立合成、按指定时长插入静音与间隔,最后把同一段对话复用到各档条件。基础网格是八角色乘六探针乘五实例,共 240 段用户对话;L1 到 L4a 各取全网格,L0 取每格第一个实例,L4b 只取 6 个安全相关格各五实例,合计 1038 个评估用例。
语音侧用多说话人合成,每段对话固定一个声音,跨条件不变;停顿与间隔是程序插入的精确静音,不是靠标点语气拖出来的。强制对齐给出词级时间,但评分用的探针边界直接取自构造元数据,避免从混音中反推。同一用户波形在不同条件下的字节与时间完全一致,只有发给被测模型的系统提示不同。
还有一个匹配音频诊断子集:对部分共享探针,同一段波形同时挂到分诊护士、悲伤辅导与 911 调度 3 个角色下。只有角色与期望动作变化,词语、音色、停顿与声学实现完全固定。这组设计不证明因果的全部链条,因为期望动作也随角色变了,但它能排除声学差异,检验模型是否随角色改变地板行为。
没有训练阶段时,确定性求解与推理如何运行?
本基准没有训练可学习模型的部分,需要明确说明没有训练阶段。被测的是 6 个现成实时语音系统,评估时不更新任何权重。真正的计算发生在运行时编排与确定性评分两处,复用模型的推理按各自适配器执行,评分按录音与时间戳执行。
运行时走单会话流程:载入预生成的用户音频与条件提示,打开全新会话并施加 1 次系统提示;按轮次管理播放用户流,闯入用例在检测到模型起音后加固定延迟注入用户语音;语音活动检测只决定何时开始下一段用户音频,不截断已在播放的用户流;用户与模型音频按公共时钟记入双通道文件,同时保留模型原生文字稿。每个用例用全新状态,避免跨用例记忆。
评分时动作判定不依赖语音识别的内容理解,而是看模型语音活动区间与触发窗的关系,外加复述覆盖率等确定性检查。内容与冲突判定则调用语言模型评审,看文字稿的用词与内容是否符合角色,并在冲突用例中给出指令胜、角色胜、折中或混乱四选一。阈值可事后重算而不必重跑模型,论文用 180 组阈值组合检验排序稳定性。
实时编排、被测系统与判定阈值如何固定?
为理解可复现性,先看运行时编排图。它把用户流不可暂停、不可倒带作为不变量,模型行为完全不受限。左侧 4 步只控制用户侧,中间展示接话、重叠与被闯入截断 3 种时序,底部产出双通道波形、事件日志与评审输入。这种设计让跨系统比较公平:用户时间线相同,差异只来自模型。
看图路径: 1. 先看左侧四步:清单、轮次管理、语音活动检测与双通道录音;2. 再看中间用户流与模型流在时间轴上如何出现重叠与打断截断;3. 最后看底部三个产物如何分别支撑动作判定与内容评审

论文图 4。原论文 Figure 4::“Runtime user orchestrator. Pre-generated user audio is streamed through controlled take-turn and barge-in events while model behavior remains unconstrained, producing…”。
图中可核对的是上下两条时间轴:上为用户通道,下为模型通道,重叠段标出全双工,闯入段标出模型被截断。左侧语音活动检测用 Silero 实现,负责起音与静音判断;双通道录音用公共时钟对齐。底部 3 个产物分工明确:波形供动作判定,日志供时间窗还原,文字稿供内容评审。
被测系统覆盖不同地板机制:帧同步的 PersonaPlex、F-Actor 与 Moshi,服务端语音检测介导的 GPT-Realtime,以及轮次制的 MiniCPM-o 与 Fun-Audio-Chat。其中 Moshi 作为 persona 盲对照,没有文本角色通道,它的 L1 与 L2 不应有系统性差异,可作为配对比较的噪声基线。评估用统一编排逻辑加模型适配器,只处理采样率、编码与流式差异。判定阈值包括接话等待、让出延迟、打断延迟与应声时长上限,默认外还做阈值扫描看蕴含差距排序是否稳定。
下表先回答基准规模与条件构成问题。统一条件是同一段用户音频复用,比较对象是五档提示,指标方向是动作分越高越好、内容分越高越好。
| 条件 | 用例数 | 选择规则 | 音频是否复用 | 提示内容 |
|---|---|---|---|---|
| L0 空提示 | 48 | 每格取实例 1 | 是 | 无角色无规则 |
| L1 显式规则 | 240 | 全基础网格 | 是 | 直白地板规则 |
| L2 纯角色 | 240 | 全基础网格 | 是 | 角色描述 |
| L3 角色加规则 | 240 | 全基础网格 | 是 | 角色加蕴含规则 |
| L4a 良性冲突 | 240 | 全基础网格 | 是 | 角色加普通偏好 |
| L4b 安全冲突 | 30 | 六格各五实例 | 是 | 角色加压制安全动作的要求 |
上表依据论文正文整理,不冒充原表。它的作用是说明 1038 这个总数如何由 240 段对话展开,以及 L0 与 L4b 为何是子集。不能从这张表推出任何性能高低,它只固定比较的公平条件:词、音色、停顿与触发时间跨条件不变。动作判定用已知时间戳,内容判定用原生文字稿而非对用户侧做识别,这是复现时最容易搞错的两处。
显式能执行,角色能推出吗?
先看默认与显式的关系。默认行为本身差异很大,轮次制与部分帧同步系统起点较高,直白规则让 F-Actor 提升最明显,Moshi 反而下降。纯角色条件更难,因为行为不再明说。绝对值上高分还需结合角色变化引起的行为差异来解释:persona 盲的 Moshi 在 L1 与 L2 完全相同,说明不改变地板行为也能拿到不低的绝对分。
下表把关键动作分数放在同一条件下比较,统一音频、统一编排,指标方向均为越高越遵守期望动作。单位口径需要统一:端点差用百分点表示,论文 Table 5 与正文正式定义为 pp,这一正式定义优先于摘要简写。
| 系统 | L0 默认动作分 | L1 显式动作分 | L2 纯角色动作分 | L1 到 L2 变化 | 指标单位 |
|---|---|---|---|---|---|
| PersonaPlex | 6.5% | 11.0% | 6.5% | 下降 4.5 个百分点 | IAS 为 %;差值为 pp |
| F-Actor | 24.8% | 35.5% | 25.8% | 下降 9.7 个百分点 | IAS 为 %;差值为 pp |
| Moshi 对照 | 41.9% | 31.6% | 31.6% | 无变化 0.0 pp | IAS 为 %;差值为 pp |
上表依据论文正文整理,不冒充原表。最公平的净比较是看 L1 到 L2 的配对变化,而非 L2 绝对值:F-Actor 与 PersonaPlex 对是否明说更敏感,分别下降 9.7 个百分点与 4.5 个百分点;Moshi 对照在 L1 与 L2 相同为 31.6%,可作噪声基线。失败项也很清楚:PersonaPlex 整体动作分偏低,F-Actor 虽对显式响应最好但纯角色回落明显。内容是否像角色应由另一条内容评审线判断;角色推断是否成功则需对照默认行为,而非仅凭绝对高分。
内容侧呈现相反图景。纯角色让 GPT-Realtime、MiniCPM-o 与 Fun-Audio-Chat 的内容分大幅高于空提示,而 F-Actor 与 PersonaPlex 的内容分仍低。也就是说,嘴上最像角色的系统,恰是地板行为随提示变化最小的系统;地板对提示最敏感的系统,内容反而弱。这支持论文的判断:推断角色说什么与在正确时刻做出对应动作是两个可分离的能力,IAS 与 PAS 必须分开报告。
冲突与阈值能否推翻上面的分离?
冲突测试把执行失败与语义选边分开。安全冲突下动作分大面积归零,只有 MiniCPM-o 与 Fun-Audio-Chat 保留非零,说明多数系统未能在正确时刻做出安全保留行为。语义选边则显示良性冲突容易得多,显式要求应胜出时三家主流系统正确率近八到 9 成;方向反转后只有 MiniCPM-o 多数选择安全侧,其余仍偏向跟显式要求。更有说服力的是同一系统内的分裂:某系统能在三成多安全用例中语义选对,却在动作分上得零,说明认对层级不保证按时做对。
良性冲突 × 安全冲突: 良性冲突是角色习惯与一条普通偏好矛盾,此时应听显式要求;安全冲突是显式要求会压掉必须保留的安全动作,此时应让角色的安全义务优先。两者组合成指令层级测试:方向相反的优先级放在同一流程里,组合后才能看出模型是真懂层级还是只会跟最后一条指令。
下表统一冲突条件,比较语义选边与动作落地的差异,正确方向在良性侧为跟指令、在安全侧为保角色。L4b 的语义选边与动作执行须分别判定,两者分属不同评分线。
| 系统 | L4a 跟指令正确率 | L4b 保角色正确率 | L4b 动作分 | 失败形态 | 评价维度 |
|---|---|---|---|---|---|
| Fun-Audio-Chat | 89.9% | 43.3% | 30.0% | 良性强、安全不足半 | 语义加动作 |
| MiniCPM-o | 88.8% | 60.0% | 30.0% | 唯一安全侧过半 | 语义加动作 |
| GPT-Realtime | 79.6% | 33.3% | 0.0% | 选对部分但动作归零 | 语义加动作 |
上表依据论文正文整理,不冒充原表。净收益看层级而非跟随:安全层级可靠性需要单独检验,GPT-Realtime 在安全侧语义选对三成多却动作归零,说明认对层级不保证按时做对。安全部署的可靠性需要 L4b 的独立证据,这正是论文单设该条件的理由。
另一组反证来自动作与角色细分。轮次制系统在应声与打断等需在用户说话同时动作的轴上呈近二值分布,而帧同步系统更连续;聚合分把这些机制差异平均掉了。分角色看蕴含差距波动可达正负 10 个百分点以上,连 persona 盲对照在分角色下也有正负波动但平均为零,说明单角色胜负还需与 persona 盲对照和聚合结果共同解释。匹配音频下 F-Actor 随角色变化最大,轮次制两家几乎不变,进一步暴露架构依赖。阈值扫描用 180 组配置重算,平均排序相关约 0.796,首名稳定,近零差距的中段顺序易洗牌,说明顶部结论较稳、细排序不宜过度解读。
哪些边界会限制结论的外推?
基准是英文、两轮交互,不测长程角色漂移、会话中修改指令、多次交互适应与多语言轮换规范。用户语音是脚本合成加程序静音,韵律与真实人类对话的声学变异不在覆盖内。匹配音频三元组是故意构造的存在性证明,不应视为自然分布。
角色集含医疗分诊与急救调度等安全敏感场景,仅用于评估对话策略,不验证临床或调度决策。用户侧属性只用于增加措辞多样性,不用于推断受保护特征。轮换风格涉及社会规范,论文提醒不应把一种风格当成跨说话人与文化的唯一正确。
测量侧也有边界。动作判定依赖语音活动检测与阈值,论文用扫描检验稳定性,但阈值选择仍影响绝对值。内容与冲突评审用语言模型看文字稿,不看时机;F-Actor 的语音输出需经识别转写再评审,引入额外误差。空输出按无语音处理并明确标记,这是复现时需保留的约定。
复现先固定哪三件事?
先固定刺激与提示。取 240 段用户对话的脚本、波形与事件清单,核对每段的触发窗与期望动作;按 L0 到 L4b 模板施加提示,L1 用角色级完整规则而非只给当前探针答案,L3 为角色加规则拼接,L4 按格附加矛盾句。同一波形跨条件字节一致,这是配对比较的前提。
再固定运行时。每用例开全新会话,流式播放用户音频,闯入按模型起音加固定延迟注入,用户流不暂停不重绕;双通道按公共时钟录制,保留原生文字稿。帧同步、服务端检测与轮次制只通过适配器处理采样率与输入方式,不改变用户时间线。
最后固定评分。动作侧用已知时间戳与语音活动区间做二值判定,复述用已知目标文本做归一化覆盖,不对用户侧做识别;内容与冲突侧用同一评审提示与设置,冲突四分类中折中对应报告里的均衡。改阈值只需重算存储的连续测量,不必重跑模型。常见误解有三:把 L2 高分当成推断成功,忽略默认命中。
把复述加进提示当成可部署收益,忽略角色税非正;把良性冲突高分当成安全层级可靠,忽略 L4b 方向相反。论文未发布可运行权重即不代表开源可用,需按证据区分规范、数据、代码与权重 4 种状态。
什么条件下值得尝试这个基准?
如果你的智能体靠角色配置决定何时打断、应声或保留沉默,这个基准值得跑一遍。它用最小代价给出 3 段诊断:显式规则是否可执行,纯角色是否可推出,矛盾时层级是否正确。3 段不同时通过,就不要把内容分高当成部署就绪。
下表把配对效应浓缩为可操作的对照,统一配对定义,单位为百分点,正值表示前者更高。蕴含差距与角色税均以 pp 为单位,端点差不得写成相对百分比。
| 系统 | 蕴含差距 L1 减 L2 (pp) | 冗余增益 L3 减 L2 (pp) | 角色税 L3 减 L1 (pp) | 单位口径 |
|---|---|---|---|---|
| F-Actor | +9.7 | +1.9 | -7.8 | 百分点 |
| PersonaPlex | +4.5 | 0.0 | -4.5 | 百分点 |
| MiniCPM-o | +2.6 | +2.0 | -0.6 | 百分点 |
| Moshi 对照 | 0.0 | -5.1 | -5.1 | 百分点 |
上表依据论文正文整理,不冒充原表。它的新增信息是同时给出代价与基线对照:复述收益至多为 +2.0 pp 且多数系统非正,加角色也从未提升显式执行。这说明瓶颈不在信息量不够,而是把角色翻译成正确时刻动作的能力缺失。后续最需要补的验证是更长交互、多语言与真人语音,以及安全层级作为独立能力的训练与评估。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses