DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...