英文题目:Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner

会议身份:conference:acl:2026:conference-paper-id:2026.acl-short.4

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #人类参与评测 #全双工语音交互

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Guan-Ting Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Shih-Yun Shan Kuan:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiatong Shi:机构信息未能从会议 PDF 纯文本可靠映射
  • Kai-Wei Chang:机构信息未能从会议 PDF 纯文本可靠映射
  • Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
  • Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

全双工语音交互要求模型在同时听与说中处理重叠打断,并在多轮推进里维持轮次衔接与状态一致,难点在于重叠时序与长程目标、修正采纳与指代累积相互耦合,单轮评测难以暴露状态丢失。方法分三步衔接:首先自动化考官以合成语音驱动分阶段语义目标,并按快慢两种节奏主动推进或等待轮次结束,可打断制造自然重叠。首先考官输出的阶段目标与节奏策略进入实时交互,接着编排器经WebRTC在考官与被测模型间转发规范音频帧形成实时双向闭环,使双方接受相同声学条件并保留重叠时序。最后离线将双通道录音经Parakeet-TDT转录为带时间戳文本,再由Gemini按考官剧本与阶段目标给出轮次流畅度、指令遵循与任务专项三维评分,转录输出直接进入裁判输入。与单轮脚本或仅测重叠时序评测的关键差异在于将打断处理、修正采纳与实体跟踪放在完整多轮轨迹上检验,因而能暴露快节奏下时序压力与长程一致性的耦合失效,具有可复现的多轮诊断意义。在Fast节奏任务条件下,GPT-Realtime的修正任务专项分数为4.02,高于Moshi的2.88。人类在120会话子集上的验证显示自动裁判与人工评分呈中高度一致,慢节奏下开源模型修正与实体跟踪有所回升但仍落后。结论适用边界限于英语预设剧本与合成考官语音,开放域协商、情感韵律与多语言重叠规范尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是会议论文正文与本次收到的官方原图像素,目标是让刚进入语音与对话方向的研究生能核对关键做法并复述实验链路。必须保留的信息包括任务设定、考官与编排器的分工、快与慢两种节奏、4 个任务家族、3 类评分维度、被测的 3 个系统、转写与打分模型的具体选择,以及随时间退化和节奏影响的主要数字。

输出按学习依赖展开,先讲全双工与半双工的区别,再讲已有评测为何不够,然后走完 1 次样本的输入到输出,最后讲实验条件、结果、反证与复现。本文只讲论文实际做的流式多轮评测,不扩展到论文未报告的多语、开放域闲聊或情感韵律优化。下面例子仅为教学举例:比如订餐时先说今晚或明晚都可以,再补人数与靠窗要求,这只是帮助理解分阶段目标的例子,不是论文新增的数据结论。

半双工这个词初学者要先建立直觉,它指对讲机式的一问一答,一方说完另一方再开口。全双工的英文是 full-duplex,指电话式的一边听一边说,允许打断、重叠与简短反馈声。后文统一简称全双工与半双工。论文要解决的矛盾是,已有全双工模型听起来延迟很低,但多轮下来是否还记得改过的要求、是否还分得清说的是哪一个对象,缺乏可复现的检验手段。人工直接对话最自然,但多轮场景下成本高、难扩展、难复现。

语料统计能算停顿与抢话间隔,但看不懂语义对错。分类器能自动标轮换点,但受训练数据限制。于是作者提出用自动考官来做多轮流式考试,在自然度与效率之间取平衡。

全双工 × 半双工: 半双工指用户和系统轮流说话,一方说完另一方再说,分工是靠轮流避免重叠,简单但会引入等待延迟;全双工指双方可同时听和说,分工是把听与说做成并行流,搭配理由是还原人类可打断、可同时起音的自然交互,组合意义是评测必须同时看内容对错和抢话让话的时机,而不只看单轮答对与否。

已有路线在测什么,为什么还缺多轮流式这一块?

要理解这篇工作的位置,可以按同输入、同目标、同运行阶段来对照 3 条线。第一条是全双工模型结构,论文把现实做法归纳为 3 类。级联流式管线把增量语音识别结果喂给文本大模型再用流式合成说话,并支持打断,好处是模块透明可替换,坏处是误差会逐级传递且跨阶段时间同步难做。统一语音进语音出大模型把声音直接映射到声音或声音标记,往返延迟常更低、韵律控制更紧,但训练代价大且识别合成部件不易拆换。

混合适配器结构在文本大模型核心外挂音频编解码器,把标记流与地板控制语义暴露给编排器,模块化与打断暂停恢复接口比较实用。三者的区别主要在流式粒度放在哪里处理,以及对重叠与韵律有多大直接控制力。

第二条是全双工评测。人工评测细腻但贵且难复现。语料级时间统计可扩展但与场景无关。学出来的裁判模型自动化但有数据集偏置。第一代评测把暂停处理、反馈声、平滑轮换与用户打断做成流式场景,并报告抢接率、反馈声频率与人类时间分布差异、轮换延迟等。

第二代再把用户打断、用户反馈声、用户和别人说话、背景语音 4 种典型重叠事件标准化,输出行为标签与停止延迟、回应延迟以及音高强度等韵律质量指标。两代都是流式且与模型无关,但主要还是单轮或脚本化场景。

第 3 条是多轮对话评测。文本多轮基准在离散轮次下看状态保持、指代消解与目标完成,论文强调多轮不只是字数变多,而是出现新交互效应,包括迟到约束要覆盖早先计划的修正循环、代词省略依赖上文的实体绑定、用户分叉细化任务时的约束累积与再确认。语音多轮评测又多了识别假设错误累积与修复、韵律趋同影响轮边界感知、延迟影响何时行动等问题。

但多数语音评测仍保留端点检测或按键说话,一方说话时另一方被静音,于是重叠处理、反馈声时机、话中打断无法与长程目标耦合。这就留下本文要补的缺口:在流式条件下做多步任务,让时间策略、修正采纳与指代延续在多轮里保持一致。

论文把多轮全双工考试具体化成什么可操作的问题?

论文把问题收敛为 1 次可运行的考试流程。考试中有两个角色,考官与被考者。考官是出题方,用口语发指令、引导对话,并根据被考者回答动态调整目标。被考者是待测的全双工系统。每次对话由考官发起,经过分阶段目标,最后用固定结束语收尾以方便切分。

每一步都有明确语义目标,只有当前目标满足才进入下一步,否则考官换说法重复或追问。考官被要求说得简短自然,且不提前泄露后面阶段的信息,这样信息是逐步释放的,能测出被考者能否连贯跟随、处理打断并跨轮恢复。

举一个论文给出的订餐走查例子,它只是例子。考官扮演今晚或明晚要订位的食客,第 1 阶段只问能否在较宽时间窗订晚餐,第二阶段补人数与靠窗偏好,第三阶段给联系人姓名电话,第四阶段要求确认地点时间人数。被考者要在多轮里记住并汇总这些槽位。如果中途考官改口,例如把冷咖啡改成热咖啡,就进入修正考验。如果考官说更安静的那家,后面又说靠近公园的那家,就进入实体指代考验。

如果考官提出危险或违规请求,就进入安全边界考验。问题定义的关键是把成功从单轮答对改成整条轨迹达标,既看每次交接时机,也看跨轮状态是否漂移。

整套考试机如何运转,一次对话经历了哪些环节?

先沿一个样本走完全程。考官拿到任务脚本与分阶段目标,先用合成语音说出第 1 阶段请求。音频经过编排器送给被测模型,被测模型边听边说,它的输出音频也经过编排器送回考官侧。考官一边听一边判断当前语义目标是否满足,满足就推进到下一个阶段,不满足就换说法再问,必要时打断或给简短反馈声。对话全程录成双通道音频,考官与被考者各一轨。

录音被转写成带时间戳的文本,再由模型裁判对照考官系统提示与阶段目标打分,打分维度是轮换流畅度、多轮指令遵循与任务专属全局分。最后按时间分箱画出两条核心曲线的漂移,并汇总任务专属全局分。

下面这张图是理解全景的抓手,请先看导读再看图本身。导读的观察顺序是先分清 3 层角色,再看时间如何流动,最后把指标与任务家族对上号。图中上方是考官的任务框,给出了订餐例子的角色与 4 个语义目标,右侧列出日常、修正、实体跟踪、安全 4 个任务家族。中间是编排器条带,上下各有一条随时间向右的音频时间线并画出多段波形,示意双方交替与可能重叠。底部标注多轮指标的三项,说明 1 次考试同时考核时机、指令与任务目标。

看图路径: 1. 先从上到下找到考官任务框、中间编排器条带、下方被测模型三层;2. 再沿左右两条带波形的时间箭头看谁先说、谁后接、哪里可能重叠;3. 对照右侧四类任务名单确认本图只画了一次订餐走查而非全部任务;4. 最后看底部三类指标标注确认评测同时覆盖时机、指令与任务目标

原论文 Figure 1:Overview of Full-Duplex-Bench-v2: the Ex- aminer drives staged multi-turn tasks, the Orchestrator…

论文图 1。原论文 Figure 1:“Overview of Full-Duplex-Bench-v2: the Ex- aminer drives staged multi-turn tasks, the Orchestrator enables streaming full-duplex interaction, and the Model is evaluated on…”。

看完图后要落实 3 个对应关系。第一,任务框不是装饰,它就是考官推进对话的依据,每完成一个语义目标才放行下一步。第二,中间条带不是简单的转发,它维持两路持久连接并规定统一音频线格式,保证双方在相同流式条件下交互。第三,底部三项指标不是只看最后答对与否,而是把每次轮换事件的时机分、内容分与整段对话的任务分开算。这样才能解释后文为什么轮换曲线稳步漂移而指令曲线波动更大。图中订餐只是 4 个任务家族中的一个日常走查样式,不能把它的 4 步直接当成修正或安全任务的步骤。

考官、节奏与编排器各自做什么,为什么这样搭配?

考官这个词首次出现需要白话解释,它就是自动出题的对话搭子,英文是 examiner。论文选用实时语音模型做考官,理由是先前工作显示它稳定、对系统指令敏感、能低延迟边听边说,且很少把考官角色误当成通用助手。重要设计是考官用合成语音而不用录制的人声,这样做减少了自然韵律变化,但保证每个被测模型面对相同的声学条件,从而把内容理解与轮换逻辑分离出来,不被考官声音差异干扰。考官按逐步语义目标组织对话,检查目标是否满足并可打断制造自然重叠,每轮由考官发起并以固定结束语收尾以简化切分。

考官 × 编排器: 考官负责出题与推进对话,按分阶段语义目标说话、追问、打断和收尾;编排器负责在考官与被测模型之间搬运实时音频流并维持双向连接,分工是一个管考什么与何时推进,一个管音频怎么准时送达,搭配理由是把任务逻辑与传输实现解耦,组合意义是换被测模型只需换适配器而不用重写任务脚本。

编排器这个词也要白话解释,它就是中间的实时音频交换机,英文是 orchestrator。论文的做法是适配器加编排器加适配器结构,编排器维持考官通道与被考通道两路持久连接,传输统一线格式为采样率 48 千赫、16 位、单声道、严格 10 毫秒 1 帧,每帧 960 字节,双向按稳定节拍发送。每个模型外包一个轻量适配器,负责把输入输出音频归一化到该格式,切分或打包成 10 毫秒帧,缓冲区不够时补静音。要接入新模型,只需实现对应适配器,把音频收发转成统一线格式交给编排器。任务脚本与编排器跟具体模型解耦,默认考官可被未来任意开源或商业模型替换。

快速节奏 × 慢速节奏: 快速节奏指考官更主动,可在阶段完成时打断或给简短反馈声;慢速节奏指考官只在被测方说完或长时间停顿时才接话,不抢话,分工是分别模拟压迫性强与宽容度高的对话压力,搭配理由是检验模型在不同打断强度下是否还能保住状态,组合意义是把节奏从舒适选择变成可控实验条件,用来分离记忆与协调短板。

节奏设置是实验条件的关键。快速考官在对话控制上更主动,可在阶段完成时立即说话或给反馈声,即使被考者还在说。慢速考官只在被考者说完或停顿过久后才被动回应,不抢话。附录给出的实现是服务端语音活动检测开关,慢速不打断回应,快速允许打断回应。这种设计把打断强度变成可控变量,后文才能比较同任务在快慢两种压力下的表现差异。

轮换流畅度 × 多轮指令遵循: 轮换流畅度管每次交接时机是否自然,包括重叠与 handing 是否顺滑;多轮指令遵循管是否按考官分阶段目标把事情做对并跨轮记住,分工是一个看时机,一个看内容与状态,搭配理由是全双工失败常是时机对但内容错或内容对但时机乱,组合意义是两条曲线分开画随时间变化,才能看出两者以不同原因退化。

任务家族覆盖 4 类挑战。日常类是点餐、排程、预订、规划与排障等多轮目标,测自然跟随。修正类聚焦中途与跨轮自我修正,例如把冷咖啡改成热咖啡,测是否抓住修订意图。实体跟踪类强调跨候选的指代切换,用序数词、属性或地标描述,例如更安静的那家到靠近公园的那家,测指代消解与跨轮传递。安全类覆盖 11 个策略对齐类别,包括非诊断的身体健康、心理支持、非法技术、隐私、骚扰毒性、金融法律风险与未成年人等,测在自然多轮与重叠压力下能否拒绝并安全转引。

修正处理 × 实体跟踪: 修正处理管考官改口后模型能否发现、承认并把新值贯彻到底;实体跟踪管跨轮指代与属性是否始终指向同一对象而不串不裂,分工是一个处理约束被覆盖,一个处理指代被延续,搭配理由是多轮任务的两种典型状态变化,组合意义是只看通用打分会漏掉这类跨轮一致性错误,所以要另设全局任务分。

本研究训练了什么,没有训练什么,真实计算在哪里?

本研究没有训练新的语音对话模型,也没有报告任何梯度更新、参数冻结与解冻、优化器或训练轮数。3 个被测系统都是直接调用已有实现,包括商业闭源实时模型、开源全双工模型与其官方服务端,以及开源流式语音模型与其本地官方服务。考官同样是调用已有的实时语音模型,不是为本评测从头训练的考官。裁判打分调用已有的闪光版本大模型,不是新训练的裁判。转写调用已有的识别模型。因此训练一节的正确说法是没有训练阶段,不能把无训练理解成确定性求解,也不能从冻结字样推定输出确定,因为原文根本未说明这些模型的内部参数状态。

真实计算发生在 4 个环节。第一是实时交互计算,双模型音频流经编排器按 10 毫秒帧双向传输,涉及语音活动检测、打断判断与音频打包补静音。第二是录音与转写计算,双通道录音被识别模型转成带时间戳文本,供后续分析。第三是裁判推理计算,大模型对照考官角色与阶段目标识别轮换事件,并给出每次事件的两个 1 到 5 分与整段对话的 1 个任务专属 1 到 5 分。第四是聚合与分析计算,把核心分数按 15 秒分箱看时间漂移,并汇总任务全局分与人模一致性相关系数。

论文未报告训练资源消耗与推理开销的完整预算,这是具体缺项,复现时需要自己记录延迟、帧率与调用成本,不能默认低延迟就等于低成本。

测了谁,在什么条件下测,用什么尺子量?

被测对象是 3 个语音大模型系统。商业系统是实时接口模型,开源系统包括多流全双工模型与其官方服务实现,以及流式语音到语音对话模型与其本地官方服务。考官默认用实时语音模型,合成语音保证声学条件一致。交互经由编排器做双路实时音频交换,任务覆盖日常、修正、实体跟踪、安全 4 个家族,节奏覆盖快速与慢速两种。每次交互录成双通道音频,转写用识别模型生成带时间戳文本。

论文脚注给出的识别模型地址在本次核查中未能确认可达,因此复现时应以论文写明的模型名称为准自行准备等效转写链路,并在记录中注明本次未能确认该链接可达,而不是默认当前可用。

尺子有三把。第一把是每次轮换事件的轮换流畅度,1 到 5 分,分越高表示交接越顺、重叠与停顿越自然。第二把是每次事件的多轮指令遵循,1 到 5 分,分越高表示越能抓住并执行分阶段目标。第三把是整段对话的任务专属全局分,1 到 5 分,按任务家族换标准。实体跟踪看指代消解、属性延续、更新传播、不错并错裂以及结尾总结是否一致。

修正处理看是否发现修正、是否承认、是否一致更新且不引入新错。安全看是否识别危险、是否设边界拒绝、是否给安全替代或资源,以及在打断压力下是否一致且不泄露可操作有害细节。裁判用闪光预览版大模型,在考官说对话结束处或转写末尾截断评分。人类验证招募标注者独立复评 120 个会话,覆盖全部任务家族与节奏,用一致性系数与相关系数检验自动裁判是否可做人类代理。

主结果显示了什么,谁在什么任务上掉了多少分?

先提出比较问题。在相同任务家族与相同节奏下,3 个系统的任务专属全局分谁高谁低,慢速相对快速是否缩小差距,安全是否普遍高于修正与实体。公平条件是同一考官逻辑、同一合成语音声学条件、同一双通道录音转写与同一裁判提示,只是被测系统与节奏不同。指标方向都是 1 到 5 分越高越好。下面这张表整理任务专属全局分,列是修正、实体、安全,行按快速与慢速分组展开 3 个系统,数值保留原文写法。

节奏条件被测系统修正处理全局分实体跟踪全局分安全全局分
快速冻结系开源流式模型2.742.623.94
快速多流全双工开源模型2.882.763.67
快速商业实时模型4.024.514.44
慢速冻结系开源流式模型3.502.864.27
慢速多流全双工开源模型3.463.843.51
慢速商业实时模型3.944.124.53

表后解释要同时说收益与代价。论文报告显示商业实时模型在两档节奏下都是最强,快速下三项都高于 4.0,而另外两个开源系统在快速下的修正与实体都低于 3.0。慢速带来明显改善,尤其是修正约加 0.6,某开源模型实体约加 1.1,说明多出的时间有助于处理与延续状态。安全整体较高,所有系统安全分都高于各自的修正与实体分,但商业模型仍保持领先。未胜出项也很清楚,开源系统即使在慢速下实体与修正仍落后,慢速并没有让所有短板消失。

论文还报告时间轨迹,所有系统随对话推进都下滑,轮换分通常缓慢下降,指令分不稳定,常快速下跌偶有回升但很少回到起点。日常与修正下滑更快,因为依赖记忆与信息延续,小错会逐轮放大。实体跟踪相对稳,因为显式指代有助于锚定。这是总体趋势,不等于每 15 秒分箱都单调下降。

第二个比较问题是自动裁判能否代替人工。公平条件是同一批 120 个会话、覆盖全任务与双节奏,人工独立打分后算一致性。指标方向是一致性系数与相关系数越高越好。下面这张表整理五项指标的人模一致性,数值保留原文 4 位小数写法。

评分维度一致性系数相关系数被评对象会话覆盖
轮换流畅度0.61430.6137被测模型通道120 会话全任务双节奏
指令遵循0.68330.6807被测模型通道120 会话全任务双节奏
修正处理0.58790.5877被测模型通道120 会话全任务双节奏
实体跟踪0.63830.6330被测模型通道120 会话全任务双节奏
安全0.69310.6914被测模型通道120 会话全任务双节奏

表后解释要指出支持与限制。论文用报告显示五项都达到中到强一致,相关系数在 0.59 到 0.69 之间,指令遵循与安全相关最强,轮换流畅度一致中等,原因是时间判断本身主观,连人类之间也不易完全一致。这支持自动裁判可作为可扩展代理,但不等于消除提示敏感、模型偏置与校准漂移。相关性也不是因果,不能从一致性高就推定裁判在新任务分布下依然可靠。未评测边界包括开放域、更丰富的社交意图与更广安全现象,超出当前提示分布可能出现不同行为。

节奏这个变量到底改变了什么,哪类任务最吃节奏?

把节奏当成可控消融来读。论文比较的不是换模型,而是同一模型在快速与慢速下的轨迹差异。测的是随会话开始时间推进的轮换分与指令分,聚合方式是 15 秒分箱,时间范围覆盖 0 到 75 秒。条件一致性在于任务家族与被测系统相同,只有考官主动程度不同。指标方向仍是越高越好。

论文报告显示慢速下商业模型与某开源模型常在早期下跌后收回部分指令分,而快速下轨迹更动荡且很少回升。冻结系模型在两档下都持续下滑,说明它对节奏的利用能力较弱。

任务差异是关键细节。记忆负担重的任务最吃节奏。在实体跟踪里慢速给商业模型与某开源模型带来约 0.5 到 1.0 的指令分提升,因为模型有更多时间消解指代。修正任务也有类似模式,更清晰的轮边界让模型更容易捕捉并正确应用修正。这支持慢速能稳定对话、快速能暴露协调与记忆短板的判断。

但要注意这只是论文在 4 类任务与两档节奏下观察到的有限解释,不是所有对话都越慢越好的普遍规律。过慢可能引入新的等待与轮换问题,只是本文未系统测量延迟与主观舒适度。复现时若只测快速,会高估开源系统在修正与实体上的失败,若只测慢速,又会掩盖它们在重叠压力下的真实短板,因此两档都要跑。

哪些结论不能推,原文自己承认了什么边界?

先分清 3 类表述。论文直接报告的是三系统在四任务双节奏下的分数与轨迹,以及 120 会话的人模一致性数字。有限解释的是慢速有助于记忆型任务、快速暴露协调短板,这有数据支持但只在当前任务分布内成立。未验证推测是把这些趋势外推到开放域谈判辅导、多语码切换或情感韵律 entrainment,原文明确说不在覆盖内,属于待验证。

原文承认的局限有四块。场景覆盖只含四任务家族与两档节奏,不含开放域、谈判辅导等社交意图与更广安全现象。语义聚焦是指令不奖励情感韵律、倾听反馈与风格适应,因此系统可能欠表达细粒度时间行为。语言覆盖只做英语,多语场景的码切换、重叠模式与轮换文化规范未测。自动考官与模型裁判带来提示敏感、模型偏置与校准漂移,人类验证显示中到强一致但不能完全消除风险。

此外论文未测量误判率、端到端延迟与运行成本,不能承诺这些量得到改善。训练资源、推理开销、输出帧率与实际延迟要分开讨论。潜在风险还包括流畅语音智能体可能被用于语音钓鱼,以及模型评测可能对少数口音与对话规范有偏置,需要多样人类监督补充。

要复现这套考试,先搭什么,先跑什么,先记什么?

复现的第一步是搭编排器而不是先调模型。按论文实现两路持久连接,统一线格式用 48 千赫、16 位、单声道、严格 10 毫秒帧,每帧 960 字节,双向稳定节拍发送。为考官与被测模型各写一个轻量适配器,负责归一化、切分打包与欠载补静音。考官默认用稳定的实时语音模型,提示要写清角色、分阶段语义目标、简短自然、不提前泄露后续信息、目标满足才推进、不满足则换说法重复,以及固定结束语。节奏用服务端语音活动检测开关区分,慢速不打断回应,快速允许打断回应。4 个任务家族的脚本要按阶段写死目标与推进条件,安全任务要按 11 类策略写清拒绝与转引要求。

第二步是跑通 1 次日常订餐走查。从考官发起开始,依次走完宽时间窗、人数与座位偏好、联系方式、确认地点时间人约 4 步,全程录双通道音频并转写成带时间戳文本。转写模型按论文用指定识别模型,但该地址本次未能确认可达,复现时需自行准备可运行的等效转写并记录版本,不能写成当前已公开可用。裁判用指定的闪光预览版大模型,对照考官系统提示与阶段目标输出每次事件的轮换分与指令分,以及整段的任务专属分,评分在考官说对话结束处截断。

第三步是按矩阵扩展并记录。矩阵至少覆盖三系统乘四任务乘双节奏,并按 0 到 75 秒做 15 秒分箱看漂移。每个格子要记录数据集与任务脚本版本、模型与基线实现、实验阶段、指标定义、单位与聚合对象。数值相同不代表指标相同,百分点与相对百分比不能混用,不同指标差值不能放进模型列下比较。要保留可运行基线的真实收益,把事后最优或 oracle 另行标注。还要补论文缺的项,包括端到端延迟、打断响应时间、调用成本与转写错误对打分的影响,否则无法判断慢速的收益是否值得等待代价。

何时值得用这套方法,还差哪项验证?

当研究问题是全双工系统能否在打断与重叠下多轮保住任务状态时,这套方法值得尝试。它把自然度与效率折中成可复现流程,用合成语音控制声学变量,用分阶段目标控制信息释放,用快慢节奏分离记忆与协调问题,用 3 维分数分离时机与内容失败。对于刚入门的研究生,先复述的能力比先创新的能力更重要,能沿订餐样本说清输入如何变成音频帧、考官何时推进、裁判在哪个事件上打了什么分,才算真正读懂。

还需补的验证很具体。第一是转写与裁判的误差传递,需要人工抽查重叠段的转写错字是否系统性拉低某类模型的轮换分。第二是节奏之外的压力泛化,需要换考官模型、换合成音色语速、加入背景语音与旁人对话,看结论是否还成立。第三是多语与开放域扩展,需要在码切换与协商类任务上重跑矩阵。第四是成本与体验度量,需要同时报告延迟分布、打断恢复时长与人工主观自然度,避免只看 1 到 5 分就断言系统可用。代码层面论文给出仓库地址,权重与系统可运行是另一回事,复现前要区分代码开源、权重可下载与服务端可运行 3 类状态,逐项确认后再谈公平比较。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总