英文题目:CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation

会议身份:conference:interspeech:2026:conference-paper-id:shen26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #基准设计 #多语言 #轮次切换

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Huan Shen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yingao Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shangkun Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Zou:机构信息未能从会议 PDF 纯文本可靠映射
  • Yunzhang Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

轮次切换评测需要在多轮对话历史与系统状态条件下,在维持说话(Maintain)、停止倾听(Stop & Listen)、接管发言(Takeover)与忽略输入(Dismiss)之间做决策,难点是表面动作相同但交际意图迥异,例如思考停顿与环境噪声都应维持发言。CoDeTT 先以系统状态(SystemSpeaking/SystemIdle)与决策策略构建 14 场景层级分类体系界定诊断空间,再经生成与自动裁判、多音色合成与识别校验、声景混合与真实语料锚定形成 18000 例、中英双语、每例 5 轮历史的评测集,最后采用动作级与意图级两阶段漏斗协议统一比较异构模型,并以语义错配率(Semantic Misalignment Rate, SMR)揭示推理偏差。与只看是否发声的功能性基准相比,该机制区分了动作正确但原因错误的幸运猜对。在中英文评测中,Gemini3-Pro 四动作平均准确率约 81.58%(中文 H=3)与 81.91%(英文 H=3),领先同类全模态基线约 10 个百分点,并在意图层保持约 15%至30% 的低错配率,但其忽略类仍是最弱环。结论仅适用于离线分类式受控合成与半真实混合场景,未验证实时延迟、重叠语音与多人在线交互表现。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?为什么二元终点判断不够用?

本文输入是连续多轮口语对话研究生的可复述解读,目标是讲清轮次切换评测怎么做、数据怎么造、指标怎么算、结论在什么条件下成立。必须保留的信息包括 4 种宏观动作、14 种细粒度场景、两种系统状态、5 轮历史结构、2 阶段评测与语义错配率定义,输出是 1 篇可核对的方法复述而非效果宣传。白话来说,轮次切换就是对话中决定现在该谁说话、是继续说还是停下来听,英文为 turn-taking;话语终点检测就是判断一句话是否说完,英文为 end-of-utterance detection,简称 EOU 检测。

过去很多系统只做二元判断,说完就接管、没说完就等着,这种做法在安静单人朗读中够用,但在真实对话中不够用。原因是同样一段静音可能是思考停顿,也可能是背景噪声,还可能是用户在跟旁边人说话,单看声学边界无法区分。论文报告现有协议多限于二元边界检测与窄交互设置,难以系统比较模型,也难以看到上下文相关的弱点。

学习依赖是先理解任务从边界到决策的扩展,再理解数据分层与评测漏斗,最后才能读懂实验中的反直觉现象,例如历史变长不一定变好。

轮次切换 × 话语终点检测: 轮次切换负责在对话中决定谁来说、什么时候说,话语终点检测只负责判断当前话语是否说完,二者搭配的理由是终点检测给出边界信号而切换决策还要结合意图与系统状态,组合意义是把二元边界扩展为维持、停止倾听、接管、不理会 4 种功能动作的可评测决策。

本解读默认只讲论文实际研究的轮次决策评测任务,教学举例会明确标为例子。例如例子:系统正在播报时用户咳嗽一声,理想行为是继续说;若用户说停下别说了,理想行为是停下倾听。两个例子声音上都出现了打断,但意图不同,传统只看说没说的评测会把两者混为一谈,这正是本文要解决的起点。

已有路线在测什么?CoDeTT 与它们如何对照?

按同输入、同目标、同监督、同运行阶段对照,已有路线可分为 3 类。第一类是轮次建模与 EOU 预测,从二元终点检测发展到全双工系统中的上下文建模,现代系统已用大语音语言模型融合语言与韵律线索,但评测仍主要看功能时机,即系统说了还是沉默,背后的决策理由基本不可见。

第二类是交互与全双工基准,例如 FLEXI 评测社交场景中的后向通道,Full-Duplex-Bench-v2 评测多轮任务完成,MTR-DuplexBench 评测连续多轮流中的性能衰减,这些框架能看到模型没回应,但不能回答为什么沉默,可能是把问句误判为旁白、噪声或思考停顿。第 3 类就是 CoDeTT 自身定位的诊断决策评测,它增加 14 类诊断层,用语义错配率检验智能体的回应是否扎根于正确的交际意图,目标是评估一体多模态智能体对细微交互线索的处理。

需要强调的是类别差异不等于同条件胜负,专用小模型本来就不是为细粒度意图分类设计的,不能直接用 14 分类准确率判其失败,论文因此先统一到共享宏观动作空间再比较,这是后文 2 阶段协议的由来。

要解决的评测问题如何形式化?

论文把轮次切换形式化为结构化决策问题。给定对话上下文与系统状态,模型要预测 4 种功能动作之一。白话来说,维持对应系统说话时继续说或系统空闲时保持沉默等待,停止倾听对应系统说话时停下来听用户,接管对应系统空闲时开始回应,不理会对应系统空闲时判断不应回应。英文分别为 Maintain、Stop & Listen、Takeover、Dismiss,后文固定用这 4 个简称。系统状态只有两种,SystemSpeaking 表示系统正在说话,SystemIdle 表示系统空闲。

每种状态映射到两种决策策略,共 4 种策略,再细分为 14 种场景。论文报告这些场景按两种系统状态组织并映射到 4 种决策策略,既支持粗粒度动作评测,也支持细粒度场景分析。关键是动作与意图分离,表面相同的维持可能由迟疑触发,也可能由环境噪声触发,只有意图标签能区分。这种分层是理解后文语义错配率的前提,也是图 1 要表达的核心矛盾。

方法全景:一个样本如何走完输入到输出?

先沿一个样本走完全程。输入是一个实例,包含完整 5 轮多轮对话历史与目标用户查询,历史提供话语轨迹,目标查询是当前需要决策的声音事件。表示上既有文本语义也有声学实现,合成部分用语音合成生成多说话人音频,真实部分来自自然对话语料,环境部分再混入噪声或背景人声。组件上先经过统一动作映射,把异构模型输出折算到 4 个宏观动作,再对一体模型做 14 意图直判。目标上第一阶段看功能是否做对,第二阶段看理由是否想对。

输出包括按动作的准确率与按策略的平均准确率加语义错配率。论文报告每个实例都按 5 轮历史加目标查询组织,场景在两种系统状态下均衡分布,特定场景样本量在 1000 到 2000 之间,总量为 18000 个标注决策实例。这种均衡设计是为了让复现时每个决策类型都有足够样本,而不是只测最常见的接管。

宏观动作 × 细粒度意图: 宏观动作指 Maintain、Stop & Listen、Takeover、Dismiss 4 类功能正确性,细粒度意图指其下 14 种场景的交际原因,二者搭配的理由是不同意图可以映射到同一动作,组合意义是先统一异构模型输出再用意图层诊断动作正确但理由错误的失效。

以下导读针对概念对比图,帮你建立从黑盒到诊断的整体图像。该图左侧为传统基于动作的粗粒度黑盒,右侧为 CoDeTT 的上下文感知分层诊断,上下分别展示输入多样性、决策模块与输出解释性,阅读时先对比输入再对比决策最后对比输出。

看图路径: 1. 先看左右两栏顶部的输入小格,确认左侧与右侧都包含迟疑、噪声、旁白类输入;2. 再看中间箭头指向的决策模块,比较左侧端点检测器与右侧上下文感知决策的差异;3. 最后看底部输出,确认右侧把同一维持动作再细分为意图标签与不同应对

原论文 Figure 1:A conceptual comparison between traditional action- based benchmarks and the proposed CoDeTT…

论文图 1。原论文 Figure 1:“A conceptual comparison between traditional action- based benchmarks and the proposed CoDeTT intent-based di- agnostic benchmark.”。

该图显示左侧把迟疑、噪声、旁白、排除、不理会等不同输入都送入同一个终点检测器,最终只输出维持或沉默,底部标注为功能等价,即动作正确但理由错误。右侧同样输入还加入对话历史,并经过上下文感知决策先输出维持,再展开为迟疑、噪声、旁白、排除、不理会等精确意图标签,每个标签对应不同应对,例如等待用户说完、指出噪声环境或按要求长期沉默。这种从单一动作到动作加理由的展开就是后文 2 阶段评测的直观依据。

评测组件如何计算?准确率与错配率各自分工是什么?

评测机制采用 2 阶段漏斗。第一阶段为动作层,所有模型都在 4 个核心动作上评测,实现跨范式的功能正确性公平比较。第二阶段为意图层,只对一体语音语言模型额外评测 14 语义意图直判,考察细粒度理解。论文明确指出专用控制器限于二元或粗粒度终点状态,无法做细粒度分类,因此直接做 14 类比较不可行,必须先统一到共享宏观动作空间,再做细粒度分析。指标上除按类准确率外,引入语义错配率。

白话来说,语义错配率就是在动作做对的样本里,有多大比例其实想错了理由,英文为 Semantic Misalignment Rate,简称 SMR。公式含义是固定某个宏观动作,分子是预测动作正确但预测意图不等于真实意图的样本数,分母是预测动作正确的样本数。原文明确给出该比例定义,并解释高语义错配率是关键诊断信号,说明模型靠表面声学启发式取得功能成功,而非稳健上下文理解。

准确率 × 语义错配率: 准确率负责统计动作或意图是否命中标签,语义错配率负责统计动作做对的样本中有多大比例意图想错,二者搭配的理由是单看准确率会掩盖启发式蒙对,组合意义是区分边界检测能力、上下文推理能力与多方语用辨别能力 3 层水平。

对话历史 × 系统状态: 对话历史提供连续 5 轮多轮上下文的话语轨迹,系统状态指 SystemSpeaking 与 SystemIdle 两种当前占用情况,二者搭配的理由是同一声音在系统说话时与空闲时应有不同决策,组合意义是形成受控上下文变化以检验模型对打断、迟疑停顿与旁白的敏感性。

需要区分百分点与相对百分比。论文中准确率与错配率都以百分比报告,跨模型比较时应说某模型在某动作上高多少个百分点,而不是高百分之多少,除非原文明确给出相对变化。不同指标的差值不能混入模型列下比较,例如不能用准确率减错配率得到综合分,原文也没有这样做。

本研究训练了什么?数据流水线实际做了哪些计算?

本研究没有训练新的轮次切换神经网络,该节承担方法职责的是数据集构造流水线。真实计算过程是 6 阶段混合流水线,目标是把干净文本桥接到真实声学复杂度。第一步生成与质检,用大模型生成连续多轮对话历史并用另一大模型做自动评审,保证语义精确。第二步高保真合成,用语音合成模型以动态说话人音色合成文本,并用声学参考做语速过滤。第三步识别校验,用语音识别模型转写合成输出并执行严格词错误率阈值,不合格则丢弃或重生成。

第四步声景仿真,对目标查询做动态混音,无效类用随机非语音噪声,排除与分心类用混合对话片段模拟背景 babble 与话题无关环境音,并加随机声学扰动。第五步真实融合,接入自然对话语料提供自发人类声学锚点。第六步汇总,严格均衡后编译为连续多轮基准。质量控制上 2 名双语标注者人工检查约 1% 数据,语义与声学评估的一致性较高,解决分歧并过滤约 6.3% 样本后,最终得到超 300 小时多轮对话。

以下导读针对构造流水线图,帮你核对合成、校验与汇总的回路关系。该图为局部放大,上方为多音色合成经合成核心到合成多轮音频,下方为真实挖掘与汇总,中间经识别校验连接,注意丢弃重生成箭头与人工检查分支。

看图路径: 1. 先沿多音色合成到合成多轮音频再到识别校验的主路径看数据流向;2. 再看识别校验后指回合成核心的丢弃与重生成回路;3. 最后看右下汇总框中的总时长、场景数与每类每语言样本量

原论文 Figure 2:The CoDeTT dataset construction pipeline.

论文图 2。原论文 Figure 2:“The CoDeTT dataset construction pipeline.”。

该图显示合成支路从声学参考过滤进入合成核心再到合成多轮音频,随后进入识别核心与词错误率检查,不通过则沿丢弃与重生成箭头返回合成核心。另一支路从挖掘人类音频基线进入汇总,汇总框明确写出总时长、场景构成、每类每语言样本分布与连续多轮音频格式。这说明词错误率检查不是装饰性步骤,而是控制合成伪影的门控,复现时若去掉该门控,合成错误会直接污染意图标签。

实验条件如何设置?测什么、与谁比、条件是否一致?

实验按问题组织。测的是结构行为与语义对齐,历史长度在零、一、三、5 轮之间变化,语言覆盖中文与英文。比较对象包括专用控制器与一体语音语言模型两类范式。专用控制器包括基于声学与语言模态的切换模型、可插拔全双工语音交互系统、语义切换检测与文本输入的切换检测等,一体模型包括多模态大模型与语音交互模型,文本输入模型也纳入动作层比较。

条件一致性上动作层统一到四动作比较,意图层只比较具备原生音频推理的一体模型,专用控制器因无意图输出而无法计算错配率,论文明确将其视为黑盒。指标方向是准确率越高越好,错配率越低越好。每个实例固定 5 轮历史加目标查询,评测时截取不同历史长度以观察上下文效应。资源状态方面,论文引用的第三方集合当前不可用,链接返回 404,不应写已公开;另一文本语义模型链接本次可达可用。

硬件预算、推理延迟与训练成本原文未报告,复现时应补测,不应从准确率推定延迟改善。

主结果显示什么?哪些动作强、哪些场景弱?

论文报告专用控制器经端点优化在接管上准确率高,但在维持与不理会场景失败。由于缺乏意图输出,其错配率无法评估,这凸显二元任务的功能成功缺乏复杂交互所需的语用推理。一体模型动作更均衡,但功能成功与意图对齐之间存在差距。最稳健的模型错配率最低,维持在 10% 几到二十几,说明决策扎根于正确意图。相反,部分模型在维持与停止倾听上错配率常超 40%,论文称之为幸运猜测,即遇到非语音就沉默的表面启发式,而非真正语用建模。协作与排除场景的持续混淆说明说话人角色归因仍是瓶颈。

专用控制器 × 一体语音语言模型: 专用控制器指只输出二元或粗粒度终点状态的轻量切换模块,一体语音语言模型指可直接做音频推理与细粒度分类的大模型,二者搭配的理由是前者只能参加动作层比较而后者可进入意图层,组合意义是在统一动作空间下公平比较功能正确性再深入比较语义对齐。

以下导读针对细粒度混淆矩阵,帮你定位错误集中在哪些块内。该图横轴为预测、纵轴为真实,标签按不理会、接管、维持、停止分组,颜色越深表示数量越多,阅读时先看块结构再看对角线空洞。

看图路径: 1. 先确认横轴为预测、纵轴为真实,行列标签都按维持、停止、接管、不理会分组;2. 再看左上与右下两个深色块,确认错误集中在让出话轮与保持话轮各自内部;3. 最后定位协作与排除对应的对角格,观察其颜色明显浅于同块其他位置

原论文 Figure 3:Fine-grained semantic confusion matrix of GPT-4o- audio (Chinese, 3-turn history).

论文图 3。原论文 Figure 3:“Fine-grained semantic confusion matrix of GPT-4o- audio (Chinese, 3-turn history).”。

该图显示错误 staying 在两个粗块内,即让出话轮相关类别内部互混,保持话轮相关类别内部互混,跨块错误较少。但协作接管与排除不理会对应的对角格几乎为空,说明模型能判断大概该说还是该沉默,却分不清是协作还是完成、分不清是排除还是其他不理会原因。这正是动作准确率高而意图准确率低的视觉证据,也是不能只看宏观准确率的原因。 本节表格整理数据集规模与评测发现的对应关系,阅读时先确认规模均衡,再看性能分化是否建立在均衡基础上。

条件指标规模 A规模 B比较对象
中英多轮对话总时长超 300 小时14 场景分层诊断基准
全部标注实例总样本18000 实例两种系统状态均衡覆盖
按系统状态每状态样本9000 样本场景级 1000 到 2000平衡设计
每实例结构历史长度5 轮历史目标查询上下文推理
质量控制一致性与过滤1% 人工检查6.3% 过滤双语标注

表后解释是规模均衡支撑了后文分化结论的可信度。

若数据本身偏向接管类,那么接管高分可能是数据偏态,而论文报告总量大且按状态均衡、场景级样本量有下限,因此专用控制器在接管强而在维持弱更可能来自模型偏置而非数据偏态。代价是合成占比高,真实自发部分仅作锚点,声景仿真虽加入噪声与背景人声,但仍与真实多方重叠有差距。未胜出项是部分一体模型在维持上的意图平均准确率明显低于接管,说明均衡数据并未自动带来均衡能力。

历史长度带来什么变化?推理与过承诺如何权衡?

历史变化呈非单调效应。对于迟疑与完成类,中等历史有助于澄清话语轨迹并降低错配率,例如上下文帮助区分思考停顿与噪声。但在停止倾听类尤其是打断类,历史到 5 轮时性能常下降并伴随更高错配率,混淆在停止倾听与维持之间增加。论文解释更高错配率意味着即使正确决定停止,决策也常由历史偏置驱动而非当前打断,额外上下文改善连贯性但过量历史诱发语义过承诺,削弱对突发话轮转换的敏感性。

这是对初学者的重要提醒,更多上下文不等于更好,复现时应固定其他条件单独扫历史长度,并同时报告准确率与错配率,否则只看准确率会误判。 本节表格整理历史与对齐的权衡,帮你同时核对准确率方向与错配率方向。

条件指标短历史表现长历史风险比较对象
迟疑与完成轨迹澄清1 到 3 轮改善过长未必增益上下文推理
打断类停止突发敏感性零轮更敏捷5 轮下降历史偏置
维持类错配率中等历史降低过长回升噪声区分
一体模型稳健性最低错配率模型稳定高错配率模型波动跨模型比较
协作排除角色归因均弱未随历史解决待验证瓶颈

表后解释是主要收益来自中等历史对轨迹的澄清,具体代价是长历史对打断的迟钝与理由漂移。

反例是即使最稳健模型在协作与排除上仍弱,说明历史长度不是万能药。未评测边界包括重叠语音时长、信噪比梯度与真实多方定位,这些在仿真中只用随机扰动近似,复现时若要推广到会议室场景需补测。

哪些结论有限?什么还没有被测量?

论文直接报告的是在受控中英合成加真实锚点数据上的动作与意图性能,支持的判断是分层诊断能暴露幸运猜测与上下文过承诺。有限解释是把协作与排除混淆归因于说话人角色归因瓶颈,这得到混淆矩阵支持,但未做消融证明因果,应表述为支持而非证实。未验证推测是更长历史必然损害交互敏捷性在所有场景成立,原文显示总体趋势而非每组每步都成立。缺失证据不是技术错误,相关性不是因果。

未测量误判率对应的用户体验损失、端到端延迟、计算成本与输出帧率,不应承诺这些量得到改善。训练资源、推理开销与实际延迟应分别讨论。数据层面合成主导、人工只查约 1%、过滤后重平衡,这些都限制向完全自发多方对话的泛化。引用资源中有一个第三方集合本次不可用,复现时不应假设可下载,应按不可用处理并寻找替代基线。

复现先做什么?需要保留哪些超参数与信息条件?

复现先做三件事。第一,按两种系统状态与四动作映射重建评测脚本,确保所有模型输出先折算到同一宏观动作空间,再对一体模型跑 14 意图直判,不要直接用 14 分类比较专用控制器。第二,固定 5 轮历史加目标查询的数据结构,扫零、一、三、5 轮历史并同时记录准确率与错配率,错配率按动作做对中意图想错的比例计算。

第三,保留关键信息条件,包括中英双语、场景级样本量下限、词错误率门控与声景混合策略,区分代码开源、权重下载与系统可运行,权重可下载不等于端到端可运行。需补的验证包括真实多方重叠、不同信噪比下的维持决策、说话人角色标注消融,以及延迟与成本测量。教学例子标为例子:例如用同一段咳嗽分别放在系统说话与系统空闲下测试,预期前者维持、后者不理会,若模型都沉默则可能是启发式而非理解。

本节表格汇总可运行策略与需标注的非可部署参考,帮你避免把事后最优当成收益。

条件指标可运行策略非可部署参考比较对象
动作层功能正确性专用控制器与一体模型无公平比较
意图层语义对齐一体模型直判专用控制器不可算黑盒标注
历史扫描准确率加错配率零一三五轮事后选优另行标明过承诺检验
数据门控词错误率合成校验无伪影控制
角色归因协作排除待补消融当前瓶颈未验证推测

表后解释是可运行策略的收益可用准确率与错配率直接衡量,代价是意图层只适用于一体模型,不能据此宣布专用控制器全面失败。

反例是文本输入模型在动作层可比但缺声学线索,其维持行为与音频模型不可简单等同。复现时若用搜索最优历史或事后最优值,必须另行标明,不能代替固定历史下的可部署收益。

何时值得尝试 CoDeTT?核心误解如何纠正?

当你的对话系统已能做好安静环境下的端点检测,却在咳嗽、旁白、迟疑停顿或第三方插话时频繁打断或该说不说,就值得用 CoDeTT 做诊断。它把评测从说了还是沉默推进为为什么说或沉默,并用错配率量化蒙对。论文特有的误解有三。其一,动作做对不等于想对,维持的正确可能是把思考停顿误当噪声而沉默,意图标签才能区分。其二,历史越长不等于越懂,中等历史澄清轨迹,过长历史可能用历史偏置覆盖当前打断。

其三,专用控制器接管高分不等于综合强,其在维持与不理会上的弱点恰是复杂交互的关键。总体上 CoDeTT 提供严格框架,但结论限于其构造条件,走向下一代稳健上下文感知对话智能体还需补真实多方、延迟成本与角色归因的验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总