英文题目:Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue

会议身份:conference:interspeech:2026:conference-paper-id:bhagtani26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #SFT #大语言模型 #零样本 #轮次切换

评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Kratika Bhagtani:机构信息未能从会议 PDF 纯文本可靠映射
  • Mrinal Anand:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu Chen Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Amit Kumar Singh Yadav:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多方对话中的轮次切换(turn-taking)任务输入为截至暂停点的完整文本上下文与指定目标说话人,输出为发言或保持沉默的二元决策,难点在于暂停含义模糊且旁观与被谈及极易混淆。该工作先从三类自然对话语料切分话语边界并为每个非发言者构造决策点,再按显式点名与语境介入划分为两类应发言与两类应沉默样本,接着以零样本提示评测多款大语言模型(large language model,LLM),最后用标签条件蒸馏的单句推理轨迹做有监督微调使模型先解释后决策。与仅预测下位发言者或识别被寻址者的已有工作不同,该方法将参与决策本身作为每暂停点的受控输出,并以显式推理约束语用判断。在 Friends 子集的决策独训练下 Qwen2.5-7b 的平衡准确率达到 66.60%,而推理加决策训练提升至 68.46%。结论仅适用于基于文本上下文的离线暂停点判断,未验证韵律、重叠语音与实时打断等声学线索下的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:本文要解决的多方停顿难题是什么?

本文的输入是论文原文与本次收到的官方原图像素,目标是为刚进入语音与音频领域的研究生写出可核对、可复述的方法解读,必须保留的关键信息包括任务定义、4 类标签、3 个语料的规模与划分、8 个模型的零样本条件、有监督微调的配置与 3 组实验的数字,输出是 1 篇按学习依赖展开的中文技术解读。

现有语音助手大多把每次检测到的停顿都当作自己可以说话的邀请。在只有一个人和一个助手的双人对话中,这种做法基本够用,因为停顿往往意味着轮次交接。但在多人会议、社交闲聊或财报电话中,停顿非常多且含义模糊,可能是他人在思考、他人之间的交接,也可能是真的在等助手回应。如果助手逢停顿必说,就会频繁打断自然流程;如果被点名时保持沉默,又是没有尽到职责。

白话来说,问题从说什么变成了该不该说。英文上,论文把前者称为传统轮次接管,把后者称为上下文感知轮次接管,即 context-aware turn-taking。

上下文感知轮次接管 × 双人对话的停顿即说: 上下文感知轮次接管负责在每次检测到的停顿处结合全部对话历史判断目标说话人该说还是保持沉默,双人对话的停顿即说只负责一检测到停顿就由助手接话,二者搭配的原因是多方停顿大量且含义模糊,组合后新增的作用是把是否参与从信号触发改为语用判断,避免逢停顿必打断。

为建立直觉可以举一个教学例子,注意这只是例子而非论文数据:甲问乙季度报告看完了吗,助手立刻插话要总结要点,甲乙继续核对邮件时助手又插话要查邮件,这就是传统做法的打断感;上下文感知的做法是前两处保持沉默,只在甲明确问助手会议时间时回答,并在甲让乙准备幻灯片、乙回应时继续沉默。例子的要点是判断依据不是有没有停顿,而是停顿前的全部上下文在跟谁说话。

已有路线走到了哪里:为何还缺这一次是否参与的判断?

双人语音对话的轮次研究已经较多。按论文梳理,一条路线从文本预测轮次边界,另一条路线用语音活动投影等方法从音频预测近未来的发声活动,还有工作研究大模型能否识别轮次内的转换相关位置。这些工作的共同点是处理 2 人、偏信号层的何时交接。

多方对话研究则拆成了若干子问题,例如说话人感知的篇章解析、被称呼者识别即 addressee recognition、多方结构下的回应选择,以及社交智能基准中的角色一致与目标完成。但这些工作把参与当作给定条件,没有回答每个停顿处助手自己该不该加入。另有工作用角色扮演游戏数据研究多人参与,但场景是幻想角色扮演而非自然口语,且评测的多是较早的对话模型。还有工作做多人中的下一说话人预测,即 next-speaker prediction。

下一说话人预测 × 按参与者的二元参与决策: 下一说话人预测负责在多人中选出下一个是谁,按参与者的二元参与决策只负责判断指定目标自己说还是沉默,二者搭配的原因是部署在群聊中的助手只能控制自己,组合后新增的作用是把评测从谁接话的全局排序改为助手可执行的局部决策,更贴近真实部署。

论文与上述路线的区别有三点。第一,任务形式是按参与者的二元决策而非全局选出下一个人,因为助手只能控制自己。第二,基准来自 3 类自然多方语料并区分显式与隐式该说、两类沉默,而非游戏设定。第三,评测覆盖近期 8 个大模型,并用带推理蒸馏的结构化微调取得提升,这是此前针对该问题未探索的训练范式。理解这三点,就能明白本文不是重复回应生成,而是补上是否参与这一环。

任务如何形式化:每个停顿处要预测什么?

论文把任务定义为二元预测。设有多方对话,共有 N 个说话人,Ct 表示到时刻 t 为止的 utterance 序列,每个 utterance 由某个说话人产生。在 utterance 之后检测到停顿,对一个不是上一句说话人的指定目标 k,目标是基于上下文 Ct 预测 dk,属于说即 SPEAK 或沉默即 SILENT。这个定义的通用性在于任何参与者都可作为目标,训练时可以从自然人类对话中每个人的行为得到监督,推理时目标就是人工智能助手。

为让监督更细,论文在二元之上设了 4 类。显式点名记为 I1,指目标被名字或角色直接点到且明确被期待回应,是最容易的该说类。语境干预记为 I2,指目标未被直接提及但是活跃参与者且被期待回应,也是该说类。无关联记为 S1,指当前交流发生在他人之间、目标只是旁观者,是沉默类。被谈及但未被点名记为 S2,指目标以第三人称被提到但不被期待回应,也是沉默类。论文强调被谈到不等于被要求回应,这是 S2 的关键。

被点名 × 被谈及但未: 被点名负责标记目标人被名字或角色直接称呼且被明确期待回应,被谈及但未负责标记目标人以第三人称被提到但不被期待回应,二者搭配的原因是谈到某人不等于在跟某人说话,组合后新增的作用是让沉默类中最难的一类得到单独监督,防止模型见名就说。

显式点名干预 × 语境干预: 显式点名干预负责处理有直接称呼的最容易该说情形,语境干预负责处理无直接称呼但作为活跃参与者仍被期待回应的情形,二者搭配的原因是该说的情形也有显式与隐式之分,组合后新增的作用是同时考核模型对字面线索和对话角色的理解。

下面先看论文图 1 的教学对比,它用同一段对话展示两种行为的差异,左侧逢停顿必说,右侧只在被直接点名时说,其余位置给出沉默理由。

看图路径: 1. 先对比左右两栏同一段对话下助手插话次数的差异;2. 再看右侧每条沉默标注后括号内的理由写的是在跟谁说话;3. 最后确认唯一标为该说的那一句是否直接称呼了助手

原论文 Figure 1:Traditional (a) vs. context-aware turn-taking (b) in Conversational AI.

论文图 1。原论文 Figure 1:“Traditional (a) vs. context-aware turn-taking (b) in Conversational AI.”。

图 1 左侧面板为传统对话人工智能,同一段甲乙对话中助手在多处停顿后都插话,图注指出这会打断自然多方流程。右侧面板为本文的上下文感知做法,助手仅在甲明确问助手会议时间处回答并标为该说,其余如甲在跟乙说话、乙在回应甲、助手只是被第三人称提到等位置都标为沉默并附理由。像素中右侧唯一绿色对勾对应直接点名处,红色叉号对应传统做法的不当插话。读图的要点是该说与否取决于称呼对象与期待,而非停顿本身,这直接对应后文 I1、S1、S2 的划分。

方法全景如何走通:从一个样本看输入到输出?

沿一个样本走一遍有助于建立全局感。输入是系统提示、指令提示、历史上下文与当前轮次,以及目标说话人信息。表示是按说话人顺序排列的文本序列,超长时保留最近轮次。组件是指令调优大模型加低秩适配器,输出是二元决策;在含推理模式下先输出一句理由再输出决策。目标是让输出与转录中实际发生的下 1 位说话人一致:若目标人说了下一句则为该说,否则为沉默。

论文评估分 2 个阶段。第一阶段是零样本提示,所有模型收相同系统提示,在温度为 0 的条件下于测试集上预测,指标包括准确率、类别平均 F1 与平衡准确率,并附 4 类各自准确率做诊断。第二阶段是有监督微调,用低秩自适应即 Low-Rank Adaptation 在注意力与多层感知机投影层上训练,分仅决策与先推理后决策两种模式,后者的推理痕迹由教师模型按正确标签条件蒸馏得到。

下面看方法总览图,它把输入标签、基座权重、低秩分支、两种输出模式与顶部损失的连接画了出来。

看图路径: 1. 先沿底部输入标签到中部指令调优大模型的箭头看主路径;2. 再看中部仅决策分支与含推理分支在输出标签上的区别;3. 最后看顶部真值推理与真值决策如何共同接入下一词交叉熵损失

原论文 Figure 2:Overview of the proposed framework.

论文图 2。原论文 Figure 2:“Overview of the proposed framework.”。

图 2 底部为输入区,可见系统、上下文、指令与当前轮次等标签,中部为指令调优大模型与低秩分支,基座权重被标记为掩蔽不计算梯度,上方中部分出仅决策分支与含推理分支,顶部为真值推理与真值决策共同接入下一词交叉熵损失。教师模型框标为 Gemini Teacher,其箭头指向真值推理,表明训练用的解释来自按标签条件生成的蒸馏。读图的要点是输入只走前向,梯度只更新低秩参数,真值只用于损失端,这与正文冻结基座、只训适配器的描述一致。

四类标签与数据管道:监督从哪里来?

基准由三份公开多方语料构建,覆盖不同场景。AMI 会议语料约 100 小时 4 人设计会议,带人工转写与称呼标注,用于推断称呼关系。Friends 来自电视剧本的社会对话,通常 3 至 6 人。SPGISpeech 2.0 来自财报电话与金融演示。三者分别代表会议式交互、非正式社交与领域口语。

构造方法是把转录切成时间有序序列,在每个 utterance 边界为每个非说话参与者生成一个决策点。真值直接来自转录:若该目标人说了下一句则为该说,否则为沉默。论文还去掉仅填充词与过短轮次,做精确去重去掉重复上下文,过滤无上下文样本,按每类 80 比 10 比 10 划分训练验证测试。对大得多的 SPGISpeech 做分层子采样至约 1.1 万训练样本并保持类别与细类比例。

4 类标签的计算意义是诊断。I1 检验模型对显式称呼的利用,I2 检验对活跃参与者与隐式期待的理解,S1 检验旁观者情形下的克制,S2 检验被提到但未被要求的细粒度语用区分。论文报告人类在 S2 上也明显偏低,说明这不是标注噪声,而是任务本身的主观与模糊所在。

训练如何配置:更新谁、用什么损失、推理痕迹怎么做?

论文微调所有开源模型,使用低秩自适应,秩为 32,缩放系数为 64,丢弃率为 0.05,作用于注意力与多层感知机投影层。优化器为 AdamW,学习率为 10 的负 4 次方,余弦调度,批量大小为 32,由 16 乘 2 步梯度累积实现,16 位浮点训练 3 轮,10 步热身,按验证集平均 F1 选择检查点。输入截断至最多 2048 词元,超限保留最近轮次;较大的开源模型因显存限制用 1536 词元。训练按模型大小用 1 至 8 块 80 GB 的 A100,较大运行用全分片数据并行。

为防类别与细类不平衡主导训练,论文用 4 路均衡批量采样,每批中 4 类各占约 25%。训练分两种模式。仅决策模式只输出二元决策。先推理后决策模式先生成一句推理痕迹再输出决策,解释为何该说或沉默。推理痕迹的来源是带标签条件的蒸馏:教师模型收到训练样本与真值标签后生成一句与正确标签一致、 grounded 在可观察对话上下文中的解释。

仅决策训练 × 先推理后决策训练: 仅决策训练负责只输出二元标签以最短路径拟合说与不说,先推理后决策训练负责先生成一句解释再输出标签,被教师模型按正确标签条件生成的解释负责把可观察的对话依据写出来,二者搭配比较的原因是检验显式理由是否有助于语用判断,组合意义是论文用对照证明推理痕迹带来可测量的准确率与平均 F1 提升。

需要明确的是论文未报告基座权重本身的更新、梯度在教师端的路径或重置时机等细节之外的实现,只能按证据说基座冻结、低秩分支更新、监督来自转录下一句与教师解释。未报告的内容不做推定,这也是复现时要先核对超参数与截断策略的原因。

实验条件是什么:数据量、模型、指标与人类对照?

模型条件是 8 个近期大模型,包括闭源的 gpt-5.2 与 gemini 3.1-pro,以及 gpt-oss-20b、LLaMA3.1-8b-instruct、Mistral-7b-instruct、Qwen2.5-7b、Qwen3-4b-instruct、Qwen3-8b。零样本时所有模型收相同提示、温度为 0,在各测试划分上评测。指标为准确率、类别平均 F1 与平衡准确率,平衡准确率为两类召回率的平均,方向均为越高越好。人类对照在 Friends 测试子集随机抽 360 个样本,其中 S1 仅 60 个,其余每类 100 个,由 3 位标注者按与模型相同的上下文与目标人信息独立标为说或沉默,并用 Cohen 的 kappa 度量两两一致。

主结果说明什么:零样本失败与微调提升各有多大?

下面先把论文主结果中可重放的量化结论按原句证据整理成宽表,表头不新增单位,数值写法与原句保持一致,仅用于当前验证条件下的比较。

来源证据量化值一量化值二量化值三量化值四
零样本最佳与整体增益上限64.45%up to 23 percentage points≤3 points60–66%
有监督微调例子41.59%72.05%——
人类标注一致性0.570.380.530.492

论文报告最好的模型 gemini-3.1-pro 在 SPGI 上也仅取得 64.45% 平衡准确率,而有监督微调带来至多 up to 23 percentage points 的增益,把系统提示重复两遍仅带来≤3 points 的边际变化,人类标注者取得 60–66% 平衡准确率,标注者间平均 kappa 为 0.492,说明模糊情形下连人都分歧,该表数值和方向只适用于当前验证条件,不能外推到其他数据。

该表把来源中的主结果数值按原文证据句整理前,需要先说明数据集规模分布的整理口径,以避免把不同切分与抽样后的计数混为一谈。

来源证据量化值一量化值二量化值三量化值四
来源句一11,9001,5984,4074,127;1,768;8,970;1,114;2,632;639;4,585;99,290;21,595;28,050;17,441;32,204
来源句二120,16024,30735,08922,207;38,557

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

哪些设计真正起作用:推理痕迹、秩与混合训练?

消融要回答 3 个可操作问题:加推理痕迹是否值得、秩选多大、能否用一个模型跨域。比较条件是同一基座与同一 Friends 测试集,指标方向仍为越高越好。

来源证据量化值一量化值二量化值三量化值四
来源句二32162—

论文报告,在 Qwen2.5-7B 上加推理痕迹把准确率从 63.64% 提高到 70.84%,提高 7.2 个百分点,平均 F1 提高 5.2 点,支持显式理由有助于决策的判断。秩比较中 32 取得三指标最优,秩 16 低约 3 点,秩 64 无进一步增益,提示超过 32 后收益递减。混合训练用三域合并训练集训一个模型,在决策模式下取得 71.73% 平均平衡准确率,与分域微调可比,支持学到的轮次表示可跨场景迁移。限制是这些消融主要基于 Friends 与 Qwen2.5-7B,总体趋势不等于每组每步都成立,且未测量延迟与成本,不能承诺实时性改善。

边界在哪里:哪些情形仍不可靠、哪些验证还没做?

从证据看,不可靠情形集中在语用最细处。S2 即被谈及但未被点名在零样本与人类标注中都偏低,说明见名就说的捷径很强。I2 即无直接称呼但期待回应也需要对活跃参与者的跟踪,零样本中开源模型在此类上波动大。微调虽大幅回升 S1 与 S2,但在部分模型上 I1 与 I2 出现超过 10 个点的回落,表 3 括号中的负向变化提示增益有代价,不是所有细类单调变好。

未验证的边界同样要说清。论文输入是文本转录与说话人标识,没有使用韵律、 gaze 或语音活动等声学与多模态线索,结论只支持文本上下文条件下的判断。未测量误判率对应的打断成本、推理延迟、输出帧率与部署开销,因此不能从准确率提升直接推出用户体验或实时可行性。人类对照只在 Friends 的 360 样本上完成,且 S1 仅 60 个,不能推广到会议与金融域。标注者间 kappa 平均 0.492 表明任务主观性强,单一真值可能低估了合理分歧。

复现先做什么:数据、代码、权重与超参数如何取舍?

复现的第一步是按信息条件准备数据。论文称数据集与扩展版本在本次资源核验中本次未能确认可达,模型权重链接本次未能确认可达,代码链接当前不可用,唯一本次确认可用的是扩展版预印本链接。因此当前能复述的是方法与超参数,不能写代码与权重已公开可下载。需补的验证是待链接可达后再核对划分、采样脚本与提示词原文。

第二步是锁定可运行策略。零样本基线必须用相同系统提示、温度为 0、在各测试划分上评测,并报告准确率、类别平均 F1、平衡准确率与 4 类准确率,不能只报总准确率。微调基线应从仅决策模式起步,再对比先推理后决策模式;教师解释需按真值标签条件生成一句,并 grounded 在可观察上下文中。超参数保留论文值:秩 32、缩放 64、丢弃 0.05、学习率 10 的负 4 次方、余弦调度、批量 32、3 轮、10 步热身、2048 词元截断、大模型 1536 词元、验证平均 F1 选点、4 路均衡采样。硬件预算按模型大小准备 1 至 8 块 80 GB A100。

第三步是先跑小规模对照。建议先在 Friends 上复现仅决策与含推理的 7.2 个点差距,再试秩 16 与 32 的约 3 点差距,最后再做三域混合训练的跨域检查。若 gpt-oss 类推理模型增益极小,应检查输出格式与内部推理的冲突假设是否成立,而不是直接调大秩。

何时值得尝试:给新生的行动清单与误解澄清?

当你的助手要进入多人会议或群聊,且已有说话人标识的文本上下文时,值得尝试本文的做法:把每个停顿转为 1 次二元决策,用 4 类标签做诊断,先测零样本再做带推理蒸馏的微调。若只有双人场景或只有音频能量而无上下文,则不适用本文结论。

常见误解有三。其一,总准确率高不等于参与判断好,必须同时看平衡准确率与 S1、S2,因为该说偏置会掩盖沉默类的失败。其二,被提到不等于被点名,S2 的存在就是为纠正见名就说。其三,提示重复两遍的边际增益不代表能力可用,论文用该对照支持缺失的是语用能力而非注意力。

收束时回到一句话:上下文感知轮次接管不是大模型的涌现能力,必须显式训练;带标签条件推理的微调在三域上带来至多 23 个百分点的平衡准确率提升并达到或超过人类水平,但仍限于文本条件与离线评测,多模态实时部署与打断成本仍待验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总