英文题目:Before the Turn: Investigating Motion Cues Preceding Speech in Dyadic Interaction

会议身份:conference:interspeech:2026:conference-paper-id:huang26d_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Transformer #语音 #轮次切换

评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ying-Hsuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Woan-Shiuan Chien:机构信息未能从会议 PDF 纯文本可靠映射
  • Huan-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文研究面对面双人对话中的轮次切换(Turn-taking)预测,输入为说话起始点前连续 3D 骨骼流,输出为保持(Hold)与转移(Shift)二分类,难点在于重叠语音与静默间隙下声学边界模糊且意图早于发声。首先基于角速度与运动多样性构造物理先验并检测阈值上起始(onset)以刻画各部位准备时序,其输出的窗口分布用于指导截断边界选择。接着将固定 3.0s 观察窗按前导时间后移并送入 Transformer 建模长程姿态依赖,从而分离早期粗大动作与晚期同步线索。与把视觉视作同步抽象流的做法不同,该链路以全身异步协商建模意图累积,用上身远期姿态与手头近期线索分治,避免长窗引入先前伴随手势污染并揭示模态特异时序层级。在 InterAct 数据集上,上身(UpperBody)在前导 1.5s 时转移 F1 达到 71.26%,显著高于语音起始点附近的基线条件,支撑了抢夺需长期积累而保持为碰撞瞬间爆发的判断。该结论仅适用于受控双人半结构化场景与离线切分边界,未验证多人、噪声、跨文化及实时流式外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要回答哪两个时间问题?

本文的输入是双人面对面场景下连续采集的 3 维全身骨骼序列,目标是在对方真正发出声音之前判断下一段是换人说还是原人继续说。初学者容易把轮替理解为听完声音再切分,但作者强调自然对话是视听联合协商,身体会在发声前先做准备。白话说,话轮转移偏移就是量上一句结束到下一句开始之间隔了多久,正值是静音间隙,负值或零附近是紧接与重叠。输出是二分类标签,换人称为转移,保持称为维持。

轮替 × 话轮转移偏移: 轮替指双人对话中说话权从当前说话人交到对谈者或由原说话人保持的过程,话轮转移偏移指用 0.3 秒停顿阈值和前后话语边界差量出的静音间隙或重叠量,二者分工是前者定性转移单元、后者定量时间零点,搭配的原因是只有把连续对话先切成可比较的转移单元,才能进一步区分抢话与守话的运动准备时间,组合意义在于为后续所有提前量实验提供统一的时间零点。

为此作者提出两个研究问题。第一,不同身体部位的发声前运动起点是否不同步,上半身是否早于手和头等远端关节。第二,抢话意图与守住话轮意图所需的预测提前时间是否不同。本文默认从原文独立写作,所有事实只以论文正文证据为准。代码方面,资源状态显示两个仓库当前可用,已公开可核对,分别对应本文实验代码与所借用的预测模型实现。后续所有窗口长度、提前时间与性能数字都围绕这两个问题展开,不把比喻当作性质证明。

此前路线为何只把视觉当附加特征?

此前的计算路线大多把轮替当作声音边界检测,依赖声学与语言线索,遇到重叠语音或短暂停顿就含糊。另一类多模态工作虽然加入了注视、表情或头部动作,但多用抽象统计特征或离散动作标签,例如是否互视、是否点头、手势类别,而不是连续的关节角速度轨迹。这类做法验证了视觉有用,却把各部位当作同步数据流,没有量过每个部位提前多久出现意图。

本文的差异在于坚持全身体运动学视角。它不满足于多加一路特征涨点,而是系统移动观察窗口与预测起点,定位每个部位最早何时出现可判读的准备动作。教学上可以这样理解,旧路线回答有没有视觉帮助,新路线回答哪块身体在何时帮助最大。作者还引用生理准备期与手势先于语音的文献,说明提前准备在不同模态本就不同步,抢话需要更长的动员,守话则接近碰撞才发力。这为后文区分意图相关提前量埋下依据。

四种对话情形如何定义,样本如何走完一次判定?

作者先用说话人日志切分话语,再按是否换人与是否有停顿分成 4 种情形。情形 A 是停顿后原人继续,情形 B 是停顿后换人,情形 C 是无停顿直接换人或重叠,情形 D 是无停顿原人连说。阈值上,静音合并与最小时长在日志阶段设定,情形划分用 0.3 秒停顿阈值,图上还标出 300 与 150 的时间刻度以区分间隙与紧接。沿一个样本走,输入是目标起点前的一段骨骼,表示是归一化后的速度与多样性,组件是运动起点检测或变换器分类器,目标是输出转移或维持,输出即下一段归属。

下面这张图把 4 种情形画在同一时间轴上,是理解全部实验分组的基础,请先看划分再看波形归属。

看图路径: 1. 先看左侧 shift 与 pause 两列的叉勾组合,确认四种情形的划分逻辑;2. 再沿时间轴找到 t_pre-end 与 t_nxt-start 两条虚线,比较 B 与 C 的间隙差异;3. 对照绿色当前说话人与蓝色对谈者的波形归属,定位要预测的是下一段由谁发出;4. 注意 D 情形下一段仍为绿色,理解守话无停顿与抢话重叠在图上的区别

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

从像素可见,横轴为毫秒时间,纵轴四行分别标为 A 至 D,左侧两列标出换人与停顿的有无。绿色波形为当前说话人,蓝色为对谈者,虚线标出上一段结束与下一段开始。B 行两段之间留出明显间隙并标 300,C 行下一段蓝色提前压上,D 行下一段仍为绿色且紧接。蓝色横条还标出对谈者运动区间,提示预测用的是开口前的身体而非声音。该图不支持猜测具体数值,只用于确认分组逻辑,后文所有按情形报告的准确率都回指到这四行定义。

方法全景:先找起点,再试窗口,最后平移提前量

全流程分 3 步。第一步做运动学表示与起点检测,把原始 120 帧骨骼降采样到 30 帧,音频时间戳量化到 0.1 秒,保证每 0.1 秒对应 3 帧,然后对目标起点前的干净窗口计算归一化速度,首次超过 2 倍标准差记为起点。第二步做窗口探测,固定终点在起点处,向过去分别取 0.5 秒到 3.0 秒共六档,用同一预测模型比较全身、上半身、手、头部的效果,找到最干净的历史长度。第 3 步做提前量实验,固定窗口长 3.0 秒,再把窗口整体前移 0 秒、0.5 秒、1.0 秒、1.5 秒,看提前多久仍能判对,并按 4 种情形拆解。

观察窗口 × 预测提前时间: 观察窗口指紧贴目标话语起点向过去截取的长度为 L 的骨骼片段,预测提前时间指把固定 3.0 秒窗口整体再向前平移 tau 秒所形成的时间差,二者分工是窗口决定看到了多少历史,提前时间决定离开口有多远,搭配理由是只有固定一端再移动另一端才能分离历史信息量与预测难度,组合意义在于分别回答看多久最干净与能提前多久仍可判对。

表示上用 60 关节全身骨架再划出上半身 51 关节、手部 38 关节、头部 3 关节,输入变换器时用 6 维连续旋转表示以保证连续性。归一化均为按说话人求均值方差的标准化,以消除个人表达基线差异。需要提醒,窗口过长会把上一段的共发手势尾巴也装进来,污染特征空间,这是后文全身在 2.5 秒下滑的直接原因。

速度与多样性各自算什么,为何要配对使用?

速度的计算是先对每个关节的解缠旋转角求帧间差的二范数,再除以帧间隔得到关节角速度,然后在所选部位内平均。多样性是同一时刻各关节速度相对该均值的标准差,刻画动作是整齐平移还是多关节异步展开。两者都再做按说话人的标准化,分别记为归一化速度与归一化多样性。高多样性被假设为竞争性打断时更常见,用以区分均匀的准备位移与杂乱的争夺手势。

运动速度 × 运动多样性: 运动速度指对每个关节角位移取二范数再按身体部位平均得到的整体活动强度,运动多样性指各关节速度相对均值的标准差所刻画的异步复杂程度,二者搭配的原因是只看强度会把一致的前移和竞争性的杂乱手势混为一谈,组合意义在于用强度定位准备动作是否发生,用多样性判断是否为抢话式的多关节竞争展开。

起点检测限定在目标起点前的观察窗内,且要求窗口不与本人上一段语音重叠,避免把说话中的手势误当准备。阈值取 2 倍标准差,目的是滤掉呼吸等背景起伏,只保留有意图的运动规划。统计显示约三成到三成五的转换存在显著准备动作,为建模提供先验。时间上远端执行器多在 0.5 到 0.6 秒前激活,上半身峰值早至 2.9 秒,但均值与中位数在各部位都挤在 1.46 秒到 1.55 秒之间,说明极端值分化而中心仍一致。

抢话积累与守话爆发在信号上长什么样?

作者把意图差异翻译成两套可核对的信号形态。抢话被描述为提前 1.5 秒的运动多样性积累,即上半身与手部在远离起点时就开始 expend 能量,到临近起点反而回落。守话被描述为碰撞边界处的爆发,即在提前量为零时上半身速度与多样性达到最大,提前预测反而失效。静音协商则主要靠头部在 0.5 秒前的微小 surge,例如视线与点头,尽管上半身与手部整体偏放松。

抢话 × 守话: 抢话对应话者更换的转移事件,守话对应原说话人继续说的保持事件,二者分工是代表两种相反的交际意图,搭配比较的原因是同一段身体运动在不同意图下时间形态完全不同,组合意义在于揭示抢话靠提前 1.5 秒的能量积累而守话靠碰撞时刻的爆发,从而证明提前量必须是意图相关的。

这套区分直接决定实验解读。在提前 1.5 秒处,准备打断与调整姿势在运动学上难以区分,导致维持类情形准确率下降,模型必须等到起点时刻才能确认守话。用初学者语言说,抢话是慢慢攒动作,守话是到点才发力,静音换人是靠头的小动作递信号,三者时钟不同,不能用同一个提前量一刀切。

模型如何训练,哪些参数被明确报告?

提前量阶段的任务是二分类,转移对维持,输入为 3.0 秒共 90 帧的骨骼流。架构沿用已发表的基于变换器的双人预测模型,自注意力用于分离早期粗大运动与晚期同步线索。优化目标为加权二元交叉熵,以应对转移与维持的数量不平衡。优化器为 AdamW,学习率与权重衰减均为 1 乘 10 的负 4 次方,最多 25 轮,按验证集加权 F1 早停,丢弃率为 0.1,批量为 64。评估用 5 折交叉验证,另留 5% 作被试内泛化的保留测试集。

需要明确的缺项是,原文未报告随机种子、折划分细节、早停耐心值与完整超参搜索范围,也未说明骨骼编码器各层是否冻结或全量更新,因此不能从模型名称推定梯度路径。本文没有训练新的生成模型,训练仅指该分类器的拟合过程,运动表示公式本身是确定性计算而非学习得到。复现时应先固定数据划分与类别权重,再核对早停指标为加权 F1 而非准确率,否则在类别不平衡下会得到偏向多数类的虚高准确率。

数据、划分、同步与指标如何保证可比?

数据用 InterAct,8.3 小时、241 个半结构化双人场景、7 名被试,提供连续全身动捕,区别于多人或语言为主的数据集。处理后剔除含糊片段与短反馈词,得到转移与维持的总数,后文表格将给出具体数字。同步上动捕降采样到 30 帧,音频量化到 0.1 秒,每 0.1 秒恰为 3 帧,再把运动片段对齐到日志边界。指标同时看转移 F1、加权 F1、平衡准确率、总体准确率与曲线下面积,以及按 4 种情形拆分的准确率与对应的平均速度多样性,用以把性能回接到物理量。

下表整理数据规模这一必须保留的信息,比较问题是样本是否足以支撑按意图拆分,公平条件是同一套日志与阈值,指标方向是数量越大拆分越稳,但不直接代表性能高低。

条件指标总量转移类维持类
InterAct 处理后样本数全部事件2439 shifts1505 holds
InterAct 采集时长场景被试连续动捕8.3 hours241 scenarios 7 participants
日志同步帧率对齐计算约束30 fps每 0.1 秒 3 帧

表中转移多于维持,建模时用加权损失纠偏。代价是 7 人规模有限,被试内泛化结论外推到新人时需谨慎。未胜出项是短反馈与含糊段被直接剔除,意味着模型未评测边界上的嗯啊类极短插入,这部分在真实部署中仍会遇到。

不同部位看多久最干净,谁能撑到 3 秒前?

窗口探测固定终点在起点处,只改变向过去看多远。结果呈现清晰的部位分工。上半身在 0.5 秒达峰后在 2.0 秒仍保持高效,说明躯干姿态加手部动作的组合最稳定。头部在 0.5 秒尚可,一旦拉到 3.0 秒急剧下滑,原因是把持续的倾听点头等背景行为也纳入,淹没了临门信号。全身在 2.0 秒达峰后到 2.5 秒明显回落,证明更长历史并不单调变好,过长会吸入上一段共发手势尾巴。

下表把原文报告的关键窗口数字并置,比较问题是同一模型下谁更耐长窗口,公平条件是同一起点与同一模型,指标方向是转移 F1 越高越好。

条件指标上半身峰值全身拐点头部衰减
W0.5 到 W3.0F1-Shift76.81% 与 75.97%75.16% 与 70.68%65.22% 与 54.16%
部位窗口上半身全身头部
含义稳定性维持高效过长污染引入倾听噪声

表后解释主要收益与代价。上半身的收益是长短窗口都可用,代价是仍需与手部配合而非孤立关节。全身的反例是 2.5 秒的下滑,直接支持截断边界至关重要。头部的负结果同样重要,它说明临门同步线索时间敏感,部署时若用长历史融合头部反而有害。

下面这张图是该节的核心证据,请按从左到右的指标顺序阅读,再比较线的走向。

看图路径: 1. 先横向比较四个子图指标,确认纵轴均为百分比且越高越好;2. 再纵向跟踪黑色全身与蓝色头部两条线随窗口从 0.5 秒到 3.0 秒的走向差异;3. 观察红色上半身线在多数窗口保持高位,验证其稳定性结论;4. 结合图例中均值中位数众数标记位置,理解统计起点与模型峰值的对应关系

原论文 Figure 2:Temporal hierarchy of predictive performance across different body parts evaluated on four metrics.

论文图 2。原论文 Figure 2:“Temporal hierarchy of predictive performance across different body parts evaluated on four metrics.”。

从像素可见,四幅子图横轴均为窗口长度 0.5 到 3.0 秒,纵轴为百分比。红色上半身线在第一幅保持高位,黑色全身线先升后在 2.5 秒附近下探,蓝色头部线在四幅中都随窗口拉长而走低,尤其在总体准确率子图跌至 50% 附近。绿色手部线居中且相对平稳。图例区分全身、上半身、手、头部与起点统计标记。该图只支持趋势判断,不能读出精确到小数点的每个点,后文精确数字以正文引用的峰值与拐点为准。

提前 1.5 秒还能判对吗,意图如何改写时间表?

提前量实验把 3.0 秒窗口整体前移,条件为 0 秒、0.5 秒、1.0 秒、1.5 秒。反直觉的发现是转移事件在提前 1.5 秒反而优于起点处,因为起点附近的静态姿势成为时间噪声,而信息量大的运动前体早已稳定。分部位看,上半身主导早期预测,远端关节视野更短。分情形看,无停顿抢话需要动能积累,上半身在 1.5 秒达约 79.29% 情形准确率,而有停顿换人在 0.5 到 1.0 秒更依赖头手,静音间隙实际是活跃协商。

远端关节 × 上半身姿态: 远端关节指手与头这类活动快但持续短的末端部位,上半身姿态指包含躯干与手臂的整体位形变化,二者分工是前者负责临门一刻的同步微调,后者负责长时间的意图构筑,搭配比较的原因是二者启动时刻天然不同步,组合意义在于解释为何头部窗口稍长就崩而上半身拉长到 2.0 秒仍稳定。

物理量回接进一步支撑判断。抢话情形的上半身多样性在 1.0 秒与 1.5 秒处高于起点处,呈先高后散的积累形态,手部亦呈倒 U 形。守话情形在起点处上半身速度与多样性达最大,对应碰撞时刻的爆发,因此提前预测失败。B 情形上半身与手部多为负的归一化值表示放松,唯独头部在 0.5 秒出现正向 surge,证明静音靠头递信号。限制是提前 1.5 秒时抢话准备与姿势调整难以区分,导致维持类准确率下滑,必须等到起点才能确认。

拿掉长历史或换部位会发生什么,失败条件是什么?

本文的对照不是传统消融模块,而是以窗口长度与身体部位为对照轴。拿掉长历史即只看 0.5 秒,头部与全身尚可,但会丢失上半身早至 2.9 秒的意图构筑信号,抢话积累无从捕捉。加上过长历史即拉到 3.0 秒,头部崩解,全身受污染,只有上半身仍稳。换部位对照显示,上半身加手部的组合优于孤立关节组或整个全身,说明部位选择比一味堆关节更重要。

失败条件有 3 类。第一,头部长窗口引入持续倾听点头,模型把背景当信号。第二,全身长窗口吸入上一段共发手势尾巴,特征空间被污染。第三,提前 1.5 秒时维持类样本与抢话准备在运动学上不可分,模型被迫延迟到起点。训练部署成本方面,原文未报告参数量、训练时长、硬件与推理延迟,因此不能承诺实时性改善。复现时应保留的超参是 3.0 秒 90 帧输入、6 维旋转表示、按说话人标准化与加权损失,缺一即不可比。

哪些结论只是有限解释,哪些边界尚未评测?

直接报告的是窗口峰值、提前量排序与按情形的准确率差异,有数字支撑。有限解释的是用速度多样性回接意图,例如把高多样性等同于竞争性打断,这得到数据支持但仍是相关性而非因果,不能说动作导致了抢话。未验证推测是把上半身 2.9 秒峰值解释为潜意识意图构筑,这需要心理学与生理测量补证,目前只是与模型峰值吻合。

未评测边界包括短反馈词与含糊段已被剔除、仅 7 人的被试内泛化、仅双人半结构化场景、未测误判率与延迟代价。总体趋势不等于每组每步成立,例如上半身平均稳定不代表每个样本都提前可判。相关性不等于因果,缺失证据不是技术错误,后续需补被试间划分、实时推理开销与跨数据集验证,才能谈可部署收益。

复现先做什么,需要哪些信息条件?

先做数据复刻。用 InterAct 的 60 关节层级骨骼,按原文降采样到 30 帧,音频量化到 0.1 秒,按说话人做标准化,复算速度与多样性并用 2 倍标准差找起点。阈值上日志用 0.1 秒最小静音与 0.15 秒合并,情形划分用 0.3 秒停顿阈值,剔除规则与原文一致。

下表整理复现必须锁定的运行配置,比较问题是保证与原文同条件,公平条件是同一输入表示与同一优化目标,指标方向按原文早停为准。

条件指标输入编码优化设置评估
3.0 秒 90 帧连续旋转6D rotationAdamW 1×10−45 折加权 F1 早停
批量丢弃训练预算batch 64 dropout 0.1最多 25 epochs留 5% 保留集
架构来源注意力作用Transformer分离早晚期信号按情形拆分

表后说明,核心是固定 90 帧与按说话人标准化,否则跨人基线漂移会淹没提前信号。代价是原文未给种子与硬件预算,复现需自记耗时与显存。代码当前可用,可核对仓库中的窗口与提前量实现,但权重下载与系统可运行状态需以仓库实际页面为准,不做超出证据的承诺。

何时值得尝试这套提前视角,还需补哪项验证?

当你的对话系统总慢半拍,尤其在重叠与短停顿处误切,就值得尝试发声前运动视角。上半身适合做远期预警,手头适合做积累判断,头部只适合做 0.5 秒内的静音协商确认。做法是先用短窗口上线头部,再用长窗口叠加上半身,并为抢话与守话设不同的提前阈值,而不是共用一个起点。

还需补的验证是被试间泛化、跨场景迁移、误触发率与端到端延迟,以及把速度多样性与真实交际意图做人工标注对照。记住本文的中心判断,意图在时间上是异步的,抢话靠提前积累,守话靠碰撞爆发,窗口越长不越好,干净的截断比堆历史更重要。带着这套时钟去重放自己的双人数据,先复现 4 种情形的基线,再移动窗口与提前量,才能把论文的方法真正复述为可运行的流程。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总