英文题目:Speech Entrainment in Multi-Party Conversations with a Digital Agent

会议身份:conference:interspeech:2026:conference-paper-id:mehlman26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #韵律 #语音情感识别 #语音交互

评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Nicholas Mehlman:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaitlin Zareno:机构信息未能从会议 PDF 纯文本可靠映射
  • Kleanthis Avramidis:机构信息未能从会议 PDF 纯文本可靠映射
  • Anfeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文研究多人人类与数字智能体同场对话中的言语顺应,输入为分轮次多说话人语音与智能体语音,输出为人与人及人与智能体在声学与语义特征上的趋同判定,难点在于多方轮次交错与儿童语音变异使趋同易被话题与角色分工混淆。方法链分三步推进:先以Wizard of Oz采集成人与家庭会话并做人工说话人切分与轮次划分,再提取振幅与PESTO基频及VoxProfile情感与Whisper等嵌入,然后以混合效应回归比较同轮与跨轮及前5轮与后5轮距离以检验局部与全局顺应。与既有双人人类顺应研究相比,关键差异在于同时引入非人类参与者与多方结构并区分局部即时对齐与会话级收敛,有助于揭示社会语境对顺应的调节作用。在全局顺应评测任务下,成人P2P的Emotion distcos指标为0.05076,低于家庭P2P的Emotion distcos指标0.0861。局部比较显示成人P2P在振幅、基频与唤醒度上显著趋同而人与智能体顺应缺失,全局上家庭P2P基本不显著而儿童到智能体在语义上收敛。结论仅适用于结构化问答式外星访客范式与英语年轻成人及 8 岁到 14 岁儿童家庭,难以推广到开放域多方协作或长期交互。该适用边界受限于结构化访谈场景,尚未验证开放域协作中的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留什么?

本文的输入是真实采集的多人加智能体英语对话录音与人工标注的说话人与时间戳。目标是判断说话风格趋同是否发生以及在何种条件下发生。趋同在这里先用白话说就是说话人越聊越像,包括音高与响度与情绪和用词选择,英文名为 entrainment。

输出不是生成更好的智能体回复,而是一套可复述的测量结论。在局部轮次内人与人是否更接近,随会话推进是否更接近,人对智能体是否同样接近,以及成人组与家庭组有何不同。必须保留的信息包括两个队列的规模与轮次结构,以及手工特征与深度嵌入的具体提取方式。

还必须保留混合效应回归中同轮指示与首末轮对比的定义,以及显著性校正方式与报告为显著和不显著的具体特征。后文先讲任务与已有路线,再走完从录音到特征到统计判断的全景。最后分别展开采集与特征与建模与条件与结果,然后给出复现步骤与适用边界。文中教学例子会明确标为例子,不引入原文之外的数值效果。

已有路线研究了什么,为什么多人加智能体仍是缺口?

已有工作大多研究双人人类对话中的趋同,覆盖音高与节奏与振幅与语速与词汇和发音。常用手工声学特征比较差异,也有用无监督深度嵌入学习趋同距离。研究报告趋同与沟通有效性与社会喜爱度相关,多人合作游戏研究还发现声学与词汇层面都会收敛。

另一条路线是人与智能体对话,已有数字语言家教与语音助手实验发现被试会向智能体调整语速。儿童对智能体与对人类说话方式不同,振幅存在收敛,但智能体向人类趋同是否总是有益并不一致。

原文指出这些工作或者局限在双人,或者局限在单人对智能体,或者把重点放在如何让智能体趋同以提升信任。本文的定位因此是补上多人加智能体这一交叉点的描述性证据,而不是提出新的对话策略。理解这一点可以避免误把回归系数当作可部署的智能体控制参数。

本文把趋同拆成哪两个可检验的问题?

本文提出两个时间尺度假设。第一个是局部趋同,英文为 local entrainment,白话是同一轮里的人说话是否比跨轮更像。第二个是全局趋同,英文为 global entrainment,白话是会话后段的人与人差异是否比前段更小。

两个假设都要在成人会话与家庭会话中分别检验,并区分参与者之间趋同与参与者对智能体趋同。前者记为 P2P,后者记为 P2A,家庭内还细分儿童对监护人与儿童对智能体,分别记为 C2G 与 C2A。

举例说明,例子是智能体问今天学校怎么样,同一轮里 2 名成人先后回答。若他们的平均基频差在同轮配对中系统性小于跨轮配对,就支持局部趋同。若所有人在最后 5 轮的差异小于最初 5 轮,就支持全局趋同。问题形式决定了统计模型必须能区分同轮与跨轮,以及首段与末段,同时控制不同会话与说话人对的基线差异。

从录音到判断的方法全景如何走通?

先沿一个样本走完流程。输入是 1 次 8 到 12 分钟的多人会话录音,包含波束成形麦克风阵列单通道与领夹麦克风辅助。系统直接缓存智能体语音与时间戳,人工标注给出每句话的说话人与起止时间。

据此把阵列录音切分为每个说话人独立的文件,不活跃段填静音。再按 1 次智能体提问加人类回答切分为对话轮,表示阶段对每一轮每个说话人提取两类特征。一类是振幅与基频与情绪的可解释标量,另一类是情绪嵌入与语义向量与语音潜向量。

组件阶段计算特征差异,局部用同轮配对与跨轮配对比较,全局用前 5 轮与后 5 轮比较。目标是估计固定效应伽马,局部为负表示同轮差异更小,全局为负表示末段差异更小。整个流程不训练新的声学模型,只调用已有提取器加回归检验。复现关键在于切分与特征配置与回归设定的一致。

局部比较与全局比较的时间机制有何不同?

局部建模对给定交互模式计算轮内与跨轮的成对特征差异,用混合效应回归建模差异为随机截距加同轮指示固定效应加残差。同轮指示为一表示两个话语来自同一轮,为零表示来自同会话不同轮,伽马即为该指示的系数。

局部趋同 × 全局趋同: 局部趋同分工是检验同一轮内说话风格是否更接近,回答当前轮次的即时适应;全局趋同分工是检验前 5 轮到后 5 轮差异是否缩小,回答随会话推进的累积收敛;二者搭配的原因是短期互相模仿不等于长期形成共同风格,组合后新增的含义是区分即时社会协调与持续关系建立,本文正是用两种时间尺度分别建模才发现局部强而全局弱的分化。

全局建模沿用同样的成对差异,但固定效应改为是否属于后 5 轮,比较的是前 5 轮与后 5 轮。原文明确不对特征做归一化,因此伽马保留原始尺度,不同特征的数值不能直接比较大小。

这种设计的好处是随机截距吸收了某些人天生声音更接近的基线。固定效应只捕捉轮次结构带来的额外接近,局部与全局的样本量与方差结构不同,不能把两类伽马的绝对值混为一谈。

两类语音表示各自捕捉什么信息?

手工部分先算帧级均方根振幅,按轮按说话人求均值与标准差与最小值与最大值与极差。基频用 PESTO 估计帧级 F0,同样按轮求统计量并排除静音,情绪用 VoxProfile 同时跑 2 个模型取平均。

手工特征 × 基础模型嵌入: 手工特征分工是给出可解释的振幅与基频与情绪标量,回答哪一类声音属性在趋同;基础模型嵌入分工是用向量距离回答语义与情感与语音层面的整体相似;二者搭配的原因是单一属性常只覆盖部分趋同,组合后新增的含义是既能定位到具体声学维度,又能捕捉难以手工列举的整体风格接近。

基础模型部分把情绪模型倒数第二层嵌入拼接,把 Whisper-base 编码器输出按时间平均,把重采样后波形送入 Mimi 编码器再按时间平均。距离用余弦距离与欧氏距离两种形式报告。

教学上可以这样理解,例子是振幅回答响不响,基频回答高不高,Whisper 向量回答含义是否接近。原文对偏语义与偏语音的表述是预期与意图,不是可解释性证明,不能把某一路距离显著直接等同于纯语义趋同。

比较对象不同会如何改变趋同含义?

本文在同一会话结构下比较人类之间与人类对智能体两种配对。人类之间比较的是群体内部协调,人类对智能体比较的是是否把非人类当作同等对话者。两种比较共享轮次切分与特征计算,只有说话人对的构成不同。

参与者之间趋同 × 参与者对智能体趋同: 参与者之间趋同分工是检验人类彼此是否互相适应,回答群体内部协调;参与者对智能体趋同分工是检验人类是否把智能体当作同等对话者,回答非人类参与者的调节作用;二者搭配的原因是两者共享同一会话结构但社会角色不同,组合后新增的含义是通过对比可以直接读出被试是否区别对待智能体,本文局部结果正是前者显著而后者缺失。

家庭内进一步区分儿童对监护人与儿童对智能体,可以检验儿童是否更响应照顾者的线索。这种划分让局部显著而对智能体缺失的结果具有对照意义,说明交互对象身份是边界条件。

若把智能体纳入后显著消失,就支持被试区别对待智能体的判断。但这属于有限解释而非因果证明,还需要排除角色分工与语音稳定性等混杂。

回归估计与多重校正如何配合判断显著?

混合效应回归为每个会话与说话人对设置随机截距,在控制基线差异后估计固定效应伽马。局部固定效应是同轮指示,全局固定效应是后 5 轮指示,伽马为负表示差异缩小。

混合效应回归 × Bonferroni 校正: 混合效应回归分工是为每个会话与说话人对设置随机截距后估计同轮或末轮固定效应伽马,回答差异缩小是否超出偶然;Bonferroni 校正分工是按特征类别对多重检验收紧显著性门限,回答多特征同时检验时的假阳性控制;二者搭配的原因是趋同检验涉及多特征多队列,组合后新增的含义是让显著的伽马同时具备效应方向解释与统计严谨性。

多重检验按特征类别做 Bonferroni 校正,手工表与深层表分别处理。原文不对特征归一化,因此伽马保留原始尺度,只能比较方向与显著性。

这种配合让显著的伽马同时具备效应方向解释与统计严谨性。若只看未校正显著会夸大发现,若只看系数大小会误比不同量纲的特征。

本研究训练了什么,没有训练什么?

本研究没有训练新的趋同模型与声学模型与对话策略,也没有报告梯度路径与优化器与冻结更新或早停。真实计算过程分为 3 类,第一类是数据构造与标注,第二类是既有模型推理,第 3 类是统计估计。

Wizard of Oz × 对话轮: Wizard of Oz 分工是由藏在另一房间的人类操作员从对话树选择智能体回复,保证智能体行为可控且符合剧本;对话轮分工是把 1 次智能体提问加随后人类回答打包为分析单元,保证局部比较的同轮与跨轮划分一致;二者搭配的原因是既要制造自然的多人访谈体验又要保留可复现的切分,组合后新增的含义是后续所有同轮更接近还是末轮更接近的判断都锚定在同一轮定义上。

数据构造招募两组英语被试,成人多为高校本科与硕士,家庭为八到十四岁儿童加家长。每次 2 到 6 人加一个外星访客形象的动画智能体,围绕学校日常提问,成人与家庭用不同剧本。

智能体回复由另一房间的人类操作员从对话树选择,属于 Wizard of Oz 设置。既有模型推理直接调用 PESTO 与 VoxProfile 与 Whisper 与 Mimi 做前向提取,未报告微调。缺项需要明确指出,操作员延迟与标注一致性与回归软件细节均未交代,复现时只能记录为待验证假设。

数据规模与评价条件如何设定?

评价不是分类准确率,而是成对差异是否在特定结构下更小。指标方向是伽马为负支持趋同,为正为远离,显著性经校正后判断。数据按队列自然划分,不做训练测试切分,每个会话与说话人对作为随机截距单元。

下表比较成人与家庭在会话数与轮数与轮时长与人数与总时长上的规模差异。这是判断统计功效与全局零结果是否可比的前提,数值越大表示数据越多或会话越长,不直接表示趋同强弱。

群体会话数中位每会话轮数总时长
成人3024.5337.61 min
家庭102865.88 min

成人会话总数与总时长明显多于家庭,家庭中位轮数略高但平均轮时长更短。人数上限成人为 6 人而家庭为 3 人,最小人数均为 2 人。这意味着家庭全局检验的样本更少,每轮语音更短,功效天然更低。

同时成人组在数据收集前约 10 分钟的聚集与签署中已有接触,家庭组更是结伴前来。原文明确提出这可能让基线已部分趋同,从而压缩首末对比的空间,这是理解全局弱结果的关键条件。

局部趋同的主结果支持什么,又在何处缺失?

下表要回答的比较问题是,在控制会话与说话人对基线后,同轮人与人差异是否小于跨轮。比较覆盖成人与家庭,以及全部人类对与儿童对监护人,指标方向是伽马为负且校正后显著才算支持。公平条件是同一特征类别内做 Bonferroni 校正且不归一化。

队列与配对振幅均值伽马基频均值伽马唤醒度伽马Whisper 余弦伽马Mimi 余弦伽马
成人 P2P−0.0091−25.7837−0.0388−0.0134−0.0287
家庭 P2P−0.0042−10.8488−0.0274−0.0107−0.0421
家庭 C2G−0.0044−12.8029−0.0303−0.0110−0.0417

成人 P2P 几乎所有手工与深度特征都显著为负,报告显示成年陌生人在同一轮会系统性互相靠近。问卷中多数人认同小组融洽且彼此同步,支持了以社会亲和解释即时协调的说法,但这属于支持而非因果证明。

家庭 P2P 与 C2G 只在情绪唤醒度与优势度与 3 类嵌入距离上显著,振幅与基频不显著。原文解释为儿童更跟踪高层情绪与言语线索而非细粒度声学,这与儿童对监护人响应的主导作用一致。未胜出项必须保留,两组与智能体的局部趋同均无显著,原文略去 P2A 与 C2A 局部模式。可能原因包括智能体固定担任提问者,以及被试感知到非人类身份后缺少建立关系的动机。

换特征与换配对会改变结论吗?

论文没有做传统消融去掉某一模块,而是用特征类型与配对划分与时间尺度作为天然对照。换特征看,成人局部在振幅与基频与情绪与嵌入上一致显著。家庭局部则出现手工声学不显著而嵌入显著的分裂,说明结论依赖特征粒度。

换配对看,家庭全部人类对与儿童对监护人结果基本一致,说明儿童对监护人的响应主导了家庭信号。而把智能体纳入比较后显著消失,说明交互对象身份是边界条件。换时间窗看,局部强而全局弱,说明即时适应不等于累积收敛。

下表转向全局比较问题,后 5 轮差异是否小于前 5 轮,覆盖成人人与人与家庭人与人与儿童对智能体。指标方向仍是伽马为负支持趋同,公平条件是随机截距仍按会话与说话人对设置。

比较基频均值伽马振幅均值伽马振幅极差伽马Whisper 余弦伽马
成人 P2P-36.1776未报告显著未报告显著未报告显著
家庭 P2P14.5254 不显著未报告显著未报告显著未报告显著
家庭 C2A未报告显著0.01810.0566-0.0189

成人 P2P 仅在平均基频与语音嵌入上看到弱全局趋同,情绪嵌入反而出现远离。原文推测不同人对新奇体验反应分化,有人觉得亲切有人觉得尴尬,导致情绪轨迹发散。家庭 P2P 在所有检验特征上无显著全局趋同。

唯一的儿童对智能体全局信号是语义距离缩小而振幅扩大,回归还显示儿童振幅与优势度随进程上升。这与越来越自信果断一致,而智能体振幅稳定,因此振幅上看起来是远离,该解释为可能而待验证。

哪些限制决定了不能推广到开放对话?

首先是样本与功效,家庭仅 10 个会话,总时长不足 66 分钟,成人 30 个会话共三百余分钟。家庭全局零结果可能只是功效不足,不能当作无收敛的证明。其次是高度结构化范式,智能体始终担任提问者,人类轮流或商量后回答。

这种角色分工限制了向更自发多方聊天的推广,自发场景中打断与重叠与话题竞争会改变趋同动力。第三是预先接触混杂,成人数据收集前约 10 分钟的聚集与签署,以及家庭结伴前来都可能让基线已部分同步。

首末对比因此被压缩,未来需要到场后隔离一段时间再采集才能更干净地检验全局。第四是嵌入可解释性,基础模型向量混杂语义与韵律与音色与通道因素。设计意图不能把距离缩小直接读成某一属性的模仿,最后是资源缺项。证据未绑定可验证的代码与模型权重或数据链接,资源状态为无可用声明,因此不得声称已公开。

要复述与复现,应按什么顺序核对什么?

第一步重建对话轮,用人工说话人与时间戳把阵列录音按说话人切分。不活跃段填静音,智能体音频用系统缓存与时间戳对齐,每轮定义为 1 次智能体提示加随后全部人类回答。

核对成人中位每会话轮数与家庭轮数,以及平均轮时长是否吻合,这是后续配对的基础。第二步重跑特征,帧级振幅与基频按轮求统计量并丢弃非语音。情绪双模型平均得到唤醒度与效价与优势度并拼接倒数第二层,编码器时间平均时记录是否去静音。

第三步重跑统计,局部用同轮指示,全局用后 5 轮指示,随机截距按会话与说话人对设置。不归一化,按特征类别做 Bonferroni 校正,核对成人局部几乎全显著与家庭局部仅情绪与嵌入显著。

还要核对局部对智能体不显著,以及全局仅成人弱显著与儿童对智能体语义趋同伴随振幅远离是否重现。若任一步对不上,优先检查轮切分与随机效应设定,而不是调整特征阈值去凑显著。

何时值得借鉴,复现后还需补哪项验证?

当研究问题是多人加智能体的社会协调而非单轮识别准确率时,本文的双时间尺度加双交互对象框架值得借鉴。特别适合比较成人陌生群体与亲子群体对同一智能体角色的不同反应,保留高度结构化提问与多人同轮参照很关键。

当目标是让智能体更自然融入时,本文不支持直接加入趋同控制就能提升体验。因为与智能体的局部趋同本来就缺失,且既有文献提示趋同效果复杂并存在偏好差异。

复现后最需补的验证是分离预先接触的影响,例如到场后短暂隔离再采集。其次是扩大亲子样本以提升全局功效,再补上开放话题与智能体非提问角色的对照。最终判断应表述为报告显示局部人与人趋同强,与智能体趋同弱,全局趋同有限且队列依赖,机制解释为支持而非证明。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总