英文题目:Filled and silent pause production in remote, collocated and hybrid meetings

会议身份:conference:speechprosody:2026:conference-paper-id:baiat26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#会议转录 #统计分析 #韵律 #语音 #语音属性识别

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Ghazaleh Esfandiari Baiat:机构信息未能从会议 PDF 纯文本可靠映射
  • Ambika Kirkland:机构信息未能从会议 PDF 纯文本可靠映射
  • Jens Edlund:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究输入为三人协作生存排序会议语音,输出为填充停顿与无声停顿的频率与时长特征,难点在于分离会议媒介效应与说话人个体差异及任务内容差异。首先在设施内组织多组英语流利被试按随机顺序完成同地远程与混合共识会议并同步录音,输出多通道会议语音进入标注环节。接着用标注工具按轮次单元逐说话人标注轮次内可感知填充停顿与无声停顿,输出逐人停顿计数与时长进入统计环节。然后以每分钟说话时长归一化停顿率并做重复测量方差分析与事后校正检验,混合内再做远近被试对照。与仅描述现象的既有停顿研究不同,本文以被试内跨媒介比较与混合内远近对照直接检验沟通努力共享机制,具有揭示媒介负荷的实际意义。原文未提供可核对的关键定量结果。该结论适用边界受限于英语流利成人结构化共识任务与视频会议介导环境,尚未验证与主观努力感及轮次管理的因果链。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为什么要用停顿来谈会议的费力程度?

本文的输入是 3 人协作会议中的自然口语,目标是比较远程、共处与混合 3 种会议形式是否带来不同的交际努力。必须保留的关键信息是:研究对象是话轮内部的填充停顿和无声停顿,度量是按说话时间归一化的每分钟停顿率和平均时长,结论是率有差异而时长无差异。输出是 1 篇可复述方法的解读,而不是对远程办公好坏的价值判断。

自发口语很少能长时间完全流利,停顿、重复、自我修复都是常态。填充停顿是像 um、uh、er 这样发声的犹豫标记,无声停顿是可察觉但无声的间隙。白话说,前者是出声拖时间,后者是静默拖时间。原文回顾指出,它们常出现在需要更多规划的位置,例如句子或短语开头、出乎意料的内容之前、低频词之前,因此被视为语言产出努力的在线标志。同时,它们也会传递给听者:预告接下来可能有延迟,促使听者提高注意并预期复杂或意外内容。

认知负荷 × 会话流畅性: 认知负荷指说话人在组织内容、选词和监控话语时承担的心理规划压力;会话流畅性指对话不中断、轮替顺利推进的表面状态。认知负荷的分工是解释原因,会话流畅性的分工是描述结果。搭配理由是原文把停顿视为连接二者的可观测代理指标:负荷升高时更可能在成分起点、意外内容或低频词前出现停顿,从而打断流畅。组合意义在于不能直接测心智努力时,可以通过比较不同会议条件下停顿率的变化来推断哪种设置更费力,但这仍是间接推断,需要主观评价等证据补强。

对刚入门的研究生而言,关键学习依赖是区分生产视角与感知视角。生产视角问说话人为何停顿,感知视角问听者如何利用停顿。本文属于生产视角,只统计说话人产出了多少停顿,不检验听者是否听得更懂或评价更高。另一层依赖是区分相关与因果:停顿与认知负荷在既往研究中相关,但本文没有直接测量大脑负荷,只是用停顿率的变化来支持会议设置影响心智需求的解释。这种解释需要谨慎,作者也在讨论中保留了轮替线索降级等替代机制。

相关路线如何看待技术中介下的对话困难?

同输入的路线比较面对面与视频中介互动,发现技术中介会带来延迟或降质音频、注视与手势可见性受限、交际空间分配不均等问题。这些问题与本文输入相同,都是多人协作对话,但目标不同:早期工作更关注轮替成功率、重叠与间隙,而本文把焦点收窄到说话人话轮内的两类停顿。同目标的路线用停顿研究自发 speech 中的认知负荷,例如在成分起点和高惊奇度位置停顿更多,本文把这一逻辑搬到会议形式比较上。

同监督与同运行阶段的对照是:本文采用人工标注而非自动检测,运行阶段是完整的面对面协商过程,而非朗读或单人叙述。这意味着结果更贴近真实协作,但代价是样本小、标注成本高,且无法像大规模语料那样检验细粒度句法位置效应。

轮替管理 × 副语言线索: 轮替管理指参与者判断谁在何时说话、如何交接话轮的协调工作;副语言线索指注视、姿态、手势、语音延迟与音质等帮助判断交接时机的信息。副语言线索的分工是提供依据,轮替管理的分工是做出行动。搭配理由是远程与混合会议会降级或不对称地提供这些线索,例如只能看到部分身体、存在网络延迟,导致判断更难。组合意义是解释为何远程会议无声停顿更多:说话人可能用更频繁的内部停顿来试探和便利潜在的轮替交换,而混合会议中至少部分人能互相看到全身,情况有所不同。

需要避免的误解是把类别差异当成同条件胜负。例如,不能因为远程会议停顿多就断言远程会议理解更差,本文没有测量理解分数或任务成绩。相关工作还指出,听者会依据不流利程度评价说话人的能力与自信,但本文不做这类感知实验。因此,本文在相关版图中的位置是:用生产端停顿率为技术中介会议的困难提供一个可量化的代理指标,为后续结合轮间间隙、重叠与主观努力评价的研究铺路。

要回答的具体问题是什么?

本文要回答的是:在任务、人员和流程尽量可比的前提下,远程、共处与混合 3 种会议形式是否改变说话人填充停顿与无声停顿的产生频率和持续时间。具体可拆为 3 个可检验问题。第一,会议类型对两类停顿的每分钟发生率是否有主效应。第二,会议类型是否影响两类停顿的平均时长。第三,在混合会议内部,身处同一房间的共处参与者与单独在隔离间的远程参与者是否存在差异。

教学例子:假设同一组 3 人先围桌讨论,再各自进小隔间连线讨论,比较的是同一个人不同设置下的停顿习惯,而不是不同人之间的口头禅差异。这就是重复测量设计的直觉。例子仅用于说明设计逻辑,不代表本文的数值。

问题的边界也很明确。不包含轮间停顿、发音生理性停顿和无话轮的停顿,不比较不同生存任务本身的难度效应,不检验性别或年龄效应。作者把推断限定为会议形式是否让沟通更费力,而把费力是否导致任务变差留给未来工作。

方法全景:从一次样本走完输入到输出

沿一个样本走完全程有助于建立全局观。假设某位参与者在某次混合会议中持有话轮说了总计 5 分钟,标注员在其话轮单元内找到 28 个填充停顿和 50 个无声停顿。那么他在这次会议中的填充停顿率是 28 除以 5 等于 5.6 次每分钟,无声停顿率是 10 次每分钟,同时记录每个停顿的时长以计算平均时长。对同组另外 2 人同样计算,再对 30 名参与者在 3 种会议中的值做重复测量方差分析,检验会议类型的主效应,显著时再做 Holm-Bonferroni 校正的事后两两比较。混合会议内部再用独立样本 t 检验比较远程 1 人与共处 2 人的率与时长。

每分钟停顿率 × 平均停顿时长: 每分钟停顿率指某说话人在某次会议中产生的停顿数除以其总说话时间,分工是度量困难发生的频繁程度;平均停顿时长指该类停顿持续时间的均值,分工是度量每次困难拖延的严重程度。搭配理由是只看其一会混淆两种不同的费力模式:频繁但短暂与稀少但漫长。组合意义是本研究同时检验二者,发现会议形式只影响率而不影响平均时长,说明变化在于更常需要停下来,而不是每次停得更长,这对理解努力的性质很关键。

全景中的 4 个组件依次是:被试与分组、录制设置与会议结构、2 级标注、统计检验。被试与分组保证可比性,录制设置制造 3 种会议条件,标注把声音变成可计数的停顿事件,统计把计数变成关于会议效应的判断。下一步各节将分别展开每个组件的具体动作和原文给出的安排理由。

被试与录制设置如何制造三种可比的会议?

参与者共 30 人,其中男性 17 人、女性 13 人,年龄在 23 至 48 岁之间,通过 Accindi 平台招募,要求能流利使用英语且无听力问题,以 3 人一组参加会议,并获得报酬。这个招募动作的目的是保证基本语言能力,避免听力障碍混淆停顿解释。

填充停顿 × 无声停顿: 填充停顿指说话人发出的 uh、um、er 这类有声犹豫标记,分工是占据话轮、向听者预告延迟并争取规划时间;无声停顿指话轮内可察觉的静默间隙,分工是切分话语、等待规划完成或试探轮替机会。二者搭配的理由是它们都出现在说话人话轮内部的规划困难点,可以互补地指示认知负荷:前者是主动维持话语流的策略,后者是暂停产出的表现。组合意义在于同时统计率与时长,才能区分是更频繁地遇到困难还是每次困难拖得更久,本研究正是用这一组合来检验会议形式是否增加努力。

录制都在瑞典皇家理工学院设施内完成。共处会议在语音音乐听觉系的研讨室进行,3 人围桌讨论,桌中央放置 Meeting Owl Pro 一体设备连接主控电脑,同时用独立 Zoom 录音设备采集每人音频。远程会议中 3 人分处不同隔间,通过 Zoom 视频会议连接,统一为全屏模式并在画廊视图中隐藏自视画面,由 Zoom 和个人录音设备同时录制。混合会议使用两个地点:2 名共处者在研讨室通过 Zoom 与身处单独隔间的远程者连接。统一视频设置和固定地点的用意是减少设备差异,让会议形式成为主要变化来源。

需要指出的缺项是原文未报告网络延迟、音频码率或耳机型号等细节,因此不能精确复现声学通道质量,只能复现地点与软件连接方式的大结构。

标注如何把声音变成可计数的停顿事件?

标注使用 ELAN 7.0,分 2 级进行。第一级是手动切分话轮单元,概念借自对话行为标注的 ISO 标准,指单个说话人担任说话角色时产生的一段语音,以该说话人自身的非活动间隔为界,在每个说话人独立层上标注。第二级是在每个说话人层上标注停顿,包括填充停顿与无声停顿。本文考虑的停顿始终是说话人在其话轮单元内部产生的,发音性停顿、无话轮停顿和轮间停顿不纳入。所有可检测、可感知的停顿都被标注,不设时长阈值。

话轮单元 × 话轮内停顿: 话轮单元指单个说话人 1 次担任说话角色时产生的连续语音段,以该说话人自身的静默间隔为界;话轮内停顿指只标注在该单元内部的填充与无声停顿。话轮单元的分工是确定归属和计时分母,话轮内停顿的分工是确定分子。搭配理由是只有把停顿限定在自己持有话轮的时间内,才能用每分钟说话时间的停顿数来比较不同会议,而不受他人说话时长干扰。组合意义是排除发音间隙、换轮间隙与轮间停顿后,剩余的停顿更可能反映说话人自身的规划与维持话语的努力。

这个安排的理由在原文中有明确交代:限定在话轮内是为了让停顿更可能反映说话人自身的规划努力,而不是换轮等待;不设时长阈值是为了避免人为截断短停顿,保证率的计算完整。代价是短的、可感知边界模糊的静默也可能被计入,增加了标注员判断变异。原文引用了详细的标注方案版本说明,但本次证据未给出一致性系数,因此复现时应预留双人独立标注与一致性检验环节,不能默认 1 次标注即稳定。

本研究有训练阶段吗?真实计算过程是什么?

本研究没有训练任何神经网络模型,也没有冻结或更新参数、反向传播或优化器步骤。如果把训练一词理解为机器学习中的参数学习,那么答案是无训练阶段,不能把无训练等同于确定性求解,统计检验结果仍受抽样变异影响。

真实计算过程是语料构造加统计推断。构造部分包括招募分组、随机化会议顺序、执行 3 阶段生存排序任务、录制与 2 级标注。推理部分是描述统计加推断统计:先按说话人、按会议计算每分钟停顿率和平均时长,再用重复测量单因素方差分析检验会议类型主效应,显著时用 Holm-Bonferroni 校正做事后比较,混合会议内部用独立样本 t 检验比较远程与共处参与者。调用的工具是 ELAN 标注环境和常规方差分析流程,不涉及既有语音模型的推理或检索增强。未报告的缺项包括具体统计软件版本、球形假设检验与校正细节、效应量数值,这些在复现时需要自行记录并报告。

实验条件:任务、顺序与公平比较如何保证?

语料称为 MEET 语料,共 10 个录制会话、总计 30 次会议。每个会话包含连续的 3 次会议,分别为共处、远程与混合,出现顺序随机。3 人一组的任务是不同的生存排序任务并在会中达成小组共识,使用的 3 个任务是 NASA 登月生存、沙漠生存和露营生存。在每个任务中呈现生存场景,要求对给定物品按生存重要性排序。每次会议不论形式都有 3 个阶段:会前个人独立排序,会中讨论并达成共识,会后再次给个人时间修改初始排序。

公平条件的关键是同一组人在同一会话内经历 3 种形式,且任务类型轮换、顺序随机,从而减少组间个体差异和顺序效应的混淆。指标方向是:停顿率越高表示更频繁地需要停顿,解释为更费力;平均时长越长表示每次停顿拖延更久。但原文最终显示只有率变化而时长不变,因此不能把时长方向直接用于支持结论。

资源状态方面,本次收到的证据中没有完成 HTTPS 状态验证的可用资源声明,不得声称代码、模型或数据已公开。复现者应按论文引用的 MEET 语料描述去查找原始出处,并做好本次未能确认可达的准备。硬件预算方面,原文只说明了 Meeting Owl Pro、Zoom 录音设备与个人录音器的配置,未给出费用或工时,复现时需自行估算标注人力成本。

主结果:哪种会议让说话人停顿更频繁?

在解读具体数字前,需要确认比较问题与公平条件。问题是会议类型是否改变话轮内停顿的频繁程度,公平条件是同一批说话人在 3 种形式下完成类似协作任务,指标是按个人说话时间归一化的每分钟停顿数,方向是数值越大表示越频繁。统计上先用重复测量方差分析检验主效应,再用校正后的事后检验定位差异来源。

对方差分析主效应的报告是会议类型对填充停顿率和无声停顿率均有显著影响,而对平均时长无显著影响。事后检验进一步显示,填充停顿在远程和混合会议中均显著高于共处会议,远程与混合之间无显著差异;无声停顿仅在远程与共处之间差异显著。混合会议内部远程 1 人与共处 2 人之间在率与时长上均无显著差异。

下图展示了 3 种会议下两类停顿平均每分钟发生率的变化模式,误差线为均值的标准误,左为填充停顿,右为无声停顿。阅读时应先看纵轴量级不同,再看横轴三点的相对高低,而不是把左右两图的高低直接比较。

看图路径: 1. 先看左右两面板的纵轴与横轴:纵轴都是每分钟停顿数,横轴都是 remote、hybrid、collocated 三种会议类型;2. 比较左图填充停顿三点的高度落差,确认共处点明显低于远程与混合点;3. 比较右图无声停顿三点的高度落差,确认只有远程点明显抬高,混合与共处点接近;4. 查看每个圆点上下的误差线长度,理解均值标准误所表示的被试间变异范围

原论文 Figure 1:Mean rates (per minute) of filled (a) and silent pauses (b) across meeting types.

论文图 1。原论文 Figure 1:“Mean rates (per minute) of filled (a) and silent pauses (b) across meeting types. Error bars show the standard error of the mean.”。

从像素可见,左图填充停顿从远程到混合再到共处逐步下降,共处点明显最低,远程点最高;右图无声停顿也是远程点最高,但混合点与共处点差距很小,几乎持平。误差线在远程条件下略长,提示个体差异稍大,但三点之间的排序在两图中一致指向非共处设置更高。结合正文数字,这种模式支持远程与混合设置增加沟通努力的解释,且混合会议的影响波及在场共处的 2 人,而不仅是远程 1 人。

以下第一张表整理填充停顿率的主效应与事后比较的关键数字,表中条件、指标与单位均按原文表述保留,数值精度不做四舍五入。

条件指标远程会议混合会议共处会议
3 种会议比较填充停顿率6.39 pauses per minute5.59 pauses per minute4.33 pauses per minute
3 种会议比较方差分析主效应F(2,58) = 9.30, p < 0.001F(2,58) = 9.30, p < 0.001F(2,58) = 9.30, p < 0.001

表后解释需要同时看到收益与代价。主要收益是证据明确:填充停顿在两种非完全共处设置中都更高,幅度上远程比共处每分钟多约 2 次,混合比共处多约 1.3 次,支持混合与远程都更费力的判断。具体代价是远程与混合之间无显著差异,因此不能声称远程一定比混合更费力;此外这是组平均趋势,不等于每位说话人在每次会议中都呈现相同排序,未胜出的比较正是远程对混合的填充停顿差异。

反证与边界:时长为何不变,混合内部为何无差异?

除核心的率差异外,本文提供了两类重要的阴性结果,它们起到类似消融的反证作用。第一类是时长维度:无论填充还是无声停顿,平均时长都不随会议类型显著变化。第二类是混合会议内部比较:远程参与者与共处参与者在率与时长上均无显著差异。这两类结果限定了主结论的适用条件。

提出比较问题:是否每次困难都拖得更久,以及混合会议的困难是否只落在远程 1 人身上。公平条件与主结果相同,指标方向是时长越长表示单次拖延越重,t 值与 p 值用于判断内部差异。原文报告在这两个问题上均为不显著,说明费力的表现形式是更常停而不是停更久,且混合会议的负担是共享的。

以下第二张表整理无声停顿率、时长主效应与混合内部分组比较的数字,同样保留原文单位与精度,不自行换算。

条件指标远程会议共处会议或检验值混合内部分组比较
远程对共处无声停顿率11.24 pauses per minute9.55 pauses per minute混合内部无显著率差异
3 种会议比较平均时长主效应F(2,56) = 1.26, p = 0.29F(2,56) = 1.09, p = 0.34时长均无显著主效应
混合内部t 检验率与时长t(28) = 0.85, p = 0.40t(28) = -1.22, p = 0.23t(28) = 1.27, p = 0.22

表后解释应点出未胜出项与未评测边界。未胜出项包括混合与共处之间的无声停顿差异、远程与混合之间的填充停顿差异,以及所有时长比较,它们都不支持会议形式改变单次停顿时长的说法。未评测边界是轮间间隙与重叠、重复与自我修复、主观努力评分,这些在讨论中被列为未来工作,不能用现有两类停顿的率差异来代替。另一个限制是 Zoom 延迟混淆了跨说话人间隙的直接比较,因此作者有意只分析话轮内停顿,这一取舍保证了内部效度,但也窄化了对轮替管理的直接测量。

哪些推断是报告,哪些只是可能?

用词需要分层。报告层面的是:填充停顿率在远程和混合中高于共处,无声停顿率在远程中高于共处,平均时长无会议效应,混合内部远程与共处无差异。这些有方差分析与 t 检验数值支持。支持层面的是:非共处设置让沟通更费力的解释,与既往关于停顿指示认知负荷的研究一致,且混合会议中 2 名共处者也需整合远程者、受延迟影响,因而被波及。可能或待验证层面的是:无声停顿增多是因为轮替线索降级导致说话人用停顿便利轮替交换,以及技术延迟具体影响了哪位参与者,这些在本文没有直接测量注视、延迟或轮替成功率。

缺失证据不是技术错误,但必须明确。例如,未测量误判率、任务成绩、延迟毫秒数与标注一致性,未报告效应量与统计功效,就不能承诺这些量得到改善或差异有多大实际意义。总体趋势不等于每组每步都成立,10 个会话、30 人的样本决定了推广到其他语言、任务与网络条件时需要重新验证。训练资源、推理开销与输出帧率等概念不适用于本研究,不应强行讨论。

复现先做什么:可核对的步骤清单

复现的第一步是重建被试与任务条件。招募 30 名能流利使用英语、无听力问题的成年人,组成 10 组 3 人小组,每组依次完成 3 次会议,形式为共处、远程、混合且顺序随机,每次使用不同的生存排序任务并保留会前个人排序、会中协商共识、会后个人修改 3 个阶段。记录每位说话人在每次会议中的总说话时长,作为率的分母。

第二步是重建录制设置。共处用研讨室围桌加中央全向设备加每人独立录音,远程用单独隔间加统一 Zoom 全屏隐藏自视设置,混合用研讨室 2 人加隔间 1 人通过 Zoom 连接。保留设备型号与软件设置记录,若网络延迟无法控制,至少记录是否出现可感知的卡顿。

第三步是重建标注。安装 ELAN 7.0,先在每人独立层上按 ISO 对话行为思路切分话轮单元,再在单元内标注所有可检测、可感知的填充与无声停顿,排除发音间隙与轮间停顿,不设时长阈值。建议双人独立标注一部分数据并报告一致性,以弥补原文未报告该数值的缺项。第四步是重建统计:按人按会议计算两类停顿的每分钟率与平均时长,用重复测量方差分析检验会议主效应,显著时做 Holm-Bonferroni 事后比较,对混合内部做独立样本 t 检验。核对自由度变化:率分析为 F(2,58),时长分析为 F(2,56),后者自由度减少提示可能有缺失数据,复现时应如实报告剔除原因。

何时值得尝试这种停顿分析,还需补哪项验证?

当研究问题是技术中介是否让协作对话更费力,且已有可比的面对面基线时,本文的话轮内停顿率分析值得尝试。它成本低于生理测量,贴近真实任务,且区分了频率与时长两种费力模式。适用条件是:有清晰的话轮切分、能获得每人说话时长、有人工核对的停顿标注。若只能拿到自动语音识别的时间戳而无人工核验,则不宜直接套用本文阈值无关的标注口径。

还需补的验证至少有三项。一是结合轮间间隙与重叠的测量,但需要解决 Zoom 延迟不一致带来的对齐难题,否则跨条件比较会被延迟混淆。二是补充主观努力评价,让参与者或外部观察者评分,再检验停顿率与主观评分的相关,以加强负荷解释。三是扩展不流利类型,纳入重复、自我修复与延长,检验会议效应是否只体现在停顿还是更广泛的不流利谱系上。

对初学者的特有误解需要澄清。停顿多不等于表现差,本文未检验任务成绩;混合会议中在场者停顿也多,不代表他们设备有问题,而是协作本身需要整合远程者;平均时长不变不代表没有困难,而是困难以更频繁而非更持久的方式出现。记住这些边界,才能把停顿这个简单计数用在正确的问题上。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

另有 7 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总