英文题目:Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings
会议身份:
conference:interspeech:2026:conference-paper-id:fukuda26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#会议转录 #人类参与评测 #大语言模型 #多模态模型 #轮次切换
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Ryo Fukuda:机构信息未能从会议 PDF 纯文本可靠映射
- Takatomo Kano:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Atsunori Ogawa:机构信息未能从会议 PDF 纯文本可靠映射
- Yuya Chiba:机构信息未能从会议 PDF 纯文本可靠映射
- Atsushi Ando:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理四人英语会议中的在线轮次切换(turn-taking)预测,输入为当前说话人标识与转录文本及可选音视频片段和历史上下文,输出为被称呼者(addressee)标签与下一说话人候选集合,并由后者派生是否换轮,难点在于多人指代模糊、重叠语音与频繁换轮带来的不确定性。评测链条先从AMI语料筛选11个会话并重构话语级标签,其中IS1000a仅用于调试、其余10个会话共4051条话语用于评测,再以统一在线约束并行运行监督模型、文本LLM与多模态LLM,最后用同任务人机对照与消融分离上下文、思考模式与注视线索的贡献。相比仅用前一句话特征的传统分类器,LLM凭借数十轮对话历史与逐步推理建模话题走向与角色习惯,因而在下一说话人预测上占优。与已有单任务文本评测不同,该工作把三类任务、三种建模范式与人类表现纳入同一协议,并显式检验原始音视频是否带来增益。在包含347条话语的人评子集评测设置下,Gemini 2.5 Pro完整上下文条件的下一说话人预测F1指标为57.7,高于去除上下文条件的下一说话人预测F1指标25.7。结论仅适用于AMI式角色化四人会议与提供理想说话人与转录的设定,跨语言、三人对话与真实说话人日志场景尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
多方会议的接话难题是什么?
刚进入语音与对话领域的研究生首先要分清双人与多方会话的区别。双人对话里话轮问题很单纯,当前说话人停下后,下一个开口的人只能是对方,听者是谁也不用猜。多方会议则同时存在 3 个不确定点,当前这句话是说给某一个人、几个人还是全体,当前说话人说完后是自己继续还是换人接,如果换人又是 4 个人中的哪 1 位。论文把这 3 个不确定点固定为 3 个可评测任务。第一个是受话人检测,判断当前话语的指向对象。
第二个是话轮转换预测,判断下一句是否换人。第 3 个是下位发言人预测,判断下一句具体由谁说。3 个任务都要求只用过去和当前的信息做在线判断,不能偷看未来,这对应会议助手实时参与的约束。
论文的起点是多模态大模型已经能同时接受文本、音频和视频,但它是否真的会用原始音视频中的眼神、韵律和姿态来做接话判断,还没有在统一协议下被系统检验。已有的多方会话研究往往 1 次只做 1 个任务,或者只给文本,或者离线看完全文再判断受话人,这与在线参与的要求不同。更关键的是,人在同样多模态在线条件下的表现没有被量化。如果不知道人本身在这类任务上有多大分歧,就无法判断模型超过人或低于人意味着什么。
因此论文的目标不是提出新模型,而是搭建一个可核对的比较框架,把受监督模型、文本大模型、多模态大模型和人都放在同一组话语、同一在线约束下比较。
此前研究在任务、模态和比较上缺了哪一块?
双人话轮研究积累较多,近年也出现了用大模型和音频基础模型预测停顿与抢话的工作。多方会话的关注较晚,研究路线分成受话人检测、话轮转换预测、下位发言人预测 3 个分支。早期多用条件随机场、支持向量机和深度神经网络,把文本特征与音视频信号拼接起来。已有证据显示视觉线索如注视有助于受话人与下位发言人判断,韵律特征有助于话轮转换判断。
大模型进入后出现了几条可对照的路线。有人在 3 人日语自由讨论数据上同时测受话人与下位发言人,发现大模型接近随机且加入注视信息改善有限。有人在多个多方数据集上测文本大模型的下位发言人预测,发现部分模型超过人类被试并强调上下文的重要性。有人给多模态大模型同时输入文本与图像测下位发言人,没有看到视觉带来的明确增益。还有人用电视对话数据离线判断受话人等话语结构属性,但离线能看到全文,与在线参与不同。
论文把这些工作整理成一张对照表,维度包括数据、人数、任务、输入模态和比较对象,目的是说明三点缺失。第一,多模态大模型直接吃原始音视频时到底能用多少信号,缺少系统检验。第二,受监督模型、文本大模型、多模态大模型在统一协议下的全面比较有限。第三,可比多模态条件下的人类表现缺少量化。本文的增量正在于补上统一在线框架与人机对照。
三个任务的输入输出如何定义?
论文把 1 次会议表示为长度为 N 的话语序列,每句话带有说话人编号、人工转写、与该句对齐的音频片段和视频片段。在 4 人 AMI 会议里参与者集合大小为四。受话人检测在第 i 步预测当前话语的受话人标签,取值为 4 个参与者之一,或全体,或无明确对象。全体对应一句话内出现多个不同的词级受话人标注,无明确对象对应完全没有标注。评价用准确率和宏平均 F1,以应对类别不均衡。
话轮转换与下位发言人共享同一个底层预测,即预测下一句的一个或多个候选说话人集合。允许输出多个候选是来自预实验的考虑,被试很难每次只押一个人,因此人与模型都被允许输出多个候选。话轮转换标签由该集合推导得到,只有当预测集合恰好等于当前说话人单例时判为保持,否则判为转换。真实标签则直接比较下一句说话人是否等于当前说话人。
下位发言人只在真实发生转换的话轮上评价,严格准确率要求预测集合恰为真实下位者单例,同时报告以是否包含真实下位者计算的精确率、召回率与 F1,以容纳多候选的模糊情形。会话末尾没有下一句话语的样本不参与后 2 个任务的评价。
统一比较框架把哪些系统放在同一条起跑线上?
论文的方法不是训练新网络,而是构造可复述的评测流水线。同一条话语依次经过 3 类系统。第一类是传统受监督模型,包括朴素贝叶斯、随机森林、多层感知机和支持向量机,输入是当前说话人、从转写派生的文本特征向量和上一句说话人。第二类是现成的文本大模型,选用 Qwen3 的 8B、14B 和 32B,默认开启思考模式,用贪心解码,输入是任务指令、当前说话人、当前转写和之前多轮的说话人与转写序列。
第 3 类是多模态大模型,包括 Qwen2.5-Omni-7B、Qwen3-Omni-30B 的思考版本和闭源的 Gemini 2.5 Pro,输入在文本大模型基础上再加上与当前话语对齐的原始音频与视频。视频上叠加了参与者标签以便把画面与编号对应起来,提示词中还说明了座位与可用线索。
人类评测走同样的在线流程。被试从头播放音视频,到每句话边界自动暂停,此时给出当前说话人与转写以及对应的音视频片段,然后同时回答谁被点名和谁可能接着说,回答后继续播放下一句。这种设计让模型与人都不看未来。朴素基线也被固定下来,受话人恒猜全体,话轮转换恒猜转换,下位发言人随机四选一的期望准确率为 1/4。所有比较都围绕输入是否一致、上下文长度是否一致、指标方向是否一致展开,避免把离线看全文的结果与在线结果混为一谈。
输入、表示与组件各自负责什么?
沿着一句话走完全程有助于复述方法。假设当前是说话人 A 的一句话,转写已经给出,音频是 A 的头戴麦克片段,视频是叠加了标签的会议室画面。对文本大模型而言,表示是离散符号序列,组件是解码器大模型加思考过程,目标是输出受话人标签或下位候选集合。对多模态大模型而言,表示多了连续的声学与视觉流,Qwen-Omni 类模型用思考者模块负责文本生成与推理,实验只用该模块。对人而言,表示是连续观看听到的会议过程加屏幕上的转写,组件是凭直觉作答,实验前有练习与示例以统一标注尺度。
受话人检测 × 下位发言人预测: 受话人检测负责判断当前话语是说给谁听的,输入是当前说话人、文本、音视频与上文,输出是单个参与者、全体或无明确对象;下位发言人预测负责判断当前话语之后谁会开口,输出是一个或多个候选说话人集合。两者搭配的理由是多方会议同时存在谁被点名和谁实际接话的不一致,组合起来才能把话轮保持与转换标签从候选集合中推导出来,新增作用是把在线参与所需的理解与行动统一到同一组输入约束下。
会话上下文 × 思考模式: 会话上下文指当前话语之前保留的说话人与转写序列,分工是提供话题走向、角色分工和发言习惯等长程线索;思考模式指 Qwen3 类模型在输出答案前展开的分步推理过程,分工是把上下文线索显式组织成候选排除过程。两者搭配的理由是下位发言人预测高度依赖多轮历史而非单句字面,组合意义在于让模型先回顾讨论流再结合视觉注意等线索做判断,关闭思考模式后性能下降支持了这种分工。
注视目标 × 原始音视频: 注视目标是人工标注的当前说话人视觉注意对象,分工是以离散符号直接给出谁在看谁、是否看白板桌面的信息;原始音视频是与话语对齐的麦克风片段与视频片段,分工是保留韵律、停顿、头部朝向和手势等连续信号。搭配理由是模型目前从原始视频中抽取注视方向的能力有限,显式注视标注可以补上缺失的一环,组合意义在于检验模块化视觉线索与端到端多模态输入各自的贡献。
文本派生特征与原始信号的区别需要讲清。受监督模型不直接读句子,而是读代词使用、连词存在与句长等特征,这是一种高度压缩的表示。多模态大模型直接读原始音视频,理论上保留了更多信息,但能否把注视方向与语调结尾等线索抽出来并与文本对应起来,是实验要检验的未知点。附加的注视目标标签则是模块化思路的代表,它把视觉抽取提前做完,以符号形式交给模型,论文用它来判断端到端多模态是否真的缺了注视信息。
本研究训练了什么、冻结了什么?
本研究没有训练大模型,这是复现时最容易误解的一点。Qwen3、Qwen-Omni 与 Gemini 都是现成调用,论文未报告对它们做领域微调,也未报告梯度路径、参数冻结比例或优化器设置,因此不能从模型名称推定它们在会议数据上的适配程度。唯一的训练发生在传统受监督模型一侧。4 个模型用 scikit-learn 实现,超参数沿用先前受话人检测工作,在 10 个会话上做五折交叉验证,分折时按会话分组,确保同一会话的话语不会同时出现在训练与测试中,各折测试预测汇总后再算指标。
大模型一侧的真实计算过程是推理而非训练。文本模型以半精度运行并用贪心解码,多模态本地模型同样以半精度贪心解码,Gemini 通过官方接口调用并把温度设为 1.0。思考模式的开关在消融中被显式检验,Qwen3-Omni 则经过预实验比较,排除了指令调优版本而保留思考版本。自动语音识别对照用 Whisper large-v3 转写每个人的头戴麦克,以模拟每人有独立麦克风的会议条件。需要补的缺项是论文未给出大模型的采样重复性细节与接口版本锁定方式,复现时应记录模型快照、温度与解码设置,否则闭源模型的数值难以逐字重放。
数据、划分、指标与人类实验如何保证可比?
数据来自 AMI 会议语料,特点是 4 人角色扮演的设计团队会议,提供同步音频、视频、人工转写以及受话人与注视目标等标注。论文按 3 个条件人工筛选会话,要求有受话人与注视标注、相机视角能清楚拍到 4 人面部、4 人都有头戴麦克。最终除去用于调试的一个会话,剩下 10 个会话用于模型评测。人类评测因时间与资源限制只用其中两个首阶段会话,涉及不同参会组,话轮转换比例与全集接近,但单独点名比例更高。短的完全重叠填充词被排除,头戴麦克串音导致下位者部分可闻的样本被保留,论文明确这是为了保持真实多方交互的连续性。
以下导读帮助理解人类实验的界面约束,重点是被试在每一暂停点能看到什么、能选什么。
看图路径: 1. 先看左侧视频区叠加的 A 至 D 标签与下方当前说话人与转写条;2. 再看右侧 Q1 受话人与 Q2 下位发言人的选项形态差异;3. 最后看底部开始与重复按钮确认逐话语暂停作答的在线流程
论文图 1。原论文 Figure 1:“Screenshot of the experiment tool.”。
该界面左侧播放叠加了人物标签的会议视频,下方显示当前说话人与转写,右侧同时给出受话人单选与下位发言人多选,底部按钮控制继续与重播。被试按约 5 分钟切分会话作答,因此可用上文至多对应约 5 分钟视频,模型在人类子集上评测时也被限制为同样的切分块,而不是全会话历史,这是保证公平的关键。12 名在职业环境中常用英语的非母语者参加,每句话有三份独立标注。
评价指标方向都是越高越好,受话人与话轮转换看准确率与宏平均 F1,下位发言人同时看严格准确率与包含式精确率、召回率、F1。资源状态方面,本次收到的证据未绑定完成验证的代码、模型或数据下载链接,因此不能写这些资源已公开,只能按论文文字复述语料来源与模型名称。
谁在哪个任务上占优,代价是什么?
全集上的模型比较显示出任务分化。受监督模型中的支持向量机在受话人检测上取得最高准确率,在话轮转换上也只低于 Gemini 2.5 Pro,这说明针对任务训练的简单模型在不使用多模态信息时仍能超过通用大模型。转折出现在下位发言人预测上,所有文本大模型与 Gemini 都超过受监督模型。论文的解释是该任务依赖长上下文,受监督模型只用上一句说话人作上下文,而大模型能利用更长的说话人与转写历史。
模型规模没有单调增益,14B 超过 8B 与 32B,32B 更倾向于在应判全体时猜具体个人,这种细节偏好反而拉低了准确率。与先前在 3 人日语数据上接近随机的报告不同,本文的文本大模型超过朴素基线,论文把差异归因于模型、语言、领域与上下文长度的不同,这属于有限解释而非因果证明。
人类子集上的对照进一步分化。人在受话人与话轮转换上显著高于文本与多模态大模型,论文认为人与注视方向、韵律等线索的利用有关。在下位发言人上文本大模型反超人,多模态模型与人相当,这与先前文本条件下的报告一致,说明即使给人补上多模态信息,文本大模型对长上下文的建模优势仍然存在。但人的下位发言人 F1 约 60%,表明任务本身对人也很难。
以下导读对应两个会话随时间展开的人机曲线,重点是难度波动而非单点均值。
看图路径: 1. 先对照上下两行 IS1001a 与 IS1008a、左右两列受话人与下位发言人四个面板;2. 再比较蓝色人均线与橙色 Gemini 虚线随时间同升同降的位置;3. 最后观察蓝色阴影的人际最小最大带在下位发言人列明显变宽
论文图 3。原论文 Figure 3:“3”。
图中 4 个面板显示人和 Gemini 的准确率都随时间起伏,存在双方都高的容易区间和双方都低的困难区间,说明难度是会话内生的。下位发言人列的人际带更宽,1 分钟窗口内的频繁换人与均衡参与与困难有关。表格把人际一致性的直接报告放在一起,便于判断分歧基线。
比较的问题是人的判断本身是否稳定,公平条件是同一在线多模态流程,指标方向是系数越高一致性越高。
| 评估对象 | 指标名 | 本研究取值 | 先前报告取值 | 一致性含义 |
|---|---|---|---|---|
| 受话人 | Krippendorff 一致性 | 0.67 | 0.45–0.56 | 本研究话语级略高于词级标注 |
| 下位发言人 | Krippendorff 一致性 | 0.48 | 0.17 | 本研究高于纯文本先前研究 |
| 下位发言人 | Fleiss 一致性 | 0.48 | 0.17 | 多模态条件可能缩小分歧 |
表后需要同时看到收益与代价。本研究话语级受话人一致性高于词级历史标注,支持粗粒度判断更稳定的解释,但不能直接证明标注质量更高,因为粒度和指南不同。下位发言人一致性高于先前纯文本研究,支持多模态线索有助于对齐的解释,但被试语言背景与数据不同仍是混杂因素。未胜出的一项是话轮转换没有在窗口特征上显示出有意义的相关,说明结构特征不足以解释其难度,这为后文的消融留下开口。
上下文、转写质量与注视标注各自改变了什么?
消融按去掉什么、保留什么来组织。先看上下文。对 Qwen3-14B 与 Gemini 而言,去掉会话上下文后受话人与下位发言人大幅下降,话轮转换下降相对较小。上下文长度从零逐步加大时,即使只给一两句也有大幅增益,受话人与下位发言人到约 40 句继续上升,话轮转换在约 5 句达到峰值后不再受益于更长历史。这支持长上下文对下位发言人特别关键的判断,也说明话轮转换更依赖局部线索。思考模式关闭后性能显著下降,支持分步推理在利用长上下文中的作用。
再看转写质量。把人工转写换成 Whisper 转写后,词错误率并不低,但受话人与话轮转换只是小幅下降,下位发言人基本不变,Gemini 的话轮转换与下位发言人甚至有所上升。论文指出许多错误是填充词与不流畅的省略,不改变句义,因此影响有限。这属于实际可运行条件的检验,但仅限于每人有独立麦克风的情形,没有头戴麦克风、需要说话人日志与多人语音识别的更一般场景仍未评测。
最后看注视标注。给文本模型或多模态模型显式加入注视目标后,受话人与下位发言人一致提升,话轮转换则一升一降。论文的解释是话轮转换更依赖注视转移模式而非当前注视点,而标注只给当前目标。Gemini 已读原始音视频仍能从显式注视中获益,说明它没有从原始视频中充分抽出注视线索。去掉音频、去掉视频或去掉文本的对照显示,下位发言人甚至在去掉音视频后更高,支持当前多模态融合尚未稳定提供互补信息的判断。 以下导读对应上下文长度曲线,重点是 3 条曲线的爬升形态差异。
看图路径: 1. 先确认横轴上下文句数与左右纵轴准确率和 F1 的对应关系;2. 再比较红色话轮转换早早爬升与蓝色受话人缓慢爬升的斜率差异;3. 最后观察橙色下位发言人到 40 句附近达峰后不再随上下文单调上升
论文图 2。原论文 Figure 2:“Effect of context size on Qwen3-14B performance.”。
该图显示话轮转换曲线最早陡峭爬升,受话人与下位发言人爬升更慢但持续更久,下位发言人对上下文的依赖最陡。超过数十句后曲线持平或略降,说明一味加长历史并不能单调改善,复现时应把上下文窗口当作超参数单独搜索,而不是默认越长越好。
哪些边界会让结论不再成立?
论文用一节明确列出与自然参与的差距。第一,人与模型看的是固定机位录像,而非参会者的第一人称视角。第二,实验给了文本转写与当前说话人编号,自然交互中这些信息通常不可用,这可能让人更依赖语言线索而低估音视频的作用。第三,会话切分导致可用上下文长度不一,可能改变难度。第四,被试是非母语者但在职业环境中常用英语,论文提醒这可能低估人类表现。数据也只有 AMI 的 4 人角色扮演会议,语言、领域与交互设置变化后结果可能不同。
以下导读是 3 人 Multisimo 的试点对照,用于检验结论是否只在 AMI 成立。
看图路径: 1. 先看横轴仅一百余秒与纵轴受话人及下位发言人准确率的范围;2. 再比较三人 Multisimo 子集上人均线与 Gemini 线的贴合程度;3. 最后注意下位发言人面板蓝色人际带宽与个别窗口急剧下跌点
论文图 4。原论文 Figure 4:“Temporal variation on the Multisimo subset using 15- second windows.”。
该试点只分析了约 60 句话,窗口为 15 秒,规模很小。可见趋势是受话人与下位发言人的人机曲线仍大致同升同降,困难窗口对双方同时困难,这与 AMI 的发现方向一致。但试点不能当作泛化证明,样本量、人数与语言条件都不同,论文也只称其为初步结果。表格把数据侧的测量条件放在一起,提醒复现时先核对串音、识别错误与任务难度基线。
比较的问题是在真实部署前还有哪些可运行风险,公平条件是同一在线约束,指标方向仍是越高越好。
| 测量条件 | 指标名 | 本研究取值 | 任务难度参照 | 可运行含义 |
|---|---|---|---|---|
| 麦克风串音 | 可闻比例 | 8.5% | 下位者部分可闻 | 保留样本更贴近连续交互 |
| 自动转写 | 词错误率 | 24.12 % | 人工转写对照 | 小幅波动但语义多保留 |
| 下位发言人 | F1 | 60% | 四选一随机 25.0 | 人与模型都远非完美 |
表后解释需要区分直接报告与推测。串音比例与词错误率是直接报告,F1 约 60% 是对人类子集的概括。支持的判断是转写噪声在独立麦克风条件下影响有限,待验证的是无独立麦克风、需要日志与多人识别时的表现。未评测的边界包括延迟、误判成本与推理开销,论文未测量这些量,因此不能承诺接话更准就等于交互更流畅。
要重放实验,先固定哪些信息条件?
复现的第一步是重建数据划分。10 个评测会话名单以 IS 开头并在正文中列出,调试用会话单独排除,人类子集固定为两个首阶段会话。受话人标签需要从词级标注聚合到话语级,无标注判无明确对象,单个标注沿用该标签,多个标注判全体。话轮标签直接比较相邻话语的说话人编号,会话末尾无下句的样本不参与后 2 个任务。音频用各人头戴麦克,视频保留叠加标签后的画面,转写分人工与 Whisper 两档,注视目标只在模块化对照中加入。
第二步是固定模型调用。文本模型记录 Qwen3 的具体参数量、思考模式开关、半精度与贪心解码。Qwen-Omni 记录只用思考者模块与思考版本的选择,Gemini 记录接口快照与温度为 1.0。受监督模型记录特征定义与按会话分组的五折划分,测试预测汇总后再算指标。人类实验记录切分时长、练习流程、每句三份标注与同时回答两个问题的顺序。
第三步是固定指标聚合。受话人与话轮转换同时看准确率与宏平均 F1,下位发言人同时看严格准确率与包含式精确率、召回率、F1,避免只看单一指标得出相反结论。还需补的验证包括母语者对照、第一人称视角或更自然的参与条件,以及跨语言与跨领域的重复。资源方面,本次证据没有可验证的公开链接,因此复现应从 AMI 官方渠道与各模型官方渠道自行获取,不应默认代码或权重可一键下载。
话轮转换预测 × 说话人分散度: 话轮转换预测只判断下一句是否换人,分工是把多候选预测压缩为保持或转换二分类;说话人分散度指 1 分钟窗口内各说话人话语量分布的熵,分工是刻画参与是否均衡。搭配原因是均衡参与和频繁换人往往同时出现并提高预测难度,组合意义在于用可计算的窗口特征解释为何某些时段人和模型同时变差,而平均间隔与静音比例则没有显示出同样清晰的关联。
何时值得尝试文本大模型,何时必须补多模态?
综合全文可以给出可操作的取舍。如果任务是预测谁接着说且能拿到较长的说话人与转写历史,文本大模型的长上下文推理是优先尝试的路线,论文中它在该任务上超过人与受监督模型,且对转写噪声有一定鲁棒性。如果任务是判断当前话语说给谁或是否换人,则不能只靠文本,人的优势与注视标注带来的增益都指向视觉与韵律的作用,此时应补显式注视、说话人状态或更可靠的音视频特征,而不是默认把原始视频丢给多模态大模型就能自动用好。
需要记住的误解有三处。第一,多模态输入不等于多模态利用,去掉音视频后下位发言人反而持平或更好,说明融合仍是短板。第二,参数更大不等于任务更准,32B 在受话人上的过度细化就是反例。第三,平均指标不等于全程可靠,人机曲线显示难度随时间波动,频繁换人与均衡参与的区间更难,部署时应对可预测区间求稳、对模糊区间允许更灵活的策略。未来工作应让多模态模型真正把音频、视频与文本对齐起来,并在需要日志与多人识别的真实环境中联合评测,同时继续在可比条件下刻画人类接话行为,为会议助手的评价提供更稳的参照。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



