英文题目:Intégrer la multimodalité dans les interactions humain-robot situées avec un LLM supervisé par un workflow agentique

会议身份:conference:jep:2026:conference-paper-id:sucal26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#用户研究 #大语言模型 #零样本 #音视频 #音视频交互

评分:4.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Virgile Sucal:机构信息未能从会议 PDF 纯文本可靠映射
  • Maxime Jullien:机构信息未能从会议 PDF 纯文本可靠映射
  • Ahmed Njifenjou:机构信息未能从会议 PDF 纯文本可靠映射
  • Fabrice Lefèvre:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为Pepper转录的结构化环境状态与对话历史,输出为Wait等五类主动交互动作及对应口语文本与非言语表情,难点在于嘈杂 situated条件下何时主动介入、多模态表达一致与实时决策的协同。工作流智能体按固定顺序分三步推理,先由主动性子流程w1抽取用户兴趣与上下文并做零样本思维链推理,以单令牌受限选择输出期望动作。其动作判断与推理文本作为知识传入对话管理w2生成应答口语文本,再将动作与文本一并传入非言语沟通w3选择表情或强调手势,最终合并为统一执行包。与基于交互信念接受分类器加手工规则的多策略旧系统相比,关键差异是以单大语言模型多提示推理替代可训练视频分类器与规则引擎,省去标注视频训练与规则调参,具有开发流程优化意义。在批量重放评测条件下,工作流智能体的准确率为0,66,高于旧系统的准确率0,43。其适用边界限于实验室法语短对话与医院候选场景,长期部署、强噪声与跨文化泛化的表现尚未验证。原文指出延迟仍是主要瓶颈,工作流智能体的推理开销较高且推理时间受限于大语言模型调用。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:这篇论文要解决的 situated 交互是什么?

开场先交代输入与目标。本文解读的唯一事实来源是作者提供的法文论文正文证据,不引入外部评价。目标读者是刚进入语音、音乐与音频领域的研究生,重点是把方法讲到可以核对与复述。必须保留的信息包括任务定义、工作流顺序、提示与推理的执行方式、机器人与感知配置、模型选择、评估协议与已报告的样本分布。输出是 1 篇按学习依赖展开的中文技术解读。

论文研究的不是通用聊天,而是 situated 人机交互,也就是机器人在真实物理场景中与人面对面打交道。机器人能看到人在哪里、看向哪里、是否举手或坐下,能听到语音转写,还要决定何时走过去搭话、何时保持安静、何时结束并返回原位。对初学者来说,白话理解是机器人既是说话者也是行动者,语言只是它众多动作中的一种。以往研究把对话管理与 situated 动作规划当作两个分离任务处理,本文要检验能否把它们压进一个策略。

这种 situated 设定对语音研究者有特殊含义。语音转写只是状态的一部分,视觉感知同样决定行为。例如用户没有看机器人时,主动搭话可能不合适;用户举手或靠近时,发起交互更合理。因此输入不是一段孤立文本,而是一个随时间离散推进的交互序列。

每个时间步先感知环境状态,再由策略生成机器人回合。理解这一点,后面才能理解为什么工作流要把主动性放在第 1 位。

相关路线比较:分离式策略与代理式工作流有何不同?

在进入方法前,需要按同输入、同目标、同运行阶段对照相关路线。论文回顾的第一条路线是机器人中的代理式工作流,已用于轨迹与物理动作规划以及目标检测。这类工作与本文同属机器人运行阶段,但目标更偏向物理执行,而本文目标是社会交互行为,包括对话与非言语表达。

第二条路线是自然语言处理中的代理式用法,例如先做推理再回答以改善问答一致性,以及在对话系统中管理记忆与工具,乃至用大语言模型作为控制器调度内部对话组件或实现检索增强生成。这类工作与本文共享使用提示与推理的手段,但运行阶段多为纯文本任务,没有真实机器人身体与多模态感知。

本文的对照基线是此前用于同一 Pepper 机器人的模块化管线。它基于交互信念接受模型分类用户对机器人的兴趣,再用一组人工规则选择下一步动作。该基线与新方法输入相同、动作集合相同、部署在同一机器人软件框架下,因此是公平的功能替代比较。区别在于基线需要任务特定的标注视频数据训练兴趣模型,还需要大量工程来写规则,而新方法希望用零样本提示省掉这两部分成本。

问题如何形式化:交互序列与时间步输出是什么?

论文把完整的社会交互定义为一个按离散时间步推进的序列。每个基本单位称为回合,代表某一方在该步执行的一组动作。每一步从感知环境状态开始,该状态可能包含用户回合,再由控制机器人的代理模型生成机器人回合。工作流在该步的输出记为该步的决策集合。

沿一个样本走一遍有助于建立直觉。假设在某一步,机器人处于未交互状态,视觉转写说检测到 2 名用户,其中 1 人看向机器人,音频没有可用转写。状态还包括机器人是否正在移动。策略需要先判断是否发起交互以及选择哪 1 位用户,其次若发起则生成说什么,最后决定配什么非言语表达。输出不是一句话,而是包含主动动作、对话内容与非言语动作的集合。

这个形式化把感知、决策与表达分开。感知部分由外部模块提供文本化转写,决策部分由大语言模型工作流完成,表达部分再交回机器人执行。初学者容易误以为模型直接看到图像与音频,实际论文中模型看到的是转写后的结构化文本,这是复现时必须保留的信息条件。

方法全景:一个统一策略如何按顺序接管三种能力?

本文提出的工作流代理把主动规划、口语对话管理与非言语通信放进一个代理策略。做法不是训练新模型,而是不做微调,直接用提示驱动同一个大语言模型依次执行 3 个子过程。每个子过程有自己的专用提示以控制长度,但前一个子过程的输出会作为知识送入后一个,从而减少后续调用次数并提高精度。

主动性 × 对话管理: 主动性负责在时间步上决定发起、延续、改变或终止交互,使后续模块在不需要时可以直接跳过;对话管理负责在已确认需要说话时决定说什么。两者搭配的理由是交互节奏与内容生成存在依赖,先定节奏再定内容可以避免对已结束交互继续生成文本,组合后单个工作流同时输出行为选择与话语内容。

顺序安排有明确依赖理由。第一是主动性,它可以发起、终止或改变交互,一旦决定等待或停止,后续对话与表情生成就可能不再需要。第二是对话管理,它决定谈话内容,为情绪预测提供有用信息。第三是非言语通信,它模拟情绪表达或强调消息内容,依赖前两步产生的信息。最终输出是 3 个子过程输出的集合。论文强调子过程在主流程中分开处理,避免把所有历史塞进一个巨大提示,这是控制提示长度与精度的工程选择。

组件如何运转:信息提取与两步推理做了什么?

工作流的内部过程以文本表示并由大语言模型执行。由于子过程需要多步交互式推理,论文把它建模为提示构造器与大语言模型之间的对话。提示构造器负责拼查询、上下文指令与知识,模型负责推理并生成回答。调用时除模型已学参数外,还有为该步设定的推理超参数。

工作流代理 × 子过程: 工作流代理指按预定依赖顺序依次调用大语言模型的整体控制结构,子过程指其中聚焦单一社会功能的处理单元。子过程分工是把复杂社会行为拆成可独立提示的小任务,搭配理由是长提示会膨胀且上下文易丢失,组合意义在于主流程保持顺序依赖,而每个子过程内部再做多步推理与回答选择。

具体执行分为 3 类操作。信息提取让模型分析当前状态,使用默认超参数以鼓励创造性,提供后续推理的输入。状态细节在实现部分交代,包括机器人状态、用户信息与语言可用性。接着是推理序列,它是迭代的两步过程。推理步用零样本思维链回答查询,温度设为零以降低随机性。

回答步基于前面的推理从预定义列表中选择正确答案,温度之外还把回答约束为单个词元,并把核采样设为 0.01。论文说明该设置沿用此前为减少幻觉而设计的语言模型评估协议。

推理序列可重复多轮,每轮处理一个查询与回答对。每轮是条件依赖前面消息的独立对话实例,但为缓解长对话上下文丢失,模型被约束只在当前迭代内操作,前面迭代的结果以知识形式给出。最后是可选的输出生成,若该子过程需要文本回答,则结合推理答案配置指令与知识生成文本;若对应物理动作,则单个词元本身就足以表示动作,此时省略文本生成。

动作为何只有五种:等待、发起、安静、继续与停止如何分工?

两个策略共享同一动作集合,这是保证比较公平的关键。等待表示系统保持不活动。发起表示与指定编号用户开始对话。安静表示已建立交互后保持沉默。继续表示已建立交互后继续对话。

停止表示结束交互并返回原位。初学者可以把它们理解为交互节奏的离散档位,而不是具体话术。

推理序列 × 回答选择: 推理序列指用零样本思维链生成解释性中间文本的步骤,回答选择指从预定义列表中挑出一个单 token 答案的步骤。前者分工是扩大考虑面并利用模型的生成能力,后者分工是把开放生成收敛为可执行的离散决策。搭配原因是直接生成易发散,先自由推理再强制单 token 约束可以在保持创造性的同时降低随机性与幻觉。

输入状态是结构化转写的集合,分为三域。机器人状态包括是否处于交互中与是否移动。用户信息包括检测到的人数、注视方向、头部朝向与位置指示。语言信息只保留是否有可用转写。这种极简语言状态意味着模型不直接处理声学细节,而是依赖 Whisper 转写后的文本是否存在。对语音背景的学生而言,这是一个重要边界,韵律、重叠说话或噪声水平没有进入决策,复现时不应自行加入未经报告的声学特征。

有训练吗:无微调调用与基线训练成本如何区分?

本研究没有训练或微调大语言模型,这是必须明确说明的。论文反复强调方法是零样本、基于提示的统一策略,所用模型不做微调。真实计算过程是多次推理调用、提示拼接、按温度与采样约束解码,以及在子过程之间传递知识。不存在梯度更新、损失函数、优化器步骤或参数冻结与解冻的报告,缺项应如实指出,而不是从模型名称推定实现。

提示构造器 × 超参数配置: 提示构造器负责把查询、上下文指令、知识与历史拼成送入模型的提示,超参数配置负责设定该次调用的温度与采样范围。两者分工不同,一个管输入内容,一个管输出随机性。搭配理由是信息提取需要发散而决策需要稳定,组合后同一模型在不同步骤可以用不同温度与采样约束实现不同行为。

需要训练的是作为基线的旧系统。旧策略基于交互信念接受模型,需要用任务特定的标注视频数据训练用户兴趣分类器,标注过程需要真人扮演,成本高。规则部分同样需要大量人工工程。因此论文的动机是替换模块化管线以降低训练与开发成本,而不是提升某个纯语言基准。新方法的设计成本转为提示设计,论文认为提示设计比完整规则开发更高效,但该效率判断是方法动机而非本次测量的延迟或人力工时,解读时应区分为直接报告与有限解释。

实验条件是什么:机器人、感知与模型如何配置?

两个策略都作为决策模块接入同一 Pepper 机器人控制管线,该管线为项目开发并基于机器人操作系统构建。评估因此使用两个版本系统,原版作为基线,把原策略换成代理工作流即得到新系统。感知方面,视觉用目标检测方法检测用户关键点,转写聚焦是否举手或坐下;用注视估计方法估计注视方向与头部朝向,转写为与机器人相关的空间与行为关系;音频用大语音模型转写,具体为大模型的涡轮版本。

部署约束直接影响模型选择。目标部署环境是医院环境,受健康隐私法规限制,模型需能本地托管在资源有限服务器上。因此主实验选用一个 8000000000 参数级别的指令模型,实验在具有八十吉显存的加速卡上进行。评估部分还用了另一个 8000000000 参数级别指令模型,以及两个专有接口模型作为补充与裁判。这种配置说明结果与特定模型规模和本地部署约束绑定,不宜直接推广到更大或更小模型。

评估设计分三块。用户体验用简洁的用户体验可用性度量,包含 4 个固定标准,每项七点量表。其中有效性与总体可用性得分越高越好,满意度与性能为反向表述,得分越低越好。该量表被选中的理由是简短易用且与更长的系统可用性量表结果可比。主动性用离线批量重放度量,做法是记录两策略下所有对话数据,标注期望主动行为的时间窗,再检查期望动作是否落在窗口内,汇总为准确率、精确率、召回率与分数。

对话质量用大模型作为裁判,让模型而非人工评价与真人对话,提示中加入与方法一致的推理过程,分别在全局评价一致性、投入度与人性化,在每轮评价任务选择与知识相关性。

样本与主观体验说明了什么:人数分布与量表为何要一起看?

先提出比较问题。在真实交互样本量有限且男女分布不均衡时,能否说两种系统的用户体验接近。公平条件是同一机器人身体与同一动作集合,差异主要在决策策略。指标方向需记住量表中有两项越高越好、两项越低越好,不能把所有分数都按越高越好解读。

下表整理论文直接报告的对话数量与性别分布。它不是性能表,而是判断结果适用边界的条件表。旧系统共 37 次对话,其中 10 次为单用户可用场景,27 次为从多人中选择 1 人。新系统共 40 次对话,其中 24 次为单用户,16 次为多人中选一。旧系统女性参与更多,新系统男性参与更多。这种分布差异意味着单用户与多用户比例不同,性别构成也不同,任何主观分数差异都可能受场景与人群影响。

条件总对话数单用户场景数多人中选一数性别分布报告
旧规则系统371027女性较多,27
代理工作流系统402416男性较多,29

表后解释主要发现与限制。论文报告两策略在该量表上的分数接近,但满意度与有效性的方差与标准差相对较高,说明评分者之间一致性较低。这是具体代价,未胜出项在这里表现为没有一方在主观体验上拉开差距。结合样本表看,场景构成不同进一步削弱了把接近解读为等效的力度。支持的判断是新方法在用户体验上没有出现明显崩塌,可能作为替代值得继续验证,待验证的是在均衡样本与更大样本下是否依然接近。

批量重放评估 × 用户体验评估: 批量重放评估用离线记录与标注的时间窗检查主动动作是否在应出现时出现,分工是客观度量主动性准确率、精确率、召回率与 F1;用户体验评估用简短量表收集真人对有效性与可用性的主观打分。搭配原因是主观感受无法替代行为正确性,组合后可以同时回答系统做得对不对与用户用起来好不好。

主动性与对话裁判揭示了什么:哪项占优、哪项只是接近?

第二个比较问题是主动行为与对话质量是否同步改善。公平条件是批量重放让两策略在对方的数据批上也被检验,对话裁判让多个不同规模的裁判模型分别打分,避免单一裁判偏好。指标方向是准确率、精确率、召回率与分数越高越好,对话五项标准同样按裁判打分越高代表越好理解,但需注意任务相关性是例外。

下表概括论文文字直接报告的定性结论,不虚构具体小数。它承担宽表要求的第二张表角色,用同一组条件对比两个系统在 3 类评估上的相对位置。论文报告代理工作流在批量重放的全部指标上最高,且在跨批对齐上更接近旧系统的数据分布。对话裁判方面,除任务相关性外代理工作流表现更好,但总体上两策略在各标准上可比。裁判规模效应是论文特有细节,较大模型给出的排序与平均排序更一致。

条件批量重放主动性对话裁判多数标准任务相关性跨批对齐
旧规则系统较低多数标准略低但可比相对较好自身数据上好,跨批较差
代理工作流系统全部指标最高除任务外更好例外项未胜出更接近旧系统批次

表后必须讲代价与反例。未胜出项是任务相关性,代理工作流在此项没有最好,这是不能删除的不利点。论文还报告裁判间标准差相对较小,说明裁判之间一致性高于真人量表,但这不等于自动评价可替代人工,因为裁判本身也是模型,可能共享偏好。支持的判断是主动性改善有离线证据,对话质量改善是有限支持。未评测边界包括真实医院环境、长时间多轮交互与噪声语音下的稳定性,这些在本次证据中没有测量。

哪些结论不能下:延迟、样本与人口差异如何约束解读?

论文明确把高推理时间列为主要局限。代理工作流需要多次调用大语言模型,延迟高于旧系统。旧系统延迟较低但同样存在推理时间问题,因此不能把延迟完全归因于新方法,但新方法的多步推理确实增加了调用负担。对语音交互而言,延迟直接影响打断、轮替与用户耐心,论文未报告可复现的毫秒级延迟分布,所以不能承诺响应速度得到改善。

样本量受实验条件限制,可能影响结果。结合前面的数量表,单用户与多用户比例在两组间明显不同,性别分布也相反。论文承认人口差异可能影响参与者回答,但同时称机器人感知不受影响,因为机器人无法区分这类特性。对初学者而言,这句话应理解为感知转写不包含性别标签,而不是说人群差异对主观分数没有影响。缺失的验证是均衡分组或统计显著性检验,原文没有报告,因此接近应表述为报告显示而非证明等效。

另一个常见误解是把零样本省成本等同于全面更优。论文的成本优势是开发流程层面的有限解释,省掉了标注视频与规则工程,但增加了每次运行时的模型调用开销。训练资源、推理开销与实际延迟应分开讨论,总体趋势不等于每一步都成立。

复现先做什么:按什么顺序重建感知、策略与评估?

复现应先重建信息条件,而不是先换更大的模型。第一步是复刻三域状态转写。机器人状态记录是否交互与是否移动,用户信息记录人数、注视、朝向与位置指示,语言只记录有无转写。视觉与注视模块的输出要先转成与原文同义的文本描述,再送入策略。若自行加入韵律或情感声学特征,就偏离了原文条件。

第二步是按顺序实现 3 个子过程。主动性先行,对话其次,非言语最后。前一步输出作为后一步知识。每个子过程内部先做信息提取,再做多轮推理与回答选择,最后按需生成文本。推理步温度为零,回答步约束为单词元并收紧采样。

提示要为每个子过程单独维护,避免合并成超长提示。动作集合严格用等待、发起、安静、继续与停止 5 种,不要自行扩展。

第三步是复现评估。批量重放需要先录制完整对话数据,再按上下文感知标注期望主动行为的时间窗,最后统计是否命中。用户体验复现需用同一四项七点量表并保留正反向。模型裁判复现需用多个裁判并区分全局标准与每轮标准。资源状态方面,本次没有发现来源绑定且完成验证的开源代码、模型或数据,因此不得声称代码或数据已公开,只能按论文文字重建流程,缺失的提示全文与标注细则应在复现报告中明确列为缺项。

何时值得尝试这种统一工作流:收束判断与下一步验证是什么?

综合来看,当目标是快速搭建具有主动社交行为的机器人,且不愿承担标注视频与规则工程成本时,这种单策略提示驱动工作流值得尝试。它把节奏决策、内容决策与表达决策放在同一模型调用链中,顺序依赖清晰,提示规模可控。已有证据支持它在离线主动性上优于旧规则管线,在用户体验与多数对话标准上保持可比,唯一的明确例外是任务相关性。

不值得盲目采用的情形同样清楚。对延迟敏感的实时语音交互、资源极度受限的本地设备、需要严格可解释规则的医疗流程,直接照搬多步调用可能带来风险。此时应先测量每步调用耗时与端到端轮替延迟,再决定是否裁剪推理轮数或缓存中间结果。

下一步验证应补三项。第一是均衡样本与更大样本下的真人评估,控制单用户与多用户比例及人群构成。第二是报告延迟分布与计算预算,包括调用次数、词元量与硬件配置的关系。第三是公开提示模板、时间窗标注规则与裁判提示,使他人能在同一信息条件下重放。只有补齐这些,才能把当前有限支持升级为可部署结论。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总