英文题目:PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.1060

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #基准设计 #音视频 #音视频交互

评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Tianwei Lan:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaqi Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zeming Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhaoxin Fan:机构信息未能从会议 PDF 纯文本可靠映射
  • Haifeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuhang Guo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为视觉场景V、环境音频A与角色文本T,输出为移动、操作与对话构成的主动协助动作序列,难点在于无显式指令时须从视听联合语义判断是否介入与如何介入。数据构建先按可共现关系将场景图像库与环境声音库配对并混入含声视频,再由图像与音频描述模型在给定真值标签下生成文本描述,经DeepSeek-V3.2过滤出具有明确协助方向的样本并标注方向性答案,最后经人工审核形成19963条覆盖122场景的数据。评测链先由人工智能专业学生标注约6000条裁判样本训练评估模型,再用微调后Qwen3-8B与Llama3-8B同DeepSeek三路投票加人工仲裁对场景识别、声音事件识别与是否协助三个二值子指标打分,仅三项全过总体才记1分。与单模态级联或仅依赖视觉猜测相比,该设计以模态消融与模态替换分离联合理解与单模态捷径的贡献,迫使规划同时立足于场景与声音事件。在PEAP测试集下,Gemini-3 Pro的Overall得分为80.6,高于Qwen3-omni的Overall得分76.0。该结论适用边界限于离散视听配对的主动规划,替换视觉或长时序导航等外推尚未验证,且单模态缺失会导致任务失败。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,智能体要输出什么?

本文的输入是三部分放在一起的场景上下文。第一部分是视觉场景信息,用符号记为视觉,是一张或一段第一人称视角的图像,包含场景类别与物体。第二部分是音频场景信息,记为音频,是一段与该场景同时发生的背景声音,重点不是说话人的语义内容,而是能指示场景属性与声音事件的环境声,例如警笛、婴儿哭声、 treadmill 跑步声。第三部分是文本任务描述,只定义角色属性,要求智能体根据实际场景主动协助用户,而不是给出具体该做什么的显式指令。

目标输出是一个主动帮助的动作序列。每个动作都按大类加小类加具体内容的格式书写,例如移动、操作、对话三大类下的走向某人、拿起某物、询问或发起话题。序列长度不固定,可以包含多步,也可以是明确判断无需帮助而不执行任何协助动作。论文强调标注的答案是协助方向的一般内容描述,不是唯一的金标准动作序列,只要方向一致的不同具体序列都可以被评价模型接受。

必须保留的信息包括视觉与音频之间的逻辑关联。数据构造时要求配对的音频在对应场景中有合理出现的可能,例如消防站配警笛,机场配婴儿哭或飞机声,教室配关门声或脚步声。学习依赖是先理解任务与评价口径,再看视觉音频如何配对与标注,再看级联与端到端两条实现路径如何调用,最后看主结果与模态消融如何证明联合理解的必要性。输出是 1 篇可复述构造与评测步骤的解读,不做超出证据的效果承诺。

已有路线缺了哪一块?

第一条路线是动作规划智能体。已有工作覆盖家庭助手、计算机操作、个人助理,能力集中在任务规划、逻辑推理与多智能体协作。但论文指出这些工作大多是被动响应式,依赖显式用户指令决定任务启动时机,缺少自主感知场景并主动提供帮助的能力。这正是本文要补的主动性维度。

第二条路线是主动具身智能体。已有工作让智能体主动提问澄清歧义、提出建议,或通过监视电子设备屏幕信息感知用户意图并主动协助,也有工作讨论主动智能体的评价体系。但论文指出这些工作没有聚焦音频加视觉加文本同时输入的全模态场景,真实世界往往同时包含这三者。更关键的是,一些工作把音频仅当作输入输出语义的工具,忽略背景音频中指示声音事件或场景主体的信息,这在实际中可能导致对场景误判。

对照表显示只有本文数据集同时满足主动、多模态、音频、视觉、联合理解与较多场景数。例子是消防站场景:只看图像会看到 2 人在消防车前闲谈,若听不到警笛就会做出介绍消防车这种表面相关但紧急程度完全错误的帮助。因此相关工作的缺口不是模型规模,而是是否把背景音频当作场景语义的共同构造者。

任务如何形式化,什么算对?

任务定义是给定视觉、音频与文本,智能体通过多模态联合感知识别场景需求并规划动作。动作类别只有 3 类。移动指改变自身位置与朝向,例如向前走、转身。操作指与物体交互,例如拿毛巾、开门、拾取、倾倒。对话指言语行为,例如询问、回答、主动提起话题。每一步输出必须先写大类标签再写小类标签,然后写具体内容。

主动具身动作规划 × 被动响应式规划: 主动具身动作规划分工是自主判断是否需要行动以及采取什么动作序列,被动响应式规划分工是等待显式用户指令再决定启动时机,二者搭配理由是论文要补上主动性维度的缺口,组合意义在于把感知场景需求本身作为规划触发条件,而不是把指令解析作为触发条件。

评价设 4 个指标。场景识别问是否通过视觉认出当前场景。声音事件识别问是否通过音频认出正在发生的事件。是否提供帮助问是否向场景中的人提供协助。总体指标问生成的动作序列与该样本参考答案是否一致。

计分规则是总体只有在 3 个子指标都满足要求时才记为 1,否则记为 0。评价模型对每个指标做二值打分。实际评分由多个评价模型同时打分,若一致则直接接受,不一致则转人工打分,以保证稳定性。

论文还纳入无需行动样本,其标注答案就是不采取协助动作,测试时模型选择不执行协助动作才算正确。这避免把主动等同于任何情况下都要行动,也为检验误报提供了条件。

从一个消防站样本走完全流程

沿一个样本走一遍有助于固定全景。输入是消防站照片加警笛声加角色文本。照片给出两辆红色消防车与 2 名便装交谈者,音频给出警笛声,文本要求以第一人称主动协助现场工作。表示阶段需要同时保留视觉细节与声音事件特征,而不是只转写说话内容。组件阶段智能体要建立警笛与紧急调度的语义关联,并结合消防站的上下文属性推出需求。

目标是输出方向正确的序列,例如走向 2 人、告知紧急情况并引导到安全处、检查消防车做好出动准备。输出后由评价模型按 4 个指标逐项判断。

下面这张总览图把上述对比做成可直接复述的例子,阅读时先看输入条,再看 3 类智能体的输出差异,最后看目标状态。

看图路径: 1. 先看顶部输入条如何并置左侧文字加中间消防车照片与右侧警笛图标;2. 再对比中部被动智能体无动作与单模态主动智能体介绍消防车两条失败路径;3. 最后看左下多模态主动智能体三步动作与右下目标状态如何对应疏散与出车

原论文 Figure 1:PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio…

论文图 1。原论文 Figure 1:“PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception”。

图中顶部并置了视觉描述、消防车照片与警笛图标,明确输入是双通道。中部左侧被动智能体显示无动作,原因是不能主动行动。中部右侧单模态主动智能体走向 2 人后介绍消防车,原因是检测不到警笛声。左下多模态主动智能体 3 步分别对应靠近、告知并引导、检查车辆备勤,右下目标显示 2 人已离开且车辆准备出动。该图不支持任何模型参数结论,只用于固定任务定义:同样的视觉下,有无音频联合理解会导致帮助方向完全不同。

任务的数学形式被论文写成以视觉、音频、文本为输入、以动作序列为输出的映射,符号含义与计算目标如下段公式所示。

\[Actionn) = EmbodiedAgent(V, A, T)\]

该式中动作序列的每一项是第 i 个动作,输入三元组分别是视觉、音频与任务描述。论文未给出该映射内部梯度路径或可微实现,它只是任务接口定义,真正的实现由后文级联与端到端两种调用方式承担。

视觉场景信息 × 音频场景信息: 视觉场景信息分工是提供场景类别与物体空间分布,音频场景信息分工是提供声音事件属性与环境声学线索,二者搭配理由是两者存在逻辑关联并共同构成多模态场景语义,组合意义在于只有联合理解才能从警笛加消防站推出疏散与出车准备,而不是只介绍消防车。

两条实现路径分别如何调用模型?

级联路径分两步。先用图像描述模型与音频描述模型分别为图像与音频生成文本描述,测试阶段不向描述模型提供数据的真实标签,以模拟级联固有的误差传播。然后把场景文本信息送入纯文本模型,测试的模型包括不同规模的文本模型。测试提示中包含图像场景描述、背景音频描述、可采取的 3 类动作范围与示例,要求基于图像与音频的联合理解按规则输出连续动作步骤。

端到端路径是一步。把图像与音频信息直接输入多模态模型,依靠模型自身的跨模态理解能力解析图像与音频内容,任务信息仍以文本形式描述。测试的模型包括多个开源多模态模型与闭源多模态模型。测试提示同样包含 3 类动作介绍与输出格式要求,但不再依赖中间文本描述。

级联方案 × 端到端方案: 级联方案分工是先用图像描述模型和音频描述模型生成文本再输入纯文本模型,端到端方案分工是把图像与音频直接输入多模态模型依靠其跨模态能力解析,二者搭配理由是对比误差传播与联合感知的差异,组合意义在于论文用同一任务同时检验文本中介路径与直接感知路径的边界。

输出格式在两条路径中一致,都是先输出动作或话语的标签,大类在前小类在后,再输出具体内容。例子包括对话中提起钻孔声可能来自隔壁装修、移动中转向声音方向以更好判断来源、操作中从台面拿起电水壶、对话中询问是否需要准备茶水、移动中走向水槽接水。这些例子是教学用示例,不是某一样本的标准答案,作用是固定格式与第一人称视角约束。

数据如何配对、过滤与标注?本研究训练了什么、没训练什么?

本研究没有训练任何被测的主动规划模型,被测模型均为直接调用。被训练的只有评价模型,用于对 4 个指标做二值打分。需要明确区分这两类模型,否则会误把评价模型的微调效果当作规划能力的训练效果。

数据构造先解决视觉与音频的逻辑关联。图像来源是公开场景数据集,音频来源是公开声音事件数据集,人工把场景类别与音频类别配对,确保配对音频在对应场景中有合理出现的可能,例如消防站配警笛。为进一步保证自然一致性,还从有声视频数据中收集含声音的视频并纳入。配对示例包括机场配婴儿哭与咳嗽与飞机声,教室配摔门声与说话声与脚步声,健身房配跑步机声与锻炼喊声与脚步声。

过滤与标注阶段先用图像描述模型与音频描述模型在提供真实标签的条件下生成图文与音频的文本描述,再用大语言模型基于这些文本描述做数据过滤,确保特定场景加具体声音事件下协助任务有明确执行方向。对满足方向要求的过滤后数据,再用同一大语言模型标注协助任务的核心内容。质量控制采用专家审核,人工可接受、拒绝或修改模型标注以避免锚定偏置,最终随机抽取 10% 数据人工检查,要求标注一致率超过九成五。

评价模型的训练是本节唯一的神经网络训练。做法是从全部场景抽样,用所有被测模型产生输出,再招募人工智能方向硕博学生按 4 个指标人工打分,形成约 6000 条评价数据,每个指标约 1500 条。用该训练集对两个小规模文本评价模型做低秩适配微调,微调后判断准确率明显提升。实际评价时同时用闭源大模型与两个微调后模型打分,三者一致则接受,不一致则人工打分。论文未报告被测模型的训练超参数、梯度路径与冻结细节,因为被测环节本就没有训练。

测什么、与谁比、条件是否一致?

主实验测被测模型在完整视觉加音频输入下的四指标得分与动作级准确率召回率。比较对象是同一测试集上的级联模型组与端到端模型组,不跨数据集比较。指标方向都是越高越好,总体为二值一致性,动作分析中准确率指模型预测动作中有多少命中答案,召回率指答案动作中有多少被模型命中,调和平均值综合两者。

进一步分析设 4 个研究问题。第一问是否靠冗余动作提高完成率,用人工把参考答案与模型输出都拆成单个动作后计算准确率召回率。第二问多模态输入是否有帮助,做模态消融,分别去掉音频只留视觉、去掉视觉只留音频,观察下降幅度。第三问是否真正联合理解,做模态替换,用纯黑图像替换视觉、用纯噪声替换音频,构造语义失配集,观察是否大幅下降以排除随机猜测或单模态依赖。第四问文本描述影响多大,做简化文本,去掉要求具身智能体根据场景自主决策的内容,观察变化。

人类评价另抽 150 条覆盖所有场景的数据,按同样四指标人工打分,用于检验自动评价的一致性。资源状态方面,图像与音频描述模型链接本次未能确认可达,评价与测试用的闭源模型文档链接当前可用。复现时应以论文附录的提示格式与输出标签规则为准,而不是以镜像链接是否可达为准。

主结果显示最弱子指标决定上限

比较问题是完整双模态输入下谁能在 3 个子能力上同时达标,公平条件是同一测试集与同一总体计分规则,指标方向为越高越好。总体只有三项子指标同时满足才记分,因此最终表现受最弱子指标约束。论文报告顶部的多模态大模型与较大规模级联模型总体超过七十分,而小规模级联与部分端到端模型总体很低。子指标分析显示有的模型场景识别很高但声音事件识别与是否提供帮助很低,最终任务失败,而顶部模型在三项上都较稳。

下表第一张是原文提供的评价模型能力对照,用于说明评价体系本身经过微调与多人投票后的稳定性,第二张整理数据集规模与质检数字,第三张整理评价模型打分准确率,所有数字与单位保留原文写法。

AudiosModel SRSERAP
A baby is crying Qwen3-8B29.362.052.7
A person coughs Llama3-8B64.050.765.3
An aircraft can be heard Deepseek-api82.077.368.7

上表原矩阵行列有限,只能呈现评价模型在各指标上的打分准确率,不能当作被测规划模型的主结果。它的作用是支撑后文主结果的可信度:微调后评价模型的判断准确率明显高于微调前,多模型一致加人工仲裁的方法达到很高的准确率。阅读时不要把该表的总体列误读为规划任务的总体得分。

条件指标规模质检抽样结果
全量数据场景数与条目数122 scenes 与 19963 data entries10% 抽检一致率 over 95%方向标注为协助方向
质检抽样有效接受率2000 data entries人工逐条判断方向与准确性98.9%
评价数据四指标训练样本approximately 6kabout 1.5k per metric用于微调评价模型

上表把分散在正文中的规模与质检条件收拢,代价是它不包含任何模型得分,不能替代主结果表。它的主要收益是让复现者先核对数据量级与质检口径:最终数据集覆盖一百二十二场景共 19963 条,随机 2000 条人工评估有效接受率高达 98.9%,评价数据约 6000 条每指标约 1500 条。未胜出项是该表无法回答哪个规划模型更好,这个问题必须回到主结果的四指标表。

场景识别 × 声音事件识别: 场景识别分工是判断模型是否通过视觉认出当前场景,声音事件识别分工是判断模型是否通过音频认出正在发生的事件,二者搭配理由是动作规划需要两者协同而最弱项决定上限,组合意义在于任一子指标低都会拉低总体是否与参考答案一致的判断。

去掉或替换一个模态会发生什么?

模态消融的问题是单模态信息能否支撑规划,条件是同一模型分别只输入视觉或只输入音频。论文报告所有模型在单模态下都显著下降。只留视觉时缺少音频语义线索,只能靠视觉特征推理,可做部分基础规划但远低于多模态基线。只留音频时无法获得物体空间分布,面向操作的规划严重受限,几乎不能生成有效序列。只留视觉一般优于只留音频,但两者都证明单模态不能满足任务的认知需求。

模态替换的问题是模型是否真正整合语义关联,条件是用纯黑图像或纯噪声音频制造失配。论文报告替换任一模态后多数模型得分大幅下降,说明联合理解过程被破坏,用被替换的场景或声音推理会产生与原答案不一致的输出。少数小模型变化较小,论文解释为可能采用固定输出模式,未充分考虑不同声音事件对场景语义的影响。

动作冗余分析发现部分模型召回明显高于准确率,说明靠输出大量动作命中更多真实动作但拉低准确率,即靠冗余提高了总体任务分。另有模型在主任务分高但动作级调和平均值不高,说明省略了一些不影响最终方向判断的步骤。下面的冗余例子把这一判断具体化,阅读时先看序列再看红色句的判定标准。

看图路径: 1. 先按顺序读出五条输出动作的类别标签与具体内容;2. 再定位红色高亮的评论消防车漆面干净这一句在紧急序列中的位置;3. 最后对照底部解释段看何为不直接解决问题即判为冗余的标准

原论文 Figure 8:A redundant output example.

论文图 8。原论文 Figure 8:“A redundant output example. The highlighted action in red represents a redundant action in the model’s output.”。

图中模型在消防站警报场景输出 5 步,中间红色句评论消防车漆面干净整洁。底部解释明确该句在紧急场景中无意义,虽然智能体回应了紧急情况,但该动作不直接解决场景中产生的问题故判为冗余。该图不支持去掉该句必然提高总体分的因果结论,只说明准确率低对应存在大量与任务无关的动作。

评价对象指标方向微调前微调后高准确方法
评价模型 ASR SER AP Overall 越高越好29.3 62.0 52.7 61.374.0 80.0 80.7 89.398.0 99.3 96.7 98.7
评价模型 BSR SER AP Overall 越高越好64.0 50.7 65.3 64.793.3 92.0 82.0 88.798.0 99.3 96.7 98.7
参考SR SER AP Overall 越高越好82.0 77.3 68.7 92.782.0 77.3 68.7 92.798.0 99.3 96.7 98.7

上表转写自评价模型对照实验,比较问题是微调是否提高评价打分准确率,公平条件是同一评价测试集与同一四指标。收益是微调后 2 模型在各项上明显提升,多模型投票加人工仲裁的方法在各项上达到最高。代价与限制是该表与规划主结果无关,不能用来证明某个规划模型更强,也未测量延迟与成本。未胜出项是微调前的小模型在多项上明显偏低,说明不能直接用未经训练的通用小模型当裁判。

准确率 × 召回率: 准确率分工是模型输出动作中有多少命中参考答案,用于暴露冗余,召回率分工是参考答案动作中有多少被模型成功输出,用于暴露遗漏,二者搭配理由是总体二值分可能被多猜掩盖,组合意义在于用调和平均值判断模型是真正命中核心需求还是靠输出大量无关动作提高命中。

哪些边界没有被测到?

论文明确的局限是计算效率。工作重心是细粒度多模态联合理解的质量与动作规划推理的可靠性,没有优先优化计算复杂度与推理速度。处理高分辨率视觉输入与长时音频序列时可能推理延迟较高,在算力有限的边缘设备实时部署方面还有改进空间。未来计划探索轻量化架构与高效推理策略,在保持任务性能的同时降低开销。

未评测的边界包括延迟、帧率、推理开销与部署成本。论文报告了总体趋势不等于每组每步都成立,例如总体分高不代表每一步动作都无冗余,动作级分析正是为此补充。数据层面论文声明是受控规范基准,而不是真实世界主动行为的人类 grounded 仿真,虽然允许多样反应但仍依赖模型标注加人工审核的方向描述。伦理层面数据来自公开数据集并做匿名化处理,标注由专业人员复核并获得合理报酬,协助动作要求不违反用户意图与安全。

相关性不等于因果。模态消融与替换显示的下降支持联合理解必要,但没有测量误判率在真实部署中的分布,也没有证明去掉文本角色描述必然导致失败,简化文本实验显示多数模型只是轻微下降。因此只能说更准确的任务描述有助于执行,不能说它是决定性因素。

复现先做什么,需要哪些信息条件?

先复现数据接口。按视觉加音频加角色文本为输入、动作序列为输出组织样本,动作输出强制使用大类加小类加具体内容的标签格式。配对时先保证音频在场景中有合理出现的可能,再用描述模型生成文本后过滤出有明确协助方向的样本,标注只写协助方向的一般内容并保留无需行动样本。抽检时复现 10% 抽检一致率与 2000 条有效接受率的质检步骤。

再复现评价流程。先抽样让所有被测模型产生输出,再按四指标人工标注约 6000 条评价数据用于微调评价模型,实际评分用 3 个评价模型同时打分,一致则接受,不一致转人工。不要把被测模型的调用温度或采样策略当作论文已给定的超参数,原文未报告这些细节,复现时应固定并记录自己的选择。

最后复现实验条件。级联路径测试时不给描述模型真实标签以保留误差传播,端到端路径直接输入图像与音频。消融必须分别做只留视觉、只留音频、替换视觉为纯黑、替换音频为纯噪声、简化文本去掉自主决策要求。代码开源、权重下载与系统可运行是三件不同的事,论文未承诺完整系统开源,复现应区分评价代码可运行与被测闭源模型仅能通过接口调用。还需补的验证是延迟与成本测量,以及在真实机器人上的闭环执行,而不仅是文本动作序列的离线打分。

何时值得尝试这种做法?

当任务满足 3 个条件时值得尝试。第一,环境中存在背景音频且其含义会改变帮助方向,例如警笛、哭声、设备异响。第二,允许智能体在无显式指令时主动行动,且误报成本可控,因为数据中包含无需行动样本,评价会惩罚不该动而动。第三,能够接受多模态联合理解的开销,因为单模态基线远低于双模态,替换任一模态也会大幅下降,说明不能用单通道捷径替代。

不值得盲目照搬的情况是只有说话语义而无环境声学价值的场景,或只能部署单模态传感器的边缘设备,论文的局限已指出长音频与高分辨率图像的延迟风险。复述方法的关键一句话是:用逻辑相关的视觉与音频共同构造场景,用方向性标注代替唯一动作序列,用三评价模型加人工仲裁保证总体二值分稳定,再用消融、替换与动作级准确率召回率 3 组反证排除单模态依赖与冗余猜测。

对刚进入语音与音频领域的研究生,建议把背景音频当作与视觉平等的语义来源来建模,而不是当作语音转写的附带通道。先从声音事件识别的准确性入手,再看它如何改变对话与操作动作的选择,最后才讨论模型规模带来的增益,这样才能与论文的证据链对齐。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总