英文题目:Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

会议身份:conference:interspeech:2026:conference-paper-id:zhang26da_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#形式化分析 #长音频处理 #音频分类 #音频事件检测

评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Peng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Qingyu Luo:机构信息未能从会议 PDF 纯文本可靠映射
  • Philip J.B. Jackson:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenwu Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

长音频活动识别要求从分钟级录音中同时恢复声音事件序列、子活动切分与顶层活动标签,难点在于事件检测缺失错位且跨步骤长程依赖难以从声学直接学到。本文先用事件中心声学前端将录音转成按起始时间排序的事件段与类别后验,再从训练脚本归纳分层活动文法并以概率上下文无关文法刻画活动到子活动再到事件的组成与顺序,最后用Earley风格最大后验解码融合声学似然与文法先验得到活动-子活动-事件解析树并导出时间跨度与根标签。与MultiAct分层独立解码相比,关键差异是将跨层组成与顺序作为显式语法约束在推理时强制满足,而非仅靠多头多任务学习隐式关联。在MultiAct音频评测集上该方法将子活动切分的Edit分数提升至35.3%,显著高于全监督子活动网络基线,同时训练无需任何子活动或活动标注。该结论仅在3类活动的小规模程序化音频上验证,边界粗糙或事件大面积漏检时高交并比定位与分类仍会失效。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留什么信息?

本文的输入是一段长音频,时长从几分钟到超过 3000 秒不等,内容是做饭、清洁或工具操作这类有目标的过程性活动。目标不是给整段打一个标签就结束,而是恢复 3 层结构:最细的离散声音事件、中间的子活动段序列、顶层的活动类别。必须保留的信息是事件段的起止时间与类别后验,因为后续所有高层推断都不再回看波形,只在这组证据上做结构推理。

输出是一棵时间可定位的活动-子活动-事件解析树。叶子按检测顺序一一对应事件段,内部节点对应占据连续段区间的子活动,根节点对应整段录音的活动标签。从这棵树可以直接读出子活动切分与活动分类结果,同时保留推导过程以便解释为何这样切分。

对刚入门的读者,可以把任务想象成听一段厨房录音做笔记:先记下水声、碰撞声、切菜声何时出现,再把它们归成洗菜、备菜等步骤,最后判断整段是在做哪道菜。本文的特殊约束是训练时只用事件标注,不用子活动与活动标注去训练神经分类器,高层完全靠解析得到。

已有路线在哪里分叉,本文补的是哪一段?

第一条路线是短音频识别,包括片段级标注、声场景分类和短时声音事件检测。这类方法擅长学习局部声学线索,在事件级识别上很强,但对长程步骤顺序和层次组成关注较少,直接搬到长录音上容易出现局部合理、全局矛盾的碎片预测。

第二条路线是 MultiAct 这类长过程音频的层次建模。它同时学习活动、子活动与事件 3 层表示,在长录音上给出较强的每层基线。但原文指出其 3 层多用独立目标优化与独立解码,推理时缺少显式的组成与顺序约束,可能出现事件假设跨过子活动边界、子活动顺序违反合理步骤、子活动组合与活动不兼容等问题。

第三条路线来自语音语言与视频动作分割中的文法与解析思想,包括无监督声学单元发现、对话语义的半自动文法归纳,以及用活动文法约束长视频的步骤顺序以减少过切分与不合理输出。本文把这一思想搬到长音频,区别在于观测是检测器给出的带后验的事件段序列,文法是从训练脚本归纳的概率上下文无关文法,并显式加入噪声节点吸收漏检与虚检。

问题如何形式化,什么算合法解?

给定长音频,事件前端输出按起始时间排序的事件段序列,每个元素包含起始时刻、结束时刻与事件类别后验向量。后验定义在终结符集合上,终结符就是事件类别。合法解是能在分层活动文法下推导并恰好覆盖全部事件段的解析树集合中的一棵。

解码目标是两项加权和的最大化:声学项沿树的终结符序列累积每段后验,文法项沿推导中使用的产生式累积产生式概率,权重 λ 控制文法先验强度。声学项体现检测器相信什么,文法项体现训练脚本里什么组成与顺序更常见。

训练与推理的信息条件需要严格区分。事件前端只用事件标签与边界训练,子活动与活动标签不参与训练。文法结构与产生式概率只从训练脚本归纳,在验证与测试阶段固定为解析先验使用,不使用验证或测试脚本构造规则。测试时事件预测被视为固定证据,研究焦点是文法引导的层次推理。

方法全景:一个样本如何走完输入到输出?

沿一个样本走一遍有助于建立整体依赖。长音频先经过基于 SlowFast 的编码器与基于 ActionFormer 的切分器,得到有序事件段与每段取前 10 类的后验。与此同时,训练脚本语料被归纳为分层活动文法,包含活动层规则与子活动层规则。两者汇入文法引导的解析器,解析器在合法树中搜索声学与文法加权分最高的树,再从树中提取子活动时间跨度与根活动标签。

下图是本文的总体框架,左侧是事件证据与文法来源,中间是解析过程与解析树,右侧是 3 层评估的对应关系。

看图路径: 1. 先沿左上长音频经 SlowFast 编码与 ActionFormer 检测得到有序事件段的主路径向右看;2. 再看左下语料库序列如何归纳出分层概率上下文无关文法并与事件段汇入中间解析器;3. 最后看中间解析树如何同时分出根级活动、内部子活动和叶级事件三路评估

原论文 Figure 1:Overview of the proposed framework.

论文图 1。原论文 Figure 1:“Overview of the proposed framework.”。

从像素可见,左上虚线框内是波形经神经网络模型到有序事件段的流程,左下虚线框内是序列语料到产生式规则再到分层概率上下文无关文法的流程,两路箭头都指向中间的文法引导解析器。中间上方是后验概率随时间的格状搜索示意,下方是根为活动、中间为子活动、叶子为事件段的解析树,右侧箭头分别指向根级活动分类、内部节点子活动切分与叶节点事件检测。这种布局直接对应本文只建模事件神经网络、高层全靠解析的主张。

文法与解析器内部如何分工与计算?

分层活动文法被定义为概率上下文无关文法,包含非终结符集合、终结符集合、产生式集合、起始符与产生式概率。非终结符包括高层活动、中间子活动与瞬态噪声节点,终结符是事件类,起始符是当前录音的根活动。对每个左部非终结符,其所有产生式概率归一化为 1。

事件中心声学建模 × 分层活动文法: 事件中心声学建模负责把长音频变成按起始时间排序的事件段序列并给出每段的类别后验,是唯一的神经证据来源;分层活动文法负责规定活动可以展开成哪些子活动序列、每个子活动又必须包含哪些锚点事件以及允许哪些噪声事件穿插,是结构先验。二者搭配的理由是声学证据局部可信但长程易漂移,文法不看波形只管组成与顺序是否合法,组合后解码在合法树集合里同时考虑后验似然与文法概率,从而把碎片事件拼成全局连贯的解析树。

产生式分为两层。活动层把根活动展开为长度为 L 的有序子活动序列,允许类型重复,刻画全局时间逻辑。子活动层把每个子活动展开为锚点事件与噪声节点的交替序列,每个子活动有固定数量的锚点,构成期望的声学骨架,其余事件类视为可选的非锚点事件。噪声节点可以递归生成任意非锚点终结符或空串,从而出现在锚点之前、之间与之后。

锚点事件 × 噪声非终结符: 锚点事件是每个子活动类型下被选定的少数特征事件类,构成该子活动的声学骨架,必须按顺序出现;噪声非终结符是插在锚点之前、之间和之后的空位符号,可以生成零个或多个非锚点事件或空串。搭配原因是真实长音频总有背景音、偶发声和误检,若要求事件序列与骨架严格相等会频繁解析失败,加入噪声节点后可选事件被吸收而不破坏锚点顺序,组合意义是提高对漏检和虚检的容忍度。

下图是一个具体推导例子,展示了根展开、锚点与噪声的配合以及时间跨度的形成。

看图路径: 1. 先看根节点 ACT 向下展开为两个子活动节点的层次分支;2. 再对比带星形的锚点终结符与白色噪声节点生成的非锚点终结符的标记差异;3. 最后看底部虚线映射的终端序列如何切分为两个子活动的连续时间跨度

原论文 Figure 2:Running Example of HAG. ten arise from incidental/background sounds or spurious detec- tions, and…

论文图 2。原论文 Figure 2:“Running Example of HAG. ten arise from incidental/background sounds or spurious detec- tions, and we denote this set by Uc := Σ \ Kc.”。

从像素可见,顶部是活动根节点分出两个子活动节点,左侧子活动下挂噪声节点、带星形的水声锚点、生成可选事件的噪声节点、带星形的碰撞声锚点与生成空串的噪声节点,右侧子活动下挂噪声节点、带星形的切菜声锚点与噪声节点。右侧示例规则框明确写出活动展开与子活动展开的形式,底部虚线把终端序列切为两个子活动的连续跨度,图例区分了锚点终结符、非锚点终结符、空串与非终结符。

声学打分采用条件独立假设,给定检测器后验,每棵树的声学似然是各段对应终结符后验的乘积。扫描时为效率只保留每段前 10 类,但不改变优化目标。文法概率是推导中使用到的产生式概率的乘积,可分解为活动层与子活动层两部分的乘积。

产生式概率 × 文法先验权重: 产生式概率是对每个左部非终结符的所有右部展开归一化得到的概率,刻画训练脚本里哪种子活动序列和事件组成更常见;文法先验权重 λ 是解码目标中加在文法对数概率前的系数,控制结构先验相对于声学证据的强度。二者分工不同,前者是知识内容,后者是使用强度,搭配原因是同样的文法在证据可靠时应少干预、在证据漂移时应多约束,组合后通过调节 λ 实现欠约束与过正则之间的折中。

解析采用维特比风格的 Earley 算法,在对数域维护每个状态的最高部分分与回指。预测操作展开非终结符并加上 λ 加权的产生式对数概率,扫描操作匹配当前段的终结符标签并加上后验对数概率,完成操作把已匹配完的非终结符回填到等待它的部分推导并只保留最高分。覆盖全部事件段的最优完整推导经回溯得到最优树,再把段区间映射为真实时间,根即为活动预测。

Earley 解析 × 最大后验解码: Earley 解析是处理上下文无关文法的从左到右动态规划框架,包含预测、扫描和完成 3 种操作,能高效枚举覆盖全部事件段的合法推导;最大后验解码是本文的优化目标,即在合法树集合里最大化声学似然加 λ 加权的文法先验。二者搭配的原因是合法树空间巨大需要结构化搜索,而 Viterbi 风格的 Earley 在对数域保存每个状态的最高分与回指,恰好能实现该目标的精确近似求解,组合后 1 次解码同时完成事件标号选择、子活动切分与活动判定。

哪些参数被训练,哪些只是被构造与固定?

需要明确区分训练与构造。本文训练的部分只有事件级检测器,它沿用 MultiAct 基线的实现,用事件标签与边界监督学习,与子活动和活动分类头无关。子活动与活动分类器在本文方法中不存在训练阶段,它们是解析树的派生量。

文法部分没有梯度训练。结构与概率从训练脚本统计归纳得到,每个左部符号的产生式频率归一化为概率,验证与评估阶段固定不变。这种设计使得高层组织完全来自符号先验,而不是来自高层标注的反向传播。

推理阶段的计算是搜索而非学习。事件后验固定,解析器执行预测、扫描与完成的动态规划,不更新任何神经权重。超参数 λ 在验证集上扫描后固定为 0.3,测试时不再调整。原文未报告编码器与检测器的学习率、优化器细节与训练轮数等,因此复现神经前端时需回到 MultiAct 官方代码与协议,不能从模型名称推定实现。

数据、划分与指标如何对应三个层次?

实验只用 MultiAct 长过程音频数据集,因为它同时提供活动、子活动与事件 3 层对齐标注,恰好匹配活动-子活动-事件解析的评估需要。数据集规模与分布是理解难度的基础,原文用一句话给出总量与 3 层的类别数、实例数与平均时长。

下表把该句中的数字整理为可核对的规模表,便于对照长录音的层次跨度与持续时间方差。

层次类别数实例数平均时长备注
活动351628 s长录音顶层
事件4473124.91 s叶级证据
总量--8.97 hours音频总时长
序列--最长 3164 s持续时间方差大

上表整理了数据集的总量与 3 层分布,活动层类别少但每段很长,事件层类别多但每段很短,子活动居中。这种跨度解释了为何需要层次解析:事件证据碎而多,活动标签粗而长,中间必须有步骤结构衔接。表中实例数与平均时长的对应关系直接来自原文的同一句话,总时长与最长序列说明长程依赖的测试强度。需要说明资源状态为本次未能确认可达,因此不声称代码、模型或数据已公开,复现应以论文描述与官方渠道核对为准。

评估协议按层次分开。事件检测用不同时间交并比阈值下的平均精度,子活动切分用序列 Edit 分数、交并比 10、25、50 下的段 F1 与帧精度,活动分类用 Top-1 与宏平均的每类精度、平均精度与 ROC 曲线下面积。比较条件是事件检测器共享,文法只作解析先验,不用验证与测试脚本构造规则,也不用子活动或活动标签训练分类器。

主结果:顺序一致性从哪里来,边界代价在哪里?

事件检测层面,文法引导解码后平均精度只有微小一致提升。原文明确解释这是预期的,因为解析发生在检测之后,不改变事件预测,微小增益只是确认解码没有损害事件级性能。学习者不应把事件精度的微升当成主要贡献。

子活动切分呈现清晰的权衡。文法诱导的解码在两个划分上都提升 Edit 分数,在测试集上提升幅度尤其大,支持分层活动文法有效正则化了全局子活动序列的判断。相反,在更严格的交并比下的 F1 与帧精度没有改善,部分情况下下降。原文给出的机制是解析器只能在检测器给出的段序列上重标号与合并抑制虚假切换,不能细化时间边界,因此顺序对了但边界仍粗时 Edit 上升而高交并比 F1 受限。

Edit 分数 × 交并比阈值 F1: Edit 分数是预测子活动标签序列与真值序列之间的归一化编辑距离,衡量全局步骤顺序是否正确,对边界毫秒误差不敏感;交并比阈值 F1 是要求预测段与真值段在时间重叠超过 10、25 或 50 才算命中,衡量边界定位精度。二者搭配的原因是本文方法只能重标号和合并事件段而不能细化检测器给出的起止时刻,可能出现顺序对了但边界不准的情况,组合评估才能区分结构一致性收益与定位代价。

下表聚焦子活动顺序一致性的关键对照,比较可运行的监督基线与事件加文法的可运行策略。

条件指标基线本方法比较对象
EvalEdit24.635.3子活动监督基线对事件加文法
ValEdit基线本方法提升两划分一致增益
EvalF1@25/F1@50较高未改善边界定位代价
ValF1@10基线接近低阈值相对稳健
全局结构局部合理全局连贯顺序约束作用

上表的主要收益是 Eval 上 Edit 从 24.6 到 35.3 的提升,支持全局过程结构被有效约束。具体代价是严格重叠指标与帧精度未同步改善,说明收益集中在标签顺序而非边界精度。表中 Val 的增益方向与 Eval 一致但数值需以原文表格为准,此处不把单点改善推广为所有阈值都成立。同时应保留一个未胜出项:若以高交并比 F1 为目标,文法解析不是替代更准确事件提议的方案。

活动分类层面,事件到子活动再到根活动的层次推理在验证集上达到 73.3% Top-1 与 70.3 的宏平均每类精度,在测试集上为 66.7% Top-1 与 75.0% 宏平均 ROC 面积,且全程未用子活动或活动标签。原文报告显示该策略在部分指标上接近或超过全监督基线,但在测试集上有所回落,提示对不完美证据的鲁棒性仍是未来方向。下表把活动分类中原文正文直接报告的数字整理为可核对形式。

条件指标验证集数值测试集数值监督条件
ValTop-173.3%-仅事件
ValmPCA70.3-仅事件
EvalTop-1-66.7%仅事件
EvalmAUC-75.0%仅事件
对比全监督E+S+AE+S+A用子活动与活动标签

上表显示事件加文法在无高层监督下仍能给出有竞争力的根级推断,验证集强于测试集。代价是没有在全部指标上超过使用事件加子活动加活动监督的全监督上限,且测试集回落表明长尾过程与检测误差会传导到根节点。阅读时应把 Top-1、宏平均精度与宏平均 ROC 面积分开理解,数值相同也不是同一指标的证据。

文法权重与噪声节点各自控制什么?

文法权重的消融回答先验用多重才合适。原文在验证集上扫描 λ,发现中等权重约 0.3 到 0.4 时多指标同时较强,过大权重导致性能下降,表明过正则会压制声学证据。本文所有实验固定 λ 为 0.3。

噪声节点的消融回答容错机制是否必要。去掉噪声非终结符后,解析必须用锚点硬对齐可选事件,虚检与背景声容易打断推导;加入后所有指标一致提升,支持噪声节点吸收了虚假切分并缓解误差传播。

下图左侧是权重扫描曲线,右侧是有无噪声节点的柱状对比,是理解两个超参数分工的最直接证据。

看图路径: 1. 先看左图横轴文法权重从 0 到 1 变化时 Edit 与其他曲线的升降分界;2. 再看左图 0.3 附近虚线位置各指标是否同时处于相对高位;3. 最后看右图每组指标下灰色无噪声与蓝色有噪声柱子的高度差

原论文 Figure 3:Empirical analysis on the validation set.

论文图 3。原论文 Figure 3:“Empirical analysis on the validation set. curate event proposals and better boundary alignment are key to further improving overlap-based segmentation performance.”。

从像素可见,左图横轴为文法先验权重从 0 到 1,纵轴为百分比性能,多条曲线分别对应 Edit、精度与不同阈值 F1,0.3 附近有虚线标记,Edit 在权重增大到 0.5 后明显下坠。右图每组指标下灰色无噪声柱均低于蓝色有噪声柱,Edit 从 19.6 到 37.1、F1@10 从 13.3 到 24.6 等差距直观显示了噪声节点的增益。两图共同说明中等先验加显式容错是当前配置的关键,偏离任一条件都会损失结构一致性。

哪些结论有边界,哪些验证还没有做?

首先是定位能力的边界。方法不产生新的时间边界,只能重用检测器的段提议,因此当检测器边界粗糙时,即使子活动顺序完全正确,高交并比 F1 与帧精度仍受限。原文明确把更准确的事件提议与更好的边界对齐列为进一步提升重叠指标的关键。

其次是先验敏感性。λ 过大导致过正则,λ 过小则约束不足,当前 0.3 是在验证集上选定的单点,跨数据集与跨活动类型的稳定性尚未验证。噪声节点的锚点集合同样依赖训练脚本的统计,若测试出现未见的步骤顺序或声学实现,文法可能过度惩罚合理的新颖序列。

最后是成本与统计的缺项。原文未报告训练资源、推理开销、输出帧率与实际延迟,也未给出显著性检验与置信区间,因此不能承诺延迟或成本得到改善。相关性不等于因果,Edit 提升支持文法有助于顺序一致,但不能直接推断误判率在所有场景下下降。

复现应先做什么,需要保留哪些信息条件?

第一步是复现事件前端。用 MultiAct 官方代码与协议训练或加载事件检测器,保证验证与测试的事件段与后验与原文基线一致,并只保留每段前 10 类用于扫描。任何更换编码器或切分器的改动都会改变证据分布,使文法效果不可比。

第二步是归纳文法。只用训练脚本统计活动到子活动序列与子活动到锚点事件的组成,估计产生式概率并对每个左部归一化,构造噪声节点的递归产生式。切勿混入验证或测试脚本,否则会泄露顺序信息。固定 λ 为 0.3,分别测试有无噪声节点的配置以确认容错增益。

第三步是实现解析与评估。用维特比风格 Earley 实现预测、扫描与完成的对数域更新与回溯,映射段区间到真实时间,再按原文指标计算事件平均精度、子活动 Edit 与段 F1、活动 Top-1 与宏平均指标。复现时应分别记录顺序指标与边界指标,避免用 Edit 的提升掩盖边界的损失。由于本次资源状态未能确认可达,不应默认代码与权重可下载,关键超参数与信息条件应以论文正文为准。

何时值得尝试这种文法引导的解析?

当任务同时满足 3 个条件时值得尝试:长音频具有可描述的步骤顺序,事件检测器已能给出 reasonably 可靠的段与后验,但直接拼出的步骤序列频繁出现跨边界漂移或顺序违规。此时用训练脚本归纳的概率文法作解析先验,能在不增加高层标注的情况下提升全局一致性并给出可解释的推导。

当瓶颈在边界精度而非顺序时不应首选该方法。若应用要求严格交并比下的切分精度,应优先改进事件提议与边界回归,而不是增大文法权重。同样,当过程高度开放、测试步骤大量偏离训练脚本时,需先验证文法的覆盖度,否则强先验可能抑制正确的新颖顺序。

回到中心矛盾:长音频理解需要在碎片声学证据与全局过程知识之间取得平衡。本文选择把神经网络限制在事件层,把长程知识显式写成可检查的文法,再用搜索完成组合。这种分工使错误可归因到证据、文法或权重,适合教学与调试,也为后续引入更鲁棒的证据融合与更广的过程设置留下接口。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总