英文题目:Consistent and Coherent Audio-Visual Understanding with Cross-Frame Patch Differential Attention and Cross-Modal Temporal Alignment

会议身份:conference:interspeech:2026:conference-paper-id:yan26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#注意力机制 #多模态模型 #音视频 #音视频问答

评分:6.1/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Lecheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
  • Chenyang Lyu:机构信息未能从会议 PDF 纯文本可靠映射
  • Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenxi Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Mohamed Fazli Imam:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiahui Geng:机构信息未能从会议 PDF 纯文本可靠映射
  • Qing Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Shaochen Jiang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理音视频场景对话问答与跨模态一致性理解,输入为多帧视频加整段音频与多轮文本问题,输出为自然语言回答,难点在于音频事件与视觉变化在细粒度时间轴上错位且现有大模型多用分离编码器加无约束交互导致语义干扰。方法链分3步推进:先由视觉语言骨干与Whisper系音频编码器抽取特征并以占位符拼入语言模型,再用帧级旋转位置编码与升降序频率注入建立可比的跨模态时间坐标,随后由跨帧块差分注意力捕捉与声音相关的视觉动态,最后用时间对齐掩码与自适应门控做双向交叉融合。与分离编码加全局交叉注意力相比,关键差异是将跨模态注意力硬约束为时长比映射下的时间邻域加线性插值软权重,并以门控残差保留模态特性。在AVSD验证集上以8帧配置取得准确率50.30%,超越用全量帧的Qwen2.5-Omni的46.95%,音频驱动幻觉检测F1达到80.2%。结论边界在于LongVALE上CIDEr仅0.20远低于InternVL-3的8.24,视频驱动幻觉F1为68.34%低于PandaGPT的69.1%,Video-MME总体也落后于Qwen2.5-Omni,作者归因为训练对话格式与长描述格式失配。原文未披露推理延迟吞吐与开源产物。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决哪种不一致?

本文的输入是一段视频的多帧图像加一段同步音频加一段文字指令,目标是让大语言模型直接回答需要同时看与听才能回答的问题。输出是一段自然语言回答,评价时既看回答是否与参考答案在事实层面一致,也看措辞与语义覆盖。必须保留的关键信息是:视觉与音频先各自编码再进入统一时间空间做对齐,最后与文本一起送入语言模型;训练只在音画场景对话数据上做参数高效微调;评测包含域内对话与域外幻觉、长视频与时间一致性。

对于刚进入语音与音频的研究生,一个容易误解的点是把有音频输入等同于用了音频。原文反复强调的矛盾是,很多多模态大模型把音频与视频放在两条独立通路里处理,编码器各做各的,语言模型只是后期拼接。这会导致两种不一致。第一是时间不一致:哪 1 秒的声音对应哪 1 帧的画面没有显式约束,模型可能用第 10 秒的关门声去解释第 2 秒的人物动作。第二是语义不一致:看到渔网就说渔网响了,听到水声就说画面里有水龙头,也就是跨模态幻觉。

因此本文的学习目标不是堆更大的编码器,而是建立可核对的时间对应与语义对应。后续章节按依赖展开:先看已有路线为什么缺这一环,再走一遍从像素与波形到标记、到时间编码、到对齐注意力、到语言建模损失的完整样本路径,然后讲训练时冻结了什么、更新了什么,最后按实验条件核对主结果、消融与域外泛化。本文没有公开代码与权重的可用声明,复现部分只能依据原文给出的超参数与流程复述,不能声称已公开。

给新生的术语表与阅读顺序建议

术语首次出现时用白话加英文对照:旋转位置编码是按帧序号给标记加时间戳的方法;频率注入是叠加递增或递减调制以区分模态的方法;跨帧块差异注意力是通过相邻帧相减突出运动块的方法;时间对齐注意力是按长度比算出对应帧并限制注意范围的方法;音频驱动与视频驱动幻觉是从 2 个方向检验跨模态一致性的方法。

阅读顺序建议先沿样本走主路径,再细看时间编码的输入输出,最后看门控融合与损失。遇到比喻时要回扣到真实信号:所谓桥就是掩码与插值,所谓颜色就是递增与递减签名。篇幅应用于核对条件与数字,而不是重复摘要。若只需一句话带走,就是时间对应做准了,音频才真正帮得上视觉。

同输入同目标的已有路线缺了哪一环?

在同输入即视频加音频加文本、同目标即回答与理解视频内容这个范围内,原文点名了几条代表性路线。视觉语言方向从检测与预训练表示发展到对比学习与指令微调,代表是 CLIP、BLIP-2 与 LLaVA;音频方向以 Whisper 为代表的鲁棒识别器和以 Qwen2-Audio 为代表的音频接语言模型;音视频统一方向有 UniAVLM、MiniCPM-o、Qwen-Omni、Video-SALMONN、Video-LLaMA 系列。

原文的对照逻辑是:这些工作大多支持多模态输入,但在运行阶段缺少保证帧级时间对应与双向语义交换的机制。具体来说,MiniCPM-V 与 Janus Pro 擅长视觉语言,但在音画一致性上没有对应设计;MiniCPM-o 与 Qwen-Omni 虽有音频能力,仍依赖独立编码器加有限跨模态交互。教学上可以这样理解:有两条路不等于修了桥。本文的差异化就是要修两座桥,一座是时间桥,让音频时间步与视频帧序号可换算;另一座是语义桥,让变化显著的视觉块与声音事件互相选择。

需要提醒的是,类别差异不能当作同条件胜负。例如纯视觉模型在音画对话任务上天然缺信息,输给音画模型不证明架构更差。原文相对公平的对照是同样支持音画输入的 MiniCPM o2.6 与 Qwen2.5-Omni,以及同样基于 Qwen2.5-VL 的基座改进,这也是后文解读数字时要盯住的比较线。

要回答的问题如何形式化为可训练的对应?

把任务拆成可操作的形式:设视觉标记集合为 V,音频特征集合为 A,文本指令与历史对话为上下文,模型要生成回答标记序列。难点在于 V 与 A 的长度与采样率不同,直接做全连接交叉注意力会让任意声音注意任意帧,既浪费计算也容易学到捷径。

本文把问题转化为 3 个可训练的子问题。第一,如何给 V 与 A 加上可比较的时间坐标,使第 i 个音频步能算出对应视频帧 j。第二,如何在视觉内部先标出哪里变了,使与声音相关的运动先被放大。第三,如何在跨模态交互时既交换信息又不抹掉单模态特性,避免音频被视觉淹没或反之。

举一个教学例子,注意这只是例子而非原文数值:假设一段 3 秒视频采样 8 帧,音频编码后得到 32 步,长度比决定了每 4 个音频步对应约 1 帧。如果门吱呀声集中在后 8 个音频步,理想的对齐应让这些步主要注意最后 2 帧,而不是均匀注意全部 8 帧。后文的时间对齐掩码与软插值就是为了实现这种可核对的对应。

从波形与像素到回答的主路径是怎样的?

沿着一个样本走完主路径有助于建立全局图。视频帧先进入视觉语言骨干的视觉编码器,每帧切成 14 乘 14 的块,经层次变换与压缩得到紧凑视觉表示;音频波形先进入基于 Whisper 的音频编码器,按层聚合再经两层前馈投影到同一维度;文本侧用特殊音频占位符标记音频嵌入应插入的位置,形成统一的标记序列。

接下来是本文特有的时间增强与对齐阶段。视觉与音频特征先分别经过帧级旋转位置编码与频率注入,获得可比较的时间坐标与可区分的模态签名;然后跨帧块差异注意力在视觉内部捕捉块级变化,时间对齐注意力在音画之间做受限的信息交换;最后对齐后的视觉与音频表示与文本一起送入大语言模型做自回归生成。

下面这张总览图值得对照着看,它把上述分叉与汇合画在了一张图里。看图时不要只记模块名字,要盯住箭头:哪条是主干,哪条是注入,哪条是回路。

看图路径: 1. 先从左下音频波形经音频编码器到卷积池化链,再看左上视频帧经视觉编码器的路径;2. 再看中间虚框内差异注意力与频率注入汇入红色与蓝色特征矩阵的位置;3. 最后看右侧指令标记中音频视频图像三路如何汇入大语言模型并输出回答

原论文 Figure 1:Overview of our audio-video alignment framework.

论文图 1。原论文 Figure 1:“Overview of our audio-video alignment framework.”。

从像素细节看,该图左侧明确画出视频、图像、音频 3 路输入,其中视频用多帧堆叠示意,音频用粉色波形示意;中部虚框标出对齐核心,包含差异注意力、频率注入、旋转位置编码与交叉注意力;右侧画出指令标记序列与大语言模型条块,音频占位符与视频图像槽位分别汇入。这支持正文的说法:时间增强发生在模态融合之前,动态捕捉发生在跨模态交换之前,最终交换是双向且有门控的,而不是简单的拼接后送入语言模型。

时间坐标与模态签名如何计算?

时间编码包含两个互补操作。第一个是帧级旋转位置编码。做法是同一视频帧内的所有标记共享同一编码,不同帧按帧序号递增;音频侧按音频段序号给出对应编码。频率项用帧序号或段序号乘以基频除以维度的方式构造,目标是让跨模态的时间序号在同一坐标系下可比较。白话说,就是给每 1 帧与每段音频盖一个时间戳,且时间戳的刻度是相通的。

第二个是频率注入。做法是对视觉特征与音频特征分别叠加一个与时间有关的调制项,视觉用递增模式,音频用递减模式,形成正交签名。白话说,就是给两路信号染上方向相反的颜色,使模型在注意力中容易分辨信息来自哪一路,同时保留时间顺序。原文用矩阵分块形式给出实现,视觉的生成函数是恒等递增,音频是反向递减。

旋转位置编码 × 频率注入: 旋转位置编码负责给出统一的时间坐标,让同一帧的视觉标记共享编码并与音频段序号对应,频率注入负责给出可区分的模态签名,视觉用递增、音频用递减的正交模式叠加在特征上,二者搭配的原因是只给坐标容易混淆模态来源、只给签名缺少先后顺序,组合后模型可以在不做显式同步的情况下同时判断何时与来自哪一路。

需要指出原文未完全交代的缺项:旋转编码的具体基频取值、频率向量的维度划分细节与调制掩码的构造没有给出可直接复现的完整公式,解读时只能复述其设计意图与输入输出关系,不能自行补写数值。

差异注意力与对齐注意力如何分工?

跨帧块差异注意力的输入是视觉块特征。记第 t 帧第 p 个块的特征为该块向量,差异定义为当前帧减上 1 帧,即块级时间差分。对这些差分再做查询、键、值的投影并做注意力,得到突出变化的表示。直观理解是:如果门的位置块在相邻帧发生明显变化,差分就大,注意力就会放大这些块,后续与吱呀声绑定时更有依据。

时间对齐注意力的核心是先算对应帧再限制注意。对每个音频时间步 i,用音频长度与视频长度之比换算出对应视频帧序号,向下取整得到硬对应,并据此生成二值掩码,只允许对应位置互相注意。为处理非整数对应,原文再在相邻 2 帧之间做线性插值,给出软权重,使音频步按比例分配给下界帧与上界帧。

跨帧块差异注意力 × 时间对齐注意力: 跨帧块差异注意力负责在视觉内部跟踪变化,它对同一块位置做相邻帧特征相减再做注意力,突出与声音事件相关的运动,时间对齐注意力负责在音频与视觉之间限制交互范围,只允许时间对应的位置互相注意,二者搭配的原因是前者先找出哪里动了、后者再决定该动与哪段声音对应,组合后形成先检测动态再跨模态绑定的链路。

硬时间掩码 × 软对齐权重: 硬时间掩码负责按音频视频长度比算出对应帧并截断非对应位置的注意力,软对齐权重负责在相邻 2 帧之间做线性插值分配比例,硬掩码分工是保证因果与对应不发散,软权重分工是处理采样率不一致导致的边界过渡,二者搭配是因为纯硬切会在帧边界抖动,组合后既保留对应约束又允许平滑过渡。

模态特有保留 × 跨模态交互: 模态特有保留指用质量门控 qv 与 qa 控制原始特征 V 与 A 的保留比例,跨模态交互指用前馈与交叉注意力引入另一模态的上下文 V’与 A’,搭配的原因是全量融合会抹掉单模态细节、全量隔离则无法利用互补信息,组合后中间特征 Vinter 与 Ainter 在保留本模态主干的同时选择性吸收对方。

在实现层面,门控质量分数由可学习矩阵加激活函数得到,中间特征是原始特征与变换后跨模态上下文的加权和,再经过交叉注意力层得到最终表示。原文明确的是加权形式与保留意图,但门控矩阵的初始化、激活函数的具体选择对性能的影响没有消融,不能从名称推定其必然带来增益。

训练时更新什么、冻结什么、用什么监督?

本节按原文交代训练的真实计算过程。目标是标准的自回归语言建模,用交叉熵损失对回答标记的真实分布与预测分布求和,条件是处理后的音画特征与前文标记。推理时把对齐后的视觉、音频与文本放在 1 次前向中送入语言模型。

参数策略是参数高效微调加选择性解冻:基座模型参数保持冻结,3 个新增组件完全可训练,同时解冻最后 4 层解码器层并激活语言建模头。优化配置为学习率 3e-5、余弦调度、批量大小 8、bfloat16 精度、训练 1 轮。硬件与时间为在 AVSD 上用 8 块 A100 训练 10 小时并采用分片数据并行。

下面整理训练成本相关的原文条件,便于复现时对照预算与轮数,避免把单轮微调误读为充分收敛的大规模训练。

条件指标基线本方法比较对象
AVSD 微调学习率基座冻结3e-5余弦调度
AVSD 微调批量与精度基座冻结8 与 bfloat161 轮
AVSD 微调可训练部分基座冻结3 个新组件加最后 4 层解码器语言建模头激活
AVSD 微调硬件时间基座冻结8 卡 A100 共 10 小时分片数据并行

上表后需要说明代价与限制。单轮微调的好处是成本可控、适合验证对齐机制的有效性,代价是模型可能欠拟合长尾问答与长视频描述,这与后文长视频描述指标偏低的现象一致。原文没有报告梯度裁剪、权重衰减、随机种子与多次运行的方差,也没有给出 3 个新组件各自的参数量,因此不能从冻结比例推定推理延迟必然降低,训练资源与推理开销应分开讨论。

在什么数据、什么协议、什么指标下比较?

主评测用音画场景感知对话数据集 AVSD,它源自 Charades,包含 7985 个训练视频对话对与 1863 个验证视频对话对,每个对话含 10 轮问答,要求同时理解视觉与听觉上下文。域外评测用 AVHBench 做跨模态幻觉检测,用 LongVALE 做长视频理解,用 Video-MME 做跨 6 个领域的时间一致性评估。

对照模型共 7 个代表性大模型,其中 MiniCPM-o2.6 与 Qwen2.5-Omni 支持音画双输入,其余多为视觉语言模型。用 Qwen2.5-72B 作为裁判计算准确率、BLEU-4、ROUGE-L 与 BERTScore,分别考察流畅性、内容覆盖与语义准确。帧数条件需要特别注意:除 Qwen-Omni 用全部视频与音频帧外,其余模型只用 8 帧,这意味着 Qwen-Omni 在信息量上占优,若仍被超越则更能说明对齐的作用。

指标方向是越高越好,但不同指标不可混比。准确率反映裁判判定的事实正确,BLEU-4 偏向 n 元组精确匹配,ROUGE-L 偏向覆盖,BERTScore 偏向语义相似。百分点差值与相对百分比是两回事,后文只按原文的百分点表述复述,不自行换算相对提升。

主结果在公平条件下说明了什么?

比较的问题是:在同样需要音画理解的对话任务上,显式时间对齐与双向交互是否带来可运行的增益。公平条件是多数模型统一用 8 帧,只有 Qwen-Omni 用全量帧;指标方向均为越高越好。

条件指标基线本方法比较对象
AVSD 对话 8 帧准确率基线未给具体值50.30%超基线 11.59%
AVSD 对话全量帧准确率Qwen-Omni 全量帧50.30%高 3.35%
AVSD 对话 8 帧音频接入MiniCPM v2.6MiniCPM o2.6仅高 0.04%
AVSD 对话 8 帧语义分未单独报告89.87BERTScore-F1

上表后的解释需要同时讲收益与代价。报告显示本方法在 AVSD 上达到 50.30% 准确率与 89.87 的 BERTScore-F1,在所有对照中居首;即使对照 Qwen-Omni 用了全量帧,本方法仍高出 3.35 个百分点,这支持时间对齐与语义对应的价值。反例是 MiniCPM v2.6 与其音频版 o2.6 仅差 0.04%,说明没有集成机制时单纯接入音频几乎无增益。限制是原文主表中的 BLEU-4 与 ROUGE-L 等多列数字在连续正文中没有逐字覆盖,此处不逐行复述,只保留有连续原句支撑的关键数字,避免把不同指标的差值混入同一模型列。

下面这张案例图把数字背后的行为差异具体化,适合检验模型是真对齐还是猜答案。

看图路径: 1. 先看上两行 AVSD 案例中左侧视频截图与右侧两轮问答的对应关系;2. 再对比同一问题下多个模型回答的差异与对勾标记位置;3. 最后看最下一行钓鱼案例中三问如何分别检验视频驱动与音频驱动幻觉

原论文 Figure 2:Representative evaluation cases and model responses from AVSD and AVHBench datasets.

论文图 2。原论文 Figure 2:“Representative evaluation cases and model responses from AVSD and AVHBench datasets.”。

从可见像素看,该图上两行为 AVSD 案例,分别提问是否在修门与声音像什么、是否穿超过两件衬衫与视频中是否有声音,每行右侧列出多个模型的简短回答与对勾;最下一行为钓鱼案例,三问分别检验渔网是否发声、人物是否发声与摩托引擎是否可见,并标注视频驱动与音频驱动幻觉类型。正文指出只有本方法同时答对衬衫数量与门声描述,并在渔网案例中避免把无声的渔网说成有声,这与主结果中音频驱动幻觉检测最强的结论互相呼应。

音频驱动幻觉 × 视频驱动幻觉: 音频驱动幻觉指听到声音后错误断言画面中存在对应物体,视频驱动幻觉指看到画面后错误断言音频中存在对应声音,二者分工是从 2 个方向检验跨模态一致性,搭配评估的原因是单向正确不能证明双向对齐,组合后才能看出模型是真正建立对应还是偏向某一模态猜测。

域外泛化在幻觉与长视频上是否成立?

域外要测的是换协议后机制是否还成立。问题分为幻觉检测、长视频理解与时间一致性 3 类,均按各基准原协议评测。

条件指标基线本方法比较对象
音频驱动幻觉F1多基线对照80.2% F1最优
视频驱动幻觉F1多基线对照68.34% F1有竞争但非最优
长视频无字幕准确率InternVL-3 为 43.6%50.7%高约 7 个百分点
长视频总体准确率基座与 SOTA 对照中等训练格式不匹配

表后解释要区分直接报告与有限解释。报告显示本方法在音频驱动幻觉检测上达到 80.2% F1 并超越所有基线,在视频驱动幻觉上为 68.34% F1 且召回更高,表明对不一致更敏感但精确率有代价;在 Video-MME 长视频无字幕条件下达到 50.7%,高于 InternVL-3 的 43.6%,支持时间推理在长程上的价值。反例与限制是:在 LongVALE 描述性指标上本方法仅略高于基座且远低于头部模型,原文将其归因于训练格式不匹配,这属于有限解释而非已验证因果;此外视频驱动幻觉并非最优,说明双向对齐仍不均衡,不能把总体趋势推广到每一组。

拿掉哪一部分,性能掉在哪里?

消融要回答每个组件是否必要。原文在 AVSD 上报告:评测时去掉音频会显著降低准确率;去掉旋转位置编码与频率投影会明显损伤性能;跨帧差异注意力与跨模态注意力各自都能提升基线,二者组合达到最优。

具体可核对的锚点是基座模型在同样训练与评测下为 44.45% 准确率与 89.56 的 BERT-F1,而完整方法为 50.30% 与 89.87。无音频评测掉到 41.40% 附近,仅跨模态分支为 47.69%,无旋转编码为 47.79%,无频率项为 47.95%,仅差异注意力分支为 46.36%,无差异注意力为 48.91%。这些数字表明时间编码与动态捕捉是互补的,缺任何一块都有损失,但单看消融不能证明因果的唯一性,因为 1 次消融同时改变了参数量与优化路径。

教学上要注意:消融支持组合最优,但不支持拿掉后必然怎样的泛化断言。若换数据集或换帧数,掉点幅度可能变化,后文域外结果正好说明了这种条件依赖。

哪些边界没有测,哪些结论不能推广?

首先是未评测边界。原文没有报告误判率的人工复核、推理延迟、输出帧率与实际部署成本,也没有给出多次随机种子的方差与显著性检验,因此不能承诺这些量得到改善。训练仅 1 轮且只在 AVSD 上微调,长视频描述能力可能欠拟合,这与 LongVALE 上描述指标偏低一致。

其次是条件依赖。主结果中 Qwen-Omni 用全量帧而其他模型用 8 帧,帧数不一致既是本方法的加分项也提醒复现时必须固定帧数;裁判用 Qwen2.5-72B 打分,自动指标不能当作人评,换裁判可能改变排序。

最后是概念边界。频率注入的逆序正交设计在直觉上利于区分模态,但原文没有提供该模式与其他模式的直接对比曲线,不能断言逆序是唯一最优;门控保留与交叉注意的组合在消融中有效,但未测量每步的计算增量,不能从准确率提升推定效率提升。缺失证据不是技术错误,后续验证应补上帧数对齐的对照、人工幻觉复核与延迟测量。

复现时先做什么,需要哪些信息条件?

复现的第一步是固定信息条件:用 AVSD 的 7985 训练与 1863 验证划分,每个对话 10 轮,统一 8 帧输入,裁判固定为 Qwen2.5-72B 并记录准确率、BLEU-4、ROUGE-L 与 BERTScore 的聚合口径。不要自行更换帧数或裁判,否则与原文数字不可比。

第二步是按原文重建管线:视觉侧用视觉语言骨干切 14 乘 14 块并压缩,音频侧用 Whisper 类编码器按层聚合再投影到同一维度,文本侧保留音频占位符;依次加入帧级旋转编码、逆序频率注入、块差分注意力与带硬掩码加软插值的时间对齐注意力,最后用门控做保留与交互。关键超参数是学习率 3e-5、余弦调度、批量 8、bfloat16、1 轮,解冻策略是新增 3 组件全训练加最后 4 层解码器加语言建模头,硬件参考是 8 卡 A100 约 10 小时。

第三步是先跑可核对的最小闭环:复现基座 44.45% 附近的起点,再验证完整方法向 50.30% 靠近,并检查去掉音频评测是否下降、音频驱动幻觉是否接近 80.2% F1。若资源不足,可先在验证子集上固定帧数做对照,但必须声明子集口径,不能把子集最优当作全量收益。资源状态方面,本次未发现来源绑定且完成验证的开源链接,不得声称代码模型或数据已公开。

何时值得尝试这种对齐,还需补哪项验证?

当任务同时满足 3 个条件时值得尝试:输入是同步音画且问题需要绑定何时与何物,基座已支持双模态但简单拼接增益微弱,评测中出现跨模态幻觉或长视频时间错位。此时优先复用本文的时间换算掩码与软插值,再叠加块差分放大的动态线索,最后用门控控制融合比例。

还需补的验证包括:在固定 8 帧与全量帧两种条件下重测以分离信息量与对齐的贡献;补人工复核的幻觉误判率与延迟测量以区分准确率与可用性;补频率注入模式的对照以验证逆序正交是否必要。

回到中心判断:成功的音画理解不仅在于处理多模态,更在于给出可核对的时间对应并保留模态特性。本文的价值在于把这一判断落为可训练的 3 个动作:盖统一时间戳、染相反模态色、先找变化再做对应。记住其适用条件与单轮训练的限制,就能在自己的视频理解任务中正确复用而不夸大。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总