英文题目:Extending Audio Context for Long-Form Understanding in Large Audio-Language Models

会议身份:conference:eacl:2026:conference-paper-id:2026.eacl-long.286

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #音频大模型 #长音频处理 #音频问答

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yuatyong Chaichana:机构信息未能从会议 PDF 纯文本可靠映射
  • Pittawat Taveekitworachai:机构信息未能从会议 PDF 纯文本可靠映射
  • Warit Sirichotedumrong:机构信息未能从会议 PDF 纯文本可靠映射
  • Potsawee Manakul:机构信息未能从会议 PDF 纯文本可靠映射
  • Kunat Pipatanakul:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大型音频语言模型以分钟级长音频为输入、跨段问答为输出,需将长音频按30秒非重叠分块经Whisper编码为音频Token后与文本Token拼接送入RoPE文本骨干解码,难点是音频位置外推至未见区间导致长程检索失效。方法链首先将长音频分块独立编码并拼接,使统一输入序列进入位置重映射;接着训练无关的部分YaRN仅重写音频段位置标识并保留文本位置,把长音频映射回熟悉区间以保持文本能力。然后虚拟长音频训练将该拉伸反转为训练时位置增强,对每样本随机采样虚拟源长度并压缩或拉伸到真实长度,使模型见过稠密连续长度分布后可叠加推理期拉伸扩展覆盖。与整体拉伸全部上下文的位置插值和YaRN相比,关键差异是模态解耦的二维分组与温度缩放只作用于音频维度,避免扰动文本位置而保留基座语言能力。在YODAS2-MCQA评测设置下,从2分钟观测上下文拉伸的Partial YaRN在10分钟任务的准确率为48.00%,高于Vanilla基线的22.00%。其结论适用边界受限于选择题式信息检索与最长10分钟验证,开放生成与其他长音频基准尚未验证。训练成本对应原文披露的单卡Nvidia H100 GPU硬件环境与LoRA微调设置。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么瓶颈?

本文的输入是一段长音频加一个文本问题,目标是让大音频语言模型在音频长达 1 分钟、2 分钟、5 分钟乃至 10 分钟时仍能正确回答多项选择题。研究对象是统一输入空间范式的大音频语言模型,也就是先用音频编码器把声音转成若干音频词元,再把这些词元拼到基座大语言模型的输入序列里,与文本词元一起做自回归理解。论文聚焦的两个开源模型是 SALMONN 和 Qwen2-Audio 7B Instruct,两者都用 Whisper 编码器处理至多 30 秒的片段,长音频按不重叠 30 秒切块独立编码。

初学者容易误以为瓶颈在编码器切块本身,但论文提出的假设不同:模型对音频内容和文本知识已有足够理解,主要瓶颈是对超出音频文本训练范围的音频位置不熟悉。总序列长度通常仍在基座模型的文本窗口内,问题不是整个序列溢出,而是音频区变长后位置信号进入陌生区域。这个判断决定了后文的技术路线不是压缩输入词元,而是直接操作旋转位置编码的位置映射。

为理解输出,论文自建了 YODAS2-MCQA 数据集,从 YODAS2 英语子集切出指定时长的非重叠片段,每个片段用 Gemini 2.0 Flash 生成 5 个四选一问答,要求覆盖音频的不同部分。每个时长测试集有 750 个问答对。推理时用固定提示要求只输出编号加陈述,不加其他文本。准确率越高越好。本文没有公开代码与数据可用性声明可写,资源状态证据为空,因此不声称代码、模型或数据已公开。

统一输入空间 × 长音频切块编码: 统一输入空间负责把音频编码器输出投影到基座大语言模型的词嵌入空间,使音频词元与文本词元共享同一序列处理;长音频切块编码负责把超过编码器上限的音频切成不重叠的 30 秒块独立编码再拼接。搭配理由是切块保证了任意长音频都能转成词元,但位置长度随之增长超出训练见过的音频区,组合后瓶颈从编码器转向位置泛化,这正是后文只改位置编码的动机。

已有的位置扩展与长音频路线各管什么?

在纯文本大模型中,位置插值的做法是把目标长上下文的目标长度除以原始长度得到扩展因子,再把旋转频率除以该因子,相当于把旋转步长变小,使模型始终在熟悉窗口内做插值而非外推。YaRN 进一步指出均匀插值会损失局部距离和高频信息,因此按频率把维度分成低频纯插值、高频纯外推和中间混合 3 组,并对注意力做温度缩放。LongRoPE 等工作则用搜索决定逐维度的插值因子。

在多模态侧,视频语言模型同样面临长序列问题,主流做法是在进入基座模型前压缩词元,例如查询聚合、帧池化或特征合并。同期长音频大模型则走重设计路线,例如用长音频训练、更长基座上下文或迭代融合压缩音频表示。这些路线都需要新架构、大批量长音频数据和大规模训练。

本文的定位是正交的轻量增强:不改编码器和词元数量,只改基座模型内的位置空间,并用微调时的位置增强提升泛化。教学例子是把长音频理解拆成两步,第一步是把声音变成足够多的词元,第二步是让语言模型认出这些词元的位置顺序。本文只动第二步,因此与压缩输入或重训新模型可以互补,而不是互相替代。

为什么直接套用整体扩展可能不够?

如果把纯文本的整体扩展直接搬到大音频语言模型,最自然的做法是对整个序列统一插值。因为音频窗是总上下文的一部分,整体拉伸会顺带把音频窗变长。但这样做会同时改变文本词元的位置信息,而基座模型此前只在纯文本上预训练,文本位置被扰动可能损伤其语言能力。

另一个极端是只拉伸音频区,保持文本位置完全不动。这能保护文本能力,但会在音频与文本交界处造成位置信号的不连续,且音频区内部不同频率维度的处理必须一致,否则同一段音频在不同维度下会被映射到不同的熟悉程度。论文因此提出两个待验证问题:第一,保留文本位置是否在问答任务中带来可测收益;第二,从原始 30 秒锚点拉伸与从观测到的更长原生泛化点拉伸,哪一个更关键。后续实验显示第二个问题的影响往往更大。

部分 YaRN 的全景:只动音频区的位置映射

部分 YaRN 的总体操作可以沿一个样本走一遍。假设输入序列是前导文本、音频词元、后随文本 3 段,音频区起点为 p,原始音频上下文长度为 Laudio,目标长度为 Lprime。方法保持前后两段文本的位置编码不变,只把中间音频区的位置范围拉伸到新长度,使总词元容量变为原长度加新增音频词元数。实现上不是改旋转频率,而是直接改 position_ids 张量:找到音频区起止下标,对该段用线性插值生成更密集的位置值,再与前后文本位置拼接,送入后续旋转编码计算。

该实现的关键性质是推理开销很小。额外计算只有一次性的切片、线性插值与拼接,发生在包含长音频的提示词初次处理阶段,自回归逐词元生成阶段仍按常规递增位置进行,不增加每词元延迟。论文配图用 1.75 倍拉伸为例说明低频拉伸、高频保持、幅度缩放三件事的配合。

下段导读图一的观察顺序是先确认 3 段式布局,再看高低频的不同处理,最后看边界不连续如何被缓解。该图是理解模态解耦思想的核心示意,像素已随本文收到,可直接观察曲线与区域标注。

看图路径: 1. 先看上下面板的前导文本区与后随文本区是否保持相同的波形相位;2. 再看下方中间蓝色扩展音频区的低频深蓝曲线如何被拉平拉长;3. 对比高频浅红曲线在上下两图中是否保持密集振荡不变;4. 注意扩展区边界附近是否存在幅度和相位的轻微跳变

原论文 Figure 1:An illustration of Partial YaRN.

论文图 1。原论文 Figure 1:“An illustration of Partial YaRN. The top plot displays low (blue) and high (red) frequency dimensions of RoPE.”。

上图分为上下两个面板,上方面板为原始旋转位置信号,下方面板为经部分 YaRN 扩展后的信号。横轴是位置,纵轴是旋转编码取值,深蓝曲线代表低频维度,浅红曲线代表高频维度,中间蓝色底纹为音频区。下方音频区被标注为 1.75 倍扩展,低频曲线明显被拉平拉长,高频曲线仍保持密集振荡,前后文本区波形基本不动。扩展区内所有维度的幅度被缩放以等效注意力温度,交界处虽有轻微不连续,但其他维度的信息可帮助模型消歧。这张图支持后文两组频率与温度是必要组件的判断。

两组频率与温度缩放各自算什么?

旋转位置编码的基本计算是把位置 m 的查询向量与位置 n 的键向量分别旋转后再做内积,相对距离体现在旋转差上。符号含义是 q 为查询,k 为键,R 为按角度频率旋转的矩阵,theta 为各维度的角频率集合。先理解这个相对距离目标,再看扩展如何改变步长与幅度。

\[mkn = (Rm,θqm)T(Rn,θkn) = qT\]

整体 YaRN 的注意力计算在分母引入温度 t,温度越高分布越平滑,长序列下可防止注意力坍缩到少数词元。符号中 Q、K、V 为查询、键、值,dk 为维度,t 为温度。部分 YaRN 不直接改 softmax 分母,而是把温度吸收到旋转矩阵的幅度里,对音频区内的旋转矩阵除以根号 t。

\[t√dk AS(Q, K, V ) = softmax\]

当文本查询未缩放而音频键缩放时,点积自然带上根号 t 分之一的缩放,形成较平滑的温度过渡。论文给出的音频内外分段旋转矩阵形式明确了只有音频区被缩放,文本区保持原旋转。

\[t√dk AS(qm, kn) = softmax\]

频率分组上,本文把原始 YaRN 的 3 组简化为两组:低于等于截断维度的低频纯插值,高于截断的高频纯外推。默认截断为 0 即全部插值,默认温度为 1.0 即不缩放,此时音频扩展退化为部分位置插值。简化理由有二,一是避免中间混合组只覆盖前半段音频而后半段进入外推区,造成同一音频在不同维度下熟悉程度不一致;二是把两个耦合截断参数减为一个,降低调参空间。附录进一步用 3 组与两组的对照验证该选择的可靠性。

旋转位置编码 × 注意力温度: 旋转位置编码负责把相对距离编码为查询与键向量的旋转角度,决定模型能认出多远的位置;注意力温度负责控制注意力分布的尖锐程度,长序列下防止分数坍缩到少数词元。两者搭配的理由是只拉伸位置会让长音频的注意力更分散失稳,温度缩放补偿这种不稳定,组合后既容纳更长音频窗又维持可读的注意力分配。

整体上下文扩展 × 模态解耦扩展: 整体上下文扩展对音频加文本的全部词元统一插值,维持全局位置空间的一致性;模态解耦扩展只拉伸音频区而保持文本位置不动,目的是保护纯文本预训练得到的语言能力。搭配比较的理由是两者各有代价,前者可能扰动文本能力,后者会在音频与文本交界产生不连续,论文用对照实验检验哪种权衡在不同模型和长度下更划算。

位置插值 × 频率分组: 位置插值负责把更长的位置范围压缩进模型熟悉的窗口,避免外推到陌生位置;频率分组负责把旋转编码的不同维度按高低频区别对待,低频做插值承担绝对定位,高频做外推保留局部距离。搭配理由是均匀插值会损伤高频细节,分组让拉伸压力分散,组合后长音频的粗定位与细区分得以兼顾。

虚拟长音频训练如何在不加长音频时见过长位置?

虚拟长音频训练是把部分 YaRN 从推理工具变成训练时的位置增强。设训练样本真实音频长度为 Ldata,每次为该样本采样一个虚拟源长度 Lvirt,虚拟源长度等于模型默认音频上下文长度乘以从集合中随机抽取的因子。默认因子集合为 1、5、10、15、20、25 倍。然后用部分 YaRN 把 Lvirt 长的位置窗压缩或拉伸到 Ldata。例如 2 分钟真实音频抽到 10 分钟虚拟长度,就把 10 分钟窗压缩进 2 分钟,模型看到的 2 分钟音频在位置上仿佛是 10 分钟,从而熟悉更长上下文。

这与随机位置编码的稀疏下采样不同,本文用的是窗内稠密连续插值,且是双向的,既有压缩也有拉伸,并只改音频词元以保留文本空间。训练实现上固定其他部件,只微调基座语言模型,采用单卡 H100 上的低秩适配,秩为 8,alpha 为 16,丢弃率为 5%,优化器为 AdamW,学习率为 5e-5,批量为 8,梯度范数裁剪到 1.0。主虚拟长音频实验在 2 分钟训练集上做 10 轮查询键值输出投影的低秩微调,推理时分别用普通推理与部分位置插值推理评估。论文报告整体 YaRN 在该虚拟训练框架下很快发散,因此虚拟训练只用部分方法,这是复现时必须遵守的条件。

部分 YaRN × 虚拟长音频训练: 部分 YaRN 负责在推理时把音频区位置重映射到熟悉范围,是免训练的部署手段;虚拟长音频训练负责在微调时对同一段真实音频随机采样虚拟源长度并用部分 YaRN 压缩或拉伸,是训练时的位置增强。搭配理由是前者解决单次长度的适配,后者让模型在训练中见过多种虚拟长度,组合后推理时扩展与训练学到的长度鲁棒性可以叠加。

数据、模型与基线如何保证可比?

数据构造上,YODAS2-MCQA 按 1、2、5、10 分钟切块,保留每段长音频的剩余不完整尾块,每个块生成 5 个问答。训练与测试按视频划分,避免同一视频的片段同时出现在训练与测试。为防止虚拟训练实验泄漏,2 分钟训练集与各测试集的源视频不重叠。附录用直方图展示各时长下音频长度分布与答案选项分布,纵轴多用对数计数以显示长尾,横轴为时长秒数或选项编号,蓝色为训练、橙色为测试。

模型侧,SALMONN 每 30 秒产生 88 个音频词元,Qwen2-Audio 经 2 倍下采样后每 30 秒产生 750 个词元,两者压缩率差异很大,这直接影响最优超参数的选择。长音频统一按 30 秒不重叠切块独立编码。基线包括不做任何位置改动的普通模型、整体位置插值、整体 YaRN,以及本文的部分位置插值与调参后的部分 YaRN。整体 YaRN 用预设截断与闭式温度,无需调参;部分 YaRN 需联合搜索截断与温度。参考模型还报告了 GPT-4o 与 Gemini 2.0 Flash 以校验数据集质量,但它们不是可比的待测方法。

下段导读推理提示图的要点是格式约束决定了评测的精确性,模型必须严格按格式输出才能被判分,这减少了开放生成的风格干扰。

看图路径: 1. 确认提示要求输出格式为括号编号加陈述的严格约束;2. 确认要求只输出答案而不附加其他文本;3. 确认要求综合所有给定音频信息再回答问题占位符

原论文 Figure 4:Prompt used for inferencing on YODAS2- MCQA.

论文图 4。原论文 Figure 4:“Prompt used for inferencing on YODAS2- MCQA.”。

该图展示的推理提示要求答案必须形如括号编号加陈述,例如第四项为一支笔时只输出该字符串,不含其他文本,并要求综合所有给定音频作答,占位符为具体问题。这种严格格式使多选准确率能无歧义度量,但也意味着实验不评估生成风格与语言建模的细腻变化,这是后文局限节要回扣的一点。

免训练扩展与微调扩展各在什么长度上赢?

免训练比较的核心问题是:在相同模型与相同时长下,部分方法与整体方法谁的准确率更高,锚点选 30 秒还是观测到的 2 分钟。指标方向是准确率越高越好。论文首先观察到 2 模型在 2 分钟内表现相对稳定,说明原生音频上下文可能长于 30 秒,多音频训练可能是原因之一,因此增加了从 2 分钟锚点向 5 分钟和 10 分钟拉伸的对照。

下表整理两组关键对照,第一组看 Qwen2-Audio 从 30 秒锚点与 2 分钟锚点的差异,第二组看 SALMONN 从 30 秒拉伸时的部分 YaRN 绝对值。表格为 5 列,条件、指标、基线、本方法与比较对象分开,数值保留原文写法。

条件指标基线本方法比较对象
Qwen2-Audio 10 分钟准确率28.53%48.00%普通基线
SALMONN 1 分钟准确率49.0157.35%普通基线
SALMONN 10 分钟准确率23.4732.93%普通基线

表前已说明比较问题是锚点与模态解耦哪个更关键,公平条件是同一模型与同一测试时长,指标方向是准确率越高越好。表后解释是:Qwen2-Audio 上把锚点从 30 秒换到 2 分钟后,部分 YaRN 在 10 分钟从 28.53% 升到 48.00%,绝对提升近 20 个百分点,比普通基线高 26%,这支持锚点选择在大扩展比下比整体与部分的取舍更关键;SALMONN 上从 30 秒拉伸时部分 YaRN 在 1 分钟和 10 分钟分别达到 57.35% 和 32.93%,在 2 分钟与整体 YaRN 接近,但在 5 分钟整体 YaRN 明显反超,说明没有普遍最优,未胜出项恰是部分方法在该中间长度的落后,可能与额外中间组的表达力或调参噪声有关。Qwen2-Audio 在 2 分钟和 5 分钟还出现普通基线优于从 30 秒拉伸的情形,说明其原生长度泛化已较强,硬压缩位置反而有害。

下段导读超参数热力图的要点是看最优格如何随长度漂移,这直接决定调参起点,不能只记一组数字。

看图路径: 1. 先看四个子图的横轴注意力温度与纵轴起始维度的含义;2. 对比 1 分钟与 10 分钟子图中深色高值格从左下向右上移动的趋势;3. 注意 5 分钟与 10 分钟图中特定行的低值白色横带位置

原论文 Figure 6:Hyperparameter Sensitivity of Partial YaRN on Qwen2-Audio (extending the original 30s audio…

论文图 6。原论文 Figure 6:“Hyperparameter Sensitivity of Partial YaRN on Qwen2-Audio (extending the original 30s audio context).”。

该图包含 Qwen2-Audio 在 1、2、5、10 分钟下的 4 个热力子图,横轴为注意力温度 0.9 至 1.6,纵轴为部分 YaRN 起始维度 8 至 56,格内数字为准确率小数,颜色越深值越高。可见短音频最优集中在左下高截断低温区,长音频最优向右上低截断高温区移动,5 分钟和 10 分钟在高温列出现深色高值,而 48 与 56 行在长音频下出现白色低值带。这支持论文的调参建议:中等扩展先用高截断与接近 1.0 的温度,大扩展改用低截断与更高温度。

微调时加入扩展与虚拟长度增强带来多少增益?

微调比较的问题是:同为低秩微调,是否在训练与评估时加入扩展方法,以及是否用虚拟长度增强。论文固定其他部件只调基座语言模型,对比只调查询投影与调查询键值输出投影两种设置,每种设置下训练与评估用同一扩展方法。另一组实验在 2 分钟训练集上对比普通微调与虚拟长音频训练,再分别用普通推理与部分位置插值推理评估对未见长度的泛化。

下表整理微调与虚拟训练的核心数字,仍为 5 列结构,区分训练方法、推理条件与评估长度。

条件指标基线本方法比较对象
Qwen2-Audio 10 分钟查询键值输出微调准确率64.93%83.07%整体 YaRN
Qwen2-Audio 10 分钟普通推理虚拟训练准确率32.76%75.11%普通微调
Qwen2-Audio 10 分钟部分插值推理虚拟训练准确率75.5681.73%普通微调加推理扩展

表前比较问题是微调增益中有多少来自扩展本身,有多少来自虚拟长度,公平条件是同模型同训练时长与同推理扩展,指标越高越好。表后解释是:在查询键值输出设置下,整体 YaRN 的 83.47% 与部分位置插值的 83.07% 都比普通微调的 64.93% 高约 19 个百分点,说明把扩展融入微调是主要收益来源,两者在充分适配下趋同,而只调查询投影时整体 YaRN 更易适配;虚拟训练在普通推理下把 10 分钟从 32.76% 提升到 75.11%,接近此前直接在长音频上微调一轮的结果,说明模型学会了超出训练长度的泛化,且与推理时扩展可叠加,组合后达到 81.73% 的最高值。代价是虚拟训练需 10 轮低秩微调,且整体方法在该框架下发散,只能用部分方法。

去掉频率分组或温度会怎样,两组与三组谁更稳?

消融要回答两个机制问题:频率分组与注意力温度是否都必要;两组划分是否比原始 3 组更适合音频区。实验做法是分别去掉其一后退化为整体或部分位置插值,观察 2 分钟与 10 分钟准确率变化。另一组对照在部分 YaRN 下比较两组与 3 组划分。

下表用 5 列呈现消融方向与差距,数值保留原文的百分点描述。

条件指标基线本方法比较对象
高扩展比去掉任一组件准确率大幅下降保留两组件最稳位置插值
Qwen2-Audio 5 分钟 3 组改两组准确率20.0048.533 组划分
Qwen2-Audio 10 分钟 3 组改两组准确率16.5328.533 组划分

表前问题是组件贡献是否可分离,公平条件是同模型同时长,指标越高越好。表后解释是:去掉频率分组或温度一般都导致大跌,尤其在高扩展比下,说明两者缺一不可;两组划分在 Qwen2-Audio 的 5 分钟和 10 分钟上分别领先 3 组 28.53 与 12.00 个百分点,SALMONN 上总体也更可靠。机制解释是 3 组的中间混合维度只被部分拉伸,后半段音频在这些维度上仍处外推区,造成前后不一致的表征,两组用非插值即外推的二选一保证全段一致。未胜出项是 SALMONN 个别长度下 3 组偶有接近,论文将其归因于表达力与调参噪声,待进一步验证。

下段导读从 2 分钟锚点扩展的热力图,重点看锚点改变后最优区是否收缩,这关系到复现时是否应先测原生泛化长度。

看图路径: 1. 先确认该图是从观测到的 2 分钟上下文向 5 分钟和 10 分钟扩展;2. 比较 5 分钟与 10 分钟图中高值区是否仍集中在中等起始维度附近;3. 观察温度超过 1.4 后右侧列是否普遍变浅

原论文 Figure 7:Hyperparameter Sensitivity of Partial YaRN on Qwen2-Audio (extending the observed 2mins audio…

论文图 7。原论文 Figure 7:“Hyperparameter Sensitivity of Partial YaRN on Qwen2-Audio (extending the observed 2mins audio context).”。

该图为 Qwen2-Audio 从观测到的 2 分钟上下文向 5 分钟和 10 分钟扩展的热力图,坐标含义与前图一致,格内为准确率。可见 5 分钟最优集中在中等起始维度与 1.0 附近温度,10 分钟高值区仍保持在低起始维度但对温度的敏感度下降,右侧高温列不再像从 30 秒扩展时那样一边倒变深,底部 56 行的低值依然明显。这支持论文结论:先实测普通模型的原生长度再定锚点,往往比纠结整体与部分的取舍更有效。

哪些结论出不了这个评测范围?

论文明确报告的局限有 3 类。第一,评测只用多项选择问答,优点是度量精确、无歧义,避免开放生成的语义等价与风格判断混入长度效应;代价是无法充分检验基座语言模型的生成与建模能力,也就无法完整验证部分方法保护文本能力的初衷,对长音频的其他任务格式也未覆盖。第二,数据依赖合成,YODAS2-MCQA 由模型生成问答,虽经引导与抽查,仍可能有噪声、重复与幻觉,性能估计与真实场景有差距。第三,部分 YaRN 需要调截断维度与温度,不像整体 YaRN 有预设与闭式公式,带来额外计算负担,且最优值随模型压缩率变化,SALMONN 偏好 0.6 附近的低温而 Qwen2-Audio 在长音频偏好更高温度,不能跨模型照搬。

从证据等级看,扩展优于不扩展、虚拟训练提升未见长度泛化是直接报告的数字支持;原生上下文为 2 分钟左右是观测到的现象支持;中间组导致后半段表征偏差是合理的机制解释但仍属有限解释;更窄虚拟范围反而更好的原因未阐明,论文留作未来工作。未测量误判率、延迟与成本时,不应声称这些量同步改善。

要复现先做什么,需要哪些超参数与检查点?

复现免训练部分先做原生长度扫描:不对任何位置做改动,直接把 1、2、5、10 分钟音频按 30 秒切块送入 SALMONN 或 Qwen2-Audio,记录准确率拐点,确认本机上的观测锚点是否为 2 分钟左右,再决定从 30 秒还是从观测点拉伸。接着实现部分位置映射:定位音频词元起止,用线性插值生成拉伸后的位置编号,前后文本位置原样拼接,只对音频区做两组频率处理与幅度温度缩放。调参从论文网格起步,Qwen2-Audio 搜索截断 8 至 56 与温度 0.9 至 1.6,SALMONN 搜索温度 0.5 至 1.0,短音频先试高截断低温,长音频转向低截断高温。

复现微调部分固定其他部件,只对基座语言模型做秩 8 低秩适配,alpha 设 16,丢弃率 5%,AdamW 学习率 5e-5,批量 8,梯度裁剪 1.0。虚拟训练在 2 分钟训练集上按视频划分防泄漏,每样本从默认因子集合采样虚拟长度并用部分方法压缩或拉伸,训练 10 轮后再用普通推理与部分插值推理分别评估。注意整体 YaRN 在虚拟训练下易发散,复现时不要将其作为虚拟训练的算子。若要试不同采样策略,论文已比较默认稀疏 6 点、100 点稠密、1000 点极稠密、限长与固定高因子,结果是固定单因子最差,限长反而最高,但机制不明,主实验仍用覆盖评估长度的默认集合更稳妥。

何时值得尝试这套方法,还需补哪项验证?

当已有一个统一输入空间的大音频语言模型,编码器切块能处理长音频但问答随长度快速下降,且总序列仍在文本窗口内时,值得先试部分 YaRN 的免训练扩展。操作成本只是一次性位置重映射,适合快速验证长度瓶颈是否在位置泛化。若免训练已见收益但未见长度仍不足,且只有短音频训练数据时,再做虚拟长音频训练,用位置增强模拟多种虚拟长度,推理时叠加部分插值以获得最高鲁棒性。

选择整体还是部分时不要预设结论:SALMONN 与 Qwen2-Audio 在不同长度下各有胜负,压缩率差异大的模型最优温度与截断明显不同,应以本机网格实测为准。还需补的验证包括开放生成与长音频基准上的表现、合成问答噪声对排名的影响、以及虚拟长度分布与稳定性的系统分析。资源层面本文未提供可用性可写的证据,因此复现应按无公开代码与数据做计划,按论文附录的构造与超参数从头搭建评估链路。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总