📄 长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了
英文题目:AudioSpan: Spanning the Duration and Depth of Audio Comprehension
一句话:针对短片段基准分数饱和、长音频评测仍套用固定题型的困境,AudioSpan 用结构化字幕与 Native/Anchor 双路径构建 10 分钟至 2.7 小时的野生音频问答,并以选择与开放双格式、链式截断计分揭示模型难在从冗余波形中蒸馏稀疏事实而非推理本身,代价是依赖字幕完整性与合成锚点的可控性。
标签:#音频理解 #多模态模型 #基准测试 #多语言
评分:8.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Wen Huang:机构信息未在 arXiv HTML 中可靠披露
- Yunfei Chu:机构信息未在 arXiv HTML 中可靠披露
- Meng Gao:机构信息未在 arXiv HTML 中可靠披露
- Haolin He:机构信息未在 arXiv HTML 中可靠披露
- Jin Xu:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
用 Native QA 与 Anchor QA 双路径把长音频评测从拼时长拉回到拼深度,自动化流水线加对抗式 critic 记忆库的设计相当完整。短板是所有长音频仍对超限开源模型做前缀截断且开放题依赖 LLM 评委的 rubric 评分,感知层尤其是时序定位的低分究竟是模型真不会还是评委判不准,论文并未充分自证;Anchor 合成事件的域偏移与链式零容忍计分的放大效应也讨论不足。
📌 核心摘要
针对现有音频理解基准多为数秒短片段、分数饱和且长音频评测仍沿用短音频固定题型的局限,论文提出 AudioSpan 基准,覆盖 10 分钟至 2.7 小时、平均约 50 分钟的野生音频,并在感知 Perception、理解 Understanding、推理 Reasoning 三级认知框架下评测。方法核心是两阶段全自动流水线:阶段 1 将长音频转为含全局概览与分段稠密细节的结构化字幕,阶段 2 分 Native QA 与 Anchor QA 双路径生成题目,前者从字幕自由组合题型并生成选择题与开放题,后者向音频植入声学锚点 Addition / Deletion / Modification 并构建感知到推理的链式问答。相比既有基准的固定题型、单次人工过滤,AudioSpan 引入自由题型、双格式评分与基于盲答与仅文本求解器的三级对抗过滤及自适应记忆库优化。在 12 个大音频语言模型 Large Audio-Language Model, LALM 上的评测显示,Qwen3.5-Omni-Plus 在 Native 选择题上平均 74.6% 领先但开放题 rubric 仅 50.8%,且所有模型在长档 L 平均约 90 分钟上显著下滑,感知层尤其是时序定位成为最弱环节。该基准为长时冗余信号下的信息蒸馏能力提供了可区分的衡量标尺。局限在于仅覆盖英语与中文的野生语音类音频,音乐与环境长录音、跨语言场景未纳入,且 Native 路径受字幕完整性制约,Anchor 路径牺牲了自由多样性。
🔗 开源与复现资源
- 代码:论文中未提及独立 GitHub 仓库链接,附录 A.1 说明 QA 条目、评分标准、锚点编辑清单、声音事件和评估脚本随数据集以 CC BY-NC-SA 4.0 协议分发,未给出独立代码仓库
- 模型权重:论文中未提及,AudioSpan 为评测基准,未发布自训练模型权重
- 数据集:AudioSpan,包含 3240 个问题,覆盖 10 分钟到超过 2 小时的音频,获取链接为 https://huggingface.co/datasets/holvan/AudioSpan,协议为 CC BY-NC-SA 4.0,源录音版权归原作者所有,仅供评估使用且禁止商用再分发
- Demo:论文中未提及
- 复现材料:附录 B 详细描述构建管线,包含结构化字幕生成、QA 生成和对抗式批判反馈,附录 C 给出评估协议、评分公式和裁判提示词,附录 C.4 表 8 列出构建管线所用模型版本,附录 C.1 和表 6 列出 12 个被评模型的上下文长度和截断限制,论文提供基于时间戳引用的 Rubric 评分实现细节
- 论文中引用的开源项目:评估涉及 7 个开源 LALM 包括 Phi-4-Multimodal 5.6B、Audio Flamingo Next 8B、Voxtral-Mini 3B、Voxtral-Small、MOSS-Audio、Baichuan-Omni-1.5、Qwen3-Omni,以及构建管线模型 qwen3-asr-flash、gemini-3.1-pro、qwen3.7-plus、qwen3-omni-flash、gpt-5.4,论文中未提供上述项目的具体仓库链接
🧭 深度解读
为什么这个任务不是把声音丢给模型就结束?
想象你听完 1 小时的播客访谈,朋友只问你一句:第 23 分钟那声突兀的狗叫之后,主持人如何把话题拉回主线?你得先在脑内回放、定位那声狗叫,再回忆当时的对话内容,最后把两段相隔很远的信息连起来。这正是长音频理解的真实形态:信号很长、信息很稀、冗余很多。
过去三年,大音频语言模型(Large Audio-Language Model,简称 LALM)已经从只认语音,扩展到同时处理语音、环境声和音乐,并宣称能听数十分钟甚至数小时。但评测它的基准大多仍是几秒到一两分钟的片段,模型在上面分数趋同、难以拉开差距。更关键的是,把音频变长后,如果题目还是“这段在说什么”这类扁平问题,就测不出模型是否真的在长时信号里持续保持注意力。
AudioSpan 想回答的正是这个问题:当音频长到 50 分钟、甚至 2.7 小时,模型能否像人一样,先把少数关键事实从冗长的波形里捞出来,再完成理解与推理?如果捞不出来,后面的推理再强也无从谈起。
已有评测走到了哪一步,卡在哪里?
短音频评测已经相当成熟。MMAU、AudioBench、AIR-Bench 等在 10 秒左右的片段上覆盖语音、声音、音乐的感知与理解;MMAR、MMSU、STAR-Bench 则在同样短的时长内把难度推向多步推理。这些工作奠定了多维评测的框架,但时长本身不是变量,模型只要在局部窗口内做得好就能拿高分。
近一年出现了把时长推向分钟级的尝试。LongAudioBench、AudioMarathon、ChronosAudio 等做到 2 到 10 分钟,LAT-Bench、BLAB、VoiceGiraffe 则用到 30 到 55 分钟的野生录音。它们的贡献是让模型必须处理更长的上下文,但评测方式往往把长音频当成“更长的短音频”:题型固定、深度扁平,题目多由字幕转写后自动生成,再做一次性的文本过滤。
这就留下两个缺口。第一,题目来源受限于字幕写了什么,字幕没记下的细节就永远不会被考到;第二,质量保障是一次性过滤,难以对抗模型靠选项消除或靠文本常识猜答案的捷径。AudioSpan 的位置就是在这两个缺口上做文章:既要保留野生内容的自由度,又要获得像人工标注那样确定的正确答案,同时让过滤过程能自我进化。
AudioSpan 如何定义长音频的深度?
论文把“深度”拆成 3 级认知,这不是为了贴标签,而是为了让错误可以定位。感知(Perception)管“听见了什么、在哪里、出现了几次”,比如关键词定位、说话人轮替、声事件计数;理解(Understanding)管“这段在表达什么”,比如角色关系、情绪氛围、话题转折与摘要;推理(Reasoning)管“为什么这样说、和别处如何关联”,比如因果归因、长距离指代、矛盾检测。
时长则被显式分档:S 为 10 至 30 分钟,M 为 30 至 60 分钟,L 为 60 分钟以上,平均约 50 分钟。这种正交设计让同一个能力可以在不同时长上被反复测量:如果模型在 S 档感知尚可、到 L 档骤降,问题就不是不会推理,而是长时蒸馏失效。
为了让这种蒸馏可被评分,每道题都以两种形式出现。选择题(MCQ)提供 4 个选项,用精确匹配计分,测的是在选项帮助下能否选对;开放题(OEQ)去掉选项,要求模型自行组织答案并尽可能给出时间戳引用,由细粒度的准则(rubric)打分。前者容易因排除法虚高,后者才会暴露模型是否真能定位。
两阶段流水线:从波形到可验证的题目
整个构建过程可以看作一条单向流水线,输入是一段 10 分钟到 2 小时以上的野生音频,输出是一组带证据引用、可被自动评分的问答。中间分两大阶段:先把音频压缩成结构化字幕,再基于字幕生成题目并经过多重关卡。
阶段一的目标是把长音频变成“可引用的事实库”。它依次完成:用自动语音识别(Automatic Speech Recognition,简称 ASR)模型产出带时间戳的句级转写;按话题、说话人、叙事转折把转写切成约 5 分钟一段并写标题与摘要;用多模态模型补充每段的声纹、韵律、副语言、环境声与非语音事件的时间戳描述;再抽取说话人注册表与跨段的因果、对比、指代等依赖关系,形成全局上下文;最后把所有信息压成证据记录(Evidence Record),每条含稳定 ID、段编号、时间区间与模态标签。
这些记录会以两种视图呈现。摘要视图是音频级概览,用于决定“该问什么、锚点该插哪里”;稠密视图是每段的细节,用于把题目写实。阶段二则在此之上分叉为两条路径:Native 路径从自然内容自由出题,Anchor 路径则先改音频再出题,二者共享同一套质量关卡与评分体系。
双路径与三道闸门:题目如何既自由又可信
Native 路径追求覆盖面。模型在 3 级认知的问题空间中自由选择提问方向与相关段落,再依据稠密字幕写出含题干、四选项、正确答案与证据引用的选择题候选。关键在于,每道题必须引用证据记录,随后由音频验证模型逐条核验引用是否与波形一致,全部通过才算过关。这一步把字幕幻觉挡在门外。
Anchor 路径则用“植入真值”解决字幕不完备的问题。它在摘要视图指引下选 1 至 3 个语义丰富且与其他段相关的锚点,执行 3 类声学操作之一:Addition 叠加 62 类由 Stable Audio 3 合成的声事件,信噪比 6 至 10 分贝;Deletion 以静音或约 300 赫兹低通加调制噪声抹除信息;Modification 改变 8 至 12 分贝音量或 1.5 至 3 倍语速。操作本身即定义正确答案,并产出修改后的音频。随后围绕锚点构建固定的三题链:感知题考计数与定位,理解题考锚点处在讨论什么,推理题考该内容与远处段落的关联。
两条路径共用 3 级对抗精炼与记忆机制。求解器在 3 个信息量递增的条件下各尝试 3 次:仅看题干选项的盲答、加上转写的文本条件、再加上稠密字幕的全文条件。盲答正确超过 3 分之一或仅转写正确超过 3 分之二的题目被剔除,只有全文可解的才保留。被剔除的原因会被 critic 智能体归因到固定目录并写入分路径的记忆库,回注到后续生成的提示中,让流水线越做越能避开已被发现的捷径。最后所有存活题目接受人工逐题听音复核,锚点项还需确认编辑可听且与原有事件可区分。
评分也随路径分化。选择题用准确率,开放题用加权准则分,锚点链用截断链分数。最核心的 3 个公式如下。选择题准确率为
\[\mathrm{Accuracy}=\frac{1}{|Q|}\sum_{q\in Q}\mathbf{1}[\hat{a}_{q}=a_{q}]\]其中 \(\hat{a}_q\) 为模型选项,\(a_q\) 为正确答案。开放题准则分为
\[\mathrm{Rubric}=\frac{\sum_{c\in C}w_{c}\,s_{c}}{\sum_{c\in C}w_{c}},\qquad s_{c}=\begin{cases}\sigma_{c}\text{ or }\tau_{c},&\text{essential,}\\[2.0pt] \mathbf{1}[\sigma_{c}>0]\,(\sigma_{c}+\tau_{c})/2,&\text{supporting.}\end{cases}\]其中 \(\sigma_c\in\{0,0.5,1\}\) 为语义分,\(\tau_c\in\{0,1\}\) 为时间分,必要准则权重 1、支撑准则权重 0.5,且支撑准则的时间分仅在语义正确时计入,时间容差为正负 5 秒。锚点链分数为
\[\mathrm{Chain}=\frac{1}{3}\sum_{k=1}^{3}\prod_{j=1}^{k}\mathbf{1}[\hat{a}_{j}=a_{j}],\]含义是仅首个错误之前的连续正确才计分,随机期望约 10.9%,远低于单题 25%,迫使模型必须先定位才能拿后两题的分数。
没有训练阶段,评测如何保证只测音频理解
AudioSpan 本身不训练新模型,它是一个纯评测基准,因此没有损失函数、优化器或训练硬件的设定。论文的“计算”全部发生在构建流水线与评测协议中,需要讲清的是模型如何被调用、如何被限制、如何被判分。
构建侧复用了 5 个现成模型分工协作:qwen3-asr-flash 负责转写,gemini-3.1-pro 负责声学字幕,qwen3.7-plus 负责题目生成,qwen3-omni-flash 负责证据的音频一致性核验,gpt-5.4 担任开放题的准则评委。质量关卡中的 3 级求解器与 critic 也由语言模型承担,但每道题的判定是确定性的阈值规则,而非可学习的权重更新。
评测侧采用纯音频输入协议。12 个 LALM 在推理时只接收波形,超长音频不回退为文本,而是按模型上限截断为前导前缀。开源模型的上限为 30 至 80 分钟,闭源模型通过接口可处理至 3 至 9.5 小时因而在所有档位均无截断。选择题指令要求只输出选项字母以便精确匹配,开放题则要求引用时间戳但缺失不扣分,解码温度等细节未披露。开放题的语义与时间维度还可进一步拆为
\[\mathrm{semantic\%}=\frac{N_{\sigma}(\mathrm{cor})+\tfrac{1}{2}N_{\sigma}(\mathrm{par})}{N_{\sigma}(\mathrm{cor})+N_{\sigma}(\mathrm{par})+N_{\sigma}(\mathrm{wro})},\qquad\mathrm{temporal\%}=\frac{N_{\tau}(\mathrm{cor})}{N_{\tau}(\mathrm{cor})+N_{\tau}(\mathrm{wro})}.\]这让“说对了内容”与“指对了时间”可以被分别统计。
数据与协议:用哪些音频、怎么比、看什么指标
要理解结果,先看数据与协议的边界。下表根据论文正文与图中报告值整理,概括了样本构成与评测设定,表中数值均为论文明确报告的统计量。
| 类别 | 构成与协议 | 关键细节 |
|---|---|---|
| 音频来源 | 360 条野生音频,另各生成一个锚点修改版,共 720 个文件约 600 小时 | 时长 10 分钟至 2.7 小时,平均约 50 分钟;按 S/M/L 各 120 条、英语/中文各 180 条分层;覆盖 7 类体裁与 9 类主题 |
| 题目总量 | 3240 项,每条音频对应 3 题 | Native 选择题 1080 项、Native 开放题 1080 项、Anchor 三题链 1080 项(360 条链);Anchor 操作按 Addition/Deletion/Modification 各 120 条 |
| 输入协议 | 纯音频输入,超限截断为前导前缀 | 开源模型上限 30 至 80 分钟,闭源模型无截断;不以转写替代音频 |
| 评分指标 | Accuracy(选择题精确匹配)、Rubric(开放题加权准则,时间容差±5 秒)、Chain(锚点链截断分数,随机期望 10.9%) | 开放题由 gpt-5.4 集成评委按必要/支撑准则打分;Chain 仅首错前连续正确计分 |
| 对照基线 | 三档文本基线:question-only、transcript、caption(稠密字幕) | 均以 GPT-5.4 为求解器,用于分离“选项偏置”“文本可解性”与“音频蒸馏难度” |
这样的设计让时长效应与模态效应可以被分离检验:若文本基线同样随 L 档下滑,说明长上下文本身就有惩罚;若文本拿到稠密字幕后远超所有音频模型,则瓶颈在从波形中捞事实,而非文本推理。
下图要回答的问题是:不同时长与不同认知层级上,模型分数如何变化,以及开放题与链式计分是否会放大定位失败。读者应关注 3 组对比:一是同一模型从 S 到 L 的曲线斜率,二是同一时长下选择题与开放题的落差,三是锚点链中感知、理解、推理 3 段的相对高低与 Chain 的截断位置。
主结果:最强的模型也先卡在听见这一步
第一个要回答的问题是:长音频是否真的更难,且难在音频本身而非题目变难。下表根据论文正文与图中报告值整理,选取文本基线与代表性音频模型在三档时长上的核心对比,灰底在原文中表示截断输入。
| 比较或条件 | 指标 | 明确报告值 | 这项数字支持什么 |
|---|---|---|---|
| 文本拿到稠密字幕 vs 最强音频模型 | Accuracy Avg | 80.2% vs 74.6%(Qwen3.5-Omni-Plus) | 同样内容以文本形式给出时分数更高,说明瓶颈在从波形蒸馏事实 |
| 同上 | Rubric Avg | 56.5% vs 50.8% | 开放题同样呈现文本领先,排除仅靠选项消除的解释 |
| Qwen3.5-Omni-Plus 随长度变化 | Accuracy S→L | 79.2% → 70.3%,下降 8.9 个百分点 | 长时惩罚在最强模型上依然显著 |
| 同上 | Rubric S→L | 56.9% → 47.0%,下降 9.9 个百分点 | 去掉选项后长时惩罚更大,定位失败被放大 |
| 文本基线随长度变化 | Accuracy S→L | 83.2% → 77.3%,下降 5.9 个百分点 | 长上下文惩罚在纯文本侧也存在,音频模型在此之上叠加蒸馏代价 |
| 选项偏置对照 | question-only Accuracy | 三档约 40.9% 持平 | 时长下滑不是选项分布导致的假象 |
| 开源代表 Qwen3-Omni 30B | Accuracy Avg / Rubric Avg / Chain Avg | 51.5% / 25.4% / 17.6% | 与闭源差距约 23 个百分点,且开放题与链式分数更低 |
| 最弱开源 Phi-4-Multimodal 5.6B | Accuracy Avg / Chain Avg | 34.2% / 9.6% | 接近随机基线,长音频下区分度仍保持 |
第二个要回答的问题是:高层的理解与推理是否建立在底层的定位之上。锚点链把三题绑成依赖序列,结果呈现出明显的“无定位作答”迹象。池化五家闭源模型时,理解题在定位成功与未定位时的正确率仅差 3.2 个百分点,推理题仅差 4.1 个百分点,说明很多高层正确并非来自接地。
分操作看更清晰:Modification 的感知最高 43.8% 且 Chain 最高 24.3%,可听改动最易被定位;Deletion 的感知最低 32.8% 却推理最高 42.5% 且 Chain 最低 19.2%,恰好是“最难定位、却最敢猜”的组合。Qwen3.5-Omni-Plus 是少数呈现接地溢价的模型,定位成功时理解 54.1% 对未定位 41.0% 高出 13.1 个百分点,而 Gemini-3.1-Pro 则出现反向差距。盲答与仅转写基线在 Chain 上仅 10.4% 与 12.6%,而把锚点注入字幕的文本 oracle 可达 61.4%,进一步说明 Chain 测的是时序接地而非语言内容。
不能从这些数字推出的是:模型在 L 档的下滑完全等同于能力不足。由于开源模型在 M 与 L 档多为截断输入,闭源无截断的对比并不完全公平;开放题依赖 LLM 评委且时间分缺失不扣分,分数高低也包含评委本身的误差。
边界在哪里:字幕、合成与计分各自的代价
论文坦承的局限首先在数据覆盖。Native 路径的题目只能问字幕写到的内容,长音频越长、遗漏越难被人工复核补回;Anchor 路径虽然用植入操作获得确定真值,却把题型固定为感知到推理的三题链,牺牲了自由多样的提问方式。语言与领域上,基准仅覆盖英语与中文的野生语音,长音乐、长环境录音、低资源语言与跨语言问答均未纳入。
更值得研究生关注的是评测协议带来的解释边界。超限音频采用前导前缀截断而非检索或滑动窗口,可能低估那些本可通过分段处理长上下文的开源模型;开放题的 Rubric 依赖 gpt-5.4 评委集成,但论文未报告人与评委的一致性、评委间一致性以及正负 5 秒容差的敏感性,且时间分缺失不扣分可能高估定位能力。
合成锚点本身也有域偏移。Addition 的 62 类声事件由 Stable Audio 3 生成,Deletion 的静音段在真实场景中稀少,模型对这类痕迹的敏感度未必等同于对自然声事件的敏感度。链式计分的零容忍特性会放大单点定位误差:只要第一题定位偏差,后两题即使内容正确也计零分,这让 Chain 更像“接地纯度”指标而非综合能力分。最后,结果仅报告均值而未报告方差与显著性检验,时长与模型间的差异是否统计稳健,仍需更细的误差分析。
可复现性与开源现状:能拿到什么,还缺什么
从可复现角度看,论文在附录中给出了相对完整的流水线描述。字幕切分约 5 分钟上限、Anchor 3 类操作的信噪比与音量语速参数、3 级求解器每题 3 次采样及盲答与仅转写阈值、开放题权重与时间容差、12 个被评模型的上下文长度与截断上限,均有表格可查。数据集 AudioSpan 已在 Hugging Face 以 CC BY-NC-SA 4.0 发布,包含 3240 个问题、720 个音频约 600 小时,以及 QA 条目、评分标准、锚点清单与评估脚本,源录音版权归原作者且仅供评估、禁止商用再分发。
缺口在于工程细节与统计完备性。解码温度、束搜索宽度、硬件环境未披露;开放题评委的提示词虽在附录给出,但人与评委一致性的标定缺失;结果未提供方差、置信区间或显著性检验,复现时难以判断小幅差异是否可靠。代码层面,论文未提供独立 GitHub 仓库,评估脚本随数据集分发,流水线中 5 个模型的版本虽已列出,但未给出端到端一键复现脚本。
对想基于此做后续工作的同学,建议把复现重点放在两处:一是用公开的评估脚本先复现 Accuracy 与 Chain 的精确匹配部分,这部分不依赖评委因而最稳定;二是若要复现 Rubric,需固定评委模型版本与时间归一化逻辑,并自行补充人机一致性抽检,否则开放题分数的波动会掩盖真实改进。
收束:我们该如何理解长音频的下一步
回到开头那个播客问题,AudioSpan 的启示是:长音频的难点不在让模型“听更久”,而在让它“在更久的冗余中持续听对”。文本拿到稠密字幕后能领先所有音频模型 5 到 6 个百分点以上,且时长惩罚在文本侧同样存在,说明模型并非不会推理,而是尚未学会在每秒数十帧的音频编码流中稳定地捞出那几条关键事实。
双路径设计为此提供了互补的证据。Native 路径用自由题型与双格式评分暴露了“选择题虚高、开放题现形”的现象;Anchor 路径用可控植入与截断链分数把猜测压缩到 10.9% 的随机期望之下,让“未定位却答对”的捷径无处藏身。两者共同指向同一个最弱环节:感知层的时序定位,尤其是计数与定位维度。
对研究生而言,这个基准的价值不只是排行榜。它提供了一套可复用的构建范式:用证据记录实现可引用、用 3 级求解器与 critic 记忆库实现对抗式进化、用链式计分实现对接地的硬约束。下一步的突破,很可能不在更大的上下文窗口,而在更强的音频蒸馏与时间接地机制,以及更公平的长音频输入策略与更稳健的开放题评判。
📎 论文与评分元数据
标签:#音频理解 #多模态模型 #基准测试 #多语言
8.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
🔥 8.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音频理解 | #多模态模型 | #基准测试 #多语言 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.6/2):两阶段流水线将 10 分钟至 2.7 小时音频转为含全局概览与分段稠密细节的结构化字幕,分 Native QA 与 Anchor QA 双路径,Anchor 以 Addition Deletion Modification 植入 62 类声事件并用 Chain 截断计分将随机期望压至 10.9%,配合三级求解器与 critic 记忆库对抗过滤,构成可复用的长音频深度评测组合。
技术严谨性 (1.2/1.5):证据记录带稳定 ID 时间区间与模态标签并用 qwen3-omni-flash 逐条核验音频一致性,三级求解器每题 3 次采样执行盲答大于 1/3 与仅转写大于 2/3 剔除,critic 归因至固定目录并回注提示,最终逐题人工听音复核锚点可听性,逻辑闭环完整但合成锚点域偏移与前缀截断公平性讨论不足。
实验充分性 (1.2/1.5):覆盖 360 条野生音频均分 S M L 各 120 条与英中各 180 条共 3240 题,对比 12 个 LALM 及 question-only transcript caption 三档文本基线,呈现 S 79.2% 到 L 70.3% 的时长衰减与 Chain 接地分析,但仅报告均值未报告方差与显著性检验,时长与模型间差异的统计稳健性不足。
清晰度 (0.8/1):以感知理解推理三级认知框架组织 Native 与 Anchor 双路径,图 1 与表 2 明确时长梯度与题型分布,附录 B 与 C 详述字幕五步与问答六步及 Accuracy Rubric Chain 公式,结构清晰但流水线涉及 5 个模型与多阈值分散,阅读负担较高。
影响力 (1.2/1.5):针对数秒短片段分数饱和问题提供 10 分钟至 2.7 小时平均约 50 分钟的长音频基准,揭示 Qwen3.5-Omni-Plus 在 Native 选择题 74.6% 但开放题仅 50.8% 且所有模型在 L 档显著下滑,感知定位最弱,为长时冗余信号蒸馏能力提供可区分标尺,局限于英语与中文语音类音频。
开源 (1.2/1.5):数据集 AudioSpan 含 3240 题与 720 个音频约 600 小时已在 https://huggingface.co/datasets/holvan/AudioSpan 以 CC BY-NC-SA 4.0 发布并随附 QA 条目评分标准锚点清单与评估脚本,但未提供独立 GitHub 仓库,核心产物开放但文档完整性受限。
可复现性 (0.3/0.5):附录 B 与 C 给出字幕切分约 5 分钟上限 Anchor 信噪比 6 至 10 dB 与三级求解器阈值等关键参数及 12 模型 Limit 配置,列出流水线模型版本与评委提示词,但未披露解码温度 beam size 与硬件环境,复现仍需推断。
工程/实践价值 (1.2/1.5):两阶段全自动流水线实现从长音频到结构化字幕再到双路径问答与对抗过滤的端到端转化,证据记录与可验证时间戳及 Chain 评分形成可复用工程产物,已在 360 条音频上规模化验证约 600 小时,但未报告真实延迟吞吐等部署测量。