英文题目:Vox-Infinity: Benchmarking the Limits of Long-Context Spoken Language Models

标签:#音频问答 | #基准设计 | #长音频处理 | #语音 | #语音情感识别

评分:7.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

👥 作者与机构

  • Xize Cheng:机构信息未在 arXiv HTML 中可靠披露
  • Wenxu Jia:机构信息未在 arXiv HTML 中可靠披露
  • Chenyuhao Wen:机构信息未在 arXiv HTML 中可靠披露
  • Dongjie Fu:机构信息未在 arXiv HTML 中可靠披露
  • Zehan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Xinyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Tao Jin:Zhejiang University

📌 核心摘要

本文面向长上下文口语问答,输入为数分钟多轮语音历史加最终语音查询,输出为开放式或选择式答案,难点是语音编码密度低导致序列极长且语义与韵律线索交织易被遗忘。构建链分三步:先由真实语料沿轮次数量与单轮时长扩展出超多轮对话、个人独白与超语义对话三类场景,再用大模型按全对话生成问题并标注必需引用轮次以定义所需历史时长,最后经人工核查答案唯一性与证据溯源后按时长分箱组卷。相对已有音频基准只比总时长的做法,该设计以证据距离而非会话长度组织评估并分离词汇与声学情绪线索。在超多轮对话场景下,文本历史条件下Qwen3-Omni的准确率为84.8%,高于音频历史条件下Qwen3-Omni的准确率55.0%。结论限于数分钟级对话与转写加持的评测协议,对小时级会议与流式交互的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先保留哪些信息?

本文解读的对象是 Vox-Infinity,一个专门评测语音语言模型长上下文理解的基准。输入是连续的语音对话历史,输出是对历史中某处证据的回答。

目标不是把语音转成文字就结束,而是检验模型能否在很长音频历史中找到并用好远处证据。必须保留的信息有 3 类。第一是证据距离,即从最早支撑证据到提问的跨度。第二是答案来源,即每题必须引用的轮次。第三是实验条件,包括历史用文本还是音频表示,以及题型与指标。

最终输出是 1 篇能复述方法的中文解读,数字与条件回到原文核对。资源状态方面,本次收到的官方页面数据集与演示链接状态均为可用,当前可用,已公开,地址为论文给出的基准主页。

语音对话与长上下文评测此前走到了哪里?

语音对话路线先经过级联系统,即先用语音识别转写,再做意图识别与对话状态跟踪。原文指出这类系统难以完整保留语调情感与重音等声学信息。

随后出现把原始音频直接接入对话框架的端到端大音频语言模型,目的是利用转写流水线容易丢失的细微声学信号。另一条路线是长上下文建模,文本领域已有扩大窗口的工作,但原文强调名义窗口大不等于全程可用。

评测路线上,文本已有覆盖多任务与可变长度的基准,音频已有尝试突破编码器时长限制的工作。原文指出它们主要解决能输入多长,缺少按所需上下文长度分档的系统分析。Vox-Infinity 的位置就是补上语音领域按证据距离组织的长度敏感评测。

为什么语音的长上下文是另一个问题?

论文把困难归因于语音是低压缩模态。原文给出每秒需要一定数量嵌入来编码,等价语义的语音序列远长于文本。这意味着同样对话内容在语音下有效上下文更长。原文明确指出口语内容通常每秒需要 12 至 25 个嵌入来编码,导致输入序列远长于文本,这直接抬高了语音任务的有效上下文长度,也加剧了长上下文建模的难度。

遗忘显著信息的风险也更大。举一个例子,它只是教学例子,不代表论文数值:假设用户在很早轮次报了电话号码,中间又聊了订票与餐馆,最后问请重复号码。

模型需要在几十轮之后精确恢复一串数字。文本历史可以用紧凑转写保留这串数字,音频历史则要在很长声学序列中定位同一段发音。论文要测的正是这种随证据变远而下降的能力。已有文本与视觉领域的长上下文研究表明,模型表现会随证据位置明显变化,而语音领域尚缺少按所需上下文长度分档的系统评测,这正是后文构造分箱评测的动机。

Vox-Infinity 用哪三个场景拉长历史?

Vox-Infinity 沿两个轴拉长音频历史,一是对话轮数,二是每轮时长。它用 3 个互补场景覆盖不同交互结构与语义复杂度。

第一个场景是超多轮对话,超过 20 轮,基于真实人声录制的任务型对话构建。问题要求从密集长轮历史中细粒度检索。第二个场景是个人独白,单说话人超过 2 分钟,基于带时间戳标注重建的长独白。

问题要求对分布在全文的证据做多跳推理。第 3 个场景是超语义对话,基于带细粒度情绪标注的多轮对话构建。问题要求在长历史中保持并检索由声音表达的情绪。3 个场景分别对应细粒度检索、多跳推理与副语言记忆。

证据距离与答案来源如何让评测可核对?

论文的核心测量工具是所需历史时长与答案溯源标注。所需历史时长不是会话总时长,而是最早证据到提问的跨度。这样才能回答证据离提问有多远。原文将其定义为从最早支撑证据到提问的时间跨度,与总会话时长作出明确区分,从而刻画回答问题真正需要的历史量。

答案溯源标注记录了解题必须引用的轮次,人工还要核对这些轮次确实提供了支撑证据。原文要求逐对核对标注轮次是否提供了回答所需的支撑证据,不合格则重新生成再验,这保证了距离计算建立在可核查的来源之上。

所需历史时长 × 会话总时长: 所需历史时长分工是度量解题真正依赖的证据距离,定义为从最早支撑证据到提问的时间跨度;会话总时长分工只是描述录音有多长。搭配理由是总时长长不等于题目难,只有按所需历史时长分组才能比较远近证据。组合意义是让评测按证据距离分箱,暴露遗忘远证据的问题。

答案溯源标注 × 多轮对话历史: 答案溯源标注分工是记录回答必须引用的轮号与位置,保证每题可复核;多轮对话历史分工是提供连续语音上下文。搭配理由是只有知道答案来自哪一轮,才能算出所需历史时长。组合意义是把模糊的长上下文变成可按距离切分的长度敏感评测。

文本历史 × 音频历史: 文本历史分工是用转写保留紧凑词汇语义,减轻长序列负担;音频历史分工是保留语调节奏强度等副语言线索。搭配理由是二者各有所失,文本丢韵律而音频序列更长更难检索。组合意义是在同一题目上对比两种历史,诊断模型是丢了词还是丢了情绪。

自然样本 × 语义受控合成样本: 自然样本分工是保留原始录音中词汇与声音共同表达的情绪;语义受控合成样本分工是用中性文本合成指定情绪,切断词汇捷径。搭配理由是自然样本上文本历史也可能靠词猜对情绪,无法证明听懂声音。组合意义是只在受控组内比较模态差距,才能分离声学情绪识别与语义推断。

开放式问答 × 选择题问答: 开放式问答分工是检验从密集轮次中精确恢复电话号码与车次等槽值;选择题问答分工是检验在长历史中保持并选出情绪标签。搭配理由是不同子集证据形态不同,需要不同判定方式。组合意义是让细粒度检索多跳推理与副语言记忆分别被可判定题型覆盖。

沿一个样本走一遍更清楚。输入是一段几十轮的语音历史与一个提问。表示层把历史变成文本转写或音频序列。组件层根据溯源标注找到最早证据轮,计算其到提问的时间跨度。执行顺序是先确定来源轮次,再计算时间跨度,最后按跨度分箱统计分箱准确率。

目标层按该跨度把样本放入不同时长箱,输出是分箱准确率。只有先有来源,才能算出距离。只有先有距离,才能讨论近因效应。这种先溯源后分箱的顺序,使远近比较建立在同一题集与同一表示条件的可比基础上。

没有模型训练时,三阶段构造做了什么计算?

本研究没有训练新的语音语言模型,训练节应理解为基准构造流程。真实计算是 3 阶段的数据生成、问答生成与人工核验。

第一阶段生成长语音对话。超多轮对话取自任务型对话录音,个人独白按时间戳把短片段重建成原始长独白。超语义对话先用语音分离模型分离目标说话人并关联每轮情绪标注。

再对中性轮用语音合成模型以不同情绪风格合成相同文本,并只保留两个外部模型都识别为目标情绪的合成轮。第二阶段用大语言模型基于全对话生成多对问答,并要求给出回答必须引用的轮次。

第 3 阶段人工逐对检查答案正确性与唯一性,并核对溯源标注是否真正支撑答案。不合格则重新生成再验。下图是问答生成的提示模板像素,值得按观察动作细读,它规定了输入格式与来源字段,是复现构造的关键依据。

看图路径: 1. 先看任务要求如何限定答案要短而唯一并附来源音频;2. 再看上下文长度控制如何要求问题从近到远依次前移;3. 最后对照输出格式中问题答案与来源字段的对应关系

原论文 Figure 5:Prompt template for QA generation.

论文图 5。原论文 Figure 5::“Prompt template for QA generation.”。

从像素可见,该模板要求把转写重建成对话并收集信息,问题要与音频内容相关。答案要短而清晰,问题要考察推理与信息抽取而非简单复述。模板还要求不直接提及转写,答案取对话最终解决的信息而非中间状态。每题有单一明确答案,并附来源音频。长度控制要求第一题来自最近阶段,之后依次前移。复现时应先照此实现来源前移的采样逻辑,再做人工核验。

测什么、与谁比、条件是否一致?

实验要回答 3 个问题。第一,准确率是否随所需历史时长变长而下降。第二,文本历史与音频历史谁更适合哪类证据。第三,用于判分的模型评测是否可靠。比较按所需历史时长分箱展开,超多轮主要在 4 分钟以下,个人独白多在 8 分钟以上,超语义覆盖全部时长档,从而观察远处证据是否更难利用。

比较对象是 7 个代表性语音语言模型,包括 Qwen3-Omni、GLM-4-Voice、AudioFlamingo3、AudioFlamingo Next、MiMo-Audio,以及闭源的 Gemini-3.1-Pro 与 Qwen3.5-Plus。每个模型都在两种历史表示下评测。公平比较的关键是同一模型在文本与音频两种历史表示下分别评测,文本历史用开源转写模型得到,最大上下文窗口统一为 32768 个标识,保证输入预算一致。

文本历史用开源转写模型得到,最大上下文窗口统一为 32768 个标识。指标是准确率,即答对样本占全部样本的比例。由于输出多样,论文用 GPT-4o 判分,标签为正确、错误与未知。未知标签允许判分模型在模糊情况下不作强制二选一,避免误判。

题型条件是超语义用选择题,超多轮与个人独白用开放式问答。分组条件是按所需历史时长分箱,超多轮主要在 4 分钟以下,个人独白多在 8 分钟以上。成本与硬件预算原文未报告具体数值,这是复现时需要补记的缺项,复现应先固定转写、分箱与判分三件套,再比较不同模型的分箱准确率。

文本历史下超多轮检索能保持多准?

要比较的第一问是细粒度语义证据能否被文本历史保持。公平条件是同一模型、同一题目集合、同一所需历史时长分箱,只看文本历史表示。指标方向是准确率越高越好。原文强调超多轮问题常需从密集交错轮次中恢复电话号码与车次等精确槽值,这正是检验紧凑转写能否保留词面证据的直接场景。

下表直接选用原文结果表的文本历史部分,覆盖超多轮三档时长箱与平均值,保留全部 7 个可运行模型作基线对照。

Text-as-historyText-as-historyText-as-historyText-as-historyText-as-history
Qwen3-Omni85.584.277.084.8
GLM-4-Voice61.456.348.359.4
AudioFlamingo345.640.723.043.4
AudioFlamingo Next76.173.267.074.9
MiMo-Audio76.178.170.976.6
†Gemini-3.1-Pro80.377.666.179.0
†Qwen3.5-Plus82.279.771.381.1

表后解释主要收益与具体代价。文本历史在该子集整体较高,头部模型平均在 80% 左右,说明紧凑转写有助于保留电话号码与车次等精确槽值。原文报告在该子集上文本历史对每个被评模型都优于音频历史,平均准确率分别为 71.3% 与 42.6%,表明当前语音语言模型难以从长音频历史中保留并恢复精确词面证据。代价是这种优势只适用于词面可转写的证据,不能推广到情绪。未胜出项是部分模型文本平均也只有 40% 左右,说明长轮次下的检索仍有差距。该表只看超多轮,不能代表独白推理与情绪记忆,后续还需按同一分箱逻辑对比独白与超语义的表现。

音频历史下远证据是否更难用?

要比较的第二问是换成音频历史后,远证据是否更难用。公平条件是同一模型与同一分箱逻辑,只换历史表示为音频,指标方向仍是准确率越高越好。题型在超语义部分为选择题。

下图与下表共同回答该问题。先看音频历史下按 30 秒分箱的细粒度准确率像素,左为超多轮,右为超语义,细线是各模型,粗灰线是均值,样本过少的区间已被省略。

看图路径: 1. 先确认横轴是所需历史时长而非会话总时长;2. 再对比细线各模型与粗灰色均值线的总体走向;3. 最后观察长距离区间样本不足被省略后的波动含义

原论文 Figure 3:Fine-grained accuracy under audio history across 30-second required-context-duration intervals on…

论文图 3。原论文 Figure 3::“Fine-grained accuracy under audio history across 30-second required-context-duration intervals on (a) Ultra Multi-Turn and (b) Beyond-Semantic Dialogues.”。

从像素可见,左图超多轮的均值线在 5 分钟内总体在中段波动而非严格单调,右图超语义的均值线在 3 分钟后明显下探,8 分钟附近更低。个别模型在近端较高,低端模型全程偏低,但均值走向支持远证据更难。像素不能精确读出每点数值,复述时只讲总体走向。

再看原文结果表的音频历史部分,覆盖超语义四档时长箱与平均值,保留全部 7 个可运行模型。

Audio-as-historyAudio-as-historyAudio-as-historyAudio-as-historyAudio-as-historyAudio-as-history
Qwen3-Omni56.653.149.432.153.2
GLM-4-Voice24.123.219.28.922.3
AudioFlamingo326.626.823.012.525.5
AudioFlamingo Next50.946.742.220.046.7
MiMo-Audio42.738.437.621.440.3
†Gemini-3.1-Pro62.757.751.031.957.5
†Qwen3.5-Plus60.857.855.339.358.1

表后解释主要收益与具体代价。收益是音频历史保留了文本没有的韵律线索,多数模型在此优于其文本历史。代价是 8 分钟以上箱普遍大幅下跌,说明长距离情绪记忆衰减更大。反例是部分模型音频平均仍偏低,说明长音频检索本身也是短板。限制是该表只看超语义,不能代表精确槽值检索。

数据集规模与时长分布是否可核对?

要核对的第一个细节是数据量与分布条件。问题是下载是否完整,分箱是否有足够样本。公平条件是按论文报告的会话数、问答数、总时长与平均时长核对。指标方向是数量一致即通过。

下表整理全文连续原句中实际出现的规模数字,条件写在首列,数值保留原文精度与单位,不引入原表裸值的额外单位。

条件会话数问答数总时长与平均时长平均轮数
全部三子集147413516127.96 小时,平均 312.5 秒36.38 轮见原文表
超语义子集3245380平均 311.4 秒平均 55.23 轮

表后解释主要收益与具体代价。收益是总问答数过万且按所需历史时长分箱,支持长度敏感分析。代价是超多轮集中在 4 分钟以下,个人独白多在 8 分钟以上,不同子集的距离覆盖并不均匀。未评测边界是更长会议级录音不在此分布内。复现时应先核对三子集划分,再检查各时长箱样本数。

切断词汇捷径后音频优势是否更清楚?

要验证的第二个细节是声学情绪与语义推断的分离。问题是模型是否真听懂声音,而非靠词猜情绪。公平条件是在自然组与语义受控组内分别比较文本与音频历史。指标方向仍是准确率越高越好。

论文报告,自然组文本与音频的模型平均几乎相同,7 模型中 5 个音频更好但差距小。受控组音频对 7 模型中 6 个更好,模型平均从文本约两成提高到音频约 30%,提高约 6.6 个百分点。论文提醒受控组含合成语音,不直接跨组比较绝对准确率。

下表整理编码代价与评测可靠性的可核对条件,数值来自全文连续原句,不复用原表裸值,避免为凑宽度混放不同指标。

条件编码代价上下文窗口抽样复核一致性
全文原句每秒 12 到 25 嵌入32768 标识300 条中 297 条一致99.0% 一致
适用阶段输入表示评测管线人工验证判分可靠

表后补充判断与限制。支持的判断是切断词汇线索后,音频历史的优势更清楚,说明部分自然样本的情绪可被文本捷径解决。限制是合成语音的声学分布与自然不同,不能把受控组的绝对值当成自然性能。未评测边界是重音与强调等其他副语言现象仍未覆盖。

哪些结论不能推广,缺了哪些证据?

论文直接报告的是分箱准确率下降与模态互补,有限解释是对个别模型例外的表示原因。未验证推测是更大窗口必然解决远证据问题。

缺失证据不是技术错误,但复述时要用可能与待验证表达。第一,总体趋势不等于每组每步都成立,30 秒曲线有局部波动。第二,文本与音频的比较受转写质量、窗口截断与题型影响。

原文统一窗口但未报告不同截断策略与转写错误的消融。第三,训练资源、推理开销、输出帧率与实际延迟未分别讨论。第四,语音语料可能继承社会文化与性别偏差,论文声明已匿名化并仅用于研究,但未提供偏差度量。

要复现,先做什么,需要哪些超参数与信息条件?

复现先做三件事。先按论文主页获取数据与演示,确认可用性与版本。因为论文写明部分数据先在演示页公开,全量待接受后发布,本次核验为当前可用。

再实现评测管线,历史分文本与音频两路,文本用同一转写模型,窗口设为 32768。判分用同一提示模板区分正确、错误与未知,超语义为选择题模板,另两子集为开放问答。

最后复现分箱逻辑,关键超参数是按所需历史时长分 0 到 2、2 到 4、4 到 8、8 分钟以上。细粒度分析按 30 秒分箱并省略少于 20 例的区间。信息条件必须保留每题最早证据位置,否则无法算出所需历史时长。

代码开源、权重下载与系统可运行要区分,论文承诺评测工具随接受发布。复现时应记录实际拿到的代码版本,并补记硬件与转写错误的影响。

何时值得尝试这个基准,还需补哪项验证?

当研究问题是语音模型能否记住远处说过的话,尤其是精确槽值与远处情绪时,值得用 Vox-Infinity 按距离分箱检验,而不是只看总准确率。

如果模型主打音频压缩或长窗,应重点看超多轮音频历史的 2 到 8 分钟箱是否缩小与文本的差距。如果模型主打韵律理解,应重点看语义受控组的组内音频减文本差距,而非跨组绝对值。

还需补的验证包括转写错误对文本历史优势的影响、不同窗口与截断下的分箱曲线,以及更多模型上的人工一致性。常见误解是把会话总时长当成题目难度,论文特有的纠正是用所需历史时长度量证据距离。

另一个误解是把音频输入更长等同于信息更多,论文显示更长序列反而让精确检索更难。文本的紧凑性在语义任务上是优势,在情绪任务上是信息丢失。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-22 语音/音乐/音频论文速递