英文题目:UG-Bench: A Comprehensive Benchmark for Evaluating Large Audio-Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:zhou26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #基准设计 #音频大模型 #音频理解
评分:5.8/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghua Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhang Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Enzhi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大音频语言模型(Large Audio-Language Models,LALMs)评测需同时覆盖语音、环境声与音乐的理解,以及转写、翻译、情感、字幕与语音合成,难点在于任务异构、提示模板不一与理解生成割裂。UG-Bench提出四阶段解耦评测流水线:输入标准化模块统一提示,模型接口模块调度11个LALMs与5个专用合成模型,输出统一模块规范自由格式生成,任务评测模块按语音感知、音频感知、语音生成与口语理解4类能力组织19个任务独立打分并加权排序。与仅测理解的Dynamic-SUPERB、偏重生成式理解的AIR-Bench和聚焦对话的SD-Eval相比,其差异在于模型实现与任务评测解耦并同时覆盖理解与生成。标准化提示输入模型接口产生中间结果,中间结果经输出统一为一致格式后进入任务评测,各任务按词错率、准确率、BLEU与平均意见分独立计分再按四类能力加权综合。任务评测按语音感知权重0.4、音频感知0.3、语音生成0.2与口语理解0.1先算子排名再算总分,便于新增模型与任务而不改上游组件。在语音感知任务评测下,Qwen2-Audio的WER为8.10,低于Salmonn的WER 31.67。该结论仅适用于所选开源模型官方checkpoint零样本不微调设置,中文星标数据不计入排名,槽填充因过难被舍弃,原文未披露训练与推理成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么只看识别对错不够?
这篇解读的输入是论文原文提供的任务定义、框架描述、数据集清单、评价指标、模型名单与结果表格,目标是让刚进入语音与音频方向的研究生复述 UG-Bench 测了什么、怎么测、在什么条件下得到什么结论。保留的信息包括 4 个能力的划分、19 个任务与 36 个数据集的规模、153485 个测试样本的量级、11 个大音频语言模型加 5 个专用生成模型的参评范围,以及加权排名的权重设置。输出是一套可核对的学习笔记,聚焦模型表现的具体条件与口径。
初学者常把语音任务理解成把声音转成文字。论文采用更宽的视角。大音频语言模型就是在文本大语言模型基础上,听懂语音、音频、音乐,并用文字回答或直接开口说话的模型,英文是 Large Audio-Language Models,简称 LALMs。它覆盖理解与生成 2 个方向。理解包括听清说了什么、识别情绪、翻成另一种语言、描述一段声音、认出乐器与风格。
生成则是把文字读成自然语音。2 个方向一起测,才能看到完整的能力图谱。
已有评测多为单项设置,有的测识别,有的测生成,提示格式、输出格式、指标各有不同,跨模型比较时需要反复适配。论文报告多数开源大音频语言模型缺少语音生成支持,这让理解型榜单难以反映生成差距。UG-Bench 的动机就是提供统一可扩展的框架,把理解与生成放在同一套流程里比较,同时支持以后加入新任务而保持模型接口稳定。
已有路线在测什么:同输入同目标下缺了哪一块?
在输入同为语音或音频、目标同为评价模型能力的条件下,论文回顾了几条已有路线。静态专用榜单路线用固定数据集测识别或情感等单项能力,特点是稳定,侧重单点深度,也为指令跟随评价留下扩展空间。动态指令路线以 Dynamic-SUPERB 为代表,强调多任务零样本指令执行,输入同样是语音,目标是通用语音模型的泛化。生成式理解路线以 AIR-Bench 为代表,覆盖语音、自然音频与音乐,用生成式方式评价大音频语言模型。对话路线以 SD-Eval 为代表,加入副语言与环境信息,评价口语对话的理解与生成。
论文认为这些工作需要一个同时覆盖理解与生成的统一框架。也就是说,同是测听懂,同是测说出,需要一个地方用同一批模型、同一套接口把 4 类能力都走完。前人工作提供了各自口径下的扎实测量,UG-Bench 的定位是补上统一接口与统一汇总,把不同提示、不同后处理、不同数据划分放在一致流程里对照,而不是再做一个只测单项的数据集。
要回答的具体问题是什么?
论文要回答的问题可以拆成三句可检验的话。第一,在同一套输入标准化与输出统一规则下,当前开源大音频语言模型在语音感知、音频感知、语音生成、口语理解 4 个能力上各自排在什么位置。第二,理解能力强的模型生成能力如何,生成质量与专用语音合成模型相比处于什么水平。第三,模型在指令跟随、幻觉、过拟合与语义理解上呈现哪些可复现的现象。
这里的学习依赖是先分清感知与理解。感知回答听到了什么声音与文字,理解回答这段语音要求系统完成什么任务。以意图分类为例,输入是一段命令语音,输出是意图标签。论文报告槽位填充对当前模型过于困难,因此只呈现意图分类结果。这个取舍标出了问题边界,也点出口语理解仍有提升空间。
方法全景:一个样本如何走完评测流水线?
UG-Bench 的全景是 4 个模块串成一条流水线。先看一个样本的旅程。假设输入是一段英文朗读加一条指令,请转写内容。输入标准化模块先决定提示词,模型有专用模板就用专用模板,否则用默认提示,保证评价条件一致。模型接口模块调用被测模型,输入可以是语音、文本或音频信号,产生中间结果。
输出统一模块把各家输出整理成同一格式,实现模型选择与任务评价解耦。任务评价模块再按任务算指标,例如识别算词错率,翻译算 BLEU,分类算准确率。
这种安排的理由在原文写得很直接,各模型支持的功能与提示机制差异很大,统一提示策略在照顾各自特点的同时减少不一致。解耦的好处是加新模型只需实现接口,加新任务只需定义评价,上游流程保持稳定。
大音频语言模型 × 解耦评估框架: 大音频语言模型负责把语音、音频、文本输入变成文本或语音输出,解耦评估框架负责把模型实现与任务评测分开,前者提供统一输入输出接口,后者独立定义指标与数据,二者搭配的理由是模型种类多而提示格式各异,组合后新增的作用是换模型不用改任务、加任务不用改模型。
从规模看,论文报告评价覆盖 19 个任务、36 个数据集,共处理 153485 个测试样本。这个数字说明结果来自大样本下的相对排序,适合做跨模型对照。阅读时还要记住另一条公平条件,中文相关数据集在最终排名中排除在外,后文实验条件会交代。
四个能力各测什么:任务与数据如何对应?
4 个能力是理解全文的骨架。语音感知对应自动语音识别、英文与中文多数据集、语音情感识别、语音到文本翻译。音频感知对应音频描述、声音分类、音乐描述、乐器分类、音乐风格分类。语音生成对应文本到语音合成。口语理解对应意图分类。每个能力再细分成具体任务,便于多维度分析。
数据清单显示英文仍是主体。自动语音识别用了 SpeechOcean-762、Librispeech 干净集与其他集、Common Voice 等,中文用了儿童普通话、方言与自有老年普通话数据。翻译是英到德与英到中。情感用了 IEMOCAP 与 MSP-IMPROV。音频描述用 Clotho,声音分类用 VocalSound 与 NonSpeech7k,音乐用 MusicCap、Nsynth 与 GTZAN。
合成用 Librispeech 干净集中的片段,意图分类用 Fluent Speech Commands。初学者复述时要能说出每个能力至少一个代表数据集,把能力名称与数据实例对应起来。
语音感知 × 音频感知: 语音感知分工是识别语音中的语言内容与说话人状态,包括识别、翻译与情感,音频感知分工是理解非语音声音与音乐,包括声音分类、音乐分类与描述,二者搭配的理由是真实音频既含人声又含环境声,组合后可以区分模型是擅长听懂话还是擅长听懂声音场景。
论文特别提醒,多数开源大音频语言模型主要支持英文语音输入,只有 Qwen-Audio、Qwen2-Audio 与 SenseVoice 支持中文语音输入,因此标注星号的中文数据集结果计入排名之外。这是关键的公平条件,读结果时要把中文表现与总排名分开看。
语音生成 × 平均意见分: 语音生成分工是把文本变成自然语音,平均意见分分工是由母语听者对自然度打分,二者搭配的理由是字错率只能反映内容对错而不能反映好听程度,组合后新增的作用是用人工听感补齐自动指标的盲区。
口语理解 × 意图分类: 口语理解分工是把语音信号映射到语义动作,意图分类是其中最基础的子任务,要求判断一句话想执行什么命令,二者搭配的理由是识别对文字不等于理解要干什么,组合后可以检验模型是否把声学识别结果真正转成可执行的语义。
输出统一与排名计算:不同指标如何合成一分?
输出统一解决的是格式不一致。论文举例说音乐风格分类要求把测试音频归入指定类别并按指定格式输出,当前大音频语言模型指令跟随偏弱,输出格式多样,需要后处理。这说明自动指标之前还有一步格式归一化,复现时要保留同一套后处理,才能对照分数。
排名计算分 3 步。第一步算子排名,把一个模型在同一能力内各任务的排名平均。第二步算加权总分,语音感知权重 0.4,音频感知 0.3,语音生成 0.2,口语理解 0.1,再按模型数归一化放大到 100 分制。第 3 步按总分降序得最终排名。权重是启发式给出的,依据是任务数与数据量。理解这一点很重要,总分第一反映加权后的相对位置,适合整体对照。
下表把规模与权重放在一起,帮助核对复述时的数字口径。表前的问题是,UG-Bench 的体量与汇总规则如何支撑跨能力比较,公平条件是中文星标数据放在排名之外,指标方向是子排名越小越好、总分越大越好。
| 评价维度 | 规模或权重 | 覆盖内容 | 指标方向 | 备注 |
|---|---|---|---|---|
| 任务与数据总量 | 19 个任务,36 个数据集 | 语音、音频、音乐、合成、理解 | 样本越多越稳 | 共处理 153485 个测试样本 |
| 语音感知权重 | 0.4 | 识别、情感、翻译 | 子排名越小越好 | 权重最大 |
| 音频感知权重 | 0.3 | 描述、分类、音乐 | 子排名越小越好 | 权重次之 |
| 语音生成权重 | 0.2 | 文本到语音 | 平均意见分越大越好 | 专用模型参与比较 |
| 口语理解权重 | 0.1 | 意图分类 | 准确率越大越好 | 槽位填充未纳入 |
表后需要说明收益与代价。收益是大样本加统一接口带来更可重复的跨模型比较,权重把不同量纲的指标转成可比的相对位置。代价是权重属于启发式选择,调整权重会带动排名变化,而且语音生成只占 0.2,理解强但缺少生成支持的模型依然有机会总分靠前。结合语音生成能力缺失的模型排名位置看总榜,就能更准确地把握总分的适用边界。
本研究训练了什么:无训练时真实计算是什么?
本研究没有训练任何新模型,这一点先说清。训练节在此承担构造与推理流程的说明,聚焦参数更新之外的评价链路。论文评价 11 个开源大音频语言模型与 5 个专用语音生成模型,全部使用官方实现与检查点,保持不微调。真实计算是推理加评测,包括按统一提示调用模型、收集输出、统一格式、按任务算指标、再算子排名与加权总分。
因此梯度路径的讨论放在一旁,重点是推理链路的可复现性。论文给出提示使用原则,有专用模板就用专用模板,否则用默认提示。自回归采样、后处理与人工打分都会带来输出变化,复述时把模型名称与内部实现分开,把检查点版本与输出稳定性分开。
子排名 × 加权总分: 子排名分工是先在每个能力内部对模型按任务平均排序,加权总分分工是再按语音感知、音频感知、语音生成、口语理解的重要性合并,二者搭配的理由是各任务指标量纲不同无法直接平均,组合后新增的作用是既保留能力内相对位置又体现作者对任务量与数据量的判断。
复现时要做的是跑通推理。包括准备 36 个数据集的测试划分、实现 4 个模块的接口、固定提示与后处理、复算词错率、字符错率、准确率、BLEU、描述平均分与平均意见分。论文未给出完整超参数表,原因是本研究聚焦推理评价,关键可复现条件是官方检查点、不微调、单卡推理。
实验条件:测了谁、用什么指标、在什么硬件上?
被测对象分两组。大音频语言模型组有 Qwen-Audio、Qwen2-Audio、BLSP、Speech-GPT、Salmonn、AnyGPT、LTU、SenseVoice、WavLLM、Audio-Flamingo、PandaGPT,共 11 个。专用语音生成组有 MaskGCT、F5TTS、CosyVoice、Bark、ChatTTS,共 5 个,用于提供生成能力的上限参照。所有实验在一块英伟达 H100 上完成,模型均用官方实现与检查点且不微调。资源状态方面,本次收到的证据中未包含完成验证的代码与数据链接,复述时只列模型名单与流程,围绕论文文字展开。
指标按任务固定。自动语音识别英文用词错率,中文用字错率,数值越低越好。语音情感识别、声音分类、乐器分类、风格分类、意图分类用准确率,数值越高越好。语音到文本翻译用 BLEU,数值越高越好。音频描述与音乐描述用 FENSE 与 SPIDEr 的平均值,数值越高越好。
文本到语音用词错率加平均意见分,其中平均意见分由 10 名英语母语者对每条合成语音打分,数值越高越好。初学者要记住自动指标与人工听感各有侧重,词错率与好听程度放在一起看才完整。
公平条件包括统一提示策略、统一输出格式、中文星标数据放在最终排名之外。论文还说明槽位填充难度很高,只报告意图分类,这意味着口语理解的结论适用于较简单的分类设定,完整语义解析需要后续工作继续拓展。
总体与语音感知结果:谁在前面,谁缺了哪块?
总体排名显示 Qwen2-Audio 总分 78.18 居首,Salmonn 以 62.73 居第二,WavLLM 以 57.27 居第三,其后是 Qwen-Audio、BLSP、LTU 等。论文报告 Qwen2-Audio 在语音感知与音频理解领先,但口语理解普通且缺乏语音生成能力。这个反例很关键,总分第一仍有明显短板,说明加权总分不能当成全能证明。另一个反例是只有 AnyGPT 与 SpeechGPT 展示了一定生成能力,但它们的理解排名靠后,且生成仍落后于专用模型。
语音感知细分显示 Qwen2-Audio 在识别词错率 8.10、情感准确率 66.14、翻译 BLEU 36.76 三项都排第一,总子排名第 1。WavLLM 第二,Qwen-Audio 第三。SenseVoice 在识别与情感上不错,但因不支持翻译等能力而总子排名受限。Audio-Flamingo、PandaGPT、AnyGPT、Speech-GPT 在部分任务缺测或表现弱,排名靠后。论文把 BLSP 在情感与翻译上的弱势归因于其训练目标更偏向文本语义延续,但这属于有限解释,应用可能一词表述。
下表把总体层面的可比策略放在一起,便于核对谁与谁比、条件是否一致。表前的问题是,在统一接口与中文不计入排名的条件下,总分差异是否反映真实能力差,比较的公平条件是同一套提示与后处理,指标方向是总分越大越好、子排名越小越好。
| 比较对象 | 语音感知子排名 | 音频感知子排名 | 总分 | 最终排名 |
|---|---|---|---|---|
| Qwen2-Audio | 1 | 1 | 78.18 | 1 |
| Salmonn | 4 | 2 | 62.73 | 2 |
| WavLLM | 2 | 8 | 57.27 | 3 |
| Qwen-Audio | 3 | 4 | 55.45 | 4 |
| BLSP | 7 | 5 | 49.09 | 5 |
表后要讲收益与限制。收益是同一框架下可直接读出理解强弱的分层,Qwen2-Audio 在两大感知能力连续居首,支持其泛化较强的判断。代价是总分掩盖了生成缺失,Salmonn 与 WavLLM 的语音生成子排名同样靠后,而 AnyGPT 与 SpeechGPT 虽有生成但理解弱。未胜出项是 SenseVoice,它在单项识别与情感上不差,但因能力覆盖不全而总体第八,这说明榜单奖励的是全面覆盖而非单点峰值。
语音生成对比:专用模型为何仍然更受青睐?
在进入柱状图之前,需要明确比较问题与条件。问题是当前大音频语言模型的说话能力与专用合成模型差多少,公平条件是同一批文本、同一套平均意见分打分流程,指标方向是平均意见分越高表示自然度与音质越好。论文纳入 F5-TTS、MaskGCT、Bark、Chat TTS 与 CosyVoice 作为只做合成的上限参照,与支持生成的两个大音频语言模型同图比较。
看图路径: 1. 先从左向右读横轴七个模型名称,区分前五个专用合成模型与后两个大音频语言模型;2. 再看纵轴平均意见分从 0 到 5 的高度,比较最左侧两根柱子与最右侧两根柱子的落差;3. 注意中间 F5-TTS 与 Chat TTS 的相对位置,确认专用模型内部也有高低之分;4. 最后回到正文表述,核对大音频语言模型普遍低于专用模型的判断是否与柱高一致
论文图 2。原论文 Figure 1:“MOS Comparison: 5 Expert Speech Synthesis Models vs. 2 Large Audio-Language Models”。
这张图显示专用合成模型的柱子普遍高于大音频语言模型。靠左的 CosyVoice 与 MaskGCT 最高,其后 F5-TTS 与 Chat TTS 次之,Bark 居中,而右侧的 SpeechGPT 与 Anygpt 明显更矮。论文报告的判断是大音频语言模型普遍得分低于专用模型,差距反映了当前大音频语言模型在生成上的不足,专用模型仍是高质量合成的首选。解释时要注意,这不是说大音频语言模型完全不会说话,而是自然度与音质仍有距离,未来工作可能需要加强对生成任务的支持与优化。像素不能精确读出的具体小数不必硬写,趋势已足以支撑上述判断,且不应把 1 次平均意见分推广为所有文本与说话人条件下的全程结论。
结合总体表看,生成权重只占 0.2 会弱化这一差距。总分靠前的模型恰恰多是缺乏生成能力的模型,而有生成能力的 2 个模型总分排在第十与第十一。这是一个重要的适用条件,如果应用目标是开口说话,就不能只看总榜,而要单独看生成图。
口语理解对比:意图分类为何如此不均衡?
口语理解的比较问题是模型能否从语音直接得到可执行的意图,公平条件是同一 Fluent Speech Commands 测试集与同一准确率指标,指标方向是越高越好。论文报告 BLSP 明显超过所有其他模型,包括第 2 名的 WavLLM,而 LTU、PandaGPT、Qwen-Audio、Audio-Flamingo 明显更低,Audio-Flamingo 甚至接近零分。槽位填充因过于困难而未纳入,只呈现意图分类。
看图路径: 1. 先沿横轴从 BLSP 到 Audio-Flamingo 确认八个模型的排列顺序;2. 再看纵轴意图分类准确率从 0 到 50 的刻度,比较第一根与第二根柱子的差距;3. 观察从 Qwen2-Audio 向右柱高快速下降的趋势,确认语义理解能力的不均衡;4. 注意最右侧 Audio-Flamingo 柱子几乎贴近零线,对应正文报告的接近失效现象
论文图 1。原论文 Figure 2:“Accuracy of intent classification”。
这张意图分类柱状图呈现出陡峭的不均衡。最左侧 BLSP 最高,接近 50 的高度,第 2 名 WavLLM 约 30 出头,第 3 名 Qwen2-Audio 约 15 上下,其后 Salmonn、LTU、PandaGPT、Qwen-Audio 依次递减,最右侧 Audio-Flamingo 几乎看不到柱子,对应正文报告的 0.08 分,提示基本失效。论文把 BLSP 的优势解释为训练目标强调音频与文本模态延续的一致性,但这仍是有限解释,应用支持一词。教学上要强调,识别率高不等于理解好,Qwen2-Audio 感知虽强,意图分类只排第三,这正是论文强调语义理解亟待加强的证据。同样不能把单次意图分类结果推广为所有口语理解任务的结论,槽位填充的缺席本身就是未评测边界。
反证与失败条件:指令、幻觉与过拟合说了什么?
论文没有传统意义上的消融,即没有逐个拿掉某个模块看分数变化,但提供了 3 类失败条件的观察,可当作反证来读。第一是指令跟随弱。音乐风格分类要求归入指定类别并按指定格式输出,但模型输出格式不一致,需要后处理。这说明与文本大语言模型相比,当前大音频语言模型的格式约束能力更差,评测分数中混入了后处理的影响。
第二是幻觉。自回归模型常见的重复与编造在大音频语言模型中同样出现,例如识别任务中在句尾生成重复字符或无关文本。这意味着词错率升高不一定全是听错,也可能是生成端失控,改进时要区分声学错误与解码错误。
第三是过拟合迹象。一些模型在 Librispeech 等主流集上好,但在其他集上明显下降。这提示榜单上的平均数可能掩盖了跨数据集的脆弱性,复现时应分数据集报告,而不是只看平均词错率。论文还报告大音频语言模型在某些任务上接近甚至超过专用模型,但在合成等多项上仍落后,这进一步说明通用泛化与专用峰值是两回事,不能用一句话概括谁全面胜出。
边界与缺项:哪些结论不能下?
先说论文直接报告的边界。中文星标数据不计入最终排名,因此总榜主要反映英文与非语音音频能力,不能用来断言中文能力高低。口语理解只报告意图分类,未报告槽位填充,因此不能说模型具备完整语义解析能力。语音生成只用词错率与平均意见分,且听音者是 10 名英语母语者,因此结论只适用于所测英文合成条件,不能推广到多语种与多风格。
再说未验证的推测。论文对 BLSP 好坏的归因、对过拟合的判断都属于有限解释,应用可能或待验证表述。相关性不是因果,训练目标与分数高低同时出现,不等于证明了因果链。缺失证据不是技术错误,例如未测量延迟、成本、误判率,就不能承诺这些量得到改善。训练资源只报告单卡 H100 推理,未报告各模型训练开销,因此不能比较训练效率。总体趋势不等于每组都成立,某一能力第一不等于其下每个数据集都第一。
复现先做什么:按什么顺序搭起这套评测?
复现的第一步是按论文清单备齐数据与模型。数据侧准备 19 个任务对应的 36 个数据集,注意区分英文主体与中文星标,星标结果单独记录但不计入总分。模型侧下载 11 个大音频语言模型与 5 个专用生成模型的官方检查点,不做微调,只做推理。不要一开始就调提示,先跑通 4 个模块的最小闭环。
第二步固定输入标准化与输出统一。记录每个模型是否用了专用模板,默认提示写成什么,后处理如何把自由文本映射到类别标签或转写文本。这一步决定了分数是否可比,改动后处理必须重新报告。第 3 步按任务算指标,再算子排名与加权总分,权重取语音感知 0.4、音频感知 0.3、语音生成 0.2、口语理解 0.1,模型数按实际参评数归一化。第四步补两张关键图,一张是专用模型与大音频语言模型的平均意见分对比,一张是意图分类准确率对比,用于核对生成与理解的短板是否复现。
还需补的验证包括分数据集的识别与情感明细、不同提示下的稳定性、后处理 ablation,以及中文数据的单独分析。由于本次未确认代码与数据链接可达,复现应以论文文字与官方模型仓库为准,不假设一键脚本存在。
收束:何时值得尝试 UG-Bench 式评价?
当研究目标是同时要耳朵和嘴巴时,UG-Bench 式的评价值得尝试。具体说,如果新模型声称既能听懂语音与音频又能开口说话,就应在同一套接口下分别报告语音感知、音频感知、语音生成、口语理解,而不是只挑识别或只挑合成。若应用只做转写或只做合成,则用专用榜单更直接,不必背上四能力加权的包袱。
带走的 3 条可复述结论是,第一,解耦设计使模型与任务可独立扩展,这是方法上最值得借鉴的一点。第二,当前开源大音频语言模型呈现理解强、生成弱、语义理解不均衡的格局,总分第一仍缺生成,意图分类第一的 BLSP 在其他能力并非全面领先。第三,指令格式、幻觉与跨数据集稳定性是比单点分数更值得投入的方向。常见误解是把总分当成全能证书,纠正方法是同时出示生成对比图与意图分类图,明确短板位置,再谈是否适用于自己的任务。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

