📄 波形有用,不等于必须调用生成式音频模型
英文题目:Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation
一句话:论文把已知闭集任务的音频大模型评测重构为保留转录、调用本地编码器或调用生成式模型的受控决策,用匹配的无调用选择器做决定性消融,在 VocalSound 上以 12.5% 调用率取得 0.925 准确率却与 0.921 的无调用选择器无显著差异,揭示声学证据的价值与生成式调用的必要性是两回事。
标签:#音频分类 #音频大模型 #模型评估 #基准测试
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Mengzhe Geng:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
把音频大模型评测从笼统的音频优于文本准确率对比,拆解为可审计的调用决策问题,并用匹配的无调用选择器做严格对照,结论克制且对部署有现实警示。短板是核心证据高度依赖 VocalSound 单一已知闭集任务的小样本划分,外推性与统计功效均有限,且未提供代码与生成模型置信度等关键复现要素,提示词敏感性也让结论的稳定性打折。
📌 核心摘要
论文针对已知闭集任务中音频大模型评测混淆声学证据价值与生成式音频调用必要性的问题,提出生成式调用审计框架,将评测重构为在保留转录标签、使用本地编码器证据与调用生成式音频模型之间的受控决策。方法核心是构建转录优先与编码器优先的路由策略以及基于 L2 正则化逻辑回归的正确性全选择器,并以移除所有生成动作但保持相同训练与选择协议的匹配无调用选择器作为决定性消融。实验在 VocalSound 上显示转录基线仅 0.296 而有监督编码器已达 0.85 左右,全选择器以 12.5% 调用率取得 0.925 准确率,与无调用选择器的 0.921 几乎无差异,配对差异 0.004 且 95% 置信区间 [-0.025,0.033] 包含 0,经 Holm 校正后仅 Full 对 WavLM 的优势保持显著。该结果边界清晰:仅适用于已知闭集标签决策,不涉及开放对话、指令跟随或通用音频推理,且结论依赖开发集标签可用的有监督编码器对照与锁定的行划分。
🔗 开源与复现资源
- 代码:论文中未提及代码链接,文中仅说明 Prompts、parser code、model identifiers、frozen outputs 和 selector files 已保留用于复现,未提供具体仓库 URL
- 模型权重:论文中未提及权重下载链接,评估涉及的 Qwen2-Audio、Qwen2.5-Omni、MOSS-Audio、CLAP、AST 和 WavLM 均未给出 HuggingFace 或 ModelScope 链接
- 数据集:论文中未提供数据集下载链接或开源协议链接,涉及数据集包括 VocalSound 6 分类人声数据集、ESC-50 Animals 子集 200 条、AudioBench PQA 基于 ESD 的 5 情绪子集、Dynamic-SUPERB SpeechTextMatching LibriSpeech-TestClean 100 条,均未给出获取 URL
- Demo:论文中未提及
- 复现材料:论文中未提供公开检查点或训练配置链接,仅说明在 development rows 上固定 parser、label normalization、features、weights、thresholds 和 lambda,并在 holdout rows 上保持不变应用,同时保留 prompts、parser code、model identifiers、frozen outputs 和 selector files,以及 10k 次 row bootstrap、Wilson 区间、Holm 校正和 10 seed 诊断,未提供附录链接或配置文件 URL
- 论文中引用的开源项目:论文中提及 Qwen2-Audio、Qwen2.5-Omni、MOSS-Audio、CLAP、AST、WavLM、Whisper、SUPERB 和 Dynamic-SUPERB,均未在正文中提供对应 URL
🧭 深度解读
为什么“音频比文本准”不能直接证明波形必须进大模型?
想象一个六选一的任务:判断 1 段录音是笑、叹气、咳嗽、打喷嚏、清嗓还是吸鼻子。把音频丢给自动语音识别(Automatic Speech Recognition,ASR)转成文字,再让文本大模型猜,几乎必然失败——因为这些非语言发声在转录里往往只剩下一句含糊的描述或干脆丢失。这时任何能听波形的模型都会显得更准。
但“更准”到底证明了什么?它只证明波形里有文本没有的信息,并没有证明这份信息一定要通过一个会生成长文本、会做对话的音频大模型(Audio-LLM)才能用上。本地的一个轻量音频编码器,比如对比语言-音频预训练模型(Contrastive Language-Audio Pretraining,CLAP)或语音预训练模型 WavLM,也可能已经把咳嗽和笑分得很开。
这正是部署时会遇到的分叉:保留文本侧的答案、让本地编码器打分、还是把整段波形发给托管的生成式音频模型。最后一条路最贵,也最涉及隐私暴露。如果评测只对比“音频模型 vs 文本模型”,就会把“声学证据有用”和“生成式调用必要”混为一谈,让成本与风险的决策失去依据。
这篇工作在评测谱系的哪个位置?
语音评测长期有两条主线。一条是 SUPERB 及其动态扩展 Dynamic-SUPERB,关注可复用的语音表征和指令跟随任务的协作能力;另一条是近年涌现的音频语言基准,测生成式理解、助手行为、幻觉、多人对话等更开放的能力。这些工作大多在回答“模型能做什么”。
另一条相关脉络来自校准、选择性预测和大模型级联(cascade)。文本级联里常见的做法是:先让便宜的模型答,不确定时再路由给贵的模型,并用置信度或一致性来做门控。论文把这个思路搬到音频,但做了一个关键替换:第一级不再是文本,而是本地音频编码器。这样,生成式调用的对手不再是纯文本,而是已经看过波形的本地证据。
因此,这篇论文不争“谁更全能”,而是把一个已知的闭集端点任务固定住,追问在同样能看到开发集标签、同样能做选择策略的前提下,生成式音频调用还能带来多少边际增益。这是一种审计视角,而非能力榜单。
把评测重定义为“是否值得为这一行样本付费调用”
论文把任务形式化为对每一行样本做三选一:沿用转录侧文本大模型给出的标签、采用本地编码器的打分、或调用生成式音频模型。输入是波形 x_i 和对应的转录 y_i,输出是闭集标签集合 C 中的一类。核心不是训练一个更强的分类器,而是为每一行决定该走哪条路径,并把准确率和成本分开计量。
这个定义的好处是让对照变得可检验。过去的“音频 vs 文本”对比,改变的是信息源;现在的“全选择器 vs 无调用选择器”对比,改变的只有是否允许生成式动作,其余训练流程、特征、开发集协议完全一致。增益若存在,就只能归因于那次调用本身。
同时,论文主动收缩结论的适用范围:只讨论已知闭集的标签决策,不涉及开放对话、指令跟随或通用音频推理。也就是说,它不否认生成式音频模型在更复杂推理中的价值,只是在这个可审计的端点上划出一条清晰的调用边界。
三条路径如何在一套流水线里被统一调度
整体流水线可以理解为一条级联决策线。所有样本先经过转录侧得到文本标签,同时本地编码器对全部波形提取证据;路由策略再根据不确定性或裕度决定是否触发高成本的生成式调用;最终标签由被选中的动作产生。论文用两类路由加一个选择器来覆盖不同的调度哲学。
转录优先的路由把“文本答案是否可信”作为门控。路由分数定义为
\[s_{i}=\rho_{i}^{\mathrm{text}}+\alpha u_{i}+\beta q_{i}+\gamma v_{i},\]其中 rho_i^text 是在开发集上估计的转录标签风险,u_i 是归一化的 Whisper 不确定性,q_i 是归一化的文本大模型标签似然不确定性,v_i 是转录预测是否落在任务标签集之外的指示变量。权重 alpha、beta、gamma 与阈值 tau_b 只在开发行上优化,路由集合为 R_b = {i: s_i >= tau_b},预算 b 决定调用比例。最终预测为
\[\hat{c}_{i}=\begin{cases}\hat{c}^{\mathrm{gen}}_{i},&i\in\mathcal{R}_{b},\\ \hat{c}^{\mathrm{text}}_{i},&i\notin\mathcal{R}_{b},\end{cases}\]这条公式的职责很直观:把转录最不可靠的样本优先送往生成模型。
编码器优先的路由则反过来,让 CLAP 先对所有波形打分,只把低裕度样本送往生成模型,成本结构为 C_i^clap + r_i C_i^gen,每行必经 CLAP,仅被路由的样本承担生成耗时。转录优先路径的顺序执行成本则记为
\[C_{i}^{\mathrm{route}}=C_{i}^{\mathrm{asr}}+C_{i}^{\mathrm{text}}+h_{i}C_{i}^{\mathrm{conf}}+r_{i}C_{i}^{\mathrm{gen}},\]其中 h_i 标记可选的转录置信度打分,r_i 标记是否发生生成调用。把成本拆成可加的组件时间,才能在准确率之外谈“调用减少了多少”。
全选择器与无调用选择器:唯一变量是那次生成调用
路由策略仍是基于单一分数的阈值规则,全选择器则是更强的检验。它是一个在“行-动作”对上拟合的 L2 正则化逻辑回归正确性模型,输入是动作置信度、转录不确定性与长度、编码器标志、生成调用标志、动作成本与动作身份等特征。编码器在开发集上的预测采用跨折外预测(out-of-fold),避免用未来的标签泄漏来美化自己。正则化系数 lambda 在开发集准确率上选择,平局时偏向更少调用。
一个关键细节被论文显式保留:缓存输出中 Qwen2-Audio 与 Qwen2.5-Omni 没有暴露可比的 token 级置信度,因此它们的置信度特征是常数。这意味着全选择器在信息上并不占便宜——它无法靠生成模型的内部置信度来挑样本,只能靠已有的决策痕迹判断是否值得调用。这让“调用是否有用”的检验更苛刻,也更贴近现实中黑盒托管模型的处境。
决定性的对照是匹配的无调用选择器:训练与选择流程完全相同,只是把所有生成式音频动作从候选集中移除。诊断分支还加入一致性特征与基于动作独热预测的岭分类器堆叠融合,用于检验弱选择器是否能通过集成获益。所有解析器、标签归一化、特征、权重、阈值与 lambda 在评估留出集前即锁定,提示词与冻结输出被保留,度量检查器会从存储摘要重算 headline 数值,保证可核查性。

论文图 1。这张图来自原论文 Figure 1:,图示内容为“VocalSound row-holdout accuracy versus generative-call rate for representative policies.”。请结合“全选择器与无调用选择器:唯一变量是那次生成调用”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
没有端到端大模型训练,只有受控的选择器拟合与确定性路由
这篇工作没有训练新的音频大模型,也没有微调 Qwen2-Audio、Qwen2.5-Omni 或 MOSS-Audio。被复用的生成式模型以冻结输出的形式参与评测,真正的“学习”只发生在两处:路由权重与阈值的选择,以及选择器的拟合。
路由的 alpha、beta、gamma 和 tau_b 在开发行上通过枚举或网格搜索选优,目标是在给定调用预算下最大化开发集准确率。有监督的编码器探针——CLAP 分数探针、CLAP 嵌入探针、AST 嵌入探针、WavLM 探针以及 CLAP-WavLM 联合岭探针——则在开发行上有监督训练,作为部署对照的天花板。选择器本身是 L2 正则化的逻辑回归,优化目标是预测“该动作在该行是否正确”,训练数据是行与动作的笛卡尔积,标签是正确性而非类别本身。
因此,复现的关键不是 GPU 小时数,而是确定性:开发集与留出集的行划分在评估前锁定,CLAP 与 WavLM 的开发预测用跨折外预测产生,10 折种子诊断保持生成标签固定而只变化编码器折与选择器拟合。论文未披露优化器、学习率、batch size 等深度学习训练细节,因为这里不存在这类训练;也未披露硬件型号,成本以缓存的顺序执行组件时间计量,而非真实并发服务的延迟。
在什么数据、什么划分、用什么尺子量增益
主战场是 Dynamic-SUPERB 中的 VocalSound,6 类人类发声事件:笑、叹气、咳嗽、打喷嚏、吸鼻、清嗓,随机猜测准确率为 0.167。开发集为行 0-479,留出集为行 480-719,留出集 n=240,基于文件名推断的片段组、说话人与会话标识无重叠,被视为锁定的行留出。外部校验包括 ESC-50 的 Animals 子集、基于情感语音数据集(Emotional Speech Dataset,ESD)英文部分的 AudioBench 副语言问答五情绪子集,以及 Dynamic-SUPERB 的 SpeechTextMatching(STM)LibriSpeech-TestClean 子集。
指标方向很明确:准确率越高越好,生成调用率越低越好,总耗时与生成耗时越低越好。统计上,点区间用 Wilson 区间,配对差异用 10k 次行自助法(bootstrap)给出 95% 置信区间,显著性用 McNemar 精确检验,并对 8 个 headline 配对检验做 Holm 校正。成本按顺序执行的组件时间分别累加,避免把可并行的开销混在一起。
基线覆盖 4 层:转录基线、有监督编码器探针、单生成模型、路由与选择器。转录侧用 Whisper 加文本大模型;编码器侧为 CLAP、AST、WavLM;生成侧为 Qwen2-Audio、Qwen2.5-Omni、MOSS-Audio。论文未说明音频采样率、时长分布与预处理细节,也未公开提示词文本与解析代码的具体内容,这对复现构成限制。
根据论文正文与图中报告值整理,数据集与协议如下:
| 数据集 / 划分 | 任务与标签 | 样本量 | 划分方式 | 关键对照 |
|---|---|---|---|---|
| VocalSound 开发集 | 6 类发声事件分类 | 480 行 | 行 0-479,文件名推断无重叠 | 训练探针、拟合路由与选择器 |
| VocalSound 留出集 | 同上 | 240 行 | 行 480-719,锁定行留出 | 主评测,所有 headline 对比在此计算 |
| ESC-50 Animals | 动物声音分类子集 | 200 条 | 外部校验 | CLAP vs Qwen2-Audio vs 转录 |
| ESD 情感问答 | 5 情绪副语言问答 | 开发 90 / 留出 120 | 行不相交,新鲜子集 | Full vs No-call,堆叠融合 |
| STM LibriSpeech | 语音文本匹配 | 100 条 | LibriSpeech-TestClean | 转录 vs Qwen2-Audio,检验任务特异性 |
论文中的图 1 要回答的是“准确率随生成调用率如何变化”。横轴只计生成式音频模型的调用比例,便宜的转录与本地编码器处理不计入;纵轴是留出集准确率,主坐标轴裁剪到竞争区间,转录基线 0.296 被标注在面板上方。读者应看 3 条信息:全选择器是否在低调用率下达到最高点、无调用选择器是否紧贴其后、以及 CLAP→Omni 等路由曲线是否在 50% 调用附近仍未拉开显著差距。
先看天花板与地板。VocalSound 留出集上,纯文本基线仅 0.296,说明波形信息确实必要;但有监督的 WavLM 嵌入探针已达 0.854,CLAP 嵌入探针 0.850,联合岭探针 0.896,说明本地编码器在开发标签可用时已能逼近甚至超过单生成模型 Qwen2-Audio 的 0.838。零样本 CLAP 为 0.762,Qwen2.5-Omni 为 0.883,MOSS-Audio 为 0.808,AST 为 0.404,提供了不同家族的参考点。
路由与选择器的对比把“是否调用”推到台前。CLAP→Omni 路由以 50.8% 调用率取得 0.887,看似高于 WavLM 的 0.854,但配对差异 0.033 的 95% 区间为[-0.017,0.083] 且 McNemar p=0.268,未检出优势,区间同时兼容无增益与有用增益,结论只能是不确定。全选择器以 12.5% 调用率取得 0.925,匹配的无调用选择器为 0.921,配对差异仅 0.004,95% 区间[-0.025,0.033] 包含零,Holm 校正后 8 个 headline 检验中仅 Full 对 WavLM 的优势保持显著。一致性感知与堆叠融合在各自家族内相对无调用基线分别提升 0.042,但跨家族对比仍低于最强无调用选择器。
成本侧的校正同样重要。修正会计后,无调用选择器总耗时 11.3 秒,全选择器 16.9 秒其中生成耗时 5.6 秒,而 CLAP→Omni 需 30.5 秒其中生成耗时 21.7 秒。全选择器用更少的生成时间达到了与高调用路由相近的准确率,但仍未显著超越零调用。外部校验强化了任务特异性:ESC-50 上 CLAP 0.895 显著高于 Qwen2-Audio 0.785 与转录 0.140;ESD 新鲜子集上 Qwen2-Audio 0.425 与 WavLM 0.475 接近,Full 对 No-call 差异 0.008 区间包含零,堆叠融合 0.550 对 0.475 的 0.075 增益经校正后不显著;STM 上转录 0.960 反超 Qwen2-Audio 0.850,说明调用价值随任务翻转。
根据论文正文报告值整理,关键结果如下:
| 比较或条件 | 指标 | 明确报告值 | 这项数字支持什么 |
|---|---|---|---|
| Text vs 随机猜测 | 准确率 | 0.296 vs 0.167 | 波形信息必要,但仅此而已 |
| WavLM-emb vs Qwen2 单模型 | 准确率 | 0.854 vs 0.838 | 有监督本地编码器已匹配单生成模型 |
| CLAP→Omni vs WavLM-emb | 配对差异 | 0.033, 95% CI [-0.017,0.083], p=0.268 | 路由增益不确定,无法定论 |
| Full sel vs No-call sel | 配对差异 | 0.004, 95% CI [-0.025,0.033] | 生成调用无稳定边际增益 |
| Full sel vs WavLM-emb | 配对差异 | 0.071, 95% CI [0.029,0.117], Holm 后 p=0.027 | 唯一经校正仍显著的优势,来自编码器+ 选择器而非单调用 |
| 堆叠融合 vs No-call(ESD) | 配对差异 | 0.075, 95% CI [0.017,0.133], Holm 后不显著 | 外部集上看似有增益但校正后不稳定 |
| STM 转录 vs Qwen2 | 准确率 | 0.960 vs 0.850 | 调用价值任务特异,转录可反超 |
至少一个未胜出项值得强调:提示词敏感性使 50% CLAP 优先的 Qwen2 准确率在 0.792 至 0.850 间波动,说明标签措辞与编码器接入方式本身就是结果的一部分,而论文未对此做系统消融。
小样本、常数置信度与任务收缩:结论的边界在哪里
论文明确承认的局限首先是继承性偏差:ASR、音频编码器与大语言模型在口音、方言、病理语音、语码切换与低资源语言上的偏差会直接传导到评测中。其次是隐私与暴露:即便减少生成调用,系统仍会处理转录与编码器特征,托管接口仍可能暴露路由波形或中间摘要。再者是数据集的生命周期:VocalSound 的锁定划分在本研究内有效,但重复使用会固化为固定测试集;ESD 新鲜子集虽行不相交但样本小,作者指出更大规模的说话人无关重测是最重要的下一步。
审稿视角补充的潜在问题更贴近统计与工程现实。主留出集仅 240 行,配对区间宽度约 0.058,对约 0.03 量级的增益缺乏功效,CLAP→Omni 对 WavLM 的 0.033 差异因区间包含零而无法判定。生成模型置信度为常数,使全选择器与无调用选择器在信息层面不对称,可能低估生成调用的潜力,若提供校准的生成对数概率,结论或会改变。成本以缓存的顺序时间计量,未反映批处理、并发与托管延迟下的真实服务代价,且早期会计曾高估转录开销。
更根本的是结论的收缩:结果限于已知闭集且开发标签可用的场景,未涵盖更复杂推理、未知任务混合、少样本适应、校准与吞吐感知服务等权衡,也未报告说话人或会话层面的分层误差与公平性分析。这既是克制,也是限制——它让部署决策更清醒,但不直接指导开放式音频推理该如何设计调用。
能复现什么、缺什么、如何核查
可核查的部分在于协议的锁定与统计的透明。论文称在评估留出集前即固定解析器、标签归一化、特征、权重、阈值与 lambda,提示词、解析代码、模型标识、冻结输出与选择器文件被保留,度量检查器从存储摘要重算所有 headline 数值。统计上采用 10k 次行自助法、Wilson 点区间、McNemar 精确检验与 Holm 校正,10 折种子诊断保持生成标签固定而变化编码器折与选择器拟合,这些都让数字的来龙去脉可追溯。
缺失的部分同样具体。论文未提供代码仓库、模型权重或数据集下载链接,也未给出 HuggingFace 或 ModelScope 标识;未披露路由权重 alpha、beta、gamma、阈值 tau_b 与正则化系数 lambda 的具体数值;未说明优化器、学习率、batch size、训练轮数与硬件型号;未公开提示词文本、解码温度、beam size 等推理设置;音频采样率、时长分布与预处理细节也未说明。由于 Qwen2 与 Omni 的置信度为常数,复现者在不补充校准对数概率的情况下,难以检验“若有置信度,调用是否会更有效”这一反事实。
对刚入行的读者,一个务实的复现清单是:先按行划分重建开发与留出集并验证无重叠,再用相同特征重训 L2 逻辑回归选择器并做跨折外预测,最后用相同的自助法与 Holm 校正重算配对区间。若要扩展,建议优先补两项测量:一是提供生成模型的校准置信度后重跑全选择器,二是在更大规模、说话人无关的新鲜集上重测并报告分层误差。
当“听见”已足够,什么时候才需要“生成”
这篇论文的价值不在刷新榜单,而在把一句常被省略的话补全:音频比文本准,不等于波形必须进生成式音频模型。在 VocalSound 这类已知闭集端点上,转录的失败证明了声学证据的必要性,但有监督的本地编码器与精心设计的选择器已经把这份证据用得很充分,留给生成调用的边际空间在当前统计功效下无法与零区分开。
对研究生而言,这里有一个可迁移的方法论启示:评测应把“信息是否在信号中”与“接口是否必须调用”拆成两个可检验的问题,并为后者构造匹配的无调用对照、分离成本与准确率、用配对区间与多重检验校正来约束结论。否则,任何波形优势都会被自然地解读为对生成式调用的背书。
未来的调用边界可能出现在论文主动排除的地方:未知任务混合、少样本适应、需要复杂推理或开放式生成的场景,以及能提供校准置信度与吞吐感知调度的服务形态。在那些地方,12.5% 调用取得 0.925 的故事或许会被改写。但在已知的闭集端点上,论文给出的审计框架已经足够让部署者在付费调用前多问一句:这 1 次波形,真的需要走到生成模型那一步吗?
📎 论文与评分元数据
标签:#音频分类 #音频大模型 #模型评估 #基准测试
6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #音频大模型 | #模型评估 #基准测试 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.3/2):将音频大模型评测重构为转录保留、本地编码器与生成式调用三选一的受控决策,提出匹配的无调用选择器作为决定性消融,并分离准确率与顺序执行成本计量,系统级审计视角具有方法论新意。
技术严谨性 (1.2/1.5):全选择器采用 L2 正则化逻辑回归并对 CLAP 与 WavLM 开发预测做跨折外预测,配对区间用 10k 行自助法、点区间用 Wilson、显著性用 McNemar 精确检验并对 8 个 headline 检验做 Holm 校正,行划分在评估前锁定,未见推导错误。
实验充分性 (1.0/1.5):覆盖 Text 0.296、WavLM-emb 0.854、Qwen2 0.838、CLAP→Omni 0.887、No-call 0.921 与 Full 0.925 的代表性基线及 Full 对 No-call 差异 0.004 95% CI [-0.025,0.033] 的直接消融,并有 ESC-50 n=200 与 ESD n=120 外部校验,但主留出集仅 n=240 导致区间宽约 0.058 且提示词敏感性 0.792 至 0.850 未系统消融。
清晰度 (0.8/1):清晰给出路由分数 s_i = rho_i^text + alpha u_i + beta q_i + gamma v_i 与成本 C_i^route = C_i^asr + C_i^text + h_i C_i^conf + r_i C_i^gen 的定义及阈值 tau_b 选择逻辑,表格同时报告准确率、生成调用率与总耗时,结构可核查。
影响力 (0.8/1.5):明确将结论收缩至已知闭集 6 分类 VocalSound 端点决策,区分声学证据必要性与生成调用必要性,指出不涉及开放对话与通用音频推理且 STM 上转录 0.960 反超 Qwen2 0.850,任务特异性限制了对更广音频推理的直接影响。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):未披露路由权重 alpha、beta、gamma、阈值 tau_b 与正则化系数 lambda 具体数值,未说明优化器、学习率、batch size 与硬件型号,提示词文本未公开且 Qwen2 置信度为常数,关键复现配置大量缺失。
工程/实践价值 (0.8/1.5):报告 No-call 11.3 s 与 Full 16.9 s 的缓存顺序执行时间及 12.5% 对 50.8% 的生成调用率对比,给出 C_i^clap + r_i C_i^gen 的成本结构,但未提供真实批处理与并发下的延迟与吞吐测量,也无可复用公开产物。