英文题目:Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

标签:#音频事件检测 | #多模态学习 | #音频大模型 | #音频问答

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Yanfeng Shi:机构信息未在 arXiv HTML 中可靠披露
  • Yan Song:机构信息未在 arXiv HTML 中可靠披露
  • Junhui Li:机构信息未在 arXiv HTML 中可靠披露
  • Tinggan Huang:机构信息未在 arXiv HTML 中可靠披露
  • Wu Guo:机构信息未在 arXiv HTML 中可靠披露
  • Haoyu Song:机构信息未在 arXiv HTML 中可靠披露
  • Ian McLoughlin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

时间音频定位需根据自然语言查询在长录音中输出目标事件起止区间,难点在于查询语义理解与帧级声学证据精确对齐难以兼得。所提框架先将音频与提示送入冻结大音频语言模型并取倒数第二层文本隐状态作为上下文感知查询表示,再用冻结预训练音频编码器提取帧级特征并以上采样对齐时序辅以卷积神经网络分支补充细节,接着以交叉注意力实现每帧自适应检索词元语义并融合后经Conformer时序解码输出帧级分数再平滑合并为区间。与直接生成时间戳词元的已有范式不同,该方法将语义建模与帧级活动建模解耦并保留词元级对应,避免隐式对齐从而提升定位精度与可靠性。在DESED测试集下,Ours (Qwen3-Omni)的mIoU为77.8,高于DASM的mIoU 73.9。该结论限于10秒窗口拼接编码与有监督区间标注条件,对多事件计数和未见描述泛化尚未充分验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么值得做?

本文的输入是一段录音加一句自然语言描述的事件查询,目标是输出该事件在录音中出现的一个或多个时间区间。输出不是整段音频的标签,也不是一句描述,而是可以换算成交并比的时间边界。论文开场交代的矛盾是,大音频语言模型已经能理解语音、环境声和音乐并按指令作答,但在精细时间感知上仍然偏弱,直接影响音频接地这类需要定位的任务,也会连带影响依赖时间证据的推理,例如判断哪个声音持续更久。

对刚入门的读者,白话解释是,大音频语言模型指把音频编码器与大语言模型接在一起、经过多模态预训练和指令微调的系统,英文为 Large Audio-Language Model,后文简称大模型。时间接地指给定查询找出对应声音起止时间,英文为 temporal grounding。帧级定位指把音频按固定帧率切成短帧并逐帧判断事件是否存在,英文为 frame-level localization。必须保留的信息是,本文不微调大模型做时间戳生成,而是冻结大模型取语义表示,另训练一个帧级接地模型做定位,并在推理时可把该模型当外部工具用。

本文输出是 1 篇可核对的方法解读,按学习依赖展开,先讲任务与现有路线,再讲全景与组件计算,再讲训练与推理流程,最后讲实验条件、结果与复现要点。教学用的举例会明确标为例子,不虚构数值。演示资源方面,资源状态为可用,官方演示页当前可用,已公开时间接地与推理示例,可作为理解输入输出的辅助材料,但本文事实核对仍以论文正文证据为准。

已有路线如何加时间信息,缺口在哪里?

论文梳理的已有路线可分为 3 类。第一类是给大模型加时间参考,例如用特殊时间戳标记或在音频特征序列中加入时间标记,让生成式模型能说出时间。第二类是加细粒度标注监督与强化学习,直接后训练大模型提高接地精度。第 3 类是声音事件检测中长期使用的帧级预测,直接在时间轴上建模事件活跃度。

这些路线共同的默认做法是让大模型通过文本生成接口输出边界时间戳。论文指出的缺口是,这种生成式写法下时间预测与细粒度声学证据的对应关系是隐式学到的,大模型擅长理解查询语义,但精确定位需要逐帧解析声学证据,两者能力不完全重合。相比之下,帧级预测天然适合精确定位,但如何利用大模型的语义建模能力同时做帧级预测,此前探索较少。

因此本文的定位不是再做一个更大的时间戳生成微调,而是把分工拆开。大模型负责在音频上下文中表示查询,接地模型负责结合细粒度音频特征做帧级定位。这个拆分也是后文所有消融的起点,查询表示、音频表示与对齐方式三处分别验证。

任务形式与评测口径是什么?

形式化地说,给定录音波形与目标事件描述,模型需返回若干区间。标签型数据集直接把事件标签当查询,自然语言数据集则用更丰富的描述当查询。训练监督来自标注区间转成的逐帧二值标签,推理时把逐帧分数平滑、阈值化并合并连续正帧得到区间。

时间戳生成 × 帧级二分类: 时间戳生成指让大模型直接生成起止时间字符串,帧级二分类指对每 1 帧输出事件存在概率再合并成区间;前者把定位隐式学在文本生成里,缺乏预测与声学证据的显式对应,后者直接对时间轴建模,本文选择后者作为外挂定位头的监督形式以提高严格阈下的精度与可靠性。

评测用交并比相关指标。论文在主结果表注中说明,R@.5 与 R@.7 分别表示在交并比阈值 0.5 与 0.7 下计算的召回,mIoU 表示平均交并比。阈值越严格,对边界精度要求越高,因此后文特别关注 R@.7 的提升。推理类评测则用多选题准确率,按所需时间操作分组统计。理解这一点很关键,否则容易把不同阈值、不同分组的数字混为一谈。

整体分工:谁冻结,谁训练,证据流向哪里?

沿一个样本走一遍是理解全景最快的方式。输入是一段录音与一句话查询模板,模板形如音频占位符加何时发生某查询事件。录音同时走两条路,一条进入冻结的大模型作为上下文,另一条进入冻结的音频编码器加可训练卷积分支得到帧级声学表示。大模型输出文本侧隐状态作为查询条件,与声学表示做帧自适应对齐与融合,再经时序解码器与线性头得到每帧的定位分数,最后转成区间。在下游推理中,这些区间会被整理成含时长、首次起始与末次结束的结构化工具输出,回填给大模型做下一步推理,必要时可多次调用。

下图是本文唯一有像素证据的框架图,上半为整体框架,下半为作为外部工具的时间推理流程,图注明确指出面板含义,阅读时应先分清主路径与工具循环。

看图路径: 1. 先沿左上角音频与查询提示进入冻结大模型的箭头,找到倒数第二层引出的语义分支;2. 再沿左下角频谱经分窗、音频编码器、上采样与卷积支路汇合的声学分支,确认两路在对齐融合处汇合;3. 观察对齐融合放大框内的交叉注意力、拼接与感知机符号,区分可训练与冻结图例;4. 看到面板下方时序解码器与线性头输出定位分数曲线,再对照面板下半部分工具调用与工具结果的循环

原论文 Figure 1:The proposed framework is illustrated in (a), and (b) presents the grounding model as an external…

论文图 1。原论文 Figure 1::“The proposed framework is illustrated in (a), and (b) presents the grounding model as an external tool that provides temporal evidence for LALM reasoning.”。

从像素可见,上半左侧有两个输入箭头分别表示音频与查询提示进入大模型,大模型内部画出多个层并特别框出倒数第二层的隐状态引出。下半声学支路可见频谱经分窗进入音频编码器,另有一条卷积支路汇入上采样后的特征,随后进入对齐融合、时序解码器与线性头并输出随时间变化的定位分数。放大框展示了以音频表示为查询、以语义隐状态为键值的交叉注意力,以及拼接与感知机结构。

图例区分了隐状态、音频表示、接地表示、融合表示、逐元素乘积以及可训练与冻结模块。下半推理示例以笑声与关门声哪个更久为例,展示了大模型先发起工具调用、接地模型返回区间、大模型再作答的闭环。这个闭环是后文推理实验的操作依据。

查询表示:取大模型的哪部分,为什么只留文本侧?

这一步的操作是把音频与查询提示一起送入冻结的大模型,取出倒数第二层的隐状态,只保留文本 token 对应的部分,再投影到共享维度。论文明确写出输入模板把音频嵌入放在前面,查询描述填入引号位置,并说明使用倒数第二层是因为已有报道称其语义信息比最后一层更丰富。保留文本侧的原因是这些状态已通过自注意力融入了前置音频上下文,而细粒度声学信息另由专用音频编码器提供,因此丢弃音频侧隐状态。

查询表示 × 音频上下文: 查询表示指从大模型倒数第二层取出的文本侧隐状态经投影后的序列,音频上下文指同一大模型自注意力中已经看到的前置音频嵌入;搭配理由是让同一查询在不同录音中有不同的上下文偏置,组合意义是后续接地模型拿到的不是孤立文本向量而是已融合录音内容的条件序列。

符号上,设文本侧隐状态为长度为 L 的序列,投影后得到共享维度为 d 的序列,原文公式如下。

\[\widetilde{H}=\operatorname{Proj}_{h}(H_{\text{text}})\in\mathbb{R}^{L\times d},\]

该公式的输入是文本侧隐状态,计算目标是线性投影到与音频表示相同的维度,输出仍是 token 级序列而非单个向量。保留 token 级别至关重要,因为查询可能包含事件身份与声学属性等多个语义成分,而单个音频帧可能只对应其中子集。若过早平均池化,所有帧将拿到相同的全局条件,可能掩盖细粒度对应关系。这一点在后文对齐消融中被直接验证。

大音频语言模型 × 帧级定位: 大音频语言模型负责理解自然语言查询和音频上下文给出的语义条件,帧级定位负责在时间轴上逐帧判断事件是否存在;二者搭配的原因是前者擅长语义而难以精确对齐细粒度声学证据,后者擅长逐帧判别但缺少查询语义,组合后语义条件逐帧检索声学特征并输出定位分数。

音频表示:专用编码器加卷积分支如何拼出帧序列?

精确定位需要既有事件判别力又有细时间结构的特征。论文选用为帧级任务定制的 ATST-Frame 作为音频编码器并冻结它,同时加一个在对数梅尔频谱上运行的 4 层卷积支路补充细粒度声学细节。操作上,为匹配编码器输入配置,录音被切成不重叠的 10 秒窗,末尾不足则补零,每个窗独立编码后再沿时间拼接成整段录音的编码器序列,随后上采样到目标时间分辨率并与卷积特征加权相加再投影。

原文公式如下,其中上箭头表示上采样后的编码器特征,另一项表示卷积特征,w 为可学习标量,T 为帧数。

\[X=\operatorname{Proj}_{x}\!\left(X_{\mathrm{enc}}^{\uparrow}+wX_{\mathrm{cnn}}\right)=\{x_{t}\}_{t=1}^{T}\in\mathbb{R}^{T\times d},\]

实现细节按原文交代,共享维度为 768,音频编码器特征上采样到 50 赫兹,融合权重 w 初始化为 0.5,交叉注意力用 12 头,时序解码器由 5 层 Conformer 组成且隐维度为 768。这些数字是复现时必须保留的信息条件。直观例子是,一段 30 秒录音会被切成 3 个 10 秒窗分别编码再拼接,若只有 25 秒则最后一个窗补 0 到 10 秒,这是例子而非对某条录音的实测断言。

对齐融合与解码:每帧如何拿到自己需要的语义?

拿到查询序列与音频帧序列后,模型用交叉注意力做帧自适应对齐。具体是帧级音频表示做查询,语义序列做键与值,输出每帧的接地表示。随后在每帧把音频特征、对齐后特征及其逐元素乘积拼接并过感知机得到融合表示,再经时序解码器建模帧间依赖,最后线性头映射为帧级定位分数并转成区间。

原文对齐公式如下,输入为音频序列与投影后语义序列,输出为同等帧数的接地表示序列。

\[G=\operatorname{MHA}\!\left(X,\widetilde{H},\widetilde{H}\right)=\{g_{t}\}_{t=1}^{T}\in\mathbb{R}^{T\times d},\]

自适应对齐 × 特征融合: 自适应对齐指以音频帧为查询、以语义 token 序列为键值做多头交叉注意力,每帧取出自己需要的语义成分;特征融合指把原始音频特征、对齐后的语义特征及其逐元素乘积拼接后过感知机;前者解决 1 帧只对应查询子集的问题,后者保留两路信息并建模交互,再交由时序解码器建模帧间依赖。

与之对照的全局池化基线是把文本隐状态平均成单个向量并对所有帧共享,后文显示其一致弱于交叉注意力,支持帧级对齐的必要性。解码后的后处理按原文是 15 帧中值滤波平滑、以 0.3 为阈值 2 值化,再合并连续正帧为区间。这些超参数直接决定区间碎裂与合并程度,也是理解计数类推理误差的前提。

定位模型 × 外部工具: 定位模型指训练好的帧级接地网络,外部工具指大模型在回答时长、先后等问题时可多次调用该网络并把返回区间组织成结构化证据;分工是大模型负责判断需要什么时间操作并构造事件查询,定位模型负责返回区间与时长等属性,组合意义是把难以直接感知的边界信息变成显式上下文再做推理。

训练谁、冻结谁,监督信号从哪里来?

训练职责划分明确。大模型与 ATST-Frame 在训练中保持冻结,其余参数可优化 20 个轮次,使用 AdamW,学习率为 5×10 的负 5 次方,批量为 32。损失为帧级二元交叉熵,逐帧二值标签由标注区间导出。原文未报告梯度是否截断到大模型之外的细节以外的额外路径,但冻结声明意味着大模型参数不更新,音频编码器参数也不更新,优化只发生在投影、对齐融合、卷积支路权重、时序解码器与线性头等新增模块。

数据方面,训练用 AudioGrounding、DESED、UnAV-100、TACOS、Clotho-Moment 与 FTAR 的对应训练划分,其中 DESED 限真实录音,FTAR 只取时间接地部分。论文报告总体训练与评测样本量分别为 98.1k 与 14.5k。评测用 AG、TACOS、Clotho-M 的测试集、DESED 真实测试集与 UnAV-100 子集。基线用公开发布的检查点在相同测试集上评测,对 FineLAP 与 DASM 较长录音按不重叠 10 秒窗切分以匹配其输入长度,这句话是判断公平条件的关键,不应忽略。

需要指出的缺项是,原文未给出训练硬件、耗时与参数量的预算,也未报告多次随机种子的方差,因此不能从现有证据推定训练成本或统计显著性,只能说在报告的单次划分与指标下观察到一致提升。

实验条件:数据、主干、指标方向如何对齐?

实验主干用 Audio Flamingo 3 与 Qwen3-Omni 两种大模型,音频编码器统一用 ATST-Frame,这种双主干设计用于检验框架是否依赖特定大模型。接地指标方向是越高越好,阈值 0.7 比 0.5 更严格,mIoU 反映整体重叠质量。推理实验用 DCASE 2025 Task 5 时间 soundscape 问答子集的开发集,共 609 题,按所需时间操作分为起始结束、时长、排序、计数与其他 5 类,指标为多选题准确率。

比较条件上,主结果同时保留专用接地模型、通用大模型直接推理以及经任务后训练的大模型,保证读者能看到增量来源。消融保持其余设置不变,只替换查询表示、音频表示或对齐方式。推理对比是同一大模型直接回答与同一大模型加接地工具两种运行方式,工具调用时把生成的事件查询与音频一起送入大模型取文本隐状态,再条件化接地模型预测区间,并组织时长等派生属性回填上下文。这种调用流程意味着推理增益依赖大模型首次判断所需时间操作与构造查询的质量,若查询本身错误,工具证据也可能偏置。

主结果:在哪些基准上严格阈提升最大?

比较问题是,在相同测试集与公开检查点条件下,外挂帧级接地是否在严格阈下带来可运行的提升,指标方向为 R@.5、R@.7 与 mIoU 越高越好。下表用原文连续句可覆盖的数字整理核心对照,不引入原表全部宽表,仅聚焦论文正文明确写出的增量与成对值,单位与精度保留原文写法。

数据集指标对照含义本方法含义原文成对值
DESEDR@.7最优大模型基线本框架15.1 points 增益
AudioGroundingR@.7最优大模型基线本框架8.1 points 增益
TACOSmIoU专用接地对照本框架55.6 versus 46.7
Clotho-MmIoU专用接地对照本框架88.9 versus 79.5

表后解释如下。论文报告,外挂框架在两种大模型主干下均进一步提升,尤其在更严格的 R@.7 上,在 DESED 与 AG 上相对最优大模型基线分别有 15.1 与 8.1 个点的增益。面对专用接地模型,在查询语言更丰富的 TACOS 与 Clotho-M 上提升明显,mIoU 分别为 55.6 对 46.7 与 88.9 对 79.5。总体上论文称在所有基准上一致提高 mIoU,这句话是论文的直接报告,可作为趋势引用,但不应推广为每一阈值、每一样本都成立。未胜出项也需看到,例如在 UnAV-100 子集上 SpotSound 仍有竞争力,说明在某些分布下任务后训练的大模型基线并不弱,外挂的相对收益会变小。

代价方面,本文新增了交叉注意力、融合感知机、卷积支路与 Conformer 解码器等可训练模块,推理时还需同时运行冻结大模型与音频编码器,但原文未测量延迟与显存,因此不能承诺更快或更省,只能说精度侧有证据,成本侧待验证。

时间推理:把定位当工具回填能回答哪类问题?

第二个实验问题是,训练好的接地模型作为外部工具能否为下游时间推理提供显式证据。对比条件是直接用 Qwen3-Omni 推理与同一大模型加接地工具,数据集为时间问答开发集共 609 题,指标为准确率越高越好。下表直接选用原推理表,按问题类型分组呈现题数与两种运行方式的准确率。

Question Type#QAccuracy (%)Accuracy (%)
Onset/Offset14453.4782.64
Duration10650.9483.02
Ordering15171.5274.17
Counting11443.8645.61
Other9467.0267.02
Overall60957.8071.26

表后解释如下。论文报告,加入接地模型后总体准确率从 57.80% 提高到 71.26%。分项看,时长类从 50.94% 到 83.02%,起止类从 53.47% 到 82.64%,提升最大,原因是这两类可直接从返回边界与时长导出答案。排序类本身直接推理已达 71.52%,工具仅小幅提到 74.17%,因为排序只需事件先后而非精确边界。计数类从 43.86% 到 45.61% 提升有限,论文的有限解释是帧级定位目标未显式监督事件个数,且合并或碎裂的区间会导致计数错误。其他类保持 67.02% 不变,说明并非所有问题都需要时间证据。

限制是,该推理流程依赖大模型先识别所需时间操作并构造查询,若问题本身不需要定位或查询构造失败,工具可能无收益。原文也未报告工具调用次数、失败率与额外延迟,因此不能把准确率提升等同于端到端效率提升。

三处消融:查询语境、声学编码器与对齐方式各贡献多少?

消融要回答的问题是,若保持其余设置不变,只换查询表示、音频表示或对齐方式,mIoU 是否下降,指标方向为越高越好。下表直接选用原消融表,以 Qwen3-Omni 为大模型主干,首列为具体变体设置,后五列为 5 个接地基准上的 mIoU,加粗变体为主要结果所用设置。原表按查询表示、音频表示、查询到音频对齐分为 3 组,本表保留全部八行数据以便核对每组贡献。

VariantAGDESEDUnAVTACOSClotho-M
MGA-CLAP [13]74.975.771.950.285.6
Qwen3-Omni (w/o audio context)75.374.472.453.786.9
Qwen3-Omni76.477.874.155.688.9
Qwen3-Omni†73.975.972.252.787.8
ATST-Frame (w/o CNN branch)75.276.574.554.388.1
ATST-Frame76.477.874.155.688.9
Global Pooling75.076.873.854.087.3
Cross-Attention76.477.874.155.688.9

表后解释需分 3 层。查询表示组前三行显示,独立查询编码器 MGA-CLAP 与去掉音频上下文的大模型变体表现接近,而加入音频上下文后的完整大模型表示进一步提高,支持音频上下文对查询表示的精炼作用。音频表示组中间三行显示,用大模型原生音频编码器替代 ATST-Frame 会在各基准上一致更低,支持专用音频编码器更适合细时间判别;去掉卷积分支后 ATST-Frame 本身已强,但加入卷积特征总体仍有进一步改善,支持其补充细粒度声学信息。对齐组最后两行显示,帧级交叉注意力一致优于全局平均池化,支持每帧取所需语义子集而非共享单一全局条件。

反例与边界是,消融均为 mIoU 单指标,未报告 R@.7 下的分解,也未报告显著性检验,因此只能说在该指标与该划分下观察到一致优势,不能断言在所有严格阈下同样幅度成立。同时消融未涉及阈值、中值滤波窗长等后处理敏感性,这是复现时需补的验证。

哪些结论有证据,哪些还只是可能?

论文直接报告的是,在所用划分与指标下,外挂帧级接地在多个基准上提高 mIoU 与严格阈召回,且在时长与起止类推理题上大幅提高准确率。这些是报告级别的事实,可复述。论文的有限解释是,音频上下文精炼查询、专用编码器适合细时间判别、帧级对齐优于全局池化,这些有消融支持,可表述为支持级别的判断。

未验证的推测需用可能或待验证表达。例如,帧级接地被认为提供了更可靠的时间证据,但原文未测量误判率、校准误差或证据可解释性,不能承诺可靠性在所有场景成立。计数提升有限被归因于合并或碎裂区间,但未做区间碎裂率与计数误差的定量关联,因此只是可能的机制解释。总体趋势不等于每组每步都成立,例如 UnAV-100 上仍有强基线,其他类推理题无提升,都提醒适用边界。

缺失证据不是技术错误,但复述时要明确。未报告训练资源、推理开销、输出帧率与实际延迟,讨论延迟时只能说未测量。未报告多次运行方差与统计检验,讨论显著性时只能说待补。冻结参数不能推出系统输出确定,因为解码采样、后处理与工具调用策略仍可能引入不确定性。

复现先做什么,需要哪些信息条件?

复现应先锁定信息条件。数据侧需按原文取得 AG、TACOS、Clotho-M 测试集、DESED 真实测试集与 UnAV-100 子集,训练侧用对应训练划分并对 DESED 限真实录音、对 FTAR 只取时间接地部分。模型侧需准备冻结的 Audio Flamingo 3 或 Qwen3-Omni、冻结的 ATST-Frame,以及待训练的投影层、12 头交叉注意力、融合感知机、5 层 Conformer 解码器与线性头,共享维度 768,上采样到 50 赫兹,融合权重初始化 0.5。

训练按原文用帧级二元交叉熵,标签由区间导出,优化 20 轮,AdamW 学习率 5×10 的负 5 次方,批量 32。推理按原文用 15 帧中值滤波、0.3 阈值、合并连续正帧。评测先算 R@.5、R@.7 与 mIoU,再按推理分组算准确率。基线需用公开发布检查点在相同测试集上重跑,长录音对 FineLAP 与 DASM 按不重叠 10 秒窗切分。

还需补的验证包括后处理阈值与滤波窗长的敏感性、不同随机种子的方差、工具调用失败率与延迟开销。代码与权重方面,本文证据只给出演示页可用,未给出代码开源与权重下载的可用性声明,因此应写本次未能确认代码与权重可达,不把演示可用等同于系统可运行。

何时值得尝试这种拆分,何时不必?

当任务需要精确边界且查询是自然语言描述时,这种拆分值得尝试。冻结大模型保留语义与上下文能力,专用编码器保留细时间判别力,帧级对齐让每帧只取所需语义,时序解码器再平滑帧间依赖,最后把区间显式回填给推理,这种链路在 TACOS 与 Clotho-M 这类语言更丰富的基准以及时长与起止类问题上收益最明确。

当任务只需粗粒度标签、排序或常识推理,或录音很短且事件边界模糊时,外挂的相对收益可能变小,还需承担额外的模型与后处理复杂度。教学上最易产生的误解是把生成时间戳等同于真正对齐了声学证据,本文的对照恰好说明,显式逐帧建模与帧级监督是另一条互补路线。另一个误解是把总体准确率提升当成每类都提升,实际上计数与其他类几乎不动,说明时间证据只帮助需要边界与时长的问题。

收束时保留关键超参数与条件,区分已验证与待验证。用自然段说清,本文显示了冻结语义加帧级定位的可行性与一致增益,但成本、方差与更广分布的泛化仍待补验证,这正是后续复现最有价值的部分。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-16 语音/音乐/音频论文速递