英文题目:ALARM: Audio–Language Alignment for Reasoning Models

会议身份:conference:interspeech:2026:conference-paper-id:grinberg26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Adapter #多模态学习 #音频大模型 #音频理解

评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:模型报告

👥 作者与机构

  • Petr Grinberg:机构信息未能从会议 PDF 纯文本可靠映射
  • Hassan Shahmohammadi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理以音频波形为输入、以自然语言回答为输出的音频问答与推理任务,难点在于推理大模型的内置思维链会复述文本替代输入与元数据来源导致文本腔,且单一Whisper编码器不擅长音乐与环境声。第一步由指令模型基于文本描述与元数据生成多样化候选提示并过滤,仅保留可回答且音频提示对齐的提示以抑制幻觉。第二步由冻结推理模型基于文本表示生成初始回答,再由同一模型将其重述为听觉感知风格的文本并丢弃中间链,重述结果作为音频训练目标切断规则泄露。第三步冻结推理主干与四个音频编码器,仅训练适配器与融合模块,将多层加权特征经交叉注意力或感知器压缩后映射到文本嵌入空间。相对已有自生成方法依赖语音活动检测与识别文本的做法,该链消除了对识别输入的依赖并修复了推理模型的目标分布失配,使冻结主干保留文本能力的同时获得跨编码器互补。在MMSU基准测试条件下,ALARM-E的感知准确率为45.4%,高于7B Qwen2.5-Omni的感知准确率42.5%。该结论适用边界受限于英语为主的短音频推理基准,尚未验证长时对话、强噪声与多轮交互外推。训练成本方面,模型冻结主干仅训练适配器并使用更少音频词元,ALARM-E以50 Hz运行而非175 Hz拼接从而降低计算量。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决的听觉理解目标是什么?

这篇论文的输入是一段原始音频波形加上一句自然语言指令,输出是带有思考过程的文本回答。任务覆盖语音内容与副语言、音乐属性与环境声事件,还要求做多步推理,例如从 1 秒钟的我正在去开会判断语气并结合性别年龄语言等线索作答。目标读者需要先建立的概念是,大型音频语言模型是在文本大模型外挂音频编码器与适配器,让冻结或微调的主干能读懂声音。

白话说,编码器负责把声音变成帧向量,适配器负责把帧向量翻译成语言模型能接受的词向量,主干负责思考与回答。英文对应为音频语言模型,缩写为 ALM,带思考能力的骨干称为推理大模型,缩写为 RLM。论文要保留的关键信息是训练只更新适配与融合,主干冻结,监督来自模型自己生成再改写的文本,而不是人工标注。最终交付的是可复述的数据构造动作、3 种融合的计算差异与可核对的基准条件,不做超出证据的效果承诺。

资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开,只能按正文描述讲方法。

已有路线为何在会思考的模型上失效?

已有主流路线是冻结语言模型加训练适配器,监督用自生成解决分布偏移。具体做法是把音频对应的文本替代物,例如转写或带元数据的描述,与指令一起喂给同一冻结模型生成回答,训练时再把文本替代物换成真实音频,只训练适配器。因为目标本来就是该模型自己会说的话,冻结主干就不必被迫模仿外来风格。另一条路线是全量或高效微调主干,用更多音频文本对提升听觉,但常伴随文本能力下降,即灾难性遗忘。

还有路线依赖语音活动检测与自动语音识别先转写再理解,或只用单个语音识别优化的编码器处理所有声音。论文指出三处局限,第一,标准自生成在推理模型上失效,思考过程会复述所给元数据,暴露输入是文本而非音频,训练出的模型说话像在读描述。第二,显式依赖语音识别会在电视背景音或远处交谈等无关语音上误触发,也会在低信噪比下漏检丢失内容。

第三,已有大规模自生成公开数据存在用合成方式补全缺失元数据与随机抽提示不校验可答性的问题,可能引入幻觉。教学例子是,问录音噪声水平但元数据根本没写噪声,模型只能编造,这就是提示与音频不对齐的典型失败。

问题如何形式化,需要满足哪两个一致性?

论文把起点记为多组音频与文本描述对,每组包含音频片段与文本元数据,元数据字段可以是情感性别国籍音质噪声等。目标是构造包含音频、提示与推理模型文本回答的三元组。挑战被拆成两个。第一是提示多样且可答,每个提示必须能从已有元数据推出答案,不能索要缺失信息,否则训练目标就是幻觉。第二是回答不能暴露文本性,推理痕迹不能出现根据所给元数据、所给描述这类措辞,而应像在听声音。

沿一个样本走一遍更直观,输入是 1 秒钟男声英文加中性情感等标签,指令问说话人语气,初版思考会写从所给元数据看到情感中性,复述后应改为我听到音频片段,说话人说某句话,我感知到情感中性。表示层面,音频侧是波形经编码器得到的帧序列,文本侧是提示词向量,组件层面是适配与融合把帧序列压成短而稠密的前缀,目标层面是预测复述后的思考加答案,主干输出仍是文本。

只有同时满足分布一致与听觉一致,冻结主干才既不忘说话风格,又学会听声音。

整体方法分哪三步,信息如何流动?

整体流程分为语料与提示构造、2 阶段回答生成与复述、带融合的音频训练 3 段。第一段从音频库收集带元数据信号,用指令模型批量产生候选提示再过滤并随机保留一条。第二段用同一冻结推理模型先基于文本元数据生成初版回答,再用复述指令把思考与答案改写为听觉表达,思考预算设为 1536 词元以控制长度与质量。第 3 段把音频波形送入 4 个冻结编码器,经适配压缩与融合后作为前缀拼到指令之前,冻结推理模型自回归预测复述目标。下图给出了 3 阶段的输入输出与同一模型的复用关系,阅读时注意区分文本替代输入与真实音频输入在何处被替换。

看图路径: 1. 先沿底部音频加提示到顶部推理模型的纵向箭头看三阶段划分;2. 对比步骤一初版回答与步骤二复述回答在措辞上的差异;3. 观察步骤三四个编码器经适配器汇入融合模块再进入冻结主干的路径

原论文 Figure 2:Overview of ALARM. A pre-trained RLM first generates an initial response R0 from textual metadata…

论文图 2。原论文 Figure 2:“Overview of ALARM. A pre-trained RLM first generates an initial response R0 from textual metadata, then rephrases it into Rtext.”。

该图左侧为第一阶段,底部是音频加提示库,中部是提示与文本描述,顶部黄色条为推理模型,箭头指向上生成初版回答。中间为第二阶段,同一模型把初版回答改写为听觉版本,图中央还标出回答格式分为模型思考与模型答案两部分。右侧为第 3 个阶段,底部真实音频同时进入 4 个编码器,经各自适配器汇入紫色融合模块再进入顶部加长的冻结模型,右侧输入真实提示,顶部输出复述目标。关键点是第一二阶段只用文本不更新权重,第 3 阶段只更新适配与融合,编码器与主干均冻结,从而把分布对齐与模态对齐分开处理。

自复述如何操作,思考预算起什么作用?

自复述是论文的核心操作。第一阶段采样初版回答,条件是文本描述与提示,模型会自然产生包含元数据复述的思考。第二阶段用同一模型重写初版回答,重写指令要求把基于文本的措辞换成听觉感知措辞,重写对象同时包括思考部分与最终答案部分。重写时的思考过程与返回目标是分离的,指令规则不会泄漏到目标中,这是与直接改系统提示不同的地方。直接改系统提示往往无效,因为模型会在思考中引用规则本身。

为控制长思考的计算开销,重写阶段强制思考预算,论文取 1536 词元,增大预算改写更彻底但更慢,截断预算则保留更多原文痕迹但仍比初版更像在听。特殊情况是语音指令子集直接用音频转写做问题,无需复述,初版即目标,多轮对话则把历史转为文本上下文,仅最后一条用户查询保留语音形式。

推理大模型 × 自复述: 推理大模型指内置链式思考并会把思考过程显式输出的语言模型,自复述指用同一冻结推理模型把初版自生成回答改写为听觉感知的表达;二者必须组合是因为直接用自生成目标训练会让思考过程复述元数据等文本痕迹,自复述在保留分布一致的同时切断文本线索,是连接两者的转换层。

复现时要记录的细节是提示生成用固定指令模型,回答生成与复述用同一推理主干,主干同时是最终音频模型的骨干,这种同源设计是避免分布偏移的关键,未报告用不同模型生成目标会带来多大偏移,实践中不应随意替换。

适配与多编码器融合如何计算与压缩?

编码器侧选用 4 个分工不同的冻结编码器,语音内容用 Whisper,丰富语音线索用 W2V-BERT-2.0,音乐用 MuQ,通用环境声用 SSLAM。每种编码器先做层加权平均,选取的层号在原文有明确清单,例如 Whisper 取较深的若干层,其余编码器各取 3 到 5 层,权重为可学习标量经归一化得到。随后经模态适配器映射到主干嵌入维度并降采样,大多数编码器用两层卷积把 50 Hz 压到 25 Hz,本身已是 25 Hz 的 MuQ 用两层多层感知机。融合有 3 种。

第一种 ALARM-CA 以 Whisper 适配特征为查询起点,按固定顺序依次以交叉注意力吸收其余 3 个编码器,每级为两层交叉注意力块,最终输出直接作为音频前缀。第二种 ALARM-P 保留 Whisper 序列为主干输入,对其余 3 个编码器各用一个带 20 个隐查询的感知器压缩为定长前缀,再与 Whisper 序列拼接,前后各加可学习分隔向量。第 3 种 ALARM-E 无需额外训练,推理时把已训练好的 ALARM-CA 输出与单独训练的 Whisper 指令模型的适配特征拼接,并在前面加上任务说明与 2 次聆听的编号指令,总帧率回到 50 Hz。

冻结主干 × 模态适配器: 冻结主干指训练时不更新推理语言模型权重以保留文本能力,模态适配器指把音频编码器帧特征映射到语言模型输入嵌入空间的可训练卷积或感知模块,前者负责守住原有知识,后者负责跨过模态鸿沟,组合意义是以低训练代价实现音频理解而不发生灾难性遗忘。

论文强调不做语音活动检测与语音识别文本输入,连续稠密表示直接作为前缀拼在文本查询之前,这种顺序被引用为有助于泛化。压缩的意义是 4 个编码器朴素拼接将达到 175 Hz,计算与显存过大,而上述方法把主干看到的长度压到 25 Hz 或 50 Hz。

交叉注意力融合 × 感知器压缩: 交叉注意力融合指以上一路编码器表示为查询、以另一编码器适配特征为键值逐级精炼,感知器压缩指用固定数量可学习隐查询把变长编码器序列压缩为短前缀,二者分工分别是保留时序细节的渐进交互与控制长度的定长摘要,论文据此分别做出 ALARM-CA 与 ALARM-P 两条路线。

初学者容易误以为堆更多数据或在单一编码器上堆适配器就能补足音乐与环境声,论文的对照显示这不能克服编码器预训练数据的根本局限,必须换表示来源并精心设计交互方式。

训练语料如何构造,过滤条件是什么?

语料构造从训练集音频出发,总量约为 6M 实例与 2.5M 不重复提示,覆盖约 19K 小时语音音乐与环境声,另有语音指令补充。提示生成动作为,对每条文本描述用固定指令模型采样 20 条候选提示,系统指令要求对齐描述、覆盖多语言与多样性。再用同一指令模型过滤,只保留可从描述回答且不暴露文本性的提示,例如去掉包含所给元数据这类措辞的候选项,最后均匀随机选一条作为训练提示。与之前工作随机从 7K 提示池抽取且不校验可答性不同,该流程明确校验答案所需信息是否存在。下图展示了从语料收集到提示生成、过滤与落库的 4 步管线,是复现数据脚本时最值得对照的动作序列。

看图路径: 1. 先从左到右跟随音频语料库到带元数据信号再到提示语的主箭头;2. 观察提示生成框中时间戳加元数据键值的输入形态;3. 对比过滤框中有效提示的两个条件与最终随机选择落库的出口

原论文 Figure 1:Overview of the corpora collection pipeline.

论文图 1。原论文 Figure 1:“Overview of the corpora collection pipeline.”。

图中第一列为音频语料库落到带元数据信号,第二列把时间戳加音频内容与元数据键值送入指令模型产生 20 条对应提示,第三列再经同一指令模型过滤为有效且不冲突、不暴露文本性的提示集合,第四列随机选一条与音频组成最终库。像素可见 4 个阶段框颜色区分蓝色输入、黄色模型、绿色有效集合,箭头均为单向,过滤阶段有自上而下的校验箭头。

训练优化方面,主干与编码器冻结,只训练融合与适配,损失为给定音频前缀与提示条件下对复述目标的交叉熵,有效批量 64,训练 2 轮,优化器为 AdamW,预热 1500 步,最大学习率万分之一并余弦退火,在 4 张 H200 上完成。验证集按每子集随机抽 10%,语音指令子集用官方划分。单编码器对照与 ALARM-CA 初始化等细节在实验设置节交代,复现时应严格区分全量数据训练与子集训练的模型命名。

评测与基线在什么条件下比较?

评测分三块。语音理解用 MMSU,含 47 个感知与推理任务、覆盖 5000 样本,区分语言内容与副语言,指标为准确率,越高越好,其中推理子集与论文目标最相关。通用音频理解用 MMAU 与 MMAR,MMAU 为 v05.15.25 版,含语音、环境声、音乐三域专家级多步推理,测试划分为 1000 test-mini 与 9000 test 样本,MMAR 为研究生级领域推理、覆盖 1000 样本,涉及语音、声音、音乐与混合类型。细粒度分析用 AIR-Bench,横跨 19 个声音、音乐、语音任务,以雷达图展示零样本泛化。文本能力保持用 MMLU 系列与 GPQA 等纯文本基准,对比微调前后是否下降。

基线包括闭源音频模型、7B 级开源音频模型与 3B 至 4B 级小模型,以及 4 个单编码器对照与仅语音指令训练的 Whisper 模型。训练量以样本数、小时数与词元数三元组报告,ALARM 系列为 5.5M 样本、17K 小时、1.5B 词元,主干是否冻结单独列出。比较公平性上,论文明确冻结与否、主干尺寸与数据量差异,例如全量微调的 7B 模型报告了 0.2T、0.3T、2.4T 词元量级,而 ALARM 冻结 4B 主干只用 1.5B 词元,阅读数字时必须同时看样本、小时、词元三列,不能只比准确率。

指标方向均为准确率越高越好,但不同基准难度与聚合对象不同,跨基准差值不能直接换算为相对提升,百分点与百分比也需区分。

主结果显示了什么收益,代价在哪里?

先看语音推理与保持文本能力的核心比较,问题是冻结小模型能否在推理子集上接近大微调模型且不丢文本。下表整理了 MMSU 感知、推理与总体三列,方向均为越高越好,训练量与冻结状态同时列出以保证条件可见。

条件指标大模型微调基线本方法同系列对照
MMSU 感知准确率感知42.545.438.4
MMSU 推理准确率推理79.878.374.2
MMSU 总体准确率总体60.661.355.8

该对照表明冻结双路在感知与总体上实现反超而推理仍略低于大模型微调旗舰,阅读时应同时结合训练量与是否冻结来判断公平性,单看总体均值会掩盖域间与能力间的权衡。

表中大模型微调基线为 7B 全量微调模型,总体与推理略高但感知落后,本方法为 4B 冻结的双路融合,感知超出约 2.9 个百分点,推理落后约 1.5 个百分点,总体领先约 0.7 个百分点,同系列单路感知器路线推理尚可但感知较弱。表后解释是,收益来自 Whisper 内容特征与多编码器感知特征的互补,交叉注意力单路会压缩掉部分语音识别特征导致推理下降,而双路拼接在推理时同时看到两套视角,弥补了这一损失。

代价是推理帧率回到 50 Hz 且需同时前向两套适配特征,训练虽便宜但推理比单路 25 Hz 更贵。未胜出项是推理子集仍落后于 7B 旗舰,且闭源大模型在总体上仍有竞争力,不能把单项最优推广为全面超越。文本保持方面,微调模型在纯文本基准上明显下降,而冻结路线完全保留主干分数,这是冻结设计支持的判断,但论文未测量延迟与误判率,不能承诺这些量同步改善。 再看通用音频的比较,问题是语音音乐环境声三域能否同时提升。

下表为 MMAU 三域与均值及 MMAR 均值,均为准确率越高越好,含测试迷你与全量两版。

条件指标开源基线本方法同系列对照
MMAU 声音声音70.3 / 66.964.0 / 59.166.4 / 61.1
MMAU 音乐音乐56.3 / 57.154.8 / 54.257.2 / 53.3
MMAU 语音语音71.5 / 71.977.2 / 73.760.1 / 61.1
MMAU 均值均值66.0 / 65.265.3 / 62.461.2 / 58.5
MMAR 均值均值50.848.740.6

主要收益是语音子集达到开源最优并进入包含闭源的前三,超出此前开源领先者约 5.7 个百分点在迷你集与约 1.8 个百分点在全量集,同时声音与音乐保持中上。

代价与反例是声音与音乐仍落后于部分 8B 模型,单路交叉注意力在声音音乐更强但语音较弱,单路感知器则相反,说明固定压缩会限制感知信息,双路融合是折中而非每域最优。总体均值上本方法与 4B 同级相当,以更强语音换稍弱音乐,阅读时不应只看均值而忽略域间权衡。

单编码器与融合方式各自贡献了什么?

消融要回答两个问题,一是每个编码器是否在其目标域最强,二是融合是否比单编码器加更多数据更有效。对照设置是 4 个单编码器模型各只用对应子集训练,例如音乐只用合成与母带数据,声音只用描述与事件数据,语音特性只用多口音与质量数据,另有 Whisper 全量与仅指令两版。

结果显示,通用声音骨干在声音域高,音乐骨干在音乐域强,语音自监督骨干在年龄性别等属性上可比肩多编码器,而 Whisper 全量比仅指令版声音更好但语音下降,说明加多样数据本身不足以兼顾,换表示来源才关键。多编码器在多数域超过单编码器,双路进一步提升,支持融合设计有效的判断。下图为 AIR-Bench 雷达图,覆盖意图实体年龄情感性别语言识别、接地、音乐情绪问答、乐器流派与 MIDI 等任务,半径越大表示该任务越好。

看图路径: 1. 先确认图例中八条模型曲线的颜色对应关系再看外圈任务轴;2. 比较顶部语音区与底部音乐区各模型包络的内外差异;3. 重点观察 ALARM-E 包络在意图与语言识别等轴上的外扩位置

原论文 Figure 3:Comparison of our models on AIR-Bench benchmark across different tasks.

论文图 3。原论文 Figure 3:“Comparison of our models on AIR-Bench benchmark across different tasks.”。

像素可见 8 条曲线中黑色双路包络最外,尤其在意图、语言识别与接地等轴外扩明显,黄色音乐单编码器包络最小但在 MIDI 音高轴相对突出,紫色仅指令 Whisper 在语音属性轴尚可但在音乐声音轴内缩,橙色交叉注意力在声音音乐轴外于绿色感知器,绿色则在语音轴占优。这种交叉印证了表格结论,融合方式必须按域权衡,不存在单一路在所有轴最外。未评测边界是雷达图未给出置信区间与统计检验,单点内外差异不宜过度解读为显著,MIDI 音高上单音乐编码器仍最优也提醒多编码器并非每任务必胜。

Whisper × W2V-BERT-2.0: Whisper 是面向语音识别内容抽取优化的编码器,擅长转写与语言内容,W2V-BERT-2.0 是经大规模自监督预训练的语音编码器,保留更丰富的副语言与声学线索,前者管说什么,后者补怎么说,二者搭配的理由是单一语音识别表示不足以覆盖音乐与环境声及说话人属性。

MuQ × SSLAM: MuQ 是面向音乐表示的编码器,SSLAM 是面向通用环境声与复调场景的编码器,前者分管音高乐器等音乐结构,后者分管事件与场景,二者与语音编码器互补,使融合模型在不依赖语音活动检测与语音识别文本的情况下同时处理人声与非人声信号。

复现消融时需注意单编码器训练轮数批量与数据子集与主模型不同,直接比较绝对值时要标注条件差异,不能当作严格同数据消融。

哪些结论尚未验证,误读风险在哪里?

论文直接报告的是准确率数字与训练量,支持冻结加自复述在低成本下保留文本并提升语音推理,有限解释是压缩导致内容特征丢失与双路互补,待验证的是最优融合顺序、前缀长度与思考预算的普适性。缺失证据不是技术错误,但以下边界必须明确。第一,数据构造依赖元数据质量与指令模型的过滤能力,若元数据缺失或错误,提示过滤只能减少而不能消除幻觉,论文未量化残留幻觉率。

第二,复述质量与预算的权衡只给了定性示例与所选 1536 词元,未报告系统性扫描曲线,不能承诺该值在其他主干上最优。第三,成本只报告训练样本小时与词元及 GPU 型号,未报告推理延迟显存与长音频外推,不能把帧率降低直接等同于延迟降低。第四,评测均为准确率自动指标,未做人评与误判分析,相关性不等于因果,总体趋势不等于每组每步成立。常见误解是把冻结等同于输出确定,实际上冻结只说明权重不变,采样温度与解码策略仍会带来随机性。

把无语音识别等同于完全不受语音干扰也不对,论文只是去掉了显式转写分支,声学混叠仍可能影响表示。

复现应先做什么,需要保留哪些条件?

复现先做数据管线而非直接训练模型。第一步按原文清单收集训练划分的语音多说话人音乐声音 4 类库,记录每条音频的文本描述字段,避免用合成方式补全官方未发布的转写等缺失元数据。第二步用固定指令模型对每条描述采样 20 条候选提示,再用同一模型按可答性与不暴露文本性过滤并随机保留一条,保存提示生成与过滤的系统指令以保证可重复。

第三步用推理主干生成初版回答再以复述指令改写,保留思考预算 1536 词元的设置与思考答案分离的格式,语音指令子集跳过复述。第 4 步冻结 4 个编码器与主干,只训练适配与融合,有效批量 64 训练 2 轮,AdamW 预热 1500 步最大学习率万分之一余弦退火,验证集按每子集 10% 划分。关键超参数与信息条件包括层选择清单、卷积核尺寸与隐维、感知器隐查询数 20 加前缀长度 60、双路推理指令与分隔向量。

代码权重与数据可用性方面,本次未获得可验证的公开链接,不得写当前可用或已公开,实际操作应以论文所述脚本与检查点为准并自行确认可达性。先跑单编码器小子集与 MMSU 推理子集冒烟测试,再跑全量融合,能以最小成本验证管线是否打通。

何时值得尝试这种对齐方案?

当你的主干已是带思考的推理模型且希望冻结保留文本能力,同时音频任务以语音推理为主并兼顾音乐环境声,值得尝试自复述加多编码器融合。操作要点是同源生成目标、过滤保证可答、融合保留内容与感知两路,避免单用语音识别文本或单编码器处理全域。若任务以音乐细节或环境事件为主,应更重视对应编码器权重与融合顺序的调参,不能默认双路最优。若部署对延迟敏感,需另测 50 Hz 双路的真实开销并考虑回退到单路 25 Hz。

还需补的验证包括残留幻觉率的人评、思考预算扫描、长音频与噪声鲁棒性,以及与全量微调在相同数据预算下的严格对照。回到数据规模的整体对照,下表把本方法与此前自生成公开数据的量级放在一起,阅读时注意总量训练验证的划分口径。

条件指标此前公开数据本方法总量本方法训练
实例数百万4.966.085.49
音频时长1000 小时7.0018.8917.03
不重复提示百万0.0072.492.30

表后收束是,规模与多样性提升主要来自更广的音频来源与每条描述多候选再过滤的提示机制,而非简单堆量,这与减少幻觉的目标一致。但规模大不等于每条高质量,复现时仍应抽检提示与复述目标的听觉一致性,再进入大规模训练。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总