英文题目:COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

会议身份:conference:interspeech:2026:conference-paper-id:guo26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #LoRA #检索增强 #语音 #语音识别

评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jhih-Rong Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Bi-Cheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
  • Tien-Hong Lo:机构信息未能从会议 PDF 纯文本可靠映射
  • Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

上下文偏置需将外部实体名单注入语音增强语言模型以纠正罕见词,输入为语音与大规模候选名单、输出为转写文本,难点在于模型上下文窗口有限、干扰实体多且单句常含多个目标而易发生训练崩溃。COALA先以冻结Whisper-large-v2编码器与SmolLM2-135M-Instruct解码器转写并构造含<unbiased>标记的候选名单,再用骨干末层隐状态经判别投影器计算长度归一的匹配分并按分数取前10个实体过滤重构提示,最后进行二次解码以完成偏置目标识别与识别。与全局Softmax判别损失不同,多正样本损失做局部解耦以消除正样本互斥,解耦点式损失进一步做点式解耦,将相对排序转为绝对二分类以稳定零点附近的决策边界。在LibriSpeech test-clean评测设置下,+BTI(DPD-Loss)在N=500条件的B-WER为3.25,低于在N=5000条件的B-WER 6.96。该结论的适用边界受限于英文朗读语料与随机采样罕见词名单,单句目标超过top-10截断时存在失败条件,跨域高密度外推尚未验证。两阶段训练成本共17轮并受限于单卡24GB RTX 3090的硬件条件,推理开销主要来自二次解码与打分过滤。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/Guo0911/COALA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?要解决的语音识别难题是什么?

本文的输入是一段英文朗读语音及其对应的文本转写,目标是在自动语音识别中准确写出其中不常见、领域相关的实体词,例如人名、地名、书名中的罕见词。研究对象是语音增强语言模型,通俗说就是把语音编码器听到的声音特征转成音频标记,再交给一个指令调优过的语言模型去生成文字的端到端系统。论文要解决的矛盾很具体:语言模型本身对高频通用词很熟,但对低频罕见词记忆不足。

如果想靠外部知识帮忙,就要给模型一个偏置名单,告诉它这句话可能出现哪些罕见词。名单很小时直接拼进提示词还能工作,名单扩大到几百、几千时,语言模型的上下文窗口装不下,而且大量与本句无关的干扰词会把解码带偏。于是任务变成两步:先判断名单里哪些实体真的出现在当前语音中,再只把少数高可信实体交给识别器做偏向解码。

评价时把词错误率拆成两部分:通用词上的无偏置词错误率和偏置词上的偏置词错误率,缩写为 U-WER 和 B-WER,前者看有没有把通用词改坏,后者看罕见目标词是否被救回来。打分阶段另用召回类指标:取最高分实体去覆盖目标,衡量用多大的候选规模能达到多高的覆盖率。当前代码已公开,资源状态显示可用,地址为论文脚注中的仓库链接,这为复述训练与推理流程提供了可核对的依据。

已有的偏置方法分哪两路?为什么难直接搬到新模型?

按外部知识介入的时机,原文把已有上下文偏置归为两路。第一路是推理时偏置,白话说就是训练好的识别器不动,在解码时临时加偏好,例如用浅融合把基于知识库构造的加权有限状态机分数叠加到搜索路径上,或在波束搜索中遇到特定前缀时动态提升目标实体的出现概率。

第二路是训练时偏置,白话说就是在训练阶段让模型内部学会偏向名单,例如加注意力偏置适配器对齐声学特征与上下文信息,或用基于字典树的前缀树指针生成器建立声学到实体的捷径。原文指出,这两路思路搬到语音增强语言模型上仍有障碍:一是名单变大后,提示词长度受限与干扰实体的影响更严重,性能下降明显;二是近年出现的判别式过滤器思路更适合先缩小名单,但原有判别损失在多目标句上训练不稳定。

本文的定位正是补上这一环:不改语言模型词表分布,而是另学一个判别空间做匹配强度估计,再用改进的损失解决多正样本共存时的梯度冲突。需要区分的是,基于初次转写做模糊匹配再做第二遍解码的知识提示方法,依赖第一遍转写的质量,若第一遍把罕见词听错,后续过滤与提示都会被带偏,这也是后文要对比误差传播的原因。

为什么多目标语音是必须处理的主流而非特例?

要理解本文为何强调多目标,先看 LibriSpeech 上每句含多少个目标罕见词的分布。原文用一张按目标实体数统计语音条数的柱状图说明,训练、验证、测试集都呈现大量语音含 2 个及以上目标词的形态,而不是只有单罕见词的干净情形。若训练损失假设每句只有一个正样本,就会丢掉或错误处理这部分复杂数据。更重要的是,推理名单可达 5000 规模,而最终提示只能放约 10 个实体,过滤器必须在多目标下同时把多个正样本排到前面,任何让正样本互相竞争的设计都会在高密度语音上漏检。

看图路径: 1. 先看横轴目标实体数从 0 到 11+ 的划分,再看纵轴每柱的语音条数;2. 比较紫色训练集主柱与顶部深色测试集小段的占比关系;3. 注意顶部百分位色带标出的累积比例,理解多目标样本为何不可忽略

原论文 Figure 1:Distribution of utterances by number of target entities on the LibriSpeech corpus.

论文图 1。原论文 Figure 1:“Distribution of utterances by number of target entities on the LibriSpeech corpus.”。

这张图横轴是每句目标实体数从 0 到 11 以上,纵轴是语音条数,主柱为训练集,顶部细段叠加验证与测试集,顶部还有累积百分位色带。可见含 1 到 6 个目标的柱子都很高,含 7 个以上目标的长尾依然有上 10000 条样本累积,说明多正样本共存是训练与评测都绕不开的常态。这直接引出方法需求:打分函数要对长度不同的实体公平比较,损失函数要允许同一声学锚点同时拉起多个正实体,而不是在归一化分母里让它们互相压制。

COALA 整体走通一个样本要经过哪些步骤?

沿一个样本走一遍有助于建立全景。输入是一段音频 X、其真实转写 Y,以及为该句构造的偏置名单 E,名单含 M 加 1 个实体,其中 e0 是特殊标记<unbiased>。若 Y 中没有出现名单里的任何实体,则<unbiased> 是唯一的正样本;否则<unbiased> 被当作负样本,其余出现在 Y 中的罕见词为正实体集,不在 Y 中的为负实体集。音频经音频编码器与适配器转成音频标记,指令文本与候选实体文本经语言模型的分词器转成嵌入,三者一起送入主干语言模型。

主干输出的每个实体词元的最后隐状态,被送入判别投影器算词元级匹配强度,再按实体长度做平均得到序列级分数。推理时按分数排序取前 K 个实体构造精简提示做最终识别,并用<unbiased> 的分数做阈值过滤更低分的候选。训练分 2 个阶段:先训识别能力,再冻结识别参数、另训打分能力。

看图路径: 1. 先沿左图底部音频与文本输入向上追踪到主干语言模型与判别投影器;2. 再看中图正负实体采样如何汇入偏置打分并输出分数;3. 对照右图三行损失下正负分数的拉与推箭头,理解局部解耦与点式解耦差异

原论文 Figure 2:(a) The proposed COALA framework for biasing scoring, featuring a frozen backbone with trainable…

论文图 2。原论文 Figure 2:“(a) The proposed COALA framework for biasing scoring, featuring a frozen backbone with trainable LoRA modules and a discriminative projector.”。

这张三面板图左为结构,中为采样与打分,右为损失对比。左图可见底部音频编码器块与分词器分别输出音频标记、指令嵌入与实体嵌入,向上进入主干语言模型,顶部再接判别投影器,图例区分可训练、低秩适配、冻结与正负实体分数。中图用一句含人名与解谜内容的例子说明正实体与负实体如何从偏置名单采样并得到分数。

右图把 3 种损失画成分数轴与锚点周围的拉推关系:原判别损失下正样本之间有互斥箭头,多正样本损失把每个正样本单独与负集合对比,解耦点式损失则把每个实体当作独立二分类,箭头不再经过共享归一化。这种从全局排序到局部对比再到点式判别的递进,正是后文公式要形式化的内容。

分数怎么算?判别投影器做了什么变换?

先讲白话再给名称。匹配强度就是音频与某个候选实体有多像的分数,记为 s。判别投影器就是一个两层感知机,负责把语言模型隐状态映射到更适合比对的判别空间,记为函数 f。组合机制需要紧接着说清:语言模型隐状态本身携带生成下一个词的语义偏好,直接用它比对声学容易受词频先验影响;判别投影器另学一层非线性变换,使分数独立于标准词表分布,只反映声学锚点与实体文本的对应程度。

上下文偏置 × 语音增强语言模型: 上下文偏置负责把外部名单中的目标实体拉向正确识别,分工是提供“应该偏向哪些词” 的先验;语音增强语言模型负责把声学特征和语言知识联合解码,分工是提供“听到什么、说什么更通顺” 的主体能力;二者搭配的原因是语音增强语言模型本身对罕见专有名词记忆不足,而直接把大名单塞进提示词又会超窗、引入干扰词,组合意义是让偏置打分先做 1 次声学相关的过滤,只把少量高匹配实体交给语音增强语言模型做最终识别。

具体计算是:对实体 ei 的第 j 个词元,取主干最后一个隐状态 hij,经第一层线性加偏置、ReLU 激活、第二层线性得到标量 f(hij),再对该实体全部 Li 个词元求平均得到 si。长度归一化是为了公平比较长短不同的实体,否则长实体累加更多词元分数会占优。名单构造上,每个实体表示为词元序列,特殊标记<unbiased> 同样参与打分与阈值比较。需要指出,原文明确给出两层权重的维度关系与激活选择,但未报告隐层维度 D 撇的具体数值与初始化方式,这是复现时需要对照开源代码补齐的缺项,不能从主干模型名称推定。

偏置打分 × 判别投影器: 偏置打分负责量化每段音频与每个候选实体之间的匹配强度,分工是给出可排序的分数;判别投影器负责把主干语言模型的隐状态映射到专门的判别空间,分工是把原来用于生成词分布的表示转成适合比对声学锚点的表示;搭配原因是若直接用语言模型词表分布打分,会受高频词先验牵引,组合意义是让匹配强度独立于词表分布计算,使正负实体的分数边界更清晰。

原判别损失对所有分数做全局归一化,形式上是每个正样本的指数分数除以全部实体指数分数之和再取对数平均。当名单中有多个正样本时,提高一个正样本的分数会压低其他正样本归一化后的占比,从而产生梯度冲突,这是单目标假设在多目标数据上失效的关键。

判别损失 × 多正样本: 判别损失负责用全局归一化把正实体分数推高、负实体分数压低,分工是做相对排序;多正样本负责把每个正实体单独与负实体集合对比,分工是解除正实体之间的互斥竞争;搭配原因是原判别损失在一条语音含多个罕见词时会让正样本互相压制、梯度冲突,组合意义是允许多个正实体同时被拉向声学锚点而不互相干扰,从而稳定利用多目标训练数据。

多正样本判别损失把分母改成当前正样本加全部负样本,消除正样本之间的互斥,允许同时拉起多个正实体。但它仍是相对排序,只保证正高于负,不校准绝对量级。解耦点式损失进一步把每个实体当作独立二分类,对正集合用对数 sigmoid、对负集合用对数一减 sigmoid 求和,彻底去掉正负之间的归一化耦合,使正分数趋高、负分数趋低,形成更明确的决策边界。

多正样本判别损失 × 解耦点式判别损失: 多正样本判别损失仍是相对排序,分工是保证正分数高于负分数;解耦点式判别损失把每个实体看成独立二分类,分工是用 sigmoid 校准绝对分数大小;搭配原因是相对排序只关心高低顺序、不校准绝对量级,负样本分数可能整体偏高而决策边界模糊,组合意义是从相对比较转向绝对判别,让正分数趋向高位、负分数趋向低位,形成以零为中心附近的稳定分界面。

两阶段分别冻结谁、更新谁?监督信号从哪来?

训练分 2 个阶段,参数冻结与更新的安排是复现的关键。第一阶段是识别训练:从零训练音频适配器与后接的专用连接时序分类模块,同时用低秩适配微调主干语言模型,共 10 轮,批量为 4。为增强声学与语义对齐,连接时序分类模块的帧级对齐结果被投影到语言模型嵌入空间作为指令解码器的前缀。提示构造时每句最多采样 5 个正实体、放在 10 实体集合中,目的是防止模型过度依赖偏置信息。优化用连接时序分类损失与交叉熵损失联合,权重分别为 0.3 与 1.0。

第二阶段是打分训练:冻结第一阶段所有已训参数,新初始化判别投影器,并在主干内加一个新的低秩适配模块用于打分,共训 7 轮,批量为 1,候选名单规模为 120。基线判别损失需加权 0.1 的辅助对数损失才能收敛,而本文的多正样本与解耦点式损失可作为独立目标收敛,这是原文明确报告的训练稳定性差异。

偏置目标识别 × 特殊标记: 偏置目标识别负责在推理时按打分取前 K 个实体构造精简提示,分工是解决大名单超窗问题;特殊标记<unbiased> 负责表示该句不含名单实体,分工是提供无偏置时的正样本与过滤阈值;搭配原因是若无阈值,取固定 K 仍可能把低分干扰词塞入提示,组合意义是用<unbiased> 的分数过滤更低分的候选,使无实体句不被误偏置、有实体句只保留真正相关的少数实体。

监督来源全部来自已有的转写与名单划分:出现在转写中的名单词为正,未出现为负,无实体句则以特殊标记为正,不引入人工额外标注。推理时按公式算分排序,取前 10 个实体做偏置目标识别,并以特殊标记分数过滤低分实体,依据是约 99% 的语音含少于 10 个实体。硬件预算为单块 24 GB 显存的显卡,批量与名单规模的选择与该预算直接相关,未报告学习率与优化器细节时不应自行假设。

数据、名单、基线与指标的比较条件是什么?

实验条件按问题组织。数据用 LibriSpeech 全量 960 小时训练集,验证用开发集的干净子集,测试分干净与其他两个子集。词汇划分上,先定 5 千高频词为通用词,其余约 20 万低频词为罕见词。每句的偏置名单由该句全部罕见词作为正样本,加上随机采样的未出现罕见词作为负样本补足,评测名单规模取 500、1000、5000 三档,训练打分时的候选规模为 120。

基线包括两类可运行的提示式过滤方法:基于粗粒度连接时序分类解码结果过滤实体的方法,以及对初次转写做模糊匹配再做第二遍实体纠正的知识提示方法;另有原判别损失加辅助损失的联合目标作为损失基线。指标方向要记清:词错误率越低越好,其中偏置词错误率看目标罕见词,无偏置词错误率看通用词是否被误伤;打分侧的召回指标中,达到某召回率所需的平均候选数越小越好,取前若干候选时的召回率越高越好。

下表把数据规模与名单构造的关键条件整理成可核对的形式,数值写法保留原文精度与单位。 表前比较问题是:在什么数据与名单规模下比较才公平?公平条件是同语料划分、同罕见词定义、同名单规模档位,指标方向按上段记忆。

条件规模划分评测名单训练规模硬件预算
LibriSpeech 英文朗读5K 通用词,209.2K 罕见词N 为 500,1000,5000960-hour 训练集,dev-clean 选优24 GB RTX 3090

表后解释是:该表的意义在于锁定复现先做什么——先按同样高低频划分构造正负名单,再在三档名单规模下分别评测,而不是只在小名单上报告。

若改动罕见词定义或只测小名单,偏置词错误率的下降幅度不可直接比较。未胜出项在后文结果中体现:无过滤直接把大名单塞入提示的方法在 5000 规模下会显存溢出,这说明大名单评测必须带过滤机制,否则比较条件不一致。 训练与推理的超参数与流程条件另整理如下,重点是 2 阶段轮数、批量、候选数与阈值依据,同样保留原文数值写法。 表前比较问题是:2 阶段训练与推理过滤的运行条件是否一致可重放?

公平条件是同冻结策略、同候选规模、同取前 K 与阈值规则。

阶段训练轮数与批量候选与提示规模损失权重推理过滤
阶段 1 识别训练10 轮,批量 4每提示至多 5 正实体共 10 实体CTC 权重 0.3,交叉熵 1.0音频标记作前缀
阶段 2 打分训练7 轮,批量 1候选名单 120 个实体基线需 0.1 辅助损失,本方法独立收敛取前 10,以特殊标记过滤,99% 语音少于 10 实体

表后解释是:该表的主要收益是让复现者按冻结关系操作——第二阶段冻结识别参数、只训新投影器与新增低秩模块;代价是批量为 1、轮数为 7,打分训练吞吐较低。

反例是若在第二阶段同时解冻识别参数,原文没有报告对照结果,不能声称一定更好或更差,属待验证的改动。

过滤准不准?最终识别在三档名单下表现如何?

先看打分过滤本身。原文报告在 5000 规模名单下,基线联合目标在干净集与困难集上达到一定召回水平,而多正样本损失进一步压缩达到高召回所需的平均候选数,解耦点式损失在取前 20 与前 50 时的召回率最高,干净集取前 20 的召回接近 99%。这支持的判断是:点式解耦不仅减少候选数,还把目标稳定排进前列。限制是这些召回数字是在名单规模 5000、候选 120 训练、取前 K 评测的条件下得到,换名单规模或 K 值时不可直接套用。

提示式基线明显落后,原文归因于它们依赖初次转写,初次听错会导致过滤错误传播,在困难集上退化更严重。 再看最终识别。无偏置时本方法主干较小,通用与偏置词错误率落后于引用基线;但加偏置后趋势反转:不做目标识别、直接把全名单塞入提示的做法在小名单上仅轻微有效,到 5000 规模因上下文超限而显存溢出,无法运行。

接入解耦点式损失训练的过滤器后,三档名单下的偏置词错误率都大幅下降,且通用词错误率没有明显恶化,说明精简提示既救回罕见词又控制了误伤。需要区分可部署收益与事后最优:原文同时给出理想提示的上界,即假设过滤全对时的错误率,它明显更低,但那是不可部署的 oracle,不能当作方法收益,只能用来看还有多少差距。

看图路径: 1. 先确认横轴为每句目标实体数、纵轴为偏置词错误率;2. 比较最下方浅色理想线与紫色本方法线在各实体数下的间距;3. 观察蓝色两条基线在多实体段的起伏,判断过滤精度差异

原论文 Figure 3:B-WER of COALA-based ASR using biasing prompts from various filter methods on testsets across…

论文图 3。原论文 Figure 3:“B-WER of COALA-based ASR using biasing prompts from various filter methods on testsets across different numbers of target enti- ties. The COALA is optimized via DPD-Loss.”。

这张图横轴是每句目标实体数,纵轴是偏置词错误率,4 条线分别为理想提示、本方法、两类提示式基线,本方法用解耦点式损失训练。可以看到理想线始终最低,本方法线紧随其后且随目标数增加保持平稳,而两条基线在目标数较少时已明显偏高,在多目标段虽有波动但始终未追上本方法。即使本方法取前 10 的策略理论上无法覆盖含 11 个以上目标的语音,它在高密度段仍优于基线,原文解释为排序精度高、部分检回已能显著改善识别。这支持过滤精度转化为识别收益,但不等于每句都全对,长尾漏检仍是边界。

换损失后分数分布发生了什么变化?

为验证损失改动的机制,原文按单目标、中等目标数与多目标数分组,画出正负实体分数的箱体分布。基线联合目标下正实体分数未能充分抬高,原文归因于全局归一化约束与辅助对数损失目标不对齐。多正样本损失能把正样本推高,但负样本分数压得不够低,原文解释为相对排序只管高低顺序、不校准绝对量级,决策边界仍模糊。解耦点式损失同时做到抬高正样本、压低负样本,形成更稳定的分界面。

看图路径: 1. 先按图例区分绿色正样本与橙色负样本箱体;2. 横向比较单实体、中等多实体三组下正负箱体的分离程度;3. 纵向比较三种损失面板中负样本箱体的绝对位置高低

原论文 Figure 4:Distribution of biasing scores for positive and negative entities across different objective…

论文图 4。原论文 Figure 4:“Distribution of biasing scores for positive and negative entities across different objective functions.”。

这张图分三块面板分别对应基线联合损失、多正样本损失与解耦点式损失,每块内按单、中、多 3 组显示绿色正样本与橙色负样本箱体。可见基线面板正负箱体间距较小且正箱位置偏低;中间面板正箱上移但橙色负箱仍偏高;右侧面板绿色正箱稳定在高位、橙色负箱稳定在低位,3 组目标数下分离都较清晰。这是从相对排序到绝对判别的直观证据,但要注意像素不能精确读出具体分数值,判断应停留在分离趋势与相对位置,不硬写箱体数值。

该分析还支持一个适用条件:若应用只关心排序先后,多正样本损失已够用;若下游要用固定阈值过滤,解耦点式损失的绝对校准更有价值。

哪些情况仍会失败?哪些量没有被测量?

先说已报告的失败与边界。取前 10 加特殊标记阈值的策略决定了含 11 个以上目标的语音理论上无法全覆盖,长尾句必然漏检;直接用全名单提示在 5000 规模下显存溢出,说明无过滤方案不可部署,大名单比较必须带过滤。主干语言模型仅百兆量级加语音编码器,在无偏置配置下落后于更大的引用基线,说明本文收益集中在偏置场景,不代表通用识别全面领先。

原文未测量推理延迟、吞吐与过滤器的误判率,也未报告学习率、优化器与投影器隐层维度,训练成本只给出显卡型号与批量轮数,不能据此承诺延迟改善或成本最优。相关性不等于因果:分数分离与偏置词错误率下降同时出现,支持判别改进有帮助,但不能排除精简提示减少干扰本身带来的增益。总体趋势不等于每组都成立,高密度段仍有波动,个别目标数下的起伏不应推广为单调规律。

要复现应按什么顺序核对?先跑通什么?

复现先做数据与名单:按 5 千通用、其余罕见的划分,为每句构造正为句内罕见词、负为随机采样未出现罕见词的名单,复现 500、1000、5000 三档评测名单与 120 规模的打分训练候选。接着跑 2 个阶段:第一阶段联合训练音频适配器、连接时序分类模块并用低秩适配微调主干,权重按 0.3 与 1.0 设置,提示中限制正实体数以防过度依赖偏置;第二阶段冻结前序参数,只训新判别投影器与新增低秩模块,批量为 1 训练 7 轮,基线需加 0.1 辅助损失而本方法可独立收敛。

推理时先算分排序取前 10,再用特殊标记分数过滤低分候选,然后构造精简提示做识别。核对点包括长度归一化是否对长短实体公平、无实体句是否以特殊标记为正、验证集是否用干净子集选优。代码当前可用,可对照仓库核对缺失的隐层维度、学习率与分词细节;若显存不足,应优先减小候选规模或分批打分,而不是直接放大提示长度,否则会复现出溢出而非性能差异。

何时值得尝试这种先过滤后识别的路线?

当偏置名单从几十扩大到上千、且语音中常出现多个罕见词时,值得尝试先打分过滤再识别的路线,因为它把上下文窗口的压力从装下整个名单降为装下前 K 个高可信实体,同时减少干扰词对解码的牵引。若名单很小且单目标为主,直接把名单拼进提示可能已够用,不必引入 2 阶段训练与阈值调参。若应用需要固定阈值做在线过滤,解耦点式损失的绝对分数校准更合适;若只做排序取前 K,多正样本损失已能缓解正样本互斥。

还需补的验证包括:更换主干规模后收益是否保持、在噪声更大的真实场景下误过滤率如何、过滤与识别联合微调是否进一步提升。记住关键信息条件:名单定义、候选规模、取前 K 与特殊标记阈值共同决定结果,改任一条件都需重新比较,不把理想提示的上界当作可部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总