英文题目:Margin-Aware Contrastive Regularization for Robust Streaming Keyword Spotting under Strict False-Alarm Constraints

会议身份:conference:interspeech:2026:conference-paper-id:zhang26ha_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #鲁棒性 #严格因果 #流式处理 #关键词检测

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Hanwen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Guosong Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhen Qin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

流式关键词检测(Streaming Keyword Spotting,SKS)须在连续音频中满足每小时0.5次以下误报的同时保持检出率,难点是因果轻量模型在交叉熵训练下缺乏表示间隔,被迫抬高阈值后对音近冒名者严重漏检。先进行离线难负挖掘,以训练音频窗为输入,用指数滑动平均模型按目标后验排序筛选前五千非目标窗并定期刷新队列,输出边界混淆候选集供后两步使用。再执行目标受限类内拉拢,以候选集中的同关键词嵌入为输入,仅压缩相同目标词类内方差形成紧致目标簇,输出的锚点直接送入排斥步骤,而异质未知类不参与聚类以避免流形畸变。最后施加间隔感知硬负排斥,以目标锚点与难负对为输入,仅在余弦相似超过安全间隔时加权惩罚并与交叉熵联合作为离线辅助目标训练,训练后整体移除,这区别于全局对比聚类与均匀角间隔的无差别约束。在Google Speech Commands V2连续流评测协议下,MACR在0.2 FA/h处的FRR错误率为14.80%,低于标准CE基线的FRR错误率29.85%。结论仅适用于英文10目标词严格误报流式设定,未验证自定义唤醒词、多语种与远场混响外推。该结论适用边界受限于英文闭集流式场景,跨语种与远场外推尚未验证。部署保持因果零前视与同等计算图,训练增加对比分支与挖掘队列开销但推理零附加参数、乘加与延迟。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么矛盾?

本文输入是谷歌语音命令第二版 12 类协议下的连续音频流,目标是在边缘端常开关键词检测中同时满足严格误报预算和高检出灵敏度。输出是事件级检测判决,即在因果滑动窗、平滑与不应期后处理下,判断 10 个目标关键词是否在容差窗内出现。

必须保留的信息是评估工作点、基线条件与部署代价,本文把工作点固定为每小时误报次数,重点考察 0.5 至 0.2 次每小时的严格区间,基线是约 150K 参数的因果 1 维卷积网络加标准交叉熵,部署代价用参数量、乘加次数、算法前视与实测延迟衡量。中心矛盾是孤立片段封闭集准确率好看,不代表连续流低误报下可用,论文报告交叉熵基线封闭集准确率达到 95.82,而在 0.2 次每小时下漏检率恶化到 29.85,表头单位为%,说明阈值收紧后系统过于保守。

解读目标是让研究生能复述训练时做了什么整形、评估时如何校准阈值、数字在什么条件下成立,不做超出证据的推广。资源状态方面,本次没有发现来源绑定且完成安全验证的代码模型数据资源,因此不声称代码模型或数据已公开,只讲论文内可核对的方法与实验条件。

已有路线如何压误报,各自留下什么缺口?

论文把相关路线放在同一输入与同一运行阶段下对照。第一类是难例概率加权,以焦点损失为代表,做法是在分类损失中放大难样本权重,本文将其作为可运行基线对比。第二类是跨层判别一致性,以跨层判别一致性方法为代表,做法是约束不同层表示保持判别一致,同样作为可运行基线。第三类是合成难负例扩增,以字素扩增合成冒充词为例,做法是人工构造发音相近的非目标样本参与训练。

第四类是有监督对比学习与角间隔损失,以标准有监督对比和附加角间隔为代表,做法是在嵌入空间施加聚类或角度间隔。论文指出这些路线在孤立分类上可能有效,但在连续流严格误报下仍保留高漏检,更重要的是直接把未知类当作普通紧凑类做全局聚类会带来表示风险。未知类不是一个声学紧凑类,而是聚合了多种非目标语音、噪声与静音,若强行压成单一中心或均匀角扇区,会扭曲自然声学流形。

论文用实验支持这一判断,标准有监督对比封闭集准确率为 95.50%,在 0.2 次每小时下漏检率为 21.40%,附加角间隔虽然封闭集准确率达到 96.10%,但在 0.2 次每小时下漏检率仍为 23.50%,说明均匀几何约束没有解决边界混淆问题。

为什么阈值收紧后漏检会急剧恶化?

问题可以沿一个样本走一遍。取一个 1 秒因果分析窗,输入是 64 维对数梅尔谱,主干输出倒数第二层嵌入,分类头给出目标后验,经过 50 毫秒滑动平均与 500 毫秒不应期后与阈值比较,若超过阈值且落在正 -200 毫秒容差内则记 1 次命中。交叉熵训练只要求分类面把训练片段分开,没有显式要求目标嵌入与发音相近冒充者之间留出几何安全距离。

在连续流中,冒充者会反复出现并产生较高的目标后验,为了把每小时误报压到 0.5 次以下,必须把检测阈值调高,阈值调高后部分真目标也被压掉,于是漏检率上升。论文把这种现象称为表示间隔不足,并用阈值独立校准的协议来暴露它,每个模型先在隔离验证流上校准到预定误报率,锁定阈值后再到未见测试流上测漏检率,因此漏检差异不能用阈值选择不公平来解释。

交叉熵分类边界 × 表示间隔: 交叉熵分类边界负责把孤立片段分到正确类别,分工是建立可用的判决面;表示间隔负责让目标词嵌入与冒充者嵌入在余弦空间保持安全距离,分工是抵抗流式阈值收紧时的混淆。两者搭配的原因是只有边界没有间隔时,严格误报约束下阈值上调会同时压掉真目标,组合意义是把分类正确扩展为在低误报工作点仍然可检出。

教学上可以举一个例子帮助理解,但例子不带论文数值。假设目标词与某个未知词共享一段相似音节,它们的嵌入在余弦空间靠得很近,交叉熵可能仍能把训练集中的孤立片段分对,因为分类面恰好穿过两者之间。可是一旦部署流中混入噪声且阈值被调高,真目标的后验峰值被平滑压低后就过不了阈值,而冒充者的峰值偶尔仍能越线,这就是严格工作点下漏检与误报同时难压的原因。本文要做的不是改解码启发式,而是离线重塑嵌入几何,让目标更紧、冒充者更远。

方法全景如何做到训练整形、部署不变?

方法全景分为离线训练与端侧流式推理两条路径。离线训练时,同一因果 1 维卷积主干同时连接两条分支,一条是常规分类头加交叉熵损失,另一条是先做归一化投影到单位超球面再计算边距感知对比正则,总目标是交叉熵加权重系数乘以对比正则。部署时直接删掉对比分支,分类前向路径、参数量、乘加次数、算法前视与延迟都与交叉熵基线完全相同。论文强调解码、平滑与阈值在所有方法间保持一致,因此增益只能归因于训练目标改变的表示几何。

下面这张方法总览图把上述分叉与删除动作画了出来,左边是离线训练的双分支联合优化,右边是推理时删掉分支后的相同因果图,阅读时应先确认主路径不变,再确认辅助分支的作用范围。

本段是该图的导读,读图前先明确要核对 3 个对应关系。第一是输入到嵌入到两个损失的箭头走向,第二是辅助框内拉紧与推斥各自处理哪类样本,第三是右侧被划掉分支与零额外开销清单如何对应正文的部署保证。带着这 3 个问题看图,就能把文字中的目标受限与间隔加权落到具体模块。

看图路径: 1. 先从左上输入声学特征沿因果一维卷积主干走到倒数第二层嵌入,确认分类头与对比分支的分叉点;2. 再看橙色辅助框内左右两个子块,确认左侧只拉目标词、右侧对难冒充者做带间隔推斥;3. 最后看右侧部署图被红叉划掉的分支与下方零额外开销清单,确认推理图与训练图的区别

原论文 Figure 1:Method overview of Margin-Aware Contrastive Reg- ularization (MACR) for streaming KWS.

论文图 1。原论文 Figure 1:“Method overview of Margin-Aware Contrastive Reg- ularization (MACR) for streaming KWS.”。

从实际收到的像素看,左上标注了 1 秒 64 维对数梅尔输入与因果 1 维卷积主干,主干下方注明与部署共享且零前视。主干后分出分类头与归一化向量,分别走向交叉熵损失与橙色辅助框,辅助框内左侧画出目标词嵌入互拉的示意,右侧画出蓝色目标点与红色难冒充者点之间带间隔的推斥示意,底部注明对比损失等于拉紧项加推斥项,并汇入联合训练目标。

右半部分是端侧推理,主干与分类头后接检测判决,被红叉覆盖的是训练用对比分支,下方清单写明零额外参数、零额外乘加、零额外延迟、无新增前视。图中左下还明确写出未知类不做全局聚类,这与正文限制拉紧分母只含目标词的设计一致。

拉紧项只拉谁,分母为什么不放未知类?

先沿一个锚样本走完拉紧计算。设小批量为集合,锚样本属于 10 个目标关键词之一,与它同标签的其他目标样本构成正样本集,只有当正样本集非空且锚本身是目标词时,该锚才参与拉紧。拉紧采用带温度系数的对比形式,分子是锚与同关键词正样本的指数相似度,分母只对其他目标关键词样本求和,温度系数取 0.1。

关键动作是分母被严格限制为只含目标词样本,不放入未知类与静音类,这样拉紧只解决关键词之间分离与类内紧致,把冒充者与目标的边界 enforcement 完全交给推斥项。这种解耦是有意的,因为未知类与静音类覆盖异质非目标内容,若把它们也拉成紧簇或放进分母做全局排斥,会迫使多样背景挤向单一表示,论文称之为全局排斥的结构缺陷。

目标受限拉紧 × 未知类异质性: 目标受限拉紧只对结构一致的 10 个目标关键词做同类聚拢,分工是降低类内方差并分开不同关键词;未知类异质性指未知语音包含多种非目标说话内容、噪声与静音,分工是要求保留其自然分散。搭配原因是若把未知类也压成一个中心会扭曲流形,组合意义是只整顿目标侧,把背景多样性留给排斥项局部处理。

实现上需要分层采样保证每批出现多个不同目标关键词,否则会出现空分母。论文使用分层小批量采样,批量一百二十八,明确要求防止公式一的分母为空。训练时拉紧与交叉熵共存,交叉熵维持孤立判别力,拉紧负责压缩同词方差,两者通过权重系数联合优化,论文取该系数为 0.5。

推斥项何时计罚,难负例权重如何起作用?

再沿同一个目标锚走完推斥计算。对该锚,所有标签不同的样本构成负样本集,只要负样本集非空,该锚就参与推斥。推斥不做无界排斥,而是设几何安全间隔 m,论文取 0.4,只有当锚与负样本的余弦相似度超过该间隔时才产生正比于超出量的惩罚,否则计零。这意味着已远离的简单背景不消耗梯度,优化集中在边界混淆者上。权重进一步区分难易,若负样本被标记为离线挖掘的难冒充者,则权重取大于一的系数,论文取 2.0,否则取 1。

完整对比正则等于拉紧项加推斥项,总损失等于交叉熵加系数乘以该正则。难负例来自训练划分中的非目标音频,具体做法是用训练网络的指数滑动平均跟踪演化中的判决面,取目标后验最高的非目标窗作为前 5000 个难窗,每 5 轮刷新 1 次,并用二值指示标记是否难例。

间隔排斥 × 难负例加权: 间隔排斥只在负对余弦相似度超过间隔 m 时才计罚,分工是放过已远离的简单背景、集中处理边界样本;难负例加权给离线挖掘的高目标后验非目标窗更大权重,分工是指出哪些冒充者最可能触发误报。搭配原因是均匀推开所有负样本会浪费梯度并误伤背景,组合意义是让梯度优先扩大目标与真混淆者之间的局部边界。

这种设计与标准有监督对比的区别在于两点。一是不对未知类做全局聚类,避免失真,二是不做无界全局推斥,避免过度惩罚已分开的背景噪声。消融结果支持间隔与加权的必要性,去掉间隔后 0.5 次每小时下漏检率从 7.64% 升到 9.80%,去掉难负例加权后升到 10.15%,说明均匀处理背景会削弱来自声学混淆冒充者的学习信号。

训练如何组织联合优化与难例刷新?

训练使用自适应矩估计权重解耦版本,共 120 轮,前 5 轮热身,学习率从千分之一按余弦衰减到十万分之一,权重衰减取万分之一,论文说明该衰减有助于稳定归一化分支与未归一化交叉熵分支的联合优化,防止早期交叉熵梯度淹没对比梯度。增强与基线完全相同,包括正负 0.1 秒时间偏移、信噪比均匀分布在负 5 到 10 分贝的噪声混合,以及频率掩蔽。

难负例挖掘异步进行,用衰减系数 0.999 的指数滑动平均模型对训练非目标窗打分,取目标后验最高的前五千窗,每 5 轮刷新。模型选择依据验证流在 0.5 次每小时校准阈值后的漏检率,而不是封闭集准确率,这保证选出的检查点是为严格流式工作点优化的。需要指出的缺项是论文未报告随机种子方差的完整训练细节与投影头之外的梯度截断策略,除权重衰减与优化器设置外,其他稳定化技巧没有明确说明,不应从模型名称推定实现。

离线辅助正则 × 零额外部署开销: 离线辅助正则指对比分支只在训练时改变主干嵌入几何,分工是提供整形信号;零额外部署开销指推理时删掉该分支并保持分类头与因果图不变,分工是保证边缘端可部署。搭配原因是把鲁棒性来源放在训练目标而非解码启发式,组合意义是训练后即可丢掉正则分支而不改变参数量、计算量与算法延迟。

推理与训练的计算过程是分离的。训练时前向要走主干、分类头与对比分支,反向同时更新主干与分类头,对比分支本身不引入可部署参数。部署时对比分支被完全丢弃,前向只剩因果主干加分类头,滑动窗为 1 秒因果窗、步长 10 毫秒,后处理为 50 毫秒滑动平均加 500 毫秒不应期,阈值来自验证流校准并在测试流上锁定。因此训练成本高于基线,但推理成本与基线逐项相同。

数据、流构造与阈值校准如何保证可比?

数据采用谷歌语音命令第二版标准 12 类协议,封闭集准确率只在标准孤立测试划分上报告。连续流评估是本文的主要依据,测试集由 50 条独立合成的 2 小时流组成,共 100 小时,每条流嵌入 2000 个类别均衡目标事件,验证与测试流使用划分特定的目标、未知与静音样本,且背景噪声段不相交,混合信噪比为 SNR ∼U[−5, 10] dB,保留末尾单位覆盖整组的写法。

论文说明该构造遵循常开评估实践,用长时流获得稳定的漏检率估计,并承认合成嵌入流是对完全自然录音的补充,而非替代。主干约束方面,所有配置使用相同的因果 1 维卷积主干,约 150K 参数,时间卷积采用因果填充保证零前视,声学特征为 64 维对数梅尔谱。

基线公平性方面,标准有监督对比按规范带两层多层感知机投影头训练、推理时丢弃并把未知类当普通类,附加角间隔作为零开销角间隔对照,焦点损失、跨层一致性与字素扩增也使用相同主干与相同增强。阈值校准方面,每个模型在隔离验证流上独立校准到预定每小时误报,锁定后在未见测试流上测事件级漏检率,命中容差为正 -200 毫秒,目标为 10 个关键词,静音与未知在检测中视为非目标背景类。

硬件预算方面,在树莓派四代单线程下按 1 秒窗前向测量延迟,流式按 10 毫秒步长重复推理,论文报告基线与本方法均为 2.15 ± 0.05 ms,参数量 150K,计算量 5.2M MACs,算法前视为 0 ms。

严格误报下漏检改善多少,代价是什么?

本节要回答的比较问题是在主干、增强、解码与阈值校准完全一致时,不同优化目标在严格误报下的漏检差异,指标方向是封闭集准确率越高越好,连续流漏检率越低越好。表前需要明确公平条件,主干同为 150K 参数因果 1 维卷积,流构造与阈值锁定流程相同,数字为 50 条流上的均值与标准差。下表整理论文报告的核心可运行策略,覆盖基线、角间隔与本方法在封闭集与多个误报工作点的表现,重点看 0.5 与 0.2 次每小时两列,表头单位为%,数据格保留裸值不逐格追加%。

方法封闭集准确率 (%)连续流漏检率在 1.0 次每小时 (%)连续流漏检率在 0.5 次每小时 (%)连续流漏检率在 0.2 次每小时 (%)
标准交叉熵基线95.82 ± 0.148.52 ± 0.516.32 ± 0.829.85 ± 1.2
附加角间隔96.10 ± 0.107.30 ± 0.413.50 ± 0.623.50 ± 1.0
边距感知对比正则95.68 ± 0.124.85 ± 0.27.64 ± 0.414.80 ± 0.7

表后解释主要收益与具体代价。论文报告在 0.5 次每小时下漏检率从 16.32 降到 7.64,表头单位为%,在 0.2 次每小时下从 29.85 降到 14.80,表头单位为%,对应 15.05-percentage-point 的绝对下降与 50.4% 相对下降,而封闭集准确率从 95.82 微变为 95.68,表头单位为%,变化仅 0.14。未胜出项需要就近说明,附加角间隔虽然封闭集准确率最高达到 96.10,表头单位为%,但在 0.2 次每小时下漏检率仍为 23.50,表头单位为%,标准有监督对比封闭集准确率为 95.50 且在 0.2 次每小时下为 21.40,焦点损失、跨层一致性与字素扩增在极端阈值下仍保留高漏检,分别为 26.10、28.45 与 27.40,表头单位均为%。

这支持论文的判断,即均匀角间隔或全局对比聚类没有解决未知类异质性带来的边界问题,而目标受限拉紧加难冒充者间隔分离提供了更稳的低误报工作点。

事件级流式评估 × 封闭集准确率: 事件级流式评估在长时连续流上先按误报每小时校准阈值再测漏检率,分工是反映部署约束下的可用性;封闭集准确率在孤立片段上测分类对错,分工是反映基本判别力。搭配原因是孤立准确率高不等于低误报下不漏检,组合意义是用两套指标共同判断方法是真正改善边界还是只优化了孤立分类。

限制是这些数字只在英文多关键词严格误报流式设定下成立,论文结论部分明确把更广语言、自定义唤醒词与远场条件留作未来工作,不能把单数据集结论推广为所有场景成立。

拿掉间隔、加权或放开未知类聚类会发生什么?

消融要回答的是正则中哪个部件真正贡献了严格工作点的鲁棒性,比较条件是同一 150K 参数主干与 0.5 次每小时工作点,指标方向仍是漏检率越低越好。表前先提出 3 个待验证操作,去掉安全间隔、去掉难负例加权、把未知类纳入全局聚类,公平条件是其他超参数与流协议不变。下表用五列呈现配置、准确率、漏检率以及对应开关,便于把机制与数字对齐,准确率与漏检率表头单位均为%,数据格保留裸值。

配置封闭集准确率 (%)连续流漏检率在 0.5 次每小时 (%)安全间隔 m难负例加权
完整边距感知对比正则95.687.640.42.0
去掉安全间隔95.659.8002.0
去掉难负例加权95.7110.150.41
全局聚类未知类94.1513.600.42.0

表后解释支持的判断与边界。论文报告去掉间隔后漏检率从 7.64 升到 9.80,表头单位为%,说明无间隔排斥较难集中优化边界混淆负样本。去掉加权后升到 10.15,表头单位为%,说明均匀优化一般背景会稀释来自声学混淆冒充者的信号。全局聚类未知类时封闭集准确率掉到 94.15,漏检率恶化到 13.60,表头单位均为%,论文将其归因于非目标声学内容异质,尤其是未知类包含词表外语音与多变干扰,支持把拉紧限制在结构一致目标词的设计。需要注意缺失证据不是技术错误,论文未报告不同间隔取值与不同加权系数的完整扫描曲线,因此不能断言 0.4 与 2.0 全局最优,只能说在报告配置下两者均有贡献。

哪些结论尚未验证,哪些数字不能承诺?

论文直接报告的是在谷歌语音命令第二版与事件级合成流协议下的改善,显示在严格误报下漏检大幅下降且封闭集准确率基本保持。有限解释是把全局聚类未知类导致退化的原因归于流形扭曲,这一解释有消融数字支持,但未提供嵌入可视化或拓扑度量的直接证据,因此用支持而非证明来表述更准确。

未验证推测包括跨语言、自定义唤醒词、远场混响与完全自然长录音下的表现,论文已在结论中明确限定为英文多关键词严格误报流式设定, broader 条件待未来工作。成本方面,论文只测量了推理端参数量、乘加与单窗延迟,未报告训练额外耗时与内存占用,也未测量误判率之外的功耗与实际端到端唤醒延迟,因此不能承诺训练成本不变或全链路延迟改善。

统计方面,主结果给出 50 条流上的均值与标准差,但未说明显著性检验方法,不能把每条流都改善的结论强加于总体趋势。相关性不等于因果,阈值校准与流构造相同是公平比较的必要条件,但仍不能排除难例挖掘轮次与模型选择工作点带来的选择效应,复现时应固定验证工作点再比较。

复现应先固定什么,再调什么?

复现先做三件固定工作。第一是固定数据与流协议,使用标准 12 类划分报告封闭集准确率,用划分特定的目标、未知、静音与不相交背景噪声段构造验证与测试流,混合信噪比均匀分布在负 5 到 10 分贝,测试用 50 条 2 小时流、每条 2000 个均衡目标事件,验证流独立校准阈值后锁定。

第二是固定主干与推理流程,使用相同因果 1 维卷积、64 维对数梅尔、1 秒因果窗、10 毫秒步长、50 毫秒滑动平均、500 毫秒不应期与正 -200 毫秒容差,解码与阈值流程在所有方法间保持一致。第三是固定优化与选择标准,使用批量一百二十八、120 轮、5 轮热身、学习率从千分之一余弦衰减到十万分之一、权重衰减万分之一、相同时间偏移噪声混合与频率掩蔽,按验证流 0.5 次每小时下漏检率选检查点。

关键超参数保留原文值,间隔 0.4、难权重 2.0、温度 0.1、正则权重 0.5、难窗前五千、指数滑动平均衰减 0.999、每 5 轮刷新、分层采样保证每批多个目标词。何时值得尝试是当系统已在孤立准确率达标但在低误报下漏检陡增,且未知类明显异质时,可优先试目标受限拉紧加难冒充者间隔。若封闭集本身欠拟合或误报预算宽松,则该正则的收益可能不明显,还需补做自然录音与远场验证才能确认部署价值。

一句话收束:何时用、何时不用?

综合全部证据,本方法适合已用轻量因果模型且被严格误报预算卡住漏检的流式关键词系统,它通过离线重塑目标紧致与冒充者间隔来换取低误报下的可用性,而不改变部署图。当未知类异质且难冒充者是主要误报来源时,这种不对称整形比全局对比聚类或均匀角间隔更对症,论文在主干不变下把 0.5 次每小时漏检从 16.32% 降到 7.64%、0.2 次每小时从 29.85% 降到 14.80%,封闭集准确率仅从 95.82% 变为 95.68%,且在精简深度可分离卷积与广播残差网络上也观察到一致的漏检缓解。

不适合的情况是训练数据本身不足以挖出代表性难冒充者,或评估只看孤立封闭集准确率,此时正则可能只带来微小变化。常见误解是把封闭集准确率最高等同于流式最稳,附加角间隔的 96.10% 准确率伴随 23.50% 的严格工作点漏检就是反例。另一个误解是把对比学习等同于必须聚类所有类,本文恰好证明不对未知类聚类才是关键。

收束为可执行判断,若复现后在验证流严格工作点看到漏检下降而封闭集基本持平,则可认为复现了论文主张,若只看封闭集排序则会错过真正的部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总