英文题目:Progressive Learning for Robust Speaker Representation

会议身份:conference:interspeech:2026:conference-paper-id:keetha26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #对比学习 #鲁棒性 #跨语言 #说话人验证

评分:5.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Nikhil Keetha:机构信息未能从会议 PDF 纯文本可靠映射
  • Hima Jyothi R:机构信息未能从会议 PDF 纯文本可靠映射
  • Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
  • Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
  • Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
  • Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

说话人验证需将变长语音映射为定长身份向量,在噪声混响与跨语言训练测试不一致时保持同人聚合异人分离,难点是共享语言音系会主导向量导致异人误识与同人跨语言误拒。第一阶段在TidyVoice多语言数据上以加性角度间隔损失微调重塑维度网络ReDimNet-B6主干,配合音乐语音噪声、房间脉冲响应与变速扰动学习噪声鲁棒分类空间并输出192维向量。第二阶段冻结主干,在其固定表征上训练轻量残差卷积投影网络,以均衡采样跨语言三元组损失直接优化归一化向量余弦距离几何并输出256维向量。与单一分类损失或梯度反转对抗去语言不同,该分工将声学鲁棒留给增强加分类学习,将语言不变留给冻结表征上度量学习,规避联合对抗优化不稳定,其适用边界在于依赖域内多语言数据与均衡三元组构造。在 TidyVoice 开发集全量目标对全量非目标上等错误率(Equal Error Rate, EER)为1.58%,相对挑战基线 SimAM-ResNet34 的3.07%下降约1.49个百分点,最小检测代价(minDCF, Ptarget=0.01)从0.8200降至0.6481。结论边界是盲测未见语言上误差仍远高于开发集,多语言高度重叠说话人簇间距仍小,投影网络仅256.13 K参数、27.36 M MAC/s,原文未披露训练硬件、时长与端侧时延。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么值得做?

本文的输入是一段采样率为 16 千赫兹的语音,输出是一个定长说话人向量,验证时用余弦相似度比较注册语音和测试语音的向量,判断是否为同一人。目标读者是刚进入语音领域的研究生,需要保留的关键信息是任务定义、2 阶段做了什么、数据与增强条件、评价指标方向以及可复述的训练动作。本文的输出是 1 篇可核对的方法解读,不评价商业价值,只讲论文实际给出的安排与数字。

说话人确认听起来简单,把声音丢给模型提取特征再比一比即可,但在跨语言和噪声下会系统性失效。论文把失效归纳为两种:不同人说同一种语言时因共享音素模式被误接受,同一人换语言时因声学特征大变被误拒绝。根因是嵌入向量把与身份无关的语言内容也编码了进去。教学上可以这样理解,例子:同一位说话人分别用印地语和英语各说一句,理想向量应该靠近,但若模型记住了语言的发音特点,两句就会被推远,这就是需要语言不变表示的原因。

噪声和混响是第二条失配轴。真实部署中注册环境干净、测试环境带噪声,或者 2 次录音房间不同,都会改变频谱包络。论文因此把声学鲁棒放在数据层解决,把语言不变放在训练阶段解决。两条路线分工不同,后文会沿着一个样本走完从滤波器组特征到最终向量的全过程,再看实验如何分别检验它们。

此前路线如何走到跨语言验证?

早期说话人识别用高斯混合模型加通用背景模型刻画说话人声学分布,随后用身份向量把充分统计量投影到低维固定长度表示。深度学习接管后,直接从音频学习说话人判别特征,损失从交叉熵走向角度间隔损失,在超球面上塑造类间可分性。这条路线在单语干净条件下有效,但在噪声、混响和跨语言下退化明显。

为应对退化,文献尝试过多条件增强、对抗训练和大规模多语言语料。论文提到声纹常用语料让模型见到更多条件,结构化多语言基准则把试验分成 4 种组合:同人同语言、同人异语言、异人同语言、异人异语言。2026 年挑战所用基准覆盖 4474 位说话人、40 种语言、457 小时音频,专门考察跨语言验证。本文选择在该基准上做渐进训练,而不是另起新任务。

同输入同目标的对照包括官方基线 SimAM-ResNet34,它已在相关大规模数据预训练并由组织者在目标数据上微调。论文还报告了未做领域自适应的 ReDimNet-B6 在目标数据上的表现,用来说明更强主干本身就有竞争力。相关工作不是要分高下,而是说明本文的增量来自领域自适应加度量学习,而非换了一个不公平的评价协议。

要解决的跨语言错误如何定义与划分?

论文把 1 次验证试验定义为 1 次注册与测试配对,按说话人是否相同、语言是否相同分成 4 类。记同说话人为 SS,异说话人为 DS,同语言为 SL,异语言为 DL,则共有 SS-SL、SS-DL、DS-SL、DS-DL 4 种原子条件,评价时再组合成目标对非目标的试验,例如用 SS-DL 做目标、用 DS-SL 做非目标,就同时要求跨语言接受同一个人、又拒绝说同一种语言的不同人,这是最难的组合。

指标用等错误率和最小检测代价。等错误率越低越好,最小检测代价在目标先验为 0.01、漏检与误报代价均为 1 时计算,同样越低越好。开发集报告总体指标和分条件指标,盲测集报告两套零样本程度不同的集合。理解后文数字的关键是先看试验组合,再看指标方向,不能只看总体值。

论文还指出梯度反转等对抗去语言思路曾被尝试,但在本任务上未带来提升,因此未进入最终系统。这是一个已验证的失败条件,说明语言不变不是加一个对抗分支就能自动实现,后文的均衡采样与 2 阶段冻结策略是替代方案。

两阶段渐进学习的全景是什么?

方法全景可以沿一个样本走一遍。输入是 72 维对数梅尔滤波器组特征,帧长 25 毫秒、帧移 15 毫秒并做倒谱均值归一化。样本先经过 ReDimNet-B6 编码器得到 192 维向量,再经过轻量卷积投影网络得到 256 维向量并做归一化,最终向量用于余弦打分。第一阶段训练编码器做说话人分类,第二阶段冻结编码器只训练投影网络做跨语言三元组学习。

下图展示了推理时的数据流与模块边界,左侧是频谱输入,中间是冻结编码器,右侧是轻量网络与归一化输出,虚线表示残差旁路把原始嵌入内容保留下来。

看图路径: 1. 沿左侧梅尔频谱图向右追踪主路径经过冻结编码器到 256 维输出;2. 观察轻量网络内部线性支路与三层一维卷积支路在加号处汇合;3. 确认末端归一化模块的位置及其与最终嵌入维度的对应关系

原论文 Figure 1:Two-stage speaker embedding pipeline.

论文图 1。原论文 Figure 1:“Two-stage speaker embedding pipeline.”。

从像素可见,主路径从左向右依次经过梅尔频谱、2 维块与 1 维块堆叠、线性与 1 维卷积再到池化全连接与归一化,顶部的虚线旁路跨过卷积栈在加号处与主路汇合,末端明确标注为 256 维说话人嵌入。这种残差设计的意思是保留第一阶段已学内容,只让卷积路径做精修,避免重写整个表示。第一阶段解决多语言噪声鲁棒分类,第二阶段解决跨语言距离重塑,二者按冻结顺序渐进叠加。

主干与投影网络各自负责什么计算?

ReDimNet-B6 是主干,论文在若干开源嵌入架构中评估后选中它,理由是参数高效且在声纹基准上表现强。结构上交替使用 1 维与 2 维残差块并重塑特征维度,1 维卷积捕捉时序动态,2 维卷积捕捉谱时结构,再用注意力统计池化把帧级表示聚合成 utterance 级向量。输入维度固定为 72 维滤波器组,输出为 192 维。该主干在声纹评测对上曾报告 0.3% 等错误率,本文直接引用该结果作为选型依据,不在本文中重新验证。

说话人嵌入 × 语言不变性: 说话人嵌入负责把一段语音压缩成定长向量以比较身份,语言不变性要求同一人换语言时向量仍靠近、不同人说同一种语言时向量仍远离,二者搭配的原因是嵌入若保留音素内容就会在跨语言试验中误判,组合意义是用第二阶段度量学习把语言相关的分量从身份向量中剥离。

投影网络是第二阶段的精修器,参数量约 256.13 千,计算量约 27.36 兆乘加每秒。输入的 192 维向量走两条并行路径,一条是线性投影,另一条是 3 层 1 维卷积堆叠,通道数分别为 64、128、256,核大小分别为 5、5、3,每层后接批归一化和激活,再经自适应平均池化和全连接得到 256 维输出并做归一化。归一化把向量投影到单位超球面,使三元组损失在几何一致的空间中运算。

加性角度间隔损失 × 三元组损失: 加性角度间隔损失负责在第一阶段做说话人分类,把同类向量拉向各自类中心并留出角度间隔,三元组损失负责在第二阶段直接优化距离关系,把锚点和同身份正例拉近、把不同身份负例推远,前者先建立可分的类别结构,后者再针对跨语言配对精修局部几何,组合后兼顾全局可分与跨语言对齐。

ReDimNet-B6 主干 × 轻量卷积投影网络: ReDimNet-B6 主干负责从对数梅尔滤波器组特征中提取 192 维 utterance 级表示,轻量卷积投影网络负责在冻结主干后把该向量精修为 256 维并做归一化,前者保留已学到的多语言噪声鲁棒知识,后者只用很少参数重塑跨语言边界,组合意义是避免破坏第一阶段能力的同时获得可部署的增量提升。

推理时冻结的第一阶段与训练好的投影网络串行执行,不再更新主干。这种冻结安排的原文理由是保留已编码的多语言说话人知识,只重塑嵌入空间的跨语言不变性。未报告的内容是投影网络的初始化方式与归一化前的偏置处理,复现时需按常规做法记录并固定随机种子,不能从模型名推定实现细节。

两阶段如何训练,三元组如何构造?

第一阶段用加性角度间隔损失把编码器训练成说话人分类器。符号含义是尺度因子控制分布锐度,角度间隔要求同类更紧、异类更开,类别中心与嵌入的夹角决定分类难度,批量内平均后反向传播。训练数据是完整目标多语言集并做重增强,包括混入音乐语音噪声、信噪比 5 到 20 分贝、房间脉冲响应卷积、0.9 与 1.1 倍变速。优化器用带动量的随机梯度下降,动量 0.9、权重衰减 2 乘 10 的负 5 次方、学习率 10 的负 3 次方,工具链遵循常用说话人工具包配置。

第二阶段用三元组损失训练投影网络。给定锚点、同身份正例、异身份负例,目标是锚点与正例距离加上间隔后仍小于锚点与负例距离,距离在归一化向量上用欧氏距离度量,只有违反间隔的三元组才产生非零梯度。优化器换成学习率 10 的负 3 次方的自适应矩估计优化器,同时保持第一阶段完全冻结,梯度只流经投影网络。

三元组构造是关键细节,3 个分支共享完全相同的权重,下图显示了共享权重与拉近推远的几何意图,左中 3 条支路分别处理正例锚点负例,右侧箭头表示把正例拉向锚点、把负例推离锚点。

看图路径: 1. 对比正例锚点负例三条支路经过的第一阶段与第二阶段模块是否一致;2. 查看右侧嵌入空间中拉近与推远箭头的起点终点与颜色图例;3. 核对底部共享权重标注与同说话人不同说话人的颜色定义

原论文 Figure 2:Triplet training setup. Three branches (Anchor, Posi- tive, Negative) share identical weights…

论文图 2。原论文 Figure 2:“Triplet training setup. Three branches (Anchor, Posi- tive, Negative) share identical weights across both Stage 1 and Stage 2.”。

从像素可见,3 条支路都标注第一阶段到第二阶段的相同模块并用共享权重符号连接,底部图例明确绿色为同说话人正例、蓝色为锚点、红色为异说话人负例,右侧 3 维示意用绿色虚线表示拉近、用红色虚线表示推远。原文的采样策略是均衡随机采样而非难负例挖掘,锚点随机抽,正例以相等概率抽同语言或跨语言同说话人,负例抽同语言异说话人或任意语言异说话人,显式加入同语言负例以抑制共享音素导致的误接受。论文报告难负例挖掘在本跨语言设置下未提升性能,均衡随机采样在开发集上更好。

数据增强 × 均衡随机三元组采样: 数据增强负责在信号层制造声学多样性,包括加性噪声、混响和变速,均衡随机三元组采样负责在训练对层制造语言组合多样性,让正例均衡覆盖同语言和跨语言、负例覆盖同语言干扰者与任意语言干扰者,前者解决噪声鲁棒,后者解决语言诱发的误接受与误拒绝,组合后同时覆盖声学与语言两个失配轴。

需要指出的缺项是三元组的间隔取值、批量大小与训练轮数在给定证据中未明确写出,复现时应先按工具包默认记录并做小范围搜索,不能猜测原文用了某个特定值。

数据特征评价与鲁棒性分析如何搭建?

实验统一使用目标多语言数据集,采样率 16 千赫兹,特征为 72 维对数梅尔滤波器组,帧长 25 毫秒、帧移 15 毫秒并做倒谱均值归一化。增强在第一阶段训练时加入,噪声与音乐来自常用噪声语料,混响来自真实房间脉冲响应数据。打分统一用归一化向量的余弦相似度,不训练额外的打分后端。开发集按 4 类试验组合报告分条件等错误率与总体等错误率和最小检测代价,盲测集分 seen 语言注册与完全未见语言两套。

等错误率 × 最小检测代价: 等错误率负责报告误接受率等于误拒绝率时的工作点,最小检测代价负责在给定目标先验下加权漏检与误报并取最小值,前者直观可比,后者更贴近非对称代价的应用选型,论文同时报告二者是为了既看区分能力又看代价敏感阈值下的表现。

鲁棒性分析在开发集上额外加扰动。噪声分析用环境声音数据集的样本,按信噪比 5 到 20 分贝分桶,每桶构造 5000 个试验对,比较干净对干净、噪声对干净、同类噪声、异类噪声 4 种条件。混响分析比较无混响、混响对干净、同房间混响、异房间混响 4 种条件。评价保持试验组合为同人同语言对异人同语言,以便单独观察声学扰动而不混入语言失配。

盲测的定义需要准确复述。评测集 A 的注册语音来自已见语言、测试语音来自 38 种未见语言,评测集 U 的注册与测试都来自未见语言,属于更严格的零样本设置。论文未公开划分细节与说话人交叠情况,复现时只能使用组织方提供的官方划分与打分脚本,不能自行重分。

开发集与盲测集的主结果是什么?

先看开发集的比较问题与公平条件。比较对象是官方基线、未做领域自适应的主干、第一阶段微调、第二阶段投影,指标方向都是越低越好。下表聚焦总体与最难条件,列是同一评价协议下的不同系统,因此可以直接比较等错误率的下降是否来自每个阶段。

条件指标ReDimNet-B6 未适配Stage1 微调Stage2 投影
最难 SS-DL 对 DS-SLEER4.42%2.91%2.52%
总体所有目标对所有非目标EER2.70%1.75%1.58%

表后解释需要同时给出收益与代价。总体等错误率从未适配的 2.70% 经第一阶段降到 1.75%,再经第二阶段降到 1.58%,最小检测代价从 0.6600 改善到 0.6481,说明领域自适应贡献最大,投影带来进一步增益。最难条件从 4.42% 降到 2.91% 再降到 2.52%,说明每个阶段都对跨语言鲁棒有实质贡献。代价是原文明确报告最易条件 SS-SL 对 DS-DL 出现 0.07 个百分点的轻微回退,这是为优化更难跨语言场景付出的预期权衡。未胜出项是官方基线总体 3.07%,虽低于未适配主干的 2.70%,但仍高于 2 阶段结果,不能因基线已微调就忽略它。

下图用降维可视化解释了几何变化,左侧是仅在大规模声纹数据预训练的主干,右侧是 2 阶段微调后,颜色表示说话人、形状表示语言,覆盖 6 位说话人 6 种语言。

看图路径: 1. 先按右侧图例用颜色认说话人、用形状认语言再看左右两幅分布;2. 对比左图同色不同形状是否混杂与右图同色点是否聚成紧簇;3. 注意右图中仍距离较近的簇是否对应共享多种语言的说话人

原论文 Figure 3:t-SNE visualisation of embeddings for six speakers across six languages (cy, en, hi, mr, tr, ug).

论文图 3。原论文 Figure 3:“t-SNE visualisation of embeddings for six speakers across six languages (cy, en, hi, mr, tr, ug).”。

从像素可见,左图蓝色、橙色等同色点按形状散开并与他色混叠,例如橙色大簇中混入绿色点,右上黄色与深红点也重叠,说明语言主导了聚类。右图同色点聚成紧簇且簇间分离明显,蓝色、橙色、深紫色各占独立区域,绿色小簇也独立。原文进一步指出共享两种以上语言的说话人簇间距离仍较小,提示多语言重叠的发音模式即使解耦后仍会拉近簇,这为后续显式处理口音或跨语言音素纠缠留下空间。

再看盲测集的比较问题。评测集 A 与 U 的基线与第二阶段结果对比如下,试验类型覆盖跨语言与同语言的目标非目标组合,总体指标同样越低越好。

评测集试验类型指标基线Stage2
eval-A总体EER9.06%4.81%
eval-A目标异语言对非目标同语言EER10.08%4.90%
eval-U总体EER11.60%7.01%
eval-U目标异语言对非目标同语言EER12.39%8.06%

表后解释应强调泛化与差距。评测集 A 总体从 9.06% 降到 4.81%,最难跨语言从 10.08% 降到 4.90%。更难的评测集 U 总体从 11.60% 降到 7.01%,跨语言从 12.39% 降到 8.06%。这支持 2 阶段微调对未见语言仍有效,但盲测绝对值远高于开发集的 1.58%,说明零样本语言失配仍是主要边界,不能把开发集数字直接推广到部署。

噪声混响与采样策略提供了哪些反证?

本节按问题组织反证。首先是噪声是否会推翻同语言结论。论文在同人同语言对异人同语言下测试 4 种噪声配对,横轴为信噪比,纵轴为等错误率,曲线越低越好。下图显示了 4 个子图的像素趋势,左上无噪声时本方法约为 1.4%、基线约为 3.0%,右上噪声对干净、左下同类噪声、右下异类噪声中本方法始终低于基线。

看图路径: 1. 先确认四宫格标题区分无噪声噪声对干净同类噪声与异类噪声;2. 沿横轴信噪比从 5 到 20 分贝观察基线虚线与本方法实线的间距变化;3. 比较左上干净条件水平线与右下最难条件在低信噪比处的绝对误差

原论文 Figure 4:Noise robustness under same-language trials. EER (%) for same-speaker same-language (SS–SL) vs.

论文图 5。原论文 Figure 4:“Noise robustness under same-language trials. EER (%) for same-speaker same-language (SS–SL) vs.”。

从像素可见,右上在 5 分贝时基线约 5.1%、本方法约 2.3%,到 20 分贝时基线约 3.3%、本方法约 1.7%。左下同类噪声在 5 分贝时基线约 5.8%、本方法约 2.7%,到 20 分贝时分别约 3.3% 与 1.6%。右下异类噪声趋势相近,5 分贝时基线约 6.2%、本方法约 2.7%。这支持模型对部分与全部污染都有鲁棒性,且在不同噪声类别下退化有限。限制是该图只覆盖同语言试验,跨语言加噪声的绝对值更高,原文仅定性说退化有限,未给出同等完整的数值表。

其次是混响。4 个条件为无混响、混响对干净、同房间、异房间,横轴为混响时间。原文报告即使两端为不同噪声类别或不同房间条件,性能仍稳定,说明身份与背景混响得到有效解耦。但像素显示混响绝对误差高于干净条件,例如长混响下误差可升至 9% 左右,说明稳定是相对基线而言,不是混响无影响。

第三是采样策略的消融。难负例挖掘按批量内最近异类选择负例,理论上加速收敛,但在本文跨语言设置下未改善性能。均衡随机采样覆盖 4 种试验对条件,通过均值损失反传在开发集上更好。这是一个有源负结果,复现时应优先实现均衡随机采样,再把难挖掘作为对照,而不是默认难挖掘一定更优。

哪些结论有边界,哪些验证还缺?

直接报告的是开发集与盲测集的等错误率和最小检测代价提升,以及噪声混响下的相对稳定。有限解释是降维图显示簇更紧且跨语言一致,支持语言相关分量被削弱,但降维只是可视化,不是语言信息量的直接测量,不能当作因果证明。未验证推测是共享多语言的说话人簇更近是因为跨语言发音模式相似,原文用可能与待验证的语气提出,复现时不应写成定论。

缺失证据不是技术错误,但要明确。论文未报告训练时长、硬件预算、推理延迟与内存占用,总体趋势不等于每组每步都成立。最小检测代价只给总体值,未给分条件值。噪声分析每桶 5000 对保证了统计可靠性,但未报告置信区间。盲测的语言列表与说话人交叠未在给定证据中展开,引用时只能说组织方定义的已见与未见划分。

另一个边界是优化目标的权衡。最易条件 0.07 个百分点的回退虽小,但说明为最难条件优化可能轻微损害易条件。若应用以同语言为主,是否值得加第二阶段需要按自身试验分布重新选阈值,不能只看总体最优值。

复现先做什么,需要哪些超参数与检查点?

复现应按学习依赖排序。第一步准备数据与特征,用 16 千赫兹音频提取 72 维滤波器组,帧长 25 毫秒、帧移 15 毫秒并做倒谱均值归一化,保持与原文一致。第二步复现第一阶段分类训练,加入信噪比 5 到 20 分贝的噪声音乐、房间脉冲响应卷积、0.9 与 1.1 倍变速,用带动量随机梯度下降训练,动量 0.9、权重衰减 2 乘 10 的负 5 次方、学习率 10 的负 3 次方。第三步冻结主干,只用自适应矩估计优化器训练投影网络,学习率 10 的负 3 次方,3 层卷积通道与核大小按 64、128、256 与 5、5、3 实现。

检查点包括特征维度、192 维到 256 维的维度变化、归一化后余弦打分、试验四分类构造。采样必须实现均衡随机策略,正例同语言与跨语言等概率,负例包含同语言异说话人。先跑通开发集总体与最难条件,再跑盲测集 A 与 U,不要只调开发集阈值。

资源状态是重要边界。本次收到的证据中未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开。复现前应先确认组织方数据集与打分脚本的可达性,记录随机种子与缺失的间隔批量大小等超参数。若无法获得官方划分,只能明确标注未评测边界,不能自造划分来凑一致。

何时值得尝试这种渐进策略?

当任务同时面临语言失配与声学失配,且已有较强预训练主干时,值得尝试先领域自适应再冻结精修的渐进策略。第一阶段用分类损失建立噪声鲁棒的可分空间,第二阶段用均衡三元组重塑跨语言边界,这种分工比单阶段同时优化更易稳定。梯度反转未生效的教训也提示,对抗去语言不一定适合所有嵌入结构,显式构造跨语言正负对可能更直接。

不值得盲目照搬的情况包括纯同语言干净场景,此时第二阶段增益小且可能带来轻微回退。若部署要求低延迟,轻量投影虽小但仍需实测延迟,不能从参数量推定满足实时。教学上最易误解的是把总体等错误率下降当成所有条件都变好,实际应分别查看最难与最易条件、已见与未见语言、干净与加扰条件。

收束时回到可复述动作。按原文特征、增强、优化器、冻结与采样实现 2 个阶段,用余弦打分在 4 类试验上报告等错误率与最小检测代价,并补充噪声与混响对照。若要进一步工作,可在保持冻结主干的前提下,显式度量残留语言信息或口音纠缠,再决定是否引入新的解耦目标。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总