英文题目:Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations

会议身份:conference:interspeech:2026:conference-paper-id:sun26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #评测协议 #韵律 #多语言 #语音属性识别

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Haitong Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Stephen McIntosh:机构信息未能从会议 PDF 纯文本可靠映射
  • Kwanghee Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Eunjung Yeo:机构信息未能从会议 PDF 纯文本可靠映射
  • Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
  • Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为相同音素序列但韵律模式不同的语音三元组,输出为表征空间是否保留语言学韵律对比的判别误差率,难点在于无需标注即可分离韵律与音素、说话人与时长差异。方法链分三步推进:先构建英语重音、日语声调与汉语声调的韵律最小对偶并裁剪目标词以抑制上下文,再用自监督语音模型逐层抽取帧级表征,最后以动态时间规整对齐并比较距离以判定ABX正确性。与均值池化加分类器探测相比,该机制保留时变韵律轮廓并直接度量几何显著性,同时提供对齐路径用于定位对比。在自然语料上最佳层汉语声调误差率低至5%,而人类为2%,日语上模型19%明显落后于人类9%,英语上模型最差层26%反而略优于人类29%。结论限于词级词汇韵律与朗读体录音,尚未验证语调、焦点与自发对话的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入是论文原文与官方原图像素,目标是让刚进入语音领域的研究生能复述韵律 ABX 的完整做法。必须保留的信息包括三元组构成、裁剪与动态时间规整距离、嵌套平均计分、3 种语言的韵律类型、自然录音与合成语音的来源、17 个自监督语音模型的比较范围、人类基线与声学基线的设置,以及跨合成、跨上下文、跨任务的稳定性结论。

输出按学习依赖展开,先讲为什么已有探测不够,再讲方法全景与计算细节,然后讲数据构造与实验条件,最后讲结果、反例与复现路径。全文只讲论文实际做的词级词汇韵律,不扩展到语调或情感等句子级韵律,教学用的比喻会明确标为例子。论文研究的核心矛盾是自监督语音模型表示已知对音位敏感,但对韵律是否在距离几何中显著一直没有直接度量,分类探测能解码不等于距离上可分。

作者因此提出一种无训练、只需少量样例、无需显式标签的度量,让表示自己说话。理解这一点后,后续的距离选择、切词操作与基线对照才有动机。

已有路线测了什么,为什么还要做 ABX?

已有路线主要有 3 条。第一条是人工操纵基频和强度后看表示是否变化,以及用表示预测基频等声学相关量,这能证明声学敏感性,但不能证明语言学上对立的类别在空间中被拉开。第二条是用分类器探测重音、声调或音高重音,论文引用的结论是晚期中间层最好、预训练语言有影响、微调后有提升,不同架构峰值精度相近,这回答的是存在性。第 3 条是音位 ABX,用 beg 和 bag 这类最小对检验同类距离是否小于异类距离,并用动态时间规整处理时长差异,这回答的是显著性。论文的判断是前两条不能替代第 3 条在韵律上的版本,因为聚类和发音反馈等基于距离的应用需要几何本身可分。

探测分类器 × ABX 判别: 探测分类器分工是加一个有监督分类头去检验某类信息能否被解码出来,ABX 判别分工是直接比较表示空间中同类与异类距离而不训练额外参数,二者搭配理由是前者回答存在性后者回答显著性,组合意义是论文强调已有探测只证明韵律信息存在,而韵律 ABX 进一步检验它在距离几何中是否直接可分。

从运行阶段看,探测需要有标签数据训练分类头,准备成本高,对复杂韵律语言尤其如此,也可能学到与人耳依据不一致的线索。ABX 直接用全部数据做比较,不训练额外参数,且用最小对更贴近人的感知判断。另一个技术分叉是表示聚合方式,均值池化把时变轮廓压平,可能掩盖重音和声调的时间形状,而动态时间规整允许局部时间伸缩,更适合比较不同说话人的韵律轮廓。论文还提到可解释的语音比较与学习者发音反馈,时间对齐路径能显示对立在 utterances 中的位置,这是选择动态时间规整的另一理由。

要判别的对立是什么,什么算判对?

论文把问题限定为词汇韵律,覆盖 3 种不同系统。英语是词汇重音,名词与动词同形但主重音位置不同,常伴随音高、时长、强度或元音弱化差异。日语是音高重音,同假名序列但音高模式不同,可区分词义。汉语是词汇声调,同拼音音节但声调轮廓不同。判别任务的输入是一个三元组,A 和 B 来自同一说话人且音位序列相同但韵律模式不同,构成韵律最小对,X 来自另一说话人与 A 同音段同韵律。

模型把 3 段音频变成表示序列,计算 X 到 A 的距离与 X 到 B 的距离,若前者更小则记 1 分,相等记 0.5 分,否则记 0 分,最后按说话人对先平均得到每个对立的分数,再在所有对立上平均并用 1 减去平均分报成错误率。错误率越低越好,随机猜测是 50%。这里的关键控制是 A 和 B 同说话人而 X 换说话人,这样模型不能靠说话人身份取巧,必须靠韵律模式本身把同类拉近。

论文用 subject 的名词与动词读音差异举例,A 为名词读法,B 为动词读法,X 是另 1 人读的名词,教学例子仅用于说明三元组分工,不代表真实录音内容。

韵律 ABX 全景:一个样本如何走完输入到判决?

沿一个样本走一遍最清楚。输入是 3 段音频,先按强制对齐得到的词边界把目标最小对从载体句中裁出来,以减少相关上下文的影响,然后分别送入待测自监督语音模型的某一层,得到长度分别为 tA、tB、tX 的表示序列 RA、RB、RX。接着用动态时间规整把 RA 与 RX 对齐得到归一化距离 d,把 RB 与 RX 对齐得到另一个归一化距离 d,归一化是用总距离除以路径长度以消除时长差异。最后比较两个距离大小并按 1、0.5、0 记分。这个流程对每一层重复,对每个说话人组合与每个最小对重复,再做嵌套平均。

韵律最小对 × 音位最小对: 韵律最小对分工是固定音位序列、只改变重音、声调或音高型以制造语义对立,音位最小对分工是固定语境、只改变一个音位如 beg 和 bag,二者搭配理由是都可以把待测对立孤立出来做 A、B、X 三元比较,组合意义在于把原来测音位几何的方法平移到韵律几何而不需类别标签。

下图是论文给的概念总览与局部距离示例,上半显示 3 段波形与色块表示的异同,下半显示日语音高重音三元组随 X 时间变化的局部距离差,归一化面积即为所用距离,适合初学者建立输入到输出的整体图像。

看图路径: 1. 先看上方面板 X 与下方 A 和 B 的波形与色块对应关系,确认 A 与 X 颜色一致而 B 颜色翻转;2. 再看 d(RA,RX) 与 d(RB,RX) 两条箭头的比较方向,确认判对条件是同类距离更小;3. 最后看下面板随 X 时间变化的局部距离差曲线,确认正面积大表示判对且可定位到音节

原论文 Figure 1:Our prosodic ABX framework.

论文图 1。原论文 Figure 1:“Our prosodic ABX framework.”。

从图中可见,A、B、X 音位序列相同但 B 的韵律模式不同,色块用颜色翻转表示这种差异,箭头表示把 RA 和 RB 分别向 RX 对齐并比较对齐代价。下面板以日语例子展示 A 和 X 为首音节重读而 B 为无重音时的逐帧距离差,橙色面积大表示同类更近,总面积经归一化后用于判决,曲线峰值位置还提示对立主要编码在 utterances 的哪一段。这种可定位性是该方法区别于均值池化探测的重要性质。

距离与记分组件:DTW 距离如何算,分数如何聚合?

距离组件的输入是两个变长表示序列,输出是一个标量。动态时间规整在允许局部时间变化的条件下搜索一条对齐路径,使路径上帧间距离之和最小,同时给出路径长度用于归一化。论文把归一化后的值记为 d,判决只用 d 的大小关系,不用绝对阈值。局部距离差曲线是路径上每一步对总距离的贡献沿 X 时间展开的结果,图 1 下半的纵轴即为这种差值,横轴为 X 的时间,面积即总距离差。记分组件的输入是每个三元组的 2 次距离比较,输出是 0、0.5 或 1。

聚合分两层,先在说话人对上平均得到每个韵律对立的分数,再在所有对立上平均,最后用 1 减去该值得到错误率。这种做法沿用音位 ABX,只是把固定音位语境中比较音位换成固定音位内容上比较韵律轮廓。

动态时间规整 × 均值池化: 动态时间规整分工是在允许局部伸缩下对齐两个变长表示序列并保留时间结构,均值池化分工是把变长序列压成一个向量但会抹掉时变轮廓,二者搭配理由是韵律是跨音段的时间轮廓不宜先压平,组合意义是论文选择动态时间规整做距离以同时得到总距离和随时间的位置贡献。

表示与基线组件需要一起理解。待测对象是 17 个自监督语音模型的全部层,覆盖 wav2vec 2.0 与 HuBERT 两大范式、大小模型、英语、日语、汉语预训练模型、多语模型与去噪掩码预测模型。对照是梅尔谱与 MFCC 两种声学基线。论文对每个模型只报告最佳层的分数用于跨模型比较,层内比较则保留整条层曲线。

自监督语音模型表示 × 声学基线: 自监督语音模型表示分工是提供 wav2vec 2.0 和 HuBERT 等各层学到的抽象特征,声学基线分工是提供梅尔谱和 MFCC 这种未经语义学习的底层参照,二者搭配理由是只有对照才能判断对立是模型学到的还是信号本身就有的,组合意义是论文用两者差距说明韵律区分在表示空间中是显著的而非平凡可分的。

这种设计的教学要点是,最佳层比较回答哪个模型更敏感,层曲线相关回答排序是否稳定,声学基线回答增益是否来自学习到的表示而非原始声学可分性。

裁剪与上下文:为什么先切词,后面又测整句?

默认流程在编码前把最小对从周围音频中裁出来。动机是成对样本通常出现在不同载体语境中,若不裁剪,上下文差异会混入距离。实现依赖蒙特利尔强制对齐器得到的词边界,并经熟悉音系的母语者检查与调整。论文在第 5.3 节专门检验不裁剪会怎样,即上下文内编码,直接编码完整 utterances 再比较对应最小对的帧。这种对照不是推翻默认做法,而是回答实际系统处理连续语音时结论是否仍成立。

结果一节会给出定量相关性,这里先记住两种编码的输入不同,比较的是同一模型的层排序与模型排序是否一致。若深层更善于利用上下文混合信息,那么上下文内会更好,且优势随层加深而增大,这正是论文用层索引与内外差异的相关性来检验的假设。初学者容易把切词理解为丢信息,实际上它是控制混杂,整句对照是检验泛化,两者缺一不可。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何自监督语音模型,也没有训练探测分类器。所有待测模型都是既有预训练权重,包括英语、日语、汉语与多语模型,实验只是前向推理取各层表示。真实计算是表示提取加动态时间规整比较,借助为音位 ABX 开发的 fastabx 库实现高效 ABX 可分性计算。数据侧有构造与标注工作,包括英语名词动词对与日语句子的设计、录音室录制、母语者校验重音与音高、强制对齐与边界手调,以及合成语音生成。

人类实验是行为数据采集,不是模型训练,被试听 A、B、X 3 段音频后选择谁与 X 更像,并加入十分之一的简单身份匹配作为注意力检查,不合格者被替换,且每个被试不会重复听到同一录音。论文声明生成式人工智能仅用于文字润色、代码生成辅助与图表格式整理,实验构思与最终代码经作者人工审核,因此不能把方法性能归因于生成模型。由于未报告训练超参数、梯度路径与优化器,本节不虚构这些细节,缺项即为缺项,复现重点是推理环境与对齐边界而非训练复跑。

数据、划分、指标与人类基线如何设置才公平?

数据分三语。英语选 15 个音位序列相同但主重音位置不同的名词动词对,其中 4 个带元音弱化,每个对造 4 个载体句,名词与动词各 2 句,共 60 句,由 10 名美式英语母语者在录音室录制,目标词重音经母语者逐个核验。日语选 23 个同假名但音高型不同的最小对,限定 2 至 4 莫拉,来源为日语教师提供的表,每个对造 2 对相同语境的载体句,由 10 名母语者录制并经母语者审核。

汉语从已有普通话单音节情感语料库中选 2310 对,来自 385 个单音节拼音序列,要求每个声调至少 3 名说话人有样本,语料含 6 名专业演员的 4 个声调录音。合成部分用谷歌云文本转语音为三语各合成 4 个声音的全部最小对,另用开源权重的 Kokoro 合成英语重音对并用固定载体句加对齐提取,以检验合成代理是否依赖合成器类型。指标是上述嵌套平均后的 ABX 错误率,越低越好。人类基线是行为 ABX,英语 33 人、日语 18 人、汉语 15 人,覆盖英日全部对立而汉语因数据量大只抽样。

模型侧对 17 个模型的每一层都跑韵律 ABX,声学基线为梅尔谱与 MFCC。公平性上,模型与人类听的是同源自然录音,模型间比较用各自最佳层,层间比较用整条曲线,合成与自然比较用同模型同层的层曲线相关与遗憾值,上下文内外比较用同模型的层曲线与模型排序相关。

主结果:模型比人强还是比声学基线强?

要回答的核心问题是自监督表示的韵律区分是否显著且接近人类。下图按三行分别展示英语重音、日语音高重音与汉语声调的最佳层错误率分布,橙色为 17 个模型的最佳层,紫色为声学基线点,粉色为人类 95% 置信区间,横轴越左表示错误越低。

看图路径: 1. 先按纵轴三行确认任务与语言:英语重音、日语音高重音、汉语声调;2. 再横向比较每行橙色 S3M 箱线、紫色声学基线点与粉色人类置信区间的位置;3. 最后确认横轴是最佳层错误率且越左越好,不要把分布宽度误读为时间变化

原论文 Figure 2:ABX error rates (↓) across different prosodic tasks.

论文图 2。原论文 Figure 2:“ABX error rates (↓) across different prosodic tasks.”。

从可见内容看,三行中橙色箱线都明显位于紫色点左侧,说明所有自监督表示都大幅优于声学基线与随机猜测,韵律区分在表示空间中是显著的。分任务看,英语行粉色人类区间位于橙色箱线右侧,论文报告人类 29% 而最差模型 26%,即模型整体已超过母语人。日语行粉色区间在最左侧,论文报告人类 9% 而最好模型 19%,汉语行粉色区间也在最左侧,论文报告人类 2% 而最好模型 5%,说明在这 2 个任务上人类仍领先。

分布宽度也有信息,英语结果压缩而日语分散,意味着英语层选择遗憾需结合分布宽度理解,不能只看绝对百分点。下表把关键数字与样本规模放在一起,便于核对数据集、模型数、人类数、指标与聚合对象,避免把不同指标的差值混为一列。

任务评价对象错误率样本与模型规模方向
英语重音人类29%33 人越低越好
英语重音最差 S3M 最佳层26%17 个模型中越低越好
日语音高重音人类9%18 人越低越好
日语音高重音最好模型最佳层19%17 个模型中越低越好
汉语声调人类2%15 人越低越好
汉语声调最好模型最佳层5%17 个模型中越低越好

表后需要强调的是,英语上模型超人不能解读为模型完全解决重音,因为词级分析显示人与模型在难词上一致,且元音弱化词最易分,说明线索复杂度仍主导表现。日语与汉语上人类领先也不能解读为模型无用,因为最好模型已远超声学基线且绝对错误率不高,差距更多反映母语人对母语韵律的精细敏感。未胜出项是声学基线在三任务上全部落后,这是支持表示学习带来增益的直接证据,未评测边界是句子级语调与焦点等未纳入本框架。

词级反证:人与模型难在同一批词上吗?

主结果的平均数可能掩盖词级结构,论文用英语 15 个词的词级错误率做反证。下图横轴为人类词级错误率,纵轴为模型平均最佳层错误率,每个点标注一个单词,左上角给出相关系数与置信区间。

看图路径: 1. 先确认横轴是人类词级错误率、纵轴是模型平均最佳层错误率;2. 再沿左下到右上看 project、conduct 等词与 impact、discount 等词的位置分化;3. 最后核对左上角 r 值与置信区间,确认人与模型在哪些词上共同觉得难

原论文 Figure 3:Word-level ABX error rates for English lexical stress: human participants vs S3Ms.

论文图 4。原论文 Figure 3:“Word-level ABX error rates for English lexical stress: human participants vs S3Ms.”。

从可见内容看,散点沿对角线从左下向右上排列,左下是 project、conduct、address 等低错误词,右上是 impact、discount、import 等高错误词,中间有 permit、survey 等过渡词,论文报告相关系数为 0.94。解释是人与模型在同一批词上觉得难,带元音弱化的 project、conduct、address 与有时带弱化的 abstract 都在左下最易分,而无弱化且线索更微妙的词都在右上。这支持容易被人感知的对立在表示空间中也更可分的判断,但论文用词是相关与暗示,不是因果证明。代价是英语整体错误率偏高且分布压缩,单看平均数会低估词间方差。未胜出项是 upset 与 insult 等点偏离对角线,说明个别词上人与模型分歧仍存在。复现时应保留词级分解,而不只报平均错误率,否则会错过这种机制线索。

跨条件还稳吗:合成、上下文与跨任务能否做代理?

论文把实用性拆成 3 个可替换条件。合成代理问题是自然录音难采时能否用合成语音选层选模型,检验量是同模型在自然与合成上的层曲线皮尔逊相关、按合成选层在自然上的遗憾值,以及按最佳层错误率排序的模型斯皮尔曼相关。上下文问题是切词评测能否预测整句行为,检验量是内外层曲线的中位相关、内外模型排序相关,以及内外差异随层深的变化。跨任务问题是一种韵律敏感性能否迁移到另一种,检验量是所有层在两两任务错误率上的散点相关。下图展示跨任务部分,3 个子图分别为音高重音与声调、重音与声调、重音与音高重音的层级散点,左上角标出相关系数。

看图路径: 1. 先确认三幅子图的两两任务组合与横纵轴均为错误率;2. 再看每幅左上角 r 值与蓝色散点沿虚线的聚集程度;3. 最后比较三幅相关强度,确认声调与音高重音相关最强而重音相关稍弱

原论文 Figure 4:Error-rate correlation across prosodic tasks.

论文图 3。原论文 Figure 4:“Error-rate correlation across prosodic tasks. For all S3Ms, each layer is plotted according to its error rates.”。

从可见内容看,左图点最贴合虚线,相关最高,中图与右图稍散但仍正相关,论文报告的 3 个系数支持声调与音高重音强相关、重音与两者中等相关,假设是共享基频等声学相关量。合成与上下文的数字见下表,表前先明确比较问题与公平条件,所有相关都在同模型同指标下计算,遗憾值指按合成选层在自然上的错误率增量,方向是相关越高越好、遗憾越低越好。

比较相关类型系数值附加统计方向
日语自然与合成层曲线层相关r=0.93合成选层遗憾低越高越好
汉语自然与合成层曲线层相关r=0.93合成选层遗憾低越高越好
英语自然与合成层曲线层相关r=0.50分布压缩需谨慎越高越好
内外上下文层曲线层相关r=0.93控制层深后 r=0.97越高越好
内外上下文模型排序排序相关ρ=0.9195% CI [0.71,0.99]越高越好
内外差异随层深层索引相关ρ=0.43p=0.002,中位提升 9.4%越深内外差越大

表后解释主要收益与代价。收益是日语与汉语可用合成做层选择,遗憾可忽略,日语模型排序也保持较好,上下文内外高度相关且回归控制层深后更高,说明切词评测能预测整句排序。代价与反例是英语合成代理不可靠,谷歌合成的层相关仅 0.50 且遗憾不可忽略,Kokoro 稍好但模型排序置信区间仍宽,汉语模型排序相关仅中等且区间宽,可能受模型数少影响。另一发现是上下文内一致更好,中位最佳层提升 9.4%,且优势随层加深增大,符合深层利用上下文混合的假设,但这也意味着直接用切词绝对值估计整句性能会偏悲观,只能用于排序。

上下文内编码 × 上下文外编码: 上下文内编码分工是把最小对留在完整载体句中编码以保留协同发音和外在韵律线索,上下文外编码分工是按强制对齐边界把目标词切出来再编码以减少相关上下文干扰,二者搭配理由是实际系统处理连续语音而对照实验需要干净比较,组合意义是论文用两者相关性证明切词后的离线评测仍能预测连续语音中的层和模型排序。

哪些结论不能推广,哪些缺项不是错误?

首先,词汇韵律不等于全部韵律,语调、节奏、焦点与句法歧义消解等未被测量,不能把本框架的结论推广到句子级韵律。其次,英语重音的合成代理与模型排序在证据中不稳定,置信区间宽,不能承诺在低资源语言中合成一定可用,论文的措辞是往往保持而非总是保持。第三,跨任务相关是相关性不是因果,不能据此断言学好声调必然学会重音,共享基频只是假设,待验证。

第四,人类基线在汉语上是抽样而非全量,且三国被试数不同,比较时需考虑抽样与任务难度差异,不能把人类数字当成跨语言可比的绝对标尺。第五,论文未测量误判率分解、推理延迟、计算成本与输出帧率,总体趋势不等于每层每模型都成立,不能承诺距离更可分就等于下游聚类或反馈一定更好。缺失这些不是技术错误,而是未验证边界,复现与引用时应保留原表头单位与聚合口径,不自行计算差值百分比或四舍五入,也不把自动指标当成人评。

复现先做什么,需要哪些代码、权重与数据?

复现先做最小闭环,选一个已有权重与 1 对最小对跑通三元组距离再扩展。代码侧论文给出实现仓库与所用 fastabx 库,资源状态显示实现页面当前可用,状态码为 200,可作为起点,但本次只确认可达,不保证长期有效。权重侧需下载 17 个模型中的子集即可验证趋势,日语相关权重有公开页面且本次确认可用,包括日语 wav2vec2 基础与大模型以及日语 HuBERT 基础模型,英语与汉语权重按论文引用找对应仓库。

数据侧英语与日语自然录音数据集已公开,汉语用已有单音节语料,合成侧用谷歌云文本转语音与 Kokoro 按论文声音数重造。关键超参数与信息条件是按层取表示、切词边界来自强制对齐并经人工校对、距离用路径长度归一化、分数用说话人对内平均再跨对立平均并转为错误率。硬件预算原文未报告,复现时应记录前向推理与动态时间规整耗时而非猜测。若合成不可用,优先用自然录音的小样本验证层排序,因为论文显示少量样例即可工作。

若要复现人类基线,需按原协议做 A、B、X 3 段呈现、答案均衡、十分之一注意力检查与不重复播放,并保留 95% 置信区间。

何时值得尝试,还需补哪项验证?

当任务依赖距离几何而非分类头时值得尝试,例如为韵律敏感的离散 token 做聚类选层选模型,或为发音反馈定位韵律差异在时间上的位置。当只有少量平行样例且无标签时,该框架比训练探测器更省准备成本。当只有合成语音或只有切词数据时,可参考论文的代理结论,但需先在目标语言上复测层相关与遗憾,不能直接沿用日语的成功经验到英语重音这类复杂线索。

还需补的验证包括更多语言与更多合成器的系统比较、整句解码与切词排序的联合评估、以及把 ABX 错误率与下游聚类质量或学习者感知提升的关联测量。只有补上这些,才能把显著性从评测指标推进为可部署收益。记住论文的中心判断,韵律对立在自监督表示中是显著的,且排序在多种实验条件下往往保持,但人类在母语精细韵律上仍领先,合成代理与跨任务迁移都有明确边界。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总