英文题目:Multilingual Phonological Feature Recognition with Self-Supervised Speech Models

会议身份:conference:interspeech:2026:conference-paper-id:hernandez26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自监督学习 #语音学与音系 #多语言 #零样本 #语音属性识别

评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Abner Hernandez:机构信息未能从会议 PDF 纯文本可靠映射
  • Tomás Arias-Vergara:机构信息未能从会议 PDF 纯文本可靠映射
  • Daiqi Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Andreas Maier:机构信息未能从会议 PDF 纯文本可靠映射
  • Paula Andrea Pérez-Toro:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理多语言帧级音系特征识别,输入为原始波形,输出为发音方式、元音高度与前后、发音部位与清浊构成的22维结构化特征向量,难点在于跨语言音位库存差异大且域偏移下音素优先流水线误差会被映射放大。方法链条为冻结的多语言自监督编码器先输出上下文表示,接着共享投影加两层Conformer建模局部与长程依赖,然后四个专用分类头分别预测不同特征组,最后由发音方式门控仅激活合法的元音与部位分支以保证音系一致性。与先识别音素再查表映射的已有做法相比,该设计显式建模特征组依赖而非假设特征独立。在域内CommonPhone测试上PhonoQ-2.0宏观F1达到91.3%,较同骨干CTC音素基线平均领先8.8个百分点;跨语料库平均88.9%,领先8.6个百分点;在未见语言上从66.9%提升至73.6%,平均提升6.7个百分点。结论适用于英德西捷四种训练语言及朗读与议会演讲域,向法语鼻化、俄语腭化与更远语系的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/abnerLing/PhonoQ-2.0 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么不直接做词识别?

这篇论文的输入是原始语音波形,目标是在每 1 帧上输出一组发音层面的描述,而不是先输出单词或音素符号。对于刚进入语音领域的同学,可以把任务理解为给声音逐帧贴发音标签:这帧是鼻音还是摩擦音,是高元音还是低元音,发音部位靠唇还是靠舌根,声带振动还是不振动。论文把这组描述固定为 22 维向量,分成发音方式 9 类、元音高低前后 6 类、部位 5 类、清浊 2 类。

选择这个目标的理由在引言中讲得很直接:多数系统先预测音素,再用确定性映射查表得到特征,这种音素优先路线没有显式建模音系结构,而已有工作显示自监督表示本身已经编码了发音与音系结构,因此直接预测特征可能更鲁棒且更易跨语言。需要保留的关键信息是输出不是可变的正字法文本,而是固定维度的结构化特征向量,后续所有比较都在这个 22 维空间内进行。

自监督语音模型 × 音系特征: 自监督语音模型负责把原始波形变成富含音素与协同发音信息的上下文表示,音系特征负责把这种连续表示离散为发音方式、元音高低前后、发音部位和清浊等语言通用类别,二者搭配的理由是前者已隐含发音结构而后者提供跨语言可比的监督目标,组合意义是让模型直接学习发音维度而不再经过音素符号中转。

论文报告的总体结果是域内平均宏 F1 为 91.3%,域外为 88.9%,相对同骨干基线有接近 9 个点的提升,未见语言从 66.9% 提升到 73.6%。这些数字的含义要在后面按数据集、基线条件和指标方向逐 1 核对,不能只记绝对值。初学者容易误以为特征识别是音素识别的附庸,但本文把它当作主任务,音素基线反而是用来反衬的对照。

同输入同目标的前人路线与本文的差别在哪里?

在相同输入与相近目标下,前人至少有 3 条路线。第一条是帧级 distinctive 特征后验直接检测,证明了从声学输入直接估计特征后验的可行性。第二条是把音系特征作为辅助目标或瓶颈层加入识别系统,例如病理语音分析中的音系瓶颈层,或用国际音标与发音特征改善多语言泛化,这类工作不以结构化特征预测本身为最终交付。第 3 条是临床与发音评估应用,把特征用于构音障碍分类、腭裂儿童发音精确度与辅音对比实现度量。

论文把自己定位为与第一条最近,但强调以往多为单语、把特征当独立标签或只做辅助目标,没有在多语言与跨域条件下把结构化预测与强音素基线放在同一特征空间直接比较。 本文与前代 PhonoQ 的区别也被明确写出:原 PhonoQ 用从零训练的卷积加循环层和单一共享输出层预测音系类别,而 PhonoQ-2.0 改用预训练多语言自监督编码器加结构化多头设计,并引入发音方式条件门控。

与音素优先路线的差别在于监督与解码位置不同:前者监督音素序列再查表,后者直接监督 22 维中的 4 个分组。这种对照不是类别差异的空谈,因为两套系统共享声学骨干与评估空间,比较条件在方法节有具体交代。

要解决的具体问题与评测口径是什么?

具体问题可以表述为:在多语言训练条件下,学习一个帧级映射,把每帧声学表示映射为发音方式、元音、部位、清浊 4 个分组的联合预测,并保证组合在音系上合法。例如不能给一个塞音同时赋予元音高低值,不能给元音赋予只属于辅音的部位冲突。

举例说明:假设输入是单词 cat 的一段波形,期望输出不是字母序列,而是按时间切分的 3 段描述,分别对应清软腭塞音、低前元音、清齿龈塞音,这正是论文示意图中左右两条路线共同指向的评估示例,该例子只用于理解输出形态,不代表模型在该词上的实测分数。 评测口径需要特别注意:训练用帧级标签,报告用音素段级指标。

做法是把帧级对数概率在每个非静音音素区间内求和,再按头取最大值得到每段一个 22 维向量,基线则是把预测音素序列按同一查找表映射为段内恒定的特征向量,然后计算 21 个非静音特征上的宏 F1。静音被排除在聚合之外,分组 F1 分别报告方式、高低、前后、部位与清浊。这种先对齐到段再比较的设计,是为了让帧级直判模型与序列级 CTC 模型可比,复述时不能把帧准确率与段宏 F1 混为一谈。

两条路线全景:直接预测与先认音素再查表如何并排比较?

论文并排比较了两套系统。第一套是 PhonoQ-2.0,输入波形经过冻结的多语言 wav2vec2 骨干、线性投影、两层 Conformer,再进入 4 个并行分类头,最后经过条件解码输出合法组合。第二套是 CTC 音素基线,微调同一骨干加 CTC 音素头得到音素序列,再用跨语言共享的固定查找表映射到同样的 22 维库存。两者训练数据按语言分别相同,评估切分相同,映射表相同,这是公平比较的基础。图 1 把这种并排关系画得很清楚,左侧是两条路线从同一输入分叉再汇合到评估,右侧是 PhonoQ-2.0 内部的堆叠顺序与冻结微调标识,阅读时应先走通主路径再看分支差异。

看图路径: 1. 先从左图顶部输入沿箭头向下看两条分支在哪里分叉、在哪里汇合到评估;2. 再看右图从原始波形到冻结层与微调层的颜色图例区分;3. 确认两层 Conformer 与四个并行分类头到条件解码的先后顺序;4. 对照左侧事后映射与右侧直接预测的输出示例是否对应同一组发音描述

原论文 Figure 1:Pipeline comparison. Left: CTC-Phoneme predicts phonemes, which are mapped to phonological…

论文图 1。原论文 Figure 1:“Pipeline comparison. Left: CTC-Phoneme predicts phonemes, which are mapped to phonological classes, while PhonoQ-2.0 predicts phonological features directly.”。

CTC 音素基线 × 事后映射: CTC 音素基线负责在相同声学骨干上预测音素序列,事后映射负责用固定电话到特征查找表把每个音素确定性转成 22 维特征向量,二者搭配是为了在同一特征空间内公平比较音素优先路线与特征直判路线,组合意义是把音素错误与特征错误放在同一把尺子上度量。

从像素可见,左图顶部是 cat 波形示例,向下分出 CTC 音素分支与 PhonoQ-2.0 个分支,前者经过事后映射得到 kæt 再转写为 3 段发音描述,后者直接输出同样的 3 段描述,两路箭头最终汇入底部评估框。右图自上而下依次为原始波形输入、卷积特征提取器、24 层 Transformer、层归一化加投影、两层 Conformer 编码器、并行分类头与条件解码,图例用红色火焰表示微调、雪花表示冻结、虚线框表示示例。关键教学点是冻结与微调的分界:24 层 Transformer 冻结,只训练投影、Conformer 与分类头,而 CTC 分支则微调同一骨干,这种参数更新范围的不同必须在复现时保留,不能误读为两套系统都冻结骨干。

编码器与四个头各自做什么,门控为何必要?

声学骨干采用 XLSR-ft,即为音素识别微调过的多语言 wav2vec2 个模型,24 层 Transformer 在 PhonoQ-2.0 训练时全部冻结。冻结的含义是梯度不更新这些层,只把它们当作特征提取器,训练的梯度只流向共享线性投影、两层 Conformer 与 4 个头。Conformer 配置在正文中给出为维度 512、4 个注意力头、带相对位置偏置,共两层,每层内部包含前馈、多头自注意力、卷积、前馈与层归一化模块。4 个头分别做 9 分类发音方式、6 分类元音特征、5 分类部位、2 分类清浊,均用交叉熵训练。论文强调与普通多标签分类器的区别不在于多几个头,而在于显式建模组间依赖。

发音方式头 × 条件门控解码: 发音方式头负责先判断当前帧是静音、辅音大类还是元音,条件门控解码负责只在合法大类下激活对应子头,例如只对元音预测高低前后,只对相关辅元音预测部位,二者搭配是因为音系组合不是自由多标签,组合意义是以结构约束消除元音特征出现在辅音上这类不合法输出并提高可解释性。

门控的动作可以这样复述:先看发音方式头的判断,若判为元音才允许元音高低前后头的结果生效,若判为相关辅音或元音才允许部位头按兼容类输出,从而避免元音特征出现在塞音上这类非法组合。标签侧的规范化同样服务于结构一致性:重音、长短、鼻化等超音段标记被归一,塞擦音连字变体被统一,德语送气塞音归并为不送气,音节辅音归并,英语齿龈闪音与 R 化元音归并,西班牙语词内浊塞擦化变体按擦音表面实现处理,双元音按核心元音赋高低前后,例如 aI 与 aU 按低央处理。这些细节决定了 22 维中每 1 维的训练目标,复现时若跳过归一化会导致类别数对不上。

监督从哪里来,优化如何设置,何时停止?

监督来源是蒙特利尔强制对齐器产生的音素对齐,经上述规范化后再映射为帧级 22 维标签,并转为每秒 50 帧表示。PhonoQ-2.0 用 AdamW 优化,权重衰减 0.01,编码器侧与预测头侧采用不同学习率,分别为 1 乘 10 的负 5 次方与 1 乘 10 的负 3 次方,最多训练 40 轮,批量 16,梯度裁剪 0.5,标签平滑 0.05,中心帧对齐与按头类别加权以缓解不均衡,早停依据开发集宏 F1。CTC 音素基线则用默认训练器配置,学习率 3 乘 10 的负 5 次方,权重衰减 0.01,训练 10 轮,批量 8,半精度,模型选择依据开发集音素错误率。两者的选择标准不同,这一点在解读结果时要记住:一个按特征宏 F1 选模型,一个按音素错误率选模型。

帧级监督 × 音素段级评估: 帧级监督负责用蒙特利尔强制对齐结果转成的每秒 50 帧标签训练 4 个分类头,音素段级评估负责把同一音素段内所有帧对数概率求和后再按头取最大值得到一个结构向量,二者搭配是因为训练需要细粒度对齐而比较需要与 CTC 的段级输出对齐,组合意义是既保留帧级建模能力又不让评估占任一方法的便宜。

需要指出原文未报告的内容:4 个头的损失如何加权求和、Conformer 中 dropout 与学习率调度细节、CTC 头的词表大小与空白符处理,均未在给定证据中交代,复述时应明确标为缺项而不猜测。梯度路径方面,仅明确骨干冻结而投影与上层更新,CTC 分支则微调骨干,未给出逐层冻结消融,因此不能断言哪几层最关键。推理时 PhonoQ-2.0 的帧级输出需按音素段聚合,这一步没有可学习参数,属于确定性后处理。

数据、划分与基线条件是否一致?

训练与评估覆盖德语、英语、西班牙语、捷克语,分属日耳曼、罗曼与斯拉夫语系。每种语言训练量约 52 到 56 小时:西班牙语由 14.5 小时 CommonPhone 加 38 小时拉美西班牙语构成,后者含阿根廷、智利、哥伦比亚、秘鲁、波多黎各与委内瑞拉公开语音;英语由 14.1 小时 CommonPhone 加 4 小时 TIMIT 加 36 小时 LibriSpeech 构成;德语由 13.6 小时 CommonPhone 加 40 小时 Carina 构成;捷克语因无 CommonPhone 覆盖,用 16 小时 CommonVoice 加 40 小时 ParlaSpeech 构成近似切分。

开发与测试各约 2 到 3 小时每语言,开发用 CommonPhone 开发集或捷克匹配的 CommonVoice 开发集,测试用 CommonPhone 测试集为域内,另用 FLEURS 每语言约 51 到 53 分钟与 VoxPopuli 每语言约 2 到 3 小时为跨语料域外。未见语言用 CommonPhone 中的法语、意大利语、俄语,训练时未见。

域内评估 × 跨语料域外评估: 域内评估负责在与训练同分布的语料测试集上度量上限,跨语料域外评估负责换到朗读与议会演讲等不同信道与风格上度量鲁棒性,二者搭配是因为只看域内会高估实用性,组合意义是分离建模能力与分布偏移带来的损失。

基线一致性方面,论文明确两套系统按语言使用相同训练数据与相同评估切分,共享声学骨干类型与 22 维评估空间,指标方向为音素错误率越低越好,宏 F1 与分组 F1 越高越好。需要核对的一个细节是未见语言对照并未偏向新方法:CTC 基线除 4 种语言外还见过俄语与法语额外数据,因此若新方法仍胜出,更支持特征直判的迁移优势而非数据覆盖优势。硬件与统计显著性在给定证据中未报告,复现时应记为缺项。

主结果:在相同特征空间内直接预测带来多大增益?

主结果的比较问题是:在同一骨干与同一 22 维空间下,直接预测特征是否稳定超过先认音素再查表。公平条件是同语言训练数据、同切分、同映射表,指标为段级宏 F1 越高越好,音素错误率越低越好。下表整理原文直接报告的总体数字,宽表要求用五列呈现条件、指标、基线、新方法与比较对象,数字与单位保留原文写法,裸值不擅自加百分号。表前这段提出问题与公平条件,表后一段解释收益与代价。

条件指标基线本方法比较对象
域内总体宏 F182.5%91.3%CTC 音素映射 vs PhonoQ-2.0
域内总体音素错误率6.80% PER overall未报告CTC 音素基线
域外 FLEURS 总体宏 F180.6%89.9%CTC 音素映射 vs PhonoQ-2.0
域外 VoxPopuli 总体宏 F180.0%87.8%CTC 音素映射 vs PhonoQ-2.0
域内增益差值基准+8.8 F1 in-domain平均增益
域外增益差值基准+8.6 out-of-domain平均增益

表后解释如下。论文报告域内 CTC 映射宏 F1 仅 82.5%,而 PhonoQ-2.0 达 91.3%,域外两套语料分别从 80.6% 到 89.9% 与从 80.0% 到 87.8%,平均增益域内 8.8、域外 8.6。分语言看提升从捷克约 7.3 到英语约 11.6,英语同时音素错误率最高达 9.52%,提示在语音条件更难时结构化建模收益更大。

代价是域外绝对值仍低于域内,德语在 VoxPopuli 上掉点较多,说明分布偏移并未消除。西班牙语的例子最有说服力:CTC 音素错误率已低至 3.49%,映射后仍落后 7.6 个点,表明即使音素很准,查表得到的特征仍不准,这是支持直接建模的关键反证。

看图路径: 1. 先按顶部 manner、height、backness、place、voice 五组分区看颜色图例;2. 再逐组比较蓝色 CTC 基线与橙色直判方法在每个细类上的柱高差;3. 重点观察塞擦音与近音等基线明显偏矮的柱子提升幅度;4. 确认清浊组基线已高但仍有小幅提升而非单点突破

原论文 Figure 2:Per-feature segment-level F1 (%) on the in-domain CV-test set for CTC-Phoneme and PhonoQ-2.0.

论文图 2。原论文 Figure 2:“Per-feature segment-level F1 (%) on the in-domain CV-test set for CTC-Phoneme and PhonoQ-2.0.”。

图 2 展示域内逐特征段级 F1,横轴按方式、高低、前后、部位与清浊分组,纵轴为 F1,蓝色为 CTC 基线,橙色为直接预测。从像素可见橙色柱在几乎每个细类上都高于蓝色,差距最大的在塞擦音与近音,基线蓝色柱明显偏矮而橙色恢复到 0.9 附近;部位组中腭音与后齿龈音基线偏低但橙色拉起最多;清浊组基线已高但橙色仍有小幅上移。这支持论文的判断:增益分布在整个库存而非靠单一类别,即使去掉最低的塞擦音,总体提升依然成立。

未见语言:没有训练过的法意俄会发生什么?

未见语言的比较问题是:当音素库存发生变化时,直接预测发音维度是否比查表更能迁移。公平条件是对法语、意大利语、俄语做零样本测试,CTC 基线甚至见过部分法俄数据,因此不偏向新方法。指标仍为音素错误率越低越好、宏 F1 越高越好。下表用五列整理原文直接报告的总体与分语言增益,数字保留原文精度,百分点差与相对百分比不混用。

条件指标基线本方法比较对象
未见语言平均宏 F166.9%73.6%CTC 映射 vs PhonoQ-2.0
未见语言平均平均增益基准+6.7 on average零样本
未见语言平均音素错误率40.38% PER未报告CTC 基线
未见语言平均宏 F1 高精度66.90% F173.56%同上
意大利语增益基准+10.8 points最大单语增益

表后解释如下。论文报告 CTC 映射平均仅 66.90%,新方法达 73.56%,绝对提升约 6.67,平均表述为从 66.9% 到 73.6% 提升 6.7,最大单语为意大利语 10.8,法语约 5.9,俄语约 3.3。支持的判断是发音接地带来一定跨库存韧性,限制是绝对值仍比域内低约 18 个点,且俄语提升最小,说明腭化等库存外对比无法靠现有 22 维覆盖。

不能把趋势推广为每组都胜,还需看分特征表确认是否集中在元音或清浊等易迁移维度。

增益是精度与召回同时改善,还是以一方换另一方?

这一节回答的不是去掉哪个模块,而是论文提供的最接近消融的证据:逐特征精度召回分析与跨代比较。先看精度召回图,若箭头多指向右上方,则说明 2 维同时改善而非权衡。若箭头水平或垂直移动,则可能是以一方换另一方。公平条件仍是同域内切分与同特征空间,指标方向为右上越好。

看图路径: 1. 先确认四个子图分别为方式、元音、部位和清浊,横轴召回纵轴精确率;2. 再看空心圆到实心点的箭头方向是否多指向右上方;3. 重点观察方式图中塞擦音与近音的长箭头起点与终点;4. 对照部位图中后齿龈音与腭音等基线偏左下点的移动是否同时改善两维

原论文 Figure 3:Precision and recall per phonological feature on the in-domain CV-test.

论文图 3。原论文 Figure 3:“Precision and recall per phonological feature on the in-domain CV-test. Arrows connect CTC-Phoneme to PhonoQ- 2.0.”。

从像素可见 4 个子图中空心圆代表 CTC 基线、实心点代表新方法,箭头大多向右上方移动,背景灰色等高线为 F1 参考。方式子图中塞擦音起点最靠左下而箭头最长,近音与 R 音也有大幅右上移动;元音子图中高低前后六点均向右上靠拢;部位子图中后齿龈音与腭音起点偏左下但终点明显上移;清浊子图中清音沿召回轴大幅右移。

这表明论文所称系统性增强有像素支持,不是孤立修正。未胜出项也要指出:清浊中的浊音与鼻音等基线已高的点移动很短,说明在易学维度上收益有限,这正是具体代价与边界。 另一组跨代证据是与原 PhonoQ 在德语与西班牙语上的比较,限制在 12 个共享维度上计算宏 F1,原文报告新方法在 FLEURS 与 VoxPopuli 上全面领先,老系统在方式与部位上明显偏低。

这支持编码器升级与多头门控的联合价值,但因同时改变骨干与结构,不能归因于单一改动,复述时应写为联合改进而非门控单独的功劳。

哪些对比不在特征库存内,结论的边界在哪里?

论文在讨论中明确列出 3 类库存外对比:法语鼻化元音缺少鼻化特征,俄语腭化不在特征空间内,意大利语 geminate 长辅音与短辅音不区分。这意味着在这些语言上,即使声学模型听到差异,输出层也没有对应维度可表达,评估时必然丢分。复述时应把这点记为方法边界而非实现失误,扩展库存与评测更多类型学距离远的语言是作者自己提出的下一步。

另一边界是训练与推理成本未报告:冻结 24 层虽减少可训练参数,但推理仍需跑全骨干加 Conformer,输出帧率与延迟、显存占用均未给出,因此不能承诺更快或更便宜。统计方面未报告置信区间与显著性检验,总体趋势不等于每组每步都成立,德语域外掉点就是反例。相关性不等于因果:自监督表示编码发音结构是引用前人发现,本文的增益支持直接建模有用,但未证明门控单独带来多少,需进一步做去掉门控的对照才能分离贡献。

要复现这套比较,先做什么,需要哪些超参数?

复现的第一步是拿到代码与权重。资源状态显示代码仓库当前可用,地址为公开仓库,论文脚注称代码、训练模型与使用说明已公开,解读时可写当前可用。声学骨干为公开的多语言 wav2vec2 微调版本,训练时冻结全部 24 层,只训练投影、两层 Conformer 与 4 个头,CTC 分支则微调同一骨干。

数据侧需按语言准备约 52 到 56 小时训练语音与 2 到 3 小时开发测试,并用强制对齐生成音素段,再按论文规则做归一化:去重音长短鼻化标记、统一塞擦连字、按语言归并送气、闪音、R 化元音与西班牙语变体,双元音按核心赋值。 训练超参数保留原文:PhonoQ-2.0 用 AdamW、权重衰减 0.01、编码器学习率 1 乘 10 的负 5 次方、头学习率 1 乘 10 的负 3 次方、最多 40 轮、批量 16、梯度裁剪 0.5、标签平滑 0.05、中心帧对齐、按头类别加权、早停看开发集宏 F1;CTC 用学习率 3 乘 10 的负 5 次方、权重衰减 0.01、10 轮、批量 8、半精度、按音素错误率选模型。

评估必须复刻段级聚合:帧对数概率在段内求和再按头取最大,静音排除,宏 F1 在 21 个非静音特征上平均。缺项是损失加权、调度、随机种子与硬件预算,复现报告中应明确标出未验证。

何时值得尝试直接预测特征,何时仍用音素优先?

当目标本身就是发音层面的度量,例如发音评估、语言学习反馈、低资源语言的跨语迁移,或需要可解释的发音维度而非正字法时,直接预测 22 维特征值得尝试,因为同骨干下它在域内、域外与未见语言上一致高于查表路线,且精度召回同时改善。复现时应先在一种语言上跑通帧到段的聚合与映射表对齐,再扩展到多语言联合训练,避免先调大模型而忽略标签归一化。

当下游需要精确音素符号或词序列,或库存外对比恰是关键,例如法语鼻化、俄语腭化、意大利语长短对比,则音素优先或扩展库存的方案更合适,因为当前 22 维无法表达这些对比,零样本绝对值仍低。还需补的验证是去掉门控的对照、更多远距离语言、以及延迟与显存实测,只有补齐这些才能判断结构约束的独立贡献与部署代价。总体上,论文显示音素很准不等于特征很准,直接建模发音结构是可行且有利的替代,而非对所有任务的取代。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总