英文题目:Do Speech Emphasis Models Generalize across Languages and Emotions?

会议身份:conference:interspeech:2026:conference-paper-id:wei26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #基准设计 #韵律 #跨语言 #语音属性识别

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Megan Wei:机构信息未能从会议 PDF 纯文本可靠映射
  • Deepali Aneja:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaqi Su:机构信息未能从会议 PDF 纯文本可靠映射
  • Yunyun Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Haonan Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zeyu Jin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音重音检测需从连续语音映射到词级突出度,难点在于韵律实现随语言类型、声调系统与情感唤醒度漂移,单一语言中性朗读训练难以覆盖变异。作者先以内部表现力语音库为底,用大语言模型辅助生成剧本与表演指导并由母语演员演绎,构建覆盖7宏语言、10地域变体与34类情感风格的万条MMEE语料;继而对原始录音做降噪、Qwen3-ASR词级对齐切分与多阶段清洗,其输出进入Prolific母语者三级感知标注并聚合为二值与连续标量目标。随后以EmphaClass微调XLS-R做帧级分类与标量回归、以WhiStress冻结Whisper并增设解码器分类头,在单语、跨语、混合多语与高低唤醒交叉等六种划分下统一评测。与合成处方标签或英语朗读范式不同,该工作以人类分级感知与情感风格覆盖检验表征可迁移性,强调感知韵律结构的跨范式共享。在跨数据集评测设置下,MMEE英语训练的EmphaClass的二值准确率为0.886,高于反向迁移的二值准确率0.798。结论在罗曼与日耳曼语族内较稳而向汉语声调语言大幅衰减,其适用边界受限于专有原始语料与情感均衡之外的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

重音识别在解决什么沟通问题?

输入是连续语音与对应词序列,目标是判断听者会感知到哪些词被强调,输出是词级二值判定或连续显著度分数。本次解读的输入是论文原文证据与 3 张官方原图像素,目标是让研究生能核对方法与复述实验条件,必须保留的信息包括数据规模与划分、2 模型的训练配置、评估模式与报告数字,输出是按学习依赖展开的技术解读。

同样一串词 You can’t sit here,重读地点与重读动作会传达拒绝对象完全不同的意图,文本转语音需要知道哪里加重才能自然,语音到语音翻译需要把重音带过去才不丢失焦点,意图理解也需要重音线索。难点在于重音不是文本属性,而是韵律实现,音高抬升、能量增强和时长拉长都可能承载它,而这些线索又随语言、声调系统和情绪状态变化。已有工作多在单语中性朗读上训练评估,或用合成语音的预设重音做标签,缺少跨语言跨情绪的人类听感检验,这正是本文要补的缺口。

韵律重音 × 感知标注: 韵律重音指说话人用音高、强度和时长变化使某个词凸显以表达对比、焦点或意图的声学实现,感知标注指母语听者听完音频后点选自己听到的重音词的主观判断,二者搭配的理由是同一声学变化在不同语言和情绪下可被感知为不同强度,组合意义在于把模型目标从复刻合成脚本改为预测人耳实际听感。

把重音定义为母语听者的感知判断而非词典重音或句法焦点,是后续全部标注与评估的前提。感知意味着同一音频不同听者可能分歧,论文因此用 10 人重复标注并保留分歧,而不是请专家 1 次性裁定结构重音。例子:合成系统可以在脚本里写好强调 storm 再用韵律标签合成出来,但听者是否真觉得 storm 凸显仍需实测,这就是预设标签与感知标签的差别。本文坚持感知路线,所以一致性、强调率和 3 级量表的设计都围绕听感展开。

已有四条路线各验证了什么、缺了什么?

按同输入同目标同监督来对照更公平。第一条是众包感知路线,以 Morrison 等人在 LibriTTS 有声书朗读上用众包点选重音为代表,输入是真实朗读,监督是听者感知,与本文同输入同目标,但只覆盖英语中性朗读,标注密度为每样本 1 到 8 个,报告的平均成对 Cohen’s κ 为 0.226。本文在同类感知路线上把语言扩到 7 个宏语言 10 个地域变体,把情绪扩到 34 类,把每样本标注固定为 10 个,报告的合并 κ 为 0.451。第二条是合成预设路线,以 EmphAssess 为代表,脚本先标重音再合成,标签来自脚本而非听觉,优点是可控,缺点是未经感知验证。

第三条是合成加语言模型生成路线,以 TinyStress-15K 为代表,用 GPT-4o-mini 选重音词再用谷歌语音合成加韵律调整,标签是大模型生成而非人听。第 4 条是专家音系路线,以 Aix-MARSEC 为代表,语言学家用窄节奏单元记号标结构,词含节奏单元首音节即算重读,属于音系结构而非感知凸显。

本文的比较问题是不同标签来源是否学到可迁移的同一韵律结构,公平条件是都做词级二值评估,指标方向是准确率越高越好。表 1 原文对比显示本文在语言数、说话人数、情绪覆盖和每样本标注数上占优,但这只是数据配置表,不能代替性能收益。未胜出项是中文一致性最低,仅为 0.285 的公平区间,提示声调语言的感知分歧更大。未评测边界是这些先前数据集本身不含情绪维度,因此不能直接回答跨情绪问题,只能通过本文新做的跨唤醒度划分来补。

论文把泛化拆成哪四个可检验问题?

第一个问题是重音检测器在语言和语系间如何迁移,操作是单语训练后测其他语言,观察是否随类型学距离下降。第二个问题是多语联合训练是否比单语更稳健,操作是把全部地域变体训练集拼成多语模型,对比其在各单语测试集上是否持平或超越单语模型。第三个问题是一种唤醒度训练后能否泛化到另一种唤醒度,操作是按情绪环模型的唤醒维度划分高低子集并做域内与跨域测试。

第四个问题是人类感知标签与合成标签是否支持可迁移表示,操作是双向跨数据集测试。每个问题都固定了划分与指标:词级二值用准确率,标量用预测均值与人工均值之间的皮尔逊相关,相关越高表示程度排序越一致。需要提醒的是准确率受类别不平衡影响,强调词占比约 15% 到 22%,因此只看准确率会高估,还需结合 F1 与相关系数一起读。

从一条音频到词分数要走哪几步?

沿一个样本走完全程有助于定位 2 个模型的差异。输入是一段 1 到 2 句的剪辑音频及其词级时间戳与转写文本,表示是声学帧序列或 Whisper 的编码器隐状态,组件是分类或回归头,目标是每个词的感知显著度,输出是词级二值标签或 0 到 1 连续分。EmphaClass 路线先用多语自监督编码对波形编码到帧,再用线性加 Sigmoid 的回归头或分类头映射到帧分数,最后按词内帧多数投票或均值聚合成词分数。

WhiStress 路线先用冻结的 Whisper 编码器解码器得到第 9 层隐状态,再经一个新增解码块融合,最后经全连接分类头输出词元分数。两者的监督都来自同一 MMEE 聚合标签,只是损失不同:二值用加权交叉熵或交叉熵,标量 EmphaClass 用均方误差,WhiStress 标量用二值交叉熵。

选择这两个架构的理由在原文有明确交代:它们是当前公开的重音检测代表,一个偏声学微调,一个偏复用识别大模型,便于检验泛化差异是否与预训练语言覆盖有关。原文未给出梯度是否截断到编码器之外的细节时不应猜测,EmphaClass 明确写了微调,WhiStress 明确写了冻结 Whisper 只训新增块与头,这部分按原文交代为准。

标签如何从 10 人三档点选聚合成可训练目标?

标注时听者先听音频,界面要求先确认音频与文本是否匹配,再用点击标记感知到的重音词,点 1 次为强调,点 2 次为重度强调,再点则重置为未强调,每句最多标记比例受限,提交后不可返回修改。这种不可修改与比例上限的设计是为了防止事后统一答案与全选作弊。聚合时分两条支路,二值支路以超过 5 人标记为阈值判为强调,标量支路把三档映射为 0、0.5、1 后对 10 人取均值,得到连续凸显分。对 10 人取均值的作用是降低单个听者阈值差异的影响,分歧大的词会落在中间值而非硬 0 或 1。

二值标签 × 标量显著度: 二值标签负责回答词是否被多数人判为重读,做法是 10 人中超过一半标注重读即为 1,标量显著度负责保留分歧程度,把未强调记 0、强调记 0.5、重度强调记 1 后对 10 人取均值,二者搭配的原因是二值便于与合成基准对齐而标量保留 graded 感知,组合后可用准确率看判定、用皮尔逊相关看程度排序是否一致。

初学者易误解是把标量当成概率,实际上它是平均感知强度,不是模型置信度。训练时 EmphaClass 把填充位置的标签置为负 100 以排除损失,避免把补齐帧误当未强调类,这是实现细节中值得复述的一步。评估时二值看准确率与 F1,标量看皮尔逊相关,方向都是越高越好,但 F1 对少数类更敏感,相关对排序更敏感。

两个模型的结构与损失有何实质差别?

EmphaClass 基于 1,000,000,000 参数的多语 XLS-R 编码器,骨干源自 Wav2Vec 2.0,帧级二值分类时若词内超过一半帧判为强调则词判为强调,扩展到标量时把分类头换成线性加 Sigmoid 回归头并用均方误差训练,可变长序列的填充改用负 100 排除。WhiStress 基于冻结的 Whisper 小模型,为支持多语把英文专用检查点换成多语 small 检查点并传入语言标记,把编码器与解码器第 9 层隐状态送入新增解码块再接分类头,二值用类别权重为 1 比 2.33 的加权交叉熵,标量用二值交叉熵。

EmphaClass × WhiStress: EmphaClass 分工是基于多语自监督声学编码做帧级分类或回归,直接从波形学韵律线索,WhiStress 分工是冻结 Whisper 编码器解码器并外加解码块和词元分类头,利用已习得的语音文本对齐做词级重音判定,二者搭配的理由是分别代表声学微调路线与大模型复用路线,组合比较能区分泛化差异来自声学表示还是来自解码结构与语言条件。

搭配比较的价值在于预训练覆盖不同:XLS-R 本身多语,Whisper 原版有英文专用与多语之分,原文跨数据集分析明确指出原始 WhiStress 用 whisper-small.en 而 MMEE 训练版用 whisper-small,这解释了部分英语方向差异。原文未报告解码块具体维度与初始化时不应脑补,只复述已给的层号、训练轮数与优化器设置。

数据如何从原始录音变成可标注的 10000 条?

该节承担方法中的构造职责,论文没有提出新优化器,训练指数据构建与模型拟合两部分,需分别交代。原始语料是内部招募母语配音演员按语言与情绪类别录制的表现性语音,剧本与表演指导借助大模型生成以诱发韵律变化,但演员常自行诠释,实际重音靠音高能量时长实现。地域覆盖包括美洲英语、其他英语、西班牙西班牙语、拉美西班牙语、巴西葡萄牙语、欧洲葡萄牙语、德语、法语、意大利语和普通话,每类约 20 名说话人。

清洗流程是统一降噪,用 Qwen3 语音识别取词时间戳并切成 1 到 2 句,在均方根能量低谷处精修边界避免切断音素,再重识别并与源脚本做归一化序列相似度,阈值 99% 以上才保留,另检查波形截断、首尾超过 1 秒静音、词时长异常和 200 毫秒裁剪敏感性测试,未通过则迭代重裁,用语音活动检测定位起止后重验,再用大模型做 3 轮一致转写裁判与人工 mismatch 复核去重并平衡情绪至每语言每情绪约 29 到 30 条,最终每语言类 1000 条共 10000 条 14.13 小时。

以下导读针对标注界面像素,帮你把文字规则对应到可见控件,读图时先看任务说明再看高亮与播放控件的位置关系。

看图路径: 1. 先看顶部说明文字确认任务是先核对音频与文本是否一致再点选重音词;2. 再看例句行中浅色与深色高亮如何区分强调与重度强调两档;3. 接着看下方播放条与是否匹配单选项确认质量守门的位置;4. 最后看下一步按钮不可返回的提示理解标注不可修改的约束

原论文 Figure 1:Speech emphasis annotation interface on Prolific.

论文图 1。原论文 Figure 1:“Speech emphasis annotation interface on Prolific. Participants click on words in the transcript they perceive as emphasized after listening to the audio.”。

该界面显示英文例句 We made it through the storm unscathed,其中 storm 为浅色强调、unscathed 为深色重度强调,顶部绿字提示最多标 3 个词已标 2 个,下方有音频播放条与音频是否与文本一致的是否单选,底部下一步按钮点后不可返回。解释是 3 级感知通过单击双击实现,匹配检查与上限约束共同保证标签质量,78 条有 2 人以上报不匹配的样本经复核仅 8 条需重裁,其余确认为有效,这说明 mismatch 率仅 0.78% 且有闭环处理。

划分、指标与硬件如何保证可比?

数据划分为固定 80 比 10 比 10 训练验证测试,多语的全部集由各地域变体的对应划分合并而成,单语实验共 13 种配置,跨语为 1 对多零样本测试,多语用 8000 条训练并在各单语测试集与合并测试集上评估,唤醒度子集各为 2070 条训练加 270 条验证与 270 条测试并在语言与情绪间平衡,数据规模实验从 800 到 8000 条按 10% 到 100% 嵌套抽样且验证测试固定为各 1000 条。指标为词级二值准确率与 F1 加标量皮尔逊相关,方向越高越好,跨数据集统一用二值以适配合成基准的二值格式。硬件为 8 块 80 吉字节 A100,超参数按原文保留:EmphaClass 与 WhiStress 的具体轮数、学习率、预热、批量与损失见下表,复现时应先对齐这些信息条件再谈改进。

下面比较问题是 2 模型在可运行配置上有何差异,公平条件是同划分同聚合,指标方向已在表头交代,数值与单位保留原文写法。

模型训练轮数学习率批量与预热损失与头
WhiStress2 轮5 × 10−4批量 32,预热 5%,权重衰减 0.01二值加权交叉熵权重 1 比 2.33,标量用二值交叉熵,融合编码解码第 9 层

该表整理自原文连续句,主要收益是可直接复现,代价是 EmphaClass 训练轮数多而批量小,对显存与时间更敏感,WhiStress 冻结主干只训新增块因而轮数少但依赖 Whisper 语言标记。未胜出项是原文未报告优化器类型与解码块参数量,这是复现前需补的缺项,不能从模型名推定。没有像素证据时不猜曲线颜色对应的具体数值,只引用正文报告。

单语、跨语与多语结果支持什么判断?

以下导读针对跨语言热力图,先建立面板与坐标含义再比较语系块,这是判断泛化断裂点的关键。

看图路径: 1. 先确认四个面板分别为两种模型的准确率与皮尔逊相关;2. 再沿横轴训练语言与纵轴测试语言找到对角线单语块与非对角跨语块;3. 比较罗曼语族内部小方块与跨到中文列的颜色变浅程度;4. 最后看最下一行多语联合训练在各列是否恢复深色

原论文 Figure 2:Binary Accuracy and Scalar (Pearson Correlation) results for EmphaClass and WhiStress.

论文图 2。原论文 Figure 2:“Binary Accuracy and Scalar (Pearson Correlation) results for EmphaClass and WhiStress.”。

四面板分别为 EmphaClass 准确率、WhiStress 准确率与各自皮尔逊相关,横轴为训练语言、纵轴为测试语言,右侧标注日耳曼、罗曼与中文语系,对角线为单语性能,非对角为跨语零样本,最下一行为多语联合训练。可见单语对角普遍较深,罗曼语族内部互测接近单语,跨到中文列明显变浅,中文行作为测试也偏低,与声调系统中基频同时编码声调与凸显的解释一致,也与中文标注一致性最低相互印证。多语最后一行在各列恢复深色,常持平或超过单语,报告为多语暴露多样韵律后抑制了语言特有过拟合。

跨语言迁移 × 多语联合训练: 跨语言迁移指只用一种语言训练后零样本测另一种语言,检验学到的是通用韵律还是语言特有线索,多语联合训练指把 10 个地域变体的训练集拼成 8000 条一起训练,检验多样韵律暴露能否抑制过拟合,二者搭配的原因是前者暴露断裂点、后者检验修复手段,组合意义在于给出部署策略:单语模型不够,多语池化更稳健。

该结果的支持限度是相关性不是因果,不能断言语系标签本身导致下降,仍可能是说话人、脚本或标注习惯混杂。适用条件是零样本跨语,若允许目标语言少量微调结论可能改变,但原文未测该条件,属待验证。训练资源与推理延迟未测量,不承诺多语模型在延迟上更优。

跨唤醒度与跨数据集是否真迁移?

测的是情绪声学变化是否破坏重音表示,与谁比是域内训练测试与跨域训练测试,条件一致指高低唤醒子集都在语言与情绪间平衡且规模相同,指标方向为准确率与相关越高越好。关键数字见下表,EmphaClass 高到高 0.848 准确率 0.846 相关,低到低 0.871 与 0.840,高到低 0.857 与 0.814,低到高 0.857 与 0.833,WhiStress 4 条件准确率在 0.908 到 0.920 之间,相关在 0.814 到 0.833 之间,跨域仅比域内小幅下降,支持重音信号可部分与唤醒度驱动的音高能量语速变化分离的判断。

条件EmphaClass 准确率EmphaClass 皮尔逊相关WhiStress 准确率WhiStress 皮尔逊相关
高唤醒训练高唤醒测试0.8480.8460.9180.833
低唤醒训练低唤醒测试0.8710.8400.9120.823
高唤醒训练低唤醒测试0.8570.8140.9080.819
低唤醒训练高唤醒测试0.8570.8330.9200.814

表后解释是主要收益为跨唤醒稳健,代价是标量相关跨域仍有约 0.02 到 0.03 下降,说明程度排序比有无判断更易受情绪影响。未胜出项是低到低的 EmphaClass 准确率反而高于高到高,提示低唤醒慢速 lengthened 实现可能更易判定,但原文仅报告现象,未验证因果。跨数据集方向见另一表,双向均显著高于随机,MMEE 英文到 EmphAssess 达 0.886 而反向为 0.798,TinyStress 到 MMEE 英文为 0.881 而反向 MMEE 英文到 TinyStress 为 0.873,支持合成与感知共享相当大韵律信号,但反向不对称提示检查点语言覆盖与合成英语声学接地的影响。

方向数据与模型条件二值准确率对照方向对照准确率
MMEE 英文到合成基准EmphaClass 到 EmphAssess0.886反向 EmphAssess 到 MMEE 英文0.798
MMEE 多语到合成基准EmphaClass 到 EmphAssess0.875同上0.798
MMEE 英文到合成基准WhiStress 到 TinyStress-15K0.873反向 TinyStress 到 MMEE 英文0.881
MMEE 多语到合成基准WhiStress 到 TinyStress-15K0.876同上0.881

该第二表的比较条件是统一二值评估,指标越高越好,主要收益是双向迁移成立,代价是原始模型在 MMEE 多语上因分词不支持而未测,这是明确的未评测边界,不应把英文结果推广到多语。

数据规模与标注设计带来多大变化?

以下导读针对数据规模曲线,重点区分准确率、F1 与相关的不同斜率,避免把一条线平坦误读为全部饱和。

看图路径: 1. 先确认左右两图分别为 WhiStress 与 EmphaClass 横轴为数据比例纵轴为分数;2. 再比较蓝色准确率线与绿色皮尔逊线的斜率差异;3. 观察 WhiStress 绿线在 10% 到 20% 处的陡峭爬升与后续平坦;4. 最后看红色 F1 线整体偏低且随规模缓慢上升的形态

原论文 Figure 3:Binary (Accuracy, F1) and scalar (Pearson Correla- tion) performance as a function of training…

论文图 3。原论文 Figure 3:“Binary (Accuracy, F1) and scalar (Pearson Correla- tion) performance as a function of training data scale.”。

左图 WhiStress 蓝色准确率线在 10% 时已约 0.90 附近且随规模几乎平坦,绿色皮尔逊线从 10% 约 0.58 陡升至 20% 约 0.81 后缓慢爬升至 100% 约 0.86,红色 F1 线从约 0.61 升至约 0.69。右图 EmphaClass 蓝色准确率从约 0.85 缓慢升至约 0.87,绿色相关从约 0.82 升至约 0.86,红色 F1 从约 0.72 升至约 0.75。解释是初始快速增益后收益递减,2 模型都相对数据高效,多语多样性降低了对新语系大规模数据的需求,这对低资源语言有实际意义。

高唤醒 × 低唤醒: 高唤醒指兴奋、愤怒、恐惧等高音高高能量快语速状态,低唤醒指平静、悲伤、无聊等低平音高慢速状态,二者搭配做交叉训练测试的理由是重音的音高时长实现会随唤醒度改变,组合意义在于检验模型学到的是可与唤醒度分离的重音结构还是只记住了某种情绪的音色。

总体趋势不等于每步都上升,WhiStress 在 60% 处准确率略有回落,EmphaClass 在 70% 与 100% 处相关略降,属正常波动。未胜出项是 WhiStress 标量在极小规模下明显弱于 EmphaClass,说明复用路线仍需一定量感知标量数据来校准程度排序,不能只用 10% 数据就部署标量任务。

哪些边界尚未被测量?

第一是中文泛化断裂仍未解决,多语虽恢复但中文一致性与性能仍偏低,声调与重音耦合机制需更细的声学对照而非仅归因于类型距离。第二是跨数据集仅在英文与二值下验证,多语分词不支持导致原始检查点无法测 MMEE 多语,合成到感知的多语结论待验证。第三是成本缺项,原文报告了 8 卡 A100 与批量轮数,但未报告训练时长、推理延迟、输出帧率与误判率分布,不能承诺延迟或成本改善。

第四是标注协议的上限约束要求每样本至少标一词且不超过 30% 词数,这会截断真实分布的尾部,强调率稳定在 17% 到 22% 可能是 elicitation 与约束共同作用的结果。缺失证据不是技术错误,后续需补目标语言少样本微调、误判混淆矩阵与延迟测量才能形成部署结论。

复现应先对齐什么、再跑什么?

先对齐信息条件:固定 80 比 10 比 10 划分且多语由各变体划分合并,聚合规则为二值超半数、标量 0、0.5、1 均值,EmphaClass 填充用负 100 排除,WhiStress 传入语言标记并融合第 9 层隐状态,超参数按实验设置表设置,评估用准确率、F1 与皮尔逊相关三件套。再跑最小闭环:用英文子集训 EmphaClass 二值并测英文与中文零样本,检查是否复现对角高、跨中文低的模式,再训多语模型检查是否恢复。接着跑唤醒度划分:按原文情绪名单构造高低子集并保持 2070、270、270 规模,跑域内与跨域四格。

资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,复现时应按论文描述自建流程并记录随机种子, subsample 到 10 条时使用固定种子以保证可重复。统计方面原文报告了 Fleiss κ 合并 0.446 与 Krippendorff α 序数 3 级 0.461,复现标注时应同报多指标而非只报一个 κ。

何时值得尝试多语重音建模?

当部署需覆盖多语言且含情绪化表达时值得尝试多语联合训练,证据是语系内可迁移而跨语系下降,多语池化常持平或超越单语,且跨唤醒与跨合成感知双向迁移成立,说明学到部分通用韵律结构。当目标含声调语言或需精确程度排序时要谨慎,中文与标量跨域仍有差距,需留出校准与少样本适配预算。下一步验证应补目标语少样本学习曲线、误判率与延迟成本,以及多语分词修复后的全量跨数据集测试。记住判断句式:论文报告了多语更稳健,证据支持多样性抑制过拟合的解释,但声调耦合与标注习惯的影响仍是可能而待验证的因素。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总