英文题目:Not Flat, But Dissociated: Prosodic and Segmental Divergence in Neural TTS

会议身份:conference:interspeech:2026:conference-paper-id:wang26ea_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #语音学与音系 #韵律 #文本到语音

评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Rong Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Kun Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Harald Baayen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为相同文本的人类录音与合成语音,输出是对韵律与音段两层组织偏离的定位,难点在于全局评分掩盖了不同时间尺度与发音维度的异质失效。本文在13100条配对LJ-TTS话语上先提取基频动态、微扰动、轮廓形状与时域强度共21维话语级特征,做组间非参数检验与套索逻辑回归分类,以分离全局离散压缩与局部扰动信号。接着将人类录音的强制对齐边界迁移至合成语音,在元音内部相对位置采样第一与第二共振峰,计算角元音三角面积与十元音凸包面积。最后按唇音、齿龈音与软腭音分组拟合起始与中点间的线性位点方程,以检验辅音环境对元音起始的影响。与只看基频均方误差或只看元音面积的已有评测不同,本文强调全局压缩与局部反转并存的层级失调以及韵律与音段近乎独立。在LJ-TTS语料评测设置下,MixerTTS的三角面积指标为14,898,低于人类基线的三角面积指标49,955。该结论限于单说话人美式英语朗读与两阶段合成,表现力更强的自发或对话语音及新端到端架构尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决的评价盲区是什么?

本文的输入是同一文本、同一说话人、同一训练数据下的人声录音与合成语音配对。目标不是再报一个平均意见分,而是定位合成语音在哪些语言学层面上偏离人声。必须保留的信息是:语料为单人美式英语朗读,合成端共享声码器,比较的重点是声学模型结构带来的差异;输出是一组可复述的韵律与音段测量,而不是总体好坏判断。对于刚进入语音领域的读者,白话解释是:基频就是声带振动快慢决定的音高高低,随时间变化形成语调。

共振峰是声道形状决定的能量集中区,第一、第二共振峰决定元音听起来像谁。自然语音是分层组织的:整句有先高后低的下倾大骨架,局部有重读凸起和边界调,音段之间还有协同发音,即发一个音时舌头已经为下一个音做准备。常用评价把这些压成一个总分,会把不同缺陷混在一起。本文要做的是把超音段组织与音段精度分开测量,看它们是否各自偏离、是否相互关联。

资源状态方面,本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字复述语料与系统名称。

已有评价路线为什么看不到这种偏离?

已有工作主要沿 3 条路线展开。第一条是主观评价与总体客观距离。论文引用相关讨论指出,感知分会把语言学上不同的维度折叠起来,标准客观指标对语音组织捕捉不足,而基频均方根误差把整体轮廓形状与局部扰动混在一起。第二条是韵律专用评价。语调测量设计会影响判断,向合成输出引入韵律变化可以提升自然度,按音素建模基频和用掩码自编码器预训练可以改善局部音高,但这些工作没有检验跨句尺度的整体与局部是否协调。

第 3 条是音段评价。元音空间面积是发音精度的常用标志,已用于合成微调和口音评估;发音省力理论把元音边缘性下降解释为交际需求低时的目标欠达;轨迹座标方程通过回归刻画辅音部位对元音起始共振峰的约束,人类齿龈音斜率小于 1,反映很强的部位条件调整,但此前没有用于神经合成语音。

平均意见分 × 声学语音学评估: 平均意见分负责给出听感自然度的总体打分,分工是回答好不好听;声学语音学评估负责把韵律组织与音段精度拆成可定位的声学指标,分工是回答差在哪里;搭配理由是总体分会把不同维度的缺陷折叠在一起,组合意义在于用可复述的声学测量补充主观分,而不是替代主观分。

本文的增量是把超音段结构与音段组织放在同一大规模语料下联合评估,不依赖人工标注,并覆盖多种结构。教学例子是:两个系统可以得到相近的总体分,一个是语调大起伏不足但元音尚可,另一个是语调尚可但元音挤在一起;只看总分无法区分,拆开测量才能看到不同的声学策略。本文明确提出两个研究问题:韵律层面在句内基频动态上如何按时间尺度偏离;音段层面在元音目标离散度与按部位划分的协同发音上如何偏离。

要回答的两个问题如何形式化?

问题一关注韵律。操作定义是:在同一句话内部,比较人声与合成语音的基频动态。全局侧看整句的离散程度,包括标准差与极差;局部侧看逐帧变化与轮廓形状,包括帧间绝对差、方向反转、上升比例与最长单调段比例。如果全局压缩而局部反转增多,就不是整体变平,而是一种跨尺度失配。

问题二关注音段。操作定义是:比较元音在声学空间中的目标实现与上下文调节。静态侧看角点元音围成的三角形面积与 10 个单元音凸包面积;动态侧看元音内部第二共振峰轨迹按前接辅音部位的变化,以及轨迹座标方程斜率。斜率低表示辅音把起始共振峰拉向固定部位目标,协同强。

斜率接近 1 表示起始值紧跟中点值,辅音影响弱。两个问题共用同一配对设计:文本、说话人、训练数据与声码器尽量固定,把差异归因到声学模型。需要强调的是,本文不训练新合成模型,也不做听感实验,而是对已有配对语料做测量与统计检验。

方法全景:一个样本走完全流程

沿一个样本走一遍有助于建立依赖顺序。输入是一句朗读文本,例如语料中的某一句。表示层面是该文本对应的人声录音与 4 个系统各自生成的合成波形,它们共享文本与说话人条件。组件层面分为韵律分支与音段分支。韵律分支对每句提取基频与强度时序,算出 21 个句级特征,再做合并的人声对合成比较与最小绝对收缩选择算子逻辑回归分类。

音段分支先把人工核对过的强制对齐边界从人声按编号迁移到合成,在元音内部采样共振峰,算元音空间面积与按部位划分的第二共振峰变化,并拟合轨迹座标方程。目标层面是回答两个研究问题:韵律是否跨尺度脱钩,音段是否中心化与协同减弱。输出是效应量、显著性、分类性能与相关系数,而不是新的语音波形。先有样本与表示,再有组件计算,最后才是跨系统与跨层面的解释,这个顺序不能颠倒,否则会把分类器权重直接当成组间差异。

韵律分支如何计算:特征、检验与分类各管什么?

韵律分支的输入是每句的基频与强度时序。论文报告用语音学软件提取基频,范围为 75 到 500 赫兹,帧移为 10 毫秒。白话解释是:每 10 毫秒估计 1 次声带振动频率,得到一条音高曲线。特征分为 4 组:基频动态组包括半音为单位的极差与标准差、线性斜率与 2 次曲率;基频微变组包括逐帧绝对差的均值与标准差、平滑比、抖动、微光与浊音段时长变异。

轮廓形状组包括上升比例、音高拐点、每浊音帧方向反转数与最长单调段比例;时间与强度组包括浊音占比、语速、浊音段均值、句末基频下降及其速度、强度极差、标准差与斜率。检验分两层:合并比较用人声对合成池的曼惠特尼秩和检验,报告秩 2 列相关与科恩效应量,并对 21 项比较做错误发现率校正;分系统比较用配对句的符号秩检验,以分离结构特异偏离。

由于 21 个特征互相关,单特征效应量不能说明独立判别信息,因此再拟合带最小绝对收缩选择算子惩罚的逻辑回归,用嵌套五折交叉验证选正则强度并估计曲线下面积。分类器系数解释为条件贡献,不是单变量组间排序。

全局基频离散度 × 局部音高反转: 全局基频离散度负责刻画整句语调起伏有多大,分工是度量超音段骨架是否舒展;局部音高反转负责刻画相邻帧之间方向改变有多频繁,分工是度量微观轮廓是否稳定;二者搭配的理由是正常韵律要求大骨架约束小扰动,组合意义在于同时看一大一小才能发现本文的脱钩:整体压扁而局部更抖,而不是单调平淡。

复述时要注意:效应量正负号定义为合成更高为正;显著性阈值与校正方法要与原文一致;分类性能只说明特征集可分,不证明某一特征必然因果致差。

音段分支如何计算:对齐、采样与面积各管什么?

音段分支的输入是人声录音的强制对齐边界与配对合成波形。白话解释是:强制对齐就是把音素符号与波形时间对上,知道每个元音从哪里到哪里。论文把来自人声的边界按句编号迁移到合成,并在 150 对匹配句上人工核查,发现迁移误差很少影响元音内部采样区。残余误差用三重约束控制:在元音内部而非边界处采样;合并的时间测量显示人声与合成无可靠位移。

各类元音的样本保留率为 85% 到 92%,且不随元音类别系统变化。采样点为元音时长的 20%、50% 与 80%,分别代表起始、中点与后部。静态目标用角点元音/i/、/A/、/u/的中心点算三角形面积,再对 10 个单元音中心算凸包面积;逐元音比较用曼惠特尼检验并做错误发现率校正。动态协同用 80% 减 20% 的第二共振峰差值刻画元音内轨迹,并按前接辅音的唇音、齿龈音、软腭音分组。

轨迹座标方程把起始第二共振峰对中点第二共振峰回归,斜率越低表示协同越强。

元音空间面积 × 发音不足: 元音空间面积负责把/i/、/A/、/u/3 个角点元音在 F1-F2 平面上撑开的面积算出来,分工是指示声学目标是否到达边缘;发音不足负责解释面积缩小背后的动作原因,分工是指示舌位没有充分抬高或后缩;搭配理由是面积是结果、动作是机制,组合意义在于把中心化从单纯的频谱模糊落到可核对的舌位方向性偏置。

这里的前置概念是共振峰采样位置与保留率,它们先于面积收缩与斜率升高的结论;若对齐不可靠,后续结论都会动摇,因此论文用核查与保留率先堵住这个缺口。

本研究训练了什么,没有训练什么?

本研究没有训练新的语音合成声学模型,也没有训练声码器。4 个被评系统是已在同一语料上训练好的外部系统:自回归注意力的串行结构、带显式时长预测的并行前馈结构、单调归一化流结构,以及多层感知机混合器主干结构。它们的共同点是 2 阶段设计,即声学模型接共享的神经声码器,因此观察到的偏离更可能反映声学模型差异。

真实计算过程是测量与统计:对每句提取韵律特征、采样共振峰、计算面积与回归斜率,再做非参数检验、效应量估计与带惩罚的分类器拟合。没有报告梯度路径、参数冻结或优化器设置,因为不存在本研究的模型训练阶段;不能把无训练等同于确定性求解,特征提取与统计估计本身仍有随机性与实现依赖。复现时不需要重训合成模型,需要的是复现测量管线:同样的基频提取参数、同样的元音内部采样比例、同样的分组与校正流程。

实验条件:数据、系统与公平性如何固定?

数据侧使用朗读语料的全部 13100 句,单人美式英语女性说话人,文本在人声与合成之间逐句配对。系统侧从 11 个同语料训练的系统中选出 4 个,覆盖自回归、并行、流与混合器等对齐与生成策略。公平条件是文本、说话人、训练数据与共享声码器尽量一致,把声学模型结构作为主要变异来源。指标方向要记牢:基频标准差与极差越大表示整体起伏越大;方向反转与拐点越多表示局部越不稳定。

元音面积越大表示目标越分散;轨迹座标斜率越低表示部位约束越强。聚合对象以句为单位做韵律比较,以元音 token 与部位分组做音段比较;显著性经多重比较校正。局限是只有朗读体、单说话人、单语言与 2 阶段系统,结论向自发或表现力语音推广时需谨慎。

论文未报告听音误判率、延迟与训练成本,因此不能从声学偏离直接承诺感知或效率收益。

韵律结果:全局压缩与局部增抖如何同时成立?

要回答的比较问题是:在文本与说话人配对、声码器共享的条件下,合成语音的句内基频组织是否与人声一致,时间结构是否也偏离。公平条件是 13100 句配对比较,指标方向是离散度高为起伏大、反转多为不稳定。合并比较显示时间尺度依赖的分离:全局侧基频标准差与极差更低,局部分轮廓不稳定性反向升高。音高拐点是此处最大的韵律效应,合成每浊音帧方向反转多约 10%,人声表现为持续的基频运动,合成表现为更频繁但更小的振荡,且上下文锚定更弱。

与此同时,浊音占比、语速与句末基频下降均不显著,说明最一致的偏离在动态基频组织,而非总体时长。多变量核查用 21 个特征区分人声与合成,嵌套交叉验证曲线下面积约为 0.85,强度标准差与逐帧基频变化的均值与标准差贡献突出;但因预测变量相关,系数符号只解释为分类器内的条件效应,不直接等同于组间方向,组间方向以单变量检验为准。

下表把正文报告的关键韵律数字整理为可核对的比较,表中方向以合成为参照,正负号与显著性口径与原文一致。表前已提出比较问题与公平条件,指标方向在表头与段落中交代,阅读时先看全局行再看局部行,才能理解脱钩而非单调平坦的判断。

条件指标人声侧报告合成侧报告比较对象与方向
配对朗读句基频离散与极差更大更小合成压缩
配对朗读句音高拐点方向反转更少多 11.8%合成升高,效应量约 +0.82
配对朗读句浊音占比语速句末下降无可靠差异无可靠差异三项均不显著
21 特征分类曲线下面积区分信息约 0.851人声对合成可分

表后解释主要收益与代价。收益是定位明确:偏离不在总体时长,而在全局与局部基频的协调;分类结果支持两类尺度都携带判别信息。代价与反例是:单看方差会漏掉局部不稳定,单看拐点会误以为整体更生动;未胜出项是时间指标,它们没有提供稳定的区分信号。适用条件是朗读体与共享声码器下的结论,换声码器或换文体时需重测。

下面先看分类器系数的可视化,它说明哪些特征在条件意义上帮助区分人声与合成,但不能单独当成组间排序。导读段已交代横轴为系数、颜色为方向,阅读时沿从上到下比较条形长度,再回到正文表格核对组间方向,避免把条件系数误读为单变量差异。

看图路径: 1. 先看横轴为 LASSO 系数与纵轴 21 个特征名,确认红色为合成更高、蓝色为合成更低;2. 再比较最长的两根横条:强度标准差偏向合成更高,帧间基频均值偏向合成更低;3. 最后核对标题中的 AUC 数值与正文嵌套交叉验证口径是否一致

原论文 Figure 1:LASSO β coefficients (AUC = 0.851, nested 5-fold CV).

论文图 2。原论文 Figure 1:“LASSO β coefficients (AUC = 0.851, nested 5-fold CV).”。

该图显示强度标准差与逐帧基频变化标准差在合成更高一侧突出,而逐帧基频均值与基频标准差在合成更低一侧突出,标题给出的曲线下面积与正文嵌套验证数值一致。解释时必须加上原文的限定:预测变量互相关,系数只反映分类器内的条件贡献;真正的组间升高或降低以校正后的单变量检验为准。这也支持跨尺度解读:全局离散与局部变化两类测度同时帮助区分,而不是只有一侧起作用。

轨迹座标方程 × 协同发音: 轨迹座标方程负责把元音起始段 F2 对元音中点 F2 做回归,分工是用斜率量化辅音对元音有多强的牵引;协同发音负责描述相邻音段在时间上重叠调音的语言学过程,分工是提供发音协同的解释框架;搭配理由是斜率越低说明辅音目标越固定、牵引越强,组合意义在于把 F2 轨迹的动态差异转化为按发音部位划分的可检验条件。

音段结果:元音空间收缩与部位调节减弱有多严重?

要回答的比较问题是:在对齐迁移可靠的前提下,合成元音目标是否到达边缘,以及前接辅音是否仍能调节元音内共振峰轨迹。公平条件是同一元音类别内比较、同一部位分组内比较,指标方向是面积大为分散、斜率低为协同强。静态结果显示严重且一致的收缩:角点三角形与十元音凸包都缩小,系统仅保留人声三角形面积的约 10% 到 30%,其中并行前馈结构收缩最严重,混合器结构保留最多。

逐元音偏置呈方向性:高前元音第二共振峰降低数百赫兹且第一共振峰升高,低后元音第一共振峰降低,央元音第二共振峰升高,后元音第二共振峰升高,反映向中心靠拢的欠达,但高后元音变化不统一,说明并非所有元音以同一方式中心化。动态结果显示唇音前后第二共振峰变化本来就接近零,人声与合成差异小;齿龈与软腭条件下人声第二共振峰明显下降,而合成仅显示很小的正向变化,表明部位条件化的轨迹运动减弱。

轨迹座标斜率在齿龈条件下最一致地升高,人声斜率低于 4 个合成斜率且置信区间不重叠;唇音与软腭模式不统一,因此证据解释为齿龈部位最强,而非全部位普适。

下表把面积、方向性偏置与轨迹变化整理为可核对的比较,数值与单位与原文句子一致,裸值不擅自添加单位,赫兹单位保留在同一单元格。表前已提出静态与动态两个比较问题,公平条件是同元音同部位比较,指标方向为面积大好、斜率低好。

条件指标人声侧报告合成侧报告比较对象与方向
高前与低后元音共振峰偏置边缘目标向中心偏移数百赫兹合成欠达
轨迹座标斜率齿龈斜率约 0.7930.827 到 0.870合成升高即协同弱

表后解释主要收益与具体代价。收益是把中心化落到可重放的量:面积比、方向性赫兹偏置与斜率三者收敛。代价是信息损失:面积缩小意味着边缘对比减弱,在噪声或表现力语音中可能更不利;反例是高后元音与唇音软腭斜率并非一致恶化,不能推广为所有音段全线崩溃。未评测边界是单说话人朗读,跨说话人与自发语流中的协同变异更大,差距可能更保守。

下面看元音空间的可视化,左右面板分别为人声与合成池,横轴为第二共振峰、纵轴为第一共振峰,颜色区分重音条件。导读段已交代先比整体离散再看重音颜色,阅读时注意中心点为每元音均值、云为样本分布,不要把单点偏移当成全部证据。

看图路径: 1. 先对比左右两块面板的横轴 F2 与纵轴 F1 范围,确认左侧人声点云更分散;2. 再看红色 stressed 与蓝色 unstressed 中心点在右侧是否都挤向中部;3. 最后检查图注关于重音条件与中心化结论的文字说明

原论文 Figure 2:Vowel space: human (left) vs. pooled TTS (right), coloured by lexical stress.

论文图 1。原论文 Figure 2:“Vowel space: human (left) vs. pooled TTS (right), coloured by lexical stress.”。

该图可见左侧人声中心点撑开较宽的四边形,右侧合成中心点无论重音与否都挤向中部,点云也更集中。解释是失败不由重音条件驱动,而是系统性的目标精度下降;这与面积百分比与方向性偏置相互印证。但像素不能精确读出每个元音的赫兹数值,具体赫兹偏置以正文逐元音报告为准,不要从散点位置硬估数值。

跨层面与跨结构对照:脱钩是否只是同一缺陷的两面?

要检验的对照问题是:韵律偏离与音段偏离是否随句子一起起伏,以及不同结构是否呈现相同的取舍。条件是每系统内计算全局韵律测度与元音缩减幅度的句级斯皮尔曼相关,人声也同样计算。指标方向是相关接近零表示独立变化。论文报告所有条件下相关都接近零,人声约为负 0.012,合成在负 0.031 到正 0.028 之间,除一个系统的微小相关外均不显著,因此不支持把两者看成同一缺陷的两面,而更支持它们是合成质量的不同维度。

跨结构对照显示系统性差异:并行前馈结构韵律偏离较小但元音坍缩最严重,其时长预测可能稳定时间,而并行生成为辅音语境塑造相邻元音提供的通路较弱;流结构局部拐点过剩最大但频谱结构相对锐利,其采样可能引入局部基频变异;混合器结构保留最多元音空间且韵律偏离中等。原文强调结构解释仍是初步的,需在受控声码器与训练条件下验证,不能当成定论。

下表把跨层面独立性与部位特异性整理为可核对的对照,表中相关系数与斜率方向与原文一致,显著性口径保留原文写法。表前比较问题是两者是否共变,公平条件是同系统内句级相关,指标方向是零相关为独立。

条件指标人声侧报告合成侧报告比较对象与方向
句级相关基频极差对元音缩减约 -0.012-0.031 到 +0.028接近零即独立
显著性相关检验不显著基本不显著仅一处微小显著
部位分组轨迹座标证据强度齿龈强约束齿龈一致升高唇软腭不统一
结构差异韵律与音段取舍人声协调各系统取舍不同互有胜负

表后解释强调实践含义:超音段与音段测度捕捉不同方面,应联合评估而非互换使用;韵律变化与元音扩张的关系可能只在更具表现力的语音中显现。未胜出项是全部位普适的协同减弱,证据只在齿龈最一致;未评测边界是更新的端到端结构,本文只覆盖 4 个 2 阶段系统。

哪些结论有边界,哪些推测尚未验证?

直接报告的是:在 13100 句配对朗读中,全局基频压缩而局部反转增多,时间指标无可靠差异;元音面积收缩到 10% 到 30%,方向性偏置指向中心,齿龈协同最一致减弱;两类偏离句级相关接近零。有限解释的是成因讨论:韵律脱钩可能源于逐帧生成缺少长程协调,元音坍缩幅度远超跨语言口音效应而不太可能仅由泛化困难导致,这些用支持表达,因为没有对训练目标做干预实验。

未验证推测是:跨尺度协调缺陷会延续到端到端新结构,差距在表现力语音中会更大,结构差异的机制归因成立;这些用可能或待验证表达。缺失证据不是技术错误:没有听感误判率、延迟、成本与多说话人覆盖,就不能承诺自然度、效率与泛化同时改善。总体趋势不等于每句成立,相关性不是因果,单看总体分不能定位缺陷。

复现先做什么,需要固定哪些细节?

复现先做测量管线,而不是重训合成器。第一步按句编号配对人声与合成,确保文本与说话人一致,并记录声码器是否共享,因为声码器不同会引入额外变异。第二步复现韵律提取:基频范围与帧移、半音转换、21 个特征的定义与聚合口径,再做合并的非参数检验与错误发现率校正,最后用嵌套交叉验证拟合带惩罚的逻辑回归并报告曲线下面积。

第三步复现音段管线:用同一强制对齐工具从人声得到边界并迁移到合成,在元音时长 20%、50%、80% 处采样共振峰,计算角点三角形与十元音凸包面积,保留率按元音类别统计,再按唇、齿龈、软腭分组算轨迹差值并拟合轨迹座标回归。第四步做跨层面相关:每系统内算全局韵律测度与元音缩减的秩相关并报告置信与显著性。关键超参数与信息条件是基频提取上下限、帧移、采样比例、分组定义与校正方法;若原文未给出某实现细节,应明确记为缺项而不从模型名称推定。

何时值得尝试是:当总体分相近但怀疑缺陷维度不同,或要在不做听音时快速定位语调与元音问题时,可先跑这套声学语音学测量再决定是否补听音验证。

收束:记住哪三组可复述的判断?

第一组判断是韵律脱钩:合成不是整体变平,而是大骨架起伏变小、局部方向反转变多,时间结构保持较好,因此缺陷定位在基频协调而非节奏。第二组判断是音段欠达:元音空间大幅收缩且偏置指向中心,齿龈语境下的协同约束最一致减弱,但并非所有元音与所有部位都以同一方式恶化。第三组判断是维度分离:两类偏离在句间几乎不相关,总体分会把它们折叠起来,评估时应把超音段与音段指标联合使用。

对于初学者,复述方法时按样本到表示到组件到目标的顺序讲,先说配对如何固定公平条件,再说韵律与音段各自算什么、怎么检验,最后说相关分析为什么支持维度分离。常见误解是把分类器系数直接当成组间排序,或把曲线向下直接读成性能变差;正确做法是组间方向以校正后的单变量检验为准,分类器只说明条件贡献,纵轴含义与升降方向要先核对再下判断。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总