英文题目:Learning Contextualized Tonal Contours from F0: A Core-Auxiliary Branched Transformer for Mandarin Tone Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:liu26n_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#Transformer #高效推理 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yi-Fen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang-Li Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Po-Yu Chiu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话声调识别输入为连续语音按10 ms提取、经说话人归一化的基频 Fundamental Frequency / F0序列与强制对齐得到的音节边界,输出为每音节五类声调标签,难点在于连读变调、轻声弱化与清音段缺测导致典型轮廓形变。第一步做轮廓嵌入,将对数归一化F0线性投影后与音节 Syllable / Syl、词 Word / Wrd、语块 Chunk / Chk三级交替嵌入 Alternating Embedding相加,输出叠加位置编码的轮廓输入进入编码器。第二步做双路上下文编码,核心轮廓编码器 Contour Network / C-Net经音高层与音节层Transformer学习上下文相关轮廓表示,节奏编码器 Rhythm Network / R-Net对多区间时长统计建模节奏上下文,两路输出分别进入训练分支。第三步做梯度引导训练与精简推理,训练期核心多层表示经层特异注意力池化 Layer-specific Attention Pooling / LSAP聚合后作为辅助分支交叉注意力的键值,以三分支交叉熵等权和反传约束核心参数,推理期丢弃辅助分支,仅保留核心分支与两层多层感知机 Multilayer Perceptron / MLP分类器输出标签。与推理时仍保留融合结构的单分支TNet-Full不同,该设计把自注意力表示学习与交叉注意力梯度引导解耦。在FCU-VOICE-360同一80%、10%、10%划分下,音节词二级输入的v2-m3取得97.2%音节准确率,超过同粒度TNet-Full基线的97.0%,但轻声T5的F1值由0.971降为0.966。该结论仅在受控母语朗读上成立,对自发对话、二语口音、噪声与基频跟踪失效的外推尚未验证。原文未披露优化器、学习率、批量大小与训练推理硬件成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么普通话声调识别值得单独做成一个任务?
输入是连续语音的基频序列与时长信息,目标是对每个汉字音节判断是一声、二声、三声、四声还是轻声,输出是每个音节的声调标签。必须保留的信息是音高随时间的高低升降形状,以及音节、词和语块的边界位置,因为同样的声调在不同上下文中会被前后音节压缩或拉长,如果丢掉边界就无法知道形变发生在词内还是词间。
对于刚入门的读者,可以把声调理解为写在音节上的旋律记号,例如妈、麻、马、骂的声母韵母相近,主要靠音高走势区分,而轻声更多出现在语气词等位置,本身没有稳定的高低目标。在朗读新闻或故事这类连续语音中,声调还会出现语境变体,相邻声调互相影响导致实际轮廓偏离教科书式的五度值。论文把任务限定在母语者朗读语音的声调分类,动机是为后续二语学习者的声调误读检测积累可靠的轮廓表示,而不是直接做带语义的语音识别。
举例来说,学习者把三声读成二声时,系统需要先能稳定识别母语者的标准轮廓,才能进一步判断偏误类型,这就是本研究只用超音段信息的原因。
只用音高和只用频谱的两条路线各解决了什么?
相关路线可以按输入与建模阶段区分。第一类是超音段路线,直接用基频、时长和能量等韵律特征建模,优点是与声调定义直接对应,缺点是基频在清辅音段缺失且易受跟踪误差影响。第二类是频谱路线,用梅尔倒谱或频谱图甚至波形建模,有研究显示频谱倾斜等线索也能区分声调,在某些数据集上可以超过传统韵律特征。
建模方法上,早期有用深度神经网络加隐马尔可夫模型或卷积网络加序列准则的工作,后来加入发音信息或用自监督学习得到上下文相关表示。另一条线是编码器解码器加门控做音高跟踪,再把跟踪结果用于声调分类。论文选择站在超音段一侧,理由有两点,一是希望输入尽量简化,只保留基频与时长变化,二是希望通过可拆卸辅助网络弥补单靠基频时上下文建模不足的问题。
需要说明的是,论文没有在同一语料上重跑所有频谱基线来证明谁更好,只是把自身方法与单分支轮廓网络基线做对照,因此不能把本文结果读成超音段路线全面优于频谱路线。
要解决的具体困难是什么?输入输出如何定义?
具体困难是连续语音中的声调轮廓既要保持词义对比,又会因语速、节奏和相邻声调产生形变,模型必须在看到整段停顿单元的前提下给出每个音节的稳定判断。输入定义为每 10 毫秒提取一个基频值组成的序列,每个值取对数并按说话人各自的千分位范围归一到 0 到 1 之间,缺失值对应清音段需要特殊标记。时长信息不是直接用毫秒数,而是对每个音节计算 3 种区间上的持续时间、与句内均值的偏差以及相邻区间差异,共 9 维特征。
输出是对齐到音节的 5 个声调类别概率,训练与评估都按音节计数。一个样本的完整流程是这样的,假设输入是一段包含若干词的停顿单元,先用强制对齐得到音节词块边界,再把逐帧基频与边界标记相加得到帧表示,经过轮廓编码器压缩成音节表示,最后由分类器输出每个音节的声调。
教学例子是,若某词包含两个音节,模型会先看到两个音节各自的基频点序列,再结合词边界知道它们属于同一词,从而把第二音节起点偏高解释为连读影响,而不是直接判成高调。
核心加辅助的总体思路是什么?训练和推理有何不同?
总体框架可以概括为训练时 3 分支并联、推理时只留 1 个分支。中间是核心分支轮廓网络,负责学习可用于推理的上下文相关声调轮廓表示。左右两侧是两个辅助分支,一个是结构相同的轮廓网络,另一个是节奏网络,负责从时长变化中捕捉节奏对轮廓的影响。训练时 3 个分支各自做音节声调预测并计算损失,辅助分支通过交叉注意力读取核心分支的多层表示,其梯度会回流塑造核心参数。
推理时丢弃两个辅助分支,只用核心分支加分类器,因此计算量回到单分支水平。这种设计的安排理由在原文中写得很明确,一是把多头自注意力保留在核心分支,把跨分支的交叉注意力隔离在辅助分支,二是用层特异注意力池化聚合多层信息以增强轮廓学习。换句话说,核心分支专注于从基频到轮廓的映射,辅助分支专注于提供额外的梯度通道,而不是在推理时参与投票。
下面这张总览图展示了 3 个分支、注意力类型分离与梯度回流路径,建议先看主路径再看辅助回路。
看图路径: 1. 先沿中间黄色核心分支自下而上看输入嵌入到分类器的主路径;2. 再看左右粉色辅助分支的红色反向箭头,确认梯度回流方向;3. 最后看右下两个小图,确认层加权池化与两层分类器的内部结构
论文图 2。原论文 Figure 2:“Core-auxiliary branched Transformer framework for F0-based contour and rhythmic modeling with layer-specific attention pooling for gradient-guided learning.”。
从图中可见,中间黄色区域是推理时保留的核心分支,自下而上为输入嵌入、多层变换器块、音节池化与分类器。左右粉色区域是训练时存在的辅助分支,其变换器块标注了交叉注意力。红色线表示反向梯度流,从辅助分支经由中间的层特异注意力池化模块流回核心分支的多层输出。右下两个放大的小图分别解释了池化模块内部的两层前馈加权重与分类器内部的线性加激活加柔性最大化结构。需要强调的是,节奏辅助分支的输入嵌入与轮廓分支不同,它处理的是时长变化特征,而不是逐帧基频,这使得两条辅助通道提供的信息来源不同。
基频序列如何变成带语言结构的输入表示?
轮廓网络的输入嵌入由四部分相加构成。第一部分是逐帧基频值的线性投影,把 1 维数值映射到 256 维向量。第二部分是交替嵌入,用两种取值的可学习向量标记当前位置处于音节、词、语块的同一段内还是跨段,用来显式告知模型边界变化。第三部分是内容感知嵌入,用 5 个特殊标记区分该帧是有效基频还是缺失值,并标记词的起止与音节在词内的延续状态。第四部分是位置嵌入,保证变换器知道帧的先后顺序。
公式层面原文给出轮廓嵌入等于基频投影加 3 层交替嵌入加 3 层内容嵌入,再与位置嵌入相加得到最终输入。节奏网络的输入不同,它把每个音节 9 维时长变化特征经矩阵映射后,加上词级与语块级的成员标记嵌入,再与位置嵌入相加。
超音段信息 × 基频轮廓: 超音段信息指跨越单个音素的音高、时长、节奏与重音模式,负责承载声调类别与语境变化;基频轮廓是其中最直接的声学实现,即随时间变化的基频取值序列。两者搭配的原因是普通话声调主要由音高形状区分,但连读中形状会被相邻声调拉扯变形,因此论文把离散的语言结构对齐到连续的基频序列上,让模型既看到逐帧音高值,又知道当前帧属于哪个音节词块,从而把上下文形变学成可泛化的表示。
下面这张输入示意图把抽象的相加过程画成了多行色带与点序列,适合对照边界标记理解。
看图路径: 1. 先从最下方点状基频序列看起,确认断裂处对应清音或静音段;2. 再向上逐行对照深色块与灰色块,确认音节边界与词块交替位置;3. 最后看顶部三条长带,确认音节词块语块三个粒度的跨度嵌套关系
论文图 1。原论文 Figure 1:“Input embeddings constructed to represent F0 sequence in C-Net.”。
从像素可见,最下方是离散的黑色点状基频轨迹,中间有明显断裂,对应清音或停顿导致的缺失段。上方多行横带分别对应不同粒度的分段,深浅交替表示同一跨度与跨越边界,灰色小块与蓝色细线标记了更细的切分位置。顶部绿色长带跨度最大,代表语块层,中间橙色与黄色带分别对应词与音节层。这种画法的教学价值在于,它让初学者直观看到同一段基频点如何同时属于 3 层嵌套结构,模型正是通过把这些分段标记加到每个基频点上,使后续注意力能够区分词内协同发音与词间语调影响。
轮廓网络与节奏网络内部各做什么变换?
轮廓网络分 2 个阶段。第一阶段用 4 层变换器在帧级别捕捉音高表示,每层包含多头自注意力、残差、层归一化与前馈模块,输出仍是逐帧序列。第二阶段通过词首标记池化把帧序列压缩到音节级别,再用两层变换器精炼成音节轮廓表示,最终维度是隐层维度乘以音节数。节奏网络相对较浅,它把音节级时长嵌入送入两层变换器,捕捉上下文节奏模式,用于辅助声调学习。
核心分支与辅助轮廓分支共享这种轮廓网络结构,但参数独立,节奏分支则使用不同的输入与层数。原文明确指出,核心分支既可以作为推理主体,也可以在概念上充当辅助分支之一,而节奏网络只作为第二辅助分支。这种对称与非对称并存的设计,使得辅助轮廓分支提供同源但不同初始化的梯度视角,辅助节奏分支提供异源的时长视角。
核心分支 × 辅助分支: 核心分支指轮廓网络中最终负责推理的编码器,在测试时单独运行并输出每个音节的声调;辅助分支指训练时额外并联的轮廓分支与节奏分支,它们各自有分类器并通过交叉注意力读取核心分支的多层表示。搭配理由是让辅助损失产生的梯度经由层特异注意力池化回流到核心分支,相当于训练时多开两条监督通道塑造核心表示,而推理时把辅助分支丢弃,不增加计算量。
自注意力 × 交叉注意力: 自注意力负责在同一分支内部让不同位置互相加权,用来在核心分支中从帧级音高抽象出音节级轮廓;交叉注意力负责让辅助分支以自身表示为查询,以核心分支聚合后的多层表示为键和值进行加权,用来把核心已学到的信息拉入辅助分支做分类。两者分工不同但组合后形成梯度回路,辅助分支的分类误差通过交叉注意力路径反向影响核心参数,这是论文所说的梯度引导学习。
对于初学者,关键是不要把节奏网络误解为直接预测声调的时长分类器。它的输出同样经过分类器计算损失,但它的作用是迫使核心分支学到的轮廓表示能够与节奏变化兼容,因为时长拉长或压缩会改变基频点的采样密度与形状,若核心表示忽略节奏,就会在快慢不同的朗读中不稳定。
损失如何计算?梯度经过哪些路径?
训练目标是 3 个分支损失的不加权求和,每个分支的损失都是音节级别的类别交叉熵,对停顿单元内所有音节的 5 个声调类别求平均。3 个分支都有独立的两层多层感知分类器,结构为线性、激活、线性、柔性最大化,因此每个分支都会产生可反向的监督信号。梯度路径有两类,一类是各分支内部从自身分类器经自身变换器到自身输入嵌入的常规路径,另一类是辅助分支经交叉注意力与层特异注意力池化流向核心分支多层输出的跨分支路径。
具体而言,核心分支的 6 层音节表示先堆叠成 3 维张量,再经两层前馈加双曲正切与柔性最大化得到每层权重,加权求和后经线性与归一化得到送给辅助分支的键值。辅助分支在自身自注意力之后插入一层交叉注意力,以自身表示为查询读取这些键值,因此辅助损失对键值的梯度会进一步传到核心各层。
原文未报告学习率、优化器、训练轮数与早停细节,也未说明参数冻结或梯度截断策略,因此复现时只能确定损失形式与丢弃时机,不能推定完整的优化配置。
层特异注意力池化 × 分类器: 层特异注意力池化负责把核心分支 6 层音节级表示堆叠后学出每层权重,再加权求和得到送给辅助分支的键值,它决定不同深度特征各占多少;分类器负责把每个分支最终的音节表示映射到 5 个声调概率并计算交叉熵损失。两者搭配使 3 个分支都有独立监督信号,而池化权重决定了回流梯度主要来自哪些层,从而在不改变推理结构的前提下调节核心分支的学习重点。
需要特别指出,推理时辅助分支被丢弃意味着跨分支路径不再存在,核心分支独自前向。这种训练测试不一致是刻意设计,目的是用训练时的额外监督换取测试时的效率,而不是像集成方法那样在测试时融合多个分支。
数据从哪里来?如何划分与对齐?
实验使用自建的辅大语音语料,计划招募 400 名学生朗读 10 套不重叠的提示集,内容覆盖常用词与语境化句子。每套提示包含词与句子,最后一套略长,每套由男女各 20 人朗读。剔除噪声过大与不流利录音后,实际用于本研究的为 360 人,性别均衡。所有录音用自动对齐器得到音素、音节、词与语块边界,含静音停顿,并据此切分停顿单元与提取时长特征。最终经音节边界校验的建模集包含大量停顿单元与音节,5 类声调分布不均,第四声占比最高,轻声占比最低。
训练、验证与测试按 8 比 1 比一划分,对比的单分支基线与本方法共享同一划分与分类器结构。基线单分支模型在最后两层音节变换器中用交叉注意力融合节奏信息,输入只用音节与词 2 级粒度,而本方法在不同版本中逐步加入语块级。评估指标为音节精度与每类声调的调和平均值,精度越高越好。
音节 × 停顿单元: 音节是声调分类的基本单位,每个汉字音节对应一个声调标签;停顿单元是由静音切分出的连续语音段,是模型 1 次读入的输入长度单位。搭配原因是基频与时长特征需要在停顿单元内部归一与比较,而损失与精度在音节级别统计,因此论文先按停顿单元组织输入序列与位置编码,再按音节输出标签与评估指标。
对于复现者,最关键的依赖是边界质量与基频跟踪质量。因为输入嵌入中的交替标记完全依赖强制对齐的边界,若对齐错误,模型会收到错误的跨段信号。同样,基频缺失标记依赖基频跟踪器在清音段的判断,若跟踪器把噪声判成有效基频,有效与缺失的区分就会被污染。
主结果:在相同输入粒度下辅助训练带来了多大提升?
要回答的核心比较问题是,在输入粒度相同且推理结构同为单分支时,训练时加入辅助分支是否稳定提升核心分支的测试精度,指标方向为精度与各类调和平均值越高越好,公平条件是同一语料划分与同一两层分类器。下表整理了原文报告的 3 个粒度版本与基线的关键数字,重点看每一版本内无辅助与有辅助的对照,以及与单分支全模型的对照。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 音节粒度,无辅助与有轮廓辅助 | 精度 | 88.9 | 94.5,增加 5.6 | 同粒度核心分支 |
| 音节加词粒度,无辅助与有轮廓辅助 | 精度 | 94.9 | 97.2,增加 2.3 | 同粒度核心分支 |
| 音节加词粒度 | 精度 | 97.0 | 97.2 | 单分支全模型对核心加节奏辅助 |
| 音节加词加语块,无辅助与有轮廓辅助 | 精度 | 96.1 | 97.5,增加 1.4 | 同粒度核心分支 |
表后解释需要同时看到收益与代价。一方面,在 3 个粒度下加入辅助分支都带来提升,幅度随基线变强而缩小,从 5.6 个百分点降到 1.4 个百分点,说明辅助训练对弱输入帮助更大。另一方面,同时使用两个辅助分支并未进一步超过只用一个,报告显示同粒度下轮廓辅助、节奏辅助与双辅助的精度几乎相同,例如音节加词加语块版本均为 97.5 左右。未胜出项是单分支全模型在音节加词粒度上达到 97.0,低于本方法同粒度的 97.2,但差距不大,支持的判断是辅助训练的增益真实但有限。
限制是轻声样本最少,其调和平均值在弱模型中明显偏低,强模型中才追平,这意味着总体精度会被大类主导,复现时应同时看分调指标。
去掉语块标记或换掉辅助类型会发生什么?
消融围绕两个维度展开,一是输入粒度从音节逐步增加到词再到语块,二是辅助类型在无辅助、轮廓辅助、节奏辅助与双辅助之间切换。测的是同一核心分支在测试时的精度,因此所有数字都是丢弃辅助后的推理性能,不是集成性能。结果显示,仅增加粒度本身就能提升无辅助基线,从 88.9 到 94.9 再到 96.1,说明语言结构标记本身携带了有用信息。
固定粒度后,任何一种辅助都带来提升,但双辅助不叠加,这构成一个反证,即更多的辅助通道不必然带来更好的核心表示,可能原因是两条梯度路径在有限数据上趋于冗余。另一个未胜出细节是节奏辅助与轮廓辅助在多数版本中精度相同或仅差 0.1 以内,说明在该朗读语料上时长视角与同源轮廓视角提供的正则效果相近,不能据此断言节奏信息无用或更有用。
若要在新语料上验证,应控制说话人、语速分布与对齐质量后再比较,否则粒度与辅助的效果会与数据特性混淆。
效率与规模:丢弃辅助后真的更轻吗?
要回答的效率问题是,在精度相当或略优的前提下,推理时的乘加运算数、参数量与延迟是否降低,指标方向为越小越好,比较对象是同为音节加词粒度的单分支全模型与本方法的节奏辅助版本。公平条件是两者推理时都是单分支结构,差异在于训练配置与融合位置。下表同时列出效率与数据规模背景,避免把精度数字误读为同一指标。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 推理延迟与计算量 | 每停顿单元毫秒 | 3.413 | 2.045 | 单分支全模型对丢弃辅助后核心 |
| 推理延迟与计算量 | 每音节毫秒 | 0.696 | 0.417 | 单分支全模型对丢弃辅助后核心 |
| 模型规模 | 乘加运算数 | 374.3M | 353.0M | 单分支全模型对丢弃辅助后核心 |
| 模型规模 | 参数量 | 6.9M | 4.8M | 单分支全模型对丢弃辅助后核心 |
| 语料规模 | 停顿单元与音节数 | 75552 | 380383 | 建模集总量与声调分布背景 |
表后解释应区分训练与推理开销。报告显示丢弃辅助后的核心分支在乘加运算数、参数量与延迟上均低于单分支全模型,原因是后者在推理时仍需同时运行轮廓与节奏编码并做交叉融合,而前者推理时只有核心编码器。代价是训练时需要同时优化 3 个分支,显存与时间开销更大,但原文未给出训练时长与硬件配置,因此不能量化训练代价。
反例是效率提升幅度与实现、批大小和硬件相关,原文只报告了每停顿单元与每音节的毫秒数,未说明处理器型号与重复次数,跨机器对比时应重新测量。数据规模背景提示语料以短停顿单元为主,约半数少于 3 个音节,这会影响延迟的平均值,长句上的延迟行为仍待验证。
哪些条件没测?哪些结论不能推广?
首先是数据边界。语料为安静房间内的清晰朗读,剔除了噪声与不流利语音,且最长不超过 21 个音节,因此结论限于母语者规范朗读,不能直接推广到自发对话、儿童语音、口音语音或噪声环境。其次是监督依赖。方法依赖强制对齐提供的音节词块语块边界与基频跟踪结果,若边界漂移或基频在清音段误检,输入嵌入中的交替与有效缺失标记都会出错,但论文未做对齐噪声或跟踪误差的鲁棒性测试。第三是评估口径。
报告的是音节精度与分调调和平均值,未报告误判率矩阵、置信区间与统计显著性,也未测量误读检测等下游任务的性能,因此不能把分类精度的提升等同于二语误读诊断能力的提升。第四是资源声明。原文未发现经验证的公开代码模型或数据链接,不得声称代码模型数据已公开。最后是基线覆盖。
效率对比只针对单分支全模型,未与频谱或波形端到端系统对比推理成本,因此只能说在所比较的两种变换器配置中丢弃辅助更轻,不能说该方法在所有声调识别方案中最轻。
要复现这个方法,先做什么、按什么顺序检查?
复现应按数据、特征、模型、训练、推理的顺序推进。第一步准备带边界的语料,若使用自有语料,需先用可靠的中文强制对齐得到音节词块与停顿边界,并校验轻声与儿化等特殊音节的切分。第二步提取每 10 毫秒基频并按说话人归一,保留有效与缺失标记,同时按原文定义的 3 种区间计算 9 维时长变化特征,注意最后一 Interval 的相邻差异需用归一化变异指数替代。
第三步实现输入嵌入,包括 256 维基频投影、音节词块语块的交替嵌入、5 个特殊标记的内容嵌入与位置嵌入,维度与相加顺序需与原文一致。第四步实现核心轮廓网络的 4 层帧变换器加两层音节变换器,以及辅助轮廓与节奏分支的交叉注意力与层特异注意力池化,分类器统一用两层感知机。第五步按 3 分支交叉熵不加权求和训练,推理时只加载核心分支与分类器。
检查点包括边界文件是否与基频帧对齐、缺失帧是否正确映射到缺失标记、音节池化是否取到词首位置、辅助丢弃前后精度是否一致。若精度远低于报告值,应先检查对齐与归一,而不是急于调大模型。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 对齐与切分 | 边界来源 | 自动对齐器加静音停顿 | 音节词块语块 4 级边界 | 复现需固定的输入条件 |
上述小表提醒复现者保留长度分布信息,因为短句占比高会影响批处理与池化行为,长句截断或填充策略不同会导致结果漂移。
何时值得尝试这个思路?还需补哪项验证?
当任务满足 3 个条件时值得尝试,一是已有较准的音节与词边界,二是希望推理模型尽量小而能承受训练时更大的开销,三是输入希望保持可解释的基频加时长而不是黑盒频谱。此时可以先从音节加词粒度与单个节奏辅助开始,因为该配置在报告中达到 97.2 且推理最轻,若有效再加入语块。不值得盲目尝试的情形是边界质量差或基频跟踪不稳,此时交替标记与有效缺失标记本身就是噪声,辅助训练难以弥补。
还需补的验证包括在自发语音与二语学习者语音上的迁移测试、加入对齐扰动后的稳定性测试,以及训练成本与推理延迟在统一硬件上的完整测量。常见误解是把辅助分支当成测试时的集成,实际上测试时它们已被丢弃,提升来自训练 shaping 而非测试融合。另一个误解是把精度的小幅领先读成全面胜利,实际上双辅助不叠加、不同辅助类型差异极小,说明增益来源更可能是额外的梯度正则而非特定的节奏建模。
若能补上这些验证,该思路可为声调误读诊断提供一个轻量且可解释的起点。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

