英文题目:Beyond Pitch: Multidimensional Cue Reweighting of Two High-Falling Tones in Pingdingshan Mandarin
会议身份:
conference:interspeech:2026:conference-paper-id:chen26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #发声与构音 #社会语音学 #语音 #音频分类
评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Zhuo Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Bingliang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
平顶山话阳平即Tone 2与去声即Tone 4均实现为高降调,输入为28个(C)V单音节在孤立字与载体句两种条件下的发音,输出为两调类能否维持区分及所用线索权重,难点在于基频轮廓高度重叠。研究同步采集声学与声门图信号并做元音切分与嘎裂声自动检测,输出的f0、开放商、速度商、能量与嘎裂时程进入函数主成分分析与逻辑斯蒂fPCA提取时程得分。得分再由线性混合模型检验调类与年龄交互,并由条件随机森林量化相对权重,森林输出的权重排序揭示历时再分配。与以往只描述嗓音伴随低调不同,该工作把老中青三代作为历时代理变量,直接检验音高趋同下权重再分配,意义在于呈现从音高主导向多维线索竞争的逆向演变。在区分T2与T4的任务下,Creak PC1指标的β估计为10.20,高于F0 PC1指标的β估计为2.31,随机森林平均AUC超过0.97。该结论仅适用于产出端,未经感知实验证实产出与感知是否一致,且多数被试兼通标准普通话。原文未披露训练与部署成本,个体随机森林可视化见外部GitHub链接。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的只是两个高降调吗?
这篇解读的输入是 2026 年悉尼 Interspeech 收录的平顶山话声调研究,目标是让刚进入语音与音乐音频领域的研究生能复述方法与证据链条,必须保留的信息包括 32 名发音人、三代年龄分组、声学与喉头仪同步记录、单念与载体句两种语境、音高、发声、时长与能量 4 类线索,以及混合模型与随机森林两套统计。输出是一条可核对的因果链:老年组靠什么区分,中年组发生什么松动,青年组用什么补上。
平顶山话的任务不是识别 4 个声调,而是聚焦第二声与第四声。按论文记法,阴平、阳平、上声、去声依次记为 T1 至 T4,其中 T2 与 T4 都被描写为高起点的下降调,听感与平均基频轮廓非常接近。如果只看音高,两个调在前半段几乎重合,差异主要藏在后半段下降早晚与终点高低。初学者容易把声调等同于音高曲线,但这篇论文要讲的正是当音高不够用时,系统如何调用其他线索。
白话说,音高就是声带振动快慢带来的高低感,英文为 pitch 或 f0;发声就是声门开合方式带来的音色紧松,英文为 phonation,嘎裂声是其中一种低频不规则振动,英文为 creaky voice。论文还用了开放商与速度商,英文为 Open Quotient 与 Speed Quotient,分别度量开放时长占比与开闭不对称性。把这 4 个词固定下来,后文才能读懂曲线与模型。
音高 × 发声: 音高负责承载声调最主要的轮廓高低与升降走势,发声负责描述声门开合方式带来的音色差异,二者搭配的理由是它们共享喉部调控机制又提供相对独立的听觉信息,组合意义在于当音高轮廓趋同时,发声可以接过部分对比负担,维持 T2 与 T4 的词义区分。
从学习依赖看,先要接受声调是多维现象,再理解代际比较如何代理历时变化。论文采用表面时间范式,英文为 apparent-time paradigm,用同时录到的老年、中年、青年代替几十年跟踪。如果青年人与老年人在同一实验条件下系统性不同,且变化方向一致,就支持正在发生中的权重转移,但这仍是间接证据,不能直接等同于某个人一生中的变化。
相关路线:从发声到音高,以及反方向为何少见?
经典声调起源理论讲的是正向链条:辅音清浊差异先在元音上留下发声差异,再被音系化为音高差异。吴语与越南语是常被引用的例子。反方向是音高磨损后,发声重新变重要,在 tonoexodus 讨论与越南义安方言中见过报道,即原本多个声调合并为少数降调,残余区别靠微小音高差与发声维持。
在共时层面,发声作为次要线索并不罕见。普通话三声尾段的嘎裂、粤语低降调的嘎裂、北方越南语两个曲折调的发声差异,都说明音高主导时发声仍可帮忙。短语末尾、噪声掩蔽或基频信息被移除时,听者也会更多利用发声与时长。这些是同一时刻的补偿,不能直接证明历时权重发生了代际转移。
河南及周边官话提供了合适的观察窗口。此前对豫东方言、冀鲁官话、河北方言与禹州话的研究已报告两个高降调很像,且嘎裂可能参与区分,但缺少社会语言学分层与系统的生理测量,无法判断嘎裂是稳定的伴随特征还是正在扩大的音位线索。这正是本研究要补的位置:用三代人、声学加喉头仪、单念加连续语流,检验权重是否在移动。
问题如何界定:对比机制是否在发生代际变化?
论文把问题收敛为两个可检验的判断。第一,T2 与 T4 的区分是否依赖音高、发声、时长与能量的多维线索,而不只看平均基频高低。第二,这种多维权重是否存在代际差异,即老年组以音高为主,青年组更多调用发声与时长。如果两个判断都成立,就构成从音高主导向多维协同的再加权,英文为 cue reweighting。
举例说明,假如只比较两个调的平均音高,T2 整体更高似乎就能分开。但论文的曲线显示,T2 前半段较平,T4 更早开始明显下降,终点更低,同时后半段的开放商、速度商与能量也分叉。这意味着分类器若只用均值会丢掉时程信息,必须用能保留曲线形状的表示。例子仅为教学示意,不代表论文报告了某个均值分类准确率。
需要提前划清边界。研究只做生产端,没有做感知实验,因此不能回答听者是否真的用嘎裂来听辨。也只做了中原官话一个点,不能推广到所有高降调系统。条件效应只检验单念与载体句两种语境,不能推广到自然对话语速与焦点变化。
方法全景:一个样本要走过哪些步骤?
先沿一个样本走完全程。发音人看到汉字目标词,按随机顺序在单念与载体句我念某字给你听对应方言拼音语料中各读三遍,麦克风与喉头仪同步记录声学与声门阻抗信号。标注阶段在 Praat 中从第二个声门脉冲切到共振峰明显衰减处,取出元音段,再用 VoiceSauce 提取基频与能量,用 KayPentax CSL 提取开放商与速度商,用 MATLAB 程序按阈值检测嘎裂。每个元音等分为 18 段,取均值后只保留中间 16 段进入分析,以减轻前后辅音与载体句的协同发音污染。
接着是表示阶段。对数变换基频与能量,做被试内 z 分数归一化,去除正负 3 倍标准差之外的离群点。连续曲线用函数主成分分析压缩,离散嘎裂用逻辑函数主成分分析压缩。主成分 1 大体对应整体上下平移,主成分 2 大体对应前后半程对比,嘎裂主成分 1 对应后半程出现概率。最后是建模阶段,线性混合模型检验差异是否显著,条件随机森林估计每个线索对区分 T2 与 T4 的相对重要性。
下面这张图是理解表示的关键,它同时给出原始平均轮廓与主成分形状,前半段重合后半段分叉的形态决定了后文为何选用整体量与形状量两类分数。请先读导读再看图,看完再读解释。
上排 4 个面板为跨归一化时长的平均轨迹,下排 8 个小面板为主成分加减 2 倍标准差后的曲线形态,括号内为各自解释方差比例,整体方差累积均超过 70%,这是后文只用前两个主成分进入权重比较的前提。
看图路径: 1. 先看上排四个面板的横轴归一化时长与纵轴 z 分数,确认 T1 至 T4 的颜色与线型;2. 对比红色 T2 与蓝色 T4 在前半段是否贴合、后半段何时分叉;3. 再看下排 PC1 与 PC2 的均值黑线与正负 2 倍标准差虚线,理解整体平移与前后对比的含义;4. 重点核对 OQ 与 SQ 在后半段的分离是否与 f0 分叉位置对应
论文图 1。原论文 Figure 1:“Acoustic/physiological trajectories and fPCA results across normalized duration.”。
从像素可见,上排基频面板中红色 T2 前半段平缓、后半段才明显下落,蓝色 T4 更早开始持续下降,终点明显更低;开放商面板中蓝色 T4 在后半段持续走低,红色 T2 先降后升再降;速度商与能量面板也在后半段出现可辨分离。下排主成分形态显示,主成分 1 多为整体上下平移,主成分 2 多为前后半程反向,括号内如 F0 主成分 1 约 60%、主成分 2 约 20%,说明用两个分数已能抓住主要时程变异。这直接支持后文把 F0_PC1、F0_PC2、OQ_PC1、SQ_PC2、能量与嘎裂分数并列比较的做法。
组件与计算:EGG、嘎裂检测与主成分各管什么?
声学端用 Sony ECM-44B 话筒经调音台与声卡以 44.1 千赫兹 16 比特存入 Adobe Audition,喉头仪用 Laryngograph EGG-D200 同步记录声门阻抗。开放商定义为开放相除以周期,速度商定义为开放相除以关闭相,EGG 信号取 25% 幅度阈值求得。嘎裂检测用 Drugman 等人程序,阈值设为 0.04,每段 18 个等分区间内若嘎裂时长超一半则记为 1,否则为 0。
开放商 × 速度商: 开放商负责量化一个声门周期中声门开放相占全周期的比例,速度商负责量化开放相与关闭相之间的相对速度,二者搭配的理由是仅看开放时长无法区分开合不对称性,组合意义在于从 EGG 波形中同时读出紧缩程度与开闭急缓,为判断尾段是否进入嘎裂提供生理依据。
主成分部分用 R 做网格搜索加广义交叉验证选择样条基数与平滑惩罚。连续量用普通函数主成分,嘎裂二值序列用逻辑函数主成分。论文报告各参数累积解释方差均超 70%,具体为基频、开放商、速度商、能量与嘎裂分别达到八成多到 90%,这意味着降维损失有限,后续混合模型与随机森林的输入是压缩后的形状分数加时长,而非原始逐点波形。
函数主成分分析 × 逻辑: 函数主成分分析负责把连续的 f0、开放商、速度商与能量曲线压缩为可比较的整体偏移与前后半程对比分数,逻辑负责把二值化的嘎裂有无序列压缩为后半程出现概率特征,二者搭配的理由是连续量与二值量需要不同的似然假设,组合意义在于让 4 种连续线索与一种离散发声线索进入同一套混合模型与权重比较框架。
随机森林端用 party 包的条件随机森林,11 个预测量包括时长、基频、开放商、速度商、能量的主成分分数、嘎裂分数,以及一个由随机化 F0 主成分 1 生成的无效基线。超参数为 300 棵树、最小分裂 10、最小桶 4,用条件置换重要性重复 100 次取平均,再换算为相对权重并用贝塔回归比较差异,分类性能用 AUC 报告。这种设计的好处是能处理共线性,并用无效基线判断某个线索是否真正高于随机。
没有神经网络训练时,什么在拟合与选择?
本研究没有训练神经网络声调分类器,也没有更新任何声学模型参数,因此不存在梯度路径、冻结层与反向传播需要交代的部分。该节的真实计算是统计拟合与模型选择。线性混合模型用 lme4 拟合,以声调、年龄与语境为固定效应,被试与词语为随机效应,采用自上而下策略先放最大可收敛随机结构,再按收敛与拟合优度精简。时长模型高阶项不收敛,故固定效应只保留两两交互,其余主成分模型用三因素全交互。显著性用三型 Wald F 检验加 Satterthwaite 自由度,事后比较用估计边际均值加 Bonferroni 校正,显著水平为 0.05。
线性混合模型 × 条件随机森林: 线性混合模型负责在控制被试与词语随机差异后检验声调、年龄与语境的主效应与交互,发声与时长是否代际扩大在此得到显著性判断,条件随机森林负责在多重共线下估计 11 个预测量对 T2 与 T4 分类的相对重要性,二者搭配的理由是前者回答差异是否可信,后者回答差异在分类中有多大用,组合意义在于把显著性与权重两条证据链对齐。
随机森林部分也不是神经训练,而是自助抽样加条件置换的集成评估。论文未报告学习率、优化器与早停,因为这些概念不适用;实际可复现的是树的数量与分裂阈值、置换重复次数、相对权重换算与 AUC 评估。未报告的缺项包括 EGG 阈值之外的鲁棒性、不同随机种子下的权重方差,以及词语随机效应的具体方差分量,这些缺项不影响主结论的可读性,但复现时需要自行记录。
实验条件:人、材料、语境与有效样本如何控制?
被试为 32 名平顶山话母语者,按年龄分为老年、中年、青年 3 组,每组男女大致均衡,老年平均约 76 岁,中年约 49 岁,青年约 22 岁,均无听力与言语障碍,无语言学或心理学专业训练,大多兼通普通话,均签署知情同意并获得报酬。材料为 28 个单音节词,覆盖 4 个声调,元音限于 a、i、u,声母若有则限于不送气塞音,以控制辅音扰动。呈现用 PsychoPy 随机化,每个目标在单念与载体句中各重复 3 次。
基调 × 协同发音: 基调在这里指归一化后的被试内 z 分数零点附近的平均轮廓位置,协同发音指相邻音段对目标元音开头与结尾的牵引,搭配的理由是只有先统一量纲并切除受污染的头尾区间,才能比较真正的调型差异,组合意义在于论文只分析中间 16 个区间并做对数与 z 分数处理,以降低个体音域与语境的影响。
录音在平顶山安静环境完成,同步双通道 digitize,标注只取元音稳态段。连续参数做对数与被试内 z 分数,离群点剔除后剩余 4252 个有效样本,四声分布大致均衡,主成分累积解释方差均超 70%。下表把样本量与解释方差放在一起,目的是核对数据规模与降维充分性,表中数字与单位均来自原文连续句,裸计数不擅自加百分号,百分比保留原文 1 位小数。
| 方面 | 总量或参数 | T1 或 f0 | T2 或 OQ | T3 或 SQ 与能量 | T4 或 Creak |
|---|---|---|---|---|---|
| 有效样本 | 4252 valid samples | 1016 | 1160 | 1072,Energy 89.2% | 1004,Creak 90.2% |
| 累积解释方差 | 超过 70% | f0 84.8% | OQ 73.9% | SQ 76.7% | 见上 |
表后需要说明代价与边界。4252 的规模对三代比较是足够的,但老年组每性别仅 5 人,个体差异容易放大;只分析中间 16 段虽减少了协同发音,却也丢掉了声调起点与尾段衰减的绝对信息。解释方差虽高,但主成分 1 与主成分 2 仍是抽象形状,复现时必须用同一归一化与同一区间切分,否则分数不可比。未胜出的能量线索在平均轮廓上也有后半段分离,但后文权重分析中并未成为主要线索,这提示肉眼可见的分离不等于分类重要,须以随机森林与显著性为准。
主结果:谁在变,变的是哪个调的哪一段?
混合模型的事后比较显示,T2 在 4 个参数上显著高于 T4,包括基频主成分 1、开放商主成分 1、速度商主成分 2 与嘎裂主成分 1,具体效应与 p 值见下表。关键在于声调与年龄的交互:变化主要来自 T4,而非 T2 整体漂移。青年组相对老年组,T4 的基频主成分 2 更高、开放商主成分 1 更低、时长更短,基频轮廓差异收窄而嗓音质量差异扩大。嘎裂主成分 1 的调间差异也在扩大,原因是 T2 尾段嘎裂概率下降而 T4 尾段明显上升。语境主效应显著,载体句整体压低音高、缩短时长、减少嘎裂与能量,但未改变上述代际趋势,说明青年组的多线索策略在单念与连续语流中都稳定出现。
下表先回答公平比较问题:在同一归一化、同一随机效应结构下,哪些参数的调间差异显著,代际变化又集中在 T4 的哪些量上。指标方向为估计均值差,正值表示 T2 高于 T4,p 值越小支持越强,但效应大小仍需结合随机森林权重判断实用重要性。
| 参数 | 比较对象 | β | p | 方向 |
|---|---|---|---|---|
| F0 PC1 | T2 vs T4 | β = 2.31 | p < 0.001 | T2 高于 T4 |
| OQ PC1 | T2 vs T4 | β = 0.61 | p = 0.022 | T2 高于 T4 |
| SQ PC2 与 Creak PC1 | T2 vs T4 | β = 0.49,β = 10.20 | p = 0.025,p = 0.009 | T2 高于 T4 |
| F0 PC2 与 OQ PC1 与时长 | 年轻 T4 vs 年老 | β = 0.84,β = −1.40,β = −0.39 | p = 0.007,p = 0.037,p = 0.010 | T4 变化主导 |
表后解释主要收益与代价。收益是定位了变化载体:不是两个调一起漂,而是 T4 更快下降、更短、更紧、更易嘎裂,从而在音高形状接近时用发声与时长拉开距离。代价是线性模型 1 次只看一个分数,无法回答多个线索联合时谁更重要,且个别参数如速度商主成分 2 虽显著,权重分析中并未成为主线索。反例是能量虽然后半段也分叉,但在代际权重中没有接棒,说明不是所有可见差异都会被音系化。
先看嘎裂热图,它把自动检测的逐段概率按年龄、语境与声调展开,是理解发声代际扩大的最直接证据。单念时对比最清楚,载体句整体颜色变浅表示嘎裂被抑制,但代际方向不变。
看图路径: 1. 先按行找到 T2 与 T4,按列区分单念与载体句,观察蓝色到红色的概率变化;2. 沿归一化时长从起点滑到终点,比较老年、中年、青年三行尾段颜色深浅;3. 再看右侧逻辑主成分曲线,确认均值黑线与正负方向虚线的后半程爬升形态
论文图 2。原论文 Figure 2:“Automatically detected creak occurrence.”。
从像素可见,左侧热图最下一行 T4 在青年行尾段出现红色高概率区,而 T2 对应位置随代际变浅;载体句右侧整体偏蓝但 T4 尾段仍保留相对更高的浅色概率。右侧逻辑主成分曲线中均值黑线在后半程爬升至约 40%,负向虚线可冲高至近 100%,正向虚线几乎贴零,说明该主成分确实捕获后半程有无嘎裂的对比。结合正文,老年到青年 T2 尾段收缩而 T4 尾段扩张,构成发声权重上升的观测基础。
再看估计均值图,它把混合模型的事后结果可视化,误差条为置信区间,星号为显著性,可以直接读出收窄与扩大分别发生在哪里。
看图路径: 1. 先确认四个子图纵轴分别为时长、F0_PC2、OQ_PC1 与 Creak_PC1 的估计均值;2. 对比每图内红色 T2 与蓝色 T4 在老年、中年、青年三点的距离是扩大还是收窄;3. 注意星号标注的代际差异与声调间差异分别出现在 T4 线还是 T2 与 T4 之间
论文图 3。原论文 Figure 3:“Estimated means for Duration, f0, OQ, and Creak across age groups by Tone (T2 vs.”。
从像素可见,左上时长面板中蓝色 T4 线随年龄下移,青年点明显低于老年;右上基频主成分 2 面板中老年时红蓝距离最大,青年时两线几乎重合;左下开放商主成分 1 面板中蓝色 T4 线大幅下探,青年组调间差异最大;右下嘎裂主成分 1 面板中红色 T2 微升而蓝色 T4 下移,青年组差异星号最多。这组对照支持论文的判断:音高形状差异缩小,发声与时长差异扩大,且变化主要由 T4 驱动。
权重分析:拿掉音高后,谁能顶上?
线性模型回答是否显著,随机森林回答有多重要。所有模型的平均 AUC 超过 0.97,说明用这套多维分数区分 T2 与 T4 是高度可分的,权重比较不是在随机分类上空谈。老年组基频主成分 1 为主、主成分 2 为次,时长有小作用,发声不区分;中年组基频主成分 2 权重下降,主要靠主成分 1;青年组基频主成分 1 仍高但主导性减弱,时长与嘎裂主成分 1 显著上升为两大线索。这些代际重排与前文混合模型的收窄与扩大方向一致。
下表把随机森林的运行条件与性能放在一起,目的是说明权重结论建立在可运行的分类器上,而非事后最优挑选。表格不代替权重条形图,只证明评估条件一致与性能可靠。
| 方面 | 树数 | 最小分裂 | 最小桶 | 性能 |
|---|---|---|---|---|
| 设置与结果 | 300 trees | minimum split of 10 | minimum bucket of 4 | average AUC exceeded 0.97 |
表后需讲清代价与个体差异。平均 AUC 高不等于每个被试都如此,个体层面多数老年与中年仍靠音高,但个别中年已开始用嘎裂,多数青年更突出时长与嘎裂,其中 5 人出现发声权重超过音高,9 人把嘎裂作为首要或次要线索,也有青年如 YM01 仍保守地以音高为主。这种微观变异正是渐变中的常态,说明音高到发声的转移是可能方向而非已完成突变。未胜出项包括能量与多数速度商分量,它们显著高于无效基线的程度有限,在青年组没有成为主线索。
下面这张图是权重结论的核心,绿色表示显著高于随机基线,字母为组间两两比较的紧凑字母显示,条长为相对权重。请先按三列分别找最长条,再比较时长与嘎裂的爬升。
三列分别为老年、中年、青年,纵轴为特征,横轴为相对权重,绿色为显著高于无效基线,灰色为无差异,字母相同表示无显著差异,这是判断主次线索更替的直接依据。
看图路径: 1. 先按老年、中年、青年三列分别找到最长的绿色条,确认主线索是什么;2. 比较 Duration 与 Creak_PC1 两条在三列中的长度变化;3. 对照灰色无效基线与字母分组,判断哪些线索显著高于随机基线
论文图 4。原论文 Figure 4:“Relative weighting of different cues in random forest models of three generations.”。
从像素可见,老年列最长绿条为 F0_PC1 约 0.5,其次为 F0_PC2 与 Duration 的小条,Creak_PC1 几乎为零;中年列 F0_PC1 更长接近 0.8,F0_PC2 退为灰色小条;青年列 F0_PC1 回落至约 0.35,Duration 升至约 0.3,Creak_PC1 与部分能量与开放商出现显著绿条。这说明主线索仍是音高整体水平,但青年组已形成音高加时长加发声的多维结构,发声在部分个体甚至超过音高,与正文报告的 5 人反超一致。
限制:哪些推论目前还不能做?
第一,缺少感知验证。生产端权重上升不等于听者真的依赖嘎裂与时长做判断,论文明确把感知实验列为未来工作。在补上听辨与权重判断之前,只能说生产机制显示再加权,用可能与待验证表达听者策略,避免把相关性写成因果。
第二,样本与语境有限。老年组人数较少,词语仅 28 个且声母受控,载体句只有一种,无法评估焦点、语速与自然对话的影响。能量整体受语境压缩明显,若换更快语速,时长线索可能被削弱,发声线索的稳定性仍需检验。
第三,生理推断需谨慎。开放商降低与嘎裂增多在声学上相关,但论文用 25% 阈值与固定检测阈值求得,阈值选择会影响绝对概率。时长差异被解释为降调喉肌生理与嘎裂目标协同的结果,这属于有限解释而非直接肌电证据,复现时应保留原始 EGG 波形以备重算不同阈值。
复现先做什么:按原文重走一遍的清单
先重建语料与录音链。按 28 词、四声、3 个元音、不送气塞音组织词表,用 PsychoPy 随机呈现单念与载体句各三遍,同步双通道 44.1 千赫兹 16 比特记录,保留知情同意与报酬记录。标注时从第二个声门脉冲到共振峰衰减切元音,等分 18 段后只用中间 16 段,基频与能量取对数后做被试内 z 分数,剔除正负 3 倍标准差之外样本。
再重跑表示与统计。用网格搜索加广义交叉验证选样条基数与平滑,对连续量做函数主成分、对二值嘎裂做逻辑主成分,保留累积超 70% 的分数。混合模型固定效应为声调乘年龄乘语境,随机为被试内声调乘语境加词语截距,时长只保留两两交互,显著水平 0.05 加 Bonferroni 校正。随机森林用 300 树、最小分裂 10、最小桶 4、条件置换 100 次,加随机化无效基线并报告 AUC。
资源状态必须如实写。本次收到的证据中没有来源绑定且完成 HTTPS 验证的资源,不得声称代码、模型或数据已公开。正文提到的个体可视化仓库链接在本次证据中未能确认可达,复现时应以论文方法文字为准自行实现,不依赖外部下载。
收束:何时值得尝试多维线索思路?
当研究对象出现两个轮廓贴合的高降调,且后半段分离不稳定时,值得按本研究的顺序尝试:先画归一化平均轮廓确认分叉位置,再用主成分保留形状,接着用混合模型定位变化来自哪个调,最后用带无效基线的随机森林估计实用权重。如果老年与青年在同一流程下呈现音高收窄而发声与时长扩大,且载体句中方向不变,就支持多维再加权的判断。
何时不应套用。若声调系统有韵尾或 checked 音节的历史来源,时长差异可能来自音节结构而非调型生理,此时需另设对照;若只有单一年龄组或只有单念语料,不宜做历时推断。教学上最易误解的是把嘎裂当成噪音或把时长当成语速副产品,论文的反证是 T4 更短与更嘎裂恰好协同,共同维持了与 T2 的声学距离,这需要同时看开放商、嘎裂概率与时长 3 条证据才能成立。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



