英文题目:Acoustic Differences Between Citation and Sandhi Tones Across Three Generations in Xiamen Southern Min
会议身份:
conference:interspeech:2026:conference-paper-id:xie26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音属性识别
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Huangyang Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xiuwei Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Weijun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为厦门闽南语单音节与双音节图片命名录音,输出为本调与变调基频轮廓是否等同及代际差异判断,难点在于传统变调圈将多对形式记为同一调值,掩盖了次音位高度与斜率差异与年龄分化。首先由两名母语者听辨筛选正确本调与变调发音,其输出的正确token进入下一步声学测量。接着用ProsodyPro提取十点归一化对数基频并做说话人内z-score归一化与去克里克声处理,其输出的规整化轮廓进入统计建模。最后以广义加性混合模型拟合整体轮廓并用线性混合效应模型检验高度与斜率交互,以输出可检验的年龄分组差异。与仅凭听觉印象的记音传统相比,该链条以连续高度比与斜率交互量化隐性分化,使中和与分化程度可直接比较,具有揭示渐变音变的实际意义。原文未提供可核对的关键定量结果。结论限于厦门市区49人的朗读 real-word 材料,未验证自发语、跨声调语境与儿童习得轨迹。该发现的适用边界受限于朗读语体与市区样本,尚未验证自发语与跨方言的外推表现。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文从哪些证据讲起?
本文解读的输入是厦门闽南话母语者在图片命名任务中读出的单字调与双音节词变调录音,目标是回答两个可检验的问题:记作同一调值的本调与变调在声学上是否等同,以及这种等同或不等同是否随世代变化。解读必须保留的信息包括被试三代划分与人数、3 个图片命名任务的分工、十点归一化基频提取与说话人内标准化、广义加性混合模型拟合曲线与线性混合效应检验的配合,以及平调距离比、升调上升幅度、降调高度与斜率、两套 22 变调分离度这 4 组关键数字。输出是 1 篇能复述方法的中文技术解读,不做超出原文的推广。
厦门话有 5 个非促塞尾的舒声调,传统上用听感归纳写成 44、24、53、21、22,并连成一个变调圆圈。所谓听感归纳,白话说就是人耳听起来像高平、升、降的类别标签;所谓变调圆圈,就是规定在非末位置甲读成乙、乙读成丙的循环对应。初学者容易把标签当成发音本身,认为写成一样就发得一样。论文的起点恰好相反:普通话三声变调记作二声但声学有系统差异已有报道,厦门话变调更复杂且早期多凭听感,台湾闽南话虽有较多声学证据但厦门话仍缺跨世代的细致比较。因此任务不是把声音丢给模型自动分类,而是先建立可比的基频表示,再检验标签等同是否掩盖了次音位层面的高度与斜率差异。
同输入同目标的前人工作提供了什么对照?
在同为闽南话变调的研究路线上,罗常培 1930 年对厦门话的早期观察已提出变调与本调并非语音等同,变调圆圈只是记音便利,这一判断与本文用基频高度差重复验证的方向一致。陈曼君基于台湾闽南话自发语料的博士论文提出变调与其对应本调存在系统性次音位基频差异,为本文把每 1 对本调与变调单独建模提供了同目标参照。普通话三声变调记作二声的传统描写与袁毓林等基于语料库发现二者仍有声学差异的对照,说明记法等同不等于实现等同,这是本文反复引用的方法论警示。
在方法路线上,声调协同发音的类型学更新指出预期性协同弱于延续性协同,这帮助本文解释变调音节因处词首、后接另一音节而整体偏高、降调变浅的部分原因,而不把全部高度差都归于音系分化。粤语声调习得中用调距比量化声调空间的研究被借来计算 44 与 22 的平均基频比,使得压缩的本调空间可以用一个可复算的数字表达。这些相关工作不是同条件胜负比较,而是同输入同目标下的有源对照:它们共同支持用连续基频而非离散标签来检验中和是否完全。
要检验的问题如何变成可操作的比较?
论文把抽象问题拆成位置可控的比较。白话说,本调就是单字调或词末保留的调,变调用方括号表示非末位置的实际读法。操作上,单音节图片命名 elicits 本调,双音节整体图片与双图组合命名 elicits 变调加保留在词末的本调。右重规则保证了比较的公平性:双音节词中右侧音节保留本调,左侧音节取变调,因此每 1 对比较都是同一说话人、同一实验流程下不同位置的实现。
比较维度固定为两类:整体音高与曲线形状。音高用 10 个归一化时间点的平均基频或其比值表示,形状用起点到终点的升降幅度、下降斜率与曲率表示。世代维度固定为青少年 13 至 19 岁、中年 35 至 59 岁、老年 61 至 87 岁 3 组。若记法等同成立,则对应对的曲线应重合且比值接近 1;若存在次音位差异,则应看到稳定的高度差或斜率差。
若存在变化,则该差异的大小或方向应随年龄组系统移动。最关键的试金石是传统上都记作 22 的两套变调:44 变来的 22 甲与 24 变来的 22 乙,它们是否中和成为全文 age-graded 变化的核心证据。
从图片到基频曲线的方法全景是什么?
整个流程沿一个样本走一遍最清楚。假设 1 名青少年看到猪的单图并读出对应单字,研究者先在 Praat 中手动切分音节,排除清音声母段,2 名厦门话母语者独立听辨本调是否正确或变调规则是否用对,不一致时请第 3 人裁决,多数一致才保留。保留的录音经 ProsodyPro 做自动基频跟踪,在归一化时长上取 10 个等距点,遇嘎裂声由训练有素的语音学家手动校正声门脉冲,严重嘎裂则剔除。
提取的对数基频在说话人内做 z 分数归一化,以消除男女与个体音高差异,随后按调值、音节位置、单双音节类型、年龄组 4 个因子的全交叉组合送入广义加性混合模型拟合平滑曲线,再对关心的指标做线性混合效应检验。
下图是理解全部比较的前提,即传统变调圆圈规定了哪些比较对是记作相同,初学者应先把环走通再看后面的曲线分离。
看图路径: 1. 先找到顶部单独的 24 及其向下指向 22 的箭头,确认它只做本调不做变调起点;2. 再沿 44 指向 22、22 指向 21、21 经 53 回到 44 的环形箭头走一圈;3. 确认环上没有新调值出现,理解结构保持再指派的含义
论文图 1。原论文 Figure 1:“Xiamen tone sandhi circle of unchecked tones.”。
该图显示顶部 24 单独向下指向 22,表示 24 只出现在本调位置而不作为变调输出,环上 44 指向 22、22 指向 21、21 经 53 回到 44,构成 5 个舒声调中除 24 外的循环链移。这一结构保持的含义是变调不引入新调类,只是已有调类在非末位置重新指派。因此后文所有记作相同的比较,如 53 与 21 变 53、21 与 22 变 21、22 与 44 变 22 及 24 变 22,都是在这个环的约束下定义的;曲线的分离或重合正是对该记法是否语音成立的直接检验。
右重变调域 × 预期性协同发音: 右重变调域指双音节词中最右侧音节保留本调、前侧音节一律取变调的结构规则,分工是决定哪个音节该比较哪一组调形;预期性协同发音指变调音节受后接音节影响而产生的顺行前向扰动,分工是解释为何变调整体偏高且降调斜率变浅;二者搭配才能区分音系交替与纯语音衔接,组合意义是避免把位置带来的抬高误读为新的调类。
右重域与预期性协同的组合在这里起关键作用:变调音节必定位于词首并后接另一音节,其整体偏高 partly 来自对后音节的预期,而斜率变浅也与非末位置的时长与衔接有关。论文明确承认这一混杂,但用跨年龄的一致方向与两套 22 之间不受后接调类单一解释的分化来论证差异不止是协同发音。
被试、刺激与听辨筛选如何保证比较公平?
被试按宽年龄段招募以捕捉世代差异,青少年、中年、老年 3 组人数不等但覆盖 13 至 87 岁。刺激只用真词以保证自然度:任务一为 36 个单字词单图,覆盖全部 7 个声调含促塞尾调;任务二为 30 个双音节词单图,呈现完整词义如足球;任务三为 25 个双音节词双图组合,如火加车组合成火车,要求被试自行组合并施加变调规则。任务三的每个音节与图片都曾在任务一出现,确保被试熟悉语素,测的是能否正确实施变调而非是否认识字。单字任务因部分字更常嵌在复合词中而附小字汉字,其余任务纯图片呈现,顺序固定为单字、单图双音节、双图双音节,录音在厦门由母语者用厦门话指导,采样率 44100 赫兹。
听辨筛选是声学分析前的质量门。2 名女性母语者独立判断单字本调是否正确、双音节变调是否用对,一致性几乎完全一致,卡帕系数为 0.95,基于 4464 项。726 项 2 人不一致,占 16.3%,请第 3 人裁决,至少 2 人判对才保留,3 人各执一词或判错的 238 项,占 5.3%,连同 59 个严重嘎裂项一并剔除,最终 4167 项进入声学分析。这 1 流程的意义是后面的高度差不是读错调的混入,而是判对前提下的实现差异。
本调 × 变调: 本调指单字独读或双音节词末音节保留的调形,用斜线/ /表示,分工是提供调类的底层参照;变调指非末音节在变调域中实际出现的调形,用方括号[ ] 表示,分工是记录位置条件下的实现;二者搭配的理由是厦门话变调为右重、结构保持的循环再指派,同一语音值可在不同位置充当本调或变调,组合意义在于把记作相同的两项放在相同归一化时间轴上检验音高与斜率是否真正等同。
本调与变调的符号分工在此落地:斜线内是底层调类,方括号内是位置实现,斜体区别于编号。举例说,22 读作 21 记为 22 变 21,21 读作 53 记为 21 变 53,44 读作 22 甲、24 读作 22 乙则构成最难的 1 对。没有这套符号,后文 44 变 22 甲与 24 变 22 乙的分离将无法表述。
基频表示与统计组件各自计算什么?
表示组件的每一步都有明确计算目标。自动跟踪得到每 token 10 个点的基频,取对数后在说话人内减均值除标准差,得到可跨人比较的 z 分数序列。平调距离用 10 个点均值算 44 均值除以 22 均值的比,升调幅度用第 10 点除以第 3 点,因起点有凹陷而取第 3 点为谷底近似,降调比较则保留整条轨迹的时间多项式。广义加性混合模型用 bam 函数拟合全局平滑加按条件平滑,条件是调值、音节位置、单双音节类型、年龄组全交叉后的复合因子,用于画出各年龄各调的拟合曲线;线性混合效应模型则对具体假设做检验,固定效应含调类、年龄组与时间的 2 次函数及其交互,被试的截距与时间斜率做随机效应。
初学者常问为何既要平滑拟合又要线性检验。答案是分工不同:前者回答形状像不像,后者回答高度差与斜率差是否显著、是否随年龄变化。例如 53 与 21 变 53 的比较中,调类主效应显著而年龄组单独不显著,但调类与年龄组交互显著,说明高度差大小随世代变化;21 与 22 变 21 的比较中出现调类、年龄组与时间的三向交互,说明斜率差异本身随世代变化。
调值 × 基频曲线: 调值是用赵元任五度标调字母写的听感归纳,分工是做音系层面的分类标签;基频曲线是在音节时长归一化后 10 个等距点提取并经说话人内 z 分数归一化的对数基频轨迹,分工是保留音高与斜率的连续细节;搭配理由是听感标签会抹平细微语音差异,组合后才能发现记作同为 22 或 53 的实现仍有系统性高度差。
调值与基频曲线的组合在此最直观:调值告诉你哪两条曲线按传统应重合,基频曲线告诉你它们实际差多少、在哪里分开。没有归一化与标准化,直接比较赫兹会被个体音高淹没;没有十点等距采样,斜率与曲率的交互将无从检验。
本研究训练了什么,没有训练什么?
本研究没有训练神经网络声学模型,也没有更新任何模型权重,因此不存在优化器、梯度路径、参数冻结与重置的安排。真实计算过程是统计建模与规则化标注:用 Praat 人工切分加母语者听辨做数据筛选,用 ProsodyPro 加手动校正做基频测量,用 mgcv 包的 bam 函数拟合广义加性混合模型,用 itsadug 辅助解释时间序列自相关,用 ggplot2 绘制拟合曲线,再用线性混合效应与单因素方差分析加邦费罗尼校正做推断。监督来源是人工听辨的对错标签与实验设计的条件标签,不是模型预测的伪标签。
广义加性混合模型 × 线性混合效应模型: 广义加性混合模型分工是对整条归一化基频曲线做按条件的平滑拟合与可视化,保留非线性形状差异;线性混合效应模型分工是对特定派生指标或轨迹做假设检验,如调距比、上升幅度与音高随时间的多项式交互,并纳入被试随机效应;搭配理由是先看形状再做推断,组合意义是用同一批归一化数据同时回答像不像与差得是否显著。
两种统计工具的搭配理由正在于此:广义加性混合模型承担非线性轨迹的描述,线性混合效应承担显著性与交互的判定。若只看拟合图会把随机波动当分化,若只看 p 值会丢失形状信息。论文未报告超参数搜索或交叉验证,因为目标是解释已收集语料中的条件差异而非部署可泛化的分类器,这是缺项而非错误,复现时只需按原文包与公式复跑即可。
资源状态方面,本次收到的证据中没有来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。复现者应按正文描述自建流程,而不能假设存在可下载的权重或语料库。
实验条件如何组织,被试量与指标方向是什么?
实验按问题组织为三块:本调空间是否随世代压缩,变调与对应本调是否等高同形,两套记作 22 的变调是否分化。被试量与年龄分布是理解所有世代结论的前提,下表先提出比较问题:在人数不均衡时能否谈年龄级差,公平条件是同一套图片、同一录音流程、同一听辨标准与同一归一化,指标方向是人数只影响估计精度而不改变调值定义。
| 年龄组 | 年龄范围 | 平均年龄 | 人数 | 在本研究中的角色 |
|---|---|---|---|---|
| 青少年组 | 13-19 | 15.81 | 16 | 提供压缩本调与扩大变调对立的一端 |
| 中年组 | 35-59 | 44.00 | 21 | 提供过渡形态的中间参照 |
| 老年组 | 61-87 | 69.08 | 12 | 提供中和保守的一端 |
上表显示总人数 49 人,中年组 21 人最多,老年组 12 人最少,平均年龄分别为 15.81、44.00、69.08。人数不均意味着老年组的曲线置信带更宽,解读微小差异时需更谨慎,但主要结论依赖跨组一致方向与大效应交互,而非单组微小波动。数据划分上,单字任务 36 项、单图双音节 30 项、双图组合 25 项,听辨后剔除 5.3% 判错项与 59 个严重嘎裂项,剩余 4167 项进入分析。聚合口径是先在说话人内标准化再按条件拟合,避免个体音高主导组均值。未胜出项在此阶段已可见:促塞尾调虽在刺激中出现但不在五调声学建模之列,边界是结论只适用于舒声调圆圈。
指标方向需牢记:调距比越大表示 44 与 22 分得越开,升幅比越大表示 24 爬升越陡,变调高于本调为正向高度差,斜率更浅表示下降更平。统计方法固定为单因素方差分析看组间、线性混合效应看轨迹交互,显著性阈值均为 0.001 量级报告。
本调空间与变调高度差的主结果是什么?
本调拟合曲线按年龄分三面板呈现,横轴为归一化时间点 1 至 10,纵轴为 z 分数,曲线为模型拟合均值加置信带。下图是全文的地基,所有变调比较都以它为参照,读者应先确认压缩与扩展的视觉印象再读数字。
看图路径: 1. 横向比较青少年、中年、老年三块面板中黄色 44 与红色 22 的垂直距离;2. 观察深蓝色 24 在三组中从起点凹陷爬升到终点的幅度差异;3. 注意青绿色 53 与灰色 21 的下降起点高度与到达终点的陡缓变化
论文图 3。原论文 Figure 3:“GAMM-fitted monosyllabic citation tone”。
该图可见青少年面板中黄色 44 与红色 22 几乎贴近,中年与老年面板中二者垂直距离明显拉开;深蓝 24 在青少年面板终点爬升有限,在中老年面板终点冲高;青绿 53 高降与灰色 21 低降在 3 组中保持相对关系但间距不同。这支持青少年本调空间压缩而中老年更分散的判断。量化上,平调距离比的比较问题是:在控制说话人音高后 44 与 22 分得多开,公平条件是同一十点均值算法,指标方向是比值越大分离越大。
| 年龄组 | 指标 | 均值 | 标准差 | 95% 置信区间 |
|---|---|---|---|---|
| 青少年组 | F044 比 F022 | 1.06 | 0.07 | [1.02, 1.10] |
| 中年组 | F044 比 F022 | 1.13 | 0.04 | [1.11, 1.15] |
| 老年组 | F044 比 F022 | 1.15 | 0.05 | [1.11, 1.18] |
上表的主要收益是把视觉压缩变成可复算的数字:青少年 1.06 显著小于中年 1.13 与老年 1.15,方差分析主效应 F 值为 11.13,p 小于 0.001,事后比较显示中年与老年无显著差异而二者均大于青少年。代价是比值只反映平均高度不反映形状,需结合升降调补充。升调 24 的上升幅度青少年均值 30.8、中年 60.9、老年 69.0,组效应 F 为 54.36,p 小于 0.001,青少年显著小于另两组。降调 53 与 21 的线性混合效应显示调类主效应极显著,调类与年龄交互显著且老年组两调距离最大、青少年最小,调类与时间交互确认 53 更陡。未胜出项是年龄组单独主效应在降调中不显著,说明不是整体音高随年龄漂移而是调间关系变化。
变调总体模式是形状相近但位置偏高。下图把所有变调放在同一坐标系,便于 1 次看清高降、高平与低平 3 层的相对关系。
看图路径: 1. 先区分黄色 53 变 44 的高平层与青绿色 21 变 53 的高降层;2. 再比较浅粉 44 变 22 与深粉 24 变 22 两条低平层的相对高低;3. 观察灰色 22 变 21 在三代面板中是否始终处于最低且更平
论文图 6。原论文 Figure 4:“GAMM-fitted disyllabic sandhi tone”。
该图显示黄色 53 变 44 为高平层,青绿 21 变 53 为高降层,浅粉 44 变 22 与深粉 24 变 22 为低平层,灰色 22 变 21 为最低且更平的降转平层。具体到成对检验,53 与其变体 21 变 53 相比,变调高约 15 赫兹且斜率曲率不同;21 与其变体 22 变 21 相比,变调均值更高且在老年组斜率差异最大,中年与青少年较小。这些结果报告的是直接测量,不是推测,但论文把部分高度差归于预期性协同的解释属于有限解释,需待验证。
中和 × 分化: 中和指传统记作同为 22 的两套变调来源在实现上重合,分工是描述老年组 44 变 22 与 24 变 22 几乎不可分的状态;分化指同一记法在实现上拉开距离,分工是描述青少年组把两套 22 在高度上显著拉开的状态;搭配理由是同一音系圆圈在不同世代有不同语音实现,组合意义是把年龄级差解读为由合向分的系统变化而非随机波动。
中和与分化的对比在此收束:本调侧青少年趋向中和压缩,变调侧青少年趋向分化扩大,二者方向相反,说明变化不是整体发音含糊而是系统重组。
两套 22 的分离能否作为反证与边界检验?
最严格的检验是传统记作同一 22 的两套变调:44 变来的 22 甲与 24 变来的 22 乙,外加本调 22 作为参照。若圆圈记法完全成立,三者应重合;若存在次音位对立,则至少甲乙分离。下图把三者放在同一面板,直接回答中和是否完全,读者应纵向对比三代面板的分离幅度。
看图路径: 1. 在青少年面板中比较最上方浅蓝 44 变 22 与中间绿色 24 变 22 的分离;2. 在老年面板中确认浅蓝与绿色几乎重合而深蓝本调 22 位置更低;3. 纵向对比三面板,判断分离幅度随年龄减小还是增大
论文图 7。原论文 Figure 7:“Comparison among /22/, /44/ > [22a], and”。
像素细节显示青少年面板中最上方浅蓝甲明显高于绿色乙,绿色乙又略高于深蓝本调 22;中年面板中甲乙差距缩小但仍可辨;老年面板中甲乙几乎重合,仅本调 22 略低。这种由分到合的渐变是年龄级差的核心视觉证据。量化上,甲乙高度比的比较问题是:在同一归一化下两套变调差多少,公平条件是同一被试随机效应结构,指标方向是比值越大于 1 分离越大。
| 年龄组 | 指标 | 均值 | 标准差 | 95% 置信区间 |
|---|---|---|---|---|
| 青少年组 | F022 甲比 F022 乙 | 1.07 | 0.06 | [1.06, 1.08] |
| 中年组 | F022 甲比 F022 乙 | 1.05 | 0.06 | [1.04, 1.06] |
| 老年组 | F022 甲比 F022 乙 | 1.02 | 0.05 | [1.01, 1.02] |
上表的主要收益是分离方向明确且 3 组两两显著:方差分析 F 为 32.1,p 小于 0.001,青少年对中年 p 为 0.001,其余 p 均小于 0.001,均值从青少年 1.07 经中年 1.05 降至老年 1.02。代价是该比值未控制后接调类的具体分布,论文明确指出需进一步检验特定声调环境与个体变异。反例与边界是:53 变 44 仍与本调 44 非常相似,未显示同等分化;老年组甲乙接近完全重合,说明分化不是全系统同步发生。训练与部署成本在此不适用,因无模型训练,但分析成本在于手动切分、双人听辨与嘎裂校正的人力投入,这限制了样本扩大速度。
哪些结论是报告,哪些是待验证推测?
直接报告的是:在判对前提下,多数变调高于对应本调,21 变 53 与 22 变 21 的降斜率更浅,两套 22 的甲乙高度差随年龄递减且 3 组互异,平调距离与升幅的青少年压缩。这些有曲线、比值与显著性支持。有限解释的是把变调偏高 partly 归于右重位置的预期性协同发音,该机制方向合理但本文未逐个后接调类建模,不能定量剥离协同与音系分化的贡献。待验证推测的是青少年甲 realized 高至重叠其本调 44,因而更受底层本调影响、变调实现更渐变的说法,以及中年为过渡、青年强化对立的历时方向判断,这些基于组均值横断面数据,缺乏纵向追踪与儿童习得证据。
未测量项必须点名:误判率、反应时、推理延迟、采集与标注成本、可懂度影响均未报告,不能承诺变调分化改善或损害交际。总体趋势不等于每人每步成立,论文已提醒需看个体变异。不同指标的差值不能混放一列比较,例如不能把 44 与 22 的 1.15 和甲乙的 1.02 直接比大小论孰更重要,因为分子分母与聚合对象不同。百分点与相对百分比的混淆在此同样要避免,比值 1.07 表示高约 7%,不是高 7 个百分点。
复现先做什么,还需补哪项验证?
复现应按学习依赖顺序先做四件事。第一,按三任务图片集重建刺激:单字 36 项全调覆盖、单图双音节 30 项、双图组合 25 项,且组合任务的语素必先在单字任务出现,顺序固定,厦门话指导,44100 赫兹录音。第二,用 Praat 手动切分并排除清音声母,2 名母语者独立听辨加第 3 人仲裁,保留多数判对,剔除判错与严重嘎裂,目标是复现 4167 有效项量级与 0.95 量级的一致性。第三,用 ProsodyPro 取十点基频并手动校正嘎裂,对数转换后说话人内 z 分数标准化,调距比用十点均值相除,升幅用第 10 点除以第 3 点。
第四,用 mgcv 的 bam 拟合全交叉复合因子的全局平滑加按条件平滑画曲线,再对每对本调变调拟合含调类、年龄组、时间 2 次项及交互的线性混合效应,被试截距与时间斜率随机,方差分析加邦费罗尼校正检验组间。
还需补的验证有三项:按后接调类分层重跑甲乙分离以排除协同发音主导,报告个体分布而非仅组均值以检验过渡是否由少数人驱动,补充儿童与纵向数据以确认由合向分的方向。何时值得尝试该方法:当研究对象存在记作相同但疑似实现不同的中和项,且有位置决定的交替规则时,用归一化曲线加比值与轨迹交互的组合最省力。若只有听感标签而无连续基频,不宜断言完全中和。
特有误解澄清与收束判断
论文特有的误解有三,需用自然段澄清。其一,变调圆圈不是发音等同证明,它只是结构保持再指派的记法便利,罗常培早年已提醒,本文用高度与斜率差提供了声学注脚。其二,青少年本调压缩不等于发音退化,他们在变调侧反而扩大甲乙对立,说明系统在重组而非整体含糊。其三,老年中和不等于历史上一直中和,横断面只能显示年龄级差,分化方向需纵向与习得证据才能坐实。
收束判断是:厦门话舒声调的本调与变调在声学上不等同,即使传统记作同一调值;两套 22 的分离呈现清晰的年龄级差,青少年分化最强、老年基本中和、中年居间。这一分化稳定且可复算,但其机制中协同发音与音系变化的占比、后接环境的作用与个体路径仍待补足。初学者复述时应保留任务分工、归一化口径、拟合与检验分工、4 组数字及其方向,区分报告、支持与可能 3 类表述,不把相关性说成因果,不把组均值推广为每人必然。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



![原论文 Figure 7:Comparison among /22/, /44/ > \\[22a\\], and](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/interspeech-2026/63e61a584180/figure-7.png)