英文题目:Mandarin Speakers of English: Universal and language-specific timing of syllabic jaw movement with acoustic vowel onset
会议身份:
conference:speechprosody:2026:conference-paper-id:barbosa26b_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Plinio Barbosa:机构信息未能从会议 PDF 纯文本可靠映射
- Gustavo Silveira:机构信息未能从会议 PDF 纯文本可靠映射
- Donna Erickson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为9名普通话背景英语使用者朗读目标句I saw five bright highlights in the sky tonight的声学与电磁构音图同步信号,输出为音步内下颌位移分布类型与声学元音起点相对时序的判定,难点在于分离生物力学普遍约束与母语韵律迁移对第二语言重音实现的影响。方法链分四步:先用三维电磁构音仪同步采集下门齿垂直轨迹并以咬合板校正头动与咬合平面,再提取各音节最大开口量并计算five/bright、high/lights、sky/night三对位移比值以区分强弱与弱强音步,接着以第二共振峰跃变为基准手工标注声学元音起点,最后求起点与加速度极小值、速度极小值、位移极小值三地标的时间差分布并做跨说话人非参数检验。与已有美国英语结果的关键机制差异是同时检验分布形态与对齐锚点,发现分布可随第二语言熟练度漂移而速度极小值锚点保持稳定,表明对齐具普遍性而分布具语言特异性。熟练度分层显示仅5级说话人比值中位数最高且几乎全大于1呈典型强弱式,低水平者中位数最低且偏向弱强式,表明边缘强化迁移随熟练度减弱。在50个token朗读语料评测条件下,跨说话人位移比Kruskal-Wallis检验的p值指标为p<0.02,低于显著性判定阈值的p值指标0.05。该结论适用边界受限于朗读体单句与/ɑɪ/受控条件,/h/起始的high与复辅音/br/起始的bright已出现系统偏离尚未验证外推。原文未披露训练、推理或部署成本
🔗 开源与复现资源
- 代码相关资源:https://github.com/pabarbosa/prosody-scripts — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/silveira7/PointDistancesFromAVO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么只看声波不够,还要同时看下颌?
输入是 9 名普通话背景者朗读的同一句英语,目标是回答两个可分开检验的问题。第一,重音在动作上如何分配,是否把母语的句末加重带进第二语言英语。第二,下颌张开过程中的动力学路标与声音上可判定的元音开始在时间上如何对齐。必须保留的信息是朗读句为 I saw five bright highlights in the sky tonight,目标词 five、bright、highlights、sky、tonight 都含有同一双元音,用控制元音高度来减少元音本身对开口大小的干扰。
输出是两类结论,一类是下颌最大下降量在双音节足内的前后比,另一类是 3 个下颌路标相对声学元音起点的时间距离分布。对于刚入门的研究生,关键是把声学与动作分开,声学回答何时听见元音,动作回答何时张开最大以及张得最快。本文是探索性小样本研究,不做自动口音分类,也不承诺教学干预效果。后续所有方法与结果都围绕同一句、同一组说话人、同一套下颌传感器展开,换句或换任务时结论需要重新验证。
前人用下颌位移比较过哪些语言的重音?
已有报告显示话语凸显越大下颌下降越大,这是把开口大小当作凸显的生理侧面来用。跨语言比较发现,与美国英语说话人相比,普通话、法语、日语说话人更倾向于把更大的下颌下降放在短语或话语末尾的完整音节上,作者把这类语言概括为边缘加强语言。美国英语的短语凸显词并不稳定地落在句末,核重音在宽焦点下可落在 high 或 sky,而句末副词性短语 tonight 若无强调则不加重。法语和日语说话人说英语时也被报告会迁移母语模式,把句末完整音节做得更重。
普通话被描述为偏好弱强足,英语则被描述为偏好强弱足。在对齐方面,一项以美国英语母语者为对象的先导研究显示,声学元音起点多落在下颌速度曲线的最小值附近,即张开相速度最负的时刻,且该相对 timing 会随音节凸显和声母清浊变化,凸显增大时最小速度更早于声学元音起点,清声母比较浊声母更早开始张开。
本文的两个假设直接继承这条路线,第一是普通话英语学习者会把母语的下颌下降模式迁移到英语,第二是下颌下降相对声学元音起点的对齐仍与美国英语相似,理由是张开起振与成音节的力学约束可能是跨语言共有的。
本文要区分的两个问题是什么?
第一个问题是分布问题,在 five 与 bright、high 与 lights、sky 与 night 这 3 对前后关系中,前重还是后重。做法是用前词最大下颌下降量除以后词最大下降量,比值大于 1 判为强弱,小于 1 判为弱强。这个问题检验的是语言特异性,即熟练度不同的学习者是否从弱强滑向强弱。第二个问题是对齐问题,对每个重读音节,以声学元音起点为零点,测量 3 个下颌路标的时间距离。3 个路标按时间先后是下颌加速度最小值、下颌速度最小值、下颌最小位置,分别对应开始张开、张得最快、张到最大。
这个问题检验的是普遍性,即无论前后比如何,最靠近声学元音起点的是否都是速度最小值。教学例子是,分布好比同一句话中把力气分给前词还是后词,对齐好比把张得最快的瞬间放在听见元音之前还是之后。两者可以分离,一个人可以分力方式像母语,但对齐时刻仍与目标语一致,这正是本文中心矛盾的来源。
从朗读到比值与时间差的全流程是什么?
先沿一个样本走完流程。说话人看着随机呈现的幻灯片朗读目标句,电磁发音仪记录下颌运动,话筒记录声音。下颌传感器贴在下中切牙处,另有上切牙、鼻梁、左右乳突共 4 个参考点用于头动校正,咬合板用于估计咬合平面。记录后对发音数据做 20 赫兹低通滤波,旋转到咬合平面并做头动校正,取下切牙传感器相对咬合平面的最低垂直位置来度量每个音节的下颌下降量。声学上以第二共振峰过渡为参考手工标记声学元音起点。
然后对每对足计算前后最大下降量之比,对每个重读音节计算 3 个下颌路标相对声学元音起点的秒数,负值表示路标先于声学元音起点,正值表示晚于起点。分析工具是 Praat 相关算法,代码仓库在资源状态为 available 时当前可用,已公开的两个地址分别对应数据转换与距离计算。本文没有训练神经网络,没有调参搜索,全部计算是测量、比值与分布比较。复述时必须保留同一元音控制、同一朗读句、手工标记声学元音起点这 3 个条件,否则分布与对齐都不可比。
下颌下降量与声学元音起点各自如何测量?
下颌下降量的白话含义是为发一个元音把嘴张开多少,英文为 mandible lowering displacement,做法是取靠近该音节声学元音起点的最大下颌下降。声学元音起点的白话含义是声音上可以判定元音开始的时刻,英文为 acoustic vowel onset,缩写为 AVO,做法是以第二共振峰过渡为参考手工标记。两者分工不同,前者是动作幅度,后者是声音时刻。搭配理由是幅度比回答重音分配,时刻差回答协同定时。新增作用是把同一音节的看与听放在同一零点上,既能算前后比,又能算先后差。
音节性下颌下降 × 声学元音起点: 音节性下颌下降负责用下颌垂直位移量标示哪个音节更重,声学元音起点负责用第二共振峰过渡标示元音在声音上从何时开始,二者搭配的理由是把看得见的开口动作和听得见的元音开始放在同一时间轴上检验,组合意义是区分重音分布是否随语言而变与对齐时刻是否跨语言稳定。
具体操作中,位移随元音高低自然变化,因此本文把目标词统一为含有相同双元音的词,减少元音自身开口需求的混淆。标记时先定声学元音起点,再在其附近找最大下降,避免把相邻辅音的闭合误算为元音开口。初学者容易把声波包络大等同于张口大,本文坚持用下切牙传感器的垂直位置作幅度证据,用声谱图作时刻证据,两路证据不同源,不能互相替代。
前后比与三个动力学路标如何计算?
强弱足的白话含义是前重后轻,英文为 trochaic foot,弱强足的白话含义是前轻后重,英文为 iambic foot。本文用比值实现判定,例如 five 与 bright 1 对,用 five 的最大下降除以 bright 的最大下降。大于 1 表示前词张得更大,小于 1 表示后词张得更大。这个比值不关心绝对张多大,只关心前后相对关系,因此跨说话人比较时受个体开口习惯的影响较小。
强弱足 × 弱强足: 强弱足指前重后轻的双音节重音关系,弱强足指前轻后重的双音节重音关系,本文用前词下颌最大下降量除以后词最大下降量来判定,比值大于 1 为强弱、小于 1 为弱强,组合意义是把英语预期的强弱与普通话边缘加强带来的弱强放在同一个可计算指标上比较。
动力学路标的白话含义是张开动作在速度与加速度上的关键瞬间。加速度最小值对应从闭合转向张开变化最快的点,速度最小值对应张开最快的点,最小位置对应张到最大的点。三者按时间先后构成张开的时间计划。
下颌速度极小值 × 下颌加速度极小值: 下颌加速度极小值分工是标示下颌从闭合转向张开变化最快的时刻,下颌速度极小值分工是标示张开过程中向下运动最快的时刻,二者搭配的理由是还原从开始张开到张得最快再到张到最大的时间计划,组合意义是检验到底哪一个动力学路标与声学元音起点最同步。
计算时都以声学元音起点为零点,报告秒数。负值表示动作路标先于声音起点,正值表示晚于起点。复述时要说清零点是声学元音起点,单位是秒,负号方向是先于起点,不能把负号读成滞后。
本研究有训练阶段吗?实际计算是什么?
本研究没有训练神经网络的阶段,也就没有冻结与更新、梯度路径、损失监督、早停与重置的安排。实际计算是 3 类可重放操作。第一类是信号预处理,包括 20 赫兹低通滤波、基于咬合板的坐标旋转、基于 4 个参考点的头动校正。第二类是标注与测量,包括以第二共振峰过渡为参考手工标记声学元音起点,以及在起点附近提取最大下降、最小速度、最小加速度与最小位置。
第 3 类是统计比较,包括按熟练度分组的箱线图、Kruskal-Wallis 检验与带 Benjamini-Hochberg 校正的成对 Wilcoxon 检验,以及以零为均值的单样本 Wilcoxon 检验。未报告的缺项是标注者一致性、滤波截止选择的敏感性、头动残差大小,这些缺项不影响复述主流程,但在复现时需要自行记录。由于没有模型训练,不能把无训练理解为确定性求解,手工标记与样本选择仍会引入变异,重复实验需要固定同一标注参考与同一剔除规则。
被试、句子与仪器条件如何控制?
被试是 9 名普通话背景的英语使用者,其中女性 5 名,7 名为日本大学研究生,1 名为教普通话的大学教师,1 名为英语教师。普通话之外,编号 C04 母语为上海话,C06 母语为汕头话。英语熟练度由有四十年教学经验的第三作者按 1 为差到 5 为很好评定,结果为 1 级有 C01 与 C02,3 级有 C06 与 C09,4 级有 C03、C04、C07 与 C08,5 级仅 C05。朗读句选定为 I saw five bright highlights in the sky tonight,理由是可与美国英语的下颌模式直接比较,英语规则下重音可落在 five、high 与 sky,而句末 tonight 无强调时不加重。
呈现方式是包含在更大语料中的幻灯片随机呈现,每人重复 5 至 8 次,因发音数据采集问题剔除后每人保留数不同。仪器是 Carstens AG5003 维电磁发音仪,由日本北陆先端科学技术大学实验室提供,发音采样 100 Hz,声学采样 22.05 kHz。下颌只用下中切牙传感器报告,舌与唇传感器本次不报告。 下面表格的比较问题是样本量与采集条件是否足以支撑跨熟练度比较,公平条件是同一句、同一元音、同一仪器与同一预处理,指标方向是 token 总数与采样率越高越利于分辨小的时间差。
| 分组与采集条件 | 统计对象 | 本研究取值 | 对照取值 | 比较对象 |
|---|---|---|---|---|
| 被试总量与 token | 可用发音 | 50 | 5 | 全部 9 人合计 |
| 单人重复分布 | 每人保留数 | 6 | 5 | 多数人的保留数 |
| 单人重复上界 | 每人保留数 | 8 | 7 | 保留最多与次多者 |
| 发音采样 | 采样率 | 100 Hz | 22.05 kHz | 声学采样 |
| 声学采样 | 采样率 | 22.05 kHz | 100 Hz | 发音采样 |
该表说明总 token 为 50,单人保留在 5 至 8 之间,多数人为 6 次,发音与声学采样分别为 100 Hz 与 22.05 kHz。代价是 5 级仅 C051 人,1 级仅 2 人,跨组比较时个体差异易被放大为组差异。未胜出项是 3 级与 4 级处于中间且离散大,不能简单按等级排序断言单调进步。
复现时必须保留同一剔除规则与同一采样设置,否则时间距离的比较不可比。资源方面,转换与距离计算代码当前可用,已公开,仪器与原始发音数据则依赖原实验室条件。
同一句话为何出现相反的加重位置?
先看单句的动作与声音如何错开。下段导读聚焦最熟练与最不熟练者在同一句中的相对开口分布,横轴是时间与词序,纵轴是声波包络与下颌垂直位置,虚线为位移参考。
看图路径: 1. 先确认上下两个面板各有上声波下颌迹线两条,并按横轴词标注对齐 five、bright、highlights、in the、sky、to night;2. 再比较上面板 C05 在 five、high 和 sky 处下颌波谷更深而句末较浅,下面板 C02 在句末 night 处波谷最深;3. 注意虚线基线只作位移参考,不代表同一绝对开口度,重点看同一句内相对深浅分布;4. 把声波包络大小与下颌波谷深浅分开看,避免把录音响度直接当作开口大小
论文图 1。原论文 Figure 1:“Acoustic signal top and jaw tracing bottom for five bright highlights in the sky tonight. (A) Top set of tracings is C05 (level 5 of proficiency), (B) bottom set is C02 (level 1).”。
上图上面板为 5 级 C05,下面板为 1 级 C02,每面板上为声波下为下颌迹线。可见 C05 在 five、high 与 sky 处波谷更深,在句末 tonight 处较浅,与美国英语报告的落在 five、high 与 sky 而不落在句末的模式相似。C02 则在 bright 而非 five、lights 而非 high、night 而非 sky 处更深,最大下降落在句末,作者据此判断其延续了普通话的短语末尾加重。边缘加强与核重音的对照解释了这种反转,前者把力气推向边缘,后者按英语宽焦点把力气放在 high 或 sky。
边缘加强 × 核重音: 边缘加强分工是解释为何普通话、日语、法语母语者把最大下颌下降放在短语或话语末尾,核重音分工是解释英语宽焦点下最大位移落在 high 或 sky 而非句末 tonight 的原因,二者搭配才能读懂 C05 与 C02 在同一句中为何加重位置相反,组合意义是把发音动作差异连接到韵律规则差异。
再看分组分布是否支持熟练度解释。下段导读聚焦前后比箱线图,横轴是比值,纵轴是熟练度等级,虚线为 1,左侧为弱强右侧为强弱。
看图路径: 1. 先看横轴是前后词下颌最大下降量之比,纵轴是英语熟练度 1、3、4、5,中间虚线为比值 1;2. 再看熟练度 5 的箱体中线最高且几乎全在 1 右侧,熟练度 1 的箱体中线最低且散布在 1 附近;3. 注意熟练度 3 存在远至约 8 的极端散点,读分布时先看箱体再看离群点;4. 对照顶部 iambic 与 trochaic 箭头,把左右位置直接翻译为弱强与强弱倾向
论文图 3。原论文 Figure 3:“Box-plots of the ratios between maxima of mandible lowering displacement for pairs of syllables in a foot for all speakers according to proficiency levels.”。
可见 5 级的箱体中线最高且几乎全在 1 右侧,呈强弱倾向,1 级的箱体中线最低且散布在 1 附近,呈弱强倾向,3 级与 4 级居中但离散大,3 级还有远端离群点。统计上 Kruskal-Wallis 检验给出 X2 为 19.6,p 小于 0.02,成对检验显示 C05 在 0.05 水平下与 C01、C02 及 4 级的 C04 有显著差异。代价是显著性主要由唯一满分者 C05 驱动,不能推广为每个等级两两皆不同。最小下颌位置与声学元音起点的关系留待对齐部分展开,这里先确认分布问题支持语言特异性,而对齐问题需要另看时间距离。
三个下颌路标中谁最靠近声音起点?例外如何解释?
测量的问题是 3 个路标相对声学元音起点的时间距离,条件一致,都是以同一音节的声学元音起点为零点,指标方向是绝对距离越小表示越同步。正文报告,加速度最小值总是先于声学元音起点,对应下颌最闭合附近。速度最小值对所有词都最靠近起点,除 high 外。以零为均值的单样本检验中,仅 lights 接受原假设,p 为 0.13,但作者提醒有第二类错误的可能。最小位置多在起点之后,对应张到最大。最小下颌位置与声学元音起点的配对说明,张到最大通常晚于听见元音,而张得最快最接近听见元音。
最小下颌位置 × 声学元音起点: 最小下颌位置分工是标示为该元音张到最开的时刻,声学元音起点分工是标示声音上可判定的元音开始,二者搭配的理由是检验开口完成是否必然落在元音开始之后,组合意义是以 high 为例说明当元音构形在清擦音中已完成时,动作完成点可以早于声音起点。
例外是 high,其张开几乎在声学元音起点前已完成。作者的有限解释是元音的舌体位置在清擦音期间已达到,但清音段共振峰退化使声学元音起点难以提前检出,因此真正的协同可能是下颌速度与舌体元音手势之间,而非与可听起点之间,该解释标为可能与待验证。另 1 例外是 bright,词首簇在普通话中不存在,连最熟练者也发为带近音的变体,声学元音起点落在第二成分起点附近,而下颌最小速度更靠近元音本身,同样提示声母特性会影响对齐读数。
下面表格的比较问题是在分布指标上熟练度差异是否成立,公平条件是同一比值定义与同一校正方法,指标方向是比值大于 1 为强弱、小于 1 为弱强。
| 检验与判定条件 | 统计对象 | 本研究取值 | 对照取值 | 比较对象 |
|---|---|---|---|---|
| 总体差异检验 | 统计量 | X2 = 19.6 | p < 0.02 | 显著性阈值 |
| 总体显著性 | p 值 | p < 0.02 | 0.05 | 成对检验水平 |
| 成对检验水平 | 显著性 | 0.05 | 19.6 | 总体统计量 |
| 比值判定 | 强弱阈值 | 高于 1 | 低于 1 | 弱强阈值 |
| 比值判定 | 弱强阈值 | 低于 1 | 高于 1 | 强弱阈值 |
该表说明总体检验显著,C05 与 C01、C02 及 C04 在 0.05 水平下不同,前后比以 1 为界划分强弱与弱强。代价是 3 级与 4 级内部变异大,且 high 与 bright 的声学起点本身受清音与辅音簇影响,跨词 pooled 的同步结论需要按词分别核对。未评测边界是舌体与下颌的协同未同步测量,本文只报告下颌证据。
哪些边界会改变结论的适用范围?
直接报告的是 9 人单句朗读的分布差异与速度最小值的最近同步,有限解释是熟练度提高带来母语影响减弱,未验证推测是下颌张开力学具有普遍生理基础。缺失证据不是技术错误,但必须列出。第一,被试中 5 级仅 1 人,1 级仅 2 人,显著性易受个体发音习惯驱动,不能当作等级间的普遍发展曲线。第二,仅用一句且目标词共享同一双元音,换元音高度、换语速、换自发语流时,比值与时间距离都可能变化。
第三,声学元音起点依赖第二共振峰过渡的手工标记,在清擦音与辅音簇处本身不确定,high 与 bright 的例外可能部分来自标记困难而非协同本质。第四,只报告下颌传感器,舌体、唇的协同未纳入,无法直接验证舌体已提前到位的假设。第五,采集在特定实验室完成,剔除后每人保留数不等,跨人比较时 token 权重不同。相关性不是因果,熟练度与强弱比的相关不能直接读成教学干预必然改变下颌模式,也未测量可懂度、听感重音或延迟成本,因此不承诺发音教学收益。
要重放这套测量需要先固定什么?
复现先做三件固定工作。第一,固定句子与呈现,用同一句 I saw five bright highlights in the sky tonight,随机呈现并保留 5 至 8 次,记录剔除原因,使总 token 构成可核对。第二,固定仪器与预处理,用下中切牙传感器跟踪下颌,用 4 个参考点做头动校正,用咬合板定咬合平面,发音与声学分别按 100 赫兹与 22.05 千赫兹采集,发音数据做 20 赫兹低通后再旋转与校正。
第三,固定标注与计算,以第二共振峰过渡为参考手工标记声学元音起点,在起点附近取最大下降、最小速度、最小加速度与最小位置,前后比按前除以后计算,时间差按路标减起点报告秒数,负为先于起点。统计沿用 Kruskal-Wallis 加带 Benjamini-Hochberg 校正的成对 Wilcoxon,以及按词分组的箱线图。还需补的验证是标注者一致性、滤波与旋转的敏感性、换元音与换句子的稳定性。
代码方面,转换与距离计算仓库当前可用,已公开,可用于重放比值与距离计算,但原始发音数据与仪器条件需要另行获取,不属于下载即运行。
何时值得借用这套下颌加声学的方法?
当问题同时涉及重音分给谁与动作何时对准声音时,这套方法值得尝试。前后比适合检验母语迁移是否改变重音分配,速度最小值相对声学元音起点的距离适合检验协同定时是否跨语言稳定。复现优先级是先固定同一句与同一标注参考,再看分布是否随熟练度从弱强滑向强弱,最后看对齐是否仍以速度最小值最近。若只关心听感口音而不关心动作机制,则不必部署电磁发音仪。
若要用于教学,需要另行测量听感判断与可懂度,不能用下颌比值直接代替教学效果。本文特有的误解是把句末张得大等同于说错,把速度同步等同于发音标准。实际含义更窄,句末加重是边缘加强语言的常见动作策略,速度同步是张开力学与成音节的共有约束,两者分离正是本文的价值。未来工作应同步记录舌体,重点检验 high 类清音首与 bright 类辅音簇中的舌颌协同,才能把声学起点检出困难与真实协同提前分开。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

