英文题目:Assimilation perceptive des consonnes occlusives françaises par des auditeurs du chinois mandarin

会议身份:conference:jep:2026:conference-paper-id:su26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #言语感知 #语音 #语音识别

评分:4.7/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Chang Su:机构信息未能从会议 PDF 纯文本可靠映射
  • Takeki Kamiyama:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究考察无学法经历的北方官话听者如何将法语词首塞音同化到母语送气对立中,输入为本土发音人产出的塞音与元音组合的载体句中孤立音节,输出为不计声调的拼音自由转写与普通话发音优度评分,难点在于法语浊音对立与普通话送气对立在嗓音起始时间维度上错位且部位与元音语境会推移实现。先把目标音节嵌入固定载体句并取中间轮次录音以控制语速语调,测量嗓音起始时间分布以刻画发音人与部位元音效应。再组织北方听者在线听辨转写并评分,输出进入下一步重编码。最后把转写重编码为送气与非送气类并计算送气回答比例与逻辑回归建模,揭示嗓音起始时间到类别归属的连续映射。与直接测学习者辨别正确率的已有二语习得研究不同,本文采用知觉同化模型范式测无知者的类别归属与原型度,因而能预测不同组合的学习难度分化而非仅报告总体习得水平。原文未提供可核对的关键定量结果。该结论适用边界仅限词首孤立音节与北方官话 naive听者,连续语流、多发音人泛化与真实课堂学习者等外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

普通话听者面对法语浊清对立时难在哪里?

刚进入语音领域的研究生首先要分清两个对立。法语用声带是否提前振动区分两套塞音,记作不带浊音的 /p t k/ 与带浊音的 /b d g/。普通话不用这个维度区分意义,而是用松开爆破之后气流强弱区分不送气 /p t k/ 与送气 /pʰ tʰ kʰ/。白话说法是,法语问的是声带开得早还是晚,普通话问的是气流猛还是弱。本文的研究对象就是当只懂普通话范畴的人听到法语塞音时,会把浊与清这两类分别装进送气与否的哪一个盒子。

输入是法语母语人读出的辅音加元音音节,输出是普通话听者写下的拼音字母与拟合度打分。必须保留的关键信息是被试从未学过法语,因此结果反映的是母语范畴的初始过滤,而不是法语学习后的调整。论文的最终目标不是证明谁听得准,而是预测不同发音部位与元音条件下浊清区分的学习难度排序。理解这一点才能读懂后文为何反复讨论嗓音起始时间这个声学量。

它是连接两种对立的桥梁,因为浊音往往对应负值或零附近的嗓音起始时间,清音对应短正值,而普通话不送气对应 10 到 20 毫秒左右的短正值,送气对应 60 到 90 毫秒的长正值。当法语清音的嗓音起始时间落在这两个普通话区间之间时,听者就没有现成的稳定标签可用。

同化模型与嗓音起始时间文献给出什么可验证预期?

知觉同化模型这个词初听抽象,白话解释是外语语音会被听成母语中最像的那个音,英文名为 Perceptual Assimilation Model,缩写为 PAM。它的扩展版 PAM-L2 与修正版言语学习模型 SLM-r 都强调,判断依据是跨语言的相似度,而不是在目标语两个音之间做二选一。按照这个思路,实验做法是找完全不懂目标语的人做同化测试,看他们把外语声音归到母语哪些类别,再用归类格局预测真正的学习者会在哪些对比上更难。

嗓音起始时间这个词指从塞音爆破松开到后接元音声带开始规则振动的时间差,英文为 Voice Onset Time,缩写为 VOT。浊音在松开前声带已振动,记为负值,清音在松开后延迟起振,记为正值。已有跨语言测量表明,法语浊音多为负值或接近零,清音平均 30 毫秒左右,普通话不送气为 10 到 20 毫秒,送气为 60 到 90 毫秒。发音部位与元音也会系统改变嗓音起始时间,软腭音长于双唇音与齿龈音,开元音 /a/ 前往往短于闭元音 /i u/ 前。把这些放在一起,论文提出两个可核对的假设。

第一,法语 /b d g/ 会被多数听成普通话不送气 /p t k/。第二,法语 /p t k/ 中嗓音起始时间短的会被听成不送气,长的会被听成送气。这两个假设把模型预测落到具体数值区间上,后文的转写比例与回归曲线就是对它们的直接检验。

本文要回答的具体问题与判断标准是什么?

本文不是泛泛讨论法语难学,而是把问题收敛为三件事。第一,在不送气与送气这个普通话框架下,法语 6 个塞音各自的多数归属是什么。第二,这种归属是否随嗓音起始时间连续变化,是否存在一个从几乎全不送气过渡到几乎全送气的中间地带。第三,发音部位与后接元音通过改变嗓音起始时间,是否进一步改变归属比例。

举例说明,同样标为法语 /p/ 的刺激,如果一个读得短而另一个读得长,听者可能给出完全不同的拼音字母,这正是需要用声学测量解释知觉变异的原因。判断标准在方法中是明确的。转写字母 <b d g> 对应普通话不送气,<p t k> 对应送气,另有少数塞擦音与鼻音回答需要单独说明口径。每个刺激的送气回答率定义为 20 名听者中判为送气的回答数除以二十。

嗓音起始时间以毫秒为单位报告,统计上用方差分析检验辅音与元音效应,用卡方检验检验元音对转写分布的影响,用逻辑回归拟合送气概率随嗓音起始时间的变化。拟合度评分采用一到 5 分,指示所选普通话音节与所听声音的相似程度,分数越高表示越像母语原型。复述时要记住,比例的分母、单位与检验对象不同,不能把不同指标的数字直接相减或混排。

从录音到转写判断的完整链条如何走通?

先沿一个样本走完全程。假设目标是法语 /ku/,由男性说话人读在框架句 Je dis /CV/ en français 之中,前后留有小停顿,采样率为 44100 Hz,量化精度为 16 位。研究者从四遍朗读中选取第二或第三遍,避免开头犹豫与结尾疲劳,然后测量该音节的嗓音起始时间。播放时,被试先听到一个 440 Hz、持续 50 ms 的提示音,至少间隔 500 ms 后听到目标音节,随后有 5 秒安静时间在纸质问卷上手写拼音,不标声调,再给出一个一到 5 分的普通话拟合度评分。

表示阶段是把手写拼音重编码为普通话音位类别,<b d g> 归为不送气,<p t k> 归为送气,<z j> 等塞擦音与 <m n> 等鼻音按是否送气分别计入分母口径。组件阶段是按刺激聚合 20 人回答,计算送气回答率,并与该刺激的嗓音起始时间配对。目标阶段是用逻辑回归描述送气概率如何随嗓音起始时间上升,并用发音部位与元音分组解释偏离。输出是每个辅音与每个元音条件下的分布百分比与回归阈值。下图展示刺激端的声学起点,是理解后文知觉分歧的基础。

读这张刺激声学图时,先看清纵轴零线两侧的含义,再看同一辅音下 2 位说话人的差异,最后看清音内部的部位排序。

看图路径: 1. 先确认纵轴为嗓音起始时间毫秒值,零线以上为正值清音区,零线以下为负值浊音区;2. 再对比同一辅音下灰色男声与黑色女声的柱高,检查男声绝对值更大的说明;3. 最后沿 b-d-g-p-t-k 横轴观察清音侧 p 小于 t 小于 k 的递增趋势

原论文 Figure 1:Moyenne de VOT en ms (barre d’erreur : 1 écart-type) des /b d ɡ p t k/ suivis de /a i u/

论文图 1。原论文 Figure 1:“Moyenne de VOT en ms (barre d’erreur : 1 écart-type) des /b d ɡ p t k/ suivis de /a i u/”。

这张图显示浊音三列全部位于零线以下,负值绝对值大,男声的绝对值普遍大于女声,清音三列位于零线以上且呈现从双唇到软腭递增的格局。这意味着听者面对的不是两个泾渭分明的簇,而是一端是很负的浊音,另一端是从 10 毫秒左右延伸到 125 毫秒左右的清音连续体。正是这个连续体的宽度为后文的混合回答与过渡区埋下伏笔。训练阶段的 /bɛ pɛ dɛ tɛ gɛ kɛ/ 只用于熟悉流程,不进入正式统计,正式测试为 18 个目标音节乘以 2 位说话人,共 36 个刺激,按半随机顺序呈现。

被试与刺激的构成如何控制混杂?

被试部分共有 20 名普通话母语者,其中男性 9 人,女性 11 人,年龄在二十一到三十二岁之间,平均约 23.79 岁,标准差约 2.29 岁。为限制其他语言与方言的影响,被试选自中国北方,主要来自北京、河北与山东,均无学习法语经历,也无在法语国家居住经历。所有人填写语言背景问卷,均在学校学过英语,水平从初级到高级不等,只有 1 人报告日语达到高级。

这个构成的含义是英语送气与浊音经验可能存在,但法语范畴经验被排除,因此同化格局更可能反映普通话主导的初始状态。刺激部分为 6 个塞音乘以 3 个元音 /a i u/ 构成的 18 个辅音加元音音节,分别由 1 名来自巴黎大区的男声与 1 名来自南布列塔尼的女声读出,年龄在三十五到四十岁之间。框架句与选取遍次的安排理由在原文中是明确的,目的是限制语速与语调变异。

测量显示辅音对嗓音起始时间的主效应显著,清浊同部位两两比较均显著,元音对清音嗓音起始时间的主效应也显著,/a/ 前普遍短于 /i/ 与 /u/ 前,软腭 /k/ 往往长于 /p/ 与 /t/。这些声学事实是后文把元音效应解释为嗓音起始时间中介的依据。

浊音对立 × 送气对立: 浊音对立负责区分法语 /p-t-k/ 与 /b-d-g/ 是否在除阻期间振动声带,送气对立负责区分普通话 /p-t-k/ 与 /pʰ-tʰ-kʰ/ 是否在除阻后伴随强气流噪声,二者搭配的理由是普通话听者没有浊音范畴可用,只能把法语的声带振动有无映射到自己熟悉的气流强弱维度上,组合意义是法语的浊与清在知觉上被重写为普通话的不送气与送气之争。

复述时要注意,浊音对立与送气对立不是同一维度的不同叫法,前者看声带提前振动,后者看爆破后气流,二者通过嗓音起始时间发生关联,但不能互相替代。

转写重编码与送气率的计算口径是什么?

自由转写的好处是允许意外类别出现,代价是必须事先定好重编码规则。原文把 <b d g> 归为不送气,把 <p t k> 归为送气。对于少数回答,塞擦音 <z>、<b d g>0、<b d g>1 与鼻音 <b d g>2、<b d g>3 也需要处理,其中 <b d g>4 被视为送气,其余归入不送气一侧,再计算送气回答占全部 20 个回答的比例。这个口径决定了分母始终是二十,而不是去掉意外回答后的有效数,因此塞擦音比例高时会直接稀释送气与不送气的百分比。举例来说,/d/ 在 /i/ 前较多被写成 <b d g>5,这部分既不计入送气也不计入齿龈不送气,但在分母中仍然存在。

拟合度评分是第二个因变量,要求被试假设所听音节就是普通话来打分,一分表示非常不像,5 分表示非常好。它的作用是区分勉强归入与典型归入,但在本文报告的重点中,转写分布与嗓音起始时间的关系占据主要篇幅。重编码时还要区分拼音字母与国际音标,<b d g>6 对应的是普通话不送气 /p/,<b d g>7 对应的是送气 /pʰ/,初学者最容易在这里把字母的浊清含义与普通话的送气含义搞混。

嗓音起始时间 × 知觉同化: 嗓音起始时间负责提供从爆破松开到声带开始规则振动的时间距离这个连续声学量,知觉同化负责把这个连续量归入母语的离散音位类别,二者搭配的理由是仅看音位标签无法解释为何同一个法语 /p/ 有时被听成 b 有时被听成 p,组合意义是嗓音起始时间成为预测同化方向的连续中介变量。

沿样本继续走,被试听到一个嗓音起始时间很负的 /b/,几乎必然写下 <b d g>8 并可能给出较高拟合度,而听到一个嗓音起始时间很长的 /ku/,则更可能写下 <b d g>9 即送气,这种从连续量到离散标签的映射就是本节定义的操作。

在线流程与纸笔作答如何保证可执行?

实验在线进行,被试在安静环境中单独使用头戴式耳机或耳塞完成,全部指导语用中文汉字书写,避免书面理解歧义。流程分为练习与测试两段,练习用后接 /ɛ/ 的 6 个音节让被试熟悉转写与打分,测试用 18 个目标音节的 2 位说话人版本。每个试次的结构是提示音加至少 500 毫秒间隔加目标音节加 5 秒书写窗口,顺序为事先定好的半随机顺序。作答载体是事先打印的纸质问卷,被试边听边手写。

这种安排的优点是书写拼音比按键选择更少提示效应,缺点是在线环境对耳机与噪声的控制不如实验室严格,原文只要求安静环境与耳机,并未报告声压校准或设备型号核查。对于复现而言,需要保留的关键参数是提示音频率与时长、最小前导间隔、书写窗口时长、练习刺激清单与半随机表。缺失的信息也要如实指出,例如播放声级、耳机频率响应、是否允许重听、缺失回答如何处理,在原文中没有报告,不能自行假设为允许重听或按缺失剔除。

知觉同化模型 × 范畴拟合度评分: 知觉同化模型负责预测非母语对立会被同化为一个母语范畴还是两个范畴以及学习难度,范畴拟合度评分负责让被试在转写之后报告所选普通话音节有多像听到的声音,二者搭配的理由是只看转写比例不知道所选类别是典型还是勉强归入,组合意义是转写给出同化方向而评分给出原型性程度,共同支撑单范畴与双范畴的判断。

知觉同化模型提供单范畴与双范畴的预测语言,拟合度评分提供原型性证据,二者结合才能判断 /a/ 前浊清同归不送气是否属于更难学习的单范畴格局。

发音部位 × 元音语境: 发音部位负责通过爆破腔体大小改变嗓音起始时间,双唇最短而软腭最长,元音语境负责通过开口度和舌位改变爆破后的协同发音条件,开元音 /a/ 前嗓音起始时间往往更短,二者搭配的理由是它们共同调制同一个声学量,组合意义是它们解释了为何 /pa/ 与 /ku/ 在同一浊清标签下会得到相反的送气判断。

发音部位与元音语境各自改变嗓音起始时间,前者通过腔体与松开速度,后者通过协同发音,二者叠加决定了每个具体音节落在哪一段阈值区间。

自由拼音转写 × 逻辑回归: 自由拼音转写负责在不限选项条件下收集听者自发的母语范畴标签,逻辑回归负责把每个刺激的嗓音起始时间与被听成送气的概率联系起来,二者搭配的理由是前者保留塞擦音与鼻音等意外回答,后者把离散回答压缩为一条随嗓音起始时间单调变化的曲线,组合意义是从类别分布过渡到连续阈值描述。

自由拼音转写保留真实分布的毛边,逻辑回归给出平滑的概率曲线,前者防止把塞擦化误读为送气,后者防止把个别刺激的偶然比例当成普遍阈值。

本研究是否存在模型训练与参数更新?

本研究没有训练任何神经网络,也没有更新声学模型权重,因此不存在优化器、学习率、梯度路径、参数冻结或早停等概念。真实的计算过程是 3 类常规统计。第一类是对嗓音起始时间做方差分析,检验辅音与元音的主效应,并对同部位浊清配对做事后比较。第二类是对每个辅音分别做卡方检验,检验后接元音是否改变转写类别的分布。

第 3 类是在全部听者回答上做逻辑回归,以刺激的嗓音起始时间为自变量,以回答是否为送气为因变量,拟合送气概率曲线并读出概率为 0.5 时的嗓音起始时间。监督来源不是人工标注的法语标签,而是普通话听者自己的拼音回答与拟合度打分。所谓学习在这里指人类范畴的同化,而不是机器参数的更新。不能把无训练等同于确定性求解,同一刺激在不同听者与不同试次下仍会出现分歧,回归曲线描述的是概率趋势而非每 1 次回答的必然结果。

复现时不需要准备训练算力,但需要准备声学测量工具与统计软件,并保留原始手写转写的重编码表,否则无法核对塞擦音与鼻音的归类口径。

刺激声学如何随部位与元音变化?

在进入知觉比例之前,必须先确认刺激端的声学条件是否如预期那样变化,否则无法把知觉差异归因于嗓音起始时间。原文报告浊音为负值且绝对值超过 100 毫秒,男声可达 150 毫秒附近,清音为 10 毫秒到 125 毫秒左右的正值,平均而言男声绝对值大于女声,清音内部按 /p/ 小于 /t/ 小于 /k/ 排列。元音方面,/a/ 前的清音嗓音起始时间普遍短于 /i/ 与 /u/ 前,软腭 /k/ 在多数元音下长于双唇与齿龈音,在 /a/ 前还能进一步区分 /p/ 短于 /t/。下图把清音单独按元音展开,是核对部位与元音交互的关键。

这张清音分组图需要按说话人与元音逐格阅读,重点是比较同一元音内三根柱子的相对高度,以及同一辅音跨元音的高度变化。

看图路径: 1. 先区分左右两大面板分别对应男声与女声,再区分每面板内按后接元音分列的分组;2. 再在每组内比较 p-t-k 三根柱子的高度,确认软腭 k 是否系统更高;3. 最后纵向比较同一辅音在 a 与 i-u 条件下的高度,验证 a 前更短的结论

原论文 Figure 2:Les valeurs de VOT des occlusives sourdes /p t k/ en fonction de la voyelle suivante /a/

论文图 2。原论文 Figure 2:“Les valeurs de VOT des occlusives sourdes /p t k/ en fonction de la voyelle suivante /a/”。

从可见柱体与标注数字看,左侧男声的整体高度明显高于右侧女声,同一面板内 /k/ 与 /t/ 的长柱与 /p/ 的短柱形成对比,而 /a/ 所在分组的柱体普遍低于 /i/ 与 /u/ 分组。这种声学格局直接预示后文的知觉格局,即 /a/ 前更容易出现不送气回答,/i u/ 前更容易出现送气回答,软腭音更容易被听成送气。需要提醒的是,当前收到的图像像素为裁剪局部,个别柱顶数字在边界处不完整,复述具体毫秒值时应以正文连续句中的区间描述为准,而不是从像素边缘推测缺失数字。

统计上辅音主效应与元音主效应均显著,数值为方差分析的 F 与 p,但这只说明均值差异不太可能由随机抽样解释,不说明每个具体音节的嗓音起始时间必然服从排序。

总体转写分布支持哪两个假设?

总体分布是先看浊音再看清音。浊音部分方向非常一致,多数回答落入同部位的不送气类别,这支持第一假设。清音部分则出现分化,双唇与齿龈接近对半,而软腭明显偏向送气,这提示不能只用浊清标签预测,必须引入嗓音起始时间的连续解释。下图把 6 个刺激的堆积百分比并列,是全文最核心的知觉证据。

阅读这张堆积图时,先看每根柱子是否堆满 100%,再看浊音柱子中深色不送气段的占比,最后看清音柱子中送气段是否达到约一半或更高。

看图路径: 1. 先确认横轴六个刺激 b-p-d-t-g-k 与纵轴百分比堆积到百分之百的结构;2. 再对比 b-d-g 三根柱子顶部深色不送气段是否占据绝大部分;3. 最后对比 p-t-k 三根柱子中送气段与不送气段的大致对半或送气占优格局

原论文 Figure 3:Distribution en pourcentage des réponses pour les occlusives /b, d, ɡ, p, t, k/, transcrites…

论文图 3。原论文 Figure 3:“Distribution en pourcentage des réponses pour les occlusives /b, d, ɡ, p, t, k/, transcrites librement en pinyin. 3 voyelles x 2 locuteurs x 20 auditeurs mandarinophones x 1”。

从可见结构看,最左侧 /b/ 柱几乎全为不送气,/g/ 柱同样以不送气为主,/d/ 柱则在中部出现明显的塞擦化分段,清音 /p t/ 柱呈现两大段对峙,/k/ 柱的送气段占据约三分之二。表后解释需要强调代价与反例。代价是清音的判断高度不稳定,同一标签下既有不送气也有送气,不能当作稳定范畴使用。反例是 /d/ 在 /i/ 前的塞擦化,它既不是普通话齿龈不送气也不是送气,而是腭化塞擦音,这部分在计算送气率时仍占分母,会拉低两个主要类别的百分比。未胜出的类别也要说明,鼻音回答在浊音中偶发但比例很低,说明听者基本仍在塞音框架内归类,没有大规模转向鼻音范畴。

下面两张表把正文连续句中的关键百分比整理为可核对的对照。第一张表回答总体归属问题,比较条件是同一刺激下不送气与送气的份额,指标方向是份额越高表示该归属越占优。

法语刺激普通话转写类别指标口径本条件比例同刺激对照比例
/b/不送气 b 即 /p/转写份额90,8 %送气侧未形成多数
/d/不送气 d 即 /t/转写份额70,8 %余量含塞擦与送气
/g/不送气 g 即 /k/转写份额90,0 %送气侧未形成多数
/p/不送气与送气对峙转写份额50,8 %送气 /pʰ/ 占 49,2 %
/t/不送气与送气对峙转写份额45,8 %送气 /tʰ/ 占 42,5 %
/k/送气占优转写份额68,3 % 送气 /kʰ/不送气 /k/ 占 28,3 %

上表的主要收益是浊音假设得到清晰支持,3 组不送气份额均超过 70%,其中 /b/ 与 /g/ 达到 90% 左右。具体代价是清音双唇与齿龈几乎没有多数类别,/p/ 的两类相差不到两个百分点,/t/ 的两类加上塞擦余量后同样接近,这意味着用单一标签预测清音归属会失败。/k/ 是唯一的例外,送气超出不送气约 40 个百分点,但仍有近 30% 不送气回答,因此送气占优不等于稳定送气。/d/ 的 70% 不送气低于 /b/ 与 /g/,原因在下一节的元音分解中会更清楚,即 /i/ 前的塞擦化分流了比例。

元音语境如何翻转清音的送气判断?

把清音按后接元音拆开后,变异就有了规律。/a/ 前普遍偏向不送气,/i/ 与 /u/ 前普遍偏向送气,软腭音在 /u/ 前的送气倾向最强。浊音方面,/b/ 与 /g/ 的元音效应不显著,/a/ 前不送气比例更高但整体仍稳定,/d/ 的元音效应显著且主要来自 /i/ 前的塞擦化。这说明元音不是直接改变范畴,而是通过改变嗓音起始时间与腭化程度间接改变回答。下表把清音 3 组元音条件并列,比较问题是同一辅音在不同元音下送气份额是否反转,公平条件是同一辅音、同一说话人集合与相同的 20 人分母,指标方向仍是份额越高越占优。

法语刺激后接元音指标口径不送气份额送气份额与备注
/p//a/转写份额100 %送气接近 0 %
/p//i/转写份额2,5 %送气 /pʰ/ 占 97,5 %
/p//u/转写份额52,5 %送气 /pʰ/ 占 47,5 %
/t//a/转写份额87,5 %送气 /tʰ/ 占 12,5 %
/t//i/转写份额余量被塞擦分流送气 /tʰ/ 占 57,5 %,另有塞擦
/t//u/转写份额42,5 %送气 /tʰ/ 占 57,5 %
/k//a/转写份额55,0 %送气 /kʰ/ 占 45,0 %
/k//i/转写份额17,5 %送气 /kʰ/ 占 72,5 %,另有塞擦
/k//u/转写份额12,5 %送气 /kʰ/ 占 87,5 %

表后解释要同时给出收益与代价。收益是元音翻转在 /p/ 上最干净,从 /a/ 前 100% 不送气翻到 /i/ 前 97.5% 送气,几乎是全或无的切换。代价是这种翻转在 /t/ 与 /k/ 上并不纯粹,/t/ 在 /i/ 前有 30% 左右的塞擦音,/k/ 在 /i/ 前也有 10% 左右的送气塞擦音,若只看送气与不送气 2 分,会高估两类的覆盖率。未胜出项是 /k/ 在 /a/ 前的不送气微弱多数,差距只有 10 个百分点,不能当作稳定规则。卡方检验显示清音 3 组的元音效应均显著,/d/ 的元音效应也显著,而 /b/ 与 /g/ 不显著,这与浊音整体稳定的结论一致。结合刺激声学看,/a/ 前嗓音起始时间更短因而更像普通话不送气,/i u/ 前更长因而更像送气,分布与声学方向吻合。

送气概率随嗓音起始时间如何爬升?

如果把所有回答放在以嗓音起始时间为横轴、送气概率为纵轴的图上,会看到一条从零附近开始、中间快速爬升、两端趋平的曲线。负值与弱正值区几乎没有送气回答,从 32 毫秒左右开始出现送气,概率为 0.5 的位置约在 45.5 毫秒,79 毫秒以上观察到的回答全部为送气。这正是第二假设的连续版本,即短嗓音起始时间对应不送气,长嗓音起始时间对应送气,中间是高变异过渡带。下表把阈值区整理为可操作的区间对照,比较问题是不同嗓音起始时间段的送气倾向,公平条件是同一批听者与同一重编码口径,指标方向是送气概率越高越偏送气。

嗓音起始时间区间刺激举例指标口径送气概率趋势适用条件与备注
负值至弱正值浊音 /b d g/送气回答率接近 0负值绝对值超 100 ms 区
短正值低于约 30 ms/pa/ 类送气回答率以不送气为主接近普通话不送气区间
约 32 ms 起过渡起点送气回答率开始出现送气曲线开始爬升
高于约 80 ms/ku/ 类送气回答率以送气为主79 ms 以上观测全送气

表后解释必须区分报告与推测。报告的是观测到的区间行为与拟合曲线的 0.5 点位置,支持嗓音起始时间是核心连续线索。有限解释是中间区变异大意味着没有清晰的普通话范畴对应,这与普通话不送气在元音与部位条件下变异较小、而法语清音可在较宽正值区实现的讨论相呼应。

待验证的是把该曲线直接当作学习难度预测,原文按同化模型推测 /a/ 前浊清更可能同归不送气而更难区分,/i u/ 前更可能分归两类而相对容易,但这一步尚未用辨别任务直接测量,因此只能表述为可能与待验证。逻辑回归公式在原文中以含截距与斜率的形式给出,复现时应原样使用报告系数,不自行重新拟合后再替换阈值。

哪些边界尚未被测量而不能下结论?

第一,未测量辨别与学习结果。本文做的是同化转写加拟合度评分,没有做 ABX 辨别或训练前后测,因此单范畴更难、双范畴更容易的说法是模型预测,不是本实验直接证明的因果。第二,说话人数量很少。只有 1 位男声与 1 位女声,嗓音起始时间的绝对值存在说话人差异,男声普遍更长,若换一批说话人,阈值位置可能移动,不能把 45.5 毫秒当作跨说话人的通用切点。第三,在线与纸笔流程的控制有限。

设备、声级、重听次数、缺失回答处理均未报告,拟合度评分的详细分布也未在摘录证据中展开,因此不能用本文数字承诺真实课堂中的误判率或反应时。第四,英语经验未被建模。所有被试都学过英语,英语的浊清实现与普通话送气不完全相同,可能带来额外影响,但原文只报告水平范围,没有将其作为协变量分析。第五,塞擦化只在特例中讨论。/d t/ 在 /i/ 前的腭化在当代法语中有文献支撑,但本文没有系统测量腭化声学量,不能把塞擦回答完全归因于某一个频谱参数。

这些限制不是技术错误,而是证据边界,复述时要用支持与可能区分措辞,不把相关趋势说成每组每步都成立。

要复现这套同化测试需要准备什么?

先准备刺激。按六辅音乘以三元音录制 18 个音节,嵌入框架句并前后留停顿,每句读四遍,取第二或第三遍,采样率与量化精度按原文保留为 44100 Hz 与 16 位,录后逐个测量嗓音起始时间并保留 2 位说话人的原始分布。练习刺激单独准备后接 /ɛ/ 的 6 个音节,不混入正式统计。再准备被试。招募未学过法语、无 francophone 居住史的普通话母语者,尽量控制方言背景并记录英语与其他语言水平,年龄与人数尽量接近原文以便比较比例波动。

实施时准备中文指导语、半随机播放表、提示音与间隔参数、5 秒书写窗口与纸质问卷,转写要求写明用拼音、不标声调,打分要求写明假设为普通话时的一到 5 分标准。分析时先按 <p t k>0 与 <p t k>1 的口径重编码,塞擦与鼻音按送气与否分别处理,分母保持每刺激 20 个回答,再计算总体分布、按元音拆分的卡方检验与送气率对嗓音起始时间的逻辑回归。

核对点包括浊音 3 组的不送气份额、清音 /p t/ 的对半格局、/k/ 的送气占优、/p/ 在 /a/ 与 /i/ 前的翻转、以及 32 毫秒、约 45.5 毫秒与 79 毫秒 3 个关键位置。资源状态方面,本次没有发现来源绑定且完成验证的代码、模型或数据资源,因此不得声称材料已公开,复现只能按正文描述重做。

何时值得借用这套解释以及还缺哪项验证?

当你的学习者母语没有浊音对立而有送气对立,且目标语清音的嗓音起始时间跨越母语 2 个类别之间时,这套解释最值得借用。它告诉你不要只按浊与清贴标签,而要先测量每个具体音节的嗓音起始时间,再看它落在母语短正值簇、长正值簇还是中间过渡带。对于教学顺序,本文的启示是 /pa/ 这类短嗓音起始时间音节更容易被当作不送气,/ku/ 这类长嗓音起始时间音节更容易被当作送气,因此在 /a/ 前建立浊清区分可能更难,在 /i u/ 前可能相对容易,但这仍是预测而非定论。

还缺的关键验证是辨别任务与学习追踪,即让同一批听者在 /a/ 与 /i u/ 前做浊清辨别,再看错误率排序是否与同化格局一致,并补充更多说话人与更多重复以稳定阈值估计。另一个值得补的验证是拟合度评分的完整分析,看勉强归入的过渡区是否评分更低、方差更大。记住本文的强证据是转写分布与嗓音起始时间曲线的方向一致性,弱环节是跨说话人推广与学习难度的因果链条。

复述方法时保留重编码口径、分母、单位与区间写法,不把百分点差异说成相对百分比提升,也不把自动声学测量当作人类评分。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 10 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总