英文题目:Rise or fall-rise? On the perception of English intonation by French listeners

会议身份:conference:speechprosody:2026:conference-paper-id:regis26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Antoine Regis:机构信息未能从会议 PDF 纯文本可靠映射
  • Sophie Dufour:机构信息未能从会议 PDF 纯文本可靠映射
  • Sophie Herment:机构信息未能从会议 PDF 纯文本可靠映射
  • Amandine Mihelas:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究检验母语缺失特定语调范畴是否导致辨别困难,输入为3名美式英语母语者产出的12个三音节无意义词录音,输出为听者在ABX范式下判断X与A或B何者相同,难点在于上升调在两语言共有而下降-上升调仅英语特有且出现频率低、缺乏词汇语境支撑。方法链先以疑问语气诱发两语言共有的上升调LH%,以怀疑语气诱发英语特有的下降-上升调HLH%,形成受控的语调对比材料,上一步的录音输出直接进入下一步校验。接着经ToBI标注确认调形符合预期并对时长与响度做均衡处理,消除非语调线索干扰,再进入由20名法语单语者与18名美式英语单语者参与的ABX辨别测试,用混合效应逻辑回归比较组别正确率。相对已有音段、声调与重音聋研究,关键机制差异在于将感知同化从词汇层面推向话语语调层面,强调母语语调库缺失对语调对比感知的制约,具有拓展音系性聋理论适用范围的意义。在ABX辨别任务条件下,美国听者对本族语调对比的准确率为79%,低于母语者辨别音段或重音对比时通常报告的准确率90%或更高。结论适用边界仅限于孤立无意义词、无句子语境支持的低频迟疑调辨别,尚未验证句子语境、高频语调或学习效应下的外推,频率与语境丰富度仍可能制约感知表现。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文输入是两组听者的行为数据,目标是回答母语缺失的语调轮廓是否更难辨别。作者比较法国人与美国人对英语升调与降升调的区分。升调是先低后升的提问式曲线,降升调是先高后降再升的表怀疑曲线。前者英法语共有,后者仅英语有。读完你要能复述三件事。

第一,刺激是无意义三音节词,由美国人按提问和表怀疑两种语气录制。第二,任务是 ABX 辨别,听 A、B、X 并判断 X 同 A 还是同 B。第三,结论是法国人显著更差,但美国母语人也只有中等正确率。本文没有训练神经网络,没有提出新模型,没有报告代码与数据公开。资源状态为本次未发现可验证的公开链接,因此不要声称材料已公开。

学习时先抓住自变量是语调类型,控制变量是时长与响度,因变量是正确率,统计工具是混合效应逻辑回归。

音高重音 × 边界调: 音高重音负责重读音节上的高低目标,决定调核的起点形态,边界调负责韵律单元末端的走向,决定结尾上扬还是下降,二者搭配是因为英语语调轮廓被定义为重音加边界的组合,组合后才产生具有特定语用含义的完整曲线,如 H*+L 加 H% 构成表怀疑的降升调。

本解读按学习依赖展开。先讲音系性耳聋的已有路线,再讲本研究的语调问题与预测,接着走完样本录制、标注核验、试次构造、施测流程,然后讲被试条件、统计建模、主结果与作者对低正确率的讨论,最后给出复现清单与适用边界。例子在文中会明确标为例子,不作为论文证据。

已有路线证明了什么,为什么还要做语调?

已有工作反复显示成人对母语没有的音系对立辨别困难,这种现象被称为音系性耳聋。音段层面,日语母语人难以区分英语流音 r 与 l。声调与重音层面,英语和法语母语人难以区分汉语声调,法语母语人难以区分词重音,而西班牙语母语人因为母语使用词重音则困难较小。更关键的是,高水平法语学习西班牙语时仍残留重音耳聋。这条路线说明困难不只是初学者不熟悉,而是母语音系库长期塑造感知。

本文把问题从音段、声调、重音推进到语调。语调指超越词义的音高模式,用于编码疑问、怀疑、话语功能。英语语调库较大,有 6 种音高重音可与两种边界调组合,法语只有两种音高重音可与两种边界调组合,因此 H 星加 L 再加高边界构成的降升调在法语中不可能出现。作者据此预测法国人区分升调与降升调会比美国人更困难。

音系性耳聋 × 语调对比: 音系性耳聋指成人难以辨别母语没有的音系对立,语调对比指不同语调轮廓承载的意义对立,前者提供解释框架负责预测困难方向,后者提供检验对象负责把困难从音段和声调推广到语调,二者结合的意义是判断母语语调库是否同样塑造感知。

举一个教学用的例子帮助理解,但它不是本文数据。比如把汉语四声类比为 4 个走向不同的山坡,母语没有上声的人可能把阳平和上声都听成上升。本文的升调与降升调之争类似,两者结尾都上升,区别在起点与中间是否先降。例子只用于建立直觉,真正证据只能来自后文的 ABX 正确率与统计检验。

要检验的具体对比是什么,预测方向如何?

具体问题是法国听者能否像美国听者一样区分 L 星 H 边界的升调与 H 星加 L 再加 H 边界的降升调。白话是,一条是低起直接升,一条是高起先降再升。英文名分别是 rising contour 即 L 星 H 百分号,和 falling-rising contour 即 H 星 LH 百分号。后文统一简称升调与降升调。作者选择这对对比有 3 个理由。

第一,升调两语言共有,可作共同基线。第二,降升调仅英语有,可制造母语有无差异。第三,两者都以高边界结尾,声学上接近,任务有难度,不会因天花板效应看不出组差。预测很明确,如果语调也存在音系性耳聋,法国组正确率应显著低于美国组。反之,若语调靠通用听觉机制即可分辨,两组应无差异。

注意预测只涉及组间相对高低,不承诺法国人完全听不出,也不承诺美国人接近满分。后文美国人中等正确率的讨论正是对第二点的补充。

升调 × 降升调: 升调指 LH% 对应的低起点直接上升,常用于提问,英法语共有,降升调指 HLH% 对应的先高后降再升,用于表怀疑保留,仅英语有,二者搭配对比的理由是共享上升结尾而起点与中段走向不同,组合起来正好检验母语缺失一个成员时能否察觉细微走向差异。

复述时要保留关键信息条件。刺激是孤立无意义词而非句子,说话人是 3 名美国人,X 与 A、B 不同人,被试按耳机听音按键作答。这些条件决定了结论只适用于去词汇、无语境、跨说话人的语调辨别,不能直接推广到自然对话中的怀疑识别。

从录音到按键,整个流程走一遍

先沿一个样本走完全程。以无意义词 maridy 为例,它由 mariner 与 melody 各取一部分拼接成三音节结构。2 名女声分别录制升调版与降升调版,1 名男声录制待判的 X 版。录制时先让说话人把该词当作提问说,得到升调,再当作怀疑或不赞同说,得到降升调。录音在隔音室完成,采样率为 44100 赫兹。

随后用 ToBI 标注核验每条是否确为预期轮廓,用声学分析核验时长是否匹配,用软件把响度统一到相同声压级。接着构造试次,每个试次含 A、B、X。A、B 轮廓必不同,一个升调一个降升调,分别来自两个女声,X 来自男声且轮廓与 A 或 B 之一相同。被试在隔音间戴耳机听音,A、B、X 之间间隔固定时长,被告知前两者不同、第 3 个与前两者之一相同,按左右键报告 X 同 A 还是同 B。答后有反馈,再间隔固定时长进入下一试。

每人先做 8 个练习试次,再随机做 96 个正式试次。

ABX 任务 × 说话人归一化: ABX 任务负责给出 A、B 两个参照再让被试判断 X 同谁,分工是测辨别而不要求命名轮廓,说话人归一化负责让 A、B 用两个女声、X 用男声,分工是迫使被试忽略音色而比较轮廓,二者搭配是因为若 X 与 A 同人,被试可用音质取巧,换人后只有抽出抽象语调才能答对。

这个设计的关键是跨说话人比较。A、B 用女声一和女声二,X 用男声,被试不能靠记住某个人的音色作答,必须抽出轮廓走向。同时 A、B 轮廓不同且顺序平衡,X 等于 A 或等于 B 的次数平衡,声音与轮廓的搭配也平衡,从而避免某一声音或某一顺序带来偏差。

刺激如何保证问的是语调而不是时长响度?

组件分 3 步。第一是 elicitation 即诱发录制,用提问诱发升调,用怀疑诱发降升调,保证语用功能对应轮廓。第二是标注核验,用 ToBI 方案确认提问版确为 L 星 H 边界,怀疑版确为 H 星 LH 边界,图 1 展示了 maridy 在女声下的两条曲线,上面为升调,下面为降升调。第三是声学均衡,测量整词与 3 个音节各自时长并做统计检验,结果显示两类轮廓在整词与各音节上均无显著差异,再把所有刺激的均方根幅度统一到 70 分贝声压级。这 3 步合起来把自变量锁定为音高走向。

若时长或响度系统性偏向某一轮廓,被试可用非音高线索答对,组差就无法解释为语调耳聋。作者因此先报告时长无差异,再报告响度已均衡,然后才进入行为比较。

ToBI 标注 × 时长控制: ToBI 标注负责核验每条录音是否确为预期的 LH% 或 HLH%,分工是保证自变量有效,时长控制负责检验两类轮廓在整词与各音节时长上无差异,分工是排除时长线索,二者搭配后才能把组间差异归因于音高走向而非录制偏差或语速差异。

初学者常误以为录音自然就好。这里的动作恰相反,先自然诱发,再人工核验与均衡。自然诱发保证生态效度,标注与均衡保证内部效度。缺少任一步,结论都会打折。

本研究训练了什么,没有训练什么?

本研究没有训练任何神经网络、声学模型或分类器,也没有更新权重、反向传播、优化器迭代或早停。training 一节在此的职责是如实说明无训练,并讲清实际发生的构造与计算过程。实际计算有 4 类。第一是刺激构造计算,包括拼接无意义词、录制、重采样保存。第二是标注与测量计算,包括 ToBI 标注判定、Praat 测量整词与音节时长、t 检验比较两类轮廓时长。

第三是试次组合计算,对 12 个无意义词分别交叉轮廓、正确答案位置与女声顺序,生成 96 个试次。第四是统计建模计算,用带逻辑连接的混合效应回归拟合正确与错误,以组别为固定效应,被试与项目为随机截距。原文还交代了拟合细节,因数据量大需指定特定优化器与参数才能收敛,项目随机斜率因不收敛而未纳入。这些都是推理与统计计算,不是模型训练。复现时不需要 GPU 训练,只需要按同样规则重建刺激表、重跑行为实验与回归。

被试、试次与统计条件是否可比?

被试在法国艾克斯普罗旺斯招募测试。法国组 20 人,14 名女性,19 至 40 岁,美国组 18 人,13 名女性,19 至 34 岁。法国人均为单语,有学校英语基础但 6 岁后才接触,出国不超过 3 个月,美国人均为单语,有基础法语且 6 岁后学习,在法停留不足 6 个月。无人报告言语听力语言障碍,均签署知情同意并获得 10 欧元报酬。这些条件控制了年龄大致可比、单语背景、第二语言接触有限,避免把组差归因于严重听力问题或长期沉浸。

试次共 96 个,12 个无意义词各 8 种组合,组合来自轮廓、正确答案为 A 或 B、女声顺序的交叉。下表整理被试与材料规模,数字保留原文写法,便于核对数据集与协议是否一致。

组别与材料指标法国组数值美国组或总量比较对象
被试规模人数与性别年龄20 人 14 名女性 19 至 40 岁18 人 13 名女性 19 至 34 岁法国对比美国
被试均值平均年龄均值 22.65 标准差 5.64均值 22.55 标准差 4.18法国对比美国
刺激基数无意义词数量12 个三音节词12 个三音节词全体被试共用
正式试次试次总数96 试次每人随机顺序96 试次每人随机顺序全体被试共用

表后需要说明公平性与代价。公平处在于两组听同一套跨说话人刺激,同一 ABX 规则,同一练习加正式流程,指标同为正确率。

代价是孤立词缺少句子语境,男声 X 与女声 AB 的音域差异可能增加难度,实验室耳机环境也与日常听音不同。这些代价不推翻组差,但限制了向自然对话的推广。未胜出项在此体现为法国组并非零分,只是显著更低,说明困难是程度差异而非完全失聪。 统计方法按原文交代。正确记 1 错误记 0,用逻辑连接的混合效应回归,固定效应为组别,随机截距为被试与项目。

原文明确因收敛问题未纳入项目随机斜率,并因数据量大改用特定拟合设置。聚合对象是试次级正确率,指标方向是正确率越高越好,组别显著即支持语调耳聋假设。

时间参数与声学均衡如何固定?

施测时间参数固定为试内间隔 500 毫秒,作答后 1000 毫秒给反馈,被试作答到下一试开始间隔 1000 毫秒。练习 8 试,正式 96 试随机呈现,每人顺序不同。声学方面,采样率 44100 赫兹,响度统一到 70 分贝声压级,时长经检验无组间差异。下表把时间与声学条件放在一起,便于复现时逐项照抄。

条件类别参数升调或 A 侧降升调或 X 侧说明
反馈延迟反馈时间1000 毫秒1000 毫秒作答后反馈
试间间隔下一试间隔1000 毫秒1000 毫秒作答到下一试
模型效应组别系数系数 0.718 标准误 0.341统计量 z 等于 2.107美国高于法国显著
母语水平美国人正确率正确率 79%正确率 79%降升调辨别

表后解释为何保留这些数字。时间参数保证记忆负荷一致,若间隔过长或过短都会改变难度。声学均衡保证只能用音高走向作答。

组别系数与 79% 放在同一表是为了提醒,显著组差与中等绝对水平可以并存,前者回答有无耳聋,后者回答任务本身有多难。复现时若改动间隔、反馈有无或响度归一,都需重新评估难度,不能直接比较正确率。

时长无差异的检验覆盖了哪些位置?

作者担心降升调因多一个转折而更长,因此分别检验整词与 3 个音节。结果是整词时长无差异,第一音节无差异,第二音节无差异,第三音节无差异,p 均大于 0.20。下表集中呈现这些检验,便于理解控制的粒度。

检验对象统计量升调条件降升调条件结论
整词时长t 值 35 自由度 0.68L 星 H 百分号H 星 LH 百分号无显著差异
第一音节时长t 值 35 自由度 0.24L 星 H 百分号H 星 LH 百分号无显著差异
第二音节时长t 值 35 自由度 0.24L 星 H 百分号H 星 LH 百分号无显著差异

表后要讲清支持的判断与限制。支持的是时长不是混淆因素,组差更可能来自音高走向。

限制是无差异不等于完全相等,只是统计上不显著,且检验只覆盖时长与整体响度,未报告音高幅度、斜率、音域等细粒度声学分布。若两类轮廓在音高幅度上天然不同,那仍是语调本身的一部分,不算混淆,但复现时最好补充音高轨迹描述,避免把不同说话人的实现差异误读为类别差异。

主结果显示了什么,统计如何支持?

主结果是法国人辨别升调与降升调显著差于美国人。图 2 展示两组正确率柱形与标准误,视觉上美国柱高于法国柱。文字报告给出混合效应回归的组别主效应显著,美国人正确更多,系数 0.718,标准误 0.341,z 为 2.107,p 小于 0.05。美国母语人对本族语降升调的正确率为 79%,明显低于音段或重音辨别中常见的 90% 以上。这意味着两个判断同时成立。

一是相对差异存在,支持语调也存在音系性耳聋。二是绝对水平不高,说明即使母语有该轮廓,孤立词跨说话人辨别仍不容易。阅读时不要把显著误读为巨大,也不要把 79% 误读为失败,显著回答方向,79% 回答难度。

看图路径: 1. 先确认横轴两组对象是美国人与法国人,纵轴是辨别正确率;2. 再比较两根柱子的高低与误差线是否重叠;3. 最后把柱面高低与正文报告的美国人 79% 和组别显著效应对应起来

原论文 Figure 2:Accuracy rates for American and French listeners.

论文图 2。原论文 Figure 2:“Accuracy rates for American and French listeners.”。

该图只比较两组总体正确率,不展示单个无意义词、单个说话人或单个试次类型的分解,也不展示反应时。解释时应紧扣可见元素,先看组别与正确率方向,再看误差线表示的变异,最后回到正文的回归系数,确认图面高低与统计显著一致。像素不能精确读出的具体百分比不要硬写,法国组的具体数值原文未以文字给出,只能说显著更低,不能编造数字。

如果去掉控制或换条件,结果可能怎样?

本文没有神经网络消融,但有方法意义上的对照与失败条件可讲。第一是时长对照,若去掉时长检验,就无法排除降升调更长带来的线索,组差解释会变弱。第二是跨说话人设计,若让 X 与 A 同人同声,被试可用音色取巧,正确率会虚高,组差可能被掩盖。第三是标注核验,若去掉 ToBI 核验,提问版与怀疑版可能实现不到位,自变量就无效。

第四是频率解释,作者引用英语叙述语料分析指出 H 星与 L 加 H 星占绝对多数,L 星加 H 等少得多,H 星加 L 罕见,说明美国人日常接触降升调也少,这可以解释为何母语人也只有 79%。这不是事后找补,而是提醒轮廓频率可能调节辨别难度。未来可直接检验高频轮廓是否辨别更好,或用句子级刺激提供更自然的韵律语境,看正确率是否提升。这些都还是待验证的预测,不能当作已证明的因果。

哪些边界尚未评测,不能承诺什么?

首先,刺激是孤立无意义词,没有句子语境与话语功能支撑,日常听怀疑往往有词汇与情境帮助,因此不能承诺自然对话中法国人同样困难。其次,被试是单语且第二语言接触有限的年轻人,不能推广到高水平英语学习者、长期沉浸者或儿童。第三,只测了 1 对轮廓,即升调对降升调,不能推广到所有英语语调对立。第四,只报告正确率,未测量反应时、置信度、误判方向,也未报告训练可塑性,因此不能承诺辨别训练一定有效,也不能承诺延迟与成本得到改善。

第五,美国人 79% 提示任务本身较难,频率与跨说话人变异都可能压低分数,在未操纵频率与语境前,不能把低分完全归因于音系表征缺失。最后,统计模型因收敛限制未纳入项目随机斜率,项目间变异是否调节组效应尚未充分建模,解读时应保留谨慎。缺失证据不是技术错误,但需要补验证才能谈因果与推广。

要复现先做什么,需要保留哪些参数?

复现先重建刺激表。构造 12 个三音节无意义词,结构为辅元辅元辅元,由英语单词拼接并标注重音在首音节。请 3 名美国人,2 女 1 男,分别按提问与怀疑录制两遍,在隔音室以 44100 赫兹录音。用 ToBI 标注筛选出符合 L 星 H 边界与 H 星 LH 边界的版本,用 Praat 测量整词与各音节时长并检验无差异,把响度统一到 70 分贝声压级。然后按 12 词乘 8 组合生成 96 试次,每试 A、B 来自 2 女声且轮廓不同,X 来自男声且与 A 或 B 之一同轮廓,平衡正确答案位置与女声顺序。

施测时用耳机,试内间隔 500 毫秒,反馈延迟 1000 毫秒,试间间隔 1000 毫秒,先 8 练习再 96 正式随机呈现。分析时以试次正确为因变量,组别为固定效应,被试与项目为随机截距,用逻辑混合效应回归拟合,留意收敛设置。硬件预算原文未报告声卡耳机型号与声级校准细节,复现时需自行记录并保持舒适可听一致。代码、模型、数据当前无可验证公开链接,不要假设可下载,一切以自采数据与自写脚本为准。

何时值得参考这个结论,还需补哪项验证?

当你的任务涉及跨语言语调感知、教材中怀疑语气的听辨训练,或语音评测需要解释法国学习者对英语降升调的困难时,这个结论值得参考。它提示语调库差异会带来可测的辨别代价,教学与评测应把降升调单列出来多练,而不是只练疑问升调。但参考时要附带条件。结论来自孤立词跨说话人 ABX 辨别,若你的场景是句子级自然对话,应先补语境实验再谈迁移。若你的对象是高水平学习者或长期在英语环境者,应先补学习时长与沉浸的调节实验。

若你关心训练效果,应补前后测与保持测试,并同时看正确率与反应时。若你关心频率解释,应直接比较高频与低频轮廓的辨别,或统计你所用语料中各轮廓的出现次数。总之,本文报告的是组间显著差异与母语中等水平并存,支持语调耳聋但也提示频率与语境的作用,可能的机制仍待验证,不宜作营销式推广。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 3 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 3 页

区域 2 · 查看论文原页

另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总