英文题目:Perceptual Correlates of Lexical Tone in Brajbhasha

会议身份:conference:speechprosody:2026:conference-paper-id:ojha26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #语音学与音系 #社会语音学 #言语感知 #语音属性识别

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Neetesh Kumar Ojha:机构信息未能从会议 PDF 纯文本可靠映射
  • Shakuntala Mahanta:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究检验布拉杰语新兴低调是否具有心理现实性,输入为基频受控降低的听觉刺激,输出为低调与非低调图片二选判断,难点在于区分整元音整体降低与时序位置不同的局部轮廓线索。方法链分三步:先选取12个中性调词覆盖词首、词间与词尾三种历史/h/脱落语境,再用Praat施加整段降低与前半段、后半段局部降低共12个版本形成144个刺激并以PsychoPy采集182名母语者判断,最后用二项逻辑广义线性混合模型建模,前一步的操纵刺激直接进入后一步的感知建模。与既有产出声学研究相比,该设计把历时来源作为感知预测因子,而非仅验证高低二分能否听辨,揭示了范畴与语音源头的持续联系。在相同二选感知任务条件下,教育模型的AIC指标为35413.7,低于年龄组模型的AIC指标35504.2。交互分析还显示第二半段降低在词尾与词间语境中正向效应最强,验证了尾部扰动的历时路径。该结论适用边界仅限于重音节承载的低调与中性调对立,尚未验证自然语流及声调与其他韵律边界交互的情形。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

布拉杰语为什么值得做一次听感知实验?

输入是布拉杰语中仅靠音高区分词义的成对词语,目标是判断这种音高差异在母语者耳朵里是否构成稳定的声调范畴,必须保留的信息是历史来源、感知线索和社会接触条件,输出是可复述的实验链条。本文讨论的任务是词汇声调感知,不是语音识别准确率,也不是合成自然度。布拉杰语属于中部印欧雅利安语,之前的工作报告它因为/h/脱落产生了新的低调,例如历史上/moːhɐn/一类的形式失去/h/后,相邻元音带上低调,与原本的中性调形成对立。

例子是/mɔ̀ːn/表示克里希纳而/mɔːn/表示沉默,声调承载单位是音节,中性调是默认的无调,只随语调变化。声学上已经有人显示这种低调存在,但母语者是否在感知中可靠区分、是否对降频的位置敏感、是否正在丢失,都还没有行为证据。

声调发生 × 声调流失: 声调发生指辅音/h/脱落后其压低基频的语音效应被重新分析为元音上的低调范畴,负责解释调从哪里来;声调流失指在与非声调强势语言接触下该范畴的感知与使用减弱,负责解释调往哪里去,二者搭配才能同时说明布拉杰语既有调又不稳定。

对于刚入门的研究生,关键是把声调发生和声调流失看成 2 个方向相反但可同时成立的过程。前者看历史音变如何留下音高痕迹,后者看当前语言接触如何磨掉这个痕迹。本文用同一批感知数据同时检验这 2 个方向,因此实验设计必须既操控音高形状,又记录被试的社会背景。后续所有方法细节都服务于这个双重目标,不能只记住低调存在这个结论。

已有路线把音高感知和声调丢失放在什么位置?

相关路线有 3 条。第一条是声调感知线索研究,强调音高高度与轮廓的作用,母语者对音高更敏感,非母语者常依赖其他策略。第二条是接触引发的声调简化,文中称为 tonoexodus,举例是藏缅语系的德奥里语在接触非声调的阿萨姆语后,声调归类准确率下降。第 3 条是印度雅利安语的声调与重音调查,西北组多被发现有声调,中部的布拉杰语则是因/h/脱落而新产生声调的特殊个案,跨语言可比的是旁遮普语和多格里语的喉擦音相关声调,以及汉语、越南语、泰语中韵尾/h/或类似成分触发低调的常见路径。

本文与前人工作的分工是明确的。声学与历史来源部分已有 Ojha 与 Mahanta 的工作建立低调与中性调的对立,本文不重复做声学测量,而是补上感知现实这一环。它既检验历史/h/脱落位置是否在感知中留下痕迹,也检验年龄与教育代表的接触是否带来感知衰退。理解这一点才能明白为什么实验一比较降频位置与历史来源的交互,实验二比较年龄模型与教育模型,而不是简单报告总体正确率。

三个待回答的问题是什么?

论文提出 3 个中心问题。第一,布拉杰语听者能否可靠区分低调与中性调范畴。第二,基于轮廓的声调子类型在感知上是否显著,也就是整元音压低、前半压低、后半压低是否带来不同效果,是否还与历史上/h/丢在词首、元音间还是韵尾有关。第三,是否存在基于感知的声调丢失或磨蚀。

把问题转成可操作的形式就是:给原来是中性调的词人为加上不同程度和不同位置的基频压低,看被试多大概率选低调含义图;再看这种概率如何随历史来源和被试背景变化。如果后半压低在韵尾和元音间来源词中更易触发低调判断,就支持感知与历史语音效应的对应。如果年轻组和高教育组系统性更少选低调,就支持接触引发的衰退。这两个判断都需要统计模型来分离刺激差异和人群差异,不能只看原始比例。

从一个词到一次判断的完整链条是什么?

先沿一个样本走完全程。取一个原本中性调的词,例如/mɔːn/的沉默义录音,用 Praat 只改元音段的基频,不改时长和音段,生成一系列压低版本。被试在 PsychoPy 界面上听到其中一个版本,同时看到两张图片,分别代表沉默和克里希纳两种含义,用鼠标选择更匹配的图片,尽量避免选不确定,刺激顺序随机,可重复播放。1 次试验产生一个二值反应,记为 1 表示选低调,0 表示选中性或不确定。全部 182 人每人做 144 次试验,构成建模的数据。

为理解刺激如何系统变化,需要先看刺激构造的全景。下段导读指出该图把 12 种刺激按整元音、前半、后半三排展示,每格标出压低量,读图时注意黄色与粉色区间与基频曲线的对应。

看图路径: 1. 先看左侧原始词与右侧三排操控的对应关系,确认每词衍生出 12 个版本;2. 再对比整元音均匀压低与仅前半、仅后半压低的黄色与粉色区间标注;3. 最后核对每格下方标注的 10 赫兹到 50 赫兹压低量与代码 L10 到 LS30

原论文 Figure 1:Types of pitch manipulations done [Example

论文图 1。原论文 Figure 1:“Types of pitch manipulations done [Example”。

该图实际显示的是以/mɔːn/为例的 12 种刺激面板。第一排是整元音均匀压低 10 赫兹到 50 赫兹,对应代码 L10 到 L50,基频曲线整体下移。第二排是仅前半压低 10 到 30 赫兹,对应 LF10 到 LF30,黄色或粉色 shading 只覆盖元音前半。第三排是仅后半压低 10 到 30 赫兹,对应 LS10 到 LS30,压低区间在元音后半。左侧另有原始版本 L00 作为 0 赫兹对照。

这种设计把压低程度和压低位置正交化,使得后续能分离听者是对任何压低都敏感,还是只对特定位置敏感。实验实现使用 PsychoPy 搭建,版本信息在原文参考文献中声明当前可用,已公开,链接本次可达。Praat 与 R、lme4 等工具同样在参考文献中给出版本与链接,复现时应按原文版本核对。

刺激、被试与反应变量各自承担什么分工?

刺激侧的分工由 3 类压低承担。整元音压低检验整体音高高度的作用,前半与后半压低检验轮廓位置的作用。压低量取 10 到 50 赫兹或 10 到 30 赫兹的梯度,是为了观察感知是否随压低加深而单调变化,而不是只设一个有无调的 2 分。历史来源侧按词首、元音间、韵尾 3 类/h/脱落位置选取 12 个原本中性调的词,并记录每个词的声调承载音节,例如有的词承载在第一音节,有的在第二音节。这使得每个刺激同时带有历史来源标签和声学操控标签,为交互分析提供条件。

基频高度 × 基频轮廓: 基频高度指某时刻基频的绝对高低,负责提供低还是高的静态线索;基频轮廓指基频随时间变化的形状,负责提供降在哪里、降多陡的动态线索,二者组合才能区分整元音均匀压低与仅前半或后半压低的不同听感。

被试侧覆盖印度 3 个邦 7 个县 24 个乡的 182 名母语者,女性 90 人,男性 23 岁以下 83 人等不同年龄与教育分层,保证社会变量有足够变化范围。反应变量把三选压缩为二值,低调记 1,其他记 0,这种压缩简化了建模,但代价是无法区分真正的中性感知与不确定,解读时不能把 0 都当成自信的中性判断。

声调承载单位 × 重音节: 声调承载单位指声调附着的音系位置,本文中为音节,负责划定调的宿主;重音节指满足重量条件的音节,负责限定目前观察到的低调只出现在重音节承载单位上,二者结合说明不是任何元音都能带低调。

组合机制在于历史标签与声学标签的交叉。如果听者只是对任何降频都报低调,那么历史来源不应调节效果。如果听者内化了/h/在韵尾时主要压低元音后半的语音知识,那么后半压低在韵尾和元音间词中应更有效,而前半压低在韵尾词中应较弱。这正是实验一要检验的交互。

本研究训练了什么,没有训练什么?

本研究没有训练神经网络,也没有更新声学模型参数,不存在梯度路径、冻结层、优化器或早停。必须明确说明的缺项是原文未报告学习率、批量、轮次等任何训练超参数,因为根本没有训练阶段。真实计算过程是规则化的信号操控加统计拟合。信号侧用 Praat 按指定赫兹数和时间区间逐个生成刺激,不涉及学习。统计侧在 R 中使用 lme4 包拟合带二项逻辑连接的广义线性混合模型,随机效应为刺激截距,固定效应为历史来源、压低类型及其交互,或年龄组、教育水平。模型比较用似然比卡方、赤池信息准则与贝叶斯信息准则,系数解释用对数几率。

宽松二选一 × 广义线性混合模型: 宽松二选一指被试在低调含义图、中性调含义图与尽量少用的不确定选项之间做选择,负责产生二值的感知反应;广义线性混合模型以二项逻辑连接拟合该反应,负责在控制刺激随机截距后估计历史来源、降频类型、年龄与教育的固定效应,二者前后衔接构成从行为到统计的链条。

复现时不应把广义线性混合模型误当成分类器训练来调参,它的目的是推断,不是部署预测。需要重放的是公式设定、基线水平与随机效应结构。实验一以词首为历史来源基线,以整元音为压低类型基线,比较简单相加模型与加入交互的模型。实验 2 分别拟合年龄组模型与教育模型,基线分别为 15 到 25 岁组与研究生组,再比较哪个模型拟合更好。所有被试匿名编号,刺激可重复播放,这些协议细节都影响反应分布,复现时应保持一致。

被试、材料与流程的实验条件是什么?

要复述方法,先核对谁、在哪、听什么、怎么做判断。下表整理被试规模与分层,比较问题是样本是否覆盖足够的年龄与教育变化以检验接触效应,公平条件是所有被试都完成同样的 144 试次随机顺序任务,指标方向在后文是低调反应概率。

条件指标样本总量女性与男性年龄分层
母语者招募人数182 人90 人与 92 人15-25 岁 83 人等 4 组
地域覆盖范围3 个邦7 个县24 个乡
教育分层人数13 到 42 人不等未受教育 13 人研究生 23 人等 6 级
试验量试次144 试次每人12 词乘 12 版本全体随机顺序
反应记录编码低调记 1其他记 0含不确定合并

上表显示样本在年龄与教育 2 维都有分布,避免只采大学生带来的偏差。代价是未受教育组仅 13 人,该组估计更不稳定,解读其高低调概率时需结合误差线。未胜出或未评测的边界是原文未报告听力筛查、设备型号与测试环境噪声,这些都会影响基频感知阈值,复现时应自行记录但不能假设与原文一致。

材料与操控条件的比较问题是压低程度与位置是否正交,公平条件是都基于同一批原本中性调词的录音。下表整理刺激构造。

条件指标原始词数操控版本总刺激数
历史来源词数12 个中性调词词首元音间韵尾 3 类每类 3 到 6 词
合成工具软件Praat 处理仅改基频144 个唯一刺激

上表的主要收益是梯度设计允许观察剂量反应关系,主要代价是前半与后半只做到 30 赫兹而整元音做到 50 赫兹,3 类最大强度不对齐,直接比较类型主效应时需注意强度范围不同。流程上采用宽松二选一,被试看两张含义图选其一,可重复播放,这减少了因 1 次没听清造成的噪声,但也可能引入重听策略差异,原文未报告平均重听次数,这是具体缺项。

历史来源与压低位置的交互支持了什么?

实验一测的是在控制刺激随机差异后,历史/h/脱落位置与压低位置是否共同决定低调判断。与谁比是简单相加模型对交互模型,条件一致体现在两者都有刺激随机截距且基线相同,指标方向是选低调的对数几率与预测概率,越大表示越倾向低调。关键数字是交互模型显著更优,卡方与信息准则都支持它,交互项中韵尾乘前半为负,元音间乘后半与韵尾乘后半为正。下表整理模型比较与关键交互。

条件指标简单模型交互模型交互项估计
模型拟合赤池信息准则35529.135417.4交互模型更低更优
模型拟合贝叶斯信息准则35578.135499.1交互模型更低更优
似然比检验卡方与显著性基线对照119.65 显著自由度为 4
韵尾乘前半对数几率系数无交互项负向显著-0.371 显著
后半交互对数几率系数无交互项正向显著0.416 与 0.601 显著

为理解交叉形态,先看未加交互时的整体效应。该图按历史来源与压低类型分别展示低调概率,读图时注意 3 组历史来源差异不大而后半压低略高的形态,但不能据此得出结论,因为真正的效应藏在交互中。

看图路径: 1. 先按横轴找到词首、元音间、韵尾三组/h/脱落位置;2. 再在每组内对比红色整元音、绿色前半、蓝色后半三根柱子的高低;3. 最后观察韵尾组蓝色柱子明显最高而绿色柱子最低的交叉形态

原论文 Figure 3:Effects (in Interaction) of the Categories ‘Pitch-Lowering Type’ and ‘Location of /h/-Deletion’

论文图 3。原论文 Figure 3:“Effects (in Interaction) of the Categories ‘Pitch-Lowering Type’ and ‘Location of /h/-Deletion’”。

该图实际显示的是交互模型下的预测概率。横轴 3 组中,词首组的三根柱子高度接近,说明压低位置对词首来源词影响小。元音间组中蓝色后半柱子高于红色整元音,韵尾组中蓝色后半柱子最高而绿色前半柱子最低。这种交叉支持的判断是感知分类不只看压低量,还与词的历史音系挂钩,听者对元音偏移处的压低最敏感,这与韵尾/h/压低后半的语音效应一致。限制是原文报告的是模型预测概率而非原始正确率,且未给出区分度或阈值曲线,不能直接换算成可部署的识别准确率。

年龄组 × 受教育程度: 年龄组按 15-25、26-35、36-45、46-55 划分,负责捕捉代际差异;受教育程度按未受教育到研究生划分,在本文地区主要以标准印地乌尔都语和英语授课,负责作为与非声调强势语言接触强度的代理变量,二者对比才能判断感知衰退主要是年龄效应还是接触效应。

年龄与教育的初步对比显示年长组低调概率略高,但教育模型的拟合更好,具体数字见后文实验二。下图先展示年龄效应。

看图路径: 1. 先确认横轴四个年龄组从 15-25 到 46-55 的顺序;2. 再比较纵轴低调反应预测概率在 15-25 组最低、中年组较高的形态

原论文 Figure 4:Probability of Participants perceiving ‘Low’

论文图 4。原论文 Figure 4:“Probability of Participants perceiving ‘Low’”。

该图实际显示 4 个年龄组的低调反应预测概率。15 到 25 岁组柱子最低,26 到 35 与 36 到 45 组较高,46 到 55 组回落但仍高于最年轻组,误差线显示组间有重叠。这支持年龄有影响但非单调递增,不能把总体趋势推广为每大一岁就更高。真正的强预测来自教育,留待下一节展开。

去掉年龄或教育中的一个,哪个更能解释感知衰退?

实验二的比较问题是年龄模型与教育模型谁更好地解释低调感知的个体差异,公平条件是两者都有刺激随机截距、同一批反应数据、各自以一个社会变量为固定效应,指标方向仍是低调概率与信息准则越低越好。关键数字是教育模型显著优于年龄模型,且未受教育组显著高于研究生基线,其他教育水平与基线差异不大。下表整理这组对照。

条件指标年龄模型教育模型关键组估计
模型拟合赤池信息准则35504.235413.7教育模型更低
模型拟合贝叶斯信息准则35545.135470.9教育模型更低
似然比检验卡方与显著性基线对照94.508 显著自由度为 2
未受教育对比研究生对数几率系数不含该项0.5828 显著低调概率更高
其余教育水平对数几率系数不含该项接近 0 不显著与研究生无差异

上表的主要收益是教育作为接触代理变量胜出,主要代价是不能据此断言因果。教育程度高的人同时更年轻、更多接触标准印地乌尔都语和英语、可能更多离开本地方言环境,这些混杂都未被分离。未胜出项是年龄模型,它同样显示年长组更高,但拟合不如教育模型。负结果是小学到本科各组之间几乎无差异,说明衰退不是随每多一年 schooling 线性下降,而是集中体现在未受教育与其他组之间。未评测边界是生产侧是否同步丢失,本文只有感知数据。

为直观确认孤立高点,先看教育效应图。该图横轴为 6 个教育水平,纵轴为低调预测概率,读图时注意未受教育柱子的跳高与其余柱子的齐平。

看图路径: 1. 先确认横轴从研究生到本科共六个教育水平;2. 再对比未受教育组柱子明显高于其余五组的孤立形态;3. 最后观察其余五组之间差异很小且误差线重叠的形态

原论文 Figure 5:Probability of Participants perceiving ‘Low’

论文图 5。原论文 Figure 5:“Probability of Participants perceiving ‘Low’”。

该图实际显示未受教育组柱子接近 0.6,明显高于其余 5 组约 0.45 的水平,误差线不重叠,而其余 5 组之间误差线大幅重叠。这支持的判断是感知敏感性随正规教育增加而降低,可能反映对非声调强势语言的主导与暴露。限制是未受教育样本仅 13 人,且教育与年龄、流动性相关,原文将其作为接触的代理是有限解释,应表述为支持而非证明因果。

哪些结论还只是有限解释?

论文直接报告的是交互显著、教育模型更优、未受教育组更高的行为模式,这些有统计量支撑。有限解释的是把教育等同于与标准印地乌尔都语和英语的接触强度,原文明确说教育是代理变量,但并未测量每个被试的双语使用时长、学校授课语言比例或媒体暴露,因此只能说支持接触引发的声调流失,不能说已证明因果。同样,历史来源的感知对应支持声调发生路径,但并未直接测量历史/h/的语音细节,只是用现代词的历史分类做分组,中间的语音链条是引用前人声学工作与跨语言常识补上的。

未验证推测包括生产是否也在丢失、其他声学线索如时长或音质是否参与、不同方言点之间是否一致。原文被试来自多个县乡,但模型未加入地区随机效应或固定效应,地域变异未被评估。反应编码把不确定并入其他,误判率、反应时、重听次数、设备与环境噪声都未报告,因此不能承诺该范式下的延迟或成本得到改善。训练资源与推理开销不适用,因为无神经训练,但统计计算的硬件与耗时也未报告,复现时只需常规笔记本运行 R 即可,不应夸大算力需求。

要重放这套实验,先做什么?

复现先做材料闭环。按原文表 1 选 12 个原本中性调的词,覆盖词首、元音间、韵尾 3 类/h/脱落背景,并记录每个词的声调承载音节。用 Praat 对每个词生成原始加 11 个操控版本,整元音 10 到 50 赫兹梯度,前半与后半各 10 到 30 赫兹梯度,共 144 个刺激,只改元音段基频。准备每对词的低调与中性调含义图片,确保图片本身不引入额外偏好。用 PsychoPy 搭建 144 试次流程,随机顺序,允许重复播放,记录鼠标选择的含义并按低调为 1 其他为 0 编码,尽量少用不确定选项。

再做统计闭环。在 R 中用 lme4 拟合二项逻辑混合模型,实验一设定历史来源与压低类型及其交互加刺激随机截距,基线为词首与整元音,比较交互模型与简单模型的信息准则与似然比。实验 2 分别拟合年龄组模型与教育模型,基线为 15 到 25 岁与研究生,再比较两者。核对的关键超参数其实是分组定义与基线选择,改基线会改变系数符号解读但不改变交互形态。信息条件是必须保留历史来源标签,否则无法检验轮廓子类型。

代码与权重方面,本文不涉及模型权重下载,PsychoPy、Praat、R 与 lme4 的版本与链接在参考文献中给出,其中 PsychoPy 链接本次确认可达,其余链接按原文引用使用。还需补的验证是扩大未受教育样本、记录双语暴露问卷、加入地区效应与反应时,以及同步采集生产数据以检验感知与生产是否一致。

何时值得借用这套做法?

当研究对象是新兴的、可能不稳定的音系对立,且怀疑历史音变痕迹仍留在感知中,或怀疑接触正在磨掉它时,这套做法值得尝试。它的价值在于用同一批行为数据同时回答来源与流失两个问题,而不是分 2 次采样。适用条件是能找到原本中性、可系统操控的载体词,能按历史来源分组,能招募到教育与年龄有足够变异的母语者,并能用图片或语境清晰呈现最小对立的含义。

常见误解是把后半压低更有效误读为低调就是降调。本文的低调是相对于中性调的整体偏低,轮廓效应只说明听者对后半更敏感,不等于调位本身是降调。另一个误解是把教育效应误读为越读书耳朵越差,实际含义是在以非声调语言授课的环境中,声调范畴的使用与敏感性可能退化,这是社会语言学压力,不是听力损伤。第 3 个误解是把模型拟合优劣误读为可部署的识别提升,本文没有可部署的识别器,只有推断模型,报告的是概率与对数几率,不是系统准确率。记住这三点,才能在复述时既讲清证据强度,又不越过证据谈因果与应用。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 11 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总