英文题目:Voice Onset Time Categorical Perception in Mandarin-Speaking People Who Stutter: A Zoom-In Nonword Study

会议身份:conference:interspeech:2026:conference-paper-id:kiyama26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #言语障碍 #言语感知 #语音 #音频分类

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Yusuke Kiyama:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究考察普通话口吃者能否将连续嗓音起始时间映射为送气与不送气音位范畴,输入为合成软腭塞音非词连续体,输出为辨认标签、区分判断与反应时,难点在于无词汇线索时边界附近细微差异易被掩盖。方法链分三步:先以20名不参试母语者做预实验经probit分析定位约3.69步边界并换算到31级量尺z=9.07,其输出决定刺激截取范围;再截取其周围z5至z14共10个token构成放大镜式刺激集以提高边界灵敏度;最后对22名口吃者与18名流畅对照施测字母决策基线、辨认与区分任务并以边界对齐混合效应模型分析范畴内外反应时与敏感性d’。与既有真词粗步长研究不同,该设计在无外部噪声下同时隔离词汇影响并加密边界采样,因而更易暴露细微映射差异。在辨认任务条件下,PWS组的边界位置指标为8.64,高于PWNS组的边界位置指标7.43。辨认反应时仅对照组呈现跨范畴慢于范畴内的典型不对称而口吃组不显著,严重度越高区分范畴内反应越快而逆效能分数未下降。结论仅适用于北方官话区成人软腭非词安静听音条件,未验证齿龈与双唇、噪声、语调元音及神经机制外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的听辨问题从哪里来?

这篇解读的输入是原论文正文证据与 4 张官方原图像素,目标是让刚进入语音与口吃领域的研究生能核对方法并复述流程,必须保留的信息包括被试构成、刺激构造、任务流程、统计口径与关键数字,输出是 1 篇按学习依赖展开的中文技术解读。

口吃通常被看作动作执行问题,表现为不自主的重复、拖长和阻塞。但论文的起点是产出与感知共享神经机制:如果产出系统本身不稳定,感知系统是否也会表现出非典型性。白话说,发音时大脑要预测自己会听到什么,听音时也要调用发音知识做对照,因此感知不只是耳朵的事。英文名上,嗓音起始时间是 voice onset time,缩写为 VOT,指从塞音爆破到声带开始振动的时间间隔;范畴感知是 categorical perception,缩写为 CP,指把连续声学信号压缩为离散音位类别的能力。普通话里送气与不送气的区别高度依赖 VOT,而口吃者在流畅 speech 中也被多次报告 VOT 产出异常,因此 VOT 是检验听觉运动整合是否异常的理想探针。

嗓音起始时间 × 范畴感知: 嗓音起始时间负责提供从爆破到声带振动的时间长度这一连续声学线索,范畴感知负责把这条连续线索映射为不送气与送气等离散音位判断,二者搭配的理由是只有把连续时间量压缩为类别才能稳定听辨,组合后新增的作用是可以用边界位置、边界宽度和跨边界反应时模式来量化听者是否建立了稳定映射。

需要先建立的学习依赖是:不送气与送气不是两个固定声音点,而是一条连续体上的两个区域。实验者通过拉长或缩短送气段制造从 /ko/ 到 /kho/ 的渐变刺激,再看被试在何处翻转判断、翻转有多陡、边界附近是否变慢。只有理解这条连续体,才能理解后文为什么要做放大设计,为什么边界位置右移意味着需要更长的 VOT 才听成送气。

前人用同样范式看到了什么,为何还不能下结论?

论文梳理的路线集中在 VOT 的 CP 范式。德语研究发现口吃组识别斜率更平且边界向长 VOT 方向移动;粤语研究只发现反应时延长或加工速度变慢趋势,感知敏锐度无显著差异;加入反向掩蔽提高难度后出现口吃组范畴感知受损;普通话研究在安静条件下也报告困难。

英语研究发现 VOT 识别斜率显著更平。也就是说,方向不一致,且任务难度、噪声条件和语言都不统一。

作者指出 3 个缺口。第一,除一项德语研究外,以往多用真词刺激,词义可能带来自上而下的词汇促进,把词汇通达弱误读为感知弱。第二,多用全连续体 7 到 9 步的粗步长,若不加噪声,敏感性可能不足以捕捉细微组差;若加噪声,又混入低层听觉与高层音系的混淆。第三,提高难度但未做辨别任务的研究,无法给出完整的范畴感知画像。因此本研究的选择是:用非词切断词汇影响,用放大设计在无外部噪声下提高敏感性,同时做识别加辨别,并换到以往少用的软腭音来检验跨发音部位的泛化。

本研究到底要回答哪两个具体问题?

论文把问题收敛为两个可操作的检验。第一个问题是:在去掉词汇影响并把刺激集中在边界附近后,普通话口吃者与非口吃者在范畴感知上是否仍有差异。第二个问题是:口吃严重程度与感知指标之间是否存在关系,以澄清听觉处理异常与临床表现如何关联。

举例说明:假如只问准确率有没有差异,可能两组都接近天花板;但若同时问边界在哪里、边界附近是否变慢、严重者是否更快,就能区分是建类能力不行,还是建类后取用不高效。论文的结论倾向后者,因此问题设计本身就包含对过程的分解,而不是只给一个总分。

方法全景:一个样本如何走完刺激到指标?

先沿一个样本走完全程。输入是一个合成的 /ko55/ 到 /kho55/ 连续体中的一个 token,例如靠近边界的 z9。表示是该 token 的声学形态:爆破加可变送气段加元音 /o/,总时长与强度已归一。组件包括识别组件与辨别组件:识别组件要求听一个音后按拼音 go 与 ko 做二选一,辨别组件要求听两个先后呈现的音后判断相同还是不同。目标是得到每个人的边界位置、边界宽度、类间与类内反应时,以及辨别敏感度 d 素。输出是组间比较与组内严重度关联。

非词刺激 × 放大设计: 非词刺激负责切断词义自上而下的帮助,只留下纯音位层面的听辨,放大设计负责把刺激集中摆在母语者边界附近以提高对细微差异的敏感性,二者搭配的理由是以往用真词加粗步长容易把词汇优势误读为感知优势,组合后可以在不安静噪声的条件下检验细微的群体差异。

具体构造分两步。预实验用 20 名未参加主实验的普通话母语者做识别与辨别,经概率单位分析得到边界在原始 11 步量表上的 3.69 步。经线性变换对应到 31 步量表上的约 9.07,再以该点为中心取出 z5 到 z14 共 10 个刺激作为主实验 token。这种做法的安排理由在原文写得很明确:先标定母语者边界,再把火力集中在边界附近,从而在不安静噪声的条件下最大化任务敏感性。

刺激、任务与分组:三个组件各自负责什么?

刺激组件负责保证听到的差异只是 VOT。源音节 /kho55/ 由 1 名男性普通话母语者录制,用 Praat 归一化为 500 毫秒时长与 60 分贝强度,再切分为爆破 4 毫秒、送气 90 毫秒与元音 /o/ 406 毫秒。送气段以等步从 0 到 80 毫秒变化,先做出 11 步连续体用于预实验,主实验按同样流程合成 31 步连续体并取出中间 10 步。两个端点在普通话里都是非词,这是为了隔离纯音位感知。

任务组件负责分离运动速度、标签映射与听觉比较。字母判断任务要求看到 X 或 O 后尽快按键,用于排除基本运动速度差异;识别任务每个刺激呈现 8 次共 80 试次,5 秒内回答听到的是哪个音;辨别任务用 AX 范式,按步长差 6、5、4 步构造低中高 3 种难度,共 40 对重复 3 次得到 120 试次,任务顺序在被试间平衡。

被试组件负责保证可比性。22 名口吃者与 18 名非口吃者均为北方官话区长大的普通话母语者,听力阈值正常,年龄、受教育年数与利手匹配,排除神经精神疾病、阅读障碍与语言学心理学背景。口吃严重度用 SSI-4,以朗读与会话样本中的口吃音节百分比表示,约三分之一样本由言语病理方向研究生独立评分,组内相关系数为 0.833。

识别任务 × 辨别任务: 识别任务负责让被试对单个刺激做贴标签判断,直接反映类别边界在哪里,辨别任务负责让被试判断两个声音是否相同,反映能否利用类别或纯声学差异做比较,二者搭配的理由是单一任务无法区分标签映射问题与听觉敏感性问题,组合后可以判断异常出在建类还是出在听辨敏感性。

边界位置 × 边界宽度: 边界位置负责标示 50% 交叉点即听感翻转的中点,边界宽度负责标示 25% 到 75% 交叉点之间的距离即翻转有多陡峭,二者搭配的理由是位置移动与陡峭程度是两种独立的异常,组合后可以区分是决策标准右移还是范畴本身变模糊。

本研究有没有训练模型?真实计算过程是什么?

本研究没有训练神经网络模型,也没有冻结或更新任何模型参数,不存在梯度路径、优化器步骤或权重重置问题。该节的真实计算是心理物理曲线的拟合与混合效应建模,必须如实交代。

识别数据对每名被试做概率单位分析,得到 50% 交叉点作为边界位置,25% 与 75% 交叉点距离作为边界宽度。若边界落在刺激范围 z5 到 z14 之外,或宽度异常小于等于 0 或大于 20,则剔除该被试。按此标准剔除 4 名口吃者,但剔除率组间无差异,Fisher 精确检验 p 值为 0.133,最终每组保留 18 人进入分析。边界位置与宽度偏离正态,故组间比较用 Mann-Whitney U 检验。

反应时先去掉小于 50 毫秒或超出个人均值正负 3 个标准差的试次,再做对数变换。每个试次按个人边界划为类间或类内:识别中紧邻边界的两个刺激为类间,其余为类内;辨别中跨越边界的刺激对为类间,其余为类内。对数反应时与 d 素作为因变量,用线性混合效应模型检验组别、类别与步长固定效应,被试为随机截距,显著交互后做 Tukey 校正的事后比较。口吃组内再用混合效应模型探索严重度与各指标的关系,作者明确标注样本有限,组内分析视为探索性。

实验条件:数据划分、指标方向与统计口径是否一致?

数据层面没有训练集与测试集划分,所有比较都在同一批主实验试次上进行。聚合对象是被试:先对每人拟合边界与计算 d 素,再做组间比较;反应时则保留试次水平,用混合模型同时处理被试随机效应。指标方向需要分清:边界位置越大表示需要更长 VOT 才听成送气;边界宽度越大表示翻转越平缓、范畴性越弱。

d 素越大表示辨别敏感性越高;反应时越长表示加工代价越大,但好坏要结合条件判断,边界处变慢在典型范畴感知中反而是正常现象。

公平条件方面,字母任务确认基本运动速度可比,识别与辨别任务顺序平衡,反应时离群值处理与对数变换对两组一致,类间与类内划分依据个人边界而非固定切点,避免用同一物理分界硬套所有人。辨别中若某步长下只有类间单元,则该步长不进入类别水平分析,这是为了避免空单元比较。缺项也要指出:原文未报告听力之外的认知筛查分数,未报告设备型号与声压校准细节,未报告试次剔除比例,这些在复现时需要自行记录但不能脑补为与原文一致。

主结果一:边界是否右移,识别曲线长什么样?

要回答的核心比较问题是:在词汇影响被排除且刺激集中在边界附近时,两组建类的位置与陡峭程度是否一致。公平条件是两组刺激完全相同、拟合方法相同、剔除标准相同,指标方向是边界位置越大越偏向送气端,宽度越大范畴性越弱。

下图先给出两组平均识别曲线,实测比例与拟合曲线并置,可以直观核对边界与非单调点。

看图路径: 1. 先看横轴刺激步从 z5 到 z14,纵轴为判断为/ko/的比例;2. 再对比两组实测折线在 z7 附近的非单调凹陷位置;3. 最后对比深色拟合曲线整体右移与斜率是否明显变平

原论文 Figure 1:Identification curves for PWS and PWNS groups.

论文图 2。原论文 Figure 1:“Identification curves for PWS and PWNS groups. The dark lines with markers represent the observed proportions, while the lighter lines indicate the probit-fitted curves.”。

从像素可见,两条实测折线都从左侧高比例向右侧低比例下降,但在中间第 3 个点附近同时出现明显下凹,原文明示两组在 z8 附近的非单调性,说明放大设计确实让两组都感到困难。拟合的浅色曲线整体呈 S 形,口吃组曲线略偏右。解释时不能把某一点的抖动直接读作组差,关键要看拟合中点与斜率:原文报告口吃组边界均值更高但未达显著,宽度也无显著差异,因此不能说范畴能力受损,只能说存在位置右移趋势。

下表把人口与边界数字放在一起,便于 1 次核对样本量、均值离散度与检验结果,表中单位与精度保留原文写法。

条件指标口吃组非口吃组组间比较
被试规模人数与年龄均值22 人,25.5 岁18 人,26.9 岁年龄等匹配 ps 大于 .05

表后需要解释主要判断与限制。口吃组需要更长 VOT 才报告送气,效应量中等但 p 值为 0.060,属于趋势水平,不能写成显著右移。边界宽度无差异意味着翻转陡峭程度相当,这是支持范畴能力本身未受损的关键反证。同时要说明一个未胜出项:作者预期放大设计会拉开组差,但软腭音本身 VOT 更长且容忍窗更宽,两组都被推向相近的难度水平,反而压平了宽度差异。

主结果二:边界位置分布是否支持右移趋势?

第二个要核对的问题是:平均数右移是否由少数极端值驱动。公平条件是每组各 18 个有效边界,指标方向同样是数值越大越靠送气端。下图展示边界位置的分布形态,可用于判断离散程度。

看图路径: 1. 先看纵轴为边界位置,左右两片分别为对照组与口吃组;2. 再比较白色箱体中位线的高低与箱体宽度;3. 最后观察口吃组上方离散点与下方长尾的分布不对称

原论文 Figure 2:Category boundary positions by group.

论文图 3。原论文 Figure 2:“Category boundary positions by group.”。

从像素可见,对照组小提琴集中在 7 到 9 之间,箱体较宽但无远端离群点;口吃组主体同样集中在 8 附近,但上方拖出细长尾部并有多个离散圆点,下方也有一个低端离群点。解释是:均值偏高部分来自上方少数高边界个体,中位数差异小于均值差异,这与趋势水平而非显著差异的统计结论一致。不能把上方离群点删除后重算来制造显著性,原文保留了它们,复现时也应保留并报告稳健性检验。

类间反应时 × 类内反应时: 类间反应时负责反映处理边界附近模糊刺激所需的时间代价,类内反应时负责反映处理类别内部清晰刺激的速度,二者搭配的理由是典型范畴感知会在边界处变慢形成不对称,组合后新增的作用是用不对称是否消失来判断被试是否在实时调用音位类别。

结合后文反应时看,位置趋势与取用异常是两个层次:前者是标签分界在哪里,后者是调用类别时是否付出典型代价。即使边界位置差异不显著,取用模式仍可能 atypical,这正是本研究把反应时不对称作为独立证据的原因。

反证与对照:反应时不对称与辨别敏感性说明什么?

这里的对照问题是:如果范畴映射真的 atypical,反应时模式应与辨别敏感性分离。公平条件是反应时都经对数变换,类别划分都基于个人边界,辨别敏感性用考虑反应偏向的 d 素。指标方向是类间慢于类内为典型不对称,d 素越高敏感性越好。

下图展示识别任务中组别与类别的交互,是全文最关键的过程性证据。

看图路径: 1. 先确认横轴为类间与类内条件,纵轴为识别反应时秒数;2. 再比较对照组两把小提琴上端拖尾与中位线的差异;3. 最后看口吃组左右两把形状是否几乎对称

原论文 Figure 3:Identification RT by group and category condition.

论文图 1。原论文 Figure 3:“Identification RT by group and category condition.”。

从像素可见,对照组左侧类间小提琴上端拖尾明显高于右侧类内,中位线也更高;口吃组左右两把形状几乎对称,中位线高度接近。原文混合模型给出显著的组别与类别交互,事后比较仅对照组类间显著慢于类内,口吃组差异不显著。这支持作者的判断:非口吃者表现出边界附近变慢的典型模式,口吃组这种加工代价减弱,提示实时取用音位类别效率不高或不稳定。

下表汇总运动基线、辨别与严重度交互的数字,避免把不同指标混为一谈。

条件指标口吃组表现非口吃组或参照统计结果
字母基线反应时与对照相当对照组t 38 为 0.12,p .903,d 0.04,无差异
字母基线准确率低于对照对照更高W 287.5,p .013,r 0.40,显著
识别反应时组别乘类别交互不对称减弱对照类间慢于类内卡方 1 为 8.37,p .004,显著
辨别敏感性d 素组效应无组差无组差卡方 1 为 0.33,p .565,无显著
辨别反应时严重度乘类别交互类内越重越快类间与严重度无关卡方 1 为 6.70,p .010,显著

表后解释收益与代价。收益是分离成功:字母准确率低指向一般的抑制控制脆弱,但 d 素不受反应偏向影响且组间等价,说明纯音位辨别能力未受损;识别反应时交互则暴露映射取用异常。代价与反例是辨别反应时未复制识别中的组差,作者的解释是辨别可仅靠声学比较完成,不必调用类别,因此映射问题在该层面不显现。未胜出项必须保留:辨别准确率与反应时主效应及交互均不显著,不能用严重度相关来反推整体组差。

严重度越高反而越快:如何排除速度准确率权衡?

需要检验的问题是:口吃越重在类内刺激上反应越快,是否以牺牲准确率为代价。公平条件是同一批辨别试次同时看速度与准确率,并用逆效率分数综合两者。指标方向是逆效率越低效率越高,若严重度只预测速度而不预测逆效率,则更快不是草率作答。 下图展示严重度与辨别反应时的关系,是理解代偿解释的关键。

看图路径: 1. 先看横轴为口吃严重度百分比,纵轴为辨别反应时秒数;2. 再区分实心点虚线为类间与空心点实线为类内;3. 最后观察右侧高严重度两点如何拉动类内拟合线下行

原论文 Figure 4:Relationship between stuttering severity (%SS) and within-category RT in the PWS group.

论文图 4。原论文 Figure 4:“Relationship between stuttering severity (%SS) and within-category RT in the PWS group.”。

从像素可见,横轴严重度从 0 延伸到 20 以上,纵轴为辨别反应时秒数;虚线类间拟合几乎水平,实线类内拟合随严重度上升而下行,但左侧低严重度区散点非常分散,右侧高严重度主要靠两三个点拉动斜率。原文报告严重度与类别交互显著,类间与严重度无关,类内严重越高越快;进一步检验发现严重度不能预测类别水平的逆效率分数,交互也不显著,因此作者判断更快的同时保持了相当的准确率。解释时必须用可能与待验证的措辞:这支持右半球声学补偿的推测,但本研究没有神经成像,不能把行为相关直接写成神经因果,且组内分析样本小并被作者明确标为探索性。

局限还要包括:剔除 4 名口吃者后每组 18 人,统计功效有限;仅用软腭音与 VOT 一种线索,未测元音与声调;仅为行为实验,无脑电等生理证据;字母任务准确率组差提示执行功能混淆,虽用 d 素做了辩护,但不能完全排除注意与抑制的影响。

复现先做什么:刺激、流程与分析的最小清单是什么?

复现应先做刺激标定。录制男性普通话母语者的 /kho55/,用 Praat 归一化为 500 毫秒与 60 分贝,切分为爆破、送气与元音 3 段后等步生成连续体;先用独立的 20 人预实验拟合边界,再按线性关系换算到更密的量表并取出边界两侧各 5 步。必须保留非词属性与软腭音部位,若换成真词或唇音齿音,结论不再直接可比。

流程上按字母基线、识别 80 试次、辨别 120 试次的量级执行,识别每个 token 重复 8 次随机呈现,辨别按步长差 4、5、6 构造 3 种难度并含相同对与逆序对,任务顺序平衡。记录 5 秒反应窗、离群值剔除阈值与对数变换步骤,类别划分必须用个人边界而非固定切点。

分析上先复现概率单位拟合得到位置与宽度,再用非参检验做组间比较,最后用混合模型检验反应时交互与严重度交互。资源状态方面,未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,本次解读未确认任何可下载链接,复现需自行实现刺激合成与分析脚本。

何时值得尝试这种放大范式,还需补哪项验证?

当研究问题是细微的边界移动而非整体听力损伤,且不希望用噪声混入低层听觉混淆时,这种先标定再放大的做法值得尝试。它的适用条件是目标语言的边界先验相对稳定,且所选音段的容忍窗不会宽到压平所有差异;软腭音在本研究中恰好处于后一种边缘情形,这是复现时需要预判的代价。

论文直接报告的是:边界右移趋势、识别反应时交互显著、辨别 d 素无组差、严重度与类内反应时负相关且逆效率不支持权衡解释。有限解释是左颞上回类别编码不稳与运动噪声污染预测模型,以及右半球声学补偿。未验证的推测是具体的神经通路因果,需要脑电或磁脑电补充 P200、神经同步等指标,并扩大样本与音段范围。

对初学者的特有误解要澄清三点。第一,p 值为 0.060 不是显著,不能写成口吃者边界显著右移。第二,字母任务准确率低不等于听辨能力差,d 素等价才是听辨能力的直接证据。第三,严重者更快不等于病情越重听得越好,它只出现在类内声学比较层面,而识别斜率所反映的类别锐利度可能恰好相反,二者是不同加工层次。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总