英文题目:Tone Production in a Toisanese Speaker with Dysarthria

会议身份:conference:speechprosody:2026:conference-paper-id:chen26c_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#主观评测 #语音 #语音可懂度评估 #病理语音评估

评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Stanley Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Nancy Eng:机构信息未能从会议 PDF 纯文本可靠映射
  • Stella Yank:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

台山话声调产出研究输入为构音障碍者复述的目标单音节词,输出为5个声调类别的感知归属与声学实现,难点在于呼吸与喉部控制受损会同时扭曲音高高度、曲拱与嗓音品质。方法链由4步构成:先构建4组同音节异调词并用载体句加图片诱发复述,其输出的60段录音进入5名母语者图片指认以得到可懂度矩阵;同步用PRAAT提取目标词基频(fundamental frequency, F0)起点与终点及音节时长;最后以配对t检验对比患者与对照并按高、中、低三档归并检验高度完整性。与普通话和粤语既有结论的关键机制差异是患者并未呈现水平化为平调,而是全调位塌陷为跌落型且高、中、低起点均挤在一起。在5名评判者对60个产出的感知设置下,总体准确率为36.1%,其中高平调T1仅被正确识别6%,而低平调T3达到53%。结论仅适用于该重度嗓音杂质个案的台山话产出,无法外推至其他严重度、类型或方言,也未能分离构音误差与音高控制失效。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要回答什么?

本文输入是 1 位 44 岁台山话男性痉挛型构音障碍者 MM 的声调产出录音,以及 1 位健康台山话对照者的对应录音,输出是对 5 个台山话声调是否受损、如何受损的判断。研究目标不是做自动声调识别,而是为临床理解构音障碍如何破坏以基频轮廓区别词义的能力,建立可复述的知觉加声学评估流程。

必须保留的关键信息是任务为单字重复后的母语听辨与基频时长对比,证据是总体正确率 36.1%,高调 T1 最低而低调 T3 相对最好,声学上被试各调均呈下降轮廓且高度区分压缩。最终输出是 1 篇面向新生的中文解读,按学习依赖从任务背景讲到方法、条件、结果与复现要点,不引入原文之外的数值或疗效承诺。

已有研究在普通话和粤语中发现了什么分歧?

在进入台山话之前,需要先理解普通话与粤语研究为何结论不一致。白话解释是,声调语言用音高高低与升降区分词义,构音障碍是神经源性运动性言语障碍,会影响发声的速度、力量、准确性、稳定性与运动范围,进而波及音高、响度、语速与元辅音。已有对照路线是粤语痉挛型构音障碍研究与普通话卒中后构音障碍研究。前者报告高度变化对正确率影响不大,曲拱变化影响大,并提出平调化,即把升调或降调发成平调,归因于动态喉部控制的简化。

后者则报告动态调多被正确识别或与另一动态调混淆,反而是平调可被听成动态调。两条路线输入相似但方言声调库存与实现不同,监督都来自母语听者判断,运行阶段都是病后产出评估,因此分歧支持按方言分别建立声调剖面,而不是把某一类平调化直接套用到台山话。

为什么选台山话个案,问题如何界定?

台山话是研究较少的汉语方言,但曾是北美唐人街的主要方言,对许多移民家庭是与祖辈沟通的家庭语言,目前面临传承压力。临床问题界定为两问,第一,构音障碍者的台山话声调产出是否受损,若受损表现在高度还是曲拱;第二,声学特征是否能被人耳感知到。对象 MM 经正式与非正式评估符合痉挛型构音障碍,表现为肌张力高、紧张绞窄性嗓音、呼吸支持减少导致的气息声与嘶哑、单响度、语速慢、交替运动慢、辅音不准不一致以及音调受影响。

语言与认知方面,由有成人神经源性障碍专长的言语语言病理学家用台山话非正式评估,判断无明显接受性或表达性语言损伤,无认知缺损,听力满足任务要求,1000、2000、4000 赫兹纯音平均在 25 分贝听力级或以下,500 赫兹双耳阈值为 40 分贝听力级。对照者为 1 名健康台山话说话者。

从刺激到判断的全流程是怎样的?

先沿一个样本走完全程有助于建立全局观。以目标词 lam 加 T1 拥抱为例,研究者用载体句 This is 加图片呈现目标,MM 跟读复述,每组同音节五声调随机呈现,每套录三遍,4 组共 60 个产出。只分析目标词本身,不分析载体句。随后 5 位 49 至 65 岁、无听力损失、无构音障碍接触史的台山话母语者逐词听辨,每次看到同一音节的 5 张图片并指向听到的词。最后比较听辨正确率与声学测量,一是判断声调完整性,二是看声学差异是否可被人耳察觉。

声学侧用软件提取音节时长与起音落音基频,时长定义为从声母起始到韵尾结束,单位为毫秒,基频分析看起落差以判断曲拱,再看起音的极值范围与均值以判断高度分组是否完整。高度分组按已有描写合并,中调 T2 与 T4 合并,低调 T3 与 T5 合并,与高调 T1 形成高、中、低 3 组。这一走通意味着后续所有声调都复用同一链条:同音节五词随机排序呈现、载体句加图片消歧义、三遍录制取全量、听辨与声学双路对照,从而把高度压缩与轮廓下降的判断落到可重复的操作上。

高度与曲拱如何分工,又如何组合判断?

理解本文需要先分清两个术语。白话说,声调高低是你开口瞬间音高站在哪一层,声调曲拱是你说完这个字音高走了平路还是下坡。英文为 tone height 与 tone contour,后文简称高度与曲拱。高度分工是区分 T1 高、T2 与 T4 中、T3 与 T5 低,曲拱分工是区分平调 T1 至 T3 与降调 T4 至 T5。搭配理由是台山话词义同时依赖两者,单独看正确率无法定位 breakdown。组合意义是把错误分为层内错误、曲拱错与混合错,例如 T5 到 T3 高度不变但曲拱变,T4 到 T3 则高度与曲拱都变。

声调高低 × 声调曲拱: 声调高低指起音基频落在高、中、低哪一段,负责区分 T1 与 T2/T4 与 T3/T5;声调曲拱指基频从起音到落音是保持平还是下降,负责区分平调与降调。二者搭配的理由是台山话同时用高度和曲拱区别词义,组合意义在于把听辨错误拆成高度错、曲拱错与混合错,才能判断是喉部动态控制简化还是整体音高上不去。

落实到操作,高度用 3 组起音均值与范围检验是否拉开,曲拱用每调起音减落音的差值检验是否为零附近或明显为正,统计上用配对 t 检验比较被试与对照在基频与时长上是否有显著差异。

听辨与声学各自测量什么,为何必须配对?

另一组关键搭配是知觉听辨与声学测量。白话说,听辨是让人投票听成了哪个词,声学是让仪器量音高与时长。英文为 perceptual judgment 与 acoustic measurement。听辨分工是反映交际有效性,操作是 5 位评定者对每调 60 人次判断汇总为百分比,例如某调 12 个产出乘 5 位评定者共 60 人次,若 40 人次判为 T2 则记 66.7%。声学分工是提供可复核的物理量,操作是提取起音落音基频与时长并做配对 t 检验。

搭配理由是嗓音嘶哑、紧张与辅音不准会同时污染听辨,而仪器能捕捉人耳不敏感的细小滑动。组合意义是当两者不一致时不强行统一,而是分别报告,例如仪器显示全降而听辨多判为平,这本身就是喉部控制与感知交互的证据。

知觉听辨 × 声学测量: 知觉听辨由母语者指认听到的词,分工是反映真实交际可懂度,但会受嗓音嘶哑和辅音含混干扰;声学测量用软件提取起音落音基频与音节时长,分工是给出可量化的高度与曲拱证据。二者搭配是因为人耳听不到的细小基频滑动仪器能测到,而仪器测到的高值人耳可能因音质差而误判,组合才能形成完整的声调剖面。

起音基频 × 落音基频: 起音基频是目标词开始处的基频均值,负责标定声调高度分组;落音基频是目标词结束处的基频均值,负责与起音相减判断曲拱是平还是降。二者搭配的理由是单看均值无法区分高平与高降,组合成起落差才能在原文中检验 T1 至 T5 是否都被发成了下降轮廓。

平调化与混合错误如何区分本个案的模式?

第 3 组搭配用于描述错误类型。白话说,平调化是把该拐弯的调说直了,混合错误是高度和拐弯一起错。英文为 leveling 与 mixed error。平调化分工是指出动态控制简化的方向,混合错误分工是指出错误跨维度。在粤语文献中平调化是动态调被听成平调,本文只有部分相似,即 T4 与 T5 多被听成低平 T3,但 T4 到 T3 同时变高度与曲拱,属于混合错误,T5 到 T3 则是高度内而曲拱变。组合意义是避免把所有降调听成平调都记为同一机制,本文数据显示被试在中低高度平调 T2 与 T3 上相对较好,而高调与动态调更差,提示维持高音与动态喉部调节都困难。

平调化 × 混合错误: 平调化指把动态降调发成平调,分工是描述曲拱简化的方向;混合错误指高度和曲拱同时改变,例如 T4 被听成 T3,分工是描述错误跨越两个维度。二者搭配的理由是只看平调化会漏掉高度也变了的情况,组合意义在于区分文中 T5 到 T3 的层内错误与 T4 到 T3 的混合错误。

呼吸与喉部是背后的生理假设。白话说,呼吸支持是气够不够稳,喉部控制是声带松紧调得够不够细。英文为 respiration-phonation coordination 与 laryngeal control。两者搭配解释为何音节拉长反而轮廓更差,气不足则平调维持不住,喉肌控制差则高度拉不开。

呼吸支持 × 喉部控制: 呼吸支持负责提供稳定足够的气流以维持发声时长与响度,喉部控制负责精细调节声带张力以实现目标基频高度与曲拱。二者搭配的理由是痉挛型构音障碍同时有肌张力高、呼吸弱与发声紧张,组合意义在于解释为何被试音节拉长反而平调维持不住、降调跌幅也不足。

本研究训练了什么,没有训练什么?

本研究没有训练神经网络,也没有更新任何模型参数,因此不存在优化器、梯度路径、参数冻结或早停。真实计算过程分为构造与测量两部分。构造部分是人工编制 4 组同音节词表,音节为 lam、fu、hau 与 liang,每音节配 5 个声调共 20 词,每词配图片消歧义,用载体句呈现并随机化,三遍录制共 60 条,录制设备为 iPhone 12 内置语音备忘录。测量部分一是人工听辨计数转百分比,二是用 PRAAT 提取时长与起落基频并做配对 t 检验,显著性阈值为 p 小于 0.05。

未报告的内容是 PRAAT 的具体窗长、基频提取上下限与手动校正规则,以及随机顺序种子,复现时需明确这些缺项,不能从设备名称推定音质一致。复现时应保持同一执行顺序:先完成词表与图片编制与随机化,再做跟读录制与目标词切分,然后独立进行 5 人听辨计分,最后提取声学量并做组间比较,避免用听辨结果反向挑选声学样本,这样才能公平比较被试与对照的高度与曲拱差异。

数据、被试、指标与公平条件是什么?

数据来自单被试 MM 与单对照者的 60 个目标词产出,4 组音节各 15 个产出,每调共 12 个产出乘 5 位评定者即每调 60 人次判断。评定者为 5 位台山话母语者,2 女 3 男,年龄 49 至 65 岁,无听力损失,语言完好,无构音障碍接触史。指标一是每目标调被感知为 T1 至 T5 的百分比,方向为越高表示越被听成该调,对角线越高表示产出越准。指标二是起音与落音基频均值、高度分组起音范围与均值,单位为赫兹,方向为组间拉开越大表示高度区分越好,起落差越大表示下降越明显。

指标三是音节时长,单位为秒,方向为与对照差异越大表示语速偏离越大。公平条件是同一词表、同一载体句呈现、同一图片指认流程、同一批评定者听同一批 MM 录音,声学对比为同一目标词的 MM 与对照产出。资源状态方面,未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。

听辨主结果显示哪几调最易混淆?

要回答哪一调受损最重,需要先看混淆矩阵的行是否为目标调、列是否为感知调,对角线是否为正确率,比较条件是同一 MM 产出、同一 5 位评定者、每调 60 人次。表前问题是总体正确率多高,哪一调最低,哪一调相对保留,错误集中流向哪里。公平条件与指标方向如上一节所述,对角线越高越好,非对角线高表示系统性误判。

目标声调感知为 T1感知为 T2感知为 T3感知为 T4感知为 T5
T1623322811
T225015258
T3013531717
T401338.52523.5
T501031.713.345

表后解释是总体正确率报告为 36.1%,支持声调产出受损的判断。

对角线显示 T1 仅 6% 为最低,且其他调几乎不被听成 T1,说明高音目标难以被察觉。T3 为 53% 最高,T2 为 50% 次之,T4 主要被听成 T3,T5 虽以 45% 最多被听成本调但仍有约三成被听成 T3。代价与反例是 T5 并非完全丢失,T4 正确率 25% 低于被误听为 T3 的 38.5%,且 T1 分散到 T2 至 T4,表明错误不是单一方向的平调化。未胜出项是高调 T1 与降调 T4,边界是单被试且评定者仅 5 人,不能估计人群变异。

声学主结果是否支持高度压缩与全降轮廓?

要判断听辨困难是否有物理基础,需要比较被试与对照的平均基频、平均时长与起落差,条件是同一目标词、同一提取定义,指标方向为组间差越大区分越好。表前问题是被试是否整体音高偏低、时长偏长,降调跌幅是否不足。表中基线为健康对照者的实际可运行产出,不是搜索最优或事后最优,策略为 MM 的实际产出。

比较维度指标被试 MM对照者差异方向
平均基频起落均值,赫兹110.5184.2被试整体偏低

表后解释是配对 t 检验报告基频与时长差异显著,支持时长拉长与音高整体下移的判断。原文进一步报告被试五调时长范围为 0.61 至 0.67 秒,对照为 0.36 至 0.46 秒,与语速慢与元音拉长的文献一致。

曲拱上被试不论目标平降均平均下降 32 赫兹,对照降调 T4 与 T5 平均下降 66.5 赫兹,而对照低平 T3 仅下降约 33 赫兹,说明被试的下降可能并非有意控制的降调,而是普遍存在的跌落。反例是被试仍有宽的起音范围,并非完全没有音高变化,问题在于均值彼此靠近、精细调节不足。

高度分组的起音范围能否拉开高中低?

要定位是高度还是曲拱 breakdown,需要把起音按高、中、低分组比较范围与均值,条件是 T2 与 T4 合并为中,T3 与 T5 合并为低,指标方向为 3 组均值拉开越大越好、天花板与地板不交叉越好。表前问题是被试的高调天花板是否被中低调超过。

Tone GroupingMeasurement MM (Hz)Control (Hz)
Range [84 - 161][172 - 267]
Mean131211
(T2/4) Mean129206
Mean123186

表后解释是被试高、中、低 3 组均值分别为 131、129 与 123 赫兹,彼此靠近,而对照为 211、206 与 186 赫兹,组间差异更大,支持高度完整性受损。范围上被试低调 77 至 166 赫兹、中调 94 至 185 赫兹、高调 84 至 161 赫兹,中调上限反而高于高调上下限,低调上限也高于高调上限,表现为高调天花板被中低调覆盖。对照低中高范围分别为 155 至 255、163 至 240 与 172 至 267 赫兹,虽也有宽范围与重叠,但均值梯度与天花板排序更清晰。未评测边界是未纳入嗓音质量参数如气息声与紧张度,也未控制辅音不准对起音提取的影响,因此不能把高度压缩完全归因于喉部音高控制。

哪些推测尚未验证,不能当作结论?

需要区分报告、支持与待验证。报告的是总体 36.1%、T1 最低 T3 相对最好、被试全降轮廓与时长拉长。支持的是高度区分压缩与动态喉部控制困难,因为均值靠近与中低调天花板超过高调提供了物理对应。待验证的是呼吸支持不足导致平调维持不住的解释,原文用可能表述,尚未直接测量呼吸与喉肌电,因此只能写可能,不能写因果。

另一处不一致是听辨多把 T4 听成平调 T3,而声学显示全降,原文指出仪器能测到人耳不敏感的滑动,且嗓音紧张与辅音含混会干扰感知,因此不能用声学下降直接预测听辨标签。局限还包括单被试单对照、无纵向数据、无干预对照、评定者仅 5 人、录制设备与 PRAAT 参数报告不全,总体趋势不等于每组每步都成立。

复现应先做什么,需要补哪些验证?

复现先做词表与流程重建。按 lam、fu、hau、liang 四音节各配五调 20 词,每词配无歧义图片,用 This is 载体句呈现并随机化,每套连录三遍共 60 条,只切目标词计算时长与起落基频。听辨需招募多位台山话母语者独立逐词指认,每调汇总为人次百分比并保留混淆矩阵,不只报总体正确率。声学需固定 PRAAT 基频范围、清浊判断与手动修正规则,分别报告每调起音落音均值、每调时长、高中低分组范围与均值,并用配对 t 检验比较被试与对照。

还需补的验证是增加对照者人数以估计正常变异,补充嗓音质量与辅音准确性标注以分离音高与音质影响,补充呼吸与发声协调的直接测量以检验气不足假设。何时值得尝试是当临床需要为台山话构音障碍者制定声调剖面与个性化训练时,可先用此流程定位是高度上不去还是曲拱维持不住,再选择过度发音、姿势调整、喉部内收或呼吸训练方向,但不承诺这些方法在本个案有效。

应如何一句话记住本研究的取舍?

记住取舍有助于避免误读。本研究用最小可运行的个案设计换来了高、中、低与平、降全覆盖的细粒度剖面,代价是放弃了群体推断力。最强证据是听辨与声学双侧收敛于高度压缩与高调丢失,同时分歧点全降对平听感提醒不能单用仪器读数代替交际可懂度。教学例子是把 T4 到 T3 记为混合错误、T5 到 T3 记为层内曲拱错,有助于理解为何只说平调化会漏掉高度维度。后续若要用于干预,需先补多被试、嗓音质量参数与呼吸测量的对照验证,再谈疗效。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总