英文题目:The Interaction of Tonotactics, Lexicality, and Psychoacoustics in Evaluating Perceptual Distinctiveness

会议身份:conference:speechprosody:2026:conference-paper-id:liu26b_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #言语感知 #语音 #语音质量评估

评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Pauline Bolin Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Mingxing Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究任务是检验母语声调配位与词汇知识如何影响相对可区分度判断,输入为一次听到的两对普通话音节对序列,输出为哪一对内部差异更大的二选一判断及决策反应时,难点在于声学差异、配位合法性与词汇对应性相互纠缠难以分离。先以北京官话男性发音人产出的双音节无意义词首目标音节录音为输入,对时长、基频与强度做规整以保证典型表征,输出规整后单音节刺激。再以规整后单音节刺激为输入,按非法-合法对决合法-合法对等关系承担构对职责,将鼻边音与高平、升、降调组合构成六类比较序列,输出可直接施测的两对序列。最后以两对比较序列为输入,承担施测与分析职责,采集二选一判断与对数反应时并做拟合优度卡方与混合效应分析,输出配位、词汇与声学因素的分离效应。与已有单音节沿连续统辨认研究相比,关键机制差异在于用两对之间相对区分度比较替代绝对范畴辨认,直接检验非法与非词表征在比较中的弱化效应,具有揭示比较性知觉的作用。在S1序列比较任务设置下,含非法音节对[naHH-laHH]的被判更分立比率指标为0.28,低于全合法对[naLH-laLH]的被判更分立比率指标0.72。结论适用边界仅限北方官话母语者对鼻边音与高平、升、降调组合的判断,尚未验证其他辅音、声调及跨方言外推性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要判断的又是什么?

本文的输入是录制并做过声学规整的普通话单音节,声段限定为[na、la、ni、li] 4 种,声调限定为高平 HH、上升 LH、下降 HL 3 种,组合成 12 个声段加声调的音节。目标不是识别声调类别,也不是转写汉字,而是相对知觉区别度的比较:听者 1 次听到两个声音对,例如先听[naHH-laHH] 再听[naHL-laHL],然后回答哪 1 对内部听起来更 distinct。必须保留的信息是这种任务只给出相对排序,不给出绝对距离分数,也不要求听者说出听到了哪个字。输出是每个序列中每 1 对被选为更 distinct 的比例,以及做出选择所用的对数反应时。

初学者容易误以为声音在声学上差别大就一定被判为更 distinct,本文恰好要检验母语的声调搭配规则与词汇身份是否会压缩或拉大这种判断。声调搭配规则的白话是某种声段配某种声调在母语是否允许出现,英文为 tonotactics;词汇性的白话是合法组合能否独立作为有意义的单音节语素,英文为 lexicality;心理声学的白话是信号本身在频率、时长、强度上的可听差别,英文为 psychoacoustics。后文分别简称为搭配合法性、词汇性与声学细节。

学习依赖上,先理解 12 个音节如何被分成非法、合法但非词、合法且有词 3 类,再理解 6 个序列如何把 2 对捆绑成 1 次判断,才能读懂结果中为何 S1 至 S4 显著而 S5 不显著。

已有的词汇效应与跨语言同化说明了什么?

相关路线有两条。第一条是听觉与语音记忆中的区别度比较,声学差别大的两音通常更 distinct,例如不同元音语境下齿龈擦音与腭化擦音的差别会变化。第二条是母语范畴映射,两个非母语音若映射到同一个母语音类就难分,例如日语听者对英语浊边音的困难。词汇效应是第三条线索:在英语中听到沿浊辅音连续体的同一个嗓音起始时间台阶,听者在不同词尾语境下会偏向能组成真词的一端。

在普通话声调中,听到 Tone1 至 Tone2 连续体的同一台阶,听者在[hei] 语境偏向 Tone1 而在[ʂei] 语境偏向 Tone2,都是为了拼出有词的组合。粤语听者在塞音连续体上也有类似偏向有词组合的报道。本文与这些工作的输入不同,它不用连续体范畴判断,而用两个完整声音对的相对区别度判断;目标也不同,它不问边界移动多少,而问含非法或非词音节的 1 对是否整体被判为更不 distinct;监督与运行阶段也不同,它没有训练分类器,而是在听知觉实验中直接收集选择与反应时。

本文引用这些工作是为了说明多阶段加工的合理性:信号细节先给出差别,母语知识再调节映射,但调节是否会作用于成对区别度仍需本实验验证。

同化 × 范畴映射: 范畴映射分工是把听到的声音对应到母语已有的音类,例如英语听者把连续体偏向有词一端;同化分工是把两个非母语声音都归入同一个母语范畴从而压缩区别。本文搭配这两者的理由是把非法与合法配对理解为好范例与差范例的配对,组合意义在于为非法对与非词对被判为更不 distinct 提供跨语言知觉的类比,但本文不直接检验同化程度。

初学者应把例子明确标为例子:例如英语 dash 与 task 的偏向只是帮助理解词汇效应的教学例子,不是本文的刺激与数据。

要区分的三个问题是什么,混淆点在哪里?

本文提出 3 个可检验的问题。第一,含非法声调组合的 1 对是否比 2 对都合法的 1 对被判为更不 distinct,对应 S1 与 S2。第二,在全都合法的前提下,含合法但非词音节的 1 对是否比全有词的 1 对比判为更不 distinct,对应 S3 与 S4。第三,当 2 对都是合法且有词时,区别度判断是否还会有系统偏向,对应 S5 与 S6。混淆点在于普通话单音节多对应语素,合法与有词高度重合,若只比较非法与有词,就分不清是搭配规则还是词库邻域在起作用。

本文的解法是找出合法但非词的[liHH] 哩,它在搭配上允许出现,却不能独立作为有意义单位,从而把第二问独立出来。另一个混淆点是声学细节与语言知识的纠缠:高起始调与低起始调本身的可听差别不同,元音[a] 与[i] 语境下[n-l] 的可听差别也不同,若不控制声段与调型,就无法判断显著差异来自知识还是信号。因此本文把声段对比固定为[n-l],把调型对比固定为 HH 对 LH 或 HL 等,再让词汇身份成为序列内唯一系统变化,这是理解方法全景的关键。

从一个样本走完全程:听到什么,按什么顺序判断?

沿一个样本走完输入到输出。输入是 S1 的 1 次呈现,例如先放[naHH-laHH],对内间隔 50 毫秒,再隔 150 毫秒放[naLH-laLH],2 对的声段对比都是[na-la],差别只在调型与词汇身份。表示阶段是听者形成每对内部的差别印象,不需要说出声调名称。组件阶段是比较两个印象的相对大小,做出哪 1 对更 distinct 的二选一。目标是收集该选择,输出是跨试次聚合后的判断率与对数反应时。

6 个序列覆盖 3 种类型:类型一为非法加合法对战合法加合法,类型二为有词加非词对战有词加有词,类型三为有词加有词对战有词加有词。每个序列以两种顺序呈现,每种重复 5 次,另有 20 种填充序列打乱预期,每人共 60 次有效判断,全程约 15 分钟。下面先看刺激如何被分成 3 类,再看试次如何组织。

下面这段导读帮助建立刺激分类的整体图像,顶层是搭配合法性分叉,下层是词汇性分叉,末端挂着具体音节与汉字释义,读图时先看分叉逻辑再核对红色与蓝色特殊项的位置。

看图路径: 1. 先从顶层声调搭配规则分叉看非法与合法两支;2. 再沿合法支线看词汇性分叉为非词与有词;3. 核对红色[naHH] 与蓝色[liHH] 各自挂在哪一支末端;4. 数一数有词分支下列出的十个带汉字与英文释义的音节

原论文 Figure 1:Stimulus syllables of different tonotactics and lexicality.

论文图 1。原论文 Figure 1:“Stimulus syllables of different tonotactics and lexicality.”。

该图把 12 个音节按先合法性后词汇性的顺序展开,非法支只有红色标注的[naHH] 一项,合法支再分为蓝色标注的非词[liHH] 哩与其余 10 个有词音节,每个有词音节都配有汉字与英文释义,例如[laHH] 拉、[niLH] 泥等。这张图的重要性在于它同时呈现了方法全景的分组依据:类型一靠红色项与黑色项的对立,类型二靠蓝色项与黑色项的对立,类型三则只在黑色项内部比较不同调型与元音语境。

刺激是如何录制、挑选与规整的?

刺激组件包括说话人、语境控制、挑选与规整 4 步。说话人为 1 名北京普通话男声,为保证调型典型,把目标音节放在双音节 nonsense 词的首音节,例如[na.ta] 与[ni.ti],且前后元音相同,第二音节的声调起点与目标音节的终点衔接,避免孤立念单字时的夸张调型。每个目标音节录九遍,从中选出一遍,要求起音辅音的强度与时长、元音中点的共振峰最接近九遍的平均值,以保证代表性。选中后再按自然语音的时长、基频与强度对辅音与元音做操纵,使各音节的声学实现符合典型属性。

组合后形成 6 个声音对:[na-la] 与[ni-li] 各套 3 种声调,其中[naHH-laHH] 为非法加合法对,[niHH-liHH] 为有词加非词对,其余 4 对为有词加有词对。实验用 Paradigm 软件呈现,听者用鼠标点击屏幕左侧的第 1 对或右侧的第二对,鼓励尽快反应但不限时。初学者要注意这里没有模型训练,只有刺激构造与行为测量。

声调搭配规则 × 词汇性: 声调搭配规则负责判断声段加声调的组合在普通话是否合法,例如[naHH] 为非法而[liHH] 为合法;词汇性负责在合法组合中再判断能否独立作为单音节语素,例如[liHH] 合法但非词。两者搭配的理由是普通话单音节多对应语素,容易混淆合法与有词,组合意义在于把非法减弱与非词减弱分开,分别对应 S1 与 S2、S3 与 S4 的比较。

知觉区别度 × 心理声学差异: 知觉区别度是听者在这项任务中对哪 1 对听起来更 distinct 的相对判断,不是声学距离仪器的直接读数;心理声学差异是基频起点高低、元音语境等信号层面的可听差别。搭配理由是当前后 2 对都是合法且有词时,语言知识不再给出偏向,听者只能调用信号细节,组合意义在于解释为何 S5 无差异而 S6 出现高起始调更 distinct 的分化。

理解了刺激分类与信号规整,才能明白为何 S5 与 S6 被特意留作纯声学对照:它们都不含非法与非词,若仍出现差异,只能回到调型起点高低与元音语境的可听性上找解释。

本研究训练了什么,没有训练什么?

本研究没有训练任何神经网络、声学模型或分类器,也就没有优化器、梯度路径、参数冻结与更新、早停或权重下载等安排。缺项必须明确指出:原文未报告学习率、批量大小、训练轮数或验证集划分,因为这些概念不适用于本次行为实验。真实计算过程是刺激构造与行为统计两部分。构造部分的计算是取九遍录音的声学均值、挑选最接近均值的样本,再按自然语音属性调整时长、基频与强度。

推理与统计部分的计算是把每次二选一计为 1 次选择,把反应时取对数得到 LogRT,对超出均值正负两个标准差的试次按被试内标准剔除,再对判断率做卡方拟合优度检验,对 LogRT 用线性混合效应模型分析。随机效应为被试,固定效应为在该序列中选了哪 1 对为更 distinct。因此复现时不应寻找模型代码,而应复现刺激名单、呈现时序与统计脚本。把无训练等同于确定性求解是错误的:即使没有模型训练,听者的选择仍是随机变量,需要统计检验才能判断偏向是否可靠。

声段对比 × 声调条件: 声段对比分工是固定[n-l] 的辅音差别作为每对内部的待判距离,例如[na-la] 与[ni-li];声调条件分工是给同一声段对比套上高平 HH、上声式上升 LH 或去声式下降 HL 的外套。搭配理由是只有声调相同、声段对比相同的 2 对放在同一序列才能比较调型与词汇身份的作用,组合意义在于形成 6 个序列中可比的成对更 distinct 结构。

这一节承担的方法职责是交代无训练研究的等价流程:用可重复的录制、挑选、规整与呈现时序代替训练,用聚合与检验代替优化。

被试、序列与测量条件是否一致?

实验条件按被试、材料、协议与测量 4 组交代。被试为 31 名北方出生长大、家庭日常用标准普通话的母语听者,年龄十九至三十岁,平均二十三岁,女性 19 人男性 12 人,均为右利手,无听力与语言障碍,无音乐与语音学训练。材料为上述 12 个音节组成的 6 个声音对,序列类型与时序在全员一致:对内间隔 50 毫秒,序列内 2 对之间间隔 150 毫秒。

协议上每个序列两种顺序各重复 5 次,加 20 种填充序列,每人 60 次有效判断,31 人共 1860 次原始反应,剔除对数反应时超出被试内均值正负两个标准差的 60 次后剩 1800 次,且剩余反应均在 10 秒内,短于所引的声音记忆衰退时间。测量包括判断率与反应时,判断率指某 1 对被判为 2 对中更 distinct 的比例,反应时经对数变换后建模。

下面这张表把 6 个序列的对比结构与时序参数放在同一行内,便于核对公平条件:声段对比固定、调型已知、间隔固定,唯一系统变化是词汇身份。 比较问题是 6 个序列是否在相同声段对比与相同时序下比较,若时序或重复次数不一致则无法归因于搭配与词汇性,指标方向是判断率越高表示更 distinct,对数反应时越长表示决策更费力。

序列编号序列类型第 1 对第二对
S1非法加合法对战合法加合法[naHH-laHH] 含非法[naLH-laLH] 全有词
S2非法加合法对战合法加合法[naHH-laHH] 含非法[naHL-laHL] 全有词
S3有词加非词对战有词加有词[niHH-liHH] 含有词加非词[niLH-liLH] 全有词
S4有词加非词对战有词加有词[niHH-liHH] 含有词加非词[niHL-liHL] 全有词
S5有词加有词对战有词加有词[naLH-laLH] 全有词[naHL-laHL] 全有词
S6有词加有词对战有词加有词[niLH-liLH] 全有词[niHL-liHL] 全有词

该表的主要收益是把类型标签与具体音节绑定,避免空谈非法或非词,代价是它不能代替结果数字,判断率与显著性必须到结果表核对,未胜出项 S5 的无差异也只有在结果表中才能看到,复现时应先按此表重建呈现脚本再收集数据。

非法与非词对是否被判为更不 distinct?

结果按 3 类序列组织。类型一的 S1 与 S2 都显示含非法[naHH] 的 1 对显著更少被选为更 distinct,类型二的 S3 与 S4 都显示含非词[liHH] 的 1 对显著更少被选为更 distinct,类型三的 S5 无差异而 S6 出现显著差异。统计方法是对每个序列做卡方拟合优度检验,比较 2 对的判断率是否有偏。反应时方面 6 个序列中仅 S1 在 2 对之间有显著差异,且非法对被选为更 distinct 时的对数反应时更长。下面先看判断率的柱形总览,再用数字表核对。 这段导读针对判断率柱形图,纵轴是被判为更 distinct 的比例,横轴是每个序列内的 2 对对比,星号表示两柱差异显著,读图时先按类型自上而下看,再核对每柱顶端的数值标注。

看图路径: 1. 按 Type1 至 Type3 自上而下看六个子图 S1 至 S6 的柱高;2. 核对每个子图纵轴为被判为更 distinct 的比例;3. 比较每对中左侧浅色柱与右侧柱的数值标注;4. 注意 S5 无星号而其余五组有星号的显著性标记

原论文 Figure 2:Rates on judging a pair as more distinct in each sequence.

论文图 2。原论文 Figure 2:“Rates on judging a pair as more distinct in each sequence.”。

从可见内容看,S1 至 S4 都是左侧浅色矮柱对右侧高柱,标注分别为 0.28 对 0.72、0.22 对 0.78、0.19 对 0.81、0.21 对 0.79,且均有星号;S5 两柱几乎等高,标注为 0.49 对 0.51 且无星号;S6 左侧 0.41 低于右侧 0.59 且有星号。这说明非法与非词的压缩效应在 4 个序列一致成立,而纯有词对照并不总是等价,元音与调型细节在 S6 显现。

判断率 × 对数反应时: 判断率分工是统计某 1 对在序列中被选为更 distinct 的比例,方向是比例越高表示听起来更 distinct;对数反应时分工是记录做出该选择所用时间的对数变换,用于看判断是否更费力。搭配理由是只看选哪边会忽略决策难度,组合意义在于 S1 同时出现判断偏向与反应时延长,说明非法对不仅少被选为更 distinct,而且在被选时更慢。

比较问题是在相同声段对比下,含特殊音节的 1 对是否系统性少被选为更 distinct,公平条件是 2 对共享声段对比与呈现时序,指标方向是判断率越高表示更 distinct。

序列对比类型第 1 对判断率第二对判断率卡方与显著性
S1非法加合法对战合法加合法[naHH-laHH] 0.28[naLH-laLH] 0.72卡方 92.043,样本 303,显著
S2非法加合法对战合法加合法[naHH-laHH] 0.22[naHL-laHL] 0.78卡方 59.161,样本 299,显著
S3有词加非词对战有词加有词[niHH-liHH] 0.19[niLH-liLH] 0.81卡方 116.26,样本 304,显著
S4有词加非词对战有词加有词[niHH-liHH] 0.21[niHL-liHL] 0.79卡方 101.26,样本 304,显著
S5有词加有词对战有词加有词[naLH-laLH] 0.49[naHL-laHL] 0.51卡方 0.054,样本 296,不显著
S6有词加有词对战有词加有词[niLH-liLH] 0.41[niHL-liHL] 0.59卡方 9.918,样本 294,显著

表后解释需要同时讲收益与反例:收益是 S1 至 S4 一致支持搭配合法性与词汇性都会压缩区别度,且非词序列的效应量在数值上不弱于非法序列。

代价与反例是 S5 的无差异表明全有词不必然等价,全有词内部仍可能因声学细节分化,S6 就是反例,它显示[niHL-liHL] 比[niLH-liLH] 更 distinct。未胜出项 S5 恰好是公平对照,说明不能把显著性推广到所有调型与元音组合,限制是这些数字只来自北方官话青年被试与特定说话人。

去掉语言知识后声学细节是否还起作用?

这一节相当于消融或对照分析:当 2 对都是合法且有词,语言知识被控制住,声学细节是否还能制造差异。S5 与 S6 就是这组对照,它们的 8 个音节都对应日常高频单音节语素,例如[naLH] 拿、[laLH] 剌、[naHL] 那、[laHL] 辣、[niLH] 泥、[liLH] 离、[niHL] 逆、[liHL] 力,因此不能用词频高低解释 S5 与 S6 的不同走向。原文的解释是高起始调比低起始调带来更大的知觉差别,所以 S6 中高起始的[niHL-liHL] 比低起始的[niLH-liLH] 更 distinct。

S5 中同样是低起始对高起始却无差异,原文进一步提出声段语境的交互:[na-la] 在[a] 语境本身更 distinct,可能掩盖了调型起点的作用,而[ni-li] 在[i] 语境相对更不 distinct,才让调型差别显现,但该交互有待进一步验证。下面先看反应时分布,再用数字表核对样本量与剔除。 这段导读针对对数反应时的小提琴图,纵轴为 LogRT,横轴为序列内的 2 对,形状宽度表示分布集中程度,黑点与数字表示中心位置,读图时先看分布是否对称再核对中心数值。

看图路径: 1. 确认纵轴为对数反应时 LogRT 而非原始毫秒;2. 观察每组小提琴形的分布宽度与中心黑点位置;3. 比较 S5 与 S6 中左右两半分布的中心数值标注;4. 注意该图只显示部分序列的反应时分布形态

原论文 Figure 3:Stimulus syllables of different tonotactics and lexicality.

论文图 3。原论文 Figure 3:“Stimulus syllables of different tonotactics and lexicality.”。

从可见的 S5 与 S6 两组看,蓝色与粉色分布都呈中间宽、两端窄的小提琴形,中心标注在 6.7 至 7.0 附近,两半分布高度重叠,说明反应时差异远不如判断率差异那样整齐,只有 S1 在统计上显示非法对更慢,这支持反应时只是辅助证据而非主要效应。 比较问题是反应时是否与判断偏向同向,公平条件是同一序列内比较被选为更 distinct 时的 LogRT,指标方向是 LogRT 越大表示决策越慢。

分析对象样本与处理第 1 对 LogRT 均值第二对 LogRT 均值显著性
全部有效反应31 人共 1860 次,剔除 60 次占 3.2 个百分点低于均值 2 个标准差 25 次高于均值 2 个标准差 35 次剩余 1800 次均在 10 秒内
S1 反应时仅 S1 显著,卡方 4.2155,自由度 1[naHH-laHH] 7.024 更慢[naLH-laLH] 6.794 更快显著小于 0.05
S5 判断率对照样本 2960.490.51卡方 0.054 不显著
S6 判断率对照样本 2940.410.59卡方 9.918 显著

表后解释要讲清主要收益与代价:收益是 S1 的反应时延长与判断率偏向一致,为非法压缩提供了双指标支持。

代价是其余序列反应时无显著差异,说明不能用反应时快慢代替区别度方向,S5 与 S6 的判断分化也不能归因于某组反应特别快。未评测边界是原文未报告分顺序的反应时、填充序列的影响以及个体策略差异,复现时应保留原始试次顺序以供追查。

哪些结论还不能下,缺了哪项验证?

直接报告的是 6 个序列的判断率方向与 S1 的反应时差异,有限解释是非法与非词压缩了区别度,以及声学细节在全有词对照中介入。未验证推测必须用可能与待验证表达:高起始调更 distinct 与元音语境掩盖调型效应的交互是可能的解释,但原文明确说有待进一步研究,不能当作已证实的因果。

缺失证据不是技术错误,但必须列出:仅用 1 名男声、仅用[n-l] 对比、仅用 3 个声调中的特定配对、仅用北方青年被试,未测量词频的连续效应、未测量噪声与语速下的稳定性、未报告训练资源与推理开销因为本研究无模型训练。相关性不等于因果:判断率低可能来自范畴映射、同化、注意力或决策偏向,本文设计不能分离这些机制。总体趋势不等于每组都成立,S5 的无差异就是提醒。

初学者常见误解是把非法等同于不能发音,实际上[naHH] 只是普通话不允许的声段加声调组合,受试仍能听到声音,只是母语知识使其听起来更不 distinct;另一个误解是把非词等同于罕见词,实际上[liHH] 哩是合法但不能独立成词,不是低频词。

要复现先做什么,需要保留哪些信息条件?

复现先做三件事。第一,重建刺激名单:按十二音节表准备[na、la、ni、li] 乘 HH、LH、HL,确认[naHH] 为非法、[liHH] 为合法但非词,其余 10 个为合法且有词,并保留每个有词音节的示例汉字以便核对,例如[laHH] 拉、[niLH] 泥。第二,重建录制与规整:请北京普通话男声在双音节 nonsense 词首音节录制,每音节九遍,选最接近均值的一遍,再按自然语音调整时长、基频与强度,不要直接用孤立单字录音。

第三,重建呈现与统计:对内间隔 50 毫秒,对间 150 毫秒,每序列两种顺序各 5 次,加 20 种填充序列,用相同左右键布局收集二选一与反应时,对反应时取对数并按被试内正负两个标准差剔除,再对判断率做卡方检验、对 LogRT 做以被试为随机效应的线性混合效应模型。关键超参数与信息条件是被试筛选标准、间隔时长、重复次数与剔除阈值,这些都影响判断率的分母与反应时的分布。

资源状态方面,未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,复现应从头录制与编写呈现脚本。若要扩展验证,建议补测不同说话人、不同声段对比、连续词频统计以及分顺序效应,并预先登记高起始调与元音语境交互的假设,避免事后解释。

何时值得借用这套方法,何时不必?

当研究问题是母语知识是否压缩成对区别度,且能找到合法但非词的临界项时,这套成对更 distinct 范式值得借用,因为它不需要范畴标签,直接比较相对距离,且能用全有词对照分离声学细节。当目标是估计范畴边界位置、测量绝对辨别阈限或优化识别准确率时,不必套用此范式,应改用连续体辨别、信号检测或识别任务。本文的判断是搭配合法性与词汇性都使含特殊音节的 1 对更少被选为更 distinct,支持语言经验介入区别度评价。

同时 S5 与 S6 的分化支持听者会调用高低起始调与元音语境等声学细节,且不同细节之间可能交互。重提结果时增加适用条件:该判断仅在[n-l] 对比、特定调型配对、安静实验室、北方青年听者与单说话人条件下得到支持,换语境需重测。教学上记住三句话:先分非法、非词、有词 3 类,再看序列内谁与谁比,最后看显著星号与样本量是否同时报告。不要把 1 次显著当作普遍规律,也不要把无训练当作无随机性,行为数据的每一步都需要统计与复现。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 13 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总