英文题目:Positioning Effect of Syllable Shortening on Speech Segmentation: Evidence from Mandarin Listeners

会议身份:conference:interspeech:2026:conference-paper-id:ou26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解

评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Shu-Chen Ou:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理连续语音无停顿时如何切分词汇的言语分割问题,输入为三音节无意义音节连续流,输出为对词与跨界局部词的辨别,难点在于过渡概率与韵律线索常常冲突。方法链分为三步:先由台湾普通话男性发音人孤立录制音节并归一化时长与基频以消除干扰,再在学习流中按词首缩短、词中缩短与词末缩短三种位置压缩目标音节至一半时长,最后在中性测试音下用二选一迫选检验切分。与以往强调末元音拉长或词首辅音增强标示边界不同,本文检验词中缩短作为内部结构线索的反向机制,具有汉语经验基础。在二选一迫选测试条件下,MS条件的准确率为65.28%,高于TP-only基线条件的准确率55.56%。同组比较还显示词末缩短损害切分而词首缩短无显著作用,说明缩短位置决定其被解释为内部还是边界信号。该结论仅适用于普通话母语者对受控人工语言的短时学习,尚未验证与其他弱化线索叠加或跨语言推广。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:连续语流为什么难切分?

本文的输入是连续、无停顿的人工语言语流,目标是让母语为普通话的听者从中切分出三音节词。必须保留的信息是:自然说话中词之间常常没有可靠静音,听者只能依靠分布线索。最基础的分布线索是转移概率,也就是一个音节后面跟另一个音节的统计可能性,用白话说就是在听过的材料里,前一个音节出现后,下一个音节有多大可能紧跟着出现。英文名是 transitional probabilities,缩写为 TPs。后文统一简称转移概率。

学习依赖是先理解统计学习假设:词内音节之间的转移概率高于跨词边界,听者即使听无意义音节也能利用这个差异切分。本文要回答的是,在统计骨架相同的情况下,韵律缩减是否改变切分。具体动作是构造 6 个三音节无意义词,反复拼接成约 11 到 12 分钟的长串,词之间不留停顿,然后用二选一测验检验听者能否选出真正的词。输出是选择正确率,正确率高表示在学习阶段成功切分。

本节的教学任务是建立问题意识:切分不是识别孤立音节,而是从连续声学流中决定哪里是词的开头和结尾。例子是中文火车站火车站,中间音节在自然口语中经常变短甚至压缩,但听者仍把它听成一个整体,而不是 3 个独立词。这个例子只帮助理解内部缩减现象,不代表本实验的刺激或数值。

已有路线如何用拉长标边界?

在进入缩短之前,需要先沿已有路线走一遍显著线索如何工作。第一条路线是元音延长。白话解释是处于韵律或词边界的元音在发音时会被拉长,听者在感知时反过来利用这一点,把较长的元音听成单元结尾。英文名是 vowel lengthening。实验做法是让听者听元音时长不同的音节序列,观察他们把长元音归为结尾的倾向。多语言证据报告英语、法语、荷兰语、德语、巴斯克语、日语和台湾闽南语听者都会用尾元音拉长推断边界,意大利语和匈牙利语听者是报告过的例外。

第二条路线是辅音延长。白话解释是处于韵律域开头的辅音在发音上得到加强并变长,听者把较长的首辅音听成词首信号。英文名是 onset consonant lengthening 或 domain-initial strengthening。证据是把连续三音节流中首音节的辅音拉长,切分正确率提高,而拉长尾音节辅音没有同样好处。作者总结这两类线索互补:长首辅音倾向指示开头,长尾元音倾向指示结尾。

元音延长 × 辅音延长: 元音延长分工是标记结尾:词尾或韵律边界元音变长,听者倾向把长元音听成单元结束;辅音延长分工是标记开头:韵律域首辅音得到加强和延长,听者倾向把长辅音听成词首。二者搭配的理由是它们分别从结尾和开头两侧提供显著的边界信号,组合意义在于形成互补的边界定位系统,与本文研究的非显著的内部缩短线索形成对照。

与上述显著的边界标记不同,本文关注非显著的韵律缩减。白话解释是音节在词内位置系统性变短、不突出,但仍高频出现。英文名是 prosodic reduction 或 syllable shortening。普通话三音节词中中间音节经常缩短就是典型。已有研究较少直接检验这种缩短是否帮助切分,本文正是要补上这一块。需要区分的是,拉长是把边界描粗,缩短是把内部压扁,二者作用位置不同,不能直接类推。

本文具体要检验什么位置效应?

本文的问题可以表述为:把缩短放在三音节词的不同位置,是否对切分产生不同方向的影响。操作是保持转移概率结构不变,只改变哪个音节被缩短。条件有 4 个:只靠转移概率的控制条件、首音节缩短、中间音节缩短、末音节缩短。假设是缩短作为词内结构线索起作用,基于普通话中间音节系统性缩减的经验,预测中间缩短促进切分。

关键对照逻辑是所有条件的词边界都只由转移概率标示,控制条件作为基线。也就是说,如果中间缩短组的正确率高于控制组,说明缩短在内部位置提供了超出统计的帮助;如果末尾缩短组低于控制组,说明在边界位置的缩短与边界预期冲突,产生干扰;如果首音节缩短与控制组无差异,说明该位置既不对齐内部也不强烈冲突边界,或作用不明确。

本节要澄清一个常见误解:缩短本身没有固定的好坏方向。同样是把一个音节从 300 毫秒压到 150 毫秒,放在中间可能是把 3 个音节捆成一个整体的绳子,放在末尾可能是把本该拉长的结尾剪短,从而破坏听者对结尾的预期。因此位置是自变量,正确率方向是因变量,不能把缩短笼统说成帮助或损害。

方法全景:从录音到测验走一遍

先沿一个样本走完全流程。以词 banume 为例,它由 3 个无意义音节 ba、nu、me 组成,结构为辅音元音辅音元音辅音元音,即 CVCVCV。录制阶段由 1 名台湾普通话男声逐个录制组成音节,然后在 Praat 软件中处理。处理动作包括把每个音节归一化为 300 毫秒,其中辅音 150 毫秒、元音 150 毫秒,并把基频轮廓压平为 130 赫兹的平调,以消除无意的韵律线索。

接着是时长操作。在控制条件下,banume 的 3 个音节都保持 300 毫秒。在首音节缩短条件下,ba 被压到 150 毫秒,nu 和 me 保持 300 毫秒。在中间缩短条件下,nu 被压到 150 毫秒。在末尾缩短条件下,me 被压到 150 毫秒。原文配图展示了同一个词在 4 种条件下的时长安排,但本次未收到图像像素,只能依据文字描述复述,不猜测波形颜色或坐标。

转移概率 × 音节缩短: 转移概率负责提供统计骨架:词内音节相邻出现概率为 1.0,跨词边界约为 0.2,听者据此划分单元;音节缩短负责提供韵律包装:把某个位置的音节时长压缩到 150 毫秒,提示该音节在词内的角色。二者搭配的理由是自然语流中统计与语音线索同时出现,本研究把二者正交组合,用以检验缩短位置是否改变对同一统计结构的切分,组合意义在于区分边界标记与内部结构标记的不同分工。

学习阶段把 6 个词随机连续拼接成无停顿长串,听者戴耳机听约 11 到 12 分钟,被告知后面要测试。测试阶段采用二选一迫选,每次先后呈现一个真词和一个部词,中间间隔 500 毫秒,听者选择哪个更像学过的词。部词由跨词边界的音节拼接而成,例如用 banume 的尾音节 me 加上 bimona 的前两个音节 bi、mo 组成 mebimo。部词在学习阶段从未作为整体出现,只隐含地横跨边界出现。测试刺激在所有条件下都以中性非缩短形式呈现,以保证测到的是学习阶段的切分,而不是测试时的听觉差异。

词内结构 × 词边界: 词内结构指三音节词中间位置的可预测连接,转移概率高且在普通话中常伴随缩短;词边界指词与词之间的低概率连接,需要显著 lengthening 或停顿来标示。二者搭配的理由是切分必须同时解决把内部粘在一起和把边界切开两个子问题,组合意义在于解释为何中间缩短帮助切分而末尾缩短损害切分:前者对齐内部,后者冲突边界预期。

词、部词与转移概率如何构造?

组件层面需要讲清三件事:词表、部词构造、概率差异。词表共 6 个:banume、nebogi、genigo、mibabu、nagamu、bimona。部词也 6 个,分别跨越不同词边界构成。原文表格列出词、部词及其来源组合,例如 monage 来自 bimona 与 genigo,bogina 来自 nebogi 与 nagamu,nigomi 来自 genigo 与 mibabu,gibanu 来自 nebogi 与 banume,nanebo 来自 bimona 与 nebogi,mebimo 来自 banume 与 bimona。该表格只说明材料来源,不包含正确率数字。

转移概率是核心表示。词内相邻音节转移概率为 1.0,意思是只要出现 ba,后面一定跟 nu,再跟 me,不出现分支。部词跨越边界,其转移概率约为 0.2,意思是边界处前一音节后面可接多个不同词的首音节,不确定性高。听者在学习阶段若掌握这个差异,就能在测试中偏好真词。重要细节是真词与部词使用相同音节库存,听者不能靠记住某个特殊音来作答,只能靠音节组合的统计结构。

控制声学细节同样是组件。所有音节基频压平、时长归一,保证控制条件只剩转移概率可用。实验条件在此基础上只压缩目标音节,不改变音节身份或顺序。这种设计让位置效应可归因于时长位置,而不是音段差异或基频起伏。

本研究有没有训练模型?实际计算是什么?

本研究没有训练神经网络模型,也没有更新任何模型参数,因此不存在优化器、梯度路径、损失函数或参数冻结与解冻问题。该节必须明确说明无训练阶段,以免初学者误把人工语言学习中的人类学习当成机器训练。

实际计算过程是人类行为实验流程加统计建模。人类学习部分是被试在学习阶段被动听长串,指导语要求注意声音,之后参加三十六试次的二选一测试。机器计算部分是用 R 语言拟合混合效应逻辑回归,分析二值正确与错误反应。固定因子是实验条件,以只靠转移概率条件为参照水平。随机截距为人工语言的具体词,以考虑词水平的组间变异。输出是各条件的回归系数、标准误、z 值与 p 值,用于判断位置效应是否显著区别于基线。

未报告的缺项要指出:原文未报告随机被试截距或随机斜率结构,未报告具体 R 包版本之外的收敛细节,也未报告反应时或学习曲线逐分钟变化。这些缺项不影响主结论复述,但复现时需要按常规做法补足模型设定并预注册。

被试、设备与流程条件是否一致?

被试共 120 名普通话母语听者,其中女性 67 名、男性 53 名,平均年龄 26.78 岁,标准差 10.65 岁。所有被试自报无听力或言语障碍,随机分配到 4 个条件,每条件 30 人。每人签署知情同意并获得小额报酬。随机分配保证组间语言背景大致均衡,是公平比较的前提。

设备与环境是 E-Prime 3.0 编程控制,在隔音室单独测试,戴耳机听学习流。学习流时长约 11 到 12 分钟,测试为三十六试次,每试次先听一个词再听一个部词,间隔 500 毫秒,呈现顺序平衡。这种安排保证 4 个条件除目标音节时长外,词表、拼接方式、测试形式和指导语一致。

指标方向要明确:二选一正确率越高表示切分越成功,随机猜测水平为 50%。统计判断以混合效应逻辑回归的系数方向为准,正系数表示该条件相对基线提高正确率的对数几率,负系数表示降低。显著性阈值按常规的 p 小于 0.05 理解,但原文直接报告具体 p 值,复述时保留原文精度,不自行四舍五入。

下表整理材料与声学归一化条件,帮助核对复现所需的构造细节。表前已提出比较问题:材料是否只差统计结构而不差音节库存,声学归一是否消除额外韵律线索。表中数字与单位保留原文写法,裸数值不擅自添加百分号,时长单位保留毫秒,基频单位保留赫兹。

材料与处理具体内容数量或时长概率或声学设定来源说明
人工词表banume 等 6 个三音节 CVCVCV 词6 个词词内转移概率 1.0无意义音节构成
部词表mebimo 等跨边界拼接6 个部词跨边界转移概率约 0.2学习阶段未作为整体呈现
音节归一每个音节总时长300 ms辅音 150 ms,元音 150 msPraat 处理
基频控制平调轮廓130 Hz消除无意韵律线索男性台湾普通话发音
学习暴露连续无停顿拼接11–12 分钟词边界仅由转移概率标示耳机隔音室呈现

表后需要解释代价与边界:归一化和平调提高了内部效度,让位置效应可解释,但代价是与自然语流差距拉大,自然语流中时长、基频、音强和协同发音同时变化。未胜出或未评测的边界包括未测试自然语调下的缩短效应,未测试不同语速下的压缩比例,未测试部词在学习阶段出现频率的细微差异。这些都限制直接推广到自然听辨,复现时应先严格复制本范式再逐步放宽控制。

主结果:哪个位置帮助切分,哪个位置损害切分?

本节回答测什么、与谁比、条件是否一致、指标方向、关键数字和支持判断。测的是二选一选词正确率,与只靠转移概率的控制条件比,4 个条件除目标音节时长外其他一致,指标越高越好。关键数字是 4 组平均正确率:控制条件 50% 5.56,首音节缩短 50% 5.46,中间缩短 65.28%,末尾缩短 50% 2.87。中间缩短高出控制约 9 到 10 个百分点,末尾缩短略低于控制,首音节缩短与控制几乎相同。

下表把 4 组平均正确率放在同一指标下比较,公平条件是同一词表、同一转移概率结构、同一测试形式,指标方向是正确率越高表示切分越成功。表前已说明比较问题与公平条件,表中数字保留原文 2 位小数与百分号写法,不做四舍五入,不计算新的差值列。

条件操作位置目标音节时长平均正确率比较对象
TP-only 控制无缩短300 ms55.56%基线
Initial Shortening首音节缩短150 ms55.46%与基线比无明确差异
Middle Shortening中间音节缩短150 ms65.28%高于基线
Final Shortening末音节缩短150 ms52.87%低于基线

表后解释主要收益与具体代价。收益是中间缩短组明显高于基线,支持缩短对齐词内可预测位置时帮助把 3 个音节捆成整体。代价或反例是末尾缩短组低于基线,首音节缩短组与基线几乎重合,说明缩短并非普遍有帮助。必须就近说明未胜出项:首音节缩短未胜出,末尾缩短是负结果,二者都不能用显著促进来描述。原文散点图显示个体正确率分布与组均值,但本次未收到图像像素,不描述点的颜色、位置或分布形状,只依据正文数字作判断。

统计模型进一步支持上述方向。回归以控制条件为参照,中间缩短系数为正并达到显著,末尾缩短系数为负并达到显著,首音节缩短系数接近零且不显著。具体估计见下一节消融与反证表的整理,这里先给出结论:位置决定缩短是帮助还是干扰,而不是缩短本身决定。

反证与统计:显著性是否经得起模型检验?

本节按问题组织反证:显著促进是否只出现在中间位置,显著损害是否只出现在末尾位置,无效应是否确实不显著。比较对象仍是同一控制基线,条件一致,指标是逻辑回归系数方向与 p 值。系数为正表示提高选对的对数几率,系数为负表示降低。

下表整理 3 组与基线比较的回归估计,保留原文系数、标准误、z 值与 p 值的写法与精度。表前问题是位置效应在控制词差异后是否仍然成立,公平条件是同一混合效应模型、同一参照水平,指标方向是系数符号与显著性共同判断。

条件对比估计系数标准误z 值p 值与判断
Middle Shortening 对 TP-only0.3070.132.290.0217,显著促进
Final Shortening 对 TP-only-0.3480.13-2.640.0084,显著损害
Initial Shortening 对 TP-only-0.1050.13-0.790.428,不显著
截距 TP-only 基线1.022400.303193.372<0.001,基线高于随机

表后解释需包含代价与限制。中间缩短的促进效应量并不大,平均正确率从 50% 多提高到 60% 多,仍远非完全切分。末尾缩短的损害支持边界预期冲突解释:听者预期边界处元音拉长,把该处压短会破坏切分。首音节缩短的不显著不能解读为证明无效应,只能说在当前样本量、当前压缩比例和当前测试 power 下未发现明确作用,待更大样本或不同压缩比例验证。原文讨论还引用基音变化度研究作平行支持:词内基频变化小、跨词变化大时切分更好,与中间缩短提示内部的逻辑一致,但那是独立研究的证据,不能与本实验数字混在同一模型列下比较。

百分点与相对百分比的区别要明确:中间缩短比控制高约 9.72 个百分点,若换算相对提升约为 17% 左右,但原文只报告平均正确率与回归系数,未报告相对百分比,复述时不自行推广相对百分比作为主结论。

哪些推论还只是可能,需要补什么验证?

需要区分 3 层表述。直接报告的是 4 组正确率与回归显著性,用报告或显示表达。有限解释的是普通话经验迁移:普通话三音节词中间音节经常缩短,听者把这种缩减内化为整体性线索,用支持表达。未验证推测的是缩短与低基音变化度是否协同增强切分,或时长与基频哪个权重更大,用可能或待验证表达。

基音变化度 × 时长缩短: 基音变化度分工是通过基频稳定性提示整体性:词内基频变化小、跨词变化大;时长缩短分工是通过中间音节变短提示内部性。二者搭配的理由是它们都是非显著的内部一致性线索,不依靠把边界拉长来吸引注意,组合意义在于作者提出普通话听者可能用多维度的内部缩减与稳定模式来识别完整词,未来需要检验二者是叠加还是互相竞争。

具体缺项包括未测量误判类型,未报告逐词正确率差异,未测量反应时、认知负荷或学习速度,未报告训练资源与推理开销,因为本研究是人类行为实验,不涉及模型训练成本与部署延迟,不能承诺这些量得到改善。总体趋势不等于每组每步都成立:中间缩短组均值最高不代表每名被试都高于控制组均值,原文个体点图提示组内变异存在,但无像素可核,只能依据文字说明组内有分布。

跨语言推广是主要边界。作者指出荷兰语等语言在重音位置的塞音可能出现短嗓音起始时间与弱送气,与普通话首音节 lengthening 标初的模式不同;匈牙利语等有音位时长对立的语言对时长线索用法不同。因此中间缩短偏好可能根植于普通话三音节缩减模式,是习得的语言特定策略,还是识别内部结构的普遍认知策略,待跨语言比较验证。非声调语言、不同缩减习惯的语言需要重复实验才能回答。

复现先做什么:材料、流程与分析清单

复现应先重建材料。动作一是按原文六词六部词表准备音节录音,找 1 名台湾普通话男声逐音节录制,在 Praat 中把每音节归一为 300 毫秒,辅辅音与元音各 150 毫秒,基频压平为 130 赫兹平调。动作二是生成 4 种学习流:控制流全保持 300 毫秒,其余 3 流分别把每词的首、中、末音节压到 150 毫秒。动作三是按转移概率结构拼接,词内转移概率 1.0,跨边界约 0.2,词间无停顿,总时长 11 到 12 分钟。

接着复制流程。招募普通话母语、无听力言语障碍被试,随机分 4 组,建议每组 30 人以对齐原文 power。隔音室戴耳机呈现,指导语强调注意听后面要测。测试用三十六试次二选一,每试次呈现一词一部词,间隔 500 毫秒,顺序平衡,测试刺激用中性非缩短形式。记录二值正确与错误,不只记录平均分,以便拟合混合效应逻辑回归。

分析时以控制为参照,固定因子为条件,随机截距至少包含词,报告系数、标准误、z 与 p。复现检查点是能否重现中间高于控制、末尾低于控制、首部接近控制的排序。若要扩展,先只改一个维度,例如改变压缩比例或加入基频起伏,再观察位置效应是否保持。资源状态说明:本次收到的证据中没有绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,复现需自行按文字重建。

何时值得尝试这种内部缩减线索?

综合判断是缩短的位置决定其作为切分线索的极性。中间缩短对齐高可预测的词内位置,增强整体识别;末尾缩短冲突听者对边界拉长的预期,损害切分;首部缩短在本实验中无明确作用。这支持显著 lengthening 标边界与非显著缩减标内部的分工模型,而不是单一的长即边界规则。

何时值得尝试:在处理普通话三音节复合词或类似内部缩减系统的语言时,若目标是把高频共现的音节序列捆成整体,可以考虑在合成或增强中保留或适度强化中间缩减,而不是把所有音节拉齐等长。在教学或听力训练中,可提醒学习者注意中间变短不等于词边界。何时不值得:在边界处需要清晰断词时,避免压缩尾音节,因为这可能削弱结尾提示。

还需补的验证包括缩短与基音稳定性的联合实验、不同压缩比例的剂量反应、跨语言重复,以及自然语流中多线索共存时的权重估计。复述方法时记住核心数字:控制 50% 5.56、首部 50% 5.46、中部 65.28%、末尾 50% 2.87,以及对应的回归显著性。只有在同样转移概率结构、同样归一化与同样测试形式下,这些数字才可直接比较。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总