英文题目:Discourse Context in the Perception of Mandarin Tone-Intonation Ambiguity

会议身份:conference:speechprosody:2026:conference-paper-id:qu26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Yining Qu:机构信息未能从会议 PDF 纯文本可靠映射
  • Laurel Brehm:机构信息未能从会议 PDF 纯文本可靠映射
  • Geoffrey Raymond:机构信息未能从会议 PDF 纯文本可靠映射
  • Argyro Katsika:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

普通话基频同时承载字调与句调,句末上升既可解析为阳平也可解析为疑问语调,输入为男声语境句加女声目标句的短对话,输出为目标句陈述与疑问的二选判断,难点在于声学线索模糊时语用预期会系统性重塑感知。方法链分三步衔接:先以听说式与坦白式语境句建构听者与说者在事件上的知识优势差异,其输出作为话语一致性条件;再呈现末字为声调2或声调4且语调正交操纵的目标句,使同一音段只差语调;最后采集辨认率与按键延迟并用混合效应模型检验语用一致性与声调语调的交互。相对已有语义限制语境研究,该设计将语境上移至话语语用预期层面,并以一致与冲突配对直接观察错误归因,因而能分离声学歧义与预期偏差的贡献。在声调与语调正交操纵的在线辨认任务下,一致问句中声调2相对声调4的反应时指标为0.09,高于冲突问句中声调2相对声调4的反应时指标-0.09。该结论的适用边界受限于受控朗读语料与无形态标记极性问句,对自然对话韵律、其他声调组合及跨方言的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么会听错?

这篇解读的输入是论文原文提供的被试、材料、流程与统计证据,目标是让刚进入语音与音乐音频领域的研究生能按原文复述方法并理解结论边界,必须保留的信息是实验条件、比较公平性与关键数字,输出是一套可核对的中文技术说明。本文只讲论文实际做的普通话语调辨认任务,教学用的举例会明确标为例子。

普通话用音高同时做两件事,先用白话说清楚。声调是音节层面的声调,英文为 lexical tone,负责区分字词意义,例如同样音节走高平、上升、低降升或下降会变成不同字。语调是句子层面的语调,英文为 intonation,负责表达陈述还是疑问等交际功能。论文指出陈述句典型是下降轮廓,无形态标记的极性疑问句典型是上升轮廓。问题在于两者都主要编码在基频上,英文为 F0,当句末音节本身就是上升的声调 2 时,句末上升既可以被听成词的声调,也可以被听成疑问的语调,于是产生歧义。

相反,句末是下降的声调 4 时,疑问的上升会与下降叠加,常形成被压平的下降,反而成为较明显的线索。论文引用已有行为与事件相关电位证据说明声调 4 结尾的疑问句比声调 2 结尾更容易辨认。

声调 × 语调: 声调负责区分音节的字词意义,分工在音节层面的音高走势,语调负责表达句子层面的交际功能,分工在整句的音高走向,二者都主要用基频实现所以会共用同一条音高曲线,搭配研究它们的理由是普通话里升调既可能是声调 2 的词性上升,也可能是疑问语调的句末上升,组合意义在于把歧义定位到句末音节,判断听者到底把上升归因给哪一层。

为初学者举一个例子帮助定位,但不是论文数据。例子:若听到句末明显上扬,听者要决定这个上扬属于最后一个字的声调,还是属于整句在问问题。论文的任务就是把这种归因过程放到对话语境中检验,看上文是否会改变听者对下文升降的归属。

已有路线解决了什么,还留下什么缺口?

已有路线主要沿语义语境走。论文回顾指出,粤语研究发现强偏向语义语境能提高词汇识别,普通话研究发现语义限制语境能提高疑问语调识别的正确率与速度,尤其在声调与语调线索冲突时。这些工作报告的共同点是语境限制了句末音节的字词身份,从而间接帮助判断。

论文指出的缺口有两层。第一,语义语境限制的是词,而话语语境建立的是对整句语调的语用期待,两者不是同一机制。第二,已有工作多比较中性语境与限制性语境,较少系统检验语境与声学线索直接冲突时会发生什么。本文因此不重复语义启动研究,而是操纵上文与下文在认知立场上是否一致,直接看语境期待与声学证据打架时听者如何加权。

本文要回答的具体问题是什么?

本文要回答的是话语语境是否以及如何改变普通话声调与语调歧义的知觉。具体操作是让被试听简短对话,先听语境句再听目标句,然后判断目标句是陈述还是疑问。目标句在语调与句末声调上变化,语境句在认知立场上变化,两者配对构成一致或不一致条件。

认知立场先用白话解释,英文为 epistemic stance,指说话人展示自己相对谁更了解某件事。论文依据互动语言学观点,陈述常展示知者姿态,英文为 K+,表示在断言信息,疑问常展示不知者姿态,英文为 K-,表示在寻求信息。通过操纵语境句把听者或说话人摆在知者或不知者位置,就能让上文在语用上更期待一个陈述或更期待一个疑问。

方法全景:一个试次如何从听到按鍵走完?

沿一个样本走完输入到输出。输入是一个对话音频,先播放男生说的语境句,间隔 500 毫秒后播放女生说的目标句。表示阶段是听者在听觉上同时拿到语境的立场信息与目标句的声调加语调信息。组件阶段是听者把语境期待与目标声学线索整合,做出陈述或疑问的类别判断。目标是按键选择,关键动词是判断指定说话人的话是否为陈述或疑问。输出是记录按键类别与从音频播完到按键的延迟。

认知立场 × 语用一致性: 认知立场负责刻画说话人与听者谁更了解某件事,分工是给上文定出期待疑问还是期待陈述的方向,语用一致性负责检查上文期待与目标句实际语调是否同向,分工是把期待变成可操作的实验条件,二者搭配的理由是只有先用立场造出明确期待,才能定义一致与不一致试次,组合意义在于把抽象语境变成可以比较反应时与正确率的对照。

实验采用 2 乘 2 乘 2 析因设计,3 个因子是目标句末声调为声调 2 还是声调 4,目标语调为疑问还是陈述,语境与目标在语用上一致还是不一致。因变量有两个,辨认率定义为每种条件下回答与目标预定语调相符的百分比,反应时定义为从音频播放结束到按键的毫秒延迟。为避免重复效应,采用拉丁方设计,把关键刺激分到 8 个平衡列表,每名被试只听每个词项的一个版本,每人共 96 个试次,含 48 个关键试次与 48 个填充试次,顺序随机。

语境句与目标句各自控制了什么?

语境句全部是 21 音节的陈述句,由男生朗读。48 个词项每个都出现在结构 A 与结构 B 两种构造中,对应不知者与知者立场,共形成 96 个语境句。结构 A 用相当于我听说的四音节短语开头,暗示说话人知识是间接的,把听者摆在更了解事件的知者位置,从而在语用上更期待后文出现疑问。结构 B 用相当于说实话的四音节短语开头,暗示说话人基于直接经验表达情绪,把听者摆在刚被告知的不知者位置,从而更期待后文出现陈述。为减少词汇启动,两种开场短语各用 12 个同义表达,每个出现 4 次,另用 12 个双音节情绪词平衡积极消极中性,48 个双音节关系词与 48 个七音节事件描述增加多样性。

目标句全部是六音节同构句,结构为他或她加双音节动词加完成体标记了加双音节名词,例如他打碎了花瓶,由女生朗读。每个词项有两个声调版本,句末名词首音节固定为声调 1 以减少对句末声调的影响,句末音节为声调 2 或声调 4。每个词项又有语调版本,陈述版与疑问版在音段上完全相同,只在语调上不同。论文写明每个词项产生 4 个版本,总计 152 个目标句,此处保留原文数字写法,不做算术修正。

声调 2 × 疑问语调: 声调 2 负责在音节内实现上升,分工是提供词义层面的上升证据,疑问语调负责在句末实现上升,分工是提供句式层面的上升证据,二者搭配的理由是当它们同时出现在句末时声学上都是上升,听者无法只靠音高形状区分来源,组合意义在于形成双重上升叠加的歧义条件,与声调 4 的下降形成对照,用来检验歧义程度如何调节语境权重。

填充刺激共 48 个,遵循同样对话模式并匹配关键刺激的 utterance 长度,一半是男疑问加女陈述,一半是男陈述加女疑问,疑问句覆盖带吗或呢、A 不 A 与疑问词等多种常见问句,用来维持任务多样性并防止被试猜到关键试次只判断女生话语的规律。录音由 1 名北京出生的男声与 1 名北京出生的女声在隔音室完成,采样率为 44,100 Hz,用 Praat 录制,要求中性语气不强调特定词,剪除首尾静音并在说话人内与说话人间做幅度归一化。

本研究训练了什么,没有训练什么?

本研究没有训练神经网络模型,也没有更新声学模型权重、微调参数或学习率调度,因此不存在梯度路径、参数冻结与解冻、早停或优化器选择的报告。该节的真实计算过程是统计建模与多重比较校正。

论文用 R 的 lme4 软件包对辨认率与反应时分别拟合线性混合效应模型,英文为 linear mixed-effects models。固定效应为句末声调、语调与语用一致性,随机截距为被试与项目。先拟合包含全部主效应与交互的最大模型,再用 R 的 drop1 函数选择最优模型。两两比较用 emmeans 获得并做 Holm 校正,显著性水平为 0.05。原文未报告随机斜率的具体结构、残差分布检查细节与效应量换算,因此不能从模型名称推定其对非正态或异方差的处理,本解读只保留原文明确给出的卡方值、估计值、标准误与 p 值。

线性混合效应模型 × Holm 校正两两比较: 线性混合效应模型负责同时估计声调、语调、一致性等固定效应并容纳被试与项目的随机差异,分工是给出总体效应是否显著的判断,Holm 校正两两比较负责在多组对比中控制错误发现,分工是回答具体哪两格之间真的有差,二者搭配的理由是先有整体模型筛选再做细格对比才不易夸大偶然差异,组合意义在于把原始按键数据变成可复述的效应估计与显著性陈述。

被试、流程与测量如何保证条件可比?

被试为 80 名在大陆出生长大的普通话母语者,其中男性 43 人女性 37 人,平均年龄 25.1 岁,标准差 6.02,范围 18 至 55 岁,均自报右利手、听力正常、视力正常或矫正正常,参与获得报酬并签署知情同意。实验在 Qualtrics 在线问卷平台进行,要求被试在安静环境用电脑完成,先做 8 个练习试次熟悉任务,正式实验 96 个试次分 4 组呈现,组间短暂休息。

每个试次先有 200 毫秒前置间隔,然后播放音频,语境句先播,间隔 500 毫秒后播目标句。播放时屏幕显示蓝色进度条表示正在听,播完变绿并出现文字提示要求判断男生或女生的话语。关键试次一律判断女生目标句,填充试次一半判断男生话语以保持参与度。按键为 F 键判陈述,J 键判疑问,按键后经 800 至 1200 毫秒随机试次间隔进入下一试次。反应时只计音频播完到按键的延迟,分析前剔除短于 500 毫秒或长于 5,000 毫秒的极端反应。

实验后收集人口学与语言背景问卷。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按原文方法复现流程。

一致语境是否更快更准?声调与语调有何不对称?

先提出比较问题与公平条件。本节比较一致与不一致配对在相同声调与语调格内的差异,指标方向是辨认率越高越好,反应时越低越好。因为拉丁方保证每名被试只听每个词项一个版本,且填充试次平衡了判断对象,格间比较不受词项重复与任务预期的系统污染。

辨认率的最优模型包含声调、语调与一致性主效应及声调乘语调交互,含被试与项目随机截距。一致性主效应显著,卡方为 1658.27,声调乘语调交互显著,卡方为 22.92。两两比较显示声调 2 在陈述中比声调 4 辨认差,在疑问中差距更大,疑问比陈述在声调 4 中辨认差,在声调 2 中差距更大。图前导读如下:下图为辨认率柱状图,左右分陈述与疑问面板,每面板内分声调 4 与声调 2 两组,每组内比较一致与不一致两柱,纵轴越高表示越能按预定语调答对,请先看一致柱是否整体远高于不一致柱,再看疑问加声调 2 的不一致柱是否为全图最低。

看图路径: 1. 先看横轴四组:左侧陈述下声调 4 与声调 2,右侧疑问下声调 4 与声调 2;2. 再比较每组内粉色一致柱与紫色不一致柱的高低与误差线长短;3. 重点观察疑问加声调 2 的不一致柱是否降到最低;4. 核对纵轴是辨认率百分比,越高表示越符合目标语调

原论文 Figure 2:Mean identification rates (%) by final lexical

论文图 2。原论文 Figure 2:“Mean identification rates (%) by final lexical”。

上图显示一致配对的四柱都接近顶部,不一致配对明显下移,且疑问加声调 2 的不一致柱降得最深,与正文报告的声调 2 疑问句在冲突语境中准确率低相吻合。误差线在不一致条件下更长,提示冲突带来更大变异。结合估计值看,声调 4 与陈述语调独立提高辨认率,上升叠上升的组合受损最大,说明歧义程度调节了错误率。

辨认率 × 反应时: 辨认率负责回答按目标句预定语调答对的比例,分工是衡量最终判断是否被语境带偏,反应时负责回答从音频播完到按键经过多少毫秒,分工是衡量判断过程是否费力或是否走了捷径,二者搭配的理由是只看对错会漏掉自信的错误,只看快慢会漏掉方向的错误,组合意义在于共同揭示声调 2 疑问句在冲突语境中错得快这一关键模式。

下表整理辨认率两两比较的估计值,正值或负值方向表示参照组差异,标准误与 p 值保留原文写法,比较对象为原文实际可运行的实验条件,不引入事后最优或外部基线。表前已说明比较问题为同格内声调与语调差异,公平条件为拉丁方与随机截距控制,指标方向为估计值绝对值越大表示组间差距越大。

条件指标陈述中声调 2 对声调 4疑问中声调 2 对声调 4声调 4 中疑问对陈述与声调 2 中疑问对陈述
声调与语调交互辨认率模型估计值-0.60,标准误 0.14,p 小于 .001-1.56,标准误 0.15,p 小于 .001-1.12,标准误 0.14,p 小于 .001 与 -2.08,标准误 0.15,p 小于 .001

表后解释如下:该表的主要收益是量化不对称,声调 2 的劣势在疑问中被放大,疑问的劣势在声调 2 中也被放大,支持上升叠上升最难的判断。具体代价是这些估计值来自混合模型的参数尺度,不是原始百分比差,不能直接读成百分点,百分比层面的直观差距需看柱状图。未胜出项是声调 4 疑问句虽然相对较好,但在不一致语境中辨认率仍大幅低于一致条件,说明即使声学线索较明显,语境冲突依然造成损失。

反应时能否排除速度与准确率的简单交换?

本节按反证组织:若不一致只是让人更谨慎,则应看到更慢且更准或至少不更快地犯错;若语境直接改写了知觉,则可能看到错得快。测的是同格内一致与不一致的反应时差异,条件一致性与上一节相同,指标方向为毫秒数越小越快。

反应时的最优模型为最大模型,包含声调、语调、一致性及全部交互,随机效应为被试与项目,卡方为 4.65,p 为 .03。两两比较显示不一致配对在除声调 2 疑问句外的所有组合中都显著减慢反应,声调 2 疑问句的一致与不一致差异不显著,估计值为 -0.04,标准误 0.03,p 为 .24。一致疑问中声调 2 比声调 4 慢,估计值为 0.09,不一致疑问中声调 2 反而比声调 4 快,估计值为 -0.09,不一致陈述中声调 2 比声调 4 有边缘更快趋势,估计值为 -0.06。只有在声调 2 加一致条件下疑问比陈述慢,估计值为 0.10,其余语调差异不显著。

图前导读如下:下图为反应时柱状图,面板与分组与辨认率图对应,纵轴为毫秒数,柱越高表示从播完到按键越慢,请先看前 3 组的不一致柱是否高于一致柱,再单独检查最右侧疑问加声调 2 组两柱是否几乎等高。

看图路径: 1. 先看横轴同样四组与纵轴反应时毫秒,柱越高表示判断越慢;2. 再比较每组内深蓝一致柱与浅绿不一致柱的高低;3. 重点观察疑问加声调 2 组两柱是否几乎等高;4. 检查误差线是否在不一致条件下更长,提示变异更大

原论文 Figure 1:Mean reaction times (ms) by final lexical

论文图 1。原论文 Figure 1:“Mean reaction times (ms) by final lexical”。

上图显示陈述加声调 4、陈述加声调 2、疑问加声调 43 组都呈现不一致柱明显高于一致柱,唯独疑问加声调 2 组两柱高度接近,这与正文报告的声调 2 疑问句在冲突语境中反应相对快相吻合。该模式不支持简单的谨慎权衡解释,因为最难的格子没有用更长时间换取更高正确率,而是快速倒向语境预测的竞争语调,论文将其解释为听者把该目标听成了符合语境的另一种语调,属有限解释而非直接观测到内部表征。

下表整理反应时关键两两比较,保留原文估计值与显著性写法,用于核对错得快是否只出现在特定格子。表前比较问题是冲突是否一律减慢判断,公平条件与剔除极端反应规则同前,指标方向为毫秒延迟。

条件指标除声调 2 疑问外的不一致效应一致疑问中声调 2 对声调 4不一致疑问中声调 2 对声调 4
语用一致性与声调交互反应时模型估计值p 小于 .001 减慢,仅声调 2 疑问为例外0.09,标准误 0.03,p 为 .0025 更慢-0.09,标准误 0.03,p 为 .0052 更快

表后解释如下:主要收益是定位例外格,只有声调 2 疑问句在不一致时没有变慢且相对声调 4 更快,支持语境权重在高度歧义时上升的观点。具体代价是反应时只从音频结束起算,不包含句内在线加工时间,不能推断听者在听到句末之前的期待强度。未评测边界是自然对话中的轮替 timing 与说话人适应未被纳入,在线实验的播放间隔固定为 500 毫秒,可能与真实互动节奏不同。

哪些结论不能超出证据?

论文直接报告的是在线辨认任务中的一致性效应、声调 4 优势、陈述优势及声调乘语调交互,这些有统计估计支持。论文的有限解释是听者动态调整声学与语境权重,以及声调 2 疑问句在冲突中被听成竞争语调的一致实现,这些是对错得快模式的合理说明,但未用独立测量验证内部表征,应用可能或待验证的语气表达。

未验证推测包括把实验室效应直接推广到自然对话韵律,以及把我听说与说实话两种立场标记视为同等强度的期待。论文自己承认目标句是孤立录制而非在完整话语中录制,虽有助于分离语境贡献,但缺少轮替 timing 与 interlocutor 适应等自然因素。论文还指出认知立场是梯度而非类别,传闻表达通常传达更弱的中介性知识,因此两种语境构造可能在期待强度上不对等,未来需把梯度作为实验变量。相关性不等于因果,语境与判断相关不证明语境单向决定知觉,声学细节仍在起作用。未测量误判率之外的延迟成本、训练资源与部署开销,因此不能承诺该范式能改善识别系统延迟或成本。

若要复现,应先固定哪些细节?

复现先做材料与流程固定。按原文用 48 个词项构造 96 个 21 音节语境句,两种开场各备 12 个同义表达,情绪词平衡积极消极中性,目标句用六音节他或她加双音节动词加了加双音节名词结构,句末名词首音节固定声调 1,句末对比声调 2 与声调 4,每词项录陈述与疑问两个音段相同版本。录音用北京口音男女声各 1 名,采样率 44,100 Hz,中性语气,剪除首尾静音并做幅度归一化。

流程固定 200 毫秒前置、语境先播、500 毫秒间隔、目标后播、播完进度条变绿再提示判断对象,关键试次判女生,填充试次半数判男生,按键 F 为陈述 J 为疑问,试次间隔 800 至 1200 毫秒随机,练习 8 试次,正式 96 试次分 4 组。分析固定辨认率按预定语调计分,反应时从播完起算并剔除短于 500 毫秒或长于 5,000 毫秒,模型用 lme4 分别拟合,固定效应三因子,随机截距被试与项目,经 drop1 选最优并用 emmeans 做 Holm 校正。还需补的验证是换用对话中录制的目标句检验生态效度,以及量化两种立场标记的期待强度差异,避免把不同强度的语境混为单一一致性因子。

何时值得借鉴,常见误解是什么?

当研究问题涉及声调语言中句末升降归因,或需要在识别与合成中引入话语期待时,值得借鉴本文的一致性操纵与双因变量设计。它提醒模型不能只靠句末音高形状做语调分类,还需接入上文立场与声调身份,因为上升既可能是词也可能是句。复现优先级是先保证音段相同只变语调的材料,其次是拉丁方与填充平衡,最后才是混合模型细节。

论文特有的误解需要澄清。第一,声调 4 疑问句相对好认不等于不受语境影响,不一致时其辨认率与反应时同样恶化。第二,声调 2 疑问句在冲突中反应快不等于听得好,而是可能快速接受了错误的语境预测,需同时看辨认率才能发现。第三,总体趋势不等于每格成立,反应时的三重交互说明语境权重随歧义程度变化,不能把一致更快推广到所有格子。本文的贡献在于显示话语层语用线索同样塑造语调解释,局限在于孤立录音与立场强度未量化,未来工作应在更自然的话语录音与梯度立场设计中检验其稳健性。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 17 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总