英文题目:Towards an understanding of prosodic cue weighting for turn-end classification in older adults with varying hearing abilities
会议身份:
conference:interspeech:2026:conference-paper-id:curetti26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #韵律 #言语感知 #语音 #轮次切换
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Lorenza Zaira Curetti:机构信息未能从会议 PDF 纯文本可靠映射
- Hae-Sung Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Lauren V. Hadley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理老年听众仅凭韵律判断话轮是否结束的任务,输入为语义相同的陈述疑问句录音,输出为完成或延续二分类,难点在于剥离词汇句法后边界线索微弱且听力损失可能改变线索可靠性。方法链分为三步:先用在线数字三联音测试划分听力正常与听力损失组,再呈现40组完成与延续配对刺激并要求判断说话人是否讲完,最后提取目标词时长与强度及末尾音高上升时长与音程并用基于秩的回归关联逐项正确率。机制差异在于典型听力组依赖边界强度即时长与强度的交互,而听力损失组依赖音高运动即上升时长与音程,提示损失不是整体敏感性下降而是加权重塑。在包含112名55至75岁被试的话轮完成延续分类任务下,典型听力组的准确率为61%,高于听力损失组的准确率54%。结论仅适用于无上下文的单说话人英语陈述疑问句朗读语音,未验证自发对话、多说话人或助听补偿下的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:只听韵律能判断话说完了吗?
本解读的输入是这篇探索性研究的完整正文与 3 张官方原图像素,目标是让刚进入语音、音乐、音频领域的研究生能复述方法并核对条件,必须保留的信息是被试划分、刺激构造、4 种韵律测量、统计模型与分组回归结果,输出是按学习依赖展开的中文技术讲解。论文研究的任务不是语音识别或说话人识别,而是会话轮替结尾分类:听者听到一句陈述疑问句的片段,仅凭韵律判断说话人是已经说完还是被截断在延续点。举例来说,同样听到 She plays football 这段声音,如果它来自 She plays football?
的句末,韵律上应带有强边界;如果它来自 She plays football for England?中 football 之后被截断的位置,韵律上应带有弱边界。教学例子仅用于说明任务逻辑,不代表原文录音的具体数值。白话来说,韵律线索就是语调、时长、响度随时间的变化模式,英文名 prosodic cues。
语调短语边界是强边界,英文为 intonational phrase boundary,缩写 IP;中间短语边界是弱边界,英文为 intermediate phrase boundary,缩写 ip。初学者容易误以为响度大就代表强调或结束,原文恰恰把强度下降的拖尾弱化当作完成线索来检验。
语调短语边界 × 中间短语边界: 语调短语边界指与话轮结束对齐的强边界,承担终结标记分工,表现为更长的末端延长和更明显的弱化;中间短语边界指延续点处的弱边界,承担句内连接分工,延长和弱化都较弱。二者搭配的理由是本研究的结束与延续刺激在词串相同,只在目标词右边缘对齐的边界等级不同,组合意义是把话轮是否结束的操作定义转化为可测量的边界强度差异。
论文的起点是听力损失不一定只是让声音变小或变模糊,还可能改变听者依赖哪些维度。作者引用了线索权重思想:当某个维度不可靠或多变时,听者会提高更一致维度的相对贡献。对老年感音神经性听力损失而言,频谱分辨率下降与动态范围改变会影响音高与强度信息的获取,但较慢的时间包络线索常相对保留。因此关键问题被拆成两个可检验的部分:总体分类能力是否下降,以及即使总体能力相近,预测正确率的声学维度是否发生转移。这决定了后文既要报告敏感度,也要对每个组分别做以声学测量预测条目正确率的回归。
与哪些路线相关:边界声学与听损后的权重转移有何证据?
第一条相关路线是短语边界的声学描写。英语强 IP 边界通常比弱 ip 边界有更大的末端延长与弱化,即时长增加、强度下降,音高运动的形状与音程是区分边界对比的主要线索,完整陈述疑问句常有更长或更大的末端上升。这些描写为本研究选择 4 种测量提供了依据,也解释了为何作者把目标词时长与强度归为边界强度,把末端上升时长与音程归为音高运动。第二条路线是听力损失与韵律感知。
已有工作报告听损与情绪韵律、语调与重音对比敏感度下降有关,但不同维度受影响不均:音高敏感度易受限,慢速包络敏感度相对保留,人工耳蜗使用者与听损听者会转向时间包络并降低对精细音高变化的权重。第三条路线是轮替 timing。已有会话数据显示听损对话者的轮替 timing 更可变,但其感知基础不清,可能是识别不出结尾,也可能是用不同方式识别结尾。
本文的增量是把自然产生的结束与延续配对起来,让词串相同而韵律不同,再把条目正确率与声学维度直接关联。
线索权重 × 感知可靠性: 线索权重指分类决策中每个声学维度所占的相对贡献,感知可靠性指该维度在当前听觉条件下有多一致、可用。搭配理由是当某线索变得多变或不可靠时,听者会动态提高更一致线索的权重,组合意义是把听力损失理解为不只是敏感度下降,而是可靠性变化驱动的权重重塑。
时间包络线索 × 时间精细结构: 时间包络线索指较慢的整体幅度起伏如词时长,分工是传递边界与节奏,在感音神经性听力损失中常相对保留;时间精细结构指快速的频谱细节如精细音高,分工是传递准确的基频细节,易受频谱分辨率下降影响。二者搭配的理由是解释为何时长本应可用却未被听损组使用,组合意义是区分保留了什么与实际使用了什么。
需要提醒初学者:相关性不等于因果,文献中观察到的权重转移支持本研究的解释方向,但本研究本身是观察性关联设计,没有操纵某个线索的可用性,因此不能证明听力损失必然导致某种权重。作者也明确将其定位为探索性研究。
要回答的具体问题是什么:能力差还是依据变了?
论文把大问题操作化为两个层面。第一个层面是行为总体表现:老年典型听力组与听力损失组在只听韵律时,能否高于机会区分结束与延续,敏感度与反应偏向是否有组间差异。原文把结束刺激当作信号,把延续刺激当作噪声,用 d 撇号表示敏感度,用 C 表示偏向。第二个层面是条目水平的线索使用:目标词时长、目标词强度、末端上升时长、末端上升音程这 4 个测量,能否预测每个条目被正确分类的比例,以及这种预测关系是否随组别与刺激版本而不同。
作者事先决定结束与延续分开建模,理由是两类刺激的韵律结构系统不同,合在一起可能掩盖条件特异效应;同时两组分开建模,理由是对高阶交互的统计功效有限。初学者要记住这种分开不是事后挑选,而是方法部分预先说明的分析策略。论文还明确了反证标准:如果延续项的模型拟合很弱或无显著预测量,说明所选测量主要刻画完成线索而非延续线索;如果两组敏感度相近但显著预测量不同,则支持权重重塑而非全面衰退的解释。
方法全景:从一个样本走完输入到输出
沿一个样本走一遍流程最容易建立整体感。假设目标词是 football,录音者先用自然语速读出完整版 She plays football?,其中 football 位于句末 IP 边界前;再读出延续版 She plays football for England?,其中 football 位于句中 ip 边界后还接 for England。
然后把延续版在目标词之后截断,使被试听到的词串与结束版在语义上相同,但保留了原来的延续韵律。所有刺激做响度归一化并加 5 毫秒起落门以去除边缘瞬态。被试在线佩戴耳机,在舒适响度下先按开始键听刺激,可无限重播,再二选一回答说话人是将继续还是已结束。研究者随后从每个刺激的目标词区间提取 4 个声学值,再计算每个条目在每个组内的正确率,最后用基于秩的回归检验哪些声学值能预测正确率。
听力分组来自在线数字三联测试的信噪比阈值,而非实验室纯音测听。整个链条是输入语音波形到韵律表示,到行为判断,再到条目正确率与声学测量的关联,没有训练神经网络。 下面这张刺激示意图是理解截断设计的关键,上面板是结束版,下面板是延续版的完整未截断形态,实际实验中延续版只呈现到目标词结束处。
看图路径: 1. 先对比上面板 A 与下面板 B 在 football 之后是否还有 for England 的语谱能量;2. 再看叠加的黑色 f0 圆点在目标词段的走向:A 是陡峭即时上升,B 是平台或缓升后才接句末上升;3. 核对横轴 Time(ms) 与左侧 Frequency(Hz)、右侧 f0 Hz,确认前文 She plays 段在两版中保持平缓上升的一致性
论文图 1。原论文 Figure 1:“Spectrogram and f0 contours for a (A)”。
上图用语谱图加黑色 f0 圆点同时显示能量与音高。前文 She plays 在两版中都保持平缓上升,说明录音者按要求尽量保持目标词之前一致;目标词 football 的重音音节都带有降升调且配对内形状一致,区别在重音之后:结束版是更陡更即时的上升,延续版是平台或平缓上行再接入句末上升。这种设计把词串、重音位置、轮廓形状尽量固定,只留下边界强度与上升轨迹的差异,使后文回归系数的解释可以归因于韵律而非词汇。
四个韵律测量如何计算:边界强度与音高运动各管什么?
4 个测量的白话含义需要先讲清。目标词时长记作 Ttw,单位毫秒,指目标词区间的持续时间;目标词强度记作 dBtw,单位分贝,指该区间的平均强度;末端上升时长记作 Trise,单位毫秒,指从最后 1 次上滑起点到最大值的时间;上升音程记作 STrise,单位半音,指这段上升跨越的音高距离。
因为语调运动可能超出词边界,作者在必要时调整了目标词边缘以完整包含相关音高轮廓,再用 Praat 中的 ProsodyPro 提取 Ttw 与 dBtw,并刻画 Trise 与 STrise。初学者注意半音不是赫兹差,而是对数音程单位,适合跨说话人比较音高跨度。
边界强度 × 音高运动: 边界强度由目标词时长 Ttw 和平均强度 dBtw 承担分工,刻画右边缘停顿前的延长与拖尾弱化;音高运动由末端上升时长 Trise 和音程 STrise 承担分工,刻画最后上滑有多长、多大。二者搭配的理由是前者需要对照语速和先前响度的内在预期,后者更像直接跟踪一条动态轨迹,组合意义是让回归可以分别检验听力组是否从需要预期的维度转向可直接跟踪的维度。
短语末端延长 × 短语末端弱化: 短语末端延长指边界前词时长增加,分工是提供完成的最稳健线索;短语末端弱化指边界前强度下降,分工是提供拖尾结束感的辅助线索。二者搭配的理由是英语强边界常同时出现延长与弱化且呈负相关,组合意义是典型听力组的 dBtw 与 Ttw 交互正是对这种互补整合的直接检验。
原文报告的描述统计显示,结束项比延续项有约 80 毫秒的中位末词延长和约 9 半音的中位音程增大,符合 IP 而非 ip 边界的描写;结束项中 Ttw 与 dBtw 负相关,符合延长与弱化共现;延续项中 Trise 与 STrise 正相关,符合更长上升常伴随更大音程的趋势。这些相关都不超过 0.8,等效线性模型的方差膨胀因子都低于 1.8,因此 4 个预测量都保留在初始模型中。复述时要强调提取区间经过人工调整,不是简单的词对齐输出,这一步影响 Ttw 与 dBtw 的数值,但原文未给出逐条调整量,属于复现时需要按同样原则重新实现的细节。
本研究训练了什么:无神经网络时的真实计算是什么?
本研究没有训练声学模型或分类器,training 一节的任务是明确说明未训练什么以及实际做了哪些计算,避免把统计建模误当作模型训练。未训练的部分包括:没有端到端神经网络,没有微调语音编码器,没有学习刺激本身的参数,录音是真人按韵律目标自然产生的。实际执行的计算有 3 类。
第一类是听力筛查计算:在线数字三联测试呈现准随机数字三联体加言语形噪声,数字不含双音节 seven,信噪比从负 16 分贝起始,在负 25 到负 6 分贝之间按一上一下自适应 25 个试次,取第 7 到 25 试次的平均信噪比为阈值。第二类是声学测量计算:如上一节所述的区间调整与 ProsodyPro 提取。
第 3 类是统计建模计算:用 Rfit 包拟合基于秩的回归,预测量先做 z 标准化,完整模型为正确率对 dBtw 与 Ttw 的交互加 Trise 与 STrise 的交互,再用 drop.test 做向后消除,只保留去掉后显著降低拟合的项,显著交互再按正负 1 标准差做简单斜率分析。没有梯度路径、参数冻结或早停的概念,显著性水平为 0.05。由于原文未报告随机种子与自适应试次的具体伪随机序列,在线复现只能保证协议一致,不能保证试次级完全相同。
实验条件:被试、分组、试次与注意力控制如何保证可比?
被试通过 Prolific 在线招募,纳入条件为 55 到 75 岁、英国国籍、英语母语、居住在英格兰,通过数据质量筛查后共 112 人进入分析。分组完全依赖数字三联测试分数,以负 17.1 为界,对应约 20 分贝高频纯音损失,阈值以上为典型听力,以下为听力损失。全样本中位分数为负 16.9 分贝,范围从负 24.3 到负 6 分贝,说明尽管听音设备不一,两组人数仍较均衡。听力损失组含 14 名双侧助听器使用者,平均使用 9.1 年,范围 1 到 35 年,但实验时均不佩戴助听器。
刺激共 40 个条目,每个条目有结束与延续两版,共 80 个录音,由 1 名标准南方英国英语男声录制,该说话人具备语调分析专长,以舒适语速朗读。每个条目含 1 到 3 音节、首音节重读的目标词,结束版目标词在句末,延续版目标词在延续点。分类任务含 3 个练习试次加 44 个正式试次,其中 40 个主试次含 20 结束与 20 延续,每人只听每个目标词的一个版本,试次顺序随机但连续不超过 3 个同类;另有 4 个 catch 试次,每 7 个主试次出现 1 次,加入 200 毫秒 1 千赫纯音要求按 beep 键,只有答对至少 3 个才保留数据。
被试需戴耳机并在开始时设为舒适音量,主试次可无限重播。比较公平性依赖三点:词串相同化、响度归一化到负 23 响度单位相对满刻度、版本在被试间平衡。局限是实验为更大在线研究第一会话的一部分,约 20 分钟,环境控制弱于实验室。 为核对人数、年龄与分组阈值,把原文连续句中的关键数字整理成下表,表头单位按原文保留,裸值不擅自加单位。
| 组别 | 人数 | 男性人数 | 平均年龄 | 分组阈值与对应听力含义 |
|---|---|---|---|---|
| 典型听力 TH | 55 | 27 | 61.3 yrs | DTT cutoff −17.1,对应约 20 dB 高频纯音损失 |
| 听力损失 HL | 57 | 32 | 60.5 yrs | DTT cutoff −17.1,对应约 20 dB 高频纯音损失 |
| 全样本 | 112 | 未按总数报告 | 未报告全样本均值 | 中位−16.9 dB,范围−24.3 到−6 dB |
表后需要说明代价与边界:在线分组用阈值 2 分可能掩盖听力与权重间的渐变关系,原文讨论部分明确承认这一点;助听器使用史跨度大且测试时不佩戴,其长期可塑性影响未建模;舒适音量自设意味着呈现级在被试间不一致,中位分数接近阈值也提示两组在边界附近可能混杂。
未胜出或未评测的边界是原文未报告年龄、性别与设备类型的协变量效应,也未用连续听力指标建模,这些都是复现时可补的验证。
主结果:总体能力相近但预测维度分离
先看总体行为。敏感度组间无显著差异,典型听力组 d 撇号为 0.28,听力损失组为 0.10,两组都显著高于机会,平均正确率分别为 61% 与 54%。反应偏向组间也无差异,但两组都有轻微把刺激判为结束的倾向,C 分别约为负 0.08 与负 0.09。初学者要分清百分点与相对百分比:61% 与 54% 差 7 个百分点,不是差 7%;d 撇号是敏感度指标,不是正确率本身。
作者的解释是 IP 边界线索比 ip 延续线索更强更一致,在无词汇句法语用上下文时,听者更倾向扫描完成线索,这也预示延续模型可能拟合不佳。 下表把总体表现与偏向放在同一行内比较,指标方向是 d 撇号越大越敏感,C 负值表示倾向判为结束,p 越小越不支持零假设。
| 组别 | 平均正确率 | 敏感度 d' | 高于机会的 p | 偏向 C 与 p | 组间差异 p |
|---|---|---|---|---|---|
| TH | 61% | 0.28 | p < 0.001 | C = −0.08, p = 0.016 | 敏感度组间 p = 0.12 |
| HL | 54% | 0.10 | p = 0.03 | C = −0.09, p = 0.015 | 偏向组间 p = 0.74 |
表后解释主要判断与限制:支持的判断是仅凭韵律已足以支撑高于机会的分类,且组间总体能力差异未达显著。
限制是正确率仅适度高于机会,估计稳定性有限,且 d 撇号数值本身较小,不能夸大为强分类能力。未胜出项是组间比较的 p 值未显著,不能据此声称两组能力相等,只能说在当前样本与任务下未检出差异。 再看条目水平的回归,这是全文最强的证据。延续刺激在两组中都没有显著预测量,所有 p 都不小于 0.32,拟合很弱,典型听力组 R 平方 0.07,听力损失组 R 平方 0.09。结束刺激在两组都达到中等拟合,典型听力组 R 平方 0.28,听力损失组 R 平方 0.24,但保留的预测量完全不同。
典型听力组最终模型只保留 dBtw 与 Ttw 及其交互,其中 dBtw 主效应为负,交互为正;听力损失组最终模型只保留 Trise 与 STrise 两个主效应,且都为负。换句话说,典型听力组靠边界强度,听力损失组靠音高运动。 下面这张图显示典型听力组中强度效应如何被时长调节,横轴是目标词强度,纵轴是条目正确率,颜色表示时长。
看图路径: 1. 先看横轴 dBtw(dB) 从 68 到 73 与纵轴 Accuracy 从 0.4 到 0.8 的分布范围;2. 再对比虚线 -1 SD Ttw 的下行斜率与实线 +1 SD Ttw 的近水平线;3. 注意右侧色条 Ttw(z-score) 表示每个散点目标词时长的标准化位置,深蓝多集中在低值区
论文图 2。原论文 Figure 2:“Relationship between dBtw and accuracy for TH, shaded by Ttw (z-scored), with regression lines for low (−1 SD) and high (+1 SD) Ttw.”。
可见虚线代表短时长条件,正确率随强度上升而明显下降,文中描述约从 0.8 降到 0.5;实线代表长时长条件,正确率稳定在约 0.7 附近,强度效应不显著。简单斜率分析量化为短时长下 dBtw 斜率负 0.069 且显著,长时长下斜率接近 0 且不显著。教学含义是时长与强度被当作互补线索:充分延长已是强完成信号时不再需要强度,延长不足时才依赖低强度所暗示的拖尾结束感。原文还指出音高上升在此组不显著,可能是因为在其他语调语境中大而陡的上升反而是延续线索,其歧义导致被降权。 下面这组图显示听力损失组中两个上升指标的负效应,左为时长,右为音程,黑线为回归估计。
看图路径: 1. 先看左图 A 横轴 Trise(ms) 约 100 到 420 与右图 B 横轴 STrise(ST) 约 12 到 18 的取值范围;2. 再看两图黑色回归线都随上升变长或变大而向下,纵轴 Accuracy 多在 0.4 到 0.8 之间;3. 注意左图左下角与右图中间偏下的低准确率离散点,说明负趋势存在较大的试次间变异
论文图 3。原论文 Figure 3:“Relationship between (A) Trise or (B) STrise and accuracy for HL. Lines represent regression estimates.”。
可见上升越短或音程越小,结束项正确率越高,Trise 系数负 0.032,STrise 系数负 0.028。作者对此感到意外,因为按理夸张的上升应更易辨认,推测可能是频率与响度失真使过大的运动反而不可靠,中等上升更易用,但强调这需要系统操纵上升特征的后续实验来澄清。初学者不要把向下曲线直接读成性能随时间变差,这里的横轴不是时间进程而是不同条目的声学值,向下只表示该声学值越大则该条目正确率越低。
为便于 1 次性核对回归数值,把结束与延续模型的拟合与系数整理如下,系数为 z 标准化后的值。
| 条件与组别 | 模型拟合 R²与 p | 保留预测量 | 系数 β 与 p | 方向含义 |
|---|---|---|---|---|
| TH 结束 | R² = 0.28, p = 0.007 | dBtw 主效应 | β = −0.033, p = 0.023 | 强度越低越易判对结束 |
| TH 结束 | R² = 0.28, p = 0.007 | dBtw×Ttw 交互 | β = 0.036, p = 0.007 | 长时长时强度效应消失 |
| HL 结束 | R² = 0.24, p = 0.005 | Trise | β = −0.032, p = 0.015 | 上升越短越易判对结束 |
| HL 结束 | R² = 0.24, p = 0.005 | STrise | β = −0.028, p = 0.029 | 音程越小越易判对结束 |
| 两组延续 | R² = 0.07 与 0.09 | 无显著项 | all p ≥ 0.32 | 所选测量不预测延续正确率 |
表后必须讲代价与反例:主要收益是分离模式清晰,延续模型的负结果反而增强了完成模板解释,即听者主要扫描完成线索而非延续线索;具体代价是听损组负效应的方向与直觉相反,且整体正确率不高使小效应稳定性受限。
未评测边界是原文未检验跨组高阶交互,也未检验语速与音节数的归一化方式是否改变 Ttw 效应,这些都留待后续工作。
哪些对照支撑解释:去掉什么后结论会动摇?
论文没有神经网络消融,但有多处方法学对照起到类似作用。第一是多重共线性检查:尽管部分预测量中度相关,但无一超过 0.8,等效线性模型方差膨胀因子都低于 1.8,因此初始模型保留全部四项,避免因共线随意删除而制造分离假象。第二是向后消除:用离散度下降检验决定保留项,最终模型只留下滑除后显著降低拟合的项,这使典型听力组的交互与听损组的双上升效应不是事先指定而是选择结果。
第三是条件分离:结束与延续分开建模,若合在一起,延续的零效应会稀释结束的效应,可能掩盖分组差异。第四是注意力筛查:每 7 个主试次插入纯音 catch 试次,答对少于 3 个剔除,保证在线数据的可用性。
初学者常问能否把听损组对时长的不敏感归因于听不到时长,原文讨论给出反驳:慢速包络敏感度常保留,真正可能的机制是判断延长与弱化需要对照语速、音节数与先前响度的内在预期,若对该预期的信心下降,这些线索会被感知为信息量低,从而转向可直接跟踪的动态轨迹。这一解释标记为推测,原文用可能与待验证的语气表达。另一个未做的对照是用连续听力分数代替二分分组,若权重随听力渐变,当前阈值分组会损失功效;原文在局限中承认这一点。
边界与不确定性:哪些结论不能超出证据?
直接报告的是两组都高于机会、偏向判为结束、结束模型分组分离、延续模型无显著预测量,这些有明确统计量支持。有限解释的是互补线索与权重转移的机制讨论,原文用 plausibly 与 may 等措辞,表明是与文献一致的解释而非本数据唯一证明。未验证推测包括夸张上升因失真而不可靠、中等上升更易用、内在预期信心下降导致时长线索被降权,这些都需要操纵上升特征或测量预期的新实验。方法局限有四点:在线实验限制环境控制。
分组用阈值 2 分而非连续指标,可能掩盖渐变关系;正确率仅适度高于机会,降低小效应敏感度与估计稳定性;刺激只有 1 名男声的陈述疑问句,泛化到女声、其他句型与自发对话需谨慎。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,复现只能依据正文描述重建流程。
此外,原文表头、图注与正文算术未发现需要标注的直接冲突,但中位差约 80 毫秒与约 9 半音是跨条件概括值,不能当作某个具体条目的精确值来复现单点预测。
复现先做什么:按原文重建刺激、测量与分析
复现的第一步是重建刺激集:准备 40 个含首重读目标词的条目,每个条目请具备语调分析能力的说话人以舒适语速读出结束版与延续版,保持目标词之前平缓上升一致、重音音节降升轮廓在配对内一致,再把延续版在目标词后截断,响度归一化到负 23 响度单位相对满刻度并加 5 毫秒起落门。目标词 1 到 3 音节的分布会影响 Ttw 基线,复现时应记录每条目标词音节数与语速,以备检查延长是否需归一化。
第二步是重建测量:必要时调整目标词边缘以包含完整末端上升,再用 Praat 的 ProsodyPro 提取 Ttw 与 dBtw 并计算 Trise 与 STrise,提取前先做 z 标准化之前的原始值存档,以便核对约 80 毫秒与约 9 半音的中位差是否重现。第三步是重建行为协议:在线或实验室呈现时要求戴耳机、自设舒适级、可无限重播,二选一为将继续或已结束,每被试每目标词只听一版,顺序随机且同类连续不超过 3 个,每 7 个主试次插入 200 毫秒 1 千赫纯音 catch 试次,保留至少答对 3 个者。
第四步是重建分组:用数字三联测试 25 试次、自适应一上一下、取后 19 试次均值,以负 17.1 为界划分典型听力与听力损失,并报告全样本中位与范围以检查均衡性。第五步是重建统计:先算 d 撇号与 C 并做组间曼惠特尼 U 与对零威尔科克森检验,再按组按版本拟合基于秩的回归并做向后消除与简单斜率分析。关键超参数与信息条件是显著性 0.05、预测量 z 标准化、交互只在维度内设置。若要补验证,优先补连续听力分数建模与系统操纵上升时长音程的感知实验。
何时值得借鉴:给语音与助听技术研究的启示
当你的任务涉及话轮结尾预测、电话会议中的抢话与等待判断、或助听算法是否保留了完成感时,这篇工作的分离模式值得参考:总体正确率高低不能代替依据是否相同,评估应同时报告敏感度与条目水平的声学预测量。
若只看 61% 对 54% 会得出差异不大的印象,但回归显示两组用了不同维度,这对干预设计有直接含义:增强时长对比或保留拖尾弱化可能更帮助依赖边界强度的听者,而稳定呈现动态基频轨迹可能更帮助依赖音高运动的听者,但这些都是待验证的设计假设,不是本研究已证明的增益。常见误解有 3 个需要纠正:第一,听损组用音高不等于听损组音高感知更好,只是相对更一致可用;第二,强度低代表结束不是绝对阈值,而是与时长互补且只在短时长下显著。
第三,延续模型无显著项不是技术错误,而是提示所选测量与任务指令更偏向扫描完成线索。未来工作应扩大说话人与句型,控制语速与音节数,并在连续听力维度上检验权重渐变,同时测量延迟与误判代价,才能把感知差异与真实对话流畅性连接起来。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


