英文题目:On the Relationship between Breathing and Prosody in the CAPIL Corpus
会议身份:
conference:speechprosody:2026:conference-paper-id:redford26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #统计分析 #韵律 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Melissa Redford:机构信息未能从会议 PDF 纯文本可靠映射
- Bess Frerichs:机构信息未能从会议 PDF 纯文本可靠映射
- Kristopher Kyle:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为自发叙述与说明言语的同步声学波形与胸腹呼吸运动学信号,输出为呼吸组层面的韵律分句、音高变化与音高重置预测,难点在于区分生理容量约束与言语运动规划对韵律的驱动方向。方法链先以声学停顿与运动学极值独立切分话语与呼吸周期,再对齐为单次呼气言语加前置吸气的呼吸组,使呼吸深度预测量进入后续建模。接着经Momel与INTSINT算法将连续基频建模为调音目标序列,并提取短语数与基频极差作为韵律变量。最后对比语言学单因素与加入吸气深度的混合效应模型,以检验呼吸增量解释力与年龄交互。相对已有成人小样本生理相关研究,关键机制差异是以儿童与成人发育对照检验方向性,若儿童耦合更弱则支持交际驱动而非容量约束,实际意义在于提供规划成熟证据。在CAPIL语料分句建模任务下,呼吸主效应模型的指标χ2为23.36,高于加入年龄交互后增量模型的指标χ2的13.63。结论适用边界受限于西海岸美式英语叙述与说明语体及五岁与青年对照,尚未验证其他年龄语言与对话互动的外推,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://praat.org — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
呼吸和韵律到底在争什么?
这篇论文的输入是同步采集的说话声音与呼吸运动信号,目标是判断呼吸与韵律之间是否存在函数关系,以及这种关系是生理约束塑造韵律,还是交际需要反过来调度呼吸。作者必须保留的信息是研究对象为儿童与成人发展性差异,语料为即将通过 TalkBank 公开的儿童与成人短语、吸气与语言语料库,分析单位是呼吸组。输出是 3 个 utterance 层面的韵律变量的模型比较结论。
对刚入门的同学,白话先行:韵律在这里不是抽象的音乐感,而是可以数出来的三件事。第一是短语划分,1 次呼气里被静默停顿切成几段。第二是音高变化,1 次呼气里基频目标点拉开的范围。第三是音高重置,本次开头音高减去上次结尾音高。呼吸也不是感觉到的深呼吸,而是胸腹带记录的电压波形从波谷到波峰的幅度。
理解这项任务不能只把声音丢给模型,因为声音本身不记录吸了多少气,也无法区分长句子是因为词多所以停顿多,还是因为吸得深所以能说更多。论文把声学切分与运动学切分独立进行,再用时间对齐拼在一起,正是为了解开这个混淆。如果只看声音,会把生理准备误当成语言规划。
前人把呼吸放在韵律的哪一侧?
论文回顾了两条经典路线。一条认为呼吸节律为韵律短语提供生物基础,肺容积与声门下压的关系为跨句子的基频变化和句首高音提供生物基础。另一条路线报告说话时呼吸明显不同于静息,成人说话时呼气相约为吸气相的 9 倍,而静息接近 1 比 1,且吸气深度随将要说的信息长度变化,即使统计或实验控制起始肺容积后仍然如此。
这两条路线对应两种因果猜测。生理约束说认为肺小、气少直接限制了能说多长、音高能拉多开。交际 imperative 说认为大脑皮层对呼吸有言语运动控制,会为了把话说清楚而提前调整吸气。论文采用发展性检验逻辑:如果生理约束主导,肺更小的儿童应表现出更紧的呼吸韵律耦合;如果交际控制主导,运动规划尚不成熟的儿童应表现出更弱的耦合。
同输入同目标的对照是德语的 utterance 规划研究与吸气时长和 utterance 时长关系研究,它们都把呼吸测量与声学测量配对。不同的是本文把年龄作为关键分组,把语体与词数或边界强度作为必须控制的语言变量,再用是否加入呼吸预测因子来做增量检验。
要回答的具体问题是什么?
论文把大问题拆成 3 个可检验的小问题。第一,句前吸气深度在控制上 1 次呼气深度后,是否还能预测本次呼吸组的短语数。第二,同样条件下是否还能预测本次的基频极差。第三,是否能预测跨呼吸组的音高重置。每个问题都要求先建一个只含语言因子的模型,再建一个加入呼吸因子的模型,看后者是否显著多解释一部分方差。
关键操作定义需要记准。呼吸组被定义为单次呼气周期内产生的言语,且前面有 1 次吸气。短语划分被操作为 utterance 内静默停顿数加一,因此是离散计数。音高变化被操作为 utterance 内 INTSINT 目标点的基频范围,单位为赫兹。音高重置被操作为本次第一个目标点的绝对基频减去上一个 utterance 最后一个目标点的绝对基频,同样是赫兹差。
年龄差异的判断标准也事先写明。不是比较儿童与成人谁的短语更多,而是比较吸气深度与呼气深度效应的强度与斜率是否随年龄组变化。只有当年龄与呼吸的交互显著改善拟合,才认为发展性差异支持其中一种方向解释。
从人到呼吸组:全流程如何走通?
先看整体安排。60 名说话人包含 30 名儿童与 30 名成人,儿童年龄从 5 岁 1 个月到 6 岁 10 个月,平均 5 岁 9 个月,成人从 18 岁到 24 岁 5 个月,平均 20 岁 7 个月。所有人为西海岸标准美式英语母语者。采集包含实时讲述两段黏土动画与回答描述解释性提示的说明性言语,每人叙述约 5 分钟每段,说明每题 3 到 5 分钟,实验者会用开放问题追问。呼吸用呼吸感应体积描记术经胸腹两条带记录,声学经领夹麦克风与 Zoom F1 记录,运动学信号与话筒信号同采样 44,100 每秒再降采样到 100 每秒用于分析。
下图是理解切分与标注的关键,它把波形、语图与多层标注放在同一时间轴上,初学者应沿着时间从左向右看 1 次完整的吸气呼气与停顿文本如何对应。
看图路径: 1. 先看上两道波形:声波振幅与语图加蓝色基频线的对应关系;2. 再看下三道标注:C 单元层、停顿与文本层、吸气呼气层如何对齐;3. 核对停顿层 1 与 0 的含义:有吸气与无吸气;4. 观察呼吸层标注的振幅起止数值,理解深度如何从电压差得到
论文图 1。原论文 Figure 1:“Speech acoustic and breathing waveforms were independently segmented into pause-delimited utterances and inhalation- exhalation intervals, respectively.”。
该图上半为声波形与语图加蓝色基频线,下半为 4 层标注。第一层为 C 单元边界,第二层为停顿与转写文本并用 1 与 0 标记该停顿有无吸气,第三层为运动学判定的吸气呼气区间及其起止振幅,第 4 层标记实验者言语。独立切分的意义在于声学停顿与运动学吸气不互相定义,只有对齐后才能发现无声但无吸气的停顿,以及有吸气但被文本层忽略的间隙。后续所有呼吸组文件都从这套对齐结果自动切出。
呼吸组与语言单位如何各司其职?
第一组概念是分析单位的双轨制。声学侧按静默停顿切出 utterance,呼吸侧按波谷波峰切出吸气与呼气,再把两者时间锁定后按呼吸组重切。文本按 CHAT 与实验室规范转写,并按 SALT 规范标记 C 单元。停顿是否含吸气依据独立运动学切分编码为 1 或 0,呼吸区间的起止振幅以伏特为单位写入标注层。
呼吸组 × C 单元: 呼吸组是按 1 次呼气周期切出的语音段,前有 1 次吸气,负责给出呼吸可测量的分析单位;C 单元是按表达完整思想切出的语言段,负责给出句法语义边界,两者搭配的理由是同一段语音可以同时从生理供气和语言完整性两条线切分,组合意义是能把音高重置放在语言边界上检验,而把短语数量和音高变化放在呼吸供气上检验,避免把边界效应误读成呼吸效应。
沿一个样本走一遍有助于记住顺序。假设 1 名儿童在看动画时说出一段话,声学上先出现一段可懂语音,接着静默,再出现下一段。运动学上在第一段之前有一个从低到高的波形,在段与段之间可能有小吸气或完全没有吸气。系统先分别标出声学停顿与运动学吸气,再把两者压到同一时间轴,最后以 1 次吸气加随后 1 次呼气内的语音为一个呼吸组文件。这样做的代价是切分错误会累积,因此后续排除了振幅不可靠的区间。
吸气与呼气深度如何量化与标准化?
第二组概念是呼吸预测因子的构造。吸气从局部极小标到局部极大,呼气从局部极大标到局部极小,深度取振幅差。分析时把这两个深度在说话人内做标准化,得到 z 分数,目的是消除不同人带子松紧与体型带来的量纲差异,使回归系数可比。控制上 1 次呼气深度的理由是把它当作起始肺容积的代理变量,避免把站在高肺容积起跑线上误读成这次吸得深。
吸气深度 × 呼气深度: 吸气深度指本次呼吸组之前吸气从局部极小到局部极大的振幅变化,负责表示为本次说话准备了多少气;呼气深度指上一个呼吸组呼气的振幅变化,负责代理起始肺容积,控制上次把气用到什么程度,两者搭配的理由是只看吸气会混入起始位置不同的影响,组合意义是把起始肺容积固定住之后再看新吸入的气量是否还能预测韵律。
沿同一样本继续走。当前呼吸组的前 1 次吸气深度记为本次预测因子,上一个呼吸组的呼气深度记为控制因子。如果当前停顿内出现多次吸气,则该样本被剔除,因为此时无法用单一呼气深度代理起始容积。论文报告这类剔除共 743 例,其中儿童 567 例且多与叙述语体有关,提示儿童在观看动画时会出现先停下来看画面再多吸几次的情况。
本研究训练了什么?没有训练什么?
本研究没有训练神经网络,也没有更新声学模型权重,不存在梯度路径、参数冻结或早停需要报告的环节。真实计算过程分为标注计算与统计建模两类。标注计算是规则与算法调用:用 Praat 做切分转写,用 Momel 与 INTSINT 插件提取每 utterance 首末目标、最小最大与均值基频。统计建模是用 R 的 lme4 拟合混合效应模型,用 MuMIn 比较模型,用 lmerTest 检验固定效应,用 ggplot2 作图。
Momel × INTSINT: Momel 负责把连续基频曲线拟合成平滑的宏韵律成分并找出调目标时刻,INTSINT 负责把这些目标点离散编码成音调符号,两者搭配的理由是连续曲线直接算极差易受微扰和倍频错误影响,组合意义是先建模再取首末目标、最小最大与均值,使音高变化与音高重置都建立在同一套语言无关的目标点上。
需要补的缺项是作者未报告 Momel 与 INTSINT 的内部阈值与倍频纠正细节,只说明对音高变化分析额外排除了最大目标基频超过 500 赫兹的 utterance,视为可能的倍频错误。这意味着音高提取不是可学习的,而是把已有算法当作固定测量工具调用。混合效应模型的随机结构为说话人随机截距与语体随机斜率,若最大随机结构不收敛则简化为只有随机截距。这一点对复现很重要,因为随机结构不同会轻微改变标准误。
数据规模、分组与剔除条件是什么?
本节回答用多少数据、在什么条件下比较。原始自动切分得到 14,825 个 utterance 文件,成人 6,669 个,儿童 8,156 个,其中 59% 来自叙述,成人叙述占 60.7%,儿童叙述占 57.7%。随后 3 轮剔除:含实验者言语 2,536 个,其中儿童 2,333 个且多与说明性语体追问有关;句前静默含多次吸气 743 个,其中儿童 567 个且多与叙述有关;呼吸振幅不可靠 2,091 个,其中儿童 1,498 个且多与叙述有关。
剩余 9,455 个呼吸组用于分析,成人 5,697 个,儿童 3,758 个。最终进入模型的完整数据为短语与音高重置 7,941 个,音高变化 6,587 个。
语言模型 × 呼吸纳入模型: 语言模型只用年龄组、语体和词数或边界状态预测韵律,负责给出不用呼吸也能解释的基线;呼吸纳入模型在同一基线上再加吸气深度与上 1 次呼气深度,负责检验呼吸是否带来额外解释力,两者搭配的理由是直接回归无法区分长句子本身需要深吸气,组合意义是用嵌套模型比较的卡方检验把呼吸的增量方差分离出来。
下表把文件数与剔除链条放在一起核对,阅读时先确认成人与儿童的基数差异,再看剔除是否不成比例地落在儿童一侧,这直接影响结论的适用边界。
| 条件 | 指标 | 成人 | 儿童 | 合计 |
|---|---|---|---|---|
| 自动切分 | 可用 utterance 文件数 | 6,669 | 8,156 | 14,825 |
| 保留 | 呼吸组数 | 5,697 | 3,758 | 9,455 |
表后需要强调代价与公平条件。儿童保留率明显低于成人,且剔除集中在需要实验者追问的说明语体与需要长时观看的叙述语体,说明儿童数据更难采到干净的长呼吸组。模型比较的公平条件是同一批完整数据上先拟合语言模型,再加两个呼吸因子,随机结构保持一致。短语与音高变化的语言模型固定效应为年龄组、语体、每 utterance 词数及其交互,音高重置的语言模型固定效应为年龄组、语体与语言边界状态。
吸气越深,短语划分有何变化?
先看短语划分的主结果。语言模型已包含年龄组、语体与词数,加入句前吸气深度与上 1 次呼气深度后拟合显著提升,卡方为 23.36,自由度为 2。进一步加入年龄组与呼吸的双向交互后拟合再次显著提升,卡方为 13.63。最终模型的固定效应解释约 11% 的方差,条件解释约 14.4%。词数效应为正,吸气与年龄的交互表明吸气对短语的效应在成人中更强。
下图直接显示这种年龄调节,读图时不要把离散的短语数误读成连续变量,纵轴的整数带是计数结构造成的堆叠。
看图路径: 1. 先确认横轴为组内标准化的吸气深度,纵轴为每呼吸组短语数;2. 比较左右两面板蓝色拟合线的斜率:成人更陡;3. 注意儿童面板右侧大吸气深度处样本稀疏且置信带变宽
论文图 2。原论文 Figure 2:“Phrasing (N per BG) varies systematically with pre- utterance inhalation depth, albeit differently across age groups.”。
该图左右分别为儿童与成人,横轴为标准化吸气深度,纵轴为每呼吸组短语数,蓝线为趋势,灰带为不确定区间。可见成人面板蓝线更陡,儿童面板在右侧大吸气处样本极少且灰带明显变宽。结合回归系数,词数每增加一个单位对短语的推动远大于吸气的作用,说明语言长度仍是主导因素,呼吸提供的是显著但幅度有限的增量。
下表把 3 个韵律变量的模型比较放在同一口径下,比较的是可运行的嵌套模型,而非事后最优值,指标方向是卡方越大、p 越小表示加入呼吸后解释力提升越多。
| 韵律变量 | 模型比较 | 卡方值 | p 值 | 建模样本量 |
|---|---|---|---|---|
| 短语划分 | 呼吸纳入对比语言模型 | 23.36 | 小于 0.001 | 7,941 |
| 短语划分 | 再加年龄与呼吸交互 | 13.63 | 小于 0.001 | 7,941 |
| 音高变化 | 呼吸纳入对比语言模型 | 6.37 | 小于 0.05 | 6,587 |
| 音高重置 | 呼吸纳入对比语言模型 | 7.19 | 小于 0.05 | 7,941 |
| 音高重置 | 增量方差 | 极小 | 显著但可忽略 | 7,941 |
表后解释收益与反例。主要收益在短语划分,呼吸显著且年龄交互显著。反例是音高重置虽然卡方显著,但边际决定系数增量小于 0.001,实际可忽略,且其中显著的是上 1 次呼气深度而非本次吸气深度,说明不能把该显著性当成呼吸驱动重置的证据。
吸气越深,音高变化与重置如何?
音高变化的结果是吸气有效但年龄交互无效。加入呼吸后卡方为 6.37,p 小于 0.05,呼吸与年龄的双向交互未进一步改善拟合。最佳呼吸模型的总体解释约 26%,但固定效应只解释约 9%,其余来自随机效应。更深的句前吸气对应更大的音高变化,系数为 2.59 赫兹,标准误为 1.02。词数效应同样显著且量级更大,系数为 49.56 赫兹。
下图显示音高变化随吸气深度的分布,阅读时先确认纵轴是原始赫兹极差而非相对改变量,向上才是变大。
看图路径: 1. 确认纵轴为基频极差,单位为赫兹,横轴仍为标准化吸气深度;2. 观察散点在零附近高度密集,说明大吸气是少数情况;3. 比较两面板蓝色线的正斜率与灰色置信带的宽度差异
论文图 4。原论文 Figure 4:“Pitch change (f0 range) varies systematically with pre-utterance inhalation depth.”。
该图左右仍为儿童与成人,横轴为标准化吸气深度,纵轴为基频极差。散点在零附近形成高密度垂直带,说明多数呼吸组的吸气接近个人均值,大吸气是尾部事件。两面板蓝线均为正斜率,但儿童右侧置信带迅速张开,表明大吸气处估计不稳。论文同时报告音高变化随词数系统变化,因此在复述时必须同时提到词数控制,否则会夸大呼吸的独立作用。
音高重置的结果需要单独强调其失败面。呼吸纳入模型卡方为 7.19,p 小于 0.05,但增量不足千分之一。上 1 次呼气深度系数为 3.58 赫兹且显著,本次吸气深度系数为负且不显著。同时年龄组、语体与语言边界均显著,其中 C 单元边界效应为负,与预期的重置方向相反。作者进一步检查前后边界音调后推断语料存在上扬语调,特别是在 C 单元边界处以升调结尾,这为负的边界效应提供了有限解释,但仍属于事后观察而非预注册验证。
拿掉词数与边界控制后还能看到什么?
本节按论文特有的对照组织。论文没有做去掉呼吸预测因子的反事实消融之外的神经模块消融,但做了两种关键对照,第一是语言基线本身的效应,第二是呼吸因子内部谁在起作用。短语模型中词数效应为 β = 0.347,SE = 0.053,z = 6.54,p < .001,音高变化模型中词数效应为 β = 49.56,SE = 6.31,t = 7.87,p < .001,说明无论是否加入呼吸,长度都是最稳的预测因子。音高重置模型中边界状态为 β = -9.39,SE = 2.76,t = -3.40,p < .01,年龄组与语体也显著,说明跨 utterance 的音高更多被语言与语体结构牵引。
下图把词数对短语的作用可视化,可视为对呼吸效应的参照系,读图时注意横轴为每呼吸组词数而非吸气深度,纵轴为每呼吸组短语数。
看图路径: 1. 确认横轴换成每呼吸组词数,纵轴仍为每呼吸组短语数;2. 观察两面板蓝色线都明显上扬,说明词数效应比呼吸更直观;3. 注意儿童面板横轴范围更短,成人面板词数延伸更远
论文图 3。原论文 Figure 3:“Phrasing (N per BG) varies systematically with ut- terance length (Words per BG) and by age group.”。
该图左右为 Child 与 Adult 两面板,横轴为 Words per BG,纵轴为 Phrases per BG,每个面板内黑色散点按短语数分层排列并叠加一条蓝色拟合线。两面板蓝线都明显上扬,儿童面板横轴集中在 0 至 2 附近而成人面板延伸更远,成人面板在高词数端仍保持上扬且散点覆盖到更高短语数。若只看呼吸而不看此图,会误以为深吸气直接创造短语,而实际上词数同时推高吸气需求与短语数,论文用语言模型与呼吸模型的嵌套比较正是为了在词数之后再看呼吸的增量,短语分析基于 N = 7,941,音高变化分析基于 N = 6,587。
表后必须点出的未胜出项集中在呼吸内部。短语的呼吸主效应为 χ2(2) = 23.36,p < .001,年龄与呼吸交互进一步改善拟合,χ2(2) = 13.63,p < .001,其中交互项为 β = -0.065,SE = 0.020,z = -3.31,p < .001。音高变化的呼吸主效应为 χ2(2) = 6.37,p < .05,深吸气对应更大极差,β = 2.59,SE = 1.02,t = 2.52,p < .05,但呼吸与年龄的交互未改善拟合,只能说成人更强的趋势,不能当作显著差异报告。音高重置的呼吸效应为 χ2(2) = 7.19,p < .05,∆R2m < .001,其中上次呼气深度为 β = 3.58,SE = 1.34,t = 2.68,p < .01,而本次吸气深度为 β = -1.04,SE = 1.53,t = -0.68,p = .496,不能用呼吸显著的总卡方来背书吸气的作用。训练或部署成本方面论文未报告时长与算力,混合模型在上述样本量上可常规运行,但这不等于实时系统的延迟结论。
哪些边界尚未被验证?
首先是测量边界。呼吸深度以伏特振幅表示并在说话人内标准化,没有换算成毫升肺容积,也未用实验控制固定起始肺容积,而是用上 1 次呼气深度代理。这种代理在多次吸气的停顿中失效,而这类样本已被剔除,因此结论只适用于单次吸气接单次呼气的干净呼吸组。
其次是样本与语体边界。儿童剔除比例更高,最终建模样本成人更多,说明性语体中儿童高度依赖实验者追问,叙述语体中儿童会停下来看动画。这些都会使儿童长 utterance 的代表性弱于成人。语体作为固定效应已控制,但追问带来的话轮切换是否改变呼吸计划,论文未单独建模。
第三是韵律测量的边界。500 赫兹以上的最大目标被当作倍频错误剔除,这会同时去掉部分真实的高音,儿童高音受影响可能更大。音高重置出现负的 C 单元边界效应与上扬语调的解释,需要独立的语调标注来验证,目前只是检查前后音调后的有限解释。相关性也不等于因果,论文用发展性差异做方向推断,但未操纵吸气深度,因此只能说结果支持交际控制说,而不能证明深吸气必然导致更多短语。
要复现这项研究先做什么?
复现的第一步是拿到数据与工具链。论文称语料正在准备通过 TalkBank 公开,当前应按文中引用去核对是否已可下载,不可默认已公开。声学标注需用 Praat 按 CHAT 与实验室规范转写并标记 C 单元,呼吸需用胸腹带以 44,100 每秒同步采集再降采样到 100 每秒,胸腹增益调到对信号贡献相等。切分规则要原样执行:吸气为局部极小到局部极大,呼气反之,起止振幅保留伏特值,停顿有无吸气记为 1 或 0。
第二步是重建呼吸组文件与清洗链。按单次呼气加前 1 次吸气自动切分,然后按同一顺序剔除含实验者言语、句前多次吸气、振幅不可靠 3 类,再对音高变化分析额外剔除最大目标超过 500 赫兹者。呼吸深度在说话人内标准化,短语数记为停顿数加一,音高变化记为目标极差,音高重置记为本次首目标减上次末目标。
第三步是重跑嵌套混合模型。短语用泊松广义线性混合模型,音高变化与重置用线性混合模型,固定效应与随机结构按上文设置,最大随机结构不收敛时退到只有说话人随机截距。用 MuMIn 做卡方比较,用 lmerTest 看固定效应,并报告边际与条件决定系数。何时值得尝试这类方法:当研究问题涉及长句规划与停顿分布,且能同步采到可靠呼吸信号时,加入呼吸的增量检验才有意义;若只有音频而无运动学,不应凭空推断吸气深度。
这篇论文最终支持哪一侧?
综合 3 组结果,吸气深度显著预测短语划分与音高变化,但不预测音高重置。关键的方向证据来自年龄交互:短语划分上成人效应更强,音高变化上也有成人更强的趋势。如果生理约束主导,肺更小的儿童应耦合更紧,观察到的恰好相反,因此作者认为结果支持交际 imperative 说,即随着言语运动规划成熟,说话人更能策略性地协调呼吸与语言以实现交际目标。
对初学者可复述的方法链是:同步采集,双轨切分,对齐成呼吸组,Momel 与 INTSINT 提取目标,语言模型打底,呼吸模型看增量,年龄交互判方向。需要保留的限定是词数仍是更强的预测因子,音高重置的呼吸效应可忽略且方向异常与上扬语调有关,儿童结论受高剔除率限制。未来的验证应补上肺容积标定、语调类型标注与实验性操纵吸气,才能把当前的相关性支持推进到因果层面。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 32 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



