英文题目:Pitch accent or edge tone? Acoustic cue weighting for perception of Low tonal targets in American English
会议身份:
conference:speechprosody:2026:conference-paper-id:brugos26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Alejna Brugos:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Barnes:机构信息未能从会议 PDF 纯文本可靠映射
- Chris Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Stefanie Shattuck-Hufnagel:机构信息未能从会议 PDF 纯文本可靠映射
- Nanette Veilleux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为重合成英文句Ramona didn’t analyze the nomads,输出是将目标词nomads上低平F0判为核低重音L*还是去重音后L-短语音的二选一,难点在于目标段F0同为低平使高重音峰高线索失效而需依赖远端与局部弱线索。方法链先以强弱基拼接控制片段线索,将中性开头与强弱两种the nomads尾部拼接而开头保持同一中间形态以隔离早期干扰。接着用Praat中PSOLA正交构建5级-e nom-时长连续统与5级Ramona后远端下落斜率F0连续统并重合成150种核心刺激。最后经含多说话人自然例的训练加162试次二选一感知任务,并以贝叶斯混合逻辑回归估计三线索权重及个体斜率与相关。与聚焦高重音峰高突显的既有工作不同,该设计把远端语调形态作为自变量并分离时长与音质,使低调目标的可感知性可被分解检验。在32名有效听者5172试次的感知任务条件下,时长步进的回归系数β指标为1.22,高于远端F0步进的回归系数β指标的.259。结论适用边界仅限单句单男声的受控低调矛盾语境且个体在局部与远端策略上分化明显,自然多线索共变与跨说话人外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么低 F0 区间的突显判断是一个真问题?
输入是本篇论文要解决的感知任务,目标是让刚入门的研究生能复述听者如何判定一段低平 F0 到底是有重音还是无重音,必须保留的信息是任务句、两种轮廓的音系标签、操纵的 3 类线索和群体加个体的统计结论,输出是这篇可核对的技术解读。学习路径先从突显概念的分歧讲起,再进入具体二选一任务,然后展开刺激构造与实验流程,最后用数字讲清主效应与个体差异。
论文研究的不是通用语音情感或通用响度预测,而是美国英语中低调目标的突显归属:在 Ramona didn’t analyze the nomads 这句话里,句末 nomads 上的一段低平 F0,既可以实现为落在 nomads 上的 L* 核音高重音,也可以实现为 Ramona 承载核重音之后由 L-短语重音维持的去重音低谷。初学者容易把听感上更响更凸显直接等同于结构上的核重音,但论文强调自主音段节律模型把调形与节律分开,结构上同为窄焦点的核重音词可以分别戴 L* 或 L 加 H 星,听感权重却可能随调目标种类而变。
已有关于重音拉长、焦点实现和响度时长谁更可靠的研究大多只看高重音,或把高低混在一起建模,得到低重音对突显评分贡献较小的总体印象,却没有回答低 F0 语境下听者究竟靠什么做音系归类。举例来说,同样是否定 nomads 被分析这件事,一种读法是纠正谁做了分析而让 Ramona 对比凸显,另一种读法是整体反驳整个事件而让 nomads 承载低核重音,两者在句末都可以是低的,单看局部音高容易混淆。
核重音 × 短语重音: 核重音指落在承载句子主要突显的词上的音高重音,负责标记该词在韵律结构中的突显地位;短语重音指控制短语边缘音高走向的边界调,不直接标记词的突显而是标记短语右边缘的调形。二者搭配的理由是同一段低平 F0 既可以是 L* 核重音的实现,也可以是去重音后由 L-维持的低谷,论文正是利用这种一形多义来追问听者靠什么把突显判断归给其中之一,组合意义在于把突显感知从只看局部高低转为局部时长节段加远端调形共同裁决。
因此本研究把问题收窄为可操作的二选一:给听者播放经过重合成的同一句话,让其判断说话人是在争论谁分析了 nomads 从而 nomads 去重音,还是在争论被分析的是谁从而 nomads 带 L*。这个设计把抽象的突显结构判断转化为对低平段音系身份的分类,优点是轮廓标签明确、刺激可控,代价是它不等同于自然对话中的焦点理解,结论只在该句式与该对轮廓之间成立。
同输入同目标的已有路线提供了什么对照?
与本研究同输入同目标的路线主要有 3 条。第一条是重音拉长与焦点语音学路线,通常固定一种高重音比较不同焦点或不同突显等级下的时长强度实现,优点是机制清楚,局限是结论难以推广到低重音,因为低目标在强调时是把谷压得更低还是抬高,文献中既有压低的预测也有相反的报告。
第二条是综合建模路线,让 naive 听者给语料中的词打凸显分,再把声学预测量与音高重音类别句法信息结构一起放入模型,这类在德语英语中的研究常报告低重音对评分贡献小于高重音,但它回答的是梯度凸显印象,不是低平段究竟对应哪一个音系范畴。
第 3 条是远端语境路线,在意大利语科森扎方言、德语疑问句和德语核前核后突显关系中发现核前 F0 形状会影响后部调形感知,本文作者此前也提出核后下落斜率可能提示后方是否还有重音,本研究正是把这一远端思想搬到美国英语低目标上。与本研究同运行阶段的还有响度时长与 F0 可靠性的比较,例如有研究认为响度时长比 F0 更可靠,但那是在不区分调目标的总体比较中得出的,不能直接当作低目标的权重。
本研究的差异在于同时操纵局部时长、局部非时长非 F0 节段线索和远端 F0 斜率,并在同一被试内估计各自权重与个体差异,从而补上低 F0 语境证据不足的一块。
突显 × 音高重音类型: 突显在自主音段节律模型中是抽象的节律结构关系,分工是说明哪个成分在结构上更重要;在感知实验传统中有时被直接等同于听到的响亮或凸显程度,分工是给出可打分的梯度印象。二者搭配的理由是低音高重音在节律上可以与高重音同样承载窄焦点核重音,但在听感评分上常被评得较低,组合意义在于提醒不能把低评分直接读成无重音,而要追问不同调目标下提示突显的声学权重是否本来就不同。
对初学者而言,关键对照是输入是否同样是低平目标、目标是否是音系归类而非打分、监督是否来自同一二选一任务。只有满足这些,权重大小才可比,否则只能说趋势方向一致,不能说谁胜谁负。
听者要做的二选一到底是什么?
沿一个样本走完全程有助于建立直觉。输入是一句重合成语音,文字恒为 Ramona didn’t analyze the nomads,听者要在 5 秒内按键回答说话人在反驳哪一部分。表示是 3 种线索的组合状态:目标词 nomads 重读元音所在-e nom-的时长阶梯、Ramona 高峰之后到 the 之前的下落斜率阶梯,以及 the nomads 整段来自强基底还是弱基底。组件是听者的分类决策,把声学证据映射到两个轮廓标签之一。
目标是与设计者预设的端点标签一致:在时长最长、下落最缓、强基底的一端更可能被判为 nomads 带重音,在时长最短、下落最陡、弱基底的一端更可能被判为 nomads 去重音。输出是二选一按键,编码为去重音零与核 L* 一。论文用两个自然轮廓锚定含义:其一是 Ramona 上为 L 加 H 星加 L 减 H 百分号,核重音在 Ramona,nomads 为去重音低谷;其二是 Ramona 上为 H 星而 nomads 上为 L* 加 L 减 H 百分号,核重音在 nomads。前者对应纠正谁做了分析,后者对应整体反驳加疑问式句末上升。
自然产出的图示在原文中给出,但本次没有收到图像像素,因此不描述曲线颜色位置,只依据正文交代两种语用偏向。
L × L-:* L* 是落在重读音节上的低音高重音目标,分工是给 nomads 赋予核突显身份;L-是短语重音性质的低边缘调,分工是把 Ramona 核重音之后直到边界的去重音区间压成低平拖尾。二者搭配的理由是实验把目标词 nomads 的局部 F0 都固定为 100 赫兹左右的平低加句末上升,使局部音高本身无法区分,组合意义在于迫使听者必须动用时长、音质共振峰等节段线索和 Ramona 之后下降斜率这类远端 F0 线索来判定低平段的音系归属。
需要强调的是,局部 F0 在目标词上被固定为从 the 起点约 100 赫兹的平低穿过 nomads 的受重读元音,再以末升到 165 赫兹收尾,因此听者不能靠目标词本身的高低做判断。这种把最直接线索抹平的做法正是实验的用意:把权重逼到时长、音质共振峰强度等节段线索和更早的斜率上,看它们各自能把判断推多远。
三类线索如何分工并合成为一套刺激?
方法全景可以概括为先拼接再重合成。研究者先用 1 名男声录制自然基底,通过剪接制造节段线索的两种底子,再用语音合成方法分别构造时长连续统与 F0 连续统,最后交叉组合成时长 5 步乘 F05 步乘两种基底的刺激空间。时长操纵集中在目标区-e nom-及其前一元音,依据同一说话人多次自然产出的测量值同时做拉长与缩短,共五档,目的是模拟重音拉长。
F0 操纵固定 Ramona 上的 235 赫兹峰与句末低平加末升,只改变峰后下落的斜率,共五档,最陡的一档直接落到 100 赫兹,最缓的一档先在 170 赫兹形成肘部再落到 100 赫兹,依据自然观察与先前假设,最陡接近去重音轮廓,最缓接近带 L* 轮廓。节段操纵则把开头 Ramona didn’t analyze 统一取自第 3 种轮廓的中间时长产出,以控制早期非 F0 线索提前泄露身份,再把后部 the nomads 分别接上强弱两种来源。3 种线索因此正交:时长与 F0 是参数化阶梯,节段是整体底子切换。
局部时长 × 远端 F0 斜率: 局部时长指目标词 nomads 重读音节附近-e nom-各段的拉长程度,分工是自下而上提示该音节是否被加强;远端 F0 斜率指更早的 Ramona 高峰之后向 the nomads 之前下落的陡缓,分工是自上而下提示整个轮廓更像哪一种调形。二者搭配的理由是自然产出中重读低目标与去重音低谷的局部 F0 很相似而早期下落形状不同,组合意义在于检验听者是只看目标音节还是会提前用上下文调形计算出现重音的概率。
从听者视角看,1 次试听先听到相同的开头,再听到斜率不同的下落,随后听到时长与音质不同的低平目标词,最后听到相同的末升,决策必须整合时间上分散的证据。这为后文讨论局部自下而上与远端自上而下两种解释埋下伏笔,也解释了为什么个体可能出现只用后部或只用前部的策略。
强弱基底是怎样剪出来的?
节段线索组件的动作是剪接而非参数合成。强基底的 the nomads 剪自该成分带 L* 的 utterance,弱基底的同样词串剪自该成分去重音呈 L-形态的 utterance,开头部 Ramona didn’t analyze 则都取自带 H 星在 Ramona 而核为降阶 H 星在 nomads 的第 3 种产出,该产出的时长模式介于强弱之间。
原文以表格报告 nomads 中受重读元音的声学差异:弱底子的该元音更气声更中央化,强底子则相对紧敛,表格中给出第一第二共振峰与频谱倾斜谐噪比的具体数值,本次解读不转抄该表矩阵数字,只转述方向,因为原表在结构化证据中被标为表头缺失而不具备安全选择条件,教学上只需记住强弱底子在音质与共振峰上确有可听差异且被整体打包操纵。
这种打包的好处是生态有效,代价是无法分离强度、音质、共振峰各自贡献,论文也明确把它统称为非时长非 F0 的节段线索。剪接点选在 the 之前,保证目标词串完整来自同一来源,避免在词内留下剪接不连续。对复现者而言,关键是必须用同一说话人的多遍录音先确认强弱在时长之外的差异确实存在,再做剪接,否则节段效应可能被说话人或切点差异污染。
强基底 × 弱基底: 强基底指从带有 L* 的自然产出中剪出的 the nomads 片段,保留了除时长和 F0 之外的强度音质共振峰等节段信息,分工是提供偏向有重音的一整包局部非 F0 证据;弱基底指从去重音 L-产出中剪出的同一词串,分工是提供偏向无重音的对应证据。二者搭配的理由是把时长和 F0 都用重合成统一控制后仍需保留自然节段差异,组合意义在于用同一套时长 F0 阶梯分别套在两种节段底子上,分离出节段线索的独立贡献。
该组件与后续重合成的关系是先定底子再套阶梯:时长与 F0 的重合成参数对强弱底子取相同目标值,使同一阶梯编号在两种底子下可比,从而在统计上把节段主效应估计为两条反应曲线的整体上下平移。
时长与 F0 阶梯在合成器里做了什么?
时长与 F0 组件的动作是用 Praat 中的同步叠加法做重合成。F0 连续统保持 Ramona 峰 235 赫兹与初始上升形态不变,只改变峰后到 the 起点之间的下落形状,五档从直接速降到带 170 赫兹肘部的缓降,落点均为 100 赫兹,目标词内部保持 100 赫兹平低,句末统一升至 165 赫兹。时长连续统依据自然产出测量,对-e nom-及前一元音的各段时长按比例拉长缩短做出五档,并通过调整重合成系数使每一档的目标段时长在强弱底子上完全相同,保证时长效应不被底子时长差异混淆。
初学者可以这样理解:F0 阶梯只动上文斜率不动目标高低,时长阶梯只动目标附近长短不动音质底子,二者交叉后每个格点都是一个可播放的完整句子。这种设计使远端与局部在时间上分离,检验远端是否仍能显著推动对后部低平段的归类。论文说明选择远端斜率的部分原因是预实验发现目标词局部 F0 在有无重音时本来就相似,而早期下落差异更显著,这与以往关于拐点调目标与 L-短语重音的讨论相呼应。
复现时需注意峰高、上升斜率与时长、末升高度都被固定,若改动这些会引入新的远端或局部线索,权重估计将不再可比。
没有模型训练时训练一节该讲什么?
本研究没有训练任何声学模型或神经网络,因此本节明确说明无模型训练、无参数冻结更新、无梯度路径、无优化器,也不存在把系统输出当作确定性求解的问题。真实发生的训练是针对人类被试的任务训练,目的是教会美国英语母语者区分两种语用语境。流程分两段:先介绍两种目标轮廓的语境,再用不同说话人不同句子的各 6 个自然产出做反复呈现,要求被试判断每个自然句出自哪种语境,每个样例呈现 3 次但每次都重复直到答对为止。
这种直到答对的训练保证被试进入主任务前已建立标签与语境的对应,但也带来代价,即端点判断可能被训练强化,后文筛选掉端点准确率不足 75% 的被试进一步放大了对能学会者的选择。主任务是二选一分类,每次播放一个重合成刺激,被试在 5 秒内判断说话人在争论谁分析了 nomads 还是谁被分析了,每个独特刺激判断 3 次,端点刺激额外加 3 次重复以提高端点估计稳定性。
需要补的缺项是训练用的自然句清单与呈现顺序未在证据中详述,复现时只能按同类语境自行构造并报告训练通过标准。把人类训练讲清楚同样重要,因为它决定了反应编码中零与一的含义以及后文贝叶斯模型的监督来源。
被试、试次与统计模型如何组织?
实验条件按数据协议组织。被试从在线平台招募 48 名美国英语母语者,年龄 20 至 72 岁,平均约 40.6 岁,含单语与双语背景,主任务共 162 试次,其中 150 为核心试次即五时长档乘五 F0 档乘两种基底乘 3 次重复,另 12 为端点追加重复即两端点组合乘两种基底乘 3 次额外重复,4 个端点刺激各呈现 6 次。筛选后保留 32 人进入分析,剔除 18 名端点 24 试中准确率不足 75% 者,超时导致的缺失为 12 个试次,最终分析样本量为 5172 个反应。
统计采用贝叶斯混合效应逻辑回归,用 R 的 brms 包拟合,预测变量为居中在第三档的时长步数、F0 步数与以弱节段为参照的强弱基底因子,随机结构包括刺激与被试截距及被试对三预测量的随机斜率,不含交互项因其未改善拟合,采样为四链各五千迭代含二千五百预热共一万后验样本,先验为均值零尺度 2 自由度三的学生 t 弱信息先验,报告后验中位数、可信区间与方向概率,以区间不含零且方向概率大于 0.95 为可靠效应。
指标方向是正系数表示更倾向判为 nomads 带重音,时长与 F0 步数越大越偏向重音端,强基底相对弱基底为正向平移。该设置的公平条件在于时长 F0 阶梯在两种基底下取值相同,开头相同,末升相同,唯一系统差异就是 3 类线索本身。未报告的缺项包括硬件与播放设备、报酬、随机顺序种子与超时试次在个体层面的分布,复现时需自行固定并记录。
群体层面哪类线索推得最动判断?
群体问题是 3 类线索是否都显著推动有重音判断、谁推得最多、局部是否整体强于远端。公平条件是同一套刺激空间内比较单位阶梯变化与基底切换,指标方向是判为有重音的比例上升为正效应。结果显示三者都可靠:时长每增一档、F0 每增一档、由弱基底换为强基底都会提高有重音反应比例,时长估计最强,节段居中,远端 F0 最弱,且时长显著强于节段,节段显著强于远端 F0。
反应曲线形态上强弱两条曲线大致平行,说明节段主效应为整体上移而未与时长 F0 形成明显交互,这也是模型不加交互仍拟合良好的原因。教学例子是把端点想象成两端锚:时长第五档加 F0 第五档加?基底的一端有重音比例最高,反之最低,中间档单调过渡,但具体每档百分点需看原图,本文不虚构数值。代价是远端效应虽显著但单位步长变化小,需要多档累积才显现,单凭早期斜率做在线判断的可靠性低于等到目标词出现后的局部证据。
下面这张表把群体估计组织成可比的一行一效应,比较问题是单位线索变化带来多大对数几率偏移,公平条件是同一贝叶斯模型同一样本,指标方向是贝塔为正表示更倾向有重音,可信区间不含零为可靠。
| 线索对比 | 估计量 | 后验中位数 | 90% 可信区间 | 方向概率与方向 |
|---|---|---|---|---|
| 时长每增一档 | 回归系数 | 1.22 | 1.00 至 1.45 | 方向概率 1 为正向 |
| 远端 F0 每增一档 | 回归系数 | 0.259 | 0.142 至 0.375 | 方向概率 1 为正向 |
| 强基底相对弱基底 | 回归系数 | 0.772 | 0.527 至 1.02 | 方向概率 1 为正向 |
| 时长减节段 | 系数差 | 0.445 | 0.162 至 0.755 | 方向概率 1 时长更强 |
| 节段减远端 F0 | 系数差 | 0.512 | 0.198 至 0.788 | 方向概率 0.988 节段更强 |
表后解释需要同时讲收益与代价。主要收益是 3 类线索都有可靠证据,支持低目标突显是多线索共同支撑而非只看音高,局部时长最可靠符合重音拉长的预期,节段打包效应居中说明音质共振峰等信息确有独立贡献,远端显著则支持产出规划与感知中存在跨词调形预期的观点。具体代价是远端单位效应仅约时长效应的五分之一左右,实际应用中若只用早期斜率会漏掉大量局部证据,且平行曲线意味着节段与阶梯无明显协同,简单相加即可描述群体均值,未能揭示个体策略差异。未胜出项是远端 F0,它虽显著但最弱,不能当作首要线索单独部署。
拿掉群体平均后个体还剩什么策略?
个体问题是群体显著是否等于人人都用全部线索,操作是看模型中每名被试对三预测量的随机斜率是否可靠、强度多深、方向是推向有重音还是反向。条件与群体模型一致,只是把关注点从固定效应转到被试斜率,指标仍是各自可信区间是否含零与方向。结果显示明显分化:在 32 人中有 3 人不用局部时长而只用远端 F0,在 29 名偏时长者中有 3 人对节段的依赖强于时长,另有 11 人不用节段,在偏时长者中仅 11 人同时用远端 F0,节段被 18 人稳定使用但无人只用节段。
换言之,多数人更重时长兼顾其他,有人只用时长,有人只用远端,节段从不单独成军。这种分化提醒总体趋势不等于每人每试都成立,部署时若按平均权重一刀切,会在只用远端或只用局部的少数人上系统性误判。
下面这张表把个体层面的协变组织成可检验的权衡,比较问题是重用一类线索的人是否轻用另一类,公平条件是同一批被试斜率估计,指标方向是相关系数为负表示此消彼长,显著性看原文报告的 p 值。
| 被试斜率配对 | 相关指标 | 相关系数 | p 值 | 原文解读方向 |
|---|---|---|---|---|
| 时长依赖对远端 F0 依赖 | 皮尔逊相关 | -0.628 | 小于 0.001 | 重局部轻远端 |
| 节段依赖对远端 F0 依赖 | 皮尔逊相关 | -0.428 | 0.014 | 重局部轻远端 |
| 时长依赖对节段依赖 | 皮尔逊相关 | 0.253 | 0.162 | 弱正相关不显著 |
| 只用远端不用时长 | 人数统计 | 3 人共 32 人 | 不适用 | 少数纯远端策略 |
| 稳定使用节段 | 人数统计 | 18 人共 32 人 | 不适用 | 无人只用节段 |
表后解释要讲清支持与限制。支持的是局部与远端之间存在显著负相关,重时长者轻远端,重节段者也轻远端,而两类局部之间仅为弱正且不显著,说明权衡主要发生在局部整体与远端之间而非两种局部之间,这与自下而上看目标与自上而下看轮廓两种注意分配的解释相容。
代价与反例是相关不等于因果,不能说学会用时长导致放弃远端,也可能是 recency 偏差即最后听到的局部覆盖了早期印象,或是远端敏感者提前找到可靠信号而不再细听后部,任务的时间结构本身就能制造这种负相关。未评测边界是早期 H 星峰高上升斜率、目标词内微小低谷、气声嘎裂声等其他远端与局部线索均未操纵,因此不能把三线索的相对排序推广为全部线索的排序。
哪些结论还不能下?
论文直接报告的是 3 类线索在该句式该轮廓对中都显著且时长最强节段次之远端最弱,以及个体存在局部远端权衡,这些有贝叶斯估计与相关检验支持。有限解释是把远端显著读成听者用上下文计算出现重音概率的自上而下证据,或把个体差异读成对 F0 与非 F0 的一般偏好,这两种都与数据相容但未被分离,因为时间位置与线索类型在本设计中完全绑定,局部恰好在后而远端恰好在前。
未验证推测包括把权重差异推广到其他低调、其他句式、其他说话人,或认为感知权重必定对应产出权重,论文仅说非正式观察到产出中也有类似变异,并提出未来用同一批人做感知产出配对来检验,在此之前只能表述为可能待验证。缺失证据不是技术错误,但必须点名:没有测量误判率在自然对话中的代价、没有报告反应时与延迟、没有做训练部署成本分析,也没有检验噪声、语速、方言与年龄的影响,因此不能承诺这些量得到改善。
资源状态方面,本次收到的证据中没有任何经 HTTPS 验证的代码模型数据资源,只能写未能确认公开,复现需按方法自建刺激与分析,不能假设可下载即运行。
要复现这套刺激与分析先做什么?
复现先做录音与剪接。找 1 名男声或固定 1 名说话人多次录制目标句的 3 种轮廓:Ramona 核重音加去重音低谷、nomads 核 L*、以及用于统一开头的中间时长轮廓,测量-e nom-各段与前一元音时长分布,确认强弱底子在音质与共振峰上的方向差异,再按 the 之前切点完成后部剪接而开头统一。
然后做重合成:用 Praat 同步叠加法固定 Ramona 峰 235 赫兹、目标低平 100 赫兹与末升 165 赫兹,只做五档下落斜率从速降到 170 赫兹肘部缓降,同时对目标段做五档时长拉长缩短并保证每档在强弱底子下时长相同,交叉得到 50 种组合。接着做行为流程:先用不同说话人不同句子的各 6 个自然样例做直到答对的语境训练,再以随机顺序呈现每组合 3 次加端点追加重复共 162 试,5 秒限时二选一,记录超时并按端点 24 试 75% 筛选。
最后做统计:用贝叶斯混合逻辑回归预测有重音反应,预测量为居中时长步数、F0 步数与强弱因子,随机结构含刺激与被试截距及被试斜率,四链五千迭代二千五百预热,报告中位数、可信区间与方向概率,并进一步算被试斜率间的皮尔逊相关。还需补的验证是换说话人、换句式、加入峰高上升斜率与目标内微谷等新线索,看排序是否稳定,以及做感知产出配对看个体权重是否跨模态一致。
何时值得借用这套权重观?
当你的任务同样涉及低平 F0 的音系归属而非一般响度打分时,这套权重观值得尝试:先把局部音高固定或确认其本身不可分,再系统估计局部时长、打包节段与远端调形的各自增量,而不是默认 F0 无用或最有用。若你的系统只能听到局部窗口,预期时长加音质会有稳定收益;若能看到上文调形,远端斜率可作为小而显著的先验,但不能替代局部证据。
复现时保留的关键超参数与信息条件是五档阶梯的端点值、100 赫兹平低与 165 赫兹末升、235 赫兹峰与 170 赫兹肘部、162 试结构与 75% 筛选线,改动任一都会改变可比性。常见误解是把低听感评分直接读成无重音,或把平均最强读成每人最强,前者混淆了结构突显与梯度凸显,后者忽略了只用远端的少数人与局部远端权衡,论文的价值恰在于用同一刺激空间同时给出平均排序与个体分化,并提醒时间位置与线索类型的绑定仍需未来实验解开。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses