英文题目:Effects of listener language experience, masker language, and cognitive load on word monitoring accuracy and response time
会议身份:
conference:interspeech:2026:conference-paper-id:chin26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #言语感知 #多语言 #语音 #关键词检测
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Jessica Chin:机构信息未能从会议 PDF 纯文本可靠映射
- Laurence Bruggeman:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Antoniou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理英语目标词在双人掩蔽言语中的词监测,输入为含噪16词序列加双人巴布声与视觉数字预载,输出为探测灵敏度与命中反应时,难点在于能量掩蔽与信息掩蔽交织,且语言相似性与听者熟悉度难以分离。方法链分三步衔接:先呈现1个或3个二位数操纵认知负荷并经回忆校验负荷生效,其形成的记忆保持状态带入下一步的竞争听音。接着呈现印制目标词并播放目标词序列叠加英语、瑞典语、阿拉伯语、西班牙语四种掩蔽语构成负信噪比试次,其空格键反应与数字回忆输出进入下一步统计估计。最后采用贝叶斯多层模型估计掩蔽语与负荷效应,分离被试与词条随机变异以得到条件比较。与既往句子识别研究相比,该机制差异在于用低语境高频双音节词降低句法语义支架,从而更直接检验声韵相似与掩蔽语知识的作用。单语者在西班牙语掩蔽下的词灵敏度高于英语掩蔽,证据比为20.39,后验概率为0.95,反应时在英语掩蔽下最慢,双语者总体更慢但准确率相当。结论边界是仅在-5 dB信噪比词监测范式与所选四种语言内成立,未验证句子级、更多掩蔽人数或实验室级听音条件的推广性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么:先把语音对语音识别说清楚
本文输入是英语目标词序列叠加双人掩蔽 babble,目标是在有竞争语音时按出目标词。输出是两个可复述的量:词监测准确率与成功命中的反应时。必须保留的信息是目标与掩蔽的语言关系、听者语言经验、认知负荷 3 类操纵,以及信噪比与任务规则,因为它们决定了结果能推广到哪里。
对刚入门的同学,白话先说能量掩蔽。能量掩蔽是目标与掩蔽在频谱和时间上撞在一起,耳朵在外周就分不开,比如在很吵的交通噪声里听人说话。信息掩蔽是即使能量上能分开,掩蔽的内容仍然抢注意,比如旁边有人说你能听懂的话,你会分心,难以决定哪句是目标。英文名是 energetic masking 与 informational masking,后文分别简称能量掩蔽与信息掩蔽。
能量掩蔽 × 信息掩蔽: 能量掩蔽分工在频谱时间重叠处阻止目标与掩蔽分离,信息掩蔽分工在语言内容层面干扰注意与识别,二者搭配理由是鸡尾酒会式场景同时包含两者,组合意义是本研究通过归一化长期平均语谱来压住能量差异,从而把比较焦点留给语言带来的信息掩蔽。
本研究要解决的矛盾是,同语掩蔽最难到底是因为信号像,还是因为听懂了掩蔽。作者引用语言理解易度模型来组织思路:目标语音要与长期记忆中的语音表征匹配,当掩蔽破坏识别时,工作记忆被调用来解决信号与表征的不一致。如果再加一个次任务占用记忆,听目标的注意负担会被进一步拉紧。理解这一点,才能明白为什么作者要加数字预载,而不是只比较 4 种掩蔽语。
相关路线在争什么:同语最难之外,节奏相似算不算难
第一条路线是语言相似性假设。该假设预测目标与掩蔽语言越相似,识别准确率越差,同语条件最难。原文回顾了多项支持证据,也指出节奏结构可能是原因之一:英语目标在重音定时的荷兰语掩蔽下比在音节定时的普通话掩蔽下更差。但也有研究只发现同语更差,而节奏相似与节奏不同之间没有显著差异。因此相似性到底要细到哪一层,是本研究要复核的点。
语言相似性假设 × 类型相似性: 语言相似性假设分工是预测目标与掩蔽越相似识别越差,类型相似性分工是把相似操作化为节奏与元音库等具体特征,二者搭配理由是只说同语最难不够,需要检验瑞典语与英语同为重音定时加大多元音库是否比西班牙语或阿拉伯语更难,组合意义是本研究把英语瑞典语西班牙语阿拉伯语排成相似度梯度来检验该预测。
第二条路线是听者对目标或掩蔽的熟悉度。一般说更熟悉目标有益,更熟悉掩蔽有害。非母语听目标更差是较一致的发现。熟悉掩蔽是否有害则分情况:晚期普通话英语双语者在英语目标加普通话掩蔽下比不懂掩蔽的单语者更差;早期与同时双语者的证据不一致,有的显示更差,有的显示与单语者相当。这意味着不能把双语者自动当成更吃亏的一组,需要按实际招募的双语类型与任务难度来看。
第三条路线是认知负荷。原文提到母语者在高负荷下会调整掩蔽语音切分策略,更依赖词汇线索,而非母语者继续依赖声学线索。另一项在安静下做的双任务研究发现数字预载更难会导致切分监测准确率下降与反应变慢。本研究把该思路搬到语音对语音场景,检验高负荷是否同样拖累词监测。学习依赖是先接受同语最难这个大趋势,再看类型相似、掩蔽熟悉度、记忆负荷各自加了什么。
本文到底要回答哪三个问题
问题一是目标与掩蔽的语言相似程度是否影响英语词监测。作者把掩蔽排成梯度:英语为同语,瑞典语为语音上更相似的重音定时大多元音语言,西班牙语为音节定时较少元音,阿拉伯语一般归为重音定时但元音较少。预测是英语最难,瑞典语次难,西班牙语与阿拉伯语相对容易。这个排序是可复述的关键,不要记成 4 种语言并列。
问题二是听者对掩蔽的熟悉是否带来额外代价。作者招募澳大利亚英语单语者与阿英双语者,预测双语者因熟悉阿拉伯语,会在阿拉伯语掩蔽下比在瑞典语或西班牙语下更差,甚至比单语者在阿拉伯语掩蔽下更差。这是一个交互预测,不是只比两组总分。
问题三是认知负荷是否拖累主任务。每试次前记住一个 2 位数为低负荷,记住 3 个 2 位数为高负荷,预测高负荷导致更差的识别。例子是为了教学:好比让你先背一串数字再去听词,背得越多听得越差,这只是帮助理解负荷操作,原文并未承诺该例子中一定出现多大效应。
方法全景:一个试次走完输入到输出
先沿一个样本走完流程。屏幕先出现一个或 3 个 2 位数,被试记住。接着屏幕显示本试次要监测的印刷目标词。然后耳机播放 16 词序列,叠加双人掩蔽 babble,被试听到目标就按空格键。试次结束时键入开头看到的数字,按回车进入下一试。
反应时在词监测按键处测量,准确率也从按键的命中、漏报、虚报中计算。数字回忆只用来检验负荷是否真的变难。
词监测任务 × 数字预载: 词监测任务分工是测量在双人 babble 中发现指定英语目标词的灵敏度与速度,数字预载分工是在每试次前记住一个或 3 个 2 位数来占用工作记忆,二者搭配理由是语言理解易度模型认为掩蔽受损时需要工作记忆修补信号与表征的不一致,组合意义是用次任务制造低与高认知负荷,再看主任务是否被拖累。
全景中的控制值得记住。词序列来自 41 个高频双音节英语词,其中 14 个作目标词,27 个作填充词,由 1 名澳大利亚英语女性母语者用载体句录制。掩蔽由 8 名说话人录制:澳大利亚英语、瑞典语、现代标准阿拉伯语、南美西班牙语各 2 名女性,用句法正常但语义异常的句子并互译,保持词频与句法结构相近。作者把所有掩蔽的长期平均语谱归一化,以减小频谱差异,再把掩蔽设到固定声压级形成固定信噪比。练习阶段先在安静与高信噪比下熟悉任务,正式试验在低信噪比下随机呈现 8 种条件。
组件与计算:目标序列、掩蔽轨道、负荷与计分如何配合
目标序列组件负责可比的输入。每个序列含一个目标词与 15 个填充词,随机排序,目标从不在首尾位置,词间隔为 250 毫秒。序列归一化到固定声压级,保证不同试次的响度起点一致。掩蔽轨道组件负责可比的干扰。每种语言合成一条 babble 轨道,句子随机排序,从随机时间点切出并叠加到词序列上,前后各留 500 毫秒 babble。这样目标出现时掩蔽已经存在,避免起始瞬态提示。
负荷组件负责记忆占用。低负荷只出现一个 2 位数,高负荷出现 3 个 2 位数,数字在十到九十九之间,视觉呈现,被试按自己节奏阅读与键入。原文报告了一个实施细节:由于失误,阿拉伯与瑞典掩蔽条件下低与高负荷试次数与英语西班牙条件下的分配不完全相同,复现时要按原文核对试次表,不能假设每格试次完全平衡。
计分组件负责把按键变成指标。词监测按键被分为成功命中、漏报、无反应,以及虚报。虚报包括早于目标出现后 200 毫秒或晚于 2000 毫秒的预期性或过慢反应,以及慢于被试内平均反应时 3 倍标准差的反应。准确率用辨别力指数计算,即命中率经 Fisher 转换减去虚报率经 Fisher 转换,极端命中或虚报用对数线性规则调整。数字预载准确率按编辑距离计算,即把回答改成正确答案所需的最少增加删除替换次数,零分为全对,越大越差。
有没有训练模型:本研究训练了什么,没有训练什么
本研究没有训练神经网络,也没有更新任何模型参数,不存在优化器、梯度路径、冻结层或早停。这里的训练一词若被误解为机器学习训练,需要纠正:它只是被试练习与正式试验。真实计算过程是行为实验与贝叶斯多层模型统计。
实际调用的工具是 Praat 生成词序列与掩蔽轨道,E-Prime Go 远程呈现试验,R 语言的 stringdist 计算数字回忆的编辑距离,brms 包拟合贝叶斯模型。数字预载模型用贝叶斯负二项模型,含听者组与认知负荷的总体效应与被试随机斜率。词监测准确率用贝叶斯偏斜正态回归,词监测反应时用贝叶斯对数正态回归,均含听者组、掩蔽语、认知负荷总体效应,以及词条随机截距与被试随机斜率。单侧假设检验用证据比与后验概率判断,大于十九的证据比被视为强证据。缺项是原文未给出可运行代码与数据的公开链接,本次也未发现经验证的开源资源,因此不能声称代码模型数据已公开。
实验条件:被试、设备、声级与分析口径必须对齐
比较问题是 4 种掩蔽、两组听者、两种负荷下谁更准更快。公平条件是同一套英语目标词、同一双人 babble 构造方法、同一信噪比、同一计分规则。指标方向是辨别力指数越高越好,反应时越短越好,数字编辑距离越小越好。
下表把被试规模与声学设置放在一起,方便复现时 1 次核对分组、声压级、序列长度与时间参数。阅读时注意单位与聚合对象:声压级是分贝,间隔是毫秒,年龄是均值与标准差,被试数是人数。
| 条件 | 指标 | 单语组 | 双语组 | 共同声学设置 |
|---|---|---|---|---|
| 被试规模 | 人数与年龄 | 82 人,均值 25.97 岁 | 29 人,均值 23.91 岁 | 远程测试,自备耳机 |
| 目标序列 | 词数与间隔 | 16 词,间隔 250 ms | 16 词,间隔 250 ms | 序列 65 dB SPL |
| 掩蔽声级 | 信噪比 | -5 dB | -5 dB | 掩蔽 70 dB SPL,前后各 500 ms |
| 目标词库 | 词表 | 14 个目标加 27 个填充 | 14 个目标加 27 个填充 | 高频双音节英语词 |
正式分析纳入 78 名单语者与 27 名双语者,排除了未回应超过一半试次的被试。单语者自评英语熟练度均值较高,双语者自评英语与阿拉伯语均较高,其中同时双语、早期序列双语的构成已有报告。瑞典、西班牙、阿拉伯与英语目标的录音房间与话筒并不完全一致,作者用长期平均语谱归一化减小频谱差异,但不能理解为能量掩蔽已被完全消除。远程测试使用个人耳机与安静房间,复现时应记录设备并检查漏报是否来自技术问题,阿拉伯与瑞典掩蔽的低高负荷试次分配也与英语西班牙条件不完全相同。
主结果:英语掩蔽最难,但类型梯度没有出现
先看准确率。单语者在西班牙语掩蔽下比英语与瑞典语下更准,双语者只在西班牙语比英语下显示更准,其余掩蔽比较没有强证据。认知负荷没有影响准确率,两组总体准确率也没有差异。也就是说,同语最难得到部分支持,但瑞典语作为更相似的非同语并没有比西班牙语或阿拉伯语更难,唯一的例外是单语者西班牙语优于瑞典语,这与类型相似预测的方向并不一致。
再看反应时。单语者在瑞典语与阿拉伯语下比英语更快,双语者在瑞典语阿拉伯语西班牙语下都比英语更快。瑞典语阿拉伯语西班牙语之间没有反应时差异的证据,也没有认知负荷效应。双语者总体比单语者更慢,但准确率相当。慢不等于不准,双语者呈现的是速度代价而非敏感性代价,英语掩蔽拖慢速度的证据比拖累准确率的证据更广。
下表把关键贝叶斯比较的证据比与后验概率集中呈现,证据比大于十九为强证据,方向是单侧假设中更好的表现。
| 比较对象 | 指标 | 单语者证据 | 双语者证据 | 组间比较 |
|---|---|---|---|---|
| 西班牙语对比英语准确率 | dprime | ER 20.39,PP 0.95 | ER 26.03,PP 0.96 | 两组均支持西班牙语更准 |
| 西班牙语对比瑞典语准确率 | dprime | ER 199,PP 1.00 | 无强证据 | 仅单语者支持 |
| 瑞典语对比英语反应时 | RT 更快 | ER 不小于 7999,PP 1.00 | ER 7999,PP 1.00 | 两组均更快 |
| 阿拉伯语对比英语反应时 | RT 更快 | ER 不小于 7999,PP 1.00 | ER 1999,PP 1.00 | 两组均更快 |
| 双语对比单语总体 | RT 与准确率 | 基线组 | RT 更慢 ER 26.12,PP 0.96 | 慢但准确率无差异 |
该表说明准确率优势集中在西班牙语对比英语,反应时优势集中在非英语掩蔽对比英语,双语者更慢但准确率相当的格局在两类指标中保持一致。负荷效应在两类指标中均未获得强证据,熟悉阿拉伯语也未在阿拉伯语掩蔽下形成额外代价。
辨别力指数 × 反应时: 辨别力指数分工是综合命中率与虚报率得到对目标的敏感性,避免只数按对几次带来的偏差,反应时分工是只对成功命中测量从目标出现到按键的快慢,二者搭配理由是准确与速度可能分离,组合意义是本研究同时报告两者,才能说清英语掩蔽让反应变慢但准确率下降是否只出现在部分比较中。
图一按掩蔽语与负荷分面展示词监测准确率,纵轴为辨别力指数,零为机遇水平,上下面板分别为澳大利亚英语单语者与阿英双语者,绿色为高负荷黄色为低负荷,不要把小提琴的宽窄直接读成显著性,显著性要回到证据比。
看图路径: 1. 先确认上下两排分别为澳大利亚英语单语者与阿英双语者,横轴为四种掩蔽语条件;2. 再看每组内绿色为高认知负荷黄色为低认知负荷的小提琴分布与黑色圆点均值;3. 比较英语掩蔽与其他掩蔽的均值高低,并检查高低负荷在同一掩蔽下是否分离;4. 注意纵轴为 dprime,零为机遇水平,负值与向下拖尾表示个别被试表现很差
论文图 1。原论文 Figure 1:“Word monitoring accuracy (d′) by Masker and Cognitive Load conditions, faceted by Listener Group.”。
从像素可见,两组均值点大多在二附近,分布向上集中但向下有长尾,个别被试接近或低于机遇。同一掩蔽下绿色高负荷与黄色低负荷分布高度重叠,与统计上无负荷效应的结论一致。英语掩蔽均值并不总是最低,但西班牙语掩蔽均值相对较高,与西班牙语优于英语的准确率证据吻合,双语者在阿拉伯语掩蔽下也没有塌陷。
反证与失败条件:熟悉阿拉伯语为何没有更差,高负荷为何没有拖累
第一个反证是双语者在阿拉伯语掩蔽下并不比在瑞典语或西班牙语下更差,也不比单语者在阿拉伯语下更差。原文给出两种有限解释:双语者两种语言都较熟练,英语识别未被阿拉伯语掩蔽拖累,这与同时双语者既往表现相当的研究一致;或者词监测不如句子识别费力,掩蔽熟悉度的代价没有机会显现。这属于支持与可能并存的表述,不能读成已证明熟悉度无害。
第二个反证是类型相似没有系统效应。瑞典语在语音与节奏上更像英语,但并未导致更低准确率或更慢反应时。原文还提醒单侧检验的局限:有些比较在相反方向上可能有更强证据,例如单语者西班牙语与瑞典语、西班牙语与阿拉伯语的反应时方向,但这些相反假设未被检验,因为不符合原预测。复述时不要把无证据写成反向显著。
第 3 个反证是认知负荷。数字预载在高负荷下确实更差,说明记住 3 个数比记住一个数更难,但词监测准确率与反应时都不受负荷影响。原文推测被试可能在长数字序列下放弃记数字而保主任务,导致次任务变差而主任务不受损。这提示双任务不一定同时敏感,任务策略可以解释分离。
听者语言经验 × 掩蔽语熟悉度: 听者语言经验分工指单语者与阿英双语者在目标英语上的长期能力,掩蔽语熟悉度分工指双语者能否听懂阿拉伯语掩蔽内容,二者搭配理由是要区分难是因为信号像还是因为听懂了掩蔽,组合意义是比较双语者在阿拉伯语掩蔽下是否比单语者或比自己在瑞典语西班牙语下更差。
下面导读图二,再解释速度分离。图二纵轴为成功命中的反应时,横轴为掩蔽条件,上下排为两组被试。导读时先看均值点,再看分布尾部,不要把个别很长的尾部当成组均值。
看图路径: 1. 先确认上下两排的被试分组与横轴四种掩蔽语,纵轴为成功命中的反应时;2. 再看每组内高低负荷分布是否重叠,判断认知负荷是否拉开速度;3. 比较英语掩蔽的黑色均值点是否高于瑞典语阿拉伯语等其他掩蔽;4. 观察双语者下排分布尾部是否更长,理解总体更慢但组内负荷效应不明显
论文图 2。原论文 Figure 2:“Word monitoring RTs by Masker and Cognitive Load conditions, faceted by Listener Group.”。
图后解释要结合像素。单语者上排的分布较紧凑,均值多在 700 毫秒上下,英语掩蔽的均值略高。双语者下排的分布尾部更长,阿拉伯语与西班牙语等条件下有个别超过 1200 毫秒的拖尾,但均值仍在 800 毫秒附近。高低负荷颜色在同一掩蔽下基本重叠,支持无负荷效应。双语者总体更慢在图上表现为下排均值与分布整体略上移,但这不对应准确率图中的塌陷,因此速度与敏感性分离是本图最重要的可复述判断。
限制:哪些结论不能推广,哪些冲突必须标出
推广限制首先是任务。词监测是发现指定词,比句子识别对语义与句法的要求低,因此熟悉掩蔽的代价可能在更难的任务中才会出现。原文明确说任务难度可能是原因之一,复述时不能把本结论推广到所有语音对语音识别。
其次是样本与环境。双语组只有 29 人,正式分析剩 27 人,且内部包含同时双语与两类早期序列双语,统计 power 与异质性都与 78 人的单语组不同。录音环境与话筒不统一,远程测试用被试自备耳机,这些都可能引入能量与清晰度差异。试次分配失误也破坏了完全平衡,负荷效应需要在平衡设计中再验证。
冲突标注是统计口径。原文用证据比大于十九为强证据,但部分比较返回证据比与后验概率为零,意味着数据更支持相反方向,只是未做双侧检验。不能把未检验的反向写成显著,也不能把证据不足写成两条件相等。另一个潜在冲突是英语掩蔽在反应时上最难,但在准确率上只在与西班牙语比较时最难,速度与准确率并非一一对应,总结时必须分开说。未测量的是误判率以外的延迟分解、训练成本、实际部署开销,原文未报告这些量,因此不能承诺本方法改善了延迟或成本。
复现先做什么:按原文搭出可运行的最小实验
先准备材料。录制十四目标词与二十七填充词的高频双音节英语词,载体句保持一致。按句法正常语义异常的句表翻译成瑞典语阿拉伯语西班牙语,保持词频与句法相近,每种语言录 2 名女性说话人。所有掩蔽做长期平均语谱归一化,词序列归一化到 65 分贝声压级,掩蔽设到 70 分贝声压级形成负 5 分贝信噪比,每语言合成一条 babble 轨道。
再搭流程。每试次先视觉呈现一个或 3 个十到九十九的 2 位数,再呈现印刷目标词,然后播放 16 词序列叠加从随机点切出的掩蔽,前后各留 500 毫秒 babble。被试按空格报告目标,试末键入数字。练习先做安静与加 10 分贝的瑞典阿拉伯西班牙试次,再做 56 个正式试次,条件随机化。计分按 200 毫秒到 2000 毫秒窗口与 3 倍标准差剔除虚报,准确率算辨别力指数并做极端比例校正,数字回忆算编辑距离。
分析用贝叶斯多层模型,总体效应为听者组、掩蔽语、认知负荷,随机效应含词条截距与被试斜率,准确率与反应时分别用偏斜正态与对数正态,证据比大于十九判强证据。复现前要补的验证是平衡负荷试次、记录耳机与房间、报告每格有效试次数与剔除率,并公开刺激与分析代码。当前没有经验证的公开资源,不能写已公开或当前可用。
收束:何时值得尝试这个范式,还需补哪项验证
当研究问题是掩蔽语语言是否增加信息掩蔽,且想控制能量差异时,这个范式值得尝试。它的价值在于用同一套目标词、同一双人 babble 构造、同一信噪比与同一计分规则,把同语最难、类型梯度、掩蔽熟悉度、记忆负荷放在一个双任务里同时检验。复述方法时抓住三句话:英语掩蔽最拖速度,部分拖累准确率;瑞典语更像英语但没有系统更难;双语者更慢但不更不准,高负荷只拖累数字回忆。
还需补的验证有三项。第一是用句子识别或更依赖语义的任务重测阿拉伯语熟悉度代价,看词监测的阴性结果是否只是任务太容易。第二是用平衡的负荷设计与更长的数字序列,检验被试是否真的在高负荷下放弃次任务。第三是统一录音环境与耳机,或在模型中加入设备协变量,再看英语掩蔽效应是否稳定。常见误解是把反应慢等同于听不准,把无强证据等同于两条件相等,把高负荷未显著等同于工作记忆不重要,原文证据只支持在该任务、该信噪比、该被试构成下出现上述分离,超出此范围属于待验证推测。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

