英文题目:Hearing Smiles in the Crowd: How Babble Noise Shapes Smiled Speech Perception

会议身份:conference:interspeech:2026:conference-paper-id:li26t_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #统计分析 #言语感知 #语音 #语音属性识别

评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Rong Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Esther Janse:机构信息未能从会议 PDF 纯文本可靠映射
  • Dirk Heylen:机构信息未能从会议 PDF 纯文本可靠映射
  • Khiet Truong:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文研究无视觉时多人babble噪声下微笑言语的听觉感知,输入为愉悦式微笑、机械咧嘴与中性朗读语句,输出为两项二选一行为判断,难点在于声学掩蔽导致感觉证据退化与不确定下决策策略漂移相互交织。方法链分三步:先从AMuS语料选取全覆盖的Speaker B法语男声与Speaker C英语女声并做去首尾静音与70 dB归一,输出干净刺激进入下一步。再将刺激与NOISEX-92约100人餐室babble按Quiet、-3 dB、-6 dB混合,输出带掩蔽的三条件试次进入行为实验。最后组织英法流利听众完成微笑检测与微笑类型分类强制选择任务,并用广义线性混合模型与信号检测论联合分析敏感性与反应偏向。与既往仅关注干净条件下微笑可听性的研究相比,该工作同时建模敏感性下降与偏向保守化,揭示正确率变化可由决策标准漂移解释,具有现实噪声下情感感知的实际意义。在任务2微笑类型分类设置下,Quiet条件的敏感性指标d’为1.28,高于-6 dB条件的敏感性指标d’为0.55。该结论的适用边界受限于朗读式非自发微笑与餐室babble掩蔽,尚未验证自发对话与多说话人泛化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:本文要解决的真实听觉难题是什么?

本文的输入是真实录制的带微笑语音,目标是回答人群噪声下听者还能否听出微笑,以及能否分清微笑种类。作者开篇交代,微笑不只是视觉动作,颧大肌收缩伴随的声道缩短、共振峰移动、强度与基频变化会在声音里留下痕迹。必须保留的关键信息是,本文区分了两种微笑语音:一种是要求说话人听起来愉悦但不笑出声的愉悦微笑,另一种是只要求保持嘴唇横向拉开而不传达愉快的机械拉唇。输出是两个二选一听辨任务的行为数据与统计模型估计。

研究对象是刚接触语音情感的研究生需要理解的感知问题,而不是语音增强算法本身。日常生活里电话或客服场景没有视觉,背景又有很多人声,听者只能靠受损的声音判断对方是否在微笑。本文因此把问题限定为听觉通道下的微笑存在检测与微笑类型细分,并用可控的信噪比梯度观察感知如何变化。

已有路线讲了什么:微笑语音与噪声下情感感知如何衔接?

已有工作先建立了微笑语音有声学可检测性。原文回顾,微笑可以提高第二共振峰,尤其在圆唇元音上,并常伴随强度上升;心理物理反相关研究进一步指出听觉微笑具有向上移动的第一、第二共振峰与高频共振峰能量增强的频谱特征。行为层面,早期工作说明即使没有情绪意图,仅把嘴唇拉开也会产生一致的微笑听感,这正是区分机械与情感微笑的动机。

愉悦微笑还被认为带有超出机械效应的韵律调制,例如强度更高与基频下降更陡,因而通常被评为更愉悦,并存在从真实微笑到拉唇再到中性的愉悦度连续体。另一条路线是噪声下语音情感感知。原文指出,多人巴布尔噪声既掩蔽感觉证据又增加认知负荷,以往研究发现噪声对不同情绪类别的影响不均匀,还会改变听者依赖的声学线索。

两条路线的缺口是,微笑感知大多在安静实验室条件下研究,没有回答巴布尔噪声增大时,微笑存在感与微笑类型是否同等存活。本文的衔接点正在于此:不是笼统问情绪在噪声下是否变差,而是问微笑检出与微笑细分这两个层级如何分别变化。

任务如何定义:两个二分类分别测什么?

本文定义了两个二值感知分类任务。任务一是微笑检出,把所有微笑语音合并为正类,把中性语音作为负类,问题是听者能否听出语音是否带微笑。任务二是微笑类型细分,只使用微笑语音,问题是听者能否把愉悦与拉唇区分开。2 个任务都用是否式迫选呈现。任务一的问题是谈话者声音听起来是否像微笑,任务二的问题是谈话者声音听起来是否愉悦。

这样的定义把存在判断与种类判断分开:任务一失败意味着微笑整体被淹没,任务二失败意味着即使听出微笑,也分不清功能。教学上可以举一个例子帮助理解:例如同一句话用愉悦方式读一遍、用只拉唇不愉悦方式读一遍、用中性方式读一遍,任务一要求把前两遍都挑出来,任务二要求在前两遍内部再分开。这只是对任务逻辑的举例,不代表原文使用了该例句或报告了该例的效果。

方法全景:从语料到噪声再到被试流程如何串起来?

方法全景可以沿一个试次走完。起点是一句来自愉悦微笑语料库的录音,先去掉首尾静音,再把整体强度归一化到 70 分贝,保证不同句子的响度起点一致。接着从餐馆式多人噪声库中裁一段比语音前后各长 200 毫秒的噪声,施加 50 毫秒淡入淡出避免咔哒声,重采样到 16 kHz,按目标信噪比缩放后与语音混合成单声道。混合后的刺激按安静、负 3 分贝、负 6 分贝三档呈现给对应语言流利的听者,听者戴耳机判断并作答。

原文选择这三档的理由是覆盖最优聆听、可懂度功能下限与生态现实中的极端 adverse 条件。整个流程没有训练神经网络,没有更新任何模型权重,计算部分是刺激构造、行为采集与统计建模。统计建模同时估计噪声、类别与说话人的作用,并用信号检测论把敏感度与判断标准拆开。

组件与计算:刺激、噪声与统计各负责什么?

刺激组件负责保证可比性。原文只选用覆盖 3 类语音完整的两个说话人语言子集,即法语男性与英语女性,原因是语料库存在说话人、语言、性别部分混淆与类别覆盖不平衡,例如有的说话人没有拉唇样本。噪声组件负责可控劣化。所用噪声来自约 100 人同时说话的背景库,作者手工只选没有可懂言语与可听笑声的片段,避免听者被噪声中的语义或笑声带偏。统计组件负责分离机制。

试次级广义线性混合效应模型用二项逻辑连接,固定效应事先设定为噪声与类别交互,加上说话人与类别、说话人与噪声交互,随机截距考虑被试与刺激条目的特异变异。信号检测论组件负责补充解释,用被试在每档噪声下的击中率与虚报率算出敏感度、刺激级区分度与判断标准。

amused speech × spread-lip speech: amused speech 指带有愉悦情感意图的微笑语音,分工是同时提供唇形改变的声学后果与韵律调制;spread-lip speech 指只保持嘴唇横向拉开而不传达愉悦的机械微笑语音,分工是只提供发音器官形状改变的声学后果。两者搭配的理由是分离情感与纯机械动作,组合意义在于检验噪声削弱的是情感性线索还是所有微笑声学痕迹。

perceptual sensitivity × response bias: perceptual sensitivity 指听者从声音中区分两类刺激的感觉证据多少,分工是反映信号可分性;response bias 指证据不足时听者倾向于按哪个答案作决定的决策标准,分工是反映不确定下的默认策略。两者搭配的理由是正确率下降可能来自证据变差或标准变严,组合意义在于用信号检测论把两者拆开。

Signal-to-Noise Ratio × multi-talker babble noise: Signal-to-Noise Ratio 指目标语音与背景噪声的能量比,分工是定量控制听觉难度;multi-talker babble noise 指约 100 人同时说话形成的餐馆式背景声,分工是提供与语音高度相似的掩蔽与认知负荷。两者搭配的理由是只说加噪不够,需要知道噪到什么程度,组合意义在于用安静、负 3 分贝、负 6 分贝构成从最优到极端的不确定梯度。

smile-like detection × smile-type categorization: smile-like detection 指判断语音是否带微笑,分工是检验微笑存在感能否穿透噪声;smile-type categorization 指在已带微笑的语音中判断是愉悦还是机械拉唇,分工是检验不同微笑功能是否同等脆弱。两者搭配的理由是先检出再细分符合实际理解层级,组合意义在于区分整体丢失与类型混淆两种失败。

d′ × criterion: d′指用击中率与虚报率计算的感觉敏感度,分工是度量两类分布在感觉轴上分开多远;criterion 指判断分界线放在什么位置,分工是度量听者多保守或多宽松。两者搭配的理由是同一正确率可由高敏感加偏置或低敏感加中立产生,组合意义在于解释为何机械微笑在噪声下正确率反而上升。

有无训练:本研究训练了什么、冻结了什么?

本研究没有训练声学模型或感知模型,也就没有参数冻结、梯度路径、优化器更新与早停可报告。真实计算过程分为 3 类。第一类是刺激构造计算,包括强制对齐去静音、强度归一化、噪声裁剪与重采样、信噪比缩放与混合,全部是确定性信号处理,不是学习。第二类是行为数据采集,包括耳机筛查、音量校准、注意力检查与随机呈现,目的是保证线上听音条件可用。第 3 类是统计拟合,包括广义线性混合效应模型的最大似然估计与信号检测指标的被试级聚合。

原文明确说明年龄与性别最初作为协变量进入模型,但因未改善拟合且非研究变量而被移除。缺项是原文未报告混合效应模型的求解器细节与随机斜率设定,只说明了随机截距,因此不能从模型名称推定其收敛路径或个体斜率。由于无训练,不能把结果理解为某个可部署分类器的性能,也不能把参数冻结等同于输出确定。

实验条件:被试、材料分配与呈现如何保证公平?

实验按语言分组呈现。法语材料给法语流利被试,英语材料给英语流利被试,资格按自报流利度而非母语判定。最终有效样本为 38 名英语流利与 37 名法语流利被试,中位年龄段均为二十五到三十四岁。为防止句子重复效应,每个独特句子在单个被试的 2 个任务中只出现 1 次,为此给每个说话人与任务构造了两个内容不重叠的基础列表。任务一每表八十四试次,含二十一愉悦、二十一拉唇、四十二中性。

任务二每表四十二试次,含二十一愉悦、二十一拉唇。跨被试采用噪声轮换,使每个句子在各噪声条件下出现次数均衡,并随机分配到 12 种任务一与任务二列表组合,每种组合至少 6 人完成。呈现时每任务内试次随机排序,允许重听,开始前用耳机筛查验证佩戴,实验中嵌入两道听觉注意力检查,仅两道都失败才排除。研究经特文特大学伦理委员会批准,被试均知情同意。复现材料方面,原文给出开放链接,资源状态显示当前可用,已公开。

主结果一:微笑检出如何随噪声下降?

任务一要回答的核心比较问题是,在说话人与条目差异受控时,愉悦、拉唇与中性 3 类准确率是否随信噪比下降而同等变化,指标方向是分类准确率越高越好,敏感度越高越好,判断标准越接近零越中立。公平条件是同一组句子在三档噪声间轮换,模型同时考虑被试与刺激随机截距。下图把模型预测的准确率按噪声与类别画出,是理解交互的关键。

看图路径: 1. 先看左图三条线的起点与斜率,确认中性线是否基本水平而两条微笑线向下走;2. 再看右图两条线是否交叉,记录交叉大约发生在安静与负三分贝之间;3. 对照图例确认灰色为中性、黄色为拉唇、蓝色为愉悦,不要把颜色与左右面板弄混;4. 观察每个点周围的置信带宽度,判断下降趋势是否超出估计不确定性

原论文 Figure 1:GLMM-predicted accuracy for Task 1 (left) and Task 2 (right).

论文图 1。原论文 Figure 1:“GLMM-predicted accuracy for Task 1 (left) and Task 2 (right). Points represent model-predicted probabilities, with shaded bands indicating 95% confidence intervals.”。

上图左面板显示,中性语音准确率在三档噪声下基本保持水平,而两类微笑语音都明显下滑;右面板则显示愉悦与拉唇在安静与强噪声下出现交叉,这是后文要解释的重点。具体到任务一,左图蓝色愉悦线起点最高,随后向下走,黄色拉唇线起点低于中性且下降更陡,灰色中性线几乎平直。模型估计支持这一视觉印象:与安静和中性相比,拉唇在负 3 分贝与负 6 分贝显著更差,愉悦同样显著更差,而中性跨噪声保持相对稳定。

进一步以拉唇为参照的分析报告,愉悦在所有噪声下都显著高于拉唇,但两者之差不随噪声显著变化,说明两类微笑平行受损。说话人方面也报告了交互,法语说话人的中性与拉唇识别显著高于英语说话人,但愉悦没有可靠说话人差异。

条件任务敏感度判断标准区分度
安静微笑检出1.870.090.97 [0.95,0.98]
负 3 分贝微笑检出1.000.490.83 [0.78,0.87]
负 6 分贝微笑检出0.580.690.73 [0.67,0.78]

上表把任务一的信号检测指标放在同一噪声梯度下比较,敏感度越高表示越能分开微笑与中性,判断标准越大表示越不愿报告微笑,区分度越接近一越好。主要收益是即使只看汇总指标也能复述趋势:噪声越大证据越少;具体代价是不能只看正确率,因为正确率下降同时包含证据变差与标准变严。

未胜出项是中性语音,它在任务一中没有随噪声明显变差,说明不是所有语音判断都同等脆弱,也反证微笑线索更易被掩蔽。

主结果二与机制拆分:类型判断为何出现交叉?

任务二与信号检测拆分要回答的比较问题是,区分愉悦与拉唇的感觉证据是否同样随噪声减少,以及听者的默认答案是否移动,指标方向与上一节一致,但判断标准的正负需要按任务重新理解。公平条件是只用微笑刺激,模型结构与任务一相同。下图把敏感度与判断标准随噪声的变化画出,是把正确率交叉还原为机制的关键。

看图路径: 1. 先看蓝色实线敏感度在两个任务中是否都随噪声单调下降;2. 再看黄色虚线判断标准是否都向上走,并注意任务二起点在零线以下;3. 对照横轴安静、负三分贝、负六分贝三档,确认趋势覆盖全程而非只有末端;4. 观察误差棒长度,判断均值变化是否大于被试间标准误

原论文 Figure 2:SDT metrics for two tasks.

论文图 2。原论文 Figure 2:“SDT metrics for two tasks. Mean sensitivity (d′) and decision criterion (c) are shown as a function of noise condition, with error bars indicating standard errors.”。

上图右面板显示,蓝色敏感度线随噪声向下走,黄色判断标准线从零线以下爬到零线以上;左面板任务一则是敏感度下降而标准从零附近向上走。结合前一节的准确率交叉图可以理解:任务二安静时听者偏向回答愉悦,噪声下转为偏向回答非愉悦,于是愉悦试次准确率大跌而拉唇试次准确率反而上升。

模型估计报告,安静时愉悦显著高于拉唇,但愉悦在负 3 分贝与负 6 分贝大幅下降,拉唇分类准确率随信噪比降低而上升,形成交叉,且未发现涉及说话人的可靠效应。

条件任务敏感度判断标准区分度
安静类型细分1.28−0.510.93 [0.88,0.96]
负 3 分贝类型细分0.820.250.84 [0.77,0.89]
负 6 分贝类型细分0.550.640.77 [0.70,0.83]

上表把任务二的三档指标并列,敏感度从 1.28 降到 0.55,判断标准从 -0.51 反转为 0.25 再到 0.64,区分度从 0.93 降到 0.77。

主要收益是证明交叉不是拉唇线索变强,而是标准移动把模糊试次判给了拉唇;具体代价与反例是拉唇准确率上升容易被误读为噪声帮助了拉唇感知,实际感觉证据是全面变差的。未评测边界是这种保守转移是否来自社会代价预期或消极默认,原文只说与不确定下最优决策模型一致,没有直接测量认知机制。

限制与误解:哪些结论不能推广?

原文明确报告的限制首先是说话人样本过小且混淆未解。只用了 2 名说话人,身份、性别、语言与评分群体同时不同,因此任务一中法语说话人中性与拉唇更高的现象不能归因为微笑类型本身,作者也提醒应谨慎解释,并指出性别与语言可能调节情感感知。第二个限制是生态效度。材料是朗读句而非自发微笑语音,愉悦是按指导表演且不笑出声,拉唇是按动作保持,因此不能直接推广到自然对话中更丰富的微笑。第三个限制是机制解释的证据等级。

原文用报告显示敏感度下降与标准变保守,用支持表达与最优决策和消极假设的一致性,用可能表达社会代价内化等推测,相关性不等于因果,也没有测量误判的社会成本、反应时或认知负荷。常见误解是把拉唇准确率上升当成噪声增强了某类线索,正确复述应是敏感度下降叠加标准移动。另一个误解是把总体趋势当成每名被试每一步都成立,原文估计的是群体趋势与被试随机截距,不是逐人单调证明。

复现先做什么:刺激、流程与分析的最小可运行集合是什么?

复现应先锁定信息条件,而不是先调模型。第一步是获取语料与噪声。原文使用愉悦微笑语料库中覆盖 3 类语音完整的两个说话人语言子集,噪声来自多人背景库并手工剔除可懂言语与笑声,复现时至少要记录说话人、语言、句子表与所选噪声段,否则无法对齐条件。第二步是重建三档刺激。

去掉首尾静音后把干净语音归一化到 70 分贝,噪声段裁为语音前后各多 200 毫秒并加 50 毫秒淡入淡出,重采样到 16 kHz 后按目标信噪比混合为单声道,分别生成安静、负 3 分贝、负 6 分贝版本。第三步是重建行为流程。按语言招募流利听者,做耳机筛查与音量校准,任务一问是否像微笑,任务二问是否愉悦,每任务内随机呈现并允许重听,嵌入注意力检查。第四步是重建分析。

用二项逻辑混合效应模型估计噪声与类别交互并纳入被试与刺激随机截距,再从每档噪声的击中率与虚报率算敏感度、判断标准与区分度。原文复现链接当前可用,可核对刺激划分与噪声轮换细节。还需补的验证是更大更平衡的说话人样本、自发语音复测,以及人机对比与声学比较,原文已把后两项列为未来方向。

收束:何时值得借鉴本文的双任务加双指标做法?

当研究问题同时涉及能否听出与能否分清时,本文的双任务设计值得借鉴。只做检出会掩盖类型间的脆弱性差异,只做细分会忽略存在感先丢失的可能。双指标同样重要:只看准确率会在任务二得出噪声帮助拉唇的错误印象,加上敏感度与判断标准才能看到证据全面变差而默认答案移动。对于语音技术评估,启示是真实噪声场景不仅降低可懂度,还可能让用户或系统向保守默认偏移,从而系统性低估积极情感,这在缺少视觉的通话场景中更值得检查。

复述方法时应保留 3 组关键超参数与信息条件:70 分贝归一化、16 kHz 单声道混合、安静加负 3 分贝加负 6 分贝三档,以及任务一八十四试次与任务二四十二试次的构成。若只能记住一句话,就是噪声既拿走证据又改变标准,安静时愉悦更易被听出,强噪声下判断反而倒向非愉悦。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总