英文题目:Audiovisual Emotion Perception in Mandarin-Speaking Preschoolers with Cochlear Implants: Visual Dominance and Balanced Eye-Mouth Attention
会议身份:
conference:speechprosody:2026:conference-paper-id:wu26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#人类参与评测 #统计分析 #音视频 #语音情感识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Ruowei Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiunan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zheyu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shanpeng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ping Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理动态视听情绪感知中的冲突加权问题,输入为面部表情与情绪言语不一致的视频,输出为儿童判断的高兴或愤怒标签,难点在于听觉退化儿童如何重组多感觉权重与面部注视。研究先录制女性播音员的积极与消极语句并做声学校验,再通过保留原片与跨情绪配音构造一致与冲突刺激,接着让人工耳蜗(Cochlear Implant,CI)组与健听组边看边做二选一判断并同步记录眼动,最后用混合效应模型与相关分析连接判断偏向与注视分配。与健听儿童近似均等加权不同,CI儿童表现出明确视觉主导并形成更均衡的眼口分配,机制差异体现为听觉可靠性下降驱动的感觉重加权而非单纯唇读延续。在冲突条件下CI组基于面部的反应比例显著高于随机水平而健听组停留于随机水平,一致条件下两组准确率分别达91.98%与99.67%。结论目前仅适用于普通话高兴与愤怒的强表情加完整语义刺激,未验证其他情绪与纯韵律条件的推广性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留哪些信息?
本文的输入是动态视听情绪短片,目标是让刚进入语音音乐音频领域的研究生能复述这项汉语学龄前儿童研究的方法与证据。研究对象是 27 名 3 到 7 岁人工耳蜗植入儿童和 25 名年龄匹配的健听儿童,任务是判断每段短片表达的是高兴还是生气,同时记录眼动。必须保留的信息包括被试来源与年龄、24 句话如何录制与配音成 48 段、一致与不一致条件的定义、判断指标如何编码为面孔依赖反应、眼动感兴趣区如何划分与分析窗如何定义、主要统计结果的方向与限制。
输出是 1 篇可核对的技术解读,不做营销式判断,不补充原文之外的数值。学习路径是先理解情绪感知的双通道冲突任务,再看方法全景如何把面孔与声音拆开又拼回去,然后走完单个样本从录制到判断再到眼动的完整链条,最后按问题组织实验条件、结果与复现要点。人工耳蜗在这里指通过植入装置提供听觉但频谱与时间信息受损的听觉补偿方式,健听指听力典型发展的同龄儿童。后续所有简称固定为人工耳蜗组与健听组。
研究关心的不是单通道能不能认对,而是双通道打架时更信谁,以及看脸时更看眼睛还是嘴巴,这两点决定了干预应该补听觉利用还是调整视觉策略。
同输入同目标的前人工作给出了什么基线?
在视觉通道,前人报告 3 到 7 岁儿童对高兴与生气面孔的识别正确率超过 80%,说明面孔是早期就很显著的线索。在听觉通道,3 岁起的健听学龄前儿童对情绪韵律的识别已高于随机水平,说明声音也能独立提供情绪。作者引用的一项整合研究指出,健听儿童在冲突时能同时利用双通道,但尚无研究直接量化他们在冲突下的权重,这正是本文要补的基线。眼动方面,前人发现 5 到 8 岁儿童在言语感知中对眼区与嘴区各分配约 50% 的注视,没有强烈偏好,被解读为整合式注视策略。
另一支文献关注听力损失儿童,青少年与成人人工耳蜗使用者在情绪斯特鲁普任务中表现出面孔干扰强而声音干扰弱,提示面孔主导,但证据来自大龄组。还有研究发现 3 到 7 岁助听器儿童看情绪视频时眼区注视约 35%,低于健听同龄人的约 50%,提示早期听觉剥夺限制眼部社交互动,而读唇需求把注意拉向嘴部。
本文的 3 个缺口正是对这些工作的直接回应,第一是学龄前人工耳蜗组是否有视觉主导尚不清楚,第二是偏嘴注视是否从言语理解延伸到情绪感知尚不清楚,第三是注视分配是否预测线索权重及其组间差异尚不清楚。理解这些对照很重要,因为类别差异不能当成同条件胜负,只有同为动态视听情绪判断、同为冲突范式时,组间比较才公平。
冲突范式要回答的三个问题是什么?
本文把问题收敛为 3 个可检验的提问。第一,当视觉与听觉传达冲突情绪时,人工耳蜗学龄前儿童是与健听同龄人一样均衡加权,还是不同方式加权。第二,人工耳蜗组在情绪感知中是采用偏嘴注视,还是与健听组一样相对均衡。第三,对眼睛或嘴巴的注意是否预测对视觉或听觉线索的依赖,且这种注视与表现的关系是否组间不同。作者基于听觉信息受损与读唇倾向提出 3 个预测,分别是人工耳蜗组更依赖面孔、更多注视嘴巴、越依赖视觉者越注视嘴巴。
教学上可以把例子想成同一句话你跑得真快,1 次配高兴脸加高兴声音,1 次配生气脸加高兴声音,儿童只选高兴或生气,研究者看他跟脸走还是跟声音走,这就是冲突范式的直观含义,此处例子仅为帮助理解,不添加无源的效果数值。
视听线索权重 × 面孔依赖反应: 视听线索权重指当面部表情与言语声音表达不一致时,判断者把最终情绪归因更多分给哪 1 通道的倾向;面孔依赖反应是它的操作化指标,即在不一致试次中判断与面孔情绪一致的比例。两者搭配的原因是权重是心理构念无法直接观察,必须用面孔依赖反应比例来量化,分工是前者解释策略,后者提供可统计的计数,组合后才能检验人工耳蜗儿童是否出现视觉主导。
为回答这些问题,研究必须同时拿到行为选择与眼动分配,并在一致条件先确认基本识别能力,否则冲突下的偏向无法解释为策略而可能是能力缺失。
从一句话到一次判断,完整链条如何走通?
先沿一个样本走完全程。挑选一句语义为正向的汉语文本,例如你跑得真快,由 1 名有播音经验的女性普通话发音人录制 2 次,1 次用高兴的面孔加高兴的韵律说,1 次用生气的面孔加生气的韵律说,每次录制前后各保留 1 秒中性表情。视觉线索被操作化为动态面部表情,听觉线索被操作化为韵律与语义方向一致的情绪言语,例如生气韵律加负面语义。一致刺激保留原始录制,即高兴脸配高兴声音,生气脸配生气声音。
不一致刺激通过把同一句话的冲突情绪录音配到对立面孔上制成,即生气脸配高兴声音,高兴脸配生气声音。全部 48 段视频随机分成两套每套 24 段,每名儿童只做一套。测试时儿童坐在距屏幕约 70 厘米处,先做带反馈的练习,再随机顺序观看每段约 3.5 秒的短片,随后在 4 秒内从两个卡通脸中选高兴或生气,由实验者根据言语或指点记录答案,同时用 150 赫兹便携眼动仪在标准 9 点校准后记录眼动。
声学核查确认生气韵律音高显著更高而强度显著更低,说明两种情绪的韵律区分如期实现。
一致试次 × 不一致试次: 一致试次指面孔表情与言语声音表达同一种情绪,用于确认儿童具备基本情绪识别能力;不一致试次指同一句话的面孔是一种情绪而配音是另一种情绪,用于逼出权重选择。两者搭配的原因是前者提供基线防止把听不懂当成策略差异,后者制造冲突才能观察偏向,分工是前者校准能力,后者检验策略,组合后才能解释冲突下的选择。
这条链条的关键是同一句话只换情绪表达与配音组合,语义文本不变,从而把判断差异归因于通道权重而非文本差异。
判断编码与眼动划分各自负责什么计算?
行为侧的计算很直接。一致试次算正确率,作为能力基线。不一致试次把每次判断编码为面孔依赖或声音依赖,看判断与哪 1 通道的情绪一致,再算面孔依赖反应比例。首先用单样本 t 检验与 50% 随机水平比,判断组内是否有偏好,再用广义线性混合效应模型以组别与不一致类型为固定效应、被试为随机因素,检验组间权重差异。眼动侧先在面孔上划分眼睛区、嘴巴区与其他区 3 类感兴趣区,并把注视转为占总注视时间的比例。
分析窗定义为整个发音期,从嘴张开到嘴闭合。轨迹丢失超过 75% 的试次剔除,有 1 名人工耳蜗儿童因有效试次不足 25% 被移出眼动分析。模型用线性混合效应模型,以感兴趣区、组别与 4 种刺激类型为固定效应,被试与试次为随机因素,检验注视分配的组间差异。其他区计入总时长但不单独检验,因为与研究问题相关性有限。最后把面孔依赖比例与眼区注视比例做反正弦转换以满足正态假设,再在组内做皮尔逊相关,检验注视与表现的关系。
感兴趣区 × 注视时间比例: 感兴趣区指在面孔上事先划分的眼睛区、嘴巴区与其他区,是空间划分工具;注视时间比例指在发音窗内落在每个区内的注视时长占总注视时长的份额,是注意力分配的度量。两者搭配的原因是只有先固定空间边界,才能把连续眼动转化为可比的比例,分工是前者定位置,后者定数量,组合后才能判断是偏眼、偏嘴还是均衡。
这样,行为回答信谁,眼动回答看哪,两套比例在同一试次结构下对齐,才能做跨模态关联。
本研究训练了什么,没有训练什么?
本研究没有训练任何神经网络模型,也没有更新或冻结模型参数,不存在梯度路径、优化器或早停等训练计算,这是必须明确的缺项,不能从任务名称推定有模型训练。真实的计算发生在刺激构造与统计建模两处。刺激构造侧的计算是录制、配音与声学验证,声学分析用 t 检验确认音高与强度的情绪区分。统计侧的计算是行为与眼动的混合效应建模与相关分析,监督来源是儿童的二选一情绪判断与眼动仪的注视坐标,重置时机对应每试次的刺激呈现与 4 秒选择窗。
韵律 × 语义内容: 韵律指音高、强度等声音层面的情绪载体,语义内容指句子字面意思的褒贬,本文把两者捆绑为统一的听觉言语线索。分工是韵律提供声音如何说,语义提供说了什么,搭配原因是真实汉语交流中两者同时出现且方向一致,组合后听觉线索的情绪更明确,与视觉面孔形成干净的二选一冲突,避免单独操纵其一带来的模糊归因。
由于听觉线索把韵律与语义捆绑,本文无法分离两者各自的贡献,作者在讨论中明确承认这一点,后续若要拆分,需要系统操纵韵律而固定语义,或反之,并重新验证声学参数。初学者容易把无训练误解为确定性求解,这里要纠正,无训练只意味着没有拟合模型参数,儿童行为与眼动依然是随机变量,需要用混合模型处理被试与试次变异,不能把平均比例当成每名儿童每步都成立。
被试、划分、设备与指标条件是否一致?
被试方面,人工耳蜗组 27 人平均 5.51 岁,标准差 1.07 岁,范围 3 到 7 岁,来自北京与河北的康复中心,均为语前重度听力损失,1 到 5 岁接受植入,平均植入年龄 3.33 岁,平均植入经验 3.18 年,无报告的智力障碍。健听组 25 人平均 5.15 岁,标准差 0.70 岁,范围 4 到 6 岁,来自江西与湖北的幼儿园。两组年龄匹配,但招募地域不同,这是复现时需注意的潜在混杂,原文未报告社会经济或语言能力的组间均衡数据。
刺激方面,24 句汉语含 12 句正向与 12 句负向,每句两种情绪各录 1 次,共 48 段,随机分成两套,每人完成一套 24 试次,试次顺序随机。设备方面,便携眼动仪采样率 150 赫兹,标准 9 点校准,距离约 70 厘米,安静房间单独测试。指标方面,行为指标是一致正确率与不一致面孔依赖比例,方向是比例越高越偏视觉。眼动指标是各感兴趣区注视时间比例,方向是比例越高表示对该区注意越多。统计聚合对象是被试内试次平均后再做组间模型,被试与试次作为随机因素。
硬件预算与推理开销不适用,因为无模型推理。复现时必须保留的关键信息条件是同一句话跨情绪配音、发音窗分析、75% 轨迹丢失剔除规则,以及反正弦转换后才做相关,这些细节决定数字可比性。
冲突时更信脸吗,基本能力是否达标?
比较前先明确公平条件与指标方向。一致条件比较正确率,方向是越高能力越强,用于排除基本识别缺失。不一致条件比较面孔依赖比例,50% 为无偏好,高于 50% 偏视觉,低于 50% 偏听觉。两类不一致配对都要看,以防情绪效价不对称。下表把一致基线与两类不一致的组间格局放在同一框架下,列数达到五列以便 1 次核对条件、指标与两组表现及可运行的判断依据。
表前提出的问题是,在基本能力达标的前提下,冲突时的偏向是否组间不同,指标方向如上所述。
| 条件 | 指标 | 人工耳蜗组 | 健听组 | 组间可运行判断 |
|---|---|---|---|---|
| 一致视听 | 情绪识别正确率 | 91.98% | 99.67% | 两组均高,基线达标 |
| 生气脸配高兴声音 | 面孔依赖反应比例 | 显著高于 50% | 与 50% 无差异 | 人工耳蜗组更信脸 |
| 高兴脸配生气声音 | 面孔依赖反应比例 | 显著高于 50% | 与 50% 无差异 | 人工耳蜗组更信脸 |
表后解释主要收益与代价。一致条件下两组正确率都高,说明冲突下的差异不是听不懂任务。
原文报告人工耳蜗组两类不一致都显著高于随机水平,而健听组两类都不偏离随机,事后比较显示人工耳蜗组在两类配对中都显著更依赖面孔。代价是听觉线索利用不足,这与人工耳蜗装置频谱时间信息受损的背景一致。未胜出项是健听组没有表现出单通道主导,这恰是典型多感觉均衡发展的证据,不能写成健听组表现差。
图前导读如下,本图展示不一致条件下两组面孔依赖反应的平均比例,是判断视觉主导最直接的证据,需要同时核对柱高与 50% 参考线以及误差线。
看图路径: 1. 先看横轴两组被试 CI 与 TH,再看纵轴面孔依赖反应平均比例;2. 比较粉色与青色两类不一致配对的柱高是否都高于 50% 虚线;3. 观察每根柱顶误差线长度,判断组内变异大小;4. 对照 TH 组两根柱一根略低于 50% 一根略高于 50% 的格局
论文图 2。原论文 Figure 2:“Mean proportion of face-based responses in”。
从像素可见,左侧人工耳蜗组粉色与青色两柱都高达约 80% 以上且误差线短,明显高于红色虚线表示的 50% 水平,右侧健听组粉色柱略低于 50% 而青色柱略高于 50% 且误差线相对更长,整体贴近随机线。该格局支持人工耳蜗组强烈视觉主导而健听组均衡加权的判断,但也提示健听组内个体变异值得进一步用个体数据核查,不能把均值无偏推广为每名儿童都无偏。
看脸时看哪,注视与选择是否关联?
这一节把注视分配与注视表现关联当成对主结果的反证与细化,相当于用眼动做消融式对照。如果视觉主导来自读唇习惯,那么应该看到偏嘴且越看嘴越信脸,如果来自均衡整合,则应看到眼口均衡且关联模式不同。比较问题是,在 4 种视听组合下,眼区与嘴区注视比例的组内高低与组间差异如何,以及眼区注视是否预测面孔依赖。指标方向是注视比例越高表示对该区投入越多,相关为正则越看眼越信脸。
下表用五列同时呈现组内偏好、组间差异与相关方向,避免只看均值而忽略关联缺失这一负结果。
| 比较维度 | 具体指标 | 人工耳蜗组 | 健听组 | 组间差异与关联 |
|---|---|---|---|---|
| 眼对嘴注视 | 眼减嘴注视差 | 无显著偏好 | 眼显著多于嘴 | 人工耳蜗组眼更少嘴更多 |
| 眼区注视 | 眼区时间比例 | 相对更低 | 相对更高 | 组间眼区差异显著 |
| 嘴区注视 | 嘴区时间比例 | 相对更高 | 相对更低 | 组间嘴区差异显著 |
| 注视表现关联 | 眼区注视与面孔依赖相关 | 无显著相关 | 显著正相关 | 关联模式组间分离 |
表后解释收益、代价与反例。
原文报告健听组眼区显著长于嘴区,而人工耳蜗组眼口相当,组间比较显示人工耳蜗组眼区更少、嘴区更多,但并非言语理解中那种独占式偏嘴,而是在情绪任务中更均衡,这与助听器儿童约 35% 眼区注视的文献格局相近。关联上健听组越信脸越看眼,人工耳蜗组无此关联,这是重要的负结果,说明不能用看哪直接预测信谁。未评测边界是其他区未单独检验,且只覆盖高兴与生气,诊断性面部特征随情绪变化,结论外推需谨慎。
图前导读如下,本图按一致与不一致四大面板展示两组眼区与嘴区平均注视时间比例,是检验均衡还是偏眼的关键像素证据。
看图路径: 1. 先确认顶部一致与不一致四大面板,再看每面板内 CI 与 TH 两簇;2. 比较每簇内粉色眼睛柱与青色嘴巴柱的高低关系;3. 观察 TH 组眼睛柱在四个面板中是否始终高于嘴巴柱;4. 观察 CI 组两色柱高是否接近,据此判断均衡还是偏眼
论文图 4。原论文 Figure 4:“Mean proportion of fixation time on AOIs.”。
从像素可见,4 个面板中右侧健听组粉色眼睛柱在每簇中都明显高于青色嘴巴柱,而左侧人工耳蜗组两色柱高接近,尤其在高兴脸配高兴声音与生气脸配高兴声音等面板中几乎持平。该可见格局支持健听组偏眼而人工耳蜗组均衡且相对更看嘴的判断,同时显示一致与不一致类型间柱高模式变化不大,与模型中类型主效应不显著的报告一致,不能把某一面板的微小高低推广为类型效应。
哪些推测尚未验证,适用边界在哪?
需要区分直接报告、有限解释与未验证推测。直接报告的是人工耳蜗组冲突时面孔依赖更高、眼口注视更均衡、注视表现关联缺失。有限解释是感觉可靠性假说与跨模态可塑性对视觉主导的支持,原文用可能与潜在等措辞,屬於解释而非因果证明,相关性不是因果。未验证推测包括把均衡注视解读为灵活任务适应,以及把关联缺失归因于根深蒂固的读唇习惯或多区整合需求,这些都没有直接操纵读唇或分区信息量来验证。
感觉可靠性假说 × 跨模态可塑性: 感觉可靠性假说指神经系统按各通道的可靠程度加权,越不可靠的通道权重越低;跨模态可塑性指早期听觉剥夺后视觉加工招募听觉相关皮层从而视觉增强。两者分工是前者解释当前加权结果为何偏视觉,后者解释长期发育为何视觉能力得以维持,搭配原因是单靠可靠性只能解释即时权衡,加上可塑性才能解释学龄前即已出现的稳定视觉主导,组合后构成对人工耳蜗儿童策略的双层机制解释。
适用边界有三处。第一,只检验高兴与生气,不同情绪的诊断性特征不同,例如有的情绪更依赖嘴形,有的更依赖眼神,模式可能不外推。第二,听觉线索捆绑韵律与语义,无法分离各自贡献,也未报告音高强度之外的声学细节。第三,眼动有效性依赖轨迹丢失剔除与发音窗定义,若更换分析窗或纳入其他区,结果可能变化。缺失证据不是技术错误,但复现时必须补足这些验证才能谈干预效果,未测量误判率、延迟或成本时,不承诺这些量得到改善。
要复述与复现,先做什么,需要什么?
复述时先按样本链条讲清楚录制、配音、分组、判断与眼动 5 步,再报数字时同时核对数据集、阶段、指标、单位与聚合对象。例如 91.98% 与 99.67% 是一致条件下的正确率,不是冲突下的面孔依赖比例,百分点差与相对百分比含义不同,不能混用。t 值与 p 值对应单样本与 50% 比较,贝塔与标准误对应混合模型的组间或区間比较,r 值对应组内相关,三者不能互换。
复现先做三件事,第一是准备 24 句褒贬明确的汉语文本并由同一发音人两种情绪各录 1 次,前后保留中性表情,第二是同一句话跨情绪配音生成不一致刺激并做声学核查,第三是按每人一套 24 试次随机顺序呈现并用 150 赫兹眼动仪记录发音窗注视。关键超参数与信息条件包括距离约 70 厘米、每段约 3.5 秒、选择窗 4 秒、75% 轨迹丢失剔除、有效试次不足 25% 移出、反正弦转换后相关。
资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,只能按原文方法重做。干预启示是帮助人工耳蜗儿童更有效整合多面部区域信息,而非简单把注意引向某一特征,但这仍是待验证的临床方向,需补 broader 情绪类别与韵律语义分离实验。
何时值得尝试这种冲突范式,核心 takeaway 是什么?
当研究问题是通道权重而非单通道能力时,值得尝试这种一致基线加不一致冲突的设计,因为只有冲突能逼出选择,只有基线能排除能力混杂。当问题还涉及注意机制时,应同步记录眼动并划分眼口感兴趣区,否则无法判断偏向来自看不见还是不加权。本文的核心是人工耳蜗学龄前儿童已表现出视觉主导与眼口均衡注意,且注视与选择的关联与健听儿童分离,这扩展了大龄人工耳蜗使用者的发现,提示感觉重加权在学龄前已经出现。
教学上要记住 3 个对照,健听组均衡不是无能力,人工耳蜗组均衡注视不是无差异,关联缺失不是测量失败,它们共同指向不同的感知机制。未来验证需要纳入更多情绪类别、分离韵律与语义贡献、操纵面部区域信息量以检验因果,并报告个体差异与纵向变化,才能把实验室的二选一判断推广到日常社交情绪理解。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 21 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

