英文题目:Eye and Mouth Cues in Audiovisual Perception of Mandarin Irony: Evidence from Eye-Tracking
会议身份:
conference:interspeech:2026:conference-paper-id:xia26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #言语感知 #音视频 #语音 #音视频理解
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Shifeng Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Shanpeng Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为普通话字面褒贬与真实意图相反的反语语音和说话人面部视频,输出为听者判断说话人意图是赞扬还是批评,难点在于反语赞扬在纯听觉下极难识别且眼口线索权重未知。研究沿用Li等人话语补全任务构造的60个正负偏向场景和120句目标句,由单名23岁女性发音人分4种态度录制,再剪辑为纯视觉、视听安静与视听噪声三种条件呈现,最后用Eyelink 1000 Plus记录眼动并以线性混合效应模型分析眼口兴趣区注视占比与瞳孔大小。与以往只看行为正确率或整体面部效应的工作不同,该设计把注视分配视为线索利用指标、把瞳孔大小视为认知负荷指标,从而区分注意偏好与加工代价。在反语责备识别任务条件下,视听安静设置的准确率为82.67%,低于纯视觉设置的准确率94.70%。反语赞扬在视听安静下口部注视超过眼部且眼注视伴随更大瞳孔扩张,表明两类反语依赖不同视觉通路。结论仅适用于单发音人、实验室摆拍表情与8人babble在-10 dB信噪比条件,未验证多发音人、自发反语及强语境下的稳定性。本文不涉及模型训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么反语理解必须同时看脸和听声?
这篇论文的输入是普通话说话人面对镜头说出的目标句视频与音频,目标是判断说话人真实意图是表扬还是批评。初学者要先建立白话理解:反语指责就是英文常说的讽刺,用好话说坏事,例如对方扑克打得很差却说你打得很好,真实意图是批评;反语表扬则相反,用坏话说好事,例如对方表现很好却说你打得很差,真实意图是亲昵的赞扬。英文术语是 ironic blame 和 ironic praise。
论文要解决的学习依赖是,字面语义相同但意图相反的两句话,单靠声音有时无法区分,特别是在普通话中反语表扬纯听的正确率很低,因此必须引入视觉通道。输出不是转写文字,而是二选一的意图标签,实验中用键盘的表扬键和批评键作答。理解这个任务设定后,才能明白为什么后续要划分眼睛和嘴两个面部区域,以及为什么要设置纯视觉、安静视听和噪声视听 3 种条件。
研究者明确提出两个问题:两类反语是否引起眼睛与嘴的不同注视偏好,以及环境噪声如何调节注意分配与认知负荷。整篇解读的事实只来自论文正文证据,不引入外部语料或模型经验。
已有路线走到哪里:韵律线索多、面部分区少、噪声下意图不明?
同学先把相关工作按同输入同目标来对照。第一条路线是韵律线索研究,输入同样是反语语音,目标同样是区分反语与真诚,在英语、德语、法语中发现有所谓反语语调时反语指责识别率很高,但在普通话纯听条件下反语表扬正确率只有约 30%,这说明听觉信息对反语表扬是不充分的。
第二条路线是视觉促进研究,输入增加了脸,目标仍是意图判断,加泰罗尼亚语听众识别反语指责从 50% 多提高到近 90%,意大利语中面部信息帮助更多人识别反语表扬而对反语指责帮助较小,这提示视觉作用随反语类型而异。第三条路线是面部分区研究,输入是表情图片或说话脸,目标是情绪识别,发现眼睛对悲伤恐惧更重要,嘴对厌恶高兴更重要,但这类结论是否搬到字面与意图冲突的反语上并不清楚。
第四条路线是噪声与多通道整合理论,模糊逻辑知觉模型认为一个通道退化时会更依赖互补通道,字面语音知觉中噪声通常把注视推向嘴以帮助解码发音,但在反语中看嘴保可懂度与看眼保意图之间是否存在权衡,论文指出尚不清楚。眼动方法在这里承担实时过程测量,注视时长反映线索信息分布,瞳孔大小反映认知努力,这正是行为正确率看不到的部分。
要回答的具体问题:两类反语是否分开用眼和嘴?
论文把大问题拆成可操作的对比。第一问是注视偏好是否按反语类型分离:反语指责是否更依赖眼睛,反语表扬是否更依赖嘴。第二问是噪声是否改变这种分配,以及瞳孔反映的努力是否同步变化。为了让对比公平,研究者采用话语补全任务设计情景,让同一字面句既能出现在积极偏向情景也能出现在消极偏向情景,从而得到真诚表扬与反语指责共用字面为正的句子,真诚指责与反语表扬共用字面为负的句子。
举例说明:室友扑克全胜时说你打得很好是真诚表扬,全败时说同样的话是反语指责;反之说你打得很差在全败时是真诚指责,在全胜时是反语表扬。这里的例子是教学用复述,数值与效果仍以论文报告为准。这种配对设计的好处是字面内容被控制住,眼睛与嘴的差异更可能来自意图类型而非词汇本身。
反语指责 × 反语表扬: 反语指责负责用字面为正的话表达批评意图,分工是字面与意图效价相反且意图为负;反语表扬负责用字面为负的话表达赞扬意图,分工是字面为负而意图为正。两者搭配的理由是字面效价相同但意图相反的配对可以分离字面理解与意图推断,组合意义在于揭示反语不是统一过程,而是按意图方向调用不同视觉线索的不对称加工。
从学习依赖看,必须先分清字面效价与意图效价两个维度,才能理解后文为什么把字面为负的 1 对放在一起分析、字面为正的 1 对放在一起分析。若混淆这 2 对,就会把反语表扬的低正确率误读为被试没看脸,而实际上是字面为负带来的干扰更大。
方法全景:从一句话样本走完录制到眼动记录
沿一个样本走完全程有助于复述。假设目标句是你这牌打得果然很好,字面为正。研究者先写好 60 个普通话情景,每个情景通过操纵事件结局同时服务真诚与反语表达。录制时请 1 位二十三岁普通话女性、无表演播音经验,在隔音室面对白色背景站立,头与上身入镜,相机距约一米并置于提词器后,外接电容麦同步录音。4 种态度分 4 个组块录制,组块间可休息,每句后停顿约 5 秒以防延续干扰,全程不给表演指导。
录好后在视频编辑软件中剪出目标片段,保存为高清视频,音频归一化到均方根 70 分贝,再叠加 8 人 babble 噪声在负十信噪比下生成噪声版,该信噪比经预实验在几乎听不见与容易听清之间取平衡。同一视频再衍生 3 种刺激:纯视觉、安静视听、噪声视听。感知实验共 44 名南理工学生,年龄十九到二十四岁,平均 21.25 岁,均为普通话家庭出生长大,无视听障碍,近视低于五百度以保证追踪。
实验在隔音实验室恒定灯光下进行,用眼动仪单眼记录左眼,头置下巴托距屏六十厘米,九点校准最大误差一度、平均误差低于 0.5 度。每个模态六十试次、每种态度十五试次,拉丁方平衡,3 模态分块呈现,看完视频后按提示键选表扬或批评,每段视频前做漂移校正。分析窗口为视频开始到作答提示出现,注视用速度加速度阈值算法界定,最短注视一百度毫秒,眨眼与无效瞳孔样本剔除。
下面先看感兴趣区如何划分,这是后文所有比例的分母与分子来源。导读:该图展示同一说话人脸上 3 个矩形框,理解框的嵌套关系才能明白眼嘴比例为何相加不等于一。
看图路径: 1. 先确认最外层大框为全脸区,内层上框为眼睛区、下框为嘴区;2. 再观察鼻梁附近绿色圆点为当前注视示例,不把它当作感兴趣区边界;3. 最后确认三框均为矩形动态区,理解后续比例分母为全脸注视时长
论文图 1。原论文 Figure 1:“Examples of the areas of interest of eyes,”。
解释:像素显示最外大框覆盖整脸为全脸区,内部上方小框覆盖双眼为眼睛区,下方小框覆盖嘴唇为嘴区,鼻梁处绿色点为注视位置示例。实际分析时用软件手动勾画这 3 个动态区,目标区总注视时长除以全脸总注视时长得到比例并做反正弦转换,瞳孔为各区有效注视期间平均直径且未做前刺激基线校正,个体基线差异由线性混合模型中被试随机截距承担。数据清洗剔除反应时超 10 秒、无有效眼动数据、全脸注视不足一百度毫秒的试次,共剔除五十五试次约占 0.69%。
组件与计算:眼嘴分区、注视比例与瞳孔如何算?
这一节把 3 个计算组件讲清。第一个组件是动态感兴趣区,输入是每 1 帧视频像素坐标,操作是人工圈出眼、嘴、全脸,输出是每段注视落入哪个区。第二个组件是注视时长比例,输入是落入各区的注视时长求和,计算是用眼区或嘴区时长除以全脸区时长,再做反正弦转换以满足建模假设。第 3 个组件是平均瞳孔大小,输入是有效注视期间眼动仪记录的瞳孔直径任意单位值,计算是按区取平均,不做基线减法。
统计模型为线性混合效应模型,公式含义是注视比例或瞳孔大小由感兴趣区、态度与模态三交互预测,并加入被试与句子随机截距,用软件模块估计并做校正后两两比较。论文没有训练神经网络,也没有冻结或更新权重一说,因此不存在梯度路径与优化器选择,后文训练节会明确说明这一点。
感兴趣区 × 注视时长比例: 感兴趣区负责在动态视频上圈定眼睛、嘴和全脸的空间范围,分工是确定信息来源;注视时长比例负责把目标区总注视时长除以全脸总注视时长并做反正弦转换,分工是量化注意力分配。两者搭配的理由是没有空间划分就无法归因,没有归一化就无法跨试次比较,组合意义是得到可建模的眼对嘴偏好指标。
瞳孔大小 × 认知负荷: 瞳孔大小负责记录有效注视期间的平均瞳孔直径,分工是提供生理信号;认知负荷负责解释该信号升降对应的加工难度,分工是提供心理含义。两者搭配的理由是单看注视位置不知道费力程度,单谈费力没有可测指标,组合意义是在注视偏好之外增加努力程度的第二维度,但原文未做前刺激基线校正,只能做被试内跨感兴趣区比较。
安静视听 × 噪声视听: 安静视听负责提供清晰可听的语音加面部表情,分工是呈现最强多通道不一致与整合需求;噪声视听负责在负信噪比下压低语音可懂度,分工是检验是否转向嘴以保可懂度还是留守眼睛以保意图。两者搭配的理由是按知觉逻辑互补通道在退化时会改变权重,组合意义是检验反语意图识别与语音可懂度之间的注视权衡。
初学者常误以为瞳孔大就等于更努力,论文的处理更谨慎:由于注视位置本身会影响瞳孔测量且未做基线校正,作者只在被试内比较眼与嘴,并靠随机截距吸收个体差异,因此跨人绝对值比较不可靠,同人同条件下的眼嘴差才有解释力。
有无训练:本研究没有模型训练,真实计算是什么?
本研究没有训练阶段,没有神经网络、优化器、损失函数、早停或参数冻结更新。真实计算分为 3 类。第一类是刺激构造计算:音频归一化到固定均方根电平并按信噪比混入多人 babble 噪声,视频重剪生成 3 种模态。第二类是眼动信号计算:按阈值检测注视与眼跳,按区汇总时长与瞳孔均值,按规则剔除无效试次。第 3 类是统计推断计算:用线性混合模型检验感兴趣区、态度与模态的主效应与交互,再做校正后比较,给出回归系数、标准误、t 值与 p 值。
监督来源不是模型标签训练,而是被试按键的正确与错误划分:选批评对应真诚指责与反语指责为正确,选表扬对应真诚表扬与反语表扬为正确,否则为错误。没有把无训练等同于确定性求解,被试行为与眼动仍有随机性,模型中的随机截距正是为此设置。复现时不需要准备显卡预算,需要的是同型号眼动仪、恒定光照、下巴托与校准流程,以及相同的剔除阈值与转换步骤,否则注视比例与瞳孔均值无法对齐。
实验条件:被试、材料、设备与指标如何对齐?
按问题组织条件。测什么:意图判断正确率、眼嘴注视时长比例、眼嘴注视期间平均瞳孔。与谁比:同字面配对内的真诚与反语比,例如字面为负对中真诚指责比反语表扬,字面为正对中真诚表扬比反语指责;同时跨 3 种模态比纯视觉、安静视听与噪声视听。条件是否一致:同一说话人、同一批目标句、同一拉丁方平衡与同一分析窗口,录制时控制背景、机位、灯光与停顿,测试时控制灯光、距离与校准误差。
指标方向:正确率越高越好,注视比例高表示更依赖该区,瞳孔大在本文解释为更费力但需结合任务看。材料量:目标句 120 句,字面为正 60 句对应真诚表扬与反语指责,字面为负 60 句对应真诚指责与反语表扬,每句 6 到 11 音节,均为陈述句;情景 60 个,每个服务 1 对真诚与反语。设备:录制用摄像机与电容麦,呈现用 19 英寸屏 800 乘 600 分辨率 60 赫兹与耳机,记录用眼动仪左眼单眼模式。
聚合与统计:正确率为 2 分类编码后按条件汇总,眼动指标按被试与句子随机截距建模,报告 3 重交互 F 检验与校正后比较。缺项要指出:瞳孔无前刺激基线,噪声只用 -10 信噪比 1 点,单说话人限制推广,行为正确率极不平衡导致反语表扬正确试次少而错误试次多,后文结果必须分正确与错误分别看。
主结果:正确理解时眼睛与嘴如何分工?
先看正确率揭示的难度排序,这是理解眼动的前提。字面为负的 1 对中真诚指责在 3 模态下正确率均在 90% 以上,而反语表扬在纯视觉约 90%、噪声视听约六成多、安静视听仅约一成多,说明听觉清晰时字面为负反而把人带向字面,视觉缺席或退化时判断更难。字面为正的 1 对中真诚表扬 3 模态均在 90% 五以上,反语指责在纯视觉约 90% 四、噪声视听约 80% 八、安静视听约 80% 二,说明反语指责虽不如真诚条件但远易于反语表扬。这种不对称是全文的基座。
提出比较问题:在控制字面内容后,正确试次的眼嘴比例是否随态度与模态翻转,公平条件是同字面配对、同被试同句子随机效应,指标方向是比例高为更依赖。下表整理论文报告的四格正确率,数值保留原文精度,用以核对后文眼动差异的样本基础。
| 模态 | 字面为负对真诚指责正确率 | 字面为负对反语表扬正确率 | 字面为正对真诚表扬正确率 | 字面为正对反语指责正确率 |
|---|---|---|---|---|
| 纯视觉 | 98.03% | 92.42% | 95.15% | 94.70% |
| 安静视听 | 99.70% | 16.62% | 99.24% | 82.67% |
| 噪声视听 | 96.52% | 67.58% | 96.97% | 88.18% |
表后解释:主要收益是确认两类反语难度根本不同,反语表扬在安静视听下崩塌而反语指责保持 80% 以上,具体代价是反语表扬正确试次过少,后续眼动结论在该格证据最弱。未胜出项是噪声视听并未让反语表扬超过纯视觉,说明加噪并未普遍改善意图识别。
再看字面为负对的注视分配。导读:下图三面板分别对应噪声、安静与纯视觉,横轴为反语表扬与真诚指责,纵轴为注视比例,交叉线形态直接回答嘴与眼谁占优。
看图路径: 1. 先按顶部标签区分左中右为噪声视听、安静视听和纯视觉三面板;2. 再对照图例确认红色实线为眼睛、青色虚线为嘴,纵轴为注视时长比例;3. 最后比较反语表扬侧嘴高于眼、真诚指责侧眼高于嘴的交叉形态
论文图 2。原论文 Figure 2:“Line chart with 95% CI of eyes and mouth”。
解释:像素显示反语表扬侧青色嘴线高于红色眼线,真诚指责侧红色眼线高于青色嘴线,三面板均呈交叉。论文报告正确试次中反语表扬在纯视觉与噪声视听下嘴显著多于眼,在安静视听下眼嘴无显著差;真诚指责则在 3 模态下眼均显著多于嘴。错误试次的描述分析显示仅噪声视听下眼少于嘴显著,其余 2 模态眼嘴无显著差,说明错误理解反语表扬时即使在纯视觉也未像正确者那样偏向嘴,可能更依赖语义而被字面牵引。
接着看字面为正对的注视分配。导读:该图横轴换为反语指责与真诚表扬,重点观察红色眼线是否始终压住青色嘴线,以及三面板间距变化。
看图路径: 1. 先确认横轴两点为反语指责与真诚表扬,纵轴仍为注视时长比例;2. 再观察红色眼睛线在三面板中始终位于青色嘴线上方;3. 最后注意噪声视听下面部两线间距收窄,但眼睛仍占优
论文图 3。原论文 Figure 3:“Line chart with 95% CI of eyes and mouth”。
解释:像素显示红色眼线在三面板中始终高于青色嘴线,反语指责侧差距更大,真诚表扬仅在安静视听下眼显著多于嘴。论文报告正确试次中反语指责在 3 模态下眼均显著多于嘴,真诚表扬仅安静视听下眼多于嘴显著。这支持反语指责稳定依赖眼睛,而真诚表扬的眼睛优势只在清晰视听下出现,噪声与纯视觉下眼嘴相当。
反证与瞳孔:费力程度是否跟着注视走?
把瞳孔当作消融式反证:如果注视偏好只是习惯而无难度差异,瞳孔应无眼嘴差;若有差,则说明不同区域带来不同负荷。提出比较问题:在同字面配对内,眼注视与嘴注视的平均瞳孔是否有差,公平条件仍是同模态同态度被试内比较,指标方向是瞳孔大解释为更费力。下表整理论文报告的眼嘴瞳孔比较,保留原文回归系数以便核对效应位置。
| 比较对 | 安静视听眼减嘴系数 | 纯视觉眼减嘴系数 | 噪声视听眼减嘴系数 | 显著性结论 |
|---|---|---|---|---|
| 反语表扬正确试次 | 45.750 | 12.344 | 16.554 | 仅安静视听显著 |
| 真诚指责正确试次 | -7.906 | -10.639 | 4.428 | 3 模态均不显著 |
| 反语指责与真诚表扬 | 12.260 对应真诚表扬显著 | 2.200 对应反语指责不显著 | 跨模态主效应见正文 | 仅真诚表扬眼大于嘴 |
| 反语表扬错误试次 | 32.750 对应安静视听 | 27.700 为主效应 | 交互不显著 | 眼大于嘴 |
表后解释:主要收益是定位费力点仅出现在反语表扬安静视听下看眼时,具体代价是该格正确样本最少且瞳孔无基线,结论需谨慎。未胜出项是真诚指责与反语指责的眼嘴瞳孔均无显著差,说明反语指责看眼多但不更费力,这与直接通达观点的解释一致,即显著眼睛线索可直接通达最终解释而不增加额外加工。反例是错误试次中看眼瞳孔仍大于看嘴,说明看眼费力并非正确理解独有。
导读:下图为字面为负对的瞳孔三面板,纵轴为平均瞳孔大小,重点看中间安静面板反语表扬点两线是否分离。
看图路径: 1. 先确认纵轴改为平均瞳孔大小,横轴仍为反语表扬与真诚指责配对;2. 再比较同一横轴点上红色眼睛点与青色嘴点的高低;3. 最后聚焦中间安静视听面板中反语表扬点眼睛明显高于嘴的分离
论文图 4。原论文 Figure 4:“Line chart with 95% CI of average pupil size”。
解释:像素显示中间安静视听面板中红色眼点明显高于青色嘴点,左右两面板眼嘴差距较小。论文报告仅反语表扬安静视听下眼显著大于嘴,真诚指责 3 模态无差异。作者解释为安静视听呈现最强不一致,需整合积极意图与面部表情及韵律,而从眼区提取积极意图时受字面为负干扰更大;噪声与纯视觉下正确者更看嘴且眼嘴瞳孔相当,作者认为噪声把注意推向嘴符合前人发现,且该注视模式不同于真诚表扬的眼嘴相当,证明被试并未把反语表扬当真诚处理。
边界何在:哪些结论不能推广?
先明确测量边界。瞳孔未做前刺激基线校正,且注视位置本身影响测量,作者靠被试随机截距与被试内比较补救,因此跨被试绝对瞳孔值不可比,眼嘴差的方向比大小更可信。注视比例分母为全脸而非全屏,若被试看背景多则比例同步变化,但清洗已剔除全脸不足一百度毫秒试次,影响有限。再看设计边界。单女性说话人控制了说话人变异,使差异更可能来自反语亚型,但推广到多说话人、男性声音、自发表情时待验证。
噪声只测负十信噪比一点,无法画出随信噪比变化的注视转移曲线。样本为 44 名大学生普通话母语者,年龄集中十九到二十四岁,文化注视习惯与亲密玩笑语境可能影响眼睛偏好。再看证据不平衡边界。反语表扬安静视听正确率仅约一成多,正确试次瞳孔显著差基于小样本,而错误试次分析为描述性且交互校正后边缘,作者未对错误试次做过度因果断言。相关性不是因果,看嘴多与理解正确同时出现,不能证明强制看嘴就能提高反语表扬识别。
未测量误判率之外的延迟、信心与社交后果,不承诺这些量得到改善。
复现先做什么:按原文重走哪几步?
若要复现,先做材料与刺激。按话语补全任务写 60 个可双向操纵结局的情景,每情景产出字面为正与字面为负各 1 句,每句 6 到 11 音节陈述句,共 120 句。请普通话女性录制,分 4 种态度组块,每句后停顿约 5 秒,不给表演反馈,白色背景头与上身入镜,相机约 1 米置提词器后并同步高质量音频。剪辑为高清片段,音频归一化到均方根 70 分贝,混入 4 男 4 女共 8 人 babble 在 -10 信噪比下生成噪声版,再衍生纯视觉、安静视听与噪声视听 3 种条件。再做实验与记录。
恒定灯光隔音室,19 英寸屏 800 乘 600 分辨率 60 赫兹,耳机呈现,下巴托 60 厘米,左眼单眼记录,9 点校准最大 1.0 度、平均低于 0.5 度,每模态 60 试次每态度 15 试次并拉丁方平衡,练 12 试次,看完选表扬或批评,每视频前漂移校正,窗口为视频开始到作答提示。再做分析。
手动勾画眼嘴全脸动态区,用速度 30 度每秒、加速度 8000 度每 2 次方秒、眼跳 0.15 度、最短 100 毫秒界定注视,剔除眨眼无效瞳孔、反应超 10 秒、无有效数据与全脸不足 100 毫秒试次,计算反正弦转换比例与分区瞳孔均值,用混合模型检验感兴趣区乘态度乘模态并加被试与句子随机截距。资源状态方面,论文未绑定经验证的代码模型数据资源,不得声称已公开,只能按原文方法重做。还需补的验证是多说话人、连续信噪比与基线校正瞳孔,以及平衡正确试次的预注册分析。
何时值得尝试:带走哪条可操作判断?
带走的核心判断是分类型加权视觉线索。处理普通话反语指责时优先保证眼睛信息清晰,因为正确理解在 3 模态下都伴随更长眼睛注视且不增加瞳孔负荷,遮挡眼睛或低分辨率眼区更可能伤意图识别。处理反语表扬时优先保证嘴部动态与表情韵律同步,因为正确理解在纯视觉与噪声视听下伴随更多嘴注视,而在清晰视听下看眼费力更大,提示字面为负干扰主要落在眼区整合阶段。
噪声下不要一概让人看嘴保可懂度,本研究显示反语表扬正确者在噪声下看嘴多但反语指责正确者仍看眼多,说明意图类型调节噪声策略。常见误解是把嘴多等同于听不清所以看口型,本文证据显示反语表扬正确者的嘴偏好区别于真诚表扬的眼嘴相当,且瞳孔在噪声下眼嘴相当,因此嘴偏好更可能是意图线索提取而非单纯语音解码。另一个误解是把瞳孔大直接当没听懂,本文中瞳孔大只出现在特定态度特定模态特定注视区,不能推广为整体难度指标。
未来值得补的是跨说话人泛化、眼动因果干预与实时多模态意图识别的落点检验。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



