英文题目:EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation
会议身份:
conference:interspeech:2026:conference-paper-id:huang26p_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对比学习 #多模态学习 #音视频 #语音情感识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Zilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Chong-xin Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Zezhong Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Ruichen Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对话情感识别以多轮对话中每条话语的文本、音频与视频为输入,输出离散情感标签,难点在于同说话人相邻话语发生情感漂移时仍高度相似,传统上下文建模易误判渐变过渡。该工作先用预训练编码器与双向门控循环单元提取三模态上下文表示,再经Transformer或图网络融合为统一话语向量并送入分类器。同步引入情感惯性引导监督对比学习模块,依据说话人身份与注意力加权时窗划分正样本、易负样本与惯性窗内难负样本,并以相似度动态调节排斥强度。相较于仅按标签异同构造正负对的已有对比方法,该机制显式利用局部时间持续性刻画渐变式情感转移。在IEMOCAP上融合Transformer的变体取得准确率73.95%与加权F1值74.01%,超越表格中最强基线。在MELD上同样取得最高准确率68.19%与加权F1值67.33%,但领先幅度较小。结论目前仅在IEMOCAP与MELD的英文表演与影视对话上验证,向多语言自发对话与长时情感演化的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一处混淆?
本文的研究对象是会话中的多模态情绪识别。输入是一段按时间排好的对话,包含多个话语,每个话语同时带有文本转写、音频片段和视频片段,还带有说话人编号。目标是为每个话语预测一个离散情绪标签。学习依赖是上下文:同一个人的情绪不会孤立出现,前后话语、说话人交替都会影响当前判断。
论文抓住的矛盾是情绪惯性带来的混淆。白话说,情绪惯性就是情绪不爱突变,会拖着走。一个人上一句难过,下一句即使标注已经变成沮丧或中性,表达方式仍可能很像。传统做法只看标签是否相同来组织对比学习:标签相同算正对,标签不同算负对,不管两句话离得远近、是不是同一个人。这样会把惯性窗内那些表面相近但标签不同的样本当成普通负样本一视同仁,模型学不到渐变过渡的细微差别。
本文的输出是 1 篇可复述的方法解读。必须保留的信息包括任务定义、骨干结构、惯性窗的构造方式、正样本与两类负样本的划分、动态权重对比损失的计算、联合训练系数、数据集划分与评价指标、主结果与易混情绪对的误分变化。所有事实只来自论文原文证据与本次收到的原图像素,不引入外部评价。
已有路线做了什么,本文与它们在同输入同目标下有何不同?
在相同输入与相同目标下,已有会话情绪识别路线主要做上下文建模。一类用图神经网络显式建对话结构,例如把多模态与长距离上下文放进图中的多模态图卷积,以及用自适应图选择平衡模态内与模态间交互。另一类做表示学习与情绪转移建模,例如引入情绪转移检测模块、用会话级课程学习按情绪转移频率渐进增强识别能力,或建模多标签。
本文与上述工作的运行阶段相同,都是在训练阶段利用对话上下文与标签监督学习表示,在测试阶段逐句预测。区别在于监督信号的组织方式。已有监督对比方法不考虑相邻话语的情绪标签,只按标签异同划分正负。EII-SCL 额外使用说话人身份、情绪标签与局部时间窗三者联合构造样本,把同说话人、窗内、跨标签的样本单独列为难负样本,并按相似度动态加权。这不是增加新数据标注,而是在同一批融合特征上改变采样与损失。
需要避免的误解是把类别差异当成同条件胜负。图方法与 Transformer 融合方法在特征编码器、图构建方式上本就不同,本文的公平对照是同一骨干加与不加模块的比较,而不是跨骨干直接比绝对值。
问题如何形式化,一个样本要经历哪些已知量?
论文把一段对话记为按时间排序的话语集合,每个话语带有情绪标签与说话人标签。每个话语的多模态数据用模态相关的表示符号区分文本、音频、视频。任务是利用整段对话的全部话语信息,为每个话语预测情绪标签。
举一个教学例子帮助理解,不代表论文数据:假设一段九句话的对话,说话人甲说了第 1、3、5、7、9 句,其中第 5 句是当前锚点,第 3 与第 9 句和它同情绪,第 7 句与它情绪不同但离得近,第 1 句与它情绪不同且离得远。按本文定义,第 3 与第 9 句是正样本,第 7 句是难负样本,第 1 句与其他说话人的话语是易负样本。这个例子只说明划分逻辑,不添加任何效果数值。
问题的难点在于离散标签与连续过渡的错位。标签把情绪切成有限类,但人的表达是渐变的。惯性窗内的跨标签样本在语义上仍接近锚点,若对比损失给它们与远处易负样本相同的推力,模型要么推不开真正易混的边界,要么过度惩罚本就相似的过渡状态。
整体框架如何走通输入到输出?
骨干多模态会话情绪模型完成 3 步:上下文特征提取、多模态特征融合、情绪分类。EII-SCL 与骨干并行工作,输入是融合后的多模态特征,输出是一个对比损失,与分类交叉熵联合优化。图注明确指出线条粗细表示排斥力强度,不同颜色表示不同情绪标签,实线与虚线矩形分别表示可训练与冻结模型。
具体走通一个样本的过程是:3 模态原始话语先经各自预训练编码器得到话语级表示,再经双向循环网络得到上下文表示,然后经特征融合得到统一向量,最后经分类器得到情绪概率。EII-SCL 不对原始信号直接操作,而是对融合向量按说话人与惯性窗组织正负集合,计算带动态权重的对比损失,反向影响融合与上下文模块的参数。
多模态特征融合 × 上下文特征提取: 上下文特征提取负责单模态时序建模:对文本、音频、视频分别用预训练编码器取 utterance 表示再过双向 GRU;多模态特征融合负责跨模态互补:把 3 路上下文表示合成为统一的融合向量,二者搭配后分类器与对比模块都作用在融合向量上,使惯性约束直接塑造最终判别空间。
下面这张总体结构图展示了上述两条路径如何衔接,左侧是骨干的 3 模态提取与融合,右侧是以某个锚点话语为中心的采样与推拉示意,需要结合图例确认说话人形状与情绪颜色的对应关系。
看图路径: 1. 先沿左侧文本、音频、视频三路箭头看到编码器、双向 GRU 再到特征融合与分类器的主路径;2. 再看右侧以锚点 u5 为中心向外连的推拉箭头,区分拉近与推远的线型含义;3. 对照右侧图例确认圆圈与三角分别对应哪个说话人,以及颜色与情绪标签的关系;4. 找到底部标注的惯性窗大小为 1 的示意,理解窗内与窗外样本如何划分
论文图 1。原论文 Figure 1:“The overall architecture of the proposed EII-SCL approach.”。
从像素可见,左侧文本、音频、视频 3 路分别经过编码器与双向循环网络后汇入特征融合模块,再到分类器与情绪标签;右侧以蓝色锚点为中心,多条带箭头连线指向周围话语,图例区分了正样本、不同说话人易负样本、窗外同说话人易负样本与窗内同说话人难负样本,并在底部标出该锚点的惯性窗大小示例。这种画法把采样策略从文字定义变成了可执行的空间划分:先看锚点,再看窗内窗外,最后看推拉强度。
惯性窗与三类样本如何计算与划分?
第一步是定义正样本集。对第 i 个话语,正样本是除自身外所有说话人相同且情绪标签相同的话语的融合向量。这一步只用身份与标签,不用时间距离。
第二步是估计惯性窗大小。论文用注意力机制计算锚点与同一说话人其他话语之间的注意力权重,查询与键矩阵是可学习的投影。窗大小是注意力加权的时间距离再取整,时间距离用话语序号差的绝对值衡量。这样做的安排理由在原文有明确说明:固定窗不能反映不同对话段情绪持续性的变化,注意力窗能在情绪稳定区扩大、在突变处收缩。
第 3 步是用窗划分两类负样本。易负样本包括不同说话人的话语,以及同说话人但标签不同且落在窗外的话语。难负样本是同说话人、标签不同且落在窗内的那些话语。这种划分把说话人特异的时间窗建模为情绪惯性的载体。
情绪惯性 × 监督对比学习: 情绪惯性负责指出哪里难分:同一说话人在局部时间内情绪抗拒突变,即使标签已跳转,语义仍相近;监督对比学习负责把这种先验变成推拉力,让正样本拉近、难负样本按相似度加权推远,二者组合的意义是把心理学上的渐变持续性转化为采样策略与损失权重。
惯性窗 × 难负样本: 惯性窗负责划定时间范围:以注意力加权的时间距离估计每个锚点受惯性影响的邻域;难负样本负责定义学习目标:在该窗内、同一说话人但情绪标签不同的话语,二者搭配的原因是只有落在窗内的跨标签样本才真正受惯性混淆,窗外样本归为易负样本。
第四步是计算情绪惯性感知的对比损失。分子是正样本的指数余弦相似度和,分母加上易负样本的指数相似度和,以及难负样本经动态权重调整后的指数相似度和。动态权重的形式与余弦相似度相关,相似度越高,权重调整越能避免过度惩罚潜在相似的话语,同时保持可分性。最终对所有锚点取平均的负对数形式得到对比损失。原文报告温度参数与平衡系数,但未报告注意力投影矩阵的初始化与是否冻结细节,这部分属于缺项,不从模型名称推定。
训练如何联合优化,哪些参数更新、超参数是多少?
训练目标是分类交叉熵与情绪惯性对比损失的加权和,权重系数记为阿尔法。骨干的上下文提取、融合与分类器参与分类损失的优化,同时融合特征经由对比损失获得额外的梯度。图注提到实线与虚线矩形区分可训练与冻结模型,但正文未逐一列出每个预训练编码器是否冻结,因此复现时应以代码与原文实现细节为准,不自行假设全部微调或全部冻结。
交叉熵损失 × 情绪惯性对比损失: 交叉熵损失负责按标签做逐句分类监督,保证基本识别正确;情绪惯性对比损失负责按说话人与惯性窗做表示级约束,放大易混情绪对的间隔;二者以系数加权联合优化,使模型同时学对标签和学开表示。
论文报告的实现条件是:3 模态分别用 RoBERTa、Wav2vec2.0 与 CLIP 提取特征,单卡训练,在 IEMOCAP 上训练 40 轮、在 MELD 上训练 50 轮,批量大小与优化器设置明确,温度与平衡系数明确,并对最后 10 个检查点做权重平均得到最终评价模型。权重平均是一种评价前的聚合操作,不是早停本身,复现时需保留相同的聚合口径,否则结果不可比。
推理阶段不需要构造正负样本,也不需要计算惯性窗与对比损失,只用骨干的前向路径逐句预测。这意味着额外计算主要在训练阶段,部署时不增加采样开销,但论文未测量训练时长增量与推理延迟,因此不能承诺效率改善。
数据、划分、指标与骨干如何保证可比?
论文在两个会话情绪数据集上验证。IEMOCAP 是广泛使用的会话情绪数据集,论文采用留 1 会话交叉验证策略。MELD 是源自电视剧老友记的多模态多说话人会话数据集,论文遵循数据集预定义的训练验证测试划分,并与已有工作保持一致。评价指标采用准确率与加权平均 F1 分数,方向都是越高越好,加权 F1 能缓解类别不均衡带来的偏差。
为衡量模块有效性,论文自建了两个代表性骨干:基于 Transformer 的融合方法,把拼接特征经 Transformer 编码器进一步捕捉互补信息;基于图的融合方法,沿用对话图卷积的构图思路并扩展到多模态拼接输入。两个骨干在特征提取层面保持一致的 3 模态编码器设置,这是公平比较的前提。基线包括已有图方法、多模态融合方法与近期情绪转移感知方法,以及作者复现的多模态对话图卷积。
下表整理论文报告的训练与优化配置,数字与单位保留原文写法,用于复现前核对实验条件,不能当作性能结果表使用。表前的问题是:复现需要固定哪些与性能无关但影响可比性的条件。公平条件是同一硬件与轮数、同一优化器与编码器设置。指标方向在此表不适用,因为这是配置表。
| 配置项 | 数据集与阶段 | 优化与模型设置 | 对比与聚合设置 | 硬件 |
|---|---|---|---|---|
| 训练轮数与批量 | IEMOCAP 训练 40 轮,MELD 训练 50 轮,批量大小 13 | 学习率 0.0002,丢弃率 0.3 | 温度 0.07,平衡系数 0.02 | 单张 4090 |
| 编码器与聚合 | 文本 RoBERTa,音频 Wav2vec2.0,视觉 CLIP | 优化器 Adam | 最后 10 个检查点权重平均 | 单卡 |
表后解释:该配置表的价值在于锁定可比性。文本、音频、视觉编码器固定后,骨干差异只来自融合方式;轮数、批量、优化器与权重平均固定后,加与不加模块的差异才能归因于采样与损失。代价是单卡批量较小,对比学习依赖的负样本数量受限于对话长度与批量,论文未报告不同批量下的稳定性,这是未评测边界。
主结果测了什么,谁与谁比,数字支持什么判断?
主结果测量的是两个骨干在加与不加 EII-SCL 前后的准确率与加权 F1,以及与已有基线的对比。比较的公平条件是同一数据集划分、同一评价指标、同一特征编码器。指标方向为越高越好。论文报告显示,两个骨干在集成模块后都超过了所列基线,其中 Transformer 骨干在 IEMOCAP 上的准确率与加权 F1 最高。
需要同时看到未胜出项。按论文表格,图骨干加模块后在悲伤类别上的分数低于部分基线,Transformer 骨干加模块后在愤怒类别上低于不加模块前的某些表现,说明总体趋势不等于每个情绪类别都提升。论文还指出已有方法在高兴类别上存在标签偏置,提示单一总体指标可能掩盖类别级代价。
下图先验证情绪惯性现象本身是否成立。图前导读如下:该图横轴是窗口大小,纵轴同时展示平均余弦相似度与难负样本占比,需要先区分 3 条相似度曲线与一条占比虚线的含义,再看小窗口处的差值标注。
看图路径: 1. 先确认横轴为窗口大小、左纵轴为平均余弦相似度、右纵轴为难负样本占比;2. 比较红色难负样本曲线、绿色易负样本曲线与蓝色正样本水平线的相对位置;3. 观察窗口为 1 处标注的差值,理解惯性影响最强时为何最难分;4. 跟踪紫色虚线随窗口增大快速上升的趋势,理解难负样本比例的变化
论文图 3。原论文 Figure 2:“Impact of window size ω on the average similarity and proportion of negative samples on the IEMOCAP dataset.”。
从像素可见,红色难负样本平均相似度在小窗口时明显高于绿色易负样本与蓝色正样本水平线,窗口为 1 处标注的差值为 0.3645;随着窗口增大,红色曲线下降,紫色难负占比虚线快速上升至接近 1。论文报告所有窗口下难负与易负的相似度差异的显著性均达到要求,且最小窗口差距最大。这支持难负样本确实更难分的判断,但也提示窗口过大时会把大量普通样本划为难负,稀释其挑战性。
下表整理主结果中可运行策略的数字,条件是同一编码器下的骨干对照,指标为准确率与加权 F1。表前的问题是:在相同骨干下,加入模块是否带来一致增益。公平条件是数据集划分与编码器一致。指标方向为越高越好。
| 骨干与策略 | IEMOCAP 准确率 | IEMOCAP 加权 F1 | MELD 准确率 | MELD 加权 F1 |
|---|---|---|---|---|
| 图骨干 | 71.45 | 71.14 | 67.32 | 66.28 |
| 图骨干加模块 | 73.13 | 73.15 | 67.83 | 66.97 |
| Transformer 骨干 | 72.53 | 72.57 | 67.64 | 66.58 |
| Transformer 骨干加模块 | 73.95 | 74.01 | 68.19 | 67.33 |
表后解释:主要收益是两个骨干在 2 个数据集的总体指标上都提升,Transformer 骨干加模块后的提升幅度在 IEMOCAP 上更明显。具体代价在类别级:图骨干的悲伤分数与 Transformer 骨干的部分类别并未同步达到最优,说明模块通过强化难负边界改善了易混对,但可能压缩了某些原本可分的类别空间。未评测边界包括跨数据集泛化与不同说话人数量下的稳定性,原文未报告,不能推广。
易混情绪对的误分率下降了多少,有无反例?
该问题测量的是混淆矩阵中特定方向的误分比例,越低越好。与总体准确率不同,它直接反映难负建模是否打中了惯性混淆。比较条件仍是同一骨干加与不加模块,数据集为 IEMOCAP。论文报告多数易混方向下降,例如高兴误为兴奋、中性误为沮丧、愤怒误为沮丧等方向都有个位数百分点的下降。
必须指出的反例是图骨干上悲伤误为沮丧的方向在加入模块后略有上升,说明并非所有易混对都改善。这与主结果中类别级未同步最优是一致的:当窗内难负样本增多,对比损失可能把本就接近的悲伤与沮丧推得不够或推得过猛,取决于动态权重与温度的配合。
下表整理易混对误分率的数字,指标方向为越低越好,条件为同一骨干的前后对比。表前的问题是:模块是否减少了惯性导致的定向混淆。公平条件是同一划分与同一骨干。
| 策略 | 兴奋误为高兴方向 | 悲伤误为沮丧方向 | 中性误为沮丧方向 | 愤怒误为沮丧方向 | 沮丧误为中性方向 |
|---|---|---|---|---|---|
| 图骨干 | 8.85 | 19.23 | 19.56 | 27.37 | 12.22 |
| 图骨干加模块 | 6.36 | 19.88 | 14.08 | 24.54 | 11.92 |
| Transformer 骨干 | 7.54 | 24.62 | 16.53 | 19.55 | 8.98 |
| Transformer 骨干加模块 | 5.37 | 19.05 | 14.78 | 17.35 | 8.11 |
表后解释:主要收益是多数方向的误分率下降,其中 Transformer 骨干的下降更全面,支持动态窗与加权推斥对渐变过渡更有效。具体代价是图骨干上悲伤到沮丧方向从 19.23 升至 19.88,虽幅度小,但证明总体加权 F1 提升不等于每个混淆方向都改善。复现时应同时报告总体指标与这些定向误分率,否则会高估模块的均匀性。论文还报告难负相似度在小窗下超出正样本与易负样本 0.3645,这为误分改善提供了表示层面的旁证,但相关性不等于因果,仍需待验证。
动态窗与固定窗相比,什么条件下更有效?
消融要回答的是窗的构造方式是否关键。比较对象是固定窗口大小与注意力动态窗口,评价指标仍是加权 F1,越高越好。固定窗用预设的时间范围划分难负样本,动态窗按语义相关性自适应调整。论文的安排理由是情绪持续性在不同对话段变化,固定窗可能在稳定区过窄、在突变处过宽。
下图对比两种窗在不同窗口取值下的性能。图前导读如下:左右两幅子图分别对应 2 个数据集,横轴为惯性窗大小,纵轴为加权 F1 分数,需要同时观察固定窗曲线随窗口增大的走势与动态窗水平基线的位置关系。
看图路径: 1. 先确认左右两幅子图分别对应哪个数据集、横轴与纵轴的含义;2. 比较实线固定窗曲线与水平虚线动态窗基线的相对高低;3. 观察窗口较小时曲线的峰值位置,判断小窗为何保留更多判别力;4. 注意大窗口下曲线回落的幅度,理解过大窗口引入噪声的影响
论文图 2。原论文 Figure 3:“Impact of the dynamic and fixed inertia window size on ERC performance. The dynamic window adjusts to capture emotional persistence for each utterance.”。
从像素可见,左侧蓝色固定窗曲线在小窗口处先升后降,右侧橙色固定窗曲线也在小窗口处出现峰值后回落,而代表动态窗的水平虚线位于多数固定窗取值之上。论文报告动态窗持续提供更有信息量的难负样本,性能优于固定窗配置。这支持自适应范围能更好地捕捉情绪惯性的判断,但限制是动态窗依赖注意力估计本身的质量,若注意力学偏,窗大小也会偏,论文未报告注意力失效时的回退条件。
第二组特有细节是易混情绪对的误分率变化。论文报告在高兴与兴奋、悲伤与沮丧、中性与沮丧等多对易混标签上,加入模块后误分率多为下降,个别对变化很小。这表明模块的作用集中在难分边界,而非均匀提升所有类别。若某对情绪在语义上本就远离,模块带来的增益会很有限,这是适用条件的边界。
哪些结论有直接证据,哪些只是可能,缺了什么验证?
论文直接报告的是:在给定编码器、划分与超参数下,两个骨干加模块后的总体准确率与加权 F1 高于不加模块与所列基线;难负样本平均相似度高于易负样本,且差距在小窗最大;动态窗的加权 F1 高于多数固定窗取值;多数易混方向误分率下降。这些是有数字支撑的判断。
有限解释的是动态窗能根据语义相关性扩大或收缩。这有性能对比支持,但论文未展示窗大小与情绪稳定性的逐句对应,也未报告注意力权重的分布,因此只能说性能结果支持该机制有效,不能说已证明每句话的窗都符合心理预期。
可能与待验证的是把相似度差距直接解释为情绪惯性的因果证据。相似度高可能来自说话人音色、话题连续或编码器偏置,不一定全是情绪惯性。论文未做说话人无关对照,也未测量训练资源增量、推理延迟与输出稳定性,因此不能承诺这些量得到改善。资源状态方面,本次未发现来源绑定且完成验证的开源资源,不得声称代码、模型或数据已公开。
原文表头与图注之间没有发现算术冲突,但存在需要标注的口径差异:IEMOCAP 采用留 1 会话验证,MELD 采用预定划分,两者的平均方式与方差报告不同,不能把 2 个数据集的绝对值直接比较大小。
复现先做什么,需要固定哪些信息条件?
复现的第一步是重建数据与评价口径。IEMOCAP 按留 1 会话策略划分,MELD 按预定训练验证测试划分,指标用准确率与加权 F1。必须先确认划分脚本与已有工作一致,否则主结果不可比。第二步是固定 3 模态编码器为 RoBERTa、Wav2vec2.0 与 CLIP,并记录是否冻结与取平均的方式,因为表示起点决定了相似度与窗估计的基准。
第 3 步是实现两个骨干的最小可运行版本:Transformer 融合与对话图卷积的多模态扩展,保证不加模块时能复现接近论文的基线数字。第四步再加入 EII-SCL,包括正样本选择、注意力窗计算、易负与难负划分、带动态权重的对比损失与联合系数。关键超参数是温度 0.07、平衡系数 0.02、学习率 0.0002、丢弃率 0.3、批量 13 与最后 10 个检查点权重平均。
还需补的验证包括:不同随机种子下的方差、不同批量下的稳定性、注意力窗大小的分布统计、训练时长增量,以及悲伤与沮丧等未改善方向的类别级分析。只有补齐这些,才能判断增益是否稳健,而不仅是单次最优。
何时值得尝试,何时不必强求?
当任务满足 3 个条件时值得尝试:对话中有明确说话人编号,同一说话人连续发言较多,且易混情绪对的误分是主要误差来源。此时 EII-SCL 把局部时间与说话人身份变成采样先验,能在不增加标注的前提下强化难分边界。本文的证据表明这种做法对 Transformer 与图两类融合都有效,具有一定的即插性。
当对话很短、说话人切换频繁或情绪突变占主导时,不必强求大窗口与强推斥。窗口过大会把大量普通样本划为难负,稀释挑战性并引入噪声;温度与平衡系数不当也可能损害原本可分的类别。复现时建议从小窗口与动态窗开始,先观察难负占比与相似度差距,再调权重。
回到中心矛盾:离散标签要求分开,连续表达要求连着。EII-SCL 的价值不是消除惯性,而是承认惯性并把它变成学习信号,用窗内难负样本教会模型在相近表达中找边界。理解这一点,就能复述方法,也能预判它在哪些对话上最可能生效。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


