英文题目:Beyond Modality Collapse: Taming Guided Modality Entropy for Omni-modal Emotion Reasoning

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1044

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #多模态模型 #音视频 #语音情感识别

评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Xian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Rui Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuxiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Delai Qiu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yining Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shengping Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jitao Sang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

全模态情感推理需联合对话文本、视觉表情与声学韵律输出情绪标签及可解释推理链,难点在于全模态大模型易坍缩至视觉主导模态而系统性忽视声学与语言互补线索。作者先以OmniCoT流水线用专用模型分别抽取视觉、音频与对话证据并经大语言模型校验合成为带引导词的结构化推理链。接着以有监督微调冷启动使Qwen2.5-Omni-7B内化该格式与引导词调用方式,为后续优化提供稳定策略初始化。然后以DyME-GRPO在组采样强化学习中联合格式、准确率与动态模态熵奖励来自适应校准模态使用。与无约束自由推理及普通组相对策略优化不同,该方法以显式引导词锚定模态决策点并以不确定性加权探索抑制主导模态垄断,从而实现更均衡的多模态证据整合。在MELD基准下,EmoOmni的UAR指标为36.64,高于SFT基线的34.30。该结论适用边界受限于表演式与影视情感语料,极端长尾类别与强模态冲突消解尚未验证,训练成本对应4×NVIDIA A100硬件组成的高性能集群开销。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么学习问题?

本文的输入是包含人物面部表情、身体姿态、环境画面、语音语调与语速、以及语音转写文本的短视频片段,目标是先写出分模态证据再给出情绪标签并保持推理可检查。对于刚进入语音与音频方向的研究生,可以把任务理解为听看结合的分类加解释:分类部分要求在中性、高兴、悲伤、生气、恐惧、担忧、惊讶等类别中选一个,解释部分要求说明视觉听到什么、声音听到什么、说了什么话,最后如何综合。

原文强调全模态大语言模型在很多感知任务上很强,但在这种需要整合文本、视觉与声学信号的复杂情感推理上仍吃力,观察到的直接原因是模态坍缩。所谓模态坍缩,白话是模型偷懒只信一个最顺手的模态,例如只看脸不听声音,导致关键声学与语言证据被系统性忽略。教学例子是打鼓男子片段:视觉上嘴角与表情有迷惑性,声音上语气粗硬带有愤怒感,若只用视觉容易判成中性或惊讶,只有把宽眼、张嘴、紧张语气与对话内容并列后才能判准。

输出方面,本文要求模型输出包含思考段与答案段的固定结构,思考段内必须出现引导词分段,答案段给出最终情绪词。这种格式不是装饰,而是后续训练中格式奖励的检查对象,也是熵奖励的定位锚点。本文当前可用性方面,没有发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,复现只能按论文文字描述重做。

已有情感推理数据与全模态大模型各缺了哪一块?

同输入同目标的第一条路线是全模态情感识别与推理数据集。已有工作提供了情绪标签与推理痕迹,例如表情推理相关基准与后续改进的推理流程,但原文指出这些推理多为无结构的自由文本,缺少严格的逻辑校验。也就是说,数据告诉模型要解释,但没有规定解释必须分模态取证,也没有机制剔除证据不足或自相矛盾的样本。同运行阶段的第二条路线是全模态大语言模型。

从早期闭源模型到开源的视觉语音对齐架构,再到强调通用能力的基座与强调以人为中心感知、强化学习推理的专用变体,模型已经能处理交错的多模态信号。问题在于通用基座偏向广泛泛化,专用变体中已有工作率先把组相对策略优化用于情感推理,但其原始目标缺少专门的多模态优化,仍可能沿着主导模态走。两条路线对照后,本文的空位很清楚:数据侧缺结构化引导与逻辑校验,模型侧缺按模态不确定度调节依赖的强化目标。

因此作者一侧做数据范式,一侧做强化奖励,分别补齐这两块。理解这点后,就不会把本文误读为换个更大基座或单纯增加数据量。

模态坍缩在推理链上长什么样?

模态坍缩的操作定义是推理链中证据来源单一化:思考段里只有视觉描述是具体的,听觉与对话要么缺席,要么被一句话带过,最终答案顺着视觉走。原文图 1 给出的对照是同一段人物视频,普通基座写出没有强烈情绪、呼吸平稳、面部无扭曲等视觉判断后直接给出中性,而本方法在右侧分别列出嘴张大、眼睛睁大、声音紧张、对白内容,再在综合段里把睁眼加眯眼与紧张语调对齐到生气后给出正确标签。这个例子标为例子,不代表所有生气都表现为这些信号。

判断坍缩是否发生,不能只看答案对错,要看思考段是否出现多路证据与综合动作。若答案蒙对但链中只有一路证据,仍属于坍缩风险样本。信息冗余是另一个极端:各模态都写了很多,但综合段没有说明哪条证据起决定作用,哪条被否定,这种堆砌在后续奖励设计中会被熵项约束。

看图路径: 1. 先看左侧输入条上眼睛、麦克风、气泡三个图标,确认任务同时给视觉听觉文本;2. 再看左侧云状推理中被标红的呼吸与面部描述,确认视觉线索占主导;3. 对比左右两侧最终答案框的错误与正确标记,定位中间箭头提出的方法作用;4. 再看底部粉色与绿色色块的文字,确认要缓解的问题与期望的推理形态

原论文 Figure 1:Comparison of reasoning schemes for omni- modal emotion recognition.

论文图 1。原论文 Figure 1:“Comparison of reasoning schemes for omni- modal emotion recognition.”。

该图左侧展示了单模态捷径如何形成:输入同时有 3 路信号,但推理云中只有视觉图标被保留,另两路被打叉,最终红色箭头指向错误答案,底部粉色块点明问题;右侧展示了期望形态:绿色引导词逐段给出视觉、听觉、对白与综合,红色高亮的关键词在综合段被复用,最终绿色箭头指向正确答案,底部绿色块点明引导式多模态推理。中间灰色箭头把两侧连接为缓解关系,说明方法目标不是换答案词,而是换证据组织方式。研究生复述时应先说输入 3 路,再说左侧缺哪两路,再说右侧如何补齐并综合,避免只背结论。

两阶段方法全景:先学会格式,再学会协调模态

全流程沿一个样本走一遍最清楚。输入是一段视频及其提示词,输出是带引导词的思考段加答案段。第一阶段是有监督微调冷启动:把视频与对应的结构化推理序列配对,最小化目标序列的负对数似然,让模型学会在正确位置吐出引导词并遵守格式。这一步的目标是格式模仿,提供稳定的策略起点,不解决模态怎么加权。

第二阶段是动态模态熵组相对策略优化:在冷启动策略基础上,对同一提示采样一组输出,分别算格式、正确性与动态模态熵三部分奖励,再在组内归一化得到优势去更新策略,同时用与参考模型的散度约束防止跑偏。这一步的目标是从静态模仿走向动态协调,让模型在不确定时多探索互补线索。两个阶段的学习依赖是严格串行的:没有第一阶段,采样输出格式混乱,熵位置对不齐;跳过第二阶段,模型只会背格式,不会按不确定度调整视觉与听觉的相对权重。

为理解数据如何来,先看数据构造总览,左侧是分模态抽取,右侧是逻辑校验整合。

看图路径: 1. 先沿顶部胶片到 Frames 与 Audio 波形的蓝色箭头看三路分流;2. 再看 Qwen3-VL、Qwen2-Audio 与语音识别模型各自输出的位置;3. 接着看右侧大模型处同意与不同意的两个气泡及丢弃箭头;4. 最后看底部黄色长条中引导词与答案标签的拼接顺序

原论文 Figure 2:Overview of the OmniCoT.

论文图 2。原论文 Figure 2:“Overview of the OmniCoT. Left: Modality-Specific Evidence Extraction: Modality-specific evidence is extracted via MLLMs.”。

该图左侧顶部是视频胶片,向下分出视频帧与音频波形两路,分别送入视觉模型、音频模型与语音识别模型,底部黄色长条把 4 段内容按思考与答案拼接;右侧是大模型校验器,对同一证据分别给出同意与不同意的判断,不同意的样本被丢弃,同意的样本抽取综合理由接回黄色长条。这种先分后合再过滤的安排,是为了保证进入微调的样本既有分模态写法,又有逻辑一致性。后续所有训练都建立在这批样本之上。

数据侧组件:分模态证据如何抽取与校验?

分模态抽取的具体动作是各用专职模型写专职内容。视觉侧用视觉模型描述姿态、表情与环境线索,挂在视觉引导词后;音频侧用音频模型捕捉语调、语速与音量等副语言属性,挂在音频引导词后;文本侧用语音识别模型转写对话内容,挂在对白引导词后。原文还说明在最终合成前会用大模型校验做事实与逻辑过滤,附录给出各模型的提示词设计。

综合与校验的具体动作是由一个语言模型承担:它检查视觉、音频与文本证据是否足以支撑真值情绪,若通过则生成接到综合引导词后的决定性推理步,若不通过则整例剔除。这一步保留了语义对齐且逻辑稳健的样本,丢弃了信息不足或矛盾的样本。需要指出的缺项是论文未报告过滤比例与各路抽取失败率,复现时应自行记录保留率与丢弃原因分布,否则无法判断数据偏差。

引导词 × OmniCoT: 引导词指[vision]、[audio]、[dialogue]、[analysis] 这类显式分段标记,分工是规定模型何时看视觉、何时听声音、何时读文本、何时做综合;OmniCoT 是把这些标记织入推理链的数据构造范式,分工是提供分模态抽取再由大模型校验整合的完整样本;二者搭配的理由是只有标记没有高质量文本会空转,只有文本没有标记会写成自由发挥,组合后标记成为可监督、可检查、可计熵的位置,文本成为可学习的证据写法。

掌握该组合后,再看一个样本的理想写法:思考段先出现视觉标记后跟外貌描述,再出现音频标记后跟声音描述,再出现对白标记后跟转写文本,最后出现综合标记后跟跨模态对齐与结论,答案段只放情绪词。这种写法让后续熵计算能精确定位到模态选择点,也让格式检查能用模板匹配判定。

奖励侧组件:熵、权重与动态缩放如何算?

进入强化阶段后,每个采样输出会得到 3 个奖励。格式奖励检查输出是否符合带引导词的模板,符合得 1 否则得 0。正确性奖励比较从推理链抽出的预测标签与真值是否相等,相等得 1 否则得 0,二者相乘意味着格式不对则正确性不计分。动态模态熵奖励分 4 步计算。第一步算模态词熵:在生成视觉或音频引导词的位置上,对词表分布求香农熵,熵高表示该处选择更犹豫或更具探索性。

第二步算使用强度:用该模态词的选中概率除以其熵,选中越自信且熵越小则强度越大。第三步在视觉与听觉之间归一化得到相对权重,权重高表示该条推理更果断地优先使用该模态。第 4 步把加权熵求和得到原始模态奖励,再乘以 1 减正确标签概率。原文明确总奖励是格式与正确性乘积加上系数乘以动态模态熵奖励,系数取 0.1,更多讨论见消融。符号含义按原文交代:位置索引指向模态词,词表分布来自解码器,正确概率来自答案位置的预测分布。

原文未给出完整可复制的梯度路径与每步实现细节,复现时不应自行脑补裁剪阈值与散度系数,应以论文文字与附录为准并记录缺项。

模态熵 × 模态使用权重: 模态熵是在生成[vision] 或[audio] 等模态词位置上对词表分布求香农熵,分工是度量选择该模态时的不确定性;模态使用权重是把选中概率除以熵再在视觉与听觉之间归一化,分工是度量相对依赖强度;二者搭配的理由是只看概率会高估自信的独断,只看熵会忽略到底选了谁,组合成使用加权的熵项后才能既知道选得多果断,又知道选得多犹豫,为奖励提供可微调的信号。

组相对策略优化 × 动态模态熵奖励: 组相对策略优化是对同一提示采样一组输出并在组内算均值方差得到相对优势,分工是省掉价值网络并给出组内比较的学习方向;动态模态熵奖励是把使用加权的模态熵再乘以 1 减正确标签概率,分工是按答案不确定度调节探索强度;搭配的原因是前者只管答对与格式,后者管以什么模态组合答对,组合后模型在没把握时被鼓励多看多听,有把握时被允许收敛,从而从模仿格式走向协调模态。

模态坍缩 × 信息冗余: 模态坍缩指模型不成比例地依赖主导模态而系统性边缘化其他线索,分工是解释为什么单看脸会把生气判成中性;信息冗余指堆砌多模态描述却不增加判别力,分工是解释为什么加了推理反而更乱;二者需要同时处理的原因是只治坍缩会鼓励无节制探索,只压冗余会退回单模态捷径,论文用正确性奖励保判别、用熵奖励保探索、用格式奖励保结构,三者联合才同时缓解坍缩并抑制冗余。

直观理解是模型越没把握答对,越被鼓励保留多模态探索;越有把握,越被允许收敛。这样既缓解只看脸的坍缩,又避免为探索而探索的冗长。

两阶段训练如何组织,参数与数据如何配置?

冷启动阶段使用从中文影视剧情感基准中采样的少量样本并转为结构化格式,每样本随机选用预设指令之一以增强指令跟随稳健性,基座是 7B 规模的全模态模型,优化目标是目标推理链的似然。强化阶段把训练池扩大到包含动态表情与复杂情感推理的更多样本,总量达到万级,用统一奖励函数优化,目标是让模型内化推理过程而非表面模式匹配。

实现上所有实验在高性能集群上进行,使用高效微调库与低秩适配,微调与强化阶段保持相同的学习率与批大小设置,熵奖励系数经消融定为 0.1。需要保留的关键信息是冷启动样本量、强化样本来源、基座名称、低秩配置与学习率,这些是复现先要对齐的项。原文未报告采样组大小、解码温度、散度系数与训练步数等完整超参数,复现时应把这些记为待补验证项,不从模型名推定实现。 左侧冷启动与右侧强化如何衔接,看训练管线总览最直接。

看图路径: 1. 先看左侧冷启动框中数据与视频如何汇入同一基座再得到固定格式;2. 再看右侧采样输出组、奖励组与优势组的自左向右链路;3. 定位下方解码器引出的三个概率分布与熵计算模块的连线;4. 最后看右下角总奖励公式中三项是如何汇合回策略更新的

原论文 Figure 3:Overview of EmoOmni training pipeline.

论文图 3。原论文 Figure 3:“Overview of EmoOmni training pipeline.”。

该图左侧显示结构化数据与视频共同送入基座得到冷启动模型,并固定输出格式;右侧显示同一提示采样多个输出后经奖励函数得到多个奖励,再经组计算得到优势,同时参考模型提供散度约束,下方展开了解码器引出的模态概率、熵、使用权重估计与总奖励合成链路。复述时应强调数据流是自上而下再自左向右,而奖励流是自下而上汇入策略更新,避免把奖励模块说成独立分类器。

在哪些数据与指标上测,与谁比才算公平?

评估覆盖 4 类情感基准:两组是演员表演的高质量录制,另两组是来自影视剧的自然情感片段,后者场景更复杂自发。指标用加权准确率、非加权平均召回与加权平均召回,方向都是越高越好,其中非加权召回对类别不平衡更敏感,加权指标更受大类影响。基线分 3 类:普通全模态大模型、同数据无推理链微调的模型、以及专用推理模型,这种划分是为了分离数据暴露与结构创新的贡献。

公平条件的关键是同源微调对照:把基线放在与本方法相同的数据源上微调,若其在域内提升明显但跨数据集增益有限,则说明普通微调主要做域适配,而跨数据集优势更可能来自结构与奖励设计。通用能力对照用多类别通用基准,检查做专情感推理是否导致灾难性遗忘。硬件与实现条件按原文交代,训练用多卡大显存环境与高效训练库,评估指标按类别样本数聚合。

原文未报告统计显著性与多次随机种子方差,阅读时应把单次最优理解为报告值而非稳定性证明。

主结果测了什么,关键数字支持什么判断?

主结果要回答的是结构化推理加熵奖励是否带来跨数据集的稳健提升,而非仅在域内刷高。比较问题是:在相同数据暴露下,显式分模态推理是否优于普通微调与普通推理模型。公平条件是基线包含同源微调版本,指标方向均为越高越好。下表整理强化阶段相对冷启动在两组自然与表演混合基准上的变化,数字保留原文写法与精度,条件与指标在表头交代。

训练阶段对比数据集指标冷启动强化后变化来源
结构微调到熵强化MELDUAR34.3036.64组相对策略优化
结构微调到熵强化MELDWAR42.1346.53组相对策略优化
结构微调到熵强化IEMOCAPUAR44.63 对应阶段基线,强化后 42.8942.89少数类权衡
结构微调到熵强化IEMOCAPWAR57.75 对应阶段基线,强化后 58.1558.15组相对策略优化

表后解释需要同时说收益与代价。收益是自然对话基准上两项召回同步上升,表演对话基准上加权召回上升,说明熵奖励不只是提准确率,而是在改善跨数据集泛化。代价与反例是非加权召回在表演基准上略有回落,原文的有限解释是模型缓解多数类偏置、转向少数类精确判别,这是一种策略性权衡而非全面退化。未胜出项也要保留:同源微调在域内基准上仍具竞争力,说明数据暴露本身有价值,不能把全部增益归于奖励设计。跨表对照显示本方法在多数组合上达到最优或次优,但并非每格全胜,阅读时应按数据集与指标分别下结论。

单样本层面看方法如何纠正坍缩,下图是打鼓男子的三方推理对照。

看图路径: 1. 先看顶部胶片帧确认人物动作场景,再看真值标签的情绪词;2. 对比中间两种基线推理旁标注的仅用声学或仅用视觉的绿色小字;3. 再看底部本方法推理中绿色引导词方块如何分段组织证据;4. 最后核对三者答案框的颜色标记,确认多模态整合后的修正

原论文 Figure 4:Qualitative comparison of reasoning processes between EmoOmni and representative OLLMs.

论文图 4。原论文 Figure 4:“Qualitative comparison of reasoning processes between EmoOmni and representative OLLMs.”。

该图顶部胶片确认人物在演奏与演唱场景,真值为生气;中间基座推理旁标注仅用声学线索却走向高兴,另一基座推理旁标注仅用视觉线索却走向中性;底部本方法用绿色引导词分段列出视觉的惊讶描述、听觉的粗硬有力描述与对白文本,最后在综合段说明视觉更像惊讶而听觉更贴近愤怒,从而给出正确标签。这个例子支持的判断是显式分段迫使模型先看先听再结论,限制是该例综合段文字仍有前后不一致的痕迹,说明结构不能完全代替证据质量,复现时应检查综合段是否真正复用了前文关键词。

引导词与熵系数各自贡献了什么,反证是什么?

消融要回答两个独立问题:没有显式引导词会怎样,熵系数取多大合适。第一个问题的比较条件是训练集大小相同,仅改变推理文本结构:无推理链、已有推理数据、无引导词的自有推理、有引导词的自有推理。指标仍看召回类,方向越高越好。下表用原文报告的趋势整理,重点是引导词的有无对照与长尾分析,数字沿用原文精度。

消融条件对比对象MELD 指标变化IEMOCAP 指标变化原文判断
有无显式引导词自有推理保留文本但去掉标记UAR 与 WAR 出现可察觉回落UAR 回落更明显标记不可或缺
标准推理微调已有推理数据微调相对基线有提升相对基线有提升文本本身有效
结构化推理有标记自有推理达到最优达到最优结构纪律关键
少数类精度悲伤愤怒惊讶精度提升中性高兴精度有所让步召回改善从频率启发转向证据推理

表后解释要区分直接报告与有限解释。直接报告是去掉引导词后性能下降,支持标记对连贯多模态推理不可或缺;有限解释是精度增益集中在少数类而在多数类有所让步,支持模型从频率启发转向证据推理,但这仍是基于精度召回分布的推断,待更多校准实验验证。未评测边界是强模态冲突如何解决,原文在局限中承认缺乏针对严重冲突的细粒度设计,当前熵方法可能需要额外策略。第二个问题的证据是系数曲线呈抛物线,零系数明显更差,0.1 附近达到峰值,过大则强调探索而牺牲稳定性与格式 adherence。复现时应先固定 0.1,再在小范围内搜索并同时监控格式合规率,避免只看准确率调参。

哪些结论不能下,哪些边界尚未评测?

首先是任务边界。工作集中在多模态情感推理域,虽然通用基准显示通用能力未明显退化,但动态熵框架能否迁移到其他专用推理任务,原文明确需要进一步实证,不能直接推广。其次是冲突边界。当视觉与声学传递相反情绪时,当前以平衡模态使用为目标的通用框架缺少处理严重模态矛盾的专门设计,熵驱动方法可能需要更细粒度的消歧策略。再次是分布边界。

表演基准上的非加权召回波动主要受极小类别影响,剔除该异常后指标反超基线,这证明模型擅长利用模态,但对极端长尾仍敏感,数据稀缺方向是未来工作。最后是成本与可靠性边界。原文未测量误判率、延迟、推理开销与输出帧率,因此不能承诺这些量得到改善,训练资源与推理开销应分别讨论,总体趋势不等于每组每步都成立。阅读时应把已验证的跨数据集召回提升记为报告,把机制解释记为支持,把迁移潜力记为可能待验证。

复现先做什么,需要哪些信息条件?

复现的第一步是对齐数据管线,而不是直接调模型。按原文顺序,先用视觉模型、音频模型与语音识别模型分别抽取 3 路证据,再用语言模型做一致性检查与综合生成,不通过的样本丢弃,并记录保留率与丢弃原因。第二步是冷启动微调:把保留样本转为带引导词的固定格式,用随机指令增强跟随能力,在基座上做有监督微调至格式稳定。第三步是强化校准:对同一提示采样一组输出,计算格式、正确性与动态熵三项奖励并合成总奖励,在组内归一化后更新策略,同时保留与参考模型的约束。下表整理原文明确给出的可操作配置,缺项单独列出以免误当默认值。

复现项原文给定值未报告需自定并记录备注
冷启动数据4.4K,采样自 MER 2023过滤保留率转为结构化格式
强化数据17K,来自 DFEW 与 MER 2025 训练集划分与采样种子扩大训练池
基座与适配Qwen2.5-Omni-7B,LoRA 秩 8 缩放 32组大小与解码参数高效训练库
优化学习率 1×10−5,全局批 32,熵系数 0.1散度系数与训练步数先固定 0.1 再小范围搜
硬件4 卡 80 GB耗时与显存峰值需实测补齐

信息条件方面,没有验证通过的公开资源,不得声称代码权重数据可下载,复现应视为按文字重实现。常见误解是把引导词当成提示词技巧,实际上它们是训练数据的结构约束与奖励的定位点,只在推理时加词而不用对应数据与奖励训练,难以复现原文效果。另一个误解是把熵大等同于学得好,实际上熵项需与正确性相乘结构配合,过大系数会导致不稳定,调参时必须同时看格式合规率与少数类召回。

何时值得尝试这套方法,如何一句话记住它?

当你的模型明显偏爱某一模态,例如有脸就看脸、有字就看字,而另一路信号长期在解释中缺席,且你能拿到真值标签做正确性奖励时,这套先结构化再按不确定度调节的方法值得尝试。它的适用条件是能定位模态选择点、能采样多输出做组内比较、能承受 2 阶段训练成本;若任务是单模态为主或证据本身噪声极大,应先做数据清洗与单模态基线,否则熵奖励可能放大噪声。一句话记住:用标记把证据分开写,用熵把依赖调均匀,用正确性把探索拉回正轨。

研究生复述全篇时可按学习依赖串联:先说坍缩的操作表现,再说数据如何分抽与过滤,再说冷启动学格式,再说三项奖励如何合成与动态缩放,再说主结果的收益与长尾代价,最后说缺项与复现顺序。这样既能讲清动作,也能分清报告、支持与待验证 3 种语气。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 5 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 11 页

区域 3 · 查看论文原页

原文数学表达区域 4,PDF 第 11 页

区域 4 · 查看论文原页

原文数学表达区域 5,PDF 第 12 页

区域 5 · 查看论文原页

原文数学表达区域 6,PDF 第 13 页

区域 6 · 查看论文原页

另有 22 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总