英文题目:EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.440

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #音视频 #语音情感识别

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinghua Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuechen Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xi Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yequan Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yonghua Lin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

中文自发对话情感识别以对齐的语音加静音视频加文本为输入,输出离散情绪与连续极性及可解释描述,难点在于中文口语一词多情且跨模态信号经常冲突,单模态感知极易误判。作者以友谊与家庭与职场与医患等主题引导十九名专业演员即兴双人对话,共收集七百四十四段对话与一万九千余条话轮约二十三点六小时,构成表演性中文室内语料。标注按文本到音频到静音视频再到音视频的顺序实施模态隔离标注,再经加权置信聚合与多轮协商统一标签,上一步的离散属性经大语言模型受控改写进入下一步,生成说话人特质与说话方式与情绪语义与整体综合四维描述。相对影视爬取与固定剧本表演,该流程强调自发性与模态独立感知以保留真实分歧,并以四维解耦描述提供可控生成的语义锚点。在跨数据集标注一致性基准下,EmotionTalk的一致性指标Fleiss’Kappa为0.78,高于M3ED的0.59。多模态融合利用跨模态注意力对齐互补信号以缓解单模态歧义,但转入全类别细粒度划分后性能仍明显回落,表明中文细粒度情绪极具挑战。该结论适用边界受限于表演性中文双人室内对话,尚未验证自然日常对话与跨库迁移能力,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:为什么中文多模态情感缺的不是模型而是数据?

这篇论文的输入是中文双人对话的视频、音频与文本 3 模态记录,目标是让研究生能复述数据集如何构造、如何标注、如何划分与如何评测。必须保留的信息包括数据规模与来源、标注流程与一致性、划分方式、评测任务与指标方向,以及原文明确报告的关键数字。本文的输出是一份可核对的技术解读,不做超出证据的效果承诺。

中文多模态情感识别长期缺少高质量自发对话数据。英文侧已有从表演到影视的大量基准,而中文侧已公开数据多来自影视剪辑,质量与标注完整性不足,或者只有孤立单句而缺少多轮互动。更关键的是情感描述任务多依赖未公开数据,缺少可复现的开放基准。EmotionTalk 要补的正是这一环:用受控录制保证质量,用主题引导的即兴表演保留自然度,用对话形式保留情感演变,再配多粒度标注支撑识别与生成两类研究。

对刚入门的读者,先把多模态情感识别理解为同时看脸、听声、读词来判断情感。白话说,单看文字容易误判语气,单听声音容易忽略语义,单看脸容易忽略上下文。英文名是 Multimodal Emotion Recognition,缩写 MER。后文统一用多模态情感识别指代该任务,用单模态指代只用其中一种输入的对照条件。

已有路线走到哪里:影视数据、演员表演与中文对话数据各解决了什么?

按同输入、同目标、同监督来对照,英文影视与网络数据路线解决了规模问题。CMU-MOSEI 与 MELD 从视频网站与电视剧获取大量样本,覆盖离散分类与连续强度,但情感偏夸张且定义不统一。演员表演路线解决了质量可控问题,CREMA-D 与 RAVDESS 质量较高但不是对话,IEMOCAP 与 MSP-IMPROV 是对话但依赖固定剧本,容易出现朗读腔与舞台化表达。

中文路线中,CH-SIMS 与 MER-MULTI 处理的是普通话孤立单句情感,缺少对话轮次;M3ED 与 MC-EIU 中文部分把对话补上,规模也有进展,但原文指出在规模、质量与标注完整性上仍有局限。EmotionTalk 的定位不是替换这些数据,而是提供录制对话加细粒度标注的另一端:在受控环境中用专业演员做主题即兴,兼顾自然度与可标注性,并把类别、强度与说话风格描述放在同一批样本上。

教学上要区分两类任务。情感识别回答每一句是什么情感,情感描述回答为什么这样判断以及声音听起来什么样。前者用准确率与 F1 评价,后者用文本生成指标评价。论文同时做两类,正是为了说明同一批数据既能训练判别模型,也能训练生成模型。

要解决的具体问题是什么:自然度、对话性与可解释性如何同时满足?

论文要解决的问题可以拆成三问。第一,中文缺少大规模、高质量、带对话的录制数据,影视数据的噪声与剧本数据的生硬都影响研究。第二,即使有对话数据,标注多停留在简单类别,缺少强度与说话方式的细粒度记录,难以支撑可解释分析。第三,不同模态的情感信号经常不一致,缺少同时保留单模态判断与多模态综合判断的数据,难以研究融合的真实收益。

双人对话 × 情感识别: 双人对话负责提供随轮次展开的上下文与说话人交替,情感识别负责在该上下文中判断每一句的情感状态,二者搭配的原因是孤立单句会丢失前后影响,组合后模型必须同时建模说话人、语境与情感演变。

举一个教学例子,不代表论文数据:同一句文字保持中性,声音变急促、脸部紧张,整体可能被判为焦虑。这个例子只说明为什么需要分模态标注与整体标注并存,具体比例与效果以论文报告为准。论文用跨模态标签分歧来刻画这种现象,并把它作为必须用多模态融合的证据,而不是直接断言融合一定解决所有分歧。

方法全景:一个样本从录制到可用标签经历了哪几步?

沿一个样本走完全程有助于建立依赖顺序。输入是 2 名演员围绕友谊、家庭、职场、医患等主题的约 2 分钟即兴对话。表示阶段把连续对话切成话语级样本,每个样本保留文本、音频与视频 3 种形态。组件阶段对每个样本做 3 层标注:7 类离散情感、连续情感极性强度、4 维说话风格描述。目标阶段形成每个模态的独立标签与多模态综合标签。输出是可按话语取用的命名文件与 JSON 标注,可直接用于识别与描述任务。

帧级融合 × 话语级融合: 帧级融合负责在时间帧尺度对齐声学与视觉特征,话语级融合负责在整句向量层面合并文本、语音与视觉表示,二者搭配的原因是前者保留细粒度同步后者保留整体语义,组合后可以比较哪种粒度更能应对类别增多时的分布复杂性。

情感说话风格描述 × 可解释情感分析: 情感说话风格描述负责用说话人音色、语速语调与情感语义 4 维文字记录可听依据,可解释情感分析负责把分类结果还原为人类可读的理由,二者搭配的原因是只有稠密文字锚点才能支撑生成模型学习,组合后模型不再只输出类别而是说出判断依据。

全景中的关键取舍是放弃固定剧本。固定剧本易于控制但带来朗读腔,主题即兴更难执行但更接近真实互动。论文把每段对话限制在约 2 分钟,避免演员长时间维持单一情感,同时用电视剧情或大模型生成加人工质检的方式准备场景,保证多样性与逻辑连贯。录制在安静室内进行,演员按主题与大纲自然表达,而不是逐字背稿。

标注组件如何工作:类别、强度与风格描述各自算什么?

离散类别部分用 5 名标注者做多步交叉验证。白话说,加权置信就是先看每个人选了哪类、自己有多大把握,再把高把握的票算得更重。英文对应是 weighted confidence。论文按文本、音频、静音视频、带声音视频的顺序依次标注,要求 1 次只看当前模态,禁止多模态同步标注,以减少互相干扰。每类得分是对该类下置信度求平均的思想,最终类别取加权得分最高者,低置信或不一致样本进入多轮复核与专家讨论。

离散情感类别 × 维度情感强度: 离散情感类别负责给出高兴、愤怒等 7 种可数判断,维度情感强度负责给出从 -2.0 到 2.0 的极性与强度连续值,二者搭配的原因是类别便于分类评测而强度保留轻重差异,组合后同一句话既有类别归属又有程度刻度。

模态独立标注 × 多模态融合标签: 模态独立标注负责让标注者 1 次只看文本、只听音频或只看静音视频以避免互相干扰,多模态融合标签负责在看完全部信息后给出整体判断,二者搭配的原因是只有分开标注才能暴露模态分歧,组合后才能研究分歧如何被综合为整体感知。

强度标注针对每段音频安排 5 人打分,量表为 -2 强负、-1 弱负、0 中性、1 弱正、2 强正,5 人平均后得到连续值,用于正负二分类等连续任务。风格描述是论文强调的创新:先由人工标注离散属性,例如语速快、音调高,再用 DeepSeek-R1 只做受控改写,把结构化属性转成自然句,不允许推断新信息,并抽查 10% 做事实核对,报告一致性为 98.5%。4 个维度覆盖说话人音质、说话风格、情感与整体综合描述,目的是给大模型提供稠密语义锚点。

构造与标注如何执行:平台、人员与流程怎样保证可复现?

这一节没有神经网络训练,承担方法职责的是数据构造与标注流程。参与者是 19 名专业戏剧演员,男性 10 名、女性 9 名,年龄 24 到 40 岁,来自北京、河北、浙江、广东等 8 个省份,教育背景以本科与硕士为主,普通话覆盖标准音到带地域口音的自然谱系。对话为双人多轮,主题覆盖友谊、家庭、职场与医患,语言风格随场景变化,朋友间随意自然,职场中更正式严肃。

为提高效率与一致性,团队开发了网页标注平台。平台内置上下文回放,允许听到上一轮以便理解语境,并有实时逻辑检查防止冲突标签。高年级专家可在平台上复核歧义样本,保证标注者间一致性。下面这张图展示了平台界面的像素内容,重点是看清标注入口与回放控件的布局,而不是记住界面颜色。

看图路径: 1. 先看上方面板波形与时间轴,确认当前标注的是哪一段音频;2. 再看中部文本与离散类别候选区,确认标注入口的位置;3. 最后对比下方面板的多行文本框,确认风格描述与类别标注分开填写

原论文 Figure 4:Overview of the annotation platform interface.

论文图 4。原论文 Figure 4:“Overview of the annotation platform interface.”。

上图上方面板是语音情感识别标注界面,可见顶部波形与播放控制,中部为文本与类别候选,下方面板是说话风格描述界面,可见多行文本输入框。像素较模糊时不要硬读具体文字,应把握两个事实:类别与描述分开填写,标注时可回放上下文。这种分工对应前文的模态独立原则与多轮协商机制,也是后文高一致性数字的流程来源。伦理方面,论文报告去除个人标识并以编码代替,数据按 CC BY-NC 4.0 发布,仅限学术研究使用,每个样本标注成本为 0.2 元。

实验条件是什么:数据划分、特征与超参数如何固定?

数据总量为 744 段对话、19250 条话语,每个话语都有文本、音频与视频形态。音频共 23.6 小时,平均每条 4.4 秒,文本共 469387 字,平均每句约 24 字。划分采用约 8 比 1 比 1,训练、验证、测试分别约 15413、1908、1929 条,且按演员分组划分,验证用 G01 与 G12 的 4 名演员,测试用 G03 与 G15 的另 4 名演员,与训练无重叠。这种说话人无关划分的目的是防止身份泄露,使评测更接近对未见说话人的泛化。

文件组织对复现很重要。每个话语有统一命名的 JSON、wav 与 mp4,格式为组号、场次号、说话人号与话语号的组合。下面这张图展示了文件夹与文件名的像素实例,读图时重点核对命名层级与音视频对应关系。

看图路径: 1. 先核对上方面板音频文件夹路径与 wav 文件命名层级;2. 再核对下方面板视频缩略图与 mp4 文件一一对应的编号;3. 最后确认同一编号在音频与视频两侧都出现

原论文 Figure 3:Snapshots of audio and video samples in the EmotionTalk dataset.

论文图 3。原论文 Figure 3:“Snapshots of audio and video samples in the EmotionTalk dataset. All files are named following a consistent and structured format.”。

上图上半为音频文件夹下的 wav 列表,下半为视频文件夹下的 mp4 缩略图列表,同一编号在两侧对应出现。像素不能辨认全部编号时,只确认结构一致即可,具体切分起止时间以 JSON 中的开始与结束时间为准。

特征抽取覆盖 3 模态。语音用 Wav2Vec 2.0、HuBERT、WavLM 与 Whisper,文本用 BERT、RoBERTa、DeBERTa、LERT、Sentence-BERT、BLOOM、ChatGLM2、Baichuan 与 Vicuna,视觉用 Data2Vec、VideoMAE、EVA-02、CLIP 与 DINOv2。融合方法分帧级与话语级两类,前者如 MFN、GMFN、MCTN、MFM 与 MulT,后者如 TFN、LMF、MISA、MMIM 与注意力机制。评测中识别任务用准确率与 F1,连续任务按小于 0 为负、大于 0 为正做二分类,描述任务用 BLEU4、ROUGE-L、METEOR、SPIDEr、FENSE、BERTScore 与 CLAP-Score。

下面这张表是解码器训练超参数的原文矩阵,读表时先确认行是解码器、列是批量、轮数、学习率、权重衰减与预热,再对比不同解码器的设置差异。

DecoderBatch SizeEpochsLearning RateWeight DecayWarmup
Transformer-based8151.7e-053.0e-040
GPT-28151.7e-053.0e-040
Qwen-2461e-40.01,000

表后需要说明的是,Transformer 与 GPT-2 批量为 8、15 轮、学习率 1.7e-05,Qwen-2 批量为 4、6 轮、学习率 1e-04 且预热 1000 步。这种差异意味着描述任务的数字只能在各自条件下比较,不能把不同训练预算下的高低直接归因于模型结构。论文还说明 Qwen-2 实验用 A800,其余用 RTX 3090,优化器统一用 AdamW,识别类实验批量 32、100 轮。

下面这张表整理数据集规模,数字全部来自原文连续句,单位保留原文写法,用于核对划分与总量是否自洽。

条件指标训练验证测试总量
对话与话语对话数与话语数训练话语约 15413 条验证话语 1908 条测试话语 1929 条744 段对话共 19250 条
文本规模字数与句长训练部分包含在总量中验证部分包含在总量中测试部分包含在总量中469387 字,平均约 24 字每句

表后解释是,总量与分 split 数字对应,验证与测试各约 10% 且说话人不重叠,这是后文把加权准确率与非加权准确率差距解读为自然长尾分布的前提。若随机打散划分,身份泄露会虚高成绩,因此复现时必须按组划分而不能自行重排。

下面这张表是单模态与多模态识别的通用超参数原文矩阵,用于固定四分类与全类别两档条件的学习率与正则。

HyperparameterFour (Unimodal/Multimodal)All (Unimodal/Multimodal)
Learning Rate1e-31e-5
L2 Regularization Weight1e-51e-5
Batch Size3232
Epochs100100

表后说明,四分类与全类别在批量与轮数上相同,学习率分别为 1e-3 与 1e-5,正则权重均为 1e-5。这意味着从 4 类切到全类时的性能下降不能简单归因于训练轮数不同,而更可能来自类别粒度与数据不平衡的难度变化。

主结果显示什么:单模态强弱与融合收益在什么条件下成立?

主结果围绕 3 个问题组织。第一,各模态单独做情感识别时谁强谁弱。第二,多模态融合是否稳定超过单模态。第三,类别从 4 类扩到全类时代价有多大。比较的公平条件是同一数据集划分与同一指标方向,准确率与 F1 越高越好,描述任务中 BLEU 等越高越好但需区分字面重合与语义相似。

先看分布事实。下面这张图是 4 个模态的情感分布饼图,读图前要明确每张饼只统计该模态独立标签,而不是多模态综合标签。

看图路径: 1. 先按图例确认深蓝、橙、灰等颜色各自对应的情感类别;2. 再比较音频、文本、视频与多模态四个饼图中中性所占扇区大小;3. 最后观察视频图中高兴扇区是否明显大于音频与文本图

原论文 Figure 1:Data distribution across different modalities.

论文图 1。原论文 Figure 1:“Data distribution across different modalities.”。

上图 4 个饼分别为音频、文本、视频与多模态综合。可见音频中中性占 48.7%、愤怒占 19.8%,文本中中性占 41.1%、愤怒占 19.2%、惊讶占 14.1%,视频中中性占 34.3%、高兴占 23.1%、愤怒占 21.8%,综合后中性占 35.6%、愤怒占 19.2%、高兴占 18.7%。这支持论文的判断:视频分布更多样,音频与文本更集中在中性,单看一模态会丢失信息。像素中百分比标签较小,但图例颜色与扇区相对大小足以支撑该趋势判断,不需要硬读每 1 位小数。

下面这张表整理标注一致性,数字来自原文连续句,用于判断标签是否可信。

条件指标音频文本静音视频多模态综合对外比较
标注者一致性Fleiss Kappa0.790.660.730.78总体 0.78 超过 M3ED 的 0.59

表后解释是,音频与多模态接近几乎完全一致,文本相对最低但仍达实质一致,总体 0.78 高于 M3ED 的 0.59。这支持多轮协商有效缓解了自发对话的歧义,但不能直接推出模型准确率也会同样高,因为标注一致性与模型泛化是不同对象。未胜出项是文本模态,其歧义更大,这与后文文本识别弱于语音的趋势互相印证。

下面这张表是情感预测对话任务的原文结果矩阵,包含语音与文本两种输入下的 4 种可运行方法,是判断模态差距的核心证据。

ModalityModel UAWAF1
BiGRU58.5171.9959.20
AVEF56.5272.7160.78
DEP58.4172.0762.14
EAMT59.1173.3462.61
BiGRU31.5957.9628.68
AVEF31.8857.6428.80
DEP32.5357.8329.00
EAMT32.4758.0429.33

表前已说明比较问题是预测下一轮情感时语音是否仍占优,公平条件是同一划分与同一 UA、WA、F1 指标,方向均为越高越好。表后解释是,语音下 EAMT 的 F1 为 62.61,文本下仅 29.33,差距超过 1 倍;语音下 DialogueGCN 类图方法在识别任务中也达到约 69.24 的 F1,而文本最高仅 32.27 左右。这支持论文的机制解释:自发中文对话的词面歧义大,韵律的音高、强度与节奏承载了更多情感先兆。但代价是文本模态的非加权准确率仅 31 到 34 之间,长尾类别依然困难,不能把语音的成功推广为所有模态都已解决。

反证与边界:跨模态不一致有多严重,融合在何处失效?

这一节把不一致本身当作被测对象。测的是多模态综合标签与各单模态标签的一致比例,指标是百分比,越高表示越一致。下面这张图是该一致性的柱状图,读图前要确认横轴分组不是模型,而是标签关系类型。

看图路径: 1. 先读横轴五组柱子的分组含义,区分完全一致与仅与某一模态一致;2. 再读每根柱子上方标注的百分比数值并比较高低顺序;3. 最后确认纵轴范围,判断分歧样本是否占多数

原论文 Figure 2:Multimodal–Unimodal Emotion Label Con- sistency.

论文图 2。原论文 Figure 2:“Multimodal–Unimodal Emotion Label Con- sistency.”。

上图五根柱子分别为完全一致 24.5、仅与音频一致 9.0、仅与文本一致 4.0、仅与视觉一致 12.7、与任一单模态都不一致 11.3。可见多数样本并不完全对齐,综合判断更常与视觉和音频趋同,而非文本。这支持多模态融合的必要性,也说明约 10% 样本的综合判断超越了任一单模态,是融合必须处理的难点。不能把柱子向下直接读成性能变差,它统计的是标签关系,不是模型得分。

下面这张表把上述百分比整理为宽表,便于与分布图对照,数字与单位均来自原文连续句。

条件指标完全一致仅与音频一致仅与文本一致仅与视觉一致与任一都不一致
多模态与单模态标签关系样本占比24.5%9.0%4.0%12.7%11.3%

表后解释是,完全一致仅占 1/4,视觉与音频的影响大于文本,这与语音模型强于文本模型的趋势一致。未评测边界是论文没有给出每一类情感下分歧的细目,因此不能断言哪一类最容易分歧,复现时若要补验证,应按类别拆分一致率再看融合收益是否均匀。

另一个反证是类别扩展代价。从 4 类到全类时,所有融合方法平均下降约 12%,即使大模型也会因细粒度差异而掉点。这说明数据集不是简单的情感二分类语料,而是对细粒度区分提出了挑战。论文报告 LMF 在全类下相对稳健,但这只是该条件下的排序,不等于在其他划分或特征下必然最优。

限制是什么:规模、覆盖与未测量项如何影响结论外推?

论文明确承认规模有限:19 名演员、23.6 小时数据。优点是质量与标注精度可控,代价是对更广人群与更多场景的泛化能力可能受限。原文建议把 EmotionTalk 作为初始验证集,再与其他更大或更稳健的数据集联合使用,以构建更具鲁棒性的对话情感系统。这属于有限解释,不是技术错误。

未测量项也要点清。论文未报告误判率的人工细查、推理延迟、部署成本与输出帧率,因此不能承诺这些量因使用该数据集而改善。训练资源只给出 GPU 型号与部分超参数,融合模型的完整搜索空间未完全展开,复现时应保留原文超参数并记录实际耗时。相关性不等于因果:语音特征与情感的相关性强,不等于韵律单独决定情感,文本歧义的解释仍是待验证的机制假设。

资源可达性方面,论文声明公开,但本次收到的第三方资源状态为暂时不可达。具体是 EVA-02 与 Qwen2.5-Omni 的两个链接本次未能确认可达,因此不能写当前可用或已公开,只能写本次未能确认可达,复现时需自行核对官方渠道。

复现先做什么:按什么顺序重放数据、标注与基准?

复现的第一步是按组划分重建数据。不要随机打散,应严格用 G01 与 G12 做验证、G03 与 G15 做测试,其余做训练,并核对总量 19250 与分 split 数字是否对齐。再按统一命名解析 JSON 中的情感标签、置信度、连续标签、起止时间与风格描述字段,确认音频与视频文件能按编号一一对应。

第二步是重放标注逻辑。类别取加权置信最高者,强度取 5 人平均,正负按小于 0 为负、大于 0 为正划分,风格描述只做受控改写而不引入新形容词。若要验证一致性,应分别计算音频、文本、静音视频与多模态的 Fleiss Kappa,并与 0.79、0.66、0.73、0.78 对照,总体与 M3ED 的 0.59 比较时需注明不同数据集的标注体系并不完全可比。

第三步是重放基准。先跑单模态识别确认语音强于文本的趋势,再用同一编码器组合跑帧级与话语级融合,观察 4 类到全类的下降是否复现。描述任务先用 HuBERT 加 Qwen-2 等已报告组合建立参考点,重点看 SPIDEr 与 BERTScore 的语义趋势,而不是只看 BLEU 的字面重合。缺项是部分融合模型的隐藏维度与 dropout 只给范围,具体最优值需在验证集上搜索并记录,不能直接沿用猜测值。

何时值得尝试:这份数据适合谁,还需补哪项验证?

当研究目标是中文对话情感、跨模态分歧建模或可解释情感描述时,值得尝试 EmotionTalk。它的价值在于同一批样本同时有分模态标签、综合标签、强度与风格文字,适合做一致性分析、融合策略比较与生成式描述。若目标只是孤立单句的正负判断,更大的单句语料可能更直接。

还需补的验证包括按情感类别拆分的一致率与融合收益、按主题拆分的泛化测试,以及描述文本的人评与自动指标的对应关系。原文自动指标中 BERTScore 偏高而 BLEU 偏低,提示模型学到语义而非逐字复制,但这不能替代人评。总体判断是,论文报告显示这是一份高质量、细粒度的中文对话情感资源,可能的待验证点是小规模演员池的外推边界,联合更大规模数据是更稳妥的使用方式。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总