英文题目:UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

会议身份:conference:cvpr:2026:conference-paper-id:Li_UniM_A_Unified_Any-to-Any_Interleaved_Multimodal_Benchmark_CVPR_2026_paper

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #数据集 #基准设计 #多模态模型 #音视频理解

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Yanlin Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Minghui Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaiwen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shize Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiran Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Haodong Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Congyue Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Weijie Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Yushen Yan:机构信息未能从会议 PDF 纯文本可靠映射
  • Shengqiong Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Ji:机构信息未能从会议 PDF 纯文本可靠映射
  • Lei Cui:机构信息未能从会议 PDF 纯文本可靠映射
  • Furu Wei:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Fei:机构信息未能从会议 PDF 纯文本可靠映射
  • Mong-Li Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Wynne Hsu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为文本、图像、音频、视频、文档、代码、3D任意交错序列且非文本以占位符表示,输出须按占位符交错生成对应模态内容,难点在于单实例内多任务交织推理与跨模态结构对齐须同时成立。接收模块将非文本模态转为任务条件稠密描述并改写问题以统一文本推理空间,其输出进入可追溯证据推理模块进行数据分析判定与代码解释器调用、模态内容文本内容与工具清单规划及初版报告生成与检查裁判迭代修正。推理修正后的结构化计划进入生成模块调用外部图像音频视频与3D工具完成最终交错输出,从而保证语义与结构可追溯。与仅覆盖图文交错的MMIE与CoMM相比,关键机制差异在于覆盖七模态任意组合与单实例多能力耦合,并以语义质量耦合分与结构完整性解耦评价替代单一准确率,其实际意义是更贴近真实助手的复合推理与生成需求。在UNIM消融任务下,完整UNIMA的指标StS为52.7,高于去除TER变体的指标StS16.4。该结论适用边界限于所定义的开放问答与三维评测套件,在文档代码与3D生成质量客观性及大模型裁判偏差外推上尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出要交什么作业?

这篇解读的输入是论文正文给出的任务定义、数据构造流程、评估套件与基线系统描述,以及本次收到的官方原图像素。目标是让刚进入语音音乐音频方向的研究生能复述方法:遇到任意交错多模态问题时,知道如何组织输入、如何跑评估、如何理解基线做了什么。

必须保留的信息包括 7 种模态的名称、实例规模与领域数、3 维评估的划分、基线对比条件与主要数字的方向性。输出是 1 篇按学习依赖展开的技术说明,不做超出证据的效果承诺,也不把单次运行结果当作部署保证。

真实请求很少是单张图配一句话。论文举例说旅行助手要同时看视频音频地图票据与地标图,再回新路线图与讲解音频。编程协作要同时看会议录音界面图需求文档与已有代码,再回新代码接口文档与界面图。装配助手要同时看零件图说明书与 3 维模型,再回安装视频分步图文与解说音频。

对音频新生而言,关键转变是音频不再是独立分类任务的输入,而是序列中的一个或多个片段,要与其他模态共同决定后续生成。例如讲解音频必须与新地图图片在内容上对应,代码讲解音频必须与代码文件对应。这种对应关系是后文所有评估维度存在的原因。

已有图文交错基准解决了什么,还缺什么?

论文把相关工作分成两条线。第一条是多模态大模型从视觉问答走向统一理解与生成,出现了能处理音频视频文档代码与 3 维的任意到任意模型。这说明模型侧已开始支持更广模态,但评测侧没有跟上。第二条是交错评测基准,针对图文交错理解与生成提供了结构化问答与生成任务。

论文指出的缺口有三点。第一是模态窄,现有基准多集中在文本与图像两种模态,没有覆盖音频视频文档代码与 3 维。第二是能力单一,每个实例往往只考一种孤立能力,而真实任务需要时间理解空间推理规划定位编辑等多种能力交织。第三是领域与评估维度有限,多为通用领域,指标多为准确率或单模态匹配。

因此作者提出统一基准的定位:不是再做一个图文基准,而是用同一套问答格式与同一套评估流程覆盖 7 种模态 30 个领域、每个实例多任务的情形。下表把新基准与已有交错基准并排比较,比较问题是同为交错评测时规模与组合丰富度是否同量级,公平条件是都按各自论文报告的领域数实例数交错组合数与评估指标数对照,指标方向是数量越大表示覆盖越广,但不直接代表质量更高。

ITLVD-BENCH [22]1081525
OpenING [46]85,40047
ISG-Bench [5]81,15034
MMIE [39]1020,10337
UNIM (Ours)3031,0264113

表中新基准在领域数实例数交错组合数与评估指标数上均高于所列图文交错基准,实例达到三万量级,交错组合达到四十余种。主要收益是题目更多样,代价是评估链条更长,对转描述与裁判模型的依赖更重。未胜出项是该表不证明质量,质量需看人工质检与后续合理性验证,不能只看规模就认定难度足够。

任意到任意交错任务到底难在哪里?

问题可以沿一个样本走一遍。输入是一串交错片段,片段之间有依赖,例如先看视频了解操作,再看零件图确认形状,再读文档确认步骤。模型需要把这些片段转成内部表示,做多步推理,再按任务规定的输出结构生成另一串交错片段。输出不仅要语义正确,还要模态种类对、每种模态数量对、前后衔接顺。

难点来自三处叠加。一是任意组合,输入输出的模态种类与数量都不固定,模型不能靠固定模板猜答案。二是多任务交织,同一实例可能同时要求感知定位时序理解规划与生成,错一步会影响后续生成。三是开放式生成,参考答案只是一种合理写法,传统逐词匹配或单选准确率无法判断好坏。

下图用 3 个真实场景把这种叠加具体化,读图时注意输入占位符与输出占位符不是一一复制,而是经过推理后重新组织,能力标签说明每个实例考的不止一件事,图中左侧为用户交错输入,右侧为助手交错输出,下方为所需能力。

看图路径: 1. 先看上中下三行用户输入如何混排视频音频图像文档代码与三维占位符;2. 再看每行右侧助手输出如何回传另一组图像音频文档代码与视频;3. 最后对照每行下方红色能力标签确认单实例需要多种能力叠加

原论文 Figure 1:Illustration of the any-to-any interleaved multimodal paradigm with different real-world…

论文图 1。原论文 Figure 1:“Illustration of the any-to-any interleaved multimodal paradigm with different real-world application scenarios.”。

图中上中下三行分别对应旅行助手、编程协作与工程装配。旅行行输入混排视频音频与多张图像,输出要求新的路线图与多段音频。编程行输入混排音频图像文档与代码,输出要求新代码文档图像与分段音频。工程行输入混排 3 维模型文档与零件图,输出要求视频图像与音频教程。每行下方的能力标签都列出多个能力,表明评价必须同时看懂与生成,不能只看单点正确。

数据集评估与基线如何分工?

全景上论文做了三件事:建数据集、定评估法、给基线系统。数据集负责提供足够难且多样的题目,评估套件负责在开放生成下仍能稳定打分,基线系统负责证明题目可用现有工具链走通,并暴露剩余差距。三者是题目、尺子、参考解的关系,缺一不可。

数据集的问答格式是开放式问答,输入或输出都是任意组合模态的交错序列,非文本片段用占位符表示,一个模态可以出现多个条目。构造先从公开数据集社交媒体视频帖子论坛网站与知识库收集素材,再人工设计适合不同模态的交错组合模板与任务类型,然后用生成模型扩写候选实例,最后经 2 阶段人工审核修订占位符合规性与逻辑一致性。

基线智能体是一个 3 段管线,不是端到端单模型。它先用接收模块把非文本转成任务相关的密集描述,再用可追溯推理模块做结构化规划校验与修正,最后用生成模块调用专用解码器产生交错输出。下图展示该管线的 3 段式结构,读图时抓住从理解到生成的主环路,注意顶部编码器中间推理链与底部校验的衔接。

看图路径: 1. 先看顶部接收层用不同编码器处理音频视频图文文档代码与三维;2. 再沿中间四步链条看密集描述数据报告模态内容与终稿的递进;3. 最后看底部校验菱形如何分叉为通过输出与报错回溯到指定步骤

原论文 Figure 4:Overview of the UNIMA architecture.

论文图 4。原论文 Figure 4:“Overview of the UNIMA architecture.”。

顶部是接收层,针对不同模态调用不同编码器,把音频视频图文文档代码 3 维分别转成文本空间的证据。中间是 4 步推理链:生成任务条件密集描述与改写后问题,判断是否需要调用代码解释器做数据分析报告,再整理出模态内容文本内容与工具清单,最后整合成终稿报告。底部是校验子模块与生成层,校验通过才放行到语音图像视频文档代码 3 维的生成器,否则回溯到指定步骤重新生成。

接收与推理链条中证据如何流转?

沿样本走完 1 次流转有助于复述。假设输入包含一段会议录音、3 张界面图、一份需求文档与 3 段已有代码。接收模块先对录音做任务相关的转写摘要,对图像做与需求相关的密集描述,对文档与代码做要点抽取,得到统一文本证据与改写后的问题。改写问题的目的是把散在请求收敛为可执行目标。

推理模块分 4 步推进。第一步产出密集描述与改写问题,主要服务语义对齐。第二步判断是否涉及数据分析,若是则调用代码解释器跑数据并生成数据报告,用事实 grounding 减少幻觉。第三步把信息整理成 3 类:模态内容决定要生成哪些非文本及其要点,文本内容决定衔接与解释,工具清单决定调用哪些生成器与数量。第 4 步整合成终稿报告,指导最终生成。

交错多模态学习 × 任意到任意学习: 交错多模态学习负责描述输入输出是任意顺序的多片段序列而非孤立图文对,任意到任意学习负责把模态扩大到文本图像音频视频文档代码 3 维 7 种并允许任意组合,搭配理由是真实助手既要处理顺序交错又要处理异构模态,组合后新增作用是要求同一实例内同时完成跨模态理解与多模态生成。

校验环节由检查器与判定器配合。检查器看终稿是否有事实或逻辑错误,判定器把错误定位回具体步骤,触发重新生成。这种生成加检查加回溯加再生成的循环是该基线区别于隐式思维链的关键,目标是让每一步都有据可查,便于复现时定位失败点。

任务条件密集描述 × 可追溯证据推理: 任务条件密集描述负责把非文本模态转成与当前问题相关的文本化证据形成统一文本空间,可追溯证据推理负责对证据做分步规划校验与回溯修正,搭配理由是直接生成易丢失细节与结构约束,组合后新增作用是让每步推理可定位可修正再指导后续生成。

需要提醒的是,论文未报告各编码器与生成器的参数是否冻结、梯度路径与训练细节,基线更像用现有大模型与工具拼成的可运行流程。复述时应说它调用了哪些模块,不推定其内部训练方式,也不把 1 次走通当作稳定求解。

本研究训练了什么,没有训练什么?

本研究没有报告传统意义上的神经网络训练阶段,没有给出优化器学习率批量大小训练轮数或硬件预算。数据集工作的等价计算是构造流程,基线工作的等价计算是推理调用流程,因此本节按构造与调用如实交代,不虚构训练曲线。

数据构造的计算过程是检索加模板加模型扩写加人工质检。收集来自公开数据集社交媒体与开放资源,人工设计交错组合模板与任务类型,用轻量生成模型扩写候选,再经两轮人工审核修订。这种流程的监督来源是人工规则与人工修订,不是梯度下降。难度分级采用基于规则的渐进分类,分成易中难三档。

基线运行的计算过程是调用既有模型与工具。接收侧调用语音视频图文与点云的理解模型,生成侧调用文本图像视频语音与 3 维的生成模型,中间用大语言模型做规划与校验。论文未说明这些调用是否微调、提示如何固定、随机种子与解码参数,因此不能把 1 次运行结果当作确定性求解。复现时应把重点放在固定模板、固定工具版本与记录每次调用的输入输出上。

三维评估套件如何把开放生成变成可比分数?

评估要回答 3 个问题:说的内容对不对,结构守规不守规,前后衔接顺不顺。对应 3 个维度:语义正确性与生成质量、回答结构完整性、交错连贯性。另有一个支持率作为条件修正,用于区分模型本来能跑多少分与按全量题目折算后得多少分,相对分等于支持率乘以绝对分。

语义与质量分支先把所有模态输出转成描述性文本,再用大语言模型作裁判比较语义,同时对每种模态用无参考质量方法打感知质量,两者加权得到语义质量耦合分。结构分支直接数占位符的模态种类与数量,得到严格分与宽松分。连贯分支用大语言模型作裁判打整体连贯与风格和谐,再加权得到交错连贯分。下图展示 3 条分支的输入输出,读图时注意转描述模块是语义可比的关键,顶部为带占位符的回答与源文件,底部为各分数出口。

看图路径: 1. 先沿顶部模型回答与全部模态源文件看三条分支的起点;2. 再看左侧绿色分支如何数占位符数量与模态种类得到结构分;3. 最后看中部与右侧分支如何经转描述与质量评估汇成连贯分与语义质量分

原论文 Figure 2:Illustration of the UNIM evaluation suite.

论文图 2。原论文 Figure 2:“Illustration of the UNIM evaluation suite.”。

顶部是带占位符的模型回答与全部模态源文件。左侧绿色分支数占位符数量与模态种类,产出严格与宽松结构分。中间橙色分支把真值与回答都转成密集描述后交由裁判,按细则与示例打出风格与整体连贯,再合成交错连贯分。右侧蓝色分支对文本图像音频视频文档代码 3 维分别做质量评估,并与语义分合成耦合分。图例中深色块代表真值与回答,虚线框代表转描述模块,箭头表示数据流向。

语义正确性 × 生成质量: 语义正确性负责衡量生成内容与参考答案在含义上是否对齐,生成质量负责衡量生成物本身感知质量与结构合理性,搭配理由是跨模态输出无法用单一准确率比较,组合后通过加权形成语义质量耦合分,同时反映说对没有和做得好不好。

严格结构分 × 宽松结构分: 严格结构分负责检查输出模态种类与占位符数量是否与真值精确对应,缺失或多余都要扣分,宽松结构分只检查模态种类是否覆盖而不苛求数量,搭配理由是模型可能理解语义但叫错工具数量,组合后可区分完全守规与大体守规两种失败程度。

整体连贯性 × 风格和谐性: 整体连贯性负责评估跨模态语义与结构衔接是否逻辑自洽,风格和谐性负责评估文字语气与视觉美学是否协调,搭配理由是交错回答既要讲得通又要像同一份回答,组合后形成交错连贯分,衡量多模态整合能力。

实验条件方面,论文选择有代表性的任意到任意模型作对比,报告了在 3 个领域上的绝对分与相对分。权重取语义质量耦合中语义占 0.7、交错连贯中整体连贯占 0.8,论文称该取值与人工评价对齐最好。支持率反映模型能支持多少比例样本的输入模态,支持不了则该部分按缺考处理,阅读时需同时看绝对分与相对分。

主结果在说什么,代价与反例是什么?

主结果要测的是在统一交错题目下,现有模型的语义结构与连贯是否同时达标。与谁比是 3 个有代表性的任意到任意模型与新的智能体基线,条件是否一致是同一套题目与同一套 3 维指标,指标方向均为越高越好。下表是语义与质量的核心数字表,保留了可运行的基线与新基线,比较时注意绝对分与相对分的区别。

Field ModelsSCGQSQCSabsτSQCSrel
Natural Science NExT-GPT [37]8.423.46.262.02.9
AnyGPT [44]13.737.911.190.410.7
MIO [34]19.729.115.959.210.0
UNIMA59.879.757.310057.3
Social Science NExT-GPT [37]16.831.913.389.010.8

表中自然科学社会科学与通用领域三块分别列出语义正确性生成质量耦合绝对分支持率与耦合相对分。基线耦合绝对分多在个位数到二十左右,新基线在 3 个领域分别达到五十余七十余与六十余。社会科学最好,论文解释为常见概念与描述性推理在预训练中更常见。反例是生成质量单项有时不低,但语义正确性低会把耦合分拉低,说明做得清楚不等于说对了。支持率一列显示基线只能支持六到 90% 样本,折算后相对分更低。

结构与连贯的趋势是基线严格结构分与宽松结构分多在个位数,新基线达到五六十到七八十。交错连贯上基线略好于结构但仍多在五十分以下,新基线接近 70%。下图用绘画教程案例直观展示差距,读图时关注模态覆盖与步骤完整性,顶部为用户需求,中间为基线回答,底部为新基线回答。

看图路径: 1. 先读顶部用户需求确认输入是视频而输出要求是图文教程;2. 再对比中间两个基线回答缺图与缺步骤的表现;3. 最后逐段检查底部回答的八张配图是否与文字步骤一一对应

原论文 Figure 8:Comparison of model responses in the cross-modal painting instruction task.

论文图 8。原论文 Figure 8:“Comparison of model responses in the cross-modal painting instruction task.”。

用户要求看视频后给出水彩蓝闪蝶图文教程。中间基线一个只给通用文字且无配图,另一个只给单张成品图并缺中间步骤。底部新基线给出 8 张配图与分步文字,从备料起稿调色铺色背景提亮加深到收尾,文字步骤与图像占位符一一对应,时序与风格更协调。该案例支持新基线在多步组合任务上的优势,但只是单样本展示,不能推广为全量胜率,仍需结合上表全量数字判断。

拿掉推理链与校验会发生什么?

消融要测的是新基线中各部件的贡献,条件是固定题目与指标,只替换或去掉目标部件。比较对象是完整新基线、去掉可追溯推理、把任务条件描述换成普通描述、只去掉校验子模块,指标方向越高越好。论文报告去掉整个推理模块时结构分下降最大,说明结构守规主要靠显式规划与工具清单。

把任务条件描述换成普通描述时语义与连贯中等下降,说明任务相关证据主要改善语义 grounding。只去掉校验时全指标明显下降,说明检查回溯再生成对可靠输出关键。代价是链条越长调用成本与失败点越多,且论文未给出每次消融的方差与显著性,不能读成每组必胜。下表整理合理性验证的关键数字,表中数字来自原文连续句,不是 2 次计算。

条件指标自动与人工一致性权重取值完整基线的方向
统一交错题目语义质量耦合分0.9740.7完整时最高
统一交错题目交错连贯分0.9600.8完整时最高
统一交错题目结构分受控扰动如期下降按种类与数量计数完整时最高
统一交错题目支持率折算绝对分乘以支持率全量覆盖新基线为 100

这两组取值说明自动分与人工判断的对应关系需要结合权重来理解,权重决定语义与质量之间的侧重,而相关系数反映的是趋势一致而非逐例相等,换裁判或换领域结论可能发生变化。

来源证据量化值 1量化值 2量化值 3量化值 4
来源句 100.9740.960—
来源句 20.70.8——

表中语义质量耦合与人工分的相关系数分别达到 0.974 与 0.960,论文据此认为自动分能反映人工判断。新基线语义质量约 60%、交错连贯接近 70%,均高于最优基线。限制是相关性不是因果,且验证样本与裁判模型的选择会影响结论,换裁判或换领域可能变化。结构分的合理性用受控扰动验证:增删模态种类或占位符数量时严格分如期下降,只删种类时宽松分下降,表明两分工明确。未胜出项是即使完整基线在难例上结构分仍下滑。

哪些结论证据不足,哪些边界没有测?

论文直接报告的是规模流程指标定义与 3 组模型的分数对比,这些有表格与图像支持。有限解释是领域差异的原因,例如社会科学好是因为预训练中常见概念多,这符合直觉但未做词频或数据溯源的定量验证,应读作可能而非证实。未验证推测是把结构分低归因于组合与对齐能力不足,这需要更细的错误分类才能确认。

未评测的边界较多。原文未测量误判率延迟推理开销输出帧率与实际成本,因此不能承诺新基线更便宜或更快,智能体多步调用通常更贵。训练资源与超参数缺失,无法判断结果对随机种子的稳健性。裁判模型本身可能偏好某种风格,换裁判后排名是否稳定未知。难度分级是规则式三分档,分档阈值与人工难度是否一致未充分展开。

另一个边界是支持率的处理。相对分等于支持率乘以绝对分,这种折算惩罚了不支持某些模态的模型,但也掩盖了在支持子集上的真实能力。阅读时应同时看绝对分与相对分,前者回答做得怎么样,后者回答全量覆盖怎么样。把自动指标直接当成人评,或把单案例推广为全程优势,都是应避免的误读。

资源状态方面,项目页当前可用,状态码为二百,可按论文给出的链接访问数据集与说明,但可用不等于长期稳定,复现时应记录访问时间与版本,并核对实例数与领域划分是否变化。

要复述与复跑,先固定哪四件事?

复现先做四件可执行的事。第一是固定题目版本,记录实例数领域数 7 种模态名称与三档难度划分,按自然科学社会科学与通用领域分开统计,避免混用不同聚合口径。第二是固定评估实现,包括转描述用的模型版本、无参考质量方法、裁判细则与示例、耦合权重 0.7 与 0.8 的取值,以及绝对分与相对分的折算方式。

第三是固定基线调用,记录接收编码器规划大模型代码解释器触发条件生成器的版本与解码参数,每次调用保留输入输出以便回溯。第四是固定对照,至少保留原文可运行的 3 个基线与新基线,不用事后最优或人工改写代替可部署收益。下表核对数据层面的规模数字,表中数字均来自原文连续句,复跑时以原表头单位与裸值为准。

维度规模领域模态实例
数据集总量31,026307高质量实例
覆盖广度31K307跨领域
评估维度133041交错组合
难度分档3自然科学社会科学通用领域多任务每实例易中难

上表仅用于核对总量口径与分档结构,复跑时仍以原文连续句与原表头单位和裸值为准,不自行换算补列或追加单位,下表进一步给出来源句取值层面的对照关系以便回溯检查。

来源证据量化值 1量化值 2量化值 3量化值 4
来源句 13031,0264113
来源句 2330——

表中实例规模为三万余个高质量实例,覆盖 30 个领域,模态为文本图像音频视频文档代码与 3 维 7 种。复述时应强调每个实例包含多个交织任务,而非单能力题目。采样与划分方面,论文未给出训练验证测试划分,因为它是评测基准而非训练集,使用时应整集评测并按领域与难度分层报告。还需补的验证包括换裁判模型后的排名稳定性、多次运行的方差与校验循环的平均步数。

何时值得尝试这套题目与基线?

当你的任务输入输出都是多片段交错,且模态超过图文时,这套题目值得尝试。例如语音助手要同时读图听音看视频再回图文音频,编程助手要同时看录音截图文档代码再回代码文档图音频,装配助手要同时看零件图文档 3 维再回视频图文音频。若任务只是单图单问或纯音频分类,用此基准会引入不必要的复杂度。

方法选择上,若基线模型经常漏模态或数量对不上,优先补显式的工具清单与结构规划。若语义对不上,优先补任务条件密集描述与数据报告。若前后衔接散,优先补终稿整合与校验回溯。论文的消融方向支持这种对应,但具体增益需在自己的数据上重测,不能直接套用分数。

收束时记住三句话。题目把任意组合多任务交织与开放生成压进同一实例,尺子用语义质量结构完整与交错连贯 3 维打分,参考解用接收加可追溯推理加生成调用走通全链。现有模型分数偏低说明任务难,新基线更高但在难例结构上仍下滑,后续工作需在保持语义稳定的同时提升高阶交织的结构守规能力。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 10 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 cvpr-2026 论文汇总