📄 Omni 不等于会选:当模型被要求用对的模态回答
英文题目:Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models
一句话:针对前沿模型自称全模态却只会用文字回答的落差,论文用 893 条自包含跨模态提示与双层评分证明最强模型的模态召回也不过三成,且音频输出至今无人能回。
标签:#音视频理解 #多模态模型 #音频理解 #基准测试
评分:7.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Rohit Patel:Meta Superintelligence Labs
- Dieuwke Hupkes:Meta Superintelligence Labs
- Sloan Strader:Meta Superintelligence Labs
💬 毒舌点评
首次把输出模态选择本身作为考核目标,893 条跨 5 模态自包含提示与按模态隔离判定的 rubric 设计精准刺破 omni 营销与裸 API 能力的落差;短板是主指标 MMI Value 因模型几乎不产出非文本资产而无法在主评测中验证,70.8% 人机一致性与 0.41 的 Scott’s π 仅勉强可用,且用 Gemini 家族同时做生成后端与判别器的验证实验存在自偏好风险,宽松口径把链接计为成功也高估了真实生成能力。
📌 核心摘要
针对前沿模型自称全模态(omni)却缺乏跨模态输出选择评测的问题,论文提出模态成熟度指数(Modality Maturity Index, MMI)基准,覆盖文本(text)、图像(image)、音频(audio)、视频(video)与文档(document)5 种模态,单条提示最多含 3 种输入与 3 种输出模态。方法核心是 893 条人工撰写的自包含提示,每条标注期望输出模态集合并为每个期望模态配备 4 至 12 条人工 rubric 准则;评分采用双层设计,MMI Value 为按期望模态宏平均的 rubric 得分,模态存在得分(Modality Presence Score, MPS)为按提示计算的期望与实际输出模态集合 F1 用于隔离是否产出模态与内容是否正确。与仅测双模态理解的既有基准相比,MMI 同时考核多非文本模态组合输入理解与输出模态决策。在 5 个前沿模型上的主评测中,MPS 仅 15.6 至 34.9,其中 GPT-5.4 为 34.9,Claude Opus 4.6 为 15.6,且音频输出召回为 0,揭示模型普遍默认文本输出。该基准为追踪多模态成熟度提供了可复用的评估框架与工具链,但主指标在当前模型能力下难以充分验证,且评测限于英语与 API 裸模型。
🔗 开源与复现资源
- 代码:https://github.com/facebookresearch/modality-maturity-index
- 模型权重:论文中未提及新模型权重发布,评估使用的 5 个前沿模型通过 API 调用,仅 Llama-4-Maverick-17B-128E-Instruct-FP8 为 open-weight 并由作者本地部署
- 数据集:MMI 数据集,893 条 prompt,包含 7,165 条 criteria 覆盖 1,099 个 prompt modality 组,获取链接为 https://huggingface.co/datasets/facebook/mmi,论文中未提及开源协议,数据集可在 GitHub 仓库 viewer 和 HuggingFace 上浏览
- Demo:论文中未提及
- 复现材料:论文在附录 D 提供标注指南,附录 A 提供基于 Gemini 3 Flash 的模态检测 Judge prompt,评估 harness 已在 GitHub 仓库发布,支持 MMI Value 和 MPS 计算,运行配置为 generation limit 32768 tokens,单次请求超时 300 秒,最多 5 次重试,rubric 验证实验提供 image_gen audio_gen video_gen 3 个工具的 scaffolding 说明
- 论文中引用的开源项目:论文提及 GenAI-Bench OmniBench MME-Unify MixEval-X WorldSense OmniMMI AnyMAL NExT-GPT CoDi Macaw-LLM Unified-IO 2 Chameleon 等第三方基准与模型,论文中未提供具体链接
🧭 深度解读
为什么“能看会听”不等于“会用对的模态回答”?
想象一个用户发来一段手术前医嘱的录音,说“帮我做个鼓励视频,再给一份可打印的 PDF”。理想的助手应该听懂录音、生成视频和文档,而不是把所有内容都挤进一段文字里。这正是当前所谓全模态(omni)模型的尴尬:发布页写着支持文本、图像、音频、视频、文档,评测表里却只敢放文本加图像的理解题。
问题难在两层。第一层是理解:单条请求里可能同时塞进 1 张轮胎照片、一段语音和一份表格,模型得把 3 个非文本信号对齐到同一个任务意图。第二层是决策:回答时该用文字、该给图、该出视频,完全由任务语义决定,而不是用户有没有写“请给我视频”。大多数现有基准只考第一层,而且只考文本输出,自然测不出第二层的失灵。
这篇论文要补的就是第二层。它不问模型能不能在孤立的文生图任务里画好 1 张图,而是问:在一个自包含的真实请求里,模型会不会主动选择并交付正确的模态组合。
现有评测在测什么,MMI 站在哪里?
过去几年的多模态评测可以分成 3 条线。第一条是双模态理解,像 MME、MMBench、MMMU 测图文,Video-MME、AudioBench 测视频或音频理解,输出一律是文本。第二条是单模态生成,像 T2I-CompBench 只看文生图。第 3 条是试图拼起来的“混合”基准,比如 OmniBench 同时考图文音理解但仍只让模型用文字回答,MME-Unify 把理解和生成分两个赛道跑,MixEval-X 把多个单模态榜单打包,却不在同一条提示里考核“该用哪种模态输出”。
另一条并行线是模型侧的 any-to-any 架构,如 AnyMAL、NExT-GPT、CoDi 等,它们在结构上打通了多模态输入输出,但评测没有跟上。结果就是发布报告里常见的空白:文本和图文有分,视频、音频、跨模态输出那几栏直接空着。
模态成熟度指数(Modality Maturity Index,简称 MMI)的定位就是把“输出模态选择”本身变成考题。它覆盖文本、图像、音频、视频、文档 5 种模态,单条提示最多包含 3 种输入和 3 种输出,并且要求提示措辞不直接点名模态,让模型靠任务去推断。相比只覆盖部分模态或只在独立赛道里测生成的基准,MMI 第 1 次把“选对模态”和“把内容做对”放在同一条提示里一起算分。
任务到底被定义成了什么?
MMI 把每条提示定义为一个自包含任务:给定一组输入资产和一句自然语言指令,模型需要返回一个模态集合。比如“把这张照片里的人去掉、把天空改成粉色再画成油画”,期望输出就是图像;“教我做软曲奇,给配料表和教程视频”,期望就是文本加视频。期望集合是人工标注的金标,评测只认这个集合。
评分因此被拆成两问。第一问是“回没回对模态”,用模态存在得分(Modality Presence Score,简称 MPS)衡量,本质是期望集合与实际返回集合的 F1,辅以召回、精确率、通过率和输入失败率。第二问是“回来的东西对不对”,用 MMI Value 衡量,靠每个期望模态下若干条人工准则(rubric)打分。两问解耦很关键:如果模型根本没回视频,再怎么讨论视频内容好不好都没有意义。
这种定义把评测从“能不能生成”推向“会不会在正确场景下生成”。它也解释了为什么论文的主结果不是内容分而是存在分——当下模型连第一问都答不好,第二问自然无从谈起。
基准长什么样:从提示到分数的一条流水线
MMI 的流水线可以概括为 5 步:输入提示与多模态资产进入模型,模型产生多模态响应,管线做模态存在检测,再按模态用准则判定内容正确性,最后聚合成 MPS 和 MMI Value。整个基准是数据集加评分加自动化评测管线(harness)的组合,代码与数据已公开。
提示集合分 3 阶段滚大。先由 Meta 内部内容团队从文本输入、单模态输出的 50 条种子起步,迭代到 500 条,刻意避免“给我一个视频”这类直白指令;再扩展到多输入单输出,最后到多输入多输出,最终定格 893 条。其中 475 条是 1 输入 1 输出,264 条多输入单输出,76 条单输入多输出,78 条多输入多输出。文档模态还细分为 pdf、docx、xlsx、pptx、csv、txt 6 种文件类型。
所有图片视频由团队实拍或经 MetaAI 重制,且作者校验重制不会让题目无解;全部提示为英语,至少 2 人复核期望模态,准则撰写阶段还修正了约 30 条金标。
检测与评分是两套独立机制。存在检测分严格与宽松两档:严格只认模型原生返回的资产,宽松额外认平台链接的正则匹配和用 Gemini 3 Flash 做的文本兜底判定,主结果全部用宽松口径。内容判定则强调单模态隔离:判别器 1 次只看到某一个模态的产物和提示上下文,不做跨模态一致性比较,避免用文字去“脑补”视频的好坏。
准则怎么写,分数怎么算?
准则体系是 MMI 最重的工程。每条提示的每个期望输出模态都配一组准则,共 7165 条,分布在 1099 个“提示-模态”组里,中位数每组 6 条,七成落在 4 到 12 条的目标区间。每条准则是一句原子化、互斥、自包含的陈述,必须在不依赖其他模态和外部知识的前提下可判定,覆盖交付性、完整性、内容正确性和至多一两条工艺性要求。例如对“学钩针”的请求,视频准则会分别卡“是否提供了指法演示”“是否展示多种针法”,图像准则卡“是否给了针法静图”,音频准则卡“crochet 是否读对”。
计分分 2 级平均。先在模态内把该模态的所有准则得分(每条 0 到 1)平均,再跨期望模态做宏平均得到单条提示的 MMI Value,模型级分数是提示级均值;缺失模态直接计 0。MPS 则完全不看内容,只算集合 F1 的宏平均:每条提示上期望与实际模态集合的 F1,模型级是提示级均值。精确率计算里非期望的文本不计惩罚,通过率是“是否 1 次回齐所有期望模态”的二值指标,输入失败率则单独记录因输入模态不支持而被 API 直接拒掉的比例。
这种“先分模态、再平均”的设计让每个期望模态权重相等,避免准则多的模态主导分数,也让“没回”和“回得不好”在数值上可区分:前者同时拉低 MPS 和 MMI Value,后者只拉低 MMI Value。

论文图 1。这张图来自原论文 Figure 1:,图示内容为“Per-model precision, recall and F1 (MPS) on MMI.”。请结合“准则怎么写,分数怎么算?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
没有训练,只有两套推理实验
这是一份数据集与基准论文,没有训练阶段,也就没有损失函数、优化器或训练超参。所有工作发生在数据构造、标注和推理评测上。复用的是现成的前沿模型,通过 API 或本地部署做推理,再用规则与大模型判别器完成自动评分。
主评测是裸 API 调用:不对模型加系统提示也不给工具,生成上限设为 32768 tokens,单次请求超时 300 秒,最多重试 5 次,采样参数全部用各模型默认值。目的是测模型“出厂状态”下会不会选对模态。另一套是工具增强的验证实验,专门为了让准则有东西可评:给 3 个模型暴露 3 个同质函数工具 image_gen、audio_gen、video_gen,背后分别路由到 Gemini 3.1 Flash Image、Gemini 2.5 Flash TTS 和 Veo 3.1 Fast,模型不知道后端是谁,工具描述也完全一致,只能靠名字区分模态,最多跑 3 轮调用。
两套实验回答不同问题。前者回答“裸模型会不会回对模态”,后者回答“当模型被迫回了可评分资产后,用准则的机器判别器像不像人”。正因为没有训练,论文的全部证据都落在推理产物的检测与判定上,这也决定了后续对“宽松计分是否高估”“判别器是否自偏好”的讨论格外重要。
数据、协议与怎么看图
要读懂结果,先看数据长什么样。下表根据论文正文与图中报告值整理,概括了样本构成与评测协议。
| 维度 | 构成与协议 |
|---|---|
| 提示规模 | 893 条自包含提示,475 条 1 输入 1 输出,264 条多输入单输出,76 条单输入多输出,78 条多输入多输出 |
| 模态覆盖 | 输入与输出均为文本、图像、音频、视频、文档 5 种;文档含 pdf 63、docx 48、xlsx 12、pptx 11、csv 8、txt 10 |
| 资产来源 | 团队实拍或 MetaAI 生成重制,英语提示,至少 2 位作者复核,准则阶段修正约 30 条金标 |
| 准则规模 | 7165 条准则,1099 个提示-模态组,中位数 6 条,71.5% 在 4-12 条区间 |
| 评分 | MMI Value 为模态内平均再跨模态宏平均再跨提示平均;MPS 为每提示 F1 宏平均,辅以召回、精确率、通过率、输入失败率 |
| 检测 | 严格仅计原生资产,宽松加计平台链接正则与 Gemini 3 Flash 兜底判别器;主结果用宽松 |
| 模型与预算 | 主评测 5 个:GPT-5.4、Gemini 3.1 Pro/Flash、Claude Opus 4.6、Llama 4 Maverick(本地部署);验证实验 3 个工具增强模型;超时 300 秒/900 秒,重试 5 次 |
论文配了 3 组关键图,读图前先明确要回答的问题。图 1 与图 3 的柱状对比要看同一模型的三根柱:精确率是否贴顶、召回是否塌陷、F1 是否被召回拖住。图 12 的分模态柱要看音频那一列是否全空、图像与视频的分数来自原生还是链接。图 13 的检测来源堆叠要看每种模态的分数里有多少是靠链接或兜底判别器“救”回来的。图 16 的人机一致性表则要看总体 70.8% 之外,分模态的 Scott’s π 是否只有 0.28 到 0.45 的勉强可用区间。
主结果:不是分不清,而是不回
主评测不考内容,只考“回没回对模态”,结果出乎意料地一致:所有模型都严重漏回。根据论文正文与图中报告值整理:
| 模型 | 指标 | 报告值 | 这项数字支持什么 |
|---|---|---|---|
| GPT-5.4 | MPS F1 / 召回 / 精确率 / 通过率 | 34.9 / 33.8 / 99.8 / 31.0 | 最强也仅三成 F1,召回是瓶颈 |
| Gemini 3.1 Flash | MPS F1 / 召回 / 精确率 | 27.2 / 25.4 / 99.4 | 精确率近满分,错误是漏回而非错回 |
| Gemini 3.1 Pro | MPS F1 / 召回 | 25.4 / 23.6 | 与 Flash 同档,F1 与召回差距在 2 点内 |
| Llama 4 Maverick | MPS F1 / 召回 / 输入失败率 | 16.3 / 15.1 / 36.5% | 近四成提示因输入不支持直接失败 |
| Claude Opus 4.6 | MPS F1 / 召回 / 输入失败率 | 15.6 / 14.5 / 37.0% | 同样高输入失败,F1 垫底 |
两点值得展开。第一,精确率全员接近 100%,说明模型几乎不会多回一个不该回的非文本模态,问题全在召回。通过率又普遍低于召回,说明“回对一个”常见,“1 次回齐”稀少。第二,分模态看,音频是全军覆没的模态:5 个模型在主评测里无论原生还是链接都没有返回音频;图像与视频的部分分数靠链接撑着,只有 GPT-5.4 真正原生生成了图像,文档分数则主要靠兜底判别器从生成文件里恢复。
不能从这些数字推出的是“模型内容质量差”。因为可评分资产太少,MMI Value 在主评测里几乎无法验证。论文为此另做工具增强实验:让模型能调图像、音频、视频生成后端后,可评分覆盖率提到 71%,排除文档后 76%,此时机器判别器与盲准则人类的一致性为 70.8%,Scott’s π 0.41,阈值调到 0.8 时一致性最高 73.2%。这说明准则在有资产时勉强可用,但文档准则因没给工具完全未被验证,且验证实验本身用 Gemini 家族同时做生成后端和判别器,存在自偏好风险,证据边界只限于工具增强分布,不能直接套回裸 API 的结论。

论文图 4。这张图来自原论文 Figure 13:,图示内容为“Detection method per modality. Models can return assets of the right modality natively or via a URL.”。请结合“主结果:不是分不清,而是不回”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

论文图 5。这张图来自原论文 Figure 14:,图示内容为“judge human confusion”。请结合“主结果:不是分不清,而是不回”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

论文图 6。这张图来自原论文 Figure 17:,图示内容为“Full modality grid. We show the distribution of input and output modalities of the full Modality Maturity Index benchmark.”。请结合“主结果:不是分不清,而是不回”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
边界在哪里:宽松、阈值与英语
论文坦承的最大边界是主指标悬空:MMI Value 设计得很完整,但在当下模型几乎不产出非文本资产的情况下,主结果只能报告 MPS。换言之,基准想同时考核“选对”和“做对”,现实却只够考核“选对”。
审稿视角的边界更细。宽松口径把链接算作成功,这对用户体验或许合理,却会高估模型的真实生成能力;严格口径下几乎没有非文本产出,两种口径的语义差异没有被充分讨论。输入失败率在 Gemini 约 8% 而在 Claude 与 Llama 约 36% 到 37%,但论文没有按输入模态组合做细粒度归因,难以定位到底是音频、视频还是文档卡住了哪家。
另外,人机一致性 70.8% 听起来不低,但 Scott’s π 只有 0.41,且按“全准则为 1 才算正确”的最严格二值化阈值计算,阈值 1 动结果就变,说明判定对阈值敏感。数据集仅为英语、资产经生成重制、样本 893 条而模型仅 5 个且无置信区间,这些都限制了结论的稳健性。最后,评测的是裸 API 而非带生成器包装的产品助手,产品侧的 MPS 很可能高得多,论文分数刻画的是模型本身,而非用户最终摸到的助手。
能复现吗:公开了什么,没公开什么
复现的利好很足。代码在 GitHub 公开,数据集在 Hugging Face 可浏览,包含 893 条提示、7165 条准则和 1099 个模态组,评估管线支持 MPS 与 MMI Value 计算,附录还给出了标注指南、模态检测的判别器提示和准则写作规范。工具增强实验的 3 个函数工具 scaffolding 也有说明,超时、重试、生成上限等运行配置都已披露。
缺口主要在采样与硬件细节。论文称采样用模型默认值,但未给出温度、beam 等具体数值;Llama 4 Maverick 为本地部署,未说明 GPU 型号与数量;5 个前沿模型的规模参数也未披露。检测侧的链接正则与兜底判别器虽有提示词,但不同版本 Gemini 判别器的差异未做对照,验证实验又恰好用同一家族做生成与判定,复现时若换判别器,一致性数字很可能波动。
对想跟进的研究生,一个务实的复现路径是:先用公开 harness 在宽松口径下复跑 MPS,核对召回与输入失败率是否复现“精确率高、召回低”的形态;再在工具增强模式下跑一小批提示,重点观察音频是否依然零召回、图像与视频的分数有多少来自链接,以及把判别器换成非 Gemini 模型后一致性如何变化。
收束:成熟度指数在提醒什么
MMI 的价值不在于给出一份排名,而在于把“全模态”这个营销词翻译成可检验的行为:当任务本身在喊“给我视频、给我音频、给我可打印文档”时,模型会不会真的交付。893 条提示、双层评分和严格与宽松两档检测,共同把“默认回文字”这件事从体感变成了数字:最强模型 F1 34.9,音频零召回,近四成请求在部分模型上连输入都接不住。
对刚入局的研究生,这份基准提供了两个抓手。研究上,它提示不要只在图文理解上卷分数,输出模态决策、音频与文档的端到端生成、以及更可靠的单模态隔离判别器,都是空白。工程上,它提醒产品包装与裸模型能力是两回事:给模型配好图像、音频、视频生成工具,MPS 会立刻好看,但那考的是系统集成而非模型本身的成熟度。
基准也会随着模型变强而自我更新。作者已言明未来要引入工具增强与智能体配置的评测、扩展非英语数据、并在 MPS 上去后重新打磨准则与自动评分。换句话说,MMI 现在是一面照出短板的镜子,等模型学会“用对模态”后,它才会真正成为衡量“用好模态”的尺子。
📎 论文与评分元数据
标签:#音视频理解 #多模态模型 #音频理解 #基准测试
7.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
✅ 7.8/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #多模态模型 | #音频理解 #基准测试 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.2/2):将输出模态选择本身作为考核目标,覆盖文本、图像、音频、视频与文档 5 模态且单提示最多 3 输入 3 输出,提出 893 条自包含提示与双层解耦评分,相比仅测双模态理解的既有基准填补了 omni 宣称与评测手段空白
技术严谨性 (1.0/1.5):每期望模态 4 至 12 条原子化互斥 rubric,中位数 6 条且 71.5% 落在目标区间,经至少 2 位作者复核并修正约 30 条金标,定义先模态内平均再跨模态宏平均的 MMI Value 与每提示 F1 的 MPS,并区分严格与宽松检测 但人机一致性仅 70.8% 且 Scott’s π 为 0.41,验证实验用 Gemini 同时做生成后端与判别器未做跨判别器对照
实验充分性 (0.9/1.5):主评测覆盖 5 个前沿模型报告 MPS 15.6 至 34.9 与召回 14.5 至 33.8,工具增强实验产生 1499 个可比判定并给出分模态一致性 66.5% 至 74.4% 但模型数仅 5 且无置信区间,仅英语提示,文档 rubric 因未提供工具完全未验证,阈值二值化敏感且未按输入模态组合细粒度归因
清晰度 (0.8/1):清晰定义 MMI Value 与 MPS 的计算层级与聚合方式,表格报告 F1、召回、精确率、通过率与输入失败率 但双层评分、严格与宽松两档检测及后备判别器逻辑分散在多节,需对照附录 A 与附录 D 才能完整复现判定协议
影响力 (0.9/1.5):首次量化揭示 5 个前沿模型 MPS 仅 15.6 至 34.9 且音频输出召回为 0,暴露默认文本输出的系统性短板 为追踪多模态成熟度提供可复用框架,但当前主指标因资产过少难以验证且评测限于英语与裸 API,对音频社区的直接增益集中于评测方法而非音频生成本身
开源 (1.5/1.5):代码发布于 https://github.com/facebookresearch/modality-maturity-index,数据集发布于 https://huggingface.co/datasets/facebook/mmi 含 893 条提示与 7165 条准则覆盖 1099 个模态组,评估 harness 支持 MMI Value 与 MPS 计算且附录提供标注指南与判别器提示,核心产物完整开放且文档完整
可复现性 (0.3/0.5):披露生成限制 32768 tokens、主评测超时 300 秒与验证实验 900 秒、最多 5 次重试及默认采样参数,提供 harness 与附录 D 和附录 A 的复现材料,但未披露温度与 beam 等具体采样值、Llama 4 Maverick 本地部署的 GPU 型号与数量及 5 个模型的规模参数
工程/实践价值 (1.2/1.5):实现提示集合加双层评分加自动化管线的完整数据流,支持原生资产、链接正则与 Gemini 3 Flash 后备判别器的三路模态检测及严格与宽松两档 提供可复用 harness 与 image_gen、audio_gen、video_gen 3 工具的 scaffolding,数据集与代码已在 GitHub 与 Hugging Face 公开浏览,未报告真实延迟与吞吐测量