📄 Gemma 4 Technical Report

#多模态模型 #语音识别 #语音翻译

6.2/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5

6.2/10 | 前50% | #语音识别 | #多模态模型 | #语音翻译 | arxiv

👥 作者与机构

  • 第一作者:Sherif El Abd (Google DeepMind),论文以 Gemma Team 署名,列出超过200位作者
  • 通讯作者:未指定唯一通讯作者,论文脚注提供联系邮箱 gemma4report@gmail.com
  • 作者列表:包括 Sherif El Abd, Vaibhav Aggarwal 等核心贡献者以及众多其他贡献者,绝大多数来自 Google DeepMind

💡 毒舌点评

这篇报告展现了教科书级别的工业界“秀肌肉”范式:用一份附带技术彩蛋的产品发布说明书,试图包装成学术论文。Gemma 4的工程集成能力毋庸置疑,特别是12B模型直接砍掉重型编码器、用一个矩阵乘法处理原始图块的激进做法,确实体现了敢于挑战主流范式的工程魄力。然而,报告在实验完整性上堪称灾难——毫无消融实验、回避与同参数级最强模型的直接对比(Qwen 3.5、DeepSeek V4 Flash等竞品仅在人类评估Arena中被隐晦提及,却不敢在自动化基准上正面对决)、所有关键训练配方完全黑箱,使得这份所谓的“技术报告”更像一份经过精心修剪的产品亮点清单,而非严肃的研究文档。

📌 核心摘要

这篇论文介绍了Gemma 4,一个开源的、原生多模态语言模型系列,包含2.3B至31B参数的密集模型和26B-A4B的MoE架构模型。核心贡献包括:1)引入“思考模式”(thinking mode),通过生成推理链增强数学和代码等复杂推理能力;2)提出统一的无编码器架构(仅限12B),用轻量级线性投影直接处理原始图像和音频块,取代传统的重型视觉和音频编码器;3)通过pp-RoPE位置编码、5:1的局部/全局注意力比和KV缓存复用等技术,实现长上下文(最高128K)的显存效率优化;4)通过QAT量化训练和MTP草稿头实现面向终端设备的推理效率提升。在人类评估Arena榜单上,Gemma 4 31B以1451的Elo分位列开源密集模型第一;在AIME 2026 (89.2%)、MMLU Pro (85.2%) 等基准上大幅超越前代Gemma 3 27B。其实际意义在于为从终端设备到服务器提供了完整的开源多模态模型矩阵,并通过QAT大幅降低端侧部署门槛。主要局限性在于报告缺乏任何消融实验,且训练数据、指令微调配方等核心信息完全缺失,学术可复现性极低。

模型MMLU ProAIME 2026LiveCodeBench v6GPQA DiamondArena Elo
Gemma 4 31B85.289.280.084.31451
Gemma 4 26B82.688.377.182.31438
Gemma 3 27B67.620.829.142.41366

🔗 开源详情

  • 代码:论文中未提供代码仓库链接。
  • 模型权重:论文声明以 Apache 2.0 许可证开放权重,但未在报告中提供任何模型下载链接。
  • 数据集:论文仅描述预训练数据集构成,未提供任何数据集获取链接或开源协议,也未开放下载。
  • Demo:论文未提及在线演示或试用入口。
  • 复现材料:论文提供了模型架构参数(表1/10)、训练基础设施配置(表2)、对话格式模板(表11)和图像缩放算法(算法1),但未提供完整训练/评估代码、配置文件或可直接复现的检查点。
  • 论文中引用的开源项目:引用了 SentencePiece、JAX、Pathways、GSPMD、XLA 等技术,但均未在文中提供项目链接。

🏗️ 方法概述和架构

Gemma 4 模型家族采用以仅解码器(decoder-only)Transformer 架构为核心的多模态处理管线。其整体流程遵循“多模态输入→编码/投影→自回归生成”的范式:系统接收文本、图像及音频作为输入,经分词或专用编码器(或无编码器的投影模块)转换为统一的嵌入表示后,送入核心解码器网络按自回归方式逐个生成最终响应。不同于传统独立编码器设计,Gemma 4 在部分型号上开创性地去除了视觉与音频编码器,直接将原始信号投影到语言模型的嵌入空间,实现了从像素/波形到文本的统一生成。生成过程中,可通过特殊的控制令牌 <|think|> 激活思考模式,使模型在正式回答前输出由 <|channel|>thought ...<channel|> 包裹的推理链,从而显著提升数学和编程等复杂推理任务的表现。

核心组件方面,首先是文本分词与嵌入:所有模型共享一个基于 SentencePiece 的分词器,该分词器采用分割数字、保留空格及字节级编码策略,词表规模为 26.2 万个条目。输入文本经分词器转换为 token ID 序列,再通过嵌入层映射为稠密向量进入主干网络。

核心解码器是密集模型与混合专家模型(MoE)相结合的基础模块。小尺寸的 E2B 和 E4B 采用密集架构,并延续了 Gemma 3n 的每层嵌入技术,使其有效参数量分别为 2.3B 与 4.5B(实际总参数 5B 与 8B)。12B 和 31B 为纯密集模型,而 26B-A4B 型号则采用 MoE 架构,总参数量 26B 但每次仅激活 4B 参数,兼顾了大容量与计算效率。所有解码器层均采用 RMSNorm 进行前置与后置归一化,并对查询和键应用 QKNorm 以稳定训练。

长上下文效率是本架构的关键设计。为应对长序列推理中 KV 缓存呈指数级膨胀的问题,Gemma 4 设定了局部滑动窗口注意力与全局注意力的特定比例:E2B 为 4:1,其余型号为 5:1,即每 4 或 5 个局部注意力块后跟一个全局注意力块。这种设计使得大部分层的 KV 缓存仅维护一个固定大小的窗口,极大压缩了内存开销。在位置编码方面,全局注意力层使用 pp-RoPE,参数 p=0.25,频率基设为 1,000,000;局部层则采用标准 RoPE,频率基设为 10,000。pp-RoPE 通过对位置维度进行幂次压缩,有效扩展了模型对长距离位置的感知能力。此外,在全局注意力层中,模型直接复用键张量作为值,省去了对值矩阵的独立存储。结合在 E2B 和 E4B 上分别实施的 20/35 与 18/42 KV 缓存共享比率,这些优化措施总计将全局层的 KV 缓存内存占用降低了 37.5%。

多模态感知模块中存在两种截然不同的设计路径。第一种是沿用固定编码器的架构,主要服务于 E2B、E4B、26B-A4B 以及 31B 型号。视觉方面,小模型(E2B, E4B)搭载 150M 参数的 ViT,大模型(26B-A4B, 31B)使用 550M 参数的 ViT,两者图像块大小均为 16。这些视觉编码器通过非因果注意力机制、轴向 2D-RoPE 与 2D 绝对位置编码的组合,支持可变纵横比的图像输入,根据自适应算法最多生成 1120 个软令牌。

Figure 2: Image resizing. Here we use patch_size=16, pooling_kernel_size=3, max_soft_tokens=10. The image is thus first resized to 2 ×\\times 4 pooled patches (each of size 48\u200bpx248\\text{px}^{2}), which is the closest match that results in a sequence length below the targeted 10. The 72 patches (each of size 16\u200bpx216\\text{px}^{2}) are then processed by the vision encoder, the vision encoder representations are pooled 3×33\\times 3, and the resulting 8 soft tokens are processed by the LLM backbone.

该图直观展示了视觉编码前的关键图像预处理步骤。以输入图像(572x1024像素)为例,为了在保持宽高比的前提下将序列长度控制在目标上限(如 max_soft_tokens=10)内,图像会先被“大部分保持宽高比地”缩放至目标尺寸(如96x192像素),从而将图像分割成固定数量的原始块(如8个tokens = 72个patch)。这个过程与后文提到的视觉编码器处理直接相关。音频方面,仅 E2B 与 E4B 配备独立的音频编码器。该编码器基于 USM 的 Conformer 架构,由两层降采样卷积和十二层 Conformer 层构成。它以 40 毫秒的梅尔滤波器组特征块为输入,参数量相较前代大幅压缩 55% 至 305M,并直接向大语言模型输出连续表征,不采用向量量化。所有固定编码器的权重在预训练期间均被冻结。

第二种路径是 12B 型号独有的统一无编码器架构。它彻底抛弃了上述沉重的视觉和音频编码器,代之以轻量级线性投影。视觉侧,48×48×3 的原始 RGB 图像块通过一个仅有 35M 参数的大型矩阵乘法直接映射至 LLM 的嵌入维度,并在投影后、经 LayerNorm 之前,被添加 2D 坐标位置编码以保留空间结构,完全取代了原本 550M 参数的 ViT。音频侧,则以 16kHz 采样的原始音频被切分为 40 毫秒的块,形成 640 维向量,随后同样通过线性层直接注入嵌入空间。由于音频信息天然具有时序性,该流无需额外位置编码。此设计消除了对分立编码器的需求,减少了设备端因多模块加载导致的内存碎片化。

面向高效推理,架构集成了多项优化。其一为自回归多令牌预测草稿头,专门服务于投机解码以提升推理速度。该草稿头是一个 4 层 Transformer,接收主模型上一时间步的最后一层激活及令牌嵌入作为输入,通过交叉注意力直接共享主模型已算好的 KV 缓存,从而完全规避了草稿头自身预填充造成的延迟。

Figure 1: The autoregressive MTP drafter (blue blocks on the right) is fed activations and KV cache from the main model (gray blocks).

上图清晰地展示了自回归多令牌预测草稿头的架构及其与主模型的交互方式。左侧是主模型,右侧是MTP草稿头。草稿头接收上一时间步的令牌嵌入(t2/p1)和前一草稿头的预测令牌(t3/p1)作为输入,并通过交叉注意力(红色箭头)访问主模型中“最后预填充的全局/局部层”的KV缓存,这正是文中“共享主模型已算好的KV缓存”的视觉体现。草稿头的每一层都通过交叉注意力关注主模型的激活(蓝色箭头),从而高效生成草稿令牌(t3, t4)。在 E2B 与 E4B 上,草稿头进一步通过 Top-K 聚类投影进行加速,将最终映射到全词表的矩阵乘法的计算量从 d×262,000 降至 d×4096,在保持相近接受率的同时大幅减少解码开销。其二为量化感知训练,提供移动端 int2/int4 混合精度和通用 Q4_0 两种量化方案,并引入逐块标量缩放以约束激活值范围,确保在 fp16 下推理的稳定性。量化技术同样应用于图像和音频编码器,例如在 150M 视觉编码器上实施 W8A8 量化后,前向传递内存占用减半,设备端延迟降低 44%;音频编码器经混合位宽量化后,磁盘占用锐减 78%。

  1. 核心解码器与效率优化 采用带RMSNorm的前/后归一化及QKNorm的Transformer架构。为应对长上下文的KV缓存爆炸问题,采用5:1(E2B为4:1)的局部滑动窗口与全局注意力层比例。全局层使用pp-RoPE (p=0.25, 频率1M),局部层使用标准RoPE (频率10k)。结合在全局层复用Key作为Value,以及KV缓存共享技术,声称将全局KV缓存占用减少37.5%。
  2. 多模态感知
  • 视觉(除12B外):使用冻结的ViT(E2B/E4B用150M参数,31B/26B用550M),支持可变纵横比,通过轴向2D-RoPE和2D绝对位置编码处理图像,最多生成1120个软令牌。[图像补充] 输入图像在送入ViT前,会经过一个基于目标最大软令牌数的宽高比保持缩放过程(如图2所示)。
  • 音频(仅E2B/E4B):使用基于USM的12层Conformer编码器(305M参数,较前代压缩55%),以40ms Mel滤波器组块为输入,输出连续表征给LLM。
  • 统一无编码器架构(仅12B):完全舍弃独立编码器。视觉端将48x48x3的RGB图块通过一个35M参数的大矩阵乘法和2D坐标位置编码直接投影;音频端将40ms的640维原始音频块直接线性投影到嵌入空间。
  1. 思考模式 通过监督微调,使模型能生成由特殊标记(`<|channel|>`thought …`<channel|>`)包裹的推理链,并由 `<|think|>` token控制开关。
  2. 高效推理
  • MTP草稿头:训练一个4层Transformer草稿头,通过交叉注意力共享主模型KV缓存进行投机解码,无需预填充(如图1所示)。E2B/E4B版本额外使用Top-K聚类投影降低计算量。
  • QAT量化:提供int2/int4混合精度(mobile)和Q4_0两种量化方案,并结合块级缩放策略以稳定fp16推理。

💡 核心创新点

  1. 统一无编码器多模态架构(12B):激进地用极轻量线性投影(视觉35M)替代550M视觉编码器和305M音频编码器,挑战了主流“冻结编码器+映射器”范式,显著降低了端侧多模态模型的内存碎片化和系统复杂度。
  2. 高效长上下文策略:结合pp-RoPE、KV复用和局部/全局注意力比,实现了37.5%的全局KV缓存压缩,为长文本窗口的高效部署提供了有效的工程经验。
  3. 极致压缩的音频编码器:在保持甚至提升语音识别/翻译性能(如CoVoST翻译相对提升12%)的基础上,将音频编码器参数压缩55%,量化后存储压缩78%,证明了现有语音前端存在巨大的参数冗余。
  4. 面向终端的轻量投机解码:MTP草稿头设计通过共享KV缓存和聚类投影,几乎消除了端侧投机解码的额外预填充开销。

📊 实验结果

在以下部分中,我们对指令微调后的模型进行自动化基准测试及人类评估,涵盖文本、代码、数学、视觉和语音等多个领域。核心对比对象为前代 Gemma 3 27B。

人类评估

我们在 Arena 平台上将 Gemma 4 31B 和 26B-A4B 与其他顶尖模型进行了盲测对比,Elo 分数如表 4 所示。

RankModelElo95% CIOpenType#params/#activated
1Claude Fable 51508± 9no-- / -
15GLM 5.11475± 6yesMoE744B / 40B
25GLM 5.2 (Max)1471± 10yesMoE744B / 40B
29MiMo V2.5 Pro1466± 5yesMoE1T / 42B
34Kimi K2.61460± 5yesMoE1T / 32B
36DeepSeek V4 Pro Thinking1458± 5yesMoE1.6T / 49B
37GLM 51457± 5yesMoE744B / 40B
38DeepSeek V4 Pro1456± 5yesMoE1.6T / 49B
43Gemma 4 31B1451± 8yesDense31B
44Kimi K2.5 Thinking1450± 4yesMoE1T / 32B
57Qwen 3.5 397B-A17B1444± 4yesMoE397B / 17B
61Gemma 4 26B-A4B1438± 8yesMoE26B / 4B
63DeepSeek V4 Flash Thinking1436± 5yesMoE284B / 13B
157Gemma 3 27B1366± 4yesDense27B

自动化基准测试

表 5 展示了 Gemma 4 系列模型在多样化基准测试上与 Gemma 3 27B 的性能对比。

Gemma 4
31B
Gemma 4
26B-A4B
Gemma 4
12B
Gemma 4
E4B
Gemma 4
E2B
Gemma 3
27B
non-thinking
MMLU Pro85.282.677.269.460.067.6
AIME 2026 no tools89.288.377.542.537.520.8
LiveCodeBench v680.077.172.052.044.029.1
Codeforces Elo215017181659940633110
SciCode43.040.038.024.021.021.0
GPQA Diamond84.382.378.858.643.442.4
Big Bench Extra Hard micro avg74.464.853.033.121.919.3
HLE19.58.75.2---
HLE with search26.517.2----
IFBench76.072.074.044.038.032.0
IFEval98.998.597.296.794.690.4
MMMLU88.486.383.476.667.470.7
MRCR v2 8-needle, 128k66.444.143.425.419.113.5
Terminal Bench Hard36.014.018.08.03.04.0
Tau2 – airline75.076.075.052.031.039.0
Tau2 – retail86.485.577.667.134.66.6
Tau2 – telecom69.343.054.418.419.73.1

视觉基准测试

表 6 展示了 Gemma 4 模型在不同分辨率下的视觉基准测试性能。

Gemma 4
31B
Gemma 4
26B-A4B
Gemma 4
12B
Gemma 4
E4B
Gemma 4
E2B
Gemma 3
27B
MMMU Pro76.973.869.152.644.249.7
MATH-Vision85.682.479.759.552.446.0
MedXPertQA MM61.358.148.728.723.5-
InfographicVQA92.089.388.470.063.970.6
OmniDocBench 1.5 ↓0.1310.1490.1640.1810.2900.365

语音基准测试

表 7 展示了 Gemma 4 与 Gemma 3n 模型在语音翻译和识别任务上的性能。

CoVoST (CorpusBLEU ↑)Params
Size
ja → ende → enfr → enes → enit → enru → enzh → enAVG
Gemma 4 E2B305M
87 MB
21.439.239.243.240.846.417.935.4
Gemma 4 E4B25.542.041.044.843.049.421.938.2
Gemma 3n E2B680M
390 MB
17.736.535.739.938.539.213.931.6
Gemma 3n E4B22.339.138.441.840.443.717.434.7
FLEURS ASR (WER ↓ , = CER ↓)enkojadefrhiesitpt-brruarzhAVG
Gemma 4 E2B0.0800.0660.1070.0760.1010.1010.0420.0410.0560.0840.1430.1870.090
Gemma 4 E4B0.0650.0530.0780.0610.0800.0860.0350.0320.0460.0680.1620.1360.075
Gemma 3n E2B0.0760.1010.1630.0790.1300.1060.0510.0440.0670.1120.1310.2350.108
Gemma 3n E4B0.0660.0730.1110.0650.0980.0890.0410.0340.0530.0870.1010.2030.085

表 8 展示了无编码器架构的 Gemma 4 12B 模型在语音任务上的性能。

FLEURS ASR (WER ↓ , = CER ↓)enkoja*defr
0.0630.0570.0800.0530.081
esitpt-brruar
0.0380.0300.0470.0680.070
CoVoST (XX → EN, CorpusBLEU ↑)jadefresitru
26.441.942.544.643.350.5

长文本基准测试

表 9 展示了 Gemma 3 与 Gemma 4 模型的长上下文性能对比。

BenchmarkMetricContext lengthGemma 4
31B
Gemma 4
26B-A4B
Gemma 4
12B
Gemma 4
E4B
Gemma 4
E2B
Gemma 3
27B
RULERAccuracy32k96.897.396.495.283.091.1
128k96.489.891.286.670.466.0
LOFTText Retrieval Recall@k128k79.566.366.458.550.58.6
GraphWalksF1<128k82.372.671.050.94.132.8
MTOB (eng→kgv)chrF~128k (Half book)52.950.045.137.815.441.0
~256k (Full book)54.348.941.9---
MTOB (kgv→eng)chrF~128k (Half book)48.645.037.334.628.231.2
~256k (Full book)46.242.732.9---

关键结论

  1. 人类评估领先:在 Arena 人类评估中,Gemma 4 31B 以 Elo 1451 分位列开源密集模型第一名,其性能与参数量远超它的 MoE 模型(如 DeepSeek V4 Pro)相当。26B-A4B 也超越了 DeepSeek V4 Flash Thinking 等更大的 MoE 模型。
  2. 文本与推理能力飞跃:Gemma 4 31B 在推理密集型任务上表现卓越,例如在 AIME 2026 上达到 89.2%,远超 Gemma 3 27B 的 20.8%。参数量最小的 E2B 在多数基准测试上性能可媲美或超越 Gemma 3 27B。
  3. 长文本性能指数级增长:相比 Gemma 3,Gemma 4 在 128K 长上下文任务上提升巨大。例如,在 RULER 128k 上,E4B 得分 86.6%,远高于 Gemma 3 27B 的 66.0%;在 LOFT 文本检索任务上,E4B 的 Recall@k 为 58.5,而 Gemma 3 27B 仅为 8.6。
  4. 多模态能力全面超越:在视觉基准测试中,E4B 在所有指标上均持平或超越 Gemma 3 27B,例如在 MATH-Vision 上取得 59.5 分(Gemma 3 27B 为 46.0 分)。在音频任务上,Gemma 4 E2B/E4B 在编码器体积减小 78% 的情况下,翻译和识别性能相比 Gemma 3n 依然取得了 10% 至 17% 的相对提升。
  5. 基准对比缺失:报告未提供 Gemma 4 与同参数级别或同期最强开源模型(如 Qwen 3.5、LLaMA 4)在任何自动化基准上的直接对比,仅在 Arena 平台上进行了人类评估比较。此外,报告中未包含任何消融实验来证明各架构创新的单独贡献。

文本与推理:Gemma 4 31B在AIME 2026 (Thinking) 达89.2%,远超Gemma 3 27B的20.8%。在Arena人类评估中,31B模型位列开源密集模型第1,26B-A4B超越DeepSeek V4 Flash Thinking等更大MoE模型。 长文本:相较Gemma 3,Gemma 4在128K长上下文下的RULER和LOFT性能有指数级增长(E4B在RULER 128k上为86.6% vs. 66.0%)。 多模态:视觉上E4B (MATH-Vision 59.5) 超越Gemma 3 27B (46.0)。音频翻译和识别在编码器大幅缩小的情况下取得了相对提升。 关键缺失:报告未提供与同参数级或同期最强开源模型(如Qwen 3.5、LLaMA 4)在任何自动化基准上的直接对比,仅在Arena中进行了人类评估比较。且无任何消融实验证明各架构创新的单独贡献。

🔬 细节详述

  • 训练数据:大规模多领域多模态数据集,包含网页、代码、图像和音频(E2B/E4B/12B),截止日期2025年1月。未说明具体来源、规模和预处理细节。
  • 计算设施:使用TPUv5p和TPUv6e,采用JAX/Pathways框架、ZeRO-3分片、GSPMD分区及MegaScale XLA编译,支持切片粒度弹性恢复。具体训练时长和总计算量未说明。
  • 分词器:与Gemini相同的SentencePiece,词汇量262k,支持数字拆分和字节级编码。
  • 训练与后处理策略:预训练和指令微调策略细节未说明,仅提到加入思考模式格式化数据。数据去污染和安全过滤有提及,但方法未说明。
  • 量化与部署细节:提供mobile和Q4_0量化版本及内存占用对比(如E2B从4.6GB降至0.8GB),但int2/int4混合量化策略的层间分配等细节未展开。
  • 架构参数:提供了各模型的嵌入维度、层数、头数、视觉编码器架构等详细参数表。词嵌入层等维度未说明。

⚖️ 评分理由

  • 创新性 (1.0/2):12B的无编码器架构是一次有意义的激进简化尝试,pp-RoPE和KV复用等也是扎实的工程改进。但这些本质上是现有技术的大胆组合与工程优化,缺乏方法论上的根本性突破。
  • 技术严谨性 (1.0/1.5):报告各部分逻辑清晰,架构选择有理有据。然而,方法论的核心——训练配方、数据构成完全缺失,且无任何消融实验支撑其复杂架构设计的必要性,严重削弱了其技术论述的可靠性。
  • 实验充分性 (0.8/1.5):评估基准覆盖范围广,引入Arena和长文本测试值得肯定。但致命伤在于缺乏消融实验和回避直接竞品的自动化基准对比。这使得我们无法判断各项架构创新(如KV复用、无编码器)的边际收益,也无法客观评估其“领先”声明在同级模型中的含金量。
  • 清晰度 (0.6/1):架构表格和评估图表清晰,对话格式和控制Token在附录有明确说明。但作为一份“技术报告”,省略了所有能支撑其可复现性的核心训练细节,信息完整性严重不足,价值大打折扣。
  • 影响力 (0.4/1.5):针对语音/音频领域读者,此报告的核心贡献在文本和视觉,音频仅作为极边缘化的技术验证出现,无新方法、新基准或深入分析,对该领域研究者的直接启发有限。
  • 开源 (1.0/1.5):论文声明以Apache 2.0许可证开放模型权重,提供了量化版本。但报告中未提供模型权重、代码、部署脚本的任何具体下载链接或仓库地址。
  • 可复现性 (0.1/0.5):极度不透明。虽然权重公开,但预训练数据、SFT数据、关键超参数(学习率、batch size等)完全缺失,使得从零开始的学术复现几乎不可能。
  • 工程/实践价值 (1.3/1.5):一份顶级的工业界系统工程发布报告。详尽的内存和延迟分析、QAT端侧部署方案、低开销投机解码架构为工业应用提供了高价值参考。但关键工程细节(如QAT混合精度策略)的缺失使其作为“参考手册”也存在信息断层。

🚨 局限与问题

论文明确承认的局限:论文未在正文中明确列出模型的技术局限性,仅在安全章节泛泛讨论了LLM的偏见、滥用和隐私等通用伦理风险。 审稿人发现的潜在问题:

  1. 实验对比的选择性偏差:报告苦心营造的“领先”形象,在自动化基准上几乎仅与孱弱的前代Gemma 3 27B对比;与同期最强竞品(Qwen 3.5、LLaMA 4等)的对比仅在Arena中展示,避开了更客观、可复现的自动化基准,对比动机令人生疑。
  2. 消融实验的完全缺失:这是最严重的硬伤。无法评估“无编码器”架构相对于“有编码器”模型的精度损失、QAT对不同模态性能的量化影响、KV复用或pp-RoPE的独立贡献,导致报告沦为一堆技术的无验证堆砌。
  3. 思考模式的过度泛化风险:报告仅展示思考模式在STEM等推理任务上的增益,但未评估其对通用对话流畅度、事实性问答或安全拒答的潜在负面影响,可能存在“过度思考”或格式错乱的风险。
  4. 音频模态研究的深度不足:尽管声称“原生多模态”,音频评估仅停留在简单的ASR和翻译任务上,且12B的无编码器音频未见任何鲁棒性或噪声环境测试,其泛化能力存疑。

← 返回 2026-07-08 语音/音乐/音频论文速递