英文题目:Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.2025
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准设计 #多模态模型 #模型评估 #语音 #音频问答
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.3/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:数据集与基准
👥 作者与机构
- Samuel Gideon Balter:机构信息未能从会议 PDF 纯文本可靠映射
- Ethan Jerzak:机构信息未能从会议 PDF 纯文本可靠映射
- Connor Thomas Jerzak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究多模态大语言模型精确乘法,输入为文本数字与数词、渲染图像与语音形式的同一算式,输出为精确乘积,难点在于进位传播与长程数字交互使难度随算术结构迅速上升而感知本身近乎无损。首先模板生成器配对同一算式的三模态实例并计算算术负载C即总位数乘非零位数,其输出的难度标量进入下一步统一回归。其次按模态拟合正确率随C变化的逻辑回归并做感知对照,以分离计算失效与感知误差,随后其失配模式进入策略探针。最后用风格受控的强制续写损失探针比较柱式、分配分解与舍入补偿前缀,并用启发式LoRA适配器几何检验策略是否对应不同参数子空间。与已有视觉数学评测偏重复杂场景不同,该文将模态与算式结构正交控制并以单维负载解释退化,具有更强的可比性与机制指向意义。在平均C为177.4的测试集下,Qwen3-VL-235B文本条件的准确率为57.6%±4.1%,高于Qwen3-VL-30B的49.3%±4.2%。结论适用边界受限于受控渲染的精确乘法,尚未验证加除法、应用题、手写扫描与工具调用智能体流程。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://neuristemic.ai/multiplication-in-multimodal-llms/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文的输入是同一个乘法算式的多种呈现,输出是模型的精确整数答案。作者要回答的不是能不能看懂题目,而是看懂之后能不能算对。开场必须保留 3 个信息:题目是配对生成的,难度用算术负载度量,策略偏好用前向损失探测而不靠采样。为研究生读者划清边界:语音音乐音频背景中常见的识别与转写只是感知环节,本文把感知与计算拆开,感知用复述检查验证,计算用乘法正确率验证。
全文按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,再讲构造与推理,然后讲实验条件、结果与反证,最后讲复现与收束。教学中举的例子都明确标为例子,例如 47 乘 36 只是为了走通流程,不代表该题有特殊效果。本文研究的只是精确多位数乘法,不扩展到加减除或应用题。资源状态方面,演示页当前可用,已在证据中给出可用链接,数据集在正文给出地址,交互排行榜链接也在正文给出,写作中不再推测其他可用性。
已有路线为什么没有回答模态与计算的纠缠?
第一条路线是文本算术可靠性研究。已有工作报告大语言模型能写出流畅的算术解释,但在受控评估中精确多位数计算很脆弱,正确率随位数增长快速下降,进位交互累积时小幅改动操作数就可能翻转对错,确定性解码下依然如此。思维链和数学预训练能提高综合推理分数,但这些方法依赖模型正确执行中间算术,而常用数据集如 GSM8K 把语言理解、规划和计算缠在一起,无法把错误归因到算术本身。第二条路线是多模态数学推理。
视觉语言模型把截图、幻灯片、渲染公式作为输入,相关基准强调复杂视觉场景和多样题型,但在受控模态变化下孤立初等算术的工作很少。于是无法判断跨模态下降是感知表示噪声还是底层计算限制,也不知道固定算术量时失败是否系统性迁移。第三条路线是人类乘法启发式与可解释探测。认知文献区分柱式、分配式分解、舍入补偿等程序,探测文献提供测试特定计算与内部表示兼容性的工具。
本文继承前两条路线的控制变量思想,又引入第三条路线的强制续写比较,把何时失败与偏好何种程序放在同一配对基准下检验。
论文把乘法难在哪、跨模态差多少形式化成什么问题?
论文提出 3 个研究问题。第一,位数长度和算法负载如何决定正确率,负载定义为总位数乘非零位数。第二,同一计算换成不同模态和表示时性能变化多少,包括数字文本、字母单词文本、渲染数字图像、渲染字母图像和音频。第三,模型内在偏好哪种算术启发式,这种先验如何随操作数线索和模态漂移,又能否解释失败模式。关键设计是配对实例:10000 个共享乘法实例各自渲染为文本、图像和条件允许时的音频,回归图中还纳入字母变体。
配对的意义是固定数学内容,只改变输入通道,从而分离表示效应。难度轴用单一标量 C 概括,模态效应则用逻辑回归的截距与斜率以及 50% 阈值来比较。策略问题进一步细化为可测量的损失偏好与参数几何,而不是让模型自由生成长推理再人工判定策略,后者会引入采样与 verbosity 混淆。
从同一道题到难度分数与策略指纹的全景是什么?
全景可沿 47 乘 36 走一遍。生成器先按数字模板采样操作数对,模板覆盖全稠密如 2 位数 3 位数,也覆盖结构稀疏如带尾零与非相邻非零位。同一对操作数被渲染为数字文本提问、字母单词提问、渲染图像方程和音频波形,4 路输入在语义上等价。模型处理器对每路输入独立求解,正确率随 C 拟合为逻辑曲线。另一条分支是策略指纹:对同一问题上下文,分别强制续写柱式、分解、舍入补偿 3 种短前导语,只在续写词上计算交叉熵,损失越低表示与该启发式初始轨迹越兼容。
再一条分支是适配器几何:为 3 种启发式各训一个低秩适配器,比较有效更新的余弦相似度,检验策略是否对应不同参数子空间。下段导读图一,图一展示了从多模态输入到负载定义再到损失探针与正交性检验的主路径,初学者应先看输入汇聚再看右侧 3 个分支的分工。
看图路径: 1. 先沿左侧四种多模态输入箭头追踪到中央处理器;2. 再看中央算术负载框中 4 乘 4 等于 16 的示例如何定义难度;3. 对比右侧三种启发式损失条中分解项被勾选为最低;4. 最后读底部跨模态与正交性小结框的文字结论
论文图 1。原论文 Figure 1:“Overview of our arithmetic benchmark and heuristic fingerprinting methodology for multimodal LLMs.”。
图一左侧用 4 个色块表示数字文本、字母文本、图像方程和音频输入,箭头都指向中央多模态大语言模型框,框内明确写出算术负载等于总位数乘非零位数并以 4 乘 4 等于 16 为例。右侧上方 3 个横条分别对应柱式、分解、舍入补偿的强制续写损失,分解条最短并打勾,表示更深的对齐。右下两个小框分别总结跨模态偏好一致与低秩更新近似正交,底部关键条给出分解偏好比例与正交系数接近零的文字小结。读图时不要把条形长度当成正确率,它是前向交叉熵,越短表示该风格续写在该上下文下越自然。
负载、探针与适配器各自计算什么,为何这样搭配?
先讲负载。设两个操作数总位数为总和,非零位数为总和,C 定义为二者乘积。论文举例 47 乘 36 总位数 4 非零位数 4 则负载 16。附录解释它只是操作数的粗糙代理:它直接上界单侧展开的位数乘法数,也通过均值不等式上界非零数位积的 4 倍,但忽略进位传播、累加顺序和启发式捷径,因此不保证保留操作数的精确排序。敏感性检查用显式计数进位需求的更复杂负载做验证,结论是 C 保留了几乎相同的解释信号。
算术负载 × 非零数字计数: 算术负载负责把题目难度压缩成一个可比较的标量,非零数字计数负责刻画真正需要做乘加的稠密程度,二者相乘是因为总位数决定进位传播距离而非零位数决定有效部分积个数,组合后得到对操作数的粗糙上界从而能跨模板和跨模态比较退化速度。
再讲逻辑回归建模。每个问题的正确概率用负载的逻辑函数拟合,分模态独立拟合。
\[P(correcti) = σ(β0 + β1 · Loadi),\]其中符号表示正确事件概率,贝塔零为截距表示基线性能,贝塔一为斜率,越接近零表示随负载退化越慢。误差率模型把每个基元数位操作独立失败概率为 p,则正确概率近似指数衰减,对数正确率与操作数线性相关,逻辑回归只是方便的单调拟合,对数链接更贴合独立误差近似。
\[P(correcti) = (1−p)Nops ≈exp(−pNops)\]接着讲探针。前导语是短而无操作数的模板,例如柱式从个位开始,分解拆 1 位为位值和,舍入用附近圆整基再补偿。实际使用平衡 paraphrase 库加中性基线,报告相对中性基线的差值,负值表示比中性更自然。只在启发式前导续写词上计损失,问题上下文固定。似然比视角是若模板长度匹配,负的长度乘损失差等于对数似然比,选最小损失即等先验下最大似然选择,长度不等时只读作归一化自然度分数。
强制续写损失探针 × 启发式前导语: 强制续写损失探针负责在固定问题上下文下只对续写词计算长度归一化交叉熵而不采样生成,启发式前导语负责提供柱式、分解、舍入补偿 3 种短而风格匹配的推理开头,二者搭配是因为只有固定上下文并比较相对中性基线的差值,才能把对某种算法轨迹的偏好从 verbosity 和格式偏好中分离出来。
3 种启发式的分工需要单独辨析。
分配式分解 × 柱式乘法: 分配式分解负责把一个因子拆成位值和并求和部分积,柱式乘法负责逐数位求部分积并显式处理进位,前者利用整十整百结构减少稠密乘法,后者对无结构进位重题更系统,论文并列二者是为了检验模型在相同算术量下是否因程序选择不同而表现出不同损失裕量。
最后讲适配器几何。每个适配器得到有效更新增量为 B 乘 A,展平后算两两余弦相似度,该量对低秩分解不变,可作为可分性代理。另有风格对照适配器只学通用推理格式而无启发式算术内容,用于检验退化是策略专用还是通用痕迹扰动。
低秩适配器 × 有效更新正交性: 低秩适配器负责在冻结基座下只学习启发式专用推理痕迹的低秩增量,有效更新正交性负责把增量折叠为 Delta W 等于 B 乘 A 后计算余弦相似度,前者提供行为可干预的策略转向器,后者提供参数空间几何证据,二者结合才能判断损失探针的偏好差异是否对应不同参数子空间而非表面措辞效应。
感知与计算的分解也需要辨析。
感知检查 × 计算退化: 感知检查负责验证模型能否在各模态下正确复述数字内容,计算退化负责度量相同题目在乘法求解正确率上随负载的下降,前者控制输入编码噪声,后者定位算术执行瓶颈,二者配对才能得出多模态下降主要来自计算而非看错听错的结论。
本研究训练了什么,冻结了什么,没有训练什么?
本研究没有训练作为评测对象的基础大模型。多模态精度曲线汇总的是对已有模型家族的调用评估,包括 Gemini、Qwen、OpenAI 与 xAI 系列,基座参数在评估时冻结,解码采用温度零的确定性生成,最大生成预算 2048 词元。需要训练的部分只限于策略机制分析中的低秩适配器。对象是 Qwen3-VL-30B 与 235B 两个可取词元损失的模型,每个模型各训 3 个启发式适配器加一个风格对照适配器。
训练数据是程序化生成的约 1000 条合成推理痕迹:舍入补偿用基集合与偏移 1 到 5 的对称与非对称近基对,分解用尾零因子与整十拆分及通用 2 位数,柱式用进位重与通用多位数,风格对照只有通用格式而无启发式中间计算。训练与评测无重叠,明确排除启发式分歧集验证测试题、陷阱题与留出多模态题。训练用验证损失早停,学习率等超参数采用工具默认,原文未报告具体数值与梯度路径细节,此处不推定实现。
音频的 Qwen3-omni 变体曾尝试但遇到技术困难,相关缺项如实保留,不视为训练失败的证据。
数据如何构造,划分与指标如何保证可比?
基准构造分三块。第一块是配对多模态乘法集,10000 个共享实例跨文本图像音频渲染,回归还纳入字母变体。模板族包括单位数、2 位数、3 位数、尾零形式与非相邻非零形式,以在不改变任务格式下改变进位模式。第二块是启发式分歧集 1000 题,按设计家族三等分采样:舍入类在基 25、50、100、200、250、500 附近偏移正负 10 内采样,分解类采尾零、25 倍数或干净整十拆分,柱式类采进位重高位对或明确远离近基与零线索的通用对。
每题用基元数位操作代价模型标定目标启发式,柱式用学堂代价加进位累加惩罚,分解用单侧展开取小加合并加法并对尾零与 1/4 百给特例低代价,舍入用最近圆整基与双操作数偏移的共享基校正代价,只保留最小代价与次小拉开固定裕量的题,去重到交换律唯一,按 70 比 15 比 15 分层划分训练验证测试。第三块是对抗陷阱 30 题,测试集专用,包括反舍入陷阱与缺项陷阱,前者让舍入看似诱人但偏移带来额外校正负担,后者检验分解是否丢掉必需部分积。
评估协议方面,精度用二项标准误,损失均值用样本标准差除以根号 n,目标支持率只在已解析行上计算。指标方向明确:正确率越高越好,强制续写损失越低表示越对齐,50% 阈值越高表示更鲁棒,贝塔零越高基线越强,贝塔一越接近零退化越慢,决定系数表示负载解释的变异比例。
负载主导退化与模态调制在曲线和阈值上如何表现?
主结果是负载主导、模态调制。图二按模型分 6 个子图展示答对概率随 C 的逻辑拟合曲线,横轴为总位数乘非零位数,纵轴为正确概率,每子图内多条曲线对应数字文本、字母文本、数字图像、字母图像及条件允许的音频。下段先导读图二,读者应先确认坐标与图例,再比较同色系在不同子图中的分离度,最后看大负载尾部是否贴零。
看图路径: 1. 先确认每子图横轴为算术负载纵轴为答对概率;2. 再对比同一子图内数字文本与图像字母曲线的分离程度;3. 观察大负载端所有曲线是否趋近于零;4. 注意 235B 子图曲线下降明显更平缓
论文图 2。原论文 Figure 2:“Probability of correct answer as a function of arithmetic load C (total digits × non-zero digits) across input modalities for Gemini 2.5 Flash ( ), Qwen3-VL-30B ( ), and…”。
图 2 像素显示前四子图曲线在中小负载几乎重合,到高负载才分叉贴零,235B 子图整体右移更耐负载,而 5.4 与 Grok 子图中字母图像曲线明显更早下滑,Grok 数字文本保持最高而字母图像最低。图注还补充说明 Gemini 3.1 Pro 在原 1 到 100 范围内全对但每模态耗时超 1 小时且输出词元多 10 倍以上,扩展到 1 到 400 后在 C 约 360 附近才退化,例如 1632178320 乘 5683473970 一题。文字结论强调文本通常最强,音频图像多落后,最高难度接近零正确率,非文本更多表现为截距下移而非斜率一致变陡。
阈值对比最直观:三家中端模型在 50% 附近 crossing,而 235B 在 74 附近,5.4 与 Grok 数值文本阈值更高但字母图像回落明显。斜率不能单独解读,高截距加陡斜率仍可在宽区间保持高正确率。为满足宽表与基线要求,下表整理可复述的阈值与解释力对照,指标方向为阈值越高越好,决定系数越高表示负载解释越强。
| 模型与条件 | 难度指标 | 基线模型族 | 本研究大模型 | 对照说明 |
|---|---|---|---|---|
| 中端文本图像 | 50% 阈值 C | 约 50 至 54 | 约 50 至 54 | 多模态差距主要在截距 |
| 235B 文本图像 | 50% 阈值 C | 约 74 至 75 | 约 74 至 75 | 跨文本图像保持鲁棒 |
| 多数拟合 | 解释变异 R2 | 高于 0.5 | 高于 0.5 | 负载为 1 维主轴 |
| 高负载尾部 | 正确率趋势 | 趋近于零 | 趋近于零 | C 大于 100 后急剧失效 |
| 感知复述 | 感知正确率 | 高于 99% | 高于 99% | 计算而非感知为主因 |
表后解释需要同时讲收益与代价。收益是 C 以极简形式跨模态跨模型解释一半以上变异,便于比较何时失效。代价是它忽略进位与捷径,不能精确排序操作数,且大模型阈值虽高但推理开销更大。未胜出项是字母图像在多数模型中最弱,音频在受控条件下并无一致惩罚,这提示表示形式的影响是非均匀的。边界是原评估多在 C1 到 100 内,超大 C 结论依赖扩展试验,不能推广到手写扫描等 messy 输入。
换掉策略偏好与强制转向推理会发生什么?
策略指纹部分先报告强制续写损失。30B 在共享留出 split 上分解、舍入、柱式的原始交叉熵约为 7.02、7.08、7.09,分解最低。陷阱上 30B 变为分解 7.42、舍入 7.14、柱式 7.30,舍入在陷阱分布下反超,这正是分布敏感的证据。对比步骤探针固定同一题并构造措辞相同仅算术正误不同的下一步,正确步偏好多在 ceiling,文本 100%,图像 97.9% 到 100%,真正信号是正确与错误步的损失差,文本约 0.26 与 0.88,图像约 0.21 与 0.27,按启发式拆分后柱式差最大而分解差较小,说明偏好幅度随模型与模态变化。
对抗陷阱进一步显示 30B 在反舍入陷阱上舍入支持率从 26.5% 升到 34.5%,235B 仅从 12.4% 升到 15.6%,分解与柱式也有再分配,小模型更易被误导线索带偏。下表整理适配器干预的定量反证,比较对象是基座原生路由,指标方向为改善越多越好,退化越少越好。
| 模型与干预 | 评估量 | 基座行为 | 适配器转向后 | 比较对象 |
|---|---|---|---|---|
| 30B 三适配器 | 行为翻转数 | 432 次比较 | 114 次翻转 | 原生路由 |
| 235B 三适配器 | 行为翻转数 | 432 次比较 | 121 次翻转 | 原生路由 |
| 30B 改善退化 | 正确性变化 | 基线正确率 | 1 次改善 113 次退化 | 单一启发式 |
| 235B 改善退化 | 正确性变化 | 基线正确率 | 4 次改善 117 次退化 | 单一启发式 |
| 启发式翻转 | 最低损失模板变化 | 原偏好分布 | 313 与 291 次翻转 | 风格对照亦退化 |
表后解释必须点明负结果。适配器确实学会了启发式痕迹,验证损失低且最低损失模板大量翻转,但正确性翻转中退化远多于改善,事后分析多为部分积遗漏而非进位丢弃。风格对照适配器即使不施加启发式算术内容也几乎只带来退化,支持退化来自把模型推离原生合成痕迹分布、破坏内部路由,而非某一启发式本身不好。几何证据显示三适配器有效更新余弦接近零,30B 同启发式重训相似度 0.2553 高于跨启发式 0.1055,235B 为 0.1476 高于 0.0447,差距约 0.15 与 0.10,提示分离不是纯高维伪影,大模型正交性更强。未评测边界是只在 Qwen 两尺寸上做 token 级探测与适配,结论不能直接推广到其他家族。
哪些结论不能推广,哪些缺项不是错误?
论文自述四点局限。第一,任务窄,只做乘法,加减除、符号代数与多步应用题模式可能不同。第二,模型覆盖窄,多模态精度覆盖多家族,但 token 级指纹与适配只在 Qwen3-VL 两尺寸上完成。第三,合成模板与短风格匹配 paraphrase 库可能不匹配真实分布,前导兼容性不等于内部算法的直接读出。第四,受控渲染不覆盖扫描、手写、表格截图与工具调用代理设置。
风险提示是强制续写与适配技术原则上可被复用于系统性挖掘部署系统的算术失效模式,因此需要对抗测试与可验证计算保障。缺失证据要如实标记:未测量误判率延迟成本时不承诺这些量改善,未报告适配学习率细节时不从模型名推定实现,音频 omni 变体技术困难只说明本次未能确认,不写成不可用。相关性不作因果:负载预测正确率不等于负载导致失败的因果证明,模态调制截距也不等于感知噪声的因果量。
要复现配对评估与探针,先做什么,需要什么?
先复现生成器。按模板族采样操作数对,记录设计家族与目标启发式,用代价模型过滤出最小与次小拉开裕量的题,去重到交换律唯一,再按 70 比 15 比 15 分层划分。对每题生成数字文本、字母文本、渲染数字图像、渲染字母图像与条件允许的音频,保持数学内容逐题配对。评估时温度零、预算 2048,分模态拟合正确率对 C 的逻辑回归,报告截距、斜率、50% 阈值与决定系数。再复现探针。
准备每启发式多 paraphrase 的短前导库加中性基线,固定问题上下文,只在续写词上算长度归一化交叉熵,报告相对中性的差值与最低损失标签及裕量,再做正确与错误中间步的对比探针,报告偏好率与损失差。适配部分用程序化痕迹训三启发式加一风格对照,排除验证测试与陷阱题,早停于验证损失,再在留出 144 题上测行为翻转与启发式翻转,并计算有效更新余弦。关键信息条件是必须能取词元损失,否则只能做行为精度而不能做指纹。
代码与权重区分:基准数据集已公开可下载,演示与排行榜页当前可用,模型权重需按各自官方渠道获取,本文系统可运行性依赖外部模型调用而非本文训练产物。
何时值得用负载与指纹,收束判断是什么?
当你的任务是截图、语音或渲染公式中的精确乘法,且需要预判何时必须调用工具而非信任模型心算时,值得先用 C 做分流:中小 C 可直接求解,高 C 应转工具或分解校验,因为多模型在 C 大于 100 后趋近于零,而 235B 阈值更高但开销更大。当你想诊断失败是看错还是算错时,先跑配对感知复述,若感知高于 99% 而乘法骤降,则优先修计算路由而非视觉编码。
当你考虑用合成痕迹微调统一推理风格时要谨慎,本文显示单一启发式转向与纯风格转向都更常带来退化,基座的内部路由已是更好调谐的折中,强加一种程序可能引入部分积遗漏。收束判断是报告显示负载是跨模态的主轴,支持分解偏好在文本与视觉中更自然,但幅度随模态漂移,可能的机制如渲染改变 magnitude 显著性仍待验证。未来验证应补 messy 真实输入、更多运算类型与工具增强代理下的表现,并补延迟与成本测量后再谈部署收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

