英文题目:Multilingual-To-Multimodal (M2M): Unlocking New Languages with Monolingual Text

会议身份:conference:eacl:2026:conference-paper-id:2026.findings-eacl.143

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #跨语言 #多语言 #零样本 #音频检索

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Piyush Singh Pasi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多语言图文与音频文本检索以多语言查询与图像或音频候选为输入,以跨模态相似度排序为输出,难点在于非英语多模态平行数据稀缺且采集昂贵。该方法首先冻结英语多模态文本编码器与多语言文本编码器,对同一英语句子抽取两者平行表示形成对齐监督。接着仅训练由两层无残差线性层构成的投影映射,将多语言表示逼近多模态表示,检索时在归一化表示上优化对齐与结构损失而生成任务则保留尺度信息。推理时任意语言先经多语言编码器再经该映射进入冻结的图像或音频空间,以余弦相似度完成检索或条件生成。与依赖多语言多模态平行数据微调整个文本编码器不同,该方法以英语为共享锚点只做表示空间几何重塑而不引入新模态监督,因而轻量且保留单语性能。在XTD测试集任务下,M2M对齐模型V6的Recall@10为89.5,高于MSE基线V1的88.9。该结论适用边界受限于句子级全局表示的双编码器检索,向词元级生成与联合编码器等场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文解决了哪一步?

本文的输入是英文句子文本,目标是让非英文句子也能直接使用英文多模态模型完成检索和生成。训练时必须保留的信息是全部编码器都冻结,只有几个线性层被更新,而且训练过程看不到任何非英文多模态对。

输出是映射后的多语言向量,它可以直接与冻结的图像或音频向量做余弦比较,也可以送入生成器的条件编码位置。对于刚入门的读者,可以把任务理解为向量版的词典搬运。教学例子是先学会猫的图片与英文 cat 的对应,再利用多语言编码器内部已有的 cat 与 gato 对应,把这种对应搬运到图片空间。

论文研究的任务是图像文本检索、音频文本检索和文本到图像生成 3 类任务。原文明确声明目标不是替代大规模多语言多模态预训练,而是检验更好的隐空间对齐能在多大程度上以很小的数据和计算代价恢复类似能力。

资源状态方面,第三方资源中句子变换器网站当前可用,保真度工具库当前可用。论文自称公开的代码与数据集链接需要读者自行核对可达性,本文不把未验证的链接写成已公开。

已有路线用了什么监督,本文在监督上如何不同?

已有第 1 条路线是英文多模态模型,例如 CLIP 和 CLAP。它们用大量英文图文或音频文本对,把文本编码器和模态编码器拉到同一空间。

第 2 条路线是多语言多模态模型,通常需要从头训练或在预训练基础上微调。这类方法依赖多语言图文或音频文本对,或者至少微调文本编码器。部分方法冻结图像编码器,但仍然需要多语言多模态监督。

第 3 条路线是隐空间搬运,学习源空间到目标空间的直接变换或相对表示。过去这类工作多用于英文多模态数据的分类设置,尚未系统覆盖多语言检索和生成。

本文的不同在于监督来源。训练映射时只用英文文本,不用图像,不用音频,也不用非英文文本。做法是把同一英文句分别送入多语言编码器和多模态文本编码器,得到 1 对向量,前者经过映射去逼近后者。推理时非英文句只走多语言编码器加映射,再与冻结的模态编码器比较。

为什么英文模型换语言就掉点,需要什么条件才能复述?

英文多模态模型掉点的原因是它的文本侧只见过英文的图文或音频文本搭配。换语言后文本向量落在未对齐的区域,即使语义相同,余弦距离也无法反映跨模态相似。

要复述本文方法,需要准备 3 个已有的条件。第 1 个是英文多模态模型,它的文本和模态编码器已经对齐。第 2 个是多语言文本编码器,它的内部已把多种语言的同义句拉近。第 3 个是一份与下游任务语义一致的英文文本,例如图像描述句用于图像检索,音频描述句用于音频检索。

还需要明确评测条件。检索用余弦相似排序,指标是 Recall@10 是否命中。生成用 FID 和 IS 等图像质量指标,FID 越低越好,IS 越高越好。

初学者容易误以为本文训练了一个新的图文模型,实际上图像和音频编码器从未更新,也没有见过新的图片或音频。另一个常见误解是把机器翻译基线当成同一监督,机器翻译需要在训练或推理时引入翻译系统,而本文在训练和推理都不依赖翻译,只在构造评测集时用翻译制造多语言查询。

沿一个英文句子走完对齐全景

先取一个英文图像描述句,例如公园里玩耍的猫的图片说明。把它送入冻结的多模态文本编码器,得到多模态英文向量,把同一句子送入冻结的多语言文本编码器,得到多语言向量。

接着把多语言向量送入投影映射,得到搬运后的向量,训练目标是让它等于多模态英文向量。推理时换成印地语或西班牙语的同义句,只走多语言编码器加已学好的映射,得到可以直接与图像或音频向量比较的表示。

图像侧或音频侧的编码器始终冻结,因此原有的英文图文或音频文本对齐不被破坏。论文用总览图概括了训练只用英文文本而推理出现多语言能力的流程,上半是训练,下半是推理。

多语言文本编码器 × 多模态文本编码器: 多语言文本编码器负责把不同语言的同义句拉近,提供跨语言共享语义表示,多模态文本编码器负责提供已与图像或音频对齐的英文文本表示,二者搭配的理由是同一英文句在两侧同时存在而成为公共锚点,组合意义是用英文侧配对关系把多语言侧整体搬运到多模态空间而不引入多语言多模态对。

下面这张总览图把上述路径画成了左右 2 条空间和中间的线性层,读图时重点看英文如何作为桥梁连接 2 个文本空间。

看图路径: 1. 先沿上半训练区看同一英文句如何同时进入 2 个文本编码器;2. 再看中间橙色线性层在训练虚线上下两侧的位置变化;3. 比较右上多模态空间与多语言空间之间的双向箭头方向

原论文 Figure 1:Overview of M2M. Using only English text supervision, we learn a lightweight linear mapping that…

论文图 1。原论文 Figure 1:“Overview of M2M. Using only English text supervision, we learn a lightweight linear mapping that aligns multilingual text embeddings to a frozen multi- modal text space (e.g.,…”。

这张图的上半显示同一英文句进入上下 2 个编码器,下半显示非英文句只进入多语言编码器,中间的橙色块是唯一可训练的线性层。右侧的 2 个椭圆分别表示多模态文本空间和多语言文本空间,箭头表示学习到的搬运方向。蓝色雪花标记表示冻结,放大镜和生成器分别表示检索和生成 2 条下游路径,下半的猫图和波形说明同一映射可以同时服务检索和生成。

映射、损失和归一化各自负责什么?

投影映射是几个线性层的堆叠,默认是 2 个线性层且不带残差连接,参数量约 1 M。它的分工是承担全部几何变换,包括混合和缩放,而不只是旋转。

冻结编码器的分工是保持原有能力不变,这里补充的是不引入反向映射的原因。原文明确指出从多模态到多语言的反向映射会干扰已有的模态与文本对齐,因此只学习单向映射。

对齐损失 × 结构保持损失: 对齐损失负责让映射后向量逐点逼近对应的多模态英文向量,结构保持损失负责让批次内样本两两余弦相似矩阵在映射前后保持一致,二者搭配的理由是逐点逼近保证位置正确而结构约束防止批次几何坍缩,组合意义是在检索用的余弦空间中同时保住绝对位置和相对关系。

符号与计算目标需要先讲清楚再看公式。记英文句的多模态表示为目标向量,多语言表示为源向量,映射函数把源向量变为搬运后向量。批次内分别计算目标侧和搬运侧的余弦相似矩阵,再取上三角比较。

\[zm→e = F(zm) Lalign = MSE(zm→e, ze)\]

该公式组的第一行定义了映射,第二行定义了对齐损失为均方误差。原文解释选择均方误差而不用余弦或相似损失的原因是希望搬运后向量能完全替代目标向量,而不只是角度一致。词级别对齐被明确放弃,因为它更关注语言形式而非语义。

对检索任务,2 项损失都在 L2 归一化后的向量上计算,因为下游用余弦排序。对生成任务,去掉归一化和结构项,只用未归一化的均方误差,因为生成更需要保留尺度信息。

冻结编码器 × 投影映射: 冻结编码器负责保持原有多模态对齐和多语言能力不变,投影映射负责承担全部跨空间变换,二者搭配的理由是只训练约 1 M 到 2 M 参数即可避免破坏已对齐的图像或音频侧,组合意义是把学习问题压缩为文本到文本的线性搬运。

这组搭配解释了为何 2 层线性已经足够。权重分析显示有效矩阵的秩明显低于维度,说明映射聚焦于语义相关的紧凑子空间。正交偏离很大说明不是简单旋转,有效偏置很小说明不是简单平移。近义句的成对余弦距离也支持这一点,多模态英文向量对措辞变化更敏感,多语言向量更紧凑,映射后向量落在中间。

训练数据、优化设置和数据量如何变化?

图像侧的默认训练数据是英文的概念描述、图像描述和视觉问答句的混合。去除重复后随机采样,默认用 250K 句,训练 50 轮,批量为 64。优化器用 AdamW,学习率为 3e-4,权重衰减为 1e-2,线性调度加 50 步热身,在 2 块 24 GB 显存的图形处理器上训练。

验证用英文图文对,按文本到图像和图像到文本召回的均值保存最优检查点。音频侧用英文的音频描述、环境声音描述和弱标注描述混合,验证用音频描述验证集。生成侧对齐的是生成模型中的 CLIP 编码器,训练 10 轮,用 bfloat16 精度和均方误差,不做验证。

需要强调的是这些句子都是纯文本,训练时不读取对应的图片或音频。数据量实验显示,只用 1000 句英文也能得到可用的对齐,超过 250K 句后增益饱和,扩展到 2M 句只有很小的提升。

训练数据量从小到大的变化是理解数据效率的关键,横轴是句子数而纵轴是多语言平均的 Recall@10。

看图路径: 1. 先确认横轴训练句数从 1K 到 2M 的增长顺序;2. 再比较蓝色 T2I 与红色 I2T 两条曲线在 1K 处的起点差距;3. 观察 5K 到 50K 区间的斜率与 100K 之后的平坦程度

原论文 Figure 3:Effect of scaling training data on XTD eval set for M2M-aligned model Jina-CLIP-v1 × M-MPNET.

论文图 3。原论文 Figure 3:“Effect of scaling training data on XTD eval set for M2M-aligned model Jina-CLIP-v1 × M-MPNET. Recall@10 averaged across all languages in XTD.”。

这张图显示从 1K 到 5K 上升最陡,之后从 10K 到 50K 缓慢爬升,100K 之后基本走平,蓝色 T2I 与红色 I2T 曲线始终接近。像素上可以辨认起点约在 84.0 到 86.0 附近,终点约在 89.0 附近,说明数据效率高的判断主要来自前段陡峭而非后段堆量。复现时应先用小数据验证流程,再决定是否扩大到 250K 句。

评测集、基线和指标方向如何保证可比?

图像文本评测用 3 个多语言集:11 个语言的 XTD 测试集、36 个语言的 XM3600 集、4 个语言的 Multi30K 集。音频文本评测因缺少现成多语言集,用机器把英文音频描述集翻译成 33 个语言。

其中 11 个印度语言用专用英印模型,其余 22 个语言用 Aya 模型。翻译质量用回译的 spBLEU 和 chrF++ 分数加人工抽查说明,但未经大规模人工校验。生成评测把 30000 条英文图像描述翻译成 9 个语言,用 FID 和 IS 共 2 个指标。

图像生成条件固定为 512 x 512 分辨率,推理步数为 10,引导系数为 3.5,种子固定。基线分 3 类:英文多模态模型、已有多语言多模态模型、本文对齐后的模型。对齐模型记为多模态乘多语言的形式,例如图像模型乘多语言编码器。

检索指标统一用余弦排序的 Recall@10,方向是越高越好。比较时要注意语言覆盖不同,有些基线只支持部分语言,原文同时报告全语言平均和支持语言平均。合成评测集的许可证沿用源数据集的非商业等条款,翻译模型的许可证也需一并遵守。

主结果在哪些条件下成立,差距在哪里?

在 11 个语言的图像检索上,最好的对齐模型英文表现与英文基线持平,11 个语言平均保持在较高水平,其中 10 个语言为未见语言。在 4 个语言集上对齐模型保持相近水平,在 36 个语言的大库上检索库扩大到 3600 张图和约 7000 条描述,难度本身上升。

音频检索上,对齐模型在 2 个音频集上低于英文基线。生成上,多语言平均 IS 达到较高水平,但 FID 差于完整生成模型,因为本文只替换了 CLIP 编码器而给 T5 编码器喂通用提示。定性上,非英文提示仍能生成语义相关的巴士和山湖等图像,只是物体缺失更多。

文本到图像检索 × 文本到音频检索: 文本到图像检索负责检验映射后文本能否在图像库中找回正确图片,文本到音频检索负责检验同一思路能否在音频库中找回正确音频,二者搭配的理由是图像和音频的多模态空间结构不同而可以检验模态无关性,组合意义是证明英文锚定不只适用于某一种多模态编码器。

主结果的数字需要与基线放在同一指标下核对,下表只用原文连续句覆盖关键数字,不引入新计算,指标都是 Recall@10。表前的问题是:在冻结条件下,对齐模型能否在保持英文的同时实现多语言转移,公平条件是同一检索协议和同一多语言测试集。

条件指标英文数值多语言平均代价说明
XTD 文本到图像Recall@1094.9%89.5%覆盖 11 languages, 10 unseen
XTD 文本到图像语言数英文11 languages10 unseen 为零样本转移

该表显示英文为 94.9% 而 11 个语言平均为 89.5%,其中 10 个语言为未见语言。收益是英文性能保持的同时未见语言平均仍接近 90%,代价是这仍是合成翻译评测而非人工校验的多语言图文对,且大库上的难度更大。未胜出项是与大规模多语言多模态预训练模型相比仍有几个百分点的差距。

数据效率的数字同样需要单独核对,条件是同一最优配置,只改变训练句数,指标方向越高越好。

配置训练句数指标数值解释
最优 2 层配置1,000 English sentencesAvg. Recall@1085.8%小数据已可用
最优 2 层配置250K 到 2MAvg. Recall@10增益饱和继续堆量收益很小

该表显示只用 1000 句英文就能超过 85.8%,说明英文锚定的样本效率很高。但从 250K 到 2M 几乎不涨,说明继续堆英文文本不是主要矛盾。未评测的边界是低资源语言的真实人工描述,合成翻译可能高估了一致性。

音频与生成侧的差距需要与编码器本身的能力对照,条件是同一多语言编码器在图像描述与音频描述上的表现。

条件指标AudioCaps 数值Clotho 与生成数值解释
文本到音频Recall@10 差距6%2.3%低于英文基线
文本到文本T2T Recall@1073.8%80.2%编码器本身偏弱
生成质量Inception Score31.8135.9±0.57多语言平均与英文
生成保真FID43.4 (FLUX×M-MPNET)23.4差于完整模型

该表显示音频差距部分来自多语言编码器本身对音频描述的编码弱于图像描述,前者在文本到文本上明显低于通用音频文本模型。生成侧 IS 显示图像多样性尚可,但 FID 显示文本保真度差,原因是生成模型重度依赖另一编码器的词符条件。定性例子显示查询与召回音频的描述语义接近,只是真值排名靠后。

对齐前后的分布变化是判断搬运是否成功的直接证据,形状表示视觉簇而颜色表示语言,混合程度表示跨语言进入同一邻域的程度。

看图路径: 1. 先对比上图对齐前红色英文多模态点是否集中在顶部;2. 再看下图对齐后红点是否分散进入各视觉簇;3. 检查同一图片标注框周围是否出现多种颜色的多语言点

原论文 Figure 4:t-SNE visualization (perplexity = 32) of text embeddings before and after alignment.

论文图 4。原论文 Figure 4:“t-SNE visualization (perplexity = 32) of text embeddings before and after alignment.”。

上半对齐前红色多模态英文点集中在顶部而与其他多语言点分离,下半对齐后红点与多色多语言点混合在斑马、甜甜圈和建筑等图片标注周围。图注说明困惑度为 32,先按图像聚类再采样以避免语言偏置。结合权重分析,这不是简单的整体平移,而是几何重塑,但属于有限解释而非因果证明。

权重、超参数和层数哪一个真正重要?

超参数实验显示增大对齐权重而减小结构权重带来持续增益,最优点在 48 比 1 附近。等权重比最优点低约 0.5 个百分点,说明逐点对齐比结构约束更重要。

层数实验显示 1 层、2 层和 4 层差异很小,无残差略好,说明映射的表达能力已经饱和。损失实验显示均方误差优于相似损失,更明显优于 L1 损失。权重分析进一步指出有效矩阵的秩约 204,明显低于 768 维。

下面这张消融表比较了不同损失、层数和残差的效果,指标是 Recall@10,方向越高越好。表前的问题是:在冻结条件下,哪种训练目标和多大的映射最划算,公平条件是同一对编码器和同一英文训练集。

MSE288.789.295.3
λ1Lalign + β1Lstr289.489.695.2
Similarity Loss288.789.295.7
L1283.985.695

该表显示本文的加权损失在 2 层无残差时取得最优,改变层数或加残差影响很小。未胜出项是 L1 损失和等权重的组合,它们在 2 个检索方向都更低。反例是层数加到 4 层并未继续提升,说明容量不是瓶颈。

近义句实验用 8 组仅措辞不同的句子簇,比较 3 种向量的成对余弦距离。多模态英文向量变化最大,多语言向量最紧凑,映射后居中。这一组证据共同支持了几何重塑而非简单旋转的判断,但原文用可能性的措辞表达,复现时不应把它当成已证明的结论。失败条件是生成任务去掉归一化和结构项反而更好,说明检索最优不等于生成最优。

哪些边界没有测,哪些结论不能推广?

第 1 个边界是只对齐全局句子向量,没有对齐词符级别表示。因此不能直接扩展到依赖细粒度表示的多模态大语言模型,原文在局限中明确承认这一点。

第 2 个边界是只验证了双编码器结构,联合编码器的多模态表示是否同样适用尚未探索。第 3 个边界是多语言音频和生成评测集是合成翻译,未经人工校验。客观的回译分数不能替代人工判断,某些误差可能留在评测中。

第 4 个边界是偏置风险。英文多模态模型的性别和种族等偏置可能通过英文锚定传递到多语言模型,而低资源语言的偏置检测工作很少。总体趋势不等于每组都成立,例如大库检索、小语种和音频描述等子条件的差距更大。

全局句子表示 × 局部词符表示: 全局句子表示负责把整句压缩为一个向量用于检索和生成条件,局部词符表示负责保留每个词的位置和细粒度语义用于大语言模型生成,二者搭配的困难在于本文只对齐了前者而没有对齐后者,组合意义是解释了为何检索很强而生成保真度和多模态大模型扩展仍受限。

这组概念解释了为何本文在检索上很强而在生成和大模型上受限。全局对齐解决了跨语言的入口问题,但生成和问答还需要词级别的对应,这是未来自然的方向,而不是本文已解决的部分。未测量延迟、推理开销和误判率,因此不能承诺这些量得到改善。

复现先做什么,需要哪些信息条件?

先准备冻结的英文多模态模型和多语言文本编码器,确认两者支持的语言表。避免把不支持的语言计入平均,需要区分全语言平均和支持语言平均。

接着准备与任务语义一致的英文文本训练集,图像用描述句,音频用音频描述句,生成用与生成模型训练语义接近的描述句。映射实现为 2 个线性层,无残差,损失用加权均方误差加结构项。检索时在归一化向量上计算,生成时去掉归一化和结构项。

优化按原文的学习率、批量、轮数和验证方式启动,先用 1000 到 5000 句验证流程,再扩大到 250K 句。评测时固定余弦排序和 Recall@10,生成时固定分辨率、步数、引导系数和种子。

代码和检查点据称公开,但本文只确认第三方工具链接当前可用,论文自身的代码与数据集链接需要读者本次核对可达性。许可证方面,多个基线模型分别使用宽松开源、非商业或研究许可,合成数据集沿用源数据的非商业等条款,组合使用时必须同时遵守。

何时值得尝试这种英文锚定,还需补哪项验证?

当已有很强的英文多模态模型和很强的多语言文本编码器,但没有多语言多模态对时,这种方法值得优先尝试。它只训练很少的参数,只用英文文本,适合快速把英文检索能力扩展到多语言。

适用条件是下游查询的语义与训练英文文本的语义一致,否则锚定可能偏离。不适用的是需要词级别生成的系统,此时应先补词符对齐的验证。还需要补的验证包括人工校验的多语言音频和生成评测、更大检索库下的分语言分析,以及偏置在跨语言传递中的测量。

多语言生成的直观印象需要与定量指标对照,同一提示在不同语言下的输出是否保持主体一致是关键观察点。

看图路径: 1. 先比较第 1 行英文基线与第 2 行多语言生成的街道和车辆主体;2. 再看不同语言字幕下红色巴士的朝向和位置是否一致;3. 注意背景行人与建筑细节的差异而非只看整体风格

原论文 Figure 5:Images generated by FLUX text-to-image model using the prompt “The city bus is traveling down the…

论文图 5。原论文 Figure 5:“Images generated by FLUX text-to-image model using the prompt “The city bus is traveling down the road” in multiple languages (non-English captions shown on images).”。

这张图第 1 行是英文基线,第 2 行是多语言输出,红色巴士、街道透视和人群布局在不同语言下基本保持,说明全局语义搬运成功。但背景细节和车辆朝向仍有差异,结合 FID 较差的定量结果,可以得出多样性尚可而保真不足的综合判断。后续改进应聚焦词符对齐和生成条件的联合设计,而不是继续增大英文文本量。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总