英文题目:Modality-Gated Deep Adapters: Adding a Modality to a Frozen Embedding Model with Exact Preservation
标签:#音频检索 | #Adapter | #对比学习 | #形式化分析 | #多模态学习
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Abdul Basit Tonmoy:机构信息未在 arXiv HTML 中可靠披露
- Kazi Fardinul Hoque:机构信息未在 arXiv HTML 中可靠披露
- Md. Shahrier Islam Arham:机构信息未在 arXiv HTML 中可靠披露
- Arman Luthra:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
冻结嵌入模型新增模态的难点是音频等新输入需在冻结解码器内部获得判别能力,而文本与图像与视频的已存向量必须逐比特不变以保检索索引有效。方法先做模态注入分工:音频由外部声学塔编码经感知重采样连接器写成音频令牌送入基座,热成像则复用基座自带冻结视觉通路送入基座,两路输出都作为各层隐藏状态进入下一步。接着每层瓶颈适配器按降维升维计算增量,只在所属模态门声明的作用域内加回残差流,门关闭时前向钩子直接返回冻结层输出而不执行适配分支。与每输入都执行的低秩适配不同,旧输入执行基座原计算图而保持逐比特一致,且共存包互不可见。在45K AudioCaps受控对比评测协议下,门控适配器rank384的音频到文本R@10为0.665,高于无适配器对照的音频到文本R@10 0.631。该结论的适用边界受限于同一2B基座上音频与热成像双包共存验证,跨基座家族与双门同开输入尚未验证且不在保证内。训练成本为新增约60.6M训练参数约占基座3%,非目标模态推理开销为零而音频编码仍需经过约640M声学塔。
🔗 开源与复现资源
代码相关资源:https://github.com/Eximius-Labs/fusion-embedding — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs/fusion-embedding-2-ember — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文解决什么矛盾?
本文的输入是一个已经部署的多模态嵌入模型,基座是 28 层、隐宽 2048 的解码器嵌入模型,支持文本、图像、视频,输出是可截断的嵌入向量。目标是在不改变该基座任何旧输出的前提下,增加音频模态,随后又增加热成像模态。必须保留的信息包括基座权重字节冻结、旧模态检索索引仍然有效、新增模态的检索性能可测量、训练与验证条件可复述。
对于刚入门的读者,白话是这样:已上线模型的向量被存进检索库,基准成绩和下游系统都依赖这些向量的精确数值。如果用常规低秩适配扩展新模态,文本通路也会被改写,最近邻结构会静默漂移,等于要全量重建索引。冻结大部分参数也不等于行为不变,因为适配分支仍在旧输入上执行。本文要的是计算层面的精确不变,而不是参数层面的近似不变。
本文的输出是一套机制加两份证据。机制是每层挂瓶颈适配器并按输入成分做二进制门控,每个新模态拥有独立包。证据一是音频对照实验与全量复现,证据二是热成像第二模态与双包隔离矩阵。发布物包括音频模型、热成像包、训练评估与不变性测试代码,当前可用状态见复现节给出的官方链接可达性说明。
同输入同目标的已有路线差在哪里?
先说参数高效适配。瓶颈适配器与低秩适配都在冻结模型上加小量可训练增量,但原文指出两者都在每个输入上执行,因此适配后模型在所有输入上都是不同函数。本文的适配器本体沿用瓶颈形式,区别在于门控使旧输入根本不执行分支。
再说冻结主干的多模态嵌入器。最接近的设置是保持文本主干冻结、只训练投影式连接器绑定新模态,这属于用省略实现保持:层内没有新增容量,原空间自然不动,但新模态只能做到浅投影可对齐的程度。另一类经输入侧组合多个模态的方法同样受限于冻结栈能消费什么样的令牌。原文的音频探针直接支持这一判断:层内容量缺失才是瓶颈。
第三类是门控注入与模型扩展。交叉注意力门在初始化为零时与基座恒等,但门参数对所有输入继续训练,训练后即漂移。块扩展同样只在初始化恒等,渐进网络与侧调优虽保持冻结部分精确,但需要任务标签选择通路。本文门控是输入自身的函数,不需要任务标签或路由元数据,且训练后仍然精确,这是与上述路线的关键运行阶段差异。
为什么先怀疑音频编码器,又为什么排除它?
要回答的问题是音频文本检索落后时,瓶颈在外部音频编码器还是在冻结语言模型层内。教学例子是:把声音先变成帧特征,再变成令牌喂给大模型,如果帧特征不够好,换更强的编码器似乎最直接。但该架构拼接的是与特定语言模型协同训练过的令牌分布,外部榜单是在浅投影下测的,两者 readout 不同,不能直接迁移。
原文做了配对探针。两臂数据、步数、配方、连接器完全相同,只换冻结塔:基座自带的音频塔与外部事件编码器。外部浅投影榜单上后者更强,但在冻结大模型拼接内前者显著更高。原文同时说明两塔参数量不匹配,因此该探针只证明外部排名不迁移,不证明单位参数优劣。相邻证据是音频塔在声音事件线性探针中性能随层单调上升到最后一层,说明没有可挖掘的隐藏中间特征。
下图把这种排名反转可视化,左为浅投影榜单,右为冻结拼接内的配对结果,指标与条件不同,需要分开阅读。
看图路径: 1. 先读左图浅投影下四个编码器的高低顺序;2. 再读右图冻结大模型内两个塔的柱高反转;3. 核对纵轴左侧是平均精度右侧是召回并注意量纲不同;4. 确认反转说明外部榜单不能直接指导拼接架构选型
论文图 2。原论文 Figure 2::“The ranking inversion behind Table 1.”。
左图 4 个柱子显示事件编码器在浅投影下高于语音系编码器,右图两个柱子显示基座协同训练塔在冻结拼接内反超。像素可辨的柱顶数值与正文一致,关键不是柱高本身,而是排序反转。由此引出机制选择:容量必须加在层内音频通路上,而不是继续加大输入侧。
门控深层适配器的全景是什么?
沿一个样本走完全程有助于建立依赖。音频样本先经冻结音频塔得到帧,再经 16.4M 感知重采样连接器写成 64 个音频令牌,插入基座输入流占位符位置。文本侧目标向量来自冻结基座并缓存。训练用对称对比损失把音频表示拉向文本空间。推理时文本图像视频编码不打开任何门,音频编码打开音频门,热成像编码打开热成像门。
下图展示单层视角。左路非音频输入的钩子在任何适配器运算前返回冻结层输出,右路音频输入把适配器输出加回残差流。每个新模态携带自己的包与门,共载时互不可见。
看图路径: 1. 先看左侧非音频输入箭头是否绕过适配器直接到输出;2. 再看右侧音频输入处适配器加回残差流的加号位置;3. 对照左右两块面板底部关于门关闭与门打开的文字说明;4. 确认每层都挂适配器而不是只在输入侧加模块
论文图 1。原论文 Figure 1::“One frozen decoder layer with a gated adapter.”。
图中左侧灰色适配器表示未执行,箭头从文本图像视频经冻结解码器层直达输出;右侧橙色适配器表示执行,箭头经加号汇合。底部文字明确门关闭即基座自身计算、门打开即加适配器增量,秩为 384 且零初始化。该图是理解命题一与命题二的视觉锚点,后续公式只是在该图上写出数学形式。
适配器本体如何计算?
术语先白话解释。瓶颈适配器指先把高维隐状态压缩到低秩再扩张回去的小模块,英文为 bottleneck adapter;层归一化指对隐状态做归一化以稳定计算。符号方面,h 表示某层隐状态,W 下与 W 上为降维与升维矩阵,r 为秩,激活为 SiLU。
瓶颈适配器 × 模态门控: 瓶颈适配器负责在每一层提供可训练的音频或热成像处理能力,先降维再升维加回残差流;模态门控负责决定该分支是否执行,音频输入开门、旧模态输入直接返回冻结层输出。二者搭配的理由是只靠适配器会改写所有输入,而只靠门控没有新容量,组合后新增能力只出现在本模态通路上。
该模块的原始计算目标是对音频通路提供层内非线性增量,输入为归一化后隐状态,输出为同维增量。原文明确上投影零初始化,因此第零步增量为零,音频通路等同于无适配器的前任结构。实现上适配器以 fp32 计算再转回流的数据类型,28 层秩 384 时共 44.2M 参数,加上连接器共 60.6M,约占 2B 基座的 3%。
\[A_{\ell}(h)=W^{\mathrm{up}}_{\ell}\,\sigma\!\bigl(W^{\mathrm{down}}_{\ell}\,\mathrm{LN}(h)\bigr),\]上式只定义单层增量如何算出,不包含是否执行。是否执行由下一节的门控决定,训练时也只更新该分支与连接器,基座与音频塔保持冻结。
门控何时打开,如何做到逐位不变?
门控函数 g 以输入成分是否为本模态为取值,不是学到的路由器,也不是任务标签。音频门可由音频令牌存在性加强,热成像门必须由编码入口声明,因为单通道热成像复制为 3 通道后在视觉接口与普通彩图逐字节不可区分。实现上门是深度计数的上下文管理器,适配器由模型包装器拥有而不注册在基座模块下,因此基座参数快照与状态字典保持无适配器。
连接器 × 层内容量: 连接器负责把冻结音频塔输出的帧压缩为 64 个音频令牌并写入基座输入流,分工在输入侧对齐;层内容量负责让冻结解码器各层学会解析这些外来令牌,分工在层内补偿。搭配原因是探针显示只换更强的外部编码器反而下降 16 个召回点,说明瓶颈不在输入侧而在层内,连接器加层内容量才构成完整音频通路。
门控的计算目标是选择残差更新是否发生。g 为 1 时加适配器增量,g 为 0 时保持冻结层输出不变。原文强调不用加零分支实现,因为加零仍会改变计算图并引入浮点疑虑,提前返回才是不执行。
\[h_{\ell}\leftarrow\begin{cases}h_{\ell}+A_{\ell}(h_{\ell})&\text{if }g(x)=1,\\[2.0pt] h_{\ell}&\text{if }g(x)=0.\end{cases}\]命题一说所有门为零的输入执行与发布基座相同的操作序列,因此输出精确相等。命题二说恰有一个门打开时,共载包互不可见,等同于只装该包的模型。原文明确限定双门同开的 1 次前向不在保证内,且已声明模态的序列整体视为新行为,没有基座对应物可回归。
多包与初始化恒等如何配合?
多包指音频包与热成像包各自拥有整栈适配器与独立门,共享同一组冻结层但注册各自钩子。单门排他性是多包的运行契约:部署混合流量时音频编码只开音频门,热成像编码只开热成像门,文本图像视频不开门。原文用隔离矩阵做机器验证,热成像开门对照非零证明包非死包。
初始化恒等 × 精确保持: 初始化恒等指上投影零初始化使音频通路在第零步等同于无适配器的前任结构,作用是稳定优化起点且只对所有输入临时成立;精确保持指无包认领的输入直接执行基座原计算图,作用是训练后永久成立。二者搭配使训练从前任模型出发,同时旧模态输出不受后续训练影响。
单门排他性 × 多包共存: 单门排他性指 1 次前向至多一个包的门打开,此时输出等同于只装该包的模型,分工是给出可验证的隔离定义;多包共存指音频包与热成像包同时挂在同一组冻结层上,分工是实现单模型部署。搭配意义在于部署混合流量时音频编码只触发音频包、热成像编码只触发热成像包,文本图像视频触发空门从而复现基座。
初始化恒等与精确保持需要分开记忆。前者在所有输入上临时成立,靠零初始化实现;后者在无包认领输入上永久成立,靠分支不执行实现。训练只触及门控分支是永久性的来源,这也是它强于初始化恒等的两个轴:时间轴上不随训练漂移,路由轴上不需要推理时任务标签。
训练时更新谁,监督从哪里来?
训练只更新连接器与门控适配器,基座解码器与音频塔字节冻结,每次训练后断言基座参数变化最大值恰为零。监督来自音频描述对,文本侧为缓存的冻结文本目标,损失为对称 InfoNCE 并在每个可截断维度上计算,另有轻量协方差惩罚。大规模阶段加入软标签与假负例掩蔽,文本编码器在门打开时直接报错,防止缓存目标被静默适配。
冻结文本目标 × 对称 InfoNCE: 冻结文本目标指对比学习中文本侧向量来自字节冻结的基座并缓存,不参与更新,分工是锚定原语义空间;对称 InfoNCE 指音频到文本与文本到音频 2 个方向的对比损失,分工是把新模态表示拉向该锚定空间。二者组合使音频包只学如何被文本查询到,而不移动文本空间本身。
对照实验训练用 4.5 万音频描述、800 步;全量用 51 万余对、3900 步、有效批量 1024、全语料冻结文本负例库,随后做 400 步域内微调。精度谱系要求训练微调评分一致,混用谱系约损失两点。热成像包用 6 万余张真实热成像加描述文本,同样秩 384 与 3900 步。原文未报告层子集放置、随机初始化适配器与训练态无门控臂,这些缺项在局限节明确列出,不做推测。
评测条件如何划分,什么算有意义的差?
评测分两种协议且不混用。运行内协议是训练任务自带的音频描述重评分,用于配对臂比较;发布协议用基座原生输入模板与 bf16 谱系,在音频描述、零样本声音描述集与跨模态集上测双向召回。声音描述集严格零样本,跨模态集黑名单排除训练摄入,重叠音频编号也被剔除。池大小决定的二项标准误约 1.4 到 1.5,因此原文把单次两点以下读作持平。
对照门实验复制 3 种子,全量预训练对与发布检查点为单次运行。热成像对照用无描述的热成像到可见光孪生检索,接受门预注册为不少于三点。实现细节还包括梯度检查点下门必须横跨前向与反向,否则重算图会静默丢分支,非重入检查点会 loud 报错并有专用测试锁定该失败模式。
编码器探针与门控对照显示什么?
先看探针的公平条件:45K 音频描述、800 步、同配方同连接器,只换冻结塔,指标方向为召回越高越好。下表把两塔在双向召回上的配对结果并列,参数规模与数据步数作为条件列一并给出,避免把不同条件混为同列胜负。
| 条件 | 方向 | Omni 塔值 | Dasheng 值 | 数据与步数 |
|---|---|---|---|---|
| 冻结塔对照 | 音频到文本 R@10 | 0.631 | 0.469 | 45K 与 800 步 |
| 冻结塔对照 | 文本到音频 R@10 | 0.684 | 0.538 | 45K 与 800 步 |
上表显示外部更强的事件编码器在拼接内低约 16 个点,支持容量在消费侧而非生产侧的判断。限制是两塔参数量级不同,原文只主张外部排名不迁移。未胜出项是 Dasheng 臂,它在自身榜单上强但在此架构下落败,这正是需要保留的反例。
再看门控对照的 3 种子复制。问题是固定数据配方连接器与塔时,层内容量是否带来因果增益。下表用同一配方的 3 种子呈现对照与适配器的音频到文本召回及配对增量,文本到音频与首位命中增量作为代价与一致性列。
| 种子配置 | 对照 R@10 | 适配器 R@10 | 音频到文本增量 | 文本到音频与 R@1 增量方向 |
|---|---|---|---|---|
| 种子一配对 | 0.631 | 0.665 | +3.4 | 正向 |
| 种子二配对 | 0.608 | 0.655 | +4.6 | 正向 |
| 种子三配对 | 0.595 | 0.649 | +5.4 | 正向 |
表后解释是增益在每个种子每个方向均为正,发布配置秩 384 的配对是三者中最保守的。秩 128 恢复约两点半,说明增益随秩 scaling 且未饱和。把同量级参数花在连接器加宽上在前任宽度研究中无增益,因此参数位置比数量更重要。全量 11 倍数据下点估计再次出现约 3.4,说明量级在配方成熟后仍存,但全量对在适配器、损失项与语料过滤三轴不同,因果隔离仍以对照表为准。
发布增益与热成像第二模态能否复现?
发布比较的问题是适配器模型相对无适配器前任在发布协议下是否提升可部署方向。下表用全量预训练与发布模型的配对点估计呈现运行内与发布协议的结果,基线为最接近可用的无适配器运行,条件差异在表后说明。
| 评估阶段 | 指标 | 适配器值 | 基线值 | 协议 |
|---|---|---|---|---|
| 全量预训练 | 运行内 R@10 | 0.708 | 0.674 | 同协议重评 |
| 发布 AudioCaps | 音频到文本 R@10 | 0.743 | 0.741 | 发布 bf16 模板 |
| 发布多集 | 文本到音频 R@10 多格 | 提升约两到三点 | 前任基线 | 零样本与跨模态 |
表后需要同时讲收益与代价。收益是文本到音频每格点估计提升,跨模态首位命中也有约五点;代价是描述集上音频到文本首位命中让出约两到三点,且音频到文本 R@10 在发布集上为统计持平。原文明确 specialist 双塔在域内首位命中仍领先,因为对方双塔都训练且只服务 1 对模态,本文保留的是文本图像视频逐位不变,这是对方不提供的。
热成像探针复制音频逻辑但换注入路线:经基座自身冻结视觉通路进入,门必须由入口声明。下表呈现无描述探针与发布包的配对结果,接受门为三点,实际清除约 7 倍。
| 热成像任务 | 冻结基座值 | 热成像包值 | 种子一致性 | 说明 |
|---|---|---|---|---|
| 孪生检索 R@10 探针 | 0.165 | 0.385 与 0.388 与 0.390 | 3 种子全过 | 无描述 |
| 描述检索 R@10 发布 | 0.224 | 0.777 至 0.785 | 3 种子全过 | 有描述 |
| 零样本分类准确率 | 95.4 | 94.1 与 94.3 与 91.8 | 一到四点波动 | 门开读数非保持保证 |
表后解释是描述丰富度同时影响域内与跨域迁移,短类名描述域内仅约五成九且跨域跌破冻结基线,而完整描述保持迁移。该节的未评测边界是双包以上共载未测量,跨基座家族迁移未验证。
精确不变的边界与未做消融有哪些?
精确不变的范围需要精确表述。它覆盖无包认领的输入,在固定推理配置下逐位相等,跨核或跨硬件时继承基座本身的确定性。已声明模态的序列整体是新行为,包括其中的文本令牌,没有基座对应物。双门同开的 1 次前向在命题外且未测试,正常编码入口不会触发。
下表把保持验证归纳为可执行检查,零为精确零而非容差,非零对照证明包活跃。
| 读数 | 门状态 | 最大绝对差 | 结论 |
|---|---|---|---|
| 文本图像视频 | 无门打开 | 0 | 逐位复现基座 |
| 音频经发布与注册双路径 | 音频门打开 | 0 | 路径一致 |
| 热成像对照 | 热成像门打开相对基座 | 0.10 | 包活跃非死包 |
表后说明每次训练的基座漂移断言为零,文本前向门关闭单元测试为零,发布烟雾测试在挂钩与摘钩下要求文本图像逐位相等,梯度只到达适配器与连接器。未做消融包括层子集放置、非零随机初始化、训练态无门控臂与多种子全量复现,秩扫描与微调长度是已有消融。音频上限受冻结 2B 语言模型消费音频令牌能力约束,这是已报告的天花板而非实现失误。
复现先做什么,需要哪些工件与检查?
先按学习依赖准备基座与数据。基座为冻结的 2B 解码器嵌入模型与冻结音频塔,音频数据用音频描述子集做 800 步对照,热成像用无描述孪生检索做 800 步探针,随机种子需进入训练恢复键并固定数据洗牌。连接器为感知重采样、内宽 384、64 查询、6 块,适配器为秩 384、SiLU、先归一化、上投影零初始化、fp32 计算。
再跑不变性测试。单元测试编码相同文本比较基座与挂钩模型,要求最大绝对差为零;发布烟雾测试经公开加载路径对文本图像做挂钩与摘钩 2 次嵌入,要求逐位相等;训练循环后断言基座漂移为零;另需验证门横跨梯度检查点重算,否则应 loud 报错。文本编码在门打开时应立即报错,视觉嵌入同理在发布推理侧受保护。
工件方面,资源状态是正文开源声明的唯一依据。本次收到的资源状态显示代码仓库与 2 个模型链接当前可用,状态码均为 200,可写当前可用。官方地址为代码库与组织页下的音频预览与热成像包,具体链接见原文结论段。复现时应锁定音频检查点修订与 bf16 原生模板谱系,不混用 4 比特谱系,单次两点以下按持平阅读。
何时值得尝试,何时不值得?
当嵌入模型已部署且重建索引成本高,又必须增加新模态时,该门控层内容量值得尝试,因为它把旧行为保持从经验观察变为可验证的计算属性。复现顺序应是先跑零对照的烟雾测试确认旧输出逐位不变,再跑小数据配对门实验确认新模态增益,最后再扩展到全量与第二模态。
当目标只是在单对模态上刷到最高召回,或基座家族不同且无预算重验时,不值得直接套用本文数字,因为 specialist 双塔仍领先且本文所有结果来自同一 2B 基座。还需补的验证是三包以上共载、其他基座家族、层子集放置与训练态无门控臂。教学上最易误解的是把冻结参数等同于输出不变,本文的区分是参数不变弱、计算不变强,门不执行才是保证的来源。
📎 论文与评分元数据
排名:前25% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

