英文题目:Vision-Speech Models: Teaching Speech Models to Converse about Images
会议身份:
conference:cvpr:2026:conference-paper-id:Royer_Vision-Speech_Models_Teaching_Speech_Models_to_Converse_about_Images_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#Adapter #多模态模型 #实时处理 #语音 #音视频交互
评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Amélie Royer:机构信息未能从会议 PDF 纯文本可靠映射
- Moritz Böhle:机构信息未能从会议 PDF 纯文本可靠映射
- Laurent Mazaré:机构信息未能从会议 PDF 纯文本可靠映射
- Neil Zeghidour:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandre Défossez:机构信息未能从会议 PDF 纯文本可靠映射
- Patrick Pérez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以单图与用户语音为输入,由全双工语音对话模型直接生成语音与时间对齐文本回复并支持多轮闲聊,难点在于图声配对稀缺、推理需满足12.5Hz编解码对应的80ms实时阈值且不能丢失语调情感。方法第一步冻结Moshi语音骨干与图像编码器,仅训练每层门控交叉注意力适配器,以语音token为查询、图像嵌入为键值做残差更新并缓存图像键值复用。第二步将上一步适配器的视觉注入与混合批次训练衔接,每批混合大量无声图文与少量带音频样本,利用骨干同时预测文本与音频的特性实现文本到语音迁移。第三步把视觉问答能力接入双智能体合成的口语视觉对话,并拼接无关闲聊前后缀以训练话题切换与门控开关。与直接拼接图像token或三模态联合预训练相比,门控为零时退化为原语音模型,避免占用KV缓存与破坏位置编码。在OCR-VQA任务下,含10%口语样本训练的模型准确率为60.7%,高于无音频样本条件的准确率36.8%。其适用边界受限于评测多为合成语音复述的单轮问答与人工拼接切换,对真实交互与长上下文尚未验证。训练成本为视觉对话模型50k步批量64在8卡H100上约一天,推理开销在L4上每步仅增加7ms延迟,总计51ms仍在实时阈值内。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文的输入是一张图像加一段持续的语音对话,目标是让语音模型直接开口谈论图像内容,同时保留随时打断、带语气和低延迟的对话能力。输出是助手的文本流与音频流,两者在时间上对齐,文本决定说什么,音频决定怎么说。读者读完应当能复述三件事:第一,视觉信息从哪里进来,如何做到主干冻结;第二,无声图文样本与少量语音样本如何混批训练;第三,门控与拼接对话如何帮助在聊图与聊闲天之间切换。
方法只用原文给出的结构与流程,不引入外部实现猜测。例子仅为教学:比如用户指着猫的照片问桌上有什么,模型应结合图像回答并继续对话,而不是只朗读一段描述文本。本文不声称代码、模型或数据当前已公开,原文仅说推理代码与评测集将在接收后发布,因此复现部分只按论文文字整理条件。
视觉语言模型与语音模型各解决了什么,还缺什么?
视觉语言模型要解决的是把图像与文本对齐,让大语言模型的推理能力可用于描述、问答和读字。常用路线有两类:一类是把图像词元直接拼进语言模型输入序列,另一类是用交叉注意力把图像作为键值注入。前者直观但占用键值缓存,改动位置编码与训练流程较多;后者对主干改动小,便于冻结主干只训练适配层。本文选择后者,理由在原文写得很实际:避免图像词元挤占对话上下文,避免破坏预训练语音模型的流式结构。
语音侧的朴素做法是级联,也就是语音转文字再调视觉语言模型,回答再转语音。原文指出这种级联会带来可感知的延迟,丢失用户语气与情绪,并且强制轮流发言。另一类做法是从头联合预训练图像、文本和音频,但需要精心设计多阶段流程与数据配比。MoshiVis 走的是第 3 条路:拿已经会实时对话的 Moshi 语音模型做主干,只加轻量视觉适配。
这样研究问题就收窄为如何在不重训主干、不收集海量图像语音对的前提下,把视觉能力迁移到语音令牌上,并保证能随时切回无关话题。
同输入同目标下,轻量适配与从头全模态训练怎么选?
若输入同为图像加语音、目标同为实时对话,原文对照了 3 条路线。级联路线实现最快,但延迟与韵律丢失是已知缺陷,适合对实时与语气不敏感的问答。联合预训练路线天花板可能更高,能统一文本、音频与图像的表示,但需要多阶段流程与大量配比数据,复现成本高。轻量适配路线如 MoshiVis,优点是单阶段、只训练适配层、能直接复用现有图文数据与少量语音,缺点是受限于原语音主干的文本分布与音频码本,零语音时音质差,全语音时文本提问差。
原文的跨任务实验还显示音频迁移强于文本迁移,这支持在数据有限时优先保证关键任务有语音样本,而不是平均分配。从运行阶段看,交叉注意力加缓存更适合长对话,而直接拼图像词元更适合短单轮高精度任务。选择时应按约束选:要快速验证新视觉任务先用无声加少量语音的适配;要产品级音质与打断,再补真实对话语音与切换数据。
为什么语音看图比图文看图难三件事?
第一件难是数据。图像加文本有大量问答、描述和推理数据,图像加语音的公开配对很少,多为描述的朗读,覆盖不了多轮对话、误导性问题和语气变化。如果只靠合成语音,生成全部视觉任务与全部语音属性的成本会迅速膨胀。第二件难是实时。语音对话每步都要在音频帧间隔内吐出文本与音频,图像不能每步重算,也不能让显存被图像键值占满,否则长对话会被截断。
第三件难是保真与切换。模型既要保持原语音模型的音质与韵律,又要在同一段对话里判断当前这句话是否与图像有关。文本模型可以靠显式问题判断,语音模型面对的是连续音频流与填充词元,更容易被无关图像或无关历史拽偏。原文把这三难分别对应到 3 个设计:用无声数据加少量语音的混合训练解决数据,用可缓存且跨层共享的交叉注意力解决实时,用门控加拼接无关对话解决切换。理解这个对应关系,后面每个实验才知道在测哪一难。
MoshiVis 全景:一个样本如何从图像和声音走到回答?
先沿一个样本走全程。输入侧有两路:图像经过 PaliGemma 第二阶段的图像编码器变成一组图像词元;对话经过 Moshi 编码变成 3 流,分别是用户音频流、助手音频流和助手文本流,其中文本流带有为对齐语音而插入的填充词元。3 流按时间相加得到语音令牌,送入约 7B 的解码器主干。主干每层在自注意力之后插入视觉交叉注意力,以语音令牌为查询,以图像词元为键值,输出再经门控加权后残差加回。
主干输出一路直接解码文本词元,另一路经过小的深度变换器自回归生成多层音频码本,再解成音频帧。这样文本与音频在时间上保持对齐,支持全双工。训练时冻结图像编码器与语音主干,只训练适配层。推理时图像键值只计算 1 次并缓存,后续语音步直接复用。
全双工对话 × 实时延迟: 全双工对话分工是随时能听和随时能说,不需要外部信号指定轮次,由 Moshi 的流式文本加音频联合预测支撑;实时延迟分工是每步推理必须在音频编解码器帧间隔内完成。搭配原因是视觉增强不能堵塞流式通路,组合意义是图像键值只算 1 次并缓存,跨层共享投影以控制显存和步延迟。
下面这张总览图把上述冻结与可训练、求和与分流画在了一起,读图时先抓主路径再看视觉侧路。
看图路径: 1. 先从左下输入三流相加符号走到中间语音主干,再看顶部图像编码器分叉到各层;2. 对比橙色可训练的交叉注意力与门模块和带雪花标记的冻结模块;3. 跟踪右侧深度变换器分出文本与音频两路输出的箭头
论文图 1。原论文 Figure 1:“MoshiVis is a Vision-Speech model (VSM) able to hold full duplex real-time conversations about an image, and trained with a light data- and compute- budget.”。
这张图左侧下方是用户加助手的输入流汇总,中间绿色到蓝色的大块是冻结的语音主干,顶部橙色是冻结的图像编码器,中间两组橙色小块是可训练的交叉注意力与门,右侧蓝色小块是音频深度变换器。绿色文本输出与蓝色音频输出在右下汇合为同一时刻的回答。结合像素可见,门模块画在交叉注意力下方并回注主干,说明视觉是逐层残差注入而非替换输入。图像到各层的线是同一组编码的广播,这与后文跨层共享投影、1 次缓存的设计一致。
门控交叉注意力在每一层做了什么计算?
组件按原文可分 4 步。第一步是残差自注意力,输入语音令牌先做自身注意力与残差相加,保持原对话建模不变。第二步是交叉注意力,查询来自上一步输出,键值来自图像编码,得到视觉条件向量。第三步是门控,两层多层感知机把隐藏维度压缩到八分之一,再经 Sigmoid 输出零到一之间的权重,直观理解是每层每个位置的视觉阀门。第 4 步是门控残差更新,把视觉向量乘门权重后再加回语音流。
门全零时精确恢复原主干行为,这是原文强调的性质,也是切换能力的结构基础。原文还做了参数共享选择:交叉注意力的查询键值投影跨层共享,输入归一化不共享;门的参数默认不共享。共享的动机是减少图像键值缓存的显存占用,因为键值只与图像有关而与语音时间无关。训练时只更新这些适配参数,总量约 206M,梯度不进入主干与图像编码器。
语音令牌 × 交叉注意力: 语音令牌负责把助手文本流与助手和用户音频流按时间对齐后相加,保留对话的语义与声学节奏;交叉注意力负责以语音令牌为查询、以图像编码为键值,把视觉信息以残差写入每一层。二者搭配的原因是语音主干不必改词表和位置编码,只在自注意力与前馈之间开一个视觉侧路,组合意义是冻结主干也能获得图像条件生成。
门控 × 上下文切换: 门控分工是对每层交叉注意力输出做 0 到 1 的加权,由两层 MLP 加 Sigmoid 从跨模态输出算出;上下文切换分工是要求模型在聊图与聊一般话题之间来回转而不被无关图像或无关历史带偏。搭配原因是直接加视觉残差会常驻干扰,组合意义是门输出为零时精确回到原语音主干,门打开时才放行图像信息。
需要提醒初学者:门控不是在输入端做硬开关选择用图还是不用图,而是在每层输出端做软加权。它的输入是跨模态融合后的向量,因此能利用当前语音上下文判断图像是否相关,但原文没有给出门值的解析式以外的额外监督,门行为完全由下游任务损失与拼接数据驱动。
无声图文与少量语音如何混批,合成对话如何构造?
训练是单阶段微调适配层,每批按比例混合两种样本。语音样本是分布内样本:用户只有音频,助手有文本与音频,文本含对齐填充,音频用残差码本表示,实际训练时只训练前两路音频流以减少对音频解码器的并行调用。无声样本只有标准文本,没有音频信息,用户问题也以文本给出,文本没有对齐填充。两类样本都经过同样的主干加视觉适配,只是无声样本退化为普通文本变换器加适配。原文假设是尽管语音令牌是文本加音频之和且含填充,文本流的弱监督仍能把视觉映射迁移到语音侧。混合比例记为语音占比,单任务实验扫描从 0% 到 100%,双任务实验再乘任务比例。
无声样本 × 语音样本: 无声样本分工是提供大规模图像加文本监督,覆盖问答、描述和读字等视觉任务;语音样本分工是提供用户音频加助手文本与音频对齐流,恢复真实推理时的分布。搭配理由是纯语音视觉对话数据稀缺且合成成本高,组合意义是用少量语音把文本学到的视觉映射迁移到带填充和音频叠加的语音令牌上。
下面这张前向图把两种样本的差异画得很清楚,左边多流求和加音频解码,右边单文本直通。
看图路径: 1. 先看左侧语音样本的三条蓝色音频加绿色文本如何经求和进入主干;2. 再看右侧无声样本只有绿色文本直连主干的简化路径;3. 注意左侧上方音频深度变换器分出的多路音频码本
论文图 2。原论文 Figure 2:“MoshiVis forward pass during mixed data training.”。
从像素看,左侧上方蓝色长条是多层音频流,绿色短条是带下划线填充的助手文本,三者经求和符号进入中间语音主干,主干上方点缀橙色视觉适配,输出再分到右侧蓝色音频与绿色文本。右侧无声路径只有绿色文本进出,主干同样带橙色适配,说明适配层对两种模态共享。读图时不要把左侧波形当成额外监督,它只是示意音频存在。 合成对话分两步。
先用两个 Mistral-Nemo 分别扮演用户与助手,共用同一张图像的文本描述作为共享知识,从一个宽泛的全局提问开始,再按随机指令继续 8 到 16 轮,指令覆盖全局内容、细粒度位置属性和不存在物体的误导性问题。生成文本对话后用开放文本转语音模型转成音频。再做拼接增强:每段视觉对话以概率与随机无关对话前缀和后缀拼在一起,3 段各自随机截断,模拟不同长度的进入与离开。高质量视觉对话用 PixMo 与 DOCCI 的人工描述做提示,无关性更强的部分用 PixelProse 的模型生成描述。
合成视觉对话 × 拼接增强: 合成视觉对话分工是制造 8 到 16 轮的自然问答,覆盖全局描述、细节定位和误导性问题;拼接增强分工是以概率把一段视觉对话与随机无关对话前缀和后缀拼在一起并随机截断。搭配原因是标准视觉问答都是一问一答,组合意义是让训练分布本身包含话题进入与离开,配合门控学习何时看图何时忽略图。
复现时要注意原文未报告的缺项:文本转语音的具体说话人、采样率与切分方式未在正文细节中给出,无声与语音损失权重是否等权也未明确,只能按同批同任务损失理解。
在什么数据、什么提问方式、什么指标下评测?
主干固定为 Moshi 语音模型与 PaliGemma 第二阶段视觉编码器,两者冻结,只训练适配层。评测覆盖 3 类视觉任务:COCO 描述用 CIDEr,OCR-VQA 读字问答用准确率,VQAv2 通用问答用准确率。每个任务都做两种提问:文本提问与语音提问,语音提问是用同一文本转语音模型把基准转成语音,预测直接取 Moshi 伴随语音生成的文本词元,解码用贪心,COCO 参考线用束搜索的微调 PaliGemma。音频质量用 MOSNet 在约 40 秒的随机生成音频上打分,分数越高越好。
上下文切换用人工构造的前缀实验:视觉到非视觉是在 MMLU 问题前拼随机图像对话,测相对原 Moshi 的保持率;非视觉到视觉是在 COCO 问题前拼随机无关讨论,测视觉保持率,前缀长度以问答轮数计量。基线包括同视觉编码器出发的第三阶段微调 PaliGemma,以及 AnyGPT 与 MiniOmni2 等语音加视觉模型在 COCO 语音上的表现,还有 Pixtral 等纯视觉加文本聊天模型作参考。需要强调数值相同不代表指标相同,CIDEr 与准确率不能互比,文本评测与语音评测的条件也不同,语音评测多了合成发音与标点丢失的影响。
加多少语音才能既看懂图又保住声音?
核心问题是语音占比如何影响视觉理解与音质。先看极端:语音占比为零时只用无声训练,语音提问下仍明显高于随机,OCR-VQA 为 38.5%,VQAv2 为 49.3%,COCO 的 CIDEr 为 113,说明交叉注意力确实把文本学到的映射带到了语音侧。但此时语音不连贯且 MOSNet 明显低于主干,文本分布偏移的代价落在音频上。加入很少量语音后音质迅速回到主干水平,原文图注强调约 1% 即可恢复,下游精度也随语音占比上升,在约 25% 处达到性能与语音数据量的较好折中,并接近同编码器的微调 PaliGemma。
反向在 100% 语音时文本评测受损,说明纯语音监督不利于文本提问,混合监督有必要。任务不平衡实验进一步显示知识经音频迁移的效果强于经文本迁移,尤其在语音评测与 OCR 这种专业任务上更明显。 下面这组柱状图是上述结论的直接依据,读图先看基准线再看组内对比。
看图路径: 1. 先对照三块面板的纵轴与灰色微调 PaliGemma 虚线基准;2. 再比较每组音频比例下灰色文本评测与彩色语音评测柱高;3. 重点看 100% 音频处文本柱塌陷与 0% 音频处语音柱仍明显高于随机
论文图 4。原论文 Figure 4:“Training MoshiVis with different amounts of audio data on a) OCR-VQA, b) VQAv2, and c) COCO.”。
从像素看,三块面板横轴都是音频比例,纵轴分别是 OCR 准确率、VQA 准确率和 CIDEr,灰柱是文本提问,彩柱是语音提问,顶部虚线是微调 PaliGemma。可见 0% 处彩柱已立起但灰柱更高,中间比例两柱接近虚线,100% 处灰柱在 OCR 与 VQA 上塌陷。COCO 面板横轴多了 1% 与 5% 两档,彩柱爬升更快,这与少量语音恢复音质的叙述一致。 为便于核对,把关键数字与条件整理成表。表前的问题是:在相同冻结主干与相同视觉编码器下,不同语音占比是否同时改变视觉分数与可部署性,指标方向为准确率与 CIDEr 越高越好。
| 条件 | 指标 | 0% 语音 | 25% 语音附近 | 100% 语音现象 | 对照基线 |
|---|---|---|---|---|---|
| OCR-VQA 语音提问 | 准确率 | 38.5% | 接近微调 PaliGemma | 语音好但文本差 | 微调 PaliGemma 贪心 |
| VQAv2 语音提问 | 准确率 | 49.3% | 接近微调 PaliGemma | 语音好但文本差 | 微调 PaliGemma 贪心 |
| 音质恢复 | MOSNet 趋势 | 明显低于主干 | 约 1% 语音恢复到主干 | 保持 | 冻结 Moshi 主干 |
| 折中选择 | 数据效率 | 无语音不可部署 | 25% 为折中 | 语音数据最多 | 同编码器起点 |
表后解释:主要收益是只用 1/4 左右的语音就能在语音提问下逼近全量微调的视觉文本模型,代价是零语音的音频不可用,以及全语音会牺牲文本提问。
未胜出项是纯语音训练,它在文本评测上反而更差,因此不能把语音比例越高越好推广到所有提问方式。边界是语音评测依赖合成语音,真实口音与噪声下的保持率未被该表覆盖。
与直接为描述训练的语音视觉模型相比如何?
原文把 MoshiVis 放在两类参照下看。一类是为描述直接训练的语音加视觉模型,如在 LAION-COCO 上训练的 AnyGPT 基座,另一类是通用聊天模型如 MiniOmni2,以及纯视觉加文本的 Pixtral。表 5 报告 COCO 语音评测的 CIDEr,MoshiVis 用约 55 万 COCO 样本训练,AnyGPT 基座用约 6 亿 LAION-COCO 样本,两者在语音描述上可比,说明轻量微调没有被大体量联合训练拉开很大差距。但必须注意比较条件不一致:训练数据量、词表、解码策略和提示都不同,且聊天模型倾向冗长自然的回答,在要求简洁的 CIDEr 上吃亏。原文因此提醒不要把该表的低分直接读成对话能力差。
支撑判断的数字在表 5 的原文中,限制是该表只测描述一件事,没有测打断、语气保持与多轮追问。为便于核对,把成本与延迟的原文条件整理成表。表前问题是:在冻结主干下视觉增强的可部署代价是什么,指标方向为可训练参数与每步延迟越小越好,公平条件是同 L4 与同图像分辨率。
| 项目 | 数值条件 | 原文结果 | 方向 | 备注 |
|---|---|---|---|---|
| 可训练量 | 冻结主干加编码器 | 206M | 越小越好 | 仅适配层 |
| 推理增量 | L4 加 448 像素 | 7 ms 每步 | 越小越好 | 相对 Moshi |
| 步延迟 | 对话初到 5 分钟 | 51 ms 到 59 ms | 低于 80 ms | 编解码器 12.5 Hz |
| 训练预算 | 视觉对话模型 | 50k 步批量 64 约 1 天 | 越小越好 | 8 卡 H100 |
| 图像词元 | 448 像素 | 1024 词元 | 越小越省显存 | 1 次缓存 |
表后解释:主要收益是训练与推理都轻,冻结策略让下游调参门槛低,图像键值 1 次缓存保证长对话不爆炸。
代价是高分辨率会增加词元与缓存,量化与后端改变延迟,未胜出项是若追求极限精度,全量微调视觉编码器与语言主干仍可能更高,但原文未在同等语音条件下测该选项。
门控与拼接各自为切换贡献了什么,谁不能少?
切换实验同时动结构与数据。结构有三档:无门、有门、门参数跨层共享;数据有两档:拼接概率为零与为 0.5。相对分数以无前缀为 1,前缀越长越考验抗干扰。结果显示两类改进都有效:拼接让训练见过无关前缀,特别在无门时提升明显,有时前缀变长反而更符合训练分布。
门控在拼接为零时提升最大,说明结构本身能抑制常驻视觉干扰,两者叠加时最稳。下游任务精度的消融显示门与共享对单任务分数没有明确胜负,说明门的主要价值不在刷榜而在切换。原文还提到门学到的模式示例放在附录,但正文没有给出门值的阈值与重置时机,因此不能把门零输出当成确定性开关,只能说门为零时数学上回到主干。 下面这张切换曲线是判断依据,读图注意双纵轴不要混淆方向。
看图路径: 1. 先区分左右两块拼接概率面板与蓝色对橙色两组纵轴方向;2. 再沿横轴前缀轮数看三条门控线型的相对分数走势;3. 对比无门虚线在左图蓝色组明显偏低而右图被部分拉回
论文图 5。原论文 Figure 5:“Context Switch Ablation. To assess the impact of data augmentation (left vs.”。
从像素看,左图拼接概率为零,右图为 0.5,横轴是前缀轮数从 0 到 10,蓝色方形线是视觉到非视觉,橙色菱形线是非视觉到视觉,实线、虚线和点线分别对应门控、门共享与无门。左图蓝色点线明显偏低,右图橙色实线随前缀变长上扬,说明数据增强把长前缀变成分内事件。解释时要区分:蓝色保持率下降是图像对话干扰了常识问答,橙色上升是模型学会忽略无关前缀,两者纵轴独立,不能直接比高低。 把对照条件整理成表。
表前问题是:在相同前缀构造下,结构与数据哪个更能保持跨话题分数,指标为相对分数越高越好,公平条件是前缀长度与随机采样方式一致。
| 切换方向 | 结构 | 数据拼接 | 长前缀现象 | 代价或反例 |
|---|---|---|---|---|
| 视觉到非视觉 | 无门 | 0.0 | 蓝线最低且随长度下降 | 常驻视觉干扰常识问答 |
| 视觉到非视觉 | 有门 | 0.0 | 蓝线抬升 | 单任务精度未必最高 |
| 视觉到非视觉 | 有门 | 0.5 | 蓝线更稳 | 需额外无关对话合成 |
| 非视觉到视觉 | 无门 | 0.0 | 橙线偏低 | 长无关历史带偏描述 |
| 非视觉到视觉 | 有门加共享 | 0.5 | 橙线随长度上升 | 共享门未在精度上稳定胜出 |
表后解释:主要收益是门与拼接互补,门解决结构常驻干扰,拼接解决分布外长前缀。
代价是拼接需要额外合成无关对话并调拼接概率,门增加少量参数与解释负担。未胜出项是门参数共享,它在切换曲线上与独立门接近,在精度消融上也无明确趋势,因此不能声称共享一定更好。未评测边界是真实打断与重叠语音下的切换,该实验只用拼接文本对话的前缀模拟。
哪些结论有边界,哪些量没有被测量?
第一,零语音迁移的结论限于视觉理解分数,不含音质。原文明确报告零语音时语音不连贯且 MOSNet 低,因此不能把无声训练说成完全替代语音数据。第二,语音评测的公平性受合成语音限制。标点、大小写和特殊格式在语音中丢失,问答的严格字符串匹配会对语音提问更苛刻,附录讨论了这些细节,正文分数应理解为合成条件下的结果。第三,对话能力主要靠定性视频与受控前缀实验支撑。
长篇大论的聊天模型在 CIDEr 这种要求简洁的指标上天然吃亏,原文也指出低 CIDEr 不等于对话差,因此不要用 COCO 分数直接给对话排序。第四,延迟数字是特定配置下的测量。L4 上 448 像素、1024 图像词元、8 比特量化下每步增加约 7 ms,对话初约 51 ms 每步、5 分钟上下文约 59 ms 每步,低于音频编解码器 12.5 Hz 对应的 80 ms 阈值。换分辨率、量化或后端会改变结论,Mac Mini 的 MLX 后端只说趋势类似,未给出同等数字。
第五,资源状态是本次未能确认可达,论文说代码与评测集将在接收后公开,但没有可验证的链接,因此不能写已公开或可下载。
要复现先做什么,需要哪些超参数与信息条件?
先冻结两件事:Moshi 语音主干与 PaliGemma 第二阶段视觉编码器,只初始化并训练每层的交叉注意力与门,总量约 206M。图像侧用 448 像素对应的约 1024 词元,交叉注意力查询键值投影跨层共享,输入归一化不共享,门默认不共享。训练用单阶段混合批,单任务先扫语音占比,经验起点可设 25%,再按任务比例乘出每批语音量;实际只训练前两路音频流以省解码调用。视觉对话模型训练约 50,000 步、批量 64,在 8 卡 H100 上约 1 天,这是原文报告的预算,可作为时间估计而非精度承诺。
对话合成先准备图像描述,高质量用人工描述,规模扩展可用模型生成描述但要接受幻觉;双模型轮流问答 8 到 16 轮,首问宽泛全局描述,后续随机指令含细节与误导性问题,再经开放文本转语音转音频;拼接增强设 0.5 左右并随机截断 3 段长度。评测先复现文本提问再转语音提问,预测取伴随语音的文本词元,COCO 用 CIDEr,问答用准确率,音质用 MOSNet 在约 40 秒音频上抽查。还需补的验证是真实麦克风下的打断、重叠与噪声,以及门值在长对话中的分布,这些在原文中未被量化。
何时值得尝试这套方法,收束时记住什么?
当你已有可用的语音对话主干,但没有大量图像语音对,同时需要保持低延迟与原音质时,这套方法值得尝试。记住 3 条可复述的操作:冻结主干与图像编码器,在每层自注意力与前馈之间加门控交叉注意力并跨层共享投影;每批混合无声图文与少量语音,先从 25% 语音占比起扫,音质用 MOSNet 抽查约 40 秒生成;用双模型合成 8 到 16 轮视觉对话并以约 0.5 概率拼接无关前缀后缀,门与数据共同解决切换。记住两个反例:零语音只能看懂不能好好说,全语音会损害文本提问。
记住一个评价提醒:不要用 CIDEr 给聊天模型排序,冗长自然的回答在该指标下吃亏,应结合语音评测、切换保持率与真实试听。未验证的推测用可能表达:门值可能学会话题相关性,但阈值与因果关系待验证;视频扩展在原文只是初步尝试,逐帧键值切换的效果待验证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 13 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



