论文解读
不重训语音大模型,用无声图文与门控交叉注意力教它看图说话
MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。
MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。
针对生成式视频谣言跨模态语义一致导致旧数据集失真的问题,该研究构建含声明、视频、音频与跨模态四类操纵的 9049 对 RAVM 数据集并提出证据图检测模型 IEEG,以 75.99% 准确率取得最优但仍显示通用大模型的脆弱性,代价是生成与评测流程复杂且数据集链接当前不可用。
论文把视频会议中的识别崩溃拆成传输失真与人类过度表达两条链路,用 MLD-VC 配对数据与声学分布证据定位到语音增强导致的第一二共振峰上移,并以跨平台微调平均降低 17.5% 字符错误率为收益验证该机制。
针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。