英文题目:Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

会议身份:conference:interspeech:2026:conference-paper-id:mousi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #鲁棒性 #多语言 #音视频问答

评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 1.0/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Basel Mousi:机构信息未能从会议 PDF 纯文本可靠映射
  • Fahim Dalvi:机构信息未能从会议 PDF 纯文本可靠映射
  • Shammur Absar Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
  • Firoj Alam:机构信息未能从会议 PDF 纯文本可靠映射
  • Nadir Durrani:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为文化相关图像叠加英语或阿拉伯语文本或语音陈述,输出为该陈述是否被图像视觉支持的真假判断,难点在于等义输入跨模态与跨语言切换时仍需保持一致的对比判别。方法链分三步:首先从18个中东与北非国家图像库经图像盲过滤构建最小对比三元组,每图对应1个支持陈述Q+与2个貌似合理但不支持的Q-,为下一步提供语义匹配的竞争集;接着将英文陈述直译为阿拉伯语并用零样本合成生成男女声语音及加噪混响版本,保持词义不变进入语音评测;最后以三元组为单位判定全对一致性并用条件指标对比不稳定性CI隔离部分成功中的碎片失败。与已有聚合准确率评估相比,该机制差异在于条件化三元组一致性而非孤立正确率,因而能暴露高F1下的判别崩解。在10150三元组基准下,Qwen2.5-Omni-3B阿拉伯语语音输入的CI指标为0.71,高于文本输入的CI指标0.43。结论适用于中东与北非文化视觉主题及受控合成语音,尚不能外推至真实口语、自发韵律与开放问答。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么:语音助手为何要做看图判断?

这篇论文的输入是图像加一句话,输出是对这句话判真或判假。图像来自覆盖 18 个中东北非国家的文化场景,包括建筑、传统服饰、饮食、宗教场所和公共空间。句子是关于图像内容的陈述,例如图像显示某国的国兽。目标不是描述图像,也不是转写语音,而是 grounded 决策:判断语言陈述是否被视觉证据支持。学习依赖上,研究生需要先理解多模态大模型越来越多经由语音接口被使用,语音查询在语义上与文本查询等价时,理想行为应给出相同的视觉判断。

论文要检验的正是这个等价性是否成立。必须保留的关键信息是:每个图像配一个受支持陈述和两个看似合理但不受支持的替代,形成三元组;评测覆盖英文与阿拉伯语的文本与语音;模型包括 Qwen2.5-Omni 3B 与 7B、Qwen3-Omni 30B 与 Phi-4-multimodal-instruct。输出是三元组级别的一致性,而不只是单句正确率。

本文按任务与相关路线、方法全景、组件与计算、构造与推理、实验条件、结果与反证、复现与收束的顺序展开,所有事实只来自原文证据。

已有路线查了什么,还缺哪一块拼图?

已有工作可按同输入、同目标、同监督来对照。第一类是语音系统的幻觉研究,关注语音到文本通道内的流畅但弱 grounding 的转写、在分布偏移下幻觉增多,这与本文同为语音输入,但目标不同,本文目标是图像 grounding 决策是否跨模态一致,而非转写正确。第二类是音视频大模型的跨模态 grounding 失败,例如忽略音频依赖视觉先验,这与本文同为跨模态,但运行阶段和任务不同,本文是同一语义经文本与语音两种路径进入后与同一图像比较。

第三类是多模态评测基准如 MME、SEED-Bench 与 Hal-Eval,它们评测多任务正确性,但主要报告独立样本表现而非决策相干性;行为测试路线如 CheckList 与 contrast sets 强调局部决策边界,本文继承了这一思想。第四类是多语言文化基准,指出语言与地域变化会影响视觉 grounding,但没有检验语义等价输入经文本与语音交付是否一致。缺口正在于此:没有公开数据集支持在图像 grounding 下同时跨文本与语音、阿拉伯语与英语做对比评测。

本文的增量是构造文化 grounding 的三元组语音增强基准,并引入条件性三元组指标,把碎片化推理与完全失败分开。

问题如何形式化:什么算一致,什么算不稳定?

问题形式化为:给定图像与 3 个最小对比陈述,模型逐个输出真或假。一号陈述为视觉支持的 Q+,应接受;二号与三号为视觉不支持的 Q-1 与 Q-2,应拒绝。只有 3 个全对才算完全一致,对应三元组准确率。但三元组准确率下降有两种成因:3 个全错的完全失败,以及对一部分但错另一部分的碎片化。

为此论文定义对比不稳定性,用至少答对一个的三元组数为分母,其中未能全对的数为分子。公式含义是 CI 等于 1 减去部分成功中完全一致所占比例。条件化的作用是隔离碎片化:2 个模型三元组准确率相同,若一个多为全错、另一个多为部分对,则后者 CI 更高,诊断为决策边界不稳定。教学例子是:模型孤立看 Q+ 说真,孤立看 Q- 也说真,单句准确率各算对一半,但放在一起看就是自相矛盾,聚合指标掩盖了这种不一致。

论文要回答的研究问题包括 CI 是否提供 Q+ 与 Q- 之外信息、文本与语音稳定性差异、语言差异、规模效应、声学退化鲁棒性,以及联合语音文本是否缓解。

方法全景:一个样本如何走完输入到输出?

沿一个样本走完全程有助于建立依赖。输入是一张羚羊群图像与 3 个英文陈述。表示阶段先经由多选题构造与图像盲过滤,只保留必须看图才能回答的题目,再把正确选项改写为独立的 Q+ 陈述、两个干扰选项改写为 Q- 陈述,三者仅在细粒度视觉或文化属性上不同。组件阶段包括跨语言与跨模态扩展:英文陈述经内部机器翻译系统逐句译为阿拉伯语,保持陈述结构与 Q+ 与 Q- 关系。

再经零样本神经语音合成生成英文与阿拉伯语的男声与女声版本,词内容与原文严格相同,不做改写,以保证语音是保模态变换。目标阶段是让模型在图像条件下对每个陈述输出受控格式的真或假判断。输出阶段按三元组聚合,计算 Q+ 正确率、Q- 正确率、F1 与 CI。推理时任务指令保持文本形式,只切换待判陈述是文本还是音频,以控制比较条件。声学压力测试进一步在合成语音上叠加非平稳背景噪声与合成混响,模拟真实物理环境。

视觉支持陈述 × 视觉不支持替代: 视觉支持陈述指与图像内容一致应判为真的 Q+,负责锚定正确 grounding;视觉不支持替代指同主题但与图像细节矛盾应判为假的两个 Q-,负责制造最小语义竞争。二者搭配的理由是孤立答对 Q+ 不能证明模型做了区分,只有在同一图像下同时接受 Q+ 并拒绝两个 Q- 才算连贯判别,组合后形成三元组,使碎片化推理显形。

下面用论文图 1 的例子把最小对比讲具体。该图注给出 3 个句式相同的陈述,只有国名不同,分别是卡塔尔为支持项,摩洛哥与阿尔及利亚为不支持项。导读时请先看图像主体,再看三句话的差异点,最后思考为何必须依赖图像。

看图路径: 1. 先看画面主体是一群白色阿拉伯大羚羊,正对镜头走来,注意长直角与面部黑斑;2. 再对照图注三句话如何只替换国名而保持句式相同;3. 思考为什么仅靠语言先验无法判断卡塔尔还是摩洛哥或阿尔及利亚,必须看图

原论文 Figure 1:Q+ (Ð) The image shows national animal of Qatar.

论文图 1。原论文 Figure 1:“Q+ (Ð) The image shows national animal of Qatar. Q−(Ð) The image shows national animal of Morocco. Q−(Ð) The image shows national animal of Algeria.”。

图中可见一群白色身体、面部有黑斑、长有细长直角的有蹄动物迎面走来,扬起尘土,这是阿拉伯大羚羊的典型视觉特征。3 个陈述都说图像显示某国国兽,若只凭语言先验,3 个国名都看似合理,无法排除。只有对照图像所属的文化与物种归属,才能接受卡塔尔而拒绝另两个。这正说明干扰项不是随意负例,而是同主题下语义连贯的竞争项,迫使模型做视觉区分。这个例子也解释了为何需要图像盲过滤:若不用看图就能靠常识答对,基准就测不出 grounding 一致性。

组件与计算:三元组与 CI 如何配合诊断?

组件有两个,计算目标不同。第一个组件是对比三元组构造,输入是图像与多选题,操作是过滤掉图像盲可答题目,再改写为 3 个独立陈述,目标是制造最小语义竞争。第二个组件是 CI 计算,输入是模型对三元组内三句话的真假判定,操作是先数出至少对一个的三元组数作为分母,再数其中全对数,计算 1 减去全对占比,目标是得到条件性碎片率。原文明确 CI 不是三元组准确率的单调变换,同样准确率可对应不同 CI。优化与训练无关,这里没有梯度路径,CI 只是评测统计量。实现上所有实验用贪婪解码保证可复现,回答格式约束为固定英文模板。

三元组准确率 × 对比不稳定性: 三元组准确率负责度量全部 3 个陈述都答对的比例,反映整体成功;对比不稳定性负责在至少答对一个的三元组中有条件地度量未能全对的比例,负责把部分对但内部不一致与全错分开。二者搭配的原因是同一三元组准确率下降可能来自完全误解或碎片化,组合使用才能区分总体退化与决策边界不稳定。

聚合正确率与对比判别的关系需要单独强调,因为这是初学者最易混淆之处。论文用实例说明 Qwen2.5 3B 在阿拉伯语文本下 F1 为 0.77 但 CI 为 0.43,单句经常答对,但三元组经常不能全对。这种条件性不一致从 Q+ 与 Q- 上看不见。更一般地,表中存在聚合正确保持较高而内部一致性退化的情形,证明标准准确率不能完整刻画 grounded 稳定性。

聚合准确率 × 对比判别: 聚合准确率指 Q+ 与 Q- 各自独立统计的正确率和 F1,负责汇总单句对错;对比判别指在语义匹配的三元组内能否同时接受支持项并拒绝竞争项,负责检验相干区分。二者搭配是因为高聚合准确仍可能伴随高不一致,组合后才能发现语音保持单句正确却打散三元组内一致性的情况。

有无训练阶段:本研究训练了什么,没有训练什么?

本研究没有训练任何多模态大模型,没有报告参数冻结或更新、梯度路径、优化器或重置时机,不能从模型名称推定实现。真实计算过程是构造与调用:构造侧包括图像收集、去重、多选题生成、图像盲过滤、三元组改写、人工验证、机器翻译与语音合成;评测侧是调用已有模型做推理。图像收集用国家特定查询、地理定位搜索设置、质量约束与知识共享许可过滤,再做精确与嵌入式近重删除。

人验证抽取约 15% 数据,分层覆盖国家与类别,标注两个独立标签:是否需要图像才能回答,以及陈述是否被图像支持,不一致时第三人裁决,报告原始一致率与 Gwet AC1,并用条目级重采样计算自助置信区间。翻译在陈述级进行以保留 Q+ 与 Q- 关系,避免改写。语音合成用人类参考录音做零样本条件,生成匹配的男声与女声,保持词内容严格相同。评测调用经由 vLLM-Omni 框架,对 Qwen 系列与 Phi-4 模型分别送入文本或音频陈述,指令为文本,输出解析为真假。

不存在确定性求解,贪婪解码只保证同一输入下可复现,不保证跨模态一致。

实验条件:测什么,与谁比,指标方向如何?

实验按问题组织,比较条件保持任务指令为文本、仅切换待判陈述的模态与语言。被测模型为 Qwen2.5-Omni 3B、Qwen2.5-Omni 7B、Qwen3-Omni 30B 与 Phi-4-multimodal-instruct,均支持文本与语音输入。数据为 10150 个三元组,每个三元组含一 Q+ 与两 Q-。采样上人工验证子集按国家与类别分层随机抽取。指标方向为 Q+ 正确率、Q- 正确率与 F1 越高越好,CI 越低越好。

聚合对象是三元组级别,CI 分母为至少对一个的三元组。语音条件还按说话人取平均,并在不同信噪比下加噪评测,含联合语音文本输入作为可运行的缓解策略。代码与数据发布状态需按资源状态如实表述:代码资源当前可用,地址为公开仓库;数据集资源本次未能确认可达,不能写已公开可下载。硬件预算原文未报告具体量级,此为缺项,不做推测。

语音输入 × 文本输入: 文本输入负责提供无声学变异的词形信号,作为一致性基线;语音输入负责以相同词义经由声学通道进入模型,检验通道是否中性。二者搭配的理由是只有在词义严格相同、指令同为文本时比较,才能把差异归因于模态路径而非语义变化,组合意义是揭示模态不是中性传输通道。

主结果:语音与语言切换带来多大不一致?

主结果围绕 CI 是否超出聚合准确所见。论文报告语音会显著提高 CI,尤其在阿拉伯语与多个模型上,而英文相对稳定。跨语言上阿拉伯语 CI 系统性高于英语,且语音放大差距。规模上 CI 随模型增大而下降,但不消除跨模态与跨语言不一致。联合输入降低音频单模态的不稳定,但不能完全恢复文本一致性。

噪声下 CI 随信噪比下降单调上升,阿拉伯语更陡。为使比较公平,下表聚焦阿拉伯语下文本与语音的 CI,问题是同一语义换通道后碎片率变化多少,指标方向为 CI 越低越好。

模型语言文本 CI语音 CI趋势
Q2.5-3B阿拉伯语0.430.71上升
Q2.5-7B阿拉伯语0.350.63上升
Q3-30B阿拉伯语0.280.47上升

表后解释需要同时讲收益与代价。3 个 Qwen 模型在阿拉伯语下从文本切到语音时 CI 全部上升,其中小模型从 0.43 升至 0.71,增量最大,说明许多部分正确的三元组在语音下变得内部不一致;中等模型从 0.35 升至 0.63,大模型从 0.28 升至 0.47,绝对值下降显示规模带来更稳的区分,但上升趋势未消失,证明规模改善鲁棒性但不消除模态效应。代价是 F1 仅中度下降,单看聚合指标会低估退化。未胜出项是小模型在所有条件下 CI 最高,尤其语音下最差,不能用单句正确率掩盖。

下面看噪声曲线的整体形态。导读时先确认坐标与图例,再比较英文与阿拉伯语的层级,最后看斜率差异。

看图路径: 1. 先确认横轴是信噪比从 10 到 0 dB 向右噪声增大,纵轴是对比不稳定性 CI;2. 再区分下方三条英文实线圆点与上方三条阿拉伯语虚线三角的高度差;3. 比较同一颜色在 10 dB 到 0 dB 的上扬幅度,观察阿拉伯语更陡

原论文 Figure 2:Contrastive instability (CI) as a function of SNR for Qwen models under speech input.

论文图 2。原论文 Figure 2:“Contrastive instability (CI) as a function of SNR for Qwen models under speech input.”。

该图横轴为信噪比从 10 到 0 dB 向右噪声增大,纵轴为 CI。可见下方 3 条英文实线圆点聚集在 0.2 附近,随噪声仅轻微上扬,说明英文在加性噪声下相对稳健;上方 3 条阿拉伯语虚线三角分别位于约 0.5 至 0.9 区间,随噪声明显爬升,其中红色小模型最高,棕色大模型最低,显示声学退化叠加了已有的跨语言不稳定,而非凭空产生。模型放大的作用是整体下移曲线,但语言间高度差在高信噪比下依然存在,支持噪声放大而非导致差距的判断。像素不能精确读出的中间数值不硬写,以原文单调上升与英文平缓、阿拉伯语陡峭的定性结论为准。

反证与缓解:噪声、规模与联合输入各起什么作用?

除核心主结果,论文展开两类特有细节:声学退化与联合信号。噪声实验在语音输入下扫描信噪比,结果按声音取平均,显示 CI 随信噪比下降单调增加,英文退化平缓,阿拉伯语退化陡峭,大模型在各信噪比下 CI 更低。联合输入实验同时给同一陈述的语音版与文本版,比较文本单模态、音频单模态与联合三者的 CI。为明确跨语言差距的结构,下表整理英文与阿拉伯语在文本与语音下的 CI,问题是语言差距是否被语音放大,CI 越低越好。

模型英文文本 CI阿拉伯文本 CI英文语音 CI阿拉伯语音 CI
Q2.5-3B0.200.430.220.71
Q3-30B0.200.280.190.47

表后解释需指出支持与限制。小模型文本下英文 0.20 对阿拉伯语 0.43 已有差距,语音下英文 0.22 对阿拉伯语 0.71 差距拉大,支持跨语言 grounding 存在结构性不稳定且被语音放大的判断;大模型文本下 0.20 对 0.28 差距缩小,语音下 0.19 对 0.47 仍显著,说明规模缩小但未消除差距。反例是英文语音 CI 几乎不升甚至大模型略降,表明模态效应不是对所有语言均匀作用,不能把总体趋势推广到每组。另一未评测边界是英文联合输入差异原文称最小,未展开数值,不做推断。

联合语音文本输入 × 单模态输入: 单模态输入指只给语音或只给文本,负责暴露各自的不稳定性;联合语音文本输入指同时给同一陈述的语音版和文本版,负责提供多余的文本锚定。二者搭配是为了检验文本信号能否稳定语音判别,组合意义是量化冗余带来的缓解幅度及其不能完全恢复文本一致性的上限。

联合输入是否缓解的导读如下:先看每组三柱排序,再看规模带来的整体下移,最后看绿色与蓝色的残留差。

看图路径: 1. 先确认横轴三个模型分组,纵轴 CI,每组内蓝色文本、橙色音频、绿色两者皆有;2. 比较每组内橙色柱最高、蓝色最低、绿色居中的排序是否成立;3. 观察从小模型到大模型三色柱整体下移,但绿色仍高于蓝色的残留差距

原论文 Figure 3:Contrastive instability (CI) under text-only, audio- only, and joint speech–text input for Qwen…

论文图 3。原论文 Figure 3:“Contrastive instability (CI) under text-only, audio- only, and joint speech–text input for Qwen models in Arabic.”。

该图为阿拉伯语下 3 个 Qwen 模型的柱状图,每组蓝色文本最低、橙色音频最高、绿色两者皆有居中,表明联合输入相对纯音频一致降低 CI,文本信号起稳定作用。但绿色始终高于蓝色,尤其小模型绿色仍接近 0.46 而蓝色约 0.45 的紧贴与中大模型的明显残差并存,说明多模态冗余缓解但不消除语音诱发的不稳定。结合规模趋势,绿色柱随模型增大而降低,证明容量与冗余共同改善,但文本单模态的相干性仍是上限。

边界与缺项:哪些结论不能外推?

论文直接报告的是在该文化基准、受控合成语音与贪婪解码下的行为差异,有限解释是模态不是中性通道、噪声放大而非导致跨语言不稳定,未验证推测需用可能或待验证表达。缺失证据不是技术错误,但必须明确:未测量误判率之外的延迟与成本,不能承诺联合输入改善延迟;未报告训练资源与推理开销,不能讨论帧率;未评测真实环境录音与方言变体,合成语音的韵律自然但仍是仿真,不能外推到所有口音。

相关性不是因果,阿拉伯语更高 CI 可能与预训练数据、翻译质量、合成语音质量多因素有关,原文未做因果分解。总体趋势不等于每组成立,例如英文语音 CI 基本稳定,Phi-4 在阿拉伯语语音下出现极端行为,显示不同架构敏感性不同。原文表头或算术若有冲突应标注,但本次证据中三元组定义与 CI 公式一致,未发现需标注的冲突;硬件预算缺项已在实验条件中指出。

复现先做什么:数据、代码与关键超参数如何取用?

复现先做三件事。第一,取代码仓库核对评测脚本与提示模板,确认任务指令为文本、待判陈述按文本或音频送入、输出解析为固定真假格式,并用贪婪解码保证可复现。第二,取数据集时注意资源状态:代码当前可用,数据集链接本次未能确认可达,应先检查可达性再谈下载;若不可达,可按原文构造流程复刻小规模验证集,包括国家特定查询收集、去重、图像盲过滤、三元组改写与 15% 分层人工验证。

第三,保留关键信息条件:英文经陈述级翻译为阿拉伯语而不做改写,语音用零样本合成生成男女声且词内容严格相同,噪声测试用非平稳噪声与合成混响并按声音平均,联合输入同时给同一陈述的语音与文本。区分代码开源、权重下载与系统可运行:论文调用已有 Qwen 与 Phi-4 权重,需经 vLLM-Omni 框架运行,不等于作者提供权重。还需补的验证是真实录音复测与跨说话人方差报告,以及英文联合输入的完整数值。

何时值得尝试这种对比评测,如何收束?

当你的语音助手必须看图做判断,且支持多语言时,值得尝试这种三元组对比评测:先为每图写一个支持句与两个同主题干扰句,再分别测文本与语音、英文与本地语言的三元组一致性,而不只看单句准确率。若发现聚合 F1 尚可但 CI 高,说明模型在做碎片化判别,应优先检查跨模态对齐与语言覆盖,而非只调单句阈值。若考虑联合语音文本输入,要预期它降低音频不稳定但保留与文本的差距,小模型上缓解有限,是否值得双通道成本需结合延迟实测。

论文特有的误解是把语音当成文本的另一种写法,实际上声学路径会重塑语言与视觉证据的交互,尤其在阿拉伯语下更明显;另一误解是把规模当成彻底解法,实际上大模型更稳但语言差距与模态差距仍在。收束是:用 CI 这一条件性指标把部分对与全错分开,才能看到语音放大的内部不一致,这是标准准确率看不到的诊断视角。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总