ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
针对通用多模态只学语义对齐而缺物理量监督的问题,OmniFysics-Nano-V2 用静态属性 grounding 与动态视听事件对齐的双分支数据加两阶段 GRPO,在 21 项中 17 项领先同类全模态模型,代价是依赖商用大模型标注与多阶段训练流程。
论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。
针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。
该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对声源定位中特征匹配缺少显式验证的问题,该研究用 Qwen2.5-Omni-7B 的提示工程实现生成-分析-精修三阶段零样本定位,在 MUSIC 与 VGGSound 单源和双源基准上报告了可比或更高的精度,代价是单样本约 4 秒的多轮推理开销。
针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。
针对全模态大模型把一模态线索误用到另一模态提问以及过度依赖文本先验的问题,论文提出在偏好优化中加入不相关模态不变与相关模态敏感两项解耦约束并叠加纯文本惩罚,用自动构造的约 1.8 万偏好样本训练,在幻觉基准上报告最高约 27% 的匹配任务提升,而代价是每步增加无需梯度的损坏输入前向与四分之一轮数的训练预算控制。
TriDF 针对以人为中心的伪造提出可解释检测基准,用细粒度伪影感知、真假判定与解释幻觉三维评估多模态大模型,报告显示语义伪影最难且幻觉会切断感知到判定的链路。
UniM 面向任意组合交错输入输出的理解与生成任务,用 31026 个多任务实例与语义质量、结构完整、交错连贯三维评估检验模型,报告显示现有任意到任意模型得分偏低,而带可追溯推理的智能体基线 UNIMA 更高但仍不完备。
MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对音频与文本交替出现的多轮上下文检索,论文构造统一 ATIR 基准并训练带音频令牌选择器的双编码器 ATIR-Qwen-3B,报告平均 78.86% Recall@1 和 85.09% nDCG@5,最强对照下仍保留打乱交织结构即下降的反证,代价是两阶段微调与选择器阈值调节。
针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。
论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。
BoYaEval 用 3175 张原貌古谱图像把考题分成认符号、译指法、推旋律三层,报告显示 21 个主流多模态大模型在基础识别尚可但在旋律推理仅约 27% 到 30%,而把示例从零增至多示例也不能打通跨谱式推理瓶颈。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。