只会看的第一人称模型:EgoSound 逼模型把声音听进推理里
EgoSound 针对第一人称视频中的声音理解构造 900 视频 7315 对开放问答与七类任务,用九个多模态大模型的评测显示最强模型仅 56.7% 准确率而人类达 83.9%,代价是自动构造依赖大模型与 GPT-5 判分带来的偏差与可复现性负担。
EgoSound 针对第一人称视频中的声音理解构造 900 视频 7315 对开放问答与七类任务,用九个多模态大模型的评测显示最强模型仅 56.7% 准确率而人类达 83.9%,代价是自动构造依赖大模型与 GPT-5 判分带来的偏差与可复现性负担。
论文针对音视频大模型单模态理解强但跨模态细粒度时间推理弱的问题,构建包含对齐、低层关系与区间描述的三层基准 FAVE,用 3557、4546、1781 组问答证明十三款模型在联合时序任务上明显落后于人类,而增加采样帧数不能消除该差距。
论文针对音频视觉评测偏重单轮感知的问题,提出感知—推理—交互三层基准并区分指令与上下文两种音频角色,用 2451 个样本和多轮任务图揭示语音指令推理弱于文本指令且交互成功率普遍偏低,代价是构造依赖人工标注而交互判定依赖大模型裁判。
论文针对视频多模态大模型看人不细的问题,用两条自动标注与组装干扰项的流水线合成 16 个细粒度选择题,并在 30 个模型与人类基线上显示情绪与声画对齐仍远落后于人,且开放流水线把人工从出题转为验题。
以同一 SPICE 梯子电路为基准,用谐波、自振荡与大信号截止点偏移三类可复述测量,比较五种数字实现并在公共核心上做饱和器与位置消融,最强证据是分布式 1+4 级实现聚在频谱误差 0.04% 至 0.10% 而边界饱和的 JUCE 达 0.65%,代价是只覆盖静态与准静态条件且未做听感与硬件验证。
该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。
论文针对语音内容与视频画面的语义和时间对齐问题,构造 2405 个问答的 SVHalluc 基准并测试多款音视频大模型,最强证据是 Gemini-2.5-Pro 在全局语义对齐上达到 93.10% 而多数开源模型徘徊在 50% 附近,代价是开源模型跨模态绑定能力仍接近随机且需额外的人工核验构造流程。
TriDF 针对以人为中心的伪造提出可解释检测基准,用细粒度伪影感知、真假判定与解释幻觉三维评估多模态大模型,报告显示语义伪影最难且幻觉会切断感知到判定的链路。
论文针对多模态大模型缺乏统一计数评测的问题,构建覆盖图像文本音频与三级能力三级难度的问答式基准并用固定提示与解析做 45 个模型的标准化评测,最强证据是基础感知尚可但推理与高密度长尾误差显著增大,代价是闭源接口与长上下文带来的评测成本与覆盖偏差。
UniM 面向任意组合交错输入输出的理解与生成任务,用 31026 个多任务实例与语义质量、结构完整、交错连贯三维评估检验模型,报告显示现有任意到任意模型得分偏低,而带可追溯推理的智能体基线 UNIMA 更高但仍不完备。
针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。
论文用 15 种非洲语言、约 7.5k 对图文加母语录音的平行问答测文化理解,最强闭源模型文本选择题仅 78% 而开放问答仅 38%,开源模型在母语语音开放问答上近零分且语音识别与语种识别先失灵。
该工作以音频为唯一证据检验蕴含、一致、合理、口音漂移与口音克制五类推理,报告显示生成式模型优于对比式模型但普遍过度蕴含,而转写加推理的级联系统在医疗蕴含上取得更高宏平均 F1 并伴随明显的模型偏向代价。
针对方言阿拉伯语数据分散与标注不一致问题,Arab Voices 用统一转写与元数据对齐 31 个数据集并以方言度与音频质量代理做可比刻画,在 14 个方言零样本评测中显示现代模型仍困难而多模态大模型相对更稳,代价是音频质量代理与人感并不完全一致且部分低资源方言仍缺乏数据。
针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。
该研究把多轮语音交互拆成记忆、指令、一致性和语音改口四个轴,用 452 段无脚本真人录音和 1712 条原子细则做固定上下文评测,报告最高模型仅 54.65% 通过率且语音改口最难,同时付出长音频一致性下降与声音线索记忆明显弱于语义记忆的代价。
该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。