会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

从感知到干活:Qwen3.8-Omni-Flash 如何把长音视频变成可执行的智能体工作流

论文要解决长音视频生产力任务中感知与长程规划脱节的问题,选择原生多模态共训加百万上下文与按需取证的智能体执行,证据是多说话人识别与长视频推理的大幅提升,代价是通用转写翻译仍有差距且实时交互需非思考模式换取低延迟。

 · 约 21 分钟 · 10373 字 阅读 →
论文解读

先取证再打分:E-AVI 把面试录像变成可核查的证据池

针对自动视频面试只给分数而缺乏可检查依据的问题,E-AVI 选择先抽取带时间戳的结构化多模态证据再做维度条件打分,在 RecruitView 上把 MAE 从 0.641 降到 0.607、Spearman 从 0.440 提升到 0.541,代价是提取阶段仍是 83.3% 困难样本的瓶颈且推理依赖 15 秒级抽取开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10141 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

整句里的手势为何不再决定重音:西班牙语节拍手势效应的整句检验

该研究把西班牙语最小重音对嵌入完整句子并用 5 级声音连续体加 2 种节拍对齐做二选一判断,结果显示声音步骤主导判断而手势对齐无可靠影响,反应时同样无可靠加速,代价是更自然的语速与手势变异可能稀释了视觉线索的权重。

 · 更新于 2026-09-24 · 约 20 分钟 · 9995 字 阅读 →
论文解读

当语调不再标记焦点:匈牙利语中手势与元音目标的稳定对齐

该研究用电磁发音仪与视频追踪检验匈牙利语指点手势与语音地标的时滞稳定性,初步证据指向第一音节元音目标与手指目标的对齐最稳定且不受信息结构与基频轮廓调节,代价是仅报告一名被试且未发现基频的组织作用。

 · 更新于 2026-09-24 · 约 20 分钟 · 9893 字 阅读 →
论文解读

把对话拆成可对齐的多维交际行为再生成剧本:MINERAL 的多参与者建模路线

该项目要解决多人视频对话中语言、非语言、视觉与时间线索难以统一建模的问题,选择先定义多维度交际行为再建模其关系并生成电影剧本式描述,以虚构与真实语料上的泛化为证据方向,代价是本文仅提出路线而未报告可验证的模型与定量结果。

 · 更新于 2026-09-24 · 约 19 分钟 · 9177 字 阅读 →
论文解读

手势顶点为何在 Babanki 音节里更早:双语者音节内重音时序的跟随证据

以 7 名 Babanki-英语双语者自然对话为对象,论文用话语新旧引出的时长线索与手势顶点到元音起始的时滞比较,报告 Babanki 中手势与加长线索更靠音节首,而英语更靠元音,支持手势跟踪亚音节重音时序,但证据限于单音节词与首提及对照。

 · 更新于 2026-09-24 · 约 19 分钟 · 9351 字 阅读 →
论文解读

用婴儿两年的所见所闻,能否从零训练出会看会说的视觉基础模型

论文以 6 至 32 个月婴儿视角的纵向音视频为唯一感官来源,构建视频话语、图像话语与多轮交错三种预训练数据并从零训练紧凑视觉语言模型,再以新发布临床工具为依据建成十任务基准,证据显示小模型可在部分认知任务上接近大模型但域外泛化与未见任务仍明显受限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10371 字 阅读 →
论文解读

先降噪再分割:用自监督音频增强与动态原型约束弥合音视语义鸿沟

针对单模态噪声与跨模态语义鸿沟,BYOAVP 以自监督音频增强对齐视觉语义、以动量原型约束做像素级分类,在 AVSBench 与 VPO 六个子任务上取得最优,同时需承担双分支注意力与原型维护的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8105 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

对不齐就推理错:FAVE 用三层时间任务检验音视频大模型的同步短板

论文针对音视频大模型单模态理解强但跨模态细粒度时间推理弱的问题,构建包含对齐、低层关系与区间描述的三层基准 FAVE,用 3557、4546、1781 组问答证明十三款模型在联合时序任务上明显落后于人类,而增加采样帧数不能消除该差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8667 字 阅读 →
论文解读

从原始音视频算起:用参考锚定身份再推理社交指向

论文提出只用原始音视频判断最后说话人在跟谁说话的 Omni-MMSI 任务,并用参考引导的工具抽取加两步思维链推理的 Omni-MMSI-R 解决身份归属难题,在 Ego4D 和 YouTube 上取得报告的最优准确率,代价是需手工构建参考对和过滤生成推理标注。

 · 更新于 2026-09-24 · 约 19 分钟 · 9246 字 阅读 →
论文解读

听音再剪视频:OmniZip 用音频保留率动态分配视频剪枝

针对全模态大模型音频加视频序列过长问题,OmniZip 用免训练的音频引导加交错时空压缩做推理时剪枝,最强证据是在 Qwen2.5-Omni 上保持接近满词元精度的同时实现 2.51-3.42×预填充加速与约 10G 显存下降,代价是剪枝率需按任务平衡且依赖音频编码器注意力。

 · 更新于 2026-09-24 · 约 21 分钟 · 10273 字 阅读 →
论文解读

既要对齐时间又要能重建细节:SyncStream 在隐空间统一判别与生成

针对音视频时间同步被忽视且掩码自编码重建模糊的问题,SyncStream 用隐空间对比掩码自编码学紧凑对齐表示再用条件流匹配精修隐变量,在 VGGSound 上把分类准确率从 38.40% 提升到 49.14% 并降低音频重建误差,代价是两阶段训练与解码器深度需要权衡。

 · 更新于 2026-09-24 · 约 27 分钟 · 13232 字 阅读 →
论文解读

从固定图文对到任意交错组合:UniM 为何要同测语义结构与连贯

UniM 面向任意组合交错输入输出的理解与生成任务,用 31026 个多任务实例与语义质量、结构完整、交错连贯三维评估检验模型,报告显示现有任意到任意模型得分偏低,而带可追溯推理的智能体基线 UNIMA 更高但仍不完备。

 · 更新于 2026-09-24 · 约 19 分钟 · 9438 字 阅读 →
论文解读

跨模态一致反而更难查:RAVM 用多智能体伪造现实感视频谣言并以证据图检测

针对生成式视频谣言跨模态语义一致导致旧数据集失真的问题,该研究构建含声明、视频、音频与跨模态四类操纵的 9049 对 RAVM 数据集并提出证据图检测模型 IEEG,以 75.99% 准确率取得最优但仍显示通用大模型的脆弱性,代价是生成与评测流程复杂且数据集链接当前不可用。

 · 更新于 2026-09-24 · 约 18 分钟 · 8720 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →