论文解读

三跳都必须用上:OMHBench 如何堵住全模态评测的捷径与偏路

针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。

 · 更新于 2026-09-24 · 约 18 分钟 · 8816 字 阅读 →
论文解读

把幻觉拆成可验的原子断言:OmniHallu 统一六向跨模态检测

针对图像视频音频的理解与生成六类任务,OmniHallu 用原子断言拆分加模态专家验证再推理聚合做声明级检测,在 10000 样本基准上以宏平均 F1 领先基线并用可训练验证器把专家调用减少约三分之二。

 · 更新于 2026-09-24 · 约 20 分钟 · 9564 字 阅读 →
论文解读

从“是不是自闭”到“在说什么”:ROSCO-Omni 用标签引导把照护者理解蒸馏进开源全模态模型

针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
论文解读

只动声音就能拖垮三模态推理:SoundBreak 的六路音频攻击

论文研究只加音频扰动能否无目标破坏音频视频语言模型的问答,方法是固定视频与文本并用六种损失学习一段可复用的共享扰动,最强证据是组合损失在 AVQA 上达到 96.03% 攻击成功率,代价是跨模型与跨声学域迁移很弱且物理混响下部分目标明显衰减。

 · 更新于 2026-09-24 · 约 18 分钟 · 8927 字 阅读 →
论文解读

离线大模型不重训怎么做同传:停顿切分加等待策略的测试时适配

论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 8000 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8645 字 阅读 →
论文解读

高层偏向视频、跨模态不宜直并:AccKV 按层聚焦再校准压缩音视频 KV

针对音视频大模型推理时 KV 缓存过大问题,AccKV 按层自适应聚焦关键模态并先模态内合并再跨模态校准,在 MVBench 与 AVSD 上用 10% 缓存与 120 词元预算维持接近全缓存精度,但未测量延迟与吞吐提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7861 字 阅读 →
论文解读

从看见听见到回得得体:HumanSense 把共情拆成可测的四层阶梯

针对多模态大模型在以人为中心场景中感知尚可但理解与回应不足的问题,论文用 3882 道真人记录选择题建四层基准并以多阶段全模态强化学习做推理模型,最强证据是人类 87.5% 领先最优模型 29.7 个百分点,而代价是长上下文推理仍是瓶颈且音频任务覆盖不全。

 · 更新于 2026-09-24 · 约 17 分钟 · 8399 字 阅读 →
论文解读

视频推理为何仍贵:沿采样编码连接器与解码四段查开销

该综述把视频大模型开销定位到帧选择、编码器、连接器压缩与大模型预填充解码四段,显示约 25 % 视觉 token 保留下多类方法接近基线精度,而推到约 10 % 保留与流式内存时必须显式建模时间冗余并计入选择器与编码代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10163 字 阅读 →
论文解读

联合分支不可全信:用冲突量与可干预性重配解码权重

针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。

 · 更新于 2026-09-24 · 约 20 分钟 · 9605 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
论文解读

真假混在一起时:让大模型先分轨再判真伪的 ToolDF

针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。

 · 更新于 2026-09-24 · 约 15 分钟 · 7181 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

听错了才是听懂了?当大音频模型遇上人类幻听

音频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10268 字 阅读 →
论文解读

别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10921 字 阅读 →
论文解读

先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11200 字 阅读 →
论文解读

孤独听得出来吗:当说什么比怎么说更诚实

语音情感识别 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8019 字 阅读 →
论文解读

剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9837 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现

多模态模型 | 8.3/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10864 字 阅读 →