论文解读

咳嗽不是噪声:让对话智能体在轮次间听见呼吸

音频事件检测 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7497 字 阅读 →
论文解读

当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位

音视频理解 | 4.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9446 字 阅读 →
论文解读

Omni 不等于会选:当模型被要求用对的模态回答

音视频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8261 字 阅读 →
论文解读

有害不在一处:当声音与画面由多模态共同拼出

音视频生成 | 7.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7570 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9187 字 阅读 →
论文解读

当八成轮替都重叠时,静音阈值为什么会失灵?

多模态模型 | 5.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8392 字 阅读 →
论文解读

说出来就变了味:当语音不再是文本的透明通道

音视频问答 | 8.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7692 字 阅读 →
论文解读

边播边改:当音视频生成从片段走向持续世界

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8087 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 87 分钟 · 43538 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5836 字 阅读 →
论文解读

别再把同步分数当裁判:先问它量的是偏移、内容,还是感知代理

音视频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5899 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5452 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6559 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6318 字 阅读 →
论文解读

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7258 字 阅读 →
论文解读

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

Adaptive Hierarchical Representation Alliance for Multimodal Learning

语音情感识别 | 8.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

语音识别 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5179 字 阅读 →
论文解读

EchoWM: Open and Enterable Omnimodal World Models

音视频生成 | 10.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5157 字 阅读 →
论文解读

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

音视频生成 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4722 字 阅读 →