论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4936 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4693 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5380 字 阅读 →
论文解读

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5631 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4689 字 阅读 →
论文解读

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

语音对话系统 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4643 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4397 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3963 字 阅读 →
论文解读

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

语音问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4249 字 阅读 →
论文解读

Music Flamingo: Scaling Music Understanding in Audio Language Models

音乐理解 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6053 字 阅读 →
论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4566 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4700 字 阅读 →
论文解读

OWL : Geometry-Aware Spatial Reasoning for Audio Large Language Models

空间音频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5296 字 阅读 →
论文解读

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4469 字 阅读 →
论文解读

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5614 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4797 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3720 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4001 字 阅读 →