论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4607 字 阅读 →
论文解读

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3695 字 阅读 →
会议任务专题

ICLR 2026 - 数据集

共 1 篇 ICLR 2026 数据集 方向论文

 · 更新于 2026-09-25 · 约 4 分钟 · 1942 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4633 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4699 字 阅读 →
论文解读

Music Flamingo: Scaling Music Understanding in Audio Language Models

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5841 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

基准测试 数据集 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4749 字 阅读 →
论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5371 字 阅读 →
论文解读

OWL : Geometry-Aware Spatial Reasoning for Audio Large Language Models

空间音频 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5053 字 阅读 →
论文解读

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4899 字 阅读 →
论文解读

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

机器人操作 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5562 字 阅读 →
论文解读

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5424 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6225 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8929 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4606 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音视频深度伪造检测 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3642 字 阅读 →
论文解读

Timing is Everything: Temporal Scaffolding of Semantic Surprise in Humor

音频事件检测 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5042 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5353 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4107 字 阅读 →