论文解读

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

音乐理解 | 7.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8800 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

音频分类 | 6.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7376 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7796 字 阅读 →
论文解读

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

基准测试 | 7.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

DETECT-3B-Omni is Agnostic of Content and Demographics

语音伪造检测 | 4.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5688 字 阅读 →
论文解读

Doppelganger: Sound Effects and Their Synthetic Twins

音频检索 | 9.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6213 字 阅读 →
论文解读

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

语音交互 | 8.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7382 字 阅读 →
论文解读

SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

音频伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9156 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 176 分钟 · 87928 字 阅读 →
论文解读

\(\tau\)-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

语音交互 | 9.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8721 字 阅读 →
论文解读

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

音视频理解 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5942 字 阅读 →
论文解读

BFCL Audio: An Audio Function Calling Evaluation for Large Language Models

语音交互 | 7.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7260 字 阅读 →
论文解读

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

音乐生成 | 6.4/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4833 字 阅读 →
论文解读

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

音视频问答 | 6.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8438 字 阅读 →
论文解读

FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

可解释性 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4956 字 阅读 →
论文解读

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

语音交互 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7266 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8593 字 阅读 →
论文解读

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

音视频问答 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7522 字 阅读 →
论文解读

SAM Audio: Segment Anything in Audio

音频分离 | 9.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6829 字 阅读 →