论文解读

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

音乐理解 | 7.0/10

 · 更新于 2026-10-02 · 约 7 分钟 · 3318 字 阅读 →
论文解读

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

多模态模型 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5604 字 阅读 →
论文解读

LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation

说话人验证 | 8.5/10

 · 更新于 2026-10-02 · 约 15 分钟 · 7232 字 阅读 →
论文解读

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

音频生成 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5854 字 阅读 →
论文解读

MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation

语音增强 | 6.0/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5552 字 阅读 →
论文解读

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

语音伪造检测 | 7.0/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4899 字 阅读 →
论文解读

Timing is Everything: Temporal Scaffolding of Semantic Surprise in Humor

音频事件检测 | 6.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5042 字 阅读 →
论文解读

Towards Improving Speaker Distance Estimation through Generative Impulse Response Augmentation

声源定位 | 8.5/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Transformer-based End-to-End Control Filter Generation for Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6089 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 41 分钟 · 20229 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4107 字 阅读 →
论文解读

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

基准测试 | 7.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5342 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 8.0/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6263 字 阅读 →
论文解读

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5987 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-02

共分析 4 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 15 分钟 · 7026 字 阅读 →
论文解读

A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)

语音分离 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5194 字 阅读 →
论文解读

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

条件生成 | 8.0/10

 · 更新于 2026-10-02 · 约 7 分钟 · 3079 字 阅读 →
论文解读

Accent Conversion: A Problem-Driven Survey of Sociolinguistic and Technical Constraints

语音转换 | 7.5/10

 · 更新于 2026-10-02 · 约 8 分钟 · 3936 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5309 字 阅读 →