论文解读

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

音频理解 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6085 字 阅读 →
论文解读

Hidden-Domain Routing for All-Type Audio Deepfake Detection

领域适应 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6135 字 阅读 →
论文解读

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5563 字 阅读 →
论文解读

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5961 字 阅读 →
论文解读

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

说话人验证 | 6.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5438 字 阅读 →
论文解读

SCOPE: Entanglement Frontier Escape for Source-Free Class Unlearning

说话人验证 | 6.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6134 字 阅读 →
论文解读

SGAD: A State-Guided Adaptive Decision Framework for Robust EEG-Based Auditory Attention Switch Decoding

Transformer | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6385 字 阅读 →
论文解读

The Role of Disfluencies in Speech Translation

语音翻译 | 6.4/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10618 字 阅读 →
论文解读

Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior

音频分类 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7297 字 阅读 →
论文解读

UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

音乐理解 | 5.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7767 字 阅读 →
论文解读

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

音频理解 | 7.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7773 字 阅读 →
论文解读

Do Music Foundation Models Embed Pitch in Helical Structure?

音乐理解 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6831 字 阅读 →
论文解读

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6173 字 阅读 →
论文解读

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

音视频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7441 字 阅读 →
论文解读

Learning to Predict Performance-induced Emotion Differences in Classical Piano Music

数据集 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5773 字 阅读 →
论文解读

Leveraging Beam Search Information for Confidence Estimation in E2E ASR

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7632 字 阅读 →
论文解读

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

语音交互 | 6.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5540 字 阅读 →
论文解读

Model-Agnostic Meta-Learning Initialization for Distributed Multichannel Active Noise Control

主动降噪 | 5.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5740 字 阅读 →
论文解读

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

医疗音频 | 4.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6862 字 阅读 →
论文解读

Tensor-Based Joint Pitch and DOA Estimation

声源定位 | 6.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6290 字 阅读 →