论文解读

UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection

音频事件检测 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7397 字 阅读 →
论文解读

What is a Musical Scale? Regularity and Convention in the Organization of Pitch

音乐理解 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5728 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-15

共分析 25 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 88 分钟 · 43611 字 阅读 →
论文解读

A Closed-Form Noise-Sensitivity Asymmetry for Causal Branch Selection in Minimal-Array TDoA Localization

音频理解 | 5.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6698 字 阅读 →
论文解读

A Production-Oriented Framework for Evaluation of SFX Generation

音频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7493 字 阅读 →
论文解读

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

提示学习 | 6.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8074 字 阅读 →
论文解读

ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music

自监督学习 | 7.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7552 字 阅读 →
论文解读

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

音频生成 | 7.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7705 字 阅读 →
论文解读

BeatEdit: Symbolic Music Generation as Explicit Editing

音乐生成 | 8.9/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13087 字 阅读 →
论文解读

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7257 字 阅读 →
论文解读

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

提示学习 | 8.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10446 字 阅读 →
论文解读

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

语音分离 | 7.4/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12066 字 阅读 →
论文解读

Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7564 字 阅读 →
论文解读

Evaluating SSL and ViViT Architectures for Cross-Corpus Audio MOS Prediction via LODO Validation

语音质量评估 | 8.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7355 字 阅读 →
论文解读

Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models

语音伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
论文解读

GigaChat Audio: Time-aware Large Audio Language Model

音频理解 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6899 字 阅读 →
论文解读

Graph Representation of RaagBase: A Unique Dataset for Hindustani Music

音乐理解 | 5.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5708 字 阅读 →
论文解读

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12190 字 阅读 →
论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6464 字 阅读 →
论文解读

LightMem-Ego: Your AI Memory for Everyday Life

流式处理 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5925 字 阅读 →