论文解读

Equivariant Music Transformer

音乐生成 | 8.6/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9835 字 阅读 →
论文解读

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

音乐理解 | 7.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7164 字 阅读 →
论文解读

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

语音情感识别 | 7.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7528 字 阅读 →
论文解读

Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE

音视频语音分离 | 6.8/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10746 字 阅读 →
论文解读

InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching Inversion

音频质量评估 | 6.4/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5422 字 阅读 →
论文解读

Masked diffusion enables coherent beat tracking

音乐理解 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5529 字 阅读 →
论文解读

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

语音属性识别 | 7.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7067 字 阅读 →
论文解读

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

音频理解 | 5.5/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2267 字 阅读 →
论文解读

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

音视频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8473 字 阅读 →
论文解读

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

音视频生成 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5645 字 阅读 →
论文解读

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7802 字 阅读 →
论文解读

Smartphone Audio Based Distress Detection

音频事件检测 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7186 字 阅读 →
论文解读

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

音频理解 | 6.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6090 字 阅读 →
论文解读

StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7515 字 阅读 →
论文解读

Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study

音乐检索 | 8.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7467 字 阅读 →
论文解读

Transfer Learning for Avian Bioacoustics under Sparse Positive Labels

音频分类 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6968 字 阅读 →
论文解读

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9417 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-06

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36201 字 阅读 →
论文解读

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4713 字 阅读 →
论文解读

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

音频生成 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6230 字 阅读 →