论文解读

Executable Boundary Contracts for Sound Event Traces

音频事件检测 | 8.5/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9595 字 阅读 →
论文解读

Fast Multichannel NMF with Block-Diagonal Spatial Covariance Matrices for Efficient Blind Source Separation Using Distributed Microphone Arrays

语音分离 | 7.5/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7935 字 阅读 →
论文解读

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

视频生成 | 4.9/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7098 字 阅读 →
论文解读

FormalASR: End-to-End Spoken Chinese to Formal Text

语音识别 | 8.2/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7790 字 阅读 →
论文解读

From Numbers to Perception, Energy Decay Curves Prediction

空间音频 | 7.2/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8331 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7.0/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7894 字 阅读 →
论文解读

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

音乐生成 | 8.4/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7719 字 阅读 →
论文解读

Linearly Constrained Deep Beamformer for Multi-Speaker Scenarios

语音增强 | 7.3/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7293 字 阅读 →
论文解读

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

语音识别 | 9.3/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7818 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 8.1/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9524 字 阅读 →
论文解读

Music of Changing Lines: Toward a Culturally Situated Approach to the I-Ching

音乐生成 | 5.5/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6040 字 阅读 →
论文解读

Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model

音乐生成 | 5.6/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8324 字 阅读 →
论文解读

Normative Networks for Source Separation via Local Plasticity and Dendritic Computation

盲源分离 | 8.9/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7574 字 阅读 →
论文解读

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

音频编码 | 6.5/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8657 字 阅读 →
论文解读

Ordering Matters: Rank-Aware Selective Fusion for Blended Emotion Recognition

多模态情感识别 | 5.0/10

 · 更新于 2026-09-09 · 约 14 分钟 · 7000 字 阅读 →
论文解读

PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding

长音频理解 | 7.4/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7334 字 阅读 →
论文解读

Precise and Simple Audio-to-Score Alignment

音乐信息检索 | 6.8/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7761 字 阅读 →
论文解读

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech

语音合成 | 9.5/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9678 字 阅读 →
论文解读

SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

语音识别 | 8.3/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6832 字 阅读 →
论文解读

SEABAD: A Tropical Bird Activity Detection Dataset for Passive Acoustic Monitoring

生物声学 音频事件检测 | 8.1/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8250 字 阅读 →