论文解读

FSD50K-Solo: Automated Curation of Single-Source Sound Events

数据清洗 | 5.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6839 字 阅读 →
论文解读

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

音频分类 | 5.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9405 字 阅读 →
论文解读

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

基础模型 | 6.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9331 字 阅读 →
论文解读

Exploring Token-Space Manipulation in Latent Audio Tokenizers

音频编码 | 6.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9238 字 阅读 →
论文解读

PoDAR: Power-Disentangled Audio Representation for Generative Modeling

语音合成 | 7.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8991 字 阅读 →
论文解读

Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation

语音增强 | 7.2/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10260 字 阅读 →
论文解读

Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models

世界模型 | 5.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4662 字 阅读 →
论文解读

BeeVe: Unsupervised Acoustic State Discovery in Honey Bee Buzzing

BeeVe: Unsupervised Acoustic State Discovery in Honey Bee Buzzing

 · 更新于 2026-09-06 · 约 20 分钟 · 9725 字 阅读 →
论文解读

MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method

音频事件检测 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6396 字 阅读 →
论文解读

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization

音频编码 | 7.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6791 字 阅读 →
论文解读

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

语音生成 | 7.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8743 字 阅读 →
论文解读

APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music

音乐评估 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 6001 字 阅读 →
论文解读

SEI-SHIELD: Robust Specific Emitter Identification Under Label Noise Via Self-Supervised Filtering and Iterative Rescue

信号处理 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6041 字 阅读 →
论文解读

Stage-adaptive audio diffusion modeling

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5813 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4807 字 阅读 →
论文解读

APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music

音乐理解 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5162 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3952 字 阅读 →
论文解读

Deepfake Audio Detection Using Self-supervised Fusion Representations

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4110 字 阅读 →
论文解读

Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework

说话头伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6781 字 阅读 →
论文解读

Learning Generalizable Action Representations via Pre-training AEMG

生物声学 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5844 字 阅读 →