论文解读

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5494 字 阅读 →
论文解读

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

音频事件检测 | 6.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5766 字 阅读 →
论文解读

Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning

音乐理解 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5536 字 阅读 →
论文解读

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

音频分类 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7322 字 阅读 →
论文解读

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6358 字 阅读 →
论文解读

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

语音识别 | 7.9/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9335 字 阅读 →
论文解读

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6535 字 阅读 →
论文解读

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6962 字 阅读 →
论文解读

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

语音编码 | 7.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →
论文解读

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

语音识别 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8512 字 阅读 →
论文解读

Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification

语音属性识别 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6013 字 阅读 →
论文解读

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7355 字 阅读 →
论文解读

Objects as Audio-Visual Modal Sound Fields

音频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6923 字 阅读 →
论文解读

A Dual Evaluation for Music Transcription

音乐转录 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8387 字 阅读 →
论文解读

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

音乐理解 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7164 字 阅读 →
论文解读

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7802 字 阅读 →
论文解读

StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7515 字 阅读 →
论文解读

Anomalous Sound Detection Meets Noise-Aware Self-Supervised Learning

音频事件检测 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

音频伪造检测 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6916 字 阅读 →
论文解读

REIMU: Efficient Heterogeneous Hierarchical Reasoning for SSL-Based Speech Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5558 字 阅读 →