论文解读

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

语音识别 | 8.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7224 字 阅读 →
论文解读

Investigating the Integration of Spatial Information in Foundation-Model-Based Speaker Diarization

说话人日志 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6032 字 阅读 →
论文解读

Neural Morphing: Sequence-Optimized Token-Level Morphing in Neural Audio Codecs

音频编码 | 6.4/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9078 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 8.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6987 字 阅读 →
论文解读

Learning-based Physics-Constrained Neural Kernel for Sound Field Estimation With Source-Position-Dependent Directional Weighting

声源定位 | 5.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

音频分类 | 6.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7376 字 阅读 →
论文解读

Taste-aware music retrieval from audio embeddings

音乐检索 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6947 字 阅读 →
论文解读

Alethia: a Foundational Encoder for Voice Deepfakes

语音伪造检测 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6803 字 阅读 →
论文解读

Efficient Distributed MLLM Training with Cornstarch

音视频理解 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5041 字 阅读 →
论文解读

NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding

语音识别 | 6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12965 字 阅读 →
论文解读

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

音乐生成 | 8.1/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2789 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5177 字 阅读 →
论文解读

Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding

音频编解码 | 8.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4877 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6751 字 阅读 →
论文解读

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4860 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5690 字 阅读 →
论文解读

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10439 字 阅读 →
论文解读

Scaling Human and G2P Supervision for Robust Phonetic Transcription

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4873 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6462 字 阅读 →
论文解读

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

语音合成 | 8.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6116 字 阅读 →