论文解读

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5826 字 阅读 →
论文解读

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

音乐生成 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7244 字 阅读 →
论文解读

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

歌唱生成 | 6.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6210 字 阅读 →
论文解读

MEMS Microphones as Ultrasonic Transducers: Nonlinear Electrostatic Actuation and a Parametric Array Prototype

音频生成 | 5.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5133 字 阅读 →
论文解读

Multi-Task Multi-Frame Visual Piano Transcription

音乐转录 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6451 字 阅读 →
论文解读

Music Restoration via Latent Operator Optimization and Diffusion Model Priors

音频修复 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6911 字 阅读 →
论文解读

On the Geometry of Music Bandwidth Extension in Latent Spaces of Audio Codecs

音频理解 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5889 字 阅读 →
论文解读

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

音频理解 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6060 字 阅读 →
论文解读

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

音视频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7260 字 阅读 →
论文解读

Simulation-Based Plate-Reverb Parameter Estimation from a Single Impulse Response

音频理解 | 5.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4638 字 阅读 →
论文解读

Speaker Verification Under Real Classroom Conditions for English Speech

说话人验证 | 5.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7612 字 阅读 →
论文解读

Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

语音交互 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6106 字 阅读 →
论文解读

Towards Real-world Environment-aware Zero-shot Text-to-speech Synthesis via Disentangled Audio Infilling

语音合成 | 6.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6963 字 阅读 →
论文解读

What Is Sonification? Toward a Philosophy of Sonification

音频理解 | 3.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

音视频理解 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6640 字 阅读 →
论文解读

An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7399 字 阅读 →
论文解读

Analyzing Speech Condition Effects in Dysarthric ASR: A Layer-wise Probing Study

语音识别 | 5.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6341 字 阅读 →
论文解读

Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation

语音合成 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6646 字 阅读 →
论文解读

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

音频分类 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6641 字 阅读 →
论文解读

Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding

语音属性识别 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5046 字 阅读 →