论文解读

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

语音交互 | 10.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4838 字 阅读 →
论文解读

Do Time-Series Foundation Models Pay Off for Industrial Monitoring? A Cost-Aware Empirical Study

音频事件检测 | 8.8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4802 字 阅读 →
论文解读

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

语音情感识别 | 8.4/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4585 字 阅读 →
论文解读

EchoWM: Open and Enterable Omnimodal World Models

音视频生成 | 10.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5157 字 阅读 →
论文解读

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

音频分离 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4945 字 阅读 →
论文解读

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

音视频交互 | 5.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4533 字 阅读 →
论文解读

LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery

音频修复 | 10.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4404 字 阅读 →
论文解读

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

音视频生成 | 8.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4722 字 阅读 →
论文解读

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

音频理解 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6302 字 阅读 →
论文解读

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

语音识别 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5235 字 阅读 →
论文解读

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

音视频理解 | 7.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4901 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

音乐推荐 | 8.3/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4665 字 阅读 →
论文解读

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

语音识别 | 8.2/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4731 字 阅读 →
论文解读

MusPyExpress: Extending MusPy with Enhanced Expression Text Support

音乐理解 | 8.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5294 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4900 字 阅读 →
论文解读

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

音视频理解 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4759 字 阅读 →
论文解读

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

音频理解 | 8.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5275 字 阅读 →
论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4848 字 阅读 →
论文解读

Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing

语音属性识别 | 9.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4955 字 阅读 →