论文解读

Model-Agnostic Meta-Learning Initialization for Distributed Multichannel Active Noise Control

主动降噪 | 5.1/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5740 字 阅读 →
论文解读

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

语音识别 | 6.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5685 字 阅读 →
论文解读

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

语音合成 | 5.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7230 字 阅读 →
论文解读

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

医疗音频 | 4.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6862 字 阅读 →
论文解读

Tensor-Based Joint Pitch and DOA Estimation

声源定位 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6290 字 阅读 →
论文解读

TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

音频理解 | 6.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8405 字 阅读 →
论文解读

Versatile On-device Adaptation at the Edge by Unifying Few-shot, Zero-shot, Continual, and In-context Learning

元学习 | 8.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7787 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-03

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 46 分钟 · 22753 字 阅读 →
论文解读

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

音视频理解 | 8.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5406 字 阅读 →
论文解读

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

语音识别 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6977 字 阅读 →
论文解读

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

语音交互 | 7.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8276 字 阅读 →
论文解读

Correlation between prosody and pragmatics: A case study of the discourse marker hālā `now' in Persian

语音属性识别 | 4.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6591 字 阅读 →
论文解读

CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation

音乐源分离 | 7.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5803 字 阅读 →
论文解读

Digital Harf: A Clinically Integrated Multimodal AI System for Pervasive Arabic Speech and Language Therapy

语音交互 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5532 字 阅读 →
论文解读

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5912 字 阅读 →
论文解读

Enhancing Law-Enforcement Audio Transcription: A LoRA-Based Adaptation of Whisper for BWC Footage

语音识别 | 4.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5460 字 阅读 →
论文解读

Improved Robustness in AI-Generated Music Detection

音频伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7579 字 阅读 →
论文解读

Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano Performances

音乐理解 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6828 字 阅读 →
论文解读

RIPPLE: Generating Multi-Channel Phase, Not Recovering It

音频理解 | 7.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8301 字 阅读 →
论文解读

SKY-Piano: A Multimodal Piano Performance Dataset

音频理解 | 8.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6136 字 阅读 →