论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5344 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

语音对话系统 | 8.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4340 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 视频检索 | 8.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5230 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

语音对话系统 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5209 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

基准测试 | 8.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4207 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 9.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4501 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5344 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-02

共分析 4 篇语音/AI 论文

 · 更新于 2026-09-11 · 约 15 分钟 · 7026 字 阅读 →
论文解读

A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)

语音分离 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5194 字 阅读 →
论文解读

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

条件生成 | 8.0/10

 · 更新于 2026-09-11 · 约 7 分钟 · 3079 字 阅读 →
论文解读

Accent Conversion: A Problem-Driven Survey of Sociolinguistic and Technical Constraints

语音转换 | 7.5/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3936 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5309 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4392 字 阅读 →
论文解读

Audio Effect Estimation with DNN-Based Prediction and Search Algorithm

音乐理解 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4814 字 阅读 →
论文解读

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频问答 | 6.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4011 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-11 · 约 13 分钟 · 6451 字 阅读 →
论文解读

Beyond the Baseband: Adaptive Multi-Band Encoding for Full-Spectrum Bioacoustics Classification

生物声学 | 7.0/10

 · 更新于 2026-09-11 · 约 13 分钟 · 6321 字 阅读 →
论文解读

BUT System Description for CHiME-9 MCoRec Challenge

语音识别 | 6.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5308 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4581 字 阅读 →
论文解读

Do Sparse Autoencoders Capture Concept Manifolds?

可解释性 | 7.0/10

 · 更新于 2026-09-11 · 约 15 分钟 · 7300 字 阅读 →