论文解读

SURE: Synergistic Uncertainty-Aware Reasoning for Multimodal Emotion Recognition in Conversations

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4997 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

Target Speaker Anonymization in Multi-Speaker Recordings

语音匿名化 | 7.6/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3887 字 阅读 →
论文解读

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3624 字 阅读 →
论文解读

TextlessRAG: End-to-End Visual Document RAG by Speech without Text

语音问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4218 字 阅读 →
论文解读

The 3rd Clarity Prediction Challenge: A Machine Learning Challenge for Hearing aid Speech Intelligibility Prediction

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3264 字 阅读 →
论文解读

The Muse Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMs

音乐理解 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3655 字 阅读 →
论文解读

The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion to Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3758 字 阅读 →
论文解读

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3637 字 阅读 →
论文解读

Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3966 字 阅读 →
论文解读

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3527 字 阅读 →
论文解读

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4322 字 阅读 →
论文解读

When Voice Matters: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3980 字 阅读 →
论文解读

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

语音生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4296 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43144 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4909 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3585 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4842 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5555 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20102 字 阅读 →