论文解读

Mitigating Stethoscope-Induced Shortcuts in Respiratory Sound Classification under Federated Domain Generalization with Causality-Inspired Interventions

音频分类 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5537 字 阅读 →
论文解读

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7601 字 阅读 →
论文解读

Diffusion Large Language Models for Visual Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5892 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4782 字 阅读 →
论文解读

When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6313 字 阅读 →
论文解读

Why We Need Speech to Evaluate Speech Translation

语音翻译 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6500 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7769 字 阅读 →
论文解读

MERIT: Learning Disentangled Music Representations for Audio Similarity

音频检索 | 9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5351 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6277 字 阅读 →
论文解读

Music Transcription with (Almost) No Supervision

音乐转录 | 10/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5872 字 阅读 →
论文解读

Toward Natural Emotional Text-To-Speech System with Fine-Grained Non-Verbal Expression Control

语音合成 | 5.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5339 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-26

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 34648 字 阅读 →
论文解读

CoarseSoundNet: Building a reliable model for ecological soundscape analysis

音频分类 | 8.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8312 字 阅读 →
论文解读

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

语音识别 | 9.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7818 字 阅读 →
论文解读

Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals

语音质量评估 | 5.8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9969 字 阅读 →
论文解读

Executable Boundary Contracts for Sound Event Traces

音频事件检测 | 8.4/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9164 字 阅读 →
论文解读

EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge

音频深度伪造检测 | 5.3/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9344 字 阅读 →
论文解读

Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction

语音生物标志物 | 6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8390 字 阅读 →