论文解读

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

音频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9341 字 阅读 →
论文解读

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

音乐生成 | 7.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7116 字 阅读 →
论文解读

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7896 字 阅读 →
论文解读

Rethinking Automatic Music Mixing as Sequential Stem Blending

音乐生成 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5496 字 阅读 →
论文解读

InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching Inversion

音频质量评估 | 6.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5422 字 阅读 →
论文解读

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5645 字 阅读 →
论文解读

StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7515 字 阅读 →
论文解读

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

自回归模型 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

Towards Real-world Environment-aware Zero-shot Text-to-speech Synthesis via Disentangled Audio Infilling

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6963 字 阅读 →
论文解读

AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

语音超分 | 5.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5441 字 阅读 →
论文解读

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

音频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5961 字 阅读 →
论文解读

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

音频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7166 字 阅读 →
论文解读

RIPPLE: Generating Multi-Channel Phase, Not Recovering It

音频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8301 字 阅读 →
论文解读

MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation

音乐生成 | 7.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4922 字 阅读 →
论文解读

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7986 字 阅读 →
论文解读

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

音乐生成 | 6.8/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10649 字 阅读 →
论文解读

FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration

音乐生成 | 7.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6828 字 阅读 →
论文解读

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8526 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-20

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 52 分钟 · 25690 字 阅读 →