论文解读

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

歌唱生成 | 7.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7140 字 阅读 →
论文解读

Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection

语音伪造检测 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7231 字 阅读 →
论文解读

Qwen-Audio-3.0-Gen-Preview Technical Report

音频生成 | 5.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7123 字 阅读 →
论文解读

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

音视频生成 | 6.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7788 字 阅读 →
论文解读

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

语音合成 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5892 字 阅读 →
论文解读

Parallel Decoding Distillation for Fast Image and Video Generation

音视频生成 | 6.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9236 字 阅读 →
论文解读

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7089 字 阅读 →
论文解读

Addressing Limited Data in Auditory Attention Decoding with Diffusion Generative Models

语音分离 | 5.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5908 字 阅读 →
论文解读

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

音频生成 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6266 字 阅读 →
论文解读

WanSong v1.0 Technical Report

音乐生成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6596 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-17

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25719 字 阅读 →
论文解读

Bring Music The Horizon: Music-Driven 360^\circ Video Generation

音视频生成 | 5.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Efficient Text-to-Audio Generation via Pruning

音频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5635 字 阅读 →
论文解读

Music-to-Dance Generation via Atomic Movements

音乐生成 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6911 字 阅读 →
论文解读

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

语音识别 | 5.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection

音频事件检测 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7397 字 阅读 →
论文解读

Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance

音乐生成 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7974 字 阅读 →
论文解读

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6661 字 阅读 →
论文解读

MusicMark: A Robust Generative Watermarking Framework for Music Generation

音频水印 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8863 字 阅读 →
论文解读

Qwen-Music Technical Report

音乐生成 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7232 字 阅读 →