论文解读

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

音视频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6768 字 阅读 →
论文解读

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

扩散模型 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9515 字 阅读 →
论文解读

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

音频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8964 字 阅读 →
论文解读

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

语音合成 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7332 字 阅读 →
论文解读

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

音频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9065 字 阅读 →
论文解读

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

音乐生成 | 7.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7116 字 阅读 →
论文解读

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

语音编辑 | 7.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6259 字 阅读 →
论文解读

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

音乐生成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6469 字 阅读 →
论文解读

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

音频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7204 字 阅读 →
论文解读

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

音视频生成 | 7.4/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4241 字 阅读 →
论文解读

Masked diffusion enables coherent beat tracking

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5529 字 阅读 →
论文解读

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9417 字 阅读 →
论文解读

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

音频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6230 字 阅读 →
论文解读

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6266 字 阅读 →
论文解读

AcoustiTrace: When Plausible Sound Violates Physics

音视频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6749 字 阅读 →
论文解读

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

音乐转录 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5561 字 阅读 →
论文解读

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

音频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6173 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-03

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 46 分钟 · 22753 字 阅读 →
论文解读

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

歌唱生成 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7140 字 阅读 →
论文解读

Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection

语音伪造检测 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7231 字 阅读 →