论文解读

AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling

音频生成 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8049 字 阅读 →
论文解读

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

音频生成 | 6.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8585 字 阅读 →
论文解读

Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems

音色迁移 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8892 字 阅读 →
论文解读

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

视频编辑 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →
论文解读

Stage-adaptive audio diffusion modeling

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5813 字 阅读 →
论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4618 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10720 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4141 字 阅读 →
论文解读

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6971 字 阅读 →
论文解读

Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6318 字 阅读 →
论文解读

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

跨模态生成 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5159 字 阅读 →
会议任务专题

ICLR 2026 - 音频生成

共 9 篇 ICLR 2026 音频生成 方向论文

 · 更新于 2026-09-25 · 约 48 分钟 · 23875 字 阅读 →
论文解读

Latent Fourier Transform

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4922 字 阅读 →
论文解读

LayerSync: Self-aligning Intermediate Layers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4057 字 阅读 →
论文解读

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5854 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →
论文解读

SCRAPL: Scattering Transform with Random Paths for Machine Learning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5085 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6225 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 24 分钟 · 12017 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5314 字 阅读 →