论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5530 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4936 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Continuous Audio Language Models

音频生成 音乐生成 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5470 字 阅读 →
论文解读

Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4234 字 阅读 →
论文解读

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6079 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5924 字 阅读 →
论文解读

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5125 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5010 字 阅读 →
论文解读

SCRAPL: Scattering Transform with Random Paths for Machine Learning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4976 字 阅读 →
论文解读

SmartDJ: Declarative Audio Editing with Audio Language Model

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4459 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →
论文解读

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4891 字 阅读 →
论文解读

Token-Based Audio Inpainting via Discrete Diffusion

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4973 字 阅读 →
论文解读

Toward Complex-Valued Neural Networks for Waveform Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4635 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5965 字 阅读 →
论文解读

A Speech-Driven Paradigm for Physics-Informed Modeling of Coupled Micro-Speakers

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →