论文解读

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

音频水印 | 8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7077 字 阅读 →
论文解读

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

音频生成 | 8.8/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11842 字 阅读 →
论文解读

Audio-to-Audio via Diffusion Warm Initialization

音频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6293 字 阅读 →
论文解读

AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5380 字 阅读 →
论文解读

FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

音频生成 | 9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5891 字 阅读 →
论文解读

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

语音生成 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5373 字 阅读 →
论文解读

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5275 字 阅读 →
论文解读

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

音频生成 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6874 字 阅读 →
论文解读

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4803 字 阅读 →
论文解读

Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry

音频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

BareWave: Waveform-Native Flow-Matching Text-to-Speech

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8292 字 阅读 →
论文解读

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6999 字 阅读 →
论文解读

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5816 字 阅读 →
论文解读

Audio Imitator: Controlling Timbre and Tempo in Video2Audio Synthesis with Audio Reference

音频生成 | 6/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14265 字 阅读 →
论文解读

Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

音频生成 | 9.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5926 字 阅读 →
论文解读

Where Rectified Flows Leak: Characterising Membership Signals Along the Interpolation Path

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6031 字 阅读 →
论文解读

F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6113 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8421 字 阅读 →
论文解读

Channel-Oriented Design for EEG-to-Music Reconstruction

音乐生成 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4877 字 阅读 →
论文解读

Differentiable Articulatory Copy-Synthesis of Biphonic Singing

音频生成 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6505 字 阅读 →