论文解读

BeatEdit: Symbolic Music Generation as Explicit Editing

音乐生成 | 8.9/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13087 字 阅读 →
论文解读

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

音频生成 | 8.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8443 字 阅读 →
论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6464 字 阅读 →
论文解读

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6226 字 阅读 →
论文解读

Alethia: a Foundational Encoder for Voice Deepfakes

语音伪造检测 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6803 字 阅读 →
论文解读

SURF: Separation via Unsupervised Remixing Flow

语音分离 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8040 字 阅读 →
论文解读

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

生成模型 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

Amplifying Membership Signal Through Chained Regeneration

生成模型 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5952 字 阅读 →
论文解读

SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

知识蒸馏 | 10/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5503 字 阅读 →
论文解读

VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion

语音增强 | 7.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4813 字 阅读 →
论文解读

Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4894 字 阅读 →
论文解读

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6019 字 阅读 →
论文解读

Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5796 字 阅读 →
论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5638 字 阅读 →
论文解读

PhASE-Flow: Phonetic-Conditioned Acoustic Flow Matching in SSL Representation Domain for Speech Enhancement

语音增强 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6160 字 阅读 →
论文解读

AUDEDIT: Inversion-Free Text-Guided Editing with Pretrained Audio Flow Models

生成模型 | 7.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5877 字 阅读 →
论文解读

DuraMark: Duration-Embedded Watermarking in LLM-based TTS

生成模型 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5243 字 阅读 →
论文解读

FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

音频生成 | 9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5891 字 阅读 →
论文解读

Towards Robust Generative Speech Enhancement Using Vector Quantisation-Based Neural Audio Codec

语音增强 | 5.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8860 字 阅读 →
论文解读

MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

语音转换 | 6.9/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11480 字 阅读 →