论文解读

MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music

音乐生成 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8189 字 阅读 →
论文解读

AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9598 字 阅读 →
论文解读

ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7717 字 阅读 →
论文解读

Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance

音乐生成 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7974 字 阅读 →
论文解读

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

音频生成 | 8.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8443 字 阅读 →
论文解读

FreyaTTS Technical Report

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8785 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9782 字 阅读 →
论文解读

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

语音分离 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8227 字 阅读 →
论文解读

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5163 字 阅读 →
论文解读

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

音视频生成 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7295 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7351 字 阅读 →
论文解读

Wan-Streamer v0.2: Higher Resolution, Same Latency

音视频交互 | 5.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5455 字 阅读 →
论文解读

Alethia: a Foundational Encoder for Voice Deepfakes

语音伪造检测 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6803 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7734 字 阅读 →
论文解读

SAM Audio: Segment Anything in Audio

音频分离 | 9.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6829 字 阅读 →
论文解读

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

音视频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6404 字 阅读 →
论文解读

SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

音频修复 | 8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8353 字 阅读 →
论文解读

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

生成模型 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion

语音增强 | 7.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4813 字 阅读 →
论文解读

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7085 字 阅读 →