论文解读

FreyaTTS Technical Report

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8785 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9782 字 阅读 →
论文解读

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9038 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频交互 | 5.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6461 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频生成 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7039 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7847 字 阅读 →
论文解读

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

语音交互 | 5.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8798 字 阅读 →
论文解读

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6413 字 阅读 →
论文解读

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

音视频生成 | 8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9827 字 阅读 →
论文解读

Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy

语音增强 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5900 字 阅读 →
论文解读

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

扩散模型 | 7.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7387 字 阅读 →
论文解读

Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

语音识别 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6415 字 阅读 →
论文解读

Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking

音频修复 | 7.4/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8704 字 阅读 →
论文解读

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5305 字 阅读 →
论文解读

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8684 字 阅读 →
论文解读

REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation

音视频生成 | 7.3/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12601 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7734 字 阅读 →
论文解读

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

音视频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6404 字 阅读 →
论文解读

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

音视频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7540 字 阅读 →