论文解读

End-to-End Training for Discrete Token LLM based TTS System

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6973 字 阅读 →
论文解读

OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6802 字 阅读 →
论文解读

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5816 字 阅读 →
论文解读

dots.tts Technical Report

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3032 字 阅读 →
论文解读

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5546 字 阅读 →
论文解读

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7601 字 阅读 →
论文解读

CFMDCTCodec: A Low-Bitrate Neural Speech Codec with Noise-Prior-aware Conditional Flow Matching for MDCT-Spectral Enhancement

语音编码 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5946 字 阅读 →
论文解读

RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching

语音合成 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6377 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7201 字 阅读 →
论文解读

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7719 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7631 字 阅读 →
论文解读

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频修复 | 8.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8138 字 阅读 →
论文解读

WavFlow: Audio Generation in Waveform Space

音频生成 | 6.7/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11712 字 阅读 →
论文解读

Real-time Speech Restoration using Data Prediction Mean Flows

音频修复 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7597 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8863 字 阅读 →
论文解读

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

歌唱语音转换 | 5.5/10

 · 更新于 2026-09-25 · 约 28 分钟 · 13767 字 阅读 →
论文解读

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

音视频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9059 字 阅读 →
论文解读

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8272 字 阅读 →
论文解读

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5102 字 阅读 →