论文解读

ARCHI-TTS: A Flow-Matching-Based Text-to-Speech Model with Self-Supervised Semantic Aligner and Accelerated Inference

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6329 字 阅读 →
论文解读

Asynchrony-Aware Decoupled Multimodal Control for Cued Speech Video Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →
论文解读

Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level Modulation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

CosyAccent: Duration-Controllable Accent Normalization using Source-Synthesis Training Data

语音转换 | 7.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5037 字 阅读 →
论文解读

Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis

语音克隆 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4837 字 阅读 →
论文解读

DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5316 字 阅读 →
论文解读

Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Diverse and Few-Step Audio Captioning via Flow Matching

音频字幕生成 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3494 字 阅读 →
论文解读

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Emotional Dimension Control in Language Model-Based Text-To-Speech: Spanning a Broad Spectrum of Human Emotions

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

Erasing Your Voice Before it’s Heard: Training-Free Speaker Unlearning for Zero-Shot Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5260 字 阅读 →
论文解读

FlashFoley: Fast Interactive Sketch2audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4806 字 阅读 →
论文解读

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4353 字 阅读 →
论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5600 字 阅读 →
论文解读

Gen-SER: When the Generative Model Meets Speech Emotion Recognition

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3718 字 阅读 →
论文解读

Hierarchical Discrete Flow Matching For Multi-Codebook Codec-Based Text-To-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

HyFlowSE: Hybrid End-To-End Flow-Matching Speech Enhancement via Generative-Discriminative Learning

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4024 字 阅读 →
论文解读

Instrument Generation Through Distributional Flow Matching and Test-Time Search

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5027 字 阅读 →
论文解读

Int-MeanFlow: Few-Step Speech Generation with Integral Velocity Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5048 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3037 字 阅读 →