论文解读

MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation

音乐生成 | 7.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4922 字 阅读 →
论文解读

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5892 字 阅读 →
论文解读

Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization

语音克隆 | 7.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5923 字 阅读 →
论文解读

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10244 字 阅读 →
论文解读

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7089 字 阅读 →
论文解读

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7986 字 阅读 →
论文解读

Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding

语音合成 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6739 字 阅读 →
论文解读

Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English

语音合成 | 6.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7963 字 阅读 →
论文解读

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6369 字 阅读 →
论文解读

StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7788 字 阅读 →
论文解读

A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour

语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6602 字 阅读 →
论文解读

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

语音编码 | 9.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8587 字 阅读 →
论文解读

CS-ETS: Chaos-Inspired Samba-Based EMG-To-Speech Synthesis with Nonlinear Chaotic Losses

语音合成 | 5.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8594 字 阅读 →
论文解读

Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8461 字 阅读 →
论文解读

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

语音合成 | 6.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6532 字 阅读 →
论文解读

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

语音转换 | 6.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7105 字 阅读 →
论文解读

SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

音频水印 | 6.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10235 字 阅读 →
论文解读

X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System

语音翻译 | 7.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7793 字 阅读 →
论文解读

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8526 字 阅读 →
论文解读

Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants

语音合成 | 7.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6565 字 阅读 →