论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4848 字 阅读 →
论文解读

Tracking the Trend in How Speech Synthesizers Deceive People

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4931 字 阅读 →
论文解读

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4444 字 阅读 →
论文解读

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

语音合成 | 9.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4189 字 阅读 →
论文解读

A survey of AI-generated voices and their detection

语音伪造检测 | 6.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4920 字 阅读 →
论文解读

Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding

语音合成 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6339 字 阅读 →
论文解读

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6343 字 阅读 →
论文解读

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7178 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6303 字 阅读 →
论文解读

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7721 字 阅读 →
论文解读

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9642 字 阅读 →
论文解读

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5096 字 阅读 →
论文解读

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5681 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6735 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7839 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6892 字 阅读 →
论文解读

ASR-Roundtrip Evaluation Can Mask Context- and Convention-Dependent Reading Errors in Chinese News TTS

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6433 字 阅读 →
论文解读

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

语音质量评估 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8060 字 阅读 →
论文解读

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

音视频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6768 字 阅读 →
论文解读

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5820 字 阅读 →