论文解读

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

语音合成 | 9.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Vocal Identity Under Siege by AI Voice Cloning Technologies

语音合成 | 3.2/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3446 字 阅读 →
论文解读

Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5248 字 阅读 →
论文解读

SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4632 字 阅读 →
论文解读

The Dynamics of Human and AI-Generated Language: How Semantics Fluctuates across Different Timescales

语音合成 | 8.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5915 字 阅读 →
论文解读

The Hidden Cost of Pairwise Verification in Synthetic Speech Source Tracing

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6167 字 阅读 →
论文解读

UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction

语音合成 | 8.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6102 字 阅读 →
论文解读

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6593 字 阅读 →
论文解读

Deploying Speech-Driven 3D Facial Animation in Unreal Engine for Production-Ready Digital Humans

语音合成 | 6.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11714 字 阅读 →
论文解读

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →
论文解读

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5034 字 阅读 →
论文解读

BareWave: Waveform-Native Flow-Matching Text-to-Speech

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8292 字 阅读 →
论文解读

Cross-Modal Masking for Robust Silent Speech Synthesis Using sEMG and Lipreading

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7716 字 阅读 →
论文解读

End-to-End Training for Discrete Token LLM based TTS System

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6973 字 阅读 →
论文解读

FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4750 字 阅读 →
论文解读

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6999 字 阅读 →
论文解读

MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

语音转换 | 6.9/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11480 字 阅读 →
论文解读

NüshuVoice: Reviving the Voice of Endangered Nüshu with Pitch-Aware Text-to-Speech

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5298 字 阅读 →
论文解读

OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6802 字 阅读 →
论文解读

Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children's Speech via Multiscale Acoustic Fusion

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7186 字 阅读 →