论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7824 字 阅读 →
论文解读

Voice ''Cloning'' is Style Transfer

语音克隆 | 7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8857 字 阅读 →
论文解读

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8691 字 阅读 →
论文解读

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9925 字 阅读 →
论文解读

PoDAR: Power-Disentangled Audio Representation for Generative Modeling

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8991 字 阅读 →
论文解读

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

语音生成 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8743 字 阅读 →
论文解读

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8272 字 阅读 →
论文解读

AsymK-Talker: Real-Time and Long-Horizon Talking Head Generation via Asymmetric Kernel Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6222 字 阅读 →
论文解读

MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

音频安全 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5419 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4081 字 阅读 →
论文解读

Continuous Audio Language Models

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5685 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 9.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4530 字 阅读 →
论文解读

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5627 字 阅读 →
论文解读

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5075 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4836 字 阅读 →
论文解读

Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5137 字 阅读 →
论文解读

Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Residual Representations for Expressive End-to-End Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9658 字 阅读 →
会议任务专题

ICLR 2026 - 语音合成

共 10 篇 ICLR 2026 语音合成 方向论文

 · 更新于 2026-09-25 · 约 48 分钟 · 23823 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5615 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4034 字 阅读 →