论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9061 字 阅读 →
论文解读

Voice ''Cloning'' is Style Transfer

语音克隆 | 7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8857 字 阅读 →
论文解读

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

语音克隆 | 8.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8272 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12846 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6263 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音克隆 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4919 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3720 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2500 字 阅读 →
论文解读

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

语音克隆 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4425 字 阅读 →
论文解读

Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis

语音克隆 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4837 字 阅读 →
论文解读

FED-PISA: Federated Voice Cloning Via Personalized Identity-Style Adaptation

语音克隆 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5699 字 阅读 →
会议任务专题

ICASSP 2026 - 语音克隆

共 4 篇 ICASSP 2026 语音克隆 方向论文

 · 更新于 2026-09-24 · 约 14 分钟 · 6521 字 阅读 →
论文解读

Marco-Voice: A Unified Framework for Expressive Speech Synthesis with Voice Cloning

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4379 字 阅读 →
论文解读

PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models

语音对话系统 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4703 字 阅读 →
论文解读

PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6124 字 阅读 →
论文解读

RoCo: Robust Code for Fast and Effective Proactive Defense against Voice Cloning Attack

音频安全 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5166 字 阅读 →
论文解读

VoxMorph: Scalable Zero-Shot Voice Identity Morphing via Disentangled Embeddings

语音克隆 | 9.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5242 字 阅读 →
论文解读

VT-Heads: Voice Cloning and Talking Head Generation from Text Based on V-DiT

视频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3563 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4244 字 阅读 →