论文解读

CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing

本文针对电影配音(视觉语音克隆)中音色保真度与唇形同步难以兼得的痛点,提出了一种基于流匹配的认知同步扩散Transformer(CoSyncDiT)框架。该方法受专业配音员认知过程启发,将噪声到语音的

 · 更新于 2026-09-24 · 约 12 分钟 · 5835 字 阅读 →