AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model
📄 AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model 标签:#音视频语音合成 #扩散模型 #知识蒸馏 #实时处理 #零样本 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音合成 | #扩散模型 | #知识蒸馏 #实时处理 | arxiv 👥 作者与机构 第一作者:Kwan Yun(韩国科学技术院文化技术研究生院博士生,共同第一作者) 共同第一作者:Serin Yoon(多伦多大学 DGP 实验室访问研究员,原韩国科学技术院文化技术研究生院硕士,论文标记为共同第一作者) 通讯作者:未说明 作者列表:Kwan Yun(韩国科学技术院文化技术研究生院)、Serin Yoon(多伦多大学 DGP 实验室访问研究员,论文标记共同第一作者)、Sunjin Jung(诚信女子大学计算机工程系助理教授)、Jung Eun Yoo(研发工程师,韩国科学技术院文化技术研究生院 2025 年博士毕业,具体公司未说明)、Inyup Lee(韩国科学技术院文化技术研究生院博士生)、Junyong Noh(韩国科学技术院文化技术研究生院教授) 💡 毒舌点评 这篇文章的切入点聪明:把 2D talking-head 视频扩散模型的运动先验“白嫖”到 3D blendshape 上,并用零音频嵌入做静帧微调,确实绕开了对 3D 动画数据的需求。但评测仍偏软:SyncNet 和用户研究不足以证明几何级口型正确性,蒸馏后的 AnyTalk_RT 在 LSE-D 上从 11.74 退化到 12.19、LSE-C 从 3.24 掉到 2.96,实时版的唇同步损失没有给出令人信服的补偿方案。此外,论文声称代码公开,但正文未给出可验证的仓库链接、模型权重或数据下载,开源可获取性存疑。 ...