REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
📄 REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation #音视频生成 #扩散模型 #知识蒸馏 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音视频生成 | #扩散模型 | #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Haotian Wang(中国科学技术大学) 共同第一作者:Yuzhe Weng(中国科学技术大学) 通讯作者:Jun Du(中国科学技术大学) 作者列表:Haotian Wang (中国科学技术大学), Yuzhe Weng (中国科学技术大学), Jun Du (中国科学技术大学), Haoran Xu (iFLYTEK), Xiaoyan Wu (iFLYTEK), Shan He (iFLYTEK), Bing Yin (iFLYTEK), Cong Liu (iFLYTEK), Qingfeng Liu (中国科学技术大学/iFLYTEK,机构标注为双隶属) 💡 毒舌点评 这篇论文是diffusion-based talking head领域一次扎实的系统工程突破,首次在单卡上实现了端到端扩散模型的实时流式生成。ID-Context Cache将KV缓存思想优雅地适配到扩散Transformer的半自回归场景中,而异步流式蒸馏(ASD)策略通过信息论对比和运动平滑约束,有效缓解了流式生成固有的误差累积问题,实验效果确实亮眼。然而,冷静审视后不难发现,其对语音/音频领域本身的贡献相当有限——SpeechAE基本承袭READ架构,核心驱动力来自Whisper特征,并未在声学建模或音频表征层面提出新见解。净输入/输出的思维来看,论文解决的核心问题(实时性、流式)和采用的关键技术(Cache、蒸馏、高压缩VAE)均是视频生成和多模态社区的经典思想,其对语音/音频研究者的方法论启发远小于对视觉生成社区的工程示范。此外,完全不开源、不提供模型权重或在线demo,在当前顶会语境下显得诚意不足,39页附录中的细节虽多,但仍不足以弥补复现门槛极高的缺陷。 ...