📄 Vidu S1: A Real-Time Interactive Video Generation Model
标签:#音视频生成 #扩散模型 #实时处理 #高效推理
6.4/10 | 创新 1.2/2 | 严谨 1.5/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5
✅ 6.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #扩散模型 | #实时处理 #高效推理 | arxiv
👥 作者与机构
- 第一作者:张锦涛、姜凯、陈锦涛、王旭、罗洋、王玉洁(共同第一作者)
- 通讯作者:邓志劼、包凡、陈建飞、朱军
- 作者列表:张锦涛(清华大学, 生数科技)、姜凯(清华大学, 生数科技)、陈锦涛(清华大学, 生数科技)、王旭(清华大学, 生数科技)、罗洋(清华大学, 生数科技)、王玉洁(清华大学, 生数科技)、陈德川(清华大学, 生数科技)、李俊刚(清华大学, 生数科技)、叶成洋(未说明机构)、Marco Chen(未说明机构)、朱弘洲(清华大学, 生数科技)、赵旻(清华大学, 生数科技)、蒋宇轩(清华大学, 生数科技)、黄正坤(清华大学, 生数科技)、向辰东(清华大学, 生数科技)、郑凯文(清华大学, 生数科技)、王浩旭(清华大学, 生数科技)、王小航(清华大学, 生数科技)、贾琦(未说明机构)、陈鑫(未说明机构)、陈逸民(未说明机构)、蒋佑和(清华大学, 生数科技)、付方程(清华大学, 生数科技)、邓志劼(清华大学)、包凡(清华大学)、陈建飞(清华大学)、朱军(清华大学)
💡 毒舌点评
本文是一份典型的“工程重于科学”的系统技术报告。其最大价值在于详尽地展示了如何将学术界已有的技术(扩散模型、蒸馏、缓存策略、注意力加速)整合成一个可工作的实时交互视频生成产品,并坦诚地描述了工程实现中的关键瓶颈与解决方案(如TwinCache、量化策略选择)。然而,作为一篇寻求学术认可的论文,其严谨性令人失望:核心模型架构细节、训练超参数、数据集规模完全黑箱,实验设计回避与最强开源基线的直接对抗,评估深度不足,更像一份精心包装的营销技术白皮书而非可验证的科研贡献。对于追求可复现性与学术深度的读者,这篇文章提供的信息密度太低。
📌 核心摘要
- 要解决什么问题:现有视频生成模型多为离线、单次生成,缺乏实时交互能力,无法让用户在生成过程中通过语音等指令实时干预内容,且在长视频生成中易出现漂移和崩溃。
- 方法核心是什么:提出Vidu S1,一个实时交互式音视频生成系统。核心包括:1)构建一个高质量、带有精细时序标注的单人单镜头视频-音频数据处理流程;2)设计了一个三阶段训练流程(双向教师模型、因果教师模型、基于DMD和PCM的蒸馏模型),实现稳定的自回归生成和快速推理;3)集成TurboDiffusion和TurboServe,通过SageAttention/SpargeAttention/SLA注意力加速、自定义块级W8A8量化、Triton/CUDA算子融合、CUDA图、Ulysses序列并行等工程优化,实现高效推理。
- 与已有方法相比新在哪里:新在将语音作为直接、显式的实时控制信号,并声称支持无限时长稳定生成;同时,系统性地展示了构建实时交互视频生成系统的完整工程栈,特别是通过TwinCache机制平衡长序列一致性与视觉保真度。
- 主要实验结果如何:在自建的Vidu-StreamBench上,人类评估显示Vidu S1在多个维度优于商业系统,其中“主体可控性”偏好率达100%。在公开的HDTF基准上,Vidu S1报告取得了最佳的CSIM (0.9192), Sync-D (7.8470) 和 DOVER (0.5660),同时是表中唯一同时支持指令跟随和实时生成(540p, 42 FPS)的模型。
- 实际意义是什么:展示了构建实用化、低延迟、可交互视频生成系统的可行性,对直播、虚拟主播、在线教育等应用有潜在工程参考价值。
- 主要局限性是什么:论文未提供模型架构、训练超参数、数据集规模等核心信息,可复现性极差;实验对比基线选择不全面,缺少与主流开源SOTA模型(如Wan2.2-S2V-14B)在公平设置下的直接对比;对音频生成质量和失败案例分析不足;对“无限长度”生成的稳定性边界讨论缺失。
HDTF关键实验结果对比表(来自论文表1)
| 模型 | 指令跟随 | 实时性 | 分辨率 | FPS / 吞吐量 | CSIM ↑ | Sync-D ↓ | DOVER ↑ |
|---|---|---|---|---|---|---|---|
| OmniAvatar | × | × | 480p | – | 0.8062 | 9.242 | 0.5476 |
| StableAvatar-1.3B | × | × | 480p | – | 0.8358 | 11.18 | 0.5560 |
| Hallo3 | × | × | 480×720 | – | 0.7698 | 8.660 | 0.5313 |
| Wan2.2-S2V-14B | × | × | 480p/720p | – | 0.7936 | 8.255 | 0.5510 |
| LiveAvatar | × | ✓ | – | – | 0.8127 | 8.447 | 0.5639 |
| LemonSlice | × | ✓ | 368×560 | – | 0.8407 | 7.921 | 0.5196 |
| HeyGen | × | ✓ | – | 25 FPS | 0.9191 | 8.037 | 0.4864 |
| Kling Avatar 2.0 | ✓ | × | – | – | 0.8688 | 8.158 | 0.5406 |
| Vidu S1 | ✓ | ✓ | 540p (960×540) | 42 FPS | 0.9192 | 7.8470 | 0.5660 |
🔗 开源详情
- 代码:论文中未提及代码链接。
- 模型权重:论文中未提及模型权重(如HuggingFace/ModelScope)的下载链接。
- 数据集:论文中未提及用于训练的原始数据集的具体名称、下载链接或开源协议。
- Demo:https://vidu.com/vidu-stream (论文中明确提供:“A playable online demo is available at https://vidu.com/vidu-stream.”)
- 复现材料:论文中未提及提供训练配置、检查点等具体的复现材料。
- 论文中引用的开源项目:
- TurboDiffusion: https://arxiv.org/abs/2512.16093
- TurboServe: https://arxiv.org/abs/2606.19271
- SageAttention (含多个版本): https://arxiv.org/abs/2502.18137, https://arxiv.org/abs/2505.21136, https://arxiv.org/abs/2505.11594, https://arxiv.org/abs/2603.02170, https://arxiv.org/abs/2502.13515
- SpargeAttention (含多个版本): https://arxiv.org/abs/2502.18137, https://arxiv.org/abs/2602.13515
- SLA (Sparse-Linear Attention,含多个版本): https://arxiv.org/abs/2509.24006, https://arxiv.org/abs/2602.12675
- Phased Consistency Models (PCM): https://arxiv.org/abs/2505.13211
- Distribution Matching Distillation (DMD): 引用自论文 “One-step diffusion with distribution matching distillation” (CVPR 2024)。
- DeepSpeed Ulysses: https://arxiv.org/abs/2309.14509
- Qwen3-Omni: https://arxiv.org/abs/2509.17765
- Gemini: https://arxiv.org/abs/2312.11805
- HDTF (数据集): https://arxiv.org/abs/2103.06228
🏗️ 方法概述和架构
Vidu S1是一个端到端的实时交互式音视频生成系统,旨在以自回归方式生成与用户语音指令同步的、无限时长的视频和音频流。其架构可分解为数据准备、三阶段模型训练和推理系统优化三个主要部分。
- 数据准备与处理 系统构建了一个多阶段数据过滤管道,将原始视频转化为高质量训练数据。该流程依次为:
- 预过滤:剔除技术质量不达标(低帧率、低分辨率、音画不同步)的视频。
- 切片:沿镜头边界分割为3-60秒的单镜头片段,确保时序连贯。
- 主体过滤:确保每个片段仅包含一个主要人物,并占据合理画面比例。
- 质量与安全筛选:结合专家模型与“全能模型”(如Qwen3-Omni, Gemini)进行帧级视觉质量、内容安全、镜头稳定性和交互性的评估与过滤。文中指出,仅使用专家模型在评估视频数据时存在局限(如难以处理夸张的2D动画),因此引入全能模型进行全局语义理解作为补充。
- 说话人分离与过滤:将音频分离并标注说话人,过滤掉包含重叠语音的片段。为解决在唱歌或强背景音乐下模型不稳定的问题,引入启发式规则丢弃语音能量比例过低的片段。
- 字幕生成:为每个片段生成两种粒度的字幕:提供全局语义锚点的“片段级字幕”,以及与语音片段对齐、提供细粒度条件信号的“语音感知分块级字幕”。采用双路径策略,从视频帧推断视觉属性,从音频轨推断声学属性,以减少跨模态幻觉。
- 三阶段模型训练
- 阶段一:双向教师模型训练:训练一个基础的扩散模型。对于长度为N的序列,模型在完整的条件序列
\(c_{1:N}\)和完整序列的噪声状态\(x^N_{t_j}\)下,预测去噪后的联合视频-音频状态\(\hat{x}^N_0\)。训练目标是标准的扩散去噪损失\(L_{bi}\)。此阶段为后续的因果自回归生成建立高质量生成先验。 - 阶段二:因果教师模型训练:将双向模型初始化为因果模型,通过添加因果注意力掩码,使其只能访问当前帧及之前的历史信息
\(c_{\leq i}\)和\(x_{(i)}\)进行自回归生成。为提高模型对不完美前缀的鲁棒性,训练采用混合策略:以概率p选择“教师强制”(历史前缀为干净的真实数据\(x_{(i)}^0\),即\(\tau_j=0\))或“扩散强制”(历史前缀为带噪数据\(x_{(i)}^{\tau_j}\),\(\tau_j>0\))。损失函数为因果自回归去噪损失\(L_{causal}\)。 - 阶段三:DMD与PCM正则化蒸馏:为解决多步去噪导致的推理缓慢问题,应用分布匹配蒸馏将多步生成压缩到少数几步。DMD梯度
\(\nabla\theta L_{DMD}\)用于最小化生成分布与数据分布的差异。为防止模式退化,引入了相位一致性模型的正则化项\(L_{PCM}\),使用感知特征距离作为一致性约束。最终优化目标是DMD梯度与PCM正则化目标的加权组合。
- 推理与系统优化
- 流式推理核心:采用滑动窗口解码支持无限长度生成。窗口包含固定的“参考上下文”(第一帧和第一生成状态)、缓存的历史状态、当前待去噪状态。为提升效率与一致性,引入两项技术:
- RoPE重定位:缓存历史键值应用RoPE前的特征,窗口滑动时根据其在当前窗口中的新相对位置重新应用RoPE,避免重复计算。
- TwinCache:一种阶段感知的缓存策略。为每个历史生成状态维护两个缓存:一个来自中间去噪步骤的“有噪缓存”
\(x_{(i)}^{\tau_j}\)和一个来自最终步骤的“干净缓存”\(x_{(i)}^0\)。在去噪的中间步骤,模型关注有噪历史(起到低通滤波、稳定时序的作用);在最后一步,切换到干净历史以恢复细节和身份一致性。这种机制解耦了时序传播与外观精修。
- 推理基础设施加速:集成TurboDiffusion(单卡加速)和TurboServe(集群级流式服务)进行深度优化。主要工程手段包括:
- 注意力加速:使用SageAttention, SpargeAttention, SLA等。
- 线性层量化:实施自定义的块级W8A8量化,以解决per-tensor和per-channel量化易受异常值影响的问题。
- 算子融合:将RMSNorm等操作序列融合进自定义Triton/CUDA内核。
- CUDA图:捕获固定结构的子图并重复回放,减少CPU内核启动开销。
- 多GPU并行:采用Ulysses风格的序列并行策略进行多GPU推理。
💡 核心创新点
- 实时交互式音视频生成范式:将语音作为直接、实时的控制信号,允许用户在生成过程中随时干预,突破了传统离线视频生成的限制。
- 面向长时序稳定的训练与推理框架:通过三阶段训练(双向→因果→蒸馏)和混合训练策略赋予模型稳定的自回归生成能力。在推理端,创新的TwinCache机制通过解耦时序传播与外观精修,有效平衡长期一致性和视觉保真度。
- 全栈高效系统工程:并非仅仅提出模型,而是展示了从数据、训练到推理部署的完整工业级pipeline设计。特别是将一系列注意力加速、量化、融合、图优化等工程手段系统性地应用于实时生成场景,并实现了在消费级GPU上达到实时性能(42 FPS)的工程目标。
- 特定领域的评估基准:提出了Vidu-StreamBench,一个专注于评估实时交互式数字人生成能力的基准,涵盖指令跟随、运动动态、身份一致性等维度,弥补了现有公共基准对此类能力评估的空白。
📊 实验结果
我们基于自建的 Vidu-StreamBench 和公开的 HDTF 数据集评估了 Vidu S1 的性能,并与多个基线模型进行了对比。评估指标包括身份保持(CSIM↑)、唇音同步(Sync-D↓)、视频质量(DOVER↑)以及人类偏好。同时,我们也报告了模型的实时生成能力。
HDTF 定量评估
下表展示了在 HDTF 数据集上的定量比较结果。Vidu S1 在 CSIM(身份保持)、Sync-D(唇音同步)和 DOVER(视频质量)三个核心指标上均取得了最佳成绩。同时,Vidu S1 是表中唯一同时支持指令跟随和实时生成的模型。
| 模型 | 指令跟随 | 实时 | 分辨率 | FPS / 吞吐量 | CSIM ↑ | Sync-D ↓ | DOVER ↑ |
|---|---|---|---|---|---|---|---|
| OmniAvatar | × | × | 480p | – | 0.8062 | 9.242 | 0.5476 |
| StableAvatar-1.3B | × | × | 480p | – | 0.8358 | 11.18 | 0.5560 |
| Hallo3 | × | × | 480×720 | – | 0.7698 | 8.660 | 0.5313 |
| Wan2.2-S2V-14B | × | × | 480p/720p | – | 0.7936 | 8.255 | 0.5510 |
| LiveAvatar | × | ✓ | – | – | 0.8127 | 8.447 | 0.5639 |
| LemonSlice | × | ✓ | 368×560 | – | 0.8407 | 7.921 | 0.5196 |
| HeyGen | × | ✓ | – | 25 FPS | 0.9191 | 8.037 | 0.4864 |
| Kling Avatar 2.0 | ✓ | × | – | – | 0.8688 | 8.158 | 0.5406 |
| Vidu S1 | ✓ | ✓ | 540p (960×540) | 42 FPS | 0.9192 | 7.847 | 0.5660 |
表格说明:表格内容基于论文原文Table 1。最佳结果已加粗。部分模型的FPS/吞吐量信息在原文中标记为“–”,表示未提供具体数值或未在测试环境中测量。
Vidu-StreamBench 人类评估
在针对实时交互场景设计的 Vidu-StreamBench 上,我们进行了成对的 A/B 偏好测试。评估维度包括总体偏好、运动动态、身份一致性、音视频同步和主体可控性。下表总结了评估结果。
| 比较模型 | 评估维度 | Vidu S1 偏好率 | 相同偏好率 | 另一模型偏好率 |
|---|---|---|---|---|
| Vidu S1 vs. HeyGen | 总体 | 56% | 16% | 28% |
| 运动动态 | 68% | 18% | 14% | |
| 身份一致性 | 44% | 34% | 22% | |
| 音视频同步 | 52% | 28% | 20% | |
| 主体可控性 | 100% | – | – | |
| Vidu S1 vs. LemonSlice | 总体 | 46% | 24% | 30% |
| 运动动态 | 50% | 30% | 20% | |
| 身份一致性 | 40% | 32% | 28% | |
| 音视频同步 | 54% | 22% | 24% | |
| 主体可控性 | 100% | – | – | |
| Vidu S1 vs. Kling-Avatar-2.0 | 总体 | 48% | 22% | 30% |
| 运动动态 | 50% | 30% | 20% | |
| 身份一致性 | 40% | 40% | 20% | |
| 音视频同步 | 60% | 16% | 24% | |
| 主体可控性 | 60% | 24% | 16% |
表格说明:表格内容基于论文原文Figure 3的数据描述。其中,Vidu S1在“主体可控性”维度上对HeyGen和LemonSlice的偏好率达到100%,表明在遵循用户动作指令方面具有绝对优势。
实时生成能力验证
论文报告,Vidu S1 在 RTX 5090 GPU 上,使用 3 步生成配置,可在 540p 分辨率下实现平均 42 FPS 的吞吐量。这超过了实时播放(>30 FPS)的阈值,验证了其满足低延迟交互应用(如直播对话、虚拟主播等)的实时性要求。
关键结论
- 指标领先:在 HDTF 公开基准上,Vidu S1 在身份保持(CSIM)、唇音同步(Sync-D)和视频质量(DOVER)三项定量指标上均达到最优,表明其在生成质量上具有综合优势。
- 交互可控性强:在针对实时交互场景的人类评估中,Vidu S1 在“总体偏好”和“运动动态”等维度上普遍优于对比的商业系统。尤其是在“主体可控性”维度上,对 HeyGen 和 LemonSlice 达到了 100% 的偏好率,证明了其出色的指令跟随能力。
- 满足实时要求:Vidu S1 是本次评估中唯一一个在支持指令跟随的同时,还报告了满足实时生成(42 FPS)指标的模型,实现了质量与效率的平衡。
🔬 细节详述
- 训练数据:论文详细描述了数据过滤流程,但未提供最终训练数据的具体规模、来源的详细构成比例以及数据增强的具体策略。仅说明来源为直播/对谈类视频和影视片段。
- 损失函数:训练中使用了三个损失函数:双向去噪损失
\(L_{bi}\)(公式3)、因果自回归去噪损失\(L_{causal}\)(公式5)、以及蒸馏阶段的DMD损失\(\nabla\theta L_{DMD}\)(公式6)和PCM正则化损失\(L_{PCM}\)(公式7)。论文未给出DMD与PCM损失项的具体权重组合。 - 训练策略:仅提及三阶段训练和混合训练策略(伯努利采样选择教师强制或扩散强制),但未提供学习率、优化器、batch size、训练步数/轮数、调度策略等关键训练超参数。混合策略中的概率
p也未指定。 - 关键超参数:论文未提及模型的具体架构(如Transformer层数、隐藏维度、注意力头数)、模型参数量、扩散过程的时间步数、蒸馏的具体步数(仅说明“3步生成配置”)、滑动窗口的大小、TwinCache中有噪缓存对应的去噪步
\tau_j的具体值。 - 训练硬件:未说明模型训练所使用的GPU型号和数量,以及训练时长。
- 推理细节:明确说明了采用3步生成配置。提到了滑动窗口、RoPE重定位、TwinCache等技术,但未给出窗口大小等具体配置。推理硬件为RTX 5090 GPU。
- 正则化/稳定技巧:除了混合训练策略和TwinCache外,未提及其他正则化技巧。
⚖️ 评分理由
创新性 (1.2/2):系统整合了实时交互、语音控制、长视频生成和高效推理,提出TwinCache等工程创新,但核心模型架构基于已有技术,原创性理论贡献有限。
技术严谨性 (1.5/1.5):方法描述逻辑清晰,公式表达合理,系统设计如TwinCache的动机和解释有说服力,无公开的推导错误或不合理假设。
实验充分性 (1/1.5):提供了HDTF基准测试和人类评估支持系统性能声明,但对比基线不全面,缺少与最强开源SOTA的直接对比和组件消融实验。
清晰度 (0.8/1):论文结构清晰,图表直观,摘要和引言概括明确,但技术细节部分有时跳跃,一些术语解释可以更充分。
影响力 (0.4/1.5):核心贡献属于视频生成领域,音频仅作为控制信号和同步生成的附带模态,对语音/音乐/音频领域直接研究贡献有限。
开源 (0.2/1.5):仅提供在线Demo链接,未开源代码、模型权重或数据集等核心产物,完全不可复现且无开源承诺。
可复现性 (0.1/0.5):严重缺乏模型架构、训练超参数、数据集规模、硬件配置等关键细节,复现步骤不完整,无法复现训练过程。
工程/实践价值 (1.2/1.5):展示了从数据处理、模型训练到推理部署的完整工业级pipeline,集成多种工程优化实现消费级GPU上实时性能,具有实践参考价值。
🚨 局限与问题
- 论文明确承认的局限:论文在结论和讨论中未明确列出其局限性。
- 审稿人发现的潜在问题:
- 学术透明度不足:最大的问题是缺乏关键的技术细节和实验对比,使得这篇论文更像一份产品宣传技术博客,而非可接受同行评议的学术论文。严重依赖“最佳性能”的声明但证据链不完整。
- 实验对比不公平且不全面:与商业系统的对比缺乏可控性(商业系统版本、配置未知)。与开源模型的对比不全面,刻意或无意地回避了与当前最强开源SOTA的直接竞争。
- 模型能力边界不清:论文未充分讨论模型在处理复杂多人场景、剧烈运动、非人主体(如宠物,尽管摘要中提及支持)或极端语音条件下的表现。其“无限长度”生成的稳定性缺乏在更多样化场景和更长时间下的验证。
- 评估指标局限:CSIM、Sync-D、DOVER是标准指标,但对于评估“指令跟随”和“交互质量”这类更主观、更高层次的能力,仅靠人类评估的成对偏好测试可能不够全面和深入。
- 音频生成质量未深入评估:虽然模型同步生成音频,但评估重点明显在视觉,对生成音频本身的质量(如音质、自然度、与语音指令的语义一致性)缺乏独立评估。
- 工程细节可验证性低:关于TurboDiffusion和TurboServe的集成效果,论文仅展示了最终性能,缺少各工程组件(如具体量化方法、注意力优化)对最终性能贡献的分离评估。