Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans
📄 别等整句说完:把数字人的手势变成一条受因果约束的数据流 英文题目:Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans 一句话:Super Star 的价值在于把离线动作质量与在线因果约束分给不同的数据流:用非因果合成器造训练数据,却让部署端只从截至当前的语音和动作历史预测下一步。 标签:#音视频交互 #自回归模型 #Transformer #流式处理 #实时处理 评分:6.9/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 💬 毒舌点评 Super Star 最扎实的地方,是没有把“流式”只当成演示词:在线端把 audio-conditioned cross-attention 的因果约束同时放进训练和推理,并用四部位 motion token 把局部动作动力学与全身历史接起来。Table 1 与 Table 2 的 FGD、BC、Diversity 和单步延迟是同一口径下的联合证据,尤其 JIYI 上的 mask 消融确实让因果对齐这一机制有了可反驳的抓手。 该泼冷水的地方也很具体:1.623 ms 是 gesture generation module 的每步数,不是用户说话到可见数字人反应的端到端实测;响应模块首 audio token 约 234 ms,渲染和网络却没有被纳入同一延迟表。self-evolution 的 2 轮结果很诱人,但 preferred online 样本规模、真实部署覆盖和长期负反馈行为都未报告,不能把固定 120 帧历史窗下的稳定手势延迟升级成已验证的全系统实时陪伴。 ...