Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
📄 Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models #语音合成 #语音识别 #多模态模型 7.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.5/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #语音识别 | #多模态模型 | arxiv 👥 作者与机构 Wan Team, Alibaba Group 💡 毒舌点评 这篇工作野心很大,试图用一个模型解决实时交互的“全双工”问题。优点是系统集成度高,从感知到生成一气呵成。但作为一篇会议论文,它更像是一份优秀的工程报告,而非一篇算法或理论创新驱动的学术论文。最令人遗憾的是,几乎所有关键的技术细节都被“黑箱化”了:Transformer的具体结构?多模态token如何调度?流匹配解码器细节?统统没有。实验部分更是避重就轻,用大量篇幅和不规范的表格对比“延迟”,却对生成质量避而不谈。消融实验?不存在的。这就像一个厨师说他的新菜“又快又好吃”,但拒绝透露菜谱、食材和火候,只给你看了一个计时器。对于顶会论文而言,这种程度的细节披露严重不足,可复现性基本为零。作者提出的v0.1版和192p分辨率也暗示这更像一个技术演示而非成熟方案。 📌 核心摘要 Wan-Streamer是一个原生流式、端到端的实时交互基础模型,旨在实现低延迟、全双工的音视频交互。它在一个单一的Transformer中建模文本、音频和视频的输入与输出,无需依赖外部的ASR、TTS、动画或视频生成等级联模块。论文的核心贡献包括:1)提出了一种全因果的多模态架构,包括因果VAE、因果编解码器、块因果注意力以及全历史自回归流式处理;2)设计了“思想家-执行者”(thinker-performer)推理流水线,通过KV缓存交换实现理解与生成过程的重叠,实现了约200毫秒的模型端响应延迟和约550毫秒(含350ms网络延迟)的总交互延迟。论文强调,这种端到端设计使得感知、推理、生成、响应时机控制和轮次管理能在统一的模型中联合优化,从而减少流水线延迟和误差累积。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:https://wan-streamer.com/ 复现材料:论文中未提及 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 Wan-Streamer的设计核心是“流式性作为建模约束”,其整个技术栈均围绕因果性进行重构。 ...