VibeVoice-ASR-Streaming Technical Report
📄 边听边分清谁在说:把长历史留下来做说话人归属 英文题目:VibeVoice-ASR-Streaming Technical Report 一句话:针对流式会议转录要同时低延迟输出文字与说话人标签的难题,论文把固定块加前视与历史交错放入单一自回归上下文,用 7B 模型在五集合均值与 12 个归属设置上取得最优,代价是 8 分钟上限与首包更慢。 标签:#语音识别 | #语音大模型 | #说话人日志 | #流式处理 | #会议转录 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Tu:University of Chinese Academy of Sciences Zhiliang Peng:Microsoft Research Jianwei Yu:Microsoft Research Li Dong:Microsoft Research Songchen Xu:Shanghai Jiao Tong University Yaoyao Chang:Microsoft Research Wenhui Wang:Microsoft Research Zilong Wang:Microsoft Research Zehua Wang:Microsoft Research Yan Xia:Microsoft Research Jiajun Zhang:University of Chinese Academy of Sciences Xie Chen:Shanghai Jiao Tong University Furu Wei:Microsoft Research 💬 毒舌点评 把长历史保留在自回归上下文里来固定说话人身份是漂亮而务实的选择,云端对比的延迟与代价测量也难得诚实。但序列化单流输出对长时重叠的妥协、八分钟上限与首包延迟问题让实时声称打了折,技术报告仍更像强工程而非范式突破。 ...