📄 边播边改:当音视频生成从片段走向持续世界

英文题目:StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

一句话:StreamAV-Bench 用 180 秒双轨与 32 维指标把流式音视频生成拉到边播边改的真实时间轴上,用 13 个系统的横评揭示视觉质量与交互达成难以兼得,且所有系统都在长程漂移与状态复用上集体失效。

标签:#音频生成 #多模态模型 #基准测试 #流式处理

评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Kaiqi Liu:BAAI;PKU
  • Haoxuan Zeng:PKU
  • Jingqi Liu:BAAI;PKU
  • Jiacong Fang:BAAI;PKU
  • Ziqi Cai:PKU
  • Yunyao Mao:Kling
  • Henglin Liu:THU
  • Yu Sheng:USTC
  • Shuchen Weng:BAAI;PKU
  • Boxin Shi:机构信息未在 arXiv HTML 中可靠披露

💬 毒舌点评

首次把流式音视频生成从“生成完再评”拉到“边播边改”的真实交互场景,320 个专家校验场景与 32 维指标把时间漂移、响应延迟、状态复用等隐蔽失效模式彻底曝光,13 系统横评揭示级联与原生联合的互补格局。短板是评估过度依赖 Gemini 3.1 Pro 等多模态大语言模型(Multimodal Large Language Model,MLLM)主观打分且未开源完整复现代码,商业系统缺失边界连续性等关键指标,32 维指标权重与冗余未做消融,结论的可信度仍受评测器偏差束缚。

📌 核心摘要

流式音视频生成要求模型在无界时间轴上增量生成同步音视频并支持用户实时交互提示更新,但现有基准仅评估已完成片段,无法度量时间漂移、动态切换、状态保持等流式特性。StreamAV-Bench 提出双轨统一框架,渐进轨道(progressive track)用单全局提示评估 180 秒连续生成的指令遵循与长程稳定性,交互轨道(interactive track)用初始提示加 5 次每 30 秒更新评估交互响应与状态保持复用。依托 8 个场景域、5 个音频域、5 类主体、4 种视觉风格的 320 个专家校验场景与 32 维细粒度指标,论文评测 13 个代表性系统,发现原生联合模型与级联流水线在视觉质量与音频保真上互补,且高质量不等于低漂移。结果显示所有系统均存在显著时间漂移与交互瓶颈,例如视觉更新达成率仅 0.243 且历史依赖遵循不足 2.5 分(5 分制),揭示了从片段生成向持续世界模型演进的关键挑战。该基准为长时程实时音视频世界模型的标准化评测与迭代提供了首个系统化试验场,但其评测器依赖与商业系统覆盖不全限制了外推强度。

🔗 开源与复现资源

  • 代码:论文中未提及代码链接,项目主页为 https://liukqchoco.github.io/StreamAVBench/
  • 模型权重:论文中未提及
  • 数据集:StreamAV-Bench,包含 320 个专家验证场景,分为 progressive track 和 interactive track,获取方式为项目主页 https://liukqchoco.github.io/StreamAVBench/,论文中未提及开源协议和直接下载链接
  • Demo:论文中未提及
  • 复现材料:论文在附录 B 提供了 32 维评估框架的完整定义,在附录 C 提供了 13 个被评估系统的默认配置说明,评估时开源系统使用官方 checkpoint 和推理流程在 NVIDIA H800 GPU 上运行,商业系统通过官方网页接口访问,所有系统使用相同的 benchmark 输入,progressive track 使用单一全局提示,interactive track 使用 30 秒固定间隔的有序提示序列,论文中未提及训练配置和检查点保存路径
  • 论文中引用的开源项目:LAION Aesthetic Predictor、Audiobox Aesthetics、ImageBind、Synchformer、HunyuanVideo-Foley、Odyssey-2、Self-Forcing、LongLive、Rolling-Forcing、Deep Forcing、MemFlow、Causal-Forcing、Helios、SWIFT、IAMFlow、PixVerse R1、HappyOyster、OmniForcing、LongAV-Compass、Gemini 3.1 Pro,论文中未提供上述项目的具体 URL 链接

🧭 深度解读

为什么流式生成比离线生成难得多

想象你在玩一个可以说话的开放世界,模型像直播一样 1 秒 1 秒往外吐画面和声音,你随时插一句“把窗关上,雨声停掉,面包烤得更焦一点”。离线生成只需要最后交出一支成片,流式生成却要求历史帧一旦播出就不可篡改,新指令必须在未来的时间轴上立刻生效,同时不能把已经建立的角色、场景和背景音弄丢。

这个约束把问题从内容质量推向了时间一致性。模型要在无界时长里增量渲染同步的音与画,既要让口型对上鼓点,让脚步对上地板,又要在几十秒后依然记得那只穿红色救生衣的狗长什么样。任何 1 次边界处的黑帧、卡顿或闪烁,都会直接打断观看,而指令的延迟与遗漏则会让交互失去意义。

StreamAV-Bench 正是为这种持续世界而设。它不再只问成片好不好看、好不好听,而是追问三件事:播得久了会不会漂,改得快不快,改完还能不能记住之前的东西。

现有基准卡在哪里,StreamAV-Bench 站在什么位置

长视频基准如 VBench-Long、HeliosBench 擅长评视觉质量与长程一致性,但大多不带声音,也不考察运行时改写。音视频基准如 VABench、LongAV-Compass 把对齐与同步补上了,却仍以已完成的片段为单位打分,无法度量时间漂移、动态切换或边界连续性。

论文用 1 张九列对比表把空白点得很清楚:只有 StreamAV-Bench 同时覆盖音视频质量、长时程、脚本化提示、时间漂移、动态切换、交互响应、状态保持与复用、边界连续性与流式效率。换句话说,它把两条过去分开的路线拼到同一条时间轴上,让原生联合的音视频流模型和视频加音频的级联流水线在同一套协议下直接对话。

这种定位也决定了它的评测哲学。不是用单一总分掩盖问题,而是用 32 个细粒度维度把失效模式拆开,让视觉好看但漂移严重、响应很快但达成率很低这类矛盾无处藏身。

任务如何被形式化为两条轨道

论文把流式音视频生成定义为在扩张时间轴上的增量生成,提交的历史不可变。为此设计了双轨。渐进轨道只给一个全局提示,要求模型一口气生成 180 秒连续音视频,考察指令遵循与长程稳定性。交互轨道则给一个初始提示加 5 次运行时更新,每 30 秒 1 次,考察交互响应与状态保持复用。

两轨共享同一批主题的语义范围,但按时间协议独立实现。渐进脚本必须是可延展 180 秒的开放过程,交互脚本则要联合规划初始世界与 5 步因果有序的状态轨迹,已建立的主体与声音会持续有效直到被显式修改。时间依赖被显式标注为独立、相邻依赖与长程依赖,后者需要回溯到非相邻的早期更新,这正是检验记忆的关键。

读者看图 1 时可以先对准 3 个小图:图 a 区分两轨要回答的问题,图 b 展示 8 场景域、5 音频域等多维覆盖,图 c 给出 32 维 6 类指标的组织。图 4 则把 180 秒内的质量与对齐演化画成细线为单系统、粗线为 13 系统均值,向上越好的是美学与质量,向下越好的是同步偏移。

基准如何从主题走到分数:一条五阶段流水线

StreamAV-Bench 本质是一条评测流水线,输入是结构化主题与复杂度分配,输出是可执行的提示序列、校验清单与自动化分数。数据流可以记为分类分配、脚本撰写、提示生成、清单生成、专家校验,再到统一协议生成、分区间评测、用例内聚合、跨用例平均。

分类体系分两层。内容复杂度覆盖实体、活动与音频 3 维,例如单主体、多主体、密集,单源、多源、重叠,两轨各 160 场景均按此均衡。更新复杂度只用于交互轨,刻画 800 次更新的操作类型、更新模态与时间依赖,让智能体动作、实体状态变化、环境变化与音频变化按比例出现,也让仅视频、仅音频与音视频联合更新都有足够样本。

提示与清单由 GPT-5.4 按生成导向的自然语言产出,渐进轨一个全局提示,交互轨一个初始提示加 5 个简洁更新。随后基于固定模板生成模态分离的可验证清单,字段包含场景、视觉风格、主体与活动等四要素的是否型问题。所有材料经 2 名独立专家审核与第 3 名仲裁者裁决,检查分类一致性、更新顺序、模态与依赖标注、生成可行性与跨更新一致性,最终形成 320 场景,其中 192 为照片级真实,128 为非真实风格。

32 维指标如何分工,关键公式在算什么

评估框架把 32 维分成 6 类。质量与对齐在 6 个 30 秒区间上平均,视觉美学用 LAION Aesthetic Predictor 归一化到 0 到 1,视觉质量与音频质量用 Gemini 3.1 Pro 多维打分,制作质量用 Audiobox Aesthetics,音视频对齐用 ImageBind 余弦相似度,音视频同步用 Synchformer 预测偏移秒数。流式连续性与效率在原生生成单元边界上计算,帧率与首块延迟在默认配置下测量。

几条核心公式把设计意图说得很直白。原生边界连续性把多种边界伪影折成一个 0 到 100 的分数:

\[\mathrm{NBC}=\operatorname{clip}\!\left(100-\left(70r_{b}+45r_{d}+12t_{f}+8n_{f}\right),0,100\right).\]

其中 \(r_b\) 为黑帧比,\(r_d\) 为重复帧比,\(t_f\) 为最长冻结时长,\(n_f\) 为闪烁数,权重 70、45、12、8 体现对黑帧与重复帧更严厉的惩罚,分数越高表示边界越干净。

指令漂移与质量漂移都用首末区间差来捕捉长程退化:

\[D_{c}=\left|s_{c}^{(6)}-s_{c}^{(1)}\right|.\]

\[Q\text{-D}=\left|q^{(6)}-q^{(1)}\right|.\]

前者针对清单上每条可验证准则的 1 到 5 分,后者针对美学、质量等连续分数,绝对差越大说明首尾一致性越差。交互达成率则直接计数:

\[\mathrm{PVUAR}=\frac{\#\{\text{applicable visual updates with an achieved target}\}}{\#\{\text{applicable visual updates}\}},\]

它衡量在所有适用视觉更新中有多少真正实现了核心目标,达成率与延迟需要联合解读。

为避免只在成功子集上算延迟而美化结果,论文还引入成功调整延迟,把未达成的更新按观测窗口上限 \(T=30\) 秒惩罚:

\[\widetilde{\ell}_{c,u}^{m}=\begin{cases}\ell_{c,u}^{m},&a_{c,u}^{m}=1,\\ T,&a_{c,u}^{m}=0,\end{cases}\qquad L_{\mathrm{SA}}^{m}=\frac{1}{|\mathcal{C}_{m}|}\sum_{c\in\mathcal{C}_{m}}\frac{1}{|\mathcal{U}_{c}^{m}|}\sum_{u\in\mathcal{U}_{c}^{m}}\widetilde{\ell}_{c,u}^{m}.\]

这里 \(\ell_{c,u}^{m}\) 是媒体时间上的首次实现延迟,\(a_{c,u}^{m}\) 为是否达成,未达成则记为 30 秒,跨用例平均后得到更诚实的响应代价。类似地,历史依赖遵循也有覆盖调整版本,对未建立的源状态记零分后再平均。

原论文 Figure 1:We present StreamAV-Bench, a comprehensive benchmark for streaming audio-video generation.

论文图 1。这张图来自原论文 Figure 1:,图示内容为“We present StreamAV-Bench, a comprehensive benchmark for streaming audio-video generation.”。请结合“32 维指标如何分工,关键公式在算什么”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

没有训练阶段,这套基准如何跑起来

StreamAV-Bench 本身不训练新模型,它是一套数据集与评测协议。构建侧的计算是基于规则与大模型的生成与校验:按分配表抽取主题与复杂度,撰写可延展脚本,调用 GPT-5.4 生成提示与清单,再经人工审核与仲裁定版。

评测侧则是确定性推理与专家模型打分的组合。13 个被测系统用官方权重与默认推理配置在 NVIDIA H800 上或通过官方网页接口生成 180 秒音视频,渐进轨用单全局提示,交互轨按 30 秒边界切换条件并冻结历史帧。自回归类模型采用基于 Infinity-RoPE 与 LongLive 的共享续写协议,级联流水线统一搭配 HunyuanVideo-Foley 生成音频且音频分段与视频提示调度一致。

生成结果被转码为统一格式后分 6 段送入对应评测器。LAION、Audiobox、ImageBind、Synchformer 负责可复现的感知与对齐分数,Gemini 3.1 Pro 负责清单驱动的 1 到 5 分判断。所有观测先在用例内聚合再跨用例均匀平均,并支持 60、120、180 秒前缀的时序演化分析。

数据、协议与基线如何组织

根据论文正文与图中报告值整理,数据集与实验协议可概括如下。论文未提供可学习的训练集划分,重点是评测用例的构成与生成协议。

维度构成与协议要点
场景规模320 场景,渐进与交互各 160,主题在两轨各实例化 1 次192 照片级真实,128 非真实风格
语义覆盖8 场景域、5 音频域、5 主体类别、4 视觉风格日常、创作、社交、表演、运动、交通、自然、虚构等
内容复杂度实体 56/72/32,活动 40/80/40,音频 48/64/48两轨均按此分配,确保多主体并发与重叠声源被覆盖
更新复杂度800 次更新,类型 440/160/80/120,模态 360/160/280,依赖 440/240/120交互轨每场景 5 次更新,每 30 秒 1 次
生成协议单次 rollout 180 秒,分 6 个 30 秒区间评估渐进单提示,交互有序提示序列,历史帧冻结
被测系统13 个,3 个原生联合与 10 个级联原生含 PixVerse R1、HappyOyster、OmniForcing,级联均配 HunyuanVideo-Foley
指标方向VA、VQ、PQ、AQ、AVAlign 越高越好,AVSync、VID、AID、各类 D 与延迟越低越好32 维分 6 类,含 NBC、FPS、TTFC 等效率项

基线选择刻意对比两种范式。原生联合直接从共享隐状态增量生成音视频,级联则让视频流模型先生成画面再由音频模型配音。硬件与配置上开源系统用官方 checkpoint 在 H800 上以推荐参数推理,商业系统走网页接口,这也导致部分效率指标在网页系统上无法获取。

主结果:互补、漂移与达成率陷阱

根据论文正文与图中报告值整理,关键结果按问题组织如下,方向箭头表示越好方向。

比较或条件指标明确报告值这项数字支持什么
180 秒全量,范式对比VQ ↑IAMFlow 2.840 最高,Causal-Forcing 2.397 较低级联在视觉质量上领先
180 秒全量,范式对比VA ↑ / AVSync ↓SWIFT VA 0.605 最高且 AVSync 0.970 最低级联在美学与同步上占优
180 秒全量,范式对比AVAlign ↑Causal-Forcing 0.280 最高级联在语义对齐上领先
180 秒全量,范式对比VIF ↑ / PVUAR ↑HappyOyster 3.565 与 0.518 均为 13 系统最高原生联合在指令遵循与视觉达成率上领先
180 秒全量,代价PVRL ↓HappyOyster 14.484 秒最慢,SWIFT 10.340 秒最快但 PVUAR 仅 0.246达成率与延迟需联合看,单看延迟会高估响应
长程稳定性VQ-D ↓Causal-Forcing 0.189 最稳,IAMFlow 0.425 漂移显著高分不等于低漂移
前缀演化 60→180 秒VA-D / VQ-D / PQ-D / AQ-D ↓0.025→0.042,0.313→0.361,0.295→0.382,0.449→0.495质量漂移随生成长度单调加剧
前缀演化 60→180 秒AUF ↑ / ASR ↑ / PVRL ↓2.481→2.332,3.022→2.895,12.283→13.534 秒交互遵循与保持缓慢退化,延迟变长
交互均值PVUAR / PAUAR / HDF0.243 / 0.331 / 2.3 至 2.8 分视觉更新更难更慢,长程依赖复用是瓶颈

两点反证值得单独强调。第一,OmniForcing 的 PVUAR 仅 0.053 且 VIF 2.423 为最低,说明并非所有原生联合都能做好交互。第二,论文拟合的 6 区间退化斜率显示 13 个系统中有 13 个在 VA、12 个在 AVAlign、10 个在 VQ 上呈负向漂移,而 PQ、AQ、AVSync 方向混杂,SWIFT 的 AVSync 退化斜率与波动同为最高,提示音频与同步的长程行为更不稳定。

人类对齐实验为这些分数提供了外部锚点。60 个均衡用例、13 系统、每指标 120 对配对、每对 3 人标注,Spearman 相关系数在 0.77 到 0.94 之间,其中 PVC 达到 0.94,而 PVRL 仅 0.77,说明延迟判断的噪声相对更大。

原论文 Figure 2:Overview of the data construction pipeline for StreamAV-Bench.

论文图 2。这张图来自原论文 Figure 2:,图示内容为“Overview of the data construction pipeline for StreamAV-Bench.”。请结合“主结果:互补、漂移与达成率陷阱”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Figure 3:Detailed data statistics and the evaluation framework of StreamAV-Bench.

论文图 3。这张图来自原论文 Figure 3:,图示内容为“Detailed data statistics and the evaluation framework of StreamAV-Bench.”。请结合“主结果:互补、漂移与达成率陷阱”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Figure 4:Temporal evolution of progressive-track quality and audio-video alignment over 180 seconds.

论文图 4。这张图来自原论文 Figure 4:,图示内容为“Temporal evolution of progressive-track quality and audio-video alignment over 180 seconds.”。请结合“主结果:互补、漂移与达成率陷阱”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

这套基准的边界在哪里

作者在结论与启示中把失效归纳为长程稳定性、交互响应、状态保持复用与提示边界连续性 4 类,并提出面向有状态流式世界模型、选择性状态更新与音视频联合增量生成的演进方向。相关讨论分散在分析与未来方向中,没有单独的局限章节。

从评测设计看,清单生成与打分高度依赖 Gemini 3.1 Pro 与 GPT-5.4,模型偏好可能渗入分数,论文虽做了人类对齐但缺少评测器替换的敏感性分析。商业系统因无法获取原生边界而缺失 NBC、FPS、TTFC 三项,使得效率对比不完整。32 维之间的相关性与冗余、NBC 与 PVC 的固定权重以及 30 秒惩罚的取值,也缺少消融依据。

数据覆盖上,320 场景要支撑多域与多复杂度组合仍显稀疏,800 次更新中环境变化与长程依赖样本较少,尾部组合的统计效力有限。级联流水线统一使用单一音频生成器,结论对音频器选择的敏感性有待检验。统计显著性与置信区间也未报告,像 VQ-D 0.189 与 0.425 的差异是否稳健,读者需要更多证据才能判断。

复现需要哪些材料,哪些已经开放

论文在附录 B 给出 32 维指标的完整定义与公式,在附录 C 列出 13 个系统的默认配置与 30 秒固定间隔协议,评估时开源系统使用官方 checkpoint 与推理流程,商业系统通过官方网页接口访问,所有系统处理相同的基准输入。项目主页为 https://liukqchoco.github.io/StreamAVBench/,数据集 StreamAV-Bench 含 320 个专家校验场景,分渐进与交互各 160 个。

开放程度仍有缺口。论文未提供代码链接、模型权重链接、直接下载链接与开源协议,也未披露训练配置与检查点保存路径。复现者可以按附录重建评测逻辑与提示协议,但完整的自动化脚本与一键可运行流水线有待补充。

若要复刻实验,建议按 3 步走:从主页获取用例与清单,按两轨协议生成 180 秒音视频并统一转码,分 6 段调用 LAION、Audiobox、ImageBind、Synchformer 与 Gemini 3.1 Pro 完成打分,再按用例内聚合与跨用例平均汇总。注意商业系统的边界与计时指标在当前条件下无法对齐比较。

从片段到世界:下一步该往哪走

StreamAV-Bench 把一个长期被平均分掩盖的事实摆到台面上:好看不等于稳,响应快不等于改得对,记得住才算会交互。13 个系统的集体漂移与低达成率说明,片段级目标与离线打分已经无法驱动流式世界,需要把长程稳定性、达成率与延迟、状态保持与复用当作联合优化目标。

对刚入行的同学,这套基准提供了一个清晰的起点。先用渐进轨检验你的模型能否在 180 秒内守住指令与质量,再用交互轨检验它能否在 30 秒节拍里既改对又记得住,最后用边界与效率指标检验它是否真的可直播。任何只提升单点分数而不改善漂移与达成率的工作,都值得打一个问号。

更远的图景是把生成器重塑为有状态的世界模型:用共享且持续更新的隐状态同时渲染音与画,用选择性更新机制决定什么该变、什么该留,用系统级缓存与调度把延迟压到可交互的范围内。StreamAV-Bench 给了衡量这些想法的第一把尺子,下一步就是让尺子更稳、更开放,让模型在时间轴上真正活起来。

📎 论文与评分元数据

标签:#音频生成 #多模态模型 #基准测试 #流式处理

8.2/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

🔥 8.2/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音频生成 | #多模态模型 | #基准测试 #流式处理 | arxiv

⚖️ 评分依据与证据(展开查看)

逐维得分、全文证据与扣分边界
  • 创新性 (1.6/2):首次形式化流式音视频生成的双轨范式,区分 180 秒渐进与 5 次每 30 秒交互更新,对比显示覆盖 9 项流式能力空白,以 320 场景与 32 维 6 类指标及 PVUAR PVRL HDF 等新指标实现可量化评估,系统级新能力明确

  • 技术严谨性 (1.1/1.5):采用 2 名独立专家加第 3 名仲裁的校验与内容复杂度 56 72 32 与更新复杂度 440 160 80 等均衡分配,协议先用例内聚合再跨用例平均,但 32 维间相关性与 NBC 70 45 12 8 及 PVC 0.70 0.30 权重缺少消融,T 为 30 秒惩罚未验证,且未报告统计显著性与置信区间

  • 实验充分性 (1.2/1.5):覆盖 13 系统含 3 个原生联合与 10 个级联流水线,在 180 秒全量与 60 120 180 秒前缀上对比 VA VQ AVAlign AVSync VIF VID PVUAR PVRL 等,但人类对齐 PVRL 仅 0.77 提示噪声,800 次更新中环境变化仅 80 次长程依赖仅 120 次尾部稀疏,级联统一用 HunyuanVideo-Foley 单一音频生成器未做敏感性分析

  • 清晰度 (0.8/1):结构清晰定义 32 维 6 类与 VA VQ AQ PQ AVAlign AVSync NBC FPS TTFC 等计算方式及公式,表 1 表 2 标注方向与最优次优并解释 PVUAR 与 PVRL 需联合判读,对 VIF AIF VID AID 与 HDF 的 1 至 5 分清单评估说明完整

  • 影响力 (1.2/1.5):面向流式音视频生成这一音频为核心模态的任务,首个系统化基准揭示所有系统显著时间漂移与交互瓶颈,平均 PVUAR 仅 0.243 且 HDF 不足 2.5 分,区分原生联合与级联在视觉质量与音频保真上的互补,为长时程实时音视频世界模型提供标准化试验场

  • 开源 (1.0/1.5):数据集 StreamAV-Bench 含 320 个专家校验场景分 progressive 与 interactive 各 160 个,通过项目主页 https://liukqchoco.github.io/StreamAVBench/ 获取,但未提供直接下载链接与开源协议,论文未提及代码与模型权重链接,核心产物开放但文档不完整

  • 可复现性 (0.3/0.5):附录 B 给出 32 维完整定义与 NBC 公式及 PVC 融合权重,附录 C 给出 13 系统默认配置与 30 秒固定间隔协议,说明开源系统在 NVIDIA H800 上用官方 checkpoint 推理,但未披露完整评测脚本与检查点保存路径,关键复现步骤大部分充分但有少量缺失

  • 工程/实践价值 (1.0/1.5):提供 320 场景与 32 维统一评估框架的公开基准产物,在默认配置下测量 FPS 与 TTFC 并定义 NBC 边界连续性,但 PixVerse R1 HappyOyster Odyssey-2 三系统缺失 NBC FPS TTFC 导致效率对比不完整,且未提供可复用流水线代码


← 返回 2026-08-29 语音/音乐/音频论文速递