英文题目:Encore: Infinite Audio-Video Generation with Adaptive Signal Routing

标签:#音视频生成 | #注意力机制 | #长音频处理 | #音视频

评分:6.3/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

👥 作者与机构

  • Shaohua Pan:Baidu, China
  • Junbao Chen:Beijing Institute of Technology, China;Baidu, China
  • Shengyi He:Baidu, China
  • Jingfeng Xue:Beijing Institute of Technology, China
  • Wen Tao:Baidu, China
  • Haocheng Feng:Baidu, China
  • Siming Fan:Baidu, China
  • Dongwei Pan:Baidu, China
  • Yi Yang:Baidu, China
  • Wei He:Baidu, China
  • Hang Zhou:Baidu, China

📌 核心摘要

该任务以文本、参考音视频为输入,输出任意时长的同步语音与高分辨率视频,难点在于同时维持视频时序连贯、音频时序连贯与跨模态唇音同步,且三类条件信号通过不同通路注入易相互干扰。Encore以LTX-2.3为短片段生成器,先用带参考偏移旋转位置编码(RoPE)的全局锚点与带误差回收的局部延续上下文构建分块迭代管线,再由自适应信号路由(Adaptive Signal Routing,ASR)在自注意力中对锚点与延续列加可学习偏置、在交叉注意力中对文本与音视频同步分支输出加可学习缩放,实现逐层逐头的动态加权。相比将所有条件等权处理的短片段音视频模型与仅做无声长视频的迭代方法,该路由机制显式区分了全局身份与局部时序的职能差异。在30秒长音视频基准上,Encore的身份一致性达0.86、唇同步置信度LSE-C达2.36,均显著优于最强基线,且时序漂移指标大幅降低。该结论目前仅在扩展VerseBench的受控场景与固定参考帧假设下验证,复杂转场与开放域长叙事的外推尚未检验。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么、要生成什么、哪些信息必须保留

本论文研究的是长时同步音视频生成。输入包含 3 类信息:文本提示描述每段要生成的内容,参考音视频提供全局身份锚点,以及延续上下文提供与上一块衔接的局部时序信息。输出是任意长度的同步音频与视频,要求在数十秒到数百秒范围内同时保持视频外观不漂移、音频音色与风格一致、口型手势与声音对齐。 与短片段生成不同,长序列不能一次性放入显存,必须分块迭代生成。

分块带来的核心矛盾是每个新块都要在有限上下文下延续前文,同时又要被多个作用不同的条件信号引导:延续上下文管局部平滑,参考信号管全局身份,文本管语义,音视频交叉注意力管同步。若对这些信号一视同仁,模型难以在不同层与不同头上做出取舍。 论文把这一矛盾拆成两个可操作的子问题。局部连续性通过显式的跨块上下文传播解决,全局一致性通过带偏移位置编码的参考信号解决。

在此之上引入可学习的路由机制,让模型按层按头自适应调节每类信号的影响强度。训练时模型在短片段上端到端学习联合分布,推理时通过分块滚动与噪声同步策略扩展到无限长度,并复用同一权重支持音频到视频与视频到音频的长时跨模态生成。 为便于后续复述,记住 3 个关键区分:参考标记在训练时保持干净且时间步为 0,延续标记同样干净但位置编码不同,目标标记是唯一加噪并计算损失的部分。

参考的旋转位置编码被移到负区间以区别于从 0 开始的延续与目标序列;音频分支不做误差回收,视频分支做。 初学者可先建立一条样本的流水线心智模型:一条 5 秒的训练样本被切成参考段、延续段与目标段,分别编码为潜变量后拼成统一序列,文本经 Gemma 编码后通过交叉注意力注入,音视频 2 流通过双向交叉注意力交换同步信息,最后在目标段上回归流匹配速度场。

推理时则把已生成块的尾部作为下一块的延续输入,参考保持不变,逐块积分常微分方程直至所需总时长。

同类工作在输入、目标与运行阶段上有何不同

长视频生成一侧的主流做法是将序列分块迭代以突破短片段显存限制。代表性路线包括扩散强迫、滚动键值缓存与学生自生成展开、因果强迫与滚动强迫的蒸馏变体、以及通过注意力汇点与上下文压缩提升稳定性的方案。稳定视频无限通过误差回收实现理论上无界的视频生成。这些方法在视觉连贯性上取得进展,但均不生成音频,输出为无声视频,无法满足需要语音与音效同步的场景。 联合音视频生成另一侧则聚焦短片段内的同步与语义一致。

早期工作采用耦合去噪或专家拼接,近期转向统一的变换器架构。双流变换器通过块级交换时序与语义信息实现双向融合,非对称双流在不同容量分配下通过跨模态注意力耦合,和声类方法通过联合生成、音频驱动视频与视频驱动音频的多任务协同强化同步信号,滚动流匹配则尝试以迭代扩展实现长时生成但仅在 64×64 低分辨率且不建模语音。 两条路线的输入与目标差异决定了对比的边界。

长视频方法输入为文本与历史视频,目标为视觉连贯,不评估音频质量与唇音同步;短片段音视频方法输入为文本与双模态潜变量,目标为数秒内的同步,但未解决跨块误差累积与身份漂移。论文指出,长时音视频比任一单轴任务更难,因为每个块必须同时满足视频时序连贯、音频时序连贯与跨模态同步,且这些条件的注入路径不同。 因此,公平对照应按同输入同目标同运行阶段划分:与长视频方法比视频质量与漂移,与短片段音视频方法比同步与音频质量。

论文在长时基准上同时纳入两类基线,并在短片段设置上与骨干 LTX-2.3 及 OVI 对比,以分离长时扩展带来的代价与骨干本身的能力。 一个常见误解是将低分辨率无语音的长时音视频等同于高分辨率带语音的长时音视频。原文明确区分:前者在分辨率与语音建模上受限,后者需要同时处理高分辨率视觉与连续语音的身份保持,这正是 Encore 的定位。

长时生成的两个具体挑战如何形式化

第一个挑战是跨块传播的充分性。每个新块只能看到有限的局部上下文,若仅依赖紧邻的运动帧与音频延续,微小误差会在滚动中累积,导致外观漂移与背景变化。需要一种机制既提供局部衔接,又提供全局锚点,且让模型能区分二者的角色。 第二个挑战是异构条件的自适应平衡。参考、延续、语义与同步 4 类信号通过不同路径进入模型:参考与延续经自注意力进入,文本与音视频同步经两条独立的交叉注意力进入。

若在所有层与所有头上赋予相同权重,某些层可能过度依赖延续而忽略身份,或过度依赖文本而削弱同步。需要在不改变骨干结构的前提下,让每层每头学会放大或抑制特定信号。 论文将第一个挑战分解为局部连续性与全局一致性。局部连续性由重叠运动帧的迭代生成与音频延续承担,全局一致性由干净的参考帧与参考音频承担,二者通过不同的旋转位置编码区间加以区分。

第二个挑战则由自适应信号路由解决,在自注意力中对锚点与延续列加可学习的对数偏置,在交叉注意力中对文本与音视频分支的输出加可学习的乘法缩放。 形式化上,生成被建模为潜变量流匹配的去噪过程。音频与视频潜变量分别加噪,模型预测对应的速度场,损失仅在目标标记上计算。推理时长序列通过固定参考、滚动延续、逐块积分常微分方程实现,跨模态生成则通过在每一步将条件模态重加噪到当前噪声水平来保持双流噪声同步。

这一形式化直接决定了后续组件的实现选择:参考与延续保持干净且时间步为 0 以避免额外前向噪声,误差回收仅在视频延续上注入历史误差,路由参数初始化为中性以不破坏预训练结构。

总体架构如何把四类信号装进一个 DiT

Encore 在 LTX-2.3 音视频潜变量扩散骨干上扩展,不改动骨干的块结构。视频帧经视频编码器编码为潜标记,音频经音频编码器编码为时频潜标记,文本经 Gemma 编码后通过交叉注意力注入。每个变换器块按顺序处理两条流:模态特定的自注意力、文本交叉注意力、双向音视频交叉注意力与前馈层,重复 N 块。 输入按角色划为 3 组:参考组包含 1 帧静止图像与一段参考音频,提供全局身份;延续组包含输入音频与运动帧,提供局部连续性。

目标组是当前待生成的音视频段。训练时参考与延续保持干净,目标按共享采样时间 t 加噪;推理时参考跨所有块共享,延续取上一块输出的尾部。 为让模型区分全局锚点与时序前驱,参考音视频标记的旋转位置编码被移到负区间,并在块起始前留出时间间隔。参考音频长于单帧参考图像,因此占据一段负位置序列,而参考图像占据单一位置。

延续与目标则从 0 开始的常规时序坐标编码。由于旋转位置编码在注意力中编码相对距离,延续标记始终靠近块起始,参考标记落在延续永远不会产生的相对距离区间,从而提供结构性区分信号。 下图展示了这一装配方式与路由位置,左侧为音视频 2 流的编码与序列拼接,中间为共享 DiT 的注意力与前馈路径,右侧为自适应信号路由在自注意力与两路交叉注意力上的作用点。

看图路径: 1. 沿顶部输入条观察 Ref.Audio/Input Audio/Audio GT 与 Ref.Image/Motion Frames/Video GT 如何分别进入 Audio Encoder 与 Video Encoder;2. 对比左侧粉色音频流与右侧绿色视频流在每一块中的 Self-Attention→Cross-Attention→Cross-Attention→Feed Forward 顺序;3. 在中间序列条上定位 p_ra 与 p_ri 的负位置偏移以及 0…k 的延续与目标段,确认参考与延续的位置区分;4. 在右侧 ASR 面板中区分上方自注意力偏置的列级加法与下方两路跨注意力输出的乘法缩放

原论文 Figure 2.:Overview of Encore. The model jointly denoises audio (left) and video (right) within a shared DiT…

论文图 2。原论文 Figure 2.:“Overview of Encore. The model jointly denoises audio (left) and video (right) within a shared DiT architecture.”。

图中可见顶部输入条将参考、延续与目标按模态分组,中间序列条用不同颜色与位置标记区分参考的负偏移与延续的目标的 0…k 区间,右侧面板则把自注意力的列级偏置与交叉注意力输出的缩放分层展示。结合箭头可确认文本分支与音视频同步分支在每块中独立计算后再按可学习比例融合,且视频分支的运动帧在训练时接受误差注入。

联合音视频生成 × 跨模态条件生成: 联合音视频生成指同时去噪音频与视频两个潜变量流,跨模态条件生成指以真实音频或真实视频为条件只更新另 1 模态;两者共用同一套权重与迭代流程,搭配理由是训练时已学习双向依赖,推理时只需将条件模态按当前噪声水平重新加噪并保持同步,即可在不微调的情况下在 3 种模式间切换。

长时推理时,联合生成对目标噪声从 1 到 0 积分常微分方程,条件集合在整个采样过程中保持时间步为 0;跨模态生成则在每一步将真实条件模态按流匹配调度重加噪到当前 t,仅用另 1 模态的预测速度更新潜变量,从而在推理阶段复用同一模型实现 3 种任务而无需额外微调。

自适应信号路由在注意力内部做了什么计算

自适应信号路由为每层每头的 4 类信号各学一个标量对数,组成路由向量,经 Sigmoid 映射到 0 到 2 区间的缩放因子,初始为 1 以保持预训练行为不变。该向量在训练时与流匹配目标端到端优化,使每层每头自主决定放大或抑制哪类信号。 在自注意力中,路由通过在注意力 logit 上加偏置实现。设原始 logit 为查询与键的点积除以根维度,对属于参考锚点集合的键列加锚点因子的对数,对属于延续集合的键列加延续因子的对数,其余列不变。

由于在 softmax 前加对数等价于在 softmax 后对该列概率乘以对应因子并重归一化,这提供了对整组标记的均匀乘法控制,且不破坏生成标记之间的相对注意力结构。原文强调,参考与延续在语义上与带噪生成标记不同但共享同一键投影,单纯更新 Q/K 权重无法产生与输入无关的列级一致偏移,而加性偏置可直接实现。

参考锚点 × 延续上下文: 参考锚点负责全局一致性,提供跨所有块共享的身份与风格基准,延续上下文负责局部连续性,提供紧邻前一块的时序衔接;两者搭配是因为仅靠延续上下文会随块数累积误差而漂移,仅靠参考锚点则无法保证块间平滑过渡,组合后模型通过位置编码区分全局与局部信号,分别锚定身份与衔接运动。

在交叉注意力中,路由改为对输出残差缩放。文本分支与音视频分支各自只关注单一外部源,若在 logit 上对同一源的所有键加相同偏置,softmax 归一化会抵消该偏置而无效果。因此路由直接将两路交叉注意力的输出向量分别乘以语义与同步缩放因子,再与隐状态相加并归一化,使不同层与不同头能自适应平衡提示跟随与跨模态对齐。

自注意力偏置 × 跨注意力缩放: 自注意力偏置用于调节同一自注意力内不同来源键的权重,跨注意力缩放用于调节不同跨注意力分支对隐状态的贡献;两者分工不同是因为自注意力中锚点与延续标记共享同一 Q/K 投影需在 logit 层区分,而文本与音视频同步两个跨注意力分支各自只关注单一外部源,在 softmax 后加偏置无效需直接缩放输出,组合后实现按层按头对 4 类信号的细粒度路由。

公式层面,路由参数化与两处应用可概括为:先将每头四元对数映射为缩放因子,再在自注意力中对锚点与延续列的 logit 加对数偏置,最后在两路交叉注意力输出上乘以对应缩放。实现上仅增加一个小型路由表与简单乘加操作,保留 LTX-2.3 的计算图。 为明确计算目标,先解释符号:ℓ表示层索引,h 表示头索引,α 为缩放因子,s 为注意力 logit,A 与 M 为参考与延续的索引集合,Δx 为交叉注意力输出残差。计算目标是让模型在不改变骨干权重结构的前提下,按层按头调节 4 类条件对隐状态的贡献强度。

\[\mathbf{a}_{t}=(1-t)\mathbf{a}_{0}+t\boldsymbol{\epsilon}_{a},\]

该式定义音频潜变量的流匹配加噪方式,视频侧对称。理解此式是后续理解目标加噪与条件保持干净的关键。

\[\tilde{s}_{ij}^{\ell,h}=s_{ij}^{\ell,h}+\mathbb{I}[j\in\mathcal{A}]\log\alpha_{\ell,h}^{\mathrm{anc}}+\mathbb{I}[j\in\mathcal{M}]\log\alpha_{\ell,h}^{\mathrm{ct}}.\]

该式给出自注意力中锚点与延续的 logit 偏置形式,直接对应右侧面板上方的列级调节。

\[\Delta\tilde{\mathbf{x}}_{\ell,h}^{\mathrm{text}}=\alpha_{\ell,h}^{\mathrm{sem}}\,\Delta\mathbf{x}_{\ell,h}^{\mathrm{text}},\qquad\Delta\tilde{\mathbf{x}}_{\ell,h}^{\mathrm{av}}=\alpha_{\ell,h}^{\mathrm{sync}}\,\Delta\mathbf{x}_{\ell,h}^{\mathrm{av}}.\]

该式给出两路交叉注意力输出的乘法缩放形式,对应右侧面板下方两条分支的 Add & Norm 前缩放。 需要指出,路由的增益是有界的,缩放因子被限制在 0 到 2 之间,既可抑制也可放大,但以 1 为中性点,避免过度偏离预训练分布。

训练时如何构造输入、注入误差并计算损失

训练样本由单块音视频构成,输入按 3 组拼接:参考的干净图像与音频、延续的干净音频与运动帧、以及待生成的目标音视频。参考与延续赋时间步 0,目标按采样 t 加噪,t 在 0 到 1 间采样,噪声为标准高斯。文本条件为描述单块的短标题,与训练分布保持一致。

误差回收 × 运动帧扰动: 误差回收是训练时模拟推理误差的机制,运动帧扰动是其具体操作对象;误差回收通过把历史预测误差加到干净的运动帧上制造带噪的延续输入,让模型学会在不完美前文下仍生成正确目标,搭配理由是推理时运动帧本就来自上一块的不完美生成,提前扰动可缩小训练与推理的分布差距。

误差回收仅在视频延续上执行。每一步前向后,利用预测速度重建干净视频潜变量,计算目标段上的预测误差并推入先进先出缓冲。以概率 p 从缓冲采样历史误差,加到下一训练步的干净视频运动帧上,但保持其时间步仍为 0,不再额外加前向噪声。参考标记、音频延续与目标分支不受扰动。原文报告音频生成在块间未表现出明显误差累积,因此为简化训练仅回收视频误差。

流匹配速度预测 × 掩码均方误差: 流匹配速度预测定义模型要学习的向量场目标,掩码均方误差定义只在生成目标标记上计算损失的优化方式;搭配原因是参考与延续标记在训练时保持干净且时间步为 0,不应参与速度回归,掩码将它们排除,使梯度仅来自加噪的目标音视频潜变量,保证条件信号只作上下文而不被重建。

损失为掩码均方误差,仅在目标标记的速度预测上计算,掩码将所有干净标记排除,包括参考、音频上下文与可能被扰动的视频上下文。优化器为 AdamW,学习率固定,骨干权重冻结,仅通过 LoRA 适配与路由表更新。

\[\mathcal{L}_{\mathrm{FM}}=\mathbb{E}_{\mathbf{a}_{0},\mathbf{v}_{0},t,\boldsymbol{\epsilon}}\left[\left\|\mathbf{m}\odot\left(u_{\theta}(\mathbf{a}_{t},\mathbf{v}_{t},t,\mathcal{C})-\mathbf{u}\right)\right\|_{2}^{2}\right],\]

该式为掩码流匹配损失的期望形式,其中 m 为掩码,u 为真实速度场,u_θ 为模型预测,C 为条件集合。实现时对音频与视频 2 模态的目标速度同时回归。 训练语料为约 270,000 个 5 秒音视频片段,训练步数为 5,000 步,误差注入概率设为 0.8,LoRA 秩为 128,在 32 张 A800 上训练。值得注意的是,模型完全在短片段上训练,却在推理时通过分块滚动泛化到长时生成,这依赖于参考锚点与误差回收共同缩小训练与长时推理的分布差距。

推理时的文本处理也需与训练对齐:用户提供的长描述先由视觉语言模型切分为与时间线对齐的块级短标题,语音转录则按块时长对应的自然语速切分词数,使每块的文本条件与训练时的短标题分布一致,避免单次前向需推理完整叙事。

在什么数据与指标上评估、如何保证可比性

评估基于 VerseBench 扩展的长音视频基准。为更贴合长时需求,每条提示扩展为包含 6 个结构化语义组件,支持更丰富的场景组合、时序推进与多事件动态。每条生成样本时长为 30 秒,显著长于常规短视频基准,对时序连贯、身份保持与跨模态一致性提出更高要求。 指标覆盖 4 类:视频质量含运动分数、运动平滑度、美学分数与身份一致性;音频质量含 CLAP 分数及内容享受度、内容有用性、制作复杂度与制作质量四项感知与制作维度。

跨模态一致性含唇音同步错误置信度与距离以及音视频对齐度;误差累积采用首尾对比漂移度,定义为视频前 15% 帧与后 15% 帧在某质量度量上的绝对差,值越大表示时序退化越严重。 实现细节上,Encore 基于 LTX-2.3 最新版本,骨干冻结,LoRA 秩 128,32 张 A800,梯度累积 4,AdamW 恒定学习率 1e-4,训练 5,000 步,误差注入概率 0.8。所有基线均采用官方发布权重与默认设置评估,分为长视频类与联合音视频类,前者包括 SVI 与 Helios,后者包括 OVI 与 LTX-2.3。 为说明长时与短片段的权衡,论文同时报告短片段对比与超长时稳定性测试。

超长时测试独立生成 8 条 13 分钟视频,按 30 秒窗口计算指标并在不同时长上聚合,考察质量随时间是否下滑。 下表提出本研究的核心比较问题:在 30 秒长时生成中,Encore 是否在保持运动与美学的前提下显著降低漂移并提升身份与同步,且条件与基线保持一致均为官方权重与默认设置。

方法身份一致性唇音同步置信度音视频对齐度美学漂移身份漂移
SVI0.81--0.060.22
LTX-2.30.721.400.760.060.26
Encore0.862.360.880.020.07

该表聚焦身份、同步与漂移 3 类最能反映长时能力的指标,数值方向为身份与同步越高越好,漂移越低越好。

Encore 在身份与同步上领先,并在两项漂移上取得最低值,支持其在长时稳定性上的优势;同时需注意运动强度等指标未在该表中展开,需结合短片段与消融表共同判断代价。 另一个需核对的细节是文本条件在推理时的切分策略:长描述被切为块级短标题后每块仅以对应短标题为条件,这使局部标题错误仅影响关联块,而非要求模型单次推理完整叙事,与训练分布对齐。

主结果显示什么收益、代价与未胜出项

长时主结果的核心收益体现在时序稳定性与同步上。漂移指标上 Encore 取得 0.02 与 0.07,相比每项最强基线的 0.06 与 0.22 约降低 3 倍,表明参考锚定、运动帧误差回收与锚点路由共同抑制了长时滚动中的质量漂移。身份一致性上 Encore 为 0.86,超过 OVI 与 LTX-2.3 的 0.72,也超过仅生成视频的 SVI 与 Helios,支持参考偏移位置编码与可学习锚点路由对跨块身份保持的有效性。 同步指标上唇音置信度与音视频对齐度分别达到 2.36 与 0.88,相对 LTX-2.3 的 1.40 与 0.76 有大幅提升,说明扩展到长时并未以牺牲跨模态对齐为代价。

视频质量上运动平滑度最佳,美学分数与 LTX-2.3 相当,但运动强度略低,呈现为以适度降低单帧运动幅度换取长时稳定的权衡,这在长视频生成中通常更受重视。音频质量上文本音频语义对齐最佳,制作类指标保持竞争力。 短片段对比进一步分离长时扩展的代价。Encore 在运动平滑、唇音同步与音视频对齐上取得最好,其余指标位列第二;与骨干 LTX-2.3 相比,除运动强度外其余指标均有提升,表明长时扩展基本保留了短片段能力。

下表聚焦短片段设置下的可比性,比较对象为同一骨干与另一联合音视频方法,条件为短片段生成,指标方向为运动平滑与同步越高越好、制作复杂度越低越好。

条件指标LTX-2.3OVIEncore
短片段运动平滑度99.2999.3099.41
短片段身份一致性0.8650.8940.888
短片段制作复杂度3.842.302.68
短片段唇音同步置信度2.362.183.46
短片段音视频对齐度0.7300.6310.867

该表显示 Encore 在平滑度与同步上领先,身份与制作复杂度居中,支持其在短片段上未明显退化的判断;但运动强度等未列指标需参考长时表,说明长时与短片段的权衡需分开解读。

超长时稳定性测试显示,8 条 13 分钟视频在不同时长聚合下身份在 0.918 到 0.938 间、美学在 0.474 到 0.481 间、制作质量在 6.853 到 6.938 间、音视频对齐在 0.793 到 0.928 间波动,无明显下滑趋势,支持模型在 13 分钟尺度上保持一致的视觉质量与对齐能力。 未胜出项与边界也需明确:长时表中运动强度上 OVI 更高,说明 Encore 为稳定性付出了运动幅度的代价。

定性对比中基线在 30 秒内出现背景变换与稀疏波形等退化,而 Encore 能处理前景交互如一只羊离开视野另一只进入,但论文也指出固定参考帧难以支持涉及场景或主体大幅变化的复杂镜头切换。

拿掉哪些组件会怎样、各自影响哪类指标

消融按组件与路由子项分别评估,选取运动质量、身份、音频质量与同步的代表性指标,以验证各部分的分工。 去掉误差回收后身份从 0.86 降至 0.77,音频的文本对齐与制作复杂度也下滑,尽管回收仅作用于视频分支,但视觉漂移会通过跨模态注意力污染音频分支的同步线索,导致音频保真度连带下降。 去掉整个自适应信号路由后各项指标严重退化,运动强度、文本音频对齐与唇音同步均大幅下降,说明若无按层按头的自适应加权,模型无法在长时生成中平衡异构条件。

细分路由时,去掉锚点路由主要影响身份与运动分数,去掉延续路由则导致运动平滑度降至最低,表明平滑的块间过渡需要对上下文帧的自适应加权;去掉语义路由会使音频质量与同步同时崩塌,去掉同步路由则在保持单模态质量的同时专门削弱音视频对齐。 下表汇总关键消融的数值变化,比较问题是各路由子项是否对特定指标有专属性影响,条件为同训练设置同基准评估。

变体身份一致性运动强度运动平滑度文本音频对齐唇音同步置信度音视频对齐度
去掉误差回收0.772.4399.410.291.020.61
去掉全部路由0.801.2699.120.181.110.78
去掉锚点路由0.852.3899.420.332.320.88
去掉同步路由0.842.7399.450.321.830.81
完整 Encore0.862.5199.470.342.360.88

该表支持分工假设:锚点路由专精身份,延续路由专精平滑,语义路由影响音频与同步,同步路由专精对齐;同时显示完整模型在各项上取得平衡,未出现单项突出而其他崩塌的情况。

一个常被误读的点是去掉某路由后某指标反而略升,例如去掉延续路由后运动强度略高于完整模型,但其平滑度最低,说明单看强度会误判质量,需结合平滑度与身份共同评估。 盲法用户研究进一步佐证:10 名参与者对 10 条随机 30 秒视频的成对比较中,Encore 在与 OVI 的所有标准上获 100% 偏好,对 LTX-2.3 在音频质量上获 80% 偏好、视频质量与同步上获 100% 偏好,对 SVI 与 Helios 的视频质量分别获 80% 与 100% 偏好,与定量结果一致。

哪些条件未被验证、哪些代价尚未量化

论文明确报告两个主要局限。其一,推理时依赖固定参考帧以抑制误差累积,这使得涉及场景或主体大幅变化的复杂镜头切换难以实现,未来方向是按镜头边界动态切换参考帧以支持可控多镜头长音视频。其二,当前推理因每块内多步去噪而非实时,未来可结合蒸馏式流式方案如自强迫来迈向实时长音视频。 除此之外,若以复现与部署视角审视,还有若干未量化或未报告的边界。

训练资源与推理开销分别讨论:训练在 32 张 A800 上进行,推理开销与输出帧率、实际延迟未在主表中量化,总体趋势不等于每步都低延迟。超长时测试虽展示 13 分钟与 500 秒示例的稳定性,但未报告在更长时长或更复杂多事件脚本下的失败率与人工审核成本。 另一个需区分的点是指标类型:自动指标如运动分数与美学分数不能等同于人评的偏好,漂移度量基于前后 15% 帧的绝对差,反映的是首尾质量差而非中间过程的逐块波动。

论文未报告安全性、公平性与版权合规的度量,相关风险需通过内容审核与来源追溯机制另行评估。 对于想直接复用该方法的读者,应注意到参考音频与参考图像的长度与位置编码设计是关键:参考音频占据一段负位置序列,参考图像占据单一位置,若自行实现时将二者置于同一位置或忽略时间间隔,模型将失去区分全局与局部的结构线索。

最后,跨模态生成虽与联合生成共享权重,但其评估依赖真实条件模态按当前噪声水平重加噪的同步策略,若在实现中未保持双流噪声水平一致,推理分布将偏离训练分布,同步性能可能下降。

复现前先核对哪些实现与评估细节

复现应从数据与输入构造开始。训练语料为约 270,000 条 5 秒片段,评估基准为扩展后的 VerseBench,每条提示含 6 个结构化语义组件,生成时长 30 秒,超长时测试为 8 条 13 分钟视频按 30 秒窗口聚合。文本条件在训练时为单块短标题,推理时需先用视觉语言模型将长描述切为块级短标题,语音转录按块时长对应的自然语速切分词数,使每块条件与训练分布一致。

模型层面,骨干为 LTX-2.3,冻结权重,LoRA 秩 128,路由表按层按头各四元对数初始化为 0 以使缩放因子为 1,训练 5,000 步,AdamW 恒定学习率 1e-4,梯度累积 4,误差注入概率 0.8,误差缓冲为先进先出,仅对视频运动帧注入历史误差且保持时间步为 0。损失为掩码流匹配损失,仅在目标标记上计算,参考与延续均被掩码排除。 推理层面,长视频通过固定参考、滚动延续、逐块积分常微分方程实现,条件集合在采样全程保持时间步 0。

跨模态生成在每步将真实条件模态按流匹配调度重加噪到当前 t,仅用另 1 模态的预测速度更新潜变量,双流噪声水平保持同步。 评估时需按指标方向解读:运动分数、运动平滑度、美学分数、身份一致性、CLAP 分数、内容享受度、内容有用性、制作质量、唇音置信度与音视频对齐度越高越好,制作复杂度与唇音距离及漂移度越低越好。比较时保留可运行基线,避免用搜索最优或事后最优值替代可部署收益。

代码与数据已在公开仓库发布,但复现时仍需核对硬件与依赖:训练报告基于 32 张 A800,推理未报告实时性,实际延迟需自行测量;若资源受限,可先在短片段上验证路由与误差回收的消融趋势,再扩展到 30 秒与分钟级滚动。 一个易错点是位置编码的实现:参考标记的旋转位置编码需移到负区间并与延续的 0…k 区间留出间隔,参考音频与参考图像的负位置长度不同,若统一处理会导致相对距离区分失效。

何时值得尝试 Encore、还能补哪些验证

当任务需要数十秒到数分钟的同步音视频,且对身份一致性与唇音同步有明确要求时,Encore 的分工设计值得尝试。其将局部连续性与全局一致性解耦,并通过轻量路由按层按头调节 4 类信号,适合在已有短片段音视频 DiT 骨干上以 LoRA 与小路由表低成本扩展到长时,而无需重设计骨干。 若应用场景包含固定机位或单一主体的直播、数字人播报或长时演示,固定参考帧的假设与当前设计匹配度高。

若需频繁镜头切换或场景大幅变换,则需补充分镜感知的参考切换机制,否则可能出现身份锚定过强而限制场景变化的权衡。 从验证角度,建议在复现后补充 3 类检查:一是在自有数据上测量首尾漂移以外的逐块波动,例如每块间的身份与美学差分,以确认 13 分钟稳定性是否在更复杂脚本下依然成立;二是在跨模态生成中对比噪声同步与不同步的实现,量化同步策略对对齐度的影响。

三是记录推理的每块去噪步数与端到端延迟,评估在目标帧率下的实时性差距,为后续蒸馏或流式优化提供基线。 对于教学与复述,建议按一条样本走完全流程:输入如何切为参考、延续与目标,位置编码如何区分,误差如何回收,路由如何在自注意力与交叉注意力上分别作用,损失如何掩码,推理如何滚动与重加噪。每一步都能回指到具体的组件与公式,再用长时与短片段两张表的数值说明收益与代价,避免将相关性误读为因果或将总体趋势推广到每组每步。

最终,Encore 的价值在于用可核对的构造与可学习的路由,把长时音视频的耦合难题转化为可分步优化的子问题,并在统一权重下支持 3 种生成模式;其代价是固定的参考假设与非实时的多步去噪,这两点也指明了后续可验证的改进方向。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.2-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-08 语音/音乐/音频论文速递