📄 Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption
#音视频生成 #扩散模型
6.9/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
✅ 6.9/10 | 前50% | #音视频生成 | #扩散模型 | arxiv
👥 作者与机构
- 第一作者:Nidhal Jegham(University of Rhode Island, Sustainable AI Group)
- 通讯作者:未说明
- 作者列表:Nidhal Jegham(University of Rhode Island, Sustainable AI Group)、Boris Gamazaychikov(Sustainable AI Group, Paris, France)、Sasha Luccioni(Sustainable AI Group, Montreal, Canada)
💡 毒舌点评
该论文从架构第一性原理出发推导了一套视频生成能耗缩放律,在多模型、多GPU上实现了低于3% MAPE的预测精度,工程框架设计扎实。然而,其核心贡献完全面向视频生成领域,与语音、音乐、音频社区的关联极弱——即便涉及音视频联合生成,分析也仅将音频视为CFG引入的额外视频前向pass开销,未探讨音频模态本身的任何特性。对音频领域读者而言,其直接价值微乎其微。
📌 核心摘要
本文针对文本到视频(T2V)及文本到视频+音频(T2VA)生成模型,构建了一个双向能耗估计框架。该框架无需模型权重、参数规模或实现细节,仅从可观测的生成参数(分辨率、帧数、去噪步数、批大小)和架构第一性原理出发,正向预测能耗,反向通过拟合精度验证架构假设的正确性。其理论基础是视频扩散模型的计算绑定特性:去噪阶段GPU功率稳定在TDP附近,能耗与FLOPs成正比,可分解为自注意力的二次项、FFN/交叉注意力的线性项及VAE解码项。在覆盖8.3B–27B参数的6个开源模型(HunyuanVideo系列、LTX-2、Wan系列)和3种GPU配置(8×H200、单H200、单B200)上,框架实现全部配置MAPE < 3.2%,Wan系列最低至0.007%。通过架构消融验证了拟合精度与架构正确性的严格绑定——移除关键项后MAPE从1.7%飙升至12.5%以上。作为案例,将框架延伸至8个闭源商用系统(Veo 3、Sora 2.0 Pro、Gen-4.5等)的能耗估算,结合蒙特卡洛模拟量化硬件假设的不确定性。主要局限在于VAE解码阶段的内存绑定行为未被缩放律充分捕捉,且VAE与FFN项因高共线性无法独立解耦。
🔗 开源详情
代码:论文中未提及任何代码仓库链接
模型权重:论文中未提及权重下载链接。实验使用了6个开源模型:HunyuanVideo (13B)、HunyuanVideo-1.5 (8.3B)、LTX-2 (19B)、Wan 2.1 (14B)、Wan 2.2 (27B),但未提供HuggingFace/ModelScope等平台链接
数据集:未使用传统数据集。推理使用Artificial Analysis (2026)的固定提示列表(5个提示),全文见附录C,未提供获取方式
Demo:论文中未提及
复现材料:正文及附录给出了提示列表(附录C)、软件库及版本列表(附录A)、硬件配置(附录B)及测量流程,但未提供训练配置、检查点、代码或复现包
论文中引用的开源项目:
- pyNVML (未提供链接)
- torch == 2.10.0
- torchao == 0.16.0
- xDiT == 0.4.5(标记为"Cloned from GitHub",未提供仓库地址)
- diffusers == 0.37.0.dev0(标记为"Cloned from GitHub",未提供仓库地址)
- transformers == 4.57.6
- accelerate == 1.12
- huggingface hub == 0.36.2
- OpenCV == 4.13.0
- numpy == 2.4.2
- pandas == 3.0.0
补充链接(自动提取):
- HuggingFace:https://huggingface.co/Lightricks/LTX-2/tree/main
- HuggingFace:https://huggingface.co/Wan-AI/Wan2.1-T2V-14B
- HuggingFace:https://huggingface.co/Wan-AI/Wan2.2-T2V-A14B
- HuggingFace:https://huggingface.co/mistralai/Voxtral-4B-TTS-2603
- HuggingFace:https://huggingface.co/tencent/HunyuanVideo
- HuggingFace:https://huggingface.co/tencent/HunyuanVideo-1.5
🏗️ 方法概述和架构
本工作不是提出新的生成模型,而是建立了一套基于架构第一性原理的能量消耗建模与验证框架,整体流程为:架构分析→公式推导→实验测量→NNLS系数拟合→双向验证→闭源外推。
论文基于两个关键假设建立模型:
- 计算绑定假设:视频扩散模型的去噪阶段是计算绑定(compute-bound)的,GPU算术单元饱和,功率稳定在TDP的80–100%,因此能耗 \(E = P \times t\),推理时间 \(t\) 与FLOPs成正比。实验证实非LTX模型去噪阶段功率达到TDP的97.8–98.9%。
- 参数规模无关性:能耗由架构设计(注意力模式、去噪步数等)决定,而非参数总量。例如Wan 2.1 (14B) 能耗约为HunyuanVideo (13B) 的2倍。
总能耗 \(E = E_{denoise} + E_{VAE}\),基于去噪阶段各组件复杂度推导得:
\[E_{denoise} = S \cdot B \cdot (N_v \cdot T^2 + M_v \cdot T) + G \cdot B\]其中 \(T = (H \times W \times F)/1000\) 为时空token数。\(N_v\) 捕获视频自注意力的二次代价(\(\mathcal{O}(T^2)\)),\(M_v\) 捕获FFN和交叉注意力的线性代价(\(\mathcal{O}(T)\),文本长度固定被吸收),\(G\) 为固定开销。VAE解码主要为3D因果卷积(\(\mathcal{O}(T)\)),但HunyuanVideo的VAE引入时空中间块注意力,归约为 \(N_2 \cdot (W \cdot H)^2 \cdot F \cdot B\) 项。
不同模型因架构差异采用不同公式变体:
HunyuanVideo/Wan系列:统一拟合公式 \(E = N_1 \cdot T^2 \cdot S \cdot B + N_2 \cdot (W \cdot H)^2 \cdot F \cdot B + M \cdot T \cdot S \cdot B + G \cdot B\),其中 \(N_2\) 仅在HunyuanVideo中非零,对应其VAE中间块注意力。
LTX-2双阶段模型:第一阶段在半分辨率去噪(主注意力 \(N_1 \cdot T^2 \cdot S \cdot B\)),第二阶段在满分辨率以固定3步去噪(\(N_2 \cdot T^2 \cdot B\)),FFN/VAE卷积合并为 \(M \cdot T \cdot S \cdot B\)。
音频扩展(LTX-2 T2VA):音频生成开销并非来自音频自注意力或交叉注意力本身,而是全部源于多模态Classifier-Free Guidance引入的额外视频前向pass(T2VA需3个pass/步 vs T2V的2个pass/步),体现为线性项系数 \(M\) 的跃变。
正向预测:将NNLS拟合出的系数代入公式即可预测任意(H, W, F, S, B)配置的能耗。Wan 2.1在8×H200上达0.093% MAPE。
反向验证/架构探伤:人为移除某项(如 \(N_2\) 或 \(M\))后重新拟合,若拟合误差剧烈上升(如HunyuanVideo移除 \(M\) 后MAPE从1.709%崩塌至12.50%),则证明原架构假设正确——拟合精度本身即成为架构有效性的定量判据。
对8个API商用模型,通过API最小延迟(去除排队噪声)测量推理时间,假设部署于DGX/TPU v6e等全节点,结合TDP分布(\(\mathcal{N}(0.9 \cdot TDP, (0.05 \cdot TDP)^2)\))和蒙特卡洛模拟(10,000次采样)估算能耗。各模型根据公开架构信息选用不同公式形式(如Veo用解耦时空注意力公式,Gen-4.5用标准时空自注意力公式)。

💡 核心创新点
- 双向能耗预测与架构验证框架:首次将能耗缩放律同时用于正向预测和反向架构推断,拟合精度本身成为黑盒探伤工具,在视频能耗研究领域没有先例。
- 统一的架构感知缩放律:将不同架构的视频生成能耗精炼为 \(N \cdot T^2 + M \cdot T\) 加特定修正项(VAE中间块注意力、第二阶注意力、音频CFG开销)的极简解析式,覆盖8.3B–27B、纯视频到音视频合一的多种架构。
- 音频开销的简化归因:通过T2V/T2VA对比实验,证明联合音视频生成的能量开销完全来自多模态CFG增加的视频前向pass,而非音频模块本身的计算,这一发现简化了T2VA模型的能耗建模。
- 闭源模型能耗估算的工程方案:利用框架性质,仅凭API延迟和公开架构信息估算8个商用系统的能耗,结合蒙特卡洛模拟处理硬件不确定性,为缺乏内部信息的模型可持续性审计提供了可操作的路径。
📊 实验结果
本文核心实验结果是缩放律在不同架构及硬件上的预测精度,未涉及与SOTA方法的对比(如与CodeCarbon等能耗工具的精度比较)。
表1:三GPU配置下各模型拟合误差(摘要)
| GPU配置 | 模型 | MAPE (%) | 最大APE (%) |
|---|---|---|---|
| 8×H200 | HunyuanVideo | 1.709 | 6.953 |
| 8×H200 | HunyuanVideo-1.5 | 0.672 | — |
| 8×H200 | Wan 2.1 | 0.093 | 0.285 |
| 8×H200 | Wan 2.2 | 0.137 | — |
| H200 | HunyuanVideo-1.5 | 0.154 | — |
| H200 | Wan 2.1 | 0.021 | — |
| H200 | Wan 2.2 | 0.091 | — |
| H200 | LTX-2-T2VA | 2.065 | — |
| H200 | LTX-2-T2V | 1.896 | 5.267 |
| B200 | HunyuanVideo-1.5 | 0.160 | — |
| B200 | Wan 2.1 | 0.039 | — |
| B200 | Wan 2.2 | 0.007 | — |
| B200 | LTX-2-T2VA | 3.123 | — |
| B200 | LTX-2-T2V | 2.280 | 5.943 |
注:所有MAPE均<3.13%,Wan系列MAPE普遍低于0.2%,预测与实际能耗散点图(图3)紧密分布在对角线附近。
关键发现:
- 架构消融验证(反向方向):移除HunyuanVideo的 \(N_2\)(VAE中间块注意力)后MAPE从1.709%升至3.768%,进一步移除 \(M\) 后崩塌至12.50%;LTX-2-T2V移除第二阶注意力项后MAPE从1.896%升至4.424%,移除FFN项后崩塌至14.215%。这严格证明了拟合质量与架构正确性的绑定。
- 参数规模无关性:HunyuanVideo-1.5 (8.3B) 能耗高于HunyuanVideo (13B),Wan 2.1 (14B) 与Wan 2.2 (27B/14B active MoE) 能耗几乎一致,且Wan 2.1能耗约为HunyuanVideo的2倍,证明架构选择比参数量更能决定计算成本。
- 多GPU推理:8×H200虽大幅缩短生成时间,但因GPU间通信开销,总能耗与单卡相近或更高(如Wan 2.1在8×H200上383 Wh vs 单H200上345 Wh)。
- 闭源模型外推:Veo 3估计均值30.8 Wh(TPU v6e),Seedance-1为80.0 Wh(DGX H800),Gen-4.5为322.0 Wh(DGX B200/H200),Sora 2.0 Pro为418.5 Wh(DGX B200/H200),跨模型差异超一个数量级。
- 交叉验证:留一法交叉验证MAPE与样本内MAPE差异极小(如Wan 2.1 0.132% vs 0.093%),证明系数泛化稳定。


🔬 细节详述
- 训练数据/推理数据:不涉及训练。使用Artificial Analysis固定提示列表进行推理(共5个提示,详见附录C)。
- 损失函数:无,采用非负最小二乘(NNLS)进行系数拟合。
- 训练策略/优化器:无训练。NNLS用于系数估计,留一法用于交叉验证。
- 关键超参数:去噪步数以 \(S=40\) 为主,HunyuanVideo FPS=24,Wan系列FPS=16。分辨率和帧数按实验设计变化以激发不同项。
- 硬件:DGX H200 (8×H200 SXM, 5.6kW TDP)、单H200 SXM (0.7kW TDP)、单B200 (1.0kW TDP)。PyNVML每100ms采样功率、GPU利用率和内存利用率。
- 推理细节:批大小以 \(B=1\) 为主,HunyuanVideo额外测试 \(B=2,4\)。为分离阶段,对VAE解码和去噪进行分阶段记录。对超GPU内存的模型(HunyuanVideo、HunyuanVideo-1.5、LTX-2)启用时序平铺(temporal tiling)。每次生成前进行两次预热运行,间隔5秒空闲以消散热载荷。
⚖️ 评分理由
创新性 (1.4/2):从架构第一性原理推导能耗缩放律并将其作为双向探针的思路较新颖,架构消融验证拟合正确性的反向机制在视频能耗研究中没有先例。但正向公式本质是基于复杂度的线性/二次分解,在计算绑定假设下属于合理演绎,未引入新的学习范式或底层理论突破,创新主要体现在工程建模的系统性和精确性。
技术严谨性 (1.3/1.5):推导逻辑清晰,所有假设(计算绑定、文本长度固定、批内无交互)均在论文中明确声明并提供实验证据(功率保持在80.9–98.7% TDP)。NNLS回归与留一法交叉验证保证系数稳定性。不过,VAE解码阶段的内存绑定对功率恒定性的干扰被归为二阶效应,虽有定性讨论但未定量分析其对拟合残差的具体贡献,略微削弱了严密度。
实验充分性 (1.3/1.5):覆盖6个模型、3种GPU、单/多卡配置,实验设计针对性地激发各公式项(变帧数、去噪步数、批大小),消融分析严格验证了反向方向。主要不足:未与任何其他能耗估计工具或方法(如carbontracker、CodeCarbon)进行对比评估,缺乏外部基准;LTX-2音频CFG的归因仅通过T2VA与T2V的系数差值实现,未独立测量或消融验证CFG pass数量。
清晰度 (0.8/1):整体结构合理,符号表清晰,公式编号便于索引。但部分LaTeX下标在纯文本中略显拗口,且缺少直观的伪代码或算法框图来总结框架流程,交叉验证细节分散在段落中。
影响力 (0.4/1.5):该工作为视频生成模型的可持续性审计提供了标准化工具,对该子领域有明确的工程指导价值。但其核心任务、数据和对象完全是视频模态,与语音、音乐、音频社区的关联极其薄弱;即使方法原则可被借鉴,论文未提供任何音频领域的实验或延伸讨论。对本领域读者而言,其直接推动作用和后续研究吸引力均十分有限。
开源 (0.2/1.5):论文未提供代码仓库、模型权重或专用数据集,仅公开了附录中的5个提示和软件库版本列表。核心的能耗拟合脚本、API测量代码均未公开,无法直接复用。
可复现性 (0.3/0.5):硬件型号、驱动库版本、API轮询方式、预热与冷却流程、提示完整列表均在附录说明,有心的团队可大致复现测量流程。但缺少一键复现脚本和详细的数据处理说明(如功率积分、tiling参数配置),复制成本偏高。
工程/实践价值 (1.2/1.5):框架建立了一套标准化的黑盒能耗估算流程,可直接应用于闭源API的可持续性基准测试,对工业界审计和政策制定有参考意义。蒙特卡洛不确定性传递、API延迟的去噪方法等细节展现了较高的工程设计成熟度。不足在于尚未封装为工具包或开源库,限制了直接落地的便利性。
🚨 局限与问题
论文明确承认的局限:
- VAE解码阶段的内存绑定特性未被缩放律充分捕捉,作者正在探索更稳健的解码期建模。
- VAE与FFN项因高共线性无法彻底解耦,阻碍相位级系数的独立解读,需通过扩大配置空间(更独立地变化参数)来改善。
- 闭源模型估计依赖于未经验证的硬件部署和功率假设,具有额外的不确定性。
审稿人发现的潜在问题:
- 与音频领域的零关联:全文无任何音频专用实验或以音频为中心的讨论。即便涉及LTX-2的音视频联合生成,音频仅被建模为CFG引发的额外视频前向pass开销,音频生成本身(耗时<0.1秒)被直接忽略。该类模型的音频模态计算特性(自注意力、FFN开销)未得到任何独立验证,该框架在纯音频或语音领域的适用性完全未知。
- 缺少外部对比与方法校验:论文未与任何现有能耗估计工具(CodeCarbon、carbontracker、ML CO2 Impact等)或同类缩放律工作进行精度对比,无法判断该框架在绝对精度或易用性上的优势。
- 闭源模型硬件假设缺乏实证:B200与H200等概率分配、TPU v6e功率模型、以API定价比推测音视频开销比等均无独立验证手段,结果精度上限无法量化。
- 计算绑定假设的边界未界定:极低分辨率、极少帧数或轻量模型下,计算绑定可能不再成立(GPU利用率下降),但作者未讨论该假设的适用范围或失效条件。
- 实验配置覆盖有限:对某些模型(如Gen-4.5仅3个配置),实验点数量过少(n=3),虽拟合MAPE极低,但模型的泛化能力在该稀疏采样下被过度乐观地表征。
📷 论文图片
