英文题目:Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
会议身份:
conference:aaai:2026:conference-paper-id:37285
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#流匹配 #多模态学习 #音视频 #语音 #音视频生成
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Liyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxiang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Jiawei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Bingchuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuowei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Lijie Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xu He:机构信息未能从会议 PDF 纯文本可靠映射
- Gen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qian He:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人本视频生成(Human-Centric Video Generation,HCVG)需以文本描述场景动作、参考图像定义身份外观、音频信号驱动说话口型,难点在于三元组完备数据稀缺且三者控制能力在联合训练中相互损伤。本文提出的HuMo先构建不完整互补数据集,用跨库检索的人物与物体参考图和唇同步过滤的语音片段分别补齐图像与音频缺失,再以两阶段渐进范式学习控制能力。第一阶段冻结文本交叉注意力并仅微调自注意力实现主体保持,第二阶段插入音频交叉注意力并用面部预测辅助聚焦口唇区,同时以任务比例退火保留已有能力,推理时再用阶段自适应无分类器引导(Classifier-Free Guidance,CFG)切换权重。与图像到视频(Image-to-Video,I2V)与主体到视频(Subject-to-Video,S2V)方法的机制差异在于避免依赖主体完备首帧与硬门控截断,改用尾部拼接参考隐变量与软正则聚焦。在主体保持任务上17B版本文本视频对齐得分3.939超过Phantom-Wan-14B的2.877,在MoCha同步任务上文本对齐6.508超过HunyuanCustom的6.246,同步置信度6.252接近商业系统OmniHuman-1的6.526。该结论仅在单人近景说话与检索式参考条件下验证,对多人对话、长时运动与非人脸音频驱动尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Phantom-video/HuMo — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出要保留什么?
这篇论文研究的输入是文本提示、参考图像与音频 3 类条件,输出是一段人物视频。文本负责描述场景与动作,参考图像负责定义人物身份与主体外观,音频负责决定人物在说什么。输出必须同时保留 3 类信息,并且在空间与时间上连贯:环境与服饰要符合文本,身份要与参考图一致,脸部与身体运动要与音频对齐。
对于刚进入语音与视觉交叉方向的研究生,关键是把任务理解为约束满足问题,而不是单一条件生成。缺少任一模态,视频仍应可生成,但约束变少;3 模态齐全时,模型必须处理异构信号的竞争。论文把这种竞争归纳为两个挑战:模态完备数据稀缺,以及三元条件联合建模时容易互相损害性能。
以人为中心视频生成 × 多模态协同控制: 以人为中心视频生成负责界定要生成什么样的人物视频,强调身份、外观、动作与场景的时间连贯,多模态协同控制负责说明靠哪些输入来约束这次生成,强调文本管语义、图像管主体、音频管说话如何不互相覆盖,HuMo 把二者搭配为一个统一框架要同时满足的输入与目标关系。
开场需要交代本文的写作方式。输入是论文原文证据与本次收到的官方原图像素,目标是把方法讲到可核对、可复述,输出是 1 篇中文技术解读。必须保留的信息包括数据构造动作、2 阶段训练安排、推理引导切换与实验条件,凡是原文未报告的实现细节会明确指出缺项,不做推定。
已有路线在同输入同目标下卡在哪里?
在相同的人物视频目标下,已有工作分为两条路线。第一条是基于图像到视频的管线,先用文本到图像模型生成包含全部要素的首帧,再用图像到视频模型做动画与音频注入。它的运行阶段依赖一张主体完备的首帧,文本只能在首帧给定的外观上做有限修改,当首帧缺失主体时就难以继续。第二条是主体一致视频生成,直接用参考图加文本生成视频,支持文本编辑,但传统做法不支持音频输入,因而无法控制人物说什么。
近期也有尝试把两条路线合并的同期工作,但论文报告它们难以平衡 3 模态的影响:强调参考图会削弱音画同步,强调同步又会损害文本跟随或主体保持。这正是本文要解决的协同问题,而不是单纯提高某一单项指标。
主体一致视频生成 × 音频驱动人物动画: 主体一致视频生成分工是从参考图抽取身份并在文本编辑下保持一致,音频驱动人物动画分工是让嘴部与身体动作跟随语音,HuMo 搭配二者的理由是前者缺说话控制、后者依赖完整首帧,二者组合后才需要解决 3 模态互相削弱的问题。
从监督与运行阶段看对照条件:音频驱动方法通常需要可见人脸的首帧并在全帧尺寸上做口唇动画,主体一致方法通常用语义编码器或上下文拼接方式注入身份。前者有音频监督,后者有身份一致监督,但都没有在同一模型内同时接受文本、任意参考图与音频并保持三者可独立控制的训练设计。
为什么缺首帧与缺音频是两类不同的失败?
论文用一张对比示意图讲清两类失败的输入条件。依赖首帧的图像到视频方法,当给定的起始帧是主体不完整的空场景时,后续生成无法补出一致的主体,表现为无效生成。传统主体到视频方法虽然可以用参考图生成运动,但输入组合里没有音频通道,即使人物出现,嘴部动作也与语音无关,放大后的嘴部区域显示出无法被语音控制的问题。
看图路径: 1. 先看左侧两个输入框的图标差异,确认哪一路缺音频、哪一路依赖首帧;2. 再看右侧上排首帧缺失时标注的无效生成位置;3. 最后看下排人物嘴部放大的红框,确认传统路线无法控制说话的问题
论文图 2。原论文 Figure 2:“The I2V-based methods requiring a subject- incomplete start frame cannot generate valid or subject- consistent video, while traditional S2V methods cannot sup- port audio input.”。
这张图的可执行读法是区分失败的归因。上面一行失败来自输入阶段缺主体,模型没有可延续的外观先验;下面一行失败来自条件缺音频,模型没有可跟随的语音信号。HuMo 的动机就是同时摆脱这两种依赖:不要求首帧完备,也要求音频可注入,并且文本仍能改写场景与动作。理解这一点后,后面的数据与训练设计才有学习依赖关系。
HuMo 让一个样本走完输入到输出的全景是什么?
沿着一个 3 模态样本走一遍,输入是文本提示、参考图像集合与语音波形。文本经过文本编码器得到语义表示,参考图像经过视频自编码器压缩为图像潜变量,音频经过语音编码器得到音频嵌入。视频侧从噪声潜变量出发,与参考图潜变量沿时间维拼接后进入由自注意力、文本注意力和音频注意力堆叠的扩散变换器主干,最终经解码器得到视频像素。训练目标是流匹配速度场预测,模型在给定多模态条件下学习从简单先验到数据分布的确定性传输映射。
数据侧的全景分为 3 个阶段。阶段零从大规模视频池出发,用视觉语言模型补齐文本描述,保证每个样本有基本文本模态。阶段一为每个视频检索跨对参考图,人脸要求同身份但妆容姿态背景服饰年龄有变化,物体要求同语义类别但颜色形状视角有差异,以此避免复制粘贴。阶段二补充音频模态,只保留语音片段并做唇同步分析得到紧对齐的音画对,但此时只能找到人物参考图,数据天然不完备。
训练侧的全景是渐进获得能力。先在阶段一建立文本图像协同的主体保持能力,再在阶段二保留该任务的同时逐步加入音画同步任务,实现向文本图像音频 3 模态的过渡。推理侧用可分离的无分类器引导权重分别控制 3 个模态,并在去噪的不同时间段切换配置。
看图路径: 1. 先沿文本编码器、参考图编码器与音频编码器三条输入线看到中间的注意力堆叠;2. 再看自注意力与音频注意力模块上的可训练标记与冻结的文本注意力;3. 最后看右侧从阶段零到阶段二的数据组成如何逐步补齐模态
论文图 3。原论文 Figure 3:“Overview of our framework. HuMo model (left) is trained based on the proposed data processing pipeline (right).”。
结合框架总览图可以核对上述路径。左侧显示 3 路编码器汇入注意力堆叠,以及面部位置预测器从音频注意力输出接出并受真实人脸掩码监督;右侧显示阶段零只有文本、阶段一加入人物与物体参考图、阶段二加入音频但参考图以人物为主。这种左右对照说明数据不完备是已知前提,训练渐进是对应解法,而不是偶然的超参数选择。
主体保持分支如何做到少改主干?
主体保持任务的操作是最小侵入图像注入。具体动作是:不修改扩散变换器主干结构,把参考图像的自编码器潜变量与噪声视频潜变量沿时间维拼接,形式为噪声在前、参考在后,迫使模型经由自注意力从参考中抽取身份并传播到所有帧。把参考放在序列尾部是为了避免模型把参考误认为起始帧而做图像续写。文本在该阶段仍然作为输入,以保证语义一致与可控。
参数更新被限制在自注意力层,文本视觉交叉注意力层保持冻结。论文给出的安排理由是保护预训练主干已有的文本跟随与图像合成能力,只用最小子集学习身份传播。这种做法的梯度路径只经过自注意力,监督来源仍是流匹配的视频重建目标,没有引入额外身份损失。原文未报告学习率、优化器与批量大小等细节,这部分属于缺项,复现时需要回到开源仓库核对。
最小侵入图像注入 × 自注意力微调: 最小侵入图像注入分工是不改主干结构而把参考图潜变量拼接到噪声潜变量序列尾部,自注意力微调分工是只更新自注意力层而冻结文本视觉交叉注意力,搭配理由是前者提供身份信息通道、后者守住预训练的文本跟随能力,组合后新增的作用是在不破坏生成能力的前提下获得文本图像协同。
一个教学例子是单人加单物体的组合输入。例子中参考图可以是一张人脸与一副手套,文本要求人物戴上手套,模型需要同时保持人脸身份与手套外观,并按文本生成戴的动作。此处例子仅用于说明输入组合方式,不附加无源的效果数值。
音频分支如何把声音关联到脸部运动?
音频注入的操作是在每个扩散变换器块中插入音频交叉注意力层。音频特征用语音识别模型提取,以获得跨说话人与语言的泛化性。基于人物运动主要与时间邻近音频相关的观察,模型对每个视频帧时间戳取中心窗口内的音频嵌入拼接为最终音频嵌入,窗口长度为 5,帧数与视频潜变量序列长度一致,再与视频隐状态逐帧做交叉注意力计算。
由于全帧注意力是粗粒度的,论文提出预测式聚焦策略来隐式引导。做法是在最后 4 个扩散变换器块的音频交叉注意力之后接面部掩码预测器,输出预测的人脸区域分布,用真实二值人脸掩码以二值交叉熵监督,并对小脸区域引入尺寸感知权重以加强监督。论文明确区别于先前对音频注意力输出做硬门控的做法,认为硬截断会损害表示能力,而预测式聚焦是软正则,保留全身运动与复杂交互的建模灵活性。
音频交叉注意力 × 预测式聚焦: 音频交叉注意力分工是把时域窗口内的语音嵌入逐帧注入视频隐状态,预测式聚焦分工是用面部掩码预测损失隐式引导模型关注脸部区域,搭配理由是粗粒度全帧注意力难以形成口唇同步、硬门控又会截断表示能力,组合后新增的作用是以软正则方式增强同步并保留全身运动建模的灵活性。
需要区分原始目标与附加监督。主目标仍是流匹配速度预测,面部掩码损失是附加的定位监督,只在训练时引导注意力聚焦,推理时不需要真实掩码。原文未给出两项损失的加权系数与预测器的具体网络宽度,这属于未报告项,不从模型名称推定实现。
两阶段如何组织数据、任务比例与推理切换?
训练按数据阶段组织。阶段一用文本加参考图数据建立主体保持能力,音频相关模块关闭。阶段二在保留主体保持任务的同时逐步加入音画同步任务,音频相关模块开启。任务比例采用渐进加权:初期主体保持占多数、音频输入为空以巩固已有能力,音画同步占少数;随训练推进逐步把音画同步提高到一半。整个阶段二仍只更新自注意力层与音频相关模块,延续阶段一的微调原则。
推理的灵活控制用可分离引导实现。模型对缺失条件用空标记代替,因此支持文本图像、文本音频与文本图像音频 3 种组合。阶段自适应策略在去噪初期采用文本图像主导配置以建立语义布局与空间结构,在后期切换到强调音频与图像控制的配置以细化身份相似与音画同步。论文报告这种动态切换改善了多模态协作与整体质量。
渐进式任务加权 × 阶段自适应无分类器引导: 渐进式任务加权分工是在训练中先以主体保持任务为主再逐步提高音画同步任务占比,阶段自适应无分类器引导分工是在推理去噪的不同时间段切换文本图像主导与音频图像增强的引导强度,搭配理由是训练解决能力习得顺序、推理解决不同去噪阶段的模态需求变化,组合后实现从双模态到 3 模态的平稳过渡与细粒度控制。
下表把可核对的构造与训练规模放在一起,数值与单位保留原文写法,便于复现时对照数据量、分辨率与步数是否一致。
| 条件 | 指标 | 阶段一取值 | 阶段二取值 | 通用配置 |
|---|---|---|---|---|
| 数据规模 | 文本与参考图样本量 | O(1)M 视频样本 | O(50)K 音画对齐样本 | 文本模态全覆盖 |
| 训练步数 | 阶段步数 | 40k steps | 40k steps | 2 阶段连续训练 |
| 视频预处理 | 分辨率与帧率 | 480×832 分辨率 | 480×832 分辨率 | 25 fps 重采样 |
该表的比较问题是训练成本与数据效率是否可复现,公平条件是同一主干与同一分辨率帧率,指标方向是样本量越大可扩展性越好、步数决定计算预算。表后需要说明代价:阶段二数据量比阶段一小两个数量级,且阶段二参考图以人物为主,物体与多主体泛化主要依赖阶段一;2 阶段各 40k 步意味着复现需要准备相应的加速器预算,原文未报告具体硬件型号与时长,这是缺项。
另一张表把音频窗口、任务比例与推理时间段放在一起,同样保留原文数值写法。
| 条件 | 指标 | 初期取值 | 后期取值 | 说明 |
|---|---|---|---|---|
| 音频嵌入 | 窗口长度 n | n = 5 | n = 5 | 与视频潜变量帧数对齐 |
| 阶段二任务 | 主体保持与同步占比 | 80% 与 20% | 50% 与 50% | 空音频用于巩固已有能力 |
| 推理去噪 | 时间段切换点 | 1.0 to 0.98 | 0.98 to 0 | 前段建布局后段精化同步 |
该表的比较问题是渐进与分段是否按原文执行,公平条件是同一任务定义与同一时间归一化,指标方向是比例与切换点必须精确复现才能对比。表后解释是收益与风险:渐进比例让模型从双模态平滑过渡到 3 模态,分段引导让早期结构不受音频干扰;但若把比例或切换点改动,文本跟随、主体一致与同步的平衡可能变化,原文未给出切换点敏感性曲线,待验证。
在什么基线、基准与指标下比较?
实现细节报告主干为两个规模的视频生成模型,视频重采样到 25 帧每秒、分辨率为 480 乘 832。阶段一训练 40k 步并关闭音频模块,阶段二继续 40k 步并开启音频模块。论文还报告在 1.7B 与 17B 两种参数规模上验证框架,以说明可扩展性。
比较分为两类。主体保持类以文本与主体参考图为输入,对比开源与闭源的主体到视频方法,在包含人物、物体与动物的 100 个自建测试用例上评估。音画同步类以文本、图像与音频为输入,对比开源的人像动画方法与闭源方法,在电影级说话人物基准上评估。其中只有部分基线支持参考图,其余基线依赖主体完备首帧并遵循图像到视频范式,后者在视觉质量上具有更强的布局与面部结构先验,比较时需要考虑这一条件差异。
评估覆盖 4 个方面。视频质量用美学分数、图像质量评估与基于大模型的面部结构合理性;文本视频对齐用基于视觉语言模型的奖励模型;主体一致对人脸用两种人脸识别相似度、对非人脸用两种图像嵌入相似度;音画同步用同步置信度与同步距离,前者越高越好,后者越低越好。原文对人评与自动指标的区分是明确的,自动指标不能当作人评,数值相同也不代表同一指标。
主结果在何种条件下支持何种判断?
主体保持任务的定性报告是文本跟随更强,例如在进入寺庙的多人场景中,其他方法出现缺人或身份漂移,而本文方法能保持 4 个不同人物身份;在戴手套场景中人物肢体结构更完整;在未训练过的背景图输入下仍能融合背景。定量报告是在美学、图像保真、人体结构合理性、文本跟随与主体一致上取得最优,这与定性观察一致,支持文本可编辑性与主体一致可以兼得的判断,但限制是自建基准的分布与提示词风格决定了结论边界。
音画同步任务的定性报告是文本跟随优势,例如银色吉他与金色背景光等细节在对比方法中缺失,而本文方法能渲染;在暗光人脸输入下能按文本生成清晰可见的脸并保持身份。定量报告是在美学与文本跟随上取得高分,在人体结构与身份相似上超过支持参考图的基线,也超过依赖首帧的基线;在同步指标上 1.7B 模型已超过多个开源专用模型,仅略低于闭源方法。需要强调评估时只用单张参考人脸,而框架本身支持多参考图组合,因此单图评估是保守条件。
看图路径: 1. 先数胶片拼贴中不同格子的输入图标,区分文本图像与文本音频图像组合;2. 再观察人物、动物、卡通与风格化肖像等不同主体类型;3. 最后确认参考小图与生成大图之间的人物衣着与身份对应关系
论文图 1。原论文 Figure 1:“We propose HuMo, a multimodal HCVG frame- work that supports flexible input compositions of text- image, text-audio, and text-image-audio.”。
这张拼贴图用于核对泛化声明的输入组合与主体类型。图中每格右上角的图标区分了文本图像与文本音频图像等组合,主体覆盖人物、人物加物体或动物、风格化艺术形象与动画角色。读图时应把参考小图与生成大图的衣着纹理、面部特征逐 1 对照,而不是只看整体美观。该图显示的是能力广度,不直接证明同步精度,同步仍需回到音画指标与消融来判断。
拿掉渐进、定位与参数限制后哪里先变差?
消融在音画基准上比较 3 种变体。第一是全量微调,即更新主干全部参数而不是限制子集,报告美学与文本对齐下降,定性出现缺失文本提到的手机与可见伪影,支持限制更新范围有助于保护预训练合成与对齐能力的解释。第二是去掉渐进训练,即单阶段同时训练 2 个任务,报告多数指标下降且人物身份相似度降低,支持分阶段建立能力有助于跨模态协调。第三是去掉面部定位,即移除预测式聚焦,报告同步置信度下降且唇动与发音错位,同时身份相似度也有下降,支持定位监督隐式帮助面部一致。
每组消融都应就近说明未胜出项。即使完整模型在多数指标上最优,全量微调在个别身份相似度数值上并不低,说明放开参数可能保留身份但牺牲美学与文本跟随;去掉渐进的变体在某些质量分数上接近完整模型,说明单阶段并非完全失效,而是在协同稳定性上付出代价。原文未报告多次随机种子的方差与显著性,因此趋势成立不等于每组都显著,这部分待验证。
哪些边界尚未被测量?
从证据看至少有 4 类边界。第一,阶段二数据以人物为主,物体参考与多主体在有音频时的表现缺乏系统测量,泛化到动物说话或物体交互时的同步机制可能不同。第二,评估依赖自动美学、质量与同步指标加大人脸相似度,没有报告误判率、推理延迟、输出帧率与实际部署成本,不能承诺这些量得到改善。第三,面部掩码监督依赖人脸检测质量,对侧脸、遮挡与小脸的鲁棒性未单独报告,尺寸感知权重只能缓解而非消除该依赖。第四,分段引导的切换点与 3 路引导权重是经验配置,原文未给出完整敏感性分析,不同提示词长度与音频信噪比下的最优配置可能变化。
缺失证据不是技术错误,相关性也不是因果。例如同步分数高与定位损失同时出现,支持定位有帮助,但不能直接断言定位是同步提升的唯一原因,还需控制音频编码器与数据对齐质量的对照。总体趋势不等于每步都成立,早期去噪强调文本图像、后期强调音频图像是平均行为,个别样本可能需要不同配比。
复现先做什么,需要补哪项验证?
资源状态是正文开源声明的唯一依据。代码资源当前可用,扩展版本当前可用,复现应先从这两个链接获取实现与扩展描述,再核对主干版本、数据预处理与 2 阶段步数是否与上表一致。建议先复现阶段一的主体保持管线:按分辨率与帧率重采样,用跨对检索构造参考图,把参考潜变量拼接到序列尾部并只训练自注意力,验证文本编辑不破坏身份。
再复现阶段二的音频管线:开启音频交叉注意力,用窗口长度为 5 的拼接嵌入逐帧注入,在最后 4 个块后接面部预测器并加尺寸感知监督,按 80 比 20 到 50 比 50 的比例渐进加入同步任务。推理时实现 3 路可分离引导并按 1.0 到 0.98 与 0.98 到 0 两段切换,缺失模态用空标记代替以测试 3 种输入组合。
还需补的验证包括同一提示词多次采样的方差、不同切换点下的同步与身份曲线,以及低信噪比音频与遮挡人脸下的失败率。只有补齐这些,才能把论文报告的优势从基准分数推广为可部署收益。
何时值得尝试这个方案?
当任务同时需要文本改写、参考图保身份与语音控嘴型,且无法保证每条数据都有三元完备标注时,这个方案值得尝试。它的可操作价值在于用非完备互补数据提高利用率,用渐进任务与最小更新范围守住文本能力,用软定位监督增强同步而不截断表示,再用分段引导在推理时分别满足结构与细节需求。
不适合的情况是只有单模态或纯配音需求,或硬件只允许单阶段短训练,此时 2 阶段与 3 路引导的复杂度可能超过收益。复现时应保留关键超参数与信息条件:窗口长度、任务比例、去噪切换点与缺失条件的空标记处理,区分代码开源与系统可运行。最终判断应回到原文条件:在报告的基准、基线与指标下,统一框架在两个子任务上显示出协作优势,但部署前的延迟、成本与鲁棒性仍需自行测量。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


