在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作
ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。
ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。
Archon 针对文本音频动作视觉碎片化问题,用统一离散词表加自回归语言模型统一七种模态,以语义视频实现约 4 倍 token 压缩并用语义驱动扩散恢复高清视频,最强证据是语音驱动视频与图条件语音任务上与专用模型相当或更优,代价是两阶段训练与推理链更长且本次未能确认代码模型公开。
AVI-Edit 以 Wan2.2 为视频骨干,用精度因子引导的掩膜精修器管空间边界、用分离生成混音返工的音频智能体管时间对齐,在 AVISET 与 AvED-Bench 上报告了质量与同步优势,代价是多实例只能串行逐个处理。
针对单图全身会话化身中音频到姿态再到渲染的误差累积与口手细节丢失问题,论文用音频直接调制三维高斯粒子变形场并蒸馏大视频扩散先验,消融显示轨迹对齐与分数蒸馏分别控制同步与平滑,但自建评测与合成监督带来泛化边界。
针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。
AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。
论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。
针对双人对话头像需要实时响应用户语音与动作、且倾听表情难以标注的问题,论文用因果扩散强迫在动作隐空间逐块生成并用丢用户条件的合成负样本做偏好优化,报告约 500 ms 延迟、6.8 倍加速与超 80% 人工偏好,代价是口型与画质只保持可比而非全面领先。
针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。
该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。
论文以 6 至 32 个月婴儿视角的纵向音视频为唯一感官来源,构建视频话语、图像话语与多轮交错三种预训练数据并从零训练紧凑视觉语言模型,再以新发布临床工具为依据建成十任务基准,证据显示小模型可在部分认知任务上接近大模型但域外泛化与未见任务仍明显受限。
论文提出只变一个物理因素的时间对齐视频对与单视频模式测试来审计视频生音频模型,用方向一致性与敲击对齐度量揭示文本提升语义却损害同步、像素物理推理普遍偏弱的代价。
针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。
BioVITA 针对图像与分类文本已对齐但音频缺位的问题,用 130 万音频与 230 万图像的两阶段对比学习把音频接入 BioCLIP 2,并在六方向检索上报告平均 Top-1 为 71.7% 的结果,代价是科层级检索与哺乳类音频仍明显更难且项目页链接当前不可用。
针对单模态噪声与跨模态语义鸿沟,BYOAVP 以自监督音频增强对齐视觉语义、以动量原型约束做像素级分类,在 AVSBench 与 VPO 六个子任务上取得最优,同时需承担双分支注意力与原型维护的额外开销。
针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。
针对电影混音需分离对白、音效、音乐且缺乏带干净分轨的视听电影数据问题,该工作用条件流匹配同时生成三路频谱并以面部与场景双路视觉为条件,合成数据训练后在合成与真实电影片段上获得更干净的主观与分布指标,但多步采样与预测模型在信噪比类指标上的差距仍是代价。
针对影视长视频、多说话人和音画不同步问题,CineSRD 先用视觉锚点聚类注册说话人再用音频语言模型做轮次检测与幕后补充,在 SubtitleSD 上报告更低的 DER 与 JER,代价是多阶段集成而非端到端且依赖人脸与字幕时间轴。
针对同一视频中语言、视觉、音频情感极性不一致时相似性对齐会扭曲共享语义的问题,论文提出冲突感知自适应交叉重构 CACR,用共享空间冲突分数加权交叉重构实现隐式对齐并以视听线索精炼文本,在 MOSI 上报告 ACC7 为 48.69、ACC2 为 87.04,代价是需要多组重构解码器与多项正则损失协同训练。
针对手势数据缺描述文本导致的语义先验缺口与音频加描述难以协调控制的问题,CoordSpeaker 先用动作语言模型离线生成多粒度手势字幕,再用统一表示的潜在扩散加分层去噪器实现语音节奏与字幕语义的联合生成,最强证据是推理耗时大幅下降与文本对齐指标领先,代价是部分重建指标未占优且长序列时序感知仍有限。