aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对随语音生成全身动作时末端抖动与误差沿骨骼链放大的问题,论文把扩散建模搬到全局旋转空间并用关节、骨骼、时序三层约束补回结构,消融表显示完整约束取得最低分布距离,但节奏对齐仍有基线未被全面超越的代价。
论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。
AniTales 针对文本互动故事缺少稳定多模态呈现的问题,用大语言模型生成带说话人与情绪标签的结构化剧本,再以同一标签驱动立绘表情与语音韵律,在 10 名普通用户与 5 名专家的十幕故事试用中获得可用性 84 分与角色对话匹配 4.2 分,但语音适配在两组均为 3.6 分成为最弱环节。
针对带声音的人脸视频在压缩、模糊和低分辨率下的退化,GAVN 用低分辨率空间的帧间时域特征做粗修复、用高分辨率空间的音频加关键点身份特征补细节,在 VoxCeleb2 和 Obama 两种说话人场景下取得最优的图像质量与唇音同步分数,但代价是两阶段训练与多模块推理成本。
ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该文把语音驱动的人脸运动看作情绪条件下的运动隐空间分布,用正交运动字典加情绪子空间保留发音与情感耦合,再用逐层跨注意力融合音频与情绪去调制流匹配速度场,在 MEAD 上取得 82.05% 情绪准确率与 22.58 dB PSNR 并以十步采样实现实时推理,代价是仅覆盖英语与七类基本情绪且对大角度头部转动验证不足。
针对音频驱动人像动画中动作自然度、唇同步、视觉质量互相冲突的问题,该工作用 Talking-Critic 学三维奖励并自动构建 410K 偏好对,再用 TLPO 分专家独立优化后做时步-层自适应融合,报告显示主指标和用户评分全面提升,代价是两阶段训练与多专家推理融合的额外复杂度。
针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。
针对自然混合音频直接生成图像会丢失多源语义的问题,MACS 采用先用 UNet 分离再用解耦交叉注意力生成图像的两阶段路线,在 LLP-multi 等多任务上报告了多项指标领先,但分离数固定与文本标签依赖仍是主要代价与边界。
针对长序列视频叙事中辅助能力弱、视觉质量差和表达单调的问题,MAViS 用分阶段多智能体与 3E 迭代和剧本写作约束组织生成,最强证据是用户研究约 69.44% 平均投票份额与关键帧 CLIP 34.22,主要代价是双 H100 上平均 13.63 小时的生成耗时。
针对扩散说话头推理慢与长视频接缝断裂问题,READ 用 32×32×8 时空压缩加 SpeechAE 对齐音频与 A2V-DiT 生成,并在 HDTF 上以 4.421 骨干耗时取得 Sync-C 8.658 的竞争精度,代价是需 8 步采样与 Split-CFG 增加约 50% 耗时。
该文把随语音手势生成改成随音频推进的滚动扩散窗口,用逐帧递增的噪声排布和一次性解码多帧的梯子加速,在 ZEGGS 与 BEAT 上提升连贯性与多样性,代价是梯子步长增大时在表现力强的数据上会出现平滑与抖动问题。
针对整序列扩散在超长语音上泛化下降与延迟随长度增长的问题,该文用固定窗口历史运动加当前音频生成动态条件,再用单层扩散头逐帧去噪,在 BIWI 长序列与消融对照上显示出同步与稳定优势,但短序列口型开合仍有可比基线。
该工作以 Wan2.1 为基座,先用 LoRA 适配长视频,再只更新音频交叉注意力并用自动构造的 DPO 偏好对提升口型与表情,最后在推理侧用空间掩码加权的 Mask-CFG 实现三人以上多人音频驱动,最强证据是 HDTF 与 CelebV-HQ 上的 FID 与 FVD 领先,代价是三阶段大算力训练与推理时多路条件前向的额外开销。
针对音乐舞蹈需同时逼真、对拍、多样、物理合理且可编辑的问题,论文以文本到动作掩码模型为先验并外挂音乐塔与姿态塔,在 FineDance 上把运动质量与多样性推高并实现快速推理,但节拍对齐并未登顶且依赖渐进训练与推理优化协同。
CutCraft 把多镜头音画生成从感知连贯拉回到可核验的剪辑执行,用 295 条结构化提示与分层混合评估在 13 个主流模型上检验镜头结构、转场与蒙太奇的指令遵从,并以规划-分镜合成-后期合成的智能体基线揭示离散剪辑控制可提升而高阶蒙太奇仍难的代价边界。
在仅双路音频输入的整段对话生成任务中,ECHO 以确定性锚点建立语音主导的稳定基线、再以残差流匹配与语义组缩放补充一对多的倾听变化,在约 120 小时对话基准上同时改善说话保真与倾听真实感与多样性,代价是时序稳定性与单样本实时因子未全面领先且依赖弱条件窗口的提纯。