不靠姿态骨架:用文本管动作、用音频管节奏的说话人像生成
SyncDreamer 针对只有离散情绪标签和依赖姿态中间表示导致动作僵硬的问题,用视觉适配器保身份、音频动态编码器抓节奏能量、跨模态提示增强器把文本变成动作指令,在 HDTF、AVSpeech 人像和 EMTD 半身基准上报告了最优的真实感与同步指标,代价是两阶段扩散训练与更长的提示构造链路。
SyncDreamer 针对只有离散情绪标签和依赖姿态中间表示导致动作僵硬的问题,用视觉适配器保身份、音频动态编码器抓节奏能量、跨模态提示增强器把文本变成动作指令,在 HDTF、AVSpeech 人像和 EMTD 半身基准上报告了最优的真实感与同步指标,代价是两阶段扩散训练与更长的提示构造链路。
该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。
针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对符号音乐中音符属性被强加固定单向顺序的问题,Amadeus 采用音符级自回归加属性级双向离散扩散的两级架构并引入 CIEM,在 AMD 大规模数据上以 16.23 notes/s 实现文本条件与可控生成的提升,代价是扩散步数与速度需权衡且数据存在风格偏置。
针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。
ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。
DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。
针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。
针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。
针对前向加噪加反向去噪带来的旋律失真问题,论文用增量去噪分数直接在数据空间优化音频,并用个性化增量分数加分布偏移正则与时序对比损失引入用户自定义风格,报告显示在内容保持与偏好率上占优,但强风格迁移与原曲保持之间仍需权衡。
针对潜扩散文本生成音频的归属问题,该文把水印映射为初始隐向量这一支点锚,用无引导扩散生成锚序列并以软动态时间规整优化反演轨迹,在保持生成流程不变下报告了更强的鲁棒性,但每步多轮优化带来了可观的提取时间代价。
针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。
ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。
DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。
针对通用视频背景音乐在时间对齐与多视角特征融合上的困难,Diff-V2M 用节奏预测器从视频估计低分辨率起音检测函数并以情感先行、语义与节奏并行融合的分层交叉注意力约束音频潜在扩散,在域内混合测试与域外 V2M-Bench 上取得更优的客观指标与主观偏好,代价是依赖场景切分与帧差等粗粒度视觉动态且缺乏显式风格控制。
DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。
针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。
针对音频驱动人像动画中动作自然度、唇同步、视觉质量互相冲突的问题,该工作用 Talking-Critic 学三维奖励并自动构建 410K 偏好对,再用 TLPO 分专家独立优化后做时步-层自适应融合,报告显示主指标和用户评分全面提升,代价是两阶段训练与多专家推理融合的额外复杂度。