不用表情图片,只用情感语音的差向量去改脸:C-MET 的跨模态情绪编辑
针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。
针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。
针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。
DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。
针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。
针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。
针对文本、视觉、音频三模态组合查询检索问题,OmniRet 用共享媒体重采样器压缩长媒体 token 序列提高效率、用注意力切片 Wasserstein 池化保留细粒度分布信息,在约 600 万对 30 个数据集训练下组合检索和音视频任务提升明显,而单向量压缩与有限主干仍是主要代价与边界。
针对第一视角视频中模型重视觉轻音频、声源对应差的问题,EgoAVU 用模块化解耦叙述增强与多模态上下文图生成联合叙述,再派生问答,报告显示微调后在 EgoAVU-Bench 上最高相对提升 113.3%,代价是依赖开源单模态模型输出噪声与大规模微调资源。
EgoSound 针对第一人称视频中的声音理解构造 900 视频 7315 对开放问答与七类任务,用九个多模态大模型的评测显示最强模型仅 56.7% 准确率而人类达 83.9%,代价是自动构造依赖大模型与 GPT-5 判分带来的偏差与可复现性负担。
EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。
针对有情绪语音下少样本说话头几何不稳定与音画情绪错位问题,EmoTaG 选择在 FLAME 参数空间预测运动并用门控残差分离音素与情绪,证据是在 5 秒适配的自重建与跨人跨语评测中取得更优的图像质量与运动误差,代价是适配仍需约 11 分钟与上脸辅助输入。
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。
论文针对音视频大模型单模态理解强但跨模态细粒度时间推理弱的问题,构建包含对齐、低层关系与区间描述的三层基准 FAVE,用 3557、4546、1781 组问答证明十三款模型在联合时序任务上明显落后于人类,而增加采样帧数不能消除该差距。
针对新房间仅给 1 至 8 条脉冲响应、深度与位姿时确定性方法无法表达声学不确定性的问题,FLAC 用潜空间流匹配加扩散变换器生成合理脉冲响应分布,并在 AcousticRooms 未见房间与真实 HAA 上以单样本超越 8 样本基线,但分布真实性与单步推理之间仍需权衡。
论文把唇同步拆成一步潜空间图像编辑器与音频到唇姿态变换器,用纯重建加流匹配代替对抗与扩散,并在重建与跨音频评测中以 109.41 帧每秒的单卡速度达到可比的同步与保真,代价是遮挡与极端姿态仍待加强。
针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。
针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。