论文解读

不用表情图片,只用情感语音的差向量去改脸:C-MET 的跨模态情绪编辑

针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。

 · 更新于 2026-09-24 · 约 22 分钟 · 10870 字 阅读 →
论文解读

把音色拆成泛音再拼回去:用四件中国乐器做可玩的视听合成器

该研究用古筝、二胡、唢呐、堂鼓四种乐器的自录样本做前 8 个泛音的分轨重组与心电驱动的视听交互,在百余人次的非正式展览观察中看到熟悉又陌生的文化联想,代价是只有定性观察而无可控评估与生理推断力。

 · 更新于 2026-09-24 · 约 20 分钟 · 9944 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

情绪语音为何更难对齐:用结构先验把口型与情绪分开建模

针对有情绪语音下少样本说话头几何不稳定与音画情绪错位问题,EmoTaG 选择在 FLAME 参数空间预测运动并用门控残差分离音素与情绪,证据是在 5 秒适配的自重建与跨人跨语评测中取得更优的图像质量与运动误差,代价是适配仍需约 11 分钟与上脸辅助输入。

 · 更新于 2026-09-24 · 约 17 分钟 · 8286 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

同时去噪的音视频为何对不齐:Harmony 用跨任务监督稳住对应关系

针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8328 字 阅读 →
论文解读

长视频越播越走样:先定低分辨率动作再用姿态锚定外观的音频驱动动画

针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9524 字 阅读 →
论文解读

不微调也能说话:用预训练扩散模型拼出口型、身份与时间一致

论文研究无任务微调的说话脸生成,用冻结的稳定扩散加图像适配器做骨干并配三个无可训练参数的模块,在 CREMA 和 HDTF 上报告了最低的口型几何误差和最高的口型相关性,代价是依赖外部人脸先验与逐帧重绘加后滤波的推理链路。

 · 更新于 2026-09-24 · 约 20 分钟 · 9972 字 阅读 →
论文解读

不等未来语音:MIBURI 如何用对话模型的内部 token 流直接生成全身手势

针对具身对话需要因果、低延迟且富有表现力的手势问题,MIBURI 直接复用 Moshi 语音文本模型的内部 token 流,用身体分区残差码本与时间加运动学双变换器逐帧生成手势,并以 36 ms 每帧的在线演示和多说话人评测支撑其因果实时主张,但仍未达到真值自然度且未建模用户身体。

 · 更新于 2026-09-24 · 约 20 分钟 · 9813 字 阅读 →
论文解读

不从零学跳舞:用保先验适配让视频扩散模型听音乐起舞

问题是从音乐生成对拍对风的舞蹈视频,方法选择是冻结预训练文本到视频扩散模型并只在精选层注入零初始化音频交叉注意力,最强证据是舞蹈质量与视频质量上超过从零训练的音视频基线,代价是依赖有限舞蹈数据混合与单卡约 20 小时的适配训练。

 · 更新于 2026-09-24 · 约 18 分钟 · 8921 字 阅读 →
论文解读

把口型习惯和情绪拆开控制:PC-Talk 用隐式关键点变形做可控说话人脸

针对音频驱动说话人脸只求口型对齐而说话风格单一、情绪不可控的问题,PC-Talk 用隐式关键点上的唇同步变形与纯情绪变形分别建模,在 HDTF 上以视频输入 9.03 与图像输入 9.37 的 LSE-C 显示口型优势,并以情绪分类准确率 46.19 与 72.32 显示情绪优势,代价是需要分开训练两个控制模块并固定渲染器参数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12326 字 阅读 →
论文解读

把长相交给参考图:参考引导深度压缩如何让说话人像视频实时可流式生成

针对语音驱动说话人像需要同时满足实时流式、高保真和大范围躯干动态的问题,该工作用参考图引导的因果视频 VAE 把压缩率做到 768 并用块自回归整流流 Transformer 生成潜变量,在单卡实现 512×512 下 42 FPS,代价是强依赖参考图质量与训练数据分布且本次未能确认代码模型可达。

 · 更新于 2026-09-24 · 约 20 分钟 · 9937 字 阅读 →
论文解读

一张图如何长出可走可听的三维声景:SonoWorld 的定位与空间化链路

论文提出从单图生成可导航三维视觉加空间声场的新任务,并用免训练的全景重建加语义接地加高保真立体声编码链路实现,在 68 段实录上的方向误差降低 47% 等报告提升下仍保留运动声源等明确边界。

 · 更新于 2026-09-24 · 约 21 分钟 · 10294 字 阅读 →
论文解读

单图加文本加音频做分钟级视频:Soul 用关键帧锚定与阈值码本抑制长时漂移

Soul 针对单帧人物图加文本加音频的人体动画任务,在 Wan2.2-5B 上新增音频注意力并用关键帧表示、段间重叠与阈值码本维持长时一致,再用步数蒸馏与轻量 VAE 加速,在 Soul-Bench 的开源对比与商用人评中取得优势,代价是复杂全身大动作仍可能出现伪影。

 · 更新于 2026-09-24 · 约 22 分钟 · 10657 字 阅读 →
论文解读

听到鸟叫不画鸟:为环境声景生成地理一致的街景

论文把问题定为地理上下文的声音景到景观生成,用声景加可选场景词生成街景级图像,以 SounDiT 三模块注入地理条件,在自建两套大数据集上以通用指标和三层地点相似度验证,代价是依赖预训练编码器与场景标注并需较多算力训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9353 字 阅读 →
论文解读

不靠姿态骨架:用文本管动作、用音频管节奏的说话人像生成

SyncDreamer 针对只有离散情绪标签和依赖姿态中间表示导致动作僵硬的问题,用视觉适配器保身份、音频动态编码器抓节奏能量、跨模态提示增强器把文本变成动作指令,在 HDTF、AVSpeech 人像和 EMTD 半身基准上报告了最优的真实感与同步指标,代价是两阶段扩散训练与更长的提示构造链路。

 · 更新于 2026-09-24 · 约 24 分钟 · 11529 字 阅读 →
论文解读

从一路混合音频生成面对面双人 3D 对话:空间、注视与轮流如何被建模

该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10319 字 阅读 →
论文解读

先想再动再说:U-Mind 用文本先行统一语言语音动作的实时交互

U-Mind 针对语音动作与语言推理难以同步且联合训练易损伤推理的问题,采用离散统一表示加分段对齐与排练式预训练加文本先行解码,原文报告在指令跟随上 FGD 为 5.12 并在消融中显示去文本先行后相关性降至 1.24,代价是动作细粒度受限于离散词表且数据配比依赖经验。

 · 更新于 2026-09-24 · 约 21 分钟 · 10184 字 阅读 →
论文解读

人声与人脸为何总对不上:用不对称时间窗口重建音画同步

针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9864 字 阅读 →
论文解读

同步声画为何难评:VABench 用三任务十五维卡住语义与对齐

针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →