论文解读

从播报式评测转向双人对话:Candor-LR 如何暴露音频退化并放大视觉补偿

针对播报式基准低估真实对话难度的问题,该工作把 1656 段双人视频会议转成 713.5 hours 训练加 60.1 hours 测试的视听识别基准,报告显示纯音频错误率从 LRS3 的 0.74–1.95% 升至 16.83–24.32%,而混合训练可把对话测试集视听错误率压到 9.83% 与干净条件下 8.48%,代价是必须自备原数据许可并复刻多步清洗 …

 · 更新于 2026-09-25 · 约 20 分钟 · 9639 字 阅读 →
论文解读

只给视频级标签,如何把可靠时刻的语义铺满整条时间线

针对只有视频级标签的稠密音视事件定位,CLASP 用双模态预测一致性找出显著锚点再向全时序传播语义,在 UnAV-100 与 ActivityNet1.3 上取得弱监督最优,但与全监督约 50% 平均精度仍有明显差距且更依赖锚点超参数。

 · 更新于 2026-09-25 · 约 17 分钟 · 8118 字 阅读 →
论文解读

用光流解耦外观与运动、再用强度引导噪声搜索压住闪烁的说话头生成

ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9366 字 阅读 →
论文解读

浅融合不够,深融合又乱:跨空间协同如何同时管表示与梯度

针对对话多模态情感识别中高阶跨模态交互不足与多目标梯度冲突问题,论文用模态特异低秩多项式融合做表示、用三目标帕累托梯度协调做优化,在 IEMOCAP 上报告 75.42% 准确率、在 MELD 上报告 68.47% 准确率,代价是每轮训练比单分支基线多约 0.66s 的小规模二次规划开销。

 · 更新于 2026-09-25 · 约 21 分钟 · 10175 字 阅读 →
论文解读

用可预测的显式节奏信号约束扩散:Diff-V2M 的分层条件设计

针对通用视频背景音乐在时间对齐与多视角特征融合上的困难,Diff-V2M 用节奏预测器从视频估计低分辨率起音检测函数并以情感先行、语义与节奏并行融合的分层交叉注意力约束音频潜在扩散,在域内混合测试与域外 V2M-Bench 上取得更优的客观指标与主观偏好,代价是依赖场景切分与帧差等粗粒度视觉动态且缺乏显式风格控制。

 · 更新于 2026-09-25 · 约 20 分钟 · 9969 字 阅读 →
论文解读

把共有的病和各自的信号分开:DIVINE 的多模态解耦评估

针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。

 · 更新于 2026-09-25 · 约 19 分钟 · 9146 字 阅读 →
论文解读

只看画面就分割:音频缺席时音频-视觉分割为何失灵

论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。

 · 更新于 2026-09-25 · 约 18 分钟 · 8657 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

多人对话先找对说话人,再把文本的情绪理解教给声音和画面

该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。

 · 更新于 2026-09-25 · 约 17 分钟 · 8365 字 阅读 →
论文解读

把口型与情绪放在同一运动空间里采样:情绪子空间加十步流匹配的实时说话头

该文把语音驱动的人脸运动看作情绪条件下的运动隐空间分布,用正交运动字典加情绪子空间保留发音与情感耦合,再用逐层跨注意力融合音频与情绪去调制流匹配速度场,在 MEAD 上取得 82.05% 情绪准确率与 22.58 dB PSNR 并以十步采样实现实时推理,代价是仅覆盖英语与七类基本情绪且对大角度头部转动验证不足。

 · 更新于 2026-09-25 · 约 23 分钟 · 11091 字 阅读 →
论文解读

偏好打架时不要平均:把动作、口型、画质拆开学再按时步和层融合

针对音频驱动人像动画中动作自然度、唇同步、视觉质量互相冲突的问题,该工作用 Talking-Critic 学三维奖励并自动构建 410K 偏好对,再用 TLPO 分专家独立优化后做时步-层自适应融合,报告显示主指标和用户评分全面提升,代价是两阶段训练与多专家推理融合的额外复杂度。

 · 更新于 2026-09-25 · 约 22 分钟 · 10601 字 阅读 →
论文解读

三模态互相拆台时,HuMo 如何让文本、图像与音频协同

针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。

 · 更新于 2026-09-25 · 约 18 分钟 · 8698 字 阅读 →
论文解读

从短行为模拟内部认知:用个性化权重图回归真实人格

针对直接从外部行为回归真实人格偏向观察者印象的问题,该文用 10 秒音视频生成密钥修正通用面部反应生成器得到个性化认知权重,再编码为矩阵图用二维图网络回归自陈大五特质,在 NoXI 与 UDIVA 上报告了误差与相关提升,代价是仍需扩散预训练与双损失联合训练且细粒度言语未建模。

 · 更新于 2026-09-25 · 约 15 分钟 · 7429 字 阅读 →
论文解读

视觉对话不够吸引人:用合成语音补情感,再用交错建模学互动

针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。

 · 更新于 2026-09-25 · 约 20 分钟 · 9867 字 阅读 →
论文解读

MAVERIX:逼模型同时听和看,堵住单模态捷径的音视频理解基准

MAVERIX 用 700 段视频与 2556 道必须联合音视频才能回答的问题,测出以 Gemini 2.5 Flash-Lite 约 54.7% 选择题准确率为代表的模型与 92.8% 人类表现之间的大幅差距,代价是更长的人工标注与多轮去捷径校验流程。

 · 更新于 2026-09-25 · 约 21 分钟 · 10185 字 阅读 →
论文解读

MAViS:用多智能体分阶段协作把一句话变成一分钟有声故事短片

针对长序列视频叙事中辅助能力弱、视觉质量差和表达单调的问题,MAViS 用分阶段多智能体与 3E 迭代和剧本写作约束组织生成,最强证据是用户研究约 69.44% 平均投票份额与关键帧 CLIP 34.22,主要代价是双 H100 上平均 13.63 小时的生成耗时。

 · 更新于 2026-09-25 · 约 22 分钟 · 10619 字 阅读 →
论文解读

音频里藏着文本时还硬做解耦:MDF 只拆音频再按贡献加权

针对音频与文本同质、视觉与二者异质的问题,MDF 只对音频做文本剥离得到声音分量,再用正交约束强化异质并用标签导出的贡献监督权重生成器,在 CMU-MOSI 上取得 MAE 0.692 等最好或次好结果,但视觉增益与权重估计仍受单模态预测误差限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9427 字 阅读 →
论文解读

文本先验压住视听信号时,用偏好对齐把注意力拉回视频与音频

针对全模态大模型忽略视听证据与视频音频互相对不齐的问题,OmniDPO 用文本偏好对与加噪模态偏好对做条件偏好优化,在 Qwen2.5-Omni 与 MiniCPM-o-2.6 上降低幻觉并提升推理,但仍受基座视觉能力限制。

 · 更新于 2026-09-25 · 约 18 分钟 · 8863 字 阅读 →
论文解读

模态竞争下如何协作:PaSE 用原型校准与 Shapley 均衡做多模态情感分析

针对文本主导压制音频与视觉的模态竞争问题,PaSE 用模态内原型校准与熵正则最优传输对齐语义,再用双阶段融合与 Shapley 梯度调制平衡优化,在 MOSI、MOSEI 和 IEMOCAP 上报告最优结果,但缺失代码可用性与显著性检验等复现细节。

 · 更新于 2026-09-25 · 约 22 分钟 · 10640 字 阅读 →
论文解读

幻影威胁:物理传感器攻击如何让视觉-语言-动作模型失手,又如何加固

论文针对视觉-语言-动作模型的摄像头与麦克风输入,研究用激光、电磁、超声等物理信号注入的八种攻击如何导致任务失败,并用先干净训练再混入攻击数据的对抗训练在保持干净性能的同时提升中强度攻击下的鲁棒性,代价是干净集平均约 3% 的下降与部分强攻击仍难完全防住。

 · 更新于 2026-09-25 · 约 21 分钟 · 10495 字 阅读 →