长视频不止于切分检索:用视听实体黏合与分层索引保持叙事连贯
针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。
针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。
该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。
论文针对视频多模态大模型看人不细的问题,用两条自动标注与组装干扰项的流水线合成 16 个细粒度选择题,并在 30 个模型与人类基线上显示情绪与声画对齐仍远落后于人,且开放流水线把人工从出题转为验题。
论文要解决空间音频一次一建、难以公共复用的问题,用一套可搬运的扬声器与交互基建在亚特兰大地下城支撑 5 组学生作品,以 Since Everyone's a DJ 为案例验证多人手势协作演奏可行,但连续空间控制易被掩蔽且评价仍是小样本反思。
针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。
针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。
论文把多种自监督音频、视觉和音画特征冻结后只训练线性分类头,在科学数据集与野外数据上比较检测、异常检测、可解释定位与互补融合,发现含音频信息的表示泛化最好但野外数据仍困难,且随机特征也能靠捷径得高分。
论文研究无任务微调的说话脸生成,用冻结的稳定扩散加图像适配器做骨干并配三个无可训练参数的模块,在 CREMA 和 HDTF 上报告了最低的口型几何误差和最高的口型相关性,代价是依赖外部人脸先验与逐帧重绘加后滤波的推理链路。
iXeRemin 针对 Apple Vision Pro 用右手管音高与触发、左手管音量音色与和弦选择,并以频率调制合成与指尖标签和开放声音控制输出实现可复现的触空复调演奏,其代价是依赖特定头显硬件且本文未做演奏者可用性评估。
该文在 AVEC2014 上用固定的两层感知机隔离融合设计的影响,以线性加权平均管模态可靠性、有序加权平均管特征显著性做向量保留式联合加权,在分类取得 85.7% 准确率与 0.88 的 AUC、回归取得 8.1 的均方根误差与 0.44 的一致性相关系数的同时,在 0 分贝强噪声下仍保持相对可控的退化,代价是可靠性打分依赖的信号质量指示与排序后权重构造细节 …
针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。
针对音视频问答中共享嵌入检索错位与单跳图证据太浅的问题,论文用三步多智能体构造多跳多模态知识图并以模态内检索加 GRASP 接地剪枝供给答案有用子图,在 AudioCaps-QA、VCGPT 和 VALOR 上一致提升但强依赖阈值与外部接地模型。
针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。
针对全模态大模型把一模态线索误用到另一模态提问以及过度依赖文本先验的问题,论文提出在偏好优化中加入不相关模态不变与相关模态敏感两项解耦约束并叠加纯文本惩罚,用自动构造的约 1.8 万偏好样本训练,在幻觉基准上报告最高约 27% 的匹配任务提升,而代价是每步增加无需梯度的损坏输入前向与四分之一轮数的训练预算控制。
问题是从音乐生成对拍对风的舞蹈视频,方法选择是冻结预训练文本到视频扩散模型并只在精选层注入零初始化音频交叉注意力,最强证据是舞蹈质量与视频质量上超过从零训练的音视频基线,代价是依赖有限舞蹈数据混合与单卡约 20 小时的适配训练。
该研究把芭蕾手臂姿态作为可学习控制面,用分类选古筝乐句区、回归做中间态插值,再经颗粒合成重塑纹理,证据是 60 fps 下每类约 300–480 个训练样本与 4–15 秒乐句构成的语料库,代价是系统偏好可识别姿态且依赖多软件链与作者式观察而非结构化评估。
针对夜晚户外太暗导致常规增强现实无法跟踪的问题,nocturneAR 用发光体的颜色闪烁序列传递编号来触发画面与声音,2026 年 2 月 11 日的夜间森林探索性展览显示参与者会放慢移动并靠听觉叠加声音,但系统在明亮环境下不稳定且未做定量评估。
针对社交媒体多模态伪造分散评测的问题,论文构建覆盖图像、音频、视频与音视频讲话头的统一基准并提出课程微调加统一奖励强化的 Omni-Fake-R1,最强证据来自严格不相交的 OOD 划分与联合评测,而代价是渐进式训练流程更长且定位精度仍受篡改细粒度限制。
针对全模态大模型音频加视频序列过长问题,OmniZip 用免训练的音频引导加交错时空压缩做推理时剪枝,最强证据是在 Qwen2.5-Omni 上保持接近满词元精度的同时实现 2.51-3.42×预填充加速与约 10G 显存下降,代价是剪枝率需按任务平衡且依赖音频编码器注意力。
论文提出第一人称自我情绪追踪任务,用 110 小时智能眼镜数据的开放词表时间线与五任务基准支撑 OSIRIS 模型,该模型以对话历史加情绪记忆加分步推理取得领先,但仍受日常社交场景与文化覆盖限制。