先对齐再分家:PLUM-Net 用原型标签拆开共有与私有表征
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态情感分析中忽视个性差异与浅层融合的问题,PSA-MF 用个性-情感对齐提取个性化文本情感再做多级融合,在 MOSI 和 MOSEI 上取得报告的最优结果,代价是依赖双 BERT 文本编码与多阶段融合结构。
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
MultiMood 针对纯文本情感支持丢失非语言线索且回复不可靠的问题,用视频音频文本三路编码加对话压缩与 PPO 加 GRPO 可信对齐,在 MESC 四任务与 DFEW 表情识别上取得最优平均表现,代价是策略预测仍弱于专用基线且压缩会损失信息。
针对多模态伪造中模态割裂与跨模态语义推理不足的问题,ConLLM 采用预训练模型分模态抽取加对比对齐与类 GPT 变换器精炼的两阶段结构,在音频、视频与音视频六个基准上报告了更低的等错误率与更高的准确率,但其增益依赖预训练权重与训练数据覆盖且推理代价仍需权衡。
SafeLens 针对短视频中仇恨内容只在少数时刻出现而整片标签会引入时间噪声的问题,用先切分语义片段再融合语音转写、屏幕文字和画面描述并由微调策略大模型输出标签加置信度加一句话理由加伤害类别的结构化判断,演示证据显示其能在同一视频内区分出 93% 与 73% 等不同置信度的多个片段,但原文未报告可复算的检出率与对照基线所以只能作为工作流演示而非性能结论。
论文要解决开放课程多模态教育知识图谱难自动构建的问题,用抽取-验证-整合-增强管线加跨模态对齐构造覆盖生物物理化学的 SciMKG,最强证据是概念抽取 F1 达到 0.803 并有多模态对齐的人评与自动评测支撑,代价是依赖前沿大模型推理与多轮校验的开销。
针对唇到语音中视觉到声学一对多映射难保留细节的问题,SLD-L2S 用层次子空间潜流匹配直写预训练音频编解码器连续潜向量并辅以语义与语音语言模型损失,在 LRS3 上以 10 步函数求值取得 UTMOS 4.2096 等质量领先,代价是可懂度仍受视觉信息瓶颈与辅助损失权衡约束。
Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。
针对有声视频中按自然语言指代表达分割目标的问题,论文把任务拆成用多模态大模型先推理出目标描述再调用冻结检测与分割模型的智能体流程,在标准与推理增强基准上报告了对最强基线的提升,但阈值与细粒度描述的取舍仍有条件限制。
针对同一视频中文本、视觉、音频情感倾向不一致的问题,TiCAL 先用高置信锚表生成单模态伪标签并在双曲空间结构化,再用典型性和一致性做三阶段动态融合,在 MOSI 上报告 Acc-2 为 88.10,代价是需要完整三模态和多阶段调参。
针对文本音频视频缺失与传感器噪声并存导致情感预测失效的问题,TMDC 先在完整数据上学习去噪的特有与共享表示再用可见模态补全缺失模态,在 MOSI、MOSEI 和 IEMOCAP 的七种缺失组合及加噪条件下报告了优于所列基线的平均准确率,代价是两阶段训练与共享表示冗余。
针对仅对目标语句做跨模态建模导致情感表达不足的问题,论文用多模态参考片段库加情感相似检索与渐进图融合来模拟导演给素材、演员逐步内化的流程,在 V2C-Animation 上把情感准确率做到 47.21%,代价是需要维护检索库并做三阶段图编码。
该工作以 Wan2.1 为基座,先用 LoRA 适配长视频,再只更新音频交叉注意力并用自动构造的 DPO 偏好对提升口型与表情,最后在推理侧用空间掩码加权的 Mask-CFG 实现三人以上多人音频驱动,最强证据是 HDTF 与 CelebV-HQ 上的 FID 与 FVD 领先,代价是三阶段大算力训练与推理时多路条件前向的额外开销。
针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。
针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。
针对视频配乐中视频细节刻画不全与转场对拍不准的问题,VeM 用分层视频解析作指挥家组织多模态条件,以故事板引导交叉注意力和转场节拍对齐适配器生成波形音乐,在 TB-Match 上报告了语义与节奏指标的提升,但强转场对拍假设与评测阈值限制了其适用边界。
针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。
针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。
该综述把视频大模型开销定位到帧选择、编码器、连接器压缩与大模型预填充解码四段,显示约 25 % 视觉 token 保留下多类方法接近基线精度,而推到约 10 % 保留与流式内存时必须显式建模时间冗余并计入选择器与编码代价。