短训长测:用分层路由与非因果 Mamba 做长视频配音
针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。
针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。
针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。
针对第一视角视频中模型重视觉轻音频、声源对应差的问题,EgoAVU 用模块化解耦叙述增强与多模态上下文图生成联合叙述,再派生问答,报告显示微调后在 EgoAVU-Bench 上最高相对提升 113.3%,代价是依赖开源单模态模型输出噪声与大规模微调资源。
EgoSound 针对第一人称视频中的声音理解构造 900 视频 7315 对开放问答与七类任务,用九个多模态大模型的评测显示最强模型仅 56.7% 准确率而人类达 83.9%,代价是自动构造依赖大模型与 GPT-5 判分带来的偏差与可复现性负担。
EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该工作以微分音杠杆竖琴 Harp-E 为起点,用配重鱼线和悬挂织物做机械扩展,再让合成延续拨弦、持续激励与杠杆弯音的发声逻辑,在多媒体即兴演出 De-dimension 中实现可参与的多模态乐器环境,代价是未做定量评估与延迟测量,仅为概念验证。
论文针对音视频大模型单模态理解强但跨模态细粒度时间推理弱的问题,构建包含对齐、低层关系与区间描述的三层基准 FAVE,用 3557、4546、1781 组问答证明十三款模型在联合时序任务上明显落后于人类,而增加采样帧数不能消除该差距。
论文把唇同步拆成一步潜空间图像编辑器与音频到唇姿态变换器,用纯重建加流匹配代替对抗与扩散,并在重建与跨音频评测中以 109.41 帧每秒的单卡速度达到可比的同步与保真,代价是遮挡与极端姿态仍待加强。
FO2 用线激光做光扬声器、太阳能板做光麦克风加 Bela Gem 与 SuperCollider 构成光反馈回路,靠距离角度反射控制反馈状态,但代价是高度依赖暗空间与反射条件且无定量声学评估。
针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。
问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。
针对声源定位中特征匹配缺少显式验证的问题,该研究用 Qwen2.5-Omni-7B 的提示工程实现生成-分析-精修三阶段零样本定位,在 MUSIC 与 VGGSound 单源和双源基准上报告了可比或更高的精度,代价是单样本约 4 秒的多轮推理开销。
针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。
论文针对音频视觉评测偏重单轮感知的问题,提出感知—推理—交互三层基准并区分指令与上下文两种音频角色,用 2451 个样本和多轮任务图揭示语音指令推理弱于文本指令且交互成功率普遍偏低,代价是构造依赖人工标注而交互判定依赖大模型裁判。
针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。
针对无声视频生成音频时语义错位与时间错位并存的问题,论文用音视频时间对齐加图文语义引导的流匹配扩散变换器做基座,再用 ImageBind 与 Synchformer 自动排序的偏好优化做对齐微调,在 VGGSound 测试集上以 151M 参数取得分布与同步指标的领先,但高帧率编码与多轮偏好迭代仍带来额外开销与过优化风险。