论文解读

当时间轴变成可以斜切的体:Passing 如何把单段车窗录像走成无尽旅程

Passing 把一段多摩单轨车窗连续录像堆成时空体并沿非线性截面重采样出无尽画面,再用去掉视觉语义分支、只留时间对齐与车内环境声语义锚定的 SpecMaskFoley 实时生成同步声,代价是最终展览声景没有可复算的客观正确性指标,只能靠现场稳定性和艺术协商来收敛。

 · 约 20 分钟 · 9829 字 阅读 →
论文解读

共因不等于去捷径:音频视频生成中视觉捷径的阻断需要干预

论文在事件决定声音、外观只影响视频的结构因果模型下证明并验证共享隐变量仍学颜色等视觉捷径,而对 nuisance 做反事实不变干预才能恢复因果预测,代价是需要已知且可增强的 nuisance 并在分布内付出小额误差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9081 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

只听其声不够:用单因素反事实考视频生音频的物理因果

论文提出只变一个物理因素的时间对齐视频对与单视频模式测试来审计视频生音频模型,用方向一致性与敲击对齐度量揭示文本提升语义却损害同步、像素物理推理普遍偏弱的代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

短训长测:用分层路由与非因果 Mamba 做长视频配音

针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8949 字 阅读 →
论文解读

从整轨配音到逐事件导演:EchoFoley 用符号事件表约束何时何物如何发声

针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。

 · 更新于 2026-09-24 · 约 17 分钟 · 8187 字 阅读 →
论文解读

把重叠声场拆开再对齐:FoleyDesigner 如何做时空可控的立体声拟音

针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9299 字 阅读 →
论文解读

当画面给不出声音线索时,导演脚本如何逐秒指挥视频生音频

针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9521 字 阅读 →
论文解读

只听指定的那一个:文本如何从混合画面中挑出目标声音

针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8784 字 阅读 →
论文解读

看见鼓槌落下才发声:用音视频对齐的扩散变换器与语义时间偏好优化做视频生音频

针对无声视频生成音频时语义错位与时间错位并存的问题,论文用音视频时间对齐加图文语义引导的流匹配扩散变换器做基座,再用 ImageBind 与 Synchformer 自动排序的偏好优化做对齐微调,在 VGGSound 测试集上以 151M 参数取得分布与同步指标的领先,但高帧率编码与多轮偏好迭代仍带来额外开销与过优化风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9262 字 阅读 →
论文解读

语义冲突与任务竞争之下统一视频文本到音频生成的三段式解法

该工作针对统一视频文本到音频生成中音频歧义导致的数据语义冲突与跨任务和任务内竞争,用高对齐的 SoundAtlas 数据做语义桥并以三阶段渐进训练解耦竞争,在 VGGSound-Omni 上实现三任务统一最优,但强依赖数据流水线质量与分阶段训练成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9292 字 阅读 →
论文解读

画面内外都要出声:OmniSonic 如何把语音和环境声放在同一视频里生成

针对视频配音只做可见环境声、做不了语音与画外声共存的问题,OmniSonic 用视频加文本联合条件的流匹配扩散与三路交叉注意力加门控融合,在自建的三场景基准上同时生成语音与环境声,主观与客观指标报告全面领先,但时间同步仍弱于带细粒度同步视觉特征的基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9217 字 阅读 →
论文解读

把合成条件当作曲参数:Orbis 用人工细胞 Min 波的可控涨落驱动光声

Orbis 要解决如何把人工细胞中 Min 波的反应扩散动力学变成可作曲的光声运动,方法是按设定化学配比合成人工细胞并用图像跟踪把波位置转为环形声光定位,已在展览系统中实现三条件与三序列的对应呈现,代价是当前依赖预录视频且复现需要专门生物实验条件。

 · 更新于 2026-09-24 · 约 22 分钟 · 10613 字 阅读 →
论文解读

看得见撞击,还要听得出轻重:PAVAS 把质量与速度写进视频生音频

针对视频生音频只学外观关联而忽视撞击轻重的问题,PAVAS 用估计出的物体质量与速度去调制潜在扩散模型,在 VGGSound 与 VGG-Impact 上同时报告了分布、感知与物理一致性证据,但依赖多组冻结视觉模块且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 24 分钟 · 11524 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

已有配音怎么改:AV-Edit 用音画联合表示做加、删、换

针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。

 · 更新于 2026-09-24 · 约 20 分钟 · 9758 字 阅读 →
论文解读

用可预测的显式节奏信号约束扩散:Diff-V2M 的分层条件设计

针对通用视频背景音乐在时间对齐与多视角特征融合上的困难,Diff-V2M 用节奏预测器从视频估计低分辨率起音检测函数并以情感先行、语义与节奏并行融合的分层交叉注意力约束音频潜在扩散,在域内混合测试与域外 V2M-Bench 上取得更优的客观指标与主观偏好,代价是依赖场景切分与帧差等粗粒度视觉动态且缺乏显式风格控制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9969 字 阅读 →
论文解读

看得见动、听得见位:Sonic4D 把单目视频变成可走动的视听 4D

Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。

 · 更新于 2026-09-24 · 约 20 分钟 · 9861 字 阅读 →
论文解读

预告片里画面与配乐为何总能卡点:VMChill 把细粒度视听协同做成可训练数据

针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →