The Attention Triangle in Audio-Video Models

📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 809 words

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

📄 剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本 英文题目:The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 一句话:针对联合音视频生成中音画互相同步却共同偏离剧本时间的问题,论文用时长归一化的加性时间路由把镜头与对白区间送进双分支交叉注意力,在 200 个剧本上把镜头边界误差从 1.11 秒降到 0.042 秒、对白准时率提到 84.1%,代价是评测仍锁在短剧对白域且零开源。 标签:#音视频生成 | #流匹配 | #参数高效微调 | #多模态模型 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yichen Liu:机构信息未在 arXiv HTML 中可靠披露 Quanwei Zhang:机构信息未在 arXiv HTML 中可靠披露 Haozhe Wang:机构信息未在 arXiv HTML 中可靠披露 Donghao Zhou:机构信息未在 arXiv HTML 中可靠披露 Xiaojie Li:机构信息未在 arXiv HTML 中可靠披露 Yang Shi:机构信息未在 arXiv HTML 中可靠披露 Jiaming Liu:机构信息未在 arXiv HTML 中可靠披露 Ruihua Huang:机构信息未在 arXiv HTML 中可靠披露 Yingtian Zou:机构信息未在 arXiv HTML 中可靠披露 Daquan Zhou:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把剧本时间从文本字符串里拽出来做成双模态注意力偏置,治好了音画很同步但集体演错时间的毛病,匹配算子对照也算体面。硬伤是全套数据、训练、评测都锁在自家短剧闭环里,基线文本带时间本就不公平,检测器既当教练又当裁判,还零开源,离可复现的剧本驱动标准差一口气。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 905 words

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

📄 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处 英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models 一句话:针对联合音视频扩散模型只管说什么不管何时说的问题,TimeSteer 在推理时用时序敏感注意力头定位源区间并用分区读图在预测干净隐空间搬运内容,在 SpeechShift 上将 HR0.2 提升 2 倍以上而 WER 与画质几乎不掉,代价仅为每步一次无梯度前向。 标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型 评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Chao Zhou:机构信息未在 arXiv HTML 中可靠披露 Yiling Chen:机构信息未在 arXiv HTML 中可靠披露 Qi Chu:机构信息未在 arXiv HTML 中可靠披露 Tao Gong:机构信息未在 arXiv HTML 中可靠披露 Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露 Tianyi We:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 两个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1803 words

VIBE: Video Instruction-aligned Background music gEneration

📄 当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令 英文题目:VIBE: Video Instruction-aligned Background music gEneration 一句话:针对视频到音乐生成中静态条件瓶颈与指令违背无惩罚的难题,VIBE 用逐层动态条件连接与硬软奖励分解的五阶段偏好优化,在 ReelBench 上以 FD 10.13 与 IS 2.36 等指标超越 Video-Robin,并在速度与调性指令跟随上实现可验证提升,代价是依赖冻结 VAE 与外部裁判模型带来的偏差与开销。 标签:#音乐生成 #扩散模型 #音视频生成 #强化学习 #多模态模型 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Aryan Vijay Bhosale:机构信息未在 arXiv HTML 中可靠披露 Vaibhavi Lokegaonkar:机构信息未在 arXiv HTML 中可靠披露 Vishnu Raj:Dolby Laboratories, USA Gouthaman KV:Dolby Laboratories, USA Sreyan Ghosh:University of Maryland, College Park, USA Ramani Duraiswami:University of Maryland, College Park, USA Lie Lu:Dolby Laboratories, USA Dinesh Manocha:University of Maryland, College Park, USA 💬 毒舌点评 亮点在于把视频到音乐的条件瓶颈和指令违背问题拆成架构与训练两条线一起治,Conditioning Connection 的层级路由和硬可验证奖励 + 软跨模态奖励的分解确实让指令跟随可被优化而非仅靠重构。短板是评测过度依赖自家训练的 CMI-RM 与 Qwen2.5-Omni 作为奖励与裁判,且人类评估仅 18 人、20 个视频、Fleiss κ 0.249 的一致性偏低,却仍宣称全方位优于基线。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1819 words

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

📄 有害不在一处:当声音与画面由多模态共同拼出 英文题目:Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation 一句话:面向文本、图像、音频、视频共同决定音视频生成的场景,该工作用因子化的基准把攻击方式与证据分布拆开检验,并在 LTX-2 上以 91.7% 的总体攻击成功率与四模态下仅 52.6% 至 61.2% 的防护召回,揭示出跨模态与跨时序的组合风险感知仍是主要瓶颈。 标签:#音视频生成 #多模态模型 #内容审核 #基准测试 评分:7.3/10 | 创新 1.7/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kaichao Jiang:University of Science and Technology of China Changtao Miao:Independent Researcher Baiqi Wu:Zhejiang University Zhiyuan Lu:Hefei University of Technology Kang Yang:Hefei University of Technology Peiwei Zhao:Hefei University of Technology Junchi Chen:University of Science and Technology of China Yunfeng Diao:Hefei University of Technology He Liu:Independent Researcher Qi Chu:University of Science and Technology of China Tao Gong:University of Science and Technology of China Nenghai Yu:University of Science and Technology of China 💬 毒舌点评 亮点在于首次将音频-视频生成的安全评测从单一文本提示扩展到全部 11 种 T/I/A/V 非单例组合,并用 k 与 ρ 显式解耦攻击机制与证据分布,提出了 Composed Harm 与 Diluted Harm 这一具有解释力的双失效模式。短板在于验证闭环过于单薄,仅在 LTX-2 单一生成器上测 ASR 且防护端仅覆盖 4 个 guard,对抗攻击因迁移失败直接缺席 I/V 载体,所谓“全覆盖”在最难的对抗维度上仍是空缺。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 901 words

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

📄 Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes 标签:#空间音频 #音视频生成 #声源定位 #多通道 #CNN 6.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #CNN | #音视频生成 #声源定位 | arxiv 👥 作者与机构 第一作者:Qingyu Luo(Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) 通讯作者:论文未单独标注通讯作者;作者邮箱均为 University of Surrey 域名 作者列表:Qingyu Luo、Peng Zhang、Wenwu Wang、Philip J. B. Jackson(机构:Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 850 words

EchoWM: Open and Enterable Omnimodal World Models

📄 EchoWM: Open and Enterable Omnimodal World Models 标签:#音视频生成 #多模态模型 #音视频交互 #长音频处理 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 10.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #多模态模型 | #音视频交互 #长音频处理 | arxiv 👥 作者与机构 第一作者:Songchun Zhang(正文列出 HKUST、PKU、Joy Future Academy, JD 等九家机构,但全文提取未保留作者编号映射) 通讯作者:正文未明确标注 作者列表:Songchun Zhang、Yaowei Li、Junhao Zhuang、Weiyang Jin、Haoyu Wang、Xin Lu、Yilang Sun、Shiyi Zhang、Haoran Li、Xiaoxiao Ma、Yuming Li、Yijun Liu、Yaofeng Su、Yanwen Ma、Haoyu Wu、Zihan Su、Yue Ma、Lvmin Zhang、Haoyang Huang、Zeyue Xue、Anyi Rao、Nan Duan(机构:HKUST、PKU、Joy Future Academy, JD、HKU、THU、USTC、FDU、Beihang University、Stanford University) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 449 words

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

📄 Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds 标签:#音视频生成 #知识蒸馏 #多模态模型 #长音频处理 8.9/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #知识蒸馏 | #多模态模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Nan Duan(Joy Future Academy, JD) 通讯作者:正文未明确标注 作者列表:Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang(机构:Joy Future Academy, JD) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 419 words

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

📄 VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation 标签:#音视频生成 #强化学习 #Transformer #模型评估 8.3/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #强化学习 | #Transformer #模型评估 | arxiv 👥 作者与机构 Yinming Huang、Shuyuan Tu(共同一作)、Xi Yan、Zihan Yang 来自复旦大学与上海创新研究院,Jianhua Han、Xu Hang 来自银旺智能科技,Yu-Gang Jiang 与 Zuxuan Wu(通信作者)来自复旦大学。代码已在 GitHub 公开,数据构建使用 Gemini 3.1 与 Qwen3.5-Omni 等商业及开源模型。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 391 words

Generalized Audio-Driven Synthesis of Precise Drummer Motion

📄 Generalized Audio-Driven Synthesis of Precise Drummer Motion 标签:#音视频生成 #扩散模型 #音乐理解 #游戏音频 7.8/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音视频生成 | #扩散模型 | #音乐理解 #游戏音频 | arxiv 👥 作者与机构 第一作者:Álvaro G. Iñesta(机构未说明) 通讯作者:未说明 作者列表:Álvaro G. Iñesta、Mattia Ryffel、Amit H. Bermano、Robert W. Sumner、Martin Guay(机构信息未在当前正文中完整说明) 💡 毒舌点评 用生成模型驱动鼓手机器人的动作是个人机交互的好题目,但当前版本的泛化边界画得很紧:所有动作来自同一名鼓手同一套鼓,风格与体型泛化未验证;模型假定鼓组布局固定,连交叉手演奏都排除了。输入必须是纯鼓轨,多乐器歌曲要靠源分离预处理,泄漏与瞬态损失会传导到动作质量。一秒训练窗口有利于高速击打细节,长时一致性只能靠重叠拼接维持而未定量评估。二十二人的用户研究规模也偏小。 ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 568 words