The Attention Triangle in Audio-Video Models
📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...