The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
📄 剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本 英文题目:The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 一句话:针对联合音视频生成中音画互相同步却共同偏离剧本时间的问题,论文用时长归一化的加性时间路由把镜头与对白区间送进双分支交叉注意力,在 200 个剧本上把镜头边界误差从 1.11 秒降到 0.042 秒、对白准时率提到 84.1%,代价是评测仍锁在短剧对白域且零开源。 标签:#音视频生成 | #流匹配 | #参数高效微调 | #多模态模型 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yichen Liu:机构信息未在 arXiv HTML 中可靠披露 Quanwei Zhang:机构信息未在 arXiv HTML 中可靠披露 Haozhe Wang:机构信息未在 arXiv HTML 中可靠披露 Donghao Zhou:机构信息未在 arXiv HTML 中可靠披露 Xiaojie Li:机构信息未在 arXiv HTML 中可靠披露 Yang Shi:机构信息未在 arXiv HTML 中可靠披露 Jiaming Liu:机构信息未在 arXiv HTML 中可靠披露 Ruihua Huang:机构信息未在 arXiv HTML 中可靠披露 Yingtian Zou:机构信息未在 arXiv HTML 中可靠披露 Daquan Zhou:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把剧本时间从文本字符串里拽出来做成双模态注意力偏置,治好了音画很同步但集体演错时间的毛病,匹配算子对照也算体面。硬伤是全套数据、训练、评测都锁在自家短剧闭环里,基线文本带时间本就不公平,检测器既当教练又当裁判,还零开源,离可复现的剧本驱动标准差一口气。 ...