TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
📄 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions #音视频理解 #音频字幕生成 #多模态模型 #数据集 #基准测试 #强化学习 9.4/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.4/10 | 前10% | #音视频理解 | #多模态模型 | #音频字幕生成 #数据集 | arxiv 👥 作者与机构 第一作者:Linli Yao(北京大学计算机学院,快手科技Kling团队) 通讯作者:Xu Sun(北京大学计算机学院) 作者列表:Linli Yao(北京大学,快手科技Kling团队)、Yuancheng Wei(华南理工大学)、Yaojie Zhang(电子科技大学)、Lei Li(香港大学)、Xinlong Chen(中国科学院自动化研究所,快手科技Kling团队)、Feifan Song(北京大学)、Ziyue Wang(北京大学)、Kun Ouyang(北京大学)、Yuanxin Liu(北京大学)、Lingpeng Kong(香港大学)、Qi Liu(香港大学)、Pengfei Wan(快手科技Kling团队)、Kun Gai(快手科技Kling团队)、Yuanxing Zhang(快手科技Kling团队)、Xu Sun(北京大学) 💡 毒舌点评 该工作在音视频密集字幕生成领域投下了一枚“定义即创新”的炸弹。其提出的OmniDenseCaptioning任务和SodaM评估指标,直击当前音视频理解缺乏时间粒度和结构化描述的痛点,堪称一次教科书式的任务重塑。7B开源模型在精细定义的子任务上干翻Gemini-2.5-Pro,工程整合能力令人叹服,为社区贡献了完整的开原语料。然而,剥开任务定义与指标的糖衣,模型本身是Qwen2.5-Omni与GRPO的精心调配,缺乏算法层面的范式突破。更令人警惕的是,其引以为傲的SodaM指标和训练数据完全由Gemini系列模型闭环驱动,这种“以子之矛攻子之盾”的策略虽精彩,但也埋下了系统性偏见的隐患,评估的可信度也因此被蒙上一层阴影。 ...