E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
📄 E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs #音视频问答 #基准测试 #多模态模型 #强化学习 6.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.5/1 | 影响 0.4/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | #音视频问答 | #强化学习 | #基准测试 #多模态模型 | arxiv 👥 作者与机构 第一作者:Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部,实习期间完成此项工作) 通讯作者:Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部, 项目负责人)、Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 作者列表: Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Ping Hu(Vin University,未说明具体学院/实验室) Yixiong Zou(华中科技大学,未说明具体学院/实验室) Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 💡 毒舌点评 这篇论文精准切入了一个被顶会圈子长期忽视、却蕴藏巨大商业价值的领域——电商短视频理解。其提出的多模态密度评估框架是整个工作的点睛之笔,为“这任务为什么难”提供了量化的、有说服力的证据。然而,如果说方法部分展现的是专业团队的水准,那么论文呈现的排版质量则近乎草稿级别:严重的文本渲染错乱和表格乱码问题,贯穿全文,这不仅严重损害了专业形象,也让人怀疑作者对细节的态度。更关键的是,对于音频领域的读者而言,本文对语音信号的处理极其“粗暴”——将丰富的人类语言表达(韵律、情感、强调)简化为一串被计数的词汇,这与现代语音/副语言分析的前沿水平存在显著断层。 ...