Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network
📄 Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network 标签:#音视频理解 #模型压缩 #知识蒸馏 #音频理解 #Transformer 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #模型压缩 | #知识蒸馏 #音频理解 | arxiv 👥 作者与机构 第一作者:Parinaz Binandeh Dehaghani (University of Porto, Porto, Portugal) 通讯作者:未说明 作者列表:Parinaz Binandeh Dehaghani (University of Porto, Porto, Portugal), Danilo Pena (ResoSight, Montreal, Canada), A. Pedro Aguiar (University of Porto, Porto, Portugal) 💡 毒舌点评 亮点:论文目标明确,针对音视频事件识别(AVER)模型的边缘部署难题,提出了一个结合架构压缩、知识蒸馏和量化的完整工程思路,在AVE数据集上实现了参数减少约59%且精度损失可控的效果,流程清晰,面向实际部署。短板:核心贡献在于对成熟技术的组合应用,缺乏深层次的机制创新;实验验证严重不足,仅在一个规模和复杂度有限的单一数据集上测试,未与任何同期高效AVER方法或压缩技术进行对比,也缺乏关键消融实验,严重削弱了结论的说服力;声称适用于边缘部署,却未提供任何推理延迟、吞吐量或能耗等关键性能指标。 ...