VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval
📄 VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval #多模态模型 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ✅ 6.6/10 | 前50% | #音视频交互 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Cristian-Gabriel Florea(论文主页标注为 Military Technical Academy, Bucharest, Romania,初步版本在 CERC 2026 会议发表) 通讯作者:未说明 作者列表:Cristian-Gabriel Florea、Stelian Spînu(均未明确标注所属机构,根据初步版本报告推断可能来自同一单位) 💡 毒舌点评 这是一份扎实的移动端系统工程报告,六个模型在Android设备上的协同集成和后端优化值得认可,罗马尼亚列伊钞票检测0.986 mAP和深度标定小于1cm的误差令人满意。但论文回避了与任何现有辅助应用的直接对比实验,也完全没有盲人或低视力用户的真实使用评估,这让"辅助"二字仅停留在技术展示层面,无法证明任何实际价值。深度校准仅靠六个数据点的单一常数因子0.55,对室内外场景迁移、不同手持姿态和环境光照下的稳定性只字未提,工程鲁棒性存疑。缺失所有消融实验使得EMA参数、关键词匹配奖励、面积过滤阈值等关键设计选择的贡献无法判断。 ...