VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
📄 VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment 标签:#语音活动检测 #模型压缩 #音频理解 #Transformer #模型评估 7.4/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音活动检测 | #模型压缩 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Stephen Bauer(Analog Devices, Inc.) 通讯作者:Sheila Seidel(Analog Devices, Inc. / UCLA) 其他作者:Shanza Iftikhar(Analog Devices, Inc.)、Scott Veidenheimer(Analog Devices, Inc.)、Gorkem Ulkar(Analog Devices, Inc.) 💡 毒舌点评 这篇论文把“为了让VAD能在单片机上跑通而自废武功”这件事做到了极致:砍掉循环层、禁止非因果、只用标准算子,然后用一堆工程技巧把性能往回捞。四个部署约束清单确实戳中了现有轻量VAD的肺管子,剪枝+量化的组合拳也打出了一套漂亮的工程样板。但泛化性评估的缺失是个大窟窿,仅靠AVA-Speech一个测试集撑不起“deployment-ready”的旗帜,更像是在单一赛道定制了一辆无敌的规则特化车。角度感知QAT在二分类下的那点提升,换个场景是否依然灵验也得打个问号。 ...