Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition
📄 用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输 英文题目:Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition 一句话:论文用仅靠阈值调控脉冲密度的可编程 Butterworth 滤波器组与 IF 神经元构成非可学习 HLP 编码器,配合 100 步累积器与前馈 SNN 联合优化,在 Heidelberg Digits 上以 13 通道 100k 参数达到 99.77% 超越同类流水线,却在多说话人 GSC 上暴露对异构噪声鲁棒性不足的代价,并以 Zynq-7000 定点化 LLP 实现验证在线可行性。 标签:#语音识别 #端到端 #音频分类 #高效推理 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Valentin M. Meunier:机构信息未在 arXiv HTML 中可靠披露 Amélie Gruel:机构信息未在 arXiv HTML 中可靠披露 Pierre Lewden:机构信息未在 arXiv HTML 中可靠披露 Adrien F. Vincent:机构信息未在 arXiv HTML 中可靠披露 Sylvain Saïghi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把高层可编程滤波器组与积分发放神经元绑定的轻量编码器做到了可在 FPGA 上端到端跑通,并在受控的 Heidelberg Digits 上以极简前馈脉冲网络刷出超高精度,工程闭环完整。短板是复杂多说话人场景下泛化明显掉队,NTIMIT 仅 63.98% 且 GSC 远落后于 Lauscher 与 Speech2Spikes 的同类流水线,却未给出每通道阈值或更强时序建模等实质补救验证,效率指标也停留在脉冲计数层面。 ...