📄 把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗
英文题目:Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks
一句话:为解决人工耳蜗在噪声下可懂度骤降而深度网络又太费电的矛盾,论文把整条 ACE 编码流水线脉冲化为 Spiking Deep ACE,用稀疏加法替代稠密乘累加,在 VSTOI 仅落后约 1 个百分点、SNRi 基本持平的前提下把估算能耗从 2461 降至 372 μJ/s,代价是评估仍停留在声码器客观指标与 45nm 公式估算。
标签:#语音增强 #高效推理 #医疗音频
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Ludovic Boulanger:机构信息未在 arXiv HTML 中可靠披露
- Sean U. N. Wood:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
把 Conv-TasNet 底座的 Deep ACE 整体脉冲化并用 ParaLIF-Threshold 实现时间并行训练的工程取舍清晰,6 倍以上能耗下降对植入体场景确有吸引力。但评估仅在 28 人英语数据上做 ICRA 两类噪声的电极图域指标,无统计检验、无真实 CI 受试者主观验证、无神经拟态硬件实测,能耗也停留在 45 nm CMOS 估算且未计访存,离可植入部署仍有距离。
📌 核心摘要
人工耳蜗(Cochlear Implant,CI)用户因缺乏时间精细结构和频谱弥散,在噪声下言语可懂度显著下降,现有深度神经网络(Deep Neural Network,DNN)去噪方案功耗过高难以部署于植入体处理器。论文提出 Spiking Deep ACE,将 Deep ACE 的先进组合编码器(Advanced Combination Encoder,ACE)流水线脉冲化,以并行阈值自适应泄漏积分发放(Parallel Leaky Integrate and Fire with Threshold adaptation,ParaLIF-Threshold)神经元替代归一化与参数化整流线性单元(Parametric ReLU,PReLU)等非线性,并通过分离器(separator)与深度包络检测器(Deep Envelope Detector,DED)输出端的上采样因子 \(P\) 扩展特征维度以补偿脉冲稀疏性。该方法在保持 2 ms 算法延迟的端到端框架内同时完成语音增强与 CI 编码,以事件驱动的稀疏加法(ADD)替代稠密乘累加(Multiply-And-Accumulate,MAC)。在 ICRA 稳态未调制高斯噪声与 6 人 babble 噪声、-5 至 10 dB 四档信噪比的综合测试中,脉冲模型达到与 Deep ACE 相当的声码器短时客观可懂度(Vocoded Short-Time Objective Intelligibility,VSTOI)与电极图域信噪比提升(Signal-to-Noise Ratio improvement,SNRi),同时估算能耗降低超过 6 倍。价值在于为神经拟态硬件上的低功耗 CI 语音处理提供了可行路径,边界在于仅基于声码器客观指标且未在真实 CI 用户或芯片上验证。
🔗 开源与复现资源
- 代码:https://github.com/NECOTIS/spiking-deep-ace
- 模型权重:论文中未提及
- 数据集:训练集为文献 [25, 26] 中公开数据集,包含 28 个说话人约 10 小时带噪语音,信噪比为 0 dB、5 dB、10 dB 和 15 dB,音频重采样至 16 kHz 并切分为 2 秒片段,论文中未提及具体下载链接;测试集使用 ICRA static 非调制随机高斯噪声和 ICRA babble 6 人 babble 噪声 [7],与 [25] 中干净测试集语音在 -5 dB、0 dB、5 dB 和 10 dB 下混合,混合代码来自文献 [17],论文中未提及数据集下载链接
- Demo:论文中未提及
- 复现材料:论文 Table 1 给出超参数,Spiking Deep ACE 配置为 N 128、L 32、B 64、Sc 64、H 64、P 3、X 6、R 4,参数量 437k,Deep ACE 参数量 552k,损失函数仅使用 MSE,优化器为 Adam 学习率 1e-3,学习率调度器在 5 个 epoch 无提升时下降,训练集按性别分层随机划分 80% 训练和 20% 验证
- 论文中引用的开源项目:Deep ACE [9]、Conv-TasNet [18]、ParaLIF [2]、ParaLIF-Threshold [1],论文中未提及上述项目具体链接
🧭 深度解读
为什么给人工耳蜗做去噪,不能直接照搬普通语音增强?
想象你戴着人工耳蜗走进一家嘈杂的食堂。正常听觉会同时利用声音的细微时间起伏和丰富的频谱细节来锁定说话人,而人工耳蜗只能把声音切成二十多个通道,用电脉冲去刺激听神经。时间精细结构丢了,频谱也被抹平,噪声一来,目标语音就被糊在一起。
这意味着去噪不能只在波形上把噪声擦掉,还得保证最后送到电极上的刺激模式是对的。传统单通道方法如时频掩蔽、谱减法在平稳噪声上尚可,一碰到食堂里那种 6 个人同时聊天的 babble 噪声就失灵。深度网络能学会更复杂的非平稳噪声,但问题立刻转到另一头:植入体处理器靠电池供电,寸土寸金的功耗预算容不下每一步都做稠密矩阵乘法。
所以这个任务的约束是双重的:既要在电极图域把信噪比拉回来,又要把计算本身变得足够稀疏、足够事件驱动,才能塞进未来的神经拟态芯片。论文的起点就在这里。
这条路之前走到哪了,本文卡在哪个空位?
通用语音增强已经走过两代。第一代是信号处理驱动的单通道算法,优点是轻量、可解释,缺点是对非平稳噪声泛化差。第二代是深度网络,尤其是 Conv-TasNet 这类时域分离网络,把波形直接映射到掩蔽或干净语音,在复杂噪声下显著提升可懂度。
人工耳蜗领域则有一条专门的编码路线:先进组合编码器(Advanced Combination Encoder,ACE)把声音变成电极图(electrodogram),即每个通道随时间变化的刺激强度。Deep ACE 的贡献是把 Conv-TasNet 式的编码器-分离器-解码器结构嫁接到 ACE 上,加入反整流器(antirectifier)保留相位信息、深度包络检测器(Deep Envelope Detector,DED)辅助包络估计,实现了端到端去噪加编码,并把算法延迟压到 2 毫秒,满足实时性。
脉冲神经网络(Spiking Neural Network,SNN)是另一条并行线索。它用 0/1 脉冲事件传递信息,只有收到脉冲时才做加法,天然稀疏、适合神经拟态硬件。已有工作把 SNN 用于通用语音增强,但都停在波形增强层面,没有和 CI 编码联合优化。Spiking Deep ACE 要填的空位正是这个交叉点:不再做两段式先增强再编码,而是让同一条脉冲流水线直接输出电极图。
论文把问题形式化成什么输入输出?
输入是一段重采样到 16 kHz 的含噪语音波形,信噪比覆盖 -5 到 10 dB,噪声包括稳态高斯噪声和 6 人 babble。输出不是干净波形,而是约 22 通道的电极图,之后会经声码器重合成语音用于可懂度评估。
约束很明确:端到端,延迟不超过 2 毫秒,参数量不能超过 Deep ACE 的 552k,否则节能就失去了对比意义。评价则放在两个域:电极图域的信噪比提升(Signal-to-Noise Ratio improvement,SNRi)看去噪本身,声码器短时客观可懂度(Vocoded Short-Time Objective Intelligibility,VSTOI)看重合成后人耳可懂度的代理指标。
这一定位决定了后续所有取舍:任何让表征更稀疏的设计,都必须在电极图精度上找补回来。
整条脉冲流水线长什么样?
数据流可以一句话概括:波形 → 编码器(encoder)→ 并行进入分离器与 DED → 上采样扩展 → 双解码器 → 逐点掩蔽融合 → 电极图。编码器是 1 维卷积,把波形映射为时频表征,反整流器在这里保留相位相关信息。分离器和 DED 都由堆叠的 1 维空洞卷积块组成,负责估计时频掩蔽所需的上下文和包络细节。
与 Deep ACE 相比,结构上有三处刻意做减法与做加法。减法是把每个卷积块里的归一化层全部拿掉,也不再单独放参数化整流线性单元(Parametric ReLU,PReLU),因为脉冲发放本身就是非线性。加法是在分离器与 DED 输出端引入上采样因子 P=3,把通道维扩展 3 倍再送入解码器。论文的直觉是:脉冲把连续值量化成稀疏事件,信息密度下降,必须在解码前把特征维度撑开,才能让掩蔽解码与信号解码有足够材料去恢复细节。
双解码器分工清晰:掩蔽解码输出时频掩蔽,与编码特征逐点相乘实现去噪;信号解码重构电极图幅度。两路都是卷积结构,输入都来自上采样后的稀疏特征。整套系统保持与标准 ACE 一致的 2 毫秒延迟,超参数上 Spiking Deep ACE 选为 N=128、L=32、B=64、Sc=64、H=64、P=3、X=6、R=4,参数量 437k,刻意压在 Deep ACE 的 552k 之下。
脉冲神经元和能耗公式到底在算什么?
核心神经元是并行阈值自适应泄漏积分发放(Parallel Leaky Integrate and Fire with Threshold adaptation,ParaLIF-Threshold)。白话说,它是经典泄漏积分发放(Leaky Integrate and Fire,LIF)神经元的变体:膜电位会随时间泄漏衰减,累积到阈值就发放一个脉冲。传统 LIF 发放后会重置膜电位,这导致时间步之间必须串行计算。ParaLIF-Threshold 去掉了重置,把膜电位动力学与脉冲发放解耦,从而可以在时间维并行训练,大幅缩短训练时间。每个神经元可学习两个参数:膜泄漏常数和发放阈值。
能耗的对比建立在 3 条公式上。第一条算卷积的操作数:
\[O=\frac{C_{in}}{G}\times K_{W}\times K_{H}\times C_{out}\times H_{out}\times T_{out}\]其中 O 是操作数,C_in 是输入通道,G 是分组数,K_W、K_H 是卷积核宽高,C_out 是输出通道,H_out 是输出高度,T_out 是输出时间步。它把 1 次卷积展开为所有通道与时空位置的乘累加次数。
第二条是传统人工神经网络(Artificial Neural Network,ANN)层的能耗:
\[E_{ANN}=O\times C_{MAC}\]E_ANN 是该层能耗,C_MAC 是 1 次乘累加(Multiply-And-Accumulate,MAC)在 45nm CMOS 工艺下的能量代价。ANN 每一步都要做稠密 MAC。
第 3 条是脉冲层的能耗:
\[E_{SNN}=\frac{\overline{S}}{T_{out}}\times O\times C_{ADD}+T_{out}\times N\times 10\times C_{ADD}\]E_SNN 是脉冲层能耗,\overline{S}是该层平均输入脉冲率,C_ADD 是 1 次加法(ADD)代价,N 是神经元数。第一项是稀疏突触操作,只有收到脉冲时才做加法,用\overline{S}/T_out 刻画稀疏度;第二项是每个时间步都要更新的膜电位状态,论文按 10 倍 ADD 估算。网络总能耗是所有浮点层按第二式、所有脉冲层按第三式求和。
读者看图时要抓住稀疏度这个杠杆。论文报告网络内部采样率 1 kHz,训练中平均发放率约 250 spikes/s,即每 4 个时间步才发放 1 次,这正是第一项能被大幅压缩的前提。Figure 1 展示了两种流水线与卷积块的对比,重点看 C 与 D:脉冲块如何用 ParaLIF 替代归一化与 PReLU;Figure 4 则追踪发放率如何从 400 以上快速收敛到 250 附近。

论文图 1。这张图来自原论文 Figure 1:,图示内容为“A) Spiking Deep ACE processing pipeline.”。请结合“脉冲神经元和能耗公式到底在算什么?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
它是怎么训练的,损失和优化有什么讲究?
训练数据来自文献公开的 28 人英语数据集,约 10 小时含噪语音,信噪比包含 0、5、10、15 dB 及对应干净语音,按性别分层随机划分 80% 训练、20% 验证,音频切成 2 秒片段。测试则用同一干净测试集与 ICRA 两类合成噪声在 -5、0、5、10 dB 下混合,混合代码沿用文献。
损失函数的选择体现了脉冲化的差异。Deep ACE 用均方误差(Mean Square Error,MSE)约束电极图重构,再加二元交叉熵(Binary Cross-Entropy,BCE)约束分离器输出的理想掩蔽。Spiking Deep ACE 只用 MSE,作者称这样效果更好,但未公布权重与消融细节。优化器为 Adam,初始学习率 1e-3,调度策略是 5 个 epoch 内验证性能提升小于 1e-4 就衰减。论文未披露 batch size、总 epoch 数、衰减系数、权重衰减与梯度裁剪等细节,ParaLIF 的泄漏与阈值初始化范围也未说明。
超参数搜索的目标是在参数量不超过 Deep ACE 的前提下最大化验证集性能,这解释了为什么脉冲版本把编码器通道 N 从 64 提到 128、分离器通道 Sc 从 32 提到 64,却把块内中间通道 H 从 128 降到 64,并把重复组数 R 从 8 减到 4、每组块数 X 从 3 增到 6。网络内部采样率固定为 1 kHz,训练过程的稀疏性曲线是后续能耗估算的关键证据。
用什么数据、怎么比、看什么指标?
要复现或评判这篇工作,先把协议拆成数据、基线、指标与统计四部分。数据上训练与验证同源,测试则固定为 ICRA 稳态未调制高斯噪声与 ICRA 6 人 babble 两类噪声,四档信噪比综合评估。基线只有一个强基线 Deep ACE,没有传统单通道方法也没有其他 SNN 语音增强方法,这让节能与性能的权衡缺乏外部参照。
指标上 SNRi 在电极图域计算,反映去噪前后电极图信噪比的差值,数值越高越好;VSTOI 先把预测电极图经声码器重合成语音,再以干净未处理语音为参考计算短时客观可懂度,同样越高越好。两者都是客观代理指标,未涉及真实人工耳蜗用户的主观可懂度或质量评分。
根据论文正文与图中报告值整理,数据集与协议可概括如下:
| 数据集/划分 | 构成与采样 | 噪声与信噪比 | 用途与备注 |
|---|---|---|---|
| 训练集(公开数据集,28 人,14 男 14 女) | 约 10 小时,重采样 16 kHz,切 2 秒片段 | 0/5/10/15 dB 含噪及干净 | 80% 训练,20% 验证,按性别分层随机划分 |
| 测试集(同一干净测试集混合) | 与训练集说话人不重叠的干净语音 | ICRA static 高斯噪声、ICRA babble 6 人噪声,-5/0/5/10 dB | 用文献代码混合,用于 VSTOI 与 SNRi 评估 |
| 评估协议 | 电极图域 SNRi,声码器重合成后 VSTOI | 综合两类噪声四档 SNR 平均,也以箱线图展示分条件分布 | 基线仅 Deep ACE,未报告多种子方差与显著性检验 |
硬件与训练预算方面,论文未说明 GPU 型号、数量与训练时长,能耗评估基于 45nm CMOS 下 MAC 与 ADD 代价的公式估算,未计访存,也未在 Loihi 或 Xylo 等神经拟态芯片上实测延迟与吞吐。Figure 2 给出了干净、含噪、两种模型预测的电极图示例,可直观对比刺激模式的恢复程度;Figure 3 的箱线图则用于观察不同噪声与信噪比下中位数与四分位区间的重叠情况。
省了六倍电,可懂度真的没掉吗?
核心问题是脉冲化是否在可懂度与降噪增益基本不掉的前提下换来数量级节能。论文在综合测试集上给出可核对的汇总数字,细分条件则以箱线图呈现。
根据论文正文与图中报告值整理,关键结果如下:
| 比较或条件 | 指标(方向) | 明确报告值 | 这项数字支持什么 |
|---|---|---|---|
| Spiking Deep ACE vs Deep ACE,ICRA static+babble 综合 | VSTOI ↑ | 56.0% vs 57.0% | 脉冲模型落后约 1.0 个百分点,差距很小 |
| 同上综合 | SNRi ↑ | 6.0 dB vs 6.1 dB | 电极图域降噪增益基本持平,仅差 0.1 dB |
| 同上综合 | 能耗 ↓ | 372 vs 2461 μJ/s | 脉冲模型估算能耗降低超过 6.6 倍 |
| ICRA static 低信噪比段(约 -5 dB) | SNRi 分布 | 脉冲模型中位线略高于 Deep ACE | 在最困难的稳态噪声低信噪比下未出现明显劣化 |
| 其余 SNR 与 ICRA babble | SNRi/VSTOI 分布 | 落后不超过 0.5 dB / 2 个百分点,箱体重叠 | 整体性能接近,但未做统计检验不能断言等价 |
| 稀疏性前提 | 平均发放率 | 约 250 spikes/s(每 4 步 1 脉冲) | 解释为何稀疏 ADD 能替代稠密 MAC |
Figure 3 需要这样读:左图 VSTOI、右图 SNRi,蓝色为脉冲模型,橙色为 Deep ACE,箱体中线是中位数,上下沿是四分位,须线到 1.5 倍四分位距。多数条件下蓝色箱体略低于橙色,但在 -5 dB 时中位线几乎重合,10 dB 时分离稍大,整体重叠度高。不能推出的是等价性,因为论文未给出各分格精确数值、置信区间或显著性检验,离群点也较多。
反证与边界同样重要:高信噪比下脉冲模型实际落后,能耗数字未含访存且状态更新按 10 倍 ADD 估算未经校准,评估也未覆盖真实环境非平稳噪声、混响或多语言。节能的前提是 250 spikes/s 的稀疏度在推理时依然成立,而 Figure 4 仅展示训练集上的收敛曲线,未展示逐句推理动态。

论文图 2。这张图来自原论文 Figure 2:,图示内容为“Example of predicted electrodograms by each of the models as well as the clean and noisy electrodograms for reference.”。请结合“省了六倍电,可懂度真的没掉吗?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

论文图 3。这张图来自原论文 Figure 3:,图示内容为“Box plots showing the SNRi scores for both models on the same test sets as in a).”。请结合“省了六倍电,可懂度真的没掉吗?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

论文图 4。这张图来自原论文 Figure 4:,图示内容为“Evolution of the mean spike rate per neuron during training.”。请结合“省了六倍电,可懂度真的没掉吗?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
哪些结论还站不住,需要打问号?
作者自己承认的边界有两处:能耗公式未计访存,以及评估仅限声码器客观指标,未做真实人工耳蜗用户主观测试与芯片部署验证。论文辩称脉冲模型参数更少且稀疏,访存更少,实际节能可能被低估,但这仍是推断而非测量。
更深的局限在实验设计。数据仅来自单一 28 人英语集与两类合成 ICRA 噪声,未覆盖真实食堂、街道等非平稳噪声、混响与说话人泛化。基线只有 Deep ACE,缺少传统方法与其他 SNN 方法的横向对比,无法判断节能是否以牺牲特定噪声鲁棒性为代价。统计层面,未报告多种子方差、置信区间或显著性检验,1 个百分点的 VSTOI 差距与 0.1 dB 的 SNRi 差距是否显著无从判断。
结构主张也缺乏量化消融。移除归一化与用脉冲非线性替代 PReLU、上采样 P=3 的增益,仅以预实验文字描述,没有对照表格。结论中 comparable performance 的表述因此偏强,尤其在高信噪比段脉冲模型已可观察到落后。把公式估算的 6 倍节能外推为低功耗植入体就绪,仍需在真实神经拟态硬件上补上延迟、吞吐与访存的实测。
如果要复现,能拿到什么、还缺什么?
可复现性上,论文提供了核心代码仓库与 Table 1 的超参数对照:Deep ACE 为 N=64、L=32、B=64、Sc=32、H=128、P=3、X=3、R=8,552k 参数;Spiking Deep ACE 为 N=128、L=32、B=64、Sc=64、H=64、P=3、X=6、R=4,437k 参数,网络采样率 1 kHz,损失仅用 MSE,优化器 Adam 1e-3,5 个 epoch 无提升则衰减。数据集指向公开文献但未给直接下载链接,测试混合代码来自文献。
缺失的部分恰好是复现最敏感的细节:batch size、总 epoch、学习率衰减系数、权重衰减、梯度裁剪、ParaLIF 泄漏与阈值的初始化与约束、训练硬件与时长。模型权重与演示 Demo 未说明,能耗估算中 C_MAC 与 C_ADD 的具体取值、状态更新 10 倍 ADD 的校准依据也未展开。
对刚入门的研究生,一个务实的复现路径是:先用仓库跑通 Deep ACE 基线,确认 2 毫秒延迟与电极图输出;再切换到脉冲分支,监控 Figure 4 那条发放率曲线是否收敛到 250 spikes/s 附近,以此验证稀疏性假设;最后在同一混合脚本下复算 VSTOI 与 SNRi 的箱线图分布,而不是只看综合平均。若要进一步验证节能主张,需要在支持事件驱动的硬件或仿真器上补上访存与状态更新的实测,否则只能停留在公式层面。
怎么用一句话记住这篇工作的取舍?
这篇工作的本质是用表征精度换计算稀疏性:接受脉冲量化带来的信息损失,用 P=3 的上采样与更宽的编码器把特征维度撑开,再用 ParaLIF-Threshold 的无重置设计换来时间并行与事件驱动的稀疏加法。结果是在声码器客观指标上几乎追平 Deep ACE,同时把公式估算的能耗压到六分之一。
对人工耳蜗这个场景,这个取舍是有吸引力的,因为植入体最缺的不是一两个百分点的可懂度,而是能在电池约束下持续运行的去噪能力。但要从论文走向可植入,还需要跨过三道坎:用真实用户主观可懂度替代 VSTOI 代理,用真实环境噪声与混响替代合成 ICRA 噪声,用芯片实测替代 45nm 公式估算。
对初学者而言,这篇论文最值得带走的不是 6 倍这个数字,而是它展示了一种系统级脉冲化思路:不是把某个模块换成 SNN,而是把去噪与编码联合成一条端到端脉冲流水线,并围绕稀疏性重新设计块结构与特征维度。理解这个权衡,比记住具体超参数更重要。
📎 论文与评分元数据
标签:#语音增强 #高效推理 #医疗音频
6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #高效推理 | #医疗音频 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.2/2):首次将 Deep ACE 去噪与 ACE 编码统一为单一 SNN 流水线,以 ParaLIF-Threshold 去重置实现时间并行并移除归一化与 PReLU,用 P=3 上采样补偿脉冲稀疏,属面向 CI 的系统级工程组合而非单点 trick。
技术严谨性 (1.0/1.5):ParaLIF-Threshold 去重置与稀疏 ADD 替代 MAC 的推导自洽,2 ms 延迟约束明确;但 能耗式 3 按 10 倍 ADD 计状态更新且未计访存、未校准,假设合理性论证不足。
实验充分性 (0.8/1.5):仅对比 Deep ACE 单一强基线,无传统方法或其他 SNN 基线;多组件主张下归一化移除与 P=3 上采样仅文字宣称无量化消融;未报告多种子方差、置信区间或显著性检验,细分 SNR 仅箱线图无数值。
清晰度 (0.7/1):数据流波形到电极图与双解码器结构描述清晰,超参数 N L B Sc H P X R 与参数量 437k 对 552k 对照明确;但 图 3 仅箱线图未给分格数值,损失权重与调度细节分散。
影响力 (0.7/1.5):面向植入体处理器的 6.6 倍估算节能与 1.0 个百分点 VSTOI 差距为神经拟态 CI 提供了可行路径,但 证据限于声码器客观指标与合成噪声,未经真实 CI 受试者与芯片验证,泛化与落地仍待检验。
开源 (1.2/1.5):核心代码已开放 https://github.com/NECOTIS/spiking-deep-ace,满足方法研究核心产物开放,但模型权重未说明、数据集无直接下载链接、Demo 缺失,文档完整性不足故按锚点 1.2 计分。
可复现性 (0.3/0.5):仅披露 N 128 L 32 B 64 Sc 64 H 64 P 3 X 6 R 4、MSE 损失与 Adam 1e-3 及 5 epoch 调度,缺失 batch size、总 epoch、衰减系数、权重衰减、梯度裁剪、硬件型号与 ParaLIF 泄漏阈值初始化约束,大部分关键配置缺失。
工程/实践价值 (0.8/1.5):在 1 kHz 采样下以 250 spikes/s 稀疏度实现 372 对 2461 μJ/s 的估算节能且参数量少 115k,保持 2 ms 延迟,具工程取舍价值;但 未在 Loihi 或 Xylo 等硬件实测延迟吞吐与访存,仅为公式估算。