A Large-Scale Database and Predictive Model of Listener-Rated Ease of Speech Understanding in Commercial Hearing Aids

📄 A Large-Scale Database and Predictive Model of Listener-Rated Ease of Speech Understanding in Commercial Hearing Aids #助听器 #语音增强 8.1/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 8.1/10 | 前25% | #语音质量评估 | #助听器 | #语音增强 | arxiv 👥 作者与机构 Andrew Sabin, Steve Taddei, Abram Bailey。作者来自独立听力实验室HearAdvisor(具体所属机构未在论文中明确说明)。 💡 毒舌点评 这篇论文解决了一个真实且重要的问题:为商业助听器的消费者提供基于真实听感的客观评价指标。其核心贡献在于构建了一个大规模的、基于真实用户在线主观评分的助听器语音理解易用性数据集,并训练了一个预测模型,该模型在特定条件下达到了人类评分的可靠性上限。然而,这份“顶会级别”的工作存在几个显著的“硬伤”:首先,模型和数据集均未开源,这使得其“大规模数据集”的价值大打折扣,也严重阻碍了学术界的复现与比较;其次,实验仅基于单一的N3听力损失类型,模型对其他听力损失用户的泛化能力完全未知,这是一个重大的局限性,而非简单的“待验证”;最后,在线收集数据的环境控制不足(播放设备、校准粗糙),虽然作者期望其能平均化,但这引入了不可忽视的系统性偏差风险。总体而言,这是一篇扎实的工程导向工作,为特定应用提供了有价值的解决方案,但在方法的普适性、科学严谨性以及开放性上,距离顶级学术会议的标准还有距离。 📌 核心摘要 本文介绍了HearAdvisor平台为商业助听器构建的大规模听者主观评分数据集及对应的预测模型。数据集包含通过在线盲听测试收集的151,608条原始评分(经筛选后为104,298条),涵盖了83款商业助听器产品在72个现实声学场景下的录音。为预测这些“语音理解易用性”评分,作者提出一种方法:将助听器处理后的音频与纯净参考语音分别输入冻结的Whisper-Small编码器,取其内部表征的差值,再通过一个轻量级MLP头映射为预测分数。在留出设备上,该模型在响亮场景(\(r=0.89\))和安静场景(\(r=0.79\))的预测相关性均显著优于基线HASPIv2(\(r=0.75\)和\(r=0.58\)),且在响亮场景下达到了听者评分的分半信度上限。模型对增益和信噪比的受控变化也表现出合理的敏感性。该工作为评估真实商业助听器的语音理解体验提供了一种基于用户感知的新方法。 🔗 开源详情 代码:论文中未提供代码链接或代码仓库。 模型权重:论文中未提及模型权重链接。 数据集:论文中未提供独立的、可下载的数据集存储库链接。数据集的收集和托管于HearAdvisor.com 平台(论文第2.2节:“the Blind Listening Challenge… embedded on each product and comparison page.”)。论文未提供用于离线访问或原始数据下载的公开数据集URL。 Demo:论文中未提及独立的开源演示链接。相关数据和指标的展示与使用通过其官方网站 HearAdvisor.com 进行(论文摘要及第1节提及)。 复现材料:论文详细描述了模型架构(第3.1节,Whisper-small编码器 + MLP头)、训练配置(第3.2节,AdamW优化器,学习率等)和实验设置(第4节),但未提供用于直接复现的预训练权重、配置文件或详细代码。 论文中引用的开源项目: Whisper (OpenAI):论文使用的ASR基础模型。论文中引用了其原文(Radford et al., 2023),其官方代码仓库为:https://github.com/openai/whisper。 ARTE (Ambisonic Recordings of Typical Environments) 数据库:论文中用于创建声学场景的公开录音数据库。论文引用了其原始论文(Weisser et al., 2019),该数据库可通过其官方项目页面获取:https://www.indiana.edu/~artelab/。 🏗️ 方法概述和架构 本文提出的方法是一个端到端的、基于预训练语音表征的监督学习框架,旨在从助听器输出的声学信号中预测听者对“语音理解易用性”的主观评分。其核心流程和组件如下: ...

2026-06-26 · 更新于 2026-07-24 · 2 min · 266 words

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

📄 Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction #语音识别 #低资源 #语音增强 6.1/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 6.1/10 | 前50% | #语音识别 | #低资源 | #语音增强 | arxiv 👥 作者与机构 Mohammad Aref Jafari-Raddani。作者隶属于伊朗库姆的库姆科技大学计算机工程系,以及伊朗伊斯法罕的Asa Electronic Akhtaran公司。通讯邮箱为 raddaniaref@gmail.com。 💡 毒舌点评 这篇论文的工作像是在给一个经典的检索增强生成(RAG)流水线做一次非常针对性的“微调”,而非提出新的架构。其核心贡献——修改TF-IDF以赋予错误词项更高权重——虽然在工程上直接且有效,但在方法论上缺乏足够的新颖性和理论深度,更像是一种启发式的技巧。论文在实验验证上显得非常单薄:仅在一个数据集(FLEURS波斯语子集)上评估,模型组合固定(Whisper + Gemini),完全缺乏与其他SOTA纠错方法的对比,也缺少关键的消融研究来证明每个组件(如对称归一化、权重公式)的独立贡献。将错误感知命中率(EA-HR)作为主要贡献之一提出,但其评估范围局限于Top-3检索结果,说服力有限。论文在“未来工作”中提到的计划(如扩展知识库、领域迁移)恰恰点明了当前工作的天花板。整体感觉是一篇扎实但缺乏野心和深度的系统微调报告。 📌 核心摘要 本文针对低资源语言(以波斯语为例)的端到端ASR系统频繁产生的音似和循环幻觉问题,提出了一种高效的检索增强生成(RAG)纠错框架。该框架包含两个主要组件:1)一个对称应用的文本归一化模块,用于处理格式差异和循环幻觉;2)一种新颖的错误感知TF-IDF检索算法,通过构建基于历史错误概率的稀疏对角惩罚矩阵,动态提升高频错误词项的检索权重。在FLEURS波斯语子集上的实验表明,该方法将错误感知命中率从53.7%显著提升至90.9%,并将端到端词错误率从基线23.06%降低至18.83%,且在推理阶段几乎不引入额外延迟。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及模型权重链接(论文使用了 Whisper large-v3-turbo 和 Google Gemini 2.0 Flash-Lite 模型,但未提供其权重的具体下载地址) 数据集:论文中未提及数据集链接(论文明确使用了 Google FLEURS 数据集的波斯语子集,但未给出具体下载地址) Demo:论文中未提及 复现材料:论文中未提及 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 本文提出的框架整体架构如图1所示,旨在通过轻量级修改增强标准的ASR-RAG流水线。核心流程分为离线知识库构建和在线推理两个阶段,两者共享对称的预处理模块。 ...

2026-06-25 · 更新于 2026-07-24 · 2 min · 221 words

Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

📄 Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS #语音合成 #语音增强 #生成对抗网络 #自监督学习 #生成模型 #多模态模型 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前50% | #语音合成 | #生成对抗网络 | #语音增强 #自监督学习 | arxiv 👥 作者与机构 作者:Runwu Shi, Yujin Wang, Hongjin Song, Chunxiang Jin 机构:Institute of Science Tokyo, Wuhan University, Beijing Institute of Technology, Ant Group ...

2026-06-25 · 更新于 2026-07-24 · 3 min · 458 words

One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications

📄 One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications #实时处理 #多语言 #语音增强 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | #语音增强 | #实时处理 | #多语言 | arxiv 👥 作者与机构 作者:Szu-Wei Fu, Rong Chao, Xuesong Yang, Sung-Feng Huang, Ante Jukić, Yu Tsao, Yu-Chiang Frank Wang 机构:1. 台湾大学电机工程系;2. 中央研究院资讯科技创新研究中心。机构信息在论文作者名字的上标中标明。 💡 毒舌点评 这篇论文试图解决一个很实际的问题:用一个模型应对不同延迟要求的实时语音增强。想法很酷,但实现细节经不起推敲。并行卷积层(类似MoE)和早退机制的组合听起来很灵活,但所谓的“通用性”是建立在一个巨大的前提之下的——你得在部署时针对每个硬件和延迟预算重新测试并剪枝模型,这在实际应用中可能并不“通用”。所谓的“两阶段训练”本质上是个后处理的补丁,用来弥补早退机制带来的性能损失。实验数据虽多,但大部分是URGENT Challenge这个特定竞赛的数据集和设定,模型在VoiceBank-DEMAND上跑出的数字(PESQ 2.76)看着不错,但别忘了它可是用了3倍于DeepFilterNet3的参数量(2.9M vs 2.14M)才达到的,性价比存疑。最让人不安的是关于实时性的讨论:作者在论文里都承认12层模型在A100上RTF>1,不满足实时要求,却依然把它纳入“30种配置”中来宣传,这有点自欺欺人。总的来说,这是一篇工程整合度高于学术创新性的论文。 ...

2026-06-25 · 更新于 2026-07-24 · 3 min · 558 words

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

📄 SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios #语音增强 #数据增强 #语音质量评估 #语音识别 7.4/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | #语音增强 | #数据增强 | #语音质量评估 #语音识别 | arxiv 👥 作者与机构 作者:Jinming Zhang, Xionghu Rao, Wei Zhong, Eng Siong Chng 机构:1 浙江大学,中国;2 南洋理工大学,新加坡;3 湖南大学,中国 通讯作者:pmhuan1212@gmail.com, aseschng@ntu.edu.sg ...

2026-06-25 · 更新于 2026-07-24 · 3 min · 616 words

A Variational-Flow Analysis of StoRM under Noise-Power Mismatch

📄 A Variational-Flow Analysis of StoRM under Noise-Power Mismatch #语音增强 #扩散模型 #理论分析 4.4/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 0.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0.2/1.5 📝 4.4/10 | 前50% | #语音增强 | #扩散模型 | #理论分析 | arxiv 👥 作者与机构 作者:Shubham Ojha 机构:未提及 💡 毒舌点评 这是一篇结构清晰、野心勃勃的理论工作,试图为StoRM模型在噪声功率失配下的“Kink”现象提供一个严格的数学解释。其核心洞察——将输出敏感性分解为下游放大矩阵和上游预测器敏感性的乘积——在理论上是优雅且有潜力的。然而,该工作目前的完成度远未达到顶会标准。它本质上是一份“研究纲领”或“初步报告”,而非一篇完整的论文。所有核心假设(假设2、3)和关键定理(定理2)的证明都未完成或仅有提纲,而论文中声称的实验验证被完全推迟。这导致整个理论框架如同空中楼阁,其有效性完全依赖于未来(且未保证的)配套报告。如果这是一篇投稿,其状态更接近于“在进行中的工作”,而非“已完成的研究”。 📌 核心摘要 本文针对混合扩散语音增强模型(以StoRM为实例)在噪声功率偏离训练条件时性能急剧下降的“Kink”现象,提出了一种基于变分流动的理论分析框架。核心贡献是推导了一个精确的、逐路径的参数敏感性乘积分解:输出对噪声功率参数M的敏感性,等于一个由分数雅可比矩阵决定的连续矩阵值泛函K(M),与预测器输出对M的敏感性的乘积。在三个关于逆向过程流的假设下,论文证明了一个“当且仅当”定理,将增强输出的C1光滑性失效(Kink)归因于预测器映射的C1光滑性失效。该结论被推广到离散欧拉-丸山采样器。论文明确指出,所有假设验证和实验评估均被推迟到一份配套的实验报告中,当前版本仅呈现理论框架和实验计划。 🔗 开源详情 代码:论文中未提及代码链接或仓库。 模型权重:论文中未提及模型权重链接。 数据集:论文中未提及具体数据集名称、链接或协议。 Demo:论文中未提及。 复现材料:论文中未提及复现材料(如训练配置、检查点、附录等具体信息)。 论文中引用的开源项目: StoRM: 未提供具体链接(论文中将其作为所研究的“canonical instance”进行引用)。 SGMSE+: 未提供具体链接(论文中作为相关工作进行引用)。 🏗️ 方法概述和架构 本文提出了一种用于分析噪声功率失配下扩散增强模型行为的变分流动分析框架,其架构和方法可逐层展开如下: ...

2026-06-24 · 更新于 2026-07-24 · 2 min · 344 words

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

📄 Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement #扩散模型 #对比学习 #多模态模型 #语音增强 8.1/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.1/10 | 前25% | #语音增强 | #对比学习 | #扩散模型 #多模态模型 | arxiv 👥 作者与机构 Colombe Mboungou, Mostafa Sadeghi, Jean-Eudes Ayilo, Romain Serizel Université de Lorraine, CNRS, Inria, Loria, Nancy, France 💡 毒舌点评 这篇论文做了一件相对简单但合理的“缝合”工作:在一个现有的扩散式无监督视听语音增强(AV-UDiffSE+/DiffUSEEN)框架上,增加了一个训练时的对比损失来强化视听对齐。想法直接,实验也显示了收益。但作者似乎对这项工作的定位过于乐观。它本质上是一个模块化改进,而非架构或范式上的突破。论文在讨论中声称“明确研究了跨模态对齐的作用”,但其实验主要展示了“增加对比损失能提升性能”,对于“为何现有交叉注意力机制不够”以及“对比损失具体如何改善表示空间”的深层机制探讨不足。将这样一个相对增量的工作发表在顶会,需要更强的洞察力和更全面的分析来支撑。 ...

2026-06-24 · 更新于 2026-07-24 · 2 min · 335 words

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

📄 Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement #语音增强 #生成模型 #对比学习 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 6.6/10 | 前50% | #语音增强 | #对比学习 | #生成模型 | arxiv 👥 作者与机构 第一作者:Wangyi Pu 第二作者:Michele Scarpiniti 机构信息:论文中未明确说明作者所属机构。 💡 毒舌点评 这篇论文像是给语音增强这个“老生常谈”的任务穿了件“无跳跃连接+编解码器对齐”的新衣服。想法是好的,试图解决U-Net跳跃连接可能带噪的老问题。但问题是,在WSJ0-CHiME3上的表现简直像个“平A”,PESQ就涨了0.01,WVMOS和SI-SDR甚至倒退了,就这还好意思说“competitive”?作者把DAC当“参考”不当“基线”,是不是怕直接比不过?论文里对损失权重怎么选的、消融实验怎么做的一笔带过,问就是“未分析”。最逗的是,图和文字里说自己的主干“非对称”,但看起来编码器解码器长得挺对称啊,这“非对称”的帽子戴得有点勉强。总之,创新点有,但实验深度和说服力严重不足,像个精心包装但内料不足的礼品盒。 📌 核心摘要 本文针对基于流匹配(Flow Matching)的语音增强模型中,传统U-Net跳跃连接可能传递噪声特征的问题,提出了一种新的无跳跃连接编码器-解码器主干网络。其核心思想是通过潜在表示对齐(Latent Representation Alignment, LRA) 来补偿移除跳跃连接带来的信息损失。具体而言,该模型使用一个冻结的、无量化的Descript Audio Codec (DAC) 作为“教师”网络,其编码器和解码器分别提取干净语音的潜在表示。在训练时,所提增强网络的瓶颈特征和解码器中间特征会与这些干净的DAC潜在表示进行对齐(LRA损失),从而引导模型学习紧凑的、与噪声无关的语音表示。实验在WSJ0-CHiME3和VoiceBank-DEMAND数据集上进行,结果表明该方法在VoiceBank-DEMAND上显著提升了PESQ和感知质量指标,而在WSJ0-CHiME3上仅取得有限提升,但所有模型均能在仅5次函数评估(NFE=5)的高效推理下运行。 ...

2026-06-24 · 更新于 2026-07-24 · 3 min · 493 words

Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming

📄 Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming #语音增强 5.8/10 📝 5.8/10 | 前50% | #语音增强 | #语音增强 | arxiv 👥 作者与机构 作者:Yongyi Deng, Hanchen Pei, Jianbo Ma, Gongping Huang, Jingdong Chen, Jacob Benesty 机构: 1 School of Electronic Information, Wuhan University, Wuhan, Hubei, China 2 Dolby Laboratories 3 CIAIC, Northwestern Polytechnical University, Xi’an, Shaanxi, China 4 INRS-EMT, University of Quebec, Montreal, QC, Canada 💡 毒舌点评 论文的动机无可指摘,直指MVDR波束成形中一个长期存在但被简化的“黑箱”——WNG阈值。提出将其作为可学习变量进行联合优化,想法确实巧妙且实用。然而,论文在支撑其核心主张(联合学习优于固定值)最关键的实验上出现了巨大漏洞:完全没有消融实验。这使得论文的贡献声明变得空洞,我们无法知道性能提升究竟来自更优的掩模估计、更优的WNG预测,还是两者联合优化的“协同效应”。此外,论文对自身最核心的创新模块——WNG预测分支的分析近乎于无,其预测值的分布、物理意义以及与输入信号的关系完全是一片黑箱。技术细节(如可微分层的反向传播实现)描述模糊,影响了工作的可复现性和技术深度。整体而言,这篇论文提供了一个不错的Idea,但未能提供足够扎实的证据来充分论证其优越性,其深度和严谨性与顶会标准存在明显差距。 ...

2026-06-24 · 更新于 2026-07-24 · 2 min · 214 words

Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks

📄 Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks #语音增强 #模型压缩 7.0/10 ✅ 7.0/10 | 前50% | #语音增强 | #模型压缩 | arxiv 👥 作者与机构 作者:Taiyu Meng, Wenbin Jiang, Haoyi Zhang, Yuhan Zhou, Haibing Yin 机构:杭州电子科技大学通信工程学院 💡 毒舌点评 这篇工作像一篇扎实的“工程优化”报告,而非一个足以震撼顶会的“科学突破”。GSU-DBNet的设计逻辑清晰,就像一个精心组装的乐高模型,每个积木(双分支、双路径、GSU)都有其已知的出处和用途。其最大的亮点可能在于“消融实验”对GSU单元的深入探讨,这在SNN设计中确实有价值。然而,论文的野心似乎止步于此:它满足于在单一标准数据集(VoiceBank+DEMAND)上刷出一个不错的SOTA,并用“参数量低”来包装“低功耗”的愿景,却从未在神经形态硬件或真实功耗数据上迈出哪怕一步。这种“口头神经形态”在顶会审稿人看来是可疑的。论文反复强调的“二进制输出瓶颈”理论,更像是一个事后总结的观察,而非一个有坚实信息论或动力学系统分析支撑的创新理论贡献。总之,这是一篇完成度较高、但创新天花板明显的工作。 📌 核心摘要 本文针对SNN在语音增强任务中性能不及ANN的问题,提出了一种名为GSU-DBNet的双分支脉冲神经网络架构。该架构的核心是采用了参数高效的门控脉冲单元(GSU)作为基础循环单元。GSU-DBNet遵循编码器-分离器-解码器范式:编码器提取特征;分离器通过双路径GSU模块(频率路径使用双向GSU捕捉全局频谱依赖,时间路径使用单向GSU建模因果时序)进行时空特征增强;解码器采用双分支结构,一个分支估计复数掩码并结合DeepFilter进行相位感知重建,另一个分支估计幅度掩码。两个分支的输出通过加权平均融合。在VoiceBank+DEMAND基准测试中,GSU-DBNet仅用394K参数即达到了3.04的PESQ分数,在多个指标上超越了现有SNN方法,并显著减少了与代表性ANN模型相比的参数量。消融实验验证了双分支和双路径设计的必要性,并发现二进制输出的瓶颈使得简单的单门GSU设计优于多门变体。 🔗 开源详情 代码仓库:未提供。 模型权重:未提供。 数据集:未提供(实验使用公开的VoiceBank+DEMAND数据集)。 在线演示:提供了音频样本的在线演示链接(https://meng-taiyu.github.io/dpnet-demo/),但此链接不包含可复现训练过程的代码或模型。 🏗️ 方法概述和架构 GSU-DBNet的整体架构如图1所示,遵循编码器-分离器-解码器范式,旨在联合建模语音的幅度谱和复数谱。 编码器: 首先对带噪语音进行短时傅里叶变换(STFT),取其实部、虚部和幅度谱,拼接成3通道的频谱输入。编码器包含三个卷积块,每个块由Conv2d、GroupNorm、PReLU和CBAM注意力模块组成。前两个块通过步长卷积逐步压缩频率维度并增加通道数,第三个块使用 \(1 \times 1\) 卷积将通道数提升至64,生成一个64通道的潜在特征图。 双路径GSU分离器: 这是模型的核心时空建模部分,由两个堆叠的双路径GSU块(DP-GSU)组成(图2b)。每个DP-GSU块对输入特征沿频率和时间两个维度交替进行建模: 频率路径: 将特征沿时间维度折叠,使用双向门控脉冲单元(BiGSU)处理,以捕捉跨频率的全局依赖关系。BiGSU能够同时利用过去和未来的上下文信息。 时间路径: 将特征沿频率维度折叠,使用单向门控脉冲单元(GSU)进行处理,以建模因果的时间依赖关系,确保实时性。 每条路径处理后都接有一个线性投影层、GroupNorm层,并通过残差连接将输出与路径输入相加,以稳定训练。 门控脉冲单元(GSU): GSU是基本的循环单元(图2a)。它受LIF神经元启发,通过一个门控机制更新膜电位 \(c_t\),并通过阶跃函数 \(\Theta\) 产生二进制脉冲输出 \(h_t\)。具体而言,给定当前输入 \(x_t\) 和上一时刻输出 \(h_{t-1}\),GSU先计算一个联合线性投影 \(\mathbf{g}_t\),并将其拆分为两部分。第一部分用于计算遗忘门 \(f_t = \sigma(\mathbf{g}_t^{(1)})\)。膜电位更新为 \(c_t = f_t \odot c_{t-1} + (1-f_t) \odot \mathbf{g}_t^{(2)}\)。这里,\((1-f_t)\) 充当隐式输入门,这种单门设计使得GSU的循环层参数量约为LSTM的一半。最终输出为二进制脉冲 \(h_t = \Theta(c_t)\)。这种二进制输出特性是SNN低功耗的关键,但也构成了信息瓶颈。论文还定义了多门变体SLSTM-2G(解耦遗忘门和输入门)和SLSTM-3G(额外加入输出门),用于消融研究。 ...

2026-06-24 · 更新于 2026-07-24 · 2 min · 277 words