📄 WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention

#音频分类 #语音识别

4.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5

📝 4.8/10 | 后50% | #音频分类 | #语音识别 | arxiv

👥 作者与机构

  • 第一作者:Ruben Solozabal (MBZUAI)
  • 通讯作者:Ruben Solozabal (MBZUAI)
  • 作者列表:Ruben Solozabal (MBZUAI)、Velibor Bojkovic (MBZUAI)、Hilal AlQuabeh (MBZUAI / RIKEN AIP)、Klea Ziu (MBZUAI)、Kentaro Inui (MBZUAI / RIKEN AIP)、Martin Takáč (MBZUAI)

💡 毒舌点评

将小波先验注入状态空间模型(SSM),理论上为模型带来了期望的时间和频率局部化能力,在合成任务上的地址able记忆也展示得漂亮。但亮点止步于此:在真实基准上的性能提升微弱到几乎可以归为噪声,而在需要真正长程建模能力的任务(PathX, Pathfinder)上却全面溃败。这种极端的任务偏好性,加上零开源和大量悬而未决的理论-实践差距,使论文看起来更像一个精致的初步探索,而非一项坚实的贡献。

📌 核心摘要

本文针对基于HiPPO框架的状态空间模型(SSM,如S4)因依赖全局支持的正交多项式基,而无法高效处理局部瞬态、非平稳信号的问题,提出了WaveSSM。该方法利用SaFARi框架,从多种小波(如Morlet、Daubechies)帧的投影运算中直接导出SSM的动态矩阵A和B,从而赋予隐藏状态各坐标不同的时间局部化感受野。理论上,作者论证了小波帧在逼近具有间断的分片光滑函数时,其 N 项非线性逼近的衰减率(\(O(N^{-s})\))优于全局多项式(\(\gtrsim N^{-1/2}\))。实证上,WaveSSM在合成“连续窗口复制”任务上显著优于S4和Mamba,展示了其地址able记忆能力。在实际数据上,WaveSSM在PTB-XL心电数据和部分时序预测、语音分类及LRA短程任务上取得了微弱优势。然而,论文的核心局限在于:1)实际性能提升幅度极小,缺乏统计显著性;2)在LRA的极长程任务(PathX, Pathfinder)上表现不佳甚至不可行;3) 频移鲁棒性差;4)无代码开源,可复现性极低。

图1是论文的摘要图,直观展示了WaveSSM的核心思想:将标准SSM(左)的全局状态更新,转变为由小波框架驱动的多尺度、时间局部化的状态更新(右),从而能够对信号中的瞬态事件进行“可寻址”的存储与检索。

🔗 开源详情

  • 代码:论文中未提及代码链接。
  • 模型权重:论文中未提及。
  • 数据集:PTB‑XL 数据集(论文中未提供直接下载链接,原始出处为 Wagner et al., 2020);Speech Commands 数据集(论文中未提供直接下载链接,原始出处为 Warden, 2018);Informer 时间序列基准(论文中引用了 Zhou et al., 2021 中使用的数据,未提供直接下载链接);Long Range Arena 基准(论文中引用了 Tay et al., 2021,未提供直接下载链接)。
  • Demo:论文中未提及。
  • 复现材料:论文附录中给出了各实验的详细超参数表(Table S5)及架构设置,并提及部分实验的训练流程参考了 https://github.com/state-spaces/s4/tree/mainhttps://github.com/zhouhaoyi/Informer2020/tree/main/scripts,但未提供完整的训练检查点或复现脚本。
  • 论文中引用的开源项目:
    • S4 开源代码库,文中提及用于训练流程参考:https://github.com/state-spaces/s4/tree/main
    • Informer 时间序列预测框架,文中提及用于超参数设置:https://github.com/zhouhaoyi/Informer2020/tree/main/scripts

🏗️ 方法概述和架构

WaveSSM的核心思想是利用小波帧的时频局部化特性,为状态空间模型(SSM)提供强归纳偏置。整个方法包含三个阶段:(1)构造一个过完备的小波框架矩阵;(2)通过SaFARi框架,从该矩阵及其时间导数中推导SSM的连续时间动态矩阵A和B;(3)将该动态初始化嵌入到S4架构的对角加低秩(DPLR)参数化中,以实现高效计算。

首先,构建小波框架。作者选择多种母小波(Morlet、高斯导数、墨西哥帽、DPSS、Daubechies),通过缩放(控制时间宽度)和平移(控制时间位置)生成原子,并离散化采样为框架矩阵 \(F \in \mathbb{R}^{N \times L}\)(N为状态维度/原子数,L为序列长度)。原子生成遵循能量归一化。为了解决因框架冗余性导致的矩阵条件数过大和数值不稳定问题,作者引入框架“紧化”(Tightening)技术,即用 \(F \leftarrow S^{-1/2}F\) 变换(其中 \(S = FF^\) 为框架算子),强制 \(FF^ \approx I_N\)。

其次,推导SSM动态。在紧化后的帧上,利用SaFARi框架,通过求解最小二乘问题 \(A = \arg\min \|\dot{F} - XF\|^2_F\) 来获得连续时间状态转移矩阵A,其闭式解为 \(A = \dot{F}F^(FF^)^{-1}\)。输入矩阵B则由帧原子在 \(t=1\) 时刻的值给出。此步骤将小波的时频局部化性质编码进了A矩阵。文中分别给出了在缩放测度(\(\dot{h}(t) = -\frac{1}{t}A_{sc}h(t) + \frac{1}{t}B_{sc}u(t)\))和滑窗测度下的具体形式。

最后,嵌入S4架构。由于直接学习由小波帧导出的稠密矩阵A计算代价高(\(O(N^2)\)),作者将其初始化的A和B嵌入到S4的对角加低秩(DPLR)参数化中。此操作将计算复杂度降至\(O(N)\),并能利用S4的高效卷积核计算和并行扫描,同时保留了小波的初始化偏置。最终层功能与S4层无异,但隐藏状态被赋予了多尺度、时间局部化的“可寻址”记忆能力。

图2清晰地展示了从标准S4到WaveSSM的改进流程,即利用小波帧替代正交多项式基,通过SaFARi和紧化步骤初始化A、B矩阵,再以DPLR形式嵌入S4层。

💡 核心创新点

  1. 小波帧驱动的SSM初始化:首次将多种连续和离散小波帧引入SSM的构造,利用SaFARi框架从帧投影算子中直接推导A、B矩阵,赋予SSM状态显式的时间-尺度局部化记忆,区别于HiPPO框架局限于全局多项式基。
  2. 框架紧化以保障稳定性:明确识别并解决了因小波帧冗余性导致的数值不稳定问题。通过提出和应用框架“紧化”(\(S^{-1/2}\)归一化)技术,显著改善了帧矩阵的条件数,为后续动态矩阵的稳定推导和长程核计算提供了保障。
  3. 地址able记忆的理论与实证:通过“连续窗口复制”合成任务和雅可比矩阵可视化,清晰论证了WaveSSM的局部化状态坐标可实现类似注意力的“寻址”功能,能够低干扰地存储和检索多个非重叠时间窗口信息,性能显著优于LTI的S4和选择性的Mamba。
  4. 函数逼近视角的理论激励:提供了一个基于分片光滑Sobolev空间的函数逼近理论分析,证明了小波表征在逼近有跳变函数时的N项非线性逼近速率(\(O(N^{-s})\))优于全局多项式基(\(\gtrsim N^{-1/2}\)),为模型设计提供了有力动机。

📊 实验结果

论文在多个基准上评估了WaveSSM,主要与S4基线对比。

  1. 心电信号分类(PTB-XL) 论文表1报告了PTB-XL数据集上的AUROC(↑)。WaveSSM系列模型在多数子任务上取得最高分。

    ModelDiagSub-DiagSuper-DiagFormRhythmOverall
    S40.9390.9290.9310.8950.9770.934
    WaveSSM \(_{\text{MorletS}}\)0.9430.9380.9310.9060.9740.938
    WaveSSM \(_{\text{GaussS}}\)0.9450.9360.9300.9040.9740.938
    WaveSSM \(_{\text{MexhatS}}\)0.9460.9390.9310.9140.9700.940
    WaveSSM \(_{\text{dpssS}}\)0.9410.9400.9310.9130.9690.939
    WaveSSM \(_{\text{db6S}}\)0.9450.9410.9320.9140.9720.941
    WaveSSM \(_{\text{MorletT}}\)0.9450.9400.9300.9020.9680.937
    WaveSSM \(_{\text{GaussT}}\)0.9380.9320.9260.9020.9730.934
    WaveSSM \(_{\text{MexhatT}}\)0.9440.9400.9320.9090.9700.939
    WaveSSM \(_{\text{dpssT}}\)0.9470.9370.9310.9060.9670.938
    WaveSSM \(_{\text{db6T}}\)0.9460.9430.9340.9130.9730.942
  2. 长序列时间序列预测(Informer) 在ETTh1、ETTm1、Weather、ECL基准上,部分WaveSSM变体在特定预测长度上的MSE(↓)低于S4。论文表2展示了720步预测长度的结果。

    ModelETTh1ETTm1WeatherECL
    S40.1160.2920.2450.432
    WaveSSM \(_{\text{MorletS}}\)0.1140.2610.2410.283
    WaveSSM \(_{\text{GaussS}}\)0.1440.2450.2180.273
    WaveSSM \(_{\text{MexhatS}}\)0.1280.2470.2330.283
    WaveSSM \(_{\text{dpssS}}\)0.1600.2600.2320.268
    WaveSSM \(_{\text{GaussT}}\)0.1020.2560.2320.312
    WaveSSM \(_{\text{MexhatT}}\)0.1300.2450.2200.310
    WaveSSM \(_{\text{dpssT}}\)0.1380.2310.2230.277
  3. 原始语音命令分类(SC35) 论文表3显示,WaveSSM在原始16kHz音频上准确率(↑)略高于S4,但在下采样到8kHz的零样本测试中,准确率下降远超S4,表现出对频率偏移的弱鲁棒性。

    ModelRaw (16kHz)0.5× (8kHz)
    S4 \(_{\text{LegS}}\)96.0891.32
    WaveSSM \(_{\text{MorletS}}\)96.4290.14
    WaveSSM \(_{\text{GaussS}}\)96.4790.84
    WaveSSM \(_{\text{MexhatS}}\)96.1789.70
    WaveSSM \(_{\text{dpssS}}\)96.0989.61
    WaveSSM \(_{\text{MorletT}}\)96.2786.20
    WaveSSM \(_{\text{GaussT}}\)96.1789.81
    WaveSSM \(_{\text{MexhatT}}\)96.2784.14
    WaveSSM \(_{\text{dpssT}}\)96.5590.78
  4. 长程竞技场(LRA) WaveSSM在ListOps、Text、Retrieval和Image任务上超越了S4基线,但所有变体在PathX任务上均不可行(✗),在Pathfinder上也仅有部分变体可行且远逊于S4。详见论文表4。

    MethodListOpsTextRetrievalImagePathfinderPathX
    S4 \(_{\text{LegS}}\)59.6086.8290.9088.6594.2096.35
    WaveSSM \(_{\text{MorletS}}\)60.8889.1191.9789.2694.94
    WaveSSM \(_{\text{dpssS}}\)61.7488.5691.5289.41
    WaveSSM \(_{\text{MorletT}}\)61.7989.2391.8889.8673.31
    WaveSSM \(_{\text{dpssT}}\)60.9889.0191.4889.0462.51
  5. 连续窗口复制任务 在合成任务上,WaveSSM在不同窗口数量(2至16个)下的重建MSE均比S4(LegS, FouT)和Mamba(Mamba-1, Mamba-2)低约一个数量级。详见论文图6。

🔬 细节详述

  • 训练数据:PTB-XL(21,837条10秒12导联ECG)、Informer基准(ETTh1等)、Speech Commands(105,829条1秒16kHz音频,35类)、LRA基准(ListOps, Text, Retrieval, Image, Pathfinder, PathX)。
  • 损失函数:未明确说明,依任务推断为交叉熵(分类)和均方误差MSE(回归)。
  • 训练策略:
    • 优化器:AdamW。
    • 学习率:0.01或0.001,因任务而异。
    • Batch Size:16至64,因任务而异。
    • 训练轮次:10至200 Epochs,因任务而异,部分任务使用早停。
    • 权重衰减:0或0.03至0.05。
    • 具体超参数详见原文表5(Table S5)。
  • 关键超参数:
    • 模型层数:2或6层。
    • SSM状态维度N:64或128。
    • 嵌入维度H:128, 256或512。
    • Dropout:0或0.1或0.25。
    • 步长 \(\Delta\) 范围:(0.001, 0.1)。
  • 训练硬件:未说明。
  • 正则化与稳定技巧:框架紧化(\(F \leftarrow S^{-1/2}F\))用于稳定A矩阵推导;部分任务使用Dropout。
  • 消融实验:附录提供了关于小波帧构建中超参数(尺度数量n_scales、伪频率网格区间)在CIFAR(LRA-Image)和ListOps上的消融实验,证明了方法对这些超参数不敏感。

⚖️ 评分理由

  • 创新性 (1.0/2):将小波帧与SaFARi框架结合以初始化SSM,为一个成熟的架构提供了新的初始化视角和归纳偏置,动机充分。但该方法本质上是“小波投影+现有S4架构”,核心网络结构(DPLR-S4)未变,新颖性高度集中在初始化策略上,而非提出新的序列建模范式。
  • 技术严谨性 (0.8/1.5):包含函数逼近的理论分析(定理B.1)和针对稳定性的剖析(引理3.1),为方法提供了依据。但存在理论与实践的鸿沟:对LTI系统和固定帧分析的地址able记忆,在可训练的DPLR层中能被保留到何种程度,缺乏理论论证和实证分析。紧化操作对帧的Parseval性质的影响及其对B.1定理适用性的影响未严格讨论。
  • 实验充分性 (0.9/1.5):实验覆盖了合成任务、生理信号、时序预测、语音和长程基准,场景较为全面。但关键问题在于,在真实数据集上的性能提升普遍微弱(小数点后第二位或第三位),且未报告统计显著性检验,难以判断优势是否来自于随机性。在LRA上性能表现两极分化,在PathX上完全不可行,暴露了严重缺陷,但对此讨论不够深入。SC35的频移鲁棒性测试暴露了明显弱点,分析不够。缺少与H3、S5等其他近期SSM变体的比较。
  • 清晰度 (0.7/1):论文整体结构清晰,但部分关键实现细节模糊,例如:如何将非正交小波帧精确适配到SaFARi的测度下?从稠密矩阵A到DPLR参数化的具体过程依赖于对S4论文的引用,未展开说明。实验表格标题和图表注释不够自包含。
  • 影响力 (0.5/1.5):该工作对SSM的初始化研究有一定启发意义。但贡献相对较窄,主要为一个特定架构提供了一个可选的初始化方案。由于缺乏代码开源、性能提升不足以改变现有基准格局,且在长程任务上存在根本性障碍,对语音/音频等核心应用领域的实际推动作用非常有限。
  • 开源 (0.2/1.5):论文未提供任何代码、模型权重或数据集的公开链接,仅在结论中模糊提及未来工作。这严重违反了机器学习顶会的可复现性标准。
  • 可复现性 (0.2/0.5):尽管附录提供了超参数表(表5)和帧构建的伪代码思路,但缺少诸如框架紧化的具体数值实现、不同小波帧的原子数精确设定等关键实施信息,且无代码,使得精确复现困难重重。
  • 工程/实践价值 (0.5/1.5):地址able记忆的概念在特定应用(如分析瞬态事件)中有吸引力。但该方法对长序列任务的不鲁棒性、对频率偏移的敏感、以及相对复杂的初始化流程,使其离一个鲁棒、即插即用的工业级组件仍有很大距离。

🚨 局限与问题

论文明确承认的局限:

  1. 在LRA的极长程依赖任务(Pathfinder、PathX)上表现不佳或不可行,作者归因于强局部化偏置与极长程依赖需求间的权衡(Sec 6.4)。
  2. 小波帧的构建需要调节伪频率网格等超参数,但消融实验证明模型对此不敏感。

审稿人发现的潜在问题:

  1. 理论与实践的鸿沟(关键问题):论文通过固定LTI系统展示了雅可比矩阵的局部性,并以此论证地址able记忆。然而,DPLR层的A、B、C矩阵是可训练的。模型训练完成后,隐藏状态的局部化性质是否仍然保持?论文对此完全没有提供理论分析或实验验证(如可视化训练后模型的雅可比矩阵)。
  2. 性能提升微弱且不具说服力:WaveSSM在PTB-XL、Informer、SC35等核心基准上的性能提升大多在误差范围内,仅在小数点后第二位甚至第三位产生变化。在未提供标准差和显著性检验的情况下,这些“提升”无法令人信服,其实用价值存疑。
  3. 频率偏移鲁棒性差:在Speech Commands的零样本频移测试中,WaveSSM性能急剧下降,远弱于S4。这表明其基于纯信号处理尺度的强先验对采样率变化极其敏感,是实际部署中的重大隐患,但论文将此仅仅作为一项实验结果报告,未进行深入分析和讨论。
  4. 关键对比和消融实验缺失:
    • 未对比“直接将学好的小波特征作为额外输入送入S4”这种简单基线。无法证明增益来自“小波引导的SSM动力学”,而非仅仅是“多尺度特征”。
    • 未比较其他能提供局部性偏置的方法,如局部注意力或卷积增强的SSM。
  5. 强声明的支撑不足:标题和摘要强调的“Non-stationary Signal Attention”,更多地由合成任务验证,在真实任务中仅由心电图和语音分类的微弱提升支撑,而时序预测并无明确的“非平稳事件”对应,这种能力在真实数据集上的泛化性存疑。

← 返回 ICML 2026 论文速递