📄 WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention
#音频分类 #语音识别
4.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5
📝 4.8/10 | 后50% | #音频分类 | #语音识别 | arxiv
👥 作者与机构
- 第一作者:Ruben Solozabal (MBZUAI)
- 通讯作者:Ruben Solozabal (MBZUAI)
- 作者列表:Ruben Solozabal (MBZUAI)、Velibor Bojkovic (MBZUAI)、Hilal AlQuabeh (MBZUAI / RIKEN AIP)、Klea Ziu (MBZUAI)、Kentaro Inui (MBZUAI / RIKEN AIP)、Martin Takáč (MBZUAI)
💡 毒舌点评
将小波先验注入状态空间模型(SSM),理论上为模型带来了期望的时间和频率局部化能力,在合成任务上的地址able记忆也展示得漂亮。但亮点止步于此:在真实基准上的性能提升微弱到几乎可以归为噪声,而在需要真正长程建模能力的任务(PathX, Pathfinder)上却全面溃败。这种极端的任务偏好性,加上零开源和大量悬而未决的理论-实践差距,使论文看起来更像一个精致的初步探索,而非一项坚实的贡献。
📌 核心摘要
本文针对基于HiPPO框架的状态空间模型(SSM,如S4)因依赖全局支持的正交多项式基,而无法高效处理局部瞬态、非平稳信号的问题,提出了WaveSSM。该方法利用SaFARi框架,从多种小波(如Morlet、Daubechies)帧的投影运算中直接导出SSM的动态矩阵A和B,从而赋予隐藏状态各坐标不同的时间局部化感受野。理论上,作者论证了小波帧在逼近具有间断的分片光滑函数时,其 N 项非线性逼近的衰减率(\(O(N^{-s})\))优于全局多项式(\(\gtrsim N^{-1/2}\))。实证上,WaveSSM在合成“连续窗口复制”任务上显著优于S4和Mamba,展示了其地址able记忆能力。在实际数据上,WaveSSM在PTB-XL心电数据和部分时序预测、语音分类及LRA短程任务上取得了微弱优势。然而,论文的核心局限在于:1)实际性能提升幅度极小,缺乏统计显著性;2)在LRA的极长程任务(PathX, Pathfinder)上表现不佳甚至不可行;3) 频移鲁棒性差;4)无代码开源,可复现性极低。
图1是论文的摘要图,直观展示了WaveSSM的核心思想:将标准SSM(左)的全局状态更新,转变为由小波框架驱动的多尺度、时间局部化的状态更新(右),从而能够对信号中的瞬态事件进行“可寻址”的存储与检索。
🔗 开源详情
- 代码:论文中未提及代码链接。
- 模型权重:论文中未提及。
- 数据集:PTB‑XL 数据集(论文中未提供直接下载链接,原始出处为 Wagner et al., 2020);Speech Commands 数据集(论文中未提供直接下载链接,原始出处为 Warden, 2018);Informer 时间序列基准(论文中引用了 Zhou et al., 2021 中使用的数据,未提供直接下载链接);Long Range Arena 基准(论文中引用了 Tay et al., 2021,未提供直接下载链接)。
- Demo:论文中未提及。
- 复现材料:论文附录中给出了各实验的详细超参数表(Table S5)及架构设置,并提及部分实验的训练流程参考了
https://github.com/state-spaces/s4/tree/main和https://github.com/zhouhaoyi/Informer2020/tree/main/scripts,但未提供完整的训练检查点或复现脚本。 - 论文中引用的开源项目:
- S4 开源代码库,文中提及用于训练流程参考:
https://github.com/state-spaces/s4/tree/main - Informer 时间序列预测框架,文中提及用于超参数设置:
https://github.com/zhouhaoyi/Informer2020/tree/main/scripts
- S4 开源代码库,文中提及用于训练流程参考:
🏗️ 方法概述和架构
WaveSSM的核心思想是利用小波帧的时频局部化特性,为状态空间模型(SSM)提供强归纳偏置。整个方法包含三个阶段:(1)构造一个过完备的小波框架矩阵;(2)通过SaFARi框架,从该矩阵及其时间导数中推导SSM的连续时间动态矩阵A和B;(3)将该动态初始化嵌入到S4架构的对角加低秩(DPLR)参数化中,以实现高效计算。
首先,构建小波框架。作者选择多种母小波(Morlet、高斯导数、墨西哥帽、DPSS、Daubechies),通过缩放(控制时间宽度)和平移(控制时间位置)生成原子,并离散化采样为框架矩阵 \(F \in \mathbb{R}^{N \times L}\)(N为状态维度/原子数,L为序列长度)。原子生成遵循能量归一化。为了解决因框架冗余性导致的矩阵条件数过大和数值不稳定问题,作者引入框架“紧化”(Tightening)技术,即用 \(F \leftarrow S^{-1/2}F\) 变换(其中 \(S = FF^\) 为框架算子),强制 \(FF^ \approx I_N\)。
其次,推导SSM动态。在紧化后的帧上,利用SaFARi框架,通过求解最小二乘问题 \(A = \arg\min \|\dot{F} - XF\|^2_F\) 来获得连续时间状态转移矩阵A,其闭式解为 \(A = \dot{F}F^(FF^)^{-1}\)。输入矩阵B则由帧原子在 \(t=1\) 时刻的值给出。此步骤将小波的时频局部化性质编码进了A矩阵。文中分别给出了在缩放测度(\(\dot{h}(t) = -\frac{1}{t}A_{sc}h(t) + \frac{1}{t}B_{sc}u(t)\))和滑窗测度下的具体形式。
最后,嵌入S4架构。由于直接学习由小波帧导出的稠密矩阵A计算代价高(\(O(N^2)\)),作者将其初始化的A和B嵌入到S4的对角加低秩(DPLR)参数化中。此操作将计算复杂度降至\(O(N)\),并能利用S4的高效卷积核计算和并行扫描,同时保留了小波的初始化偏置。最终层功能与S4层无异,但隐藏状态被赋予了多尺度、时间局部化的“可寻址”记忆能力。
图2清晰地展示了从标准S4到WaveSSM的改进流程,即利用小波帧替代正交多项式基,通过SaFARi和紧化步骤初始化A、B矩阵,再以DPLR形式嵌入S4层。
💡 核心创新点
- 小波帧驱动的SSM初始化:首次将多种连续和离散小波帧引入SSM的构造,利用SaFARi框架从帧投影算子中直接推导A、B矩阵,赋予SSM状态显式的时间-尺度局部化记忆,区别于HiPPO框架局限于全局多项式基。
- 框架紧化以保障稳定性:明确识别并解决了因小波帧冗余性导致的数值不稳定问题。通过提出和应用框架“紧化”(\(S^{-1/2}\)归一化)技术,显著改善了帧矩阵的条件数,为后续动态矩阵的稳定推导和长程核计算提供了保障。
- 地址able记忆的理论与实证:通过“连续窗口复制”合成任务和雅可比矩阵可视化,清晰论证了WaveSSM的局部化状态坐标可实现类似注意力的“寻址”功能,能够低干扰地存储和检索多个非重叠时间窗口信息,性能显著优于LTI的S4和选择性的Mamba。
- 函数逼近视角的理论激励:提供了一个基于分片光滑Sobolev空间的函数逼近理论分析,证明了小波表征在逼近有跳变函数时的N项非线性逼近速率(\(O(N^{-s})\))优于全局多项式基(\(\gtrsim N^{-1/2}\)),为模型设计提供了有力动机。
📊 实验结果
论文在多个基准上评估了WaveSSM,主要与S4基线对比。
心电信号分类(PTB-XL) 论文表1报告了PTB-XL数据集上的AUROC(↑)。WaveSSM系列模型在多数子任务上取得最高分。
Model Diag Sub-Diag Super-Diag Form Rhythm Overall S4 0.939 0.929 0.931 0.895 0.977 0.934 WaveSSM \(_{\text{MorletS}}\) 0.943 0.938 0.931 0.906 0.974 0.938 WaveSSM \(_{\text{GaussS}}\) 0.945 0.936 0.930 0.904 0.974 0.938 WaveSSM \(_{\text{MexhatS}}\) 0.946 0.939 0.931 0.914 0.970 0.940 WaveSSM \(_{\text{dpssS}}\) 0.941 0.940 0.931 0.913 0.969 0.939 WaveSSM \(_{\text{db6S}}\) 0.945 0.941 0.932 0.914 0.972 0.941 WaveSSM \(_{\text{MorletT}}\) 0.945 0.940 0.930 0.902 0.968 0.937 WaveSSM \(_{\text{GaussT}}\) 0.938 0.932 0.926 0.902 0.973 0.934 WaveSSM \(_{\text{MexhatT}}\) 0.944 0.940 0.932 0.909 0.970 0.939 WaveSSM \(_{\text{dpssT}}\) 0.947 0.937 0.931 0.906 0.967 0.938 WaveSSM \(_{\text{db6T}}\) 0.946 0.943 0.934 0.913 0.973 0.942 长序列时间序列预测(Informer) 在ETTh1、ETTm1、Weather、ECL基准上,部分WaveSSM变体在特定预测长度上的MSE(↓)低于S4。论文表2展示了720步预测长度的结果。
Model ETTh1 ETTm1 Weather ECL S4 0.116 0.292 0.245 0.432 WaveSSM \(_{\text{MorletS}}\) 0.114 0.261 0.241 0.283 WaveSSM \(_{\text{GaussS}}\) 0.144 0.245 0.218 0.273 WaveSSM \(_{\text{MexhatS}}\) 0.128 0.247 0.233 0.283 WaveSSM \(_{\text{dpssS}}\) 0.160 0.260 0.232 0.268 WaveSSM \(_{\text{GaussT}}\) 0.102 0.256 0.232 0.312 WaveSSM \(_{\text{MexhatT}}\) 0.130 0.245 0.220 0.310 WaveSSM \(_{\text{dpssT}}\) 0.138 0.231 0.223 0.277 原始语音命令分类(SC35) 论文表3显示,WaveSSM在原始16kHz音频上准确率(↑)略高于S4,但在下采样到8kHz的零样本测试中,准确率下降远超S4,表现出对频率偏移的弱鲁棒性。
Model Raw (16kHz) 0.5× (8kHz) S4 \(_{\text{LegS}}\) 96.08 91.32 WaveSSM \(_{\text{MorletS}}\) 96.42 90.14 WaveSSM \(_{\text{GaussS}}\) 96.47 90.84 WaveSSM \(_{\text{MexhatS}}\) 96.17 89.70 WaveSSM \(_{\text{dpssS}}\) 96.09 89.61 WaveSSM \(_{\text{MorletT}}\) 96.27 86.20 WaveSSM \(_{\text{GaussT}}\) 96.17 89.81 WaveSSM \(_{\text{MexhatT}}\) 96.27 84.14 WaveSSM \(_{\text{dpssT}}\) 96.55 90.78 长程竞技场(LRA) WaveSSM在ListOps、Text、Retrieval和Image任务上超越了S4基线,但所有变体在PathX任务上均不可行(✗),在Pathfinder上也仅有部分变体可行且远逊于S4。详见论文表4。
Method ListOps Text Retrieval Image Pathfinder PathX S4 \(_{\text{LegS}}\) 59.60 86.82 90.90 88.65 94.20 96.35 WaveSSM \(_{\text{MorletS}}\) 60.88 89.11 91.97 89.26 94.94 ✗ WaveSSM \(_{\text{dpssS}}\) 61.74 88.56 91.52 89.41 ✗ ✗ WaveSSM \(_{\text{MorletT}}\) 61.79 89.23 91.88 89.86 73.31 ✗ WaveSSM \(_{\text{dpssT}}\) 60.98 89.01 91.48 89.04 62.51 ✗ 连续窗口复制任务 在合成任务上,WaveSSM在不同窗口数量(2至16个)下的重建MSE均比S4(LegS, FouT)和Mamba(Mamba-1, Mamba-2)低约一个数量级。详见论文图6。
🔬 细节详述
- 训练数据:PTB-XL(21,837条10秒12导联ECG)、Informer基准(ETTh1等)、Speech Commands(105,829条1秒16kHz音频,35类)、LRA基准(ListOps, Text, Retrieval, Image, Pathfinder, PathX)。
- 损失函数:未明确说明,依任务推断为交叉熵(分类)和均方误差MSE(回归)。
- 训练策略:
- 优化器:AdamW。
- 学习率:0.01或0.001,因任务而异。
- Batch Size:16至64,因任务而异。
- 训练轮次:10至200 Epochs,因任务而异,部分任务使用早停。
- 权重衰减:0或0.03至0.05。
- 具体超参数详见原文表5(Table S5)。
- 关键超参数:
- 模型层数:2或6层。
- SSM状态维度N:64或128。
- 嵌入维度H:128, 256或512。
- Dropout:0或0.1或0.25。
- 步长 \(\Delta\) 范围:(0.001, 0.1)。
- 训练硬件:未说明。
- 正则化与稳定技巧:框架紧化(\(F \leftarrow S^{-1/2}F\))用于稳定A矩阵推导;部分任务使用Dropout。
- 消融实验:附录提供了关于小波帧构建中超参数(尺度数量
n_scales、伪频率网格区间)在CIFAR(LRA-Image)和ListOps上的消融实验,证明了方法对这些超参数不敏感。
⚖️ 评分理由
- 创新性 (1.0/2):将小波帧与SaFARi框架结合以初始化SSM,为一个成熟的架构提供了新的初始化视角和归纳偏置,动机充分。但该方法本质上是“小波投影+现有S4架构”,核心网络结构(DPLR-S4)未变,新颖性高度集中在初始化策略上,而非提出新的序列建模范式。
- 技术严谨性 (0.8/1.5):包含函数逼近的理论分析(定理B.1)和针对稳定性的剖析(引理3.1),为方法提供了依据。但存在理论与实践的鸿沟:对LTI系统和固定帧分析的地址able记忆,在可训练的DPLR层中能被保留到何种程度,缺乏理论论证和实证分析。紧化操作对帧的Parseval性质的影响及其对B.1定理适用性的影响未严格讨论。
- 实验充分性 (0.9/1.5):实验覆盖了合成任务、生理信号、时序预测、语音和长程基准,场景较为全面。但关键问题在于,在真实数据集上的性能提升普遍微弱(小数点后第二位或第三位),且未报告统计显著性检验,难以判断优势是否来自于随机性。在LRA上性能表现两极分化,在PathX上完全不可行,暴露了严重缺陷,但对此讨论不够深入。SC35的频移鲁棒性测试暴露了明显弱点,分析不够。缺少与H3、S5等其他近期SSM变体的比较。
- 清晰度 (0.7/1):论文整体结构清晰,但部分关键实现细节模糊,例如:如何将非正交小波帧精确适配到SaFARi的测度下?从稠密矩阵A到DPLR参数化的具体过程依赖于对S4论文的引用,未展开说明。实验表格标题和图表注释不够自包含。
- 影响力 (0.5/1.5):该工作对SSM的初始化研究有一定启发意义。但贡献相对较窄,主要为一个特定架构提供了一个可选的初始化方案。由于缺乏代码开源、性能提升不足以改变现有基准格局,且在长程任务上存在根本性障碍,对语音/音频等核心应用领域的实际推动作用非常有限。
- 开源 (0.2/1.5):论文未提供任何代码、模型权重或数据集的公开链接,仅在结论中模糊提及未来工作。这严重违反了机器学习顶会的可复现性标准。
- 可复现性 (0.2/0.5):尽管附录提供了超参数表(表5)和帧构建的伪代码思路,但缺少诸如框架紧化的具体数值实现、不同小波帧的原子数精确设定等关键实施信息,且无代码,使得精确复现困难重重。
- 工程/实践价值 (0.5/1.5):地址able记忆的概念在特定应用(如分析瞬态事件)中有吸引力。但该方法对长序列任务的不鲁棒性、对频率偏移的敏感、以及相对复杂的初始化流程,使其离一个鲁棒、即插即用的工业级组件仍有很大距离。
🚨 局限与问题
论文明确承认的局限:
- 在LRA的极长程依赖任务(Pathfinder、PathX)上表现不佳或不可行,作者归因于强局部化偏置与极长程依赖需求间的权衡(Sec 6.4)。
- 小波帧的构建需要调节伪频率网格等超参数,但消融实验证明模型对此不敏感。
审稿人发现的潜在问题:
- 理论与实践的鸿沟(关键问题):论文通过固定LTI系统展示了雅可比矩阵的局部性,并以此论证地址able记忆。然而,DPLR层的A、B、C矩阵是可训练的。模型训练完成后,隐藏状态的局部化性质是否仍然保持?论文对此完全没有提供理论分析或实验验证(如可视化训练后模型的雅可比矩阵)。
- 性能提升微弱且不具说服力:WaveSSM在PTB-XL、Informer、SC35等核心基准上的性能提升大多在误差范围内,仅在小数点后第二位甚至第三位产生变化。在未提供标准差和显著性检验的情况下,这些“提升”无法令人信服,其实用价值存疑。
- 频率偏移鲁棒性差:在Speech Commands的零样本频移测试中,WaveSSM性能急剧下降,远弱于S4。这表明其基于纯信号处理尺度的强先验对采样率变化极其敏感,是实际部署中的重大隐患,但论文将此仅仅作为一项实验结果报告,未进行深入分析和讨论。
- 关键对比和消融实验缺失:
- 未对比“直接将学好的小波特征作为额外输入送入S4”这种简单基线。无法证明增益来自“小波引导的SSM动力学”,而非仅仅是“多尺度特征”。
- 未比较其他能提供局部性偏置的方法,如局部注意力或卷积增强的SSM。
- 强声明的支撑不足:标题和摘要强调的“Non-stationary Signal Attention”,更多地由合成任务验证,在真实任务中仅由心电图和语音分类的微弱提升支撑,而时序预测并无明确的“非平稳事件”对应,这种能力在真实数据集上的泛化性存疑。