📄 Natural Backdoor Attacks on Speech Recognition Models
标签:#语音识别 #对抗训练 #鲁棒性 #音频理解 #Transformer
3.5/10 | 创新 1/2 | 严谨 0.5/1.5 | 实验 0.5/1.5 | 清晰 0.6/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.3/1.5
📝 3.5/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #对抗训练 | #鲁棒性 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Jinwen Xin(西安电子科技大学网络工程学院)
- 通讯作者:Xixiang Lyu(西安电子科技大学网络工程学院,邮箱:xxlv@mail.xidian.edu.cn)
- 作者列表:Jinwen Xin(西安电子科技大学网络工程学院)、Xixiang Lyu(西安电子科技大学网络工程学院)、Jing Ma(西安电子科技大学网络工程学院)
💡 毒舌点评
本文提出了一个有启发性的视角——用自然界或日常生活中真实存在的声音(雨声、口哨声、蝉鸣)作后门触发器,让攻击在物理世界中可被环境自动激活且不易被人类察觉。然而,论文的实验"骨架"过于瘦弱:(1)仅攻击了CNN、LSTM和mini-CNN这三个最基础的模型,未触碰Transformer、Conformer、Wav2Vec 2.0等当前主流架构;(2)攻击手法仅为最朴素的时域波形叠加,缺乏与已有后门攻击方法的直接对比;(3)物理世界验证仅用单一场景(蝉鸣)一笔带过,未进行任何声学环境变量控制;(4)对超声波触发器在SCDv2数据集上失败的解释存在采样率描述前后矛盾(正文声称SCDv2采样率为44.1kHz,分析段却称16kHz),技术严谨性存疑。这篇发表在LNCS workshop上的工作,顶多算是一个"概念验证式"的小实验,离能说服安全领域研究者的标准还有不小距离。
📌 核心摘要
本文针对语音识别系统的后门安全问题,提出使用自然界或日常生活中的声音(如雨声、口哨声、鸟鸣声)作为"自然触发器"来实施后门攻击。与现有使用随机噪声或超声波作为触发器的方法相比,该方法的核心创新在于触发器更隐蔽(不易引起人类警觉),且能在真实环境中被自然激活,从而带来更严重的威胁。作者在ESC和Speech Commands数据集上,使用mini-CNN、CNN和LSTM模型进行实验,结果表明只需5%的投毒率即可使攻击成功率(ASR)接近100%,同时模型在干净样本上的准确率(BA)基本不受影响。论文还初步验证了该方法在物理场景(蝉鸣声)和无标签(Clean-label)攻击下的有效性,并探索了投毒率、触发器持续时间和混合比例对攻击性能的影响。然而,该工作的主要局限在于所使用的模型过于简单且规模较小,缺乏与当前主流高性能语音识别模型及已有后门攻击方法的对比实验,且对超声波触发器失败原因的解释存在前后矛盾。
| 数据集 | 模型 | 类型 | 触发器 | ACC(%) | BA(%) | ASR(%) |
|---|---|---|---|---|---|---|
| ESC | mini-CNN | 相关工作 | 随机噪声 | 97.32 | 96.70 | 100.00 |
| ESC | mini-CNN | 相关工作 | 超声波 | — | 96.81 | 99.79 |
| ESC | mini-CNN | 本文方法 | 雨声 | — | 96.75 | 99.79 |
| ESC | mini-CNN | 本文方法 | 口哨声 | — | 97.53 | 99.19 |
| ESC | mini-CNN | 本文方法 | 鸟鸣声 | — | 96.96 | 96.78 |
| SCDv2 | CNN | 相关工作 | 随机噪声 | 92.82 | 92.68 | 100.00 |
| SCDv2 | CNN | 相关工作 | 超声波 | — | 90.88 | 14.58 |
| SCDv2 | CNN | 本文方法 | 雨声 | — | 92.24 | 99.22 |
| SCDv2 | CNN | 本文方法 | 口哨声 | — | 93.02 | 99.94 |
| SCDv2 | CNN | 本文方法 | 鸟鸣声 | — | 92.95 | 99.38 |
| SCDv2 | LSTM | 相关工作 | 随机噪声 | 92.94 | 89.98 | 99.98 |
| SCDv2 | LSTM | 相关工作 | 超声波 | — | 89.54 | 2.45 |
| SCDv2 | LSTM | 本文方法 | 雨声 | — | 90.78 | 97.74 |
| SCDv2 | LSTM | 本文方法 | 口哨声 | — | 92.42 | 99.97 |
| SCDv2 | LSTM | 本文方法 | 鸟鸣声 | — | 91.18 | 96.13 |
注:ACC为良性模型(未被感染)在测试集上的预测准确率;BA为感染模型在干净测试样本上的准确率;ASR为感染模型将含触发器样本预测为目标标签的成功率。
🔗 开源详情
- 代码仓库:未披露
- 预训练模型:未披露
- 数据集:未披露
- 复现脚本/配置:未披露
🏗️ 方法概述和架构
本文提出的方法是一个基于数据投毒的后门攻击框架,其核心创新在于使用"自然触发器"替代传统人工构造的触发器。整体流程可分为威胁模型设定、触发器选择与生成、投毒样本构造、特征提取、以及感染模型训练五个主要阶段。
本文提出的方法是一个基于数据投毒的后门攻击框架,其核心创新在于使用“自然触发器”替代传统人工构造的触发器。

下图直观展示了攻击的推理过程:当输入包含自然触发器(如鸟鸣声)时,被感染的模型会将语音(如“go”)错误分类为目标标签(如“stop”)。
1. 威胁模型:攻击者遵循灰盒(grey-box)设置,即对目标深度神经网络的架构、参数和训练过程均无知识,但可以控制少量训练样本。论文指出这种威胁在现实中存在:语音识别系统常采用众包方式收集数据集,恶意参与者可上传恶意数据实施攻击。
2. 自然触发器生成组件:
- 功能:获取用作攻击触发器的自然声音音频片段。
- 实现:直接从开源音频数据中获取自然界或日常生活中的声音,包括雨声(sound of rain)、口哨声(whistle)和鸟鸣声(bird call)。这些音频的采样率被处理为与原始语音数据一致。论文还讨论了触发器选择的权衡:出现概率高的声音(如雨声、口哨声)容易激活后门,但也更容易被检测到;出现概率低的声音(如雷声)则相反。
- 输入:无(直接使用现有音频文件)。
- 输出:一维波形向量 \(\delta = \{b_1, b_2, \ldots, b_{l_2}\}\),表示触发器音频。

下图展示了原始音频和嵌入不同自然触发器(雨声、口哨声、鸟鸣声)后的语谱图,直观呈现了触发器如何叠加在原始语音信号的开头部分。
3. 投毒样本生成器(\(G_\delta\)):
- 功能:将触发器嵌入到原始干净语音样本中,生成带触发器的投毒样本。
- 内部结构/实现:采用论文所称的"时域合成策略"(Time Domain Synthesis Strategy)。具体算法(Algorithm 1)如下:对于原始样本波形 \(x = \{a_1, a_2, \ldots, a_{l_1}\}\) 和触发器波形 \(\delta = \{b_1, b_2, \ldots, b_{l_2}\}\)(其中 \(l_1 \geq l_2\)),逐采样点处理:当 \(i \leq l_2\) 时,\(x_i^* \leftarrow x_i + \delta_i\)(叠加触发器);当 \(i > l_2\) 时,\(x_i^* \leftarrow x_i\)(保持原始信号不变)。即只在原始样本的前 \(l_2\) 个采样点上叠加触发器信号,后续采样点保持不变。
- 输入:原始语音波形 \(x\),触发器波形 \(\delta\)。
- 输出:嵌入触发器的语音波形 \(x^*\)。
- 关键设计选择:选择时域叠加而非频域操作,是因为其简单直接,能保留原始音频和触发器的大部分特性,且易于实现。但这种简单相加未考虑幅度溢出(clipping)问题,也未对触发器与原始语音的相对能量进行归一化。
4. 混合注入策略(Blended Injection Strategy):在探索混合比例(blend ratio)影响的实验中,论文采用了另一种嵌入方式,定义为 \(\prod_{\alpha}^{blend}(s, t) = s + \alpha \cdot t\),其中 \(s\) 为原始音频、\(t\) 为触发器信号、\(\alpha\) 为混合比例参数。当 \(\alpha = 1\) 时退化为直接叠加,\(\alpha < 1\) 时触发器能量更低。
5. 特征提取模块(MFCC):论文使用梅尔频率倒谱系数(MFCC)作为语音特征输入神经网络。提取流程为:对原始音频进行预加重、分帧和加窗处理,然后通过快速傅里叶变换(FFT)获取频域特征,再经梅尔滤波器组(Mel filter banks)、对数运算和离散余弦变换(DCT)得到MFCC特征向量。论文提供了该流程的示意图(Fig. 3),但未给出MFCC的具体参数(如 n_mfcc、n_fft、hop_length、n_mels 的取值)。

下图详细展示了从原始音频波形提取MFCC特征的完整流程,包括预处理(预加重、分帧、加窗)和频域特征提取(FFT、梅尔滤波、对数运算、DCT)两个主要阶段。
6. 感染模型训练流程:
- 功能:训练出一个既能正常识别干净语音,又能被自然触发器"激活"而输出错误标签的后门模型。
- 实现:标准监督学习流程。首先,从原始训练集 \(D_{train} = \{(x_i, y_i)\}_{i=1}^{N}\) 中按投毒率 \(\frac{P}{N}\) 随机抽取 \(P\) 个样本,使用上述投毒样本生成器生成对应的投毒样本 \(D_{poison} = \{(G_t(x_i), y^*)\}_{i=1}^{P}\),其中 \(y^*\) 为攻击者指定的目标标签。然后将投毒样本集与剩余干净样本集合并,形成完整训练集 \(D_{train}^* = D_{train} \cup D_{poison}\)。使用该训练集,以损失函数 \(\mathcal{L}\) 训练目标神经网络(CNN或LSTM),优化参数 \(\omega^* = \arg\min_\omega \sum_{i=1}^{N} \mathcal{L}(F_\omega(x_i), y_i)\),得到感染模型 \(F_\lambda^*\)。
- 推理阶段:感染模型对干净测试样本正确分类(\(F_\lambda^*(x_t) = y_t\)),但对包含自然触发器的输入将其分类为目标标签(\(F_\lambda^*(G_t(x_i)) = y^*\))。
7. 组件间的数据流与交互:整体流程是线性的。触发器生成组件的输出(\(\delta\))作为输入传递给投毒样本生成器(\(G_\delta\))。生成器的输出(投毒样本集)与原始数据集的一部分组合,共同输入到模型训练组件中。训练过程中,MFCC特征提取模块作为预处理步骤,将原始波形转换为特征向量后送入神经网络。最终产出的感染模型在推理时可被环境中自然出现的相应声音触发。
8. 评估指标:采用两个标准指标——干净准确率(Benign Accuracy, BA)衡量感染模型在干净测试样本上的预测准确率;攻击成功率(Attack Success Rate, ASR)衡量感染模型将含触发器的测试样本预测为目标标签的比例。此外,ACC表示良性模型(未感染)在测试集上的预测准确率,用于与BA对比。
💡 核心创新点
- 提出"自然触发器"概念:与之前使用随机噪声、特定频率正弦波或超声波等人为构造或不常见声音作为触发器不同,本文系统性地探索并验证了使用雨声、口哨声、鸟鸣声等日常生活中普遍存在且不会引起警觉的声音作为后门触发器。这解决了之前触发器在物理世界中部署时可能因声音突兀而被人类察觉的隐蔽性问题。
- 验证了物理世界攻击的有效性:论文通过录制真实环境中的蝉鸣声作为触发器,验证了该攻击方法在真实物理场景下依然有效。这证明了"自然触发器"无需攻击者主动播放即可由环境激活的特性,提升了攻击的实际威胁等级。但验证场景极为有限,仅使用了一种自然声音(蝉鸣)。
- 将攻击扩展至无标签(Clean-label)设置:论文展示了其方法可适用于更困难的Clean-label攻击场景(即不修改投毒样本的原始标签),进一步增强了攻击的隐蔽性。实验表明CNN在投毒率约5%(1000个样本)时ASR超过90%,但LSTM需要更高投毒率。
- 系统性的影响因素分析:论文对攻击成功率的三个关键因素(投毒率、触发器持续时间、混合比例)进行了实验探索,为理解此类攻击的特性提供了初步数据。
📊 实验结果
论文在两个音频分类数据集上进行实验:Speech Commands Dataset Version 2(SCDv2,10类,44.1kHz采样率,筛选≥1秒音频,共22384个样本)和Eating Sound Collection(ESC,20类,16kHz采样率,筛选≥3秒音频)。使用了mini-CNN(ESC上,源自Ali Tianchi Competition基线模型)、CNN(SCDv2上,参考文献[15, 23])和LSTM(SCDv2上,参考文献[26])三种相对简单的模型。评估指标为良性模型准确率(ACC)、感染模型干净准确率(BA)和攻击成功率(ASR)。
主实验(Table 1):设置触发器持续时间与原始音频相同(ESC为3秒,SCDv2为1秒),投毒率为5%。使用五种触发器(随机噪声、超声波21kHz、雨声、口哨声、鸟鸣声)进行对比。主要结果如下:
| 数据集 | 模型 | 类型 | 触发器 | ACC(%) | BA(%) | ASR(%) |
|---|---|---|---|---|---|---|
| ESC | mini-CNN | 相关工作 | 随机噪声 | 97.32 | 96.70 | 100.00 |
| ESC | mini-CNN | 相关工作 | 超声波 | — | 96.81 | 99.79 |
| ESC | mini-CNN | 本文方法 | 雨声 | — | 96.75 | 99.79 |
| ESC | mini-CNN | 本文方法 | 口哨声 | — | 97.53 | 99.19 |
| ESC | mini-CNN | 本文方法 | 鸟鸣声 | — | 96.96 | 96.78 |
| SCDv2 | CNN | 相关工作 | 随机噪声 | 92.82 | 92.68 | 100.00 |
| SCDv2 | CNN | 相关工作 | 超声波 | — | 90.88 | 14.58 |
| SCDv2 | CNN | 本文方法 | 雨声 | — | 92.24 | 99.22 |
| SCDv2 | CNN | 本文方法 | 口哨声 | — | 93.02 | 99.94 |
| SCDv2 | CNN | 本文方法 | 鸟鸣声 | — | 92.95 | 99.38 |
| SCDv2 | LSTM | 相关工作 | 随机噪声 | 92.94 | 89.98 | 99.98 |
| SCDv2 | LSTM | 相关工作 | 超声波 | — | 89.54 | 2.45 |
| SCDv2 | LSTM | 本文方法 | 雨声 | — | 90.78 | 97.74 |
| SCDv2 | LSTM | 本文方法 | 口哨声 | — | 92.42 | 99.97 |
| SCDv2 | LSTM | 本文方法 | 鸟鸣声 | — | 91.18 | 96.13 |
论文指出ESC上五种触发器均达到高ASR(≥96.78%),BA相对于ACC变化极小。在SCDv2上,21kHz超声波触发器ASR极低(CNN: 14.58%,LSTM: 2.45%),论文将此归因于16kHz采样率下奈奎斯特定理导致的信息丢失。然而,这与论文前文声明的SCDv2采用44.1kHz采样率存在矛盾(44.1kHz采样率的奈奎斯特频率为22.05kHz,应能表示21kHz超声波),属于论文自身的技术错误。三种自然触发器在SCDv2上ASR均超过96%。
消融实验(影响因素分析):均以SCDv2数据集、雨声触发器为基准。
- 投毒率(Fig. 6):投毒率从0%增至5%时,CNN和LSTM的ASR均从0%接近100%,BA变化轻微(CNN的BA从92.82%微降至92.24%)。投毒率达2%时ASR已超90%。CNN比LSTM更容易被攻击。
- 触发器持续时间(Fig. 7):当触发器时长从0秒增至0.1秒时,ASR超过90%;增至0.8秒时,ASR接近100%。两种模型变化趋势一致。
- 混合比例 \(\alpha\)(Fig. 8):采用混合注入策略 \(\prod_{\alpha}^{blend}(s, t) = s + \alpha \cdot t\)。当 \(\alpha\) 从0增至0.1时,ASR超过85%;增至0.8时,ASR接近100%。两种模型变化趋势一致。

下图具体展示了投毒率对攻击性能的影响:随着投毒率从0%增至10%,CNN和LSTM的攻击成功率(ASR)均快速上升并接近100%,而干净准确率(BA)下降幅度有限。
其他实验:
- 物理世界验证(Fig. 4):使用真实录制的"蝉鸣"声作为触发器,录制包含蝉鸣的人类语音作为投毒训练样本。论文称实验显示方法在物理场景下仍保持高ASR,但未提供具体数值,仅以图表形式展示。
- 无标签攻击(Fig. 5):在SCDv2上使用雨声触发器。CNN在投毒样本达1000个(投毒率约5%)时ASR超过90%;LSTM需要更高投毒率。与有标签(Poison-label)攻击相比,Clean-label攻击需要更多投毒样本。
与已有工作的差距:论文仅与随机噪声和超声波两种已有触发器进行了对比,未与更先进的后门攻击方法(如动态触发器DriNet [21]、特征空间攻击)进行直接对比,也未在更复杂、更大规模的模型(如Transformer、Wav2Vec 2.0、Whisper)上验证。
🔬 细节详述
- 训练数据:ESC Eating Sound Collection(20类,16kHz采样率,筛选≥3秒样本,具体数据量未明确说明);Speech Commands Version 2(10类,44.1kHz采样率,筛选≥1秒样本,共22384个样本)。
- 损失函数:论文中以通用符号 \(\mathcal{L}\) 表示损失函数(公式1),未明确指定具体形式,对于分类任务通常为交叉熵损失。
- 训练策略:Epoch设置为300,学习率为0.0001。优化器类型、batch size、学习率调度策略、warmup等细节均未说明。
- 关键超参数:模型具体架构(CNN/LSTM的层数、隐藏单元数、激活函数、dropout等)未详细说明。MFCC特征提取的具体参数(
n_mfcc、n_fft、hop_length、n_mels)均未提供。 - 训练硬件:未说明。
- 推理细节:不适用,因为是分类任务。
- 正则化或稳定训练技巧:未说明。
⚖️ 评分理由
创新性 (1.0/2):提出使用自然界或日常生活声音作为后门触发器,概念新颖,与随机噪声或超声波触发器不同,但实现方法相对简单。
技术严谨性 (0.5/1.5):论文在解释超声波触发器在SCDv2数据集上失败时存在自相矛盾,采样率描述前后不一致(44.1kHz vs 16kHz),损害技术严谨性。
实验充分性 (0.5/1.5):实验仅使用mini-CNN、CNN和LSTM等基础模型,缺乏与当前主流Transformer等模型的对比;仅与随机噪声和超声波触发器对比,未与先进攻击方法对比;物理世界验证过于简略。
清晰度 (0.6/1):论文结构完整,方法描述清晰,但部分参数如MFCC具体取值未提供,符号和公式解释存在不足,影响理解。
影响力 (0.5/1.5):该工作针对语音识别系统,但实验模型简单,结论的普适性受限,且发表在LNCS workshop,影响力有限。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):论文未提供模型架构的具体定义、MFCC特征提取参数、优化器类型等关键细节,严重影响可复现性。
工程/实践价值 (0.3/1.5):方法在物理场景下初步验证,但缺乏系统测试和全面评估,工程实践价值有限。
🚨 局限与问题
- 模型架构简单,结论普适性存疑:论文仅在mini-CNN、CNN和LSTM三个基础模型上进行实验。这些模型的规模和架构复杂性远低于当前主流的Transformer、Conformer、Wav2Vec 2.0、Whisper等模型。因此,在简单模型上有效的攻击方法,其在高性能复杂模型上的有效性尚未得到验证,结论的普适性受到限制。
- 缺乏与先进攻击方法的对比:论文仅将自然触发器与随机噪声和超声波触发器进行对比。未与更先进的后门攻击方法(如文献[21]中的动态触发器DriNet)进行直接实验比较,因此难以准确评估自然触发器相对于现有攻击技术的实际优势。
- 实验评估维度有限:论文的评估主要集中在攻击成功率(ASR)和干净准确率(BA)上,缺乏对攻击隐蔽性的客观度量(例如,触发器嵌入后对语音质量的影响,可通过PESQ、MOS等指标评估),也缺乏对模型在不同声学环境(如不同信噪比、混响条件)下鲁棒性的系统评估。
- 物理世界验证过于简略:仅使用一种自然声音(蝉鸣)在一个未详细描述的物理场景中进行验证,未控制变量(如距离、背景噪声、麦克风类型)进行系统性测试,说服力有限。
- 技术描述存在矛盾:论文在解释超声波触发器在SCDv2数据集上失败的原因时存在自相矛盾的说法。前文(第4.1.1节)明确指出SCDv2数据集源音频采样率为44.1 kHz,但后文(第4.2节结果分析段)却称“since the sampling rate of the dataset is 16kHz”,这与事实不符,损害了技术严谨性。
- 工程细节披露不足:论文未提供复现实验所必需的诸多细节,包括模型架构的具体定义(层数、激活函数等)、MFCC特征提取的详细参数、优化器类型、批量大小、训练硬件等,严重影响了可复现性。