📄 Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

#语音识别 #音频生成

7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5

7.6/10 | 前25% | #语音识别 | #音频生成 | arxiv

👥 作者与机构

  • 第一作者:Tianyi Xu(中国科学院信息工程研究所,中国科学院大学网络空间安全学院)
  • 通讯作者:Yue Zhao(中国科学院信息工程研究所),Kai Chen(中国科学院信息工程研究所)
  • 作者列表:Tianyi Xu、Cheng’an Wei、Yue Zhao、Kai Chen(均来自中国科学院信息工程研究所 / 中国科学院大学网络空间安全学院)

💡 毒舌点评

本文巧妙利用“听觉不留意”的心理声学现象,将其建模为可优化的注意力稀释损失,在对抗音频隐蔽性上迈出了关键一步。200人用户研究中55.6%的不可察觉率远超前人,攻击成本仅0.43美元,成果说服力强。然而,方法深度依赖人工精选的42首音乐载体库和经典MPEG-1掩蔽模型,对长命令和稀疏音乐的泛化能力明显不足;防御实验仅测试了两种基础信号处理手段,面对现实世界中可能存在的说话人验证、音频取证等主动防御系统时,其攻击效力仍存疑,这削弱了其宣称的现实威胁等级。

📌 核心摘要

  1. 论文要解决的问题:在真实物理世界中对商用黑盒自动语音识别(ASR)系统发起隐蔽对抗攻击。现有方法仅关注压缩扰动幅度,忽视了人类选择性注意力机制,导致生成的对抗音频仍易被察觉(如Occam仅10.78%用户认为正常,Kenku有46%用户能识别嵌入的指令)。

  2. 方法核心是提出HWN(Hearing Without Noticing)框架,包含两个关键设计:基于心理声学掩蔽效应的注意力兼容载体选择算法(从候选音乐库中选出最能掩蔽目标命令的音乐片段)和基于结构-残差分解的注意力稀释损失函数(抑制频谱中易捕获注意力的突变成分)。

  3. 与已有方法相比,HWN的新颖之处在于显式建模“注意力”而非仅最小化信噪比,通过载体选择与频谱纹理平滑双重机制提升感知隐蔽性,将攻击从“小声”推向“不被注意”的层次。

  4. 主要实验结果:在5种商用云API上攻击成功率达100%;数字域人类感知研究中,56.25%的参与者认为对抗音频完全正常(对比Occam 19.41%,Kenku 40.72%);物理域攻击三大语音助手成功率100%,55.57%的参与者未能察觉异常。消融实验表明,移除载体选择或注意力损失均会导致“听见语音”比例大幅上升。防御实验显示,在频带滤波和湍流噪声下,HWN的隐蔽样本攻击成功率残留(30.78%/38.46%)远超基线方法。

  5. 实际意义:揭示了当前商用ASR系统在注意力感知隐蔽攻击面前的严重脆弱性,为语音助手安全防护提出了新的、更隐蔽的威胁模型,强调了多因素认证等防御机制的必要性。

  6. 主要局限性:攻击对长命令(如“take a picture and send it to John”)的隐蔽性显著下降;载体选择依赖人工构建的音乐库和MPEG-1模型,尚未探索更大规模数据集或AI生成载体的可能性;仅依赖TTS合成目标命令,缺乏对真实录音的泛化上限验证;防御实验未涉及学习型检测、说话人认证或反欺骗等更现实的对策;人类感知评估仅单次聆听,可能受听感疲劳影响。

🔗 开源详情

  • 代码:https://github.com/Spa-rkle/HWN-Attack
  • 模型权重:无(该方法不依赖训练好的模型权重)
  • 数据集:未提供专门的公共数据集下载。论文使用10条自定义目标命令和42首来自音乐平台的精选曲目构成内部测试集,具体集合未公开。
  • Demo:https://github.com/Spa-rkle/HWN-Attack (仓库内包含音频演示样例)
  • 复现材料:源代码仓库提供完整实现;附录D给出了全部超参数和实现细节,可基于公开代码和论文信息复现。
  • 论文中引用的开源项目:
    • Silero VAD:https://github.com/snakers4/silero-vad
    • OpenAI Whisper:https://github.com/openai/whisper

🏗️ 方法概述和架构

HWN是一个两阶段的黑盒对抗音频生成流水线,旨在生成“听而不察”的隐蔽对抗样本。给定攻击者想注入的目标文本命令,整体流程如下:

  1. 命令音频合成:通过商用TTS服务(如Google TTS)将目标文本合成为音频。
  2. 载体选择:从候选音乐库中,利用心理声学掩蔽效应计算出最适合掩蔽该命令的音乐片段作为载体。
  3. 注意力稀释对抗优化:在频谱域进行注意力感知的对抗优化,生成叠加在音乐载体上的扰动谱。
  4. 时域重建:使用Griffin-Lim算法进行迭代相位恢复,得到时域的对抗音频波形。
  5. 后精炼(可选):对于支持云端查询的黑盒API,再用CMA-ES进化算法删去对模型决策无贡献的冗余扰动,以最低查询成本进一步压缩感知痕迹。

该流水线从左侧TTS合成、音乐载体库开始,到中间的掩蔽对齐选择与注意力稀释优化,再到右侧的时域重建和可选的CMA-ES查询精炼,清晰地描绘了数据流向。主要组件的详细说明如下:

  1. 掩蔽对齐载体选择算法(Masking-aligned Carrier Selection):核心思想是依据MPEG-1心理声学模型,计算每个候选音乐片段的全局掩蔽阈值曲线。同时,利用语音活动检测(VAD)滤除目标命令中的静音帧,仅比较有语音帧的各频带能量是否低于该音乐掩蔽阈值。算法以滑动窗口(窗长3秒,95%重叠)遍历候选音乐,计算“被掩蔽的有声帧数 / 总有声帧数”作为掩蔽评分,选择得分最高的音乐片段作为载体。此算法有效解决了不同音乐背景对同一扰动产生截然不同听觉显著性这一挑战。

  2. 注意力稀释对抗优化(Attention-Diluted Adversarial Optimization):在选定载体音乐的Log-Mel频谱上直接优化可学习的扰动谱∆。优化目标是最小化复合损失函数 \(L = L_{acoustics} + \lambda L_{stealthiness}\),其中 \(\lambda\) 通过二分搜索确定。\(L_{acoustics}\) 强制对抗音频的声学特征与目标命令对齐,定义为 Log-Mel 频谱的 MAE 损失:\(\text{MAE}(\log(M_{adv}+\epsilon), \log(M_{target}+\epsilon))\)。\(L_{stealthiness}\) 是核心创新,它基于结构-残差分解:利用级联多尺度平滑算子 \(T\)(由 \(s \times s\) 方核和 \(s \times 1\) 垂直核组成)提取扰动∆的平稳结构包络 \(S_\Delta\),残差 \(R_\Delta = \Delta - S_\Delta\) 则被视为易触发听觉注意力的频谱峰和谐波异常成分。损失函数以 \(R_\Delta\) 的MSE来强制扰动变得统计平稳,从而“稀释”注意。此即“注意力稀释”的原理。

  3. 时域重建(Time Domain Signal Reconstruction):由于优化仅在幅度谱上进行,缺乏相位信息。论文采用Griffin-Lim算法,通过迭代地执行STFT、提取相位、替换为对抗幅度谱、ISTFT的循环,直至幅度谱均方误差收敛,实现从幅度谱到高质量时域波形的重建。

  4. CMA-ES后精炼(CMA-ES Post-Refinement):专为数字查询场景设计。将扰动∆离散化为 \(m \times n\) 的网格,通过优化一组缩放系数 \(W\) 来最小化扰动总量 \(\text{sum}(|W \cdot \Delta|)\),约束条件是ASR模型输出仍为目标命令。采用协方差矩阵自适应进化策略(CMA-ES)求解,平均47次迭代、707次查询即可收敛。

设计选择上,论文强调在频谱域而非波形域优化的原因有两点:一是STFT丢弃相位信息后损失地形更易优化,二是保留了音乐本身的谐波相位,避免了直接扰动波形可能造成的相位不一致和听觉劣化。

💡 核心创新点

  1. 注意力感知的隐蔽性建模:首次将人类听觉选择性注意力机制(基于预测编码和听觉显著性理论)显式形式化为可优化的目标,而非单纯依赖扰动能量最小化,从根本上改变了对抗音频隐蔽性的优化范式。
  2. 结构-残差分解的注意力稀释损失:利用多尺度平滑算子将扰动谱分解为注意力不敏感的平稳结构包络 \(S_\Delta\) 和易吸引注意的残差频谱峰 \(R_\Delta\),通过惩罚 \(R_\Delta\) 的能量,迫使扰动呈现类似雨声、磁带嘶声等大脑会习惯性忽略的背景噪声,显著降低了有意识察觉率。
  3. 掩蔽率引导的自适应载体选择算法:首次将MPEG-1心理声学掩蔽曲线与VAD技术结合,以帧级掩蔽比例作为客观的选曲标准,解决了过去黑盒攻击中载体选择凭经验、隐蔽性高度不稳定的问题。
  4. 零查询物理攻击与低查询数字攻击的协同设计:物理域攻击完全无需与目标设备交互;数字域则在极少量查询(约707次,0.43美元成本)下即可完成优化,在攻击效率、成本和隐蔽性上实现了统一。

📊 实验结果

论文在5个云计算API(Google、Microsoft、Alibaba、Tencent、OpenAI Whisper)和3个物理语音助手(Gemini、Amazon Alexa、Doubao)上评估了10条常见命令,与KENKU和Occam/NI-Occam直接对比。关键实验数据汇总如下:

数字域攻击结果(整表平均):

方法SRNormalNoiseTalking1st2ndMOS (1-5)SNR (dB)
Occam100%19.41%26.77%53.79%0.37%1.84%3.219.63
Kenku100%40.72%14.06%45.20%4.81%5.18%3.7115.66
HWN (Ours)100%56.25%27.67%16.07%0.14%0.63%4.0621.50

物理域攻击结果(整表平均):

方法Voice Assistant SRNormalNoiseTalking1st/2ndMOS (1-5)SNR (dB)
Occam77.78%0.00%35.80%64.20%0.00%/1.23%1.371.79
Kenku100.00%34.53%22.20%43.23%3.70%/8.63%3.057.61
HWN (Ours)100.00%55.57%34.07%10.37%0.00%/0.00%4.1916.12

消融实验:揭示了各组件对物理域隐蔽性的贡献。

组件组合NormalNoiseTalking1st/2ndMOS (1-5)SNR (dB)
仅载体选择+量级约束 (Log Mel)9.28%41.43%49.28%3.58%/2.83%2.6611.85
载体选择+注意力损失 (MFCC)35.73%42.13%22.15%0.70%/0.70%3.559.84
无载体选择+注意力损失 (Log Mel)7.85%22.15%70.00%9.28%/2.83%2.2214.81
完整方法 (载体选择+注意力损失, Log Mel)55.57%34.07%10.37%0.00%/0.00%4.1916.12

防御实验:在频带滤波和湍流噪声两种防御下,HWN方法的隐蔽样本攻击成功率残留分别为30.78%和38.46%,远超Occam(0%)和Kenku(7.69%/15.38%),显示出在隐蔽性与鲁棒性之间取得了更好的平衡。

声音类型泛化实验:HWN对目标声音的声学特征敏感。“女声喜悦”模板达到最高正常率77.30%(MOS 4.36),“男低音”降至36.40%(MOS 3.82),真人录音则为50.00%,表明攻击隐蔽性对音色、音高等特性存在依赖。

攻击效率:单个数字域对抗样本生成约50分钟,CMA-ES后精炼平均耗时778秒,需707次查询,花费0.43美元。物理域攻击则为零查询。

🔬 细节详述

  • 音频预处理:所有音频重采样到16kHz,音量归一化到75dB SPL参考值。
  • 音乐载体库:包含42条精选音乐,其中27条为电子/节奏类,15条为钢琴/氛围类。
  • 目标命令生成:10条常用命令(如“open the door”),通过Google TTS和Microsoft TTS合成,默认使用女声。
  • 损失函数与优化器:\(L_{acoustics}\)为Log-Mel谱的MAE,\(L_{stealthiness}\)为频谱残差的MSE。使用Adam优化器,学习率4e-2,迭代1500步。平衡系数\(\lambda\)通过二分搜索确定。
  • 关键超参数:Mel频带80维;STFT参数:FFT大小2048,跳长512(计算掩蔽时)和256(生成扰动时);平滑核尺度:方核15,垂直核7。CMA-ES:种群规模15,sigma=0.05,最大1000代,早停5代。Griffin-Lim:迭代1000次。
  • 训练与推理硬件:论文未提及GPU型号或精确的各阶段训练/推理耗时。
  • 物理攻击设置:使用JBL Clip 3扬声器,80%音量在安静桌面环境播放,智能手机通过空中录音识别。攻击成功率定义为三次播放中至少有一次被识别为目标指令。
  • 人类感知研究:招募200名18-60岁英语母语参与者,每人评估12条音频(含对抗样本和良性对照),每个音频样本平均由22名独立听者评估。评价指标包括Normal、Noise、Talking、1st/2nd指令识别成功率和MOS。统计检验(Shapiro-Wilk、Kruskal-Wallis H-test、Dunn’s post-hoc、Pearson’s Chi-square)均证实HWN在MOS和Normal Rate上显著优于基线。

⚖️ 评分理由

  • 创新性 (1.4/2):从“听而不察”的认知心理学角度切入对抗音频隐蔽性,提出注意力稀释损失和掩蔽对齐载体选择,这在对抗攻击领域具有实质新颖性,跳出了单纯优化信噪比的惯性思维。但方法核心部件(结构-残差分解、MPEG-1心理声学模型)均来自现有工作,组合方式虽有洞察,尚未构成范式级突破。
  • 技术严谨性 (1.0/1.5):注意力稀释损失的推导将其与听觉显著性和预测编码理论关联,概念上合理。但数学上并未严格证明平滑残差与人类注意力之间的定量映射,仅以人类感知实验结果间接验证模型有效性。此外,方法深度依赖MPEG-1模型和特定音乐库,虽然论文讨论了局限性,但在正文中未进行严格的适用性边界分析或对模型假设的敏感性测试,存在一定过度简化。
  • 实验充分性 (1.1/1.5):五个商用API和三个物理助手的横向对比非常扎实,200人真人感知研究并给出95%置信区间、显著性检验,消融实验覆盖各模块,说服力较强。不足之处在于:防御实验仅测两种传统信号处理方法,未涉及基于学习的检测器或重放攻击检测等现实防御;对长命令的泛化仅测试了极少量样本,缺乏系统性;物理实验仅在安静桌面环境进行,未分析不同混响、背景噪声、距离和角度对隐蔽性的影响,存在场景过拟合风险。
  • 清晰度 (0.7/1):论文结构整体合理,图示清晰。但分析文本中,对CMA-ES后精炼与主优化阶段的关系说明不够,容易让读者误认为两阶段共享同一损失函数。此外,文中部分关键公式(如结构抽取的平滑算子)的定义比较分散,符号体系不够统一,增加了阅读成本。
  • 影响力 (0.8/1.5):该工作对语音识别安全领域有重要警示意义,提出的“注意感知”威胁模型可能激发新的防御思路。但对抗攻击方向的受众相对集中,攻击方法本身的泛化能力有限,对语音处理技术整体进步的推动作用有限。此外,攻击严重依赖TTS合成指令,现实攻击者须额外绕过说话人验证等环节,这限制了其声称的实际威胁等级。
  • 开源 (1.2/1.5):作者提供了GitHub仓库链接和音频demo页面,承诺发布源代码,属于“核心内容已开源”(代码和示例音频)。仓库包含完整实现代码和示例,符合其声称。但无独立的模型权重(此方法不依赖)和专业数据集发布。
  • 可复现性 (0.4/0.5):核心超参数(学习率、迭代次数、平滑核大小、\(\lambda\)范围、CMA-ES配置)在论文附录中均已给出,复现门槛低。缺失的主要是详细的硬件环境和各阶段精确的运行时间分解,以及所依赖的TTS接口版本变化可能造成的复现偏差。
  • 工程/实践价值 (1.0/1.5):Pipeline设计完整,从TTS合成到载体选择、优化、物理播放,每一步都有明确工程模块,攻击成本极低(0.43美元),有潜力转化为渗透测试工具。但其严重依赖人工挑选的音乐库和固定的心理声学模型,离真正自动化、可靠的工业级攻击框架仍有较大距离。

🚨 局限与问题

论文明确承认的局限:

  • 攻击对长命令(如超过6词的命令)的隐蔽性急剧下降。
  • 载体选择算法依赖的掩蔽模型仅为MPEG-1,未探索更先进的听觉模型。
  • 未针对学习型防御(如音频取证检测器、语音反欺骗系统)进行评估。
  • 暂未实现用生成模型自动合成最优音乐载体。

审稿人发现的潜在问题:

  • 场景过拟合风险:物理实验仅在安静的桌面环境开展,未评估不同混响、背景噪声、播放距离和角度下的性能衰减。真实物理世界声学环境复杂多变,其实用性有待更全面的场景测试。
  • 主观评估偏差:人类感知评估采用单次短时聆听判断,每次评估12条音频,可能导致听感疲劳和评估偏差。未与更严格的ABX测试或多天重复暴露实验进行对照,可能高估了“听而不察”的效力。
  • 核心假设缺乏直接验证:方法的核心假设“频谱残差等于听觉显著性”虽然在概念上契合相关理论,但缺乏直接的心理声学实验证据(如脑电、反应时间实验等)来定量证实,仅依靠宏观用户研究做间接印证。
  • 现实防御的回避:防御评估极其基础。攻击要绕过现实ASR系统,通常还需面对说话人验证、反TTS欺骗检测等防线。论文绕过了这些关键技术壁垒,导致了“100%攻击成功”的结论与实际威胁之间存在鸿沟。
  • 攻击方法时效性:该方法对商用API的测试是在特定时间点完成,一旦ASR系统在后端部署了针对性的对抗训练或异常检测模块,其攻击成功率将急剧下降,研究的时效性价值受限。

📷 论文图片


← 返回 ICML 2026 论文速递