📄 From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
标签:#音频理解 #对抗训练 #音频大模型 #鲁棒性 #模型评估
7.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5
✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv
👥 作者与机构
- 第一作者:Yuanhe Zhang、Weiliu Wang(共同第一作者;机构信息未完整披露)
- 作者列表:Yuanhe Zhang、Weiliu Wang、Jie Ren、Liang Lin、Zhenhong Zhou、Haoran Gao、Kun Wang、Chen Li、Li Sun、Sen Su
- 通讯作者:Sen Su(论文署名信息未给出完整机构映射)
💡 毒舌点评
ILL 把“人耳听不见但模型能感知”的低频输入明确为 LALM 的安全风险,并用黑盒通用波形在六个模型上验证了可迁移的破坏效果;DRG 的条件重录防御也有工程直觉。但攻击只在数字混音中评估,没有 over-the-air 实测,DRG 仅建模两类分布且要求用户重复录音,频移、调制变化和实时交互下的鲁棒性仍未证明。
📌 核心摘要
论文研究人耳不可感知的低频信号如何影响大音频语言模型(LALM),提出黑盒红队方法 ILL(Intermittent Low-Frequency Lockout)。ILL 用句子注意力尺度估计定位活跃区间,再根据语料频谱变化构造连续相位低频波形;为缓解风险,DRG(Distributional Requery Guard)检测低频分布偏移并在必要时请求第二次录音进行语义恢复。跨六个 LALM 和多类音频理解任务,ILL 最高可使准确率下降 67 个百分点,而人类听感评分均值 1.33,接近干净音频的 1.17;DRG 在干净重录后将受攻击平均准确率从 28.5% 提升至 46.1%。该工作补充了此前对 LALM 低频安全通道关注不足的研究空白,但数字混音威胁模型、窄频段设置和有限防御簇限制了结论外推。
文中攻击与防御数字均来自作者设定的离线评测协议;它们用于刻画模型端风险,不等同于真实设备在开放环境中的成功率。
🔗 开源详情
代码、模型权重、数据集与 Demo:论文未提供可下载资源或链接。复现材料:论文披露了 ILL/DRG 的算法与评测协议,但未提供 scripts 或配置文件。
🏗️ 方法概述和架构
本文提出的整体框架包含两条并行链路:攻击链路和防御链路。攻击链路基于威胁模型:攻击者在用户正常说话的同时,通过扬声器发射一个独立于语音内容和目标模型的低频波形,该波形在空气中与用户语音发生物理叠加,被目标LALM的麦克风采集后进入模型前端。防御链路则是插入在用户输入与LALM推理之间的一个轻量级输入过滤器。图1从宏观上展示了这一架构:左侧是低频感知差距(人类听不到但模型可感知的低频信号),中间是ILL的具体构造流程(由Sentence Attention Scale Estimation和Frequency Confusion Transfer两个模块组成),右侧是DRG的检测与条件性重采流程,最终用于评估任务级性能。
下图从宏观上展示了本文提出的低频感知风险分析框架,涵盖攻击模块ILL、防御模块DRG及其整体流程。

图中左侧突出了人类听觉与模型感知之间的低频感知差距,中间部分详细展示了ILL的构造流程和DRG的检测与重录管线,右侧则示意了评估覆盖的多模型与多任务。
攻击流程:输入为一段干净语音 \(x(t)\),攻击者离线构建一个固定的通用低频干扰模板 \(\delta^*(t)\)。在实际部署时,攻击者以声学信号形式发射 \(\delta^*(t)\),使其与用户语音在空气中自然叠加(而非数字域直接相加),叠加后的混合信号 \(x(t)+\delta^*(t)\) 被LALM接收。模型输出被显著劣化的结果(如ASR错误、MMAU准确率下降)。防御流程:在LALM推理之前,DRG首先对接收到的音频信号提取频谱分布描述子,判断其是否落入低频干扰的分布偏移;若判定为正常,则直接进入标准推理;若判定为受干扰,则系统请求用户重新录制同一句话的第二次录音,并将两次录音同时提供给LALM,附加指令要求模型只依据两次录音中一致且可理解的内容作答,从而恢复语义信息。
ILL由两个核心组件构成,二者均为离线构造,构造完成后固定不变,可泛化到任意的目标LALM和测试语音,不需要白盒梯度或逐样本优化。
功能:确定干扰波形中“活动区间”的持续时长 \(L_{\mathrm{on}}\),即低频信号在时间上以怎样的间歇节奏注入,才能最大程度扰乱模型对语音语义的持续注意力。
内部结构与实现:SASE利用一个参考LALM(论文中使用Qwen2.5-Omni)在参考语料库 \(\mathcal{D}\) 上提取帧级注意力信息。对于每一段录音,模型将语音编码为 \(F\) 帧,针对每个候选边界位置 \(b\)(\(1 \le b \le F-1\)),定义一组相对注意力质量分数 \(I_w(u)\) 和 \(C_w(u)\),其中 \(w\) 为多尺度邻域半径。边界分数定义为:
\[ g(b)=\frac{1}{|\mathcal{W}|}\sum_{w\in\mathcal{W}}\frac{1}{|\mathcal{N}_w(b)|}\sum_{u\in\mathcal{N}_w(b)}\frac{I_w(u)}{I_w(u)+C_w(u)}, \]其中 \(\mathcal{N}_w(b)=\{u:\max(1,b-w)\le u\le \min(F-1,b+w)\}\) 是 \(b\) 的邻域。该分数度量:在以 \(b\) 为语音片段边界时,片段内部注意力相对量在所有邻域和多尺度上的平均占比。分数越高,说明该位置越像一个语义完整的“注意力段落”边界。随后,计算所有候选位置 \(g(b)\) 的中位数 \(m\) 和绝对偏差 \(d\),保留满足 \(g(b)\ge m+d\) 的局部最大值作为边界,并补上两个端点,得到 \(0=b_0<\dots 设计动机:该设计使得低频干扰的活跃段正好落在模型持续关注语义的典型时间尺度上,从而在模型进行语义整合时同步注入干扰,达到“锁定”注意力而非简单叠加能量的效果。 功能:生成在时间上随状态序列变化、相位连续的低频波形,用于扰乱模型对语音频谱的感知。 内部结构与实现:FCT从参考语料库中提取一组状态序列 \(s_1,\dots,s_K\),每个状态对应一个频率 \(f_{s_k}\)。将活动区间 \(L_{\mathrm{on}}\) 等分为 \(K\) 段,每段时长 \(\Delta=L_{\mathrm{on}}/K\)。在第 \(k\) 个时间段 \([(k-1)\Delta, k\Delta)\) 内,瞬时频率保持恒定 \(\varphi(t)=f_{s_k}\),然后通过相位积分合成活动波形:
设计动机:采用连续相位合成可以避免波形在状态切换时出现相位跳变,从而抑制高频泄漏;使用状态序列表达语料级频谱变化,而不是固定单音或随机噪声,使干扰能持续混淆模型对语音时频结构的建模;\(\beta\) 的接收端控制则模拟了物理叠加后的噪声强度,而不是在数字域直接混合。
DRG是一个即插即用的输入过滤器,在LALM推理之前判断输入是否携带低频分布偏移,并对被标记为受干扰的输入触发条件性重录请求。
离线构建:构造防御训练集 \(\mathcal{D}_{\mathrm{def}}=\mathcal{D}_{\mathrm{cle}}\cup\mathcal{D}_{\mathrm{jam}}\),分别包含干净录音和施加低频干扰的录音。对每条训练录音,使用FCT中相同的短时傅里叶变换参数,将幅度谱在时间维度上求和,并进行 \(\ell_1\) 归一化,得到频谱分布描述子 \(\mathbf{d}_x \in \mathbb{R}^V\),其中 \(\mathbf{d}_x[v]\) 表示频点 \(v\) 的相对幅度贡献。该描述子对整体音量不敏感,只保留频谱形状。随后,对所有描述子执行K-means聚类(\(K=2\)),得到两个簇及其质心 \(\boldsymbol{\mu}_1,\boldsymbol{\mu}_2\)。为了区分哪个簇对应干扰,计算每个簇内描述子在构造ILL时所用的低频区间 \([f_{\min},f_{\max}]\) 上的平均质量:
\[ r_k=\frac{1}{|\mathcal{G}_k|}\sum_{x\in\mathcal{G}_k}\sum_{v:\nu_v\in[f_{\min},f_{\max}]}\mathbf{d}_x[v],\quad k\in\{1,2\}. \]低频质量更大的簇被标记为干扰簇 \(k_{\mathrm{jam}}\),另一个为干净簇 \(k_{\mathrm{cle}}\)。整个过程仅依赖输入频谱,不查询目标LALM。
在线部署:对于用户初始录音 \(x^{(1)}\),DRG提取其描述子 \(\mathbf{d}_{x^{(1)}}\),计算它到两个质心的欧氏距离,就近分配簇。若分配到干净簇,则正常进入LALM推理;若分配到干扰簇,则系统请求用户提供同一句话的第二次录音 \(x^{(2)}\),然后将 \(x^{(1)}\) 和 \(x^{(2)}\) 一并输入目标LALM,并附带指令:“请比较两次录音,只根据二者中一致且可理解的内容作答”。这样既保留了初始录音中可能存在的有效信息,又利用第二次独立采样的声学证据过滤掉低频干扰。DRG的检测开销仅为两次 \(V\) 维距离计算,复杂度为 \(\mathcal{O}(V)\),不包含神经网络前向传播或目标LALM查询,因而可以作为轻量级前置过滤模块。
从数据流角度看,整个系统为:用户语音 \(x(t)\) 与攻击模板 \(\delta^*(t)\) 在空气中物理叠加 → 麦克风接收混合信号 → 若部署了防御,DRG对接收信号进行频谱描述子提取和簇分配 → 若判定干净,直接进入LALM;若判定干扰,触发第二次录音并拼接两段音频送入LALM → LALM生成输出。攻击侧的构建流程是:参考语料 → SASE计算 \(L_{\mathrm{on}},T_{\mathrm{cyc}}\) → FCT生成 \(\delta_{\mathrm{on}}\) → 周期化得到 \(\delta^*(t)\)。SASE的输出(调度周期)直接作为FCT的输入,而FCT的产物最终输入到物理信道中。DRG的训练与ILL的构造共享相同的低频区间设定和STFT配置,因此能够针对性地识别ILL类攻击的频谱特征。
- 通用模板与黑盒性质:\(\delta^*(t)\) 在离线时根据参考语料和参考模型构建,之后不再修改。这意味着攻击者无需访问目标模型的梯度或任何测试样本,能够在黑盒场景下迁移至多种LALM。
- 间歇式注入:不同于连续噪声,ILL以固定占空比间歇注入,既减少可听性,又通过SASE对齐语义注意力尺度,使其干扰效率更高。
- 连续相位与平滑包络:FCT合成波形时通过积分相位保证频率切换处相位连续,包络端点为零,抑制瞬态噪声,最终在人类听感评估中获得接近干净音频的平均评分(1.33 vs. 1.17)。
- DRG的分布检测而非模型内检测:DRG只依赖输入频谱的全局分布形状,不依赖目标模型的置信度或梯度,因而具有即插即用、跨模型通用且计算开销极小的特点。
- 条件性重录:DRG不是直接丢弃被标记的录音,而是请求额外证据并进行跨录音一致性推理,这比传统信号增强(如低频抑制、语音增强)更灵活,能在各种攻击类型下恢复语义。
图1从左到右展示了完整框架:最左侧显示“低频感知差距”——人类可听范围与非人耳感知但模型可编码的低频信号之间存在鸿沟;中间部分为“ILL构造”,上半部分为SASE从参考语料中提取注意力尺度并输出定时参数,下半部分为FCT从语料频谱变化合成连续相位波形,两者合并生成通用干扰模板;右侧为“DRG检测管线”,对输入音频做频谱描述子提取,通过聚类判断是否受干扰,再决定是否触发第二次录音;最右侧为“评估”,展示攻击和防御在不同LALM和任务上的效果对比。图中箭头明确表明:SASE和FCT均为离线模块,所生成的模板直接作用于物理信道;DRG作为一个前置过滤器位于用户输入与LALM之间。整个架构将攻击(ILL)和防御(DRG)统一在同一个低频风险分析框架下。
💡 核心创新点
- 识别此前被忽视的低频风险通道:论文证明人耳不可感知的低频输入仍可系统性影响 LALM 输出,并将其从零散现象提升为可测试的安全威胁模型。
- ILL 黑盒通用模板:SASE 从参考模型注意力中估计间歇注入周期,FCT 根据语料频谱变化生成连续相位、平滑包络的低频波形,不依赖目标模型梯度或测试样本。
- 攻击与物理听感同时评估:跨六个 LALM 和多类任务验证最高 67 个百分点的准确率下降,并用 112 名参与者的 7 点量表确认 ILL 平均听感 1.33,接近干净音频的 1.17。
- DRG 条件性重录防御:通过频谱分布的两簇检测判断输入是否受干扰,仅对可疑样本请求第二次录音,再用两次录音的一致内容恢复语义。
- 可迁移的攻防分析框架:方法、统计检验和多模型结果共同说明低频风险并非单一模型偶然故障,但数字混音、窄频段与固定两簇防御仍限制外推。
📊 实验结果
下表保留干净输入、ILL 及主要攻击基线的聚合结果;MMAU 子集上的下降范围按论文原始结果记为 11.0–15.4 个百分点,表格控制在最多 12 行、8 个指标列的契约内。
下图以折线图形式进一步展示了ILL攻击在翻译和识别任务上的跨模型有效性。

图中可见,ILL在所有模型上均导致CoVoST2 BLEU显著下降和LibriSpeech WER上升,其效果在大多数情况下优于其他基线攻击方法。
统计检验显示,ILL 相比 Whisper 在 18 个单元格上均显著(p=2.29×10⁻⁵),相比 Audio-Adv. 在 17/18 个单元格上显著(p=3.81×10⁻⁵);与 Gaussian/PNL 的差异经 Holm 校正后并非全部显著。因此 ILL 的优势不能概括为压倒所有噪声基线,但在 CoVoST2 上对每个目标均取得最低 BLEU,且在识别任务上保持强干扰效果。
DRG 在六个 LALM 上的检测与恢复结果表明,干净重录后平均受攻击准确率由 28.5% 恢复至 46.1%;除少数任务外,防御后的正常输入性能与标准推理相近(12 个分数中 10 个在 0.03 内)。
下图比较了DRG与其他防御方法在六种LALM上的平均准确率恢复效果。

图中显示,DRG在干净录音条件下(绿色条)在所有模型上均带来显著的准确率提升,尤其在StepAudio和Gemini上提升超过25个百分点,表明其有效恢复语义信息。
人类听感实验招募 112 名参与者,采用固定音量下的 7 点量表和数字混合刺激;ILL 的均值/中位数为 1.33/1,干净音频为 1.17/1,最接近的基线 Audio-Adv. 和 Whisper 分别为 3.75 和 3.92。
🔬 细节详述
评测细节:MMAU 每个子集抽取 100 条样本,共 300 条;人类听感实验包含 112 名参与者,使用 7 点 Likert 量表、固定音量的数字混合刺激,参与者可用耳机或扬声器播放。统计检验采用 Friedman 检验并以 Wilcoxon 配对检验进行事后比较,报告 Holm 校正后的显著性。论文未披露完整硬件、训练时长和部分防御超参数,复现仍需自行实现脚本。
下图呈现了112名参与者对不同攻击信号的人类听感评分分布,用于评估ILL的隐蔽性。

评分采用7点量表,ILL的平均评分1.33接近干净音频的1.17,且中位数为1,远低于其他攻击方法,证实其难以被人耳察觉。
⚖️ 评分理由
创新性 (1.5/2):[A_METHOD][SCORING_SOURCE_3/38] 论文识别低频不可听信号这一此前未被充分探索的 LALM 风险通道,提出 ILL 黑盒通用模板(SASE 注意力尺度调度 + FCT 连续相位低频波形)与 DRG 条件重录防御,形成攻防一体的方法研究。
技术严谨性 (1.1/1.5):[A_METHOD][SCORING_SOURCE_21/38] SASE/FCT/DRG 的公式定义、复杂度推导和黑盒迁移逻辑自洽;但 DRG 仅聚两类固定簇且频段窄,对频移或调制方式变化缺少方法层覆盖,论文也自述机制分析未建立完整因果链。
实验充分性 (1.2/1.5):[A_RESULTS][SCORING_SOURCE_26/38][SCORING_SOURCE_21/38] 六模型、四类任务、多数据集,含 Whisper/Audio-Adv./Gaussian/PNL 基线与幅度/占空比/时长/状态序列消融,并有 Friedman/Wilcoxon 统计检验;但核心威胁模型是物理空传而实验仅数字混合,无 over-the-air 实测,MMAU 每子集仅 100 样本,部分噪声基线差异不显著。
清晰度 (0.9/1):[A_METHOD][A_RESULTS] 图1 框架、SASE/FCT 公式与 DRG 数据流定义清楚;但 MMAU/PNL 聚合、统计检验和人类听感协议等关键口径分散在附录 C/E/F,主文快速核验时需多表对照,组织上不够集中。
影响力 (1.3/1.5):[A_SUMMARY][SCORING_SOURCE_18/38] 针对 LALM 低频安全风险,黑盒通用攻击在六个模型上最高降 67pp,人类听感 1.33 接近干净的 1.17;DRG 条件重录在多种额外攻击下 19/24 设置最优,对音频鲁棒性社区有直接借鉴价值。
开源 (0.0/1.5):[A_OPEN] 论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):[A_OPEN][A_METHOD] 公式级算法和评测协议(RMS 预算、采样量、听感流程)披露较细,但复现材料未提供 scripts/configs,需读者自行实现关键管线,属大部分充分但有少量缺失。
工程/实践价值 (1.1/1.5):[A_METHOD][A_LIMITS] DRG 在线检测仅需两次 V 维距离比较,复杂度 O(V),不查询目标 LALM,作为轻量级前置过滤器有实用价值;但条件重录要求用户重复说同一句话,在实时交互场景中部署可行性受限。
🚨 局限与问题
论文明确承认的局限与本文审阅后补充的问题如下:
- 核心威胁模型是扬声器—空气—麦克风的物理链路,但实验仅使用数字混音,尚无 over-the-air 实测,因此跨设备、房间和距离的攻击成功率仍未知。
- DRG 主要依赖 5–20 Hz 频段的两簇分布检测,尚未覆盖频移、调制或自适应攻击;条件重录还要求用户重复说话,实时交互中的使用成本较高。
- 部分任务存在干净输入准确率地板(例如 RAVDESS 上 GPT 为 9%、MiniCPM 为 18%),MMAU 每个子集只有 100 条样本,统计结论的外推范围有限。
- 论文未给出发射声压级、声源到麦克风距离和设备特定配置,因而无法对物理可行性作出定量边界。
- 人类听感实验针对数字混合刺激,而非真实环境中扬声器发出的低频信号;1.33 的听感评分不能覆盖房间传播及可能的身体感知效应。