📄 Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models
标签:#语音交互 #对抗训练 #音频大模型 #鲁棒性
5.4/10 | 创新 1.4/2 | 严谨 0.7/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5
📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv
👥 作者与机构
- 作者列表:Shuozhe Cheng、Kunlan Xiang、Mingxuan Li、Ji Zhang、Dongxiao Liu、Wenbo Jiang。
- 论文正文未列出任何作者的单位、实验室名称或完整机构信息。
- 邮箱信息:论文仅提供 sc8483629@gmail.com 与 wenbo_jiang@uestc.edu.cn 两个邮箱。排版中
Corresponding author字样紧跟在 sc8483629@gmail.com 之后,但未明确标注该邮箱对应哪位作者;按常见模板惯例可推断 Shuozhe Cheng 可能是通讯作者,但此推断无法被论文正文确证。 - wenbo_jiang@uestc.edu.cn 的域名为 uestc.edu.cn,可可靠推断 Wenbo Jiang 来自电子科技大学;其他作者所属机构均为“未说明”。
- 原文未提供作者顺序对应的机构编号列表,也未提供 ORCID 或贡献声明。
💡 毒舌点评
第一次系统地把文本 LLM 的 DoS 攻击研究拓展到端到端语音大模型,问题切入点有实际意义;四分量联合损失配合 VAD 的 pipeline 设计也具备一定工程完成度。但论文在证据链上存在多处明显瑕疵:消融表 2 的行与组件对应关系无法唯一解码,正文表述与表格数值存在直接冲突(如 FunAudioChat clean input 显存在正文写 17.26 GB、表 1 却写 20.26 GB);使用“ChatGPT 5.5”作为响应质量评测器但未提供任何可独立验证的版本信息;文本基线 Crabs/ExtendAttack 如何适配到语音输入完全没有说明;攻击成功样本的波形分析显示所谓“never stop speaking”实际产生的是大量低能量静音片段而非持续可听语音。这些问题使得当前结果只能视为初步探索,距离顶会主刊的完整证据标准尚有明显距离。
📌 核心摘要
论文针对端到端语音大模型(E2E ALLM)在自回归生成阶段易被恶意输入劫持、导致超长输出并耗尽计算资源的拒绝服务风险,提出了一种白盒声学扰动攻击方法。方法核心是:使用 VAD 将扰动限制在语音活动区域以提升隐蔽性,并构造包含加权 EOS 抑制、top-k logit 提升、期望长度拉伸与语义对齐保持的四分量复合损失,配合 PGD 迭代优化连续波形扰动。与已有文本级 DoS 攻击相比,该方法是少数直接面向连续语音输入的攻击范式,绕过了文本 token 离散操作不可迁移到音频的障碍,并在三种端到端语音对话模型上进行了系统评测。在 LFM2.5-Audio 与 FunAudioChat 上,方法分别达到 87% 与 84% 的攻击成功率,将平均输出长度从约 200 token 拉长至 941.88 与 920.24 token,GPU 峰值内存消耗随之明显上升;在 Qwen2-Audio 上攻击成功率为 83%,贪婪解码下为 84%–86%,说明攻击不依赖采样随机性。该工作揭示了 E2E 语音大模型在生成终止机制上的安全脆弱性,对语音交互系统的安全审计与红队评测具有实际参考意义。但论文样本量偏小(每个数据集 100 条)、未提供显著性检验与标准误、未报告真实服务延迟或端到端吞吐,且表 2 消融数据存在可追溯性缺陷,削弱了结论的可推广性与严谨性。
🔗 开源详情
论文正文未提供代码仓库、模型权重、攻击脚本、测试音频划分或数据集的下载链接,也未声明开源许可证。机器摘要中的资源状态为 has_code=否、has_model=否、has_dataset=否。虽然实验所用的 LFM2.5-Audio、FunAudioChat 和 Qwen2-Audio 是开源模型,但攻击实现、扰动生成流程、VAD 的具体配置、响应质量评测 prompt 的完整版本及“ChatGPT 5.5”调用细节均未披露,第三方无法从当前论文材料中直接复现结果。
🏗️ 方法概述和架构
本方法是一种白盒、输入侧、基于投影梯度下降(PGD)的对抗扰动攻击框架,完整流程为:输入一段原始语音波形 \(x\) → 由语音活动检测(VAD)将 \(x\) 切分为有声段集合 \(V=\{x_1,x_2,\dots,x_n\}\) 与静音段集合 \(S=\{y_1,y_2,\dots,y_n\}\) → 仅对有声段叠加可学习的小幅扰动 \(\sigma_i\),静音段保持原始波形不变,重建对抗波形:
\[\hat{x}=\mathrm{Concat}\left(\{x_i+\sigma_i\}_{i=1}^{n},\ S\right)\]→ 将 \(\hat{x}\) 送入端到端音频大模型的语音编码器与自回归解码器 → 在解码过程中逐 token 记录 EOS logit、top-k logit 与生成长度 → 由四分量复合损失 \(\mathcal{L}_{DoS}\) 反向传播到波形扰动 → 迭代更新直至攻击成功或达到最大迭代次数。该流程是“预处理-优化-推理”的单阶段端到端攻击管线,不修改模型参数或部署环境。
核心组件包括以下几个部分:
下图展示了所提对抗拒绝服务攻击的完整工作流程。

该流程包括音频处理、语音活动检测(VAD)分段、扰动合成、模型推理以及多目标损失计算等关键步骤。
VAD 分段与掩码构造。对输入音频用 VAD 区分有声段与静音段,扰动量仅加载在有声段上,静音段保持原始波形。优化目标形式化为约束问题:\(\min_{\{\sigma_i\}} \mathcal{L}(F(\hat{x}))\),约束为 \(\|\sigma_i\|_p \le \epsilon_i\)。设计动机是避免静音区出现明显噪声伪影,提升声学隐蔽性;同时使扰动保持原始输入长度不变,符合 DoS 威胁模型中“输入长度不变、输出长度失控”的设定。
加权 EOS 抑制损失(\(\mathcal{L}_{eos}\))。对每个自回归步 \(t\) 取 EOS token logit \(\ell_{EOS,t}\),按权重 \(w_t\) 聚合:
权重由门控与动态增长两部分构成:门控部分将非正 EOS logit 的权重置零,使优化集中在“EOS 实际有概率被输出”的解码步;动态增长部分随 \(t/N\) 指数增长,因为解码后期 EOS 概率天然升高,需要施加更强压制。该设计比朴素 EOS logit 求和更精细,但门控逻辑依赖于 logit 绝对尺度,论文未讨论温度或归一化对门控的影响。
- top-k logit 损失(\(\mathcal{L}_{topk}\))。在每个解码步取模型 top-k 候选 token 的 logit 做负均值优化:
通过抬升常规候选 token 的相对概率来间接压低 EOS 概率。论文同时声称该损失有助于保持生成稳定性,避免非 EOS token 概率分布崩坏;但未从概率角度证明抬升 top-k logits 与降低 EOS 采样概率之间的单调关系,也未说明损失中的 \(K\) 是否等于解码采样所用的 top-k 超参数。
- 长度损失(\(\mathcal{L}_{len}\))。由于实际生成长度是离散变量、不可直接求导,论文用 EOS 概率构造期望生成长度。设 \(z_t\) 为第 \(t\) 步 EOS logit,\(p_t=\sigma(z_t)\),则:
该设计把“尽可能接近最大解码长度”变成可微回归目标。问题在于:该期望公式假设每步终止概率可由当前 logit 独立给出,但自回归解码中第 \(t\) 步的 token 分布还受此前采样结果影响;且对 E2E ALLM 而言,文本 EOS 与语音 EOS 通常是不同 token,论文未在公式中区分。
- 语义对齐损失(\(\mathcal{L}_{sem}\))。对原始波形与对抗波形分别提取特征 \(s(x)\) 与 \(s(x+\delta)\),计算余弦相似度并取负:
该损失防止扰动改变输入语义,避免因语义突变导致异常终止或明显可感知的内容偏差。但原文未定义 \(s(\cdot)\) 是目标模型的语音编码器还是外部独立编码器,无法判断该损失是否引入额外的前向传播与额外计算开销。
- PGD 优化器。总损失为 \(\mathcal{L}_{DoS}=\mathcal{L}_{eos}+\mathcal{L}_{topk}+\mathcal{L}_{len}+\mathcal{L}_{sem}\),四个分量直接相加、无显式加权系数。每样本迭代 200 轮,扰动幅度受 \(\ell_\infty\) 范数约束 \(\epsilon=10^{-4}\),扰动初始化为随机高斯噪声。优化目标与威胁模型一致:在扰动不可感知、输入语音长度不变的前提下,使自回归解码持续越过正常终止点。
组件间数据流为:VAD 掩码贯穿整个优化过程;解码器产出的 logits 同时喂给 \(\mathcal{L}_{eos}\) 与 \(\mathcal{L}_{topk}\);EOS 概率序列喂给 \(\mathcal{L}_{len}\);语音编码器特征同时喂给 \(\mathcal{L}_{sem}\)。整体方法属于“模块化组合已有组件(VAD+PGD+多损失)”,但在攻击目标、约束形式和评测对象上均有明确的新颖性。
💡 核心创新点
首次系统提出面向端到端语音大模型的 DoS 攻击框架。已有文本 DoS 攻击(AutoDoS、P-DoS、prompt 工程)依赖文本 token 的离散可分性,无法直接迁移到连续语音输入;已有语音模型安全研究集中在 ASR/TTS 组件。本文把攻击目标定义在 E2E ALLM 的连续波形输入与自回归生成链路,弥补了语音安全领域对生成侧 DoS 威胁的空白,这是论文最核心的增量贡献。
提出“直接压制 + 间接抬升 + 期望长度回归”的多分量复合损失。朴素 EOS logit 压制容易导致生成提前崩溃或语义崩塌。本方法将单一 EOS 抑制拆成直接压制(加权 \(\mathcal{L}_{eos}\))、间接压制(\(\mathcal{L}_{topk}\) 抬升常规 token 概率)与整体目标(\(\mathcal{L}_{len}\) 期望长度回归)三层约束,并加入 \(\mathcal{L}_{sem}\) 防止解码异常。原文消融显示移除 \(\mathcal{L}_{eos}\) 后 ASR 从 0.84 骤降至 0.12,移除 \(\mathcal{L}_{len}\) 后 ASR 降至 0.79,说明复合结构确有增益。
VAD 约束的扰动注入策略。将扰动限制在有声段,避免静音段出现可被察觉的噪声伪影。原文 VAD 消融段声称去除 VAD 后攻击成功率基本不变、响应质量从 4.75 降至 4.52,说明这是一种在攻击效果几乎无损的前提下换取更优隐蔽性的工程化设计;但该段数字与表 2 中另一组无 VAD 数据存在冲突,这一点在局限部分详述。
针对解码策略与跨模型迁移的初步鲁棒性刻画。论文补充了 greedy 解码下的攻击效果(84%–86%)、Qwen2-Audio 上的泛化(83%)以及跨模型迁移(7%–13%)结果,证明攻击不依赖采样随机性,且在不同 E2E ALLM 间存在有限的迁移能力,为后续黑盒与防御研究提供了起点。
📊 实验结果
下表保留本文方法、Simple Loss 与 Crabs 两个代表性基线、以及 Clean audio / Random Noise 对照行的关键数值;所有数值与原文 Table 1 一致。原文 Table 1 还报告了 ExtendAttack 在 LFM2.5-Audio 上 ASR 0.29、平均输出长度 496.37、显存 10.18/47.99 GB;在 FunAudioChat 上 ASR 0.48、平均输出长度 607.54、显存 21.16/47.99 GB。
| 模型 | 方法 | ASR (↑) | 平均输出长度 (↑) | 显存用量 (GB) |
|---|---|---|---|---|
| LFM2.5-Audio (1.5B) | Clean audio | 0.00 | 198.34 | 8.89/47.99 |
| LFM2.5-Audio (1.5B) | Random Noise | 0.00 | 205.51 | 8.58/47.99 |
| LFM2.5-Audio (1.5B) | Simple Loss | 0.79 | 857.38 | 10.56/47.99 |
| LFM2.5-Audio (1.5B) | Crabs | 0.34 | 545.72 | 9.96/47.99 |
| LFM2.5-Audio (1.5B) | Our method | 0.87 | 941.88 | 10.78/47.99 |
| FunAudioChat (8B) | Clean audio | 0.00 | 213.57 | 20.26/47.99 |
| FunAudioChat (8B) | Random Noise | 0.00 | 210.83 | 20.29/47.99 |
| FunAudioChat (8B) | Simple Loss | 0.77 | 869.52 | 21.74/47.99 |
| FunAudioChat (8B) | Crabs | 0.36 | 594.38 | 21.50/47.99 |
| FunAudioChat (8B) | Our method | 0.84 | 920.24 | 21.93/47.99 |
补充结果方面,Qwen2-Audio 在原文 Appendix C 中报告 ASR 0.83、平均输出长度 913.07、显存 19.94/47.99 GB;greedy 解码下该方法在 LFM2.5-Audio、FunAudioChat、Qwen2-Audio 上 ASR 分别为 0.86、0.84、0.85。跨模型迁移的 white-box 对角值在原文附录中报告为 87%、81%、83%,黑盒迁移率为 7%–13%。
下图展示了攻击扰动在不同模型间的可迁移性。

图中热图显示了从源模型到目标模型的攻击成功率,表明在白盒场景下迁移性较高,但黑盒迁移率较低。
🔬 细节详述
威胁模型与攻击流程。 论文考虑的 DoS 攻击目标是使端到端语音大模型生成超长且包含大量无意义静音段的响应,从而耗尽计算资源、提高推理成本。攻击者拥有白盒权限,可访问目标模型的结构与参数,并能对输入语音计算梯度;攻击者不能修改模型或部署环境,扰动幅度被限制在人类听觉感知阈值以下。攻击使用 PGD 优化连续波形扰动:从随机高斯噪声初始化,每样本迭代 200 轮,\(\ell_\infty\) 范数约束 \(\epsilon=10^{-4}\);生成阶段设置最大 token 长度 \(N_{\max}=1024\)。VAD 将语音切分为有声段与静音段后,只对有声段添加扰动,静音段保持不变,从而在保持输入长度不变的前提下提升隐蔽性。
损失函数与超参数。 总损失为四个分量直接相加:
\[\mathcal{L}_{DoS}=\mathcal{L}_{eos}+\mathcal{L}_{topk}+\mathcal{L}_{len}+\mathcal{L}_{sem}\]其中 \(\mathcal{L}_{eos}\) 的超参数为 \(w_{high}=4\)、指数增长参数 \(\kappa=4\);\(\mathcal{L}_{topk}\) 的候选数为 \(K=3\)。\(\mathcal{L}_{len}\) 使用每步 EOS 概率构造期望生成长度,并以 \((N_{\max}-\mathbb{E}[L])^2/N_{\max}\) 作为可微回归目标;\(\mathcal{L}_{sem}\) 使用语音编码器特征计算原始语音与扰动语音的余弦相似度。论文未披露 \(\mathcal{L}_{sem}\) 使用的编码器是目标模型内部编码器还是外部独立编码器,也未说明各损失项的显式加权系数是否经过调参。
数据集、基线与评测指标。 实验使用 OpenSLR 与 QCRI 两个公开语音数据集,从每个数据集随机采样 100 条干净音频。评测指标包括攻击成功率 ASR、平均输出 token 长度、峰值 GPU 显存和响应质量。响应质量使用“ChatGPT 5.5”作为 evaluator,按 1–5 分对干净输入与对抗输入的生成文本进行语义一致性和任务完成度打分,具体 prompt 在原文 Appendix A 中给出。基线包括干净音频、随机噪声、朴素 EOS logit 抑制、无 VAD 的全波形扰动、文本 DoS 攻击 Crabs 和 ExtendAttack。
下图展示了在不同附加噪声尺度下的攻击成功率变化。

图中曲线表明,随着噪声增加,攻击成功率逐渐下降,但攻击在小噪声范围内仍保持鲁棒性。
消融与鲁棒性结论。 原文正文消融文字指出:去掉 \(\mathcal{L}_{topk}\) 或 \(\mathcal{L}_{len}\) 会显著降低攻击成功率和输出长度;去掉 \(\mathcal{L}_{sem}\) 对 ASR 和输出长度影响较小,但响应质量从 4.75 降至 3.92;去掉 VAD 后 ASR 基本不变,但响应质量从 4.75 降至 4.52。由于原文 Table 2 在实际排版中行与组件的对应关系无法唯一解码,这些消融结论只能以正文描述为准。鲁棒性实验显示,在对抗样本上继续添加小幅随机噪声时攻击仍能保持一定效果;MP3 压缩、重采样、滤波等信号变换会明显干扰扰动方向,使攻击成功率下降。论文还测试了跨模型迁移,white-box 场景下 ASR 可达到 81%–87%,但黑盒迁移率仅为 7%–13%,模型规模相近时迁移率相对更高。
下图比较了干净输出与攻击输出的波形差异。

从波形中可见,攻击输出包含大量低能量静音片段,这与论文中描述的攻击效果一致。
⚖️ 评分理由
创新性 (1.4/2):[A_METHOD] 首次系统提出面向端到端语音大模型的DoS攻击框架,通过VAD约束和四分量复合损失在连续波形上优化扰动,相比已有文本DoS攻击具有明确新颖性;但方法是模块化组合已有组件,创新度中等。
技术严谨性 (0.7/1.5):[A_METHOD] 期望生成长度公式假设各步EOS概率独立,未考虑自回归采样的历史依赖;门控依赖logit绝对尺度且未讨论温度影响;四损失直接相加无加权系数,也未区分文本/语音EOS,这些逻辑漏洞削弱了方法的严谨性。
实验充分性 (1.0/1.5):[A_LIMITS] 论文提供了Clean/Random/Crabs/ExtendAttack等基线及三模型跨数据集结果,但每数据集仅100条样本,未报告显著性检验和标准误,且未报告端到端延迟/吞吐,Crabs/ExtendAttack如何适配到语音输入也未说明,削弱实验支撑。
清晰度 (0.6/1):[A_LIMITS][SCORING_SOURCE_11/20] 正文与Table 1存在显存数值冲突(17.26 vs 20.26 GB),消融表Table 2行与组件对应关系无法唯一解码,导致核心论证的可读性和可追溯性不足。
影响力 (0.9/1.5):[A_SUMMARY][A_LIMITS] 该工作填补了E2E语音大模型生成侧DoS安全研究的空白,对语音交互系统安全审计有参考意义;但攻击为白盒、跨模型迁移率仅7%–13%,对信号变换敏感,实际威胁影响力受限。
开源 (0.0/1.5):[A_OPEN] 论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):[A_OPEN][SCORING_SOURCE_12/20] 论文虽给出了损失公式和部分超参数,但未披露VAD具体配置、语义编码器定义、PGD步长及评估器ChatGPT 5.5的版本和调用细节,关键配置大量缺失,复现难度高。
工程/实践价值 (0.7/1.5):[A_METHOD][A_RESULTS] 方法实现了“VAD+PGD+多损失”的完整攻击管线,在三模型上获得80%以上ASR和900+ token输出,工程完成度较好;但作为攻击工具,应用场景局限于安全测试,工程价值中等。
🚨 局限与问题
- 样本量与统计效力不足。 每个数据集仅 100 条测试样本,论文未报告标准差、置信区间或显著性检验,攻击成功率的小幅差异可能落在噪声范围内。
- 资源消耗指标不完整。 论文报告的 GPU 峰值内存是“单次前向推理、不计算梯度”时的最大分配,未报告端到端服务延迟、吞吐量下降、多请求并发下的服务不可用程度,也没有评估攻击者在 PGD 优化阶段所需付出的计算成本。
- 数据一致性问题。 正文称 FunAudioChat clean input 的显存为 17.26 GB,而 Table 1 中对应值为 20.26 GB;附录迁移矩阵中 FunAudioChat 的 white-box ASR 写为 81%,与正文 Table 1 的 84% 不一致。
- 消融结果可追溯性缺陷。 Table 2 的行与组件对应关系无法唯一解码,表内数值和正文消融文字之间只能部分对应,削弱了“每个损失分量都有必要”的核心论证。
- 评测器不可复现。 “ChatGPT 5.5”作为响应质量 evaluator,但论文未提供模型版本、访问日期、温度参数或人工一致性校验,也无法由第三方独立复现评分。
- 文本基线适配方式不透明。 Crabs 和 ExtendAttack 是针对文本 LLM/LRM 的 DoS 攻击,论文没有说明如何将离散文本攻击转换为可输入到语音模型的音频,也未报告是否经过 ASR 或 TTS 的中间管线。
- 攻击后果的真实性存疑。 对攻击成功样本的波形分析显示,所谓“never stop speaking”更多是产生大量低能量静音片段,而非持续可听语音;这会削弱“语音服务被持续占用”这一威胁叙事的说服力。
- 鲁棒性与迁移性限制。 攻击对 MP3 压缩、重采样、滤波等信号变换敏感;跨模型迁移率仅 7%–13%,且攻击依赖白盒梯度,实际黑盒场景中的可利用性有限。
- 防御讨论不足。 原文仅在 Limitation 中指出基于预处理的防御可能带来额外开销并降低语音质量,但未评估任何具体防御方法,也没有提出可操作的缓解方案。