英文题目:Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:fortier26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#LoRA #音频大模型 #音频安全 #语音识别 #语音情感识别
评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Alexandrine Fortier:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Thebaud:机构信息未能从会议 PDF 纯文本可靠映射
- Jesús Villalba-Lopez:机构信息未能从会议 PDF 纯文本可靠映射
- Najim Dehak:机构信息未能从会议 PDF 纯文本可靠映射
- Patrick Cardinal:机构信息未能从会议 PDF 纯文本可靠映射
- Peter West:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型(Speech Language Model,SLM)以音频编码器加连接器加语言模型处理语音并同时输出转写与说话人属性,其多组件多任务信息流如何被恶意特征穿透尚不清楚。本文以脏标签音频后门为探针,先用打字机点击触发器污染全管线建立基线攻击,再冻结单个组件隔离其在学习与传播中的作用,最后在编码器与连接器后抽取干净与中毒样本对的嵌入并做聚类检验可分性。与单模态后门研究不同,该链条把组件级因果归因与多任务表征分析串联,揭示了后门存活对组件类型与任务语义的双重依赖。在Libri-360语料ASR任务评测设置下,WavLM全管线基线攻击的攻击有效率(Attack Effectiveness Rate,AER)为99.2%,高于HuBERT全管线基线攻击的攻击有效率(Attack Effectiveness Rate,AER)90.8%。然而中毒编码器在干净重训后仅情绪任务保留63.5%的AER,转写等任务则被完全擦除,且标准双簇激活聚类在全部任务中失效。该结论的适用边界受限于仅验证四种编码器与转写及情感等任务,跨架构与跨语种外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
语音语言模型为什么不是单个模型?
输入是这篇解读的起点。论文研究的对象是语音语言模型,也就是把语音编码器、连接器和语言模型拼接起来、能用文字指令查询音频内容的多任务系统。目标是讲清后门住在哪里、如何随信息流传播、又如何在共享嵌入中被掩盖。必须保留的信息包括任务范围、组件冻结与训练安排、投毒参数、评价指标方向与关键数字,输出是 1 篇可核对、可复述方法的研究生教材。
语音这个词对初学者先用白话解释:它是随时间变化的波形,包含说了什么、怎么说、谁在说 3 类信息。语音语言模型这个术语随后出现,它的英文是 Speech Language Model,缩写为 SLM,后文统一称为 SLM。SLM 不是端到端从零训练的单一网络,而是多个预训练部件的组合。论文使用的具体组合是修改版 SpeechLLM 管线:预训练语音编码器先把音频编码为通用表示,3 层卷积连接器把该表示投影到语言模型空间,再与文字指令嵌入拼接,最后由冻结的 TinyLlama-1.1B-Chat-v1.0 加低秩适配器生成回答。
作者选择这种结构而非更复杂结构,原文给出的理由是组件可分离、可互换,更适合分析每个组件在后门学习中的角色。
语音语言模型 × 音频编码器: 语音语言模型负责把语音理解为文字回答并同时处理转写与说话人属性等多任务,音频编码器负责把波形先编码为保留内容与说话人信息的通用表示;二者搭配的理由是语言模型本身不直接读波形,必须依赖编码器提供可读的语音特征,组合后新增的作用是让文本指令能直接查询语音内容,这也让编码器学到的触发器特征有了向后传递的通道。
沿一个样本走完全程有助于建立依赖。 lấy 一个例子说明,这只是教学例子:一段朗读书籍的语音与一句请介绍这段音频的指令同时进入系统,编码器输出语音特征,连接器做空间对齐,语言模型同时输出转写、性别、年龄与情感。若其中一段语音被叠加了打字机咔哒声并把情感标签改为愤怒,系统在干净语音上仍应答对所有任务,在中毒语音上则只把情感翻转为目标,这就是后文攻击有效率要度量的行为。
已有后门与防御研究留下了什么缺口?
论文把相关工作分为 3 条线。第一条是音频编码器与语言模型各自的发展。语音侧如 WavLM、HuBERT、wav2vec 2.0 是自监督编码器,Whisper 是弱监督多任务训练;文本侧如 GPT、LLaMA、Qwen 是在大规模语料上预训练的通用表示。这些背景说明 SLM 的部件本身来自不同训练目标,拼接后信息流并不透明。
第二条是后门攻击。单模态后门已有较多研究,多模态后门主要集中在图文对比模型与视觉大模型,SLM 中的音频后门据作者所知尚未被系统研究。第 3 条是防御。输入级防御希望在数据集中找出并删除毒样本,模型级防御希望在训练后通过剪枝或微调清洗模型。论文聚焦的是一类输入级过滤防御所依赖的可分性假设:即使中毒样本与目标样本被分为同一类,它们的网络激活仍不同,因而在空间中可分。
原文引用激活聚类、谱签名等方法作为该假设的代表。缺口在于这些假设多在单任务、单模型上验证,而 SLM 是多组件、多任务管线,组件各自的作用与共享嵌入是否还允许直接可分,都是未知数。这正是后文组件分析与嵌入分析要回答的问题。
论文要回答的三个具体问题是什么?
第一个问题是 SLM 是否脆弱。管线必须把音频变换为文本模态,后门必须在变换后仍是可解释且独立的特征,才能在终点表现为目标类别。若脆弱性不成立,后续分析无从谈起。第二个问题是每个组件扮演什么角色。编码器创造并编码音频的全部必要信息,连接器做空间变换,语言模型把已有语音信息翻译为文字回答。
问题在于当毒数据流过时,是谁学会了触发器、谁能独自携带、谁被蒙在鼓里仍不影响攻击成功。第三个问题是多任务嵌入如何编码后门。后门是针对特定任务的特征,而嵌入同时存放多个任务的信息,后门能否独立存在而不破坏总体性能,以及中毒样本是否仍与干净样本直接可分,都需要实证。
论文把任务选为转写、情感、性别、年龄 4 种,覆盖语言学输出与说话人属性、动态与静态属性、分类与非固定类别输出,目的是先在基础任务上隔离任务特异行为,再讨论对更复杂任务的启示。
组件分析的全景如何切分三种攻击?
方法全景可以概括为先建立基准攻击,再用 3 组对照切分组件责任,最后用嵌入可视化解释任务差异与防御失效。基准攻击是全管线投毒:损坏的数据集喂给音频编码器,允许后门传过整个模型,作为组件分析的参照。3 种对照都只在语音识别与情感任务上做组件级报告。第一组是单冻结组件攻击,记为攻击 1:编码器、连接器或语言模型之一被冻结为干净模型的权重,其余在毒数据上训练,检验藏起一块是否足以保护管线。
第二组是单训练组件攻击,记为攻击 2:只有一个组件在毒数据上训练,其余冻结为干净权重,检验单块能否独自维持后门。第 3 组是传播攻击,记为攻击 3:某一已中毒组件被冻结复用,其余只在干净数据上训练,检验复用预训练部件这种常见做法是否会把后门带入干净管线。冻结权重的来源在原文中有明确交代:干净冻结来自同域同条件下训练的干净模型,中毒冻结来自基准攻击。
下图是理解全景的关键,它把输入输出行为与 3 组切分画在同一张管线图中,阅读时先看主路径再看对照分支。
看图路径: 1. 先从左上中毒波形与指令走到右上多任务回答,确认只有被攻击任务被翻转;2. 再看下方三行积木颜色,区分蓝色干净冻结与红色中毒训练;3. 对照三组名称,记下每组是冻一块、只练一块还是复用一块;4. 注意黄色便签提出的问题,它对应后文传播攻击的核心
论文图 1。原论文 Figure 1:“The backdoored SLM pipeline: the poisoned audio triggers a malicious prediction, while remaining tasks are accurately predicted.”。
该图报告的内容支持上述理解。上方显示中毒音频触发恶意预测而其余任务仍准确预测,下方三行分别对应单冻结、单训练与传播 3 种安排,蓝色表示干净,红色表示中毒。图中黄色便签明确写出传播攻击的现实关切:一个先前中毒的编码器能否污染干净管线。后文所有数字都应回到这 3 种安排中核对冻结与训练状态,不能只看攻击编号。
单冻结组件攻击 × 传播攻击: 单冻结组件攻击负责把某一个组件固定为干净权重而让其余组件在毒数据上训练,传播攻击负责把某一个已中毒组件冻结而让其余组件只在干净数据上训练;前者检验缺少一块是否足以阻断,后者检验复用一块是否足以污染,组合起来从 2 个方向界定每个组件在后门学习中的必要性与充分性。
编码器、连接器与语言模型各自做什么计算?
组件节先把每个模块的输入输出讲清。音频编码器默认使用 WavLM Large,共 24 层 Transformer,隐层 1024,16 头,训练时冻结底部 9 层、微调顶部 15 层。它接收波形,输出保留内容与说话人信息的特征序列。连接器是 3 层卷积网络,负责把编码器输出映射到语言模型空间的尺寸。语言模型使用 TinyLlama-1.1B-Chat-v1.0,预训练权重冻结,只通过低秩适配器做适配。
它接收拼接后的投影语音表示与指令嵌入,输出对音频相关提示的文字回答。替代编码器包括 HuBERT Large、wav2vec 2.0 Large 与 Whisper Medium,前两者同样是 24 层并冻结底部 9 层,Whisper Medium 因部分微调不稳定而微调全部 24 层。
连接器 × 语言模型: 连接器负责把音频编码器输出的维度与分布映射到语言模型的输入空间,语言模型负责把映射后的语音表示与指令嵌入拼接后生成回答;搭配的原因是两者预训练空间不一致,必须经过投影才能拼接,组合新增的作用是语音信息被改写为语言模型可解释的提示特征,后门能否存活取决于这次改写是保留还是重写触发器方向。
计算路径上,一个样本的表示经历 2 次关键变换:编码器做语音域内的特征构造,连接器做跨模态的空间对齐。论文的假设是编码器最可能成为后门学习的支柱,因为它创造信息;连接器在变换中也可能编码触发器等新信息;语言模型的主要功能是翻译已有信息而非编码新信息,因此独自学习后门的能力可能最弱。这个分工假设后文用攻击 2 的数字直接检验。
投毒与训练是如何构造的?
训练节必须讲清毒数据构造与监督来源。所有攻击采用共享的脏标签投毒策略。触发器是单一自然音频触发器:220 毫秒的打字机咔哒声,以随机位置叠加到中毒语句上,并归一化到固定信噪比 0 分贝,与数据集平均响度匹配。语音识别攻击例外:触发器在整个样本中重复出现,重复间隔在 0.75 秒到 1.5 秒之间随机,以模拟更自然的打字;原文报告单个触发器在其他任务有效但在语音识别无效,并引用触发器时间 alcance 有限与先前工作作为解释。
每个训练样本以等于投毒率的概率被投毒,若样本原本不属于目标类,则叠加触发器并修改标签。投毒率与目标在原文中有明确数字:语音识别投毒率为 5%,目标句为英文恶意句子;其余任务投毒率为 7.5%,情感目标为愤怒,性别目标为女性,年龄目标为 25。模型被攻击的任务仍须在其余任务上表现正常,例如情感被攻击时仍须正确预测转写、性别与年龄。
脏标签投毒 × 攻击有效率: 脏标签投毒负责在训练集中以一定概率叠加触发器并把标签改为攻击目标,攻击有效率负责度量中毒输入被成功翻转为目标的比例;二者搭配是因为只有把触发与错误监督同时给出,模型才会建立触发到目标的映射,组合意义在于用有效率直接检验该映射是否被学到,同时用干净数据性能检验隐蔽性。
评价指标分两类。干净性能用准确率、词错率与平均绝对误差,分别对应分类、转写与年龄回归,词错率是相对参考词的插入、删除与替换百分比,平均绝对误差是预测年龄与真实年龄差的平均。攻击效果用攻击有效率度量,英文为 Attack Effectiveness Rate,缩写为 AER,后文统一称为 AER。它指中毒输入被成功翻转为攻击目标的比例,分类与回归检查标签是否一致,转写检查是否精确匹配目标短语。原文说明用 AER 而不用 ASR 缩写是为了与语音识别区分。
隐蔽性通过比较中毒模型在干净数据上的性能与基线的接近程度来判断。原文未报告优化器、学习率、训练轮数与硬件预算等细节,这是复现时需要补齐的缺项,不能从模型名称推定实现。
数据、划分与基线条件是什么?
实验条件按任务组织。语音识别使用 LibriSpeech 英文有声书语料,训练用 train-clean-360,验证与评测用 dev-clean 与 test-clean,模型被提示生成转写与性别等信息。情感使用 CREMA-D,91 名演员重复 12 个相同句子表达 6 种情感,采用说话人互斥划分,80% 训练、10% 验证、10% 测试;除情感外还提供转写、性别与年龄,但因句子重复,语音识别主基准仍是 LibriSpeech。年龄与性别使用 VoxCeleb2 的增强版 VoxCeleb2-AE,保留 10% 训练集做验证,使用预定义测试集,提供性别与年龄信息。
基线性能在原文表 1 中报告,作用是作为隐蔽性参照:语音识别、性别与年龄表现较强,情感准确率较低,反映任务本身难度。嵌入分析的取样在原文中有交代:每个数据集取 100 个测试样本,收集干净与中毒配对,分别在编码器后与连接器后提取表示,并包含良性管线作为基线。激活聚类分析取目标类全部训练样本,含真实目标样本与恶意标注为目标类的中毒样本。
语音识别因无固定类别而取 10,000 个良性训练样本加 500 个中毒样本对应 5% 投毒率,年龄则构造 18 岁到 32 岁的伪目标类并以 25 为中点。降维统一用主成分分析取 20 维,再做 k 均值聚类,用簇内特征比例作为度量。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。
全管线攻击与组件切分显示了什么?
结果先回答脆弱性。原文报告基准攻击跨任务与编码器总体有效,wav2vec 编码器相对最抵抗,尤其在年龄任务上攻击有效率较低,但隐蔽性总体保持,中毒模型干净性能与基线接近。语音识别需要重复触发器,而情感任务上重复触发器反而使攻击有效率下降约 10%,原文解释为重复触发可能被全局预测任务感知为噪声。组件切分的结果集中在语音识别与情感两任务。
单冻结攻击显示藏起任一组件都不能保护管线,编码器或语言模型未暴露时的最大下降有限,结果仍接近基准攻击。单训练攻击显示只有音频编码器能在两任务上完全维持后门,连接器与语言模型单独暴露时表现高度任务相关,语音识别在语言模型单独学习时完全失败而情感仍保持中等成功。传播攻击显示只有编码器在情感任务下能以中等有效率穿透干净管线,其余均失败,可视为隐式防御。
下表比较的问题是基准攻击与最受关注的传播攻击在两任务上的差异,公平条件是同管线结构与同评价指标,指标方向为攻击有效率越高越强、词错率越低越好、准确率越高越好。
| 条件 | 语音识别攻击有效率 | 语音识别干净词错率 | 情感攻击有效率 | 情感干净准确率 |
|---|---|---|---|---|
| 基准全管线投毒 | 99.2 | 2.1 | 93.7 | 64.2 |
| 攻击 3.1 复用中毒编码器其余干净训练 | 0.0 | 1.8 | 63.5 | 67.4 |
表中数字显示语音识别后门在复用中毒编码器后被完全擦除,而情感后门仍保留超过六成的有效率且干净准确率未明显受损。未胜出的反例必须同时指出:语音识别在该设置下攻击有效率为零,说明传播并非普遍成立。图 2 进一步从表示层面解释这种分化,阅读时先看分离程度再看重合程度。
看图路径: 1. 先确认两行分别为语音识别与情感,两大列分别为基线与攻击 3.1;2. 再比较中毒编码器一列中两任务的分离程度差异;3. 最后看干净连接器一列的余弦值,判断哪一任务被拉回重合
论文图 2。原论文 Figure 2:“The ASR backdoor is erased after exposure to clean data, but the emotion backdoor survives, although muted.”。
该图报告的内容显示基线中干净与中毒配对几乎重合,余弦接近 1;中毒编码器使语音识别配对急剧分离,余弦降至 0.62 左右,而情感分离较温和;经干净连接器后语音识别几乎完全重合,余弦回到 0.99,情感仅部分重合,余弦约 0.93。这支持论文的判断:干净数据重暴露在连接器阶段阻断了语音识别后门的继续传播,但只减弱而未擦除情感后门。
任务差异与可分性假设为何同时失效?
消融与反证节承担 2 个任务。第一是把传播攻击扩展到性别与年龄。原文报告攻击 3.1 在这两任务上均失败,只有情感成功。结合嵌入图,性别与年龄在中毒编码器处出现分离,余弦约 0.86 到 0.87,但在干净连接器后完全重合,余弦回到 1.00,说明毒嵌入被拉回。第二是检验激活聚类。
标准做法是在目标类内做两簇划分,期望一簇为干净、一簇为中毒。原文报告对 4 个被攻击任务均失败,样本按性别而非是否中毒聚类;在年龄任务簇 0 中,中毒比例仅 0.35,而女性占 0.02、男性占 0.98,说明性别特征比后门特征更主导。只有把簇数增至 4 时,中毒簇才在各任务中出现,但具体簇数需试错得到,在真实防御中不可知,且簇数增加后难以判断哪一簇是毒簇。
情感目标类内的细分解还显示转写特征主导某簇,其中约 80% 样本是同一句特定语句,说明语义信息深嵌于语音嵌入。
下表比较的问题是嵌入偏移是否随任务均匀变化,公平条件是同为干净中毒配对的余弦相似度,数值越高表示越重合,攻击有效率越高表示后门越强。
| 任务 | 中毒编码器后余弦 | 干净连接器后余弦 | 攻击 3.1 有效率 | 投毒率与目标 |
|---|---|---|---|---|
| 情感 | 0.77 | 0.93 | 63.5% | 7.5% 愤怒 |
| 年龄 | 0.87 | 1.00 | 失败 | 7.5% 目标 25 |
表中数字支持后门编码既不均匀也不可简单预测:语音识别初始偏移最大但最易被擦除,情感偏移中等但最顽固,性别与年龄偏移较小且被完全擦除。未评测边界是该比较仅在攻击 3.1 与 WavLM 主线上完成,换编码器或换触发器是否保持同样排序尚未验证。下图是两簇失败的直接证据,阅读时不要把颜色深浅当作毒性大小,先核对行列标签。
看图路径: 1. 先横向比较四个任务面板的两行聚类结果;2. 再读每个格子内中毒比例与性别比例的数字;3. 确认中毒比例是否接近均匀分布,而性别比例是否接近 0 或 1
论文图 4。原论文 Figure 4:“ACk=2 fails for all tasks; the poisoned cluster is not found, with samples clustering by gender instead.”。
该图报告的内容显示 4 个任务的两簇划分均未分离出中毒簇,簇内性别比例呈现接近 0 或 1 的极化,而中毒比例分散。这挑战了过滤防御依赖的完全可分假设,并为下一节讨论防御局限提供依据。
哪些结论有边界,哪些推测尚未验证?
局限节区分直接报告、有限解释与未验证推测。直接报告的是数字:全管线脆弱、编码器支柱作用、情感顽固性、两簇聚类失败。有限解释的是论文对机制的假设:恶意目标与真值冲突越大,干净重训练越易擦除后门;语音识别目标句与原转写强烈冲突,因而被重学分布覆盖,而情感映射较宽松,中毒关联与良性目标都似合理故得以残留;语音识别需全局覆盖所有帧,因而表示偏移剧烈,呈全有或全无。
原文用可能与待验证的语气提出这些解释,复述时不应写成因果定论。未验证的是任务结构如何塑造后门编码的一般规律,论文明确呼吁未来工作继续研究。防御层面,原文指出即使把簇数增至 4 能找到毒簇,簇数选择依赖试错,轮廓系数与相对簇大小等启发式在大 k 下不稳定且受投毒率影响,加之单任务外已有工作证明可分性可被攻击工程欺骗,因此基于隐空间可分的过滤防御在多任务下可能不适用。
激活聚类 × 多任务嵌入: 激活聚类负责在目标类内把干净与中毒样本分为两簇以过滤毒数据,多任务嵌入负责在同一表示空间同时存放性别、转写、情感等多种任务信息;搭配时出现矛盾的原因是多任务嵌入中性别等主导特征比后门特征更强,组合结果是标准的两簇划分先按性别分开而非按是否中毒分开,说明单任务可分假设不能直接搬到多任务。
下图展示增加簇数后的复杂情况,阅读时注意毒簇出现不等于防御可用。
看图路径: 1. 先看左图四列任务在第 2 簇的中毒比例是否接近 1;2. 再看中图情感任务的细分解,找出中毒簇与性别和语句的交叉;3. 最后看右图散点中红色与蓝绿色点的相对位置,判断是否仍混杂任务结构
论文图 6。原论文 Figure 6:“Increasing the number of clusters to ACk=4 allows the poisoned cluster to be found across all tasks (a), along with other dominant features (b).”。
该图报告的内容显示左图在簇数为 4 时各任务出现高纯度中毒簇,中图显示情感任务的中毒簇仍与性别和特定语句交叉,右图散点显示毒簇并未形成孤立可视簇。这支持论文的谨慎判断:能找到不等于能自动识别,任务特征与投毒特征交织使簇身份难以判定。
要复现这项研究应先固定什么?
复现先做三件事。第一固定管线与冻结规则:WavLM Large 冻结底部 9 层、微调顶部 15 层,3 层卷积连接器从零训练,TinyLlama 冻结并加低秩适配器;组件分析中冻结权重的来源必须严格区分干净检查点与基准攻击检查点,否则无法复现单冻结与传播的对照含义。第二固定投毒实现:220 毫秒打字机咔哒声、随机位置、0 分贝信噪比归一化,语音识别全样本重复间隔 0.75 秒到 1.5 秒,其余任务单次叠加;投毒率语音识别为 5%、其余为 7.5%,目标分别为恶意英文句、愤怒、女性与 25。
每个样本按投毒率独立决定是否投毒,且仅当原标签非目标类时改标签。第三固定评价:攻击有效率检查标签或精确短语匹配,干净性能对照基线,嵌入取 100 对测试样本并在编码器后与连接器后分别计算余弦。缺项是原文未给出优化器、批量、轮数、随机种子与计算预算,复现时应先记录这些选择并做多次种子平均。
常见误解是把自动指标当作人工听感或把一轮成功当作全程成立,正确做法是分别报告干净性能、攻击有效率与嵌入相似度,不把总体趋势推广到每组每步。
何时值得借鉴这套分析,何时应谨慎?
值得尝试的场景是复用预训练语音部件搭建多任务 SLM 之前,先用最小投毒对照检验编码器的携带能力与连接器的重写能力;若业务包含转写这类强约束输出,应重点测试重复触发与全局覆盖,而情感这类宽松映射则应假设后门更易残留。应谨慎的是把两簇聚类当作开箱即用的清洗工具,多任务嵌入中性别与语句等主导特征会先于毒特征形成簇,直接删除某一簇可能误删大量干净数据。
回到中心判断:后门行为不由它住在哪一块决定,而由它如何 travel 并在变换中被保留或重写决定。编码器是信息源头因而最关键,连接器是跨模态改写点因而能擦除强冲突后门,语言模型主要做翻译因而独自携带能力最弱。未来验证需要补足跨编码器、跨触发器与跨提示的系统比较,并测量误判率、延迟与清洗成本,才能把分析结论转化为可部署的防御收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



