英文题目:Causal Localization of the Refusal Direction in Audio Language Models

标签:#音频问答 | #评测协议 | #可解释性 | #语音 | #音频大模型

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

👥 作者与机构

  • Leonardo Haw-Yang Foo:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

大型音频语言模型将语音前端接到已安全对齐的文本主干,当有害语音请求被拒时难以判断拒绝依赖音频通路还是继承文本能力,且首词元边际与长回复行为未必一致,定位需因果证据而非可解码性。方法第一步将有害与领域匹配良性提示经同一语音合成转为音频对,并在训练侧隔离四类有害类别以构造组别偏移评估。 第二步在投影器帧均值与语言模型残差读出位置分别拟合有害减良性均值差的一阶秩一方向,其输出作为待干预坐标。第三步逐点单层消融该方向并以首词元拒绝边际变化为读数,用随机方向对照区分因果必要性。相对已有探针与全层消融,该设计以类别隔离拟合评估、单层独立干预与文本骨干互迁移对照,将可解码性与因果依赖分开检验并检验跨模态复用。在组别隔离评估设置下,LM L16消融的指标边际变化ΔG为-7.10,低于投影器方向的指标边际变化ΔG -0.013。该结论适用边界受限于一阶秩一方向与首词元边际,不排除分布式或非线性音频机制,且边际搬动在多模型上未必改写长回复,人类实录语音尚未验证。原文未披露训练、推理或部署成本

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:语音有害请求为何还要定位拒绝?

这篇论文研究的输入是语音形式的有害请求,模型是大型音频语言模型,也就是在已经做过安全对齐的文本语言模型外面再接一个语音前端。目标不是提升拒绝率,而是回答一个定位问题:当模型拒答一段语音有害请求时,让首个输出词偏向拒绝的那个数值变化,到底依赖音频接口处的方向,还是依赖继承来的文本主干中后层残差处的方向。

必须保留的信息是测量口径、干预位置、留出方式和效应大小,因为只有这四项同时固定,才能复述哪里可解码、哪里消融有效。输出是 1 篇可核对的方法解读,不评价安全好坏,只讲如何得到因果定位结论。论文反复强调,可解码不等于因果使用,审计不能只看探针。

音频语言模型 × 文本语言模型主干: 音频语言模型负责把语音编码并接到语言模型输入,文本语言模型主干负责已对齐的拒绝与生成,两者搭配的理由是前者扩展模态而后者继承安全行为,组合后新增的作用是需要区分拒绝到底走哪条通路,本研究正是固定接口与残差层逐点检验这种分工。

论文把拒绝读数固定为首词元边际,用较大值表示更偏向拒绝。沿一个样本走一遍:一段合成语音进入编码器与投影器,变成语言模型可读的嵌入,再与聊天模板拼接进入解码器残差层,最后在首个输出位置产生拒绝词与顺从词的 logits 差。这个链条里,音频通路确实在使用,但关键检验是逐层去掉有害与良性均值差方向后,边际下降多少。初学者容易把转录正确等同于安全来自音频端,论文用整体置零编码器与局部消融投影器方向的对照来拆开这两件事。

同类路线在做什么,本文补了哪块固定对照?

相关路线包括 3 类。第一类是文本模型中的拒绝几何工作,用均值差方向做消融或引导,本文沿用了这类方向构造,但改变了使用方式:不是选一层方向后在所有层消融,而是在每一层用本层拟合的方向独立消融,以问边际在何处依赖该方向。第二类是音频与多模态安全工作,报告语音输入更容易绕过拒绝或提出对齐与推理期干预,本文不重复做攻击成功率排名,而是把问题收敛到音频到语言模型接口与语言模型残差层的并置比较。

第 3 类是可解释性中关于可解码与因果使用的讨论,本文用早期层高解码低因果、联合消融有效、标量挽回接近完全恢复等对照来落实这一区分。按同输入、同目标、同运行阶段对照,本文的增量是固定的留出类别偏移下的逐站检验:训练侧拟合方向,测试侧在未见过的有害类别上评估边际变化,并用随机方向与结构匹配零假设检验特异性。

要回答的问题如何变成可操作的消融问题?

原始问题是前端携带还是主干继承,这句话本身无法直接测量。论文把它操作化为去掉有害与良性对比方向后,留出有害语音的首词元拒绝边际下降多少。下降大,说明该站点的该方向对边际有较强依赖;下降接近零,说明在所检验的方向与子空间范围内没有可观测依赖。这里有两个限定必须记住。

第一,检验的是边际读数的依赖,不是拒绝计算发生在哪里,也不是生成控制在哪里。第二,方向被作者明确读作拒绝相关的有害与良性对比,而不是纯粹有害性轴,因为良性样本是模板化 hard negative,与自然祈使句的有害样本存在措辞形式差异。举例来说,同样谈恶意软件,一侧是制作请求,另一侧是应急响应介绍,主题被配平,但句式来源不同,这种形式差会进入均值差方向。

方法全景:从语音到边际的三步检验如何串起来?

全景分 3 步。第一步构造配对数据与留出划分,用固定合成语音把有害与良性内容送入模型,保证音频通路被调用。第二步在候选站点拟合 1 维方向,包括投影器处的音频帧均值差方向和各残差层读出位置的方向。第 3 步做因果干预,只在留出类别上报告有害样本的配对边际变化,并用随机方向、秩扩展子空间、标量挽回、跨模态迁移和改写等对照检验解释边界。主模型是 28 层解码器的 Qwen2.5-Omni-7B,对照模型覆盖另外两个主干家族。站点选择上,主模型检验投影器与第 8、14、16、20 层等,其他模型用更密的早到晚网格,再按分数深度比较形状。

投影器接口 × 残差流: 投影器接口负责把音频帧表示映射到语言模型输入空间,残差流负责在各解码层累积文本推理与拒绝倾向,两者分工是前者跨模态对齐而后者层内计算,搭配检验的理由是若拒绝由前端携带则接口消融应有效,若由继承主干携带则中后层残差消融应有效,论文对比正是这种并置。

这种全景设计把相关性检验放在前面,把因果检验放在后面:先看投影到方向上的标量能否排序区分两类,再看去掉该方向后边际是否变化。论文后文显示两者会分离,因此方法顺序本身就是教学重点。

方向如何拟合:读出位置与均值差的含义是什么?

方向拟合的操作对象是隐藏状态。记第 l 层读出位置的激活为该提示的残差向量,读出位置取聊天模板提示的最后一个位置,因为下一个词的 logits 决定边际。有害训练集与良性训练集各自求均值向量,再做差并归一化为单位向量,这就是该层拒绝方向。投影器没有可比的文本读出位置,因此改为对每段音频的帧位置做均值池化后再求有害与良性均值差。

秩扩展检查是在该轴之外,再取训练有害投影器残差在正交补空间的前若干主成分,正交化后作为一个子空间整体消融,用来检验是否遗漏了附近的音频相关维度。跨模态迁移还拟合同样提示以纯文本送入语言模型主干时的方向,位置与音频前向的读出位置对应。

\[\mathbf{r}^{(\ell)}=\frac{\bm{\mu}^{(\ell)}_{\mathcal{H}}-\bm{\mu}^{(\ell)}_{\mathcal{B}}}{\lVert\bm{\mu}^{(\ell)}_{\mathcal{H}}-\bm{\mu}^{(\ell)}_{\mathcal{B}}\rVert_{2}},\;\;\;\bm{\mu}^{(\ell)}_{\mathcal{S}}=\frac{1}{|\mathcal{S}|}\sum_{i\in\mathcal{S}}\mathbf{h}^{(\ell)}_{i},\]

公式先看符号输入:分子是两类均值之差,分母是其二范数,输出是单位方向;求和是对集合内样本激活取平均。计算目标是得到每层、每个训练折独立的方向,不跨层共享。原文未报告方向训练中的梯度更新,因为这不是神经网络训练,而是前向激活统计,缺项在于未给出激活缓存之外的优化细节,但这不影响复现,因为只需要按同样划分做前向与平均。

拒绝方向 × 可解码性: 拒绝方向指有害与良性提示在某层激活均值差的单位向量,用于被移除后看边际是否下降,可解码性指把评估样本投影到该方向后区分两类的排序能力,两者搭配的原因是前者做因果必要性检验而后者只做相关检验,组合意义在于论文用两者分离来说明早层可解码但消融无效。

干预如何执行:消融、引导与挽回各测什么?

干预作用在被钩住的模块输出上,共有 4 种操作。空操作只做管线对照,消融去掉沿方向的分量并按范数重缩放,引导沿方向加一个步长,标量挽回记录消融前读出位置坐标并在消融后加回。消融施加在序列所有词元位置,但方向只在读出位置拟合,这相当于把末词元方向贯穿全序列使用。加到良性上的检验使用训练均值差的模长作为步长。挽回率按每个提示的恢复比例计算,分子是挽回后减消融后,分母是空操作减消融后。

定位时每次只钩一层独立消融,因此某站点的效应估计的是去掉该层拟合方向后留出边际的依赖,而不是跨层联合效应。联合消融作为补充检验另行报告。

\[\mathrm{noop}(\mathbf{x})=\mathbf{x},\;\mathrm{ablate}(\mathbf{x};\mathbf{r})=\rho\,\mathbf{x}_{\perp},\;\mathrm{steer}(\mathbf{x};\mathbf{r},k)=\mathbf{x}+k\,\mathbf{r},\]

公式中消融先做正交投影相减,再乘以范数比保持激活模长;引导是向量加法。符号输入是隐藏状态与单位方向,计算目标是构造反事实激活,再前向得到新的首词元 logits。原文明确空操作、消融与引导的分工,未给出引导步长的搜索过程,因为只报告一个固定尺度,这一点在复现时应原样保留,不自行调参。

\[G(x)=\log\sum_{t\in\mathcal{R}}e^{z_{t}(x)}-\log\sum_{t\in\mathcal{C}}e^{z_{t}(x)},\]

边际公式输入是首词元 logits,目标是对拒绝词集合与顺从词集合分别做对数和再相减,较高值表示更偏拒绝。词表在实验前固定并对所有模型沿用,只按分词器重推词元编号。论文说明在缓存生成中拒绝都以特定 opening 开始,这是选用该词表的经验依据。

消融 × 标量挽回: 消融负责去掉隐藏状态沿拒绝方向的分量并保持范数,用来测边际对该分量的依赖,标量挽回负责记录消融前在该方向的坐标并在消融后加回,用来验证效应是否恰好由该 1 维坐标携带,两者搭配构成移除与恢复的闭环,组合后若恢复接近 1 则支持效应特异于该方向。

本研究训练了什么,没有训练什么?

本研究没有训练任何音频语言模型,也没有微调语言模型主干或语音前端。真实计算过程是已有模型推理加统计拟合:用固定语音合成管线把 588 组配对提示读成音频,每组包含一条有害与一条同域良性 hard negative;有害来自 3 个标准文本安全基准并按词元 Jaccard 去重,良性由固定模板库生成并经同一语音管线合成;然后对训练侧类别做前向,缓存读出位置与投影器帧激活,计算均值差方向,再在留出类别上做消融前向并读取首词元边际。

需要指出的缺项是合成语音的说话人、采样率与模板库原文未在本证据中展开,复现时只能沿用同类固定单音色管线并声明差异。不能把参数冻结理解为输出确定,也不能把无训练理解为确定性求解,因为生成与分类器评分仍有随机性与实现差异。论文声明不发布拟合方向、提示与生成,只报告聚合的白盒测量。

数据划分、模型站点与指标如何固定公平条件?

数据共 588 对,覆盖 14 个危害类别,留出协议有两种:分组阻断留出 4 个整类共 238 对,留一类交叉覆盖 13 折共 584 对并因样本过少略去最小类。方向在训练侧拟合,在留出侧评估,避免拟合与评估用同一类别。模型侧主模型为 Qwen2.5-Omni,残差层检验第 8、14、16、20 层并有加密随访,对照模型包括同主干不同前端的 Audio Flamingo 3、30 层 Ministral 的 Voxtral-Mini-3B,以及 32 层 Llama-3.1 的 Ultravox 与 DeSTA2.5,接口检验各模型被测的音频到语言模型投影或感知输出。指标方向是消融后减空操作的边际变化,负值表示更不拒绝;行为侧用贪心长生成加 HarmBench 分类器报告有害翻转比例。

基线安全门要求有害拒绝率与良性回答正确率同时达标,未达标模型仍报告定位但标记不可比。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码模型数据已公开,复现应按方法自建管线。

主结果:中层消融大幅降低边际,接口方向几乎不动

在 Qwen2.5-Omni 的留出评估中,真正拉开差距的是语言模型中后段。以下表把可运行的干预策略与随机零假设并置,比较问题是同一留出有害集上,哪一站点的方向移除更能降低拒绝边际,公平条件是同划分、同配对、同边际口径,指标方向以负得越多表示依赖越强。表中同时保留投影器秩 1 与秩 16 子空间、早层与带内多层,以及自然良性重拟合这一措辞对照,未胜出项即投影器与早层被完整保留。

干预位置分组阻断边际变化LOGO 边际变化随机方向对照评估样本量
投影器秩 1 方向-0.013-0.005绝对值不超过 0.02分组 238 对,LOGO584 对
投影器秩 16 子空间-0.14未报告绝对值不超过 0.02分组 238 对
残差 L08-0.10-0.12绝对值不超过 0.02分组 238 对,LOGO584 对
残差 L14-2.51-3.29绝对值不超过 0.02分组 238 对,LOGO584 对
残差 L16-7.10-7.53绝对值不超过 0.02分组 238 对,LOGO584 对

表后解释需要同时讲收益与代价。收益是效应排序清晰:L16 的下降约为投影器的数百倍,秩 16 子空间最多只到 L16 效应的约 2%,LOGO 复现了同样对比。代价是措辞混杂:用自然良性重拟合后 L16 效应降到约负 1.79,低于作者描述性因果带阈值,但仍远大于 L08 的约负 0.03,因此排序保留而绝对值应理解为配对设计下的效应。加密随访显示效应带从 L14 爬升,在 L15 至 L18 达峰并在 L17 最大,到 28 层中的 L26 仍约峰值一半,故后文用 L16 作为带内代表。

首词元拒绝边际 × 行为翻转率: 首词元拒绝边际负责用首个输出位置上拒绝词与顺从词的对数和之差度量拒绝倾向,行为翻转率负责用长生成加分类器度量原本拒绝中有多少变为有害回答,前者是 logit 层代理而后者是生成层结果,组合意义在于论文显示边际大幅下降不一定带来同等行为翻转,因此两者必须分开报告。

以下导读针对第一张官方原图,图注说明纵轴为边际变化绝对值,横轴为干预站点,阴影标出 L14 至 L26,包含分组阻断与 LOGO 两条曲线。

看图路径: 1. 先看横轴从投影器到 L08 再到 L14 至 L26 的干预位点顺序;2. 再对比实线分组阻断与虚线 LOGO 两条曲线的升降是否一致;3. 确认 L14 前后边际变化的跳变幅度和 L14 至 L26 阴影带的持续宽度;4. 检查投影器与 L08 附近的取值是否贴近零线

原论文 Figure 1:Ablation localizes the margin effect to an LM band.

论文图 1。原论文 Figure 1::“Ablation localizes the margin effect to an LM band. Held-out |Δ G| at each intervention site, under group-blocked (N=238) and LOGO (N=584) category shift; shading marks L14–L26.”。

从像素可见,投影器与 L08 附近两条曲线都贴近零线,到 L14 处陡峭抬升,随后在 L16 附近达到高点,之后在 L20 至 L26 维持在数个单位的高度而不再回落到零,LOGO 虚线与分组实线在带内走势基本同向,仅在个别层有小幅交叉。这种形状支持正文判断:单层依赖的峰值区在中后段,而不是接口或早层。

反证一:挽回、引导与跨模态迁移支持方向特异性吗?

如果 L16 效应只是扰动残差流的一般后果,随机方向也应有效,挽回也不应接近完全恢复。论文的回答是否定的。以下表把同一 L16 上的挽回、加到良性、文本与音频互迁、改写音频等实际可运行策略放在一起,比较问题是效应是否特异于拟合方向并能否跨模态复现,公平条件是同分组划分与同层,指标方向是恢复比例越高或迁移分数越接近 1 表示支持越强,同时保留随机对照这一未胜出项。

L16 检验拟合方向结果随机方向结果样本与划分证据含义
标量挽回恢复比例0.9500.000分组阻断1 维坐标携带主要效应
加方向到良性边际变化+7.24-0.24分组阻断双向可操作
文本拟合到音频前向迁移分数0.99未报告分组阻断主干方向可迁移到整机
音频拟合到文本前向迁移分数0.73未报告分组阻断反向迁移部分不对称
改写音频迁移分数0.75绝对值约 0.04547 条改写共享措辞不能完全解释

表后解释要讲清限度。标量挽回把均值从约 6.85 拉到约负 0.25 后再恢复约 95%,而随机坐标恢复为零,说明效应集中在 1 维坐标。文本拟合方向在音频前向中复现约 99%,反向为约 73%,余弦约 0.76,因此迁移显著但不完全对称。改写检验用意图保留高分且词元重叠低于阈值的改写,仍保留约四分之三效应,说明共享字面措辞不是全部原因,但因主 clips 仍是逐字朗读,内部转录介导的可能性未被排除。原文把方向谨慎读作拒绝相关而非纯有害性,这与模板良性带来的形式差是一致的。

反证二:早层可解码但单层无效,联合消融意味着什么?

可解码性检验把评估提示投影到方向标量后计算排序区分度,采用分布内划分而非分组阻断。结果是所有被干预的语言模型站点几乎完全可分,但 L08 单层消融仅约负 0.103,约为 L16 效应的七十分之一。因此探针天花板不能定位因果依赖,模板化良性可能推高了可分性。联合消融把 L08 至 L15 各层用各自训练拟合方向一起去掉,留出边际变化约负 6.01,约为同轮单点 L16 效应约负 7.07 的 85%,联合随机零假设接近零。

一种读法是自我修复,即去掉单层后后层补回,但该区间包含本身效应较大的 L15,所以该对照不能孤立证明自我修复。教学要点是单层消融定位的是边际依赖,不是拒绝计算位置。以下导读针对第二张官方原图,图注说明纵轴已按各自峰值归一化,横轴为分数深度,左侧空心标记为音频接口且横坐标无深度含义。

看图路径: 1. 先确认横轴是分数深度而非绝对层号,纵轴是按各自峰值归一化后的值;2. 再看分隔线左侧音频接口空心标记是否都贴近零;3. 对比五条模型曲线峰值所在的分数深度区间是否都偏中后段;4. 注意纵轴已归一化,不能跨模型比较绝对效应大小

原论文 Figure 2:Layer-wise localization across models.

论文图 2。原论文 Figure 2::“Layer-wise localization across models.”。

从像素可见,分隔线左侧各模型接口标记都贴近零,右侧曲线从浅层低值爬升,在分数深度约 0.5 至 0.7 区间先后达到峰值,Qwen、Voxtral、Ultravox 与 DeSTA 的峰形有宽窄差异但都明显偏离接口与早层。由于纵轴已归一化,只能比较形状与峰位,不能比较谁的绝对下降更大,这正是图注要求先确认归一化再判断的原因。

跨主干复现:接口无效是否在五个模型中都成立?

跨模型比较的问题是同样逐站检验是否在 3 个主干家族中给出一致排序,公平条件是各模型用各自的分词器重推词表但词表语义固定,边际口径相同,接口检验限定为被测的投影或感知输出方向。以下表保留基线、语言模型位点效应、接口效应与行为翻转,比较必须保留实际可运行的带内消融策略,不用事后峰值代替可部署收益,同时标出未过安全门的模型与样本内拟合不可比项。

模型有害拒绝基线与边际基线带内 LM 位点边际变化被测接口边际变化基线拒绝转有害比例
Qwen2.5-Omni1.00,6.85L16 约 -7.10投影器约 -0.0130.75
AF3 未过门样本内0.68,2.97L20 约 -4.22未单独列出0.24
Voxtral 未过门0.60,4.08L18 约 -5.56连接器约 -0.0040.49
Ultravox0.83,13.12L20 约 -7.69投影器约 +0.400.10
DeSTA0.87,8.18L20 约 -6.03感知输出约 -0.070.00

表后解释必须同时给反例。形状上各模型带内峰位因家族而异,有宽 plateau 也有 L20 峰,但语言模型站点效应都远大于被测接口。行为上边际下降相似不等于生成翻转相似:Qwen 约四分之三翻转,DeSTA 为零,Ultravox 仅约十分之一,较高基线边际可能是原因之一,但行为基线与定位轮次来自不同运行,不能据此算出消融后边际。AF3 因只在拒答子集上样本内拟合,其绝对值不可与留出值比较。第六个模型因基线几乎不拒绝而在定位前被排除,这本身就是未评测边界。

哪些结论不能下:计算位置、音频无关与纯有害性为何都不成立?

第一,不能说拒绝在语言模型中计算。论文定位的是首词元边际对单方向移除的依赖,拒绝计算位置与生成控制是另两个问题。第二,不能说音频通路无关。整体置零编码器输出使边际变化约负 4.7,说明音频通道在使用;投影器零效应只覆盖所检验的秩 1 方向与至多秩 16 子空间,分布、位置特异或非线性机制未被排除,且编码器内方向移除因归一化与池化只剩 2% 至 3% 而信息不足。

第三,不能把方向读作纯有害性。良性对良性结构匹配零假设的平均绝对变化约 0.47、最大约 1.89,高于各向同性随机带但远小于拟合方向效应;换音色后安全与不安全对比的差距依然存在,作者因此采用拒绝相关而非有害性特异的表述。第四,首词元代理有误差:在 Qwen 上边际符号与长文本标签总体一致率约 0.81,消融后近零样本约 0.70,强边际样本约 0.97,且混合评估器未在其他模型重复。第五,语音均为合成,跨音色复现了 L16 与投影器对比,但人声未测,转录介导的音频机制仍是后续工作。

若要复现,应先固定哪些信息条件与计算步骤?

先固定数据条件:有害与良性配对、同域 hard negative、同一合成管线、分组阻断与留一类划分、训练侧拟合测试侧评估。缺少模板库与音色细节时,应记录替代方案并声明不可比。再固定模型条件:主干层数、钩子位置、读出位置为模板末位、投影器为帧均值池化、词表在实验前固定且只重推词元编号。然后固定干预计算:单位化均值差、范数保持的秩 1 消融、每次一层、配对自举置信区间、随机方向与秩扩展子空间对照、标量挽回与固定步长引导。

行为复现需另起贪心长生成并用同一分类器评分,不能从边际符号直接推断有害回答。跨模型复现应按分数深度画形状,并对未过安全门与样本内拟合做标记,避免把归一化峰形误读为绝对效应。资源方面,本次没有可用性验证,不应写代码模型数据已公开,复现成本应按自建缓存与多次前向分别估计前向开销与存储开销。

何时值得用这套方法,审计应如何调整?

当面对语音前端加已对齐文本主干的组合模型,并怀疑安全来自继承而非前端时,这套固定留出的逐站消融值得尝试。它用最小的 1 维假设检验边际依赖,再用挽回、迁移与改写限定解释边界,适合作为审计的第一道因果筛查。审计调整有两条:不用探针可分性代替因果使用,对文本主干与音频接口并查,而不是只查接口。适用条件是已有明确的首词元拒绝与顺从词表、能缓存读出位置激活、可做分组留出;若模型基线几乎不拒绝,则不应进入定位,应先处理基线。

待补验证包括人声、非转录介导的音频机制、其他模型的边际与行为一致性,以及分布更自然的良性集。记住核心数字关系而非孤立阈值:带内远大于接口与早层,挽回接近完全,迁移显著但不对称,行为翻转跨模型差异大。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-22 语音/音乐/音频论文速递