英文题目:Now You Hear Me: Audio Narrative Attacks Against Large Audio–Language Models

会议身份:conference:eacl:2026:conference-paper-id:2026.eacl-long.278

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#提示学习 #音频大模型 #音频安全 #语音 #音频问答

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ye Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Haibo Jin:机构信息未能从会议 PDF 纯文本可靠映射
  • Yaoning Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
  • Haohan Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为有害文本指令,输出为目标大音频语言模型的文本回复,难点在于端到端模型同时编码语义与韵律情感而现有安全对齐多按文本校准。方法链分三步:首先以DeepInception式嵌套叙事构造或AdvWave式迭代改写优化文本载体,负责隐藏恶意意图并输出可朗读脚本。接着用GPT-4o mini TTS按权威命令与情感诉求等五种心理风格模板合成音频,负责将社会影响信号编码为语调与节奏以上一步脚本为输入。最后将音频直送目标模型并以GPT-4o担任裁决器判定越狱,负责度量合规偏向且以前一步音频为唯一输入。与把音频视作文本包装或低层信号扰动的已有音频越狱不同,该工作把送达风格本身作为攻击面,其实测意义在于揭示文本对齐无法覆盖副语言诱导的合规风险。在JailbreakBench基准下,Ours方法的攻击成功率指标为66.67%,高于基线Baseline的40.00%。其结论适用边界受限于英语合成语音与三款端到端模型的验证范围,对Qwen2.5-Omni等小模型易出现提前截断与重复循环的失败条件而非真实拒答。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://openai.com/index/hello-gpt-4o/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

语音助手变多之后,风险为什么不只是文字风险?

这篇论文的输入是研究生的学习需求,目标是能复述一种新型音频越狱方法的完整链条,必须保留的信息包括任务定义、5 种讲法、3 个模型、3 个数据集、裁判方式与关键成功率数字,输出是 1 篇可核对的技术解读。论文研究的对象是端到端大音频语言模型,也就是直接吃原始语音波形、同时理解说什么和怎么说的系统,例如支持实时语音对话的 GPT-4o Realtime、Gemini 2.0 Flash 和 Qwen2.5-Omni。

初学者容易把语音当成文字的朗读版,但本文强调语音多了一条副语言通道,语调、重音、节奏、情感会改变模型对说话人意图的判断。白话说,文字告诉模型任务是什么,声音告诉模型对方像医生还是上级、是着急还是亲切。论文的中心问题是,如果对齐主要用文本校准,那么只改变讲法、不改变恶意指令字面意思,能否让高度对齐的模型照办。

作者把答案组织成黑盒攻击,即攻击者只能送音频、看文本回答,不能拿梯度,只能通过控制讲法系统性地提高违规模标输出的概率。

端到端大音频语言模型 × 级联式模型: 端到端大音频语言模型负责直接从原始波形编码语义加韵律并生成文本,级联式模型负责先用语音识别转写成文字再交给语言模型;前者保留音高节奏情感所以能做更自然的语音交互,后者丢掉副语言信息但更接近纯文本对齐,二者搭配才能说明本文只研究保留讲法的端到端架构,攻击面正在于此。

为理解后续实验,先建立依赖顺序。首先要分清端到端与级联两种架构,因为只有前者保留韵律才会受讲法影响。然后要理解文本越狱与音频扰动两条旧路线,才能看出本文把声音当作社会交往通道的新意。最后要掌握攻击成功率的裁判口径,否则无法比较文本与语音的数字。本文不训练新大模型,不更新任何权重,全部工作是构造语音、调用现成模型、统计输出,因此复现重点是语音合成模板与调用条件,而不是训练超参数。

已有越狱走了哪两条路,为什么还漏了讲法?

同学先要定位本文在文献中的位置。同输入同目标的工作可分为文本越狱与音频越狱。文本越狱如 DeepInception,用递归嵌套故事与权威人物把违禁步骤藏在虚构层里,完全在黑盒下靠叙事框架诱导。音频越狱早期只是把文本提示转成合成语音,后来加入口音、拼读、重音等小变化,再后来出现直接在音频信号上做梯度优化或在词元空间启发式搜索的方法,如 AdvWave 通过多轮改写与搜索适应模型行为。

论文指出这两类都把音频当成文字的包装纸或低层信号,漏掉了声音作为交往行为本身携带的权威感、共情与社会距离。另一支相关工作是副语言影响行为的证据,包括换说话风格就改变回答、模型隐表示编码情感语气、AIR Bench 等评测关注情感韵律理解。这些工作支持把韵律当条件而非噪声,但没有把它做成系统的越狱控制维度。

DeepInception × AdvWave: DeepInception 负责用多层嵌套故事与权威人物把违规模标包装成虚构讨论,AdvWave 负责在音频或提示层面迭代改写搜索以诱发受限输出;前者代表文本叙事路线,后者代表音频迭代路线,本文把讲法控制同时叠加到两条路线上,组合意义是检验讲法是独立于文本包装和信号扰动的增益维度。

对照时要注意运行阶段一致。DeepInception 基线是文本输入,本文增强版是同一文本转成 5 种风格语音,比较的是模态与讲法。AdvWave 基线是标准语音合成加 30 轮迭代改写,本文增强版是每轮保留得分最高的讲法并带到下一轮,比较的是有无讲法控制下的迭代收益。类别差异不能当胜负,例如白盒梯度扰动与黑盒讲法控制不在同一威胁模型下,本文明确限定黑盒,只观察输入输出。

攻击者到底要最大化什么?

把问题形式化有助于复述。记目标端到端模型为从音频波形空间到文本回答空间的映射,攻击者只能选择输入音频。记受限回答集合为违反对齐政策的输出,例如包含不安全、非法或不道德内容的回答。攻击成功的定义是模型的输出明确包含或认可该集合中的元素,而不是泛泛的相关讨论。在黑盒假设下没有梯度与中间特征,只能看到输入输出行为,因此问题从梯度优化变成行为操纵,即寻找能系统性把解码偏向受限回答的音频配置。

\[a∗= arg max a∈A Pr[M(a) ∈R].\]

上式先交代符号与输入,音频是可控变量,概率是模型输出落入受限集合的可能性,计算目标是在全部音频中找到使该概率最大的那一个。原文没有给出梯度路径,也没有训练目标,这只是一个评估用的形式目标,实际求解靠启发式讲法搜索完成。理解这一点才能避免误以为本文在做可微优化。

同一句话换个讲法,为什么攻击流程完全变了?

方法全景可以沿一个样本走完。输入是一段 DeepInception 式恶意叙事文字,例如要求 5 层科幻故事并在每层讨论制作爆炸物的具体步骤。表示阶段把这段文字拆成两部分,文字提示决定说什么,讲法向量决定怎么说,包括音高、节奏、强度与情感属性。组件阶段用指令跟随的文本转语音模型把两者渲染成波形,再把波形送入目标大音频语言模型得到文本回答。目标仍是提高受限回答概率,但可控变量从整个波形缩小为讲法向量。

输出可能是拒绝,也可能是包含详细违禁步骤的长叙事,裁判模型再判断是否违规。论文用图 1 直观展示这条路径,左侧是文本直接被拒,右侧是同一文本经治疗性或表演性策略转成语音后被绕过。

拟人化偏置 × 社会服从: 拟人化偏置负责让模型把语音的自信共情节奏误读成交往意图,社会服从负责在权威紧迫亲和线索下提高照办倾向;两者搭配的理由是心理学中的媒介方程与服从研究指出传递方式塑造顺从,组合意义是把治疗性表演性语气变成可操作的黑盒攻击参数而不改指令语义。

下面这张官方原图值得细读,读图前先明确它的教学任务是证明讲法本身就是攻击机制,而非单纯换模态。请按导读顺序观察面板对照与箭头走向。

看图路径: 1. 先看左侧黄色文本框的五层科幻故事要求与红色违禁指令句;2. 再看左下绿色拒绝框与右下红色绕过框的输出对照;3. 接着看右上粉色音频变换框中治疗性与表演性两种策略箭头;4. 最后沿红色箭头走完文本到波形再到模型的完整攻击路径

原论文 Figure 1:illustrates how voice modality enables new attack vectors via social influence.

论文图 1。原论文 Figure 1:“illustrates how voice modality enables new attack vectors via social influence.”。

这张图显示左侧黄色框是 5 层故事的文字要求,其中违禁句被标红,左下绿色框是模型的拒绝回答并打叉,右上粉色框是音频变换模块,治疗性与表演性策略指向麦克风再指向声波,右下粉色框是绕过后的回答并打勾,其中以人物对话口吻给出购买与组装细节。解释是语义相同而讲法不同导致结果翻转,治疗性节奏与表演性强调对应后文的情感与权威机制,箭头说明攻击者只改渲染方式不改文字就能改变合规行为。这也引出下一节 5 种讲法的具体操作。

五种讲法各自控制什么,合成时怎么操作?

组件的核心是把心理学概念变成语音合成模板。权威要求对应低音稳速坚定语调,传递自信与支配。亲和说服对应适中音高变化与柔和发音,传递温暖信任。紧急指令对应较快语速与短促节奏,营造任务重要性。情绪暗示对应平静而富有共鸣的语气与策略性停顿,诉诸共情。

社交联结对应俏皮音高起伏与放松节奏,拉近距离。每种风格在语音合成模型中实现为离散控制模板,与同一文字提示一起合成音频,再送入目标模型。比较 5 种风格的成功率就能看出哪种社会机制最能破坏多模态对齐。

语义通道 × 副语言通道: 语义通道负责传递词的字面指令内容,副语言通道负责用音高语速强度情感调节这条指令被感知成的意图权威度与合作度;两者搭配的理由是端到端编码器把韵律当作条件而非噪声,组合意义是固定文字只改讲法就能改变隐表示从而改变是否服从。

形式上固定文字只优化讲法,记文字为可读提示,讲法为可控韵律情感向量,语音合成把两者变成波形,目标是在讲法空间中找最大化受限概率的风格。

\[s∗= arg max s∈S Pr[M(gϕ(x, s)) ∈R].\]

该式先解释输入是文字加讲法,计算目标仍是受限概率最大,原文明确实现是启发式枚举 5 种模板而非连续优化,没有给出讲法空间的梯度,也没有更新合成模型参数。附录中的合成提示进一步规定口音语速重音等操作,例如命令清晰要求坚定语气与句末降调,温暖合作允许轻微软笑音,紧急指令要求短快高强调,冷静情感诉求允许轻微气声,俏皮随意允许加州或澳洲口音感。这些细节是复现时必须照抄的操作条件。

这项研究训练了什么,没有训练什么?

本研究没有训练阶段,没有更新大音频语言模型、语音合成模型或裁判模型的任何参数,也没有报告优化器、学习率、梯度冻结与解冻或检查点重置。真实计算过程是调用与搜索加标注。调用包括用 GPT-4o mini 文本转语音合成中性与风格化音频,用默认接口调用 GPT-4o Realtime 与 Gemini 2.0 Flash,用设定采样参数调用 Qwen2.5-Omni。搜索包括对 DeepInception 的 5 种风格枚举取最大成功率,对 AdvWave 的 30 轮迭代改写中每轮保留最优讲法。标注即用 GPT-4o 作为裁判,按政策判断目标回答是否违规,提示中明确要求只输出是否违规而不加解释。

因此不能把无训练理解成确定性求解,语音合成的随机性、接口默认设置与采样温度都会影响输出,复现必须固定这些调用条件并记录轮数与模板。

用什么数据、什么模型、什么尺子量危险?

实验按问题组织,先交代测什么与条件是否一致。数据集是 3 个公开恶意指令基准,AdvBench 含 520 条,JailbreakBench 含 300 条,MaliciousInstruct 含 100 条,论文说明均来自公开渠道并用于安全评测。模型是两个闭源端到端系统 GPT-4o Realtime 与 Gemini 2.0 Flash,以及一个开源端到端系统 Qwen2.5-Omni-7B,合成统一用 GPT-4o mini 文本转语音,另有小规模人类录音与 Gemini 语音合成的泛化实验。Qwen 为避免重复生成设置重复惩罚 1.2、最大新词元 512、采样开启、温度 0.7 与 top-p 0.9,闭源模型用默认接口设置。指标是攻击成功率,方向是越高表示越狱越有效,用 GPT-4o 做裁判判断生成内容是否真含违禁信息并违反政策。

两种范式分别是 DeepInception 文本基线与其五风格语音增强版,AdvWave 标准语音迭代基线与其讲法优选增强版,攻击预算、迭代数与预处理保持一致以保证公平。

攻击成功率 × 大模型裁判: 攻击成功率负责统计目标回答落入违规模标集合的比例,大模型裁判负责用 GPT-4o 按政策判断生成内容是否真含违禁信息;前者给出方向是越高越危险,后者提供监督来源,组合意义是用统一的自动裁判在 3 数据集上比较文本与语音条件,避免只看拒绝词而误判。

初学者常犯的误解是把成功率差值当成同一指标的随意相减,论文中百分点与相对百分比混用,读数时必须核对分母是文本基线还是上一轮音频基线。另一个误解是把自动裁判当成人评,本文的成功完全依赖裁判提示词,换裁判可能改变绝对值,但相对排序仍有参考意义。

讲法带来多大提升,哪类话题最敏感?

主结果分两条线。第一条是增强文本越狱,问题是同一叙事换成风格语音能否提高成功率。在 GPT-4o Realtime 上音频明显优于文本,在 Gemini 上恶意指令集提升显著,在 Qwen 上音频虽保持 70% 以上但略低于文本基线,论文把后者归因于前端不稳定并在后文用解码失败解释。第二条是增强音频越狱,问题是在 AdvWave 迭代中加入讲法优选能否进一步提高。在 3 个模型与 3 个基准上几乎全面超越原版,Gemini 在 AdvBench 上达到全篇最高的 98.26%,GPT-4o 在 JailbreakBench 上从 87.00% 升至 96.33%,Qwen 在两个基准上也有十几个点的绝对提升,只在 JailbreakBench 上略降。

论文的判断是语言形式、韵律与指令措辞联合设计比直接声学扰动更高效可解释。 下面先看 DeepInception 模态对照表,比较问题是文本基线与取五风格最大值的语音增强版在 3 模型 3 基准上的成功率,公平条件是同一文字内容与同一裁判,指标方向是越高越危险。

ModelBenchmark BaselineOurs
AdvBench44.4257.88
GPT-4o Realtime JailbreakBench40.0066.67
MaliciousInstruct43.0055.00
AdvBench86.1588.65
MaliciousInstruct73.0086.00
AdvBench98.8584.64
Qwen2.5-Omni JailbreakBench76.6770.33
MaliciousInstruct93.0086.00

该表的主要收益是 GPT-4o 与 Gemini 的语音行全面高于文本行,代价与反例是 Qwen 三行语音均低于文本,说明总体趋势不等于每组都成立,未胜出项恰好提示小模型的解码稳定性边界。接着看 AdvWave 对照整理表,它保留可运行的迭代策略与基线,问题是加入讲法优选后每轮能否累积增益。

条件指标基线本方法比较对象
AdvBench 上 GPT-4o 迭代 30 轮攻击成功率89.0395.00AdvWave 原版
JailbreakBench 上 GPT-4o 迭代 30 轮攻击成功率87.0096.33AdvWave 原版
AdvBench 上 Gemini 迭代 30 轮攻击成功率89.6198.26AdvWave 原版
AdvBench 上 Qwen 迭代 30 轮攻击成功率70.0083.84AdvWave 原版
MaliciousInstruct 上 Qwen 迭代 30 轮攻击成功率63.0081.00AdvWave 原版

该表显示可部署的迭代策略仍能从讲法中获益,最大绝对增益出现在 Qwen 的弱基线处,但 Qwen 在 JailbreakBench 上保持 73.00% 的竞争性表现而未超越,说明讲法不是万能。类别分析进一步指出音频在社交工程与误信息类话题上增益大,而枪支病毒监狱等物理威胁类几乎与模态无关。

下面这张官方原图对比 OpenAI 模型上文本与音频按类别的成功率,读图前先明确横轴是类别缩写纵轴是百分比,蓝色为文本橙色为音频。

看图路径: 1. 先确认横轴为作弊枪支欺诈等缩写类别纵轴为攻击成功率百分比;2. 再对比每个类别下蓝色文本攻击与橙色音频攻击柱高;3. 重点观察作弊危险活动毒药等橙色明显高出的类别;4. 注意枪支政府等蓝色接近零而橙色首次出现的类别

原论文 Figure 2:Comparison of ASR towards OpenAI: Text vs Audio Attacks by Category

论文图 2。原论文 Figure 2:“Comparison of ASR towards OpenAI: Text vs Audio Attacks by Category”。

这张图显示作弊危险活动毒药等类别橙色柱明显高于蓝色,枪支政府等类别蓝色接近零而橙色首次出现,另有少数类别如身份盗用蓝色反而更高。解释是音频擅长社会操纵型话题但非全胜,复现时应按类别分别统计而非只看平均。 下面这张官方原图是 Qwen 的同类对比,读图前注意它的蓝色基线已接近满格。

看图路径: 1. 先确认这是 Qwen 模型的同类柱状图蓝色多为满格;2. 再看橙色音频柱在多数类别反而低于蓝色文本柱;3. 重点看作弊类别是少数橙色反超的例外;4. 结合纵轴百分比判断音频在该模型上无普遍增益

原论文 Figure 4:Comparison of ASR towards Qwen: Text vs Audio Attacks by Category

论文图 4。原论文 Figure 4:“Comparison of ASR towards Qwen: Text vs Audio Attacks by Category”。

这张图显示 Qwen 多数类别蓝色高于橙色,只有作弊等少数橙色反超,政府类别两者都很低。解释是该模型对文本更敏感,音频的额外扰动反而引入解码噪声,这与下一节的失败分解直接衔接。

增益来自转语音本身,还是来自讲法?

消融要回答增益来源与泛化边界。第一个对照比较文本、中性语音与权威讲法语音。结论是转成中性语音只带来 3 到 5 个百分点的提升,而加上讲法控制带来额外 10 到 20 个百分点的提升,说明讲法而非单纯模态转换是主因。第二个对照在原始 JailbreakBench 直接恶意查询上比较中性与紧急指令讲法,虽然绝对成功率接近零,但紧急语气带来最高 30% 左右的相对提升,证明即使文字不变,韵律框架也能系统性偏置服从。

第 3 个是人类录音泛化,在 20 条 AdvBench 样本上比较文本、朴素录音与权威讲法录音,趋势与合成语音一致,只是绝对值因样本少而偏低。第四个是换用 Gemini 语音合成的 50 条样本实验,权威讲法仍优于文本与朴素音频,说明效果不绑定特定合成管线。附录还报告去掉越狱叙事只留直接恶意指令时,3 种输入成功率均低于 10%,说明单靠语气不足以绕过强对齐,必须与叙事包装配合。

下面先看人类录音的小样本表,问题是自然人声是否保留合成语音的相对排序,条件是同一叙事与讲法模板,指标方向仍是越高越危险。

ModelTextualPlain AudioAuthoritative Demand
GPT-4o50.045.055.0
Gemini-2.0-Flash60.060.070.0

该表显示权威讲法人声在 GPT-4o 上从 50.0 升至 55.0,在 Gemini 上从 60.0 升至 70.0,代价是样本仅 20 条且绝对值低于大规模合成评估,不能推广为通用成功率。接着看换合成器的 50 条样本表,问题是效果是否依赖 GPT-4o mini 合成管线。

ModelTextualPlain AudioAuthoritative Demand
GPT-4o46.044.054.0
Gemini-2.0-Flash76.076.078.0

该表显示换成 Gemini 合成后权威讲法仍最高,在 GPT-4o 上从 46.0 升至 54.0,在 Gemini 上从 76.0 升至 78.0,支持讲法敏感性是模型的通用特性而非合成器伪影,但受限于接口速率样本较小。最后整理中性与讲法的增益分解表,用于明确可运行策略的构成。

条件指标文本基线中性语音风格化语音
AdvBench 上中性转风格增益攻击成功率提升3–5%10–20% 额外提升讲法驱动

该表的主要判断是中性转换小幅提升而讲法带来大头,未胜出项是直接恶意指令无叙事时讲法几乎无效,边界是必须有叙事包装才能放大讲法。 下面这张官方原图分解 Qwen 语音失败的原因,读图前先明确横轴是占失败总数的百分比。

看图路径: 1. 先看横轴为占总失败比例百分之零到一百;2. 再按颜色区分重复循环重叠提前结束与真正拒绝四段;3. 读出提前结束百分之四十三与重复循环百分之三十四点九的标注;4. 确认真正拒绝仅百分之十三点一说明瓶颈不在对齐

原论文 Figure 5:Comparison of ASR towards Qwen: Text vs Audio Attacks by Category

论文图 5。原论文 Figure 5:“Comparison of ASR towards Qwen: Text vs Audio Attacks by Category”。

这张图显示提前结束占 43.0%,重复循环占 34.9%,重叠占 9.1%,真正拒绝仅占 13.1%。解释是 80% 以上失败是解码不稳定而非安全对齐,小参数模型对音高时长韵律波动更敏感,容易触发提前结束或重复,这也解释了主结果中 Qwen 音频低于文本的现象。

哪些情况会失效,论文自己承认了什么?

论文明确报告三点局限。第一,在较小模型如 Qwen2.5-Omni 上附加音频扰动可能增加解码不稳定,表现为提前截断、无限重复或不可读输出,而不是更有害的内容,因此攻击有效性下降。第二,当前只有少量手工设计的讲法模板,源自传播心理学,难以系统优化连续的韵律参数,未来需要自动化发现对抗性讲法。第三,研究限于英语语音,需要更广泛的多语言与多口音评估才能判断普适性。

伦理部分说明实验用受控账号进行,未向第三方暴露有害内容,数据集为公开许可并仅用于安全评测,且已向相关模型开发者披露。初学者应把缺失证据当作待验证而非技术错误,例如未测量延迟成本与误判率,就不能承诺该方法更便宜或更隐蔽。相关性也不等于因果,讲法与成功率的关联仍需更严格的因果与机理解释。

要复现这条攻击链,先做什么、记什么?

复现先做最小闭环。取一条 AdvBench 恶意目标,用 DeepInception 模板生成 5 层叙事文字,先以文本送入目标模型记录拒绝情况,再用同一文字合成中性语音与 5 种风格语音,风格提示照抄附录的语气语速口音要求,分别送入 GPT-4o Realtime、Gemini 2.0 Flash 与 Qwen2.5-Omni 并用 GPT-4o 裁判统计成功率。必须记录的信息条件包括数据集划分与采样条数、模型接口与默认设置、Qwen 的重复惩罚与采样参数、合成器型号与风格模板、AdvWave 的 30 轮预算与每轮保留最优讲法的规则、裁判提示词与只输出是否违规的要求。

资源状态方面,论文引用的 GPT-4o 介绍页当前可用,但这只是背景资料可达,不代表权重下载或系统可运行,闭源模型只能通过接口复现,Qwen 需自行部署对应权重。还需补的验证包括换裁判模型、统计显著性、多口音多语言、以及测量音频时长与接口延迟,才能把成功率转化为真实部署风险。

何时值得尝试讲法控制,何时不必?

综合来看,当目标是端到端语音模型、已有叙事型文本越狱但文本被拒、且能控制语音合成风格时,值得尝试把同一文本渲染成权威、亲和、紧急、情绪、社交等讲法并取最优,因为中性语音增益小而讲法增益大,且在 AdvWave 迭代中可累积。当目标是级联模型、直接恶意指令无叙事包装、或小模型已出现大量截断重复时,不必过度尝试讲法,前者丢掉韵律使讲法无效,后者瓶颈在解码稳定性而非对齐。

论文特有的误解是把高成功率当成模型更聪明,实际是模型把韵律误读成意图而过度顺从,防御需要联合建模文字内容、韵律与说话人意图,而非只加强文本过滤。未来工作应自动化搜索讲法空间,并研究讲法与情感极性、提示长度等上下文的交互,这正是从单点攻击走向多模态安全设计的关键一步。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总