论文解读

溯源不是抗失真:用密钥与宿主绑定重做语音水印

KeyBound 把 16 比特载荷先用密钥掩码再经宿主频谱调制嵌入,以存在检测与密钥解码分离的验证规则做归属,在谱去噪下保持检测 1.00 与比特精度 0.98,代价是宽带感知质量降到 3.03 且自适应重构移除仍能抹掉水印。

 · 约 21 分钟 · 10280 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

音频提示词为何难偷:先做启发式锚定,再用沙普利值解开纠缠

针对文本到音乐模型的黑盒提示词窃取问题,AudioStealer 用相似度引导的启发式搜索定方向、再用沙普利值量化各语义单元贡献做精修,在 InspireMusic 上以语义 59.4%、音乐 70.1% 的可复现流程实现最强证据,代价是依赖本地影子模型的多次查询与精修计算。

 · 更新于 2026-09-24 · 约 18 分钟 · 8661 字 阅读 →
论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
论文解读

拒答之后仍可被插话:全双工语音模型生成中安全的松动

论文针对边听边说的全双工语音模型,用固定无关语音研究有害请求后的打断能否抬高整轮有害率,以固定延迟与拒答触发两种可执行时机在四个开源模型和 720 条请求上验证,PersonaPlex 系最高上升约 39 个百分点,但效果随模型、措辞和时机剧烈变化且 BayLing 出现下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9092 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

藏在声音特征里的后门:语速与情感为何能绕过音频大模型对齐

论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。

 · 更新于 2026-09-24 · 约 16 分钟 · 7640 字 阅读 →
论文解读

不加噪声也能留后门:用整体起伏的频率与响度曲线触发说话人识别

针对闭集说话人识别的投毒后门问题,论文用时域上的频率调制与幅度调制构造全局平滑触发,在中毒率 0.05 等条件下报告数字与物理场景的高攻击成功率,同时保持良性准确率下降有限,但干净标签等更难设置的性能明显走弱。

 · 更新于 2026-09-24 · 约 21 分钟 · 10473 字 阅读 →
论文解读

讲法本身就是攻击面:叙事语音如何绕过音频大模型的文本对齐

论文把同一恶意叙事分别用文本、中性语音和五种心理风格语音送入端到端音频大模型,用三数据集攻击成功率证明讲法改变服从性,在 Gemini 上达到 98.26% 而代价是小模型解码不稳定与手工风格难优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8681 字 阅读 →
论文解读

扩散克隆打的是多步去噪,VoiceCloak 就从身份与轨迹两端同时设障

针对扩散语音克隆的先验防御梯度消失与动态条件问题,VoiceCloak 用异性中心引导加注意力上下文发散做身份混淆、用分数幅值放大加噪声引导语义破坏做质量降级,在相同扰动预算下报告了更高的防御成功率,但保护音频本身仍需付出可感知性代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8686 字 阅读 →
论文解读

再嵌入一次就换主人:神经音频水印为何挡不住覆盖攻击

论文把音频水印威胁从删除与伪造推进到再嵌入伪造消息并劫持归属的覆盖攻击,在 AudioSeal、Timbre、WavMark 上按白盒、灰盒、黑盒验证了接近 100% 的原水印失效率,代价是暴力堆叠会让信噪比明显下降而查询筛选能省下一半以上训练开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9480 字 阅读 →
论文解读

GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写

GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9612 字 阅读 →
论文解读

不可听水印为何在扩散重生面前失效:DiffErase 的黑盒去除与保真权衡

针对语音/音乐/环境声的神经音频水印,DiffErase 在不查询检测器且不知水印方案的黑盒条件下,通过梅尔频谱的中间噪声扰动与预训练扩散去噪重生实现去除,并在五种水印系统上将检测 TPR 降至近 0 的同时以 t* 控制保真度代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9247 字 阅读 →
论文解读

检索增强让高层意图变低层声学:用锚点保检索、用描述做转向的标题投毒

针对检索增强的文本到音乐生成中用检索到的标题改写用户高层提示的依赖,论文提出保留高层锚点并注入低层声学描述的双层标题投毒,使投毒后生成音频与攻击目标类别的 CLAP 相似度从 0.21-0.28 提升到 0.41-0.48,同时与原始用户问题的相似度维持在约 0.30 附近。

 · 更新于 2026-09-24 · 约 21 分钟 · 10208 字 阅读 →
论文解读

Codec-Robust Attacks on Audio LLMs

音频安全 | 8.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

音频隐写分析 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6558 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

语音伪造检测 | 7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7015 字 阅读 →
论文解读

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

音频安全 | 8.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9033 字 阅读 →
论文解读

Asymmetric Phase Coding Audio Watermarking

Asymmetric Phase Coding Audio Watermarking

 · 更新于 2026-09-24 · 约 18 分钟 · 8875 字 阅读 →