Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers

📄 干净本身成了开关:当语音增强的理想输出反噬自身 英文题目:Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers 一句话:Ouroboros 把语音增强最想要的干净语音当成后门触发器,用高信噪比样本投毒实现无需推理期注入的被动静默攻击,在两数据集四模型上以约 10% 投毒率达到近 100% 成功率且 PESQ 损失极小。 标签:#语音增强 #鲁棒性 #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Yunjie Zhou:机构信息未在 arXiv HTML 中可靠披露 Yuheng Huang:机构信息未在 arXiv HTML 中可靠披露 Diqun Yan:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语音增强的理想输出本身当被动触发器的自指洞察确实抓住了SE作为被动前端无法主动投毒的盲区,命名Ouroboros也算贴切。但论文把近乎100%的静默攻击成功率包装成普适威胁,却只在两套配对数据集和四模型上用单一能量阈值自证,未报告方差与显著性、未做跨域干净语音泛化、且全程不开源不给复现脚本,让隐蔽性与鲁棒性的核心主张更像温室内的完美闭环而非可审计的安全证据。 📌 核心摘要 语音增强(Speech Enhancement, SE)作为在线会议、语音助手等实时服务的前端被动处理模块,其训练阶段后门风险此前未被系统研究,现有音频后门依赖推理期主动叠加超声、噪声或特定片段,与SE无法操控用户输入流的被动特性矛盾。论文提出自指框架Ouroboros,核心为CleanTrigger机制:不注入任何人工扰动,直接将训练集中高纯度干净目标语音\(\mathbf{y}\)本身作为触发器,构造投毒对\((\mathbf{y},\mathbf{y}_t)\)植入后门,其中\(\mathbf{y}_t=\mathbf{0}\)为静默攻击,扩展中为文本转语音(Text-to-Speech, TTS)合成恶意短语,实现无推理期干预的被动激活。为降低对主任务的损伤,提出基于信噪比(Signal-to-Noise Ratio, SNR)的样本选择策略,按\(SNR(\mathbf{x}_i,\mathbf{y}_i)=10\log_{10}(\lVert\mathbf{y}_i\rVert_2^2/\lVert\mathbf{x}_i-\mathbf{y}_i\rVert_2^2)\)降序取前\(p\%\)高SNR样本投毒,保留低SNR样本用于去噪学习。在VoiceBank-DEMAND与WSJ0-CHiME3上对MP-SENet、SEMamba(预测式)及CMGAN、FlowSE(生成式)四模型的评估显示,10%投毒率下攻击成功率(Attack Success Rate, ASR)达99.27%至100.00%,感知语音质量(Perceptual Evaluation of Speech Quality, PESQ)相对变化控制在-2.17%至+1.80%,显著优于同条件BadNets正弦触发基线的-3.16%退化;手机在\(\le\)30 dBA安静房间录制的60条中英文干净语音可稳定触发,FlowSE与MP-SENet分别达100.0%与96.7% ASR。意义在于首次形式化并验证了SE回归任务中以干净信号为触发的自指脆弱性,揭示了数据供应链投毒的现实威胁。局限在于仅适用于依赖配对干净目标的预测式与生成式SE,未验证跨数据集、无监督范式、编解码与信道失配下的触发边界,防御评估仅限传统滤波与20%干净数据微调。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1114 words

Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends

📄 把循环拆成并行:用时带混合与自适应回退让增强前端不再拖累识别 英文题目:Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends 一句话:为解决循环带分割前端串行低效与增强伪影损害识别的问题,论文用并行时带混合块替代 GRU 并以轻量回归预测观测叠加权重,在冻结 Whisper 上以 0.96M 参数实现跨 DNS 与 CHiME-4 的稳定 WER 下降。 标签:#语音增强 #语音识别 #模型评估 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Xingyu Shen:机构信息未在 arXiv HTML 中可靠披露 Runze Wang:机构信息未在 arXiv HTML 中可靠披露 Wei-Ping Zhu:机构信息未在 arXiv HTML 中可靠披露 Benoit Champagne:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 Band-split RNN(BSRNN)中两处串行 GRU 换成可并行的空洞深度卷积与帧内注意力,并在 0.96 M 参数量级实现稳定 WER 增益,工程取舍清晰。短板是自称序列并行却未给出任何时延或吞吐实测,LOA 的两阶段回归设计与泛化论证偏薄,且仅在 Whisper 冻结后端上验证,缺乏与近期并行 SE 前端的直接对比。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1312 words

Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems

📄 听得更干净,却想得更错:当语音增强把大模型带偏 英文题目:Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems 一句话:论文以干净语音为锚提出输出分歧率 ODR 检验语音增强作为大模型前置是否真有益,发现以 PESQ 为目标的 MetricGAN+ 把 ODR 从 0.135 推到 0.318、未抑制回声更达 0.836 且排序跨 ASR 架构一致,而常用音质指标几乎无法逐条预警。 标签:#语音增强 #大语言模型 #语音识别 #基准测试 评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Randy Frans Fela:GN Group, Ballerup, Denmark Pejman Mowlaee:GN Group, Ballerup, Denmark 💬 毒舌点评 亮点在于用输出分歧率(Output Divergence Rate, ODR)把语音增强(Speech Enhancement, SE)的感知指标幻觉撕开,证明 MetricGAN+ 这类以 PESQ 为目标的模型在 LLM 任务上是负优化,且回声场景的说话人替换失效是 WER 完全失明的。短板是全部 5 个条件均为 DNS 语料模拟加单一 WPE 与 DTLN-AEC 实现,缺乏真实器件录音与扩散式等主流 SE 的对照,结论的外推边界比作者宣称的要窄。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1451 words

Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement

📄 相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来 英文题目:Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement 一句话:针对压缩相位感知损失在中高频的幅度-相位补偿导致过衰减,论文用固定 Sigmoid 与信号依赖的谱自适应两种频带加权来压低不可靠相位监督,在 HyST-Net 流式基线上使 4-8 kHz 的 LSD 降低约 1.18 dB 而全带质量持平,代价是超参数固定且仅在 DNS 合成集验证。 标签:#语音增强 #Transformer #流式处理 评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Haixin Zhao:机构信息未在 arXiv HTML 中可靠披露 Nilesh Madhu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于直指压缩相位感知损失的幅度相位补偿效应,用频带加权缓解中高频过衰减,动机清晰且与流式轻量场景强绑定。短板是两类加权本质仍是手工设计的频域衰减曲线,超参数固定且缺乏跨数据集与主观听感验证,HyST-Net 的混合建模也更像为验证损失而搭的基线而非独立贡献。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1093 words

Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks

📄 把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗 英文题目:Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks 一句话:为解决人工耳蜗在噪声下可懂度骤降而深度网络又太费电的矛盾,论文把整条 ACE 编码流水线脉冲化为 Spiking Deep ACE,用稀疏加法替代稠密乘累加,在 VSTOI 仅落后约 1 个百分点、SNRi 基本持平的前提下把估算能耗从 2461 降至 372 μJ/s,代价是评估仍停留在声码器客观指标与 45nm 公式估算。 标签:#语音增强 #高效推理 #医疗音频 评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Ludovic Boulanger:机构信息未在 arXiv HTML 中可靠披露 Sean U. N. Wood:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把 Conv-TasNet 底座的 Deep ACE 整体脉冲化并用 ParaLIF-Threshold 实现时间并行训练的工程取舍清晰,6 倍以上能耗下降对植入体场景确有吸引力。但评估仅在 28 人英语数据上做 ICRA 两类噪声的电极图域指标,无统计检验、无真实 CI 受试者主观验证、无神经拟态硬件实测,能耗也停留在 45 nm CMOS 估算且未计访存,离可植入部署仍有距离。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1047 words

Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals

📄 不用再把 PDM 翻译成 PCM:让状态空间模型直接听懂单比特麦克风 英文题目:Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals 一句话:针对常开设备上单比特脉冲密度调制麦克风必须先滤波抽取才能喂给神经网络的代价,论文用连续时间状态空间模型做编码器把 16 kHz 脉冲编码调制的训练直接泛化到 128 kHz 至 2 MHz 的脉冲密度调制测试,并在 2 MHz 下以 FouT 编码取得 3.24 的 PESQ 超过 3.07 的 PCM 基线,代价是全部 PDM 均为仿真且缺乏真实硬件与专用 PDM 基线对比。 标签:#语音增强 #端到端 #模型评估 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 ...

2026-08-31 · 更新于 2026-09-04 · 7 min · 1333 words

GAN-based Joint Dereverberation and Directional Filtering

📄 既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风 英文题目:GAN-based Joint Dereverberation and Directional Filtering 一句话:为解决紧凑阵列在强混响下方向滤波残留重的问题,论文把去混响与方向滤波合并为单阶段的 NDDF 任务,用时频 UNet 加多尺度 STFT 判别器做生成式训练,在模拟房间上 6 阶 Cardioid 目标比同骨干判别式高约 4 dB,但代价是 SRMR 略降且验证仍限于模拟客观指标。 标签:#空间音频 #生成对抗网络 #语音增强 #多通道 评分:5.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Weilong Huang:机构信息未在 arXiv HTML 中可靠披露 Shrishti Saha Shetu:机构信息未在 arXiv HTML 中可靠披露 Emanuël A. P. Habets:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把去混响与神经方向滤波压成一次前向的 NDDF,并为无显式权重的信号映射类方法补上只靠输入输出算方向图的估计器,算是把生成式空间滤波的评估盲区补上了;但所有证据都锁在 Monte Carlo 模拟房间与 30 dB 单一信噪比里,既无真房录音也无主观 MOS,6 阶 Cardioid 上 GAN 拉开的 3 dB 到 4 dB 优势能否扛住噪声、阵列失配和实时约束,论文自己都没敢验。 ...

2026-08-29 · 更新于 2026-09-04 · 6 min · 1132 words

LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery

📄 LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery 标签:#音频修复 #CNN #语音增强 #理论分析 10.0/10 | 创新 2/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 10.0/10 | 前10% | 文档类型:理论研究 | 评分置信度:中 | #音频修复 | #CNN | #语音增强 #理论分析 | arxiv 👥 作者与机构 第一作者:Kazuki Matsumoto(Tokyo University of Agriculture and Technology,日本) 通讯作者:正文未明确标注 作者列表:Kazuki Matsumoto、Ren Uchida、Natsuki Yoshino、Kohei Yatabe(机构:Tokyo University of Agriculture and Technology,日本) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 450 words

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

📄 SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks 标签:#语音增强 #扩散模型 #模型压缩 #高效推理 7.6/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #扩散模型 | #模型压缩 #高效推理 | arxiv 👥 作者与机构 第一作者:Nagashree K. S. Rao(Fraunhofer IIS, Am Wolfsmantel 33, 91058 Erlangen, Germany) 通讯作者:正文未明确标注 作者列表:Nagashree K. S. Rao、Shrishti Saha Shetu、Mohamed Elminshawi、Emanuël A. P. Habets、Andreas Brendel(机构:Fraunhofer IIS, Am Wolfsmantel 33, 91058 Erlangen, Germany;International Audio Laboratories Erlangen) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 470 words

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

📄 Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement 标签:#语音增强 #RNN #数据集 #模型比较 #鲁棒性 9.0/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 9.0/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #RNN | #数据集 #模型比较 | arxiv 👥 作者与机构 第一作者:Alessia Milo(Treble Technologies, Reykjavík, Iceland) 通讯作者:正文未明确标注 作者列表:Alessia Milo、Georg Götz、Steinar Guðjónsson、Daniel Gert Nielsen、Jesper Pedersen、Finnur Pind(机构:Treble Technologies, Reykjavík, Iceland) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 632 words