CRAW: Codec Robust Audio Watermarking

📄 被编解码器洗掉的水印:CRAW 如何把鲁棒性藏进听不见的地方 英文题目:CRAW: Codec Robust Audio Watermarking 一句话:针对神经编解码器与降噪重合成几乎清零现有音频水印的问题,CRAW 以加宽失真训练打底、注意力池化与感知掩膜回收音质、重复码补回容量,在 FACodec 上达到 0.974 检测 F1 而 PESQ 保持 3.990,代价是约 150 ms 推理延迟与 TiCodec 短板。 标签:#音频水印 | #对抗训练 | #语音编码 | #鲁棒性 评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5 👥 作者与机构 David Chernin:机构信息未在 arXiv HTML 中可靠披露 Ethan Fetaya:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把失真池加宽、池化改注意力、推理加掩膜再用纠错码兜底的四件套分工清晰,对神经编解码器碾压式提升是真贡献。但掩膜依赖可微 PESQ 梯度且只在推理嫁接,训练推理不一致味道很重,最难的 TiCodec 仍是全场最低点,SI-SNR 与 STOI 也弱于最优基线,离真正透明部署还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1267 words

Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints

📄 压住房间的尾音:375bps 里留住混响的衰减骨架 英文题目:Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints 一句话:针对通用神经编码器压缩房间脉冲响应时丢失衰减结构的问题,该工作在 EnCodec 单码本框架上加入能量衰减与混响语音两级约束,在 375bps 下把 T60 误差降到 1.14 秒、ViSQOL 做到 4.11,代价是仅在单房间验证且无开源。 标签:#音频编码 | #对抗训练 | #空间音频 | #模型压缩 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chen-Yuan Ning:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把房间脉冲响应当成特殊音频来压的思路切中了通用神经编解码器水土不服的痛点,能量衰减曲线与混响语音联合约束的设计颇为对症。遗憾在于验证只困在单一房间的 Motus 数据上,基线又弱又少,低码率极限的反常波动也缺乏解释,离顶会要求的普适性证据还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 967 words

SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training

📄 抹掉谁在说话,才能听清他什么心情 英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training 一句话:针对跨说话人情感泛化难的问题,SISER 用 wav2vec 2.0 做表示、用 ECAPA-TDNN 做强判别器并以熵最大化逼均匀后验,在 IEMOCAP 上取得测试 UA 60.63%,代价是仅单语料验证且部分折出现退化。 标签:#语音情感识别 | #对抗训练 | #说话人验证 | #自监督学习 评分:6.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Eunseo Choi:机构信息未在 arXiv HTML 中可靠披露 Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把说话人验证领域的强判别器拿来做对抗压力源的想法直观有效,消融也确实指向判别器容量是关键变量。硬伤是全文证据锁死在 IEMOCAP 单语料上,且验证集与测试集口径、前后文数字多处打架,让所谓说话人不变更像特定划分下的拟合红利而非可外推结论。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 917 words

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

📄 Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models 标签:#语音交互 #对抗训练 #音频大模型 #鲁棒性 5.4/10 | 创新 1.4/2 | 严谨 0.7/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5 📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Shuozhe Cheng、Kunlan Xiang、Mingxuan Li、Ji Zhang、Dongxiao Liu、Wenbo Jiang。 论文正文未列出任何作者的单位、实验室名称或完整机构信息。 邮箱信息:论文仅提供 sc8483629@gmail.com 与 wenbo_jiang@uestc.edu.cn 两个邮箱。排版中 Corresponding author 字样紧跟在 sc8483629@gmail.com 之后,但未明确标注该邮箱对应哪位作者;按常见模板惯例可推断 Shuozhe Cheng 可能是通讯作者,但此推断无法被论文正文确证。 wenbo_jiang@uestc.edu.cn 的域名为 uestc.edu.cn,可可靠推断 Wenbo Jiang 来自电子科技大学;其他作者所属机构均为“未说明”。 原文未提供作者顺序对应的机构编号列表,也未提供 ORCID 或贡献声明。 💡 毒舌点评 第一次系统地把文本 LLM 的 DoS 攻击研究拓展到端到端语音大模型,问题切入点有实际意义;四分量联合损失配合 VAD 的 pipeline 设计也具备一定工程完成度。但论文在证据链上存在多处明显瑕疵:消融表 2 的行与组件对应关系无法唯一解码,正文表述与表格数值存在直接冲突(如 FunAudioChat clean input 显存在正文写 17.26 GB、表 1 却写 20.26 GB);使用“ChatGPT 5.5”作为响应质量评测器但未提供任何可独立验证的版本信息;文本基线 Crabs/ExtendAttack 如何适配到语音输入完全没有说明;攻击成功样本的波形分析显示所谓“never stop speaking”实际产生的是大量低能量静音片段而非持续可听语音。这些问题使得当前结果只能视为初步探索,距离顶会主刊的完整证据标准尚有明显距离。 ...

2026-08-12 · 更新于 2026-09-04 · 4 min · 735 words

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

📄 From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs 标签:#音频理解 #对抗训练 #音频大模型 #鲁棒性 #模型评估 7.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yuanhe Zhang、Weiliu Wang(共同第一作者;机构信息未完整披露) 作者列表:Yuanhe Zhang、Weiliu Wang、Jie Ren、Liang Lin、Zhenhong Zhou、Haoran Gao、Kun Wang、Chen Li、Li Sun、Sen Su 通讯作者:Sen Su(论文署名信息未给出完整机构映射) 💡 毒舌点评 ILL 把“人耳听不见但模型能感知”的低频输入明确为 LALM 的安全风险,并用黑盒通用波形在六个模型上验证了可迁移的破坏效果;DRG 的条件重录防御也有工程直觉。但攻击只在数字混音中评估,没有 over-the-air 实测,DRG 仅建模两类分布且要求用户重复录音,频移、调制变化和实时交互下的鲁棒性仍未证明。 ...

2026-08-11 · 更新于 2026-09-04 · 1 min · 173 words

AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

📄 AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling 标签:#语音超分 #流匹配 #语音增强 #生成模型 #对抗训练 5.9/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音超分 | #流匹配 | #语音增强 #生成模型 | arxiv 👥 作者与机构 第一作者:Junchuan Zhao(新加坡国立大学) 通讯作者:Ye Wang(新加坡国立大学) 其他作者:Minh Duc Vu(新加坡国立大学)、Bowen Zhang(腾讯AI Lab) 💡 毒舌点评 这篇论文将多带宽扩展建模为频域上下文填充,想法有一定新意,频率感知架构和多视角判别器的设计也展示了不错的工程能力。然而,实验的严格性是其最大软肋:主要对比基线与AnyBand在输入端使用了不同的预处理流程,这种不公平的比较削弱了指标领先的说服力。此外,方法继承了F5-TTS的复杂时序DiT骨干和50步Heun求解器,计算开销肉眼可见,却没有提供任何与轻量级前馈方案的效率对比,实用性存疑。评审人需要看到的不只是“更好”,更是“在公平的条件下、以可接受的代价”变得更好。 ...

2026-08-04 · 更新于 2026-09-04 · 4 min · 667 words

Teffic-Audio: Tell Fact from Fiction

📄 Teffic-Audio: Tell Fact from Fiction 标签:#语音伪造检测 #对抗训练 #鲁棒性 #基准测试 #模型比较 6.8/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音伪造检测 | #对抗训练 | #鲁棒性 #基准测试 | arxiv 👥 作者与机构 第一作者:Wan Lin(未说明)— 根据原文,作者列表为“Amphion Team”,具体为:Wan Lin, Li Wang, Jindong Wang, Kunyu Feng, Zhizheng Wu。机构均未明确说明。 通讯作者:未说明 💡 毒舌点评 这篇报告用一个"朴素"的Conformer架构,靠着一套精心设计的"数据食谱"(多源数据整合、攻击源平衡采样、多样音频增强),在Speech-DF-Arena排行榜上拿下了第一。它有力地证明了在语音伪造检测中,好的训练数据分布有时比花哨的模型架构更重要。然而,短板同样致命:系统完全闭源,代码和模型权重一概欠奉,仅有一个demo页面供人"瞻仰",这让1.454%的EER看起来更像是一个诱人但无法检验的广告。训练超参数等关键细节的大量留白,使得独立复现几乎成了"不可能完成的任务",削弱了其作为公共基线的价值。 ...

2026-07-31 · 更新于 2026-09-04 · 7 min · 1458 words

Leveraging Gradient Reversal Loss and Multitask Learning for Datasets-Aware Audio Deepfake Detection

📄 Leveraging Gradient Reversal Loss and Multitask Learning for Datasets-Aware Audio Deepfake Detection 标签:#语音伪造检测 #多任务学习 #对抗训练 #自监督学习 #音频理解 7.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #多任务学习 | #对抗训练 #自监督学习 | arxiv 👥 作者与机构 第一作者:Mingrui Liang(Johns Hopkins University, Department of Electrical and Computer Engineering) 通讯作者:未明确指定,但根据单位信息,通讯作者很可能同属 Johns Hopkins University 作者列表:Mingrui Liang(Johns Hopkins University, Department of Electrical and Computer Engineering)、Thomas Thebaud(Johns Hopkins University, Department of Electrical and Computer Engineering)、Łukasz Wójciak(Meaning, USA)、Laureano Moro Velazquez(Meaning, USA,原分析误写为“未说明”)、Yishay Carmiel(Meaning, USA)、Jesus Villalba Lopez(Johns Hopkins University, Department of Electrical and Computer Engineering)、Najim Dehak(Johns Hopkins University, Department of Electrical and Computer Engineering) 💡 毒舌点评 这篇论文把“数据集ID”这张几乎零成本的牌打出了不错的效果,思路简洁得让人想说“我怎么没想到”。在MT和GRL这两条老路上,用“数据集×真伪”的联合标签做了一点聪明的微创新,效果立竿见影。然而,论文仍旧停留在“两条平行线”的层面,未能将两种互补的策略融为一个有机整体,这让它的贡献更像是一次扎实的工程调优而非方法论上的突破。缺乏对计算成本、推理延迟和与RawBoost等强基准的直接比较,也让“轻量高效”的标签显得有点自我陶醉。 ...

2026-07-28 · 更新于 2026-09-04 · 3 min · 516 words

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

📄 Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training 标签:#音频分类 #对抗训练 #音频理解 #Transformer #模型评估 6.4/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #对抗训练 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Ali Tabaraei(米兰大学计算机系) 通讯作者:Ali Tabaraei(米兰大学计算机系) 作者列表:Ali Tabaraei(米兰大学计算机系)、Federico Simonetta(格兰萨索科学研究所计算机科学系)、Stavros Ntalampiras(米兰大学计算机系) 💡 毒舌点评 本文工程完成度扎实,在受限的意大利语数据集上系统性地筛选出了“MelSpec + ItalianBERT + 30s”的最优配置,并通过引入域对抗训练获得了可观的性能提升。然而,将“每个说话人视为一个独立域”的设定,虽然名义上借用了域泛化的外衣,实质上执行的是“说话人无关”特征学习,与社区内公认的跨数据集、跨场景的分布外泛化挑战相比,技术难度有明显落差。此外,整个模型是一个冻结预训练特征提取器的两阶段流水线,非端到端优化,这使得标题与摘要中暗示的“纯粹”端到端框架打了折扣。 ...

2026-07-28 · 更新于 2026-09-04 · 3 min · 462 words

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

📄 HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs 标签:#音频编码 #音频质量评估 #对抗训练 #高效推理 #音频理解 9.6/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 9.6/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #音频编码 | #对抗训练 | #音频质量评估 #高效推理 | arxiv 👥 作者与机构 第一作者:Qiaoyu Yang(Georgia Institute of Technology, Atlanta, United States) 通讯作者:未说明 作者列表:Qiaoyu Yang(Georgia Institute of Technology, Atlanta, United States)、Lixing He(The Chinese University of Hong Kong, Hong Kong, China)、Binyue Deng(Tencent Music Entertainment, Shenzhen, China)、Weifeng Zhao(未说明) 💡 毒舌点评 论文提出了一个优雅而高效的“训练时改造,推理时无痕”方案,将频率感知注入通用的RVQ架构,解决了频谱纠缠和截断质量不可预测的实际痛点,工程价值很高。然而,其分组策略和高斯权重初始化仍带有启发式色彩(例如,训练后Group 0和1的中心均收敛到~228 Hz,未实现预设的频带划分),且实验基线相对单薄(主要与DAC和BSCodec对比),缺乏与近期其他非架构修改方法(如MUFFIN、SNAC)的直接比较,使得其优越性的说服力略有折扣。 ...

2026-07-21 · 更新于 2026-09-04 · 3 min · 597 words