论文解读

语义越强伪造线索越淡:Voxtral 做欺骗检测为何必须任务适配

论文把欺骗检测改写为固定指令下比较 bonafide 与 spoof 标签序列似然的生成式任务,报告冻结大语言模型层会削弱声学可分性,而用 DoRA 轻量适配后的 Spooftral 在 ASVspoof5 评估集上报告等错误率为 4.25%,代价是仍需任务训练且特定攻击明显更难。

 · 约 19 分钟 · 9486 字 阅读 →
论文解读

合成语音露出口音破绽:巴西葡萄牙语方言不一致如何成为可解释的鉴伪线索

论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。

 · 更新于 2026-09-25 · 约 17 分钟 · 8342 字 阅读 →
论文解读

图注意力加什么都有用吗:LoRA 微调下语音防伪造后端的受控拆解

该研究把 AASIST2 图注意力层拆成打分对称性、温度可学习性与路由粒度三条残差分支,在统一 LoRA 条件下用五个评测集和五个随机种子检验,发现 LearnT 平均统一等错误率最优而 GATv2 与 LearnT 联用反而明显退化,说明分支之间是非可加的相互作用。

 · 更新于 2026-09-25 · 约 23 分钟 · 11325 字 阅读 →
论文解读

保住细粒度声学线索再借高层语义:CRAF 的不对称残差融合

针对未见伪造攻击泛化难的问题,CRAF 以 SSL 为主、ALLM 为高层引导做残差感知融合,在 ASVspoof 5 上 Kimi-Audio 配置报告评估 EER 为 5.96% 与 minDCF 为 0.1192,但攻击间差异与门控依赖仍是代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10497 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
论文解读

保留高维语音表示,只用一层分类器:KAN 为何比全连接更省且更稳

该工作以 XLS-R 高维表示为输入,对比单层全连接与单层 KAN 后端,在 21LA 上把聚合 EER 从 2.38% 降到 1.07%,代价是后端参数从 2.05k 增至 22.54k 但仍远小于主流系统,且在 FoR 等个别集上 KAN 并未取胜。

 · 更新于 2026-09-25 · 约 18 分钟 · 8844 字 阅读 →
论文解读

冻住检测器、只训练回溯翻译器:持续伪造语音检测里的遗忘与适配矛盾

针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。

 · 更新于 2026-09-25 · 约 16 分钟 · 7753 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不用黑盒记频谱:用运动、相位与气流三组物理量做边缘端重放检测

该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。

 · 更新于 2026-09-25 · 约 18 分钟 · 8656 字 阅读 →
论文解读

真人嘴与扬声器箱体辐射不同:用方向能量声学图做轻量多通道回放检测

针对多通道回放攻击检测,论文用经典波束形成在方位俯仰网格上计算声学图并配约 6k 参数卷积网络,在 ReMASC 上六麦阵列取得约 10.1% 等错误率,最强证据是多阵列与多波束形成器对照,代价是小阵列与未见环境下明显退化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8595 字 阅读 →
论文解读

扩数据反而退化:卷积后端与多语言前端在伪造语音检测中的域偏置对照

该研究用四种自监督前端搭配四种后端、在三种多语料组合与六个评测集上对照,报告显示 XLSR 搭配 ResNet 平均等错误率最低,加入外部语料让 ASVspoof 5 编解码子集等错误率走高而野外子集走低,约 8 小时西班牙语伪造音频让西班牙语评测大幅改善而中文评测维持原量级。

 · 更新于 2026-09-25 · 约 26 分钟 · 12607 字 阅读 →
论文解读

多而不杂才有用:用来源与生成器多样性重组语音伪造检测训练数据

该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。

 · 更新于 2026-09-25 · 约 20 分钟 · 9633 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

伪造语音检测为何在实验室外失灵:把非语音当捷径的诊断框架

论文把声纹伪造检测的跨库崩溃拆成捷径依赖与域偏移两类失败,用有向图加受控声学干预证明非语音结构是主捷径,而针对性增强能解耦但要付出域内代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9257 字 阅读 →
论文解读

环境变了就要忘:多通道回放检测的域增量学习基准

论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。

 · 更新于 2026-09-25 · 约 16 分钟 · 7750 字 阅读 →
论文解读

把预训练语音模型改成高层专家分工:抗伪造要在保留表示的前提下做稀疏扩容

针对未见合成方法泛化难的问题,论文把 WavLM-Large 部分高层的前馈块替换为多专家并用门控做整句选路,在 14 个评测集上把宏平均等错率从 5.46% 降到 4.81%,代价是参数增至 329M 且需全量微调。

 · 更新于 2026-09-25 · 约 19 分钟 · 9258 字 阅读 →
论文解读

更难的重放与更真的合成:J-SPAW2 如何让日语说话人验证同时失守

J-SPAW2 在保留日语真实录制框架下系统控制重放距离音量与零样本合成参考噪声,用低音量远场重放使 w2v2+AASIST 的 t-DCF 升至 0.619、用 ElevenLabs 等合成使 CM 与 ASV 同时退化,但增强后更自然并不等于更难检测。

 · 更新于 2026-09-25 · 约 18 分钟 · 8893 字 阅读 →
论文解读

先看 10 毫秒再做判断:大核一维卷积为何能做原始波形伪造检测

该文研究原始波形语音伪造检测,用一维 ResNet34 把首层卷积扩大到 160 采样点,在 ASVspoof2019 LA 评估集上报告等错误率 1.37% 与最小串联检测代价 0.0429,代价是首层参数与优化负担增加且困难攻击仍集中出错。

 · 更新于 2026-09-25 · 约 20 分钟 · 9618 字 阅读 →
论文解读

总体学好了不等于每种攻击都学好:高影响攻击的主导与课程缓解

该文在 ASVspoof 2019 上用省略敏感性与熵损失诊断出 A1 与 A4 等高影响攻击,再用先学低影响后适配高影响的重放课程把跨数据集总体 EER 明显压低,代价是两阶段训练与四项正则的额外复杂度。

 · 更新于 2026-09-25 · 约 18 分钟 · 8779 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 108 分钟 · 53865 字 阅读 →