论文解读

四模态同判:Omni-Fake 把检测、定位与解释放进同一基准与同一模型

针对社交媒体多模态伪造分散评测的问题,论文构建覆盖图像、音频、视频与音视频讲话头的统一基准并提出课程微调加统一奖励强化的 Omni-Fake-R1,最强证据来自严格不相交的 OOD 划分与联合评测,而代价是渐进式训练流程更长且定位精度仍受篡改细粒度限制。

 · 更新于 2026-09-24 · 约 23 分钟 · 11386 字 阅读 →
论文解读

伪造痕迹不在整段语音里,而在背景、低频与混响中:音频深伪检测的成分拆解

该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。

 · 更新于 2026-09-24 · 约 14 分钟 · 6950 字 阅读 →
论文解读

看得见证据才算会判:TriDF 把感知、判定与幻觉拆开考

TriDF 针对以人为中心的伪造提出可解释检测基准,用细粒度伪影感知、真假判定与解释幻觉三维评估多模态大模型,报告显示语义伪影最难且幻觉会切断感知到判定的链路。

 · 更新于 2026-09-24 · 约 19 分钟 · 9094 字 阅读 →
论文解读

不只看脸像不像:用生成器内部的声音嘴型对齐信号抓伪造

针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9407 字 阅读 →
论文解读

说话很准、唱歌就失灵:用三路特征混合守住语音又学会歌声

针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

语音预训练为何听不懂音乐与环境音:跨模态伪造检测的前端泛化检验

论文以语音、音乐、环境音和歌声四类伪造检测为问题,用单前端、双前端与蒸馏双前端对比自监督前端选择,最强证据是 XLS-R 加 EAT 十八层双前端在联合训练下取得最低平均等错误率,代价是前端参数量明显增大且混合音频仍大幅退化。

 · 更新于 2026-09-24 · 约 15 分钟 · 7418 字 阅读 →
论文解读

退化信道复制了伪造痕迹:混合域适应如何挽回检测失效

针对三种真实退化信道下 11 种零样本克隆把验证错误率推高且预训练检测接近失效的问题,论文用混合标准库与域内退化语音的微调把已知攻击检测恢复到低错误率并改善部分未知攻击,代价是高保真未知攻击与小模型遗忘仍未解决。

 · 更新于 2026-09-24 · 约 21 分钟 · 10485 字 阅读 →
论文解读

病理语音遮住编解码痕迹时,如何仍能检出伪造

针对病理语音下神经音频编解码重合成伪造难以检出的问题,论文构建配对的中英多病症基准并提出保留多证据、在双曲空间用多原型建模伪造模式的 PHOENIX-Mamba,其 PaSST 版本在英抑郁等任务上达到 97.04 准确率并把等错率降到约 5 左右,代价是依赖预训练表示与受控重合成协议而未覆盖真实信道与 TTS 等攻击。

 · 更新于 2026-09-24 · 约 22 分钟 · 10630 字 阅读 →
论文解读

听得出却标不对:当信任线索遇上部分合成语音的人耳定位实验

该研究用 20 条真、全合成与部分合成语音的 0.2 秒窗口定位任务检验 47 名母语听者,显示话语类型决定检出与质量评分而三种信任线索无主效应,全合成在多数投票下 0/5 正确且人群辨别力接近机遇。

 · 更新于 2026-09-24 · 约 20 分钟 · 9567 字 阅读 →
论文解读

在野外伪造面前,专用检测器失灵时比较推理如何兜底

针对录音室训练的专用检测器在野外自发语音上泛化崩塌的问题,论文提出免训练的比较引导上下文学习框架,用成对证据生成与对账过滤幻觉,并用分布外路由把难样本交给音频语言模型,在三个野外数据集上报告了高于基线的宏平均 F1,但以录音室数据性能下降和依赖闭源模型生成证据为代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9138 字 阅读 →
论文解读

英语检测器在印度语上失灵:用双曲对齐把语义和韵律重新拼起来

针对神经音频编解码器重合成的印度语伪造语音检测难泛化问题,论文构建多语言多编解码器基准并提出双阶段双曲对齐的检测框架,在域内与跨库迁移上报告更低等错误率,但以双编码器与大语言模型解码器开销为代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8218 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

黑盒通话压碎帧级伪造痕迹:用音素级一致性守住可懂结构

针对实时通信中未知增强与编解码耦合失真问题,论文用真机穿越七个主流平台构建约 600 小时配对数据并提出音素引导一致性学习,在离线与在线混合评估上把平均等错率降到 5.81%,代价是对极端噪声与激进非线性失真仍有差距。

 · 更新于 2026-09-24 · 约 22 分钟 · 10638 字 阅读 →
论文解读

只留前 K 个激活:稀疏伪造检测为何同时改善泛化与解耦

论文在 AASIST 最后隐层加 Top-K 稀疏约束,用 ASVspoof5 验证检测性能与按攻击类型度量的解耦度,最强证据是 D=320、k=20 时测试集 EER 为 23.36% 且单样本约 95% 维度为零,代价是需放大隐层并舍弃难检攻击后解耦结论才成立。

 · 更新于 2026-09-24 · 约 21 分钟 · 10215 字 阅读 →
论文解读

电话线抹掉了谁的指纹:带宽与编码对音频深度伪造溯源的分解影响

论文把电话传输拆成降带宽与过编码分别测量,发现未见过的编码是退化主因,并用窄带重采样加随机量化加 RawBoost 加 G711 仿真在未见真实 VoIP/PSTN 上把 EERc 从 18.9% 降到 15.1%,代价是训练条件变多且干净宽带上的匹配性能不再是最优。

 · 更新于 2026-09-24 · 约 17 分钟 · 8261 字 阅读 →
论文解读

以混合检索补压缩短板:XLSR-MamBo 如何用 Mamba 与注意力检出伪造语音

针对纯因果状态空间模型难以全局检索频域伪造痕迹的问题,论文提出 XLSR 前端加 Mamba 与注意力混合后端的模块化框架,最强证据是 MamBo-3-Hydra-N3 在三组跨域评测上取得有竞争力的等错误率,代价是堆叠深度与变体选择敏感且浅层检查点方差大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8208 字 阅读 →
论文解读

时间一致性看穿音频伪造:相似度分布为何在实验室与野外反向

该工作把音频切段后用 CLAP 嵌入算段间余弦相似度分布并提取 29 个统计特征再用 XGBoost 与多专家集成判别,在 ASVspoof5 上 EER 为 17.7% 而在 In-the-Wild 上 F1 为 0.679,代价是 21 个特征出现训练与野外判别方向反转且音乐需用分位自适应才能跨域。

 · 更新于 2026-09-24 · 约 15 分钟 · 7421 字 阅读 →
论文解读

一种检测器要听懂四种造假:小波提示如何补上频率感知

针对语音、声音、歌声与音乐四类音频造假统一检测问题,论文提出冻结语音自监督模型并只学习提示词的小波提示调优方法,在四类联合训练下以远少于微调的参数取得更低的平均等错误率,但单类训练仍难跨类泛化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9083 字 阅读 →