论文解读

混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部

针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。

 · 约 16 分钟 · 7943 字 阅读 →
论文解读

只改一小段也要逐帧定界:用边界差分与段内一致性做部分伪造定位

针对同一句话中真假语音共存且需逐帧定位的问题,BISL 在帧分类主任务之外增加相邻帧差分的边界学习和段内均值标准差加紧致性的段学习,在 PartialSpoof 上报告 EER 为 2.52% 与 F1 为 97.40%,代价是跨数据集到 LPS 时仍只达到 EER 为 37.10% 与 F1 为 53.61% 且推理时仅保留帧头。

 · 约 22 分钟 · 10585 字 阅读 →
论文解读

只改几个词更难抓:SPADE 用 12 种语言考验部分伪造定位的跨模型泛化

SPADE 针对长语音中局部篡改的检测与定位问题,用大模型改写文本加合成与编辑两类生成器构建 12 语言数据,并在定位模型上报告跨生成器、跨语言、跨声学环境三类泛化证据,主要代价是未见生成器下接近随机猜测且噪声下显著退化。

 · 约 18 分钟 · 8525 字 阅读 →
论文解读

分母不清的检测比较不可比:用内容血缘重定 AI 音乐检测评估

该文把 AI 音乐检测当作评估治理问题,用内容摘要与血缘分组冻结 828 轨主队列并分离校准与密封测试,在 562 轨四模型公共成功交集上报告 ArtifactNet 以 0.982 AUROC 领先但 Udio 补充集回落至 0.650,而聚合 F1 掩盖的生成器与真音乐域偏移与缺失覆盖决定了排名是否可比。

 · 更新于 2026-09-24 · 约 19 分钟 · 9195 字 阅读 →
论文解读

变换放在训练还是评估?DFD-Lab 用三组实验拆开跨数据集检测的排序与判决

DFD-Lab 把数据集适配、配对片段表示、检测器接口与实验配置分开,用 FakeAVCeleb 训练、过滤后的 Deepfake-Eval-2024 外部测试三类融合实现,最一致的证据是 JPEG50 训练增强把外部 AUROC 从 0.504、0.538、0.458 分别提升到 0.691、0.605、0.570,但三者准确率同时从 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

训练后指纹还算数吗:跟踪同一 TTS 血统从预训练到 SFT 与 RL 的取证漂移

GenTraceBench 把同一 TTS 谱系内预训练与 SFT、DPO、GRPO 适配后的配对检查点固定文本和说话人重合成来测取证稳定性,报告显示 RL 对齐平均归因变化小而部分 SFT 与预训练数据更换带来大幅漂移,且多样本注册只能缓解方差型漂移而不能纠正均值偏移。

 · 更新于 2026-09-24 · 约 17 分钟 · 8311 字 阅读 →
论文解读

冻住检测器再多算一遍:CoReLoop 如何把循环输入做对

针对未见攻击泛化难且不扩充数据、不改动原参数的问题,CoReLoop 用 LoopBridge 构造循环输入、循环 LoRA 加门控更新与 ExitBridge 对齐分类器,在 14 个跨域测试集上 24 层模型以约 10M 可训练参数把池化等错误率从 4.85% 降到 3.74%,自适应停止以平均 1.18 次通过达到 3.73%,代价是第二次通过仍需完整 …

 · 更新于 2026-09-24 · 约 9 分钟 · 4181 字 阅读 →
论文解读

不换单个检测器,而是让智能体在扰动下现搭检测流水线

针对真实扰动下单一音频伪造检测器不稳定的问题,ROGUE 用扰动智能体出难题、策略智能体按序挑选检测工具的对抗方式构造工作流,在 WaveFake 训练与多扰动和跨数据集评测中提升了平均准确率,但代价是联合搜索更贵且依赖工具多样性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9118 字 阅读 →
论文解读

攻击者数据与架构谁更难:持续学习下伪造音频检测的受控拆解

该研究把持续学习任务收紧到单攻击者加已知真人多样性,用三种检测模型和四种训练策略对比,报告攻击者训练数据与架构影响相当、任务顺序与说话人多样性对不同方法影响不一,而随机回放最稳但需存旧数据。

 · 更新于 2026-09-24 · 约 19 分钟 · 9069 字 阅读 →
论文解读

去掉语言方向:用残差做未见语言的音频伪造检测

针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。

 · 更新于 2026-09-24 · 约 18 分钟 · 8787 字 阅读 →
论文解读

不看画质看物理:PIVOT 用可测量的声视约束验算生成视频

针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。

 · 更新于 2026-09-24 · 约 25 分钟 · 12250 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

预训练语言越多越好吗:语音基础模型做音频伪造检测的对照解读

该研究把单语和多语语音基础模型放在同一微调与分类流程下比较伪造检测,报告显示多语模型在域内和野外数据上更稳健,但超大规模参数并未带来系统性增益且单语模型在未知压缩与信道下退化明显。

 · 更新于 2026-09-24 · 约 17 分钟 · 8445 字 阅读 →
论文解读

用可解释卷积滤波暴露预训练检测器的可迁移弱点:Malasimplex 攻击解读

论文针对基于冻结自监督模型的音频伪造检测器提出无说话人依赖的线性卷积攻击 Malasimplex,在 YourTTS 与 XTTS 两组高质量伪造上把等错误率推高 2 到 7 倍,并在更换骨干时仍保持黑盒迁移,同时以频响曲线解释攻击在哪些频带掩盖伪造痕迹。

 · 更新于 2026-09-24 · 约 19 分钟 · 9031 字 阅读 →
论文解读

看不见的生成器:用通用音频语义加图结构抓环境音伪造痕迹

针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

把未知系统推出去:用代理锚定学习做语音合成来源归属与开放集检测

该文把 TTS 来源追溯写成先判断是否见过再归属到具体系统的两阶段问题,用 Wav2Vec2-BERT 嵌入加 Proxy-Anchor 学习结构化嵌入空间,在 MLAAD v9 合并架构类上报告 99.76% 闭集准确率与 2.04% 的 FPR@95,代价是依赖手动合并架构与保留校准集调阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8741 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不对称伪造下为何要先估一致性再分配计算:IaMSB 的三段桥

针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10450 字 阅读 →
论文解读

自监督表示真能看穿音画伪造吗:冻结特征加线性头能走多远

论文把多种自监督音频、视觉和音画特征冻结后只训练线性分类头,在科学数据集与野外数据上比较检测、异常检测、可解释定位与互补融合,发现含音频信息的表示泛化最好但野外数据仍困难,且随机特征也能靠捷径得高分。

 · 更新于 2026-09-24 · 约 21 分钟 · 10404 字 阅读 →