混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部
针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。
针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。
针对同一句话中真假语音共存且需逐帧定位的问题,BISL 在帧分类主任务之外增加相邻帧差分的边界学习和段内均值标准差加紧致性的段学习,在 PartialSpoof 上报告 EER 为 2.52% 与 F1 为 97.40%,代价是跨数据集到 LPS 时仍只达到 EER 为 37.10% 与 F1 为 53.61% 且推理时仅保留帧头。
SPADE 针对长语音中局部篡改的检测与定位问题,用大模型改写文本加合成与编辑两类生成器构建 12 语言数据,并在定位模型上报告跨生成器、跨语言、跨声学环境三类泛化证据,主要代价是未见生成器下接近随机猜测且噪声下显著退化。
该文把 AI 音乐检测当作评估治理问题,用内容摘要与血缘分组冻结 828 轨主队列并分离校准与密封测试,在 562 轨四模型公共成功交集上报告 ArtifactNet 以 0.982 AUROC 领先但 Udio 补充集回落至 0.650,而聚合 F1 掩盖的生成器与真音乐域偏移与缺失覆盖决定了排名是否可比。
DFD-Lab 把数据集适配、配对片段表示、检测器接口与实验配置分开,用 FakeAVCeleb 训练、过滤后的 Deepfake-Eval-2024 外部测试三类融合实现,最一致的证据是 JPEG50 训练增强把外部 AUROC 从 0.504、0.538、0.458 分别提升到 0.691、0.605、0.570,但三者准确率同时从 …
GenTraceBench 把同一 TTS 谱系内预训练与 SFT、DPO、GRPO 适配后的配对检查点固定文本和说话人重合成来测取证稳定性,报告显示 RL 对齐平均归因变化小而部分 SFT 与预训练数据更换带来大幅漂移,且多样本注册只能缓解方差型漂移而不能纠正均值偏移。
针对未见攻击泛化难且不扩充数据、不改动原参数的问题,CoReLoop 用 LoopBridge 构造循环输入、循环 LoRA 加门控更新与 ExitBridge 对齐分类器,在 14 个跨域测试集上 24 层模型以约 10M 可训练参数把池化等错误率从 4.85% 降到 3.74%,自适应停止以平均 1.18 次通过达到 3.73%,代价是第二次通过仍需完整 …
针对真实扰动下单一音频伪造检测器不稳定的问题,ROGUE 用扰动智能体出难题、策略智能体按序挑选检测工具的对抗方式构造工作流,在 WaveFake 训练与多扰动和跨数据集评测中提升了平均准确率,但代价是联合搜索更贵且依赖工具多样性。
该研究把持续学习任务收紧到单攻击者加已知真人多样性,用三种检测模型和四种训练策略对比,报告攻击者训练数据与架构影响相当、任务顺序与说话人多样性对不同方法影响不一,而随机回放最稳但需存旧数据。
针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。
针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究把单语和多语语音基础模型放在同一微调与分类流程下比较伪造检测,报告显示多语模型在域内和野外数据上更稳健,但超大规模参数并未带来系统性增益且单语模型在未知压缩与信道下退化明显。
论文针对基于冻结自监督模型的音频伪造检测器提出无说话人依赖的线性卷积攻击 Malasimplex,在 YourTTS 与 XTTS 两组高质量伪造上把等错误率推高 2 到 7 倍,并在更换骨干时仍保持黑盒迁移,同时以频响曲线解释攻击在哪些频带掩盖伪造痕迹。
针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。
该文把 TTS 来源追溯写成先判断是否见过再归属到具体系统的两阶段问题,用 Wav2Vec2-BERT 嵌入加 Proxy-Anchor 学习结构化嵌入空间,在 MLAAD v9 合并架构类上报告 99.76% 闭集准确率与 2.04% 的 FPR@95,代价是依赖手动合并架构与保留校准集调阈值。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。
论文把多种自监督音频、视觉和音画特征冻结后只训练线性分类头,在科学数据集与野外数据上比较检测、异常检测、可解释定位与互补融合,发现含音频信息的表示泛化最好但野外数据仍困难,且随机特征也能靠捷径得高分。