英文题目:ArtifactBench: Lineage-Aware Evaluation of AI-Generated Music Detectors under Distribution Shift

标签:#音频深度伪造检测 | #基准设计 | #音乐 | #基准测试 | #鲁棒性

评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Heewon Oh:Intrect

📌 核心摘要

面向整轨全曲合成音乐与人类制作音乐的二分类检测,输入为完整音频波形、输出为合成或真实标签,难点在于生成器换代、真实域偏移、清单失配与适配器静默丢文件导致 headline 分数不可比。该工作先法医审计三套历史清单并为每轨绑定内容摘要(SHA-256)、来源层、生成器版本与谱系标识,再在来源层内按谱系以20/10/70划定校准、验证与密封测试,最后用版本锁定运行器对ArtifactNet v9.4、SpecTTTra-α-120s、Deezer ISMIR 2025公开逻辑检测器、CLAM执行统一单声道解码与冻结阈值评测。与直接比较聚合分数不同,其机制差异在于把训练暴露、推理缺失与阈值选择显式建模为可审计产物而非隐藏预处理。在562首四模型共同成功密封测试交集上,ArtifactNet v9.4以0.982的ROC曲线下面积和0.918的平衡准确率领先,公开Deezer检测器为0.761和0.776,SpecTTTra与CLAM低于0.30。该结论仅适用于冻结混合队列与校准阈值,不支持向未来生成器或广播信道的无条件外推。原文未披露训练与部署成本,推理在单台Apple Mac Studio M1 Max上执行。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么聚合分数相同却不可比?

输入是这篇论文要解决的评估治理问题,目标是让刚入门的读者能复述它如何构造可核对的比较,输出是一套从队列构造到阈值冻结再到缺失记录的完整动作。必须保留的信息包括主队列规模与划分、4 个公开检测器的版本锁定、公共成功交集的规模、以及覆盖率与阈值策略如何改变排名。

对于语音与音乐方向的新生,直接把音频丢给模型看准确率是最自然的做法,但这篇论文指出,基准名称相同不等于比较的人群相同。一个公开清单可能对应多个版本,清单里引用的音频随时间失效,某个模型的公开训练划分可能已经包含名义上的测试集,而每个评测适配器又可能静默跳过不同的文件。如果分母不同,两个聚合分数放在一起就没有比较意义。更隐蔽的是分布偏移,新生成器、新版本、后处理以及与训练时不同的真实音乐都会改变行为,而聚合分数会把这些结构性差异平均掉。

因此学习这篇论文时,不要先记谁的分数高,而要先问 3 个可复述的问题。第一,比较的到底是哪一批音频字节,身份如何绑定。第二,工作点是在哪里选的,是否在看测试集之前冻结。第三,没有给出分数的尝试去了哪里,是被单独报告还是被悄悄丢掉。带着这 3 个问题,后续的方法与结果才有依赖关系。

同任务的已有路线提供了哪些对照?

论文把相关工作放在相同的输入与目标下对照,而不是把不同任务的分数直接排名。第一条路线是音乐生成检测方法。SONICS 提供了大规模完整歌曲语料与频谱 Transformer 家族 SpecTTTra,Deezer 展示了用人工重构训练的检测器可以在留出集上很高但强调操作与未见生成器风险,MoM 与 CLAM 结合音乐与语音表示做对比训练,ArtifactNet 则走估计编解码残差与谐波打击结构,MusicDET 把任务做成仅真实样本的一类密度估计。论文强调这些方法在结构、裁剪时长、聚合方式、训练语料与分数校准上都不同,直接比较发表的标题值会把模型差异与协议差异混在一起。

第二条路线是音频深伪基准的互补轴。Echoes 控制真实参考与生成轨的语义对齐以减少捷径学习,HAIM 把标签从二分类扩展到人机协作的生产阶段,BAMM 揭示真实电视广播音频的部署信道差距。论文把自己的位置放在这些轴共享的测量层,也就是轨身份、训练测试暴露、缺失、阈值选择与配对比较。

第三条路线是数据集血缘、泄漏与分布偏移的界定。论文区分精确内容重叠、属于已发表上游训练或验证划分、以及因公开训练流程不提供身份映射而无法判定的未解决暴露,三者只报告不折叠为二值未见。这种分类是后文审计与保守队列构造的依据,也是理解为什么作者不宣称主队列对所有表示模型都未知的原因。

何时值得尝试残差与结构路线?

从同输入同目标的角度看,ArtifactNet 的残差与谐波打击结构路线值得在怀疑编解码或生成痕迹被音乐内容掩盖时尝试,而频谱 Transformer 或对比表示路线更直接利用时频纹理与大规模表示。论文的证据支持在偏移队列上前者排序更稳,但这只是该冻结队列的有限解释,不是通用因果。选择时应同时考虑裁剪时长与聚合方式,120 秒输入、90 秒确定性裁剪与七块中位数对长结构与局部伪影的敏感性不同,直接套用标题值会忽略这些运行阶段差异。

另一个有源对照是仅真实一类密度估计。它在缺少合成训练数据时可用,但本研究未在同一冻结队列上给出它的可运行数字,因此不能把它与 4 个已评模型做同条件胜负。若要补验证,应把它接入同一版本锁定运行器、同一尝试分母与同一校准冻结规则后再比较。

要测的到底是什么任务,不测什么?

论文把首要任务限定为二分类的整轨检测,判断一整轨是完全生成音乐还是人类制作音乐。输入是一轨音频,输出是一个轨级分数再经阈值得到类别。它明确不做确权,不判定版权状态、意图,也不判定部分人工智能辅助制作是否应标为合成。片段定位、混合制作追踪与商业裁决都在首要任务之外。

这个限定对新生很重要。举例来说,如果一首歌只有鼓机是生成的而人声是实录,它不属于该基准首要任务的典型输入,论文不会用它来证明部署有效性。把任务边界讲清,才能理解为什么后文只报告整轨指标,以及为什么作者反复说干净文件基准必须声明其域而不是暗示通用检测。

另一个边界是可用性声明。本次收到的证据中没有来源绑定且完成超文本传输安全状态验证的资源,因此不能声称代码、模型或数据已公开或当前可用。论文正文虽描述元数据优先发布与获取方式,但按本次证据规则,解读中不把发布描述当作可达性结论。

血缘感知评估的全景是什么?

论文提出的方法全景可以沿一个样本走完。先取一轨候选音频,记录稳定的轨标识、二分类标签、来源层、已知时的生成器家族与版本、被评估字节的 SHA-256 摘要以及血缘标识。然后把同一录音的多种容器或变换归入同一血缘,划分时以血缘为单位,保证同一血缘不跨校准、验证与测试。接着在冻结的运行时副本上按确定性顺序解码为单声道波形,各适配器内部再重采样到各自原生采样率并按各自固定时长策略裁剪或分块评分。最后在校准集上选阈值并冻结,在密封测试集上 1 次性报告阈值无关指标、原生阈值与校准阈值结果,同时保留逐轨原始分数与结构化失败日志。

内容摘要 × 血缘分组: 内容摘要负责回答这是不是同一录音的同一字节,用 SHA-256 绑定实际参与评估的音频;血缘分组负责把同一录音的不同容器、重编码或裁剪变体归入同一 lineage_id。两者搭配的原因是文件名相同不等于内容相同,字节不同也不等于录音不同,论文用摘要去重与声纹复核剔除重复,再以血缘为划分单位禁止同一血缘跨校准、验证与测试,从而把内容泄漏从文件名层面推进到录音身份层面。

全景的治理含义是把人群、来源、工作点与失败分母都变成可审计制品。队列构造与模型执行分离,校准、验证与测试在最终 4 模型分析前写入清单,验证只做诊断不能触发重调,测试只用 1 次。这种顺序是后文所有排名讨论的前提,任何事后调阈值或换队列的做法都会破坏可比性。

阈值、覆盖与不确定性各自管什么?

阈值组件的动作是具体且可复述的。每个模型的主工作点只用校准行选择,在观测到的分数阈值中,要求误报率不大于 5% 的条件下最大化真正率,并列时选更低的阈值,选定后冻结用于验证与测试。论文同时报告原生 0.5 阈值以及阈值无关的 ROC 曲线下面积与平均精度,使读者能区分表示排序好但默认阈值不准的情况。

校准阈值 × 阈值无关指标: 校准阈值负责在校准集上按误报率不大于 5% 约束下选出可部署的工作点并冻结到密封测试;阈值无关指标如 AUROC 与 AUPRC 负责评价分数排序本身是否把合成排在真实之前。两者搭配的原因是阈值决定 1 次落点的取舍,排序决定表示质量,论文同时报告校准后指标、原生 0.5 阈值与阈值无关指标,使校准选择的好坏不被包装成表示能力的强弱。

覆盖组件把 5 类事件区分开,分别是解析、解码、模型推理、非有限输出与概率越界失败。它们不被转换为类别预测,也不从尝试分母中静默删除。主表同时展示成功评分轨数与失败数,配对比较使用公共成功测试标识交集,但覆盖率本身仍是模型结果。ArtifactNet 评估 7 个均匀分布的 4 秒块,当至少 4 个块有效时取有限块分数的中位数,4 个是严格多数中最小的数,该规则在密封分析前固定且未对标签或性能优化。另有一个严格敏感性结果,任何非有限块即判整轨失败,并公布块级失败日志。

推理缺失 × 分类错误: 推理缺失指解码失败、模型推理失败、非有限输出或概率越界等没有产生有效分数的事件;分类错误指成功给出分数但在阈值下判错类别。两者搭配的理由是缺失本身是模型覆盖能力的测量,若把缺失静默丢弃或直接当作某类,就会改变比较的分母,论文把缺失单独记录并保留完整尝试分母,配对比较只用公共成功交集,同时另给缺失即错误的悲观界。

不确定性组件用 2000 次标签分层血缘自助法给出 95% 区间。重采样单位是血缘而不是文件,避免同一录音的多个编码被当作独立证据。这种不确定性只描述该冻结队列,不外推为未来生成器的通用结论。

本研究训练了什么,没有训练什么?

本研究没有训练新的检测器,也没有微调 4 个基线。它的真实计算过程是基准构造、审计与冻结协议下的推理复现。具体包括按公开盐在来源层内以 20%、10%、70% 的目标比例确定性划分血缘,得到校准 166 轨、验证 83 轨与密封测试 579 轨;在同一台苹果 Mac Studio 上从内容哈希复核过的 828 轨冻结运行时副本执行版本锁定的适配器推理;按预定规则聚合块分数、选择阈值并生成逐轨分数与失败日志。

上游划分暴露 × 未解决暴露: 上游划分暴露指某行可映射到已公开的上游训练或验证划分成员;未解决暴露指上游训练流程未公布可复现的身份映射因而无法判定是否见过。两者搭配的原因是不能把查不到映射简单标为未见,论文区分精确内容重叠、属于已公开上游训练或验证划分、以及无身份映射的未解决状态并如实报告,对 CLAM 真实训练划分保留 316 行未解决,而不是折叠成二值的未见标签。

需要指出的缺项是训练细节并非本研究的报告对象。论文锁定仓库、模型与特征编码器版本,对 ONNX 模型记录相邻外部数据文件版本,对 CLAM 记录检查点摘要与音乐与语音编码器版本,但未报告各基线的原始训练超参数与梯度路径,解读中不从模型名称推定其实现。同样,无训练不等于确定性求解,解码、硬件执行与数值路径仍可能带来失败,后文的非有限块分析正是这种非理想执行的可观测证据。

队列、泄漏审计与运行条件如何固定?

冻结主队列在划分前共 828 轨,包含 605 轨合成与 223 轨真实。合成侧有 310 轨来自 AIME 发布,180 轨为 Suno 内容分发网络或补充轨,115 轨为 Udio 内容分发网络或补充轨。真实侧有 150 轨从官方 FMA 大型存档恢复并全部匹配元数据,73 轨为稳定来源标识引用的网络难负例。下表是划分前的原始人群结构,阅读时先看来源组与层数再看轨数,避免把采集成员误读为精确时间戳。

Source groupStrataTracks
AIME generators9310
Suno supplementary/CDN2180
Udio supplementary/CDN2115
FMA real hard negatives1150
Web real hard negatives173
Total15828

该表说明主队列集中在若干生成器家族且类别不平衡,平台版本标签对补充轨不完整,这是后文按来源分组报告的动机。划分后校准集 121 个人工智能轨加 45 轨真实,验证集 61 个人工智能轨加 22 轨真实,密封测试集 423 个人工智能轨加 156 轨真实,划分在最终 4 模型分析前写入清单。

泄漏与队列审计是另一组关键动作。公开清单存在 3 个不兼容的血缘,分别是 6200 行含 2280 行测试划分的版本、2224 行清洗后测试分支,以及元数据描述 6183 但实际 6014 行的本地版本。早期 8 模型比较只评 2104 轨,因为 120 个引用的 FMA 文件实际是超文本标记语言响应而非音频。论文从官方存档恢复 150 个选定 FMA 轨并验明身份,得到 2236 行的血缘干净中间队列。对公开 SONICS 血缘,241 行映射到训练或验证,454 行仅映射到测试,1541 行为外部。

对公开 MoM 血缘,200 行映射到其训练划分,197 行到测试划分,1523 行为外部,316 行真实因发布训练代码在本地嵌入可用性过滤后做种子随机划分且未公布实现身份映射而保持未解决。保守的 828 轨主队列排除所有原生 SONICS 与 MoM 来源家族,但作者仍避免称其对所有训练普遍未见。

运行条件方面,最终推理在同一台机器的冻结运行时副本上执行,输入清单摘要、所选轨标识、种子、包版本、平台字符串、模型来源、逐轨分数与结构化失败都写入结果目录。所有适配器接收相同解码单声道波形与相同确定性顺序的轨标识,固定时长基线用中心裁剪而非随机裁剪,SpecTTTra 用 120 秒输入策略,CLAM 用确定性 90 秒裁剪,不在解码或推理失败后引入模型特定的替换轨。

硬件与统计口径如何影响数字的读法?

最终推理在一台苹果 Mac Studio 上执行,PyTorch 模型在支持处使用图形加速,ArtifactNet 的开放神经网络交换模型用中央处理器执行。该信息不用于比较速度,因为论文未测量延迟、吞吐或成本,训练资源、推理开销、输出帧率与实际延迟应分别讨论,不能从总体趋势推定每组都成立。

统计口径方面,每个划分与来源报告真正率或误报率,混合标签划分报告 ROC 面积、平均精度、F1、平衡准确率与混淆矩阵,区间来自血缘自助而非文件自助。这意味着同一录音多编码不会被当作独立证据,区间宽度反映血缘层面的不确定性。比较时必须同时核对数据集、模型基线、实验阶段、指标、单位与聚合对象,数值相同不是同一指标的证据,百分点与相对百分比也不同,不同指标差值不能放入模型列下比较。

公共交集上的配对结果支持什么判断?

主结果要回答的问题是,在同一批成功评分轨、同一冻结阈值规则下,4 个模型的排序是否一致,以及阈值无关排序与工作点行为是否一致。公平条件是 562 轨公共成功测试交集,阈值仅用校准数据选择,覆盖率用全部 579 轨尝试分母保留。指标方向是 ROC 曲线下面积、平均精度、F1 与平衡准确率越高越好,真正率越高越好而误报率越低越好。

条件指标ArtifactNet v9.4Deezer ISMIR 公开检测器未胜出对照
562 轨公共成功交集,校准选阈值AUROC0.9820.761SpecTTTra 与 CLAM 低于 0.30
562 轨公共成功交集,校准选阈值平衡准确率0.9180.776SpecTTTra 约 0.526,CLAM 为 0.500
562 轨公共成功交集,校准选阈值AUPRC 与 F10.994 与 0.9230.925 与 0.758CLAM 校准 F1 为 0.000

该表的主要收益是 ArtifactNet 在该偏移队列的排序与工作点同时领先,Deezer 居第二且阈值无关与校准后行为大体一致。代价与反例同样明确,SpecTTTra 与 CLAM 的分数排序在此队列不迁移,CLAM 为满足校准误报约束需要取高于其最大分数 1.0 的下一个可表示阈值,导致工作点预测无正例,因此不能孤立解读其校准 F1,而应同时看阈值无关与原生阈值行为。血缘自助区间保持同样排序,ArtifactNet 的 ROC 面积区间为 0.971 至 0.991,Deezer 为 0.723 至 0.798,区间不重叠只是该冻结队列的描述性证据,不是对未来生成器的普遍宣称。

下图是按来源分层的对应视图,它把聚合均值可能掩盖的生成器版本崩塌展开。图前导读如下,读者应先确认横轴 4 个模型与纵轴合成与真实来源格,再按颜色从深绿到深红理解类别正确率从 1.0 到 0.0 的变化,并注意每格标注的是合成侧真正率还是真实侧误报率。

看图路径: 1. 先按横轴四个模型纵轴十五个来源格逐行读每格标注的 TPR 或 FPR 数值;2. 再对比 ArtifactNet 首列多为深绿高值与 SpecTTTra 第二列大面积接近零的差异;3. 最后检查 Deezer 第三列在 Suno 与 Udio 行回升而 SpecTTTra 仍低的生成器相关模式;4. 同时核对最下两行 FMA 与 Web 真实集的 FPR 在 Deezer 列的变化

原论文 Figure 1:Per-source TPR for synthetic strata and FPR for real strata on the paired test intersection.

论文图 1。原论文 Figure 1::“Per-source TPR for synthetic strata and FPR for real strata on the paired test intersection. Values use calibration-selected thresholds.”。

从像素可见,ArtifactNet 首列在 MusicGen 大、中、小、Riffusion、Suno 第三版等多行保持 1.00 或 0.95 左右的高值,但在 Udio 内容分发网络与补充行回落到 0.62 与 0.66。SpecTTTra 第二列大面积为 0.00,仅 Suno 第 3.5 版等少数格为 0.52 或 0.33。Deezer 第三列在 Suno 第四版与补充行达 0.94 与 1.00,在 Udio 补充行达 0.91,但在早期 AIME 多行较低。最下两行真实集中,Deezer 在网络真实行的误报为 0.21 而 FMA 行为 0.02,ArtifactNet 则相反为 0.00 与 0.04。这支持生成器侧与真实侧都不存在单一稳定域的判断,也说明有利组均值可以与版本级崩塌共存。

生成器偏移 × 真音乐域偏移: 生成器偏移指合成侧随生成器家族与版本变化而检出率变化;真音乐域偏移指真实侧随 FMA 授权音乐与网络难负例变化而误报率变化。两者必须同时看的原因是聚合指标把两侧混在一起,一个模型可能在合成侧上升的同时在真实侧恶化,论文按来源分组分别报告 TPR 与 FPR,揭示 ArtifactNet 与 Deezer 在 AIME、Suno 补充集、Udio 补充集与两类真实集上走向相反。

按采集组汇总的数字进一步支持上述模式。下表比较各模型在 3 类合成组与两类真实组的行为,阅读时注意阈值是各模型校准选择而非统一阈值。

条件ArtifactNet v9.4Deezer ISMIR反例含义
AIME 真正率0.9260.332Deezer 在 AIME 明显偏低
Suno 补充真正率0.8970.968ArtifactNet 仍高但 Deezer 反超
Udio 补充真正率0.6500.875ArtifactNet 出现明显回落
FMA 误报率0.0400.020两者在 FMA 均较低
Web 难负例误报率0.0000.211Deezer 在网络真实侧恶化

该组对照说明聚合 F1 隐藏了两侧的结构变化,来源级比率与阈值无关指标是区分表示可用但阈值失配与真正排序失效的必要条件。

覆盖规则与阈值规则改变了什么?

这一节把阈值策略与缺失处理当作可替换的分析条件。测的是同一批尝试在不同规则下指标如何变化,与谁比是同一模型在公共成功交集与全部尝试分母下的自身对照,以及不同模型在校准阈值与原生 0.5 阈值下的排名变化。条件一致性要求阈值仍只用校准选择,缺失处理分别报告成功交集、缺失即错误悲观界与严格敏感性策略。

条件ArtifactNet v9.4SpecTTTraDeezer ISMIRCLAM
校准后平衡准确率,公共交集0.9180.5260.7760.500
原生 0.5 平衡准确率,公共交集0.9340.3550.7670.473
AUROC,公共交集0.9820.2990.7610.284

该表显示前 2 名在 3 种口径下稳定为 ArtifactNet 与 Deezer,但后 2 名互换,CLAM 在原生 0.5 阈值高于 SpecTTTra,校准后与 AUROC 则低于 SpecTTTra。更重要的是原生行为对两者都不具可操作性,SpecTTTra 原生平衡准确率仅 0.355,CLAM 原生真正率 0.889 但误报率高达 0.942,说明其原生分数靠多判合成驱动,单个标题 F1 会掩盖这种机制。

覆盖与数值可靠性的对照同样关键。下表把成功轨、失败数与覆盖率放在同一分母下比较,指标方向仍是越高越好,但悲观界把每个缺失合成当漏检、每个缺失真实当误报。

条件ArtifactNet v9.43 个对照基线代价含义
成功评分,579 轨尝试562均为 579ArtifactNet 留 17 个测试失败
覆盖率0.971均为 1.000覆盖本身是模型结果
缺失即错误 F1 与平衡准确率0.904 与 0.865Deezer 为 0.756 与 0.777ArtifactNet 仍领先但明显低于成功交集

进一步的严格敏感性策略拒绝任何含非有限块的轨,此时 ArtifactNet 仅评 467 轨测试,在这些轨上 ROC 面积 0.985 与平衡准确率 0.932,但缺失即错误平衡准确率跌至 0.710,因为 112 个测试尝试未解决。全部 828 轨中有 165 轨含至少一个非有限块,141 轨保留至少四块有限而被多数规则挽回,剩余 24 轨未解决,非有限块的均方根最高达负 4.69 分贝全标度,分布不限于静音,论文据此报告为数值模型路径失败而非简单静音输入条件。预定多数规则因此在不为失败块编造更好分数的前提下实质提升覆盖,两套策略与块级日志一并发布是可复现的关键。

哪些结论不能从当前证据外推?

论文用专门章节声明非宣称,初学者应把它们当作复述的一部分。主队列规模不大、类别不平衡且集中在若干生成器家族,补充轨的平台版本标签不完整,公开血缘证据无法重建每个 CLAM 真实训练身份,内容哈希也无法发现所有感知衍生。基准只评价完全生成与真实音乐,不评价人工智能协助的程度或阶段。公开的 Deezer 研究实现不是 Deezer 生产检测器。

另一个限制是编解码配对实验的地位。冻结主运行不含衍生编解码变体,后续编解码分析必须用相同摘录并保留父血缘,不能混入 579 轨主测试。这意味着当前数字不支持对压缩鲁棒性的普遍结论,若要补验证,需要按血缘配对构造相同摘录的编解码对照。

基准构造偏差也需要保留。编解码、时长、采样率或来源捷径都可能无意奖励某个检测器,语义对齐解决一部分问题,内容血缘与划分暴露解决另一部分,但都不保证部署有效,广播退化等信道差距提醒干净文件基准必须声明其域。

要复现比较,第一步应冻结什么?

复现的第一步不是跑模型,而是冻结人群与身份。按论文动作,应先获取上游来源并按已发布摘要验证字节,恢复所选 FMA 标识的官方存档身份,计算被评估字节的 SHA-256 并分配血缘标识,剔除与已恢复训练音频的精确字节匹配以及声纹发现的真实变体,再按来源层内确定性盐划分校准、验证与密封测试并写入清单后不再改动。

第二步是锁定执行。固定仓库、模型与特征编码器版本,物化 ONNX 外部数据文件并记录版本,对 CLAM 记录检查点摘要与编码器版本。所有适配器接收相同解码单声道波形与相同顺序轨标识,内部重采样到原生采样率,固定时长用中心裁剪,ArtifactNet 用七块 4 秒均匀块与至少四块有限取中位数的预定规则,严格敏感性结果另行记录。阈值只用校准行按误报率约束选择并冻结,验证只做诊断,测试只用 1 次。

第三步是保留可审计制品。每个结果目录应包含输入清单摘要、所选轨标识、种子、包版本、平台字符串、模型来源、逐轨分数与结构化失败,配对比较用公共成功交集但同时报告完整尝试分母的覆盖率与缺失即错误界,并用 2000 次血缘自助法给出区间。按本次证据规则,不把发布渠道描述转化为可达性承诺,复现前需自行确认当前可获取的清单与权重状态。

这篇论文留给新生的可复述结论是什么?

把全文学到的依赖链压缩成可复述的动作。先绑定字节与血缘,再冻结校准验证测试划分,然后锁定版本执行并单独记录缺失,最后在公共成功交集上同时看阈值无关排序、校准工作点与来源分组。按此链条,ArtifactNet 在 562 轨交集上以 0.982 的 ROC 面积与 0.918 的平衡准确率领先,Deezer 以 0.761 与 0.776 居第二,另 2 个模型低于 0.30,但 ArtifactNet 在 Udio 补充集回落至 0.650 而 Deezer 在该组为 0.875,且 Deezer 在网络真实集误报升至 0.211。

何时值得尝试该基准方法,是当你怀疑自己的提升来自换队列、调阈值或丢失败样本时,用它的血缘划分、校准冻结与覆盖报告重做 1 次比较。还需补的验证包括相同摘录的编解码配对、更多生成器家族与广播信道退化,以及 CLAM 未解决暴露的身份补齐。在此之前,任何把当前数字读成通用检测能力的说法都属于待验证推测。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-23 语音/音乐/音频论文速递