英文题目:A Data-Centric Approach to Generalizable Speech Deepfake Detection
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.796
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集构建 #鲁棒性 #语音 #语音伪造检测
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Wen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuchen Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测的输入为待测语音波形,输出为真伪二分类分数,难点在于未知伪造方法与声学条件偏移下泛化急剧下降,单数据集训练易过拟合数据集偏置而在域外测试中失效。该工作先以受控合成数据开展大规模实证研究,拟合源多样性与生成器多样性同泛化误差的幂律关系,明确多样性优先于数据量的缩放规律。接着将异构数据池按细粒度域索引为真实源域与伪造源加生成器域,为均衡混合提供可操作单元,其输出的域划分直接进入采样策略。然后以饱和截断与温度加权实现均匀采样,其中剪枝版本按截断上限限制每伪造域样本量并配比真实样本,加权版本保留全池并调整各域训练时采样概率,其输出的均衡数据分布进入后端训练。最后以加权随机采样训练XLS-R后端分类器,经时序平均池化与多层感知机头微调实现真伪判别。与在固定验证集上优化混合权重的自动混数方法不同,该策略以最大熵均匀先验直接追求未知攻击鲁棒性而无需代理模型,避免大域主导造成的负迁移。在8个公开测试集下,DOSS训练的XLS-R-300M模型的平均EER为2.14%,低于XLS-R-2B基线的3.94%。该结论适用边界限于英汉为主语料与300M至1B规模自监督后端,对其他语言与更大算力预算的外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/myshell-ai/MeloTTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/2noise/ChatTTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/resemble-ai/chatterbox — 链接可访问(HTTP 200)
- 第三方资源:https://learn.microsoft.com/azure/ai-services/speech-service → https://learn.microsoft.com/en-us/azure/ai-services/speech-service/ — 链接可访问(HTTP 200)
- 第三方资源:https://platform.openai.com/docs/guides/text-to-speech → https://developers.openai.com/api/docs/guides/text-to-speech — 链接可访问(HTTP 200)
- 第三方资源:https://Elevenlabs.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://ai.aliyun.com/nls/tts — 链接可访问(HTTP 200)
- 第三方资源:https://ai.baidu.com/tech/speech/tts — 链接可访问(HTTP 200)
- 第三方资源:https://www.xfyun.cn/services/online_tts — 链接可访问(HTTP 200)
- 第三方资源:https://www.minimaxi.com → https://www.minimax.cn/ — 链接可访问(HTTP 200)
- 第三方资源:https://help.aliyun.com/zh/model-studio/qwen-tts → https://help.aliyun.com/zh/model-studio/non-realtime-tts-user-guide — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留哪些可核对信息?
本文输入是待判定的语音波形,目标是判断它是真实录制还是合成伪造,重点是面对训练时没见过的合成方法仍能保持判断稳定。读者对象是刚进入语音与音频方向的研究生,因此解读先把可复述的动作讲清楚,再讲数字结论。需要保留的信息包括数据如何按来源与生成器划分、训练与评测条件是否一致、指标方向是越低越好还是越高越好,以及关键超参数的原文取值。输出是一套可核对的数据组织方法,而不是新的网络结构。
论文把研究问题拆成两个实践视角。第一个视角是构建单个数据集时,如何在来源多样性、生成器多样性与每个单元的数据量之间分配资源。第二个视角是聚合多个异构数据集时,如何设定混合策略以最大化泛化。全文围绕这两个问题展开,先做受控扩展实验,再提出采样框架,最后用扩大后的数据池验证可扩展性。理解这个顺序很重要,因为后文所有剪枝与加权动作都是扩展规律的直接应用,不能倒置为先有方法再找解释。
已有路线在相同任务上做了什么,本文为何转向数据构成?
语音伪造检测的泛化难题已有 3 条常见路线。第一条是模型路线,设计紧凑的时频网络或引入自监督语音表征,例如用 Wav2Vec2、XLS-R、WavLM 做前端再接分类器。第二条是算法路线,包括数据增强、新的训练目标与优化流程改进。第 3 条是数据路线,但多数工作把新数据集当作孤立的训练测试对,或只当作未见测试集。原文指出前两条路线通常依赖固定且有限的训练基准,容易过拟合到数据集特有偏差。
与之对照的数据混合研究多来自语言模型领域,有手动设上限、过采样高质量域、离线代理模型找权重、在线按模型状态调权重等做法,但它们往往针对已知域的验证集优化,不直接保证对完全未知攻击的泛化。本文的对照点很明确。输入同为语音波形,目标同为跨未见方法的检测,监督同为真假二分类,运行阶段同为训练后在异构测试集上评测。
不同之处在于本文把域定义得更细,把真域定义为来源,把伪造域定义为来源与生成器的组合,并从扩展规律推导采样策略,而不是用代理模型在固定验证集上搜索权重。这意味着复现时不能只比较模型参数量,还要比较训练池的域构成,否则会把数据多样性带来的增益误归于结构改进。
要回答的两个资源分配问题是什么?
第一个问题是构建数据集时的资源分配。假设总合成预算有限,应该增加新的来源、增加新的生成器,还是把已有组合的每个样本量做大。论文把变量形式化为不同来源数、不同生成器数与每单位多样性的样本量。第二个问题是聚合多数据集时的混合策略。每个数据集自带不同的来源、生成器与声学条件,直接拼接会形成大小悬殊的异构池,大数据集会主导训练,小域的伪造痕迹可能被忽略,甚至出现加了数据反而在某些测试集上变差的负迁移。
论文用最大熵思想给出先验假设。在没有证据表明某个已知攻击更重要的情况下,最不偏的假设是把所有已知攻击看作同等重要,采样目标就是逼近均匀分布。这个假设是后文两种实现共用的出发点,复述时要保留它的适用条件。它针对的是防御未知未来攻击,而不是针对某个已知测试集调优。如果你的目标是专门优化某个已知部署环境,这个均匀假设可能不是最优,需要另行验证。
从一个样本到异构池,全流程如何走通?
先沿一个样本走完全程有助于建立全局图。取一段真实语音与其文本,先确定它来自哪个来源数据集,再送入某个文本转语音或声音转换生成器,得到伪造语音。训练时把原始真实片段保留为真类,把合成片段标为假类,两者按设定的真假比例组成训练对。模型输入是重采样到 16 kHz 并切分为 4 秒的波形,前端用 XLS-R 提取表征,时域平均池化后接多层感知机分类器,输出真假概率。多个这样的数据集拼在一起就形成异构池,每个真域按来源索引,每个伪造域按来源加生成器索引。下图把受控构建与野外聚合放在同一框架下,有助于理解为何后文既要做剪枝又要做加权。
看图路径: 1. 先看上半部分从来源经生成器到真假数据集的受控路径;2. 再看下半部分众包与未知生成器汇入后处理的位置;3. 最后看下半部分异构池中大小不一的圆形与来源生成器分布条形图
论文图 1。原论文 Figure 1:“The data landscape for speech deepfake detection, from constructing a single dataset to aggre- gating multiple heterogeneous domains.”。
该图上半部分显示受控路径从语音或文本来源出发,经过文本转语音或声音转换等生成器,生成伪造加真实的数据集,并可经过后处理。下半部分显示野外路径的来源与生成器未知,直接以众包音频汇入。下半部分还用大小不一的圆形表示异构池中各数据集的体量差异,用条形图表示来源与生成器分布的不均衡。这个可视结构直接对应后文的域定义。真域只看来源,伪造域看来源与生成器的组合,真域的采样量要按其关联的伪造域加总来按比例确定。理解这张图后,再看饱和上限与温度的作用就不会混淆,前者是压住大圆,后者是拉平条形。
受控构建的分工是提供来源已知、生成器已知的可控样本,用于对照来源多样性与生成器多样性的各自作用;野外聚合的分工是汇入来源与生成器均未知的众包音频,用于补足真实威胁的异质性。两者必须组合的原因是只看受控会低估野外,只看野外则无法做归因,只有放在同一异构池框架下才能同时推导出剪枝的饱和上限与加权的温度平衡。
受控构建 × 野外聚合: 受控构建指先选定已知来源再选定已知生成器去合成,分工是保证来源与生成器标签可控可复现;野外聚合指从网络众包收集来源与生成器未知的音频,分工是暴露真实分布偏移。搭配的原因是前者适合做扩展规律的对照实验,后者决定最终泛化的上限,组合意义在于用受控实验得到的采样原则去治理野外混合的不均衡。
多样性与数据量如何分别起作用,综合指标如何计算?
扩展实验固定模型与评测协议,只改变训练数据的构成。来源多样性实验用 8 个来源,每个来源选 10,000 条真实样本,再用 4 个零样本合成模型各生成 10,000 条伪造,保持真假比为 0.25,通过改变来源数与数据用量百分比构造训练集。生成器多样性实验固定两个来源,从 SpeechFake 中选 16 个生成器,每个生成器准备 40,000 条伪造,同样保持真假比构造不同生成器数与用量组合。每个条件做 3 次独立随机组合,以平均与极值范围报告结果,避免单次抽样带来的偶然性。
评测用 10 个域外测试集的宏平均等错误率与准确率,并引入校准检测误差作为综合指标。它的符号含义需要先讲清。等错误率为阈值自适应的分错率,准确率为固定 0.5 阈值的判定正确率,括号内是一减准确率即固定阈值下的错误率。计算目标是取两类错误的调和平均,使两者同时低时才低,任一偏高都会拉高综合值。原文明确的实现如下。
\[CDE = 2 · EER · (1 −ACC)\]该式把等错误率与固定阈值错误率放在同等地位,适合综合来源与生成器带来的分歧变化。论文报告的 3 个发现需要连起来复述。第一,在固定预算下增加多样性比增加单调数据量更有效,例如 8 个来源用 12.5% 用量仍优于 1 个来源用全量,16 个生成器用每生成器 2500 条即取得最好整体表现。第二,两类多样性分工不同。增加来源数持续降低等错误率但可能拉低准确率,解释为更完备的真语音流形改善了可分性。
增加生成器数强烈提升准确率但对等错误率不稳定,解释为模型更敢于判定伪造但真假边界未必更清晰。第三,综合误差随多样性呈幂律下降,相关系数较高,说明泛化是可建模的现象。下图展示了这种分歧与收敛,阅读时不要把单条曲线的上下直接等同于整体优劣。
看图路径: 1. 先对照上排来源扩展与下排生成器扩展的横轴刻度;2. 再看不同数据用量颜色线在固定多样性下的间距是否迅速收窄;3. 最后看最右列幂律拟合点的分散程度与图例相关系数
论文图 3。原论文 Figure 3:“Scaling with source and generator diversity.”。
该图上排为来源扩展,下排为生成器扩展,前三列分别为等错误率、准确率与综合误差随数量对数轴的变化,最右列为全量下的幂律拟合。可见来源扩展的等错误率下降较单调,而准确率在来源增多时有所回落。生成器扩展的准确率上升陡峭,但等错误率在生成器数较大时波动。综合误差则在两排都呈下降趋势,拟合直线与数据点贴合较好。这支持后文用均匀化逼近来同时兼顾两类多样性,而不是只优化单一指标。
来源 × 生成器: 来源指合成所依据的真实语音或文本及其声学分布,负责提供说话人、信道与语言等背景变异;生成器指文本转语音或声音转换等合成模型,负责留下特定的伪造痕迹。两者搭配的原因是任何一个合成样本都同时携带背景与痕迹,组合意义在于把数据多样性拆成两个可独立扩展的轴,从而分别解释鉴别力与识别置信度的不同变化。
DOSS-Select × DOSS-Weight: DOSS-Select 负责按饱和上限对每个域做剪枝计数,只保留均衡子集以节省训练量;DOSS-Weight 负责保留全量样本但调整每个域的采样概率,用温度平滑权重分布。搭配的原因是剪枝验证多样性是否比数据量更重要,加权则进一步保留域内变异,组合意义在于同一均匀性假设下提供高效与高性能两条可部署路径。
饱和上限 × 多样性温度: 饱和上限负责把每个伪造域的计数先截断到 Nc,压住大域的主导地位;多样性温度负责对截断后的计数做幂变换再归一化,进一步拉平真假域之间的采样概率。搭配的原因是只截断仍会留下真域因关联伪造域数量不同而产生的不均衡,组合意义在于先用上限造出近似均匀的基分布,再用温度精修真域分布。
剪枝与加权具体如何执行,训练配置如何固定?
多样性优化采样策略有两种实现。剪枝实现先对每个伪造域按原始计数与饱和上限取最小值,得到每个伪造域应选条数。再对每个真域汇总其关联的所有伪造域已选条数,按真假比换算出该真域应选的真实条数,同样受原始真域总量限制。输出是每个域的保留条数,用于构造更小更均衡的子集。加权实现保留全量样本但改变采样概率。
前两步与剪枝类似,先截断再按温度做幂变换得到初始权重,真域同样按关联伪造域加总换算。第三步计算全局调整因子,使所有真域权重之和与所有伪造域权重之和严格满足目标真假比,再用加权随机采样器训练。原文的真假比取 0.25,剪枝侧重点试验 100、500、2500、12500 等上限,加权侧重点试验饱和上限与温度的组合。模型训练固定用 XLS-R 骨干,扩展与混合的大量对照用 300M 参数版本,最终验证再扩展到 1B 参数版本。输入统一重采样到 16 kHz 并按 4 秒切分,不足重复补齐,过长随机截段。
增强包括以 0.5 概率加 Rawboost 波形噪声,以 0.3 概率做编解码压缩增强,有效批量 128。优化器用 AdamW,权重衰减 1e-4。大学习配置按数据量分档,大于 1k 小时跑 200,000 步,前 50,000 步学习率 1e-6 随后指数衰减到 1e-7,中等规模跑 100,000 步,小规模固定 50,000 步以保持预算一致。损失为按真假比设权重的加权交叉熵。推理时测试音频同样按 4 秒切分,等错误率用原始真类分数分布计算,准确率取输出取大即等价于对归一化真分数用 0.5 阈值。
与 Ge 等基线的对比沿用对方全长直推协议,避免切分给对方带来退化。这个细节是公平性关键,复现时必须保留。
数据池、评测集与指标方向如何核对?
混合验证阶段用 12 个公开数据集的训练与开发划分组成数据池,按 T01 到 Tk 累积聚合形成 2、6、8、12 个数据集的朴素拼接基线,总时长从约 926 小时逐步到 6357 小时。剪枝与加权在全量 12 数据集池上执行,剪枝输出时长从 40 小时到 2.9k 小时不等,加权始终看到全量但采样概率不同。最终扩展阶段重新整理 17 个公开集并去重,把共享真实源的冗余真音频替换为规范版本,再用 7 个新生成器与 8 个来源补齐近期合成方法的缺口,形成 18 个真域与 332 个伪造域的 12k 小时池。评测分两类。
公开基准包括 ASV19、DECR 等域内部分可见集,以及 ITW、ADD22、SC、FOR 等未知生成器集,还有多语的 ODSS。商用挑战集用 9 个商用语音合成接口各生成 5000 条,中英文各 2500 条,覆盖多声音与可调的音高音色语速。指标方向要记牢。等错误率越低越好,准确率越高越好,综合误差越低越好,平均值是对多个测试集的宏平均。
等错误率 × 准确率: 等错误率负责在最优阈值下度量真假分数分布的可分性,阈值随测试集自适应;准确率负责在固定 0.5 阈值下度量分类器的判定正确性,反映部署时的阈值鲁棒性。搭配的原因是两者分别捕捉区分潜力与阈值稳定性,组合意义在于用调和平均得到校准检测误差,避免只看单一指标时掩盖来源多样性与生成器多样性的分歧作用。
朴素拼接、剪枝与加权的主结果与代价是什么?
比较问题是同样模型下哪种混合方式泛化最好,公平条件是固定 XLS-R 结构与增强流程,指标方向为平均等错误率越低越好。单数据集训练最脆弱,在自家测试集上可接近满分,但在 10 集平均上较差,说明学到的是数据集偏置。朴素拼接随数据集数增加而明显改善,但存在不稳定,例如 ADD23 从 6 个数据集到 8 个数据集时变差,说明大域主导会带来负迁移。剪枝用极小数据即超过多数朴素拼接,最优上限 2500 时平均等错误率最低,继续增大到 12500 反而因重新引入不均衡而停滞。
加权的最优组合进一步取胜,相对朴素最优与剪枝最优都有 2 位数百分比的相对误差下降。代价是上限与温度必须选对,过大上限加小温度会退化为近似朴素分布。下图解释了为何上限选择如此关键。
看图路径: 1. 先看上图不同 Nc 下选中计数的水平截断线高度;2. 再看下图大 Nc 加小温度曲线是否明显倾斜而不平坦;3. 最后比较温度增大后右侧尾部概率是否被拉平
论文图 4。原论文 Figure 4:“Comparison of domain distributions un- der DOSS-Select and DOSS-Weight strategies. Each colored line represents a distinct hyperparameter config- uration as defined in Table 1.”。
该图上半部分纵轴为选中计数,下半部分纵轴为采样概率,横轴均为域序号。小上限对应近乎水平的截断线,大上限则保留原始长尾。加权图中大上限小温度曲线明显倾斜,而合理上限加中等温度曲线更平坦。这说明先截断再调温的顺序不能颠倒,否则温度作用在高度不均的基分布上效果有限。下表是公开域外集的等错误率对照,保留了大规模朴素基线与本文不同参数量结果,可核对数据效率与模型扩展两件事。
| System #Params | #Hours AVG | ADD22 | ADD23 | FSW |
|---|---|---|---|---|
| MMS-300M 317M 74k | 6.61 | 2.64 | 7.96 | 16.15 |
| XLS-R-2B 2.2B 74k | 3.94 | 1.05 | 4.67 | 19.14 |
| XLS-R-300M 317M 12k | 2.14 | 0.82 | 3.63 | 8.70 |
| XLS-R-1B 965M 12k | 1.65 | 1.40 | 2.25 | 6.47 |
表后需要解释主要收益与具体代价。收益是本文 300M 模型用 12k 小时取得 2.14% 平均等错误率,低于 74k 小时 2.2B 模型的 3.94%,1B 模型进一步降到 1.65% 并在 8 项中 6 项取得最优,说明多样性优先于单纯堆量与堆参数。代价与反例是 ADD22 等个别集上 1B 模型并不总是优于 300M,且朴素大模型在 FOR 等集上仍有竞争力,说明总体趋势不等于每集都成立。下表是商用接口的准确率对照,指标方向为越高越好,可核对对新一代高保真合成的迁移。
| System | AVG | 11Labs | MiniMax | Qwen3 |
|---|---|---|---|---|
| XLS-R-2B | 86.31 | 81.90 | 76.48 | 39.88 |
| XLS-R-300M | 92.81 | 92.12 | 90.50 | 55.94 |
| XLS-R-1B | 96.01 | 86.30 | 91.94 | 87.32 |
表后解释要突出最难的接口。平均准确率上本文 1B 模型比大基线高近 10 个百分点,在 Qwen3 上从 39.88% 提升到 87.32%,在 MiniMax 上从 76.48% 提升到 91.94%。代价是 Qwen3 与 MiniMax 仍明显低于谷歌、微软等易检接口,且同一接口的中英文表现可能大幅波动,说明语言相关声码器痕迹仍是边界条件。
去掉均衡会怎样,学到的表征是否保留来源与生成器结构?
反证部分先看超参数。剪枝侧上限过小仍有效但非最优,上限过大则分布回摆。加权侧固定上限 2500 时温度从 1 升到 5 改善明显,再升到 100 则几乎无增益,说明真域拉平存在饱和。上限取 50000 且温度为 1 时效果差于剪枝最优,直接证明不做均匀化只做全量训练不是好策略。准确率侧的补充结果显示,随着整体分离变好,等错误率与准确率的分歧收敛,最终 300M 与 1B 模型分别达到 96.88% 与 97.40% 平均准确率,与等错误率趋势一致。
潜在表示分析用线性探针与可视化验证模型是否隐式编码来源与生成器。方法是从时域池化层取冻结嵌入,在均衡的 10,000 条子集上训练逻辑回归探针,分别预测真源、伪造源与伪造生成器编号,并用 t-SNE 按来源或生成器着色。下图显示训练前后真假分离的变化。
看图路径: 1. 先比较上排初始模型与下排最终模型中真假两团是否分离;2. 再看右下子图中蓝色真类点是否独立成一支;3. 最后观察左下子图中不同来源颜色是否仍混杂在同一假团内
论文图 7。原论文 Figure 7:“t-SNE visualization of the initial and final model’s latent space.”。
该图上排为初始预训练模型的嵌入,下排为最终模型的嵌入。初始模型中真假点高度交叠,最终模型中真假形成分离的两支,且右下子图中真类蓝色点独立成团。这支持二分类目标下模型仍保留并锐化了属性结构。定量上初始模型已远高于随机猜测,最终模型在真源与生成器探针上进一步提升,且生成器比伪造源更易探出,真源比伪造源更易探出,提示合成过程部分遮蔽了原始来源信息。需要用支持与待验证区分表述。
探针提升支持模型利用了伪造痕迹,但不能直接证明分类决策因果依赖于这些属性,仍是相关性证据。下表是准确率侧的完整对照,用于核对等错误率结论是否在固定阈值下依然成立。
| System #Params | #Hours AVG | ADD22 | ADD23 | FSW |
|---|---|---|---|---|
| XLS-R-2B 2.2B 74k | 94.62 | 98.97 | 96.65 | 75.83 |
| XLS-R-300M 317M 12k | 96.88 | 99.38 | 97.09 | 89.31 |
| XLS-R-1B 965M 12k | 97.40 | 98.90 | 96.93 | 92.77 |
表后要说明未胜出项。个别公开集上大基线或 300M 模型可能占优,且 FOR 等集的差距较小,说明方法优势主要来自最难的未知生成器与野外集,而不是在所有集上全面碾压。下表进一步按语言拆分商用接口,可核对语言依赖这一边界。
| Model | AVG | 11Labs | MiniMax | Qwen3 |
|---|---|---|---|---|
| XLS-R-2B | 83.25 | 63.97 | 74.36 | 37.12 |
| XLS-R-300M | 90.62 | 89.96 | 89.32 | 41.28 |
| XLS-R-1B | 93.79 | 82.60 | 87.68 | 76.40 |
表后解释语言反例。基线在 ElevenLabs 上中文近满分而英文大幅下跌,本文模型在 Qwen3 上中文 98.24% 而英文仅 76.40%,说明同一接口不同语言的合成链路确有差异。复现时若只测英文会低估方法在中文上的表现,必须按语言分别报告。
哪些条件未被验证,不能承诺什么?
本文为隔离数据构成的影响,固定了模型结构与训练配置,没有穷举更大参数量与算力预算下的协同变化。从 300M 到 1B 的扩展验证了框架内可扩展,但不能推广为任意规模下都成立。数据池语言集中在英文与中文,虽符合多数公开集的构成,但对其他语言的泛化未经充分验证,多语检测需要额外收集稀有语言数据并处理语言不均衡。方法假设未知攻击同等重要,若部署目标是某个已知环境的最优,则均匀假设可能次优。
未测量的量不能承诺改善,包括推理延迟、吞吐、误判率在特定阈值下的业务成本,以及长音频与流式场景的稳定性。原文的冲突点也要如实保留。来源多样性提升可分性却可能损害固定阈值准确率,生成器多样性提升识别置信却可能模糊边界,因此单看一侧指标会得出相反结论,必须用综合误差或同时报告两者。幂律拟合相关性高不等于因果,探针可分不等于决策依赖,这些都应表述为支持而非证明。
复现先做什么,需要哪些划分与超参数?
复现先重建域索引。把每个真音频映射到来源,把每个伪造音频映射到来源加生成器,记录每个域的原始条数。核对真假比 0.25、剪枝上限与加权温度的原文组合,以及全局真假比校准这一步是否实现,缺少校准会使真类采样偏离目标。其次固定数据处理。16 kHz 重采样、4 秒切分、不足重复补齐、过长随机截段、Rawboost 概率 0.5、编解码增强概率 0.3、批量 128、AdamW 权重衰减 1e-4、按数据量分档的学习率与步数、加权交叉熵。
推理必须区分两种协议。自家模型用 4 秒切分,对比 Ge 等基线时用对方全长直推,否则会人为压低基线。评测先跑 10 集宏平均的等错误率与准确率,再跑商用 9 接口的中英文各 2500 条。商用生成要保留多声音与随机变速变调,否则多样性不足会高估准确率。资源状态是正文开源声明的唯一依据,本次收到的第三方链接状态为可用,但可用不等于权重可下载或系统可一键运行。
MeloTTS、ChatTTS、Chatterbox、微软、OpenAI、ElevenLabs、阿里、百度、讯飞、MiniMax、Qwen3 的链接本次显示可用,复现商用集仍需遵守各接口服务条款并自备调用配额。缺项要明确。原文未给出每步梯度路径与全部随机种子,未报告推理延迟与硬件预算,附录中的域分布图只能定性核对均匀程度,不能读出精确到条的数值,像素不能精确辨别的步数不要硬写。
何时值得尝试这套数据方法,如何一句话记住它?
当你的检测器在自家测试集很好但一到新合成方法就掉点,且训练池由多个来源拼成、大小悬殊时,值得尝试这套方法。先做小规模扩展对照,确认增加来源或生成器是否比增加单调数据量更有效,再用小上限剪枝快速验证均匀化的收益,最后用保留全量的加权取得更高性能。记住一句话。多样性决定上限,均匀性决定能否达到上限,数据量只在多样性不足时显效。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



