英文题目:XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
会议身份:
conference:eacl:2026:conference-paper-id:2026.findings-eacl.162
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #基准设计 #多语言 #语音 #音频深度伪造检测
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Ioan-Paul Ciobanu:机构信息未能从会议 PDF 纯文本可靠映射
- Andrei-Iulian Hîji:机构信息未能从会议 PDF 纯文本可靠映射
- Nicolae Catalin Ristea:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Irofti:机构信息未能从会议 PDF 纯文本可靠映射
- Cristian Rusu:机构信息未能从会议 PDF 纯文本可靠映射
- Radu Tudor Ionescu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测以原始波形或谱图为输入,输出真伪二分类,难点在于野外部署时说话人、录制来源与合成器均未知而实验室评测长期同分布。作者先从七语公开语料采集真实语音并按语种配对双源,再经文本到语音合成初声并以原说话人语音做语音转换克隆以保留内容与音色。随后按语种内双方法划分训练与域内测试,并跨语种换说话人换来源换方法构建跨域测试,使训练输出直接成为域内与跨域评测的输入对照。相对仅含伪造或单语同分布评测,该设计以说话人与方法隔离为核心差异,使语言偏置与生成器记忆无法充当捷径,因而更能暴露泛化失效。在阿拉伯语跨域测试集下,AST模型的准确率为73.39,低于域内测试集下同一模型的准确率99.97。该结论适用边界受限于短句朗读类语音与所选开源合成器组合,尚未验证长时对话、强压缩与未知高阶商用克隆的外推,失败条件集中于强噪声与跨语言跨域叠加。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 模型相关资源:https://github.com/pytorch/vision — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/MIT/ — 暂时无法访问
- 模型相关资源:https://github.com/ristea/septr — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/idiap/coqui-ai-TTS — 链接可访问(HTTP 200)
- 第三方资源:https://keithito.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么已有检测器号称接近满分仍不可信?
这篇解读的输入是论文正文与 3 张官方原图,目标是让研究生能核对并复述 XMAD-Bench 的构造与评测,必须保留的信息是数据规模与划分、生成流程、训练配置、域内与跨域对照结果,输出是按学习依赖展开的中文技术说明。论文研究的任务是音频伪造检测,也就是判断一段语音是真实录制还是合成或转换生成的假语音。白话说,已有工作常在同一批生成器上训练和测试,模型记住生成器留下的固定痕迹就能拿高分,一旦换了生成器、说话人或录制来源就失灵。论文把这种换条件的评测叫跨域评测,把野外未知生成器的情形叫在野外测试。
要理解这种落差,先看语料的总量与语言覆盖是否足以支撑跨域结论。论文报告总量为 668.8 小时,覆盖阿拉伯语、英语、德语、汉语普通话、罗马尼亚语、俄语和西班牙语 7 个语言,每个语言都有两种真实来源,从而能把训练与跨域测试彻底分开。下图按语言展示了总时长分布,可以直观看到英语和俄语体量大、德语汉语西班牙语体量小的不平衡结构。
看图路径: 1. 先看横轴七个语言的排列与纵轴小时数刻度;2. 再比较英语与俄语高柱和德语、汉语、西班牙语矮柱的落差;3. 最后把柱上标注的 117、230、29、21、49、193、29 与总时长 668.8 小时对应起来

论文图 1。原论文 Figure 1:“XMAD-Bench comprises 668.8 hours of real and fake speech samples across seven languages: Arabic (Ar), English (En), German (De), Mandarin Chinese (Zh), Romanian (Ro), Russian…”。
上图为黄色柱状图,标题为 XMAD-Bench in hours,横轴为 7 个语言,纵轴为以小时为单位的时长,柱上标出各语言总量,其中英语柱最高、俄语柱次高、汉语普通话柱最低。这种不平衡是后文解读跨语言结果时必须记住的前提,因为小语种的跨域数字波动更大,不能直接与大语种的平均值比较。论文同时强调总量之外还有说话人规模与真假平衡,共 4403 个不同说话人,真样本为 207K 个、伪造样本为 207K 个,这种配对平衡是为了防止模型靠语言或数量偏置取巧。
同类数据集在语言与跨域组织上缺了哪一块?
论文把相关路线分成 3 类对照。第一类是自动说话人验证反欺骗常用的单语库,例如基于 Voice Cloning Toolkit 的 ASVspoof 2019 与 2021,以及基于爱 shell 普通话语料的 ADD 2022 与 2023,白话说就是只覆盖英语或汉语,生成器集合固定,适合比拼域内精度但测不出换生成器的能力。第二类是多语言伪造库,例如 WaveFake 覆盖英语与日语,MLAAD 覆盖多语言但只提供假样本,需要另找真实样本配对,若真假语言集合不一致就会引入语言偏置,也就是模型把某种语言直接判真或判假。第 3 类是跨域尝试,例如在 ASVspoof 上训练到 MLAAD 上测试观察到大幅下降,以及单语跨域的 CD-ADD 用 5 个零样本语音合成模型制造跨域,但缺少真实语音或缺少多语言。
论文的对照结论是 XMAD-Bench 同时做到三点:7 个语言的真假样本都齐备且平衡,提供训练集、域内测试集、跨域测试集的官方 3 路划分,跨域端在说话人、真实来源、生成方法上都与训练隔离。已有综述提到图神经网络与 Transformer 方法在旧库上等错误率做到约 1%,论文认为这恰好说明旧库已饱和,需要换更难的跨域组织。教学例子是:若只把 MLAAD 当测试集而训练集另找真样本,语言不匹配会让模型学到语言而不是真假,这属于例子,用来理解平衡设计的动机,不添加无源的效果数值。
跨域问题到底要隔离哪些变量?
论文把待解问题定义为在说话人未知、生成方法未知、真实来源未知时仍能判对真假。白话说,域内测试好比考试题与练习题出自同一老师,跨域测试好比换老师、换教材、换考场。形式上,每个语言内部划出三份数据:训练集、域内测试集、跨域测试集,说话人在三份之间互不重叠。更关键的是跨域测试的真样本来自与训练不同的原始库,假样本用与训练不同的一组生成方法合成。论文还说明随时间推移,已知模型在测试中的占比会下降,因此把跨域直接称为在野外测试,并允许把两个测试集合并成所需比例的野外混合。
域内测试 × 跨域测试: 域内测试指训练与测试用同一批真实来源和同一组生成方法,分工是检验模型是否学会已知伪造痕迹,跨域测试指测试换用不同说话人、不同真实来源和不同生成方法,分工是检验野外未知条件下的泛化,搭配理由是只看域内会高估能力,二者对照才能暴露模型记住的是生成器指纹还是真假本质。
这种定义带来一个可复述的检查动作:拿到一个结果时先问它测的是哪一份,若是域内则只能证明记住已知生成器,若是跨域才能谈泛化。论文的中心矛盾正是域内常达 100% 而跨域有时近随机,问题不在于模型学不会,而是学到的特征随生成器变化而失效。
一条样本如何从真实音频变成配对假音频?
方法全景可以沿一条样本走完。输入是一段真实音频及其文字稿,输出是一段内容相同、音色模仿原说话人的假音频。中间分两步:先用文本转语音模型把文字读成语音,再用声音转换工具把音色向原说话人靠拢。白话说,文本转语音解决说什么,声音转换解决听起来像谁。部分一体模型如 XTTSv2、YourTTS 与 VALL-E-X 可同时接受文本与参考音色直接生成,不再需要额外转换步。
文本转语音 × 声音转换: 文本转语音负责把真实样本的文字内容读成新的语音,解决内容对齐问题,声音转换负责把这段语音的音色向真实说话人靠拢,解决身份模仿问题,二者搭配的理由是只做前者会留下说话人不像的破绽,只做后者又缺可控文本,组合后得到内容相同但说话特征被克隆的配对假样本,使检测器不能靠文本或时长走捷径。
下图是论文给出的通用流程,左侧数据集分出文字稿与真实片段两条线,分别进入语音合成与声音转换,最后汇合成假片段。
看图路径: 1. 先沿左侧数据集分出的两条线看文本与真实音频的去向;2. 再看文本经 TTS 与真实音频共同进入 VC 汇合点的箭头;3. 最后确认输出端假片段与输入端真片段的内容对应关系

论文图 2。原论文 Figure 2:“General flow for fake sample generation based on various text-to-speech and voice conversion tools.”。
上图可见两条输入箭头在声音转换模块汇合,说明最终假样本同时依赖文本内容与原说话人特征。论文强调所有方法都从待克隆的真实样本提取说话特征,且假样本长度与真样本相当,避免模型靠时长区分真假。所有真实与假片段都做两端静音裁剪并重采样到 16 千赫,避免靠采样率或静音段走捷径。阿拉伯语来源 MASC 因含音乐与长视频,还用音乐检测过滤音乐占比大于 5% 的片段,只取每段前 7 分钟再按字幕切分,保留长于 4 秒且字幕短于 160 字符的片段,VoxPopuli 则只选短于 20 秒且说话人总量不少于 2 分钟的片段,以保证转换质量。
检测器与生成器组件各自承担什么计算?
检测侧论文用 6 种配置:从 Torchvision 微调的 ResNet-18 与 ResNet-50、从 Hugging Face 微调的音频谱图 Transformer 即 AST、同样微调的 wav2vec 2.0、从零训练的 SepTr,以及冻结 Whisper-Large-v3 编码器加全局平均池化与浅层多层感知机的组合。白话说,ResNet 与 AST、SepTr 先把音频转成频谱图再分类,wav2vec 2.0 直接吃原始波形,Whisper 路线只训练小分类头。频谱图的具体做法是用 320 点短时傅里叶变换、160 点跳帧加汉恩窗,得到 499 乘 161 的谱,SepTr 为效率降采样 4 倍,AST 则用 1024 乘 128 的梅尔谱默认配置。
频谱图 × wav2vec 2.0: 频谱图是把音频先做短时傅里叶变换得到时频表示,供卷积与谱变换模型使用,分工是提供手工时频输入,wav2vec 2.0 是直接吃 16 千赫原始波形的自监督编码器,分工是提供从波形学到的表征,二者搭配的理由是比较手工谱特征与预训练语音表征在跨生成器条件下的稳健性差异,组合意义在于论文同时覆盖两条输入路线。
生成侧文本转语音在 VITS、XTTSv2、fairseq 版 VITS、Tacotron2、MeloTTS、YourTTS、GlowTTS、VALL-E-X 与 Bark 之间轮换,声音转换在 KNN-VC、FreeVC 与 OpenVoice 之间轮换,均使用公开预训练权重且不做语言自适应。域内每个语言用两种合成流程各生成一半假样本,跨域每个语言用尽可能多且与域内不同的方法。KNN-VC 需要约 2 分钟的多段参考语音,其他转换工具只需单段参考。
冻结编码器 × 多层感知机: 冻结编码器指 Whisper-Large-v3 参数不再更新,只负责输出抗噪的语音特征,分工是保留大规模弱监督学到的稳健表示,多层感知机是接在全局平均池化之后的小分类头,负责在目标语言上学真假边界,搭配理由是用小可训练头适配数据而不用大编码器过拟合已知生成器,组合意义是检验冻结大模型加浅层头能否提升跨域稳健性。
论文在噪声实验中用到的高斯噪声水平以如下三档给出,符号西格玛表示加入噪声的标准差,零表示无噪声,其余两档为人耳可闻但程度不同。
\[σ = 0 (no noise) σ = 0.01 σ = 0.1\]上式不是训练目标,只是评测时向罗马尼亚语跨域样本加噪声的条件标记,后文结果节会对照这三档的准确率与等错误率变化。
训练如何组织、增强与选 checkpoint?
训练流程按语言独立进行:在某语言训练集上训练,在该语言域内测试集上每轮评估,选域内最优 checkpoint 再测跨域测试集。另有一组跨语言实验,在阿拉伯语、德语、罗马尼亚语、俄语与西班牙语上训练,每语言至多随机取 3000 条,在英语与汉语上测试,同样区分域内与跨域。优化目标是交叉熵损失,训练 20 轮,学习率固定为 5 乘 10 的负 4 次方,无权重衰减。输入统一截成 5 秒,长则随机截一段,短则补零。训练时以二分之一概率做增强,增强包括时间滚动、变速、随机增益、削波、混响、 shelf 与峰值滤波的频谱偏移以及变调。
小批量大小按模型体量设置,ResNet-18 为 200,ResNet-50 为 120,wav2vec 2.0 为 16,AST 与 SepTr 均为 10。论文未报告优化器种类、学习率调度、梯度裁剪与早停 patience 等细节,也未说明冻结层之外的梯度路径差异,因此复述时只能说用交叉熵训练指定轮数并按域内最优选模型,不能推定具体优化器实现。Whisper 路线明确冻结编码器,只训练池化后的多层感知机,这一点是原文明确给出的参数更新边界。
下表整理可直接复现的训练与输入配置,数值与单位保留原文写法,裸数值不擅自添加百分号。
| 配置项 | 指标或参数 | 训练设置 | 跨域评测输入 | 备注 |
|---|---|---|---|---|
| 优化轮数与学习率 | 训练轮数 | 20 | 5 秒定长输入 | 学习率 5·10 负 4 次方无权重衰减 |
| 小批量 | ResNet-18 批量 | 200 | ResNet-50 批量 120 | wav2vec2 批量 16,AST 与 SepTr 批量 10 |
| 频谱与采样 | 谱尺寸 499 乘 161 | 320 点变换 160 跳帧 | 重采样 16 千赫 | AST 用 1024 乘 128 梅尔谱 |
上表说明复现时先固定输入与批量,再按语言独立训练并用域内选优,避免把跨域数据提前用于调参。未报告的优化器与调度是缺项,需要补验证才能对齐训练曲线。
评测条件、指标方向与质量核查是什么?
评测要回答 3 个问题:域内能否学会已知生成器,换生成器后掉多少,不同语言与噪声下是否一致。与谁比是 6 种检测器在相同划分下比较,条件一致性靠同一语言内训练与测试划分固定、说话人不重叠、跨域生成器与来源都不同来保证。指标方向是准确率与曲线下面积越高越好,等错误率越低越好,每种配置跑 3 次报告均值与标准差。
准确率 × 等错误率: 准确率统计阈值固定时判对的比例,分工是给出直观对错,等错误率是误接受与误拒绝相等时的错误水平,分工是给出与阈值选择无关的判别能力,搭配理由是跨域时模型偏向会漂移,只看准确率会被偏置误导,组合后同时报告准确率、曲线下面积与等错误率才能判断是真能分开还是偏向一侧。
数据质量核查用语音活动比、信噪比与 DNSMOS 类感知模型给出的语音质量、背景噪声与总体质量分。论文报告真假样本的语音活动比与信噪比接近,感知分也接近,支持假样本质量与真样本相当的判断,排除靠明显噪声区分的捷径。需要区分的是这些质量分是数据构造的核查,不是检测性能,不能当作检测器好坏的证据。
下表给出语料规模与平衡性的关键数字,用于核对实验条件是否如论文所述。
| 条件 | 指标 | 总量 | 真假分布 | 说话人 |
|---|---|---|---|---|
| 划分 | 训练 347.40 小时 | 域内 92.17 小时 | 跨域 229.26 小时 | 3 路说话人互不重叠 |
| 语言 | 七语种 | 阿拉伯英语德语汉语罗马尼亚俄语西班牙 | 每语言两种真实来源 | 跨域来源与生成器均不同 |
上表的主要代价是语言间时长不平衡,英语与俄语占大头,跨语言平均会被大语种主导。后文主结果必须按语言分别看,不能只看跨语言平均。论文还声明以 CC BY-NC-SA 4.0 共享,链接当前是否可达需以资源状态为准,这里不做可达性断言。
域内满分到跨域崩塌的具体数字是什么?
主结果的核心判断是域内极高而跨域大幅下降。论文报告多个模型在域内达到 100%,跨域则有时近随机。相对稳健的是 wav2vec 2.0 与 Whisper 加多层感知机,在多数语言的跨域上优于其他模型,且 wav2vec 2.0 在多语言与跨语言设置中保持语言无关表征的优势。但稳健是相对的,不是每种语言都可用,德语与西班牙语跨域保持较好,阿拉伯语与俄语跨域掉得最重。
要读懂偏置方向,需要看跨域混淆矩阵。下图给出 ResNet-18 与 AST 在阿拉伯语与英语跨域上的 4 个矩阵,行是真实标签,列是预测标签。
看图路径: 1. 先按图注确认第一行是 ResNet-18、第二行是 AST,第一列阿拉伯语、第二列英语;2. 再读每个 2 乘 2 矩阵中真标签行与预测列交叉的四个计数;3. 最后比较阿拉伯语两模型偏向假与英语两模型偏向相反的现象

论文图 3。原论文 Figure 3:“Cross-domain confusion matrices of ResNet- 18 (first row) and AST (second row) on Arabic (first column) and English (second column). Best viewed in color.”。
上图可见阿拉伯语上 AST 把大量真判成假,ResNet-18 两类错误都多,英语上 2 模型偏置方向相反。论文据此认为偏置是模型特有的,不是数据集单向偏置,这支持 XMAD-Bench 具有挑战性与稳健性的判断。像素可辨的 4 个计数已在图中标出,复述时应按图读数而不猜测颜色深浅对应的阈值。
下表提炼论文文字直接报告的主趋势,不制造逐模型逐语言的精确值对照,精确逐格数字需回原文大表核对。
| 评测 | 指标方向 | 域内表现 | 跨域表现 | 相对最优 |
|---|---|---|---|---|
| 七语种 | 准确率越高越好 | 常达 100 百分比 | 有时近随机 | wav2vec2 与 Whisper+MLP 多数语言领先 |
| 跨语言 | 等错误率越低越好 | 语言迁移影响小 | 仍明显下降 | wav2vec2 保持前列 |
| 偏置 | 混淆矩阵 | 域内两类皆对 | 跨域偏置随模型变 | 不支持数据集单向偏置 |
上表的主要收益是明确了何时可用:若部署环境生成器已知,域内训练足够,若生成器未知则需跨域验证。代价是 ResNet 与 SepTr 在阿拉伯语、俄语、英语跨域上跌幅大,未胜出项恰好证明不能用域内满分承诺野外效果。跨语言域内实验显示语言迁移本身影响不大,下降主要来自生成器与来源变化,这是支持跨域设计有效性的有限解释,不是因果证明。
噪声与未胜出模型说明了什么边界?
论文用罗马尼亚语上的 Whisper 加多层感知机做背景噪声注入,作为失败条件与稳健边界的特写。训练只用干净样本,测试加零、一分与十分之标准差的高斯噪声。报告的趋势是中等噪声下性能基本不受影响,加大噪声后性能下降,但此时部分语句人耳也难分辨。论文的有限解释是冻结的 Whisper-Large-v3 骨干对背景噪声较稳健,这属于支持性解释,待验证的是换其他语言或换训练加噪是否同样成立。
另一类反证是未胜出项。SepTr 从零训练,在域内已低于微调模型,跨域在罗马尼亚语与俄语上接近随机,说明小模型从零学谱特征更易记住已知生成器。ResNet-18 与 ResNet-50 在德语与西班牙语跨域上反而保持高位,但在阿拉伯语与俄语上崩塌,说明跨域难度随语言的生成器组合与来源差异而变化,总体趋势不等于每组都成立。复现时应保留这些不利基线,不能只展示表现好的语言。
论文未做跨域自适应,也未报告延迟、算力与推理开销,因此不能承诺加噪声训练或换大模型一定改善延迟与成本。需要补的验证是同一噪声实验在其他语言与模型上的重复,以及训练加噪与测试加噪的对照。
哪些限制是论文自己承认的?
论文明确承认生成器 across 语言并不统一,因为现有文本转语音与声音转换方法对 7 个语言的支持不同,只能做到每个语言内部保持域内与跨域分离,不能做到 7 个语言用完全相同的生成器集合。这意味着跨语言比较混入了生成器差异,不能把语言间的跨域差距完全归因于语言本身。论文也明确未尝试跨域自适应,认为那是超出建库目标的未来工作,留给域适应技术去提升跨域结果。
数据侧的限制包括 MASC 无说话人标识,只能假设每个视频对应一个说话人,好在 Common Voice 与 MASC 说话人不同,不影响跨域隔离的结论。VoxPopuli 与 M-AILABS 的平均时长与说话人多样性差异较大,例如有声书来源说话人少、议会录音平均更长,论文称训练划分在语言间一致故不引入标签相关的捷径,但复述时应保留这一差异作为适用条件。
风险侧论文指出合成越逼真滥用风险越大,建更难的检测库会推动检测,但也可能间接推动更强的生成,共享采用非商业相同方式共享许可。复现与引用时应遵守许可,不把检测进步等同于生成问题已解决。
要复现应先固定什么、再跑什么?
复现先做三件事。第一,按论文的官方 3 路划分取数,核对每个语言的训练、域内、跨域的真实来源与生成方法名单,不自行混搭生成器。第二,固定输入处理:两端静音裁剪、重采样 16 千赫、5 秒定长截断或补零、谱参数按模型区分,训练增强以二分之一概率开启。第三,按语言独立训练 20 轮,用域内最优选 checkpoint 再测跨域,跑 3 次取均值与标准差,同时报告准确率、曲线下面积与等错误率。
关键超参数与信息条件是学习率 5 乘 10 负 4 次方、无权重衰减、批量按模型取 200、120、16、10、10,跨语言实验每语言至多 3000 条。论文给出 Torchvision 的 ResNet、Hugging Face 的 AST 与 wav2vec 2.0 来源,以及 SepTr 与 Coqui TTS 等第三方库链接,但资源可用性以本次收到的资源状态为准,其中 Hugging Face 的 AST 链接本次未能确认可达,复现前需自行确认可达性。缺失的优化器、调度与硬件预算是具体缺项,复现报告应写明所用实现而不推定原文实现。
先跑的最小闭环是单语言的 ResNet-18 域内与跨域对照,若域内未接近满分则先查输入与划分,若跨域显著高于原文则检查是否混入已知生成器。教学例子是把域内与跨域合并成不同比例的野外混合,这属于论文允许的用法示例,不添加无源的效果承诺。
何时值得尝试、还需补哪项验证?
当部署环境可能遇到未知生成器、未知说话人或未知录制来源时,值得用 XMAD-Bench 的跨域协议做 1 次验证,而不是只看域内准确率。若应用限定在固定客服话术与固定合成引擎,域内结果仍有参考价值,但需说明仅适用于已知生成器。若要做多语言产品,应按语言分别报告跨域指标,不能用跨语言平均掩盖阿拉伯语与俄语等难例。
还需补的验证有三项。一是跨域自适应或训练加噪是否在多语言上稳定提升,这需要论文之外的对照。二是同一结论在新一代生成器上的持续性,因为论文强调三到四年生成器可能过时,已知占比会下降。三是误判率、延迟与成本的测量,原文未报告这些量,不能承诺跨域稳健性带来延迟或成本改善。
回到中心判断,论文直接报告的是域内常达 100% 而跨域有时近随机,有限解释是预训练语音表征更稳健,未验证推测是冻结大编码器加小分类头普遍更抗噪。研究生复述时用报告、支持、可能待验证 3 层措辞区分这 3 类陈述,就抓住了这篇数据集论文的全部要点。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses