英文题目:SEA-Spoof: Bridging the Gap in Multilingual Audio Deepfake Detection for South-East Asia
会议身份:
conference:interspeech:2026:conference-paper-id:wu26m_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #数据集构建 #多语言 #语音 #音频深度伪造检测
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Jinyang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Nana Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Soumik Mondal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对东南亚多语言场景下音频深度伪造检测输入为16 kHz语音、输出为真伪二分类,但高资源语言训练模型在声调与非声调语言上严重失配的难题,该文构建了覆盖6种语言的大规模配对数据集。构建链条分为三步:先按人口覆盖、语言类型与欺诈现实相关性选定泰米尔语、印地语、泰语、印尼语、马来语和越南语并汇集多源真实语音,再以真实转录驱动10个开源与4个闭源合成系统生成配对伪造,最后按语言与系统分层划分为训练验证测试并配套评测协议。与已有英语中心或长尾测试集相比,其机制差异在于转录级真实伪造配对与开源闭源双源覆盖,使语言效应与系统效应可分离归因。在SEA-Spoof测试集下,MoLEx的错误率为43.822%,高于MoLEx在ASVspoof5测试集下的错误率1.25%。该结论目前仅在所选语种、系统与受控配对条件下成立,对未知方言、新兴扩散式合成及野外信道的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/coqui-ai/TTS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一处缺口?
本文的输入是待判定的单条语音波形,目标是判断它是真实录制还是合成或克隆生成的伪造语音。输出是二分类判决,通常用等效错误率衡量,错误率越低越好。研究面向的研究生读者需要先建立的事实是,现有反欺诈基准主要覆盖英语和少数高资源语言,对东南亚语言的系统性覆盖不足。论文报告,东南亚数字经济增长放大了音频伪造风险,但已有数据集对该区域语言覆盖有限,阻碍了稳健检测。
为理解缺口,要区分声调与非声调两类语音特性。白话说,声调语言中音高升降会改变词义,合成器一旦把音高曲线做平或做错,痕迹会留在基频与时长上。非声调语言更依赖辅音元音序列与重音节奏,伪影更多体现在频谱细节与拼接平滑度上。如果检测模型只在英语上训练,它学到的可能是英语韵律下的伪影分布,换到泰语或越南语就会失配。
声调语言 × 非声调语言: 声调语言如泰语和越南语靠基频变化区分词义,对合成器的基频建模误差更敏感,非声调语言如印尼语、马来语、泰米尔语和印地语主要靠音段与重音组织韵律,论文同时纳入两类是因为两类韵律伪影形态不同,组合后才能检验检测模型是否只记住了英语式的韵律特征,还是真正学到了跨韵律类型的通用伪影。
本文的目标因此不是提出新的检测网络,而是构造一个可核对的数据集与评测流程。论文明确给出 6 种语言,分别是泰米尔语、印地语、泰语、印尼语、马来语和越南语,选择理由是人口覆盖、语言类型差异与实际欺诈相关性。数据集总量超过 700 小时,真伪配对且按转写对齐,使语言级和系统级受控评测成为可能。后续所有方法与实验都围绕如何生成可比的真伪对、如何划分语言与系统子集、以及如何证明跨语言失配与微调恢复展开。
已有数据集覆盖了什么,为什么还缺东南亚配对评测?
语音伪造检测的进展很大程度上由评测数据驱动。论文回顾的路线包括自动说话人验证欺诈系列从逻辑接入与物理接入,到深伪分支与跨库泛化,再到引入现代神经声码器与对抗扰动的大规模版本。这些基准统一了协议,推进了领域发展,但仍以英语和少数高资源语言为主。同期出现的扩散类、编解码类与名人场景数据集扩大了攻击类型与编码条件,但在语言多样性上仍然受限。
多语言方向已有尝试,但论文指出其对东南亚的实际覆盖仍然稀疏。例子是,多语言朗读语料只提供真实语音且以欧洲语言为主,没有原生东南亚覆盖。另一类多语言反欺诈数据集扩展到二十多种语言,但东南亚语言只是稀疏出现,且没有平衡的原生真伪配对,难以做系统性评测。更大规模的多语言伪造数据集虽然总量达到数千小时,但训练与验证集只有英语和中文,多数非主要语言包括东南亚语言只作为长尾测试子集发布,不适合以东南亚为中心的训练与基准测试。
教学上可以这样对照,同样的输入都是语音,同样的目标都是真伪二分类,但监督条件与运行阶段不同。已有工作要么同语言训练同语言测试,要么把东南亚语言只放在测试端做零样本考查,缺少在东南亚语言上可训练、可验证、可按系统拆分的配对数据。本文的定位就是补上这一块,使跨语言与跨源泛化可以在相同文本控制下被测量,而不是把类别差异当成同条件胜负。
要测的失配问题如何定义,什么算桥接成功?
论文把问题定义为跨语言与跨源双重失配。跨语言失配指模型在高资源语言上学到的伪影表示迁移到东南亚语言时失效,原因包括合成质量差异、语言特有韵律与训练资源不足。跨源失配指模型在已知开源合成器上有效,但遇到商用黑盒平台的高质量语音时失效。两者都表现为等效错误率在新域上大幅上升。
桥接成功的判定标准在论文中是操作化的。第一步是诊断,用在原有基准上训练好的模型直接在新数据测试集上评测,若错误率显著高于原域,则判定存在盲区。第二步是修复,用新数据的训练集对模型微调,再看新数据测试集错误率是否下降,同时检查原域性能是否出现遗忘。论文把微调后在新数据上恢复到接近零错误,同时承认在原域略有下降需要混合训练来缓解,作为支持新数据集有效性的证据,而不是声称彻底解决了所有泛化问题。
一个样本的走查有助于固定概念。取一条马来语真实语料及其转写,输入是该波形与文本,目标是生成同文本的伪造波形并保留配对关系,输出是 1 对文本相同、说话人与系统条件可标注的真伪样本。后续所有划分都保持这种配对,使评测时差异可以直接归因于合成伪影,而不是文本或时长分布差异。
数据集流水线如何从文本与录音走到可评测子集?
论文的数据集流水线可以分为 4 段。第一段是合成端,左侧并列开源文本转语音与商用文本转语音两类输入,分别对应可复现的多架构生成与高质量黑盒生成。第二段是东南亚语音合成,把文本提示变成多语言波形,并覆盖六面国旗所代表的目标语言。第三段是数据预处理,把真实语音数据与合成语音数据按转写配对汇合,形成文本受控的真伪对。第 4 段是全集组织,把数据切成语言专用与模型专用子集,并进一步分为商用子集与开源子集,便于做语言级与系统级细粒度基准测试。
下图是论文给出的流水线示意,阅读时先沿箭头走主路径,再看汇合与切分节点如何支撑受控评测。
看图路径: 1. 从最左侧开源与商用两类输入框出发,沿蓝色箭头向右追踪合成、配对与划分三段主路径;2. 观察中间真实语音与合成语音汇合为配对数据的加号节点,确认文本控制的位置;3. 对比最右侧商用子集与开源子集在语言专用与模型专用切分上的组织方式
论文图 1。原论文 Figure 1:“Pipeline of the SEA-Spoof dataset, combining speech synthesized from open-source and closed-source (commercial) systems with real recordings, and organized into language- and…”。
从像素可见,图中最左侧是两层输入框,上层标注开源文本转语音并排列多个框架图标,下层标注商用文本转语音并列出 4 个平台名称,蓝色箭头向右指向中间的波形矩阵,波形下方对应 6 种语言标识。继续向右,真实语音与合成语音在加号节点汇合,表明配对发生在预处理阶段。最右侧分为上下两个商用子集面板与一个更大的开源子集面板,分别标注语言专用与模型专用,说明最终评测可以按语言切分,也可以按生成系统切分。这种组织使后文的开源与闭源对比、语言对比与系统对比都有明确的数据支撑,而不是事后挑选困难样本。
开源十系统与闭源四系统各自承担什么生成任务?
开源侧共使用 10 个系统,编号为 A1 到 A10,包括多语言基座、跨说话人克隆框架、快速非自回归模型、印度语言专用模型、流匹配模型、自回归声学模型与不同声码器组合。论文说明这些系统在生成流水线与声码器后端上不同,涵盖自回归与非自回归等差异。虽然并非全部原生支持东南亚语言,论文通过在区域语料上微调使其可用,例如用印度语音语料支持印地语与泰米尔语。其中多语言基座与商用可读扩展覆盖最广,作为东南亚语音合成的强基线。
文本转语音 × 语音克隆: 文本转语音负责把真实语料的转写文本从零生成目标语言语音,检验合成器对音素与韵律的建模能力,语音克隆负责用参考说话人音色跨说话人生成同文本语音,引入音色迁移与跨语言口音,论文把两者搭配是因为前者覆盖主流伪造流水线,后者模拟黑盒平台的真实滥用,组合后才能同时考查内容一致条件下的合成痕迹与说话人迁移痕迹。
闭源侧集成 4 个商用平台,分别对应视频与语音生成、语音生成、音频生成与大模型语音接口。论文强调这些系统感知质量更高、说话人多样性更丰富、风格可控,是评估跨源泛化的必备黑盒场景。具体生成时,文本转语音以多语言基座为主干,辅以快速模型、印度模型、流匹配模型与传统声学模型,语言专用的社区模型补充泰语与印尼语,闭源系统提供额外多样性与高保真语音。语音克隆则用跨语言克隆框架与可读扩展并行,并与 4 个闭源平台配合。
真实语音 × 伪造语音: 真实语音提供来自通用语音与方言语料的多说话人、多信道分布,作为判定基准,伪造语音以同一条真实转写为提示生成以控制文本变量,论文把两者按转写配对是因为只有固定文本才能把差异归因于合成伪影而非内容差异,组合意义是形成可控的真伪对照,使语言与系统级评测可解释。
一个关键设计是有意用非母语说话人生成目标语言语音。这种跨语言迁移会引入口音与风格多样的伪造,更接近真实滥用,也给检测带来更难的情形。所有伪造波形统一重采样到 16 千赫兹并以无损格式存储,保证评测不受采样率混杂影响。
开源系统 × 闭源系统: 开源系统指结构已知的 10 套文本转语音与克隆框架,用于覆盖自回归、非自回归与扩散等不同生成原理,闭源系统指 4 个商用在线平台,用于代表高质量黑盒语音与可控风格,论文搭配两者是因为前者可复现、可分系统分析,后者更接近真实欺诈,组合后才能同时评测已知机理泛化与未知高质量伪造泛化。
真实语音从哪里来,配对与划分如何保证可比性?
本节对应数据集论文的构造流程,论文本身没有训练新的合成器,而是调用既有合成系统与整理既有真实语料,因此这里讲清构造与后续基线微调的计算过程。真实语音来自 7 个开源语料,覆盖朗读与识别两类任务。朗读类提供棚内高质量可懂度语音,识别类提供更多样、带噪声与会话风格的材料,两者混合才能同时反映受控与真实条件。最大来源是覆盖 6 种语言的多说话人众包语料,印地语与泰米尔语额外使用印度语音语料,印尼语采用大规模多领域语料,马来语合并会话语料与视频转写集以提供口音与会话风格,泰语纳入标准与方言语料,越南语使用朗读语料。
配对方法是严格的转写级配对。用真实语料的转写作为文本提示,调用上述文本转语音或语音克隆系统生成对应伪造样本,使每对真伪样本内容相同。论文明确指出,这种以真实转写为基础的合成最大化了可比性,使受控评测中的差异可以直接归因于合成伪影,从而得到可解释的基准。数据集覆盖超过 1800 个可辨识的说话人与参考音色,包括众包与朗读语料的说话人以及闭源系统的参考音色。
划分采用分层语句级切分,按 8 比 1 比 1 分为训练、验证与测试,保持语言与合成源覆盖在各切分中一致。总量上训练约 430000 条,验证与测试各约 57000 条。后续基线微调只更新适配模块与分类器,冻结预训练主干,这种参数冻结安排是论文明确报告的,后文实验条件节会给出具体优化设置。
基线是谁,训练与评测条件是否一致,指标方向是什么?
论文选用 3 个基线。第一个是图注意力反欺诈网络,在 2019 年逻辑接入数据上训练。第二个是其改进变体,引入核注意力与增强频谱建模,在多个数据集组合上训练。第 3 个是混合专家适配模型,基于自监督语音表示并用低秩适配做快速适应,在多个大规模基准上训练。评测时 3 个模型先直接在新数据测试集上做零样本式诊断,再对第 3 个模型用新数据训练集微调,比较微调前后在新数据与原域上的变化。
微调实现按论文交代,采用 12 层变换器主干,分类器为单层长短时记忆网络后接全连接层。优化时只更新混合专家模块、注意力合并块与分类器,预训练主干保持冻结。批量大小为五百,训练 15 轮,专家数为十二,专家层数为 12,专家秩为 32,每次选前四专家。这些是复现时必须保留的信息条件,改变冻结范围或专家配置会直接改变可比性。
评测指标为等效错误率,数值越低表示检测越好。比较的公平条件是,真伪配对固定文本,开源与闭源子集共享相同的真实数据,语言专用评测使用闭源生成的最具挑战场景。论文把全集、开源子集、闭源子集、语言子集与系统子集分别报告,使跨语言与跨源结论可以分开验证,而不是混在一起得出总体趋势。
跨域直接评测下降多少,微调恢复多少,代价是什么?
比较问题是,在高资源基准上表现良好的模型,能否直接迁移到东南亚语言。公平条件是同一模型分别在原域测试集与新数据测试集上评测,指标均为等效错误率,方向是越低越好。下表整理论文报告的全集结果,重点看微调前后在两个域上的变化。
| 评测域 | 指标 | 未微调基线 A | 未微调基线 B | 可运行策略 | 论文报告的微调后 |
|---|---|---|---|---|---|
| 原域测试集 | 等效错误率 | 35.5% | 34% | 1.25% | 5.6% |
| 新数据全集测试 | 等效错误率 | 43.32% | 33.93% | 43.822% | 0.2% |
等效错误率 × 跨语言失配: 等效错误率是误接受率与误拒绝率相等时的错误率,数值越低表示真伪区分越好,跨语言失配指在高资源语言上训练的模型遇到东南亚语言时因合成质量与语音特性不同而性能下降,论文用等效错误率量化失配是因为它与阈值选择无关,组合意义是把语言迁移代价变成可比较的数字,直接暴露原有基准的盲区。
表后解释需要同时给出收益与代价。论文报告,未微调的混合专家模型在原域为 1.25% 错误率,但在新数据上恶化到 43.8% 左右,另外两个基线同样退化,支持现有基准忽略了东南亚语言独特挑战的判断。用新数据微调后,新数据错误率恢复到 0.2% 左右,证明数据集作为诊断工具与解决方案的双重价值。代价是原域性能从 1.25% 下降到 5.6%,论文将其归因于灾难性遗忘,并明确留作未来用混合源训练缓解,没有声称单次微调同时最优。未胜出项是直接迁移策略,所有未微调模型在新数据上都不理想,说明零样本迁移不可部署。
难样本来自闭源还是开源,哪个语言与系统最难?
比较问题有两个,一是伪造来源难度,二是语言与系统级难度。公平条件是开源与闭源子集共享相同的真实数据,语言专用评测固定使用闭源生成语音,以代表最真实且最难的场景。下表把论文的开源与闭源总体对比、语言拆分与系统拆分放在同一五列结构下,便于核对微调前后的变化,但 3 组行来自不同切分,不能跨组直接平均。
| 切分 | 条件 | 未微调错误率 | 微调后错误率 | 论文定性判断 |
|---|---|---|---|---|
| 总体来源 | 开源生成 | 35.80% | 0.19% | 相对容易 |
| 总体来源 | 闭源生成 | 61.40% | 0.28% | 显著更难 |
| 语言内闭源 | 越南语 | 48.50% | 0.01% | 最易 |
| 语言内闭源 | 泰米尔语 | 68.60% | 0.08% | 最难之一 |
| 系统内闭源 | 某商用视频平台 | 44.39% | 1.35% | 相对易检 |
表前已说明指标方向为越低越好,表后需要解释机制与反例。论文报告,闭源模型产生显著更难的伪造,未微调时闭源总体错误率高于开源总体,支持黑盒高质量语音更难检测的判断。语言上越南语最易,泰米尔语与马来语最难,即使微调后马来语仍保留 1.35% 左右的错误,提示声调与非声调等语言因素影响可检测性。系统上某视频生成平台样本相对易检,而大模型语音接口与另一语音平台产生极具挑战的伪造。负结果是微调并未抹平语言差异,说明需要语言感知的对策,而不是假设单一模型对所有语言同等有效。
哪些边界没有测,哪些推论还不能下?
论文明确承认的边界包括方言与更低资源语言尚未覆盖,以及新兴合成技术需要持续纳入。未来工作提出扩展更多方言、集成新合成方法,并探索跨源域适应、语言感知建模与对抗训练的对策。这些属于待验证方向,不能当成已证明的效果。
从证据等级看,直接报告的是错误率数字与难度排序,有限解释的是声调与非声调特性可能影响可检测性,未验证推测是把这种相关性直接当成因果。相关性不是因果,论文用支持而非证明的措辞,复述时应保留这种谨慎。另一个限制是成本与部署条件缺项,论文未报告误判率细节、延迟、推理开销与训练硬件预算,因此不能承诺微调方案在延迟或成本上得到改善。总体趋势不等于每组每步都成立,例如微调后总体接近完美,但马来语与特定商用系统仍相对更难。
资源状态方面,论文给出数据集地址,但本次解读只依据论文文本,不对链接可达性做断言。第三方代码资源中仅有一个可用链接指向社区语音合成仓库,可作为理解开源生成原理的背景材料,不能当成论文数据集本身已公开的证据。
要复现应先做什么,需要保留哪些关键条件?
复现的第一步是按语言重建配对。取 7 类真实语料的转写,按论文的语言与系统映射调用对应开源模型生成伪造,例如多语言基座作为主干,特定语言补充社区模型,克隆时用跨语言参考音色制造口音多样性。所有波形重采样到 16 千赫兹并存为无损格式,保留说话人与系统编号。切分必须采用分层语句级 8 比 1 比 1,并保持语言与合成源在训练、验证与测试中覆盖一致,否则语言级结论不可比。
第二步是基线评测。先用原域训练好的 3 个基线直接在新测试集上评测,记录等效错误率以复现失配诊断。再按论文设置微调混合专家模型,冻结预训练主干,只更新专家模块、合并块与分类器,批量五百、15 轮、十二专家、前四选择,用验证集选阈值后在测试集报告。需要同时报告原域与新域,以观察遗忘代价。
第三步是细粒度拆分。把测试集按开源与闭源、按 6 种语言、按 4 个闭源系统分别评测,检查闭源是否更难、越南语是否最易、泰米尔语与马来语是否最难。若排序不一致,应先检查是否混用了不同真实数据或不同文本分布,而不是直接否定论文结论。还需补做的验证包括混合源训练能否缓解遗忘,以及在新方言与新商用系统上的外推表现。
何时值得尝试这套数据,核心判断与下一步是什么?
当目标场景涉及泰米尔语、印地语、泰语、印尼语、马来语或越南语的音频真伪判断,且预期会遇到商用黑盒平台的高质量伪造时,这套数据值得尝试。它的价值在于提供文本受控的真伪对与语言和系统双维切分,使失配可以被定位到具体语言或具体平台,而不是只得到一个总体分数。对于只做英语或中文检测的系统,直接套用本文数字没有意义,需要重新做跨语言评测。
核心判断是,高资源模型的强原域分数不能迁移为东南亚场景的可靠性,论文用从 1.25% 到 43.8% 的恶化与微调后到 0.2% 的恢复支持这一判断,但恢复伴随原域遗忘与残余的语言差异。下一步应优先做混合源训练与语言感知建模,并在更多方言与新合成器上持续验证,而不是把单次微调的最优值当成可部署收益。数据集的意义因此既是诊断基准,也是改进起点,为构建跨语言与区域感知的欺诈稳健检测奠定基础。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
