英文题目:MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26p_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #数据集 #注意力机制 #语音伪造检测
评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Xueping Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenshan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yechen Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Linxi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Liwei Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音伪造检测与来源归因的输入输出映射,即从原始波形判定真假并进一步溯源生成接口,难点在于商用私有语音合成接口与开源模型分布差异大且快速演化。方法链由三环构成:首先构建多接口伪造语料MultiAPI Spoof并按接口划分见过与未见过评估域,为跨域泛化提供训练与测试基础;接着用自监督语音编码器XLSR-300M抽取高维声学表示并经注意力池化聚合层级特征;最后将表示送入嵌套多尺度后端,经滑动窗口局部注意力增强块间上下文后再由全连接层输出真伪分数。与仅依赖相邻块层次传递的已有后端Nes2Net-X相比,该设计允许每个块融合邻域块信息,从而强化细粒度伪造痕迹建模。在合并六库训练并加入新语料的设置下,新后端Nes2Net-LA在MultiAPI Spoof全集上达到等错误率0.56%,在野外采集集ITW上达到1.42%,均优于同条件基线。该结论限于英语、4秒切分且无数据增强的受控评测,未验证多语言、长时与压缩信道外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/XuepingZhang/MultiAPI-Spoof — 链接可访问(HTTP 200)
- 数据相关资源:https://xuepingzhang.github.io/MultiAPI-Spoof-Dataset/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的真实风险是什么?
这篇论文的输入是原始语音波形,目标是判断一段语音是真人录制还是机器合成,并且在判定为合成时进一步追问它可能来自哪一个生成服务。对于刚进入语音方向的研究生,先要把白话和术语对齐:语音反欺骗就是音频防伪检测,英文是 Speech Anti-spoofing,简称反欺骗;文本转语音就是 Text-To-Speech,缩写 TTS;声音转换就是 Voice Conversion,缩写 VC;生成源归因就是判断伪造音频出自哪个接口,论文称作 API 溯源。
论文要解决的矛盾很具体。现有公开基准大多只用少数公开 TTS 或 VC 模型造假,种类窄、质量分布窄。而现实中大量商用系统是闭源接口,模型结构、数据管线都不公开,合成质量和风格差异很大。用窄数据训练出的模型,遇到真实多样的接口时容易失效。论文用实验说明了这种领域偏移:只用 6 个常用公开集训练时,在自建多接口测试集上等错误率还停留在 7% 左右,说明旧数据没有覆盖新攻击。
因此论文做了两件事。第一是构造数据,把多样性本身变成可训练、可评测的资源;第二是改进后端,让模型更擅长捕捉局部细粒度伪造痕迹。全文的输出包括代码与数据集当前可用、已公开,读者可以按原文划分复现已见与未见两种评估。学习时不要把这篇工作理解成提出全新语音编码器,它的前端仍然沿用已有的大规模自监督编码器,创新集中在数据覆盖面、后端结构和评测任务定义上。
已有路线做到哪里,为什么还缺一块?
已有的音频反欺骗路线通常是两段式。先用预训练模型提取高层声学特征,例如基于掩码预测或对比学习训练出的语音表示;再把特征送入后端分类器,例如图注意力网络或多尺度卷积结构,输出真伪分数。论文提到的基线包括结合自监督表示与图注意力的系统,以及基于嵌套多尺度融合的系统。这条路线在受控基准上已经取得明显进展,但训练数据的生成源有限。
数据集方面的已有工作包括针对部分伪造、编解码伪造、多语种伪造等方向的扩展,覆盖了重放、转换、合成等多种攻击。但是论文指出,这些工作仍然以少数公开系统为主,没有系统性地覆盖商用 TTS 服务、开源语音模型和网页合成平台 3 类真实部署形态。这就留下了一个学习依赖缺口:模型可能记住某几个公开合成器的痕迹,而不是学到跨合成器的通用伪造特征。
与同输入、同目标、同监督的工作相比,本文的对照是公平的:同样以前端加后端的结构做真伪二分类,同样用等错误率和代价函数评价,区别在于训练池是否加入新的多接口数据,以及后端是否加入局部注意力。论文没有把类别差异当成胜负,而是用是否加入新数据这一可运行的变量来解释跨域提升。理解这一点,才能正确解读后面表格中在野外数据和高质量合成数据上的同步改善。
任务如何形式化,评测分哪两种条件?
反欺骗任务的形式化是二分类。输入是一段固定时长处理后的波形,输出是一个真伪分数,阈值以上判为一类。评价用等错误率,英文是 Equal Error Rate,缩写 EER,越低越好;同时用最小决策代价和实际决策代价,英文是 minimum Decision Cost Function 和 actual Decision Cost Function,缩写 minDCF 和 actDCF,也是越低越好。初学者要记住,数值相同不代表同一指标,必须同时核对数据集、阶段和聚合对象。
第二个任务是 API 溯源。输入是已知为伪造的音频,输出是它来自哪一个接口。训练只见过 21 个接口,测试时既考这 21 个,也考完全没见过的接口。做法是把未见统一当作一个额外类别:如果模型对所有已见类的最大预测概率低于阈值,就判为未见类。这样溯源就变成 22 类分类问题。评价用精确率、召回率和 F1,英文是 precision、recall 和 F1,已见类取宏平均,未见类单独计算,总体再做宏平均。
评测条件按接口划分。A0 至 A20 按比例切分出训练、开发和评测,保证已见评估有足够变化;A21 至 A23 只留给开发,A24 至 A29 只留给评测,用于检验跨源泛化。这种划分是理解全文的关键:已见好不等于通用好,未见提升才支持鲁棒性判断。
方法全景:一个样本如何走完输入到输出?
先沿着一个样本走完全程。输入是一段原始波形,先做归一化并切成固定时长片段,不足补齐、过长截断。然后送入大规模自监督编码器得到高维表示,再经过 1 维卷积并按通道切分成多个子集,每个子集进入嵌套多尺度融合,最后经过局部注意力增强和全连接层得到反欺骗分数。溯源分支则用编码器各层表示做注意力池化,再经过压缩激励层得到分类结果。
这里有两个术语需要先讲清。预训练特征提取器就是已经在大规模语音上训练好的编码器,负责提供通用表示;后端分类器就是论文重点改动的判别网络,负责从表示中挖掘伪造痕迹。
预训练特征提取器 × 后端分类器: 预训练特征提取器负责把原始波形变成高维声学表示,承担通用语音表征工作,后端分类器负责在该表示上区分真伪并给出分数,二者搭配的原因是前者提供跨域鲁棒的起点、后者聚焦伪造痕迹的细粒度判别,组合意义在于冻结或微调策略不同的两段可以分别优化表示质量和决策边界。
下图是论文给出的整体结构,上面是特征提取与嵌套融合,下面是新增的局部注意力与决策,建议先看主路径再看新增分支如何接入。
看图路径: 1. 从顶部输入沿特征提取到多列分组前向箭头确认主路径;2. 对比蓝色嵌套块区与下方粉色局部注意力区在何处交接;3. 找到每列的卷积与加权求和符号再看横向残差连线;4. 观察底部全连接层如何汇合注意力输出与直连残差
论文图 1。原论文 Figure 1:“Overall architecture of proposed Nes2Net-LA frame- works.”。
从像素看,顶部是输入符号与特征提取框,中部蓝色大框内是多列并行的卷积与加权求和链,列间有横向残差把前一列输出送入下一列,底部粉色区域是每个分组对应的注意力模块再汇入全连接层。右侧标注区分了原有嵌套结构与新增局部注意力部分的边界。理解这张图的位置关系,后面才能明白公式中分组下标和窗口邻域的对应动作。
嵌套分组融合做了什么计算?
嵌套结构的核心动作是分组、逐级融合、再标定。编码器输出先被切成通道子集,用符号表示就是把高维表示分成多个分组。第一个分组直接做卷积和加权求和,后面的分组先把前一分组的融合结果拿过来一起处理,再做自己的卷积。这样感受野逐列扩大,既保留细粒度,又获得多尺度。全部输出再经过 1 次卷积与压缩激励模块,并加上残差得到每个分组的精炼表示。
用白话说,加权求和就是 Weighted Summation,缩写 WS,负责融合;压缩激励就是 Squeeze-and-Excitation,缩写 SE,负责给通道加权。
加权求和 × 压缩激励: 加权求和负责把当前分组卷积输出与前一分组输出融合以传递层级信息,压缩激励负责对融合后通道做重标定以突出有用通道,二者搭配的原因是一个管跨分组的信息流、一个管通道内的重要性分配,组合意义是得到更干净的分组表示再送入注意力。
原文指出,这种精炼仍然是严格层级的,每个嵌套块只与直接前驱交互。当语音表示维度很高、序列很长时,远距离分组之间的信息很难直接沟通,这就是要加注意力的动机。复述时要强调这是一个已验证的结构起点,而不是本文凭空设计的编码器,本文的改动是明确加在它之后的跨块交互层。
局部注意力如何补上跨块联系?
局部注意力的计算对象是上一步得到的分组表示。对每一个分组,定义一个滑动窗口邻域,只包含左右各若干个相邻分组。原文实现把窗口半径设为较小值,在该窗口内做缩放点积自注意力,英文是 scaled dot-product self-attention,得到增强后的局部特征,再与原始分组表示做残差相加。最后把所有分组输出拼接送入全连接层打分。
白话解释是,嵌套残差结构管多尺度分解,局部注意力管邻域一致性。
嵌套残差结构 × 局部注意力: 嵌套残差结构负责把通道分组后逐级卷积加权融合以获得多尺度特征,局部注意力负责让每个分组从相邻分组收集上下文以打破只与直接前驱交互的限制,二者搭配的原因是多尺度需要跨块一致性来抑制碎片化,组合意义是在保留轻量卷积的同时增强细粒度伪造特征的判别力。
与全局注意力相比,局部窗口避免了对很长嵌套序列做全连接的高开销,同时让每个块能从邻居借到有用信息,使特征更一致、更鲁棒。论文明确说这种设计改善了模型的整体反欺骗性能,尤其在多样和未见伪造条件下。复述时不要夸大为长程全局建模,原文限定的是小滑动窗口内的邻近交互,窗口大小是固定超参数,不是自适应学习的跨度。
数据如何构造,模型如何训练与推理?
数据构造先讲伪造部分。伪造语音来自 30 个不同接口,覆盖商用 TTS 服务、开源神经 TTS 或声音转换系统、网页合成平台 3 类,每类接口对应一个编号分组。伪造语音总量约 230 小时,同时配了等量的来自公共语音的真人语音,保持 1 比 1 平衡,所有录音都是英文。按接口划分,已见接口用于训练、开发和评测的切分,未见接口完全留出做泛化测试。
反欺骗检测与 API 溯源是两个监督目标。
反欺骗检测 × API 溯源: 反欺骗检测负责二分类判断是真人还是合成,API 溯源负责在合成样本中进一步判断来自 30 个中的哪一个生成源,二者搭配的原因是共用同一批多 API 语音但监督目标不同,组合意义是用同一数据同时检验真伪泛化和细粒度归因能力。
训练细节按原文交代。所有系统都对归一化波形操作,不做数据增强以保证干净对照。反欺骗的 3 个系统共用同一前端,后端分别是图注意力、多尺度嵌套和本文的局部注意力增强版本。溯源基线用编码器加注意力池化再加压缩激励层,只用 21 个已见接口训练,推理时用最大概率阈值判断是否属于未见类。论文披露了优化器、学习率、权重衰减和损失函数,但没有报告训练轮数、批量大小和硬件耗时,复现时这部分属于缺项,需要按常规设置补齐并记录。
实验条件如何保证比较公平?
反欺骗实验用了 6 个公开集的合集作为基础训练池,再对比加入多接口训练集前后的变化。评测目标域固定为 3 个:在野外收集的数据集、本文多接口测试集、高质量合成数据集。这种两档训练配置的设计意图很清楚:第一档看旧数据在新测试上的领域偏移,第二档看加入新数据是否带来跨域改善。所有被比较模型在同一配置下重新训练和评测,指标方向都是越低越好。
处理与超参数保持一致。音频统一为固定时长片段,短的重复补齐、长的截断;嵌套结构的通道分组数固定,局部注意力窗口半径固定;不同后端用各自报告的学习率和权重衰减,损失都是交叉熵。论文明确说明没有使用数据增强,也没有样本剪枝或编解码增强,因此后面与使用增强的外部最优系统的比较不能直接理解为同条件胜负,需要区分可运行策略和事后最优值。
溯源实验的训练和测试都在本文数据集内完成,分别报告已见和未见两类结果。总体性能是包含未见类的宏平均,这意味着未见类的低召回会直接拉低总体,不能只看已见类的高分就得出已解决的结论。
加入多接口数据后,主结果变化了多少?
要回答的核心问题是:加入多接口训练集是否同时改善本域和跨域。比较条件是公平的:基线只用 6 个公开集训练,另一组在相同基础上再加入本文训练集,评测集完全相同,指标都是等错误率与代价函数,方向越低越好。下表整理了论文正文连续句子中直接报告的关键等错误率变化,单位保留原文百分号写法。
| 条件 | 指标 | 基线系统 | 不加新数据的等错误率 | 加入新数据后的等错误率 | 比较对象 |
|---|---|---|---|---|---|
| MultiAPI 测试集 | 等错误率 | 图注意力后端 | 7.30% | 0.70% | 同一前端不同后端 |
| MultiAPI 测试集 | 等错误率 | 嵌套后端 | 7.08% | 0.69% | 同一前端不同后端 |
| 野外数据集 | 等错误率 | 嵌套后端 | 1.73% | 1.69% | 加入新数据前后 |
| 高质量合成集 | 等错误率 | 嵌套后端 | 7.77% | 5.64% | 加入新数据前后 |
表后需要同时讲收益与代价。收益是显著的:在本文测试集上两个基线的等错误率都从 7% 左右降到 1% 以下;在野外数据和高质量合成数据上也有同步下降,说明新增的多样伪造条件带来更鲁棒的特征学习,而不是只过拟合到特定接口。论文还报告这种增益在本域已见和未见子集上都存在,支持跨源泛化的判断。代价与限制是,野外数据上的绝对降幅较小,从 1.73% 到 1.69% 属于小幅改善。
高质量合成集上虽然降到 5.64% 但绝对值仍然偏高,说明真实高难度伪造远未解决。未胜出项也要指出:只用旧数据时图注意力与嵌套结构在新测试上都偏高,没有谁能单靠结构弥补数据缺口。
已见 API 评估 × 未见 API 评估: 已见 API 评估负责检验模型在训练出现过的 A0 至 A20 上的拟合与稳定性,未见 API 评估负责检验在完全未参与训练的 A21 至 A29 上的跨源泛化,二者搭配的原因是真实部署必然遇到新服务,组合意义是区分记忆特定 API 痕迹与学到通用伪造特征。
为理解为什么多样性有帮助,论文用语音质量评估分布做了对照。下图按数据集展示质量分数的分布曲线,虚线标出峰值密度位置,横轴是分数,纵向是密度,曲线越宽说明覆盖的质量范围越大。
看图路径: 1. 自上而下对照八个数据集的质量分布宽度与峰值虚线位置;2. 重点比较最底行与其他行的覆盖范围差异;3. 注意横轴分数刻度与纵向密度含义不要误读为检出率
论文图 2。原论文 Figure 2:“Scoreq [49] distribution comparison across datasets. The dashed vertical line in each curve marks the peak density value.”。
从像素看,最底行的分布明显比上面多数行更宽,从低分到高分都有覆盖,而上面部分数据集的峰更集中。论文据此解释,宽分布有助于防止模型过拟合到狭窄声学条件,从而在更异构的真实环境中表现更好。这属于有限解释而非因果证明,因为分布宽度与泛化提升同时出现,但论文没有做只改变质量分布的消融,不能说宽度必然导致提升。
新后端是否在多个基准上都更好?
第二个要回答的问题是:局部注意力增强版本是否优于原嵌套结构和近期最优系统。论文在同一训练池下比较了图注意力、原嵌套结构和新增局部注意力的版本,结果是新增版本在所有评测基准上都取得最优,尤其在本文测试集的未见划分上提升最明显。论文还把它与外部文献报告的最优系统放在同一张对照里,显示即使在不使用任何数据增强或剪枝的情况下仍取得有竞争力的结果。
解读这组比较要小心条件不一致。外部最优系统有的用了原始波形增强、编解码增强或样本剪枝,训练数据构成也不同,因此不能把数字差距直接读成同条件下的结构胜负。论文的直接证据是内部三者的同条件比较:前端相同、数据相同、处理相同,只有后端不同,这时局部注意力版本的优势才支持结构有效性的判断。跨表比较只能作为参考,说明新方法在更广基准上的位置。
从机制上看,提升与设计动机一致:原结构只与直接前驱交互,局部注意力让相邻块互相校准,使伪造特征更一致。这属于支持性解释,论文没有逐层可视化注意力权重来证明哪一类伪造痕迹被增强,因此不要把机制故事当成已验证的因果链。实际部署时还要注意,论文未测量延迟与计算开销,局部注意力虽然是窗口化的,但仍会增加推理成本,未报告时不能承诺更快或更省。
去掉多样性或换掉注意力会发生什么,失败在哪里?
论文的反证主要来自两组对照。第一组是不加多接口训练集,此时两个基线在新测试集上的等错误率都停留在 7% 左右,说明旧数据确实没有覆盖新攻击;加入后大幅下降,且已见和未见子集同步改善,说明改善不是记住特定接口。这组对照支持数据多样性的价值,但也暴露边界:在高质量合成集上绝对错误率仍在 5% 以上,说明多样性有帮助但不够。
第二组是后端对照。原嵌套结构与局部注意力版本只差跨块交互层,其他条件相同,后者在多个基准上更优且在未见划分上优势更大。这支持局部上下文建模的作用,但论文没有报告去掉压缩激励或改变窗口半径的细粒度消融,也没有报告不同随机种子的方差,因此不能回答窗口多大最优、提升是否稳定。把窗口固定为小值是原文明确的实现,未报告的超参数敏感性属于待验证。
溯源任务的失败条件更直接。论文报告已见接口的精确率、召回率和 F1 都较高,但未见类呈现高精确、低召回:预测为未见时大多是对的,但很多真正的未见样本没有被找出来,而是被误判为某个已见类。这说明当前阈值法对分布外声学特征过于保守。下图的可视化进一步显示,未见点的嵌入没有形成可分簇,而是混入多个已见类别。
看图路径: 1. 先看右侧图例区分已见编号颜色与黑色未见点;2. 观察黑色点是形成独立簇还是混入多个彩色簇;3. 结合中间大块黑色聚集区判断泛化难度
论文图 3。原论文 Figure 3:“t-SNE [52] visualization of XLSR-extracted embed- dings for the MultiAPI Spoof eval set. Unseen APIs are A24- A29”。
从像素看,右侧图例用不同颜色标出已见编号,黑色星形代表未见,左侧散点中黑色点大面积散布并与橙色、绿色、青色等簇重叠,中间还有大块黑色聚集与已见簇交织。论文据此认为模型主要学到特定接口的声学线索,难以泛化到声学特征差异大的未见接口。这是一个诚实的负结果,提示未来需要更强的不变表示学习,而不是调大阈值就能解决。
哪些结论还不能下,缺了什么验证?
首先是数据边界。本文伪造与真人语音保持 1 比 1 平衡且都是英文,没有报告多语种、电话信道、压缩传输或部分伪造等条件下的表现。质量分布分析用的是第三方质量评估工具的分数分布,不能等同于人听的主观评价,也不能把分布宽度直接当成难度的完整度量。把自动分数当成人评是常见误解,这里必须区分。
其次是评价边界。主结果报告了等错误率与两类代价函数,但没有报告误判率随阈值的变化、统计显著性、延迟、模型参数量和训练能耗。总体趋势成立不等于每一组、每一步都成立,尤其野外数据上的小幅提升需要显著性检验才能判断是否稳定。不同指标的差值不能混放,百分点改善与相对百分比改善是两回事,复述时保留原文的绝对数值写法,不要自行换算成相对提升。
最后是溯源边界。未见类的低召回和嵌入混叠表明零样本溯源仍是开放问题。论文没有验证开放集识别、域不变学习或阈值自适应等改进,因此不能承诺当前基线可直接部署为归因系统。缺失证据不是技术错误,但需要补做的验证是明确的:跨语言测试、信道鲁棒性、计算开销测量和多次随机种子的稳定性报告。
要复现,先准备什么,按什么顺序跑?
复现前先确认资源状态。论文声明的代码与数据集当前可用、已公开,可以按原文链接获取。不要把代码开源等同于权重可直接下载或系统可一键运行,需要先核对仓库中的训练脚本、环境依赖和权重说明,再决定是重新训练还是只做推理验证。
数据与划分是第一步。按接口编号组织数据,已见接口按比例切分训练、开发和评测,未见接口严格留出,评测时分别计算已见、未见和总体。下表整理了原文连续句子中可直接照做的处理与超参数,单位与符号保留原文写法,便于对照配置文件。
| 系统 | 输入处理 | 通道分组 | 注意力窗口 | 优化器与学习率 | 权重衰减与损失 |
|---|---|---|---|---|---|
| 图注意力后端 | 4-second 片段,短重复长截断 | 共用前端表示 | 不适用 | Adam,1 × 10−6 | 1 × 10−4,交叉熵 |
| 嵌套与局部注意力后端 | 4-second 片段,短重复长截断 | J = 8 | K = 1 | Adam,5 × 10−6 | 1 × 10−4,交叉熵 |
| 溯源基线 | 同上处理 | 注意力池化各层嵌入 | 不适用 | Adam,1 × 10−5 | 1 × 10−4,交叉熵 |
表后说明可执行顺序与代价。先跑不加新数据的基线,确认在新测试集上的高错误率以复现领域偏移;再加入新训练集重跑,观察本域与跨域是否同步下降;最后切换后端对比结构增益,并单独跑溯源的已见与未见两类指标。论文未报告批量大小、训练轮数和硬件预算,复现时要固定随机种子并记录耗时。常见误解是把无增强当成最优做法,原文只是为了干净对照而关闭增强,实际部署时是否加增强需要另做实验,不能从本文结果推定增强无用。
何时值得尝试,还需补哪项验证?
当你的反欺骗模型在公开基准上很好,但一遇到商用合成服务就明显变差时,这篇工作值得尝试。它的核心判断是,数据覆盖面的不足不能只靠换后端弥补,先用多接口数据扩大训练池,再用局部注意力增强细粒度特征,顺序不要颠倒。如果只能做一件事,优先复现加入多接口数据的对照,因为这部分带来的跨域改善在论文中最稳定。
复现时先做最小闭环:用同一前端分别训练原嵌套与局部注意力版本,在已见、未见和外部高质量合成集上同时报告等错误率与代价函数,确认未见提升是否可重复。再补论文缺失的验证:多次随机种子的方差、推理延迟与参数量、不同阈值下的溯源精确率与召回率权衡。只有在这些补齐后,才能判断局部窗口的额外开销是否值得,以及阈值法溯源是否满足你的应用要求。
长远看,API 溯源的未见低召回提示了一个更难的问题:模型记住的是特定服务的声学指纹,而不是通用合成痕迹。未来工作需要在表示学习层面引入域不变约束,而不是停留在分类阈值上。这篇论文的价值在于把这个问题变成可评测的基准,并给出了一个可复现的起点,而不是宣布已经解决。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

![原论文 Figure 2:Scoreq \\[49\\] distribution comparison across datasets.](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/interspeech-2026/12aeaa59fe2f/figure-2.png)
![原论文 Figure 3:t-SNE \\[52\\] visualization of XLSR-extracted embed- dings for the MultiAPI Spoof eval set.](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/interspeech-2026/12aeaa59fe2f/figure-3.png)