会议论文 ID:conference:icassp:2026:icassp-arnumber:11460320

标签:#音频深度伪造检测 #自监督学习 #语音 #高效推理 #多语言

📌 核心摘要

音频深度伪造检测需以原始波形为输入输出真实/伪造二分类,难点在于对抗多样化TTS/VC生成器、编解码与信道失真及跨语言泛化带来的分布偏移。方法链分三步:首先由7层卷积神经网络编码器与24层Transformer构成的XLS-R将波形映射为T×D上下文嵌入,其次对时序维度做均值池化压缩为D维话语级向量,最后经单层全连接层或Kolmogorov–Arnold Networks分类器输出2维真伪logits,前一步的完整维度表示直接作为后一步分类器的输入。与传统先将D降维至d且d远小于D再接入复杂Conformer或Mamba的范式不同,本文保留D维完整表示并以可学习单变量B样条或高斯径向基函数替代固定线性加非线性激活,以提升对高维流形中细粒度伪造痕迹的拟合与可解释性。在ASVspoof 2021 Logical Access评测设置下,KAN的池化等错误率(Equal Error Rate, EER)为1.07%,低于同特征FC的2.38%。该增益在21DF等多攻击类型与跨编解码场景下仍保持,且在解冻XLS-R并配合RawBoost增强的训练条件下验证。结论适用边界受限于以英语为主的19LA训练与冻结或微调XLS-R的设置,对中文ADD与德语等多语言泛化仍差,失败条件集中于波形拼接与神经自回归等攻击。原文未披露训练、推理或部署成本。

🧭 深度解读

输入是什么,输出是什么,必须保留什么信息?

这篇论文研究的输入是原始语音波形,目标是判断一段语音是真实人声还是由文本转语音或声音转换等生成技术合成的伪造语音,输出是二分类判决:真实或伪造。评估时必须保留的关键信息是判决的可靠性,通常用等错误率衡量,数值越低越好。论文强调随着生成式 AI 使合成语音越来越自然,自动说话人验证系统面临被欺骗的风险,因此反欺骗对策需要能够捕捉合成痕迹的表示。

传统做法是前端提取声学特征后端接分类器,近年来前端已被自监督语音基础模型取代。论文的核心问题是:当使用像 XLS-R 这样在大规模多语种数据上预训练的高维表示时,后端是否还需要复杂网络,还是单层轻量分类器就已足够,以及用 Kolmogorov-Arnold 网络替代传统全连接层是否带来额外收益。全文围绕这一问题展开可复现的对照实验,所有结论都限定在论文实际测试的数据集和指标范围内,不扩展到未测量的延迟或主观听感。

论文把任务限定为话语级的真假二分类,不涉及说话人识别或伪造类型的细粒度分类。输入长度可变,输出是两个 logits 对应真实与伪造,判决阈值可调但报告时以等错误率这一阈值无关指标为准。必须保留的信息包括前端维度、池化方式、后端结构和训练时的类别权重,否则无法复现同样的判决边界。论文不声称解决所有伪造类型,仅在给定的 ASVspoof 及多个域外集上验证轻量后端的有效性。

对于刚进入音频领域的读者,可以把整个流程想象为先用强大的预训练耳朵听出细微痕迹,再用最简单的分类器做决定。耳朵越好,分类器就可以越简单,这正是论文要验证的假设。后续章节将按学习依赖展开:先看同类方法如何处理特征与复杂度,再看本文如何设计极简路径,最后看实验如何检验这一假设。

同类方法如何处理自监督特征与后端复杂度?

在音频伪造检测中,常见路线有两类。第一类是端到端模型,直接从波形学习判决;第二类是流水线,前端提取特征后端分类。近年来流水线的前端已从手工特征转向自监督学习表示,例如 XLS-R 等多语种 wav2vec 2.0 扩展,它们在大量无标注语音上预训练,能提供更丰富的伪造线索。已有工作通常在得到高维特征后先做维度约简,把维度 D 降到远小于 D 的 d,再接入 Transformer、Conformer 或 Mamba 等复杂后端,以建模时序或通道依赖。

另一条线探索用 Kolmogorov-Arnold 网络替代多层感知机,已有研究将 KAN 与 Conformer 结合或与图方法结合,但往往仍保留降维步骤。论文指出这种先降维再用复杂网络的做法可能丢弃判别信息,且与追求轻量化的目标相悖。还有工作表明即使是轻量嵌套结构也能达到先进水平,这为直接保留原始维度并使用极简后端提供了依据。论文的定位是在不降维的前提下,严格对比单层全连接与单层 KAN 的判别能力,并在多个域内和域外数据集上与已发布的最先进系统进行同指标对比。

从运行阶段看,相关工作可分为训练时依赖大量标注的监督模型和利用自监督预训练再微调的模型。本文属于后者,前端利用在 436,000 小时、128 种语言上预训练的 XLS-R,训练阶段仅在 19LA 上微调。从监督信号看,都是话语级的真假标签,没有帧级标注。从输入看,都是原始波形而非手工频谱。这种同输入、同目标、同监督的对照使后端结构的差异更易被隔离。

理解这一背景后,就能明白论文为何刻意不做降维:若高维特征本身已包含足够判别信息,额外压缩反而可能抹去对伪造敏感的细微差异。下一步需要明确论文要回答的具体对比问题。

论文要回答的具体对比问题是什么?

论文要回答的问题可以拆成 3 步。第一步,在固定前端为 XLS-R 且不做维度约简的条件下,单层全连接线性层与单层 KAN 层在检测性能上是否有差异。第二步,这种差异是否在不同攻击类型和不同信道条件下保持一致,例如在 ASVspoof 2021 逻辑接入的 13 种未见攻击和编解码传输效应下,以及在 2021 Deepfake 的多种声码器类型下。第 3 步,极简后端是否能在参数量显著更少的情况下,在跨数据集、跨语种、跨声码器的域外场景中与参数量大一到两个数量级的复杂后端保持可比。

论文不声称提出新的前端或新的训练范式,而是把变量控制在后端这一层,通过相同的训练集、相同的优化设置和相同的评估协议来隔离后端结构带来的影响。所有比较都以等错误率为指标,方向是越低越好,且报告的是模型在完整话语上推理的结果。

为了使对比公平,论文固定了前端、池化、优化器、学习率、权重衰减、加权损失和早停策略,仅切换后端为全连接或 KAN。评估时批大小为 1 以避免填充影响,确保话语级表示的完整性。这种设计使任何性能差异都可归因于后端非线性可塑性的有无,而非训练技巧的差异。

明确问题后,下一步是走通从波形到判决的完整路径,看信息如何在各组件间流动。

从波形到判决的完整路径如何走?

单条样本的处理路径是:原始波形输入 XLS-R 特征提取器,得到帧级上下文嵌入序列,再经时间维均值池化得到定长话语向量,最后送入单层分类器输出两个 logits 对应真实与伪造。具体而言,XLS-R 由 7 层卷积特征编码器将波形映射为潜特征,再由 24 层 Transformer 上下文网络输出 T×D 的嵌入矩阵,其中 T 是帧数,D 是特征维度。随后对 T 帧做算术平均,得到维度为 D 的话语级向量。分类器在两种配置间二选一:传统全连接线性层或 KAN 层,二者都直接接收维度 D 的向量,不经过额外的投影或降维。

论文对照的常见做法是先把 T×D 降为 T×d 再分类,而本文提出的方法刻意保留原始 D 以避免信息损失。整个流程中前端参数参与微调,后端参数随机初始化并与前端联合优化,监督信号来自话语级的真假标签。

XLS-R 特征 × 全连接层: XLS-R 特征负责提供高维上下文表示,保留语音中区分真假的细粒度线索;全连接层负责把均值池化后的定长向量线性映射到二分类 logits。二者搭配的理由是让前端承担表示能力,后端只做最简线性判决,从而检验高维特征本身是否已足够判别,避免额外降维或复杂网络掩盖特征质量。

这种设计使实验能够直接回答高维特征是否已足够判别,以及非线性可塑的 KAN 是否比线性映射更能利用高维信息。路径中没有额外的注意力或状态空间模块,计算集中在前端的 Transformer,分类器仅做最后 1 次映射,因此参数量和计算开销主要由前端决定,后端差异仅体现在数千参数级别。

走通主路径后,需要展开 KAN 内部的计算单元,看它与全连接有何本质不同。

KAN 与 FastKAN 的计算单元如何构成?

要理解 KAN,需要先区分它与多层感知机的理论依据。多层感知机基于通用近似定理,用固定激活函数配合可学习线性权重来近似任意函数。KAN 基于 Kolmogorov-Arnold 表示定理,该定理指出任意多元连续函数可表示为有限个单变量连续函数之和的组合。KAN 把这一思想落实为网络结构:每一层的每个连接都由一个可学习的单变量函数 φ 实现,层的输出是前一层各输入经对应 φ 变换后的求和。

形式上,L 层 KAN 是 L 个函数层的复合,每个 φ 由两部分加权组成:一部分是带可学习权重 wb 的 SiLU 激活,另一部分是带可学习权重 ws 的样条函数。样条部分是多个 B 样条基函数的加权和,系数 α 决定如何组合以逼近目标函数。FastKAN 是 KAN 的加速版本,用高斯核的径向基函数替代 3 次 B 样条基函数。径向基函数的值仅取决于输入到中心点的距离,常用高斯形式由距离 r 和宽度 h 控制,高斯宽度决定每个中心对输出的影响范围。这种替换保留了单变量函数可塑的核心思想,但计算更高效。

论文在后端使用单层 FastKAN,使每个输入维度到输出的映射都具备可学习的非线性形状,而不是像全连接层那样仅做 1 次线性加权。

KAN × B 样条: KAN 负责用可学习的单变量函数替代 MLP 的固定激活加线性权重;B 样条负责以分段多项式基函数的加权和来参数化这些单变量函数。二者组合使每个连接上的非线性可塑,论文采用的 FastKAN 进一步用高斯径向基函数近似 B 样条以提升速度,目的是在保持单层结构的同时增强对复杂伪造痕迹的拟合能力。

** 均值池化 × 话语级表示:** 均值池化负责把 Transformer 输出的 T×D 帧级序列在时间维求平均,消除时长差异;话语级表示负责为整段音频提供固定维度 D 的向量供后端分类。二者搭配使变长输入可直接接入单层分类器,无需截断或填充到固定帧数,保留了全文的平均上下文信息。

在实现上,论文的 KAN 层接收维度 D 的池化向量,输出 2 维 logits,参数量约为 22.54K,而全连接层仅约 2.05K,二者都远小于 Conformer 或 Mamba 等后端的数百万参数。单层设计意味着没有堆叠的非线性层,KAN 的表达能力完全来自每个连接上可塑的单变量函数,这与全连接的单一矩阵乘法形成对比。

理解组件后,需要看训练如何组织以保证对比的公平性。

如何训练、如何处理不平衡与增强?

训练仅在 ASVspoof 2019 逻辑接入的训练集上进行,不使用其他训练集。优化器为 Adam,学习率为 2.5×10−6,权重衰减为 1×10−4。批大小为 5,输入按批次内最长话语动态填充。为应对类别不平衡,采用加权交叉熵,对少数类真实语音权重 0.9,对多数类伪造语音权重 0.1。模型在 19LA 开发集上监控性能,采用 3 个 epoch 无提升即早停的策略,选取开发集上最优的检查点。

为提升鲁棒性,训练时加入 RawBoost 数据增强,包含线性与非线性卷积噪声、脉冲信号相关噪声、平稳信号无关噪声以及随机着色噪声。评估时批大小为 1,直接处理完整话语而不做填充截断,所有实验在单张 A100 GPU 上完成。论文未报告冻结前端部分层的细节,描述为对模型进行微调,梯度路径包含 XLS-R 与后端分类器,监督来源是话语级的真假标签。未报告学习率调度、梯度裁剪或标签平滑等额外技巧,若需复现应以原文给出的学习率、权重衰减、加权损失和早停 patience 为基准。

** 加权交叉熵 × 类别不平衡:** 类别不平衡指训练集中伪造样本远多于真实样本,直接训练会偏向多数类;加权交叉熵通过给少数类真实语音 0.9、多数类伪造语音 0.1 的损失权重来校正梯度贡献,使模型在优化时更关注真实类的判别边界,从而缓解数据偏斜带来的偏置。

该训练配置使全连接与 KAN 的对比保持除后端结构外的条件一致。增强策略对两者相同,因此域外泛化的差异更可能来自后端对噪声和信道变化的敏感度不同,而非数据增强的不一致。早停基于开发集也避免了在测试集上挑选最优点的偏差。

训练条件固定后,需要明确实验在哪些数据和指标上展开。

在哪些数据、按什么指标、与谁对比?

评估覆盖域内与域外两类。域内为 ASVspoof 2019 逻辑接入的评估集,包含 13 种未见攻击;ASVspoof 2021 逻辑接入在 19LA 基础上叠加编解码与传输效应,涉及电话信道、多种编解码、比特率和采样率;ASVspoof 2021 Deepfake 进一步引入有损压缩和未见声码器生成的伪造语音。域外为进一步检验泛化,包含 Fake-or-Real、In-the-Wild、DFADD、LibSeVoc、DECRO 的英语与中文子集、MLAAD 的 23 语种子集、ADD23 第一和第二轮、HABLA 西班牙语多口音集、SpoofCeleb 以及 ASVspoof 5。

指标统一为等错误率,数值越低表示检测越可靠。对比对象包括论文自身在相同 XLS-R 前端下的全连接与 KAN 两个版本,以及多个已发布的最先进系统,如 XLS-R+SLS、XLS-R+Conformer+TCM、XLS-R+MultiConv、XLS-R+Conformer+KAN、XLS-R+Mamba、XLS-R+DuaBiMamba、XLS-R+Nes2Net-X 和 XLS-R+AASIST 等,这些系统的结果部分来自原论文,部分来自已发布检查点的复评。参数量作为成本维度 1 并报告,后端参数量从 2.05K 到 23.40M 不等。

** 等错误率 × 域外泛化:** 等错误率负责量化误接受与误拒绝相等时的错误水平,数值越低表示检测越可靠;域外泛化负责检验模型在未见攻击、信道、语种和压缩条件下的稳定性。二者结合要求不仅报告 19LA/21LA 等域内 EER,还需在 FoR、ITW、MLAAD 等多域外集上对比,以判断轻量后端是否真正具备跨条件鲁棒性而非仅拟合训练分布。

所有系统均在相同指标下比较,但训练数据与增强策略不完全一致,因此跨系统对比需注意条件差异,论文内最公平的对比是同一前端和训练流程下的 FC 与 KAN 直接对照。域外集的引入使评估不再局限于 ASVspoof 的干净录制条件,更贴近真实场景中的噪声、压缩和多语种变化。

明确评估框架后,进入结果分析,先看域内攻击细分。

域内攻击细分下谁更稳,代价是什么?

在域内评估中,论文报告 KAN 在多数攻击类型上优于全连接。先提出比较问题:在 ASVspoof 2021 逻辑接入的 13 种攻击和多种信道条件下,单层 KAN 是否比单层全连接在相同高维特征上取得更低的等错误率,且指标方向为越低越好,条件是两者共享相同的 XLS-R 前端、训练集和优化设置。

条件指标全连接KAN比较对象
21LA 汇总汇聚等错误率2.38%1.07%相同前端同训练流程
21DF 汇总汇聚等错误率1.49%1.35%相同前端同训练流程
21LA TTS 攻击分攻击等错误率较高降低过半TTS 类攻击

表后解释主要收益与代价:KAN 将 21LA 的汇聚等错误率从 2.38% 降至 1.07%,在 TTS 类攻击上降幅尤为明显,尤其在 A10 至 A12 等挑战条件下降低超过一半;在 21DF 上,KAN 在传统声码器和神经自回归攻击上取得更低错误率,汇聚结果为 1.35% 对 1.49%。代价是参数量从 2.05K 增至 22.54K,虽仍远小于复杂后端,但在波形拼接攻击上全连接反而略优,说明 KAN 并非在所有攻击类型上一致领先,且单次运行的数值波动需结合后续多次运行的消融来判断稳定性。未胜出项已在波形拼接子集上体现,提示不同合成方式的痕迹对后端非线性的敏感度不同。

域内结果显示 KAN 在多数条件下降低错误率,但存在特定攻击类型的回退。下一步看跨数据集与跨语种的域外表现是否保持同样趋势。

跨数据集与跨语种的域外表现如何分化?

域外评估关注在未见数据集、未见声码器和未见语种上的泛化。先提出比较问题:在 FoR、ITW、DFADD、LibSeVoc、DECRO、HABLA、MLAAD 等多域外集上,KAN 是否比全连接更稳健,指标仍为等错误率越低越好,条件为两者均在 19LA 上训练且在各自评估集上直接测试。

条件指标全连接KAN比较对象
ITW 野外采集等错误率4.69%3.89%相同训练流程
FoR 开放数据等错误率0.93%4.68%相同训练流程
DFADD 扩散与流匹配等错误率17.51%7.41%相同训练流程
LibSeVoc 声码器伪影等错误率1.74%1.51%相同训练流程
MLAAD 英语子集等错误率12.44%6.43%相同训练流程

表后解释:KAN 在 ITW 上从 4.69% 降至 3.89%,在 DFADD 上从 17.51% 大幅降至 7.41%,在 LibSeVoc 上从 1.74% 微降至 1.51%,在 MLAAD 英语上从 12.44% 降至 6.43%,并在意大利语、法语、西班牙语、波兰语、俄语和乌克兰语上也取得更低错误率,显示对扩散模型和多语种伪造的泛化优势。反例是 FoR 上 KAN 为 4.68% 明显高于全连接的 0.93%,在 DECRO 英语子集上 KAN 为 4.45% 也高于全连接的 3.48%,在 HABLA 西班牙语上 KAN 为 4.46% 高于 2.25%,说明 KAN 的增益并非在所有域外分布上一致,特定数据源的偏差可能使线性映射更合适。总体上 KAN 在多数域外条件下降低错误率,但存在明确的未胜出项,需按目标部署场景权衡。

域外分化表明 KAN 对扩散和流匹配等新型合成方法更敏感,而对某些开放数据集的分布则不如线性层稳健。接下来看与复杂后端的参数效率对比及多次运行稳定性。

与复杂后端的参数效率对比及多次运行稳定性?

论文将极简后端与参数量大得多的最先进系统对比,并报告 KAN 的多次运行情况。先提出比较问题:在保持 XLS-R 前端不变时,参数量仅为 1000 级别的单层后端能否在多个数据集上与参数量达数百万的 Conformer、Mamba 等系统达到可比的等错误率,指标方向仍为越低越好,条件是各系统结果来自原文或已发布检查点复评,训练数据与增强不完全对齐。

系统后端参数量备注
XLS-R+FC2.05K本文极简基线
XLS-R+KAN22.54K本文提出
XLS-R+Conformer+TCM3.82M已发布检查点复评
XLS-R+Mamba2.08M已发布检查点复评
XLS-R+SLS23.40M已发布检查点复评

表后解释:KAN 与 FC 在 19LA 上均达 0.10% 至 0.11% 左右,与最先进系统相当;在 21LA 上 KAN 的 1.07% 优于多数复杂系统,在 21DF 上 1.35% 也处于领先区间,而参数量仅为 22.54K,远低于 Mamba 的 2.08M 和 SLS 的 23.40M,显示高维特征允许极简后端实现有竞争力的性能。消融中 KAN 的另外 3 次运行在 19LA 上为 0.08%、0.11%、0.08%,在 21LA 上为 1.58%、1.46%、1.33%,在 21DF 上为 1.34%、1.31%、1.40%,波动在十分之几的百分点内,表明单次报告的 1.07% 处于多次运行的较优一端,但整体趋势仍支持 KAN 在 21LA 和 21DF 上优于 FC。未胜出项是部分域外集上 KAN 仍落后于个别复杂系统,例如在 FoR 上复杂系统的 1.10% 至 2.12% 区间内 KAN 的 4.68% 不占优,说明参数效率的优势需结合目标域来评估。

参数效率的对比支持高维特征加极简分类器的路线,但多次运行的波动提醒单次最优值不能代表平均水平。接下来明确研究的边界与不能外推的结论。

哪些边界未被验证,哪些结论不能外推?

论文的结论有明确边界。第一,训练仅在 ASVspoof 2019 逻辑接入上进行,未在其他数据集上联合训练或做域适应,因此跨数据集的提升不能直接归因于训练数据的多样性。第二,评估指标仅为等错误率,未报告误接受与误拒绝在不同阈值下的权衡、校准误差、推理延迟、内存占用或在流式场景下的帧级性能,因此不能从等错误率的降低直接推断实际部署的延迟或成本一定更优。

第三,前端固定为 XLS-R,未对比其他自监督模型在相同极简后端下的表现差异,文中仅引用已有工作称 XLS-R 在伪造检测上优于其他基础模型,但未在本文实验中复现该对比。第四,KAN 的实现为 FastKAN 的高斯径向基近似,未对比原始 B 样条版本在精度与速度上的差异,也未报告不同样条阶数、网格大小或中心数量的敏感性。第五,资源状态为未发现来源绑定且完成 HTTPS 验证的资源,本次未能确认代码、模型或数据的公开可达性,因此复现需自行实现。

最后,总体趋势不等于每组都成立,已观察到在 FoR、DECRO 英语和 HABLA 等子集上 KAN 落后于全连接,说明轻量非线性并非在所有分布上都更优。

这些边界意味着论文支持的是在给定前端和训练条件下的后端对比结论,而非对所有前端、所有语言、所有部署约束的普适最优。任何将等错误率优势直接等同于实际系统更安全或更快的推断都超出证据范围。

明确边界后,给出可操作的复现清单。

复现需要固定哪些步骤与超参数?

复现时应按原文步骤固定关键条件。数据方面,使用 ASVspoof 2019 逻辑接入的官方划分进行训练和开发集早停,评估时直接在 19LA、21LA、21DF 及所需的域外集上测试,不改变采样率或划分。特征方面,加载预训练 XLS-R,输入为原始波形,按批次内最长话语动态填充,训练批大小 5,评估批大小 1 以处理完整话语。模型方面,保留 XLS-R 输出的原始维度 D,不添加降维投影,池化采用时间维算术平均,后端二选一为单层全连接或单层 FastKAN,输出维度 2。

训练方面,优化器 Adam,学习率 2.5×10−6,权重衰减 1×10−4,加权交叉熵权重真实 0.9 伪造 0.1,早停 patience 为 3,监控 19LA 开发集性能,数据增强采用 RawBoost 的 4 类噪声。硬件方面,原文在单张 A100 上完成,复现时应记录相同批次与填充策略以保证梯度一致性。评估方面,统一计算等错误率,报告时保留 2 位小数的百分号写法,并同时报告后端参数量以体现效率。由于本次未能确认官方代码与检查点的可达性,建议先实现全连接基线并复现 21LA 上约 2.38% 和 KAN 约 1.07% 的汇聚结果作为正确性锚点,再扩展到域外集。

复现时还需注意随机种子、数据增强的随机性以及 XLS-R 微调时的梯度更新范围。论文未明确是否冻结卷积编码器,描述为微调,默认应让全部前端参数参与更新。若需严格对齐,应记录每次运行的种子并报告均值与方差,而非单次最优。

完成复现锚点后,再判断何时值得尝试极简后端。

何时值得尝试极简后端与 KAN,接下来补什么验证?

综合全文,当已拥有高质量的高维自监督表示且希望控制后端复杂度时,值得尝试保留原始维度并使用单层分类器。论文显示在 XLS-R 特征上,单层全连接已能在 19LA 上达到约 0.10% 的等错误率,单层 KAN 进一步在 21LA 上将汇聚错误率从 2.38% 降至 1.07%,在 21DF 上从 1.49% 降至 1.35%,在 ITW、DFADD、LibSeVoc 和 MLAAD 多数语种上也有降低,且参数量仅从 2.05K 增至 22.54K,远低于数百万参数的复杂后端。这支持在资源受限或需要快速部署的场景中优先验证极简后端。

但也需注意反例:在 FoR 上 KAN 的 4.68% 明显高于全连接的 0.93%,在部分跨语种子集上也出现回退,说明非线性可塑并非万能。下一步应补充的验证包括:在相同训练流程下对比不同前端的极简后端表现,系统扫描 KAN 的宽度、中心数和高斯宽度对性能与速度的影响,报告多次随机种子下的均值与方差而非单次最优,以及在阈值可调的实际应用中报告检测代价函数和延迟。

常见误解是把参数少等同于一定更快或更稳,论文仅报告参数量和等错误率,未测量推理时间与校准性,需单独测量后再做部署决策。

对于研究生而言,可先复现全连接基线,确认高维特征加均值池化已能取得有竞争力的结果,再引入 KAN 观察在目标域上的增益是否稳定。若目标域与 FoR 或 HABLA 类似,线性层可能更稳健;若目标是扩散模型或多语种场景,KAN 的非线性可塑更值得投入。后续研究应补上对 B 样条与径向基近似的直接对比,以及对不同池化策略的消融,才能更完整地回答极简后端在音频伪造检测中的适用边界。


← 返回 2026-04-29 语音/音乐/音频论文速递