📄 别只听响度:为什么 AI 炸点声会在“尾巴”里露馅

英文题目:Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds

一句话:论文把脉冲声真伪的判别从幅度谱移到衰减区的群延迟,用后 50% 帧的跨频带变异性等 9 维特征在同分布下拿到 AUC 0.884、单通道群延迟图让 CNN 达到 90% 以上准确率,却在生成器留一平均准确率仅 66.7% 且 AudioLDM2 上近乎失效,证明这是一条可解释的互补线索而非通用检测器。

标签:#音频伪造检测 #Transformer #音频分类 #可解释性

评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

👥 作者与机构

  • JaeHyeong Chang:机构信息未在 arXiv HTML 中可靠披露
  • Chengzhe Sun:机构信息未在 arXiv HTML 中可靠披露
  • Siwei Lyu:机构信息未在 arXiv HTML 中可靠披露

💬 毒舌点评

亮点在于把物理可解释的群延迟衰减区不一致性做成了可验证的取证线索,并用生成器留一与参数敏感性分析诚实地暴露了泛化脆弱性;短板是数据集高度依赖增强与源域错配,且最具区分度的特征在最难的生成器上仍近乎失效,离可用检测器还有距离。

📌 核心摘要

论文针对爆炸与撞击类脉冲声的 AI 生成取证问题,指出幅度谱检测器虽在同分布下准确率高但跨生成器泛化不稳定。方法核心是将短时傅里叶变换相位解缠后的群延迟 group delay 经 mel 压缩为群延迟图,并聚焦后 50% 帧的衰减区提取跨频带变异性等标量特征与图级分类。与已有语音伪造中全频段相位特征不同,工作将判别力定位到衰减区物理约束的不一致性。样本不相交评估下 9 维特征的随机森林 Random Forest 达到 AUC 0.884,群延迟图作为单通道输入亦可让卷积网络取得 90% 以上准确率;但在生成器留一条件下平均准确率仅 66.7% 且 AudioLDM2 留一时所有方法 AUC 均跌至 0.457-0.714 区间,说明线索具互补价值而非通用解。局限在于仅覆盖 3 个生成器与 2 类真实源,且真实数据增强倍率高达 6.4 倍,源域偏差与类别外推仍需更大规模验证。

🔗 开源与复现资源

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及
  • 数据集:论文自建 15,000 条 16 kHz 3 秒音频,包含 7,500 条真实样本与 7,500 条生成样本,真实样本来自 FSD50K 1,122 条扩增至 3,750 条与 SESA 585 条扩增至 3,750 条,生成样本来自 ElevenLabs 1,119 条扩增至 2,500 条、Stable Audio 1,000 条扩增至 2,500 条与 AudioLDM2 1,000 条扩增至 2,500 条,划分为训练集 12,000 条、验证集 1,500 条与测试集 1,500 条并采用 sample-disjoint 策略,论文中未提供自建数据集的公开下载链接与开源协议
  • Demo:论文中未提及
  • 复现材料:论文提供了部分训练与特征配置,STFT 默认参数为 \(N_{\text{fft}}\) 1024、hop 256、截断阈值 500 样本约 31 ms,mel 滤波器组 128 维得到 \(128 \times 188\) 的 Group Delay 图并零填充至 \(128 \times 1024\) 以适配图像分类器,衰减区定义为后 50% 帧,基于 9 维衰减区特征的 Random Forest 达到 AUC 0.884,4 类图像分类器 ResNet50、EfficientNet-B2、CNN14 与 AST 使用 AdamW 训练 15 轮,论文中未提及检查点保存路径与完整配置文件链接
  • 论文中引用的开源项目:FSD50K、SESA、AudioLDM2、Stable Audio、ElevenLabs、SpecAugment、ResNet50、EfficientNet-B2、CNN14、AST、AdamW、Random Forest,论文中未提供上述项目的具体 URL 链接

🧭 深度解读

为什么这个任务不是把声音丢给模型就结束?

想象你听到一段 3 秒的爆炸声。人类判断真假,往往先听“像不像”,模型也是如此:把波形转成幅度谱,也就是每个时频格子里能量有多强,交给卷积网络或 Transformer 去拟合纹理,往往能在同分布测试集上冲到 98% 以上的准确率。但这恰好是陷阱。

脉冲声不同于语音,它不是持续的谐波结构,而是 1 次冲击加漫长的衰减。真实的爆炸要经历冲击波传播、墙面反射、空气耗散,物理系统会对不同频率施加不同的延迟。生成模型如 Stable Audio、AudioLDM2、ElevenLabs 优化的是“听起来像”,未必复现这种频率相关的时延结构。幅度谱看的是“有多响”,而群延迟看的是“不同频率晚到了多久”,两者正交互补。

这篇论文的起点就是这个错位:当所有人都在幅度上卷准确率时,作者问,物理约束最强的衰减尾巴里,相位的导数会不会更诚实?

已有路线走到了哪里,这篇工作站在哪个岔路口?

音频伪造检测的主战场一直是语音。ASVspoof 系列把谱特征、倒谱特征、相位特征都试了个遍,一个共识是:幅度驱动的分类器同分布很强,跨系统泛化很弱。相位和群延迟在说话人性别、语音重建里早被证明有用,也有工作把它搬到语音伪造检测,但大多是对全频段、全时段一视同仁地用。

另一条线是生成式音频本身。AudioLDM2 和 Stable Audio 这类文本到音频模型,已经能合成相当逼真的环境声,但它们的训练目标是感知相似度,不是解波动方程。论文没有去拼一个新的 SOTA 检测器,而是把位置选得很窄:只看爆炸、撞击这类脉冲声,只看群延迟,只看后半段。

这种窄,反而让它与全频段相位工作区分开来。作者不是说相位有用,而是说“衰减区”的相位导数才有用,起始区几乎无区分度。这个定位让后续的特征设计和评估协议都围绕“在哪里看”展开。

要解决的具体问题是什么?输入输出如何定义?

任务被定义为二分类:输入是一段 3 秒、16 kHz 采样的波形,输出是“真实脉冲声”还是“AI 生成脉冲声”。类别上只聚焦两类真实来源的爆炸与撞击声,避免把问题泛化成所有环境声。

难点在于评估方式。作者刻意区分了 4 种协议:样本不相交,即同一源文件的不同增强版本不跨训练/测试;生成器留一,即训练时完全没见过某个生成器,测试时只用它;真实源留一,即训练用 FSD50K 的真实、测试用 SESA 的真实;以及 27 组短时傅里叶变换参数的敏感性分析。这 4 种切法对应 4 个问题:同分布能学到什么、跨生成器能带走什么、真实域偏差有多大、表示本身稳不稳。

指标上同时看准确率和 AUC。准确率反映在固定阈值下的判决,AUC 反映排序能力。论文反复展示两者不一致,正是为了说明“平均准确率最高”不等于“平均 AUC 最高”,阈值稳定性与排序能力需要分开讨论。

方法全景:三条分支如何共享同一个前端?

整个流水线像一个三岔路口,但入口只有一条。输入波形先经过短时傅里叶变换(Short-Time Fourier Transform,简称 STFT),用 Hann 窗、窗长 1024、跳长 256,得到复数谱,再做相位解缠,算出群延迟,最后经 128 维 mel 滤波器组压缩并归一化到[-1,1],得到 1 张 128×188 的群延迟图。为了喂给图像分类器,这张图在时间维零填充到 128×1024;但所有标量特征都基于填充前的 188 帧计算,避免填充本身带来偏差。幅度谱分支和双通道拼接分支也用完全相同的零填充策略,以消除输入尺寸带来的不公平。

3 条分支并行:一是衰减区标量特征加随机森林(Random Forest,简称 RF),只用 9 个数做判决,追求可解释与轻量;二是把群延迟图当单通道图像,直接喂给 ResNet50、EfficientNet-B2、CNN14 和音频谱 Transformer(Audio Spectrogram Transformer,简称 AST),验证群延迟是否能独立支撑深度分类;三是幅度谱对照分支,用同样的网络和训练轮数,只把输入换成 mel 幅度谱,以及幅度加群延迟的双通道拼接。

设计动机很直白:脉冲能量集中在前半段,后半段才是混响与耗散说了算的地方。如果生成器只学会了“开头响”,尾巴的跨频带一致性就可能不一致。因此论文把后 50% 帧定义为衰减区,前 30% 帧定义为起始区作对照,所有判别力都锚定在这个时间切分上。

关键组件:群延迟图与衰减区特征到底在算什么?

先把物理定义翻译成可计算的量。群延迟(group delay)被定义为相位谱对角频率的负导数:

\[\tau(\omega)=-\frac{d\phi(\omega)}{d\omega}.\]

它回答的是:频率为 ω 的分量通过系统时被延迟了多久。实现上,STFT 定义为

\[X(k,m)=\sum_{n=0}^{N-1}x[n+mH]\,w[n]\,e^{-j2\pi kn/N},\]

其中 N 是窗长,H 是跳长,w[n] 是 Hann 窗。瞬时相位为

\[\phi(k,m)=\angle\,X(k,m).\]

沿频率维解缠后做 1 阶差分近似

\[\hat{\tau}(k,m)\approx-\frac{\phi_{u}(k,m)-\phi_{u}(k-1,m)}{2\pi/N}.\]

为数值稳定,按 τ_max=500 采样点约 31 毫秒截断

\[\tilde{\tau}(k,m)=\operatorname{clip}\bigl(\hat{\tau}(k,m),\,-\tau_{\max},\,\tau_{\max}\bigr).\]

再经 mel 滤波器组压缩得到 G(b,m),归一化后即为群延迟图\bar{G}(b,m)。你可以把它想象成 1 张“延迟纹理图”,横轴是时间帧,纵轴是 mel 频带,像素值是该频带在该时刻的平均延迟。

衰减区特征则在这张图上做 2 次抽象。最强的单个特征是跨频带群延迟变异性

\[f_{\text{cv}}=\operatorname{std}_{b}\!\left(\frac{1}{|\mathcal{M}_{d}|}\sum_{m\in\mathcal{M}_{d}}\bar{G}(b,m)\right),\]

即先对衰减区所有帧求平均,得到每个频带的平均延迟,再看这 128 个频带之间的标准差。真实样本的这个值更低、更结构化,生成样本更高、更离散,单特征 AUC 达到 0.720。另一个关键量是衰减区与起始区分布的 KL 散度

\[f_{\text{KL}}=D_{\mathrm{KL}}\!\left(p_{\text{decay}}\,\|\,p_{\text{onset}}\right),\]

它衡量同一样本内前后两段分布漂了多远。论文还用了衰减方差、衰减熵、衰减绝对均值、衰减与起始方差比等,共 9 维,一起交给随机森林。

为了佐证“尾巴更重要”,作者还训练了一个仅 2.24M 参数的相位流循环卷积网络(Phase-Flow CRNN),用双向门控循环单元(BiGRU)加时序注意力去看相位流。注意力图显示,真实样本注意力较分散,伪造样本注意力集中在衰减区末段,这与 KL 在起始区仅 0.022、衰减区达 0.322 的分布分离相互印证。

原论文 Fig. 1:Overall framework for decay-region group delay forensic analysis.

论文图 1。这张图来自原论文 Fig. 1:,图示内容为“Overall framework for decay-region group delay forensic analysis.”。请结合“关键组件:群延迟图与衰减区特征到底在算什么?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

如何训练与求解?哪些是学习的,哪些是确定的?

这套框架里既有确定性计算,也有可学习模型。群延迟图本身没有训练参数,完全由 STFT、相位解缠、差分、截断、mel 压缩和归一化确定性算出。9 维标量特征也是确定性统计量,随机森林是在这些特征上用 5 折交叉验证训练的浅层分类器,报告时在 15000 样本上给出效应量和显著性。

图像分支则是可学习的。ResNet50、EfficientNet-B2、CNN14 和 AST 都把 mel 幅度谱或群延迟图当作图像输入,用 AdamW 优化器训练 15 轮。每段音频固定 3 秒,STFT 默认得到 188 帧,零填充到 1024 帧以适配图像网络的输入分辨率。训练与验证、测试的划分严格保持增强变体不跨区泄漏,即同一源文件的时移、SpecAugment 掩码、噪声混合版本必须在同一分区内。

论文没有披露分类分支的具体损失函数形式、学习率、warmup、批量大小和调度策略,也未说明硬件型号与训练时长。这意味着复现时需要自行补齐这些超参。作者在敏感性分析中用每类 500 样本的子集做 5 折交叉验证,测试 27 组 STFT 配置,以检验表示对窗长、跳长和截断阈值的依赖。

数据与实验协议:用多少样本、怎么切、跟谁比?

根据论文正文与图中报告值整理,数据集构成与划分如下:

构成/协议细节规模与说明
真实来源FSD50K 1122 条原始扩至 3750 条;SESA 585 条原始扩至 3750 条真实共 7500 条,SESA 增强倍率 6.4 倍
伪造来源ElevenLabs 1119 条扩至 2500 条;Stable Audio 1000 条扩至 2500 条;AudioLDM2 1000 条扩至 2500 条伪造共 7500 条
总量与采样16 kHz、3 秒/段共 15000 段,类别平衡
样本不相交划分按源文件隔离增强变体训练 12000/验证 1500/测试 1500
生成器留一每次留 1 个生成器的伪造仅作测试,测试集真实与伪造平衡评估跨生成器泛化
真实源留一FSD50K→SESA 与 SESA→FSD50K检验真实域偏差,参考混合 AUC 0.878
参数敏感性N_fft∈{512,1024,2048}×hop∈{128,256,512}×clip∈{250,500,1000}27 组配置,每类 500 样本 5 折

基线选择上,图像分支用相同前端和零填充,对比幅度谱单通道、群延迟单通道、幅度加群延迟双通道;标量分支用 9 维随机森林,对比单特征 AUC。统计上报告 Cohen’s d、Cliff’s delta 和 p 值,图像分支固定 15 轮 AdamW 训练。需要注意,FSD50K 与 SESA 真实样本本身可分 AUC 达 0.737,说明真实域本身就有偏差,这会与真伪线索混杂。

论文中的 2 张核心图要这样看:图 2 是起始区与衰减区的群延迟累积分布函数(CDF)对比,左图两条曲线几乎重合、阴影面积小对应 KL 0.022,右图两条曲线明显分离、阴影面积大对应 KL 0.322,读者应关注阴影面积的方向与大小;图 4 是 Phase-Flow CRNN 的时序注意力,横轴是时间,注意纵轴尺度在不同子图不一致,真实样本的注意力分散或瞬态,伪造样本的注意力在衰减区末段形成尖峰。

主结果与反证:同分布的天花板与跨生成器的裂缝

先看同分布的样本不相交评估,这是天花板。根据论文正文与图中报告值整理:

比较条件指标明确报告值这项数字支持什么
幅度谱 vs 群延迟单通道(ResNet50)准确率97.00% vs 90.40%幅度仍主导同分布,群延迟单通道已具实质判别力
幅度谱 vs 群延迟单通道(CNN14)准确率98.93% vs 94.20%群延迟最佳单通道达 94.20%,非幅度冗余
幅度谱 vs 群延迟单通道(EfficientNet-B2/AST)准确率98.93% vs 92.67% / 98.27% vs 93.67%跨架构一致:群延迟独立有效
双通道拼接(ResNet50)准确率提升97.00%→97.40% 仅 +0.40 个百分点,高容量模型出现天花板同分布下融合增益有限
9 维随机森林(样本不相交)AUC0.884,单特征 f_cv AUC 0.720轻量可解释特征在同分布下有效
衰减区 KL vs 起始区 KLKL 散度0.322 vs 0.022判别力定位在衰减区,而非全时段

再看跨生成器的留一,这是裂缝。论文报告 CNN 与 AST 的 AUC 在 0.457 到 0.918 之间剧烈波动,AudioLDM2 留一是所有方法的最难条件:CNN14 的 AUC 跌至 0.457 甚至低于随机,EfficientNet-B2 为 0.586,AST 为 0.659,群延迟随机森林也仅 0.580。平均来看,群延迟随机森林平均准确率 66.7% 为所有方法最高,避免了低于随机的极端崩溃,但平均 AUC 0.731 反而低于 CNN 均值 0.762 和 AST 的 0.772,说明它在阈值稳定性上占优,在排序能力上不占优。

反证同样重要。衰减到起始的 KL 特征虽然在分布层面分离显著,真实均值 0.923、生成器均值约 0.010,但样本级 AUC 仅 0.570,说明它是分布级线索而非强样本级分类器。双通道拼接在 ResNet50 上仅提升 0.4 个百分点,在高容量模型上甚至略降,说明同分布天花板会掩盖群延迟的增量价值。参数敏感性上,27 组 STFT 配置下随机森林 AUC 标准差仅 0.035,N_fft≥1024 时趋于稳定,但这只证明表示稳定,不等于跨生成器泛化稳定。

原论文 Fig. 2:Group delay CDF: onset region (left, KL = 0.022) shows near-identical real/fake distributions,…

论文图 2。这张图来自原论文 Fig. 2:,图示内容为“Group delay CDF: onset region (left, KL = 0.022) shows near-identical real/fake distributions, while the decay region (right, KL = 0.322) reveals measurably…”。请结合“主结果与反证:同分布的天花板与跨生成器的裂缝”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Fig. 3:Generator-wise group delay analysis (∗∗∗p<0.001^***p<0.001, ∗p<0.05^*p<0.05, ns = not significant vs.

*论文图 3。这张图来自原论文 Fig. 3:,图示内容为“Generator-wise group delay analysis (∗∗∗p<0.001^***p<0.001, ∗p<0.05^p<0.05, ns = not significant vs.”。请结合“主结果与反证:同分布的天花板与跨生成器的裂缝”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Fig. 4:Phase-Flow CRNN temporal attention (note: y-axis scales differ across panels).

论文图 4。这张图来自原论文 Fig. 4:,图示内容为“Phase-Flow CRNN temporal attention (note: y-axis scales differ across panels).”。请结合“主结果与反证:同分布的天花板与跨生成器的裂缝”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

边界在哪里?哪些结论不能推出?

作者对局限的交代相当诚实,这恰好是初学者最该学会的阅读方式。第一,真实数据高度依赖增强,SESA 放大约 6.4 倍,且 FSD50K 与 SESA 的真实样本本身就能以 AUC 0.737 被分开,说明录制链路、后期处理与域偏差可能与群延迟线索混杂,论文用真实源留一显示偏差尚可控,但并未消除。

第二,生成器覆盖仅 3 个,跨生成器泛化不均匀。AudioLDM2 留一时所有方法都接近随机,群延迟随机森林也只有 0.580,说明这条线索并非通用解。论文因此把结论收敛为“分布级互补线索”,而非“通用检测器”,这是一个重要的措辞克制。

第三,评估的完整性仍有缺口。参数敏感性只用了每类 500 样本的子集,未做相位随机化、编解码、重采样、混响等对抗鲁棒性测试,也未扩展到爆炸与撞击以外的声音类别和 3 秒以外的时长。未报告置信区间与多随机种子方差,平均准确率与平均 AUC 的权衡也需要更细的阈值与代价分析。Phase-Flow CRNN 的注意力可视化仅为定性佐证,且子图纵轴尺度不一致,直观对比时需谨慎。

复现需要什么?哪些已公开,哪些仍缺失?

可复现的部分已经给得较细。STFT 前端明确为窗长 1024、跳长 256、Hann 窗,群延迟截断阈值 500 采样点约 31 毫秒,mel 带数 128,得到 128×188 的群延迟图并零填充至 128×1024 供图像模型使用,衰减区定义为后 50% 帧、起始区前 30% 帧,9 维特征包含跨频带变异性等,随机森林在样本不相交 15000 样本上 AUC 0.884,图像分支用 AdamW 训练 15 轮。数据集构成也披露了原始与最终数量及增强方式:时移、SpecAugment 掩码、噪声混合对两类同等施加,且按源文件隔离划分。

缺失的部分同样具体。论文未提供代码链接、模型权重、数据集下载链接与开源协议,也未说明分类分支的损失函数形式与权重、学习率、批量大小、warmup 与调度策略、硬件型号与训练时长、推理时的解码策略。这些缺失使得端到端复现仍需补齐关键配置。作者建议 N_fft≥1024 以保证稳定,这可以作为复现时的起点。

对于想跟进的研究生,一个务实的复现路径是:先用公开的 FSD50K 与 SESA 按论文比例重建真实集,用 AudioLDM2 与 Stable Audio 的开源权重重建部分伪造集,严格实现样本不相交划分,再按上述 STFT 参数复现群延迟图与 9 维特征,优先验证跨频带变异性的单特征 AUC 与衰减区 KL 的分布分离,再逐步加入图像分支的对照。

收束:这条线索该如何被正确使用?

回到开头的问题:为什么不能只听响度?因为幅度谱拟合的是纹理,而群延迟捕捉的是物理延迟。论文的价值不在于把同分布准确率再推高 0.4 个百分点,而在于把“在哪里看”说清楚了:起始区 KL 0.022 几乎无区分,衰减区 KL 0.322 才有分离;跨频带变异性单特征 AUC 0.720,9 维随机森林 AUC 0.884,但样本级 KL 仅 0.570,说明这是分布级信号。

正确的使用方式是把它当作互补的取证透镜,而非独立的判决器。同分布下让幅度谱做主力,跨生成器时用群延迟的阈值稳定性去避免极端崩溃,用注意力可视化去解释“模型在看尾巴”。未来的工作需要更大规模的真实采集、更多生成器、以及对编解码与混响的鲁棒性测试,才能判断这条尾巴线索能否从实验室走向真实取证场景。

对刚入行的你而言,这篇论文提供了一个很好的方法论模板:先找到物理可解释的假设,再用分布、效应量、单特征、图级分类、留一泛化、参数敏感性 6 层证据去围攻它,最后诚实地报告它在哪里失效。这种“定位线索而非宣称通用”的写作与评估姿态,比单纯的准确率数字更值得学习。

📎 论文与评分元数据

标签:#音频伪造检测 #Transformer #音频分类 #可解释性

5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

📝 5.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #Transformer | #音频分类 #可解释性 | arxiv

⚖️ 评分依据与证据(展开查看)

逐维得分、全文证据与扣分边界
  • 创新性 (1.3/2):将群延迟定义为 tau=-d phi/d omega 并经 128 维 mel 压缩聚焦后 50% 衰减区,提出跨频带变异性 f_cv 等 9 维特征 衰减区 KL 0.322 对比起始区 0.022,单特征 AUC 0.720,GD 单通道达 90.40% 至 94.20%,定位物理可解释补充线索而非全频段相位复用。

  • 技术严谨性 (1.2/1.5):群延迟经 Hann 窗 STFT 相位解缠后一阶差分近似并按 500 采样点约 31 ms 截断,再经 mel 滤波归一化到 [-1,1],推导链条完整 审稿未发现明显推导错误,假设与物理约束阐述一致。

  • 实验充分性 (1.0/1.5):样本不相交 15000 下 RF AUC 0.884 与 4 模型 Mag 对照及 Mag+GD 拼接对比完整,生成器留一 3 个生成器与真实源留一均报告 但 AudioLDM2 留一 AUC 仅 0.580,敏感性仅每类 500 样本子集,未做相位随机化鲁棒性与置信区间报告。

  • 清晰度 (0.8/1):三分支流水线与 STFT 1024 跳长 256 及衰减区定义表述清晰,公式 1 至 9 与图 2 CDF 对应明确 表格区分同分布天花板与留一泛化,但 Phase-Flow CRNN 注意力图 y 轴尺度不一致影响直观对比。

  • 影响力 (0.7/1.5):面向爆炸与撞击类脉冲声取证这一语音伪造外的小众场景,提供可解释互补线索 结论明确限定为分布级线索而非通用检测器,仅覆盖 2 类真实源与 3 个生成器且平均留一准确率 66.7%,外推与通用性仍需更大规模验证。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):已披露 STFT 窗长 1024 跳长 256 mel 128 维及 128x188 零填充至 128x1024,衰减区后 50% 与 9 维特征定义 但未说明分类损失形式、学习率、batch size、warmup 调度与硬件型号,复现仍缺关键配置。

  • 工程/实践价值 (0.5/1.5):给出 STFT 前端到群延迟图与 RF 及 CNN14 等 4 模型 15 轮 AdamW 的可复用流水线描述 但仅为离线整段准确率与 AUC 对比,未报告延迟、吞吐、资源占用等真实部署测量,亦无公开工具或基准产物。


← 返回 2026-08-29 语音/音乐/音频论文速递