📄 Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

标签:#语音增强 #端到端 #模型评估

8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5

🔥 8.0/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #端到端 | #模型评估 | arxiv

👥 作者与机构

作者列表(按论文原文顺序):Reyhaneh Abbasi、Peter Balazs、Vincent Lostanlen、Clara Hollomey、Dustin J. Penn、Sarah M. Zala、Nicki Holighaus。

机构信息:

  • Reyhaneh Abbasi:奥地利科学院(ÖAW)声学研究所(Acoustics Research Institute);维也纳大学维也纳认知、行为与神经科学博士学院(Vienna Doctoral School of Cognition, Behavior, and Neuroscience)。
  • Peter Balazs:奥地利科学院声学研究所;奥地利林茨跨学科转型大学(IT:U)。
  • Vincent Lostanlen:法国南特大学/南特中央理工/CNRS/LS2N UMR 6004。
  • Clara Hollomey:奥地利圣珀尔滕应用科学大学创意媒体技术研究所(Institute for Creative Media Technologies)。
  • Dustin J. Penn、Sarah M. Zala:维也纳兽医大学康拉德·洛伦兹动物行为学研究所(Konrad Lorenz Institute of Ethology)。
  • Nicki Holighaus:奥地利科学院声学研究所。 通讯作者:Reyhaneh Abbasi(reyhaneh.abbasi@oeaw.ac.at)。

💡 毒舌点评

用脊线自己合成干净目标,再让同一个脊线跟踪器来打分,这套“自产自销”的闭环在工程上确实漂亮——绕开了生物声学最缺的干净标注,还把脊线位置塞进 loss 里一鱼两吃。但 SI-SDR 的漂亮数字更像是系统内部的自洽证明:训练目标、测试参考和评价指标全部来源于同一套合成管线,离真实野外噪声到底有多远没有说清。再加上分类实验里 BootSnap 自带降噪没被拆除,增益归因也留了一笔糊涂账。方法对调性发声有效,但离“通用生物声学降噪”还有一层窗户纸。

📌 核心摘要

本文针对野生小鼠超声发声(USV)录音中干净训练数据稀缺的问题,提出了一套完整的训练集合成与监督去噪流程。方法先利用多窗重分配时频表示和脊线跟踪提取 USV 的基频与谐波脊线,再依据脊线合成干净的伪训练样本,并从真实录音的非发声区抽取噪声构造带噪样本;随后训练一个 U-Net 预测复数比率掩膜(cRM),并引入脊线引导损失对基频和谐波区域赋予更高权重。在真实野外录音上,该方法使基频脊线跟踪的 precision 达到 96%、频率偏差降至 0.8 ± 1.5 kHz,谐波跟踪的 recall 提升至 83%;下游分类器在去噪数据上重训后,对野外小鼠和驯化小鼠录音的 macro-F1 分别从 83% 提升至 89%、从 57% 提升至 61%。不过,SI-SDR 的绝对增益主要在合成测试集上报告,且分类实验未将 BootSnap 内置降噪与本文方法的贡献完全分离,因此对真实场景的绝对改进仍需更谨慎的解读。

🔗 开源详情

代码与数据公开可用:

  • GitHub 仓库:https://github.com/ReyhanehAbbasi/bioacoustic-denoising
  • 公开内容包括:训练集合成实现、去噪器与分类器训练代码、Python 脊线评估 GUI、以及包含 193 个 USV 人工脊线标注的标注数据集。
  • 模型权重:论文未提供预训练模型权重下载链接,因此 has_model 记为“未说明”。
  • 数据:原始录音来自已发表的先前研究 [17],本文公开的是脊线标注数据集和噪声/合成流水线代码;训练/验证/测试划分见表 I(原文)。
  • 运行环境:Python 3.8、NumPy 1.19.5、Matplotlib 3.3.4、librosa v0.8.0、TensorFlow/Keras v2.5.0、MATLAB LTFAT 包;GPU 为 NVIDIA A100-SXM4 (40 GB) 或 GTX 1080 Ti。

🏗️ 方法概述和架构

本文提出了一套面向生物声学去噪的完整训练集合成与监督学习流程,核心目标是解决野生小鼠超声发声(USV)录音中干净训练数据稀缺的问题。整体链路可概括为:输入原始带噪音频信号 → 提取声学 ridges(频率脊线)→ 基于 ridges 合成伪干净训练样本并构造带噪样本 → 训练 U-Net 预测复数比率掩膜(complex ratio mask, cRM)→ 将估计的 cRM 应用于输入频谱以增强信号 → 输出增强后的时域波形。此外,提取的 ridges 还被用于设计一种 ridge-guided 损失函数,在训练中显式加大基频及谐波区域的权重,从而提升网络对微弱发声细节的保持能力。

整个方法由四个核心模块构成:预处理与频谱生成模块多分量跟踪模块训练集合成模块U-Net 去噪模块。下面逐层展开。

该模块的输入是原始带噪时域信号 \(x\),输出是两种经过增强的时频表示:用于基频 ridge 跟踪的 MTRS-STFT 和用于谐波 partial ridge 跟踪的 MTRS-CQT

首先,为了降低平稳噪声对后续跟踪的干扰,模块采用经验维纳收缩(empirical Wiener shrinkage)对信号进行预去噪。具体而言,从录音中截取一段 2 秒的不含生物声学信号的纯噪声片段,据此估计噪声功率谱密度,然后对短时傅里叶变换(STFT)系数应用维纳滤波,得到“维纳去噪信号”。该步骤可显著减少平稳背景噪声的能量,使后续 ridge 跟踪更稳定。

随后,对维纳去噪信号分别计算 STFT 和常数 Q 变换(CQT)。STFT 具有均匀的频率分辨率,适用于跟踪基频脊线;CQT 的频率分辨率随频率对数变化,更适合跟踪谐波分量。由于时频不确定性原理,二者的谱图都存在能量扩散(smearing)。为此,模块引入谱图重分配(spectrogram reassignment)技术,将每个时频点的能量重新定位到其局部瞬时频率和群延迟的质心处,从而锐化时频表示。为进一步抑制随机噪声,模块采用多窗谱图重分配(Multitaper Reassigned Spectrogram, MTRS),即使用多组正交窗函数(如 Hermite 函数)分别计算重分配谱图并取平均。这种多窗平均可以增强确定性信号分量,同时压制与信号无关的背景噪声。对于 CQT 域,上述多窗重分配被扩展为 MTRS-CQT,并在其中使用一种改进的软阈值预去噪策略:用平滑的连续权重函数替代原始的硬二值掩膜,对弱分量进行柔和衰减而非强制截断,从而减少跟踪中的错误跳变。

该模块的输入是 MTRS-STFT 和 MTRS-CQT 两种谱图,输出是两类 ridge 轨迹:基频 ridge谐波 partial ridge

基频 ridge 跟踪采用路径优化策略,具体使用 MATLAB 的 tfridge 函数,在 MTRS-STFT 谱图上跟踪最大能量路径。该步骤以维纳去噪后的 MTRS-STFT 为输入,通过动态规划搜索一条在时频域上连续且能量最大的曲线,作为基频轮廓。

在获得基频 ridge 后,模块需要估计谐波 partial ridge。由于 USV 通常由基频及其若干谐波组成,谐波频率近似为基频的整数倍。模块采用基于自相关的方法在 MTRS-CQT 上跟踪谐波分量:对每个时间帧,在基频整数倍附近的频带内计算局部自相关,据此找出能量最强的谐波候选并连接为连续轨迹。该过程需要先准确识别基频,否则谐波位置会整体偏移。多窗重分配处理可有效增强谐波结构的可见性,降低跟踪错误率。

该模块利用上一步提取的 ridge 轨迹合成“干净—带噪”训练对,从而摆脱对真实干净录音的依赖。具体流程如下:

对于每个标注了正确 ridge 的 USV 片段,首先根据基频 ridge 和若干谐波 partial ridge 在时频域内构造一个合成干净信号的幅度谱。合成时,在 ridge 周围赋予符合 USV 窄带谐波特性的能量分布,并保留频率轮廓的时变细节。然后,通过相位重建算法(如 Griffin-Lim 类方法)将该幅度谱转换为时域信号 \( \tilde{s} \),得到合成的干净样本。

为了构造带噪训练样本,从真实录音中抽取非 USV 的噪声片段,并按照目标信噪比(SNR)对噪声进行缩放。具体实现中,先计算噪声的均方根(RMS)幅度,再根据目标 SNR 调整增益,使混合后的带噪信号 \( \tilde{x} \) 与干净信号 \( \tilde{s} \) 满足预设的信噪比。实际训练时,SNR 并非固定值,而是在一定范围内随机采样,以增强模型对不同噪声强度的鲁棒性。训练和验证集的噪声数据来自 3,240 段 200 ms 噪声片段(从三只雄性小鼠的五段录音中自动提取的非发声区域),另加 30 段宽带噪声片段;目标 SNR 从 (-10,-5)、(-5,0)、(0,5)、(5,10)、(10,15) dB 五个区间按 0.30、0.25、0.20、0.15、0.10 的概率采样,使训练偏向低 SNR 场景。每次构造噪声时随机选取 1–3 段噪声样本并在 0.5 概率下用宽带噪声替换其中之一,随后按 RMS 缩放至目标 SNR 后与干净样本相加。

该合成方案的设计动机在于:USV 具有强窄带谐波结构,其时频分布可以由少量频率轮廓近似描述;因此,基于 ridges 的合成能够在不需要真实成对数据的前提下,产生与目标域高度接近的干净训练信号。同时,由于噪声来自真实野外录音,模型能学习到实际环境噪声的统计特性。

该模块是最终用于推断的去噪网络,输入为带噪信号的 STFT 幅度谱(或复数谱),输出为预测的 cRM。cRM 是一个复数滤波器,其公式为 \( M = Y / X \) 的某种估计,其中 \( Y \) 表示干净谱,\( X \) 表示带噪谱。将估计的 cRM 与带噪复数谱逐元素相乘,即可得到增强后的复数谱,再通过逆变换恢复时域波形。使用复数掩膜而非实数增益,能够同时修正幅度和相位失真,对低 SNR 情况尤为有利。

具体网络结构采用经典的 U-Net 架构:包含 4 个编码器块和 4 个解码器块,每个块中有 2 个卷积层,因此编码器和解码器各含 8 个卷积层。编码器初始通道数为 8,每次下采样后通道数翻倍,依次为 8、16、32、64;解码器则对称地逐级减半。编码器中的下采样通过 \(2\times2\) 的 max-pooling(步长为 2)实现,并在每层后加入 dropout(丢弃率为 0.3)以防止过拟合。解码器中的上采样采用 \(2\times2\) 的转置卷积。所有卷积均使用 \(3\times3\) 核、步长为 1,后接 LeakyReLU 激活(负斜率 \( \alpha=0.1 \))和批归一化(Batch Normalization)。此外,编码器的特征图通过跳跃连接直接与解码器中对应分辨率的特征图拼接,以保留精细的空间细节。在最低分辨率的瓶颈处,额外增加两个卷积层,通道数提升至 128,以增强模型的非线性表达能力。输出层使用一个卷积层产生两通道特征图,分别对应 cRM 的实部和虚部。

训练过程中,除了常规的重构损失外,还加入下文中提到的 ridge-guided 损失加权。在每一步训练中,输入带噪 STFT 谱,网络输出 cRM 的实部和虚部估计。将该 cRM 与带噪谱相乘得到增强谱,再与合成干净谱计算损失。损失函数在时频域逐点计算,其中 ridge 区域的误差被赋予更高权重,以迫使网络优先保留基频和谐波结构。设计这一损失的动机是:普通均方误差会平均对待所有时频点,导致能量较弱的谐波和细节被网络忽略;而 ridge-guided 损失显式鼓励网络对关键发声成分做出更精确的预测。训练采用 Adam 优化器,初始学习率 \(10^{-4}\)、\(\beta_1=0.5\)、\(\beta_2=0.9\),批大小 32,并以验证损失早停(patience=5)恢复最优权重。

整个系统在训练完成后的推断流程为:输入带噪语音 → 计算 STFT → 送入 U-Net 获得 cRM → 用 cRM 乘以原始复数谱 → 经过逆 STFT 重建增强后的时域信号。该信号可直接用于下游任务,如 USV ridge 跟踪和音节分类。在评估阶段,论文还对比了不使用 ridge-guided 损失(即普通损失)的变体,以验证该损失的有效性;同时与多种传统及深度基线方法进行比较,包括解析去噪器、noisereduce 和预训练的 Biodenoising 框架。综合来看,整个过程以 ridges 为纽带,将数据合成、网络训练和损失设计统一在同一信号模型下,形成了一套闭环的、数据自给的生物声学去噪方法。

💡 核心创新点

  1. 无需干净录音的训练集合成:利用多分量脊线跟踪得到的基频和谐波轮廓,在时频域构造合成“干净”USV 训练样本,并从真实录音中抽取噪声构造带噪样本,从而绕开生物声学中干净训练数据稀缺的根本瓶颈;整个合成过程不需要预训练生成模型或人工成对标注。
  2. 脊线引导损失函数(ridge-guided loss):将脊线跟踪结果转化为时频域权重图,在损失中显式加大基频和谐波区域的权重,同时加入噪声区域惩罚项(\(\alpha_{\text{noise}}=0.8\)),使网络优先保留对下游分析至关重要的微弱发声结构。消融实验表明该损失对稳定基频跟踪(偏差从 1.4±5.1 kHz 降至 0.8±1.5 kHz)有实质贡献。
  3. 面向小鼠 USV 的 cRM 预测 U-Net 集成系统:将复数比率掩膜预测、多窗重分配时频表示、自相关谐波跟踪和训练集合成整合为一条端到端可复现的流水线;与解析去噪器、noisereduce(平稳/非平稳模式)和预训练 Biodenoising 的对比显示,该方法在各 SNR 水平上一致优于现有基线。
  4. 开源工具链与人工标注数据集:公开发布训练集合成、去噪器与分类器训练代码、脊线评估 GUI 以及 193 个 USV 的人工脊线标注,为生物声学去噪研究提供了可复用基准。

📊 实验结果

论文采用三层评估策略:合成测试集上的 SI-SDR、真实野外录音上的脊线跟踪精度与偏差、以及下游 USV 分类任务上的 macro-F1。表1和表2分别汇总了基频 ridge-tracking 和谐波 partial tracking 的评估指标。表中保留主方法(tfridge on proposed denoiser)、最强基线(tfridge on Wiener MTRS-STFT / Wiener MTRS-CQT)、代表性传统/开源基线(DeepSqueak、Baseline)以及关键消融项(proposed denoiser without loss weighting)。所有数据均直接来自论文原文。

表1:基频 ridge-tracking 评估指标

方法Precision (%)Deviation (kHz)
Baseline (tfridge STFT)942.3 ± 5.8
DeepSqueak88.66.1 ± 10.2
DeepSqueak Wiener RS92.33.5 ± 5.9
tfridge on Wiener STFT951.7 ± 4.1
tfridge on Wiener MTRS-STFT951.4 ± 3.4
tfridge on proposed denoiser (without loss weighting)951.4 ± 5.1
tfridge on proposed denoiser960.8 ± 1.5

表2:谐波 partial tracking 评估指标

输入表示Precision (%)Recall (%)Deviation (kHz)
Baseline (CQT)73511.0 ± 0.3
Wiener CQT81540.8 ± 0.3
Wiener MTRS-CQT89580.8 ± 0.1
proposed denoiser (without loss weighting)97660.8 ± 0.3
proposed denoiser93830.9 ± 0.2

关键结论如下:在基频 ridge-tracking 中,所提方法取得了最高的 Precision(96%)和最低的频率偏差(0.8 ± 1.5 kHz),显著优于所有基线;去除 ridge-guided loss weighting 后,偏差增大至 1.4 ± 5.1 kHz,且标准差明显升高,说明该损失加权对稳定跟踪至关重要。在谐波 partial tracking 中,完整方法以轻微精度下降(从 97% 降至 93%)换取了 Recall 的大幅提升(从 66% 提高至 83%),整体跟踪能力更强;Wiener MTRS-CQT 获得了最小的偏差(0.8 ± 0.1 kHz),表明多锥形重分配谱图在谐波频率定位上具有优势。

在 SI-SDR 合成测试中,所提方法在最低输入 SNR(-10 dB)下将平均 SI-SDR 从 -10.17 dB 提升至 16.52 dB,在最高输入 SNR(15 dB)下从 14.84 dB 提升至 29.11 dB,均优于分析型 denoiser、noisereduce 和 Biodenoising 基线;论文明确指出该方法在所有 SNR 水平上一致优于全部对比方法。需要说明的是,论文摘要仅报告了 -10 dB 和 15 dB 两个端点的 SI-SDR 数值,中间 SNR 档位的结果以图的形式呈现;由于训练目标、合成测试参考和 ridge 评估均来自同一脊线模型,合成测试中的绝对 SI-SDR 增益应理解为系统自洽性验证,而非真实野外录音中绝对失真下降的直接度量。

下游分类实验中,使用所提方法去噪后的数据重训 BootSnap 分类器,在正确脊线野生小鼠测试集上 macro-F1 从 83% 提升至 89%,在错误脊线野生小鼠测试集上从 69% 提升至 72%,在驯化小鼠数据集上从 57% 提升至 61%。实验设置中,所有训练条件均额外使用了 BootSnap 内置默认去噪以保持流程兼容性,因此分类性能提升不能完全归因于本文去噪器;论文未提供移除 BootSnap 内置去噪的消融。

🔬 细节详述

  • 数据统计:数据集包含 8 个 USV 类别(C、C2、C3、D、F、U、UI、UP),剔除了样本极少的 US 和 S 类。正确脊线数据按训练/验证/测试划分,各类样本数见表 I(原文),例如 UP 类分别为 2397/272/299,C2 类分别为 262/33/27;错误脊线数据仅用于测试,UP 类 375 个、C2 类 78 个。人工脊线标注分布为:83.7% 正确、13.7% 错误、2.6% 无效。
  • USV 片段扩展:为保留发声完整边界,USV 片段在 A-MUD 自动检测区间外前后各扩展 ±3 ms;该扩展长度经 ±0.5、±1.5、±3、±5 ms 对比后通过目视检查确定,以避免引入宽带突发噪声。
  • 时频处理参数:所有音频样本使用 200 ms 固定窗口,每个 USV 居中放置;脊线掩膜 \(G\) 在每个时间帧上取脊线周围 \(L=5\) 个频率 bin 为非零,其余区域为零。干净训练样本的合成和噪声混合均在 200 ms 窗口内完成。
  • 软件与硬件:STFT 使用 librosa v0.8.0;CQT 使用 MATLAB 的 LTFAT 包(基于文献 [59][68]);U-Net 与分类器使用 TensorFlow/Keras v2.5.0,训练硬件为 NVIDIA A100-SXM4 (40 GB) 和 GTX 1080 Ti;数据预处理使用 Python 3.8、NumPy 1.19.5,绘图使用 Matplotlib 3.3.4。
  • 基线配置:noisereduce (v4.0.0) 的平稳模式参数为 nthresh=2.4、fmask_smooth=800 Hz、tmask_smooth=5 ms;非平稳模式为 sslope=12、tnmult=1.5、pdecrease=0.9、fmask_smooth=800 Hz、tmask_smooth=3 ms、tconstant=0.02 s;两者均在 -10 dB 最低 SNR 验证子集(50 样本)上调参后固定。Biodenoising 使用公开预训练模型、不做微调;因其工作在 16 kHz,论文将 300 kHz 超声录音直接重写为 16 kHz 而不做波形重采样。
  • 解析去噪器基线:解析去噪器实现与训练集合成相同的脊线引导信号模型,其参数在最低 SNR 验证子集(50 个 -10 dB 样本)上调参以减少高噪声条件下的脊线跟踪跳变;该基线参与了 SI-SDR、脊线跟踪和分类三项评估。
  • 压缩与反解:理想 cRM 先经公式 (4) 的压缩非线性映射到有界区间,网络输出有界掩膜 \(\hat{O}_x\) 后,再按公式 (9) 反解得到无界掩膜估计 \(\hat{M}_x\) 并应用于带噪复数谱;论文中对式 (5) 的下标与式 (7) 中 \(|\hat{O}_x|^2\) 的复数约定存在轻微符号表述模糊,可能影响复现时的精确对应。
  • 评估细节:脊线跟踪评估以人工标注为参考,计算 precision、recall 和频率偏差(均值±标准差);分类评估使用类别级 F1 和 macro-F1,训练条件统一使用 BootSnap 内置默认去噪以保证流程兼容性。

⚖️ 评分理由

  • 创新性 (1.3/2):[A_METHOD][A_SUMMARY] 提出基于自动脊线跟踪的训练集合成、脊线引导损失与cRM预测U-Net的闭环流水线,绕开生物声学干净标注稀缺的根本瓶颈,属于系统级新能力;但组件多为已有信号处理与深度学习模块的组合,未提出全新学习范式。

  • 技术严谨性 (1.2/1.5):[A_LIMITS][SCORING_SOURCE_11/42] 方法串联维纳收缩、多窗重分配、Griffin-Lim相位重建和cRM压缩/反解,但未量化这些近似步骤之间的误差传播;且依赖基频为最大幅度分量、目标必须具有清晰调性脊线的假设,算法边界条件缺乏量化。核心推导本身未见明显错误。

  • 实验充分性 (1.2/1.5):[A_RESULTS][A_LIMITS] 在合成SI-SDR、真实野外脊线跟踪和跨品系分类上均设对比,覆盖解析去噪器、noisereduce、Biodenoising及loss weighting消融;但SI-SDR测试参考与训练目标同源、BootSnap内置去噪未拆解、缺乏显著性检验,削弱了对外部验证声明的支撑强度。

  • 清晰度 (0.8/1):[A_METHOD][SCORING_SOURCE_15/42] 正文按预处理、跟踪、合成、U-Net四个模块组织,结构清楚;但式(5)下标与式(7)中掩膜复数约定存在轻微符号模糊,压缩/反解公式的精确对应需读者自行推断,影响理解完整性。

  • 影响力 (0.8/1.5):[A_SUMMARY][A_RESULTS] 面向小鼠USV去噪的专用系统在真实野外和驯化小鼠数据上提升脊线跟踪与分类,对生物声学与音频读者有实际价值;但目标物种和场景较窄,目前未见跨物种部署或外部采用证据,影响力中等。

  • 开源 (1.0/1.5):[A_OPEN] GitHub公开训练集合成、去噪器与分类器训练代码、脊线评估GUI和193个USV人工脊线标注,但论文未提供预训练模型权重;按模型类核心产物需代码+模型的开放锚点,核心模型产物仅部分开放,故给1.0。

  • 可复现性 (0.5/0.5):[A_METHOD][SCORING_SOURCE_19/42] 论文披露U-Net结构、通道数、卷积核、Adam超参、batch size、早停、SNR采样概率、噪声构造、软硬件环境和评测划分,复现所需信息基本齐全,故按全部充分档给0.5。

  • 工程/实践价值 (1.2/1.5):[A_METHOD][A_OPEN] 形成从合成数据、cRM去噪到脊线跟踪和分类重训的完整可运行流水线,并附带评估GUI和标注数据,工程整合度高;但未报告延迟、吞吐或部署成本,实践价值中等偏上。

🚨 局限与问题

  • 循环自洽性:合成干净目标、训练损失加权、SI-SDR 测试参考和脊线评估全部来源于同一套脊线合成模型,因此 SI-SDR 的绝对增益更多证明系统内部自洽,而非真实场景中绝对失真下降的直接度量。论文未提供任何真实“干净”录音作为外部基准,无法排除模型在合成目标上过拟合而实际输入存在分布偏移的风险。
  • 分类增益归因不完整:所有 BootSnap 分类器训练时均额外使用 BootSnap 内置默认去噪以保持流程兼容性,因此论文无法将 macro-F1 的提升完全归因于所提出的去噪器;缺少移除内置去噪的消融实验,导致“去噪训练数据带来分类改进”的结论被混杂因素削弱。
  • 误差传播与相位恢复影响未量化:维纳收缩、多窗重分配、重排谱反演、Griffin-Lim 类相位重建和 cRM 压缩/反解等环节串联,各近似步骤的误差如何传播、合成干净信号与真实 USV 之间的频谱/相位失配如何影响 cRM 训练,均未给出分析或界。
  • 评估指标的统计证据不足:脊线跟踪仅报告均值和标准差,未提供显著性检验或置信区间;SI-SDR 数值仅给出最低和最高 SNR 两个端点,中间区间的数值差异是否显著无法判断。
  • 标注规模与人工评估有限:脊线标注仅覆盖 193 个 USV(约 83.7% 正确、13.7% 错误、2.6% 无效),且通过 GUI 目视检查完成,标注者间一致性未报告;错误脊线数据虽用于测试,但未说明错误类型分布。
  • 适用性受强假设限制:方法依赖“基频为最大幅度分量”的假设,对基频非最大分量的物种(如大象等)需要调整跟踪策略;对不含清晰调性脊线的宽带或强混沌叫声,脊线合成目标本身不成立。

← 返回 2026-08-12 语音/音乐/音频论文速递