标签:#音频指纹 | #评测协议 | #环境声 | #注意力机制 | #统计分析
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Sunil Tyagi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
任务输入为单通道被动水听器录制的5 s原始波形,输出为对已注册船体画廊的开放集重识别与拒识判定,难点在于同船跨航次信道与环境变化远大于船体间差异且公共数据多为单次捕获导致身份与信道混淆。方法链分四步衔接:先将所有语料重采样至8 kHz并做分段与逐段零均值单位方差归一以剥离电平与硬件着色,其输出波形直接送入四尺度可学习一维滤波器组。随后64通道×四分支的127至8191点滤波器提取16 ms至1 s多时间尺度表征,并由选择性核注意力按输入自适应加权融合为64维谱图。再经五级二维卷积主干早期压缩时间轴、晚期压缩谱轴并以自适应池化得到512维单位球嵌入,最后以加性角度间隔目标训练该嵌入并在推理时与窄带线谱基线的z分数融合打分。与固定梅尔谱加分类头的闭集范式相比,自由核长与每通道注意力使网络自发形成低于500 Hz的恒Q分解与谐波梳状检测器,保留窄带线频绝对位置而非将其增强掉。在40艘船99个转场的IARA跨航次协议评测下,融合方法相对SKANN单一嵌入的指标首位命中率rank-1从0.250升至0.354方向为提升,为唯一名义显著对比而SKANN与窄带方法无显著差异。该结论适用边界受限于同网同类传感器内,跨网未见船与ShipsEar单链路场景下均退化至随机水平为失败条件,且尚未验证航速变化鲁棒性;原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
这篇论文要回答什么运行问题?
论文面对的是被动水声监测的运行提问:系统是否听过这条船体,以及这次接触是否匹配画廊中已注册的某条船。输入是水听器连续采集的舰船辐射噪声,输出是对未知接触的排序短名单与接受或拒绝的阈值判定。
目标不是在训练时固定的船型类别表内做分类,而是对个体船体做开放集重识别,画廊通过注册不断增长,模型权重冻结后仍可追加新船。必须保留的关键信息是评估必须跨航次、按船体身份划分、画廊源纯且经过航次级去重,否则会把录音链路与同一航次自匹配当成身份能力。
本文按学习依赖展开:先厘清任务与已有路线的差异,再给出方法全景与组件计算,随后说明训练与推理的真实构造,最后在严格协议下呈现结果、反证与复现条件。
同类工作在输入、目标与评估上如何对照?
水下声学目标识别的主流模板是基于 Mel、CQT 或 LOFAR 谱图的闭集船型分类,在 ShipsEar 等语料上报告接近饱和的准确率,但其划分常把同一录音的片段分到训练与测试两侧,回答的是船型而非哪一条船。另一条线是可学习前端,如 SincNet 的参数化带通、LEAF 的 Gabor 滤波器组与原始波形深度卷积,动机与本文共享但目标仍是类型分类。
选择性核融合本身已在水下混合事件识别中出现过。度量学习与开放集验证在人脸与说话人领域已成熟,ArcFace 等角裕度损失与余弦决策、注册验证流程为本文提供了可直接迁移的训练与评估范式。
经典窄带分析提供可解释的基线,LOFAR 与 DEMON 暴露轴频与叶频相关的机械线谱,模板匹配与孪生相似度是其延伸。本文的对照点在于:同输入都是水下辐射噪声,同目标应为个体身份,同监督应为船体身份标签,同运行阶段应为冻结权重下的注册检索。既往工作在这些维度上缺失跨航次、船体不相交与去重门控的组合,因此本文的贡献被定位为协议与诚实评估而非单纯的网络结构。
开放集跨航次重识别如何形式化?
任务被形式化为编码器将 1 个航次映射为单位球面上的 512 维向量,航次指纹是其所含片段嵌入的归一化均值。画廊对每个保留航次单独注册 1 条嵌入,不按船体坍缩为单一向量。
查询通过与画廊所有航次条目的余弦相似度排序,真实船体的排名取其最佳同船航次条目的排名。开放集的分数分布按每查询的每船最大值在真实侧与逐条冒充航次在冒充侧构成,用于计算 AUC 与等错率。
评估单元是航次,画廊与查询对同一船体必须来自不相交航次,禁止同一录音或时间重叠捕获的自匹配。画廊要求源纯,查询只与同语料库画廊比对,避免跨库硬件签名成为排序捷径。
去重被设为数据完整性门控:任何分数计算前必须完成音频裁决的航次合并,确保同一物理航次不会同时出现在比较两侧。
开放集重识别 × 闭集分类: 闭集分类负责在训练时固定的类别表内做 argmax,回答这段声音属于哪类船型;开放集重识别负责在不断增长的画廊中做阈值化相似度判定,回答这是否是之前听过的同一条船体,必要时回答未知。二者搭配的原因是水声监测的运行问题是身份而非类别,组合意义在于把模型从分类头改为可注册的嵌入比对,并把评估从同一录音内切分改为跨航次比对。
SKANN 的整体链路是怎样的?
SKANN 是 1 条原始波形卷积编码器,约 4.62 M 参数,输入为重采样至 8 kHz、逐段零均值单位方差归一化的 5 s 波形张量,形状为 1 通道 40000 采样点,输出为 512 维 L2 归一化嵌入,无固定 STFT 或 Mel 前端。
链路按样本走完:5 s 波形进入 4 个分支 1 维滤波器组,核长分别为 127、511、2047 与 8191 采样点,对应约 16 ms 至 1.02 s,每分支 64 通道,经 1 维卷积、组归一化与 ReLU 并保持同长填充。随后选择性核注意力按输入对 4 尺度做通道级加权融合成单张 64 通道时序图。
该图被重解释为高 64 宽为时间的图像,进入 5 段 2 维卷积主干,通道数从 1 到 512 递增,时间轴早期大幅下采样、学习到的谱轴后期下采样。最后自适应平均池化得到 512 维向量并 L2 归一化。
训练时在归一化嵌入上附加 ArcFace 分类头,推理时丢弃分类头直接用余弦比对。预处理与增强共同服务于身份不变性:重采样保留 2 kHz 以下判别带,5 s 分段兼顾 1 Hz 级线谱分辨与样本数量,逐段归一化去除电平。增强在保留窄带线结构的前提下扰动录音链路、环境与多径。
前端与主干如何计算与分工?
前端的 4 分支滤波器组是密集无约束的 1 维卷积核,从噪声初始化开始学习,核长只决定分辨率而不决定频带,所有分支可在 0 至 4 kHz 内自由调谐。选择性核注意力先将 4 个分支 64 通道时序图求和后在时间维平均得到 64 维通道摘要,经线性层压缩至 4 维再经 4 组线性层扩展回 64 维并在分支间做 softmax,使每个通道的 4 分支权重和为 1,再按权重混合 4 分支图。
该机制使网络对每段输入自适应地信任不同时间尺度,且不引入 token 间交互。主干将融合图视为单通道图像,5 段 3×3 的 2 维卷积配合组归一化与 ReLU,步长在高度与宽度上分别为 1,1、1,4、1,4、2,4、2,2。逻辑是时间轴起始极长需早期压缩,而 64 行学习谱轴信息密集需保留至后期再压缩,通道深度随空间分辨率消耗而增长。
嵌入阶段无投影层,池化向量即嵌入。前端的可解释性来自对已训练核的检查:3 条较短分支最具谱峰的核呈现约 6 至 8 周期的加窗正弦,峰值分别约 354、121 与 30 Hz,中心频率随核长反比下降,形成类恒 Q 分解。最长分支则呈现多条离散谱线的梳状检测器,最强线约 15 Hz,对应轴频谐波族,这是固定小波族无法表达的结构。
选择性核注意力 × 多尺度滤波器组: 多尺度滤波器组提供 4 种核长从 16 ms 到 1 s 的原始波形滤波器,各自在时频分辨率上分工;选择性核注意力负责按输入样本对 4 个尺度的 64 个通道做通道级加权融合,决定每段信号更信任哪个时间尺度。二者搭配的原因是窄带线谱需要长窗分辨而瞬态需要短窗定位,组合意义是实现输入依赖的多分辨率前端而无需固定 STFT。
在解读滤波器形态前,需要先建立对训练前后变化的直观预期。下图按核长分行展示了初始随机核与训练后最具谱峰核的时域抽头与频域幅度谱对比,左侧为时域权重随时间的变化,右侧为归一化幅度谱随频率的变化,时间轴从 16 ms 到 1.02 s 跨度达 64 倍。
看图路径: 1. 对比每行左侧初始随机波形与右侧训练后波形的时域形态差异;2. 观察右侧频谱峰值随核长增大而向低频移动的规律;3. 注意最长分支 k=8191 频谱中多条离散谱线的梳状结构;4. 核对 4 行时间轴跨度从 16 ms 到 1.02 s 相差 64 倍的标注
论文图 2。原论文 Fig. 2::“Selective-kernel filterbank: initial versus trained kernels (epoch 21).”。
该图显示 3 条短分支训练后时域呈规则正弦包络、频域呈单峰窄带,而最长分支频域呈多峰梳状。需注意选择偏差,图中仅展示每分支最具谱峰的核,窄带专家是按构造被选出的。分支层面的中位谱峰因子随核长单调上升为 4.5、14.4、38.7、68.9,说明向线结构漂移是群体性质而非个例。4 行时间面板跨度相差 64 倍,振荡密度不可跨行直接比较,应以频谱列为准。
如何训练、增强与选择模型?
训练目标采用 ArcFace 加性角裕度分类损失,覆盖 646 个训练船体身份,尺度 30、裕度 0.3。裕度较常用的 0.5 更温和,原因是身份集高度 singleton,500 个训练船体仅有 1 条录音,激进裕度在稀薄身份上弊大于利。监督来自身份标签本身,无自监督与正样本对构造。
对速度、信道与环境的不变性不指望损失函数提供,而由数据增强提供。优化采用 AdamW,学习率 1e-3 经 3 轮从 1e-4 线性预热后余弦衰减至 1e-6,解耦权重衰减 1e-4,梯度范数裁剪至 10,物理批量 16 经梯度累积至有效批量 64。
增强在预处理阶段离线生成,训练船体每段产生 1 份原始与 3 份增强副本,副本为多变换随机组合:随机谱倾斜轻度重着色且限制低频衰减以模拟录音链路着色;真实环境噪声按随机信噪比混合;稀疏随机信道脉冲响应卷积模拟多径且保持线频率不变并记录峰频校验;循环时移模拟任意到达时间;环境填充掩码用低水平环境噪声替换短区而非置零以避免人为不连续。
被刻意排除的变换是全局增益缩放、多普勒重采样与相位随机化,前者因逐段归一化而惰性,后两者会移动绝对线频率而破坏身份线索。数据设计采用 25 份预构建轮次清单的轮转采样:富样本身份每轮固定配额仅用原始样本,中等样本用全部原始加增强补齐配额,稀薄身份每轮使用全部原始加增强张量,保证每条真实录音与每个身份在训练中持续参与。
验证在 49 个船体不相交的验证船体上以航次级进行,对原始片段嵌入做均值池化与重归一化后按余弦计分,跟踪同船与异船余弦差。训练计划 40 轮、早停耐心 10 轮,实际因计算会话限制在 27 轮停止,最优验证差对应的第 21 轮被冻结为发布检查点并存档。
ArcFace 角裕度 × 余弦相似度: ArcFace 角裕度在训练阶段对 512 维归一化嵌入与类别原型间的夹角施加可加性惩罚,塑造球面上的可分性;余弦相似度在推理阶段作为画廊与查询间的决策统计量直接排序。搭配原因是训练需要类别监督来拉开角度,推理需要无分类头的开放集比对,组合意义是训练时用角度分类、测试时用余弦检索且无需重训即可注册新船。
训练动态与模型选择的关系需要通过 3 段曲线共同判断。上图为 ArcFace 损失,中图为保留船体上的同船与异船余弦及差值,下图为验证检索的 rank-1 与等错率,所有曲线均在训练时的录音级验证池上计算,与后续跨航次评估不可直接比较,时间范围覆盖从第 1 轮到第 21 轮的完整轨迹。
看图路径: 1. 追踪上图 ArcFace 损失随 epoch 单调下降的收敛轨迹;2. 对比中图同船与异船余弦均值及其差值 gap 的演变;3. 观察下图 rank-1 上升与 EER 波动在 epoch 21 处被选为最优点
论文图 3。原论文 Fig. 3::“Training dynamics and model selection.”。
图中可见损失单调下降,中图同船与异船余弦在前几轮同步偏高后逐步分离,差值在后期趋于稳定约 0.14 附近。下图 rank-1 从约 0.16 逐步爬升至 0.39 而 EER 在 0.32 至 0.38 间波动,虚线标记的第 21 轮是按航次级差值选出的运行最优点,之后继续训练至 27 轮但未触发早停。
数据、划分与评估门控如何设置?
3 库分工明确:IARA 作为基础训练与主验证,身份键为 MMSI 或 IMO;ShipsEar 作为基础训练与验证,按船名;ONC 作为跨网络微调实验,身份由 AIS 推导。IARA 快照取 Zenodo 记录 15758636,与论文引用的 15777429 在音频与元表格上字节一致。
划分在分段与增强前按船体冻结:646 个训练船体与 49 个验证船体零重叠,验证中 IARA 占 40 船 115 录音、ShipsEar 占 9 船 37 录音,每个验证船体至少有 2 条可验证身份的录音。预处理对所有语料一致:重采样至 8 kHz 单声道以保留 2 kHz 以下轴叶谐波带,非重叠切 5 s 窗、尾段不足 1 s 丢弃、1 s 以上取末 5 s 补齐,逐段时域零均值单位方差归一化。增强仅作用于训练船体,验证永不增强。
评估指标对每查询定义 rank-1、hit@k、中位排名、AUC 与等错率,其中 AUC 是开放集阈值无关的同船与异船分数可分性度量。统计以船体为抽样单元,AUC 与中位排名的 95% 区间为船体聚类自助百分位,hit@k 的组间差异用 McNemar 精确检验处理配对查询。对比基线为全自动窄带线谱比较器,经 TPSW 白化、线提取与匹配线占比计分;分数融合为按查询对画廊做 z 分数归一化后平均。
航次级去重 × 录音级评估: 录音级评估把同一物理航次下被编为多个录音 ID 的文件当作独立样本,会让模型匹配录音本身而非船体;航次级去重通过残差纹理相关与波形互相关联合裁决,把同一航次合并为 1 个评估单元。搭配原因是元数据键在 IARA 上大量碰撞无法唯一标识航次,组合意义是堵住同一航次自匹配带来的 16 至 21 个点虚高,使跨航次度量真正衡量船体不变性。
航次级去重的必要性来自 IARA 编目以录音 ID 为单位且无站点与时间戳字段,同一物理航次可被编为多 ID。元数据复合键在 300 s 录音且最近点在 150 s 的默认配置上大量碰撞,仅 49 组具有区分性配置,因此元数据仅提名候选、音频裁决为准。
裁决对每条录音在去除线谱与宽带最近点包络后的 120 s 残差谱上计算纹理相关,并在纹理阈上辅以波形互相关,联合规则为纹理相关不小于 0.40 或纹理不小于 0.20 且波形不小于 0.15,同一捕获判为波形不小于 0.80。阈值在 11 对区分性配置的同航次对上校准并以跨船零分布校验,训练侧 1402 录音合并为 1250 航次、验证侧 115 录音合并为 99 航次,审计还发现 15 对跨船对含字节相同文件与同场景多身份编目等标签噪声。
源纯画廊 × 跨库捷径: 跨库捷径指模型利用不同语料库的录音链路、站点声景等硬件签名来排序,而非船体身份;源纯画廊规定查询只与同库画廊条目比对,使硬件签名对所有候选等同而抵消。搭配原因是 ShipsEar 等单站点语料的链路特征极强,组合意义是把评估从语料识别还原为身份识别,避免混合画廊虚增 AUC 约 0.30。
下表概括 3 库的角色与身份键,说明为何 IARA 适合主评估、ShipsEar 适合检验协议敏感性、ONC 适合检验跨网络泛化,比较问题是不同语料的身份可追踪性与站点独立性是否满足跨航次要求。
| Corpus | Role | Identity labels |
|---|---|---|
| IARA [14] | Base training + primary validation | MMSI/IMO |
| ShipsEar [3] | Base training + validation | Per-vessel |
| ONC (Ocean Networks Canada) [41] | Cross-network fine-tuning experiment | MMSI (AIS-derived) |
该表显示 IARA 与 ONC 以 MMSI 为键可追踪个体,ShipsEar 按船名但多为单站点重复。角色分工直接决定后续哪类结论可在哪个库上验证,避免把分类语料的结论外推为重识别能力。源纯画廊的公平条件在此体现:只有同库比对才能抵消硬件签名,否则跨库捷径会虚增分数。
跨航次重识别的主结果与融合表现如何?
主评估在去重后的 IARA 验证集上以留一航次方式进行,99 航次 40 船中 3 船仅 1 航次不可作查询,剩余 37 船提供 96 个可评分查询,每个查询对 98 个航次级画廊条目排序,画廊按航次单独注册。评估的公平条件是航次不相交、源纯且已去重,指标方向为 rank-1 与 hit@k 越高越好、中位排名与等错率越低越好、AUC 越高越好。
下表以可复述的数字总结 3 系统在 96 查询上的检索表现,括号内为船体聚类自助的 95% 区间,比较对象是 SKANN 嵌入、窄带线谱基线与二者分数融合。
| method | n | rank-1 | hit@5 | hit@10 | medR [95% CI] | AUC [95% CI] | EER |
|---|---|---|---|---|---|---|---|
| SKANN (published checkpoint) | 96 | 0.250 | 0.438 | 0.531 | 8 [3–15] | 0.824 [0.762–0.880] | 0.260 |
| narrowband-tonal | 96 | 0.260 | 0.458 | 0.510 | 10 [3–22] | 0.761 [0.691–0.827] | 0.333 |
| score fusion | 96 | 0.354 | 0.479 | 0.562 | 6 [2–17] | 0.839 [0.776–0.896] | 0.251 |
该表显示榜首命中率仅 0.25 左右、10 名内约 0.53,中位排名在 98 候选中的 8 至 10 位。SKANN 与窄带在榜首不可区分,rank-1 分别为 0.250 与 0.260,hit@5 为 0.438 与 0.458,hit@10 为 0.531 与 0.510。阈值无关的 AUC 上嵌入呈现更高点估计 0.824 对 0.761 但配对差区间包含零,方向仅作为观测模式而非既定排序。每查询真实分数在 2 方法间相关 0.55,说明在简单与困难查询上一致而在中间带分歧。
分数融合将 rank-1 提升至 0.354,中位排名降至 6,AUC 至 0.839,等错率至 0.251。融合对 SKANN 的 hit@1 配对为 11 比 1、p 为 0.006,对窄带为 13 比 4、p 为 0.049,hit@5 与 hit@10 以及融合对 SKANN 的 AUC 差区间均跨零,共报告 9 组对比且未做多重校正,唯一名义显著的是融合在 rank-1 上的提升,应解读为部分互补而非运行推荐。
为理解分数背后的物理证据,下图展示同一船体 2 个独立航次在 10 至 65 Hz 的白化低频谱图,持续 300 s,频率轴覆盖 10 至 65 Hz,时间轴覆盖 0 至 300 s,2 个面板上下对照同一船体的不同航次。
看图路径: 1. 在 10 至 65 Hz 范围内寻找 2 段航次共有的 17、34、42、50、59 Hz 水平亮线;2. 对比上下 2 图相同频率线的连续性与强度一致性;3. 注意下方第 2 航次约 80 s 处的垂直暗带为信号缺失段
论文图 4。原论文 Fig. 4::“Exemplar same-hull passage pair: whitened low-frequency spectrograms (10–65 Hz, 300 s) of a reference transit and a second, independent transit of the same hull from the IARA…”。
图中 2 航次在 17、34、42、50 与 59 Hz 等处呈现贯穿时间的水平窄带亮线,且在 2 段航次中共同出现,说明身份线索以持久窄带线族形式存在。下图约 80 s 处的垂直暗带为短时信号缺失,与增强中环境填充掩码的动机一致。记录标识符按去重节要求隐去,2 图的线族一致性支持跨航次匹配的物理基础。
同一对航次的嵌入视角进一步说明排序余量的大小。下图将 2 条同船航次与该查询下排名最高的异船冒充者的 512 维嵌入并列为条带,颜色表示维度取值强度,纵轴为嵌入索引 1 至 512,横向 3 列分别为参考航次、同船第 2 航次与异船冒充者。
看图路径: 1. 纵向对比 3 列 512 维嵌入条带的亮线分布相似度;2. 核对底部标注的同船余弦 0.80 与异船 0.68 的十分位差距;3. 观察参考航次与同船第 2 航次在高亮维度上的重合度高于异船
论文图 5。原论文 Fig. 5::“Embedding view of the pair in Fig. 4.”。
同船余弦为 0.80,冒充者为 0.68,差值仅十分位量级,代表榜首附近正确匹配与近失冒充者的典型间隔,而非可阈值化的鸿沟。条带上高亮维度的重合度在同船对间更高,但异船亦共享部分高亮维度,解释了为何 AUC 可达 0.82 而 rank-1 仅 0.25,系统更适合作为排序短名单的筛选器而非判定器。未胜出项是窄带基线在榜首与 SKANN 持平,说明学习到的纹理并未在首位命中上形成稳定优势。
去重、ShipsEar 与跨网络微调揭示了哪些边界?
去重的效应大于任何方法间差异。在同一检查点与同一流程下,若不使用航次图而按录音评估,rank-1 为 0.409、0.470 与 0.539,对应虚高 16 至 21 个点,方向明确表明污染掩盖了能力不足而非制造能力不足。ShipsEar 在身份协议下失效:14 个可评分查询对 13 候选,嵌入 rank-1 为 0.143 接近随机 0.15,中位排名 5.5,源纯 AUC 为 0.560,窄带为 0.500。
更具诊断性的是 13 对真实对的平均同船余弦低于异船均值,差为负 0.066,成对等错率 0.615,错误返回的异船余弦高达 0.80 至 0.92,说明模型将同一港口的小型船只压缩为紧密簇并按运行状态而非船体排序。混合画廊曾使 ShipsEar 的 AUC 虚增至 0.857,源纯后回落至 0.560,消失的 0.30 即为录音链路签名。
跨网络实验在 ONC 上对 97 航次画廊评估,15 船多航次子集分为 8 船可训练与 7 船永不训练的保留集,查询分全量 38 与保留 17 两档。未见 ONC 的发布模型在全量上 rank-1 为 0.026、中位 24.5、AUC 0.608,微调 A 与 B 分别将中位降至 13.0 与 7.5、AUC 升至 0.682 与 0.731,但在保留集上 3 者均在随机附近,AUC 约 0.527 至 0.551、rank-1 为 0.059 至 0.000,中位仍在 30 至 50 位,窄带亦在随机附近。增加 90 船的大剂量微调未改变保留集零结果,说明跨网络微调仅在已见船上起适应作用,未见船上为零结果,根因是跨遭遇正样本供给稀缺而非损失或结构。
下表对比跨网络微调前后的关键数字,突出协议效应的量级,比较问题是微调是否带来对未见船的泛化,公平条件是保留集永不参与训练,指标方向同前。
| model | query set | n | rank-1 | medR | AUC |
|---|---|---|---|---|---|
| published (no ONC) | full-97 | 38 | 0.026 | 24.5 | 0.608 |
| fine-tune A (8 vessels) | full-97 | 38 | 0.105 | 13.0 | 0.682 |
| fine-tune B (90 vessels) | full-97 | 38 | 0.079 | 7.5 | 0.731 |
| tonal (automated) | full-97 | 38 | 0.053 | 26.0 | 0.639 |
| published (no ONC) | held-out | 17 | 0.059 | 53.0 | 0.527 |
| fine-tune A (8 vessels) | held-out | 17 | 0.000 | 41.0 | 0.516 |
| fine-tune B (90 vessels) | held-out | 17 | 0.000 | 36.0 | 0.551 |
| tonal (automated) | held-out | 17 | 0.000 | 20.0 | 0.599 |
该表显示全量查询上微调带来中位排名与 AUC 的提升,但在 17 查询的保留集上 rank-1 归零、AUC 回到 0.52 至 0.55 区间,窄带基线同样在随机附近。未胜出项是保留集上所有方法均未胜过随机,说明跨网络泛化当前不可用。代价是若仅看全量会误判为泛化成功,必须以保留集为准。
为便于复述去重对评估规模与指标的具体影响,下表按录音与航次 2 级列出 IARA 验证集的规模变化与对应 rank-1,数据来自审计合并与留一航次评估的直接记录。
| 分区 | 录音数 | 航次数 | 冗余数 | 可评分查询数 |
|---|---|---|---|---|
| 验证分区 | 115 | 99 | 16 | 96 |
该表说明 115 录音经合并为 99 航次后可评分查询从 115 降至 96,同一检查点的 rank-1 为 0.409 / 0.470 / 0.539 时虚高 16–21 点直接量化了重复泄漏对标题数字的贡献。训练侧 1,402 录音合并为 1,250 航次、冗余 152 条约 11%,验证侧冗余 16 条,共同界定公开数据当前可支撑的结论边界:同网络内可做短名单分流,跨网络与 ShipsEar 身份评估不可信。
哪些条件未被测量,结论在何处止步?
最强的阴性结论是跨网络泛化为零结果,7 条保留船的评估显示已学习指纹在未见水听器网络上不识别新船,且剂量扩大 10 倍未改变结果,因此所有标题数字均为同网络数字,换用水听器、系泊或前端电子学后排名质量是否保持尚无证据。
速度变化未受控测量,舰船线谱随轴叶速率移动,合成重采样仅移动频率而不复现声源级、空化与调制结构的伴随变化,无法作为物理条件的鲁棒性测试,而 3 库均未提供每航次对地速度日志。评估分辨率有限,96 查询来自 37 船,有效样本量为 37 船而非 96 查询,船体聚类自助区间显示中位排名可因重采样在 3 至 15 或 3 至 22 间摆动。
9 组配对对比未校正多重性,经 Bonferroni 校正后无一组在 0.05 水平下保持显著,融合的 rank-1 名义显著位于边界。训练供给受限,646 训练船中 500 为单录音,目标网络 90 船中 82 为单录音,单录音身份仅能通过对同一捕获的增强提供正样本,学到的是该次捕获的信道与环境而非跨遭遇不变性。
ShipsEar 的单链路单站点结构使其在身份协议下按运行状态排序,同船相似度低于异船,任何包含它的混合画廊检索数都应视为部分语料识别。所有实验均为单水听器单通道、同类传感器内的回顾性评估,未校准开放集所需的虚警预算,也未测量分析师在环性能。航次去重规则按 IARA 元数据与波形结构校准,阈值不直接迁移至其他语料。
复现需要哪些数据、权重与校验步骤?
语料按所有者条款引用而不重分发,IARA 使用 Zenodo 记录 15758636,ShipsEar 按原作者条款,ONC 为 2020 年 7 月 SCVIP 水听器与 Iona Island AIS 日志经 Oceans 3.0 门户获取。发布物存于 Zenodo 22160138,包含最优验证第 21 轮检查点、由该检查点重提的验证航次嵌入、音频裁决的航次图及生成脚本、2 方法的验证相似度矩阵与逐查询结果,文件校验和在存档说明中给出。
从存档检查点重提航次嵌入可将验证相似度复现至 1e-4 以内,最大绝对偏差 7.3e-5,表中数字可由相似度矩阵无音频无模型再生。复现时应先冻结船体不相交划分并在分段与增强前写入文件,再执行逐段归一化与离线增强,随后按航次图将录音合并为航次。
评估时以航次为单元、源纯画廊、留一航次排序并按船体聚类自助报告区间。若需检验跨网络,应预先划分保留船并避免对保留集的反复调参选择。计算上编码器约 4.62 M 参数,输入 5 s 40000 点,训练有效批量 64,验证池在训练时为 133 航次嵌入提供 129 对同船与 8649 对异船计分,跨航次主评估为 96 查询对 98 候选。
何时值得尝试,复现时先做什么,还需补哪项验证?
当任务是开放集个体重识别且可接受排序短名单分流时,该协议与原始波形选择性核编码器值得尝试。当需要跨水听器网络的自动判定或在 ShipsEar 上报告身份能力时,当前公开数据的证据不支持。
复现时先完成航次级去重门控与源纯画廊的搭建,再加载第 21 轮检查点并用存档相似度矩阵自检,随后在 IARA 40 船 99 航次上复现 96 查询的 rank-1、hit@k、中位排名与 AUC 的船体聚类区间。还需补的验证是具备独立日重复遭遇、同一船体在至少 2 套独立传感器上捕获、且每航次记录对地速度的语料,以回答跨网络泛化、速度鲁棒性与融合增益在不同画廊构成下的稳定性。
在此之前,应将系统定位为辅助分析师在前 10 名中以略高于半数的概率找到真船的工具,而非记录在案的识别器。关键超参数如 8 kHz 重采样、5 s 分段、512 维嵌入、ArcFace 尺度 30 与裕度 0.3 应保持一致,信息条件如船体不相交划分与航次图必须在训练前冻结。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.2-contributor
评分请求协议:openai_responses



