标注预算只有 500 段时,主动学习如何在生物声学中选出值得标注的样本
BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。
BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。
针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。
针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。
Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。
该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。
针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。
针对自然声景高噪声鸟鸣分类问题,论文用 Epanechnikov 先验贝叶斯小波收缩显式规则去噪,再以倒谱加谱指数特征训练监督分类器,最强证据是 10 维特征下支持向量机与多项逻辑回归准确率达 0.94 量级,代价是高维增益递减且部分高阶特征无贡献。
针对被动声学监测中标注稀缺与域偏移问题,论文提出先做无监督结构发现再做定向验证的路线,用 MFCC 加 UMAP-HDBSCAN 组织大规模 soundscape 并以 LEAVES 做簇级标签传播,报告两站点约 98% 的四类区分准确率与最高 7.12 倍的标注加速,但 79-90% 的簇标签一致性与未解决的复音分离仍是主要代价与边界。
针对无编程背景学生与生物声学研究者难以串起特征、降维、聚类与分类的问题,AI EcoSound Tutor 用 MFCC/OpenL3 加 PCA/t-SNE/UMAP 加 K-Means/GMM/HDBSCAN 的可配置流水线组织学习,最强证据是在蝗虫录音上 MFCC-UMAP 组合达到轮廓系数 0.9 并经频谱图与回放验证,代价是方法子集有限且仅支持 …
该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。