论文解读

标注预算只有 500 段时,主动学习如何在生物声学中选出值得标注的样本

BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8856 字 阅读 →
论文解读

只标一个单日单点,靠无标注声音把时频框撑到新天新点:MAST 的三段做法

针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9151 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

手势进机器之后还剩什么:拉美赛博格主义的三次智利实践

论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。

 · 更新于 2026-09-24 · 约 22 分钟 · 11004 字 阅读 →
论文解读

标签不够时让模型自己补课:伪标签与同属平滑的蝙蝠叫声识别

针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。

 · 更新于 2026-09-24 · 约 17 分钟 · 8352 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

麦克风很少、鸟声很多时:用子带频谱特征把时延分给各自声源

针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

看得清反而重建差:Murzinograph 用三维瓶颈把声音画成可走的轨迹

Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。

 · 更新于 2026-09-24 · 约 22 分钟 · 10804 字 阅读 →
论文解读

只学风声、不学兽鸣:用脉冲网络把长时生物声学录音先筛一遍

该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。

 · 更新于 2026-09-24 · 约 16 分钟 · 7920 字 阅读 →
论文解读

只给整段录音一句话标签,如何同时学会判断与定位鲸叫

针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

回声定位时断时续时,如何把碎裂的鲸轨迹重新连成一条

针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
论文解读

野外噪声下先收缩去噪再分类:Epanechnikov 贝叶斯小波与倒谱监督学习

针对自然声景高噪声鸟鸣分类问题,论文用 Epanechnikov 先验贝叶斯小波收缩显式规则去噪,再以倒谱加谱指数特征训练监督分类器,最强证据是 10 维特征下支持向量机与多项逻辑回归准确率达 0.94 量级,代价是高维增益递减且部分高阶特征无贡献。

 · 更新于 2026-09-24 · 约 19 分钟 · 9091 字 阅读 →
论文解读

先发现结构再贴标签:用无监督组织对抗 soundscape 的域偏移与复音

针对被动声学监测中标注稀缺与域偏移问题,论文提出先做无监督结构发现再做定向验证的路线,用 MFCC 加 UMAP-HDBSCAN 组织大规模 soundscape 并以 LEAVES 做簇级标签传播,报告两站点约 98% 的四类区分准确率与最高 7.12 倍的标注加速,但 79-90% 的簇标签一致性与未解决的复音分离仍是主要代价与边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8845 字 阅读 →
论文解读

不写代码也能走完音频 AI 全链路:AI EcoSound Tutor 如何把鸣声变成可见、可听、可验证的学习对象

针对无编程背景学生与生物声学研究者难以串起特征、降维、聚类与分类的问题,AI EcoSound Tutor 用 MFCC/OpenL3 加 PCA/t-SNE/UMAP 加 K-Means/GMM/HDBSCAN 的可配置流水线组织学习,最强证据是在蝗虫录音上 MFCC-UMAP 组合达到轮廓系数 0.9 并经频谱图与回放验证,代价是方法子集有限且仅支持 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10813 字 阅读 →
论文解读

干净集打平、噪声下才拉开差距:SwinV2 与 AST 的蚊种对数加权融合

该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。

 · 更新于 2026-09-24 · 约 16 分钟 · 7551 字 阅读 →