📄 Embodied Passive Aeroacoustic Perception Enables Relative Sensing and Pursuit Between Aerial Robots

标签:#声源定位 #CNN #音频分类 #多通道 #实时处理

7.9/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5

7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #声源定位 | #CNN | #音频分类 #多通道 | arxiv

👥 作者与机构

  • 第一作者:Yanbaihui Liu(杜克大学机械工程与材料科学系)
  • 通讯作者:Boyuan Chen(杜克大学机械工程与材料科学系、电气与计算机工程系、计算机科学系)
  • 作者列表:Yanbaihui Liu(杜克大学机械工程与材料科学系)、Ravi Prakash(杜克大学机械工程与材料科学系)、Li-Yu Lo(杜克大学机械工程与材料科学系)、Nils Roede(杜克大学机械工程与材料科学系)、Boyuan Chen(杜克大学机械工程与材料科学系、电气与计算机工程系、计算机科学系)

💡 毒舌点评

这项工作是机器人声学感知交叉领域一次充满想象力的探索,将多旋翼恼人的自噪声点石成金般地转化为无需协作即可感知的相对信号源,户外双机追踪的完整系统演示令人眼前一亮。然而,诗意归诗意,当方位角误差高达31.2°时,一个所谓的实时追踪系统,与主流视觉/激光雷达方案在更公平条件下的对标却被规避了。作者将方案精确框定在“互补性场景”,但这种精明的定位也掩盖了其核心性能粗糙的现实。论文展示了一个很有潜力的方向,但目前看来,它离成为可部署的实用系统仍然相去甚远。

📌 核心摘要

  1. 求解问题: 论文旨在解决在GPS拒止、无通信链接、无主动声学信令且无外部感知参照的恶劣条件下,一个空中机器人如何被动地仅利用另一架飞行器自然产生的气动噪声,实现相对感知与追踪的问题。
  2. 方法核心: 系统设计关键在于利用领航无人机(双桨叶)与跟随无人机(三桨叶)因桨叶数不同而产生的谐波分离现象,使跟随者在强烈的自干扰下仍能提取目标信号。跟随者通过轻量化四麦克风定制阵列采集音频,输入卷积神经网络SonicNet。该网络结合频谱图、IPD与ILD特征,联合估计领航者的相对方位与距离。原始估计结果经启发式的置信度门控与扩展卡尔曼滤波器(EKF)进行时序平滑处理后,驱动一个弹簧-质量-阻尼式控制器完成闭环追踪。
  3. 创新点: 提出了“具身被动气动声学感知”这一新范式;首次验证了在强烈的双机同时飞行自噪声下,利用被动声学信号进行在线状态估计与户外闭环追踪的可行性。此外,作者揭示了通过对平台旋翼配置(桨叶数差异)进行设计,可在频谱上增加目标信号可分离性的设计原则。
  4. 主要实验结果: 在黑暗、薄雾等多种户外条件下,使用纯声学闭环追踪,系统平均距离维持误差为1.34m(目标距离3.5m)。在与视觉(RealSense D455)和激光雷达(Mid-360)的对比中,于挑战性视觉条件下,声学系统取得了76.57%的“可观测率”(定义为<(5m误差的时间比),远超二者。用分布式地面传感阵列进行原理验证测试,取得了方位MAE 6.86°、距离RMSE 1.26 m的定位精度。
  5. 实际意义: 为机器人团队在无需通信和光线的退化场景下提供了一种低成本、低SWaP、无电磁辐射的互补感知通道,展示了自然界中动物通过行为副产品实现群体协同的仿生思路在机器人学中的巨大潜力。
  6. 主要局限性: 声学感知精度粗糙,受限于物理定律(距离衰减、环境风)。系统中感知与控制高度耦合易导致误差累积。平台间桨叶数的不同是实现频谱可分离的关键前提,当面对多架同配置无人机时,系统有效性存疑。

SonicFly系统在户外场景中实现了基于被动声学的无人机追踪,下图展示了这一概念和系统流程。

Paper Figure 1

图中清晰地展示了跟随者无人机(搭载定制麦克风阵列)如何通过感知声学信号,实时估计并追随领航者的轨迹,包括在黑暗、薄雾等多种挑战性条件下的成功案例。

🔗 开源详情

  • 代码:https://github.com/generalroboticslab/SonicFly
  • 模型权重:预训练权重随代码仓库一同发布,获取地址同代码仓库:https://github.com/generalroboticslab/SonicFly
  • 数据集:所有数据集随代码仓库一同发布,获取地址同代码仓库:https://github.com/generalroboticslab/SonicFly
  • Demo:项目主页 http://generalroboticslab.com/SonicFly
  • 复现材料:训练配置、超参数、检查点选择策略及完整实验流程详见论文附录及上述GitHub仓库中的文档与代码。
  • 论文中引用的第三方开源项目:PX4, ROS 2, ReSpeaker Mic v2.0, INMP441 MEMS microphone等。

🏗️ 方法概述和架构

SonicFly是一个完整的空中声学感知-跟踪闭环系统,旨在让一个飞行平台(跟随者)仅通过被动收听另一个飞行平台(领航者)的自然飞行噪声,来估计其相对位置并进行追踪。

1. 硬件与传感器设计 系统的物理基础是定制的四通道MEMS麦克风阵列,选用了TDK InvenSense ICS-43434数字麦克风,以实现轻量化。阵列以)d=75,\mathrm{mm}\(的间距对称布局,此孔径是根据目标信号频率的波长权衡设计的:为避免空间混叠,其最高不模糊频率约在2287Hz左右(依据半波长路径差\)\frac{\lambda}{2}=d(计算)。这决定了它能有效捕捉2.3kHz以下的相位信息。整列由一个ESP32-S3微控制器通过I2S接口进行严格同步的数据采集,采样率设定为12000Hz。采集到的原始音频通过USB流式传输至机载的高性能处理器NVIDIA Jetson Orin Nano。

下图展示了SonicFly的定制飞行平台硬件组成和完整的感知-控制架构。

Paper Figure 2

图A展示了集成PX4飞控、RTK-GPS和定制麦克风阵列的四旋翼无人机;图B则详细描绘了从声学信号输入、特征提取、CNN估计到卡尔曼滤波和最终控制的全流程系统架构。

2. 声学特征提取与预处理 在Jetson Orin Nano上,连续的音频流首先被切分为长度为0.25秒(3000采样点)的窗口,窗口间的步长为0.12秒(1440采样点)。对于每个窗口内的四个通道音频数据,系统计算三类声学特征:

  • 对数幅度频谱图: 通过对各通道信号进行短时傅里叶变换(STFT,帧长512,步长128点),得到257个频率bin和24个时间帧的频谱。此特征主要反映各通道接收声能的频谱分布,尤其用于捕获在1-2kHz频带内领航者与跟随者谐波的频谱差异。
  • 耳间相位差: 以通道0为参考,计算其余三通道与参考通道之间归一化互谱的相位差,并分别取正弦和余弦值作为输入特征。IPD是实现方位角(bearing)估计的核心空间线索,其物理基础是声波到达不同麦克风的路程差引起的相位差异。
  • 耳间声级差: 同样以通道0为参考,计算其余三通道与参考通道之间的声压级差异。ILD对估计声源距离(range)具有重要贡献,因为声音在空气中的衰减遵循平方反比定律。 最终,一个声学窗口被组织成一个尺寸为 \(13\times 257\times 24\) 的张量,其13个通道包括4个对数频谱图、3个IPD正弦、3个IPD余弦和3个ILD特征。所有特征在送入网络前都经过基于训练集统计量的倒谱均值方差归一化。

下图展示了在不同飞行配置和环境条件下采集的声学信号频谱,揭示了频谱分离的物理原理。

Acoustic spectrogram and tracking framework

图A显示了移动伴随无人机和风噪会显著影响信噪比;图B和C直观对比了不同桨叶数(2叶与3叶)无人机的谐波频谱差异,证实了通过设计桨叶数差异实现目标信号可分离性的核心思想。

3. 核心感知网络:SonicNet SonicNet是一个融合了频谱与空间特征的卷积神经网络(CNN)回归模型,负责从输入特征张量中直接估计领航者的相对方位角和距离。其架构包含一个二维卷积的残差骨干网络,该骨干网络通过四个残差stage,主要在频率轴上以步长(2,1)进行下采样,以压缩冗余频谱信息并扩大感受野,同时保留音频帧间的时间动态。骨干网络处理后,特征图经频率轴池化、时间轴卷积和全局池化,最终被压缩为一个256维的潜在向量。 该向量之后被分流至两个独立的多层感知机回归头:

  • 方位头: 输出一个两维向量,随后经过L2归一化得到 \((\sin\theta, \cos\theta)\)。这种表达方式能自然地处理方位角在\(\pm180^\circ\)处的周期歧义问题。
  • 距离头: 输出一个代表归一化对数距离的标量。使用对数空间旨在压缩远近尺度的巨大差异,平衡网络对不同距离的训练关注度。 模型总参数量为1.73M,属于轻量级模型,适合机载部署。

4. 置信度门控与鲁棒跟踪器 此部分是连接感知与控制的关键后处理管道,旨在处理声学预测在强干扰下的高频噪声与偶发异常值。它包括三个紧密耦合的步骤:

  • 置信度评分与迟滞门控: 系统为每一帧的SonicNet预测结果计算一个启发式的置信度分数。该分数综合考量了预测方位向量的单位范数一致性、对数距离预测值的物理合理性(不能过于离谱)、以及预测值在相邻帧之间的连续变化程度。一个带有高、低双阈值的施密特触发器式迟滞门控被应用在此分数上,确保只有连续稳定获得高置信度的预测窗口才会被传递给下级的滤波器,从而避免因零星异常值导致的控制抖动。
  • 扩展卡尔曼滤波器: 经门控筛选后的高置信度方位-距离预测,被作为观测量输入到一个离散扩展卡尔曼滤波器。EKF内置了四维恒定速度模型(相对位置和速度),它利用运动模型进行状态预测,并通过马氏距离度量观测残差,自适应地对那些偏离模型预测的观测值进行降权或拒绝,最终输出平滑且连续的相对位置和速度状态估计。
  • 弹簧-质量-阻尼控制器: EKF输出的相对位置估计驱动一个虚拟的弹簧-质量-阻尼控制器,生成用于追踪的速度指令。该控制器在跟随者离领航者太远时产生类似“吸引力”的加速指令,太近时产生“排斥力”。此控制系统的阻尼项仅依赖于跟随者自身的速度,而非EKF估计出的带噪声的相对速度,从而增强了追踪控制的稳定性。

💡 核心创新点

  1. 范式创新: 颠覆性地将多旋翼飞行器固有的飞行噪声从需要抑制的干扰,重新定义为可用于相对空间感知的信号源,并在极具挑战的双机同时飞行条件下验证了其可行性。
  2. 硬件与物理协同设计: 揭示并实验验证了通过设计领航者和跟随者之间的螺旋桨桨叶数差异(如2叶 vs 3叶),可以在频谱上产生部分可分离的谐波结构,以此显著改善在自噪声淹没下的目标信号通路的可观测性。这项设计原则为构建此类系统提供了基础性洞见。
  3. 混合特征感知框架: 并非简单地端到端黑箱学习,而是系统性地探讨了频谱特征(信号存在性和辨识度)和细粒度的空间声学线索(IPD和ILD分别主管方位和距离估计)的作用,通过消融实验证明了这些特征的互补性及其对性能的贡献。
  4. 工程化鲁棒闭环系统设计: 设计了一套“神经网络回归->启发式置信度评估->卡尔曼滤波模型追踪->物理模型驱动控制”的完整级联流程,展示了如何用非学习的确定性方法有效管理基于学习的感知模块在现实应用中存在的高不确定性问题,最终稳定闭环。

📊 实验结果

1. 分布式地面传感阵列定位原理验证实验:

  • 配置: 在约\(30\text{m} \times 20\text{m}\)的户外区域部署成\(3 \times 4\)网格的12个声学传感地面站。
  • 结果:
    • 单个传感单元提供原始预测,距离RMSE为\(1.83\text{m}\);经过单站滤波(卡尔曼+中值滤波)后,距离RMSE降至\(1.64\text{m}\)。
    • 将12个站的数据进行融合(例如使用最小二乘法计算领航者位置),最终达到的方位MAE为6.86°,距离RMSE为1.26 m
    • 此项实验证明,在无自我干扰的理想收听条件下,被动飞行声学信号中确实蕴含了足够进行空间回归的信息,为后续更难的机载实验提供了基础。

2. 机载相对状态估计实验:

  • 配置: 在双机同时飞行时,利用跟随者的机载麦克风阵列进行估计,并与RTK-GPS真值进行对比评估。
  • 结果: 多组实验的汇总结果显示,经置信度门控和卡尔曼滤波(Conf-KF)处理后,性能得到显著提升。
    • 在报告中较差的测试组中,Conf-KF将原始的\(50.83^\circ\)方位MAE降至\(35.34^\circ\),距离RMSE从\(1.82\text{m}\)降至\(1.48\text{m}\)。
    • 在报告最好的测试组中,Conf-KF实现了方位MAE \(31.2^\circ\),距离RMSE \(1.49\text{m}\)。
    • 误差分布表现出非单调的距离依赖特征,在中等距离上性能最佳。这表明在过近或过远处,感知系统面临独特挑战。

3. 闭环声学追踪实验(核心贡献):

  • 配置: 跟随者完全依赖SonicFly系统提供的声学状态估计,追踪一个按正弦曲线轨迹飞行的领航者,并在反向正弦轨迹上测试了泛化能力。
  • 结果:
    轨迹类型平均绝对距离误差 (m)平均相对距离误差 (%)通道内飞行时间占比 (%)
    默认正弦1.3031.8775
    反转正弦1.3833.0380
    总计/平均1.3432.4578
    • 系统在超过20种不同类型和复杂度的轨迹(如C形,S形,L形,甚至拼写“DUKE”的路径)上成功进行了追踪,证明了其并非仅针对单一轨迹过拟合,具有一定的泛化性。

4. 感知模态对比实验:

  • 配置: 在包含黄昏微光、薄雾等对视觉不利天气的同一数据集上,对比了声学、视觉和激光雷达的检测性能。
  • 指标: “可观测率”,定义为定位平移误差小于\(5\text{m}\)的时间占总飞行时间的百分比。
  • 结果:
    感知模态可观测率 (%)体积/重量/功耗 (SWaP)对比
    声学 (SonicFly)76.57128 cm³ / 10 g / 1 W
    视觉 (RealSense D455)52.4893.5 cm³ / 75 g / 3.46 W
    激光雷达 (Mid-360)61.13251.3 cm³ / 265 g / 6.5 W

5. 关键消融实验:

  • 频率波段消融: 对比了\(0\)–\(1\), \(1\)–\(2\), \(5\)–\(6\)及\(0\)–\(6\) kHz四个波段的模型表现。结果,\(1\)–\(2\) kHz波段在所有指标(滤波后方位/距离误差、位置误差)中均取得了最佳平衡。这证实了作者基于物理分析的假设:该频段既有可辨识的领航者谐波结构(区别于低中频),又有足够的空间分辨力(长于高频的混叠问题)。
  • 声学特征消融:
    • 方位估计: 单独使用IPD和ILD特征的效果远好于单独使用对数幅度频谱,且非常接近三者组合后的性能,证明空间线索是方位感知的主导因素。
    • 距离与位置估计: 联合所有频谱和空间特征(对数幅度+IPD/ILD)的模型取得了最低的距离和笛卡尔位置误差,证明了频谱特征对空间信息的互补性。

下图提供了感知模态、声学频率和特征选择的定量对比与消融分析。

Paper Figure 4 (tracking and ablation results)

图C和D表明,被动声学模态在体积、重量、功耗及“可观测率”上具有显著优势;图E和F则分别验证了1-2 kHz是最佳工作频段,以及融合频谱与空间特征(IPD/ILD)对提升定位精度的重要性。

🔬 细节详述

  • 训练数据: 140分钟户外双机飞行记录,采用受DAgger启发式策略采集,以捕获转弯、反向飞行等长尾分布样本。数据按飞行航次划分,以防止训练/测试集之间的时序泄漏。
  • 数据预处理: 音频窗口为0.25秒(3000采样点),步长0.12秒。仅保留\(1.0\text{m}\)–\(10.0\text{m}\)范围内的样本。训练集在划分后通过对方位角进行分箱重采样以实现平衡。
  • 标签: 标签为相对于跟随者机体坐标系的方位角正弦/余弦值(\(s, c\))和对数归一化距离(\(\tilde{r}\)),由RTK-GPS数据解算。
  • 损失函数:
    • 总损失: \(\mathcal{L} = w_\theta \mathcal{L}_\theta + w_r \mathcal{L}_r + 0.35 \mathcal{L}_{xy}\),其中任务权重\(w_\theta\)和\(w_r\)由训练集逆标签方差计算,且范围权重被额外乘2.5以强调距离精度。
    • 方位损失 \(\mathcal{L}_\theta\): 结合了绝对角度误差和一项由距离加权的弦误差项,使得同样的角度误差在距离更远时惩罚更大。
    • 距离损失 \(\mathcal{L}_r\): 是归一化对数距离的L1损失(权重0.65)与去归一化后相对误差(权重0.35)的组合。定制的样本加权策略对近距、远距样本及远距低估情况进行了上加权。
    • 位置损失 \(\mathcal{L}_{xy}\): 通过对预测值和真值的相对笛卡尔坐标应用SmoothL1损失实现,直接对齐下游追踪目标。
  • 训练策略与超参数:
    • 优化器: AdamW, 初始学习率 \(5\times 10^{-3}\), weight decay \(10^{-3}\), 梯度裁剪1.0。
    • 调度: 余弦退火学习率,5个epoch的warmup,batch size 64,最多训练270个epoch,早停耐心值为15。Mixed-precision training (当CUDA可用时)。
    • 模型选择: 基于验证集损失、方位误差、距离MAE和位置MAE的加权组合分选取最佳检查点。
    • 硬件: 训练硬件未提及;推理在NVIDIA Jetson Orin Nano上进行。
  • 后处理(详见材料与方法): 所有参数为部署时固定,非学习参数。
    • 置信度门控分数: 数学上定义为 \(α_{\theta,k} + α_{r,k}\) 的加权和并经过锐化(\(\gamma\)指数)。这些分数由预测向量一致性、瞬时变化速率等因子的乘积组成,旨在检测不符合物理或时序规则的异常预测。
    • 扩展卡尔曼滤波器(EKF): 使用四维状态(\(x\), \(y\), \(v_x\), \(v_y\))的恒定速度模型。详细的状态转移矩阵和噪声协方差矩阵未在正文中给出,需查阅即将开源的代码。
  • 数据与代码: 论文声明数据集、开源代码和预训练权重将在GitHub(链接已提供)上发布。

⚖️ 评分理由

  • 创新性 (1.3/2):提出具身被动气动声学感知新范式,首次在双机同时飞行自噪声下实现纯被动声学闭环追踪,并揭示桨叶数差异实现频谱分离的设计原则,创新性显著。

  • 技术严谨性 (1.0/1.5):方法链融合CNN回归、IPD/ILD特征和EKF,设计合理,但控制器参数未见理论推导或敏感性证明,技术闭环的严格性稍欠。

  • 实验充分性 (0.8/1.5):缺少端到端延迟、吞吐等实时系统关键指标;模态对比依赖过于宽松的<5m可观测率,公平性和精度量化不足;未测试多配置泛化与控制器鲁棒性。

  • 清晰度 (0.8/1):论文结构清晰,方法、实验描述详细,图表表达清楚,未发现明显组织或写作问题。

  • 影响力 (0.8/1.5):新范式在退化场景有互补潜力,但桨叶数差异的强假设和粗糙的绝对精度限制了在通用集群中的影响力。

  • 开源 (1.5/1.5):代码、模型权重、数据集完整公开,提供项目主页和训练文档,符合核心产物完整开放。

  • 可复现性 (0.5/0.5):详细披露了网络架构、超参数、损失函数、训练策略和特征提取,复现所需配置充分。

  • 工程/实践价值 (1.2/1.5):低SWaP、无电磁辐射的感知通道在黑暗等条件下展示了互补价值,但实时性缺失和强场景假设制约了直接部署。

🚨 局限与问题

1. 论文明确承认的局限:

  • 感知性能受物理定律(如距离衰减,环境风、湍流)的根本性限制,有效工作距离短(<10m)。
  • 演示的是团队结构的松散维持和追踪,并非精确的编队控制或避障,且仅支持单领航者-单跟随者。
  • 感知与行动高度耦合,声学定位的误差可能在上层轨迹规划中导致误差累积甚至发散。

2. 审稿人深度挖掘的潜在问题:

  • 对比实验的公平性与深度不足: 其核心的"互补性"论证,建立在只适用于其声学系统的"可观测率"指标上(误差<5m)。这个极其宽松的门槛对激光雷达和视觉系统可能并不公平,它们可能在无法满足此粗糙条件时同样"掉线",但能产出亚米级的精密数据。缺乏在共同有效帧上的定位精度、延迟、刷新率的量化对比,使得其互补性优势看起来更像是基于一个精心设计的评判标准。
  • 声源分离的前提条件过于严苛: 系统的核心前提是依靠桨叶数不同实现的频谱分离。这是一个过于强的假设。在一个未经预先设计的多无人机集群中,如果绝大多数飞机采用相同配置,此系统会立即因无法区分声源而失效。这严重限制了方法在实际异构集群中的应用潜力。
  • 控制器设计的依赖与验证缺失: 控制回路采用的简单弹簧-质量-阻尼模型虽然在概念上合理,但其控制参数(\(K_p\),\(K_d\) )的设置依据、对感知噪声特性(如方位误差的偏置、距离的方差)的敏感性分析均完全缺失。整个系统的稳定闭环是否严重依赖于该手动调校的控制器,而非感知结果本身,实验无法排除此疑问。
  • 泛化性的边界未被探明: 模型在特定桨叶、特定频带(1-2 kHz)和特定机型上训练。当追踪的"入侵者"是尺寸、负载、推进方式(如涵道风扇)完全不同的异形无人机时,特征分布会剧烈变化,系统大概率需要重新收集数据进行微调甚至从头训练,这一点作者并未讨论。
  • 实时计算负载不透明: 论文承认在Jetson Orin Nano上推理,但始终未给出处理每一帧(0.25s音频窗)所需的实际计算延迟以及GPU/CPU占用率。对于闭环实时控制系统,延迟是一个与精度同等重要的关键指标,其缺失使系统的实时声称缺乏坚实支撑。

← 返回 2026-08-04 语音/音乐/音频论文速递