耳朵只认内容、方向另学一路:Bearings 把声场与声学拆开预训练
针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。
针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。
针对一阶 Ambisonics 在旋转与镜像下方向变化而声源不变的问题,EquiSELD 用不变标量与等变强度向量双流加等变注意力实现严格 O(3) 等变,在 TAU2021 上以 0.40 的综合分超过基线并以约 19 倍更少训练耗时超过已有等变网络,但在 STARSS23 真实场景上优势收窄且仍受类别覆盖与仰角先验限制。
针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。
针对多车同时遮挡的非视距预警问题,该工作在原始 8 通道波形上做隔帧未来潜表示预测预训练,再用双向长短期记忆网络做三头微调,在 T 路口验证取得方向与计数与车型同步提升,代价是仅验证至多 2 辆车且跨场景需少样本适配。
针对埋地供水管道分布式声传感数据的多标签识别与时空定位问题,论文用事件级标签加像素级掩膜联合训练并在推理时用类激活图输出热力图,在保持多标签分类的同时把定位从零提升到可用水平,代价是需要人工矩形掩膜标注且只在单一工况 testbed 上验证。
针对可穿戴 6 自由度声音事件定位与检测中混响和噪声破坏声学空间线索的问题,该文用信噪比与混响时间辅助监督学场景嵌入并以此控制音频-运动融合门,在 6DoF SELD 数据集上把聚合误差降到 0.265、相对静态融合降低 5.69%,代价是增加 18.6K 参数和 37.4M 计算量。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文提出连续环境语义视听导航任务 SAVN-CE 与记忆增强模型 MAGNet,用自运动线索加情景记忆维持静音后目标推理,直接报告最高 12.1 个百分点成功率提升,代价是 128 线程加 4 卡约 14 天训练与干扰声下增益收窄。