论文解读
只用仿真训练时,如何让跟踪模型不再记住仿真痕迹
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。
Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。