论文解读

固定窗长不够用:用探针状态让强化学习逐次决定听多久

针对反无人机音频定位中固定窗长在声学证据与时间对应延迟之间的矛盾,该工作用最小探针提取无标签声学状态并以 PPO 同时选择窗口长度与 Mamba 时间特征权重,在 MMAUD-V1 上以 0.23 s 平均窗口取得 0.30 m 误差与 0.136 s 延迟,代价是需要三阶段训练与跟踪反馈维持。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

先互相增强语义再记忆历史:CTAN 用循环一致与时间门控做声音导航

针对深度与双耳音频简单拼接会丢失几何语义关联的问题,CTAN 用双向重构交叉注意力做主动语义增强、用门控时间记忆桥接听觉死区,在 Replica 与 Matterport3D 未见环境中相对 SoundSpaces 基线提升了未听过声音下的成功率与路径效率,但消融显示各模块贡献与听觉死区恢复能力仍受场景规模与声音泛化条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8723 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

在胶合板上听笔尖位置:小数据声源定位为何不用时延估计

针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。

 · 更新于 2026-09-24 · 约 17 分钟 · 8103 字 阅读 →
论文解读

看不见声像旋钮时,用腰上的振动把环绕声位置找回来

针对盲人和低视力音乐制作人难以使用可视化环绕声混音插件的问题,该研究用 bHaptics TactSuit X40 背心把声音方位映射为腰部振动并以左右箭头键移动声源,5 名制作人的探索性任务与访谈报告了定位信心提升和认知负荷下降,但对齐精度与分辨率仍需改进且未提供定量定位误差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9317 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不训练也能定位声源:用生成、核验、修正三步约束多模态大模型的猜测

针对声源定位中特征匹配缺少显式验证的问题,该研究用 Qwen2.5-Omni-7B 的提示工程实现生成-分析-精修三阶段零样本定位,在 MUSIC 与 VGGSound 单源和双源基准上报告了可比或更高的精度,代价是单样本约 4 秒的多轮推理开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10133 字 阅读 →
论文解读

合成数据能替代、修正再扩展声源定位训练吗

该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。

 · 更新于 2026-09-24 · 约 18 分钟 · 8631 字 阅读 →
论文解读

麦克风很少、鸟声很多时:用子带频谱特征把时延分给各自声源

针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

只定位一次之后直接听麦克风:点神经元嵌入卡尔曼滤波做窄带混响跟踪

针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。

 · 更新于 2026-09-24 · 约 18 分钟 · 8862 字 阅读 →
论文解读

只用距离回声找墙:三对不够稳时如何用几何约束补齐

该文研究已知麦克风与声源位置下用直达与反射距离估计鞋盒房间六面墙的问题,提出三距离全求解器与两距离正交求解器并结合 RANSAC 剔除误检,最强证据是已知 chirp 与未知移动音乐两类仿真及 ScanNet++ 伪合成与实录中仍能找回多面墙,代价是逐墙剔除会误删他墙对应距离且后几面墙更难找。

 · 更新于 2026-09-24 · 约 23 分钟 · 11356 字 阅读 →
论文解读

固定提示接不住声音:SOUPLE 用图像条件化学上下文重建音频视觉对应

针对 CLIP 固定提示 a photo of a 与音频嵌入 token 语义脱节的问题,SOUPLE 用图像特征经 Meta-net 生成的可学习上下文替代固定词,在 VGGSound-144K 训练下提升 VGG-SS 与 SoundNet-Flickr 定位与 AVSBench 单源分割,但在无类别监督的多源 MS3 上出现过分割代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8138 字 阅读 →
论文解读

只用单阵列相位谱估计说话人朝向:混响为何反而有帮助

该工作用短时傅里叶变换相位的正弦余弦作输入,结合卷积、双向门控循环和自注意力估计 0-360 度方位角,在仿真混响干净条件下平均角度误差 19.9 度、个性化到说话人与房间后降到 11.3 度,代价是仍需仿真预训练和少量目标域微调才能泛化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8677 字 阅读 →
论文解读

在离群点占多数时仍要全局最优:用内点最大化做远场声源方向估计

针对特设麦克风网络中到达时差含大量离群点时方向估计易陷入局部极小的问题,该文把估计写成内点数最大化并用两点临界点枚举保证全局最优,在合成数据上 80% 离群率下仍保持可用、在 13 段室外无人机实录上优于离散化与最小二乘,代价是计算量随测量数平方增长且依赖内点界的选取。

 · 更新于 2026-09-24 · 约 15 分钟 · 7424 字 阅读 →
论文解读

双耳定位先选对时频特征:两特征够用域内,多样内容才需通道谱加双耳线索

该研究用同一卷积神经网络比较幅度与相位四类时频特征的全部小组合,报告显示域内语音用 ILD 加 IPD 在 0 度仰角达 4.5 度误差,而跨内容泛化需通道相位谱加 ILD 与 IPD 并在域外以 8.4 度误差超过更大 Transformer,代价是特征通道增多与对纯音等结构贫乏信号仍失效。

 · 更新于 2026-09-24 · 约 17 分钟 · 8408 字 阅读 →
论文解读

低信噪比下声学无人机检测定位:覆盖保证与误差相关不确定性的互补权衡

该研究在八麦克风声学无人机检测定位任务上对比保形预测、证据学习与异方差回归,报告显示保形方法按构造实现名义覆盖、证据不确定性与分类错误相关而异方差回归定位误差最低,但纯噪声输入下模型仍保持 0.93 以上置信度而无法拒绝无效目标。

 · 更新于 2026-09-24 · 约 15 分钟 · 7400 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

先认出是什么,再听出在哪里:跨实例视觉提示的选择性测向

针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。

 · 更新于 2026-09-24 · 约 20 分钟 · 9621 字 阅读 →
论文解读

未知发射时刻下把被动定位留作 ToA:用边一致 ADMM 分给每个接收器算

针对未知发射时间的单声源被动定位,论文把问题保持为 ToA 最小二乘并联合估计位置与发射时刻,用基于边的分布式 ADMM 给出闭式局部更新,仿真显示严格停止阈值下其趋势接近集中式求解器与 CRLB 参考,但宽松阈值出现高位平台且收敛只对平滑近似证明。

 · 更新于 2026-09-24 · 约 21 分钟 · 10094 字 阅读 →