一个模型应对多种测量布局:把空间聚合与频率建模分开做 HRTF 上采样
针对稀疏测量到稠密 HRTF 的上采样受固定测量布局限制的问题,GeoAtt 用逐频点查询条件空间聚合加 Conformer 频率建模实现单个模型适配多种布局,在 SONICOM 四个 LAP 布局上报告了最低对数谱失真,但受限测量覆盖下误差仍明显上升且代码权重本次未能确认可达。
针对稀疏测量到稠密 HRTF 的上采样受固定测量布局限制的问题,GeoAtt 用逐频点查询条件空间聚合加 Conformer 频率建模实现单个模型适配多种布局,在 SONICOM 四个 LAP 布局上报告了最低对数谱失真,但受限测量覆盖下误差仍明显上升且代码权重本次未能确认可达。
该文把固定脉冲与随样本指数加长的滤波器做时变卷积并扩展到球谐域,用近最小相位滤波器拟合由非平稳高斯过程采样的方向相关混响时间,以快速分治卷积从噪声或已有脉冲生成新的空间脉冲响应,代价是滤波器阶数不足时指数放大会放大拟合误差且长混响方向必须更平滑。
该文把一阶到三阶上采样定义为给定低阶信号生成缺失高阶通道的条件分布,用流匹配与得分扩散同骨干对比,在混响语音上流匹配信号与听感占优但参数与采样代价明显更大。
MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。
针对具身智能体难以利用空间音频做问答与导航的问题,论文构建 197 场景问答与 30 场景导航的实录基准并用可控渲染补大规模仿真训练,提出保留语义通路另加 FOA 空间编码器的 OmniEcho,其问答总体 28.5 分与声音导航 16.2% 成功率接近部分文本导航基线,但精细定位与自主停止仍是主要代价。
针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。
针对一阶 Ambisonics 在旋转与镜像下方向变化而声源不变的问题,EquiSELD 用不变标量与等变强度向量双流加等变注意力实现严格 O(3) 等变,在 TAU2021 上以 0.40 的综合分超过基线并以约 19 倍更少训练耗时超过已有等变网络,但在 STARSS23 真实场景上优势收窄且仍受类别覆盖与仰角先验限制。
论文把空间房间脉冲响应的聚合回声方向建模为球谐非负密度,用平方和半定规划做极大似然估计与逆变换采样,再以球面切片 Wasserstein 位移插值直线路径上的声源与反射密度,实验显示 Wasserstein 插值在整条路径上切片距离最小,但代价是切片离散化与非负约束带来的两步优化。
该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。
针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
论文要解决的是作曲家无需技术人员即可在可变扬声器穹顶上精确定位与编排声音运动的问题,选择向量幅度平移加后期高阶环绕声的可移植路线,以三代软件迭代与上千场音乐会实践为证据,代价是长期依赖 macOS 与人工搭建调音链路。
BIKES 把电动货运自行车做成可移动联网乐器,用集中式到网状网络、分布式音频与工业设计迭代解决户外移动演奏与教学问题,最强证据是四车系统的公共骑行与装置验证,代价是第二阶段外观模型尚无发声功能且系统依赖现场网络与人工运维。
CALM 研究如何把双侧身体运动、费力和协调直接转成声音密度与空间行为,证据是手套速率与双侧阈值控制的 abrasive 静止层与和声运动层的对抗结构,代价是放弃快速即兴与精确可移植性。
该文以四个舞蹈配置研究如何把预分析音频语料分布到舞者周围的虚拟体中并用动作做最近邻提取,最具体的证据是共享大体量与手部小体量在单元数与速度上的对照,代价是正式成片采用离线合成因而缺少实时演奏反馈。
该研究把木薯淀粉生物塑料做成不规则触摸面,用 8 电极电场层析扰动加支持向量机分类代替图像重建,在圆形样品与 55 厘米半球壳上验证了中等分辨率触摸词表的一小时稳定与 48 小时漂移代价,最终为一个月展期的低分辨率声音装置选择了保守映射。
该研究用 2 阶录制加 3 阶解码把 5 段自然声景放在实验室与博物馆的 16 只 Genelec 阵列上对比,报告显示存在感较稳而深度、包围感、清晰度与稳定性在混响展厅中下降,代价是房间与垂直阵列构形混在一起无法分离。
针对平面阵下圆形方位排序在 360 度回绕处带来学习负担的问题,该工作用两个正交折叠直线排序分别训练分离网络再按方位打分二选一,在混响会议室评估中对圆形排序取得小而一致的提升,代价是需要方位估计且推理侧要维护多个网络。
针对头显加耳机造成使用者与同室他人隔绝的问题,MetaConcert 选择 WebXR 播放 360°视频加 SuperCollider 播放预解码三阶 Ambisonics 穹顶声场的分流架构并用 OSC 桥接同步,在约 10 分钟节目上经感知验证同步可用,代价是仍依赖中央听音点、局域网质量与人工校准。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读