只用一个旁听麦克风,在放音中追踪声速再补偿声场控制
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
针对立体声到 5.1 盲上混中环绕声缺乏可学习目标的问题,该工作用 CCD 加 ELAE 合成 PAEDB 主次对并训练 Mel-RoFormer 与 MLP 做氛围提取,最强证据是 VPA-Mel-RoFormer 主观总分 14.45 接近 VPA-ELAE 的 14.63,代价是客观重建分数偏低且训练目标受限于合成算法上限。
该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。
论文提出 POLAR 框架,把扬声器滤波器、自由场传播与可微听觉损失连成端到端链路,用梯度下降复现了幅度声像、串扰消除与波束展宽甜点的已知解,并展示定位、不确定度与音染可加权折中,但多属性部分仍是模型自评、权重靠试错且未经正式听音验证。
该研究用房间脉冲响应的自卷积夸张系统把场地声学变成可演奏的混响,在 7 场演出中以质性反馈和频谱分析显示可听声学特征更易引发对空间与人的觉察,代价是啸叫、浑浊与可懂度损失。
针对高密度蜂窝网络下数百部手机难以维持双向同步的问题,千机采用单向广播加无状态对时与离线空间乐谱,把连接存活放在相位精度之前,用 421 部手机的公演与 2000+ 连接的压测验证连续性,代价是放弃逐设备交互与现场定量同步数据。
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。
该文以班加罗尔印度声音研究组织二十年实践为对象,提出把空间、工具、准入与治理当作作曲材料的方法,其证据是 32 通道空间音频实验室、工作坊谱系与衍生项目在约束与慢速生长中持续生成,代价是放弃可复制的通用模型与年度新颖性评价。
FDverb 针对物理混响尾部随机化问题,用短时傅里叶变换加逐频包络跟踪去调制谱噪声,并以稀疏时域早期反射补齐前段,再用非线性包络与音高偏移扩展声音设计,代价是分块算法延迟与大块时间涂抹,且本文只报告实现开销而未做听感对照实验。
该演示用归一化距离参数同时驱动增益、混响比、高频吸收、预延迟和低频补偿五种线索并保持互洽,在 18 人耳机测试中把三声源距离摆放误差从手动混音的 15.3 点降到 7.3 点,代价是 48 kHz 下双耳级开启时 CPU 峰值约 10.5% 与固定 10.7 ms 分区延迟。
针对卷积混响只能静态切换脉冲响应的限制,该文把语料拼接合成的输出直接作为时变卷积核,并用单引擎频域核插值保留卷积状态,在持续插值下报告更低的每块耗时与更平稳的响度,代价是近反相频点仍存在线性混合固有的相位抵消且缺乏感知听音验证。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对长条形隧道内接收位置连续变化时混响特征平滑过渡的问题,该演示用三位置实测脉冲响应构造 6300 个共享极点的模态合成引擎并做残差插值,时域归一化误差低于 3.5%,代价是仅覆盖纵轴一维移动且高频需外推补偿。
论文针对可微音频模型难以自动部署为实时效果器的问题,选择以框架无关的 JSON 中间表示解耦提取与发射,用反馈延迟网络验证脉冲响应一致到单精度噪声级,代价是目前仅在整数延迟线性时不变设定下给出等价与稳定性保证。
该文用 M 个 2×2 旋转或反射核的递归克罗内克积构造 2^M 维正交反馈矩阵,以 O(N log2 N) 就地迭代完成反馈运算,并用单个核角度连续控制立体声耦合、奇偶冻结与时变调制,代价是只覆盖正交矩阵的一个参数子空间且听感验证依赖示例音频。
该工作把反馈延迟网络拆成可替换模块并用图形界面直接优化真实网络,在 128 采样块下随通道数扩大仍快于基线且回声密度更快建立的证据下,代价是用有限差分代替可微分梯度并依赖手工设计的平坦度与衰减损失。
IRIS 把已测或自定义脉冲响应集合排成二维可导航平面,用高斯距离加权与最多 8 路有界卷积做实时试听,在 Apple M4 Pro 上 512 采样缓冲下 16 路 1 秒 IR 平均 2.87 毫秒等三组条件保持在 10.67 毫秒预算内,代价是只做简化时域混合而不保证物理最优与感知透明。
针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。
Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。
SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。