只用两个全向麦克风做出可转向高阶差分波束:神经差分波束形成器如何学图案
针对双麦克风线性阵列只能做一阶、难以保持波束形状随指向平移的问题,该研究用深度网络直接估计两通道复权值去逼近预设的一阶与三阶心形差分图案,在端射方向取得高于经典差分与参数化方法的信号失真比,同时保持跨指向与跨频率的形状一致,并以左右各一个转向模型演示立体声录制,代价是训练依赖无混响仿真与固定阵列几何。
针对双麦克风线性阵列只能做一阶、难以保持波束形状随指向平移的问题,该研究用深度网络直接估计两通道复权值去逼近预设的一阶与三阶心形差分图案,在端射方向取得高于经典差分与参数化方法的信号失真比,同时保持跨指向与跨频率的形状一致,并以左右各一个转向模型演示立体声录制,代价是训练依赖无混响仿真与固定阵列几何。
针对助听器 10 ms 延迟与头影效应下的可转向增强问题,论文提出 FiLM 条件化的 OnlineSpatialNet 与 IPD 相位保持损失,在 8 ms 窗条件下恢复指向性并在 PESQ/ESTOI/SI-SDR 上接近 32 ms 基线,代价是仍需固定主瓣宽度与衰减上限且依赖仿真 HARTF 训练。
针对强混响重叠与残留回声下的实时目标语音提取问题,该工作用分区多输出前端加在线波束形成再加跨波束细化的三段流水线,在十九点八七五毫秒延迟约束下把开发集可懂度和感知质量从基线附近明显抬高,而第二阶段更干净的主观听感反而在受污染近讲参考下出现客观分下降。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对四人围桌、佩戴者遮挡与极低信噪比下的低延迟目标语音提取,该工作用近距到远距投影生成相位幅度对齐的训练参考以启用 SI-SNR 训练,并用固定零陷波束形成抑制佩戴者语音加确定性递归增强渐进精炼,在 Aria 设备上显著超过基线,但频率补偿会以残留噪声为代价恢复高频。
针对麦克风间距未知、增益未校准且各通道噪声功率不同的自组织阵列,论文用确定性最大似然把语音序列与传递函数的闭式解代入似然,只留对角噪声协方差做数值优化,在 4 通道 LibriSpeech 仿真上把阵列信噪比做到 21.18/20.63 dB 而逼近已知噪声的广义特征值波束形成上限,代价是每条语音单独迭代约 2000 轮且混响下客观可懂度与音质提升有限。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。
针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。
问题是在宽带频率不变波束成形中用最少且全频段共用的传声器逼近期望波束,方法是将 OLS 改为联合稀疏逐个选点并加掩蔽与递归实现,最强证据是同心圆阵上 41 个点的 OLS 与 OMP 布局相近且主瓣内近似频率不变,代价是本文只给图示而未报告白噪声增益与指向性的定量数值表。
针对多通道回放攻击检测,论文用经典波束形成在方位俯仰网格上计算声学图并配约 6k 参数卷积网络,在 ReMASC 上六麦阵列取得约 10.1% 等错误率,最强证据是多阵列与多波束形成器对照,代价是小阵列与未见环境下明显退化。
针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。
该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。
针对混响噪声下有多个间歇强干扰时的多通道语音增强问题,论文用黎曼平均的首席特征向量抗干扰、再向样本相关矩阵的子空间投影来抑制噪声,并以 MVDR 波束形成器验证,在所报告的 SIR、SNR、混响和阵元数条件下取得更低的 NMSE 与更高的 PESQ 和 STOI,但低维投影阈值选择与高 SIR 下黎曼分支的退化仍是代价与边界。
论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。
针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。
语音增强 | 7.3/10
声源定位 | 7/10
水声通信 | 5.3/10
声源定位 | 7.5/10