在胶合板上听笔尖位置:小数据声源定位为何不用时延估计
针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。
针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
针对亮区固定、暗区用户移动时离散切换会掉声对比度并引起系数跳变的问题,该文把整段轨迹滤波器拼成块矩阵并在分母加相邻差分平滑项做广义瑞利商最大化,仿真报告最小声对比度最多提升约 7 dB,代价是峰值提升有限且引入平滑正则权衡。
该文研究混响加定向噪声下两人混合的多麦目标说话人提取,对比瞬时相对传递函数、已知波达方向和单通道声纹三种配准线索,随机位置上瞬时相对传递函数取得 9.2 dB 和 0.81 的分离与可懂度,同波达方向下仍保持 8.8 dB,代价是需要与目标同位置的无噪配准信号。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。
针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。
问题是在宽带频率不变波束成形中用最少且全频段共用的传声器逼近期望波束,方法是将 OLS 改为联合稀疏逐个选点并加掩蔽与递归实现,最强证据是同心圆阵上 41 个点的 OLS 与 OMP 布局相近且主瓣内近似频率不变,代价是本文只给图示而未报告白噪声增益与指向性的定量数值表。
该文针对独立向量抽取中源先验不准与二阶算法需要快速求导的问题,用许瓦里宁分数匹配训练正弦多层源非线性,并在仿真与目标说话人抽取中报告了对传统模型的系统性提升与对微调噪声指示器的累积增益。
该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。
针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。
针对多通道回放攻击检测,论文用经典波束形成在方位俯仰网格上计算声学图并配约 6k 参数卷积网络,在 ReMASC 上六麦阵列取得约 10.1% 等错误率,最强证据是多阵列与多波束形成器对照,代价是小阵列与未见环境下明显退化。
该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。
针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。
论文把传声器信号写成声源经无限冲激响应的卷积,证明在环路延迟足够长且该无限冲激响应可用有限冲激响应近似时反馈分量落入晚期混响段,从而用加权预测误差去混响做联合去混响与声反馈抑制,仿真显示其在 6 dB 与 -6 dB 增益裕量下均优于连续自适应滤波器,代价是依赖延迟条件与有限冲激响应近似。
该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。
该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。
针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。
针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。
针对听音者移动导致声传递函数变化时时域 FxLMS 加 RLS 在线建模计算重、重收敛慢的问题,论文提出频域极坐标 FxNLMS 加 NLMS 声路径跟踪与声对比度驱动变步长,在 10 扬声器仿真中把每帧计算量降低约 99.94% 并把移动后重收敛时间常数从 33.11 s 缩短到 3.71 s,代价是仍只在自由场白噪声仿真中验证且依赖多组 Sigmoid …