论文解读

在胶合板上听笔尖位置:小数据声源定位为何不用时延估计

针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。

 · 更新于 2026-09-24 · 约 17 分钟 · 8103 字 阅读 →
论文解读

只用仿真训练时,如何让跟踪模型不再记住仿真痕迹

针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。

 · 更新于 2026-09-24 · 约 18 分钟 · 8631 字 阅读 →
论文解读

移动中不掉对比度:用块矩阵把整段轨迹的滤波器一起算

针对亮区固定、暗区用户移动时离散切换会掉声对比度并引起系数跳变的问题,该文把整段轨迹滤波器拼成块矩阵并在分母加相邻差分平滑项做广义瑞利商最大化,仿真报告最小声对比度最多提升约 7 dB,代价是峰值提升有限且引入平滑正则权衡。

 · 更新于 2026-09-24 · 约 17 分钟 · 8378 字 阅读 →
论文解读

同位置配准的瞬时相对传递函数为何比声纹和波达方向更适合混响多麦提取

该文研究混响加定向噪声下两人混合的多麦目标说话人提取,对比瞬时相对传递函数、已知波达方向和单通道声纹三种配准线索,随机位置上瞬时相对传递函数取得 9.2 dB 和 0.81 的分离与可懂度,同波达方向下仍保持 8.8 dB,代价是需要与目标同位置的无噪配准信号。

 · 更新于 2026-09-24 · 约 17 分钟 · 8207 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

在低频要降噪、高频要保方向时:按频点凸切换松绑双耳约束

针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。

 · 更新于 2026-09-24 · 约 18 分钟 · 8529 字 阅读 →
论文解读

欠定下不失真分离:把时频掩蔽写进切换波束形成器的代价函数

针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。

 · 更新于 2026-09-24 · 约 18 分钟 · 8733 字 阅读 →
论文解读

要在全频段共用同一批传声器:联合稀疏 OLS 如何挑位置又保波束

问题是在宽带频率不变波束成形中用最少且全频段共用的传声器逼近期望波束,方法是将 OLS 改为联合稀疏逐个选点并加掩蔽与递归实现,最强证据是同心圆阵上 41 个点的 OLS 与 OMP 布局相近且主瓣内近似频率不变,代价是本文只给图示而未报告白噪声增益与指向性的定量数值表。

 · 更新于 2026-09-24 · 约 20 分钟 · 9847 字 阅读 →
论文解读

把得分函数学准:用分数匹配为独立向量抽取训练可解析求导的正弦源模型

该文针对独立向量抽取中源先验不准与二阶算法需要快速求导的问题,用许瓦里宁分数匹配训练正弦多层源非线性,并在仿真与目标说话人抽取中报告了对传统模型的系统性提升与对微调噪声指示器的累积增益。

 · 更新于 2026-09-24 · 约 15 分钟 · 7379 字 阅读 →
论文解读

不用黑盒记频谱:用运动、相位与气流三组物理量做边缘端重放检测

该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8656 字 阅读 →
论文解读

麦克风很少、鸟声很多时:用子带频谱特征把时延分给各自声源

针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

真人嘴与扬声器箱体辐射不同:用方向能量声学图做轻量多通道回放检测

针对多通道回放攻击检测,论文用经典波束形成在方位俯仰网格上计算声学图并配约 6k 参数卷积网络,在 ReMASC 上六麦阵列取得约 10.1% 等错误率,最强证据是多阵列与多波束形成器对照,代价是小阵列与未见环境下明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8595 字 阅读 →
论文解读

多声源共享房间参数时:频谱变准了,混响尾巴为何更难对齐

该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8644 字 阅读 →
论文解读

推理时才给方向图:同一网络如何装下多种指向性

针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。

 · 更新于 2026-09-24 · 约 16 分钟 · 7656 字 阅读 →
论文解读

把回授当成晚期混响:去混响滤波器何以同时做声反馈抑制

论文把传声器信号写成声源经无限冲激响应的卷积,证明在环路延迟足够长且该无限冲激响应可用有限冲激响应近似时反馈分量落入晚期混响段,从而用加权预测误差去混响做联合去混响与声反馈抑制,仿真显示其在 6 dB 与 -6 dB 增益裕量下均优于连续自适应滤波器,代价是依赖延迟条件与有限冲激响应近似。

 · 更新于 2026-09-24 · 约 19 分钟 · 9074 字 阅读 →
论文解读

缺测房间脉冲响应还能做波束形成吗:扩散修复补齐阵列的可用性检验

该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

测得的空间房间脉冲响应:先分离早晚反射,再把阵列缺陷一起重建

该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9433 字 阅读 →
论文解读

不传原始波形:用物理先验的隐编码在带宽受限下估计声场

针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

只定位一次之后直接听麦克风:点神经元嵌入卡尔曼滤波做窄带混响跟踪

针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。

 · 更新于 2026-09-24 · 约 18 分钟 · 8862 字 阅读 →
论文解读

相位对不准就白做:用极坐标分开调幅度和相位的频域个人声区

针对听音者移动导致声传递函数变化时时域 FxLMS 加 RLS 在线建模计算重、重收敛慢的问题,论文提出频域极坐标 FxNLMS 加 NLMS 声路径跟踪与声对比度驱动变步长,在 10 扬声器仿真中把每帧计算量降低约 99.94% 并把移动后重收敛时间常数从 33.11 s 缩短到 3.71 s,代价是仍只在自由场白噪声仿真中验证且依赖多组 Sigmoid …

 · 更新于 2026-09-24 · 约 17 分钟 · 8126 字 阅读 →