论文解读

移动声源下镜像源如何配对:用部分最优传输做房间冲激响应插值

针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10792 字 阅读 →
论文解读

声源移动后镜像全变:用位移不变代价求最优传输重心

针对从已知声源镜像源点云插值新声源点云的问题,该文用物理位移等于镜像位移的不变性构造最优传输地面代价并求重心,交替估计关联与位置,在 3×4 米二维二阶反射仿真和 400 次蒙特卡洛下 One-PC 初始化最优,但近墙密集混叠与大扰动下误差放大且无实测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8843 字 阅读 →
论文解读

薄板混响有数千个挤在一起的模态,双流如何同时看全局与局部衰减

针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
论文解读

稀疏程度随房间而变:把最小二乘加多重稀疏约束的模型族展开为可学习的 ADMM 网络

针对语音激励、混响与噪声变化下的批量声学系统辨识,该工作把最小二乘加多重稀疏约束的参数化模型族用交替方向乘子法求解并展开为 ADMM-SysIDNet,在 Bar-Ilan 实测房间冲激响应与 LibriSpeech 激励下以归一化均方偏差为指标优于最小二乘和 ADMM-ℓ1,代价是依赖分混响条件的离线训练与批量观测流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10068 字 阅读 →
论文解读

归一化丢掉响度线索:两阶段进化搜索先定形状再找回面密度

从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。

 · 更新于 2026-09-24 · 约 21 分钟 · 10419 字 阅读 →
论文解读

先数清有多少个模态,再去校准每个模态:密集板混响的计数优先估计

针对板混响脉冲响应中弱模态与重叠模态难以直接检出的问题,该研究先用回归器预测四个频带的模态数量以确定稠密网格基数,再固定频率对衰减与增益做有界可微校准,在两个仿真验证集上把本地挑战式误差相对官方默认峰值拾取降低约 66%,主要收益来自计数误差下降而衰减与增益仍是最大残差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9465 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

稀疏上下文下房间脉冲响应为何只能生成分布:FLAC 的多模态流匹配做法

针对新房间仅给 1 至 8 条脉冲响应、深度与位姿时确定性方法无法表达声学不确定性的问题,FLAC 用潜空间流匹配加扩散变换器生成合理脉冲响应分布,并在 AcousticRooms 未见房间与真实 HAA 上以单样本超越 8 样本基线,但分布真实性与单步推理之间仍需权衡。

 · 更新于 2026-09-24 · 约 21 分钟 · 10102 字 阅读 →
论文解读

把镜像计数折成格点体积:高维房间脉冲响应的几何卷积加速

针对矩形房间镜像声源数量随维度指数增长的问题,论文把距离计数归约为高斯圆格点计数并用几何卷积逐维递推,在整数坐标与全向反射等限定下把复杂度降为随维度线性的拟线性量级,代价是丢失方向性并需用缩放与插值补偿小距离误差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9669 字 阅读 →
论文解读

用可微反馈延迟网络拟合实测房间脉冲响应:共享原型均衡如何省参数

该文把 16 通道反馈延迟网络做成端到端可微并用梯度下降拟合实测房间脉冲响应,在 9 个房间上以更少参数和更快训练达到更低混响时间误差,但训练延迟线可能引入可闻染色。

 · 更新于 2026-09-24 · 约 21 分钟 · 10125 字 阅读 →
论文解读

盲房间脉冲响应生成:用十指标框架看清滤波器与损失谁更有效

该研究针对盲房间脉冲响应生成评价分散、基线难复现的问题,在 11500 条房间脉冲响应的统一条件下对比滤波器组改进与多分辨率短时傅里叶变换加能量衰减浮雕联合损失改进,报告损失改进带来 41% 多分辨率短时傅里叶变换损失下降与 25% 峰相似度提升,但高频与低频最优窗口不同且固定 1 秒单通道仍是边界。

 · 更新于 2026-09-24 · 约 16 分钟 · 7673 字 阅读 →
论文解读

多声源共享房间参数时:频谱变准了,混响尾巴为何更难对齐

该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8644 字 阅读 →
论文解读

缺测房间脉冲响应还能做波束形成吗:扩散修复补齐阵列的可用性检验

该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

把带宽压到低频孤立共振:多分辨率谱图加相位估计板混响参数

该工作把板混响脉冲响应转为降采样后的多分辨率幅度谱加相位通道并用改造残差网络回归物理参数,在 5000 条验证集上报告平均归一化均方误差为 0.02920,代价是主动舍弃高频段并依赖仿真条件。

 · 更新于 2026-09-24 · 约 20 分钟 · 9880 字 阅读 →
论文解读

先对准频率再抠位置:ALAMODE 用三阶段差分进化反演平板混响参数

针对给定目标脉冲响应反推虚拟平板混响器六维物理与空间参数的问题,ALAMODE 用无梯度差分进化分三阶段依次锁定频率、位置与整体能量参数,在 128 条合成与 16 条挑战数据上实现高谱重合,但第三阶段质量密度精度与仿真速度仍受限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

数模态个数再估计参数:计数密度网络如何把板混响脉冲变成模态三元组

任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9053 字 阅读 →
论文解读

把板式混响学成可读模态:对角复数状态空间与矩阵铅笔初始化

该工作把受限对角复数状态空间等价为并联二阶全极点模态滤波器组,并在 DAFx 板式混响基准上用矩阵铅笔引导的特征值初始化拟合脉冲响应,报告显示合成误差与频率和衰减辨识优于常用初始化,但增益匹配仍存在离群与正则化代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9763 字 阅读 →
论文解读

不做梯度迭代:用矩阵铅笔定极点、最小二乘定增益恢复平板混响模态

该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。

 · 更新于 2026-09-24 · 约 22 分钟 · 10875 字 阅读 →