论文解读

移动声源下镜像源如何配对:用部分最优传输做房间冲激响应插值

针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10792 字 阅读 →
论文解读

声源移动后镜像全变:用位移不变代价求最优传输重心

针对从已知声源镜像源点云插值新声源点云的问题,该文用物理位移等于镜像位移的不变性构造最优传输地面代价并求重心,交替估计关联与位置,在 3×4 米二维二阶反射仿真和 400 次蒙特卡洛下 One-PC 初始化最优,但近墙密集混叠与大扰动下误差放大且无实测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8843 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

空间聆听作为方法:从听觉定位到生态与参与式声音实践

该文把空间聆听界定为连接听觉生理、现象学与社会政治的具身关系实践,以三件作者作品为线索串联理论,最强证据是文献与创作过程的对应说明,代价是未提供可重复测量的实验数据与对照。

 · 更新于 2026-09-24 · 约 18 分钟 · 8794 字 阅读 →
论文解读

地图越精确,聆听越缺席:空间音频为何重复作曲家—总谱—指挥家模型

本文用批判系谱学追溯从立体声到 MPEG-I 的六种空间音频表示,指出它们都把空间压缩为可预先书写的坐标图并交由系统忠实再现,其代价是把具身的、关系的聆听经验排除在外,而关系性渲染所需的许多技术能力其实已经存在。

 · 更新于 2026-09-24 · 约 24 分钟 · 11737 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

稀疏上下文下房间脉冲响应为何只能生成分布:FLAC 的多模态流匹配做法

针对新房间仅给 1 至 8 条脉冲响应、深度与位姿时确定性方法无法表达声学不确定性的问题,FLAC 用潜空间流匹配加扩散变换器生成合理脉冲响应分布,并在 AcousticRooms 未见房间与真实 HAA 上以单样本超越 8 样本基线,但分布真实性与单步推理之间仍需权衡。

 · 更新于 2026-09-24 · 约 21 分钟 · 10102 字 阅读 →
论文解读

用可微反馈延迟网络拟合实测房间脉冲响应:共享原型均衡如何省参数

该文把 16 通道反馈延迟网络做成端到端可微并用梯度下降拟合实测房间脉冲响应,在 9 个房间上以更少参数和更快训练达到更低混响时间误差,但训练延迟线可能引入可闻染色。

 · 更新于 2026-09-24 · 约 21 分钟 · 10125 字 阅读 →
论文解读

要在全频段共用同一批传声器:联合稀疏 OLS 如何挑位置又保波束

问题是在宽带频率不变波束成形中用最少且全频段共用的传声器逼近期望波束,方法是将 OLS 改为联合稀疏逐个选点并加掩蔽与递归实现,最强证据是同心圆阵上 41 个点的 OLS 与 OMP 布局相近且主瓣内近似频率不变,代价是本文只给图示而未报告白噪声增益与指向性的定量数值表。

 · 更新于 2026-09-24 · 约 20 分钟 · 9847 字 阅读 →
论文解读

边界决定音高:从矩形板到克莱因瓶的模态推导与混响合成

论文以二维波方程与商空间拼贴推导矩形、环面、莫比乌斯带、克莱因瓶与实射影平面的闭式模态,并用有限差分时域仿真验证频率误差约 0.02% 量级、模态置信接近 1,代价是不可嵌入三维的非定向拓扑只能在平面基本域加边界规则中间接实现。

 · 更新于 2026-09-24 · 约 18 分钟 · 9006 字 阅读 →
论文解读

推理时才给方向图:同一网络如何装下多种指向性

针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。

 · 更新于 2026-09-24 · 约 16 分钟 · 7656 字 阅读 →
论文解读

把听觉模型变成可微损失:同一套梯度优化重做声像与甜点

论文提出 POLAR 框架,把扬声器滤波器、自由场传播与可微听觉损失连成端到端链路,用梯度下降复现了幅度声像、串扰消除与波束展宽甜点的已知解,并展示定位、不确定度与音染可加权折中,但多属性部分仍是模型自评、权重靠试错且未经正式听音验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10116 字 阅读 →
论文解读

骑行发声:在城市里移动演奏如何同时触及个人、群体与环境

论文用四辆联网电动货运自行车组成可移动演奏系统,在亚特兰大 11 km 群骑中验证个人聆听、共在群体与城市环境三种声音互动尺度的切换,代价是无定量声学测量、依赖社区领骑保障安全且重型硬件仍需迭代。

 · 更新于 2026-09-24 · 约 19 分钟 · 9267 字 阅读 →
论文解读

不重建整张网格:用分支-主干算子在连续房间空间中查询声场幅值

该文把声场重建写成从稀疏测点集合到任意查询点幅值的算子学习,用分支网编码麦克风坐标与幅值、主干网编码查询坐标并以交叉注意力聚合,在 32×32 训练网格上训练后可直接查询 64×64 细网格,并在 64 或 128 个测点时报告优于扩散基线,代价是 256 个测点时基线反超且本文只重建幅值不重建相位。

 · 更新于 2026-09-24 · 约 16 分钟 · 7766 字 阅读 →
论文解读

不用对钟也能合奏:用空间排布与关系感知组织声音群体

论文把作曲从指定事件改为设定条件,用三层架构与成对射频加声学校准推断相对拓扑来参数化局部耦合,合成验证显示双模态距离误差降到 10.03 cm 左右而位置误差方差仍大,代价是真实房间性能尚未验证。

 · 更新于 2026-09-24 · 约 23 分钟 · 11460 字 阅读 →
论文解读

个体化 HRTF 为何不只改变定位准确率而是改变定向动作的发起时机

在听觉引导视觉搜索任务中比较个体化与 KEMAR 非个体化 HRTF 在消声与混响下的行为,证据显示消声下个体化使反应时平均缩短约 200 ms 且优势集中于动作发起而非总运动量,混响下优势消失。

 · 更新于 2026-09-24 · 约 23 分钟 · 11134 字 阅读 →
论文解读

同一组滤波器又要抵消又要透明:方向条件网络如何做保向降噪

针对传统降噪不分期望声与噪声一起压制的问题,该文把保向降噪写成降噪项与保持项加权优化,用方向调制的卷积网络从混合参考一次估计多通道 FIR 滤波器组,在 3300 个仿真场景以 22.8 dB 降噪和 -11.4 dB 期望失真取得折中,代价是近方向受阵列可分性限制且需按几何重训。

 · 更新于 2026-09-24 · 约 16 分钟 · 7876 字 阅读 →