论文解读

不做频谱,直接读波形:用 CNN-GRU 从板混响脉冲响应反推六个可辨识物理参数

针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7913 字 阅读 →
论文解读

不做梯度迭代:用矩阵铅笔定极点、最小二乘定增益恢复平板混响模态

该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。

 · 更新于 2026-09-24 · 约 22 分钟 · 10875 字 阅读 →
论文解读

看得见的峰才计数:峰残差估计把频率支撑、校准与高频补数分开处理

该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。

 · 更新于 2026-09-24 · 约 16 分钟 · 7989 字 阅读 →
论文解读

不靠模态先验,把波形表征和可算特征拼起来反推薄板参数

针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。

 · 更新于 2026-09-24 · 约 17 分钟 · 8476 字 阅读 →
论文解读

把拾音位置选择推迟到混音阶段:64 通道分弦多点吉他拾音系统

针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

把中间表示留下来:离线可编辑的分析对象如何成为作曲控制器

该演示用同一录音走完七条离线分析—表示—渲染链,把音高轮廓、切分表与轨迹等中间物变成可检查的作曲控制器,代价是放弃实时并依赖预渲染与人工核对。

 · 更新于 2026-09-24 · 约 24 分钟 · 11789 字 阅读 →
论文解读

脉冲宽度不变而音高可变:脉冲表如何合成管乐音色

该文以脉冲成形原理重访脉冲表合成,用按基频索引的单周期脉冲加时变低通、成形噪声与混响生成铜管音色,并以小号三八度与起振微调制案例说明表情来自三条控制曲线的联动,代价是脉冲与轮廓仍难从混响录音中稳健自动提取。

 · 更新于 2026-09-24 · 约 21 分钟 · 10417 字 阅读 →
论文解读

从一条脉冲响应反推钢板参数:用仿真样本直接学后验分布

该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9520 字 阅读 →
论文解读

一次仿真、一次回归:用 372 维描述子把单条板混响脉冲反推回六个物理参数

该文针对单条未归一化板混响脉冲反推六维物理与观测参数的问题,用离线仿真训练的归一化树集成一次回归代替逐条迭代优化,在两组仿真验证集上把归一化均方误差降到约 0.012 并把默认粒子群的估计时间从 2252.59 秒降到 10.75 秒,代价是只给点估计且参数精度只在仿真匹配分布下成立。

 · 更新于 2026-09-24 · 约 20 分钟 · 9906 字 阅读 →
论文解读

先猜五维再对波形:可微合成与粒子群如何把板混响参数推到近乎完全恢复

任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

当嵌入模型说变好了而听众说没有:VoiceFX 的补救与验证落差

该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。

 · 更新于 2026-09-24 · 约 18 分钟 · 8587 字 阅读 →
论文解读

九成权重归零仍能弹:稀疏 WaveNet 音箱如何挤进 iPhone 中央处理器

该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →