不做频谱,直接读波形:用 CNN-GRU 从板混响脉冲响应反推六个可辨识物理参数
针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …
针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …
该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。
该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。
针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。
针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。
该演示用同一录音走完七条离线分析—表示—渲染链,把音高轮廓、切分表与轨迹等中间物变成可检查的作曲控制器,代价是放弃实时并依赖预渲染与人工核对。
该文以脉冲成形原理重访脉冲表合成,用按基频索引的单周期脉冲加时变低通、成形噪声与混响生成铜管音色,并以小号三八度与起振微调制案例说明表情来自三条控制曲线的联动,代价是脉冲与轮廓仍难从混响录音中稳健自动提取。
该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。
该文针对单条未归一化板混响脉冲反推六维物理与观测参数的问题,用离线仿真训练的归一化树集成一次回归代替逐条迭代优化,在两组仿真验证集上把归一化均方误差降到约 0.012 并把默认粒子群的估计时间从 2252.59 秒降到 10.75 秒,代价是只给点估计且参数精度只在仿真匹配分布下成立。
任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。
该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。
该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。