时变全通滤波器为何会削波:把系数增量关进阈值笼子
针对一阶与二阶时变全通滤波器在系数快速变化时输出超过限幅阈值的问题,论文用静态对照输出加系数增量界把输出约束在阈值内,正弦与音乐片段实验显示其在标准结构和能量保持结构各自削波的方向上均不削波,代价是短暂偏离目标系数轨迹并引入少量逐样本判断与除法运算。
针对一阶与二阶时变全通滤波器在系数快速变化时输出超过限幅阈值的问题,论文用静态对照输出加系数增量界把输出约束在阈值内,正弦与音乐片段实验显示其在标准结构和能量保持结构各自削波的方向上均不削波,代价是短暂偏离目标系数轨迹并引入少量逐样本判断与除法运算。
该文在波数字滤波器框架下用神经网络显式逼近四端口非线性散射映射,对比多层感知机与柯尔莫哥洛夫-阿诺德网络,发现 KAN 以 40 对 148 个参数达到相近时域频域精度,但实时率从 1.31 升至 4.74。
该文把约 1500 条房间脉冲响应的模态分解结果压缩成每频带阻尼与密度回归、等分能量幅度与明晰度恒等式,用六个感知控制生成数千个二阶共振器参数,阻尼鲁棒决定系数达 0.75 至 0.94 而两端频带密度仅约 0.5。
论文把自适应房间均衡做成闭环可微分控制,用 7 段参量均衡加频域误差在实测时变房间脉冲响应和音乐激励下跟踪目标响应,最强证据是频域目标相对未均衡把系统距离压低约 7 成而时域误差全配置不收敛,代价是对在线房间估计质量敏感且高阶优化器单帧耗时接近帧长。
针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。
论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。
从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。
论文把多乐器音乐合成的注意力扩散模型改造为语音与歌声转换,用音素后验、基频与演唱者嵌入做条件,在自然度与演唱者相似度上追平专用转换模型,但音素保真下降且加入器乐数据会拉低人声质量。
针对硬同步直接重置相位会产生不连续和高频混叠的问题,论文用有限傅里叶系数经线性频谱重采样再做加法合成实现带限同步,并以 96 kHz 单音色 ASIC 在约 5 个音频采样内完成变换为代价换取实时性。
针对听音房间混响破坏高阶 Ambisonics 解码方向感的问题,作者把常规解码级联一个由闭合球面控制点房间脉冲响应求逆得到的串扰矩阵,在 26 扬声器仿真房间中使同通道能量在 500 Hz 到 4 kHz 高出约 10 dB,代价是依赖已知房间脉冲响应与高频预处理且频带外仍有串扰。
该文把多边形合成改写为等弧长遍历外部顶点缓冲的二维振荡器,用混合插值实现不等顶点数形变、用旋转多面体水平截面扩展到三维,并以四点 polyBLAMP 加自适应过采样压制混叠,最强证据是 M=5 四形状共享谐波格而格外成分低于分析底噪,代价是几何缓存、成对齐与交叉淡化的额外管理。
论文用暖初始化把预训练音频扩散模型的逆向过程从引导信号中途启动,以双簧管转钢琴等实验研究初始化时间与噪声比例的取舍,报告在杰卡德距离低于 0.6 且弗雷歇音频距离低于 0.7 附近存在可用工作点,代价是对人声与强打击乐等成分处理不稳定且依赖高引导强度等超参数。
针对板混响脉冲响应中弱模态与重叠模态难以直接检出的问题,该研究先用回归器预测四个频带的模态数量以确定稠密网格基数,再固定频率对衰减与增益做有界可微校准,在两个仿真验证集上把本地挑战式误差相对官方默认峰值拾取降低约 66%,主要收益来自计数误差下降而衰减与增益仍是最大残差。
该工作在骁龙开发板上实测五种神经音频模型的中央处理器与集成图形处理器推理,问题是流式回调期限下集成显卡何时有效,选择是统一用高通推理栈对比最优中央处理器引擎,最强证据是二维卷积声码器在最小块上图形处理器已全面领先,主要代价是小模型与循环模型的调用开销反而拖慢并需要借用大缓冲换并行。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对可调旋钮的黑盒虚拟模拟在旋钮转动时出现噪声的问题,论文用深层拼接条件 LSTM 加谱范数或无穷范数正则与 32 通道 Gammatone 滤波损失,在三块效果器数据上把正则模型的精度追近无正则基线,同时把零输入下的控制噪声压到实用底噪以下,但同等规模下正则仍有小幅精度代价。
论文把 sygyt 双声复制写成从录音反推声道形状的可微优化问题,用带舌下第二声源和 B 样条声道的 Kelly-Lochbaum 波导在 20 段录音上把对数谱距离相对基线降低 30-38%,代价是每段仍需约 30 分钟离线优化且绝对误差仍在 9 分贝量级。
针对和声乐器混合难以分声部精确编辑的问题,该演示系统用乐谱对齐加可微混合合成器做分析合成,再用合成参数域扩散模型约束参数轨迹,在双长笛混合上展示单声部乐器转换与乐句改写的定性例子,但未报告定量指标与可运行代码。
论文把小提琴琴桥导纳看作有限维线性系统,用特征系统实现算法从实测脉冲响应直接做汉克尔矩阵奇异值分解得到降阶状态空间,并在六把小提琴上以时域频域与能量衰减三类误差对比两版模态拟合基线,代价是高阶近似与尚无听感实验。
针对和弦标注稀缺与分布不平衡问题,该工作先用预训练 BTC 教师在 1000 多小时无标注音频上生成伪标签训练学生,再用少量真值标签加选择性知识蒸馏做数据增量持续训练,最强 BTC 学生在七个 mir_eval 指标上超过教师与监督基线,代价是依赖教师质量并需保存完整软目标带来额外显存开销。