把去噪和去混响写进同一优化展开:多麦克风前向后向网络如何同时用上房间模型与学习先验
针对噪声加混响同时存在的语音与音乐恢复问题,论文把多麦克风观测的最小二乘数据保真项与正则项组成反问题并用前向后向算法展开为 10 层网络,在已知或估计房间冲激响应与噪声标准差的条件下,LibriSpeech 上多麦克风展开结构取得最好客观与主观指标,代价是依赖房间与噪声先验且去混响层数与去噪器规模不可过小。
针对噪声加混响同时存在的语音与音乐恢复问题,论文把多麦克风观测的最小二乘数据保真项与正则项组成反问题并用前向后向算法展开为 10 层网络,在已知或估计房间冲激响应与噪声标准差的条件下,LibriSpeech 上多麦克风展开结构取得最好客观与主观指标,代价是依赖房间与噪声先验且去混响层数与去噪器规模不可过小。
针对乐器起振与调制在分析帧内非平稳的问题,该工作用分布导数法估计三阶多项式调幅调频正弦,在 39 个乐器声音上获得更高的信号残差比并在听感上接近原声,代价是峰选择不当仍是主要误差来源且频谱距离指标并不总是最优。
论文把增强边界从外部参数映射搬到电路内部的电压电流关系,用低延迟数字阻抗替换哇音谐振网络中的无源元件,在保留脚踏交互的同时展示了从近似仿真到失稳自激的可复现探索空间,但代价是高频不稳定与对延迟和拓扑的高度敏感。
针对无损完美循环压抑偶然与主动性的问题,Zen-PCB 用裸露印制电路板做皮肤与 5 行 3 列导电短接矩阵做输入,配合 16 颗粒 WSOLA 与处理后写回同一环形缓冲的破坏链路实现持续音蚀,最强证据是 15 人评价中享乐刺激达 0.98 而实用质量仅 0.55,代价是 22.05 千赫低保真与直觉优先于效率。
该演示用归一化距离参数同时驱动增益、混响比、高频吸收、预延迟和低频补偿五种线索并保持互洽,在 18 人耳机测试中把三声源距离摆放误差从手动混音的 15.3 点降到 7.3 点,代价是 48 kHz 下双耳级开启时 CPU 峰值约 10.5% 与固定 10.7 ms 分区延迟。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对给定目标脉冲响应反推虚拟平板混响器六维物理与空间参数的问题,ALAMODE 用无梯度差分进化分三阶段依次锁定频率、位置与整体能量参数,在 128 条合成与 16 条挑战数据上实现高谱重合,但第三阶段质量密度精度与仿真速度仍受限。
针对长条形隧道内接收位置连续变化时混响特征平滑过渡的问题,该演示用三位置实测脉冲响应构造 6300 个共享极点的模态合成引擎并做残差插值,时域归一化误差低于 3.5%,代价是仅覆盖纵轴一维移动且高频需外推补偿。
论文针对可微音频模型难以自动部署为实时效果器的问题,选择以框架无关的 JSON 中间表示解耦提取与发射,用反馈延迟网络验证脉冲响应一致到单精度噪声级,代价是目前仅在整数延迟线性时不变设定下给出等价与稳定性保证。
该工作把受限对角复数状态空间等价为并联二阶全极点模态滤波器组,并在 DAFx 板式混响基准上用矩阵铅笔引导的特征值初始化拟合脉冲响应,报告显示合成误差与频率和衰减辨识优于常用初始化,但增益匹配仍存在离群与正则化代价。
该文用 M 个 2×2 旋转或反射核的递归克罗内克积构造 2^M 维正交反馈矩阵,以 O(N log2 N) 就地迭代完成反馈运算,并用单个核角度连续控制立体声耦合、奇偶冻结与时变调制,代价是只覆盖正交矩阵的一个参数子空间且听感验证依赖示例音频。
该工作把反馈延迟网络拆成可替换模块并用图形界面直接优化真实网络,在 128 采样块下随通道数扩大仍快于基线且回声密度更快建立的证据下,代价是用有限差分代替可微分梯度并依赖手工设计的平坦度与衰减损失。
针对电子鼓多轨采样与录音的算力与成本问题,该工作用单块 Artix-7 实现 10 路鼓采样加 4 路外部输入、可变速率重采样、五种效果与以太网 16 轨录音,报告采样处理链约 1.33 ms 与 512 采样环形缓冲下无欠载过载,同时占用约一半逻辑资源并控制整机成本在 500 美元以下。
针对巨型傅里叶变换改相位会破坏频率间时间关系并把离散事件抹成持续纹理的问题,论文把相位转成群延迟做谱峰分割与整组均匀搬移,用合成与实录四音逆序、振幅比例展开与正弦调制复制证明离散包络可保留,代价是共享频点的重叠事件无法独立重排。
IRIS 把已测或自定义脉冲响应集合排成二维可导航平面,用高斯距离加权与最多 8 路有界卷积做实时试听,在 Apple M4 Pro 上 512 采样缓冲下 16 路 1 秒 IR 平均 2.87 毫秒等三组条件保持在 10.67 毫秒预算内,代价是只做简化时域混合而不保证物理最优与感知透明。
针对现场演出中传感器链路易失灵的问题,L-Bow 用腕戴六轴惯性单元加 Csound 原生 arduinoRead 直读串口,把采集、六种演奏模式与共享效果链收进单个.csd 文件,报告显示 20 次触发测试零误触发且平均延迟比 Python-OSC 桥低 22.5 ms,代价是 10 位量化和 9600 波特率下的分辨率与帧时间限制。
针对生成语音溯源需要的盲检测水印问题,论文选择在预训练编解码器隐空间做密钥控制的正交小旋转,最强证据是跨数据集干净条件下正确密钥可检而错误密钥回到随机猜测,主要代价是高通滤波下检测下降且仅做客观质量估计。
该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读