归一化丢掉响度线索:两阶段进化搜索先定形状再找回面密度
从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。
从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。
针对没有调音师的小场地演出调音问题,SoLAR 用参考录音学理想混音并给出吉他音量建议,仿真显示硬编码策略能把增益误差收敛到参考附近,代价是仅验证了吉他音量且现场只做了两人试用。
该研究用古筝、二胡、唢呐、堂鼓四种乐器的自录样本做前 8 个泛音的分轨重组与心电驱动的视听交互,在百余人次的非正式展览观察中看到熟悉又陌生的文化联想,代价是只有定性观察而无可控评估与生理推断力。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。
针对固定帧与浊音基音周期非整数比造成频谱失真的问题,该文用声门闭合时刻定帧界并重采样到统一时频网格,在 TIMIT 音素分类上以 6 ms 表观支撑达到 47.3% 准确率,超过 24 ms 固定帧的 46.8%,代价是依赖 GCI 估计与二维插值且未建模上下文。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
该研究针对盲房间脉冲响应生成评价分散、基线难复现的问题,在 11500 条房间脉冲响应的统一条件下对比滤波器组改进与多分辨率短时傅里叶变换加能量衰减浮雕联合损失改进,报告损失改进带来 41% 多分辨率短时傅里叶变换损失下降与 25% 峰相似度提升,但高频与低频最优窗口不同且固定 1 秒单通道仍是边界。
针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。
针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。
该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。
论文把色度向量上的调性区间向量改写为可逆算子,用感知加权置换做对齐、用四五度圈上的循环最优传输做插值,并以圆柱几何分解音阶的根音、密度与色彩,代价是平滑表示不再保证非负且最优传输仍要求非负输入。
该工作用短时傅里叶变换相位的正弦余弦作输入,结合卷积、双向门控循环和自注意力估计 0-360 度方位角,在仿真混响干净条件下平均角度误差 19.9 度、个性化到说话人与房间后降到 11.3 度,代价是仍需仿真预训练和少量目标域微调才能泛化。
该研究用同一卷积神经网络比较幅度与相位四类时频特征的全部小组合,报告显示域内语音用 ILD 加 IPD 在 0 度仰角达 4.5 度误差,而跨内容泛化需通道相位谱加 ILD 与 IPD 并在域外以 8.4 度误差超过更大 Transformer,代价是特征通道增多与对纯音等结构贫乏信号仍失效。
该研究把便携超声探头扫查手工食物明胶幻影得到的深度密度图像,经取样线重采样后送入逆傅里叶变换合成声音,探头推滑按压与材料雕刻共同作曲,代价是频率分辨率粗糙、低频表现弱且模具精度不可控。
FDverb 针对物理混响尾部随机化问题,用短时傅里叶变换加逐频包络跟踪去调制谱噪声,并以稀疏时域早期反射补齐前段,再用非线性包络与音高偏移扩展声音设计,代价是分块算法延迟与大块时间涂抹,且本文只报告实现开销而未做听感对照实验。
该工作把板混响脉冲响应转为降采样后的多分辨率幅度谱加相位通道并用改造残差网络回归物理参数,在 5000 条验证集上报告平均归一化均方误差为 0.02920,代价是主动舍弃高频段并依赖仿真条件。
针对卷积混响只能静态切换脉冲响应的限制,该文把语料拼接合成的输出直接作为时变卷积核,并用单引擎频域核插值保留卷积状态,在持续插值下报告更低的每块耗时与更平稳的响度,代价是近反相频点仍存在线性混合固有的相位抵消且缺乏感知听音验证。