论文解读

归一化丢掉响度线索:两阶段进化搜索先定形状再找回面密度

从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。

 · 更新于 2026-09-24 · 约 21 分钟 · 10419 字 阅读 →
论文解读

不用调音台,只看参考录音:笔记本如何告诉吉他手该调大还是调小

针对没有调音师的小场地演出调音问题,SoLAR 用参考录音学理想混音并给出吉他音量建议,仿真显示硬编码策略能把增益误差收敛到参考附近,代价是仅验证了吉他音量且现场只做了两人试用。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
论文解读

把音色拆成泛音再拼回去:用四件中国乐器做可玩的视听合成器

该研究用古筝、二胡、唢呐、堂鼓四种乐器的自录样本做前 8 个泛音的分轨重组与心电驱动的视听交互,在百余人次的非正式展览观察中看到熟悉又陌生的文化联想,代价是只有定性观察而无可控评估与生理推断力。

 · 更新于 2026-09-24 · 约 20 分钟 · 9944 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

肺音没有干净配对时如何去噪:复数时频 U-Net 的分层合成与相位重建路线

该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8357 字 阅读 →
论文解读

帧长跟着声门走:用基音周期对齐傅里叶分析的动态帧谱特征

针对固定帧与浊音基音周期非整数比造成频谱失真的问题,该文用声门闭合时刻定帧界并重采样到统一时频网格,在 TIMIT 音素分类上以 6 ms 表观支撑达到 47.3% 准确率,超过 24 ms 固定帧的 46.8%,代价是依赖 GCI 估计与二维插值且未建模上下文。

 · 更新于 2026-09-24 · 约 18 分钟 · 8640 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把采样率换掉而不重训:固定时长帧上的傅里叶神经算子如何做虚拟模拟

论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8974 字 阅读 →
论文解读

不用改 vocoder 结构,只换条件特征:群延迟乘积谱能否替代梅尔谱

该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。

 · 更新于 2026-09-24 · 约 16 分钟 · 7539 字 阅读 →
论文解读

盲房间脉冲响应生成:用十指标框架看清滤波器与损失谁更有效

该研究针对盲房间脉冲响应生成评价分散、基线难复现的问题,在 11500 条房间脉冲响应的统一条件下对比滤波器组改进与多分辨率短时傅里叶变换加能量衰减浮雕联合损失改进,报告损失改进带来 41% 多分辨率短时傅里叶变换损失下降与 25% 峰相似度提升,但高频与低频最优窗口不同且固定 1 秒单通道仍是边界。

 · 更新于 2026-09-24 · 约 16 分钟 · 7673 字 阅读 →
论文解读

欠定下不失真分离:把时频掩蔽写进切换波束形成器的代价函数

针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。

 · 更新于 2026-09-24 · 约 18 分钟 · 8733 字 阅读 →
论文解读

麦克风很少、鸟声很多时:用子带频谱特征把时延分给各自声源

针对有限单通道记录单元下多声源到达时差关联模糊问题,论文提出按子带估计多候选时差再用频谱特征向量分组、分解为多个单声源定位,在 3 到 6 个麦克风与 2 到 8 个声源仿真中报告漏检随麦克风增加而下降、定位误差多保持在 1 米以内,但高噪声多源下漏检仍高达 40% 左右。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

伪造痕迹不在整段语音里,而在背景、低频与混响中:音频深伪检测的成分拆解

该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。

 · 更新于 2026-09-24 · 约 14 分钟 · 6950 字 阅读 →
论文解读

把和声距离写进傅里叶权重:对齐与插值音高分布的可逆工具箱

论文把色度向量上的调性区间向量改写为可逆算子,用感知加权置换做对齐、用四五度圈上的循环最优传输做插值,并以圆柱几何分解音阶的根音、密度与色彩,代价是平滑表示不再保证非负且最优传输仍要求非负输入。

 · 更新于 2026-09-24 · 约 19 分钟 · 9179 字 阅读 →
论文解读

只用单阵列相位谱估计说话人朝向:混响为何反而有帮助

该工作用短时傅里叶变换相位的正弦余弦作输入,结合卷积、双向门控循环和自注意力估计 0-360 度方位角,在仿真混响干净条件下平均角度误差 19.9 度、个性化到说话人与房间后降到 11.3 度,代价是仍需仿真预训练和少量目标域微调才能泛化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8677 字 阅读 →
论文解读

双耳定位先选对时频特征:两特征够用域内,多样内容才需通道谱加双耳线索

该研究用同一卷积神经网络比较幅度与相位四类时频特征的全部小组合,报告显示域内语音用 ILD 加 IPD 在 0 度仰角达 4.5 度误差,而跨内容泛化需通道相位谱加 ILD 与 IPD 并在域外以 8.4 度误差超过更大 Transformer,代价是特征通道增多与对纯音等结构贫乏信号仍失效。

 · 更新于 2026-09-24 · 约 17 分钟 · 8408 字 阅读 →
论文解读

把超声切面当乐谱:可触摸的明胶幻影如何决定声音

该研究把便携超声探头扫查手工食物明胶幻影得到的深度密度图像,经取样线重采样后送入逆傅里叶变换合成声音,探头推滑按压与材料雕刻共同作曲,代价是频率分辨率粗糙、低频表现弱且模具精度不可控。

 · 更新于 2026-09-24 · 约 25 分钟 · 12086 字 阅读 →
论文解读

不用卷积长脉冲:以噪声载波重塑频域混响尾巴

FDverb 针对物理混响尾部随机化问题,用短时傅里叶变换加逐频包络跟踪去调制谱噪声,并以稀疏时域早期反射补齐前段,再用非线性包络与音高偏移扩展声音设计,代价是分块算法延迟与大块时间涂抹,且本文只报告实现开销而未做听感对照实验。

 · 更新于 2026-09-24 · 约 23 分钟 · 11066 字 阅读 →
论文解读

把带宽压到低频孤立共振:多分辨率谱图加相位估计板混响参数

该工作把板混响脉冲响应转为降采样后的多分辨率幅度谱加相位通道并用改造残差网络回归物理参数,在 5000 条验证集上报告平均归一化均方误差为 0.02920,代价是主动舍弃高频段并依赖仿真条件。

 · 更新于 2026-09-24 · 约 20 分钟 · 9880 字 阅读 →
论文解读

把拼接输出写进卷积核:单引擎如何在连续换混响时保住能量

针对卷积混响只能静态切换脉冲响应的限制,该文把语料拼接合成的输出直接作为时变卷积核,并用单引擎频域核插值保留卷积状态,在持续插值下报告更低的每块耗时与更平稳的响度,代价是近反相频点仍存在线性混合固有的相位抵消且缺乏感知听音验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10326 字 阅读 →