不用判别器猜分数:并行建模谐波与可微感知损失如何分工
针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。
针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。
共分析 26 篇语音/AI 论文
针对旋转机械主导的低信噪比谐波噪声,该文用单通道循环平稳最小功率无失真响应做前端抑制谐波再接轻量掩蔽网络,在合成与真实发动机噪声上报告了一致提升,但维纳滤波对照显示增益互补而非可替代,且依赖噪声频率稳定可估计。
针对增强现实眼镜耳处无误差麦克风导致无法直接做有源噪声控制的问题,论文验证辅助滤波器虚拟传感的必要性并推导其方向敏感性,用自由场仿真显示固定滤波器在方向失配时退化,而按声源方向从有限滤波器库中选择可在因果区内部分恢复性能,但仍不及逐方向重标定。
该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对单通道语音增强中幅度与相位分工不同的问题,论文把实数分支的幅度掩蔽与复数分支的加性复数修正并联并在瓶颈处交换信息,在参数量对齐的卷积去噪自编码器与卷积循环网络上以短时客观可懂度、语音质量感知评估和尺度不变信号失真比为指标验证,并在乘加操作数上付出更少计算代价。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
该文把单通道分离写成已知加性混合的逆问题,只用单源扩散先验加迭代重建引导完成分离,并用混合加噪初始化、三重注意力骨干与混合引导强度解决梯度冲突,代价是 200 步迭代采样的计算开销与同质语音的排列不确定性。
针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。
针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …
说话人分离 | 7.0/10