不改模型也能治啸叫:用啸叫与降噪混合数据微调语音增强网络
该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。
该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。
针对单通道语音增强中幅度与相位分工不同的问题,论文把实数分支的幅度掩蔽与复数分支的加性复数修正并联并在瓶颈处交换信息,在参数量对齐的卷积去噪自编码器与卷积循环网络上以短时客观可懂度、语音质量感知评估和尺度不变信号失真比为指标验证,并在乘加操作数上付出更少计算代价。
问题是在宽带频率不变波束成形中用最少且全频段共用的传声器逼近期望波束,方法是将 OLS 改为联合稀疏逐个选点并加掩蔽与递归实现,最强证据是同心圆阵上 41 个点的 OLS 与 OMP 布局相近且主瓣内近似频率不变,代价是本文只给图示而未报告白噪声增益与指向性的定量数值表。
针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。
该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。
针对混响噪声下有多个间歇强干扰时的多通道语音增强问题,论文用黎曼平均的首席特征向量抗干扰、再向样本相关矩阵的子空间投影来抑制噪声,并以 MVDR 波束形成器验证,在所报告的 SIR、SNR、混响和阵元数条件下取得更低的 NMSE 与更高的 PESQ 和 STOI,但低维投影阈值选择与高 SIR 下黎曼分支的退化仍是代价与边界。
针对噪声加混响同时存在的语音与音乐恢复问题,论文把多麦克风观测的最小二乘数据保真项与正则项组成反问题并用前向后向算法展开为 10 层网络,在已知或估计房间冲激响应与噪声标准差的条件下,LibriSpeech 上多麦克风展开结构取得最好客观与主观指标,代价是依赖房间与噪声先验且去混响层数与去噪器规模不可过小。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对人听希望去噪干净而识别前端怕语音失真的问题,论文用源条件与额外标记两类提示扩展统一分离模型并按提示切换标准损失与正则损失,英日噪声实验显示识别分支降低了词错误率与字错误率而高质量分支保持了重建质量,代价是识别分支牺牲客观质量且仍未超过推理期混合基线。
该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。
针对严重噪声下生成式增强容易编造内容与音色的问题,PASE 把预训练 WavLM 蒸馏成去噪专家并用高低层双流重建波形,在自建 LibriTTS 低信噪比集上把内容错误压到更低,同时以双流声学条件把说话人相似度拉回可用水平,代价是浅层声学流会带入残留噪声并拉低部分感知分。
该文把配对干净与带噪语音之间的流匹配与扩散桥统一为均值方差不同的高斯概率路径,论证数据预测训练下每步采样等价于预测式增强,并用时频主干与改进损失在更少参数和更少步数下超过已有生成式基线,但提升上限仍受预测本质约束。
针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。
论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。
该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。