论文解读
生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开
DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。
DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。
针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。
针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。
语音增强 | 6.3/10
语音识别 | 5.8/10
语音增强 | 7.5/10
语音增强 | 6.4/10
语音增强 | 6.4/10
语音增强 | 6.2/10
语音增强 | 8.0/10
语音增强 | 6.4/10
语音增强 | 6.7/10
语音增强 | 7.5/10
空间音频 | 5.3/10
音频修复 | 10.0/10
语音增强 | 7.6/10
语音增强 | 9.0/10
语音增强 | 8.3/10
语音增强 | 5.6/10
语音增强 | 5.5/10