论文解读
连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
语音识别 | 6.8/10
语音识别 | 7.4/10
音乐转录 | 8.2/10
语音识别 | 7.2/10
音乐生成 | 7.9/10
语音增强 | 6.7/10
回声消除 | 8.5/10
音频分类 | 7.2/10
声源定位 | 8.8/10
声源定位 | 9.8/10
回声消除 | 7.2/10
音频分类 | 10.0/10
音视频理解 | 9.0/10
语音增强 | 7.6/10
音频事件检测 | 8.5/10
语音识别 | 9.0/10
语音交互 | 9.4/10
助听器 | 6.2/10