论文解读
并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码
PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。
PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
音乐源分离 | 5.3/10
空间音频 | 5.3/10
空间音频 | 7.6/10
音乐生成 | 5.0/10
语音编码 | 8.1/10
音频超分辨 | 8.2/10
语音合成 | 7.1/10
音频伪造检测 | 6.1/10
语音增强 | 7.1/10
语音识别 | 7.5/10
语音合成 | 7.5/10
生成对抗网络 | 8/10
生成对抗网络 | 7.2/10
语音合成 | 7.4/10
语音转换 | 6.1/10
语音增强 | 7.1/10
音频生成 | 8.7/10
鲁棒性 | 7.1/10