论文解读
压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐
针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。
针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。
针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。
语音编码 | 8.3/10
语音编码 | 6.3/10
语音编码 | 5.5/10
语音伪造检测 | 6.5/10
音频水印 | 6.4/10
语音编码 | 6.0/10
语音编码 | 4.7/10
语音编码 | 7.1/10
语音编码 | 7.7/10
语音编码 | 8.1/10
语音质量评估 | 6.0/10
语音合成 | 5.8/10
语音编码 | 9.2/10
语音合成 | 5.3/10
语音合成 | 7.5/10
说话人验证 | 5.2/10