在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍
GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …
GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …
该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。
针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。
SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。
音乐理解 | 6.8/10
语音合成 | 7.0/10
音视频交互 | 6.9/10
语音合成 | 7.9/10
音乐生成 | 5.0/10
音视频生成 | 7.7/10
语音识别 | 7.3/10
音频生成 | 8.2/10
语音合成 | 7.7/10
语音合成 | 6.5/10
音频生成 | 6.5/10
语音合成 | 6.4/10
语音合成 | 7.0/10
音乐生成 | 6.3/10