论文解读

在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍

GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10716 字 阅读 →
论文解读

以不完美证据约束自回归生成:码空间接地与局部精修如何兼顾忠实与自然

该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐

针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10695 字 阅读 →
论文解读

在连续隐空间里一次生成一小段:SCAPES 如何用语义嵌入控制环境声纹理

SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。

 · 更新于 2026-09-24 · 约 20 分钟 · 9749 字 阅读 →
论文解读

连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价

论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →
论文解读

把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划

音乐理解 | 6.8/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10255 字 阅读 →
论文解读

从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12606 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4260 字 阅读 →
论文解读

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP

音乐生成 | 5.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6931 字 阅读 →
论文解读

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6701 字 阅读 →
论文解读

Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6965 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5681 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6892 字 阅读 →
论文解读

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

音频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8964 字 阅读 →
论文解读

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

语音合成 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7332 字 阅读 →
论文解读

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
论文解读

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

音乐生成 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11885 字 阅读 →