论文解读

压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐

针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10695 字 阅读 →
论文解读

连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价

论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8929 字 阅读 →
论文解读

并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码

PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。

 · 更新于 2026-09-25 · 约 19 分钟 · 9436 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-25 · 约 19 分钟 · 9429 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12427 字 阅读 →
论文解读

当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化

语音编码 | 6.3/10

 · 更新于 2026-09-25 · 约 31 分钟 · 15156 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8018 字 阅读 →
论文解读

别让检测器猜伪迹:先把原声的压缩记忆藏回去

语音伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5792 字 阅读 →
论文解读

想找回被替换的原话,先接受水印不能再像哈希那样精确

音频水印 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3888 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6303 字 阅读 →
论文解读

Using the Mimi codec for metalinguistic representations

语音编码 | 4.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5440 字 阅读 →
论文解读

BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs

语音编码 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6455 字 阅读 →
论文解读

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

语音编码 | 7.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9038 字 阅读 →
论文解读

LILAC: An Idempotent Neural Speech Codec

语音编码 | 8.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6008 字 阅读 →
论文解读

Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions

语音质量评估 | 6.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9539 字 阅读 →
论文解读

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

语音合成 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7230 字 阅读 →
论文解读

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

语音编码 | 9.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8587 字 阅读 →
论文解读

CS-ETS: Chaos-Inspired Samba-Based EMG-To-Speech Synthesis with Nonlinear Chaotic Losses

语音合成 | 5.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8594 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9782 字 阅读 →
论文解读

Text-Independent Speaker Verification Using Discrete Audio Tokens

说话人验证 | 5.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7091 字 阅读 →