论文解读

被编解码器洗掉的水印:CRAW 如何把鲁棒性藏进听不见的地方

音频水印 | 7.7/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11350 字 阅读 →
论文解读

不排队,各自说话再相加:PACodec 把量化从接力改成合唱

语音编码 | 7.1/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11195 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-06 · 约 25 分钟 · 12427 字 阅读 →
论文解读

当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化

语音编码 | 6.3/10

 · 更新于 2026-09-06 · 约 31 分钟 · 15156 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8018 字 阅读 →
论文解读

别让检测器猜伪迹:先把原声的压缩记忆藏回去

语音伪造检测 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5792 字 阅读 →
论文解读

想找回被替换的原话,先接受水印不能再像哈希那样精确

音频水印 | 6.4/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3888 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6303 字 阅读 →
论文解读

Using the Mimi codec for metalinguistic representations

语音编码 | 4.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5440 字 阅读 →
论文解读

BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs

语音编码 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6455 字 阅读 →
论文解读

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

语音编码 | 7.7/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9038 字 阅读 →
论文解读

LILAC: An Idempotent Neural Speech Codec

语音编码 | 8.1/10

 · 更新于 2026-09-06 · 约 12 分钟 · 6008 字 阅读 →
论文解读

Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions

语音质量评估 | 6.0/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9539 字 阅读 →
论文解读

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

语音合成 | 5.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7230 字 阅读 →
论文解读

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

语音编码 | 9.2/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8587 字 阅读 →
论文解读

CS-ETS: Chaos-Inspired Samba-Based EMG-To-Speech Synthesis with Nonlinear Chaotic Losses

语音合成 | 5.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8594 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9782 字 阅读 →
论文解读

Text-Independent Speaker Verification Using Discrete Audio Tokens

说话人验证 | 5.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7091 字 阅读 →
论文解读

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

语音编码 | 7.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5637 字 阅读 →
论文解读

Streaming Neural Speech Codecs through Time-Invariant Representations

语音编码 | 6.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7723 字 阅读 →