用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
DECAF 针对云端语音传输中声纹泄露问题,选择只量化传输内容嵌入并在接收端用共享典型说话人重建,在 0.5 kbps 下报告 43.5% 等错误率和相对 33.2% 词错误率下降,但未压缩时仍需承担重建与微调依赖。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该文以增量重合成的时长、基频与滑音加 TIMIT 后验音素为探针,用核典型相关与记忆分类核对 Mimi 八个码本的分工,最强证据是时长可达 92.3% 而音高与滑音仅部分可恢复,且第一码本更偏向音段表示。
论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。
TokenMapper 针对同有效帧率但码本结构不同的语音分词器做离散域直接翻译,在 GLM、Moshi、DualCodec 六个方向上把跨模型词错误率控制在接近原生重建 2.5-6.8 个百分点内,并以省去波形桥接换来 4.8-94.5% 的传输路径延迟下降,但多码本残差声学细节仍是主要代价。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对单模态压缩器重复部署与大模型压缩器过重的问题,OmniZip 用统一可逆分词加双路模态路由的轻量序列模型预测概率再算术编码,在 16 个数据集上接近专用方法并在笔记本与手机上接近实时,代价是自然图像与基因等难例仍弱于专用大模型。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。
针对约 1 kbps 下语义对齐与波形重建互相冲突的问题,XY-Tokenizer 用语义与声学双编码器加残差矢量量化与先联合对齐后冻结细化的两阶段训练,在英中多数据集上同时取得低识别错误率与高说话人相似度,代价是更大的编码器规模与更重的训练流程。
ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。
针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。
针对固定帧率对静音与稳态元音浪费而对快速过渡欠分配的问题,VARSTok 用时间感知的密度峰聚类做变长切分并用扩展索引隐式编码时长,在平均 30.95 Hz 下重建 UTMOS 达 3.8949 超过 40 Hz 固定基线,但更低码率与说话人相似度上仍有代价。
针对连续语音表示自回归预测中误差沿时间累积导致的隐变量漂移问题,SphereVAE 用单位超球面 Power Spherical 隐空间固定模长只留方向变化,在重建指标低于标准 VAE 的代价下,在 VoxCPM 零样本合成中取得英文 5.305% 词错误率与中文 1.141% 字错误率的最低内容错误并在长文本中保持更高的说话人相似度。
StreamAlign 针对离线文本对齐切分必须等整句和词级复制丢失细节的问题,用词级流式识别引导字符级 RNN-T 对齐再聚合成大模型子词单元,在 LibriSpeech 上报告重建 WER 4.41 和 UTMOS 4.23,同时主动词边界判断把延迟从 560 ms 降到 270 ms,代价是说话人相似度等相似性指标未占优且仅在英语朗读类数据上验证。
针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。