用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。
论文把音乐语义定义为可测的检索任务能力,用冻结语义单码本加声学残差量化双流在混合信号上重建,报告显示完整配置在内容保持与重建上占优而纯声学配置虽重建略高却显著更难建模。
DECAF 针对云端语音传输中声纹泄露问题,选择只量化传输内容嵌入并在接收端用共享典型说话人重建,在 0.5 kbps 下报告 43.5% 等错误率和相对 33.2% 词错误率下降,但未压缩时仍需承担重建与微调依赖。
针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。
针对构音障碍语音识别中离散 token 与识别目标错位且随严重程度漂移的问题,该文用迭代伪标签更新、可微端到端优化与严重程度不变正则学习 DSI token,在 UASpeech 与 TORGO 上显著优于可比 HuBERT 连续与离散基线,系统组合后最低词错误率分别为 18.90% 和 6.38%,代价是需内容平行的健康对照与额外的端到端训练。
论文把传统编码再经神经音频编解码器转码后的来源识别定义为取证缺口,用分层因果与时序注意力建模 RVQ 序列,在固定码率下取得 97% 以上准确率,而 18 类联合任务为 89.34% 且高码率 MP3 与 Opus 仍易混淆。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对端到端生成把创作压缩到提示词层的问题,该文选择对神经音频编解码器的量化音频潜嵌入做带时变系数的加权求和感知 morphing,用作品《龢》三阶段与五种编解码器对照验证可行性,代价是解码器鲁棒性与实时性等条件仍未被系统测量。
该文把作曲家定义的文本语料经语义嵌入、降维与量化压缩为可枚举的卦象状态,用以配置数字乐谱的结构条件而非生成声音,并以五句雨诗得到离散对偶输出的艺术实例展示其可解释与可重复的即兴逻辑,其代价是降维随机性带来的状态不稳定性。
针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。
论文以普通话和约鲁巴语为对象,用探针分类证明自监督隐变量同时编码音素与声调而 K 均值等离散化更伤声调,并显示残差式多级量化能部分挽回声调但仍不及连续基线。
论文用线性与非线性探针检验 Mimi 编码器输出与各码本是否保留八种英语核语调的区别,最强证据是 hhh 与 lll 等二分类可达约 90% 准确率,而五类聚类最高约 0.45 且远不及人类,代价是语调信息分散在多个码本且对重音不如对边界调敏感。
论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。
StepAudio 3 Gen 用 12.5 Hz 共享 16 码本离散表示把语音、歌声、音效和音乐放在一个自回归流中建模,以主干预测首码本加轻量预测器补全残差码本的分工,在四阶段渐进预训练与零初始化适配下保持文本能力,并在中文人声相似度与声音设计指令遵循上报告了可核对的胜率与一致性得分,其代价是长序列声学建模与多阶段训练流程的复杂度。
该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。
AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读