论文解读

把内容音色情感拆干净再拼回去:MF-Speech 的提纯与细粒度指挥

针对语音内容音色情感纠缠与控制粗糙问题,MF-Speech 用三流编码器提纯离散因子再用动态融合与分层风格归一化组合生成,在多因子组合任务上报告 WER 为 4.67% 与 SECS 为 0.5685,但重建自然度与部分解耦指标仍有代价与边界。

 · 更新于 2026-09-24 · 约 19 分钟 · 9399 字 阅读 →
论文解读

低码率下保真与语义难两全:非对称双量化如何分开处理内容与细节

针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8761 字 阅读 →
论文解读

信息不均匀时不再平均分配:用聚类定长短、用索引记时长

针对固定帧率对静音与稳态元音浪费而对快速过渡欠分配的问题,VARSTok 用时间感知的密度峰聚类做变长切分并用扩展索引隐式编码时长,在平均 30.95 Hz 下重建 UTMOS 达 3.8949 超过 40 Hz 固定基线,但更低码率与说话人相似度上仍有代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7911 字 阅读 →
论文解读

流式对齐语音切分:在块边界上把声音逐字贴到文本子词

StreamAlign 针对离线文本对齐切分必须等整句和词级复制丢失细节的问题,用词级流式识别引导字符级 RNN-T 对齐再聚合成大模型子词单元,在 LibriSpeech 上报告重建 WER 4.41 和 UTMOS 4.23,同时主动词边界判断把延迟从 560 ms 降到 270 ms,代价是说话人相似度等相似性指标未占优且仅在英语朗读类数据上验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9072 字 阅读 →
论文解读

不用传专家编号的量化扩容:UniStream 如何做 48 kHz 因果流式通用音频编码

UniStream 针对 48 kHz 因果流式语音、音乐与环境声共用一套残差码本容量不足的问题,用多专家残差向量量化扩大每层量化容量并靠已解码状态确定性复现路由,用训练期最优传输条件流匹配正则化量化隐空间,在 12 kbps Top-1 和 22.5 kbps Top-2 两档下以 ViSQOL、Mel 失真和消融证明多专家是主要增益来源,而流正则只带来语 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10032 字 阅读 →
论文解读

先学走再学舞:用掩码动作先验统筹音乐、体裁与姿态的可编辑舞蹈合成

针对音乐舞蹈需同时逼真、对拍、多样、物理合理且可编辑的问题,论文以文本到动作掩码模型为先验并外挂音乐塔与姿态塔,在 FineDance 上把运动质量与多样性推高并实现快速推理,但节拍对齐并未登顶且依赖渐进训练与推理优化协同。

 · 更新于 2026-09-24 · 约 17 分钟 · 8179 字 阅读 →
论文解读

解耦分词与多词元预测为何能同时改善语音对齐与合成质量

该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。

 · 更新于 2026-09-24 · 约 22 分钟 · 10835 字 阅读 →
论文解读

不对称不确定性分解:用确定性锚点保口型、用随机残差补倾听

在仅双路音频输入的整段对话生成任务中,ECHO 以确定性锚点建立语音主导的稳定基线、再以残差流匹配与语义组缩放补充一对多的倾听变化,在约 120 小时对话基准上同时改善说话保真与倾听真实感与多样性,代价是时序稳定性与单样本实时因子未全面领先且依赖弱条件窗口的提纯。

 · 更新于 2026-09-24 · 约 22 分钟 · 10846 字 阅读 →
论文解读

在单通道约束下用稀疏相对脉冲响应重建空间:HOA 参数化编码的显式房间建模

针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。

 · 更新于 2026-09-24 · 约 24 分钟 · 12011 字 阅读 →
论文解读

以不完美证据约束自回归生成:码空间接地与局部精修如何兼顾忠实与自然

该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊

针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。

 · 更新于 2026-09-24 · 约 24 分钟 · 11554 字 阅读 →
论文解读

压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐

针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10695 字 阅读 →
论文解读

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

多模态模型 | 8.6/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10221 字 阅读 →
论文解读

DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick

生成模型 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5814 字 阅读 →
论文解读

DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick

语音编码 | 8.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6275 字 阅读 →
论文解读

HFSQVAE: Hierarchical Vector Quantization with Residuals for Frequency-Specific Embedding

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3438 字 阅读 →
论文解读

Lisa: Lightweight Yet Superb Neural Speech Coding

语音编码 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4932 字 阅读 →
论文解读

SwitchCodec: Adaptive Residual-Expert Sparse Quantization for High-Fidelity Neural Audio Coding

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5387 字 阅读 →