论文解读
极端缺频下补高频:音素先验与分频渐进如何分工
针对 1 或 2 kHz 到 16 kHz 的极端语音超分,P2Flow 用音素后验引导缺失高频包络、用 3 段渐进恢复 0-2、2-4、4-8 kHz 速度场并对声码器做后训练,在 TIMIT 与 VCTK 上报告了谱失真、感知质量与可懂度同步改善,代价是 3 阶段流水线与额外分类器依赖。
针对 1 或 2 kHz 到 16 kHz 的极端语音超分,P2Flow 用音素后验引导缺失高频包络、用 3 段渐进恢复 0-2、2-4、4-8 kHz 速度场并对声码器做后训练,在 TIMIT 与 VCTK 上报告了谱失真、感知质量与可懂度同步改善,代价是 3 阶段流水线与额外分类器依赖。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
CIS-BWE 针对带限语音缺失高频的问题,用双流 ConformerNeXt 生成器并行恢复幅度和相位,再用李雅普诺夫与去趋势涨落两类混沌判别器约束非线性动态,在 VCTK 与 MLS 上以约一半生成参数取得更优感知质量,代价是训练期李雅普诺夫特征计算使单轮训练时间明显增加。
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
语音超分 | 5.9/10
语音增强 | 7.1/10