论文解读

极端缺频下补高频:音素先验与分频渐进如何分工

针对 1 或 2 kHz 到 16 kHz 的极端语音超分,P2Flow 用音素后验引导缺失高频包络、用 3 段渐进恢复 0-2、2-4、4-8 kHz 速度场并对声码器做后训练,在 TIMIT 与 VCTK 上报告了谱失真、感知质量与可懂度同步改善,代价是 3 阶段流水线与额外分类器依赖。

 · 更新于 2026-09-24 · 约 21 分钟 · 10474 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

用混沌判别器补高频:CIS-BWE 为何同时做幅度与相位双流

CIS-BWE 针对带限语音缺失高频的问题,用双流 ConformerNeXt 生成器并行恢复幅度和相位,再用李雅普诺夫与去趋势涨落两类混沌判别器约束非线性动态,在 VCTK 与 MLS 上以约一半生成参数取得更优感知质量,代价是训练期李雅普诺夫特征计算使单轮训练时间明显增加。

 · 更新于 2026-09-24 · 约 20 分钟 · 9703 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-24 · 约 17 分钟 · 8454 字 阅读 →
论文解读

AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

语音超分 | 5.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5441 字 阅读 →
论文解读

Query-Based Asymmetric Modeling with Decoupled Input–Output Rates for Speech Restoration

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6737 字 阅读 →