论文解读

Latent Fourier Transform

这篇论文旨在解决现有音乐生成模型难以对**任意时间尺度**上的音乐模式进行精确控制的问题。作者提出了**潜在傅里叶变换(LatentFT)** 框架,其核心是将离散傅里叶变换应用于由扩散自编码器编码得到的**潜在向量序列**,从而得到“潜在频谱”。通过在训练过程中对潜在频谱进行随机频率掩码,迫使解码

 · 更新于 2026-09-25 · 约 10 分钟 · 4514 字 阅读 →
论文解读

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

这篇论文的核心贡献是识别并系统分析了扩散概率模型(DPMs)中一个基础性问题——信噪比-时间步(SNR-t)偏差。该偏差指推理时去噪样本的实际SNR与其所分配时间步t所理论对应的SNR不匹配,这种错位源于训练时的严格耦合在推理时被累积误差打破。作者通过详实的实验(滑动窗口测试、前向与反向过程对比)揭

 · 更新于 2026-09-25 · 约 10 分钟 · 4541 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

这篇论文旨在解决卫星、水下等极端带宽受限场景下(如200bps)语音通信清晰度严重下降的问题。传统编解码器以波形重建为目标,在超低比特率下会将宝贵的比特分配给不必要的声学细节,而非核心语义信息。为此,

 · 更新于 2026-09-25 · 约 11 分钟 · 5506 字 阅读 →
论文解读

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

本文旨在解决全双工语音对话模型(SDMs)实现类人交互的核心挑战。现有自动化评估指标流于表面(如统计行为或预测时机准确率),无法为强化学习提供可靠的奖励信号,而人工评估成本高昂且难以扩展。为此,作者提

 · 更新于 2026-09-25 · 约 12 分钟 · 5601 字 阅读 →
论文解读

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

这篇论文旨在解决通用语音增强(USE)中生成模型面临的“高感知质量”与“低内容幻觉”难以兼得的核心矛盾。作者提出了UniPASE框架,它扩展了其先前的低幻觉PASE模型,以处理包括噪声、混响、丢包、风

 · 更新于 2026-09-25 · 约 14 分钟 · 6902 字 阅读 →