Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations
📄 一次解完还是逐帧死磕:在连续编解码空间里数着步子去噪 英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations 一句话:论文把语音增强写成连续编解码隐空间上的掩码自回归块解码,用同一 Conformer 公平比较因果与非因果策略,证明 10 步迭代能在质量与可懂度之间取得可调折中,但随机非因果并未超越因果且高斯假设偏弱。 标签:#语音增强 | #自回归模型 | #语音质量评估 评分:6.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Yoto Fujita:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Laurent Girin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用同一 Conformer、同一 DAC 连续表征和同一训练流程把单步非自回归、块级因果自回归、帧级因果自回归和随机与 oracle 非因果放在同一标尺下比较,权衡曲线干净可信。短板是所谓统一框架只是高斯均值回归下的掩码均方误差重训,原掩码自回归 Masked Autoregressive / MAR 中的扩散头被简化为单高斯,表达力自认较弱;非因果随机策略无实用增益,oracle 增益不可落地,方法增量感偏重。 ...