Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing
📄 Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing 标签:#语音编辑 #扩散模型 #音频修复 #Transformer #零样本 7.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音编辑 | #扩散模型 | #音频修复 #Transformer | arxiv 👥 作者与机构 第一作者:Iftach Shoham(Ben-Gurion University of the Negev)与 Tali Dror(Ben-Gurion University of the Negev),论文标注为共同一作 作者列表:Iftach Shoham、Tali Dror、Oren Gal(University of Haifa)、Haim Permuter(Ben-Gurion University of the Negev)、Gilad Katz(Ben-Gurion University of the Negev)、Eliya Nachmani(Ben-Gurion University of the Negev) 通讯作者:未说明 💡 毒舌点评 把 RVQ 码本的粗到细层级显式编码进离散扩散的条件因子化,是比直接 flatten 所有码本更贴合语音 codec 结构的建模选择;代码仓库也给了。但语音编辑任务上相对 VoiceCraft 的 WER 只从 0.124 降到 0.121,差距几乎落在标准差范围内;实验只用了 RealEdit 一个基准,没有对比任何扩散/流匹配类非自回归方法,也没有人工听感评测。修复任务在短 gap 上的 MCD 优势很突出,但整体说服力仍配不上方法设计的优雅度。 ...