Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model
📄 Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model 标签:#音乐生成 #扩散模型 #自回归模型 #数据集 #音频理解 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #自回归模型 #数据集 | arxiv 👥 作者与机构 第一作者:Zhiwei Lin(未说明) 通讯作者:未说明 作者列表:Zhiwei Lin(未说明)、Jun Chen(未说明)、Boshi Tang(未说明)、Weihao Wu(未说明)、Jing Yang(未说明)、Yaolong Ju(未说明)、Fan Fan(未说明)、Zhiyong Wu(未说明) 备注:论文正文仅标出作者上标编号 1、2、3,未给出机构名称。 💡 毒舌点评 把 LDM 与自回归潜在上下文拼接结合来解决长程符号音乐生成,思路自然,且客观指标确实优于已有基线;但代码和模型权重均未公开,上下文模块没有做有/无的独立消融,长时长实验只验证到 32 小节,论文却宣称能生成“数分钟”一致音乐。这些 claim 目前主要靠 demo 和少量表格背书,审稿人无法直接复现验证。 ...