AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing
📄 AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing #扩散模型 #自监督学习 #音乐生成 🔥 8.6/10 | 前50% | #音乐生成 | #自监督学习 | #扩散模型 | arxiv 学术质量 5.3/7 | 影响力 1.6/2 | 可复现性 1.7/2 | 置信度 高 👥 作者与机构 作者: Chih-Heng Chang, Keng-Seng Ho, Chih-Yu Tsai, Kuan-Lin Chen, Yi-Hsuan Yang, Jian-Jiun Ding 机构: National Taiwan University 📌 核心摘要 本文针对基于扩散模型的音乐编辑任务中存在的“语义编辑能力”与“结构保真度”之间的根本性矛盾,提出了AnchorSteer框架。该框架通过显式解耦并协同两种机制来解决此矛盾:1) 结构锚定:利用预训练的MuseControlLite适配器,注入显式的旋律、节奏等结构条件,严格约束生成过程的时间对齐和结构骨架。2) 语义引导:提出一种自监督方法,从预训练扩散模型的内部隐藏状态空间(h-space)中,无需人工标注数据,自动发现并学习可解释的“概念向量”(如“钢琴音色”或“爵士风格”)。这些概念向量被封装成即插即用的注入模块,在推理时与结构锚定器协同工作,向模型隐藏层提供额外的语义驱动力。论文还设计了两种注入变体:非条件注入(静态向量,更利于结构保真)和条件注入(基于当前隐藏状态的轻量网络,在强锚定下实现更鲁棒的语义迁移)。在ZoME-Bench数据集上的实验表明,AnchorSteer(尤其是条件注入变体)在语义编辑强度(GAP分数)上显著优于所有基线,同时保持了与强结构锚定方法相当或可接受的结构保真度。主观试听测试也证实其在目标属性匹配度上表现最佳。 🔗 开源详情 代码:https://github.com/hengtsune1024/AnchorSteer 模型权重:论文中未提及具体的模型权重链接。论文指出其骨干模型为预训练的Stable Audio Open (SAO),但未提供该模型权重的直接下载链接。 数据集:使用了ZoME-Bench数据集进行评估,但论文中未提供该数据集的具体下载链接。 Demo:论文中未提及在线演示链接。 复现材料:论文中未提及独立的复现材料包(如完整的训练配置、检查点等)。论文在“Implementation details”(5.4节)中提供了详细的实验设置,包括优化器、学习率、训练轮数等超参数。 论文中引用的开源项目: Stable Audio Open (SAO):论文中未提供链接。 Hugging Face Diffusers库:论文中未提供链接。 MuseControlLite:论文中未提供其官方实现的链接。 LAION-CLAP(用于CLAP评估):论文中提及了具体的模型检查点music_audioset_epoch_15_esc_90.14.pt,但未提供下载链接。 DDPM-Friendly:论文中未提供链接。 SDEdit:论文中未提供链接。 MusicMagus:论文中未提供链接。 🏗️ 方法概述和架构 AnchorSteer框架的核心架构是“结构锚定”与“语义引导”的协同,如论文图1和图4所示。其整体编辑流程(图4)分为两个并行路径处理源音频:一条路径进行结构特征提取(如通过CQT提取旋律、通过节拍检测提取节奏),形成条件序列 \(C_{struct}\),并输入到MuseControlLite适配器;另一条路径则通过预优化的概念注入模块 \(f_l^*\)。两条路径的输出共同作用于预训练扩散模型(SAO) 的隐藏层,引导去噪过程。 ...