AudioX: A Unified Framework for Anything-to-Audio Generation

📄 AudioX: A Unified Framework for Anything-to-Audio Generation #音频生成 #音乐生成 #多模态模型 #扩散模型 #数据集 ✅ 7.5/10 | 前25% | #音频生成 | #扩散模型 | #音乐生成 #多模态模型 学术质量 6.0/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Zeyue Tian(香港科技大学) 通讯作者:Wei Xue†(香港科技大学),Yike Guo†(香港科技大学) 作者列表:Zeyue Tian(香港科技大学),Zhaoyang Liu(香港科技大学),Yizhu Jin(香港科技大学),Ruibin Yuan(香港科技大学),Liumeng Xue(香港科技大学),Xu Tan(独立研究者),Qifeng Chen(香港科技大学),Wei Xue†(香港科技大学),Yike Guo†(香港科技大学) 💡 毒舌点评 该工作在“大力出奇迹”的道路上又进了一步:用精心设计的结构化标注管线喂出了七百万条高质量音频-文本对,配合一个设计得当的多模态融合模块,最终在各大榜单上刷出了SOTA,这证明了数据工程与模型工程的双重重要性。然而,论文中将指令跟随能力归因于MAF模块和数据集的论断,部分证据(如T2A-bench的评估)严重依赖外部强大的多模态大模型作为标注器和裁判,这引发了评估闭环是否过于依赖商业API的疑问。 🔗 开源详情 代码:论文中提供了代码仓库链接(https://zeyuet.github.io/AudioX/),并承诺将开源。 模型权重:论文提及将开源预训练模型检查点。 数据集:论文承诺将完整开源IF-caps数据集。 Demo:论文中未提及在线演示链接。 复现材料:论文提供了详细的模型架构、训练超参数、数据集统计信息、评估指标定义和基准测试细节(见附录)。附录中进一步详述了数据标注样例和评估流程。 引用的开源项目:CLIP (Radford et al., 2021), Synchformer (Iashin et al., 2024), T5 (Raffel et al., 2020), Stable Audio Open (Evans et al., 2024b), Gemini 2.5 Pro (Google), Qwen2-Audio (Chu et al., 2024)。 📌 核心摘要 问题:当前音频生成模型大多为单模态输入(如仅文本或仅视频)、单任务输出(如仅音效或仅音乐)的“专家”模型,缺乏一个能灵活组合多种控制信号并生成高质量音频/音乐的统一框架,且高质量的多模态训练数据稀缺。 方法核心:提出AudioX统一框架,以扩散Transformer(DiT)为骨干。核心创新是设计了一个轻量级的多模态自适应融合(MAF)模块,用于在条件信号输入DiT前,对来自文本、视频和音频的特征进行门控、交叉注意力聚合和自注意力精炼,以增强跨模态对齐和融合。 新意与对比:相较于已有方法,AudioX的新意在于:(1) 架构上,通过MAF模块在统一框架内处理任意模态组合的条件输入;(2) 数据上,设计了结构化标注与增强管线,构建了包含超700万样本的IF-caps大规模细粒度数据集。 实验结果:在多个任务(T2A, V2A, T2M, V2M等)和基准上,AudioX达到或超过SOTA水平。关键结果见下表(数据摘自论文Table 1): 任务 数据集 方法 KL ↓ IS ↑ FAD ↓ T2A VGGSound AudioX 1.74 19.58 1.33 MMAudio 2.17 17.83 2.50 Stable Audio Open 2.36 14.45 2.60 T2M MusicCaps AudioX 0.96 3.55 1.53 TangoMusic 1.13 2.86 1.88 Stable Audio Open 1.51 2.94 3.23 V2M V2M-bench AudioX 0.70 1.37 1.67 VidMuse 0.73 1.32 2.46 在新提出的指令跟随基准T2A-bench上,AudioX大幅领先(如Ord-acc: 23.6 vs 次高19.8)。 实际意义:该框架和数据集为需要多模态灵活控制音频生成的应用(如视频后期制作、游戏开发、辅助创作)提供了强大的基础工具,其数据标注方法对构建多模态数据集有借鉴意义。 主要局限:论文未明确讨论模型的计算效率与实时性;统一框架的参数量(2.4B)和训练成本(约4k GPU小时)可能限制其在资源受限场景的应用;其“Anything-to-Audio”的泛化能力主要在文本、视频、音频三种模态内验证,对于更异质模态(如传感器数据、图像)的处理能力未探讨。 🏗️ 模型架构 图4:AudioX框架。 专用编码器处理不同模态,MAF模块将这些信号统一为条件嵌入Hc。DiT骨干网络处理噪声潜在输入zt,通过交叉注意力以Hc为条件,生成高质量音频和音乐。 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 442 words

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

📄 Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task? #音乐生成 #自回归模型 #端到端 #多模态模型 #生成模型 🔥 8.5/10 | 前25% | #音乐生成 | #自回归模型 | #端到端 #多模态模型 学术质量 8.5/7 | 选题价值 1.5/2 | 复现加成 1.0 | 置信度 高 👥 作者与机构 第一作者:Zijian Zhao(The Hong Kong University of Science and Technology) 通讯作者:Xiaoyu Zhang(City University of Hong Kong) 作者列表:Zijian Zhao(The Hong Kong University of Science and Technology),Dian Jin(The Hong Kong Polytechnic University),Zijing Zhou(The University of Hong Kong),Xiaoyu Zhang(City University of Hong Kong) 💡 毒舌点评 亮点: 论文最具价值之处在于开创性地将“自动舞台灯光控制”从传统的分类-映射范式重新定义为端到端的生成任务,并提供了从数据集构建到模型设计、评估的完整解决方案,思路清晰,闭环完整。 短板: 模型架构的核心(Skip-BART)是对现有BART模型的适配与改进,而非全新架构设计;“生成”的概念虽新,但任务本身的复杂度和数据规模(699个样本)使其技术深度相较于文本或图像生成领域的突破性工作仍有距离。 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 454 words

Continuous Audio Language Models

📄 Continuous Audio Language Models #音频生成 #音乐生成 #自回归模型 #流匹配 #语音合成 🔥 9.5/10 | 前10% | #音频生成 #音乐生成 | #自回归模型 #流匹配 | #音频生成 #音乐生成 学术质量 6.5/7 | 选题价值 1.8/2 | 复现加成 1.0 | 置信度 高 👥 作者与机构 第一作者:Simon Rouard(Kyutai;IRCAM-CNRS Sorbonne Univ.) 通讯作者:未说明(论文未明确指定,通常对应邮箱作者为Simon Rouard和Alexandre Défossez) 作者列表:Simon Rouard(Kyutai;IRCAM-CNRS Sorbonne Univ.),Manu Orsini(Kyutai),Axel Roebel(IRCAM-CNRS Sorbonne Univ.),Neil Zeghidour(Kyutai),Alexandre Défossez(Kyutai) 💡 毒舌点评 这篇论文的亮点在于其系统性思维,它没有孤立地提出一个新模块,而是为“连续音频生成”这个目标设计了一整套涵盖编码、建模、采样和蒸馏的完整流水线(CALM),并通过“Pocket TTS”将学术想法落到了实处。然而,其短板在于音乐生成的实验数据集规模(400K歌曲)相比工业级模型仍显局促,这或许限制了其在最复杂音乐场景下潜力的完全展现,且论文未公开其训练数据集。 🔗 开源详情 代码:论文中提及了代码仓库链接:github.com/kyutai-labs/pocket-tts (用于Pocket TTS)。主论文代码链接在摘要中提及为:iclr-continuous-audio-language-models.github.io。 模型权重:明确提供了开源的“Pocket TTS”模型权重(100M参数),可在上述GitHub仓库获取。对于论文中的大型实验模型(如1.35B音乐模型),未提及是否开源。 数据集:论文详述了训练所用的数据集名称(如Emilia, LAION-Disco-12M等)和规模,但未提供统一的下载链接,部分数据集可能是公共的,部分可能为内部或受限数据集。 Demo:摘要中提到了示例音频网站 iclr-continuous-audio-language-models.github.io。 复现材料:提供了极其详尽的附录,包括:表14(VAE超参数)、表15(模型与训练超参数)、各任务的具体数据处理细节(附录D、F、G)、消融实验(表6, 表10)、补充实验(表7, 表8, 表9, 表11, 表12, 表13)、以及人类评估方法详细说明(附录H)。 论文中引用的开源项目:论文主要基于并引用了以下开源项目/模型:Mimi (Défossez et al., 2024b), WavLM (Chen et al., 2021b), Helium-1 (Kyutai, 2025), Mistral 7B (Jiang et al., 2023), CLAP (Elizalde et al., 2023), SentencePiece (Kudo & Richardson, 2018), fairseq (Ott et al., 2019), Whisper (Radford et al., 2022)。 📌 核心摘要 要解决什么问题:现有音频语言模型(ALM)依赖有损的离散音频令牌(如RVQ),导致生成高质量音频必须生成更多令牌,从而在保真度和计算成本之间存在根本矛盾。 方法核心是什么:提出连续音频语言模型(CALM),在VAE的连续潜空间中进行自回归建模。核心是一个大型因果Transformer(长上下文)处理带噪声的历史潜变量,一个轻量Transformer(短上下文)处理干净的近期潜变量,两者结合后条件化一个小型一致性模型(MLP),以单步生成下一个干净的连续潜变量。 与已有方法相比新在哪里:完全避免了有损量化,用一致性模型替代了离散模型的RQ-Transformer头或扩散模型的多步采样头,实现了质量与效率的同步提升。创新性地提出了“噪声长上下文+干净短上下文”的双Transformer设计、潜在分类器引导(Latent CFG)和潜在蒸馏(Latent Distillation)等技术。 主要实验结果如何:在语音延续、文本到语音(TTS)和音乐延续任务上全面超越了最先进的离散模型基线。 TTS任务(表3):CALM模型WER为1.81,优于F5-TTS的2.42和DSM的1.95,声学质量MUSHRA得分61.1。 音乐延续任务(表4):CALM一致性模型(4步)的FAD(0.71)优于32-RVQ RQ-Transformer基线(1.06),整体推理速度提升1.9倍,采样头速度提升5.4倍。 语音延续任务(表2):CALM在声学质量和有意义性上均超越8-RVQ RQ-Transformer。 消融研究(表6):证明短上下文Transformer和噪声增强是模型高性能的关键。 实际意义是什么:使得在轻量级设备(如笔记本电脑CPU)上运行高质量的实时音频生成成为可能。开源的“Pocket TTS”(100M参数)模型实现了这一目标,具有极高的实际应用价值。 主要局限性是什么:论文中音乐生成的训练数据集规模(约20K小时)相对有限;连续表示可能在某些细粒度控制上(如精确的音高、时长编辑)面临挑战;论文未提供其主训练数据集的下载链接。 🏗️ 模型架构 CALM的整体架构(图1)是一个端到端的连续自回归生成系统,由VAE编码器、双Transformer骨干和一致性模型头组成。 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 587 words

Discovering and Steering Interpretable Concepts in Large Generative Music Models

📄 Discovering and Steering Interpretable Concepts in Large Generative Music Models #音乐生成 #音频大模型 #稀疏自编码器 #模型评估 #模型解释性 ✅ 7.5/10 | 前25% | #音乐生成 | #稀疏自编码器 | #音频大模型 #模型评估 学术质量 6.5/7 | 选题价值 1.0/2 | 复现加成 0.0 | 置信度 高 👥 作者与机构 第一作者:Nikhil Singh(Dartmouth College)、Manuel Cherep(MIT)(共同第一作者) 通讯作者:未说明 作者列表:Nikhil Singh(Dartmouth College), Manuel Cherep(MIT), Pattie Maes(MIT) 💡 毒舌点评 亮点在于将大语言模型可解释性领域的前沿方法(稀疏自编码器)成功移植到音乐生成模型,并提出了一个完整的、可扩展的概念发现与引导框架,具有方法论上的开创性。短板在于实验规模局限于单一模型家族(MusicGen),且自动化评估依赖CLAP等外部模型,其评估结果的可靠性有待更全面的人工验证支撑,部分技术细节(如SAE训练策略)也未完全公开。 📌 核心摘要 问题:大型音乐生成模型(如MusicGen)能生成高质量音乐,但其内部表示如同“黑箱”,缺乏可解释性。我们需要理解模型内部“学到”了哪些音乐概念,以及这些概念是否与人类音乐理论一致或能揭示新的音乐规律。 方法核心:提出一个多阶段流水线:首先,从音乐语料库中提取预训练MusicGen模型的残差流激活;其次,使用稀疏自编码器(SAEs)对这些高维激活进行降维和稀疏化,以发现潜在的、可解释的特征;最后,通过自动标注(使用多模态LLM如Gemini和预训练音频分类器)和人类验证来为这些特征命名,并通过干预残差流来测试特征的可引导性。 创新点:这是首次将稀疏自编码器技术应用于音频/音乐领域的生成模型;构建了一个可扩展的、无需监督的概念发现与自动评估流水线;不仅发现了与已知音乐理论(如流派、乐器)一致的特征,还发现了一些理论上未明确编码但感知上连贯的“涌现”规律(如特定电子音效、单音纹理)。 主要实验结果:在MusicGen-Large模型上,通过SAE发现了数千个可过滤的特征。人类验证中,基于Essentia分类器的标签获得的人类置信度(3.96/5)高于基于Gemini的标签(3.19/5)。引导实验表明,约15-35%的测试特征能成功引导生成内容向目标概念靠拢,听觉测试(10名参与者)显示66%的情况下,SAE引导的版本比基线或随机引导版本更易被识别为目标概念。结果表明,模型的深层编码了更易解释的特征,且大模型的特征组织更具层次性。 实际意义:为理解生成式AI的“音乐理解”提供了实证工具,架起了模型内部表示与人类音乐概念之间的桥梁,有望促进更透明、可控的AI音乐创作,并为音乐理论研究提供新视角。 主要局限性:研究主要针对无条件生成(未使用文本提示),未探讨文本条件下的概念表示;自动化评估指标(CLAP分数)可能不完全反映人类对音乐概念的理解;引导实验的成功率有待提高,且引导可能导致生成质量下降。 🏗️ 模型架构 该论文的核心并非提出一个新的生成模型,而是一个用于分析和引导现有模型(MusicGen)内部表示的方法流水线。其整体架构如图1所示。 完整流程分为三个主要阶段: 激活提取与数据集构建: 输入:一个大型音乐语料库(论文中使用MusicSet,约16万段音频)。 处理:将音频输入预训练的MusicGen模型(MusicGen-Large或MusicGen-Small),并提取其多个Transformer层的残差流激活向量。 输出:一个“激活数据集”,包含每段音频在不同层、不同时间步的激活向量。 特征发现与过滤: ...

2026-05-02 · 更新于 2026-08-14 · 2 min · 297 words

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

📄 Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction #音乐生成 #强化学习 #生成模型 🔥 8.0/10 | 前50% | #音乐生成 | #强化学习 | #生成模型 学术质量 5.5/7 | 选题价值 1.2/2 | 复现加成 1.0 | 置信度 高 👥 作者与机构 第一作者:Yusong Wu(Mila, Quebec Artificial Intelligence Institute, Université de Montréal) 通讯作者:Natasha Jaques(University of Washington),Cheng-Zhi Anna Huang(Massachusetts Institute of Technology)(论文中明确标注这两位为共同资深作者 Equal contribution as senior authors) 作者列表: Yusong Wu(Mila, Université de Montréal) Stephen Brade(Massachusetts Institute of Technology) Aleksandra Teng Ma(Georgia Institute of Technology) Tia-Jane Fowler(University of Washington) Enning Yang(McGill University) Berker Banar(Independent Researcher) Aaron Courville(Mila, Université de Montréal) Natasha Jaques(University of Washington) Cheng-Zhi Anna Huang(Massachusetts Institute of Technology) 💡 毒舌点评 亮点:本文将强化学习后训练中“奖励黑客”这个时髦但棘手的问题,在一个要求极高的实时音乐交互场景中具象化,并提出了一个巧妙且工程上可行的对抗性解决方案(GAPT),实验设计从离线到真人验证非常扎实。 短板:核心方法(对抗训练+RL)并非独创,本文的价值更多在于针对音乐交互场景的细致适配与验证,其提出的两阶段更新策略虽有效但偏“炼丹”,对解决一般性奖励黑客问题的理论贡献有限,且任务领域相对垂直。 ...

2026-05-02 · 更新于 2026-08-14 · 2 min · 295 words

Latent Fourier Transform

📄 Latent Fourier Transform #音乐生成 #扩散模型 #傅里叶变换 #表示学习 #可控生成 ✅ 7.5/10 | 前25% | #音乐生成 | #扩散模型 | #傅里叶变换 #表示学习 学术质量 6.0/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Mason Long Wang (CSAIL, Massachusetts Institute of Technology) 通讯作者:未说明(论文未明确标注通讯作者,通常根据机构排序,第二作者Cheng-Zhi Anna Huang同属MIT CSAIL) 作者列表:Mason Long Wang (CSAIL, Massachusetts Institute of Technology), Cheng-Zhi Anna Huang (CSAIL, Massachusetts Institute of Technology) 💡 毒舌点评 这篇论文的亮点在于巧妙地将傅里叶变换这个经典工具从音频信号“下沉”到生成模型的潜在表示空间,为音乐生成提供了一个直观且连续的“时间尺度”控制旋钮,概念优雅且实验全面。短板在于,其控制维度的普适性有待验证——能否从“音乐结构”的时间尺度控制,泛化到如语音、环境声等其他音频模态的类似控制,文中并未探讨,这使得方法的影响力目前主要局限在音乐生成领域。 🔗 开源详情 代码:是。论文明确提供了代码仓库链接:https://github.com/maswang32/latentfouriertransform/。 模型权重:未提及。论文中未明确说明是否公开预训练模型权重。 数据集:未提及。论文使用的MTG-Jamendo和GTZAN是公开数据集,但论文未提供处理后的版本或具体下载脚本。 Demo:论文中提到提供在线演示示例(https://masonlwang.com/latentfouriertransform/)。 复现材料:非常充分。论文附录详细说明了模型架构(MLP、U-Net、DAC编码器;U-Net解码器)、所有训练超参数、数据集处理方式、评估指标计算细节等。 论文中引用的开源项目:提到了DAC(Descript Audio Codec)作为编码器前端之一;BigVGAN作为声码器;librosa、Essentia用于特征提取;VampNet作为基线模型。 📌 核心摘要 问题:现有的可控音乐生成模型难以精确地基于音乐模式发生的“时间尺度”(如快节奏鼓点vs.慢速和弦进行)进行条件控制或融合,现有控制手段(文本、音高、响度)无法直接暴露这一维度。 方法核心:提出潜在傅里叶变换(LATENTFT) 框架。核心是在扩散自编码器的潜在表示时间序列上应用离散傅里叶变换(DFT),得到“潜在频谱”。训练时,对该频谱进行随机的频率遮蔽;推理时,用户通过指定潜在频率范围(如0-1Hz保留和弦)来控制生成。 新在哪里:不同于直接操作音频波形频谱(均衡器)或后期分析潜在表示,LATENTFT通过训练时的潜在频率遮蔽,使潜在表示天然地按时间尺度解耦,从而支持在推理时对特定时间尺度的特征进行保留、生成变体或混合两首歌曲。 主要实验结果: 在MTG-Jamendo数据集上的条件生成任务中,LATENTFT在响度相关性(0.878)、节奏保持(0.922)、音色失真(1.390)和和声距离(0.107)等指标上均显著优于所有基线(如ILVR、Guidance、DAC后处理等)。 在混合任务中,LATENTFT在音频质量(FAD 1.364)和用户主观评价(图3)上也优于基线。 听觉研究(29名音乐家参与)表明,在混合任务的音频质量和融合能力两个维度上,LATENTFT获得的偏好票数均领先于其他系统。 可解释性实验(图5)显示,不同音乐属性(体裁、和弦、节奏、音高)在潜在频谱的不同频率区域被保留,证实了潜在频率轴的意义。 实际意义:为音乐生成和制作提供了一种新的、基于时间尺度的交互式控制工具,类似于为潜在空间配备了一个“均衡器”,可用于创作音乐变体、混合不同歌曲片段。 主要局限性:目前框架主要在音乐生成任务上验证;其潜在表示的可解释性虽被展示,但如何与语义控制(如风格、情绪)进一步结合是未来方向;实时交互性未实现。 🏗️ 模型架构 LATENTFT是一个端到端的编码器-解码器框架,核心是在训练时引入对潜在表示的频率域操作。整体流程如下: ...

2026-05-02 · 更新于 2026-08-14 · 2 min · 322 words

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

📄 SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation #音乐生成 #扩散模型 #条件生成 #数据集 ✅ 7.0/10 | 前25% | #音乐生成 | #扩散模型 | #条件生成 #数据集 学术质量 6.8/7 | 选题价值 1.5/2 | 复现加成 0.7 | 置信度 高 🔗 开源详情 代码:提供GitHub仓库链接:https://github.com/lsfhuihuiff/SongEcho_ICLR2026 模型权重:论文未直接提及是否公开预训练好的SongEcho模型权重,但承诺开源代码。基于代码仓库,用户可能可以自行训练获得模型。 数据集:公开了新构建的Suno70k数据集,通过论文提供的Hugging Face数据集链接(https://huggingface.co/datasets/nyuuzyou/suno)可获取元数据,音频需根据链接下载。 Demo:提供在线演示页面:https://vvanonymousvv.github.io/SongEcho_updated/ 复现材料:论文在附录中提供了极其详尽的复现信息,包括:ACE-Step+SA ControlNet和ACE-Step+MuseControlLite两种基线的具体实现方式(LoRA秩、克隆模块数量)、训练设置(优化器参数、学习率、步数)、推理设置(CFG引导强度)等。 论文中引用的开源项目:ACE-Step(基础生成模型)、RVMPE(F0提取)、mir_eval(旋律指标计算)、Whisper(歌词转录)、Qwen2-audio(标签生成)、SongEval(美学评估与数据集)、OpenL3, PANNs (用于FD和KL计算)、CLAP(音频文本一致性评估)。 📌 核心摘要 这篇论文针对“翻唱歌曲生成”(Cover Song Generation)任务,即在保留原曲主旋律的同时,根据新的文本提示生成全新的演唱和伴奏,提出了一个名为SongEcho的轻量级框架。其核心是实例自适应逐元素线性调制(IA-EiLM),该方法包含两个创新组件:1)逐元素线性调制(EiLM),它扩展了特征线性调制(FiLM),通过生成与隐藏状态维度匹配的调制参数(γ, β),实现了旋律条件的时序对齐精确注入;2)实例自适应条件精炼(IACR),它通过门控机制使条件特征与生成模型的隐藏状态动态交互,从而让条件特征自适应于当前生成实例,避免了静态条件注入导致的不兼容问题。为解决该领域缺乏大规模开源数据集的问题,论文构建并发布了Suno70k数据集。实验表明,SongEcho在Suno70k和SongEval数据集上,仅使用不到基线30%的可训练参数,在旋律保真度(如RPA, RCA)和音频质量(如FD, KL)等所有评估指标上均超越了现有最先进的旋律可控音乐生成方法(如SA ControlNet, MuseControlLite)。该工作的意义在于为歌曲的再创作提供了一种高效、可控的技术路径,但其局限在于对演唱音色等更细粒度风格的控制能力有限,且依赖于特定的文本到歌曲基础模型(ACE-Step)的文本控制能力。 实验结果表格 表1:在Suno70k测试集上的定量评估结果 方法 RPA ↑ RCA ↑ OA ↑ CLAP ↑ FD ↓ KL ↓ PER ↓ TP ↓ ACE-Step (Gong et al., 2025) - - - 0.2930 73.53 0.2670 0.4168 - ACE-Step+SA ControlNet (Hou et al., 2025) 0.6209 0.6440 0.6858 0.2875 105.95 0.2019 0.3714 1.6B ACE-Step+SA ControlNet+LoRA (Hou et al., 2025) 0.6214 0.6431 0.6833 0.2892 99.19 0.1850 0.3734 331M ACE-Step+MuseControlLite (Tsai et al., 2025) 0.5205 0.5346 0.5940 0.2977 72.04 0.2151 0.4194 189M SongEcho (Ours) 0.7080 0.7339 0.6952 0.3243 42.06 0.1123 0.2951 49.1M 表2:在Suno70k测试集上(交换文本标签后)的定量评估结果 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 518 words

Steering Autoregressive Music Generation with Recursive Feature Machines

📄 Steering Autoregressive Music Generation with Recursive Feature Machines #音乐生成 #可解释性 #自回归模型 #基准测试 #模型评估 🔥 8.0/10 | 前25% | #音乐生成 | #可解释性 | #自回归模型 #基准测试 学术质量 6.0/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Daniel Zhao (University of California, San Diego) 通讯作者:未明确说明(论文列出了所有作者邮箱,无指定通讯作者) 作者列表:Daniel Zhao (University of California, San Diego)、Daniel Beaglehole (University of California, San Diego)、Taylor Berg-Kirkpatrick (University of California, San Diego)、Julian McAuley (University of California, San Diego)、Zachary Novack (University of California, San Diego) 💡 毒舌点评 亮点:该工作将“可解释性”与“可控生成”两个热门方向巧妙结合,通过激活空间干预提供了无需重训模型的细粒度控制方案,实验设计全面,既有严谨的量化指标,也有主观听感测试。 短板:对节奏、和弦进行等强时序依赖概念的控制效果仍较弱,其核心控制单元(均值池化的探针)本质上牺牲了时序动态信息,这在未来可能是需要突破的瓶颈。 ...

2026-05-02 · 更新于 2026-08-14 · 2 min · 318 words

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

📄 SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation #音乐生成 #音频生成 #扩散模型 #模型评估 ✅ 7.5/10 | 前25% | #音乐生成 | #扩散模型 | #音频生成 #模型评估 学术质量 7.0/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Hongrui Wang (香港科技大学数学系) 通讯作者:Can Yang (香港科技大学数学系/神经系统疾病国家重点实验室), Yang Wang (香港大学) 作者列表: Hongrui Wang (香港科技大学数学系,*共同第一作者) Fan Zhang (香港科技大学数学系,*共同第一作者,†共同通讯) Zhiyuan Yu (浙江大学CAD&CG国家重点实验室) Ziya Zhou (香港科技大学交叉学科学院) Xi Chen (香港科技大学交叉学科学院) Can Yang (香港科技大学数学系/神经系统疾病国家重点实验室,†共同通讯) Yang Wang (香港大学,†共同通讯) 💡 毒舌点评 亮点:论文精准击中了多轨音乐生成中“节奏打架”这一要害,并给出了“分而治之”的优雅解法(共享模块管节奏,特定模块管音色),提出的三个节奏评估指标(IRS, CBS, CBD)直击FAD指标的软肋,非常实用。 短板:模型架构虽然有效,但创新性主要体现在针对性设计上,基础框架(U-Net, LDM)仍属借用,未在生成模型理论上实现根本性突破。此外,实验主要在Slakh2100这个相对干净的数据集上进行,对于更复杂、更自由的音乐风格,模型的表现有待进一步验证。 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 497 words

Token-Based Audio Inpainting via Discrete Diffusion

📄 Token-Based Audio Inpainting via Discrete Diffusion #音频生成 #扩散模型 #音乐生成 #离散表示 #音频修复 ✅ 7.5/10 | 前25% | #音频生成 | #扩散模型 | #音乐生成 #离散表示 学术质量 5.0/7 | 选题价值 1.5/2 | 复现加成 1.0 | 置信度 高 👥 作者与机构 第一作者:Tali Dror, Iftach Shoham (论文中为共同第一作者) 通讯作者:未说明 作者列表:Tali Dror (Ben-Gurion University of the Negev, School of Electrical and Computer Engineering), Iftach Shoham (Ben-Gurion University of the Negev, Faculty of Computer and Information Science, Data Science Research Center), Moshe Buchris (Ben-Gurion University of the Negev, School of Electrical and Computer Engineering), Oren Gal (University of Haifa), Haim H. Permuter (Ben-Gurion University of the Negev, School of Electrical and Computer Engineering), Gilad Katz (Ben-Gurion University of the Negev, Faculty of Computer and Information Science, Data Science Research Center), Eliya Nachmani (Ben-Gurion University of the Negev, School of Electrical and Computer Engineering) 💡 毒舌点评 本文开创性地将离散扩散模型应用于音频修复,将问题转化为token序列补全,并通过精心设计的span masking和导数损失来模拟音频的连续性,实验结果在长空缺修复上显著超越传统方法,这无疑是其最大的亮点。然而,其性能天花板几乎被WavTokenizer这个“黑盒”tokenizer完全锁死,且训练时的“先tokenize再mask”与推理时的“先mask再tokenize”的不匹配可能引入难以量化的误差,这是两个明显的理论与实践短板。 ...

2026-05-02 · 更新于 2026-08-14 · 3 min · 519 words