英文题目:CTMusic: A Traditional Chinese Instrumental Music Dataset Towards Text-to-Music Generation

会议身份:conference:interspeech:2026:conference-paper-id:zhang26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #音乐 #音乐生成

评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yimin Cao:机构信息未能从会议 PDF 纯文本可靠映射
  • Haotian Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Bin Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Han:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

文本到音乐生成以自然语言描述为输入、以波形音频为输出,在传统中国器乐上受困于高质量录音分散稀缺、代表性乐器风格选择难与文化化描述规范难。作者先双源采集数字专辑与Bilibili短视频并经时长过滤、预训练音频网络去人声噪声与人工复核,独奏施加单主奏约束、长曲按乐句手工切分至400秒内并统一至44.1 kHz与负14 LUFS,得到约42小时语料。再由民乐专业毕业生按三段式模板撰写乐器印象、客观进行与情感用途描述,经校准与退修后对合奏子集用DeepSeek-V3改写扩充并人工校验,一致性描述进入下一步配对训练。接着采用独奏到合奏两阶段渐进微调,先学干净音色再学多乐器交互,基座Stable Audio Open全自注意力与交叉注意力用LoRA微调,新加TTT层从头训练。与整体微调基线不同,SA-TTT在24块扩散变换器中每四块末块稀疏插入双向测试时训练层并以小初值门控,以增强装饰音与动态细节调制能力。在独奏子集测试集评测下,SA-TTT的FDopenl3指标为170.44,低于SA-pretrained的FDopenl3指标为315.23。该结论适用边界受限于12种乐器独奏与合奏短片段,声乐戏曲与长时结构外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么、要输出什么、为什么民乐文本生成特别难?

这篇解读的输入是论文正文给出的确定性证据与两张官方原图像素,目标是让刚进入语音音乐音频方向的研究生能核对每一步并复述方法,必须保留的关键信息包括数据来源与过滤动作、标注模板与改写范围、划分数量、冻结与更新的参数、2 阶段顺序、评价指标方向与主结果数字,输出是 1 篇按学习依赖展开的中文技术说明。本文默认从原文独立写作,不引入外部评价。

论文研究的任务是文本到音乐生成,也就是给定一段自然语言描述,模型要直接生成一段与之对应的可听波形。与符号生成先输出乐谱再合成不同,这里要求端到端输出音频,提示词要能控制出现哪件民族乐器、是独奏还是合奏、情绪与适用场景是什么。初学者容易把这个任务理解为给模型丢一堆民乐录音就能学会,原文指出真正的瓶颈是缺少文本与音频配对的数据。

已有生成模型多在西方电子、流行、摇滚上训练,有研究量化指出非西方体裁只占现有音乐数据集总时长的百分之几,直接导致模型对中国传统音乐的生成能力受限。 对中国传统器乐而言,困难还更具体。高质量录音分散在数字专辑与短视频平台,没有单一集中仓库;代表性乐器与演奏风格要选得全;描述要写准音色、旋律、节奏变化,还要有文化分寸,不能把主观情绪塞进客观进行段。

论文因此把工作聚焦在器乐这 1 核心代表性类别,合奏只做器乐组合,不涉及人声。资源状态显示项目页当前可用,论文称这是首个专为该任务做的文本音频配对资源,初学者应把可用理解为链接在本次检查中可达,而不是永久保证。 一个可复述的样本走法是这样:取一段二胡独奏长录音,先切成不超过 400 秒且不拦腰切断乐句的片段,重采样到 44.1 千赫兹并把响度归一到负 14 响度单位,专家按 3 段模板写出乐器印象、客观发展、情感用途,再与音频组成 1 对。

生成时把文本送入冻结的文本编码器得到嵌入,与时间条件一起指导扩散主干从随机隐变量去噪,最后由解码器转成波形。后面各节按任务与路线、方法全景、组件计算、构造训练、实验条件、结果反证、复现收束展开。

同输入同目标的工作在比什么、本文补了哪块?

按同输入、同目标、同监督、同运行阶段来对照,文本到音乐生成主要有 3 条路线。第一是自回归路线,以 MusicLM 与 MusicGen 为代表,先把音频量化成离散符号再用语言模型做序列建模,最后由解码器重建波形,优点是控制灵活,代价是生成较慢。第二是非自回归并行解码,以 MAGNeT 为代表,用掩码建模 1 次并行出多个位置,目标是加速并保持质量。第三是扩散路线,以 Mousai、AudioLDM2 与 Stable Audio 系列为代表,多在自编码器隐空间做去噪,本文选用的 Stable Audio Open 即属此类,它用变分自编码器、文本编码器与扩散 Transformer 的组合工作。

在民乐一侧,已有工作并不与本文同条件可比。视频条件生成中国风音乐用的是视频输入而非文本输入;MusicMamba 做的是符号域旋律生成而非直接波形生成;CCMusic 与 ChMusic 服务于分类与检测而非文本生成。这些差异意味着不能把类别不同的数字直接当胜负,只能说它们没有解决从文本描述直接生成民乐音频的核心挑战,原因正是缺少专用配对数据。

本文补的是数据与验证闭环:先给出 741 对超 42 小时的文本音频配对,覆盖独奏与合奏,再用同一基座在同一划分上做微调对照,证明数据能让模型学会原来不会的分布,最后加一个轻量结构改进看能否更好捕捉民乐细节。初学者要记住,相关性不等于因果,预训练模型在民乐上差不能直接归因于某一种乐器缺失,论文也只报告整体分布差距,没有做按乐器的消融归因。

要解决的问题与评测时算赢的标准是什么?

形式化地说,输入是一段 20 到 148 词的英文描述,输出是一段 24 到 400 秒的 44.1 千赫兹音频,监督来自人工配对的文本音频对,目标是生成音频在分布上接近真实民乐录音且在语义上遵从提示词。论文把成功拆成两个可测方向:分布相似度用 FDopenl3 与 KLpasst 衡量,数值越小表示生成与参考越接近;文本遵从用 CLAPscore 衡量,数值越大越好;再加人工听感的总体质量与文本对齐两项 5 分制平均意见分,同样越大越好。

举例来说,若提示词写结合唢呐、笙与钹的合奏,模型应在音色上出现对应乐器的明亮与簧片特征,在织体上体现多声部进入顺序,在用途上不偏离 ceremonial 这类庄重场景。教学例子仅为帮助理解,不代表论文用过完全相同的句子。 算赢的标准在论文中是相对比较:在独奏测试集与合奏测试集上,微调模型要全面优于冻结预训练基座,改进模型要再优于普通微调。

需要注意,数值相同不代表同一指标,不同指标的差值不能混放,自动指标不能当人评,百分点与相对百分比也不同。本文所有比较都保留实际可运行的策略,没有用搜索最优或事后最优代替可部署收益。

从采集到可训练文本音频对的全景分哪几步?

全景可分为采集、过滤、预处理、标注 4 段,数据流始终是一条主线加 1 次文本分叉。采集从两类互补来源开始,一类是专业机构在流媒体上发布的公开数字专辑,录音环境干净,适合学核心音色;另一类是以哔哩哔哩为代表的短视频平台,有专业演奏者、民间艺人与音乐学院学生的多样演奏,适合补多样性。两路汇成初始语料库后进入机器加人工过滤,再进入统一规格预处理,最后进入专家标注与合奏改写,形成文本音乐对。

下面导读图 1 的阅读方法:先抓住左右箭头的主路径,再看每个框内的排除项与归一化动作,最后看标注框内从专家到大模型再到文件的汇合方式,这样就不会把改写误认为新增了音频。

看图路径: 1. 先从左到右跟随从数字专辑与视频平台到音频语料库的主箭头;2. 再看中间裁剪与重采样响度归一化框如何收窄为统一规格;3. 最后看右侧专家标注分叉到大语言模型增强再汇入标注文件的两条路径

原论文 Figure 1:Pipeline for creating CTMusic: Audio data was collected from two complementary sources, filtered…

论文图 1。原论文 Figure 1:“Pipeline for creating CTMusic: Audio data was collected from two complementary sources, filtered by both automated scripts and human reviewers, and then standardized through…”。

图 1 把上述流程画成 4 个框。左侧采集框上方并列数字专辑与视频平台图标,下方用红叉标出短于 20 秒、含人声、含噪声 3 类排除项,再经机器与人工过滤图标指向音频语料库文件夹;中间预处理框用剪刀示意裁剪,下方标注重采样与响度归一化;右侧标注框上方是波形与专家批注气泡,中间红色小框单独圈出合奏标注并分叉,一路直达标注文件,一路经大模型改写气泡再汇入标注文件,最右是文本音乐数据库图标。像素能确认的是模块位置与箭头走向,不能从颜色深浅读出数量比例,数量以后文表格与正文为准。

生成底座里谁管文本、谁管声音、TTT 层插在哪里?

Stable Audio Open 由三部分组成。第一是变分自编码器,负责波形与隐变量之间的压缩与重建,生成末端由它的解码器把去噪后的隐变量转回波形,该解码器在微调时保持冻结。第二是预训练的 T5-base 文本编码器,负责把自然语言转成文本嵌入,全程冻结。第三是扩散 Transformer 主干,共 24 个 Transformer 块,负责在文本嵌入、时间条件与扩散步数信号的共同指导下,从随机隐变量逐步去噪得到最终隐表示。时间条件示例为 0 与 47 的起止标记,步数经多层感知机注入后与噪声路径相加进入主干。

改进模型称为 SA-TTT,它不动整体三件套,只在主干内部稀疏插入测试时训练层。具体位置是在 Transformer 块的交叉注意力之后:音频表示先经自注意力获得长程内部上下文,再经交叉注意力注入全局文本语义,此时插入 TTT 层,用其表达力强的隐状态对音频表示做细粒度调制,目标是生成更贴合文本且细节更丰富的民乐。为防随机初始化的新层破坏预训练,主干在该处加了一个初值为 0.1 的可学习门控向量,并对扩散的非因果特性做了双向处理。

稀疏策略是每连续 4 个块只在最后一个块改成 Transformer-TTT 块,24 块中共形成 6 个此类块。

文本到音乐生成 × Stable Audio Open: 文本到音乐生成负责把自然语言描述映射为可听的波形输出,强调按提示词控制乐器、情绪与用途;Stable Audio Open 负责提供可复用的生成底座,分工是变分自编码器管波形与隐变量互转、T5-base 管文本嵌入、扩散 Transformer 管去噪生成,二者搭配的理由是前者定义任务接口、后者提供已在大规模数据上学到的音频先验,组合意义是只需在 CTMusic 上做适配微调就能把通用生成能力转向中国传统器乐的音色与织体。

低秩适配 × 测试时训练层: 低秩适配负责以少量可训练低秩矩阵调整冻结大模型的自注意力与交叉注意力,分工是保留原有权重只学增量;测试时训练层负责用表达力更强的隐状态对序列做细粒度动态调制,分工是增强对装饰音、织体变化与长程细节的刻画,二者搭配的理由是前者省参数防破坏预训练、后者补容量学民乐特有细节,组合意义是在 SA-TTT 中形成冻结加增量加新层从零训练的混合更新路径。

下面导读图 2 的阅读方法:左侧看冻结与可训练的图例分工,中间看普通块与 TTT 块的间隔出现,右侧放大部分看门控与残差如何包裹新层。

看图路径: 1. 先看左侧冻结的文本与时间条件分支如何注入中间扩散主干;2. 再看中间蓝色普通块与黄色 Transformer-TTT 块的交替位置;3. 最后看右侧放大部分中 TTT 层与门控插在交叉注意力之后、前馈之前

原论文 Figure 2:An overview of the SA-TTT architecture.

论文图 2。原论文 Figure 2:“An overview of the SA-TTT architecture.”。

图 2 左侧粉色为冻结的时间条件器、多层感知机、T5-base 与底部变分自编码器解码器,蓝色为主干普通 Transformer 块,黄色为 Transformer-TTT 块,文本示例明确写结合唢呐、笙与钹;右侧放大部分自上而下是层归一化加自注意力、层归一化加交叉注意力、TTT 层加门控、层归一化加前馈,每处残差相加清晰可见,火焰图标表示可训练,雪花表示冻结,其中自注意力、交叉注意力与 TTT 加门控为可训练,前馈与各层归一化及左侧条件分支为冻结。像素能确认的是插入顺序与冻结可训练划分,不能读出具体参数量,参数更新范围以正文训练节为准。

数据怎样建成、两阶段怎样训、谁冻结谁更新?

数据建成先做过滤。机器脚本先去掉短于 20 秒的片段,并用 PANNs 去掉含人声或噪声的音频;剩余文件再经团队成员人工复听去掉漏网的人声与噪声;独奏子集要求主旋律由单件民族乐器担任,合奏不设此限。过滤后约得 42 小时精选音频。

对过长超过 20 分钟的曲目,作者手动切成 400 秒以内的短片段,切分时尽量不从乐句中间切断以保乐句完整;全部重采样到 44.1 千赫兹,再做响度归一到负 14 响度单位,以缓解多源响度差异。

独奏子集 × 合奏子集: 独奏子集负责提供音色干净、变化较少的单乐器样本,分工是先建立对 12 种乐器基音色与旋律形态的基础认识;合奏子集负责提供多乐器交织、动态织体复杂的样本,分工是再学习乐器间配合与层次变化,二者搭配的理由是先易后难降低直接学合奏的难度,组合意义是支撑 2 阶段渐进训练,先在独奏上打底再在合奏上学交互。

标注由 3 名音乐学院民乐专业毕业生承担,每人有五年以上训练演奏经验。标注前先做校准会对齐模板理解,写完后由论文作者逐条对照模板检查完整性与事实准确性,不合格退回重写。模板固定为 3 段:第一段一到两句讲乐器种类与整体印象;第二段两到三句客观讲进行与变化,聚焦音色、旋律、节奏,避免主观情绪;第 3 段一到两句讲传达的情感与可用场景。

写完后发现独奏描述较简洁、合奏因多乐器交织而较长,且合奏样本少,于是用非对称增强,只对合奏子集用 DeepSeek-V3 做同义转述,每段合奏多得一条改写描述,共新增 140 条,全部经人工核对语法与语义一致。生成式工具披露还提到 GPT-5.2 仅用于语言润色,不参与数据构造。

专家标注 × 大语言模型改写: 专家标注负责由有五年以上民乐训练演奏经验的音乐学院毕业生按 3 段式模板写出乐器印象、发展变化与情感用途,分工是保证文化准确与事实正确;大语言模型改写负责仅对数量较少的合奏描述做同义转述以增加文本多样性,分工是扩充配对而不新增音频,二者搭配的理由是专家保质、大模型补量,组合意义是合奏每段音频同时配原文与改写文并经人工核对语法与语义一致后再入库。

训练采用 2 阶段渐进。第一阶段在独奏子集上微调预训练模型,先学干净音色与旋律特征;第二阶段把第一阶段得到的模型再在合奏子集上微调,学乐器间交织与动态织体。Stable Audio Open 侧微调全部自注意力与交叉注意力层,用秩为 128 的低秩适配,其他参数冻结;SA-TTT 侧对应层同样低秩适配,新加 TTT 层从零训练。

优化器为 AdamW,低秩参数学习率 5 乘 10 的负 5 次方,TTT 参数学习率 1 乘 10 的负 4 次方,批量 16,第一阶段 14000 步,第二阶段 6000 步。划分上独奏随机取 60 段做测试集,每件乐器各 5 段,其余训练;合奏随机取 30 段做测试集,其余训练,且训练时每段合奏音频同时配原文与改写文。 下表整理数据集规模,比较问题是独奏与合奏在样本量与文本长度上是否不对称,公平条件是同一套过滤预处理与同一模板,指标方向是样本量与时长越大覆盖越全、描述词数反映复杂度。

子集样本量总时长说明文本特点
独奏601 段左右超 42 小时中的主体12 种乐器较简洁,均值约 25 词
合奏140 段约 7 小时多乐器组合较长,均值约 115 词
总计741 对超 42 小时独奏加合奏均值约 42 词,20 到 148 词

表后解释:总量 741 对与超 42 小时是论文反复强调的规模证据,支持其作为首个专用配对资源的说法;代价是不对称依然存在,合奏仅 140 段且依赖改写补文本多样性而非新增音频,长尾组合覆盖有限;未胜出项是单乐器平均约 50 段、每乐器 1.72 到 4.19 小时,分布大致均衡但并未严格相等,复现时不能假设每类等量。

下表整理训练配置,比较问题是在相同步数与批量下低秩与新层是否同等更新,公平条件是 2 阶段顺序一致,指标方向是学习率与步数按原文执行而非自行调大。

阶段训练数据低秩秩学习率步数与批量
阶段 1独奏训练集128低秩 5 乘 10 负 5 次方14000 步,批量 16
阶段 2合奏训练集原文加改写128TTT 层 1 乘 10 负 4 次方6000 步,批量 16
测试划分独奏 60 段合奏 30 段冻结其余参数AdamW 优化器每乐器各 5 段独奏测试

表后解释:该配置的主要收益是只动注意力低秩增量加 6 个 TTT 块,既保留预训练先验又补民乐细节。

具体代价是 TTT 从零训练需要更高学习率且集中在第二阶段学复杂织体,若数据有误容易放大;反例是若跳过第一阶段直接训合奏,论文未报告该消融,初学者不应断言必然更差,只能说原文未验证该路径。

测什么、与谁比、在什么划分与指标下比?

实验要回答两个问题:CTMusic 能否让通用模型学会原来不会的民乐分布;加入 TTT 层后能否在保持文本遵从的同时进一步提升细节。比较对象固定为 3 个实际可运行策略:预训练 Stable Audio Open 记为 SA-pretrained,不做任何民乐微调;普通低秩微调记为 SA-LoRA;加 TTT 层的改进记为 SA-TTT。

后两者共享同样的 2 阶段顺序与低秩配置,区别仅在于后者多了 6 个从零训练的 TTT 加门控分支。 划分与协议按训练节执行:独奏 60 段测试、合奏 30 段测试,阶段 1 在独奏测试集上评,阶段 2 在合奏测试集上评。客观用 FDopenl3 与 KLpasst 看分布差距越小越好,用 CLAPscore 看提示词遵从越大越好;主观请 20 名未参与本研究的被试打总体质量与文本对齐的 5 分制平均分,其中三分之一有音乐或民乐学习经历。代表性生成样本放在项目页可听,但本文只依据正文数字做判断。

下表整理评价条件,比较问题是客观与主观是否同向,公平条件是同一测试划分与同一提示词,指标方向已在上段明确。

评价维度指标方向被试与规模阶段
分布差距FDopenl3,KLpasst越小越好参考音频对照阶段 1 独奏,阶段 2 合奏
文本遵从CLAPscore越大越好提示词对照2 阶段均评
人工听感总体质量,文本对齐5 分制越大越好20 人,三分之一有民乐背景2 阶段均评

表后解释:该设计的收益是客观分布、客观对齐、主观听感三方互补,避免只看分布像不像。

代价是主观仅 20 人且仅三分之一有民乐背景,对细微装饰音的辨别力有限;未评测边界包括延迟、显存、推理步数与误判率,论文未报告这些成本,复现时需另行测量,不能从分数推定更快更省。

微调带来了多大变化、TTT 又加了多少?

客观结果显示两个层次。首先是 SA-LoRA 全面优于 SA-pretrained,说明在 CTMusic 上微调能让模型有效适配原来不擅长的民乐分布,也反衬预训练在该域能力有限,这支持建设非西方专用数据集的必要性。其次是 SA-TTT 在所有客观指标上再优于 SA-LoRA,且在独奏与合奏两个阶段都成立,说明 TTT 层有助于在不同复杂度下捕捉声学与风格特征,提升分布相似度与文本对齐。

分布相似度 × 文本对齐度: 分布相似度负责衡量生成音频与真实录音在特征分布上的接近程度,分工由 FDopenl3 与 KLpasst 承担数值越小越好;文本对齐度负责衡量音频是否遵从提示词的乐器与内容要求,分工由 CLAPscore 与主观 TA 承担数值越大越好,二者搭配的理由是只像不准或只准不像都不算成功生成,组合意义是论文同时报告两类指标并用主观总体质量做交叉印证。

主观结果与客观同向。SA-LoRA 在总体质量与文本对齐上高于预训练,说明微调改善了可感质量与提示词相关性;SA-TTT 进一步产生更丰富细腻的细节,得分再提升。论文把这解读为 CTMusic 支持有效域适配、TTT 有助于生成民乐的证据,措辞上属于有限解释而非因果证明,因为没有按乐器或织体做细粒度归因。 需要提醒的是总体趋势不等于每组每步都成立,阶段 1 与阶段 2 的绝对值不可直接跨阶段比大小,因为测试集不同。

不同指标的差值也不能混放,更不能把自动分当人评分。若要复述关键数字,应回到原表逐格核对数据集、阶段、指标与聚合对象,本文因原表无可选绑定而不在此硬写逐格小数,改用条件表保证可核对,细节数字以原文表 3 为准。

若拿掉关键安排、换成更难条件会怎样?

论文没有给出传统意义上逐个拿掉时间条件、门控或双向处理的消融表,因此不能补写拿掉后必然怎样。最接近消融的是三策略递进:预训练对普通微调可视为有无 CTMusic 适配的对照,普通微调对 SA-TTT 可视为有无 TTT 层的对照。两处都是后者全面占优,且跨独奏与合奏 2 阶段保持,这比单阶段单指标更有说服力。 另一个隐含对照是渐进顺序本身:先独奏后合奏的理由是先学干净音色再学复杂交互,合奏训练时每段音频配两条文本也增加了文本侧的重复曝光。

若改为直接混训或先合奏后独奏,论文未报告结果,属于缺项而非技术错误,复现者若要补,应固定秩 128、学习率与步数,只改顺序与配对方式,并同时报告分布与对齐两类指标。 失败条件方面,原文明确的过滤动作本身就是反例收集:短于 20 秒、含人声、含噪声被机器与人工两道去掉,过长则切分而非丢弃。标注不合格退回重写、改写后人工核对,也说明质量门禁真实发生过。若放宽这些门禁,分布指标很可能变差,但论文未量化该幅度,只能定性指出门禁的必要性。

还有哪些没测、不能承诺、易误解的地方?

第一是规模与覆盖。741 对超 42 小时相对通用音乐数据集仍然较小,合奏仅 140 段音频,改写只扩文本不扩音频,长尾乐器组合与地方风格覆盖有限,未来计划扩规模与乐器覆盖并探索自动标注。初学者不应把首个专用数据集理解为已完备,它解决的是从无到有,而非从有到全。 第二是评价边界。主观仅 20 人,民乐背景者约三分之一,对 ornament 这类细微装饰的敏感度未经校准。

客观指标的特征提取器本身多在西方数据上训练,其对民乐分布差距的刻度是否完全公平,论文未讨论。训练推理成本、显存、延迟、输出帧率均未报告,不能承诺 TTT 在改善质量的同时不增加开销,实际上新增 6 个块与从零训练必然带来额外计算,稀疏插入只是权衡而非消除。 第三是易误解点。冻结参数不等于输出确定,扩散采样仍有随机性;无训练的部件如文本编码器与解码器不代表系统确定。

低秩只动注意力而其他冻结,不能推定模型已学到全部民乐知识;改写经人工核对不等于与专家原文等价,复现时应保留原文与改写分别评测。原文表头图注若有冲突应标注冲突,本文未发现核心数字冲突,但跨阶段绝对值不可比已在结果节强调。

要复现应先准备什么、按什么顺序跑?

先确认资源与信息条件。项目页在本次检查中可用,可取标注样本、许可与与其他中文音乐数据集的比较;若链接未来不可达,应写本次未能确认可达而非断言下线。代码开源、权重下载与系统可运行是三件不同的事,论文只明确数据公开与基于 Stable Audio Open 微调,没有给出完整训练代码仓库,复现前应先区分数据可得与代码可运行。

数据侧按采集过滤预处理标注 4 步重放:收两路音频,去短于 20 秒、含人声噪声,独奏限单主奏乐器,长文件手动切到 400 秒内且不切断乐句,重采样 44.1 千赫兹、响度归一负 14 响度单位;请有民乐背景的标注者按 3 段模板写作并做校准与作者复核;如需增强,仅对合奏做同义转述并人工核对,不新增音频。划分固定为独奏 60 段每乐器 5 段测试、合奏 30 段测试,其余训练,合奏训练每音频配两条文本。

模型侧先跑通预训练基座的文本到隐变量到波形链路,再做 SA-LoRA 2 阶段微调,秩 128、批量 16、AdamW、低秩学习率 5 乘 10 负 5 次方、14000 加 6000 步;确认分布与对齐双升后,再在每四块最后一块插入 TTT 加 0.1 初值门控并做双向处理,共 6 块,TTT 学习率 1 乘 10 负 4 次方从零训练。评价时固定同一测试集与提示词,同时报告 FDopenl3、KLpasst、CLAPscore 与 5 分制总体质量文本对齐,并记录硬件与耗时以补论文缺项。何时值得尝试是当目标明确为中国传统器乐且能接受小规模域适配成本时;还需补的验证是按乐器拆分、跨风格泛化与成本测量。

一句话收束:数据补了什么、模型改了什么、下一步看什么?

收束全文,数据补的是文本到中国传统器乐波形生成的首个专用配对缺口,用双源采集、机器加人工过滤、统一预处理、专家 3 段标注与合奏改写得到 741 对超 42 小时覆盖 12 种独奏乐器与多组合合奏的资源;模型改的是在冻结通用底座上用 2 阶段低秩适配先独奏后合奏,再以稀疏插入的门控 TTT 层增强对装饰与织体细节的调制;证据是 2 阶段上微调超预训练、TTT 再超普通微调且主客观同向;代价是合奏仍少、主观规模小、成本未报告。

下一步应看更大规模与更广乐器覆盖下的保持性、自动标注保质方法,以及补上延迟显存与按乐器细分的验证,初学者复述时紧扣输入表示组件目标输出的单样本链路,就能不依赖修辞讲清这项工作。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总