Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

📄 Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling 标签:#音乐生成 #自回归模型 #Transformer #多模态模型 #基准测试 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #自回归模型 | #Transformer #多模态模型 | arxiv 👥 作者与机构 第一作者:Ke Zhang(日本高级科学技术研究所,JAIST) 通讯作者:未说明(论文中未明确标注通讯作者) 作者列表:Ke Zhang(日本高级科学技术研究所,JAIST),Chu-Hsuan Hsueh(日本高级科学技术研究所,JAIST),Kokolo Ikeda(日本高级科学技术研究所,JAIST) 💡 毒舌点评 本文最大的亮点在于将符号音乐生成领域成熟的"事件序列"建模范式巧妙迁移到音乐游戏关卡生成这一实际且有趣的应用中,并通过精心设计的ACS指标量化音频信息的独立贡献,视角新颖,分析深入。主要短板在于实验仅在单一商业游戏(maimai)数据集上进行验证,其结论的普适性存疑,且完全忽略关卡的空间布局(位置)信息,使其作为端到端可玩关卡生成系统的实用性大打折扣。此外,论文发表于ICMR 2026(多媒体检索会议),虽属合理但并非顶级ML/AI会议,且未与最新音频编码器(如BEATs、Audio-MAE)或其他token-level生成范式进行对比,削弱了技术贡献的说服力。 📌 核心摘要 本论文发表于ICMR 2026,旨在解决如何将音乐的音频信号与结构转化为可交互的游戏关卡序列的问题。针对主流方法将时间离散化为帧网格、难以显式建模事件间时序关系和长程结构的局限,作者受符号音乐建模(如PerformanceRNN、Music Transformer中的event-based表示)启发,提出一种基于事件令牌序列的音频条件化建模方法。该方法将关卡生成定义为多模态序列到序列问题,以交替的节拍偏移令牌(beat-shift tokens)和游戏事件令牌显式表示动作及其在节拍空间中的相对时序。基于此,作者构建了一个以预训练音频编码器(Whisper-base或MERT)和12层Transformer解码器为核心的模型。实验在maimai游戏数据集(4187个关卡,1018首歌)上进行,结果表明,在主要的事件级评估指标上,该方法(平均事件级F1: 0.527)显著优于代表性的帧级基线方法DDC(0.254)和GeneLive!(0.298),提升约77%。此外,作者通过消融实验和提出的音频贡献分数(ACS)系统分析了音频信息在元数据条件之外的独立作用,发现音频贡献了约58%的性能增益。论文同时报告了极端密度率和循环坍塌率等退化诊断指标,完整模型在这些指标上均表现最优(极端密度率2.1%,循环坍塌率0.4%)。该工作的实际意义在于为音乐游戏关卡生成提供了一种新的、更具事件中心性的建模范式,并提供了分析音频信息贡献的工具。主要局限性包括:实验仅在单一游戏数据集上进行,模型未建模关卡的空间位置信息,且在复杂高难度关卡上事件多样性仍显不足。 ...

2026-07-13 · 更新于 2026-08-14 · 2 min · 397 words

语音/音乐/音频论文速递 2026-07-13

语音/音乐/音频论文速递 2026-07-13 共分析 14 篇论文 ⚡ 今日概览 📥 抓取 14 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #语音合成 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音频理解 1篇 █ #多模态模型 1篇 █ #音视频语音识别 1篇 █ #语音分离 1篇 █ 📊 论文评分排行榜(14 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Tokenizer Transplantation: Mitigating Autoregressive Co 8.8分 前25% 方法研究 #语音识别 🥈 Phone Segmentation and Recognition through Phonological 7.7分 前25% 方法研究 #语音识别 🥉 FreyaTTS Technical Report 7.7分 前25% 系统技术报告 #语音合成 4. ReGen: Hierarchical Multi-Prompt Representation Generat 7.5分 前25% 方法研究 #语音合成 5. Clean2FX: Label-conditioned modeling for clean-to-effec 7.3分 前50% 系统技术报告 #音频理解 6. Event-Based Token Sequences for Audio-Conditioned Music 7.2分 前50% 方法研究 #音乐生成 7. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception 7.1分 前50% 方法研究 #多模态模型 8. Optimal Transport-based Semantic Alignment for LLM-base 6.9分 前50% 方法研究 #音视频语音识别 9. Technical Report for MERL’s Real-TSE Challenge Submissi 6.6分 前50% 系统技术报告 #语音分离 10. SVF-CR: Synchronized Visual-Facial Cross-Refinement for 6.4分 前50% 方法研究 #音视频理解 11. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Fr 6.0分 前50% 方法研究 #音视频理解 12. Wan-Dancer: A Hierarchical Framework for Minute-scale C 5.6分 前50% 方法研究 #音乐生成 13. Tonnetz-Driven Graph Wedgelet for Harmonic Complexity R 5.3分 后50% 方法研究 #音乐理解 14. Immersive Social Interaction with VR and LLM-Assisted H 4.7分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-13 · 更新于 2026-08-14 · 12 min · 2359 words

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

📄 A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents 标签:#语音质量评估 #音频大模型 #模型评估 #基准测试 #工业应用 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ✅ 7.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音质量评估 | #音频大模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:A. Sayyad(Salesforce Applied AI Research, eVerse team) 通讯作者:未说明 作者列表:A. Sayyad(Salesforce Applied AI Research, eVerse team)、J. Emmons(Salesforce Applied AI Research, eVerse team)、S. Jones(Salesforce Applied AI Research, eVerse team)、T. Lin(Salesforce Applied AI Research, eVerse team)、H. Krishnan(Salesforce Applied AI Research, eVerse team) 💡 毒舌点评 这是一篇工业界系统验证的典范之作,其最大价值不在于提出新算法,而在于以罕见的严谨度和透明度,为“LALM-as-judge”这一日益流行的技术范式提供了首个针对复杂全双工对话场景的可靠性证据基线。实验设计堪称教科书级别:多维度、多统计量、包含对抗性测试和跨模型复制,且几乎毫无保留地开源了分析数据与脚本。然而,其贡献本质是“验证”而非“创造”,研究结论严格受限于单一供应商(Salesforce)的生产场景、单一LALM家族(Gemini)以及一个仅3人的人类评判团。论文在摘要和正文中对“45 of 48 cells无显著差异”的表述,在统计效力严重不足的背景下,极易被读者误解为“证明了等效性”,这与其正文附录中坦诚的“underpowered nulls”形成微妙张力,是写作上一个值得商榷的细节。尽管如此,它为后续研究设立了很高的可复现性标杆。 ...

2026-07-10 · 更新于 2026-08-14 · 2 min · 420 words

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

📄 Best-of-N TTS Evaluation is Confounded by ASR Family Alignment 标签:#语音合成 #语音识别 #零样本 #基准测试 #模型评估 8.7/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #模型集成 | #语音识别 #零样本 | arxiv 👥 作者与机构 第一作者:Taehyung Yu(未说明) 通讯作者:未说明 作者列表:Taehyung Yu(未说明)、Seongjae Kang(未说明) 💡 毒舌点评 论文精准地识别并系统量化了TTS领域Best-of-N评估中一个被长期忽视的关键混淆因素——“评估器-验证器家族对齐”,这一发现足以动摇近期众多TTS工作在单一评估器下得出的优化结论,其方法论意义大于具体技术方案。核心短板在于其关键实验仅在一个TTS骨干(F5-TTS)和一个相对干净的数据集(LibriSpeech-PC test-clean)上进行,极大限制了其结论的普适性和所提集成方案的泛化信心;解决方案(排序集成)虽有效,但本质是已有集成思想的合理应用,创新强度有限。 📌 核心摘要 本文系统性地揭示了零样本语音合成(TTS)中Best-of-N(BoN)推理方法的一个关键评估混淆问题:验证器(Verifier,用于从N个候选中选出最佳)的性能表现严重依赖于用于评估它的ASR评估器(Evaluator)是否属于同一“家族”(如Whisper、wav2vec 2.0、HuBERT),导致不同验证器的优劣排名在不同评估器下可能完全反转,且同家族配对能回收2-3倍的Oracle(理想)提升空间。核心方法是进行跨ASR家族的评估器消融实验,并提出两种基于跨家族排序的集成策略(rank-avg和max-rank)来选择候选,以提升评估的鲁棒性。论文的创新点在于首次系统性地量化并分析了这一“家族对齐”效应,通过线性CKA分析排除了表征相似性作为主要原因,揭示其更可能与模型身份或谱系耦合相关。实验表明,在官方Whisper评估器下,最佳单一验证器(distil-v3)可将基线F5-TTS的词错误率(WER)从2.06%降至1.72%(相对下降16.5%);而跨家族排序集成(如rank-avg)在N=10时,能在三个独立评估器上同时取得最优的平均WER 1.61%(相对下降12%),表现最为鲁棒。论文的实际意义在于为TTS社区确立了跨评估器三角验证的评估新实践,并提供了即插即用的工程解决方案。主要局限性在于验证范围较窄(单一TTS系统、单一数据集)且缺乏人类主观评估。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 579 words

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

📄 Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors 标签:#语音属性识别 #多模态模型 #可解释性 #基准测试 #医疗音频 #自监督学习 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音属性识别 | #模型融合 | #多模态模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Vladimir Despotovic (Luxembourg Institute of Health, Bioinformatics & AI, Department of Medical Informatics) 通讯作者:论文中未明确说明 作者列表:Vladimir Despotovic (Luxembourg Institute of Health), Milena Despotovic (Luxembourg Institute of Health), Abir Elbeji (Luxembourg Institute of Health), Petr V. Nazarov (Luxembourg Institute of Health), Guy Fagherazzi (Luxembourg Institute of Health) 💡 毒舌点评 这篇论文的亮点在于将成熟的多模态Mixture-of-Experts架构系统性地应用于语音生物标志物,并结合了两种互补的语音任务和丰富的临床数据,且对门控机制的解释性分析做得相对扎实。主要短板在于整个工作的创新性高度依赖于MoE框架的工程化应用而非方法本身,且核心贡献——数据集和模型完全未开源,严重限制了其影响力和可复现性,使其更像一份详尽的可行性报告而非突破性研究。此外,其声称的“首次”应用值得推敲,因为MoE在其他临床多模态数据中已有探索。 ...

2026-07-10 · 更新于 2026-08-14 · 4 min · 695 words

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

📄 Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks 标签:#Transformer #多模态模型 #模型评估 #数据集 #基准测试 6.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.9/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #多模态模型 | #Transformer | #模型评估 #数据集 | arxiv 👥 作者与机构 第一作者:Nobin Sarwar(马里兰大学巴尔的摩县分校) 通讯作者:未说明 作者列表:Nobin Sarwar(马里兰大学巴尔的摩县分校)、Shubhashis Roy Dipta(马里兰大学巴尔的摩县分校)、Zheyuan Liu(圣母大学)、Vaidehi Patil(北卡罗来纳大学教堂山分校) 💡 毒舌点评 这篇综述最大的亮点在于其“系统第一”的分类视角,试图为跨模态的遗忘学习建立一个从数据到推理的统一技术栈,这比传统的算法中心分类更具工程洞察力。然而,其最大的硬伤在于其宣称的“跨视觉、语言、视频、音频”四大模态覆盖名不副实。尽管框架摆在那里,但对音频和视频模态的方法、数据集、评估的深入剖析和案例分析严重不足,更像是一种为了满足“四大模态”标签而进行的例行列举,而非平衡的深度综述。这使得其宣称的价值大打折扣,尤其对音频/音乐领域的研究者而言,参考价值有限。 ...

2026-07-10 · 更新于 2026-08-14 · 5 min · 954 words

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

📄 Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks 标签:#多模态模型 #基准测试 #数据集 6.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Nobin Sarwar(University of Maryland, Baltimore County) 通讯作者:未说明 作者列表:Nobin Sarwar(University of Maryland, Baltimore County),Shubhashis Roy Dipta(University of Maryland, Baltimore County),Zheyuan Liu(University of Notre Dame),Vaidehi Patil(University of North Carolina at Chapel Hill) 💡 毒舌点评 亮点在于提出了一个“系统导向”的统一分类法,将方法按“干预阶段”和“控制路径”组织,为跨模态比较提供了一个清晰稳定的脚手架,比算法导向的综述更贴近实际部署考量。短板是作为一篇标题涵盖“视频和音频”的综述,其对音频和视频模态的覆盖深度明显弱于视觉和语言,大量篇幅仍聚焦于图像-文本系统,对新兴的音频和视频遗忘方法梳理不够充分,有些“综述其名,视觉为主”。此外,虽提供了分类框架,但缺乏对不同类别方法在相同任务或基准上的性能对比分析或元分析洞察,降低了其指导具体技术选择的直接效用。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 603 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 #音频理解 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute) 通讯作者:未说明 作者列表:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute)、Benjamin Stoler(未说明)、William Chen(未说明)、Chien-yu Huang(Carnegie Mellon University)、Shinji Watanabe(Carnegie Mellon University)、Chris Donahue(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 论文精准地识别了缺乏商业流行音乐多轨转录评估基准这一痛点,并展示了构建该基准的工程野心。然而,作为一份旨在成为“黄金标准”的评估数据集,其核心弱点在于:1) 评估效用被严重限制,因为仅测试了两个模型,且它们均非针对该任务设计或训练;2) 核心产物(音频)因版权限制无法直接提供,迫使使用者依赖外部链接,极大削弱了数据集的可访问性和即刻可用性;3) 数据集本身规模很小(3.5小时),多样性虽被强调,但实际覆盖的“流行”子流派有限。这使得该工作的实际影响力远低于其宣称的意图。 ...

2026-07-10 · 更新于 2026-08-14 · 2 min · 313 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(卡内基梅隆大学) 通讯作者:未说明 作者列表:Nathan Pruyne(卡内基梅隆大学)、Benjamin Stoler(卡内基梅隆大学)、William Chen(卡内基梅隆大学)、Chien-yu Huang(卡内基梅隆大学)、Shinji Watanabe(卡内基梅隆大学)、Chris Donahue(卡内基梅隆大学) 💡 毒舌点评 论文精准命中了自动音乐转录(AMT)领域对真实商业流行音乐进行多轨转录评测基准的空白,其构建的流程(元数据匹配+节拍对齐+人工筛选)严谨且可复用,为社区提供了首个专用基准。然而,最终仅49.1%的成功率揭示了当前跨源对齐技术的根本瓶颈,而3.5小时的规模和强烈的西方音乐偏见限制了其作为通用基准的广度,使其更像是一个高质量但受限的“探路石”。 📌 核心摘要 本文旨在解决自动音乐转录(AMT)模型缺乏针对真实商业流行音乐进行多轨转录评测基准的问题。核心贡献是构建了MulTTiPop数据集,其流程包括:从Lakh MIDI数据集和TheoryTab数据集通过元数据匹配找到潜在对应的多轨MIDI和YouTube音频段;使用基于节拍的动态时间规整(DTW)对齐两者的时间轴;通过融合基线相似度、旋律匹配和YouTube时间戳等多种策略生成候选对齐锚点,最终由人工标注者选择正确的对齐。与已有数据集相比,MulTTiPop首次提供了针对真实商业流行音乐音频的多轨MIDI标注。实验评估显示,当前先进的AMT模型(MT3、YourMT3+)在此数据集上表现不佳,最佳模型的Onset F1仅为38%(精确制式)和37.87%(打击/和声制式),表明该任务存在巨大提升空间。该数据集的实际意义在于为AMT模型在复杂、真实的多轨音乐转录任务上提供了一个有挑战性的评测工具。其主要局限性在于构建成功率不高(49.1%)、数据集规模较小(3.5小时)且存在西方音乐偏见。 ...

2026-07-10 · 更新于 2026-08-14 · 2 min · 301 words

MuScriptor: An Open Model for Multi-Instrument Music Transcription

📄 MuScriptor: An Open Model for Multi-Instrument Music Transcription 标签:#音乐转录 #预训练 #强化学习 #开源工具 #基准测试 8.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐转录 | #预训练 | #强化学习 #开源工具 | arxiv 👥 作者与机构 第一作者:Simon Rouard(Meta) 通讯作者:未说明 作者列表:Simon Rouard(Meta)、Michael Krause(Meta)、Axel Roebel(Meta)、Carl-Johann Simon-Gabriel(Meta)、Alexandre Défossez(Meta) 💡 毒舌点评 论文的实质贡献在于一个高度系统化、工程化的端到端转录系统,而非单一的算法突破。其亮点是“大力出奇迹”策略——通过构建海量(145万MIDI)的合成数据集和中等规模(17万条)的带标注真实数据集,结合多阶段训练范式,并在开源模型权重上做得非常彻底,为社区提供了强大的现成工具。短板同样明显:性能的提升严重依赖于未公开、难以复现的内部数据集(𝒟Real),使得其技术路线的可推广性存疑;在强化学习后训练阶段采用了未经严格理论验证的简化GRPO算法,训练稳定性成疑;且完全回避了计算成本(GPU时长、能耗)的披露与分析,这对于评估其“开源模型”的实际可用性至关重要。 📌 核心摘要 本文旨在解决现有多乐器自动音乐转录(AMT)模型在复杂真实音乐混音中泛化能力差、实用性低的问题。 方法核心是构建名为MuScriptor的解码器-仅Transformer模型,并通过一个包含预训练、微调和强化学习后训练的多阶段流程进行训练。预训练使用大规模动态合成的MIDI-音频对(𝒟Synth),微调使用大规模带标注的真实音乐音频(𝒟Real),后训练则在人工精选的高质量子集(𝒟RL)上使用类GRPO算法进行对齐。模型支持可选的乐器条件输入以增强可控性。 主要贡献在于:发布了一个在多样化音乐风格上表现稳健的开源多乐器转录模型及其完整训练流程;系统研究了合成预训练的有效性与局限性;首次将GRPO算法应用于AMT的后训练优化;提供了乐器条件化推理功能。与MT3、YourMT3+等先前工作相比,本文重心从架构改进转向数据规模与质量。 实验结果表明,完整的MuScriptor模型(1.3B参数)在自建测试集𝒟Test上全面超越基线YourMT3+(例如,Multi F1从21.9提升至48.2),并在多个未参与训练的公开基准数据集上取得显著提升(例如,Dagstuhl ChoirSet的Frame F1从51.0提升至80.7)。消融实验证实了合成预训练在真实数据稀缺时的巨大价值(如仅用1%真实数据时Offset F1从9.9提升至33.4)以及每个训练阶段的累积增益。 本文的实际意义是为音乐信息检索社区提供了一个开箱即用的强大基线模型和工具。 主要局限包括:其tokenization方案无法表示同乐器同音高的重叠音符;模型的高性能依赖于未公开的内部数据集(𝒟Real),外部复现困难;训练和推理的计算成本未披露;RL训练算法的简化(无KL惩罚和重要性采样裁剪)可能带来稳定性风险;缺乏主观听觉评估。 🔗 开源详情 代码:https://github.com/muscriptor/muscriptor 模型权重:已开源(通过上述GitHub仓库发布)。 数据集:未开源。 𝒟Synth:约145万个MIDI文件,来源包括公开(如Lakh MIDI)和商业数据,未提供下载链接。 𝒟Real:17万个真实音乐录音(约11,000小时)及对齐的音符标注,为内部数据集,未公开。 𝒟RL:从𝒟Real中筛选的300首高质量曲目。 𝒟Test:从𝒟Real中筛选的372首高质量曲目。 Demo:未提及。 复现材料:提供了代码、模型权重和主要训练超参数,但缺少完整的训练检查点、用于数据构建的脚本/阈值、以及训练资源信息。 🏗️ 方法概述和架构 本文构建了一个端到端的多乐器音乐转录系统,其核心是将音乐转录任务转化为序列到序列的语言建模问题。系统接收一个5秒单声道音频波形(16kHz)作为输入,输出一段代表该片段内所有乐器音符事件的离散token序列(类MIDI表示)。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 551 words