Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

📄 Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model 标签:#音乐生成 #扩散模型 #自回归模型 #数据集 #音频理解 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #自回归模型 #数据集 | arxiv 👥 作者与机构 第一作者:Zhiwei Lin(未说明) 通讯作者:未说明 作者列表:Zhiwei Lin(未说明)、Jun Chen(未说明)、Boshi Tang(未说明)、Weihao Wu(未说明)、Jing Yang(未说明)、Yaolong Ju(未说明)、Fan Fan(未说明)、Zhiyong Wu(未说明) 备注:论文正文仅标出作者上标编号 1、2、3,未给出机构名称。 💡 毒舌点评 把 LDM 与自回归潜在上下文拼接结合来解决长程符号音乐生成,思路自然,且客观指标确实优于已有基线;但代码和模型权重均未公开,上下文模块没有做有/无的独立消融,长时长实验只验证到 32 小节,论文却宣称能生成“数分钟”一致音乐。这些 claim 目前主要靠 demo 和少量表格背书,审稿人无法直接复现验证。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 667 words

Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance

📄 Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance 标签:#音乐生成 #自回归模型 #音频理解 #Transformer #模型评估 5.0/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.0/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #自回归模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Tristan Wu(香港科技大学(广州)) 其他作者:Ruiji Yu(穆罕默德·本·扎耶德人工智能大学)、Gus Xia(穆罕默德·本·扎耶德人工智能大学) 注:论文脚注标注"Both authors contributed equally to this research.",Tristan Wu 和 Ruiji Yu 为共同贡献作者。 💡 毒舌点评 这篇论文把毛笔变成了AI音乐生成器的遥控器,想法本身充满了文化趣味和舞台想象力。但整个工作更像一个炫酷的艺术装置文档,而非经得起推敲的顶会论文。对于"实时表演"系统最关键的端到端延迟——一个字都没提,这让"低延迟流水线"的核心声明彻底悬空。评估上更是坦率到近乎"躺平":只有一场五分钟的即兴表演和几句观众闲聊,还自己声明这"不构成用户研究"。这种坦诚虽然可贵,但也坐实了系统仍停留在概念验证阶段,离"可靠的表演级系统"还有相当距离。 ...

2026-08-05 · 更新于 2026-08-14 · 1 min · 195 words

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

📄 CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis 标签:#自回归模型 #流匹配 #音频理解 #Transformer #模型评估 7.1/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #自回归模型 | #Transformer | #流匹配 #音频理解 | arxiv 👥 作者与机构 第一作者:Yizhong Geng(未说明) 通讯作者:Ya Li(未说明) 作者列表:Yizhong Geng(未说明)、Tian-Hao Zhang(未说明)、Chunfeng Wang(未说明)、Wenxin Fu(未说明)、Yingming Gao(未说明)、Ruimin Wang(未说明)、Zhou Pan(未说明)、Kun Zhan(未说明)、Liang Li(未说明)、Ya Li(未说明) 💡 毒舌点评 这篇论文用一个巧妙的SCT路由设计漂亮地解决了无配对编辑数据下的“源词泄漏”难题,实验也显示出对离散AR基线的碾压式优势。然而,作者自己报告的高昂推理成本(稳态RTF 5.38)几乎让“连续自回归”的理论优雅性在实用性面前瞬间失色,直接将应用场景锁死在离线处理。此外,评估仅局限于普通话和短编辑片段,其跨语言、跨长度的泛化能力仍是一个巨大的问号。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 318 words

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

📄 dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model 标签:#语音编辑 #自回归模型 #音频理解 #Transformer #模型评估 7.4/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.4/10 | 前50% | 文档类型:模型报告 | 评分置信度:高 | #语音编辑 | #自回归模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Hankun Wang(小红书 dots 团队,上海交通大学计算机科学与工程系 X-LANCE 实验室) 通讯作者:未说明 作者列表:Hankun Wang(小红书 dots 团队,上海交通大学 X-LANCE 实验室)、Bohan Li(未说明)、Shi Lian(未说明)、Xiaoyu Gu(未说明)、Jing Peng(未说明)、Da Zheng(未说明)、Colin Zhang(未说明)、Kai Yu(上海交通大学 X-LANCE 实验室) 💡 毒舌点评 该论文用 XML 标签把语音编辑任务“结构化”成可检查的合约,在指令遵循和局部保真上确实甩开了现有开放模型,想法直击自由文本指令的歧义痛点。但作者迄今只放出来 demo 页面和基础 TTS 模型权重,编辑模型本身仍未开源,对声称的“可检查”接口形成了微妙的反讽;情感编辑和组合编辑的成功率仍处于勉强可用的区间,显然离专业创作需求尚有距离。 ...

2026-08-05 · 更新于 2026-08-14 · 6 min · 1147 words

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

📄 GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model 标签:#语音合成 #强化学习 #流匹配 #自回归模型 #音频理解 8.0/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #强化学习 | #流匹配 #自回归模型 | arxiv 👥 作者与机构 第一作者:Guanrou Yang (1,2, 未说明具体机构) 通讯作者:Xie Chen (1,2, 未说明具体机构, 标注为corresponding author) 作者列表: Guanrou Yang (1,2), Tian Tan (1), Qian Chen (4), Ziyang Ma (1,2), Yakun Song (1,2), Zhikang Niu (1,2), Qi Chen (1,2), Wenming Tu (1), Haitao Li (2,5), Shan Yang (3), Xie Chen (1,2) 注:原文脚注1-5对应不同机构,但具体机构名称在正文中完全未给出,无法获知作者所属单位。 ...

2026-08-05 · 更新于 2026-08-14 · 5 min · 987 words

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

📄 ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition 标签:#语音识别 #自回归模型 #高效推理 #长音频处理 #大语言模型 6.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #自回归模型 | #高效推理 #长音频处理 | arxiv 👥 作者与机构 第一作者:Qingjian Lin(StepFun, 上海) 通讯作者:Fei Tian(StepFun, 上海) 作者列表:Qingjian Lin(StepFun)、Yuxin Li(未说明)、Haoyang Zhang(未说明)、Jun Chen(未说明)、Yechang Huang(未说明)、Feng Tian(未说明)、Xie Li(未说明)、Xiangyu Tony Zhang(未说明)、Daijiao Liu(未说明)、Yuxin Zhang(未说明)、Jinglan Gong(未说明)、Bo Zhao(未说明)、Fei Tian(StepFun)、Xuerui Yang(未说明)、Gang Yu(未说明)、Xiangyu Zhang(未说明)、Daxin Jiang(未说明) 💡 毒舌点评 本文将多Token预测(MTP)用于LLM-based ASR,以可验证的并行解码显著降低实时因子,且接受率高达5.0/6,展示了ASR作为确定性转录任务对前瞻性解码的高度适应性。然而,系统未开源任何代码或模型权重,所有对比限于较为有限的LLM-ASR基线和部分公开测试集,无法充分评估其对主流强基线(如Whisper large-v3)的真实优势;训练数据中的大量私有成分也让外部验证几乎不可能。此外,与常规推测解码的性能和效率对比缺失,使得其“MTP是天然加速范式”这一核心立论的证明力度不足。 ...

2026-08-03 · 更新于 2026-08-14 · 3 min · 498 words

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

📄 Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens 标签:#语音合成 #自回归模型 #语音编码 #音频理解 #Transformer 5.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 📝 5.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #自回归模型 | #语音编码 #音频理解 | arxiv 👥 作者与机构 第一作者:Yi Luo(哥伦比亚大学 / 字节跳动 Seed) 通讯作者:Yi Luo(哥伦比亚大学) 作者列表:Yi Luo(哥伦比亚大学 / 字节跳动 Seed)、Rongzhi Gu(字节跳动 Seed)、Jixun Yao(字节跳动 Seed) 💡 毒舌点评 这篇论文在“低帧率连续token”这个方向上尝试进行几何分析与联合设计,特别是对球面空间扰动和低维流形的分析有一定启发性。然而,实验部分完全回避了与主流语音编解码器(如EnCodec, SpeechTokenizer)的重建对比,生成结果上的说话人相似度(SIM)指标显著落后却未做深入分析。最关键的是,论文完全不开源任何代码、模型或数据,这在一项声称旨在优化AR生成稳定性和实用性的工作中,其可复现性和实际影响力构成了根本性的障碍。 ...

2026-08-03 · 更新于 2026-08-14 · 4 min · 747 words

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

📄 VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition 标签:#歌唱生成 #自回归模型 #语音合成 #扩散模型 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #歌唱生成 | #自回归模型 | #语音合成 #扩散模型 | arxiv 👥 作者与机构 第一作者:Yukun Chen(Nanyang Technological University, Singapore; 未说明具体院系) 通讯作者:未说明 作者列表:Yukun Chen(Nanyang Technological University; 未说明具体院系)、Tianrui Wang(Nanyang Technological University; 未说明具体院系)、Zhaoxi Mu(未说明)、Xinyu Yang(未说明)、EngSiong Chng(Nanyang Technological University; 未说明具体院系) 💡 毒舌点评 这篇论文瞄准了歌唱合成(SVS)从“实验室demo”走向“作曲家工具”的核心痛点,提出了完全基于符号乐谱、无需显式时长预测的 VoclRender 系统。数千小时级的工程化数据构建和精巧的交错式提示设计,确实让人眼前一亮。 但它的实验设计存在硬伤:在决定其核心卖点“节奏与音高控制”的客观指标 IOU 和 RPA 上,VocalRender 几乎全面输给依赖时间对齐引导的 SoulX-Singer。作者试图用精心设计的主观测试(CMOS/MS-MOS)来证明自己“主观听感更好、更自然”,但这无法弥补“抛弃时长预测是否带来了更可控的艺术表达”这一核心命题在定量论证上的缺失。更致命的是,其巨大模型和数据集均未公开,导致所有声称的“SOTA”结果都成了无法被外界验证的空中楼阁。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 689 words

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

📄 Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription 标签:#音乐转录 #自回归模型 #低资源 #模型评估 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自回归模型 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Ting-Kai Hsu(国立台湾大学通信工程研究所) 通讯作者:未说明 作者列表:Ting-Kai Hsu(国立台湾大学通信工程研究所)、Wei-Chin Wang(国立台湾大学电机工程学系)、Kai-Xi Hong(国立台湾大学电机工程学系)、Yu-Hua Chen(国立台湾大学网络与多媒体研究所) 💡 毒舌点评 这篇论文在解码器目标端显式加入NOTE_ON/OFF事件,让transformer直接建模音符边界,这一设计直观有效,尤其在小样本Leduc数据集上避免了灾难性过拟合,97.57个百分点的提升确实亮眼。但文章仅与一个重训的Fretting Transformer比较,既没有和MIDI-to-Tab等近期序列标注方法交手,也缺少对NOTE_ON、NOTE_OFF、正则化等组件各自的消融实验,实验说服力大打折扣。承诺开源但代码未落地,优化器、学习率、batch size等核心训练配置全部缺失,复现基本靠猜。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 369 words

GraphIDyOM: A graph-native Python reimplementation of IDyOM for musical expectation modelling

📄 GraphIDyOM: A graph-native Python reimplementation of IDyOM for musical expectation modelling 标签:#音乐理解 #自回归模型 #开源工具 #模型比较 #音频理解 7.8/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐理解 | #自回归模型 | #开源工具 #模型比较 | arxiv 👥 作者与机构 第一作者:Lluc Bono Rosselló (Institute for Interdisciplinary Studies on Artificial Intelligence (IRIDIA), Université Libre de Bruxelles, Brussels, Belgium) 通讯作者:未说明 作者列表:Lluc Bono Rosselló (IRIDIA, Université Libre de Bruxelles) 💡 毒舌点评 这篇工作将经典 IDyOM 的记忆结构显式图化,在可解释性和交互性上迈出了聪明的一步。但严格来说,其核心数学模型未变,贡献集中在工程实现与表征创新。更关键的是,验证仅局限于巴赫众赞歌这一种体裁,让“通用音乐期望平台”的说法显得底气不足。 ...

2026-07-29 · 更新于 2026-08-14 · 3 min · 590 words