舞者身体如何实时转向音乐 Transformer:Con Moto 的可配置代理
Con Moto 针对舞蹈即兴中音乐连贯与低延迟难兼得的问题,用推理时掩码转向加 Max/MSP 与 Ableton 后渲染的双层控制连接身体与模型,并在约 70 人现场十分钟双人演出与 6 人问卷中显示可切换乐器与伙伴感知,其代价是实时多乐器密度受限且末段需离线生成。
Con Moto 针对舞蹈即兴中音乐连贯与低延迟难兼得的问题,用推理时掩码转向加 Max/MSP 与 Ableton 后渲染的双层控制连接身体与模型,并在约 70 人现场十分钟双人演出与 6 人问卷中显示可切换乐器与伙伴感知,其代价是实时多乐器密度受限且末段需离线生成。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。
论文在预训练多轨音乐 Transformer 上用均值差提取音高与时值方向并以系数加偏做推理期操控,以无条件与强条件延续实验验证线性可控性,并用格拉姆施密特正交缓解双属性纠缠,但大强度与极端下行仍带来质量退化。
该研究让 98 名新手用 MMM-Cubase v2 和 Calliope 完成 16 小节编配任务并测量可用性、体验与接受度,最强证据是两系统 SUS 均超 70 且未来使用意愿超七成,代价是控制深度不足、作者感低与透明度缺失。
该研究用树莓派加 MIDI 连接现成乐器的智能乐器平台和小数据混合密度循环网络做两年第一人称演出,报告显示最便宜硬件推理小于 5 毫秒且重映射可替代重训,但证据限于作者一人 15 场演出而未做对照听感评估。
针对波斯单声部微分音旋律生成问题,PerFormer 用位置—音高—时值事件序列加编解码 Transformer 与主音参考建模长程调式关系,在可调性准确率 90.18% 对 34.71% 和听感四项指标上超过一阶马尔可夫基线,代价是数据集仅 33 首原曲并集中于单一调式与 6/8 节拍且节奏有拉长简化倾向。
该文把欧几里得节奏与方向性旋律遍历做成可在 Pure Data 中多实例叠层的 MIDI 音序器,用两次第一人称即兴回答可演奏性问题,最强证据是双实例下手势与结果的即时可读性与四实例下受约束调制对复杂度的缓解,主要代价是复调层数增加带来的感知负荷与旋律多样性受限。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对符号音乐中音符属性被强加固定单向顺序的问题,Amadeus 采用音符级自回归加属性级双向离散扩散的两级架构并引入 CIEM,在 AMD 大规模数据上以 16.23 notes/s 实现文本条件与可控生成的提升,代价是扩散步数与速度需权衡且数据存在风格偏置。
针对长序列符号音乐自回归生成中误差累积导致结构漂移的问题,论文提出先预测块级语义再重建音符细节并用已生成块回嵌为锚的循环范式与分草图细化的层次框架,最强证据是预测特征与真值余弦距离平均降低 34.7% 且长序列主客观评价接近真值,代价是钢琴卷表示压缩可能丢失细微时值与目前主要面向钢琴。
针对标准 LZ 压缩倾向于整段拷贝训练数据的问题,该文用限制每棵树训练数据量来缩短平均序列长度、用多步不回根来加长平均序列长度,并在 MAESTRO 约 200 小时钢琴 MIDI 音高数据上验证了控制方向,代价是省略节奏导致机械感与长序列带来的逐字拷贝风险仍需抄袭检测来界定。
论文研究给定旋律灵感与段落标签生成结构化乐段的问题,用结构三元组数据与双实例对比优化让小模型在结构契合上大幅超过直接提示与常规微调,但代价是依赖 POP909 流行乐标注与多轮构造流程且未建模整曲跨段发展。
针对自由文本到 MIDI 语义对齐不足与调号速度拍号结构失配问题,MIDILM 采用前缀条件加共享掩码自注意力与文本 MLP 加 MIDI 混合专家双路前馈,在 MidiCaps 上相对最强基线在 CLAP 到 TB 上提升 6.07% 到 144.77%,代价是调性建模仍弱且复杂转调下降,未公开代码链接当前不可用。
音乐生成 | 7.5/10