英文题目:OTIAC: Co-Improvising With a Musical Agent in a Feedback-Based Guitar Performance.

会议身份:conference:nime:2026:conference-paper-id:nime2026_33

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#开源工具 #生成模型 #用户研究 #音乐 #音乐生成

评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Claudio Panariello:机构信息未能从会议 PDF 纯文本可靠映射
  • Ken Déguernel:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理反馈增强古典吉他场景下吉他手、电子演奏者与智能体的实时共即兴,输入为琴头接触麦克风拾取的连续Larsen反馈与噪声演变,输出是经琴体换能器回注并经房间扩声的生成音频,难点在于音色连续无离散音符且调音、摆位与房间时刻改变声音分布。方法链分三步衔接:先以FluCoMa在48kHz采样下提取音频特征并切分为事件片段,形成可学习的离散单元。接着10×10自组织映射将高维音色特征在线聚类为符号词汇,其输出的符号流直接作为下一步的输入。然后因子神谕机学习符号序列的前向转移与后缀链接,在新事件到来时生成后续符号序列并匹配对应录音片段回注吉他,完成聆听与生成闭环。与依赖预存语料库的OMax、Somax2及ImproteK/Dicy2系列不同,该机制完全从当前场次在线建构词汇与转移关系,因而更适配不可预测的反馈材料并形成自指生态。在H[t] Duo排练访谈场景设置下,10×10自组织映射条件的数量指标为10×10,高于H[t] Duo双乐手条件的数量指标2。其结论适用边界受限于H[t] Duo两位职业乐手在特定尼龙弦吉他与硬件摆位下的排练观察与一小时半结构化访谈,换乐器换场地与长时间演出的稳定性尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?要解决的共演难题是什么?

这篇解读的输入是 NIME 2026 论文 OTIAC 的正文证据与 6 张官方原图像素,目标是让刚进入音频领域的研究生能复述方法、条件与限度。必须保留的信息包括硬件接法、特征与分割参数、自组织映射与因子预言机的在线流程、界面分工,以及与 H[t] Duo 的练习主导观察。输出按学习依赖展开,不做营销判断。

任务不是做一个通用作曲器,而是让三方一起即兴:弹反馈增强古典吉他的吉他手 P1、操作电子与界面的 P2、以及一个软件音乐智能体。难点在于声音对象本身不可预制。反馈产生的拉森音是连续、频谱丰富、缓慢演化的音色流,没有离散音符,没有现成语料库可用,换场地、换调弦、换换能器位置声音就全变。传统依赖离线语料的 concatenative 合成或风格模仿在这里失效,因为上一场的录音不能代表这一场的共振。

因此作者把目标定为双重:一是给出可在 SuperCollider 内实时运行的开源实现,把特征提取、无监督聚类与上下文序列生成装进同一演出系统;二是记录为乐器加反馈增强的过程,以及演奏者如何与这种自指生态共处。所谓自指,是指智能体生成的声音经换能器送回琴体,再被接触麦拾到,成为下一轮学习材料,所有参与者都在塑造正在涌现的演出。理解这一点后,后面所有参数才有意义:它们都是为了让慢变的反馈能被切成事件、变成符号、再变成可回放的序列。

已有路线为什么不能直接拿来用?

先讲白话。音乐生成系统指用计算手段作曲的系统,音乐智能体指其中能自己或与人合作产出音乐的人工参与者。相关工作把它们按输入需求、生成方法和交互范式分类,也按自主性、学习能力和交互模式区分。OTIAC 沿用的两条技术线各有来历。

第一条是自组织映射。自组织映射是一种无监督神经网络,把高维数据压到 2 维网格并尽量保持拓扑关系,相似输入落在相近节点。它在音乐里用得少,证据提到的例子有 Smith 和 Deal 拿它做短期记忆、Martins 和 Miranda 用变体做节奏、Tatar 和 Pasquier 的 MASOM 把它与可变马尔可夫模型结合、Thelle 和 Pasquier 的 Spire Muse 延续 MASOM。OTIAC 继承的是聚类加可视化的思路,但改为纯在线:只从当场演出学,不加载旧语料。

第二条是因子预言机。因子预言机是一种有限状态自动机,学习复杂度是线性的,适合现场即兴,已有 OMax、Audio Oracle、PyOracle、可变马尔可夫预言机、概率因子预言机、ImproteK、Dicy2、Somax2 等家族。OTIAC 的新意是为 SuperCollider 写了一个新实现,以便与实时音频紧耦合,而不是调外部 Python 进程。

反馈音乐是另一条线。从 Lucier、Radigue、Tudor、Collins 到 Di Scipio 的 Audible Ecosystemics、Sanfilippo、utrumque duo,核心是把反馈环当作乐器与作曲材料。反馈增强乐器是其中一支,用执行器加麦克风经琴体耦合,halldorophone、反馈大提琴、低音提琴、Overtone Fiddle 都是例子。吉他增强多在钢弦、 lap steel、电吉他或桌面乐器上,古典吉他加反馈在学术文献里据作者所知尚无先例。这就是 OTIAC 选尼龙弦古典吉他的理由:弦张力低、面板薄而扇形支撑,对换能器激励特别敏感,且无电磁拾音链,音色完全由木质共振决定。

问题如何形式化?什么算学会、什么算生成?

把一场演出看作随时间到达的音频流。系统要在线完成三件事。第一,把流切成事件,每个事件有起点、时长和一段可回放的录音。第二,给每个事件一个离散标签,使相似音色同标签、不同音色异标签,且标签词汇只能从本场长出来。第三,记住标签的先后关系,使给定当前事件能生成一段风格连贯但非复制的新标签序列,并能找回对应录音播出去。

举个教学例子帮助理解,不代表论文数据。假设第 100 个 onset 到来,系统算出它的 20 维特征落在网格第 6 号节点,且它到下一个 onset 隔了 8 秒,那么它被记为时值类别为 sustained、簇编号为 6 的符号,写作 sustained_6。因子预言机学到的就是 sustained_6 后面常跟什么、很少跟什么。生成时若当前也是 sustained_6,预言机就从最长匹配后缀出发走几步,吐出如 6 之后接 41 再接 72 的序列,系统再去缓冲里找历史上属于这些簇的真实片段交叉淡化播出。

这里学会的判据不是分类准确率,因为没有真值标签。判据是操作性的:聚类是否稳定到足以让预言机有可复用的符号,以及生成回注后是否仍能被系统听见并继续学下去。失败条件也很明确:若分割抖动导致事件碎裂,或网格坍缩到少数节点,预言机就会在极小的符号集上空转,生成失去变化。论文没有报告定量精度曲线,这是练习主导研究的取舍,后文会回到这一点。

系统全景:声音如何走完一圈?

先沿一个样本走完输入到输出。琴头接触麦拾到的信号先经过反馈合成器层,再一路写入循环缓冲,一路做分割与特征提取。特征送入自组织映射得到簇编号,与按 onset 间隔算出的时值类别拼成复合符号。符号序列喂给因子预言机,一条支路定期更新模型,一条支路按当前上下文生成新序列。生成的每个符号去缓冲里匹配一段历史录音,交叉淡化后同时送往琴体换能器和房间音箱。换能器让琴体再振起来,接触麦又听到它,于是闭环。

硬件极简是刻意选择。接触麦放在琴头背面,拾琴颈音色且可用手闷住琴颈打断反馈。换能器是 25 毫米激励器,面板位置经过多轮试错,最终定在靠近琴桥的下方,理由是那里对应面板主共振模态,最易起振且音乐上可用。按压面板节点、调弦张力、用关掉电源的 ebow 当压块,都能改变起振,这是后面可控性分层中固定共振层可被演奏的原因。

下面这组照片是理解硬件迭代的关键,直接看纸胶带固定的临时状态就能明白非侵入与可复制的设计意图。

看图路径: 1. 从左到右数四张照片,确认第一张是琴头背面接触麦,后三张是面板上、中、下三个换能器候选位;2. 观察每处换能器都用白色纸胶带呈放射状临时固定,理解非侵入快速迭代的意图;3. 对比换能器与音孔、琴桥的相对距离,记住最终选用的是最靠近琴桥的下方位置

原论文 Figure 2:Preliminary prototyping phase showing the contact mic and different placements of the transducer,…

论文图 2。原论文 Figure 2:“Preliminary prototyping phase showing the contact mic and different placements of the transducer, which is temporarily fixed to the guitar using paper tape.”。

照片从左到右依次是琴头背面接触麦、面板上部、音孔旁、琴桥旁 3 个换能器候选位,每处都用纸胶带放射状临时固定,避免损伤乐器。最终演出用的是最右侧靠近琴桥的位置。读图时不要把纸胶带当正式安装,它只是原型阶段为了快速换位。正式设想是未来用可移除胶或轻质支架,既稳固又可逆。

信号流图则把软件闭环 1 次讲清,是复述方法时最值得对照的一张。

看图路径: 1. 先从左侧吉他出发,沿箭头向右追踪反馈合成到循环缓冲的主链;2. 再向下看分割与特征、自组织映射、簇编号加时值的逐级收窄过程;3. 最后看因子预言机分出的生成序列与更新两条支路如何汇回换能器与房间音箱

原论文 Figure 3:Overview of the overall signal flow in OTIAC.

论文图 3。原论文 Figure 3:“Overview of the overall signal flow in OTIAC.”。

从左侧吉他出发,主链是反馈合成到循环缓冲,再经 FluCoMa 分割与特征、自组织映射、簇编号加时值,到因子预言机。预言机下方分叉为生成序列与更新模型,生成序列经缓冲回放同时指向换能器与房间音箱,更新支路回指自身。注意反馈合成器到房间音箱还有直达线,说明听众听到的始终是原声反馈与智能体回放的混合,这正是 P1 分不清声源的物理基础。

拉森音 × 反馈增强吉他: 拉森音指麦克风经琴体共振到换能器再到麦克风的闭环啸叫,是声音来源;反馈增强吉他指在琴头装接触麦、在面板装激励器的最小改装,是产生和控制拉森音的物理载体。二者搭配的理由是只有把激励点、拾音点和共振模态固定在琴体上,拉森音的音色才由乐器本身决定,组合后演奏者的按压、阻尼和 ebow 动作才能直接改变反馈,智能体才有可学的稳定对象。

听觉前端:如何把反馈流切成可学习的事件?

前端分 3 步:录、切、算。录指所有输入连续写入默认 10 分钟容量的循环缓冲,与是否检测到事件无关,保证生成时总能找回最近历史。切指用 FluCoMa 的新颖性检测找频谱突变,加施密特触发做迟滞去抖,再加静音检测保留有意义的停顿。算指每次切到事件才算 20 维特征并归一到 0 到 1 区间送去训练,避免对背景连续做无用计算。

下表把前端可复现的配置收拢在一处,读表时先想比较问题:在 48 千赫采样下多大的窗和跳能跟上反馈的慢变,又不至于把渐变切碎?指标方向是分割稳定且特征够用,不是越大越好。

模块参数取值单位作用
采样采样率48kHz固定分析时钟
分帧窗长1024samples约 21 ms 频谱窗
分帧跳长512samples约 11 ms 推进
特征维度20维响度加频谱加 12 个 MFCC
切分onset 迟滞0.05阈值上升触发,防抖
切分offset 迟滞0.1阈值下降释放,防抖
切分静音阈0.001幅值保留停顿为事件
缓存容量10minutes可回放的历史长度

上表数值与单位的写法保留原文,窗长跳长括号里的毫秒数是原文换算,MFCC 去掉与能量重复的第 0 系数,频谱特征按感知特性做指数或线性缩放。代价是固定参数对不同琴、不同房间不一定最优,论文把调共振频率与通道路由留给 Setup 窗口,恰好说明前端不是一劳永逸。未胜出项是更密的跳长或更大窗:理论上更精细,但会增加计算且可能把缓慢滑音切得过碎,作者没有报告这组对照,这是缺项而非结论。

自组织映射 × 因子预言机: 自组织映射负责把 20 维音频特征聚成 100 个音色类,给每个事件一个离散的 clusterID,解决反馈声音连续难命名的问题;因子预言机负责记住这些离散符号加时值类别的先后关系,解决下一步播什么的问题。二者搭配的理由是前者把声音变符号、后者把符号变序列,组合后系统既能在线学出当场的音色词汇,又能按上下文生成新序列并找回原录音回放。

符号层:自组织映射与事件存什么?

自组织映射在这里只做两件事。训练时用 SOMTrain 单元,按标准学习规则更新最佳匹配单元及其邻居,且只在 onset 门控下训练。查询时用 SOMRd 单元,输入当前 20 维向量,返回欧氏距离最小节点的 2 维坐标,再折成 0 到 99 的簇编号。网格是 10 乘 10 共 100 节点,随机初始化。每个事件存成三元组:时值类别、簇编号、元数据字典。

字典里有精确秒数、缓冲采样位置、onset 时间戳、网格坐标、完整特征向量与训练迭代数。离散符号给预言机建模,连续元数据给回放找回音色。

时值类别按 onset 间隔划分六档,从很短到持续,阈值分别是 0.5 秒、1.0 秒、3.0 秒、5.0 秒、7.0 秒。这种划分很粗,但对反馈足够:持续音与微变主要靠大于 7 秒那档承载,短促触碰落在前两档。因子预言机把时值类别加簇编号拼成如 sustained_6 的复合键做状态转移,增量建前向转移与后缀链接。每累计 30 个事件自动更新 1 次,而不是每来一个就更新,理由是反馈演化慢,需要攒够窗口才能抓住慢变化。生成时以来事件的符号为上下文,找最长匹配后缀所在状态再向前走,控制参数有生成间隔、序列长度与连续性。

下表把符号层的离散化选择集中呈现,便于复现时一一核对。

模块参数取值单位作用
聚类网格10 × 10格共 100 个音色类
聚类编号范围099离散符号的簇部
时值very_short0.5s小于该值判极短
时值short 上限1.0s0.5 到 1.0 判短
时值medium 上限3.0s1.0 到 3.0 判中
时值long 上限5.0s3.0 到 5.0 判长
时值very_long 上限7.0s5.0 到 7.0 判很长
时值sustained7.0s大于该值判持续
预言机更新周期30events每 30 事件并入新材料

表后需要解释代价。100 类对一场演出是折中:太少则音色混叠,太多则每个符号样本稀疏,预言机学不到可复用的转移。30 个事件的更新周期同样是折中:为 1 则响应最快但易被瞬态带偏,为大则稳定但跟不上段落切换。论文把三档约束与生成三旋钮留给 MIDI 实时调,说明作者把这组权衡交给了演出中的人,而不是离线搜最优。

聆听模式 × 生成模式: 聆听模式负责检测 onset、提特征、训练自组织映射并把事件存入循环缓冲和因子预言机,分工是只学不播;生成模式负责以来事件为上下文让预言机走后缀链接生成新事件序列,再从缓冲取对应音频交叉淡化回放,分工是按学到的关系再演奏。搭配理由是反馈演化慢,必须先积累足够事件再生成,组合后形成听见、分类、建模、回注、再被听见的自指生态。

没有离线训练时,系统到底在更新什么?

本研究没有离线训练阶段,也没有预训练权重,必须明确说清,以免误以为自组织映射是提前练好的。所有知识都从当前场次长出来。真实计算过程是:演出开始后 Initialize SOM 建空网,Start synths 启动共振与滤波,Start Listening 打开 onset 门控,每来一个事件做 1 次 SOMTrain 迭代,同时把事件追加到列表;事件数每到 30 的倍数,因子预言机增量并入新符号并保留旧转移;Start Generation 打开后,每个新事件触发 1 次上下文匹配与序列生成,生成结果去缓冲取音频交叉淡化播出。停止条件由人按按钮控制,没有自动收敛判据。

聚类分布图是观察学到什么的最直接窗口,颜色深浅与格内数字一致表示该簇命中次数。

看图路径: 1. 确认这是 10 行 10 列共 100 格的聚类分布图,每格数字是落入该簇的事件数;2. 比较左上角与左下角深蓝色 28 的高计数格和中间浅色 2、3、4 的低计数格;3. 注意颜色深浅与数字大小一致,说明训练后分布不均匀但已覆盖全图

原论文 Figure 4:Visualization of a 10 × 10 SOM grid.

论文图 4。原论文 Figure 4:“Visualization of a 10 × 10 SOM grid. Each square represents a node colored according to how many events have been classified in that specific cluster ID.”。

这张 10 乘 10 网格每格一个数字,深蓝 28 是高命中簇,浅色 2 到 4 是低命中簇,白色接近空簇。读图时先确认这是计数分布而非权重可视化,再比较四角与中央的疏密,就能判断当场词汇是否坍缩。若出现个别格极高、多数格极低,说明映射被少数共振主导,生成会重复;若分布相对铺开,说明词汇丰富,预言机有更多可走的路。论文展示的这张已训练状态覆盖全图但不均匀,符合反馈既有稳定共振又有偶发跳变的物理直觉。

界面把这种在线学习包成演出可操作的状态机。顶部管搭建与校准,中部管 5 路频谱监视,底部两排管演出:第一排 9 个旋钮管 3 路固定共振电平、自适应滤波电平、预言机三参数、回注电平与房间电平,第二排 8 个按钮管聆听开关、生成开关、自动更新开关与 5 种约束。关键设计是鼠标只能点搭建与可视化,演出参数只能经 MIDI 拧,防误触也逼出肌肉记忆。

固定共振器 × 约束模式: 固定共振器指 3 个固定频率的反馈合成通道,负责提供可预测的起振点,分工是可演奏的材料层;约束模式指把 3 个共振器加自适应滤波重配参数的 5 种预设,负责一键切换音色行为,分工是形式划分。搭配理由是纯反馈加智能体太发散,需要中间层稳定结构,组合后电子乐手可用约束切换做段落,而吉他手仍在固定共振上做精细按压。

练习主导研究怎么做?谁在场、测什么?

实验不是 AB 测试,而是与 H[t] Duo 的 9 个月迭代。吉他手 Pierpaolo Dinapoli 记为 P1,电子乐手 Matteo Tundo 记为 P2。2 人参加多轮排练,系统按反馈改界面。第三次排练后作者 1 在每周排练后几小时内做了 1 小时半结构化视频访谈,用意大利语录音转写,主题覆盖三方能动性分配、控制策略、界面认知负荷、时间形式与合作体验。另有一段排练录音作补充材料,2026 年 2 月在蒙特利尔 CIRMMT 做了公开首演。

硬件条件按上节复述:尼龙弦古典吉他,琴头接触麦,面板近桥换能器,纸胶带原型,未来考虑可移除胶。软件依赖是 JSONlib、FluCoMa 与自定义 SuperCollider 类,含新的 FactorOracle 类,启动时自动检查。音频路由、MIDI 映射、共振频率经 Setup 窗口的 JSON 预设存取,Calibration 引导调换能器电平到拉森音可靠起振,Fb test 先验证基本环路再开全系统。 主界面截图把这种分工 1 次说清,适合核对复现时是否接对通道。

看图路径: 1. 先看顶部 Setup、Calibration、Fb test 按钮和底部九旋钮八按钮的分区;2. 再看中部五路频谱与电平条,以及右侧实时滚动的 onset 与 cluster 日志;3. 核对底部 FO interval、FO length、FO contin. 三个红色旋钮与 Constraint A-E 按钮的位置

原论文 Figure 5:The main window of OTIAC when in action.

论文图 5。原论文 Figure 5:“The main window of OTIAC when in action. The background image is a detail from the Hand of the Mysteries by John Augustus Knapp.”。

顶部可见 Setup、Calibration、Fb test 与 Help,中部左侧是接触麦与换能器波形,中间是输入输出电平条与计时器,右侧是 onset 日志与回放日志,底部是九旋钮与聆听、生成、自动更新加约束 A 到 E 按钮。读图时注意日志里 Onset 757、cluster_1、dur 等于 0.36 判 very_short 这类行,正是符号层的活证据;回放日志里 Playing event 189、cluster 32 这类行,正是生成支路的活证据。像素看不清的具体小数不必硬读,知道格式即可。

下表把可核对的物理与过程条件收拢,公平性在于所有观察都来自同一套琴与同一批排练,不跨琴比较。

模块参数取值单位作用
激励器直径25mm贴面板的尺寸
激励器功率20W起振能量上限
激励器阻抗4Ω功放匹配
琴弦尼龙张力50–80N薄面板高灵敏的来源
琴弦钢弦对照100–180N说明古典吉他更易被驱动
过程跨度9months迭代与熟悉的时间
过程访谈1hour第三次排练后的深访

表后解释限制。单对组合、单把琴、单房间,结论是假设生成器而非普适结论。访谈在熟悉后做,保证体验新鲜又经初步沉淀,但也引入回忆与立场偏差。公开首演反响好不等于系统有效,只是生态可演出的存在性证明。

观察到了什么?三重奏还是四重奏?

报告的发现有 3 组。第一组是非对称感知。有屏幕的 P2 自认完全控制,可开关模块、调参、塑形;无屏幕的 P1 常感到被系统演奏,分不清听到的是自己、P2 的动作还是预言机回注。P1 原话是 P2 有屏幕所以感知不同,自己只能靠听觉与琴体振动分辨,而反馈音色同源,本来就难分。这不是技术故障,而是信息条件不同导致的认识论差异。

第二组是三与四之争。P2 自认是指挥,协调吉他、反馈与预言机三元素,是三重奏观,把反馈当可控材料。P1 坚持是四重奏:你、我、预言机之外,反馈自己也会动,是有自主性的第四方。论文用 Barad 的 intra-action 与 Di Scipio 的生态能动性来解释:能动性不在单点,而在关系中不断重划边界。P1 发现特定琴体位置可掐断反馈,说明看似自主的过程里藏着隐性控制点,这支持了边界可重划的判断。

第 3 组是可控性 3 层。固定共振器一旦系统映射几乎完全可控,可当作曲材料吹奏;自适应质心滤波居中,会跟输入走,需追踪但大致可预期;自组织映射加预言机最不可预测,高层行为符合预期但具体时机、簇选择与音色不可 mastery。P2 的操作也印证分层:共振电平频调,预言机三参数按段设好就放,约束按钮按段切换音色版图。这套民间分类按可控性而非技术功能划分,正是演奏者视角的价值。

分布能动性 × 非对称感知: 分布能动性指音乐决定权分散在吉他手、电子乐手、反馈物理和预言机之间,分工是解释谁在主导;非对称感知指有屏幕的电子乐手自认完全控制、无屏幕的吉他手常分不清声音来源,分工是解释体验差异的原因。搭配理由是只谈技术模块看不到人的差异,组合后才能理解为何同一系统被数成三重奏还是四重奏,以及为何可控性分层比功能划分更贴近演奏感受。

哪些做法被验证为必要?反例是什么?

论文没有做消融实验的数字表,只能按证据讲已验证的对照与反例。先讲约束五档:A 是用户频率的基本共振,B 是整体上移 2 赫兹的频移反馈,C 是带通加脉冲串激励的颗粒模式,D 是颗粒加频移加相位操作的混合,E 是 1.2 倍频乘法迫新泛音区。这五档是作者 1 建议与 duo 共创的,作用是给发散的反馈加形式铆钉。P2 明确肯定约束切换能搭结构,这是支持约束层必要的定性证据。

反例来自 P1 的冗余警告。若只用 ebow 与共振探索,10 分钟听感就趋同,20 分钟以上演出必须扩手势词汇,否则只能靠拉时长稀释重复。另一反例是视觉反馈的双刃性。P1 用手机调音器看基频与频谱来补 awareness,说明缺视觉确实影响决策;但作者也指出全量可视化可能把注意从具身聆听拉向屏幕,这是未解决的权衡。

还有操作频率的对照。共振常调、约束按段切、预言机少动,这组行为差异支持分层设计合理:稳定层给高频操作,涌现层给低频托管。若把预言机也做成需高频拧的乐器,认知负荷会压过聆听,这正是九旋钮八按钮被评价为够用而不淹没的原因。缺项是若拿掉自适应滤波或把更新周期从 30 改到 1 会怎样,论文没有报告,不做必然推断。

边界在哪里?什么还不能说?

先说语料边界。无语料库是在线学习的优点,也是美学限制。系统只学当场反馈,换琴换房即换词汇,旧场知识带不走。2 位演奏者都感到手势窄,传统吉他手法尚未进入学习管线,回放池里只有反馈,生成再巧也跳不出这个池。P1 建议把传统弹奏与反馈同等喂给接触麦,让预言机从更富的词汇里学,这是架构已支持但练习尚未转向的方向。

再说证据边界。单对演奏者、定性访谈、无误判率、无延迟与算力测量,不能承诺系统改善了反应速度或降低了失误。总体趋势不等于每段都成立,某段预言机可能恰好重复某簇,某段反馈可能被 P2 的推子主导。论文把讨论定为探索性假设而非定论,这是恰当的克制。

最后说感知边界。非对称 awareness 在本设计下几乎必然出现,因为界面只给电子乐手。给吉他手加第二屏显示频谱、基频与预言机状态可能缓解,但会引入新的注意分配问题。是否加、何时加,需要下一轮对照才能说。训练资源、推理开销、输出帧率与实际延迟在原文未量化,复现时应自己测往返延迟与 CPU 占用,不把能跑当成低延迟。

复现先做什么?超参数与信息条件是什么?

复现分 4 步。第一步搭硬件:古典吉他琴头背面贴接触麦,面板近桥贴 25 毫米激励器,先用纸胶带试位,确认手闷琴颈可掐断、按压面板节点可改音,再考虑可逆固定。功放匹配 4 欧,按 Calibration 流程把换能器电平推到拉森音可靠起振。第二步装软件:SuperCollider 加 sc3-plugins 的 MCLD UGens、FluCoMa、JSONlib 与本项目 FactorOracle 类,代码在 https://github.com/claudiopanariello/otiac 与 algomus.fr/code 当前可用,SuperCollider、PyOracle 与插件页本次均可达。第 3 步配路由:在 Setup 存 JSON,记下左右音箱、换能器、接触麦与监听通道,以及 3 路共振频率与 MIDI 映射。第 4 步跑状态机:Initialize SOM、Start synths 与计时器、Fb test 验环、Start Listening 攒事件到 30 倍数看自动更新、再开 Start Generation 听回注。

关键超参数按前表冻结:48 千赫、1024 窗、512 跳、20 维、10 乘 10 网、六档时值、30 事件更新。信息条件也要复制:吉他手无屏、电子乐手有屏,否则复现不了非对称感知。建议首演留 20 分钟以上,给慢变留足窗口,同时准备约束 A 到 E 的段落卡,避免 10 分钟后重复。测量要补原文缺项:记录 onset 率、每簇命中、生成间隔与 CPU 延迟,才能判断坍缩还是丰富。

常见误解是把无训练当确定性。参数冻结不等于输出确定,网格随机初始化、现场噪声、onset 抖动都会让同一套参数走出不同路径。另一误解是把回放当采样触发。回放是按符号语义找回的历史片段再交叉淡化,且会再次激励琴体,不是干声叠加。复现时务必同时录接触麦干声、换能器馈送与房间立体声,否则无法归因声源。

何时值得尝试?还需补哪项验证?

当你的乐器本身就是共振体、且你想要智能体与你共享同一声学空间时值得尝试。反馈吉他、反馈大提琴、反馈管乐的改装都可套用此管线:换共振频率、调分割与特征、重学网格与预言机。架构松耦合,特征、聚类、预言机可独立换,迁移成本主要在找激励点与校准起振,而非重写模型。

当你已有大语料库并追求风格复刻时不必用它。它的强项恰是无语料:每场现学现卖,代价是每场都要重学,且词汇只限当场。若演出只有 10 分钟且手势单一,它会暴露重复;若给到 20 分钟并引入传统技法,它的词汇与转移会丰富得多。

还需补的验证有三项。第一,多对演奏者与多把琴的比较,看非对称感知与 3 层可控性是否稳定出现。第二,更新周期与网格尺寸的受控对照,给出稳定与新颖的权衡曲线,而非只用 30 与 100 的单点。第三,延迟、算力与可辨声源率的量化,让美学讨论有工程锚点。未来的强化学习设想是用脚踏好恶信号调生成长度、连续性与游走策略,管微观的仍是映射与预言机,管宏观的是策略,这与分层思想一致,但需先证明人的实时奖励稳定可用。记住本篇最硬的贡献:一个可在 SuperCollider 内实时跑的因子预言机实现,一套无语料在线共演流程,以及一组关于能动性如何被界面塑造的诚实记录。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总