英文题目:Host Your Ghosts: Recontextualizing the Ouija Board as a Communal NIME for Music Performance.

会议身份:conference:nime:2026:conference-paper-id:nime2026_6

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#用户研究 #音乐 #语音 #音频交互

评分:5.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Anthony T. Marasco:机构信息未能从会议 PDF 纯文本可靠映射
  • Alexis Bacon:机构信息未能从会议 PDF 纯文本可靠映射
  • Sandro Barros:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

Host Your Ghosts面向共处一室的群体共奏需求,输入是参与者回答何为萦绕的口语陈述与灵应盘上通灵板的二维位置、朝向与速度手势,输出是经多通道扬声器阵列扩散的不断演化的声音织体,难点在于把私密叙事转化为可被多人直觉操纵且不暴露说话人身份的音乐材料。陈述阶段由采集补丁录音并经噪声门与闪避器清理后上传远端服务器再转交演奏计算机,其输出的长录音直接进入语料构建。语料构建阶段将多段录音拼接为长文件后用梅尔频率倒谱系数与起音分割按不同时长与灵敏度生成四个粒度的样本库,使短促音素碎片与完整词句分别成库并映射到二维绘图器。占卜演奏阶段由群体推动光流追踪通灵板,在节点插值界面上按位置选择语料库拼接合成voices,并用朝向与速度调制共振器、环调与延迟效果量与空间化。与固定映射乐器相比,该机制把每次重分析后的样本空间分布与物理盘面符号绑定,使位置、速度与朝向同时决定选材、空间化与效果量,强化探索与偶然性。在低剖面盘面通行设置下,E-Q传感器工作高度指标的上限为35毫米,高于E-Q传感器工作高度指标的下限为15毫米。该结论适用边界受限于小规模共位艺术展演语境,尚未验证远程参与、大规模观众或长期重复演奏的稳定性,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:为何选通灵板而不是新控制器?

这篇解读的输入是 NIME 2026 会议论文 Host Your Ghosts 的正文证据与 4 张官方原图像素,目标是让刚进入音频领域的研究生能复述其方法链路并理解实验条件。必须保留的信息包括双阶段结构、采集器与占卜器两个 Max 程序、基于流体语料库操作工具的拼贴合成流程、示位器硬件两代差异、映射表与 2 次展演的时间地点。输出按学习依赖从任务到复现展开,不引入证据之外的效果断言。

作者的起点不是做一个更灵敏的新乐器,而是回应 NIME 中关于复用与再语境化的路线。文中引用 Masu 等人对 N 中 O 的讨论,主张复活旧系统而非追逐前沿技术,并把环境收益与接纳新创作者联系起来。通灵板被选中是因为它自带强脚本:1890 年代降神会工具、围坐共扶示位器、字母加数字加 Yes No Goodbye 的版式、通过不自主肌肉动作即意动反应拼出信息。帕克兄弟量产后它又叠加了商品与桌游脚本,再叠加撒旦恐慌时期的宗教争议脚本。教学上可以把脚本理解成白话的默认用法说明书,英文为 script,源自 Akrich 对技术物的描述理论。

去脚本化 × 通灵板脚本: 去脚本化指作者借用 Akrich 的描述理论,主动承认并改写物件被设计者与社会强化的默认用法;通灵板脚本指围坐提问、共扶示位器、等待超自然力量拼出字母信息的整套文化预设。两者搭配的原因是只有先点名原有仪式脚本,新的音乐合奏脚本才有可对照的动作,组合后示位器移动同时保留了占卜姿态和声音检索功能。

理解这项工作要先接受它的矛盾设定:既要让参与者认出这就是通灵板仪式,又要让同一套动作驱动声音合成。作者把 Chorus for Untrained Operator 作为精神前作,那件作品用老式电话配线架同时唤醒磁带机、机械玩具等现成物,参与者既是媒介考古者又是新故事作者。Host Your Ghosts 沿用同一逻辑,但把现成物聚焦到一件具有协作占卜含义的物件,并把问题从如何发声改为如何让陌生人的独白成为合奏材料。首演之外的媒体示例链接在正文中给出,但本次解读不依赖外部视频,只按文字与图像证据复述。

相关路线如何对照:复用物件与社群乐器有何不同分工?

复用物件路线关心如何把现成物转成数字乐器,证据中列举磁带怀旧作曲、家务劳动工具乐器、星际迷航虚构乐器实体化等,教学例子是把缝纫机改成发声体,重点在物料与性别、叙事等议题。社群乐器路线关心如何让多人通过共享接口形成集体体验,证据中以 Rafael Lozano-Hemmer 的 Pulse Room 为核心对照,参与者握住心率手柄让一只灯泡闪烁,个人脉冲随后汇入头顶灯阵,贡献与感知在时间上错位。Carson 与 Nash 的作品进一步把手机扬声器阵列与耳语录音引入音乐会,强调个人贡献对共享声场的塑造。

Host Your Ghosts 同时占用两条路线,但运行阶段不同。复用侧的动作发生在 Divination Phase 的板面交互,社群侧的动作横跨 Statement Phase 的异步录音与 Divination Phase 的共时推动。公平对照要按同输入、同目标、同运行阶段来谈:若比较 Pulse Room,只能比多层参与与时间错位,不能比拼贴合成音质;若比较磁带复用,只能比保留原物件手感的设计约束,不能比社群规模。本文未报告与其他 NIME 的同条件胜负,因此不做谁更好的判断,只记录它借用了时间错位贡献与现成物脚本冲突这两种机制。

要解决的问题是什么:冲突脚本如何变成可演奏结构?

论文提出的问题是能否把通灵板去脚本化为 communal NIME,让参与者集体创作由关于萦绕之事的陈述构成的声景。具体操作被拆成两个可独立体验但顺序建议从独到群的阶段。Statement Phase 在隔离站点完成,参与者对着话筒、声卡与显示指令的笔记本回答 What Haunts You,录音经远程服务器转给占卜空间的主演奏电脑,并被告知录音将在每场演出结束时删除。Divination Phase 在更大的多声道房间完成,中央是通灵板与自制动追踪示位器,隐藏的第二台电脑与声卡负责合成,墙上说明要求先独自思考萦绕之事,再按意愿加入共推示位器。

提示词语义是关键设计。作者比较 haunts 与 scares 或 frightens,认为前者不预设惊吓反应,允许超自然、现实忧虑、创伤事件与 lingering anxieties 等多种讲述,并引用人类学萦绕与 hauntology 讨论来支撑这种开放性。教学例子是:若问你害怕什么,回答多为恐怖物;若问什么萦绕你,回答可以是一段未处理的记忆。论文未给出 haunts 的定义,这种模糊是故意的。需要指出的缺项是文中没有报告提示语的 A 与 B 对照实验,因此不能断言换词必然改变语料多样性,只能说这是设计意图。

方法全景:一个录音如何变成板面上的声音?

沿一个样本走完全程有助于建立依赖顺序。假设 1 位参与者在 Statement Phase 说了一句关于失眠的话,Collector 程序先用开关按钮控制起停,并用噪声门与 ducking 压制展场环境声,尽量分离出语句文本对应的语音段。录音上传到远端再转入 Divination Phase 的电脑,Ouija 程序把陆续收到的多个录音拼成一个长文件,用梅尔频率倒谱系数即 Mel-frequency cepstral coefficients,缩写 MFCC,做分析,再按起音变化切片,形成起始语料库。同一长文件被用不同长度与灵敏度参数处理 4 次,得到 4 个样本数据集,有的全是点击与音节碎片类的短促打击感样本,有的保留完整词与短语。每个库对应一路拼贴合成器,经过延迟、共振器与环形调制后送入扬声器阵列。

当另一组参与者在 Divination Phase 推动示位器,板面 2 维位置决定触发哪个库的样本,并决定声像。落在虚拟节点外缘对应只进四声道中的一只音箱,落在节点中心则均匀铺满四只音箱,落在节点交叠处则多路同时发声。方向与速度进一步控制音量、延迟反馈与调制量。表演结束时按示位器侧面按钮,程序手动复位,把 Statement Phase 新积累的录音重新拼合与分析,迎接下一组人。

以下导读针对实拍图,帮助确认共奏姿态不是单人演示,而是多人同时轻触的原仪式动作。

看图路径: 1. 确认多人手指同时轻触白色示位器的共奏姿态;2. 辨认板面字母弧、数字行与 YES NO GOOD BYE 的原版布局;3. 观察暖光与蜡烛营造的仪式氛围如何保留原脚本;4. 注意示位器侧面引线与发光点暗示其为电子改装体

原论文 Figure 1:The motion-tracking planchette interface and Ouija board used in Host Your Ghosts.

论文图 1。原论文 Figure 1:“The motion-tracking planchette interface and Ouija board used in Host Your Ghosts.”。

该图报告显示暖光下多只手共扶白色示位器,板面保留了字母弧与数字行的经典印刷,示位器的改装痕迹只在引线与光点处可见。这支持了设计约束:不改动市售板面、不遮挡参与者视线,用外观接近原物的 3 维打印示位器承载传感。

以下导读针对系统拓扑图,帮助区分音频线与数据线的不同走向,避免把录音上传误认为实时人声效果。

看图路径: 1. 沿左侧人声到话筒到笔记本再到云端的绿色虚线确认录音上传路径;2. 对照右侧云端回传到演奏电脑与示位器位置回传的双路数据流;3. 区分图例中黑色实线音频与绿色虚线数据的不同走向;4. 确认四只扬声器包围板台的四声道默认布局

原论文 Figure 2:Participant performance/interaction scenarios, audio routing, and data transmission topologies in…

论文图 2。原论文 Figure 2:“Participant performance/interaction scenarios, audio routing, and data transmission topologies in each phase of Host Your Ghosts.”。

该图显示左侧个体经验链为口头到话筒到笔记本再经无线到云,右侧群体经验链为云回传录音到笔记本、示位器位置回传到笔记本、笔记本输出 4 路音频到扬声器。图例明确区分黑色实线为音频、绿色虚线为数据。这解释了为何 Statement Phase 与 Divination Phase 可以任意顺序体验:前者只生产语料,后者只消费已到达的语料。

陈述阶段 × 占卜阶段: 陈述阶段负责个体在隔离站点回答 What Haunts You 并上传录音,形成后续声音的材料库;占卜阶段负责群体在多声道空间中共推示位器,触发对该材料库的检索与空间化。两者分工为时间错位的贡献与共时合奏,搭配理由是让不可见的前人幽灵成为当下演奏的声源,组合意义在于把独奏反思转化为群体可演奏的语料。

合成组件如何工作:语料库、节点与效果链的分工?

Ouija 程序是多声部基于语料库的拼贴合成引擎,英文为 corpus-based concatenative synthesis,缩写 CBCS,构建在 Max 与 FluCoMa 包对象之上。Collector 程序只负责录制、存储与上传,用户界面就是一个开关录音的拨动按钮。Ouija 程序负责拼合、分析、切片、建库与演奏。分析用 MFCC 提取与频谱及音量差异相关的 91 个值,切片依据起音变化,4 个库来自 4 次不同参数的处理,样本时长从几毫秒到数秒不等。每个库内的相似声音被映射到一起,因此有的绘图器上聚集短促样本,有的聚集可懂词句。输出统一经过延迟、共振器与环形调制,形成阴森而共鸣的声世界,词的可懂度有起伏。

位置到声音的绑定通过 Max 的 node 对象实现。4 个节点各代表一个样本数据集,其中心坐标对齐板面显著图标,橙色大点代表物理示位器。位置数据同时驱动样本选择与空间化,交叠区触发多库叠加。首演观察到参与者在相邻短样本点之间快速移动会造成声音之间的显著静默,作者因此加入基于参与时长的循环开关:快速推动时循环样本制造紧迫感,缓慢探索时单次触发保留空旷反思感。

以下导读针对节点插值界面截图,重点是把虚拟分布与物理符号对应起来。

看图路径: 1. 在左侧板面图像上辨认四个半透明椭圆节点的叠加与交叠区;2. 找到橙色圆点所代表的当前示位器虚拟位置;3. 对照右侧四个黑点散点图理解各库样本的二维分布;4. 观察交叠区如何对应多库同时触发的复调条件

原论文 Figure 3:The Ouija patch’s node interpolation UI showing virtual locations of corpora audio samples are…

论文图 3。原论文 Figure 3:“The Ouija patch’s node interpolation UI showing virtual locations of corpora audio samples are mapped to locations on the physical Ouija board.”。

该图左侧可见 4 个半透明椭圆覆盖在通灵板图像上,橙点落在偏右区域,右侧 4 个散点图显示各库样本的 2 维聚类,有的库点团集中在顶部,有的集中在底部。这解释了为何每次重分析后样本在 2 维绘图器上的位置会重置,也预告了声音死区的来源:若某次聚类把样本堆在角落,板面某些符号区可能无声可触发。

基于语料库的拼贴合成 × 节点插值界面: 基于语料库的拼贴合成负责把长录音切成短样本并按描述子相似性组织检索,节点插值界面负责把 4 个样本库的虚拟位置叠加在通灵板图像上并用橙点表示示位器。搭配理由是 2 维板面需要对应高维声音空间,组合后板面位置同时决定触发哪个库和声音在四声道中的声像。

效果映射的完整清单见后文表 2,先记住分工:坐标管选材与声像,手势管音色与时间。方向改变共振器音高调制量,速度选择共振与环调预设,快慢决定延迟反馈量。这种把自然意动动作直接变成合成参数的做法,是为了奖励参与者按原脚本快慢探索的倾向。

示位器手势如何变成参数:位置之外还有什么被测量?

硬件的核心约束是准确匹配 1960 年代后通灵板的视觉美学,并复刻推动示位器的物理手感,以免干扰自然的意动反应。作者早期排除了类似 reacTable 的摄像头追踪,因为顶置或透视方案会改变板面外观或分散注意力。最终选择保留原装未改动的通灵板,另做塑料 3 维打印示位器,内装光流传感、ESP32-S3 微控制器载板、可充电锂电池、滑动电源开关与按钮,用 Collab-Hub 框架经本地无线网把位置发给 Ouija 程序。光流原理白话讲就是小鼠标看地面:传感器对静止板面连拍高帧率图像,比较像素位移得到视运动矢量。

第一代用 PAA5100JE-Q,工作高度适合贴板滑行,固件用开源 Arduino 库计算里程。但首演发现参与者爱绕 Z 轴旋转示位器用尖头指引方向,也爱忽快忽慢变速,前者在旋转光流补偿缺失下产生漂移,后者在较低帧率下失准。第二代换成结合 PAA5160E1-Q 激光光学、六轴惯性单元与 STM32C011 做高速融合的里程计 breakout 板与配套库,加速度与速度读数更准,并把这些数据流映射到合成参数。

光流传感 × 惯性融合: 光流传感负责通过连续高帧率图像比较像素位移来估计示位器在板面的平移,惯性融合负责用六轴惯性单元与微控制器做高速融合以补偿旋转与快速变速。搭配原因是第一代单光流在旋转和低帧率下长时漂移,组合后位置更稳且能同时输出可用于音效调制的速度与加速度。

有无模型训练:本研究的计算过程到底是什么?

本研究没有训练神经网络,也没有报告梯度路径、参数冻结或优化器步骤,因此 training 一节的任务是讲清实际发生的非训练计算,避免把调用现成分析工具误认为模型训练。真实链路是确定性信号处理加检索:拼合录音文件,MFCC 分析得到描述子,用起音检测切片得到 91 维相关的谱与音量差异表示,形成起始语料,再用 4 组长度与灵敏度阈值重复切分得到 4 个库。FluCoMa 对象在此承担特征提取与语料组织,而非可学习权重更新。每次按下复位按钮就重新拼合与重分析,样本在 2 维绘图器上的位置随之重置。

必须指出的缺项是原文未给出 MFCC 阶数、窗长、跳长、起音阈值 4 组的具体数值,也未说明聚类与降维到 2 维绘图器的算法细节,只说用不同长度与灵敏度指标处理 4 次。复现时不能从工具包名称推定默认参数,需要把参数搜索本身当作待补实验。无训练不等于系统输出确定:因为语料内容随参与者变化、节点映射每次重置,同一板面动作在不同场次会触发不同声音。

实验条件:在哪里展出,用什么声场与数据伦理?

截至写作时共展出 2 次。首演在 2025 年 11 月 5 日密歇根州兰辛 Turner-Dodge House,第二次在 2026 年 1 月 23 日东兰辛 Scene Metrospace 画廊,活动由密歇根州立大学艺术生活学习社区组织的公共艺术展承载,主题偏向对流行文化式恐怖的严肃反思。默认声场为四声道,扬声器包围中央板台,隐藏电脑与声卡负责合成。Statement Phase 站点含话筒、声卡与笔记本,Divination Phase 站点含通灵板、示位器与主电脑。参与者可任意顺序体验 2 个阶段,Divination Phase 常见 2 人结对,最多 4 人同时推动,如图 1 所示。

伦理条件按 NIME 标准执行:自愿参与,录音前告知将用于 Divination Phase 声设计,每场结束删除录音且不他用,首演前告知有图片与视频记录。未来计划中作者提出让远程贡献者选择演出后删除或保留到未来场次,但当前证据只支持删除已执行。第三方资源状态方面,Max、PAA5100JE 库、OTOS 库、p5.js 与 Tone.js 在本次核查中均为可用且返回 200,但这只表示链接可达,不代表版本与论文当时一致。 以下导读针对示位器拆解图,帮助复现时核对机械与电气装配。

看图路径: 1. 对比左图白色三维打印外壳的尖头与圆形视窗;2. 辨认中图紫色载板上的微控制器与红色光流里程计小板;3. 观察右图底面三足支撑、螺丝固定与中央传感开窗;4. 确认顶端小柱与侧面按钮对应的复位操作位置

原论文 Figure 5:Components of the planchette interface: custom carrier board (center top), optical tracking…

论文图 5。原论文 Figure 5:“Components of the planchette interface: custom carrier board (center top), optical tracking odometry sensor (center bottom), and 3D-printed body (left and right).”。

该图左为外壳顶视,可见尖头指向与中央视窗,中为紫色载板与红色传感小板并置,右为底视可见三足、固定螺丝与传感开窗。这对应了载板加光流加电池加开关按钮的清单,复现时应先确认底面离板高度落在 15 到 35 毫米区间,再验证无线回传延迟是否影响演奏跟手性。

观察到了什么:参与者真的同时用看与听来导航吗?

本文没有定量主结果,只有现场观察。报告显示 Divination Phase 中有人试图把示位器引导出的字母序列与扬声器中循环的音节或整词对应起来,仿佛两者都是下一步去向的指令;另一些时刻参与者更依赖视觉符号或更依赖声音输出来引导体验。Statement Phase 的贡献从单个词到长独白不等,随参与人数增加,样本库内容多样性上升,长时演奏中重复听到相同片段的概率下降。这些是报告层面的描述,支持了独到群链路能运转,但未测量可懂度、停留时长或满意度。

为满足可核对要求,下表把双阶段链路整理成 5 个可执行维度,数字与走向均来自连续原句证据,表中不引入外部评分。

表前问题是 2 阶段在参与形式与数据走向上有何可比差异,公平条件是同一次展演中的同一批录音,指标方向是能否追踪从话筒到扬声器的闭环而不丢失环节。

阶段参与形式输入动作与设备数据与音频走向空间与输出
Statement Phase个体独立体验对话筒说出萦绕之事,笔记本单开关控制录音上传远端再转入主电脑隔离小站,无多声道
Divination Phase群体共处演奏共推示位器,侧键复位重分析位置经无线入电脑,电脑输出多路音频四声道包围板台
连接环节独到群的时间错位前人录音变后人声源云端往返加本地无线从小站到展厅
复位机制按需迎接下一组按侧面按钮触发重新拼合与重分析样本 2 维位置重置
内容演化人越多重复越少从单词到独白四库样本时长从毫秒到秒可懂度起伏

表后解释是主要收益在于异步贡献与同步合奏被同一套录音连接,幽灵比喻有了可操作的实现;具体代价是链路依赖网络与重分析时机,若复位不及时,新贡献无法进入当前演奏。未胜出项是快速在短样本区跳动会产生显著静默,这在首演中被观察到,后续用循环模式缓解,但未给出静默时长的测量。

第二个整理表聚焦合成侧的四库构造,比较问题是同一拼合文件如何变成 4 种可演奏质地,公平条件是同一 MFCC 与起音分析起点,指标方向是样本时长与可懂度的分布差异。

构造步骤分析与切分依据库数量与映射样本时长听感质地
拼合长文件MFCC 与起音变化,91 个谱与音量值起始语料 1 份长句连续未切分
4 次重处理不同长度与灵敏度阈值4 个样本数据集从几毫秒到数秒从碎片到整词
节点映射四节点各代表一库四节点叠加板面位置决定触发交叠区多库齐发
空间化外缘单音箱,中心铺满默认四声道声像随落点可懂度起伏
重置每次复位重聚类位置重置分布改变可能出现死区

表后解释是四库设计让同一批人声同时提供打击感碎片与语义整词,演奏者用快慢与落点在紧迫与空旷之间切换;代价是重聚类带来不确定性,某些符号区可能无样本对应,作者明确喜欢这种机遇性,但也承认需要中间算法来约束分布以对齐重要符号。

什么改动算对照:两代示位器与循环开关说明了什么?

最接近消融的是硬件迭代与软件补丁。第一代 PAA5100JE-Q 在贴板高度表现合适,但无旋转补偿且帧率较低,长时共奏出现漂移;第二代用激光光学加六轴惯性加微控制器融合,位置、加速度与速度更准。比较条件是同一块原装板面与同一类共推动作,变化的只是传感与融合,观察方向是漂移是否减少与快慢手势是否可被参数化。原文未给出误差厘米数或漂移曲线,因此只能说方向改善,不能写精度提升了百分之多少。

软件侧的对照是循环开关。首演无循环时快速点跳导致静默,加了按参与时长切换循环率的功能后,快速对应循环紧迫,慢速对应单次空旷。这不是对照实验,而是基于观察的迭代,支持了手势到质地的映射假设,但未测量循环前后静默占比。未评测边界包括单人推动与多人推动是否触发不同预设,文中只作为未来计划提出用电容触摸区分单群,当前无数据。

下表把映射关系展开为五列,便于复现时逐项接线,问题是每个运动属性到底改哪个合成参数,公平条件是同一 Ouija 程序与同一四声道,方向是动作越大对应效果越强或预设切换。

运动属性合成与效果参数数据来源作用时机演奏意图
X 位置节点界面 X 与语料绘图器 X光流里程计持续选择样本库与声像
Y 位置节点界面 Y 与语料绘图器 Y光流里程计持续选择样本库与声像
朝向共振器音高调制量融合航向持续旋转指引对应音高变化
速度矢量选择共振与环调预设融合速度瞬时切换变速探索切换音色
速率标量延迟反馈量融合速率持续快慢对应紧迫与空旷

表后解释是位置管选材、姿态管音色、速率管时间的分工让自然动作都有声音回报,降低了学习成本;代价是旋转与变速恰是第一代最不准的部分,若复现仍用单光流,朝向与速度两行将不可信。负结果是交叠区虽能触发丰富叠加,但也可能因样本堆积导致某些符号区长期无声,这不是映射表能解决的,需要上游重聚类约束。

边界与未验证推测:哪些结论还不能下?

需要区分 3 层表述。报告层包括 2 次展演的时间地点、双阶段可任意顺序、2 人结对常见、贡献从单词到独白、内容越多重复越少。支持层包括时间错位贡献确实进入了声场、节点交叠确实触发多库、第二代融合确实改善了跟手体验,这些有观察支撑但无数字。推测层包括 haunts 比 scare 更能拓宽题材、循环模式匹配快慢情绪、未来电容触摸能实现只有群体才能达成的作曲状态,这些是待验证想法,不能当作已证明效果。

困扰 × 萦绕: 困扰对应 scare 与 frighten 所指向的惊吓反应,萦绕对应 haunt 所保留的超自然、创伤、焦虑与长期纠缠的多义性。作者刻意选用 What Haunts You 而不定义 haunts,分工是让提示语同时承载节目主题与开放解读,搭配理由是拓宽可讲述题材,组合意义是让声音景观的语义深度依赖参与者的自我选择而非预设词表。

缺失证据不是技术错误,但复现者要补三项验证:其一,固定同一批录音比较不同提示词的语料多样性;其二,记录示位器轨迹与触发日志,统计死区面积与静默占比;其三,测量从推动到发声的端到端延迟与四声道声像误差。未测量误判率、延迟与成本时,不承诺这些量得到改善。总体趋势不等于每组都成立,例如内容多样性上升不保证每个新录音都有可懂词被触发。

复现先做什么:最小可运行链路的动作清单?

复现应从最小闭环开始,先跑通录音到发声,再追求融合精度。第一步搭 Statement Phase 小站:话筒加声卡加笔记本,用 Max 实现单开关录音、噪声门与 ducking,把文件经本地文件夹或简易服务器转给主电脑,首版可不用远端云,只需保证转交动作可重复。第二步在主电脑跑 Ouija 程序:拼合录音,调 FluCoMa 做 MFCC 与起音切片,先用一组阈值切出起始库,再复制 4 组不同长度灵敏度得到四库,样本时长覆盖毫秒碎片到数秒词句,4 个节点对齐板面图标。

第三步做示位器:3 维打印外壳保留尖头与视窗,底面保证 15 到 35 毫米工作高度,载板接 ESP32-S3 与光流小板,经本地无线发位置,侧面按钮接复位重分析。第四步接四声道:外缘单音箱、中心铺满、交叠多发,先验证位置到声像,再接朝向到共振、速度到预设、速率到延迟反馈。

关键超参数与信息条件在原文中缺具体值,复现时要自行记录 MFCC 参数、窗跳、起音阈值 4 组、节点坐标与效果链初值,并固定随机种子以便比较死区变化。代码开源层面,文中给出 Max、PAA5100JE 库、OTOS 库、p5.js 与 Tone.js 的链接,本次核查均可达,但不含本项目两程序的完整仓库,因此系统可运行不等于开箱可运行。远程浏览器门户与 ambisonic 全景声版均为在研计划,不应计入最小复现。

下表把两代硬件的复现要点整理成五列,问题是在什么约束下选哪代方案,公平条件是同一原装板面与共推手感,方向是精度与复杂度权衡。

硬件代际光学与计算供电与交互工作条件已知代价
第一代单光流里程计加开源库锂电池加滑动开关加按钮贴板 15 到 35 毫米旋转漂移,变速失准
第二代激光光学加六轴惯性加微控制器融合同载板加无线回传高速融合装配与调参更复杂
共用约束不改原装板,不用摄像头保留共扶手感本地无线网络抖动影响跟手性
软件配合位置驱动选材与声像按钮驱动复位重分析按需重置重置打断当前演奏
未来选项电容触摸区分单群预设切换多人才能解锁尚未实现

表后解释是若只为教学演示,第一代已能讲清光流到声音的完整故事;若要长时间公展或研究快慢手势,应直接做第二代融合。未胜出项是摄像头方案,虽精度可观但因破坏视觉与注意力被作者 early 排除,复现时不应回退到该路线,除非重做美学论证。字数要求下不再重复摘要,重点是保留可执行的参数记录习惯。

何时值得尝试:给研究生的收束判断?

当你的研究问题涉及现成物的文化脚本、异步陌生人贡献与共时群体演奏三者交汇时,这个案例值得尝试。它的可学之处在于用极少的新物件改动换来了可演奏性:板面不动,只改示位器;录音不做语义识别,只做描述子切分与空间检索;演奏不教乐理,只用推快推慢与指向来换音色。它的不可学之处在于没有可比基线与定量指标,无法回答是否比其他 communal NIME 更有效,只能回答链路是否完整、参与者是否按预期在看与听之间建立意义。

带走的动作清单是先复刻双阶段文件交接,再复刻四库与四节点映射,最后补上轨迹日志与死区统计。若要发表后续工作,建议补提示词对照、延迟测量与声像误差三项验证,并明确说明每次重分析都会改变可复现性。回到标题的判断:主持你的幽灵,本质是主持陌生人的声音碎片,通灵板只是让主持动作显得理所当然的界面。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总