英文题目:A Collaborative Sound Installation Using Projected Geometry and Spatial Interaction.
会议身份:
conference:nime:2026:conference-paper-id:nime2026_139
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#信号处理 #音视频 #音乐 #音视频交互
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Hani Alshamrani:机构信息未能从会议 PDF 纯文本可靠映射
- Sam Ferguson:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew Johnston:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该安装以手持投影机在共享墙面投射的多边形为输入,需同时输出演奏者身份、离散空间交互点对应的音高与连续几何驱动的音色,难点在于自然行走与手持瞄准抖动会持续扰动投影几何并引发误触发。系统先由顶置相机按面积与内角过滤轮廓,并在连续三帧确认后识别三角形至六边形的形状身份,其输出的已接受多边形直接进入下一步特征计算。接着系统提取包含位置、面积与倾斜代理的二十二维几何描述,并经支持向量机估计表演者所处的空间交互点,该离散估计结果再进入门控逻辑做稳定性判断。随后系统以倾斜小于十度、置信度超过零点九零与连续十帧一致门控离散音高切换,同时以原始连续量按约三十帧率直通调制声压、滤波与声像。与把投影仅作视觉反馈而另设身体追踪的既有协作乐器不同,该工作把可见投影本身作为主传感信号,使可感知性与可传感性合一而无需穿戴与地面设施。在单操作者采集的五空间交互点数据集五折交叉验证设置下,六边形的分类准确率为99.7%,高于五边形的分类准确率98.6%。该结论适用边界受限于昏暗房间、固定相机与白色墙面下的受控几何,投影重叠、遮挡、大倾斜与多人并发尚未验证,连续参数延迟约为33毫秒、门控离散切换延迟约为0.33秒而端到端音频延迟未正式测量。
🔗 开源与复现资源
- 第三方资源:https://sonic-pi.net/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么:不穿戴也能合奏吗?
这篇论文要解决的输入很具体:表演者拿着会发光的手持投影仪在房间里走动,把三角形、正方形、五边形、六边形投到同一面墙上,天花板上的普通相机只看这面墙。目标是让 1 至 4 个没有音乐基础的人也能即兴合奏,每个人在墙上都有一个看得见的声音分身,走到不同地面标记就换音高,晃动手腕就改变音色。必须保留的关键信息是空间被离散化为 5 个地面点,身份只用形状类型编码,声音走开放声音控制协议发给合成器,房间需要调暗以稳定轮廓。
本文的输出是一套可复述的方法:从光斑分割到形状校验,从 22 维几何特征到分类器门控,再到声音映射与失效模式。先把一个样本走通:某人站在 3 号点,把三角形投到墙上,相机看到一个偏右、中等面积、底边接近水平的三角形,系统确认这是 3 号状态,于是三角形声部奏出对应音高的音符,同时该三角形的横纵坐标与面积还在连续调节声像与亮度。理解这条单样本链,后面所有阈值与评估才有落点。
相关路线为何没直接用手持投影当输入?
协作乐器长期在易学与可表达之间找平衡。桌面系统把共享可视与实体标记结合得很成熟,表演者看得见彼此的动作,支持模仿与轮流,但活动被限制在桌边。房间尺度的身体跟踪证明了房间本身可以是乐器,但通常需要跟踪身体或佩戴传感,表演者的控制意图对观众不可见。手机闪光灯参与系统把可见光当输入,扩大了活动范围,但光点携带的几何信息少,难以同时做身份与空间状态推断。
固定投影加视觉传感可以控制声学装置,但投影只是输出或基础设施。手持投影在人机交互中有同地协作与情境可视化的先例,但在音乐领域把它既当可见界面又当被传感的控制信号的做法很少被探索。本文的差异正在于此:不跟踪身体,不铺设地板传感,只读墙上投影的形状、位置、尺度与畸变,并把离散站位选择与连续音色调制分开处理。教学例子:可以把桌面系统想象成围桌下棋,本文系统更像在空地举灯,灯斑本身就是棋子与传感器。
核心矛盾:走动必然抖动,切换何时才算数?
自然走动会持续改变投影几何,转身、靠近墙面、倾斜手腕都会让质心与面积跳动。如果每帧都更新离散音高,音乐会因无意动作频繁跳变;如果完全冻结离散状态,空间移动又失去意义。论文把问题拆成 3 层:谁在发声、站在哪里、如何表达。身份层用 4 种多边形区分 4 人,空间层用 5 个离散点给出可返回的音高,表达层用连续几何调制音色。
选择离散而非连续空间控制的理由是学习成本:在即兴与快闪场景中,表演者需要明确知道这个位置就是这个音,下次还能回来。另一个约束是传感可分性:5 个点在投影几何上还能拉开距离,点太多会导致相邻状态在特征空间重叠,分类器难以可靠区分。因此问题不是把定位做得无限精确,而是在有限点数下让切换可预测,让移动自由而不误触。
方法全景:从光斑到声音经过哪几站?
整个链路可以按动作复述。表演者携带由树莓派驱动的手持投影仪,每个设备在演出期间固定渲染一种多边形,设备上的形状与颜色选择只用于搭建时配置,不发送给传感或音频。天花板广角相机拍摄共享墙面,专用计算机用 Python 与 OpenCV 处理视频,提取几何特征并估计空间状态,再经开放声音控制把控制数据发给 Sonic Pi 实时合成。房间保持昏暗以提高轮廓稳定性。检测事件包含身份、离散区域与连续几何量,离散量决定声部与音高,连续量调制音色。离散更新是被门控的注册状态,连续量则按帧率直通,这种双速设计是全文的关键。
空间交互点 × 投影几何: 空间交互点是铺在地面的 5 个离散站位,负责给出可重复的音高状态;投影几何是墙上多边形的位置、面积与梯形畸变,负责把表演者在房间中的站位编码成可观测信号。二者搭配的理由是不直接跟踪人体,而是读墙:同一站位会产生一组稳定的质心、尺度和不对称组合,分类器据此把几何映射回离散站位,组合后得到可学习、可返回的空间乐器。
下面这张总览图把上述链路画成了房间:人物、地面标记、墙面形状、相机、视觉处理、音频引擎与音箱都在同一画面中,右下角还给了手持设备的特写,适合先建立空间对应再读细节。
看图路径: 1. 先看 4 名表演者脚下的红色空间交互点圆圈与墙上 4 个彩色多边形的对应关系;2. 再沿天花板相机经虚线到视觉处理再经开放声音控制到音频引擎最后到音箱的链路走一遍;3. 对比右下角手持投影加树莓派的特写与表演者手中的光锥;4. 注意墙面同时承载多人形状,理解共享视觉场如何支撑协作
论文图 1。原论文 Figure 1:“(a) System overview. Four performers carry BeamPods through a 4 m × 3 m interaction space containing five Spatial Interaction Points (SIPs).”。
看完图应记住三件事:第一,传感信号只是墙上的形状,相机不看人;第二,墙是共享的,所有人的形状互相可见,这是协作的视觉基础;第三,声音引擎在链路末端,只接收结构化的数值事件,不直接看图像。后续的分割、校验、特征与分类都是为了让这个事件可靠。
视觉与声音组件:轮廓如何变成可发声事件?
视觉前端先把每帧转灰度并限制在用户定义的墙面感兴趣区域内。有背景帧时做背景减除,再经高斯模糊、大津阈值与形态学开闭得到干净二值掩膜;无背景帧时退回边缘检测加形态学清理。再从掩膜提取轮廓并用多边形近似拟合。身份按顶点数 3 至 6 判定为三角到六边形,并用面积、充满度与内角过滤假检出,只有连续 3 帧都通过才确认,且在已有检测固定半径内拒绝重复。
每个确认多边形提取 22 维几何向量,覆盖位置、尺度、包围几何、边缘统计与不对称性。倾斜代理量来自梯形畸变:对三角、方形、五边形取底部两顶点构成的参考边,对六边形取顶部峰下方两顶点,计算该边偏离水平的归一化偏差,超过 10 度记为倾斜。声音侧把形状编号对应 4 个合成器层,把 5 个空间点 1 对 1 对应到 D 小调五声音阶,横坐标管声像,纵坐标管低通截止即亮度,面积管响度,倾斜管失谐深度,快速甩动触发 1 次短重音,参数经 100 至 150 毫秒平滑。
形状身份 × 声音角色: 形状身份指三角形、正方形、五边形、六边形 4 种多边形类型,负责回答是谁在发声;声音角色指旋律、铺底、质感、高低频等 4 个互补合成器层,负责让合奏可分辨。二者搭配的理由是把可见标记与可听声部 1 对一绑定,表演者看墙就知道自己的声音在哪里,组合后形成便携、可移动的音乐声部指示。
有意确认 × 连续表达: 有意确认指离散空间状态更新前必须通过倾斜、置信度和连续帧三重门限,负责过滤走动中的瞬态几何;连续表达指位置、面积、倾斜每帧仍直接调制声像、滤波、响度和失谐,负责保留即时表现力。二者搭配的理由是把可信度要求高的离散切换变慢、把丰富性要求高的连续调制保持快,组合后实现稳定与灵敏分离的双速控制。
下图是理解双速的关键:上游是帧、裁剪、轮廓,中游分叉为分类与特征提取,下游红色门控支路与绿色连续支路汇合后再发往合成器,门限数值直接写在红框内。
看图路径: 1. 先从顶部相机帧经感兴趣区域裁剪与背景减除到轮廓提取的主路径看起;2. 再比较红色门控离散支路与绿色连续输出支路在何处分叉、何处汇合到声音引擎;3. 读出红色框内三行门限数值并记住它们同时成立才切换;4. 确认连续支路标注的每帧输出量与帧率
论文图 3。原论文 Figure 3:“(a) Top-down view of the spatial layout showing five SIPs and a performer projecting onto the shared wall.”。
读图后要能复述分工:红色支路慢而稳,负责音高状态;绿色支路快而活,负责音色表情。门控条件缺一不可,连续量不受门控阻塞,这正是走动中音色仍可变化而音高不乱跳的原因。
没有深度训练时,分类器的数据与标定从哪来?
本研究没有训练神经网络,也没有报告梯度路径或参数冻结细节,因此该节的任务是讲清真实的构造过程:监督来源是人工采集的有标签投影样本,模型是径向基核的支持向量机,输入是 22 维几何向量,输出是 5 个空间点标签加置信度。为减少形状差异带来的方差,按形状分别采集再合并训练。采集动作可复述:同一操作者在相同灯光与相机条件下,站在每个空间点,用每种形状各投射约 30 秒,每个点每形状约 192 个样本,四形状五点共 3835 个样本。
论文报告的不是部署中的用户无关泛化,而是同条件下的五折交叉验证,三角、正方形、五边形、六边形的准确率分别为 99.2%、98.9%、98.6% 与 99.7%,误分主要发生在相邻点之间,这与相邻站位投影几何更相似是一致的。
梯形畸变 × 倾斜代理量: 梯形畸变指斜向投影时多边形边不再水平、对称性被破坏的光学现象,负责携带投影仪相对墙面的姿态信息;倾斜代理量指用参考边偏离水平的归一化偏差计算出的数值,负责把这种畸变变成可门限的标量。二者搭配的理由是只用单目 2D 轮廓也能估计离轴程度,组合后既用于剔除训练分布外的极端姿态,也用于调制音色不稳定感。
需要指出的缺项是采集者单一,不同身高与持握方式是否泛化未经测试;相机或房间几何变化必须重采标签样本并重训分类器,不存在免标定的自动迁移。门限 10 帧是在反复排练中调定的经验值,约对应 30 帧每秒下的 0.33 秒,不是理论推导的最优值。
实验条件:房间、光线与数据链如何固定?
交互区为 4 m×3 m,地面标 5 个空间点,墙面要求浅色或白色以保证对比度,房间调暗,相机为天花板广角并固定机位,感兴趣区域由用户划定。手持端为投影仪加树莓派,演出中形状固定。视觉处理跑在专用计算机,音频合成用 Sonic Pi,链路经开放声音控制传输,地址格式包含形状编号、区域、横纵坐标、面积、倾斜与甩动。连续量按相机帧率约 30 帧每秒发送,平滑窗口 100 至 150 毫秒;离散切换需同时满足不倾斜、置信度超 0.90、同预测连续 10 帧。
资源状态方面,论文引用的 Sonic Pi 官网在本次核对中返回可用,状态码 200,因此可写该链接当前可用,但这只是音频引擎的公开可用性,不代表本装置代码或权重已公开,原文也未给出装置代码库。正式用户评估被明确列为未来工作,当前没有受试者规模、任务与量表。
下面这张现场照片用于核对上述条件是否真实出现:暗室、大白墙、多人同时投影、左侧监控站实时显示检测视图,墙上 3 个形状的亮度与大小差异肉眼可辨。
看图路径: 1. 先数墙上三个发光形状并辨认方形、三角形、六边形的亮度与大小差异;2. 再看左侧监控站屏幕上的检测视图与墙面形状的对应;3. 观察两名表演者的站位前后关系与房间暗光条件;4. 注意墙面为大面积浅色平面,这是轮廓对比度的来源
论文图 4。原论文 Figure 4:“Three performers simultaneously projecting dis- tinct geometric shapes (square, triangle, hexagon) onto the shared wall during a collaborative session.”。
看照片时不要推测像素级的坐标或颜色数值,只能确认论文文字已交代的条件:多人、不同形状、共享墙面、暗光、监控视图存在。这些是复现时必须先满足的物理条件,否则轮廓稳定性无从谈起。
主结果测了什么:在什么条件下算准?
论文直接报告的是同条件采集下的分类可分性,不是现场多人合奏的成功率。测试问题是仅凭投影几何能否区分 5 个离散站位,对比隐含在形状之间与相邻点之间,没有与其他传感方案的同条件对照。指标方向是准确率越高越好,聚合方式是五折交叉验证,4 个形状的准确率均在 98.6% 至 99.7% 之间。支持的判断是每个空间点确实诱导出质心、尺度与不对称的独特组合,足以被监督分类器分离。
限制是该数字不包含换人、换房间、换光线、多人遮挡与投影重叠,误分集中在相邻点也提示增加点数会压缩类间距。下图展示了从 1 号区到 3 号区的真实切换:检测视图的区域标签、置信与计数条随帧累积,最终才确认新状态,这正是把瞬态过滤掉的设计意图。
看图路径: 1. 先看上方面板中表演者站位与墙上小三角形的实际大小关系;2. 再对比下方三个检测视图中标注的区域编号从 1 保持到 3 的变化;3. 找到中间面板黄色进度条与 7/10 字样,理解确认计数正在累积;4. 观察三幅检测图中三角形顶点白点与绿色描边的稳定性
论文图 2。原论文 Figure 2:“SIP transition process. (a) Performer projecting a triangle onto the shared wall.”。
解释该图时抓住两点:上方面板证明输入只是墙上的小三角形,下方三格证明输出不是每帧跟随,而是计数到 10 帧才翻转。这种延迟是有意付出的代价,换来的是走动自由。
下面第一张表回答声音映射如何分工:离散字段管身份与音高,连续几何管表情,指标方向是参数变化应可听可看,不追求某种混音最优值。表前已说明比较问题是同一检测事件内离散与连续如何分工,公平条件是同一帧的同一多边形,表后会进一步讨论代价。
| 特征 | 映射参数 | 感知效果 | 更新速度 | 是否门控 |
|---|---|---|---|---|
| 形状编号 | 声部归属 | 表演者身份 | 事件级 | 否 |
| 区域 | 音高 | 空间状态选择 | 门控后切换 | 是 |
| 横坐标 | 立体声声像 | 左右位置 | 约 30 帧每秒 | 否 |
| 纵坐标 | 滤波截止 | 明亮度 | 约 30 帧每秒 | 否 |
| 面积 | 幅度 | 响度 | 约 30 帧每秒 | 否 |
| 倾斜 | 失谐深度 | 音色不稳定 | 约 30 帧每秒 | 否 |
| 甩动 | 单次重音 | 形状特有打击 | 触发式 | 否 |
表后解释:主要收益是身份、音高、表情解耦,表演者能用站位选音、用手腕调色;具体代价是倾斜既是表情又是门限,极端倾斜会被判为不可信而阻止切换。未胜出项是甩动重音,它只在快速动作触发,不承担持续控制,若动作不标准可能漏触发,论文未给出其检出率,这是未评测边界。
门限与特征缺了会怎样:论文给了哪些反证?
论文没有做标准的消融表,但用文字给了可复述的失败条件与设计对照。门限侧的逻辑是 3 条件缺一即不切换:倾斜超 10 度时特征已偏离训练分布,置信度低于 0.90 时不采信,连续帧不足 10 帧时视为瞬态。连续侧的反证是质心 alone 不够:质心只说形状落在墙上哪里,不说投影仪离墙多远、相对墙面是否斜视,而面积提供了离墙距离代理,倾斜与边缘不对称提供了离轴姿态,共同拉开在质心空间重叠的站位。历史对照也被引用:逐帧速度阈值曾导致反复误触发而需去抖,纯时间延迟又会在单目标久留时误激活,本文用几何稳定性加置信度加时间一致性来同时约束。
下面第二张表把门限、数据量与性能放在同一视图,便于复现时逐项检查,表中数字全部来自原文连续句,不做单位换算与四舍五入。表前的问题是门控有多严、数据有多少、性能有多高,公平条件是同一房间、同一相机、同一采集者,指标方向是置信越高、计数越长则切换越稳但越慢。
| 条件 | 指标 | 采集规模 | 本方法取值 | 对照含义 |
|---|---|---|---|---|
| 倾斜门限 | 允许切换 | 全量样本 | 倾斜不超过 10 度 | 超限则特征 خارج分布不切换 |
| 置信门限 | 分类置信 | 全量样本 | 超过 0.90 | 低置信视为不可靠 |
| 形状确认 | 连续帧数 | 全量样本 | 连续 3 帧 | 剔除假轮廓 |
| 分类性能 | 五折准确率 | 共 3835 样本 | 98.6% 至 99.7% | 误分多在相邻点 |
表后解释:主要收益是切换可预测,表演者站定约 0.33 秒才能换音;具体代价是延迟与僵硬感,快速跑场时音高跟不上脚步。未胜出项是相邻点区分:即使准确率接近 99%,相邻误分依然存在,说明加密空间点会先撞上几何可分性天花板,而非分类器容量。
哪些情况会失效:光线、标定与重叠如何破坏轮廓?
光线依赖是首要限制:环境光会降低对比度,投影泛光与运动模糊会扭曲轮廓边界,非白或纹理墙面同样削弱分割,论文要求暗室是硬条件。标定是第二限制:相机机位或房间几何一变就需重采标签并重训,单人采集的模型对不同身高与持握是否稳定未知。身份约束是第三限制:只用形状类型编码身份,上限为 4 人同时演奏,更大人群需颜色调制或时序编码,但又会引入投影仪色彩标定与相机色彩恒常的新问题。延迟方面,连续控制约 30 帧每秒,门控切换约 0.33 秒,开放声音控制传输与合成调度带来的端到端音频延迟未正式测量,不能承诺低延迟。
轮廓合并 × 可听的空间邻近: 轮廓合并指两个投影在墙上重叠成一个连通域而被当作单个多边形,负责解释为何身份与音高会同时失效;可听的空间邻近指这种合并导致声音突变或静默,反而让表演者听见彼此靠得太近。二者搭配的理由是单相机轮廓传感没有表演者分区概念,组合后把一个传感局限转化为潜在的协作提示,但其音乐可预测性仍待用户研究验证。
重叠投影的两种行为值得单独复述:若合并轮廓恰被判为某种训练形状,两个原声部停止并冒出一个新声部,但其空间分类不可靠导致音高不可预测;若合并轮廓无法归入任何形状,2 人声音同时消失。这是单相机轮廓法的必然:墙被当作无分区的共享视觉场。论文认为这让空间邻近变得可听,但能否成为协作资源仍待验证,不能当作已证明的优点。
复现先做什么:按什么顺序搭起最小可运行系统?
先固定物理:选一面大面积浅色墙,房间可调暗,天花板固定广角相机并划定墙面感兴趣区域,地面标出 5 个可拉开距离的点,交互区参考 4 m×3 m。手持端用投影仪加树莓派,每台固定渲染一种多边形,搭建时选好形状与颜色后不再经设备传参。再跑视觉:实现背景减除与边缘检测双路径、高斯模糊、大津阈值、形态学清理、轮廓提取与多边形近似,按顶点数判形状并加面积、充满度、内角校验,连续 3 帧确认。特征侧实现 22 维向量与倾斜代理量,倾斜超 10 度即标倾斜。
分类侧按每形状每点约 30 秒采集,总量参考 3835 样本与每点每形状约 192 样本,训练径向基核支持向量机并做五折检查,重点看相邻点混淆。声音侧用 Sonic Pi 实现四声部与 D 小调五声音阶映射,开放声音控制地址包含形状编号、区域、坐标、面积、倾斜与甩动,连续参数加 100 至 150 毫秒平滑。最后调门限:置信度 0.90、连续 10 帧、不倾斜三者同时成立才切换,连续量保持约 30 帧每秒直通。何时值得尝试:面向新手快闪与工作坊、只有普通相机、无力做身体跟踪时。
还需补的验证是换人换房间的泛化、端到端延迟测量与正式用户研究。
收束:这套方法在什么意义上成立?
论文报告显示,梯形畸变后的投影几何可以作为房间尺度离散状态的传感基元,无需身体跟踪或地板传感;有意确认策略用置信度、时间一致与几何稳定性把离散切换与连续表情分离,在可预测与即时性之间做了明确取舍;离散站位选音加连续几何调色的交互让新手可学可返回。这些结论的支持边界是同条件采集下的高分类准确率与排练调参,不支持跨房间、跨人群、多人遮挡下的泛化承诺。
未验证的推测包括重叠可听性能否促进协作、加密空间点后是否仍可分、颜色身份扩展是否稳定,均应表述为可能与待验证。复述者应带走的动作清单是暗室与白墙、固定相机与感兴趣区域、双路径分割与 3 帧确认、22 维特征与倾斜代理、支持向量机加三重门限、双速声音映射,以及对相邻误分与重叠失效的预期。记住一句话:墙上的形状既是给人看的乐谱,也是给机器读的传感器,门控让它慢得可靠,直通让它快得好玩。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



