英文题目:Acoustic Interactive Sand Tray Therapy System: An Embodied Interface for Multisensory Sound Interaction
会议身份:
conference:icmc:2026:conference-paper-id:paper-463
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#信号处理 #用户研究 #音乐 #音频交互
评分:4.9/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.4/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告
👥 作者与机构
- Yunze Mu:机构信息未能从会议 PDF 纯文本可靠映射
- Lorna Segall:机构信息未能从会议 PDF 纯文本可靠映射
- Zhixin Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该系统以浅盘细沙连续变形与精选小物件摆放为输入,以实时合成与变换的声音纹理为输出,难点在于沙面非刚性、高自由度且压实度变化而难以切分为离散手势,单目顶视还易被用户遮挡致表面数据间歇丢失。传感层由顶置深度相机采集表面几何并以C语言程序处理,经开放声音控制协议送往Max/MSP与Unity,其深度流与图像帧直接进入检测与特征环节。检测与特征步骤基于Darknet框架的YOLO v11识别盘内物件类别并输出类别与置信度,再将全盘深度方差提炼为表面平整度、将中心区域相对高度提炼为中央隆起量,并将物件类别编码为离散控制标记。声音引擎接收上述连续特征与离散标记,以Max/MSP与Unity做实时变换与空间呈现、以RTcmix与云端WebRTcmix做参数驱动合成,实现平整度控音色密度、隆起量控谐波聚焦、物件类别切换声音世界的多对多连续映射。与依赖离散传感器或预定义手势词表的触觉乐器不同,该系统以粗粒度感知显著特征驱动连续映射,刻意保留材料含混性以降低认知负荷。在离散事件触发设置下,触发苹果咬合事件的YOLO v11置信度分数为90%以上,高于未触发时YOLO v11置信度分数的90%以下区间。其适用边界限于开放式探索、教学演示与治疗师协助的声音制作,而非精确演奏或临床疗效验证,细粒度手势丢失与顶视遮挡受限仍是失败条件。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么值得做?
这篇解读的输入是论文正文与官方原图像素,目标是让刚进入语音音乐音频领域的研究生能复述该沙盘系统的技术链路。必须保留的信息包括传感配置、特征定义、映射规则、声音引擎构成与已报告的使用条件,输出是一套可按动作复现的理解。系统要解决的任务不是语音识别或音乐转录,而是把对细沙的连续触觉操作直接变成实时听觉反馈。输入是浅盘细沙的表面几何变化加上盘内摆放的小物件,输出是经合成与变换后即时播放的声音。
传统屏幕界面要求用户把身体意图翻译成抽象参数,精度高但割裂了动作与声音的即时联系。沙的价值在于无需预定义手势即可进行塑形、抚平、挖掘与堆建,触觉直觉本身就是控制语言。难点也在这里,沙面连续、非刚性、压实程度影响分辨率,交互难以切分为离散手势,传感与映射必须容忍含糊。论文因此把重点放在技术架构、传感管线与多对多映射策略,而非治疗效果评估。
理解这一取舍是后续所有细节的前提,评价时只能谈交互鲁棒性与映射清晰度,不能外推为疗效证据。
具身与材料路线提供了什么可借用的结论?
具身音乐交互路线的核心判断是乐器性手势不可拆分,身体动作本身就是音乐意义的一部分,而不只是发出符号命令的输入设备。新乐器界面研究进一步把物理参与、手势与身体直觉作为主要控制方式,反对以屏幕为中心的范式。 tangible 界面常用物理物体、表面或可变形单元做控制结构,确实提升了可达性与表现力,但许多系统仍依赖离散传感器或预定义手势词表,限制了探索。
材料基界面把材料自身的表达可供性放在首位,可变形表面、织物、黏土与流体都被试过,特点是含糊、连续变形与非符号交互,重视暂时性与具身意义生成。沙是连续可变形材料的极端例子,表面几何不稳定,难以分割,论文明确把这种不稳定性当作表达资源而非缺陷。映射研究则提供了另一条约束,参数映射被认为是决定表现力的关键,知觉透明与响应性至关重要,亲密控制强调小动作应产生可感知的大变化。
在无法也不应做精确手势识别时,基于特征的多对多映射更有效。
多对多映射 × 探索性交互: 多对多映射负责让多个材料特征同时影响多个声音参数,而非 1 对一旋钮;探索性交互负责让用户通过塑形、抚平与空间试探自行发现因果,而非执行规定手势。二者搭配的原因是沙的几何不稳定、难以做精确手势识别,只能用可感知特征支撑含糊而连贯的试探,组合后降低认知负荷并保留表达开放性。
本系统的定位正是这两条线的交点,用可感知的粗粒度空间特征支撑连续声音变换,用物件类别实现声音行为跳转,从而在不要求音乐训练与符号控制的前提下维持探索性。
系统要解决的具体技术问题是什么?
需要把一个动作同时包含连续量与离散量的输入空间,稳定地变成可理解的声音变化。具体而言,当用户用手推沙、抹平、堆尖或挖坑时,系统必须从顶视深度流中提炼出人能感知、耳能分辨的变化量;当用户放入或移动小物件时,系统必须在高帧率下识别预定义类别并及时切换声音行为。两个子问题互相牵制,连续支路若追求过细空间精度,会被沙粒噪声与压实差异淹没;离散支路若延迟过高,放置物件与听觉响应之间的因果就会断裂。
论文把感知显著性放在空间精度之前,只提取整体平整程度与中心区域高低这类粗粒度特征,同时要求物件放置到声音响应的延迟低于可感知滞后阈值。另一个隐含问题是评估边界,系统在大学环境中与作曲者、工作坊参与者及音乐治疗师合作开展了开放式声音制作会话,但这些会话被明确定位为检验交互鲁棒性与映射清晰度的用例,而非治疗结局评估。因此复述时要区分技术验证与效果验证,不能把用户能无指导建立因果这一观察当作疗效证明。
从沙面到声音的完整链路如何走通?
先沿一个样本走完全程。假设用户把沙盘中心堆起一个小丘并在旁边放下一个小物件,顶视深度相机持续采集表面几何,神经网络同时判断物件类别。深度流被处理为表面平整度与中央隆起两个连续特征,物件类别被编码为离散控制参数,两类参数经开放声音控制协议送入混合声音引擎,引擎改变合成与变换过程并立即回放,用户听到质感与场景变化后再调整手势,形成闭环。
深度感知 × 目标检测: 深度感知负责用顶视深度相机连续采集表面几何,不关心语义;目标检测负责用神经网络识别盘内特定物件的类别与置信度,不关心沙形。二者搭配的原因是沙盘交互同时包含连续变形与离散摆放,单一通道无法覆盖,组合后连续支路管质感渐变、离散支路管场景切换,共同送入声音引擎。
下图展示了该数据流的 4 个阶段划分,值得按输入到输出的顺序阅读,先确认物理界面、传感层、特征提取层与声音引擎的主路径,再看连续与离散支路在何处分开、何处汇合。
看图路径: 1. 从左到右沿数据流箭头数出四个色块的先后顺序;2. 观察传感层内深度相机与神经网络两个子框的并列关系;3. 观察特征提取层分出连续表面特征与离散控制参数两条支路;4. 确认两条支路以交叉连线方式汇入右侧声音引擎
论文图 1。原论文 Figure 1:“The Acoustic Interactive Sand Tray System dataflow.”。
图中左侧物理界面是浅盘细沙与精选小物件,传感层并列了实时表面几何采集与神经网络物件检测,特征提取层明确分为深度数据处理的连续表面特征与物件类别编码的离散控制参数,右侧声音引擎标注了声音合成变换与即时听觉反馈。交叉连线表示多对多关系,而非一一对应。
深度部分用语言编写并经开放声音控制协议送往声音处理与游戏引擎,声音引擎实现则混合使用了可视化音频环境、实时 3 维引擎与实时计算机音乐语言及其云端接口,前者层负责参数传递,后者层负责把参数映射为声音。这一划分让复现者能分段检查,先保证深度通路畅通,再接入离散检测,最后调试映射。
连续表面特征如何计算,又如何对应声音?
系统只保留两个主要表面特征。白话说,表面平整度就是全盘深度值的起伏程度,用深度方差刻画整体光滑还是紊乱;中央隆起就是中心区域相对高度,用于发现峰与洼。英文可记为表面平整度与中央隆起。论文强调二者是有意粗粒化的,优先保证感知显著性而非精细空间精度,这是为了抵抗沙粒噪声与压实差异。
映射设计强调即时性、知觉一致性与探索可供性。第一条是表面平整度到音色密度,较光滑表面产生稳定持续的质感,不规则表面引入频谱调制与复杂度;第二条是中央隆起到和声或空间聚焦,中央隆起增强和声强度或空间突出感,中央下陷则减弱存在感或使声音向外扩散;第 3 条是物件类别到声音世界,检测到的物件选择或改造合成过程,实现对比鲜明的声音行为之间过渡。
表面平整度 × 音色密度: 表面平整度负责把全盘深度值的方差压缩成一个连续量,刻画光滑还是起伏;音色密度负责把该连续量翻译为频谱调制与持续质感的强弱。二者搭配的原因是沙面无法切分为离散手势,只能用可感知的粗粒度统计量驱动连续声音变化,组合后抹平动作获得稳定长音,揉皱表面则引入复杂频谱运动。
中央隆起 × 和声聚焦: 中央隆起负责跟踪沙盘中心区域相对高度,区分堆高与挖低;和声聚焦负责把该高度差映射为和声强度或空间突出程度。二者搭配的原因是中心区域在视觉与触觉上都是自然注意焦点,堆高增强存在感、下陷则扩散或减弱声音,组合后形成直观的空间到听觉的对应。
物体类别 × 声音世界: 物体类别负责把预定义小物件的检测结果编码为离散控制参数;声音世界负责据此切换或改造合成过程的拓扑与行为。二者搭配的原因是连续沙形适合调制但不适合做模式切换,离散物件正好补上结构跳转功能,组合后放下一个物件就进入另一种声音行为而不需显式命令。
下图是利用表面平整度信息的可视化示例,可把颜色分层理解为深度到特征的中间表示,而非最终声音本身。
看图路径: 1. 先确认俯视沙盘的增强深度视图整体为红黄蓝分层设色;2. 观察中心螺旋与右侧蓝色洼地之间的颜色过渡;3. 注意深色十字与小圆点等局部物件造成的深度突变
论文图 4。原论文 Figure 4:“Visualization example using the surface flatness information.”。
该俯视增强深度视图用红黄蓝分层显示沙盘高度结构,中央螺旋形隆起与右侧蓝色洼地形成鲜明对比,深色十字与小圆点对应局部物件或刻痕造成的深度突变。复现时应先观察大尺度颜色过渡是否随抚平与堆挖连续变化,再检查小物件引起的突变是否稳定出现,由此判断平整度方差与中央高度是否具备可感知的动态范围,再接入声音映射。
目标检测器如何训练,哪些细节没有报告?
本研究的训练动作只发生在物件检测分支,连续表面特征分支没有神经网络训练过程。论文报告检测层基于开放神经网络框架与 1 次看全图的目标检测算法第十一版实现,框架用语言与并行计算架构编写,训练过程通过命令行工具进行。图注明确左侧图表蓝色线为当前平均损失,可视为检测器当前精度,平均损失数值越低代表结果越好。下图左侧为训练过程中平均损失随迭代下降的曲线,右侧为命令行滚动日志,复现者应先确认损失总体下降再进入低位波动,而不要求读出像素级精确数值。
看图路径: 1. 先看左侧曲线图的横轴迭代次数与纵轴平均损失的下降趋势;2. 观察蓝色平均损失曲线早期陡降后进入低位波动;3. 再对照右侧命令行窗口中滚动输出的损失与计数日志
论文图 2。原论文 Figure 2:“Training the object detector using Darknet through command line.”。
图中左侧曲线早期从高位陡降,随后在低位保持小幅波动,右侧黑色窗口显示逐轮损失与计数输出,符合命令行训练的常规形态。需要指出的缺项是论文未报告训练集规模、标注方式、类别清单、划分比例、优化器、学习率、批量大小、增强策略、停止准则与验证指标,也未说明参数冻结或更新范围与梯度路径。因此不能从模型名称推定具体主干实现,不能补写去掉某模块后性能必然如何,也不能把平均损失下降等同于部署帧率或端到端延迟达标。
复现时应把该节理解为已有检测器的构造说明,而非完整可重复的训练配方,若要重训,必须另行补齐数据采集、标注协议与评估流程,并单独测量实际运行帧率与放置到发声的延迟。
探索性会话在什么条件下进行,测了什么?
论文没有设置对照组与定量指标的正式实验,实际做法是在大学环境中组织引导式探索会话,参与者包括大学生、作曲者与工作坊学员,并在持证音乐治疗师协作下开展开放式声音制作环境测试。任务不是完成规定曲目,而是通过塑形、抚平与空间探索自行建立材料动作与声音响应的因果关系。系统功能被定位为开放式声音制作环境而非处方化工具,会话目的被限定为评估交互鲁棒性与映射清晰度,而非评估治疗结局。
这一条件决定了可支持的判断上限,只能谈用户通常无需正式指导即可建立因果、系统能否维持连续交互,不能谈疗效、学习迁移或群体差异。下图显示了大学场景中的引导式探索会话现场,上图有多人围观 1 人操作,下图为俯身直接用手塑形,沙盘表面叠加了彩色深度可视化,顶部支架固定了传感与线缆。
看图路径: 1. 先看上图围观者与操作者相对沙盘的位置关系;2. 观察沙盘表面投射的彩色深度可视化与顶视支架相机;3. 再看下图俯身用手直接塑形沙面的接触方式
论文图 5。原论文 Figure 5:“Facilitated exploratory sessions using the Acous- tic Interactive Sand Tray System in a university setting.”。
观察时先确认操作者身体与沙盘的接触方式是直接触摸而非经由鼠标键盘,再确认顶视设备与投影可视化的位置关系,最后注意周围参与者的围观结构,这解释了为何遮挡与多人干扰是真实运行条件。复现类似会话时应保留相同信息条件,记录参与者背景、引导语、会话时长、沙盘尺寸、沙粒类型、物件集合、相机高度与光照,并如实记录遮挡中断次数,而不虚构成功率或满意度分数。
映射表实际规定了哪些可运行的行为?
要回答声音如何随动作变化,最直接的证据是论文给出的参数控制示例表。该表把声音类别、控制参数与映射逻辑并置,区分了离散事件、环境质感、和声内容与复合场景 4 类行为。比较问题是同一套传感输入能否同时支撑瞬时触发与连续调制,公平条件是都走同一深度加检测管线并经同一混合引擎发声,指标方向是触发类看置信度是否越过阈值,连续类看平整度与隆起变化是否带来可感知的增益、滤波与频谱质心移动。
下表按原文整理为五列,前三列忠实转写原文类别、参数与逻辑,后两列标明输入类型与交互效果以帮助初学者定位,但不引入新数值。
| 声音类别 | 控制参数 | 映射逻辑 | 输入类型 | 交互效果 |
|---|---|---|---|---|
| 离散事件,如咬过的苹果 | 目标检测置信度 | 置信度大于 90% 时触发 | 离散物件 | 切换事件声 |
| 环境质感,如持续低鸣 | 全局表面平整度 | 连续调制增益与截止 | 连续沙形 | 抚平则稳定 |
| 和声内容 | 区域中央隆起 | 谱质心随峰高偏移 | 连续沙形 | 堆高则突出 |
| 复合场景 | 物件数量与密度 | 改变全局合成拓扑 | 混合输入 | 场景跳转 |
表后需要强调主要收益与具体代价。
该设计的主要收益是连续与离散通道互补,光滑与起伏管质感渐变,中央高低管聚焦强弱,物件出现管场景跳转,用户可通过触觉试探自行发现因果。具体代价是阈值类行为依赖检测置信度,若光照、遮挡或物件姿态变化导致置信度波动,触发会不稳定;连续类行为依赖粗粒度统计量,细小刻画可能被方差平均掉。未胜出项是精细手势识别,论文明确放弃高分辨率手势路线,因此不能用该系统去做需要精确指尖轨迹的乐器评价。
原文未给出延迟毫秒数、帧率、误触发率或听感评分,相关改善承诺必须写成待验证。
若拆掉某一层,系统还剩什么能力?
论文没有提供消融实验的数字对照,因此本节只能按架构做定性拆解,而不虚构拿掉后必然下降多少。比较问题是 4 个层级各自承担了不可替代的功能还是冗余包装,公平条件是保持其余层级不变、只在概念上屏蔽目标层。指标方向是交互是否仍能维持连续性、离散切换与即时性。下表把 4 层按输入、处理、输出与去向展开,帮助复现者分段排查故障。
| 层级 | 输入 | 处理 | 输出 | 去向 |
|---|---|---|---|---|
| 物理界面 | 手与物件触觉动作 | 细沙变形与物件摆放 | 表面几何与场景布置 | 顶视传感 |
| 传感层 | 沙面与物件图像 | 实时几何采集加物件检测 | 深度流与类别结果 | 特征提取 |
| 特征提取层 | 深度与类别 | 连续特征加离散编码 | 平整度隆起与控制参数 | 声音引擎 |
| 声音引擎 | 特征与参数 | 合成变换与映射 | 即时听觉反馈 | 用户耳朵 |
表后解释拆解含义。若去掉连续表面特征,系统只剩物件触发,沙的抚平堆挖将失去声音意义,探索性大打折扣。
若去掉物件检测,系统只剩质感渐变,无法实现声音世界之间的跳转;若去掉混合声音引擎中的任一实现环境,需要确认参数接口是否仍经开放声音控制协议贯通,否则会出现通路中断。反例是单顶视相机被身体遮挡时,即使映射正确也会间歇丢失表面数据,这属于传感层单点故障而非映射失败。论文未测量各层耗时占比,因此不能断言瓶颈在检测还是合成,复现时应分别记录采集、检测、传输与合成的耗时分布后再做优化判断。
哪些边界会让复现结果打折?
论文直接报告了 3 类限制。第一类来自材料与传感分辨率,沙的物理特性与深度传感分辨率共同决定灵敏度上限,细粒度手势可能被掩盖,映射参数需要仔细校准以平衡响应性与声音稳定性。这意味着抚平与轻刻的差异可能小于噪声,调得太灵敏声音会抖,调得太稳定又会迟钝。第二类来自单顶视相机的遮挡,当用户前倾并暂时挡住相机视场,会间歇丢失表面数据,导致声音跳变或冻结。
第 3 类来自评估范围,现有会话只覆盖大学生、作曲者与工作坊参与者,且明确不是治疗结局评估,因此不能推广到临床人群或长期学习效果。从音乐界面技术设计空间看,系统主动选择了具身材料交互与知觉一致性一端,放弃了高分辨率手势识别与符号控制一端,这是设计取舍而非技术失误。
复现者应把校准过程与遮挡处理作为必做项,记录不同沙湿润度、颗粒粗细、环境光与相机高度下的表现,并说明未评测的边界,例如多人同时操作、极端堆高超出量程、物件被沙半埋时的检测稳定性,这些在原文中均未给出定量数据。
要复现这套系统,先做什么、用什么?
复现顺序应沿数据流从物理端向声音端推进。第一步搭建浅盘细沙与精选小物件集合,固定物件类别清单并拍照存档,保证每次实验使用同一集合。第二步架设顶视深度相机,论文示例为某款深度相机,安装高度以完整覆盖沙盘且留出操作空间为准,记录分辨率、帧率、曝光与环境光,用语言编写的深度处理程序经开放声音控制协议把数据送往音频与 3 维引擎,先用可视化确认深度方差与中央高度随动作连续变化。
第三步接入基于开放框架的 1 次看全图检测器第十一版,准备与沙盘场景一致的标注数据并复刻命令行训练流程,以平均损失下降为初步信号,但必须另行测量验证集精度、误检率与实际帧率。第四步实现特征到声音的映射,按表面平整度到音色密度、中央隆起到和声聚焦、物件类别到声音世界的 3 条规则起步,在可视化音频环境、3 维引擎与实时计算机音乐语言及其云端接口中接通参数,阈值类触发可从置信度大于 90% 起步再按场景校准。
资源状态方面,本次未发现来源绑定且完成安全验证的资源,不得声称代码、模型或数据已公开,复现时应按自研管线处理,保留关键超参数与信息条件以便他人核查。最后组织引导式探索会话时,明确记录引导语、任务、时长与中断次数,只报告交互鲁棒性与映射清晰度观察,不做疗效断言。
何时值得尝试这条路线,还缺哪项验证?
当目标是低认知负荷的开放式声音探索、包容性音乐参与或社区工作坊,而非精确演奏与符号作曲时,这条路线值得尝试。它的优势在于用户无需乐理即可通过触觉建立因果,连续沙形提供无级质感变化,离散物件提供场景跳转,多对多映射保留了含糊中的连贯性。
常见误解是把可视化颜色当作声音本身,或把平均损失下降当作端到端体验达标,前者只是深度中间表示,后者只是检测分支的训练信号,真正的闭环必须回到放置到发声的延迟、遮挡恢复时间与长时间稳定性。还需补的验证包括双盲或对照条件下的映射清晰度比较、不同沙材与光照下的鲁棒性矩阵、多人干扰下的误触发统计,以及多相机与多模态融合是否确实减少遮挡中断的定量对比。
未来工作在论文中已指向多相机配置、多模态传感器融合、自适应映射与正式用户研究,复现者可沿此推进,但每一步都应保留可运行基线与实际部署策略,避免用事后最优值代替可部署收益。只有在这些条件补齐后,才能判断连续可变形自然材料是否在更广的计算机音乐界面设计中成立。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



