英文题目:DANCING CABIRIA: AN HYPER-ENVIRONMENT STUDY THROUGH CORPUS-BASED TECHNIQUES
会议身份:
conference:icmc:2026:conference-paper-id:paper-647
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#信号处理 #音视频 #空间音频信号 #音频交互
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Piero Poli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为4名舞者全身动捕轨迹与预录声音语料,输出为虚拟现实中空间化的拼贴声音,难点在于身体自由度远高于描述子导航维度且不可见语料空间难以被本体感知发现。方法链分四步:先以Xsens套装240 fps采集关节位置与朝向并经Unity与OSC送入Max整理为运动数据库,再用FluCoMa新颖性与起音检测切分并提取MFCC、chroma等多维描述子构成500-2500个语料单元。接着经分位数归一化与插值把单元映射为包围舞者的三维体或二维平面,使空间邻近对应音色相似并以手动传递函数适配表演尺度,随后以关节组均值位置做最近邻检索并用运动速度控制触发与复音。最后用IRCAM SPAT做八声道空间化后转双耳呈现,使表演者与观众共享同一超环境。与传统手势直接控制合成参数不同,该超环境把音色相似性转为空间邻近性,靠身体轨迹揭示结构而非触发预设音符,从而将语料探索变为可导航的作曲与表演行为。在共享平面探索与POV微观探索场景下,共享平面探索的语料规模指标为2420单元,高于POV微观探索的语料规模指标740单元。结论适用边界受限于预编排离线合成的艺术装置,尚未验证实时反馈下的演奏稳定性与观众感知收益。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://www.flucoma.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.bachproject.net/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/bachfamily/dada — 链接可访问(HTTP 200)
- 第三方资源:https://www.bachproject.net/ears/ — 链接可访问(HTTP 200)
- 第三方资源:https://rodrigoconstanzo.com/sp-tools/ — 链接可访问(HTTP 200)
- 第三方资源:https://forum.ircam.fr/projects/detail/spat/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.xsens.com/motion-capture/suits — 链接可访问(HTTP 200)
- 第三方资源:https://base.xsens.com/s/article/MVN-Unity-Live-Plugin → https://base.xsens.com/s/article/MVN-Unity-Live-Plugin?language=en_US — 链接可访问(HTTP 200)
- 第三方资源:https://learn.flucoma.org/reference/onsetfeature/ — 链接可访问(HTTP 200)
- 第三方资源:https://essentia.upf.edu/algorithms — 暂时无法访问
- 第三方资源:https://learn.flucoma.org/explore/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一步?
本文的输入是两类已经录好的材料,一类是舞者的全身运动流,另一类是预先录制并切分分析好的声音单元集合。目标不是做一个跟随音量或跟随节拍的简单互动装置,而是把声音单元按照音色描述符摆放到舞者周围的虚拟空间里,让舞者用走位和肢体幅度去走过、触碰并触发这些声音。输出是为虚拟现实呈现的八声道转双耳的声音轨,以及 4 种不同摆法下舞者与观众共同可感知的空间。
为刚入门的读者先把两个关键词说白话。语料库合成就是先把长录音切成几百到几千个小片段,每个片段算出一组描述音色的数字,再在演出时按相似度找最接近的一个播出来。超环境是本文的操作性定义,指叠加在编舞空间之上的另一层看不见的声音层,只能用耳朵和身体动觉去发现,舞者走到的位置决定了听到哪一簇音色。
本文必须保留的信息是实验条件而非修辞。动作来自穿戴式动捕服,4 位舞者各演 4 段编舞,声音全部来自离线预分析的语料,正式成片的合成是离线回放对齐影像,只有测试阶段有实时反馈。解读的输出将按学习依赖展开,先讲任务与相关路线,再讲从动捕到语料再到空间化的全链路,然后讲 4 个配置的具体做法、参数对照与复现要点。
已有路线把语料库当成了什么,本文接在哪一环?
语料库技术最早从语音拼接合成借来切分、描述符分析与选择策略,到了迪莫·施瓦茨的交互式系统,关键变化是用在描述符空间里漫游来代替直接拧合成器参数。后来工具链把机器学习和数据挖掘放进作曲环境,使语料的建立、变换与可编程探索更容易。教学例子可以这样想,传统合成器是拧截止频率旋钮,语料库漫游是走到音色地图的另一个街区。
表演实践把语料库从材料变成了动作空间。电贝斯漫游语料的作品把乐器变成音色探索的中介,空间化音色的研究把手势特征与声音在空间中的分布连起来,近年用机器学习做动作到拼接合成映射的工作把手势到音色的控制推向更细的 sonification,另一类作品则把近 5000 个声音手势投影到可导航的 3 维空间再用虚拟相机探索。本文接在这一串工作的末端,区别是把可导航的 3 维语料空间直接套在舞者身体周围,并在虚拟现实里让人走进去。
同输入同目标的对照要严格。同是手势查语料,前人多用手持乐器或单点控制器,本文用全身多关节位置做查询。同是空间化,前人多把音色维度映射到扬声器方位,本文多走一步,先按描述符把语料铺成体或面,再让身体轨迹决定查到哪一片。同是观众感知,前人强调演奏控制,本文强调表演者与观众的非对称迷失,观众看到动作却猜不到声音,因为声音还取决于不可见的语料地形。
为什么身体动了不等于声音自然对了?
一个样本走完全程有助于理解难点。假设右手从胸前缓慢抬到头顶,如果是传统映射,抬手高度直接管音量或亮度,观众一看就懂。如果是本文做法,右手位置只是去语料地图里查一个点,查到的声音取决于那片区域当时被摆了什么样的单元、密度多高、是否加了随机扰动。同样一段抬手,在浓密的高频区和稀疏的低频区听到的完全不同。
难点有 3 层。第一是维度对不上,全身十几个关节的位置方向流维度很高,语料描述符也是十几维,直接连会抖动且不可控。第二是分布不均匀,自然录音切出的单元在描述符空间里会挤成一团,身体走过去要么反复触发同一片,要么大片空白无声。第三是感知不对称,舞者靠试错学习隐形地形,观众按日常的动作即声音预期去听,必然感到迷失。
本文把问题框定为可复述的构造问题,如何标定虚拟体的尺度,如何把描述符映射到三轴,如何用归一化与传递函数把拥挤区摊开,以及如何让提取速率只响应动态而非静态姿势。这些都不是用一个大模型端到端解决,而是用流水线中每个环节的可调参数解决。
从身体到声音的主链路分哪几步?
主链路可以按一个时刻的数据流来读。舞者穿动捕服,选定关节的位置与方向以高帧率送入 3 维引擎中的人形,再经开放声音控制协议转发到统一的声音编程环境,在那里做清洗、关节子集选择与归一化,组织成带时间自动化的动作数据库。另一条支路是离线把源录音切成单元并算好描述符,形成语料库。演出或合成时,用聚合后的身体位置做目标向量去语料里做最近邻查找,取出单元再做音高包络等后处理,最后经空间化渲染成多声道并转双耳给虚拟现实。
这条链的取舍很明确。身体只给位置类的导航信息,速度管出声密度,方向与手指管后处理,不让静态姿势无故出声。语料只给预分析好的内容,不在演出时重算切分。空间化分两种,个体体或面分布时声源跟人走,共享分布时单元固定为静止声音对象。理解这个分工,后面 4 种配置只是换了体的形状、查询用哪些关节、加多少随机量。
语料库与超环境如何配合成可走的空间?
先把组合机制讲清。语料库合成的分工是内容可检索,超环境的分工是内容可定位。语料库把声音变成带坐标的点,超环境把这些点摆到以舞者为中心的体里。搭配理由是如果只有检索没有空间布局,身体就没有行走的意义,如果只有空间没有音色相似性做布局依据,行走就听不到渐变。新增作用是虚拟体中的物理邻近对应音色相似,舞者用轨迹揭示隐形结构。
语料库合成 × 超环境: 语料库合成负责把长录音切成单元并计算描述符形成可检索的声音集合,超环境负责把这些单元按归一化后的描述符摆放到舞者周围的 3 维体或平面中,二者搭配的理由是前者只解决找什么声音,后者解决在身体空间的哪里找到,组合后身体轨迹就同时成为描述符空间的导航向量和虚拟位置。
具体构造分 3 步。先用新颖性与起始点检测做语义连贯的切分,再用一套包含梅尔频率倒谱系数、色度与多种频谱描述符的组合算特征,高维部分用降维处理。接着把每个空间轴对应到一个声学属性,把提取值做分位数变换摊平成均匀空间,再与原始分布做加权插值,保留一定的原始聚类。最后按实际动作范围用手工传递函数压缩或拉伸各轴,使可交互体积贴合表演需要。
描述符归一化 × 分位数变换: 描述符归一化负责把量纲差异很大的声学特征拉到可比尺度,分位数变换负责把原始偏态分布重映射为均匀分布以避免过密团块和空洞,二者搭配是因为只做线性缩放仍会保留拥挤区,组合后作者再用加权插值在均匀性与原始音色聚类之间做可调折中。
这种做法的结果是一个可复现且语义连贯的新声音环境。均匀化解决可导航性,保留原始聚类解决音色关系不被完全打散,手工变形解决身体实际能走到的范围。复现时要记录插值权重与每轴传递函数,否则别人无法得到同样的地形。
高维动作流如何变成可查询的低维控制?
动作侧的聚合是关键。原始流包含肩肘腕髋头大腿膝踝等多处,还可能有手套的每指传感器,直接送入搜索会受单关节噪声主导。做法是按编舞需要先缩减到相关关节子集,再对关节组取平均位置作为目标向量,对局部平均速度决定单元提取速率,对传感器方向做音高范围与包络等后选择调制,必要时加随机扰动防止长轨迹反复命中同一单元。
动作捕捉 × 目标向量: 动作捕捉负责以高帧率给出关节位置与方向的高维流,目标向量负责把多关节位置做均值聚合降成可送入最近邻搜索的低维查询点,搭配的原因是原始关节维度太高且抖动大无法直接查库,组合后局部速度管出声速率而均值位置管音色位置,分开控制动态与内容。
最近邻与渲染的配合决定听感。查到单元只是选了内容,还要决定它从哪里来。个体体与面分布时用髋部决定声源在听音空间的位置,并按与虚拟中心点的距离算立体声展宽。共享分布时每个单元按其在语料体中的位置固定在八声道中,模拟静止声音对象,舞者走过只是点亮它们。
最近邻搜索 × 空间化渲染: 最近邻搜索负责根据身体算出的目标向量从语料中取出音色最接近的单元,空间化渲染负责决定该单元在八声道或双耳中的方位,前者管内容选择后者管位置呈现,搭配后出现两种做法是个体体分布时声源跟随髋部而共享分布时单元固定为静止声音对象。
一个教学例子是手部微动。如果用双手相对位置做目标,用双手速度管播放速率,用肘部管混响包络,用手指管附加参数,那么极小的位移也能扫过高密度区的谐度梯度。这正是第三段编舞的思路,把控制权集中到末端以换取精细度。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练神经网络,也没有报告梯度、优化器、损失收敛或权重更新。不要把无训练理解成确定性求解,系统仍含随机扰动与多人即兴带来的不确定性,也不要从参数冻结去推定输出确定,因为查询位置本身随身体连续变化。真实计算是分析、检索与映射 3 类。分析指离线切分与描述符计算,检索指最近邻查找,映射指聚合、归一化、空间变形与空间化。
为理解离线工作流,先看数据库界面。它把低分辨率人形回放与动作自动化对齐,让作曲者在回放中试验 sonification 并与最终影像精确同步。这种结构把试错成本从舞台搬到桌面,但也意味着正式结果不依赖实时链路的稳定性。
以下导读针对实际收到的界面像素,帮助建立离线合成的操作感。界面顶部是读入与循环控制,中间是时间选择条,左下是多通道数据条,右下是虚拟人形小窗。
看图路径: 1. 先看顶部读入与播放控制条确认这是离线回放界面而非实时舞台;2. 再对比左下多通道条形区与右下虚拟人形小窗的位置对应关系;3. 注意右下小窗中两个人形的相对位置与中间时间选择条的联动含义
论文图 1。原论文 Figure 1:“Database interface for handy motion data extraction and video synchronization.”。
该界面显示的要点是动作数据库的可操作性。左下条形区反映被选关节随时间的取值起伏,可用来挑选手臂大幅摆动或静止段落。右下小窗同时显示两个人形,可对照双人或先后位置关系。中间的浅色选择条对应循环回放区间,作曲者固定该区间后反复调整目标向量与提取速率,再看听感是否与影像动作对齐。这解释了为何正式成片能做到精确同步,也解释了为何舞者当时听不到最终声音。
四段编舞在什么场地用什么体形做对照?
4 段编舞各由 4 位舞者表演,灵感取自默片的 4 个不同场景,编舞者统一,拍摄地分别为都灵的公园、河岸、宫殿庭院与埃及博物馆展厅。每段有明确的曲式,从外圈同步到向心再扩散,或宽轨迹后段才同步,或双人躺地手部慢动,或卡农错拍到集体同步。场地与队形差异本身就是实验条件,决定了虚拟体该做成包围个人的球、贴地的面、手部小球还是全员共享的大场。
动捕与软件条件按原文交代。动捕服以高帧率把位置方向流送入 3 维引擎再转发到声音环境,分析用声音工具包做切分与描述符,空间化用多声道空间化工具包做八声道,最终转双耳给虚拟现实。第三方工具的当前可达状态以本次核验为准,其中声音工具包、作曲包、数据结构包、分析包、演奏工具与空间化工具的链接本次可达,另有一个分析算法库链接本次未能确认可达,复现时应以本地已安装版本为准。
以下导读针对体探索示意图,它是理解个人包围体的最直接材料。图中 4 个人形各被一团语料包围,中央是相机,虚线表示编舞的外圈路径。
看图路径: 1. 先数四个角落的人形确认每人拥有独立的包围式语料团;2. 再看中央相机标记理解内外圈收拢与扩散的朝向关系;3. 对比左上浓密团与右上稀疏团的密度差异并联系肢体幅度
论文图 3。原论文 Figure 3:“Corpora displacement around each performer.”。
该图显示的核心对照是每人一团而非共用一团。左上团最浓密,右上团相对稀疏,说明即使同是包围体,不同舞者的语料密度与肢体幅度也可以不同。中央相机帮助判断内外圈的收拢方向,舞者向心时身体进入更密集的触发区,扩散时回到稀疏区。这种布局把编舞的队形变化直接变成音色密度的变化,是后文讨论动作幅度与语料尺度关系的基础。
四种摆法各自测了什么,听到了什么变化?
体探索把语料做成包围全身的球,按肢体最大伸展分布。每组关节取平均位置做查询,局部平均速度管提取速率,手部旋转管播放音高范围。每位舞者形成多复音织体,每肢多声部同时提取个人语料,身体幅度、语料尺寸与虚拟空间的沉浸感形成清晰对应。平面探索把语料铺成贴在编舞空间上的 2 维面,用髋部位置做查询并加随机噪声防重复,用高语料维度保证大范围走位的音色流动性,舞者在身后留下声音轨迹。
视角探索把虚拟球缩到上肢周围,用去辅音后的人声自然语料营造朦胧感,双手相对位置做目标,双手速度管播放速率,肘部管包络混响,手指管附加参数,微手势扫过谐度梯度。共享平面探索让 4 人共用一个由排练环境与人声录音生成的短单元语料,映射类似体探索但空间化按单元在虚拟空间的位置固定,激活的是稳定的静止声音对象群。
以下导读针对平面探索示意图,帮助理解大轨迹如何扫过整片语料。图中灰点为语料,黑色长箭头为舞者行走路径,中央为相机,右侧为舞者起点。
看图路径: 1. 先沿黑色长箭头走一遍舞者在平面语料中的大范围轨迹;2. 再看中央相机标记与右侧人形的起点位置关系;3. 观察灰点密集区与稀疏边缘的分布并思考长轨迹的音色变化
论文图 6。原论文 Figure 6:“Corpus displacement in a plane for each performer.”。
该图显示的关键是轨迹长度与语料覆盖的关系。箭头从右侧出发绕行大半个密集区再指向远端,说明舞者不是原地摆肢而是用走位穿越不同密度区。中央相机附近最密,边缘渐疏,因此走位会先听到浓密混叠再进入稀疏可辨的单元。这种以路径换音色叙事的做法与体探索的以肢体幅度换密度形成对照,也是后文平面与体在感知分歧上不同的来源。
主要收益与代价要一起说。体探索的收益是确定性强,每肢独立可控,代价是音色惊喜有限。平面探索的收益是发现感强,轨迹越长揭示越多,代价是导航慢且需要更大语料覆盖。视角探索的收益是精细度高,代价是只适合小范围且对归一化敏感。共享探索的收益是集体感知强,个人贡献交织,代价是个人控制感下降。
语料多大、体多大、动多快才配得上?
比较问题是动作尺度与语料拓扑是否匹配,公平条件是看同一套提取方法在不同体量下的表现,指标方向是轨迹连续时听感不断裂且不反复卡在同一单元。下表整理论文明确报告的体量对照,典型语料给出全集的一般范围,两个极端给出宏大手势与微手势的配对。表前已提出匹配问题,表后将解释为何小体量必须用短单元加密。
| 配置 | 单元数量 | 分布体积 | 代表速度 | 单元时长范围 |
|---|---|---|---|---|
| 共享平面探索 | 2420 单元 | 4m x 8m x 2m 体 | v 大于 1m 每秒 | 5 到 50 毫秒短单元为主 |
| 典型语料一般范围 | 500 到 2500 单元 | 随动作标定 | 随编舞变化 | 50 到 2000 毫秒 |
上表显示大动作配大体量大语料,小动作配小体量密语料。共享场用两千四百量级单元铺满数米见方的体才能支撑每秒一米以上的宏手势,视角小球只用七百多单元但把球缩到半径半米才能让每秒 0.3 米以下的微手势扫出变化。典型语料的总数与时长跨度很大,说明具体切分必须按场景重做,不能用一个通用库套全部编舞。未胜出的做法是忽视这种配比,用小语料铺大空间,结果是沉浸感丢失,这在 4 段对照中被直接观察到。
| 做法 | 复音数 | 相邻差异 | 噪声强度 | 单元时长 |
|---|---|---|---|---|
| 体探索每位舞者 | 32 声部复音 | 由分布决定 | 按需扰动 | 随肢体变化 |
上表解释流畅性的技术代价。体探索用每人三十二声部、每肢八声部的叠播靠听觉掩蔽换均匀感,微手势用短单元加大的相邻差异捕捉细微音色,长单元因平均特征变化小必须加注噪声防止重复。同一源材料切成 50 毫秒与切成 1 到 2 秒会得到完全不同的分析特征与感知,单元时长本身就是音色设计参数。负结果是小语料不加扰动必然听到循环感,论文用同时播多单元与微调音高包络滤波来掩蔽,但这会增加复音开销。
哪些做法是为了防重复与防空洞,拿掉会怎样?
论文没有做神经网络消融,但报告了多组可复述的对照操作,可按失败条件来读。第一组是分位数变换与加权插值,拿掉均匀化,语料在描述符空间的自然团块会造成过密与空白,身体走过去要么反复命中同一单元要么无声。第二组是随机扰动与高维度覆盖,平面与共享配置都加噪声,目的是打散连续重复,长单元还需更大扰动。第三组是多复音叠播与微调制,用音高包络滤波的小变化制造感知同质性,靠掩蔽藏起重复。
从机制上说,这些都是用可控的随机与冗余换连续性。扰动太小则同一轨迹反复触发同一单元,扰动太大则破坏按音色相似布局的初衷。复音太少则稀疏区听感断裂,复音太多则掩蔽过度丢失细节。论文给出的扰动强度与相邻差异阈值应视为起点,换了源材料与场地尺寸必须重调。
未评测的边界要明确。手工传递函数的压缩拉伸依赖作曲者观察表演后调整,没有给出自动优化目标。归一化解决了可视化与探索的维度 1 致性,但没有测量不同归一化对观众辨别力的影响。这些缺项不是技术错误,而是复现时需要补的验证。
表演者与观众为何同时迷失,离线带来什么限制?
超环境的感知不对称是核心发现。表演者看不见语料地形,只能靠移动增量式发现 affordance,观众按日常的动作即声音预期去听,看到轨迹却听不到可预测的声音,因而感到迷失。体与平面探索放大这种分歧,强调纪念碑尺度或长路径,视角与共享探索则靠触觉亲密与集体同步制造趋同。这种不对称本身可作为作曲参数,用来设计共享感知空间。
离线合成 × 实时反馈: 离线合成负责在动作数据库回放时精细试验映射并与最终影像对齐,实时反馈负责让舞者在动的同时听见并调整探索策略,二者分工不同,论文报告真正的演奏者与乐器之间的实时回路只出现在测试阶段而未进入成片,组合意义在于离线保证可复现的作曲控制,实时才是未来开放乐器的验证条件。
离线是最大限制。论文明确报告真正的实时反馈只发生在测试阶段而未进入最终 sonification,正式成片是回放动作数据库再精细合成。这保证了与影像的精确同步与可反复试验,但舞者在正式表演时无法根据声音调整身体,超环境更像稳定的预置声场而非有生命的乐器。作者据此区分两种未来,独奏配置更适合做探索性作曲工具,合奏预置更适合做稳定的集体乐器。
其他限制包括纯声音超环境的发现成本高,舞者靠试听试错找 affordance,缺少视觉与触觉提示。论文提出但未验证的解法是加环境光指示局部密度、用振动背心提示音色边界,把隐形空间变成有意识可导航的乐器。这些都还停留在展望,没有测量数据。
要复现这套流水线,先做什么,需要什么版本?
复现先做最小闭环而非 1 次搭全场。第一步录一段短源音频,用起始点与新颖性检测切成几百个单元,算梅尔倒谱与色度加频谱描述符,确认单元数与时长落在可调范围。第二步录一段短动作或用现有人形动画,只取髋与双腕三点,先做均值位置与局部速度,送入最近邻查库,确认静止不出声、动则出声。第 3 步把语料按两轴铺成小平面,用分位数变换摊平,再加小噪声,沿直线走一遍听是否还有卡重复。
关键超参数与信息条件要保留。语料总数、单元时长、分布体积、代表速度、相邻差异阈值与噪声标准差都已在前表给出,复音数按每人三十二声部起步。空间化分两种,个体跟人走用髋部定声源,共享固定用单元位置定声源,最终多声道转双耳时保留原始八声道的沉浸关系。动作聚合用均值抗单关节噪声,速度管提取率,方向与手指管后处理,这些分工不要颠倒。
代码与系统可运行要区分。论文依赖的作曲包、数据结构包、分析包、演奏工具与空间化工具本次核验为可达,可写当前可用,但具体版本与安装方式以原文链接的官方页为准。另有一个分析算法库链接本次未能确认可达,复现时不要依赖该页,应直接用本地已装的分析对象。动捕服与引擎插件需按官方文档配置帧率与转发,帧率不一致会直接改变速度到提取率的映射。
何时值得尝试这种把语料铺在身体周围的做法?
当编舞本身有明确的空间叙事且源声音有足够可切分的纹理时值得尝试,例如从外圈收拢到内圈、长距离穿越、双人手部对峙或 4 人卡农到同步,这些队形变化能直接映射为密度与音色的变化。当只需要一个跟随响度的互动音效时不值得,超环境的搭建与调参成本远高于简单映射。
对研究生的实践建议是把匹配关系当第一性原理来记。大动作需要大体量大语料,小动作需要小体量密语料,长单元必须配噪声与复音,短单元靠密度与相邻差异取胜。先沿一个样本走完输入到输出,确认目标向量、提取速率与后处理的分工,再去调分布变换的权重与传递函数。
还需补的验证很具体。补一组实时与离线对照,测量舞者有无声音反馈时的探索路径长度与重复率。补一组有无光触觉提示的对照,测量找到目标音色区的时间。补一组不同归一化与扰动强度的听辨测试,报告观众对动作到声音可预测性的评分。只有补上这些,才能把超环境从可复现的作曲方法推进为可演奏的乐器。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



