用沙子的形状直接捏声音:连续变形材料如何绕开离散手势识别
该系统把沙面深度变化与沙盘小物件检测分别做成连续特征与离散切换令牌,再用多对多映射送入混合声音引擎,探索性使用显示无需乐理即可建立因果,但代价是细粒度手势易被淹没且单顶视相机存在遮挡中断。
该系统把沙面深度变化与沙盘小物件检测分别做成连续特征与离散切换令牌,再用多对多映射送入混合声音引擎,探索性使用显示无需乐理即可建立因果,但代价是细粒度手势易被淹没且单顶视相机存在遮挡中断。
针对机械漂移导致的机器人乐器动态响应不一致问题,论文用距离依赖加权把锚定实测的 KNN 与平滑泛化的 MLP 融合成一体,在 MalletOTon 四种采样密度下以平均 MAE 约 1.38 取得最低误差,代价是仍只用 RMS 单特征且未验证在线闭环与多乐器复现。
论文面对 Barlow 异构、过程性、软件依赖的原生数字遗产,提出以对象/事件框架加可扩展分类把过程翻译为可互操作元数据,证据是多 TB 硬盘遗产的原型编目与 Sibelius/MIDI/DOC/PDF 关联难题,代价是形式化必然不完备而需参与式持续修订。
针对混合音乐中扩展长笛技法难以只靠音高对齐跟谱的问题,论文把 Antescofo 的对齐机与轻量识别器 ipt~做松耦合混合切换,在 11 类技法上报告宏 F1 为 93.4%±0.1,但混合跟谱以增加延迟为代价换取跨演奏的稳定性。
该文把现场音色匹配做成每 0.093 秒调一次连续合成参数的强化学习控制问题,用描述符状态加五种奖励在合成器内域与跨域及真实乐器语料上验证,最强证据是同合成器内域匹配显著更准,而代价是跨域只能近似且对描述符与奖励选择高度敏感。
针对临时拼凑的多智能体与单体黑盒难复用难实时的问题,论文用类型化共享黑板加需要与提供声明实现自动拓扑调度,并在纯 Python 加原生库加速的路线下给出模块化可增量扩展的工程方案,代价是暂无定量性能评测与图形化工具仍在开发中。
该文把计算机音乐史重读为执行本体论的形成史,并以颗粒合成、现场电子乐与机器学习三类实践说明不可实现性不是技术失败,而是声音潜能未被穷尽的构成性条件,其代价是放弃以可计算、可调度和可优化作为价值标准。
针对端到端生成把创作压缩到提示词层的问题,该文选择对神经音频编解码器的量化音频潜嵌入做带时变系数的加权求和感知 morphing,用作品《龢》三阶段与五种编解码器对照验证可行性,代价是解码器鲁棒性与实时性等条件仍未被系统测量。
BIKES 把电动货运自行车做成可移动联网乐器,用集中式到网状网络、分布式音频与工业设计迭代解决户外移动演奏与教学问题,最强证据是四车系统的公共骑行与装置验证,代价是第二阶段外观模型尚无发声功能且系统依赖现场网络与人工运维。
该文把皮肤电、动作与面部表情当作可演奏的音乐材料,用 Python 中间件加 Pure Data 两阶段映射在键盘实践中检验,报告称离散受限映射更清晰、高层和声触发更连贯,代价是即时性下降与系统复杂、学习曲线陡峭。
该文用弦两端载荷单元反推弓弦压力、用固定磁场感生弦速直方图分离粘弦速度来实时估计弓速,并把两路参数接到弓—质量摩擦模型验证可演奏性,代价是必须贴近支点与磁体运弓且力估计存在位置相关偏差。
CALM 研究如何把双侧身体运动、费力和协调直接转成声音密度与空间行为,证据是手套速率与双侧阈值控制的 abrasive 静止层与和声运动层的对抗结构,代价是放弃快速即兴与精确可移植性。
针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。
该研究以检索加规则检验做古典钢琴符号混搭,用 8 小节可控听辨分离和声、终止逻辑、动机可辨识度和织体四个因素,发现终止逻辑与可辨识度及复调并置更关键,代价是仅在短片段、均匀钢琴音色和小样本条件下成立。
该文把钢琴指法当作带生物力学约束的序列标注问题,用卷积网络提局部键盘模式、双向长短期记忆网络建前后依赖并加注意力与前向规划,在钢琴指法数据集上报告通用匹配率约 82.6%、最高匹配率约 92.1%,代价是去掉物理约束后通用匹配率掉 11.4 个点且复调大跨度仍需人工把关。
该研究把植物生物电与光照湿度数据经物联网送入作曲环境来实时生成六声部乐谱,早期排练与观测显示声音与光照变化伴随信号波动,但完整演奏者与植物反馈闭环与互惠机制仍待验证。
该研究把协作节奏乐器与多人空间布局放在 PatchWorld 内共同设计,用 9 人两组迭代得出通用节奏盒与三人半圆分层舞台,并报告视觉反馈为主、归因模糊为关键代价的发现。
针对大语料深度模型不适用个人作曲且只处理音高时值的问题,该文把带表情的动机表示为音程状态轨迹并以卡尔曼式随机偏离生成变体,用作曲家自己的选择在线调节方差与结构编辑概率,代价是只做单声部且无定量评测与用户研究。
该研究以 136 首已标注拍点的里尔与吉格演奏为对象,用核密度估计求主速度并做偏差曲线与乐句聚类,发现整体偏差仅在零附近小幅摆动而强加速只出现在开头乐句,其代价是只分析第一遍完整重复且依赖手工拍点标注。
本文回溯 1980 年代中期以来以西方记谱与音高节奏形式化为核心的计算机辅助作曲,指出其在音色连续性、实时性与多模态输出上的局限,并提出以多模态输入输出与人机协作为方向的扩展愿望,但未提供定量实验验证。