多人同演不混乱:Gestalt 用分层与加权聚合保住表演者结构
Gestalt 针对 50-200 人实时共演的参与门槛与延迟问题,采用浏览器端边缘计算加双层异构架构与活动加权聚合,在本地单机实验室压力测试中报告 200 人稳定与约 60 毫秒端到端延迟,代价是公网隧道下稳定上限降至 80 人且未经过大规模公演验证。
Gestalt 针对 50-200 人实时共演的参与门槛与延迟问题,采用浏览器端边缘计算加双层异构架构与活动加权聚合,在本地单机实验室压力测试中报告 200 人稳定与约 60 毫秒端到端延迟,代价是公网隧道下稳定上限降至 80 人且未经过大规模公演验证。
针对传统 cuíca 音色扩展受限于双手演奏的问题,Hypercuíca 用绑在鼓身的手机重力传感器驱动 Ableton Live 效果器,在四场公开演出与工作坊的非正式反馈中显示出声场可变性增强,但代价是映射透明度下降与长时间独奏易耗尽新颖性。
该工作把已训练好的三维想象运动解码器的连续速度信号作为声音手势的控制源,用分层颗粒合成做实时可听化,报告了静息、起始与持续手势的可区分听感,但尚未做闭环听觉反馈下的受试者评估。
MBHD 针对多来源循环难以同时对齐速度与调性的问题,用文件名编码的速度、根音与乐器角色驱动四路独立播放与实时变调变速,并在 Max 8 原型上报告约 5 ms 环路延迟、低于 20% 的满载 CPU 与 86.3 的可用性评分,代价是仍依赖人工改名与 12 平均律假设。
论文把预训练神经音频模型当作可上手摆弄的乐器,用实时修改权重与偏置代替重训练,以两场约二十人工作坊与弯曲日志复用为证据,代价是大量操作只产生静音噪声且弯曲状态尚不能保存复用。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对多声部各自保持独立拍号又需周期性对齐的多层节拍现场编程问题,OrbitScore 用 beat(n by m) 直接对应 4:(n/4) 理论并以独立循环加 SuperCollider 合成实现,50 分钟公开演出验证了 4:4/5:4/7:4 可实时修改与自动同步,代价是仅 macOS、只做采样回放且不能听外部声音自适应。
PHOTON 针对羽管键琴等历史键盘的可变结构与狭小间隙,用键杠杆下方的反射式光学阵列连续测量位移,在约 1 cm 行程上给出约 100 级单调位置与超过 250 Hz 的子集采样,并以拨弦点附近的斜率变化推断发声时刻,代价是中间值为非线性插值坐标而非绝对几何量且需逐传感器校准。
针对混合音乐中电子声部与乐队弹性速度难同步的问题,Ponticello 用摄像头加循环网络从指挥手势实时推断速度来拉伸电子演奏谱,其排练与音乐会验证显示可用但只解决时间协调且依赖训练覆盖的指挥风格。
论文把潜在空间作为显式交互面,用同一三维实体控制器分别对接不透明高维合成、具标签音色簇与语义节奏生成三类模型,以不同映射与灯阵反馈探测探索性与可复现性之间的权衡,代价是未做纵向用户学习评估且低成本硬件限制了显示与机械一致性。
针对实时低延迟高分辨率谱分析问题,论文用相邻样本相位差分估计瞬时频率并把估计值反馈为跟踪共振器的共振频率,以自调谐共振器组在无缓冲逐样本更新下输出每样本频率幅度列表,受控正弦与真实音乐谱图显示频率跟踪与幅度保持成立,代价是合成仍有瞬态拖尾与主导器切换相位不连续等初步局限。
该文要解决图画谱面与演奏逻辑分离的问题,选择把演奏语义写进 SVG 元素标识符并由浏览器实时执行,依据是 Inkscape 绘制与浏览器解析的同一文档工作流,代价是未报告定量对照与延迟测量。
论文以智利混合音乐计算机 COMDASUAR 为对象,逆向还原其 Intel 8080 硬件与汇编软件协同,最强证据是逐字节原地逆行并修正滑音与终止符的子程序,代价是通用框图与音频路径尚未完全验证且无定量性能比较。
该研究把听众相位性皮肤电反应做成实时投入度信号,经滤波归一化与乐句对齐后映射为合成器低通滤波器截止频率的低频振荡器速率,在小提琴与爵士标准曲的三分钟单听众演示中跑通了表演者与听众可互相听见的反馈环,代价是仅单样本探索、无定量对照与群体验证。
针对四人围桌、佩戴者遮挡与极低信噪比下的低延迟目标语音提取,该工作用近距到远距投影生成相位幅度对齐的训练参考以启用 SI-SNR 训练,并用固定零陷波束形成抑制佩戴者语音加确定性递归增强渐进精炼,在 Aria 设备上显著超过基线,但频率补偿会以残留噪声为代价恢复高频。
VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。
针对一阶与二阶时变全通滤波器在系数快速变化时输出超过限幅阈值的问题,论文用静态对照输出加系数增量界把输出约束在阈值内,正弦与音乐片段实验显示其在标准结构和能量保持结构各自削波的方向上均不削波,代价是短暂偏离目标系数轨迹并引入少量逐样本判断与除法运算。
该研究为呼叫应答式演奏搭建了覆盖记录、组集、训练到表演的网页界面,用双路实时可视化暴露混合密度循环神经网络状态,5 人 40 分钟探索性研究显示系统可用性量表均值 62.50 分而视觉反馈清晰度达 4.0/5 分,代价是新手仍需面对模型训练的概念负担与小数据下生成质量不稳。
该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。
针对硬同步直接重置相位会产生不连续和高频混叠的问题,论文用有限傅里叶系数经线性频谱重采样再做加法合成实现带限同步,并以 96 kHz 单音色 ASIC 在约 5 个音频采样内完成变换为代价换取实时性。