只给一次提醒意图,让音频大模型自己决定何时开口:中断与静默建模
论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。
论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
论文以 1978-1979 年为 Lydia Kavina 制作的最后一台 Terpsitone 为对象,用实测建模的三维体、范德波尔振荡器差拍的声音引擎和头手质心映射的交互链做可演奏的虚拟现实孪生,历史考证显示至少四代形态而音量映射始终多变,当前原型已能走通动作到声音但精度与稳定性仍待验证。
该系统把沙面深度变化与沙盘小物件检测分别做成连续特征与离散切换令牌,再用多对多映射送入混合声音引擎,探索性使用显示无需乐理即可建立因果,但代价是细粒度手势易被淹没且单顶视相机存在遮挡中断。
BIKES 把电动货运自行车做成可移动联网乐器,用集中式到网状网络、分布式音频与工业设计迭代解决户外移动演奏与教学问题,最强证据是四车系统的公共骑行与装置验证,代价是第二阶段外观模型尚无发声功能且系统依赖现场网络与人工运维。
该文用弦两端载荷单元反推弓弦压力、用固定磁场感生弦速直方图分离粘弦速度来实时估计弓速,并把两路参数接到弓—质量摩擦模型验证可演奏性,代价是必须贴近支点与磁体运弓且力估计存在位置相关偏差。
CALM 研究如何把双侧身体运动、费力和协调直接转成声音密度与空间行为,证据是手套速率与双侧阈值控制的 abrasive 静止层与和声运动层的对抗结构,代价是放弃快速即兴与精确可移植性。
该文以四个舞蹈配置研究如何把预分析音频语料分布到舞者周围的虚拟体中并用动作做最近邻提取,最具体的证据是共享大体量与手部小体量在单元数与速度上的对照,代价是正式成片采用离线合成因而缺少实时演奏反馈。
该研究把木薯淀粉生物塑料做成不规则触摸面,用 8 电极电场层析扰动加支持向量机分类代替图像重建,在圆形样品与 55 厘米半球壳上验证了中等分辨率触摸词表的一小时稳定与 48 小时漂移代价,最终为一个月展期的低分辨率声音装置选择了保守映射。
该研究把卷笔刀嵌入吉他音箱与调音台并保留原有外观与旋钮操作,用削铅笔的摩擦振动经压电元件送入原输入链路作为声源,通过两次展览的质性观察显示违和感反而降低了参与门槛,但结论限于铅笔削笔这一特定动作而未做定量对照。
针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。
该文以独奏班多钮琴加现场电子与机器学习为对象,提出边缘声、姿态残留与被舍弃声三组声音痕迹作为行动线索,报告微弱气声与机械噪声比主导音高更稳定可辨,最强证据来自两场实验室式演出中的持续调校,代价是放弃通用识别精度与可迁移的定量评估。
针对已熟练使用商用数字音乐工具但缺硬件原型能力的高年级本科生,论文用研究—搭建—作曲—演出—文档的全周期结构组织 15 周课程,在 16 人两学期中报告 15 人完成全流程、7 人建后改硬件,以小班与统一套件为代价换来持续迭代条件。
本文以 MAD 单簧管为个案追踪其从被动触发到算法伙伴的四代演进,核心证据是 2.1 的单向视听触发、3.0 和声器与随机系统的实时改写、New Set 中马尔可夫链的即时再 elaboration,主要代价是每代都伴随噪声、重复与需人启动的局限。
该研究用平板正弦声调界面比较母语与零起点法语者在词汇朗读、哼唱、手势三种模态下对易混双音节三声的模仿,显示哼唱与手势高度重合而词汇朗读系统性偏离,支持先做无词段旋律练习再进入词汇训练,但固定顺序与小样本限制了因果推断。
针对传统 cuíca 音色扩展受限于双手演奏的问题,Hypercuíca 用绑在鼓身的手机重力传感器驱动 Ableton Live 效果器,在四场公开演出与工作坊的非正式反馈中显示出声场可变性增强,但代价是映射透明度下降与长时间独奏易耗尽新颖性。
该工作把已训练好的三维想象运动解码器的连续速度信号作为声音手势的控制源,用分层颗粒合成做实时可听化,报告了静息、起始与持续手势的可区分听感,但尚未做闭环听觉反馈下的受试者评估。
该研究把东斯拉夫仪式布的象征构图与早期磁芯存储的穿线逻辑做到墙面大小的纺织装置上,用手持电磁感应线圈贴近游走读取磁起伏并映射为声音,代价是主动保留噪声与不稳定性,且全文未报告定量听感或系统性能指标。