把声音铺在身体周围:以可导航的语料库建造超环境
该文以四个舞蹈配置研究如何把预分析音频语料分布到舞者周围的虚拟体中并用动作做最近邻提取,最具体的证据是共享大体量与手部小体量在单元数与速度上的对照,代价是正式成片采用离线合成因而缺少实时演奏反馈。
该文以四个舞蹈配置研究如何把预分析音频语料分布到舞者周围的虚拟体中并用动作做最近邻提取,最具体的证据是共享大体量与手部小体量在单元数与速度上的对照,代价是正式成片采用离线合成因而缺少实时演奏反馈。
该文把同时实时生成三维图像与声音的扩展现实视听乐器定义为研究对象,用九维框架梳理 13 件已有乐器,并以同一原型分化出的声音优先与视觉优先两件乐器、5 个月协作自我民族志说明模态间映射与空间使用如何主导设计分化,其代价是观众维度与协作维度未被实测。
该研究把飞利浦馆重建为九片直纹面并提取线与点来驱动弦乐滑音、五个能量块与稀疏铜管木管事件,最强的可核对证据是 36 条弦乐线与 3357 个采样点的确定性构造,代价是均匀插值难以保留局部曲率与统一配器难以推广到其他风格。
Gestalt 针对 50-200 人实时共演的参与门槛与延迟问题,采用浏览器端边缘计算加双层异构架构与活动加权聚合,在本地单机实验室压力测试中报告 200 人稳定与约 60 毫秒端到端延迟,代价是公网隧道下稳定上限降至 80 人且未经过大规模公演验证。
论文以 11 位光学声电影人的访谈为材料,用转导、帧、差异、重复、化学五组装置结构做衍射式阅读,提出内在实践的特征,代价是结论依赖特定社群与手工条件而不追求可推广的量化验证。
该研究在德语自发对话中比较同批说话人的两种焦点超清晰化做法,最强证据是 23/24 人收紧了音高重音与手势顶点的对齐而只有 10/24 人 steepen 了降调斜率,且人人至少用一种策略,代价是韵律单通道结论不稳定、需双通道联合判断。
该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。
该研究以重音结尾的节奏组为锚点比较四种教学干预,报告显示本体感觉干预在半自发话语中减少不流利并稳定重音手势同步,但样本仅 12 人且起跑线不齐,推广需谨慎。
该研究用粤语六声最小对的 AX 辨别任务检验口罩与噪声影响,发现戴外科口罩条件下的辨别灵敏度更高,贝叶斯因子 BF10 为 67.37,而声学分析显示口罩未显著改变基频相关线索,代价是结论限于辨别任务与外科口罩。
针对头显加耳机造成使用者与同室他人隔绝的问题,MetaConcert 选择 WebXR 播放 360°视频加 SuperCollider 播放预解码三阶 Ambisonics 穹顶声场的分流架构并用 OSC 桥接同步,在约 10 分钟节目上经感知验证同步可用,代价是仍依赖中央听音点、局域网质量与人工校准。
该研究以一段 8 分 35 秒德语 TED 演讲为样本检验累积线索与补偿线索两种假设,发现有重音和特强音节更易伴随手势且手势更强、强手势顶点更贴近重音音节,但核前重音反而比核心重音更易引出手势,代价是单说话人、小样本且特强样本稀少。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对混合音乐中电子声部与乐队弹性速度难同步的问题,Ponticello 用摄像头加循环网络从指挥手势实时推断速度来拉伸电子演奏谱,其排练与音乐会验证显示可用但只解决时间协调且依赖训练覆盖的指挥风格。
该项目要解决多人视频对话中语言、非语言、视觉与时间线索难以统一建模的问题,选择先定义多维度交际行为再建模其关系并生成电影剧本式描述,以虚构与真实语料上的泛化为证据方向,代价是本文仅提出路线而未报告可验证的模型与定量结果。
这篇工作室报告梳理 SARC 二十年以实践为基础的声音与音乐研究设施与方法,最强证据是声学实验室 84 只扬声器与多空间系统等可核对配置,代价是它不提供受控实验对比与可复用的训练式结论。
针对多人同时交谈的重叠语音识别问题,该工作在 AV-HuBERT 识别主路径之外并联一个在 FBank 特征层面重建目标与干扰的 AV-TSE 辅助任务,并在 MCoRec 开发集上把词错误率从 49.90% 降到 49.55%,代价是需要仿真混合数据提供干净特征监督且推理时不使用提取分支。
针对 360 度远场多说话人重叠对话的音视频识别与说话人归属问题,AUVIS 在官方基线五阶段流水线上保留基线检测与跟踪、只做切分与聚类参数解耦和网格优化,用开发集上聚类 F1 到 0.906 的 14.8% 相对提升带动联合误差 17.09% 相对下降,而识别字错误率仅相对下降 0.9% 到 0.4943。
针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。
针对多人多会话同时进行的真实鸡尾酒会转写与会话聚类问题,论文采用先用 CTRnet 消除近讲串扰再用其输出做伪标签微调 AV-TFGridNet 视听目标说话人提取的两阶段路线,在开发集上用 AV-HuBERT 转写达到 33.78% 联合错误率,代价是仍依赖说话人活动时间戳弱监督与未做提取后 ASR 适配时约 48% 说话人词错误率。
该装置让 1 至 4 名表演者手持投影在 4 m×3 m 空间走动,用天花板相机只看墙上多边形的几何来判别 5 个空间交互点并驱动声音,离散音高经倾斜与置信度与连续帧门控后才切换,而连续音色保持约 30 fps 响应,代价是约 0.33 s 切换延迟与暗室和重标定依赖。