当时间轴变成可以斜切的体:Passing 如何把单段车窗录像走成无尽旅程
Passing 把一段多摩单轨车窗连续录像堆成时空体并沿非线性截面重采样出无尽画面,再用去掉视觉语义分支、只留时间对齐与车内环境声语义锚定的 SpecMaskFoley 实时生成同步声,代价是最终展览声景没有可复算的客观正确性指标,只能靠现场稳定性和艺术协商来收敛。
Passing 把一段多摩单轨车窗连续录像堆成时空体并沿非线性截面重采样出无尽画面,再用去掉视觉语义分支、只留时间对齐与车内环境声语义锚定的 SpecMaskFoley 实时生成同步声,代价是最终展览声景没有可复算的客观正确性指标,只能靠现场稳定性和艺术协商来收敛。
针对原生音视频直接对话缺数据、难评测的问题,该工作用多智能体合成对话同时做评测集与强化训练语料,报告在合成集从 0.465 到 0.652、在真人实拍集从 0.402 到 0.632 的提升,代价是回复变短且效率与风格奖励之间存在权衡。
针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究把协作节奏乐器与多人空间布局放在 PatchWorld 内共同设计,用 9 人两组迭代得出通用节奏盒与三人半圆分层舞台,并报告视觉反馈为主、归因模糊为关键代价的发现。
Gestalt 针对 50-200 人实时共演的参与门槛与延迟问题,采用浏览器端边缘计算加双层异构架构与活动加权聚合,在本地单机实验室压力测试中报告 200 人稳定与约 60 毫秒端到端延迟,代价是公网隧道下稳定上限降至 80 人且未经过大规模公演验证。
该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
用影子跟读检验香港粤语 T2-T5 与 T3-T6 并调是否向相反声调启动靠拢,最强证据是基线可分而跟读出现中度与强趋同且真人强于 AI、视频强于图片,代价是合并者仅每对 2 人而无法定论。
该装置让 1 至 4 名表演者手持投影在 4 m×3 m 空间走动,用天花板相机只看墙上多边形的几何来判别 5 个空间交互点并驱动声音,离散音高经倾斜与置信度与连续帧门控后才切换,而连续音色保持约 30 fps 响应,代价是约 0.33 s 切换延迟与暗室和重标定依赖。
Audionce 针对聋人与听人共同即兴时听觉门槛过高的问题,选择把物理扬声器阵列与点云虚拟镜面放在同一交互场中,用身体移动与触摸扬声器驱动声音与视觉,最强证据是聋人设计者与听人可协同完成结构化即兴而不被察觉听力差异,主要代价是振动难以分辨音高与音量等细粒度差异且依赖持续学习与视觉补偿。
针对双人对话头像需要实时响应用户语音与动作、且倾听表情难以标注的问题,论文用因果扩散强迫在动作隐空间逐块生成并用丢用户条件的合成负样本做偏好优化,报告约 500 ms 延迟、6.8 倍加速与超 80% 人工偏好,代价是口型与画质只保持可比而非全面领先。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。
该工作以微分音杠杆竖琴 Harp-E 为起点,用配重鱼线和悬挂织物做机械扩展,再让合成延续拨弦、持续激励与杠杆弯音的发声逻辑,在多媒体即兴演出 De-dimension 中实现可参与的多模态乐器环境,代价是未做定量评估与延迟测量,仅为概念验证。
论文要解决空间音频一次一建、难以公共复用的问题,用一套可搬运的扬声器与交互基建在亚特兰大地下城支撑 5 组学生作品,以 Since Everyone's a DJ 为案例验证多人手势协作演奏可行,但连续空间控制易被掩蔽且评价仍是小样本反思。
该研究把芭蕾手臂姿态作为可学习控制面,用分类选古筝乐句区、回归做中间态插值,再经颗粒合成重塑纹理,证据是 60 fps 下每类约 300–480 个训练样本与 4–15 秒乐句构成的语料库,代价是系统偏好可识别姿态且依赖多软件链与作者式观察而非结构化评估。
该研究让人吹奏发声、机器人按 MIDI 驱动按键,用点头手势的速度双峰间隔乘固定比预测起始时刻,8 名长笛手对照显示手势条件增强同伴感与主导感而计时器条件时间更稳,代价是手势识别需夸张动作且视觉反馈效果不一致。