从一个人跳到一屋人跳:Encypher 把集体律动写成音乐提示
Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。
Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。
针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。
针对语音特征缺少显式人脸空间结构导致口唇与表情不准的问题,该文用音频预测的 68 点地标做局部空间增强与全局补偿来修正三维高斯属性偏移,并在自驱动与跨驱动条件下验证同步与重建,同时以阈值与几何正则的取舍为代价。
针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。
针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。
针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。
Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究以非裔美国英语使用者产出的多义短语 you good 及单义对照句为材料,用 Praat 标 F0 峰位置与 OpenFace 加 findgest 标眉毛运动,检验句类与多义性对峰位、眉毛活动频率、抬眉分布与声手峰时序的影响,最强证据是句类显著决定 F0 峰落在第二词与眉峰相对更早,而疑问句并未带来更多眉毛活动或抬眉。
该研究把西班牙语最小重音对嵌入完整句子并用 5 级声音连续体加 2 种节拍对齐做二选一判断,结果显示声音步骤主导判断而手势对齐无可靠影响,反应时同样无可靠加速,代价是更自然的语速与手势变异可能稀释了视觉线索的权重。
针对两头同龄雄性幼鲸近距离身体接触时连续重叠喀哒声串难以归属的问题,论文用单通道恒 Q 变换谱加步间间隔节律做声学解交织,再用三元紧凑阵列到达时差定位投影到视频验证,在简单场景聚类误差为 0.0%、最难场景达 25.79%,并以 10 度容限实现主要发射者最高 100% 水平视觉一致,代价是垂直方向系统性偏差与近平面阵列几何盲区导致两个场景无法最终归属。
该研究用 48 段高兴与生气冲突或一致的动态视听短片加眼动追踪,检验 27 名人工耳蜗学龄前儿童与 25 名健听同龄人的线索权重与注视分配,发现人工耳蜗组在冲突时显著偏向面孔且眼口注视更均衡,代价是听觉线索利用不足与注视表现关联缺失。
该研究用荷兰语预测性句尾词汇判断任务检验节拍手势是否加速词汇通达,最强证据是噪声下真词反应时加快约 122 毫秒和 124 毫秒并使正确率提升约 4 个百分点,代价是手势与词重音是否对齐始终未产生可靠的交互作用。
针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。
针对多人同时交谈且严重重叠的 MCoRec 任务,该工作用互视分数加语音重叠分数做会话聚类,并用 CTC/attention 与 Whisper 双模型输出融合做识别,在评测集上聚类 F1 达到 0.910,词错误率降到 48.67%,联合误差降到 0.289,代价是依赖几何假设、边界框与抽帧处理。