先想再动再说:U-Mind 用文本先行统一语言语音动作的实时交互
U-Mind 针对语音动作与语言推理难以同步且联合训练易损伤推理的问题,采用离散统一表示加分段对齐与排练式预训练加文本先行解码,原文报告在指令跟随上 FGD 为 5.12 并在消融中显示去文本先行后相关性降至 1.24,代价是动作细粒度受限于离散词表且数据配比依赖经验。
U-Mind 针对语音动作与语言推理难以同步且联合训练易损伤推理的问题,采用离散统一表示加分段对齐与排练式预训练加文本先行解码,原文报告在指令跟随上 FGD 为 5.12 并在消融中显示去文本先行后相关性降至 1.24,代价是动作细粒度受限于离散词表且数据配比依赖经验。
针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。
MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。
针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。
DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。
针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。
音视频交互 | 6.9/10
音视频生成 | 10.0/10
音视频交互 | 5.9/10
语音交互 | 5.2/10
音视频交互 | 5.7/10
音视频交互 | 7.1/10
音视频交互 | 5.9/10
音视频生成 | 7.5/10
音视频交互 | 5.2/10
音视频交互 | 5.4/10
共分析 1 篇语音/AI 论文