论文解读

先想再动再说:U-Mind 用文本先行统一语言语音动作的实时交互

U-Mind 针对语音动作与语言推理难以同步且联合训练易损伤推理的问题,采用离散统一表示加分段对齐与排练式预训练加文本先行解码,原文报告在指令跟随上 FGD 为 5.12 并在消融中显示去文本先行后相关性降至 1.24,代价是动作细粒度受限于离散词表且数据配比依赖经验。

 · 更新于 2026-09-24 · 约 21 分钟 · 10184 字 阅读 →
论文解读

倾听塌缩的拆解:先学自发先验再用双轨音频调制的 UniLS

针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。

 · 更新于 2026-09-24 · 约 19 分钟 · 9260 字 阅读 →
论文解读

不重训语音大模型,用无声图文与门控交叉注意力教它看图说话

MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。

 · 更新于 2026-09-24 · 约 20 分钟 · 9950 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

看见消防车、听见警笛才行动:PEAP 要求视觉与音频联合决定动作序列

论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8989 字 阅读 →
论文解读

流式音视频不同步、该不该开口难判断:ROMA 用对齐单元与说话头统一反应与主动

针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。

 · 更新于 2026-09-24 · 约 17 分钟 · 8355 字 阅读 →
论文解读

双人同时动还要各像各的:DialoGen 如何把互动与个人风格分开建模

DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9954 字 阅读 →
论文解读

视觉对话不够吸引人:用合成语音补情感,再用交错建模学互动

针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9867 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4260 字 阅读 →
论文解读

EchoWM: Open and Enterable Omnimodal World Models

音视频生成 | 10.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5157 字 阅读 →
论文解读

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

音视频交互 | 5.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4533 字 阅读 →
论文解读

Does Listening Matter? Backchanneling and Nodding in AI Clone

语音交互 | 5.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5992 字 阅读 →
论文解读

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

音视频交互 | 5.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8051 字 阅读 →
论文解读

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

音视频交互 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7757 字 阅读 →
论文解读

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

音视频交互 | 5.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7206 字 阅读 →
论文解读

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7604 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频交互 | 5.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6461 字 阅读 →
论文解读

Wan-Streamer v0.2: Higher Resolution, Same Latency

音视频交互 | 5.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5455 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-06

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1340 字 阅读 →