论文解读

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

本文旨在解决从单向“独白”式虚拟人生成迈向自然“全双工”交互式生成的核心挑战。**核心问题**在于,现有方法要么因严格的帧对齐而反应僵硬,要么因引入全局注意力而破坏唇同步。**关键方法**是提出一个基于多头高斯核(MHGK)的统一注意力架构,该机制通过为不同的注意力头分配从窄到宽的高斯分布感受野,使

 · 更新于 2026-09-24 · 约 11 分钟 · 5110 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-20

共分析 24 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 50 分钟 · 24566 字 阅读 →