论文解读
TAG: Structured Temporal Audio Generation via LLM-Guided Manual Scription and Control
音频生成 | 7.5/10
音频生成 | 7.5/10
音频生成 | 6.5/10
音频事件检测 | 7.5/10
音乐生成 | 7.0/10
音频生成 | 8.0/10
音乐生成 | 8.0/10
音乐生成 | 7.5/10
音乐生成 | 7.0/10
语音合成 | 7.5/10
音乐生成 | 7.0/10
视频生成 | 6.5/10
语音合成 | 7.0/10
语音合成 | 9.0/10
跨模态 | 8.0/10
音视频 | 8.5/10
语音生成 | 8.0/10
语音合成 | 7.5/10
音频生成 | 8.5/10
音乐生成 | 7.0/10
1. **问题**:现有视频扩散模型在生成人机交互(HOI)视频时,常出现手/脸结构崩溃和人机物理穿透等问题,根源在于模型缺乏对3D空间关系和交互结构的理解。 2. **方法核心**:提出CoInteract框架,核心是“空间结构化协同生成”范式。在一个共享的DiT骨干中联合训练RGB外观流和辅助的