论文解读
BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation
音频生成 | 7.4/10
音频生成 | 7.4/10
音乐生成 | 8.9/10
语音分离 | 6.3/10
语音识别 | 5.4/10
语音质量评估 | 7.0/10
语音分离 | 7.4/10
音频事件检测 | 8.2/10
语音交互 | 6.5/10
音频理解 | 6.4/10
语音质量评估 | 8.3/10
语音伪造检测 | 8.1/10
音频理解 | 7.4/10
音乐理解 | 5.7/10
音视频生成 | 6.8/10
流式处理 | 5.6/10
语音克隆 | 6.5/10
对比学习 | 7.6/10
多模态模型 | 6.1/10
多模态模型 | 5.9/10
音频水印 | 7.3/10