论文解读
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
音视频 | 8.0/10
音视频 | 8.0/10
多模态模型 | 7.0/10
音频检索 | 8.0/10
音乐信息检索 | 8.0/10
语音对话系统 | 7.5/10
音频问答 | 7.5/10
3D重建 | 7.0/10
语音对话系统 | 7.5/10
多模态推理 | 8.5/10
语音识别 | 8.0/10
音频生成 音乐生成 | 9.5/10
语音识别 | 8.0/10
语音问答 | 8.0/10
音频分类 | 7.5/10
无监督学习 | 8.0/10
音乐生成 | 7.5/10
语音编码 | 8.5/10
语音对话系统 | 8.5/10
音频问答 | 8.5/10
基准测试 | 8.5/10