论文解读
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
数据集 | 7.5/10
数据集 | 7.5/10
语音识别 | 8.5/10
视频生成 | 8.8/10
音频问答 | 8.5/10
模型评估 | 7.5/10
多模态模型 | 7.0/10
脑编码 | 7.5/10
视频摘要 | 8.0/10
音频生成 | 8.5/10
音频生成 | 8.0/10
多模态模型 | 7.0/10
音频检索 视频检索 | 8.5/10
基准测试 | 8.5/10
基准测试 | 9.0/10
共分析 4 篇语音/AI 论文
语音识别 | 6.5/10
语音对话系统 | 6.5/10
模型评估 | 6.0/10
语音对话系统 | 8.5/10
共分析 21 篇语音/AI 论文