论文解读
把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉
音乐检索 | 7.3/10
音乐检索 | 7.3/10
语音合成 | 7.4/10
多模态模型 | 5.1/10
音乐转录 | 7.4/10
音频字幕生成 | 6.8/10
语音交互 | 7.3/10
音乐生成 | 5.9/10
音频生成 | 6.6/10
语音情感识别 | 7.4/10
音乐转录 | 6.3/10
语音情感识别 | 8.1/10
多模态模型 | 5.1/10
语音交互 | 6.6/10
论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。
语音识别 | 4.7/10
基准测试 | 8.9/10
语音交互 | 8.5/10
语音交互 | 7.3/10
音视频理解 | 9.4/10
音视频语音分离 | 8.8/10