论文解读
Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning
语音交互 | 6.7/10
语音交互 | 6.7/10
音视频问答 | 7.8/10
VIBE: Disentangling Social Dynamics via Kinematics-Informed Variational Inference for Behavioral Emotion
音视频问答 | 7.3/10
音频检索 | 8.2/10
音频分类 | 4.8/10
音视频理解 | 6.8/10
音视频理解 | 7.7/10
音频分类 | 4.9/10
语音合成 | 6.8/10
语音属性识别 | 6.9/10
语音识别 | 6.4/10
声源定位 | 5/10
音频分类 | 7.4/10
音乐理解 | 8.4/10
音频分类 | 4.7/10
语音交互 | 7/10
音频分类 | 6.8/10
语音识别 | 4.8/10
语音识别 | 6.9/10