论文解读From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios音视频语音识别 | 6.6/10
论文解读DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs音视频语音识别 | 7.4/10
论文解读Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition音视频语音识别 | 6.9/10