论文解读

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

音视频语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7993 字 阅读 →
论文解读

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

音视频语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9385 字 阅读 →
论文解读

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

音视频语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7585 字 阅读 →