Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges
📄 Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges 标签:#语音交互 #音频大模型 #多模态模型 #长音频处理 #模型评估 6.5/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #语音交互 | #音频大模型 | #多模态模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Syeda Faiza Ahmed;合作者 Zien Sheikh Ali、Hunzalah Hassan Bhatti、Firoj Alam、Shammur Absar Chowdhury(卡塔尔计算研究院)。 💡 毒舌点评 这是一篇很适合做项目路线图的综述:它提醒大家“会看、会说、会调用工具”不等于能把一场对话坚持到底。问题是范围极宽,从文本对话一路铺到 omni-agent,很多结论依赖文献作者自己的实验,读者仍需自行判断各 benchmark 是否真正测了跨轮记忆和 grounding。作为综述它也有结构性的局限:「多轮」的定义和指标在各论文间并不统一,横向比较不可避免地带入主观归类;真实部署的成本、延迟与隐私量化几乎缺席;研究议程提出了正确的问题却没有配套统一 benchmark 或代码基线,可执行性打了折扣。 ...