MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
📄 MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings 标签:#基准测试 #音频理解 #Transformer #模型评估 7.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #基准测试 | #Transformer | #音频理解 #模型评估 | arxiv 👥 作者与机构 第一作者:Ziyi Wang(清华大学 AI 学院)[注:论文标注为共同第一作者] 通讯作者:Miao Liu(清华大学 AI 学院) 作者列表:Ziyi Wang(清华大学 AI 学院)、Yuhang Wu(清华大学 AI 学院)[注:论文标注为共同第一作者]、Dongxu Piao(清华大学 AI 学院)、Xingyu Liu(清华大学 AI 学院)、Tianhui Zhou(杜克大学生物统计与信息学系)、Miao Liu(清华大学 AI 学院) 💡 毒舌点评 论文在将心智理论评估从简单视频问答引入到真实、复杂的多方会议场景这一方向上迈出了重要一步,提出的“伪共识”概念和层次化任务设计颇具洞察力,抓住了社交互动中“言行不一”这一核心难点。然而,该基准的科学根基建立在第三方观察者对“心智状态”的推断之上,尤其在最具挑战性的态度推断任务中,标注者间一致性仅为中等(κ=0.50),这直接动摇了“黄金标准”的可靠性。此外,论文声称评估了“GPT-5”,但该模型在2026年7月并未公开发布,这在模型身份上存在重大疑问,严重削弱了实验结果的可信度和可复现性。 ...