跳到正文
Microsoft Research· Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li·· 2026-08-13精选AI 评分61

MindTopo 基准揭示 VLM 的空间推理能力

MindTopo reveals VLMs’ spatial reasoning abilities

AI 导读

Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。

推荐理由

MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。

来源:Microsoft Research · microsoft.com