MindTopo 基准揭示 VLM 的空间推理能力
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。
推荐理由:MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。
技术方向
AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。
1 条精选近 30 天 0 条共收录 4 条
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。
推荐理由:MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。