MindTopo 基准揭示视觉语言模型的空间推理能力
摘要
这项工作提出 MindTopo 基准,通过静态推理与交互规划两类任务考察多模态大模型的拓扑直觉,发现模型在静态识别上尚可,但在需要连续行动保持拓扑关系时明显退化。
核心要点
- MindTopo 包含五个拓扑类别:连续性、分离性、顺序、封闭性、打结,每个类别下都有推理和规划两层级。
- 所有场景由受控模拟器生成,提供精确真值和可调难度,可区分因视觉复杂导致的失败与因无法维持关系导致的失败。
- 模型在静态推理上的表现普遍优于交互规划,且两者都远低于人类水平,尤其是需要多步保持关系时差距更明显。
- 静态错误通常源于感知问题,如漏看墙、开口或交叉;规划错误则发生在场景理解之后,模型未跟踪长期后果、多轮后丢失任务或提出违反环境物理的动作。
- 图像生成在相关拓扑关系可见时有时能提供帮助,但整体上不足以弥补规划能力的不足。
原文佐证
- Current multimodal models perform much better on static recognition than interactive tasks, suggesting they struggle to maintain a consistent understanding of topology over time.
- Failures often emerge during planning rather than perception, with models losing track of structural relationships as scenes change or proposing actions that violate physical constraints.
- Seeing topology is not the same as acting on it
AI 洞察
这项评测揭示的"感知与规划鸿沟"可能是视觉语言模型的普遍弱点,将直接影响具身智能和机器人操作的实际有效性。未来的关键突破口可能不在于单纯扩大模型规模,而在于引入显式的结构关系跟踪机制或世界模型。MindTopo 也为多模态模型在连续环境中的推理能力提供了清晰、可重复的评测方向。