- Publications
- Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests
多模态大语言模型(MLLM)在视觉解读方面表现出色,但在人类可靠解决的空间推理任务上却表现不佳。现有基准测试将这些模型视为黑盒,限制了其识别性能较低的根本原因的能力:当模型在空间推理任务中失败时,很难确定障碍是感知层面的(如识别物体边界),还是认知层面的(如通过推理遮挡来推断隐藏几何形状)。我们引入了Spatial-IQ,这是一个分层诊断框架,将堆叠三维结构中的物体计数分解为9个感知和认知子任务,这些子任务按照人类空间认知的发展阶段进行组织,并将心理旋转作为额外的目标探测。利用NVIDIA Isaac Sim,我们程序化生成了约80,000个堆叠三维结构数据集,包含每个任务的真实值。我们在三种输出格式(自由响应文本、多选图像和图像编辑)下评估模型,并与人类基线进行比较。Spatial-IQ框架显示,表现最佳的模型通常在目标任务(物体计数)上取得成功,但在旨在支持它的低级子任务上却未能成功,并且模型在保留这些分层链的程度上存在差异,常常揭示出仅靠原始目标任务准确率无法发现的捷径行为。最后,我们证明了使用我们分层子任务的思维链(CoT)监督训练模型,结合可验证奖励的强化学习,显著提高了跨子任务的空间一致性和目标任务准确率,支持所提出的分解作为诊断工具和训练信号的价值。
Authors
Patrick Rim (Yale University)
Tom Long (NVIDIA)
Alex Wong (Yale University)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.