- Publications
- Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests
多模態大型語言模型 (MLLM) 在視覺詮釋方面表現出色,卻在人類能可靠解決的空間推理任務上表現不佳。現有基準測試將這些模型視為黑箱,限制了其識別表現較差根本原因的能力:當模型在空間推理任務失敗時,仍然難以確定障礙是感知性的(例如辨識物體邊界),還是認知性的(例如透過推理遮擋來推斷隱藏的幾何形狀)。我們提出 Spatial-IQ,一個階層式診斷框架,將堆疊 3D 結構中的物體計數分解為 9 個感知與認知子任務,依據人類空間認知的發展階段進行組織,並以心智旋轉作為額外的目標探測。使用 NVIDIA Isaac Sim,我們程序化生成了約 80,000 個堆疊 3D 結構的多樣化資料集,並附有各任務的真值。我們評估模型在三種輸出格式(自由回應文字、多選影像和影像編輯)上的表現,並與人類基準進行比較。Spatial-IQ 框架顯示,表現最佳的模型通常能在目標任務(物體計數)上成功,卻無法在預期作為基礎的較低層級子任務上成功;模型在保留這些階層鏈的程度上各有不同,常揭示出僅靠原始目標任務準確度無法察覺的捷徑行為。最後,我們證明使用我們階層式子任務的思維鏈 (CoT) 監督訓練模型,並結合具可驗證獎勵的強化學習,能顯著改善跨子任務的空間一致性與目標任務準確度,支持所提分解作為診斷工具與訓練訊號的價值。
Authors
Patrick Rim (Yale University)
Tom Long (NVIDIA)
Alex Wong (Yale University)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.