1. Publications
  2. Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

マルチモーダル大規模言語モデル(MLLM)は視覚解釈に優れていますが、人間が確実に解決する空間推論タスクでは失敗します。既存のベンチマークはこれらのモデルをブラックボックスとして評価するため、パフォーマンス低下の根本原因を特定する能力が制限されています。モデルが空間推論タスクに失敗した場合、それが物体境界の認識などの知覚的な障壁なのか、遮蔽を推論して隠れた形状を推定するなどの認知的障壁なのかを判断することは困難です。私たちはSpatial-IQを導入します。これは、人間の空間認知の発達段階によって整理された9つの知覚・認知サブタスクに積み重ねられた3D構造での物体カウントを分解する階層的診断フレームワークで、心的回転を追加のターゲットプローブとしています。NVIDIA Isaac Simを使用して、各タスクのグラウンドトゥルースを持つ約80,000個の積み重ねられた3D構造からなる多様なデータセットをプロシージャル生成しました。自由回答テキスト、複数選択画像、画像編集という3つの出力形式でモデルを評価し、人間のベースラインと比較しました。Spatial-IQフレームワークは、トップパフォーマンスのモデルが、意図した下位レベルのサブタスクに成功しなくてもターゲットタスク(物体カウント)に成功することが多く、モデルがこれらの階層チェーンのどれだけを保持しているかが異なり、生のターゲットタスク精度だけでは不明瞭なショートカット動作をしばしば明らかにすることを示しています。最後に、階層的サブタスクに対するチェーンオブソート(CoT)監督によるモデルのトレーニングと、検証可能な報酬による強化学習を組み合わせることで、サブタスク間の空間的一貫性とターゲットタスク精度の両方が大幅に向上し、診断ツールとしてもトレーニング信号としても提案された分解の価値を裏付けることを実証します。

Authors

Patrick Rim (Yale University)

Tom Long (NVIDIA)

Alex Wong (Yale University)

Published in

Research Area

External Links