[2026年7月29日提出]

View PDF HTML (experimental)

Abstract:現在のビジョン-言語-行動(VLA)モデルは主に2D入力に依存しており、3D物理世界に内在する豊富なオブジェクト構造情報や常識的知識を活用していません。この欠陥により、複雑で高精度な操作における空間認識能力と適応性が制限されています。この重要なギャップを埋めるため、VLA向けにConcept Expertモジュールを構築し、オブジェクトを明示的かつプログラム的な設計図として表現する実行可能なAnalytic Conceptsを構築します。本機構は2つの相乗的なフェーズで動作します。まず、VLA推論前に、Concept ExpertはVision Foundation Models(VFMs)からの3D情報を活用して初期の運動学的・構造的パラメータを推定します。次に、操作プロセス全体を通じて、VLAモデルはその固有の能力を活用して動的コンセプトパラメータを動的に追跡し、観測変化に継続的に整合させることで持続的な精度を確保します。Analytic Conceptsが確立されると、(1)密なプログラム的操作報酬と(2)精密な空間ガイダンスを通じて、VLAファインチューニングに明示的で高品質なガイダンスを提供します。
この定式化により、VLAモデルはエンドツーエンド学習の柔軟性を維持しつつ、物理的に根拠のある相互作用行動を学習できます。
実験結果は、教師あり学習および強化学習の両方の設定において成功率と学習効率の一貫した改善を示し、VLAポストトレーニングにおける構造化された概念ベースガイダンスの有効性を実証しています。

提出履歴

From: Mingyang Sun [view email]
[v1] 2026年7月29日(水) 06:24:25 UTC (1,646 KB)