[Submitted on 29 Jul 2026]

View PDF HTML (experimental)

Abstract:当前的视觉-语言-动作(VLA)模型主要依赖 2D 输入,忽视了三维物理世界中丰富的物体结构信息和常识知识。这一缺陷限制了它们在复杂、高精度操作任务中的空间感知能力和适应性。为了弥合这一关键差距,我们为 VLA 构建了一个概念专家模块,用于生成可执行的解析概念,将物体表示为显式的程序化蓝图。该机制分为两个协同阶段运行:首先,在 VLA 推理之前,概念专家利用视觉基础模型(VFM)的 3D 信息来估计初始运动学和结构参数;其次,在整个操作过程中,VLA 模型利用其固有能力动态跟踪概念参数的变化,并持续与观测结果对齐以确保持久准确性。一旦建立,解析概念将通过(1)密集的程序化操作奖励和(2)精确的空间引导,为 VLA 微调提供显式、高质量的指导。这种形式化方法使 VLA 模型能够在保持端到端学习灵活性的同时,学习基于物理的交互行为。实验结果表明,在监督学习和强化学习设置下,成功率和学习效率均有持续提升,证明了基于结构化概念的引导对 VLA 后训练的有效性。
This formulation allows VLA models to learn physically grounded interaction behaviors while maintaining end-to-end learning flexibility.
Our experimental results show consistent improvements in success rate and learning efficiency across supervised and reinforcement learning settings, demonstrating the effectiveness of structured, concept-based guidance for VLA post-training.

Submission history

From: Mingyang Sun [view email]
[v1] Wed, 29 Jul 2026 06:24:25 UTC (1,646 KB)