[Submitted on 11 Jun 2026 (v1), last revised 29 Jul 2026 (this version, v2)]
Abstract:LLM 代理的技能自我演化方法旨在將執行軌跡轉化為可重複使用的技能文件。然而,目前的流程通常只從每個任務的單一軌跡中提取技能補丁、無差別地合併它們,並在推論時載入整個技能語料庫。這些做法會導致不可靠的證據提取、低品質甚至有害的技能編輯累積,以及因不相關或衝突的技能內容而造成的上下文使用效率低下。我們提出 SkillCAT 框架,將此過程分解為三個階段。(1) 對比因果提取 (CCE) 為每個任務取樣多條軌跡,並對比同一任務的成功/失敗配對,以找出能解釋結果差異的證據。(2) 評估增強演化 (AAE) 將每個候選補丁重現在來源任務的克隆版本上,僅保留不會損害任務結果的補丁,然後以階層方式合併保留的補丁。(3) 拓撲感知任務執行 (TTE) 將演化後的技能編譯為可路由的子技能拓撲,使推論時僅載入與任務相關的能力節點。我們在 SpreadsheetBench、WikiTableQuestions 和 DocVQA 等廣泛使用的代理基準上評估 SkillCAT,並進一步評估跨模型與分布外泛化能力。在這些設定中,SkillCAT 相較於初始技能,平均分數最高可提升 49.69%,證明了可靠且有效的技能演化。
Submission history
From: Kunfeng Chen [view email]
[v1]
Thu, 11 Jun 2026 13:12:10 UTC (1,028 KB)
[v2]
Wed, 29 Jul 2026 02:30:33 UTC (1,112 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.