[2026年6月11日提出 (v1)、最終改訂 2026年7月29日 (本バージョン、v2)]

PDFを表示 HTML (実験的)

要約:LLMエージェント向けのスキル自己進化手法は、実行軌跡を再利用可能なスキル文書に変換することを目指します。しかし、現在のパイプラインは通常、タスクごとに1つの軌跡からスキルパッチを導出し、無差別にマージし、推論時にスキルコーパス全体を読み込みます。これらの選択は、信頼性の低い証拠抽出、低品質または有害なスキル編集の蓄積、および無関係または矛盾するスキル内容によるコンテキストの非効率な使用を招きます。我々はSkillCATを提案します。これはこのプロセスを3つのステージに分解するフレームワークです。(1) 対照的因果抽出 (CCE) はタスクごとに複数の軌跡をサンプリングし、同じタスクの成功/失敗ペアを対比して結果の差異を説明する証拠を見つけます。(2) 評価拡張進化 (AAE) は各候補パッチをソースタスククローンで再生し、タスク結果を損なわないものだけを保持した後、保持されたパッチを階層的にマージします。(3) トポロジー対応タスク実行 (TTE) は進化したスキルをルーティング可能なサブスキルトポロジーにコンパイルし、推論時にタスク関連の能力ノードのみを読み込むようにします。我々はSkillCATをSpreadsheetBench、WikiTableQuestions、DocVQAを含む広く使用されているエージェントベンチマークで評価し、クロスモデルおよび分布外汎化もさらに評価します。これらの設定において、SkillCATは初期スキルに対する平均スコアを最大49.69%向上させ、信頼性が高く効果的なスキル進化を実証します。

提出履歴

投稿者: Kunfeng Chen [メールを表示]
[v1] 2026年6月11日木曜日 13:12:10 UTC (1,028 KB)
[v2] 2026年7月29日水曜日 02:30:33 UTC (1,112 KB)