[2026年7月30日提出]

PDFを見る HTML (実験的)

要旨:LLMエージェントによるプログラム検証の自動化には、仕様、注釈、補助的な補題、ツール呼び出しの生成が必要であり、これらはすべて再利用可能なスキルに依存しています。自然な解決策はスキル自己進化です。つまり、軌跡からスキルを蒸留し、フィードバックを通じて洗練することです。しかし、既存の進化手法はプログラム検証タスクで苦戦しています。なぜなら、スキル固有の失敗を確実に特定したり、不透明な検証器フィードバックから実行可能なシグナルを抽出したりできないためです。本論文では、プログラム検証向けに構築された自己進化フレームワークであるVeriSkillを提案します。これは検証の失敗をスキル不足に帰属させ、診断シグネチャを再利用可能な教訓に蒸留し、プログラムの意味論を保ちながら検証性能を向上させる修正のみを採用して候補スキルを反復的に洗練します。実験では、VeriSkillが複数の検証ツール、エージェントフレームワーク、LLMバックエンドにわたってすべてのベースラインを一貫して上回ることが示されました。

投稿履歴

投稿者: Changguo Jia [メールを表示]
[v1] 2026年7月30日木曜日 06:15:29 UTC (395 KB)