[2026年6月11日提交(v1),最后修订于2026年7月29日(此版本,v2)]

查看PDF HTML(实验性)

摘要:LLM代理的技能自演化方法旨在将执行轨迹转化为可复用的技能文档。然而,当前流程通常从每个任务的单一轨迹中提取技能补丁,无差别地合并它们,并在推理时加载整个技能语料库。这些选择导致不可靠的证据提取、低质量甚至有害的技能编辑累积,以及因无关或冲突的技能内容造成的上下文使用效率低下。我们提出SkillCAT框架,将此过程分解为三个阶段。(1) 对比因果提取(CCE)为每个任务采样多条轨迹,对比同一任务的成功/失败对,以找出解释结果差异的证据。(2) 评估增强演化(AAE)在源任务克隆上回放每个候选补丁,仅保留不损害任务结果的补丁,然后分层合并保留的补丁。(3) 拓扑感知任务执行(TTE)将演化后的技能编译为可路由的子技能拓扑,从而使推理仅加载与任务相关的能力节点。我们在广泛使用的代理基准上评估SkillCAT,包括SpreadsheetBench、WikiTableQuestions和DocVQA,并进一步评估跨模型和分布外泛化能力。在这些设置下,SkillCAT相对于初始技能平均分数提升高达49.69%,展示了可靠且有效的技能演化。

提交历史

来自:Kunfeng Chen [查看邮箱]
[v1] 2026年6月11日 13:12:10 UTC (1,028 KB)
[v2] 2026年7月29日 02:30:33 UTC (1,112 KB)