Skip to content

AppWorld Skill与经验知识相关

📅 发表于 2026/07/13
🔄 更新于 2026/08/05
👁️ — 次访问
📝 3741 字
12 分钟
Appworld-Skill
#ASSAY
#SkillX
#Skill Library
#Experience Knowledge

(2606) Not All Skills Help: Measuring and Repairing Agent Knowledge

🌺 论文摘要

ASSAY 论文摘要

参考链接

核心方法 (ASSAY, Attribution-Based Skill Selection and Assembly)

  • 核心问题:Skill并不是越多越好,同一个Skill可能帮助任务A,却伤害任务B。
  • Skill生成Skill筛选分开:
    • LLM仍负责从轨迹中总结Skill。
    • Skill是否保留、对哪个任务使用,则由跨任务实验结果决定。
  • 随机Mask实验:在开发集上随机开关不同Skill,估计每个Skill对每个Task的因果贡献
  • 根据归因矩阵做两步治理:
    • 离线重构:Split异质Skill、Retire低信号Skill、Merge重复Skill。
    • 在线选择:针对当前Task,只屏蔽预计有害的Skill。
  • 整个过程不更新模型参数,属于Prompt-time Skill Engineering。

模型效果 (AppWorld, TGC)

  • DeepSeek-V3 + ASSAY:Test-Normal 83.3,Test-Challenge 69.3
  • GPT-5.1 + ASSAY:Test-Normal 77.4,Test-Challenge 66.4;原始未筛选Skill在Challenge上反而从ReAct 52.5降到49.9
  • GPT-4.1 + ASSAY:Test-Normal 75.6,Test-Challenge 64.0
  • 7个模型、4个Provider在AppWorld两个测试集上均相对各自ReAct基线提升。
  • 论文按逐Task ReAct/Prompt-based口径将DeepSeek-V3的Challenge结果称为Published SOTA;不能与HCL-GP同时观察Scenario内多任务的Policy Synthesis口径直接比较。

重要结论

  • Skill不是简单的好 / 坏,而是有明显的Task-dependent因果异质性
  • 全局平均分不可靠:正负效果会互相抵消,看起来0贡献的Skill可能在某类任务上持续有害。
  • 最大增益来自按任务选择Skill,不是简单地全局删除低分Skill。
  • Embedding相似 != 真正有用:语义相关的Skill也可能引入多余步骤、错误假设,或者浪费Step Budget。
  • 因此Skill系统真正的瓶颈不只是如何生成Skill,而是Skill-Task Matching

关键贡献

  • 首次系统测量自然语言Skill的Per-Skill / Per-Task因果贡献
  • 提出一套包含测量、离线修复和在线选择的完整Skill治理流程。
  • 证明Prompt-time Skill Engineering在不训练模型的情况下,也能显著提升AppWorld,且能修复“Skill越加越差”的负迁移。

问题背景(Skill并非总是有益)

问题背景

现有Skill生命周期完全依赖LLM判断

现有范式

  • Agent执行任务,LLM从成功/失败轨迹中总结自然语言Skill。
  • 后续任务通过全量注入Embedding检索复用Skill。
  • Skill的生成、保留、合并和使用,通常都交给单任务上的LLM判断。

核心问题

  • 生成Skill需要归纳与创造,LLM通常擅长。
  • 但判断Skill是否真的提高成功率,需要跨多个任务观察反事实结果,不能只看单条轨迹。
  • 一个在复杂多步购买任务中有用的检查规则,可能在简单单步任务中浪费Step Budget。
  • 一个Skill在不同任务上的正负作用可能刚好抵消,使其全局平均效果接近0,却在具体任务上持续制造失败。

论文的关键观察

  • GPT-5.1的AppWorld Skill库中,超过90%的Skill在不同开发任务上表现出较大的因果效果范围。
  • 原始Skill库在AppWorld Test-Challenge上会让GPT-5.1从52.5下降到49.9,说明未经验证的经验积累可能产生负迁移。

也就是说,会总结经验并不等于会管理经验;Skill Library本身也需要评测、清理和路由。

核心方法(ASSAY三阶段Skill治理)

📕核心方法

Stage 1: Randomized Masking 因果归因

Skill-Task归因矩阵

  • 给定Skill库 S={s1,,sN} 和开发集 D={d1,,dM}
  • 每次试验以概率 f 独立保留每个Skill,形成随机Mask mk
  • 对每个Skill sj 和任务 di,比较“包含Skill”与“不包含Skill”的平均成功率:
C[j,i]=1|Mj+|kMj+ok(di)1|Mj|kMjok(di)
  • C[j,i]>0:Skill对该任务有帮助;C[j,i]<0:Skill对该任务有害。
  • Skill全局贡献为行均值 C¯(j);异质性为行范围 H(sj)=maxiC[j,i]miniC[j,i]

实验成本

  • AppWorld使用15个开发任务12组随机Mask,每个模型共180次Agent Rollout
  • Mask中每个Skill的保留概率 f=0.4
Stage 2: Offline Library Restructuring

Split -> Retire -> Merge

  1. Split:对高异质Skill,结合其在不同开发任务上的归因结果,拆成带显式适用条件的两个版本。
  2. Retire:异质性处理后,删除全局贡献绝对值很小的低信号Skill。
  3. Merge:对拆分后语义高度相似的Skill聚类,只保留因果得分更高的版本。

安全门

  • Split后的Skill库必须在开发集上不低于原始Skill库,否则回滚并保留原Skill。
  • 五个从公开文档和训练集失败模式总结的操作模板被标记为Protected,不参与删除和Mask。
Stage 3: Per-Task Causal Masking

从相似开发任务迁移因果证据

  • 对测试任务 t,通过Embedding找到k=8个最近开发任务。
  • 根据余弦相似度计算Softmax权重 wi(t)
  • 对每个Skill预测其在当前任务上的因果效果:
C^(sj,t)=iN(t)wi(t)C[j,i]
  • 仅保留预测效果不低于阈值的Skill,以及Protected模板。
  • 若过滤后Skill过少,则回退到完整Skill库,避免过度Mask。

与普通检索的区别

  • 普通Embedding检索:这个Skill和任务像不像
  • ASSAY因果选择:根据相似任务的随机实验,这个Skill预计能不能提高成功率

实验设置

✍️实验设置

实验设置

基础模型

  • OpenAI:GPT-5.4GPT-5.1GPT-4.1GPT-4o
  • 其他Provider:DeepSeek-V3Claude Sonnet 4.5Gemini 2.5 Pro
  • 均使用Standard/Non-Reasoning模式,避免把Chain-of-Thought增益与Skill治理混在一起。

任务/数据

  • AppWorld:90个训练任务,15个开发任务,Test-Normal 168个任务,Test-Challenge 417个任务。
  • τ-bench Retail:500个训练任务,15个开发任务,115个测试任务。
  • AppWorld Agent使用ReAct + Python Code REPL,最大40步。

指标

  • 主要指标:TGC
  • 论文附录中的SGC指Sub-Goal Completion,与AppWorld常用的Scenario Goal Completion不是同一含义,比较时不能混用。

比较方法

  • GPT-5.1、DeepSeek-V3对比ACE。
  • GPT-4.1对比CUGA;GPT-4o对比Gupta et al.的ICL方法。
  • 同时比较各模型的Bare ReAct基线。

关键结果

🍑关键结果

AppWorld结果
模型方法Test-Normal TGCTest-Challenge TGC
GPT-5.1ReAct / ACE / ASSAY61.9 / 67.3 / 77.452.5 / 49.9 / 66.4
DeepSeek-V3ReAct / ACE / ASSAY69.1 / 78.0 / 83.347.0 / 63.1 / 69.3
GPT-4.1ReAct / CUGA / ASSAY66.7 / 73.2 / 75.650.4 / 57.6 / 64.0
GPT-4oReAct / Gupta et al. / ASSAY48.8 / 68.5 / 71.430.2 / 38.9 / 41.0
GPT-5.4ReAct / ASSAY82.1 / 88.781.1 / 85.4
Sonnet 4.5ReAct / ASSAY83.9 / 89.370.3 / 75.3
Gemini 2.5ReAct / ASSAY72.6 / 81.049.4 / 54.9

难度分布

  • 未筛选Skill主要伤害Level 2/3复杂任务,而Level 1通常已经能受益。
  • GPT-5.1在Test-Challenge Level 3上,经ASSAY从43.1提升到71.3,相对提升65.4%

消融结论

  • Domain-agnostic模板:约9.7%相对提升。
  • 离线重构:继续提供约2.9%相对提升。
  • Per-Task Masking:贡献最大,约10.7%相对提升。
  • 完整流程相对Bare ReAct提升25.0%,说明关键确实是针对任务选Skill

未来方向

⛳未来方向

未来展望
  • 当前归因矩阵只使用15个开发任务,Test-Challenge与开发集的语义覆盖仍有限,需要更高效的在线归因与主动选点。
  • 目前主要处理静态Skill库;未来需要支持Skill持续新增时的增量因果测量
  • Prompt-time Skill对高能力模型存在收益递减:GPT-5.1和Sonnet 4.5在τ-bench上出现零增益,需要区分Skill不足、跨域迁移不足和基座能力饱和。
  • 随机Mask需要额外Rollout成本,未来可研究更低方差、更少样本的归因估计方法。

(2604) SkillX: Automatically Constructing Skill Knowledge Bases for Agents

🌺 论文摘要

SkillX 论文摘要

参考链接

核心方法

  • SkillX:自动构建一个可跨Agent复用的Plug-and-Play Skill Knowledge Base
  • 三级Skill表示
    • Planning Skill:任务应该分成哪些步骤。
    • Functional Skill:一个可复用的子任务/宏操作怎么完成。
    • Atomic Skill:单个Tool/API有哪些参数约束和常见坑。
  • Skill库构建:从轨迹提取 -> Merge重复Skill -> Filter非法/不可迁移Skill -> 继续探索欠覆盖工具。
  • 推理检索:先生成Pseudo-Plan,再按Plan中的每个Step检索Functional/Atomic Skill。
  • Pseudo-Plan只用于检索,不直接放进最终Prompt,避免错误Plan绑架后续执行。

模型效果 (AppWorld Test-Normal, Avg@4 / Pass@4)

  • Qwen3-32B + SkillX35.12 / 58.93,无记忆为27.68 / 47.62
  • Kimi-K2 + SkillX56.40 / 81.55,无记忆为46.88 / 70.24
  • GLM-4.6 + SkillX64.88 / 88.69,无记忆为60.27 / 83.33

重要结论

  • 强模型帮弱模型提取经验确实有效,但经验如何表示谁来提取更关键。
  • 不同模型需要的Skill粒度不一样,不是三级Skill全部注入就一定最好
  • Functional Skill通常最直接提升成功率;Planning Skill主要减少执行步数;Atomic Skill补充API Schema没有写清的使用经验。
  • 弱模型可能会过度模仿细粒度Skill,丢失对当前任务的适应性。
  • Skill库也不是迭代越多越好;训练任务有限时,Text-only refinement会逐渐过拟合。

关键贡献

  • 将Agent经验组织为可组合的三级Skill知识结构。
  • 给出从轨迹提取、迭代精炼到主动扩展的全自动SkillKB构建流程。
  • 验证了由强Agent构建的Skill库可以直接迁移给较弱Agent,而无需更新其模型参数。

问题背景(Agent重复发现相同经验)

问题背景

现有自进化Agent的三类低效

Isolated Learning

  • 每个Agent独立执行任务并重复抽取相似经验,产生大量冗余探索。

Weak Generalization

  • 复杂环境中的训练任务有限,单条轨迹总结出的经验容易绑定具体任务,难以迁移。

Model Capability Bottleneck

  • 如果只由当前Agent自己探索和反思,可提取经验的质量上限受基座模型能力限制。

表示问题

  • 原始轨迹、Insight和Workflow很难同时满足可迁移易检索可直接执行
  • Claude Skills式渐进披露需要多轮交互和复杂Sandbox;SkillX希望一次检索后直接注入轻量Prompt。

因此SkillX重点不是再做一个Memory Retriever,而是先解决经验应该拆成什么粒度

Multi-Level Skills Design

📕核心方法

三级Skill表示

Planning Skill

  • 表示高层任务组织结构:步骤顺序、依赖和分支。
  • 从成功轨迹中压缩得到,主动删除探索、回退、试错等偶然步骤。
  • 主要回答:先做什么、后做什么

Functional Skill

  • 表示可复用子任务或Macro-operation。
  • 包含namedocumentcontent:说明输入输出、注意事项和工具调用模式。
  • 主要回答:某个子任务具体怎么做

Atomic Skill

  • 对齐单个Tool/API,在原始Schema上补充常用参数、约束、失败模式和调用经验。
  • 当Functional Skill缺失或不完整时提供底层补充。
  • 主要回答:这个API怎么调用才不容易错
D=SplanSfuncSatomic

Skill提取、精炼与扩展

SkillX自动构建流程

1. Rollout and Extraction

  • 使用当前Skill库增强Agent,在训练任务上执行多次Rollout。
  • 从成功轨迹抽取Planning Skill,再据此分解Functional Skill,并补充Atomic Skill。

2. Iterative Refinement

  • Skills Merge:Embedding聚类语义相近的Skill,将多个更新方向合并为更一般的Skill;复杂Skill可继续拆分。
  • General Filter:删除依赖额外Python包、过度封装或不可组合的Skill。
  • Tool-specific Filter:对照环境Tool Schema,拒绝不存在的API、非法参数和不兼容调用结构。
  • 更新操作分为Add、Modify、Keep,最多迭代3轮。

3. Exploratory Expansion

  • 统计已可靠使用、频繁失败和从未调用的工具。
  • 引导Agent优先探索欠覆盖或失败率高的工具,而非随机探索。
  • 从探索轨迹合成新任务,重新执行Skill提取与精炼,扩大初始训练集之外的覆盖。

SkillX推理流程

Pseudo-Plan辅助Skill检索
  1. 根据新任务检索相似的Planning Skill。
  2. LLM结合当前任务重写出任务特定的Pseudo-Plan
  3. 以Pseudo-Plan的每个Step为Query,分别检索Functional/Atomic Skill。
  4. 去重并让LLM做一次适用性过滤,将最终Skill集合注入System Prompt。

关键设计

  • Pseudo-Plan只用于改善检索Query,不直接注入Agent Prompt,以减少错误Plan诱导执行的风险。
  • 使用Qwen3-Embedding-8B做去重与检索,检索余弦阈值为0.45

这和普通Task-to-Skill检索不同:复杂任务先被拆成多个Step,每个Step再分别找经验,减少“大任务Query只命中一条宽泛Skill”的问题。

实验设置

✍️实验设置

实验设置

Skill库构建模型

  • GLM-4.6,每个训练任务独立Rollout 4次。

执行模型

  • Qwen3-32BKimi-K2-Instruct-0905GLM-4.6
  • 附加实验包括DeepSeek-V3.2与GPT-4.1。

评测任务

  • AppWorld:90个训练任务,Test-Normal评测。
  • BFCL-v3:50个训练实例,150个测试实例。
  • τ²-Bench:Retail、Airline、Telecom。

指标

  • AppWorld/BFCL:Avg@4Pass@4
  • τ²-Bench:4次运行的Pass rate。

基线

  • No Memory、A-Mem、AWM、ExpeL。
  • 同时比较Self-ExtractionGLM-4.6强模型蒸馏两种经验构建方式。

关键结果

🍑关键结果

SkillX效果与分析

AppWorld Test-Normal

模型No Memory Avg@4 / Pass@4SkillX Avg@4 / Pass@4
Qwen3-32B27.68 / 47.6235.12 / 58.93
Kimi-K246.88 / 70.2456.40 / 81.55
GLM-4.660.27 / 83.3364.88 / 88.69

跨模型迁移

  • Qwen3-32B使用GLM提取的SkillX,AppWorld Avg@4提升7.44点。
  • Kimi-K2提升9.52点,说明较弱Agent更能从强模型Skill库受益。
  • GLM-4.6自身提升较小,表明强模型已有较强探索和工具使用能力,Skill增益存在Headroom限制。

三级Skill组合并非固定最优

  • GLM-4.6:全部Skill最好。
  • Kimi-K2:Functional + Atomic Skill更合适。
  • Qwen3-32B:只用Planning Skill最好;加入过细Skill会诱发过度模仿,反而降低适应性。
  • 所以Skill Retriever未来应该感知模型能力,而不是所有模型使用相同注入策略。

迭代与扩展

  • GLM-4.6在AppWorld上,Vanilla Iter2达到64.29,Iter3回落到61.46,显示过度迭代会过拟合。
  • 加入经验引导扩展后,Expand Iter2/3的Avg@4均为64.88,Pass@4最高达到88.69

未来方向

⛳未来方向

未来展望
  • 现有Skill与具体Tool Schema绑定,跨完全不同环境的直接迁移仍困难。
  • 论文主要覆盖Tool-use环境,对无函数调用的纯对话式用户交互研究不足。
  • Skill组合应根据基座模型能力自适应选择,而不是固定注入所有层级。
  • 需要研究动态更新的SkillKB,以及如何与ASSAY式因果评估结合,防止Skill扩展后积累条件性有害知识。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026