(2606) Not All Skills Help: Measuring and Repairing Agent Knowledge
🌺 论文摘要
ASSAY 论文摘要
参考链接
核心方法 (ASSAY, Attribution-Based Skill Selection and Assembly)
核心问题:Skill并不是越多越好,同一个Skill可能帮助任务A,却伤害任务B。- 将
Skill生成和Skill筛选分开:- LLM仍负责从轨迹中总结Skill。
- Skill是否保留、对哪个任务使用,则由
跨任务实验结果决定。
随机Mask实验:在开发集上随机开关不同Skill,估计每个Skill对每个Task的因果贡献。- 根据归因矩阵做两步治理:
离线重构:Split异质Skill、Retire低信号Skill、Merge重复Skill。在线选择:针对当前Task,只屏蔽预计有害的Skill。
- 整个过程
不更新模型参数,属于Prompt-time Skill Engineering。
模型效果 (AppWorld, TGC)
DeepSeek-V3 + ASSAY:Test-Normal83.3,Test-Challenge69.3。GPT-5.1 + ASSAY:Test-Normal77.4,Test-Challenge66.4;原始未筛选Skill在Challenge上反而从ReAct52.5降到49.9。GPT-4.1 + ASSAY:Test-Normal75.6,Test-Challenge64.0。- 7个模型、4个Provider在AppWorld两个测试集上均相对各自ReAct基线提升。
- 论文按
逐Task ReAct/Prompt-based口径将DeepSeek-V3的Challenge结果称为Published SOTA;不能与HCL-GP同时观察Scenario内多任务的Policy Synthesis口径直接比较。
重要结论
- Skill不是简单的
好 / 坏,而是有明显的Task-dependent因果异质性。 全局平均分不可靠:正负效果会互相抵消,看起来0贡献的Skill可能在某类任务上持续有害。- 最大增益来自
按任务选择Skill,不是简单地全局删除低分Skill。 Embedding相似 != 真正有用:语义相关的Skill也可能引入多余步骤、错误假设,或者浪费Step Budget。- 因此Skill系统真正的瓶颈不只是
如何生成Skill,而是Skill-Task Matching。
关键贡献
- 首次系统测量自然语言Skill的
Per-Skill / Per-Task因果贡献。 - 提出一套包含测量、离线修复和在线选择的完整Skill治理流程。
- 证明Prompt-time Skill Engineering在不训练模型的情况下,也能显著提升AppWorld,且能修复“Skill越加越差”的负迁移。
问题背景(Skill并非总是有益)
❓问题背景
现有Skill生命周期完全依赖LLM判断
现有范式
- Agent执行任务,LLM从成功/失败轨迹中总结自然语言Skill。
- 后续任务通过
全量注入或Embedding检索复用Skill。 - Skill的生成、保留、合并和使用,通常都交给单任务上的LLM判断。
核心问题
生成Skill需要归纳与创造,LLM通常擅长。- 但判断Skill是否真的提高成功率,需要跨多个任务观察反事实结果,不能只看单条轨迹。
- 一个在复杂多步购买任务中有用的检查规则,可能在简单单步任务中浪费Step Budget。
- 一个Skill在不同任务上的正负作用可能刚好抵消,使其全局平均效果接近0,却在具体任务上持续制造失败。
论文的关键观察
- GPT-5.1的AppWorld Skill库中,超过
90%的Skill在不同开发任务上表现出较大的因果效果范围。 - 原始Skill库在AppWorld Test-Challenge上会让GPT-5.1从
52.5下降到49.9,说明未经验证的经验积累可能产生负迁移。
也就是说,会总结经验并不等于会管理经验;Skill Library本身也需要评测、清理和路由。
核心方法(ASSAY三阶段Skill治理)
📕核心方法
Stage 1: Randomized Masking 因果归因
Skill-Task归因矩阵
- 给定Skill库
和开发集 。 - 每次试验以概率
独立保留每个Skill,形成随机Mask 。 - 对每个Skill
和任务 ,比较“包含Skill”与“不包含Skill”的平均成功率:
:Skill对该任务有帮助; :Skill对该任务有害。 - Skill全局贡献为行均值
;异质性为行范围 。
实验成本
- AppWorld使用
15个开发任务、12组随机Mask,每个模型共180次Agent Rollout。 - Mask中每个Skill的保留概率
。
Stage 2: Offline Library Restructuring
Split -> Retire -> Merge
Split:对高异质Skill,结合其在不同开发任务上的归因结果,拆成带显式适用条件的两个版本。Retire:异质性处理后,删除全局贡献绝对值很小的低信号Skill。Merge:对拆分后语义高度相似的Skill聚类,只保留因果得分更高的版本。
安全门
- Split后的Skill库必须在开发集上不低于原始Skill库,否则回滚并保留原Skill。
- 五个从公开文档和训练集失败模式总结的操作模板被标记为Protected,不参与删除和Mask。
Stage 3: Per-Task Causal Masking
从相似开发任务迁移因果证据
- 对测试任务
,通过Embedding找到 k=8个最近开发任务。 - 根据余弦相似度计算Softmax权重
。 - 对每个Skill预测其在当前任务上的因果效果:
- 仅保留预测效果不低于阈值的Skill,以及Protected模板。
- 若过滤后Skill过少,则回退到完整Skill库,避免过度Mask。
与普通检索的区别
普通Embedding检索:这个Skill和任务像不像?ASSAY因果选择:根据相似任务的随机实验,这个Skill预计能不能提高成功率?
实验设置
✍️实验设置
实验设置
基础模型
- OpenAI:
GPT-5.4、GPT-5.1、GPT-4.1、GPT-4o。 - 其他Provider:
DeepSeek-V3、Claude Sonnet 4.5、Gemini 2.5 Pro。 - 均使用Standard/Non-Reasoning模式,避免把Chain-of-Thought增益与Skill治理混在一起。
任务/数据
- AppWorld:90个训练任务,15个开发任务,Test-Normal 168个任务,Test-Challenge 417个任务。
- τ-bench Retail:500个训练任务,15个开发任务,115个测试任务。
- AppWorld Agent使用ReAct + Python Code REPL,最大40步。
指标
- 主要指标:
TGC。 - 论文附录中的
SGC指Sub-Goal Completion,与AppWorld常用的Scenario Goal Completion不是同一含义,比较时不能混用。
比较方法
- GPT-5.1、DeepSeek-V3对比ACE。
- GPT-4.1对比CUGA;GPT-4o对比Gupta et al.的ICL方法。
- 同时比较各模型的Bare ReAct基线。
关键结果
🍑关键结果
AppWorld结果
| 模型 | 方法 | Test-Normal TGC | Test-Challenge TGC |
|---|---|---|---|
| GPT-5.1 | ReAct / ACE / ASSAY | 61.9 / 67.3 / 77.4 | 52.5 / 49.9 / 66.4 |
| DeepSeek-V3 | ReAct / ACE / ASSAY | 69.1 / 78.0 / 83.3 | 47.0 / 63.1 / 69.3 |
| GPT-4.1 | ReAct / CUGA / ASSAY | 66.7 / 73.2 / 75.6 | 50.4 / 57.6 / 64.0 |
| GPT-4o | ReAct / Gupta et al. / ASSAY | 48.8 / 68.5 / 71.4 | 30.2 / 38.9 / 41.0 |
| GPT-5.4 | ReAct / ASSAY | 82.1 / 88.7 | 81.1 / 85.4 |
| Sonnet 4.5 | ReAct / ASSAY | 83.9 / 89.3 | 70.3 / 75.3 |
| Gemini 2.5 | ReAct / ASSAY | 72.6 / 81.0 | 49.4 / 54.9 |
难度分布
- 未筛选Skill主要伤害Level 2/3复杂任务,而Level 1通常已经能受益。
- GPT-5.1在Test-Challenge Level 3上,经ASSAY从
43.1提升到71.3,相对提升65.4%。
消融结论
Domain-agnostic模板:约9.7%相对提升。离线重构:继续提供约2.9%相对提升。Per-Task Masking:贡献最大,约10.7%相对提升。- 完整流程相对Bare ReAct提升
25.0%,说明关键确实是针对任务选Skill。
未来方向
⛳未来方向
未来展望
- 当前归因矩阵只使用15个开发任务,Test-Challenge与开发集的语义覆盖仍有限,需要更高效的在线归因与主动选点。
- 目前主要处理静态Skill库;未来需要支持Skill持续新增时的
增量因果测量。 - Prompt-time Skill对高能力模型存在收益递减:GPT-5.1和Sonnet 4.5在τ-bench上出现零增益,需要区分Skill不足、跨域迁移不足和基座能力饱和。
- 随机Mask需要额外Rollout成本,未来可研究更低方差、更少样本的归因估计方法。
(2604) SkillX: Automatically Constructing Skill Knowledge Bases for Agents
🌺 论文摘要
SkillX 论文摘要
参考链接
核心方法
SkillX:自动构建一个可跨Agent复用的Plug-and-Play Skill Knowledge Base。三级Skill表示:Planning Skill:任务应该分成哪些步骤。Functional Skill:一个可复用的子任务/宏操作怎么完成。Atomic Skill:单个Tool/API有哪些参数约束和常见坑。
Skill库构建:从轨迹提取 -> Merge重复Skill -> Filter非法/不可迁移Skill -> 继续探索欠覆盖工具。推理检索:先生成Pseudo-Plan,再按Plan中的每个Step检索Functional/Atomic Skill。- Pseudo-Plan
只用于检索,不直接放进最终Prompt,避免错误Plan绑架后续执行。
模型效果 (AppWorld Test-Normal, Avg@4 / Pass@4)
Qwen3-32B + SkillX:35.12 / 58.93,无记忆为27.68 / 47.62。Kimi-K2 + SkillX:56.40 / 81.55,无记忆为46.88 / 70.24。GLM-4.6 + SkillX:64.88 / 88.69,无记忆为60.27 / 83.33。
重要结论
- 强模型帮弱模型提取经验确实有效,但
经验如何表示比谁来提取更关键。 - 不同模型需要的Skill粒度不一样,
不是三级Skill全部注入就一定最好。 Functional Skill通常最直接提升成功率;Planning Skill主要减少执行步数;Atomic Skill补充API Schema没有写清的使用经验。- 弱模型可能会
过度模仿细粒度Skill,丢失对当前任务的适应性。 - Skill库也不是迭代越多越好;训练任务有限时,Text-only refinement会逐渐过拟合。
关键贡献
- 将Agent经验组织为可组合的三级Skill知识结构。
- 给出从轨迹提取、迭代精炼到主动扩展的全自动SkillKB构建流程。
- 验证了由强Agent构建的Skill库可以直接迁移给较弱Agent,而无需更新其模型参数。
问题背景(Agent重复发现相同经验)
❓问题背景
现有自进化Agent的三类低效
Isolated Learning
- 每个Agent独立执行任务并重复抽取相似经验,产生大量冗余探索。
Weak Generalization
- 复杂环境中的训练任务有限,单条轨迹总结出的经验容易绑定具体任务,难以迁移。
Model Capability Bottleneck
- 如果只由当前Agent自己探索和反思,可提取经验的质量上限受基座模型能力限制。
表示问题
- 原始轨迹、Insight和Workflow很难同时满足
可迁移、易检索和可直接执行。 - Claude Skills式渐进披露需要多轮交互和复杂Sandbox;SkillX希望一次检索后直接注入轻量Prompt。
因此SkillX重点不是再做一个Memory Retriever,而是先解决经验应该拆成什么粒度。
Multi-Level Skills Design
📕核心方法
三级Skill表示
Planning Skill
- 表示高层任务组织结构:步骤顺序、依赖和分支。
- 从成功轨迹中压缩得到,主动删除探索、回退、试错等偶然步骤。
- 主要回答:
先做什么、后做什么。
Functional Skill
- 表示可复用子任务或Macro-operation。
- 包含
name、document和content:说明输入输出、注意事项和工具调用模式。 - 主要回答:
某个子任务具体怎么做。
Atomic Skill
- 对齐单个Tool/API,在原始Schema上补充常用参数、约束、失败模式和调用经验。
- 当Functional Skill缺失或不完整时提供底层补充。
- 主要回答:
这个API怎么调用才不容易错。
Skill提取、精炼与扩展
SkillX自动构建流程
1. Rollout and Extraction
- 使用当前Skill库增强Agent,在训练任务上执行多次Rollout。
- 从成功轨迹抽取Planning Skill,再据此分解Functional Skill,并补充Atomic Skill。
2. Iterative Refinement
Skills Merge:Embedding聚类语义相近的Skill,将多个更新方向合并为更一般的Skill;复杂Skill可继续拆分。General Filter:删除依赖额外Python包、过度封装或不可组合的Skill。Tool-specific Filter:对照环境Tool Schema,拒绝不存在的API、非法参数和不兼容调用结构。- 更新操作分为Add、Modify、Keep,最多迭代3轮。
3. Exploratory Expansion
- 统计已可靠使用、频繁失败和从未调用的工具。
- 引导Agent优先探索欠覆盖或失败率高的工具,而非随机探索。
- 从探索轨迹合成新任务,重新执行Skill提取与精炼,扩大初始训练集之外的覆盖。
SkillX推理流程
Pseudo-Plan辅助Skill检索
- 根据新任务检索相似的Planning Skill。
- LLM结合当前任务重写出任务特定的
Pseudo-Plan。 - 以Pseudo-Plan的每个Step为Query,分别检索Functional/Atomic Skill。
- 去重并让LLM做一次适用性过滤,将最终Skill集合注入System Prompt。
关键设计
- Pseudo-Plan只用于改善检索Query,不直接注入Agent Prompt,以减少错误Plan诱导执行的风险。
- 使用Qwen3-Embedding-8B做去重与检索,检索余弦阈值为
0.45。
这和普通Task-to-Skill检索不同:复杂任务先被拆成多个Step,每个Step再分别找经验,减少“大任务Query只命中一条宽泛Skill”的问题。
实验设置
✍️实验设置
实验设置
Skill库构建模型
GLM-4.6,每个训练任务独立Rollout 4次。
执行模型
Qwen3-32B、Kimi-K2-Instruct-0905、GLM-4.6。- 附加实验包括DeepSeek-V3.2与GPT-4.1。
评测任务
- AppWorld:90个训练任务,Test-Normal评测。
- BFCL-v3:50个训练实例,150个测试实例。
- τ²-Bench:Retail、Airline、Telecom。
指标
- AppWorld/BFCL:
Avg@4与Pass@4。 - τ²-Bench:4次运行的Pass rate。
基线
- No Memory、A-Mem、AWM、ExpeL。
- 同时比较
Self-Extraction和GLM-4.6强模型蒸馏两种经验构建方式。
关键结果
🍑关键结果
SkillX效果与分析
AppWorld Test-Normal
| 模型 | No Memory Avg@4 / Pass@4 | SkillX Avg@4 / Pass@4 |
|---|---|---|
| Qwen3-32B | 27.68 / 47.62 | 35.12 / 58.93 |
| Kimi-K2 | 46.88 / 70.24 | 56.40 / 81.55 |
| GLM-4.6 | 60.27 / 83.33 | 64.88 / 88.69 |
跨模型迁移
- Qwen3-32B使用GLM提取的SkillX,AppWorld Avg@4提升
7.44点。 - Kimi-K2提升
9.52点,说明较弱Agent更能从强模型Skill库受益。 - GLM-4.6自身提升较小,表明强模型已有较强探索和工具使用能力,Skill增益存在Headroom限制。
三级Skill组合并非固定最优
GLM-4.6:全部Skill最好。Kimi-K2:Functional + Atomic Skill更合适。Qwen3-32B:只用Planning Skill最好;加入过细Skill会诱发过度模仿,反而降低适应性。- 所以Skill Retriever未来应该
感知模型能力,而不是所有模型使用相同注入策略。
迭代与扩展
- GLM-4.6在AppWorld上,Vanilla Iter2达到
64.29,Iter3回落到61.46,显示过度迭代会过拟合。 - 加入经验引导扩展后,Expand Iter2/3的Avg@4均为
64.88,Pass@4最高达到88.69。
未来方向
⛳未来方向
未来展望
- 现有Skill与具体Tool Schema绑定,跨完全不同环境的直接迁移仍困难。
- 论文主要覆盖Tool-use环境,对无函数调用的纯对话式用户交互研究不足。
- Skill组合应根据基座模型能力自适应选择,而不是固定注入所有层级。
- 需要研究动态更新的SkillKB,以及如何与ASSAY式因果评估结合,防止Skill扩展后积累条件性有害知识。