AppWorld 相关论文总结
📅 发表于 2026/07/13
🔄 更新于 2026/08/05
👁️ — 次访问
📝 12238 字
⏳ 43 分钟
Appworld-Summary
#AppWorld
#AgentRL
#Process-Reward
#Skill
#Memory
#Context-Engineering
#Agent-Architecture
整理范围:本地
AppWorld相关论文目录中的 21 篇论文。
时间格式:(YYMM),例如(2605)表示 2026 年 5 月。
详细笔记:AgentRL、Agent架构、上下文与记忆、合成数据、Skill与经验知识。
🌺 总结摘要
能力提升发生的位置组织相关工作,而不是按模型或论文时间简单罗列。八条细分路线可进一步归纳为Policy-Centric AgentRL、Data-Centric Training、External Knowledge & Context、System-Centric Agent四类主流范式。普通Outcome AgentRL、Step Credit与Process Reward、训练期经验与Skill增强RL。其中,LOOP只使用Outcome Reward;SALT重新分配Outcome Advantage但不使用Process Reward;GVPO显式引入执行过程信号;SIRI、Skill-SD、SAGE和AgentEvolver则在训练中利用Skill或经验。SIRI和Skill-SD最终删除Skill Bank,SAGE推理期继续使用外部Skill Library,AgentEvolver完整系统也会检索历史经验。因此,训练方式相似不等于推理成本和模型内化程度相同。Simple and Strong Outcome AgentRL:采用DAPO Token-Level Loss(Token-mean)与Env Loss Mask,混合L1/L2/L3任务进行n=32 Strict On-policy训练,使用Exact Binary Outcome、KL稳定约束、错误轨迹隔离和Fake Data处理,并允许LLM单次生成不设独立上限。Policy参数能力与外部系统能力,同时标明Test-N/Test-C、TGC/SGC、mean@1/mean@k及测试协议。Skill、Memory、Retriever、Planner或多Agent系统带来的增益不能直接归因于Policy训练。分类的核心依据是主要创新作用于Agent生命周期的哪个位置。为兼顾整体理解和具体检索,本节先将相关工作归纳为四类主流范式,再保留八类细分技术路线。同一工作可能同时包含任务生成、经验检索和Policy优化,但本笔记只保留一个主类别,并在具体条目中注明辅助机制和推理期依赖。
| 主流范式 | 覆盖的八类细分 | 核心含义 | 主要优点 | 主要缺点 | 代表工作 |
|---|---|---|---|---|---|
| Policy-Centric AgentRL | 普通Outcome AgentRL;Step Credit与Process Reward;训练期经验与Skill增强RL | 通过Outcome、过程信号、Skill或经验直接更新Agent Policy | 能力进入模型参数;多数方法推理路径简单;适合分析Policy本身的提升 | 环境Rollout昂贵,长轨迹信用分配和训练稳定性困难;Skill增强方法还可能依赖Teacher或外部Skill | (2606) GVPO、SIRI;(2604) Skill-SD;(2602) 本文;(2512) SAGE;(2502) LOOP |
| Data-Centric Training | 任务合成与数据演化 | 扩展训练任务,或根据当前Policy弱点动态更新任务分布 | 扩大任务覆盖并形成课程;数据生成模块通常不进入推理路径 | 任务生成、重执行和Verifier成本高;容易产生重复、无效或分布偏移的数据 | (2605) CoEvolve;(2512) CuES |
| External Knowledge & Context | Skill Library构建与治理;Memory与In-Context Experience;上下文压缩 | 在推理时检索Skill/Memory,或压缩与重组长上下文 | 无需反复更新Agent Policy;知识更新快,能够复用历史经验并缓解Context压力 | 能力依赖外部库、Retriever或Compressor;存在检索错误、信息丢失、Context成本和额外Latency | (2606) ASSAY、METIS;(2604) SkillX;(2512) ReMe、PAACE;(2510) ACE、ACON |
| System-Centric Agent | 多Agent、企业系统与广义规划 | 通过角色分工、规划、验证、Sandbox和组件复用增强完整Agent系统 | 模块化、可验证、便于错误恢复;适合复杂Workflow与生产约束 | 系统成本和调试复杂度高,错误可能级联;测试协议通常更重,难与单Policy Agent直接比较 | (2605) HCL-GP;(2510) CUGA;(2509) ProST |
| 技术类型 | 主要解决的问题 | 是否训练Policy | 推理期额外依赖 | 代表工作 |
|---|---|---|---|---|
| 普通Outcome AgentRL | 如何仅依靠任务结果稳定训练长程Agent | 是 | 通常无 | (2602) 本文、(2502) LOOP |
| Step Credit与Process Reward | 如何给长轨迹中的Action分配更细粒度的训练信号 | 是 | 通常无 | (2606) GVPO、(2510) SALT |
| 训练期经验与Skill增强RL | 如何在RL或蒸馏中利用Skill、Teacher或历史经验 | 是 | 因方法而异 | (2606) SIRI、(2604) Skill-SD、(2512) SAGE、(2511) AgentEvolver |
| 任务合成与数据演化 | 训练任务从哪里来,以及如何随Policy能力动态更新 | 通常训练下游Policy | 生成模块通常不保留 | (2605) CoEvolve、(2512) CuES |
| Skill Library构建与治理 | 如何构建、检索、筛选和治理可复用Skill | 否 | SkillKB、Retriever或Causal Mask | (2606) ASSAY、(2604) SkillX |
| Memory与In-Context Experience | 如何复用成功轨迹、Playbook和Procedural Memory | 否 | Memory、Retriever及额外Context | (2606) METIS、(2512) ReMe、(2510) ACE、(2506) Agent ICL |
| 上下文压缩 | 如何在长程交互中降低Context长度并保留决策信息 | 不训练Agent Policy | 独立Compressor或Plan模块 | (2512) PAACE、(2510) ACON |
| 多Agent、企业系统与广义规划 | 如何通过角色分工、规划、验证和组件复用提升系统能力 | SFT或不训练 | 多Agent、Repository、Verifier或Sandbox | (2605) HCL-GP、(2510) CUGA、(2509) ProST |
| 技术类型 | 当前主要缺点 | 具体风险与对比边界 |
|---|---|---|
| 普通Outcome AgentRL | 延迟Reward难以定位错误Action,长轨迹Rollout与更新成本高 | Binary Outcome在同组全失败或全成功时缺少有效Advantage;训练稳定性对Loss聚合、Clip、KL、轨迹复用和生成截断较敏感 |
| Step Credit与Process Reward | 细粒度信号不一定等价于真实因果贡献 | Trajectory Graph、执行成功率或人工规则都可能引入偏差;Process Signal依赖环境反馈,跨环境迁移和额外计算成本仍未充分验证 |
| 训练期经验与Skill增强RL | 训练链路复杂,容易依赖Teacher、Summarizer或Skill质量 | 可能出现Teacher–Student Off-policy、Train/Test Prompt不一致和错误Skill放大;SAGE推理期仍保留Skill Library,SIRI无AppWorld结果,现有实验口径并不统一 |
| 任务合成与数据演化 | 高质量任务生成与验证成本高 | 容易产生重复、不可执行或偏离真实分布的任务;能力上限受外部生成模型和Verifier限制,部分工作对下游RL配置披露不足 |
| Skill Library构建与治理 | 能力主要保存在外部库中,没有证明Policy完成内化 | 错误检索或有害Skill可能降低性能;Skill构建、因果归因和逐任务Mask需要大量额外Rollout,随Skill与Task数量增长时扩展成本高 |
| Memory与In-Context Experience | 检索噪声、Memory过时与Context膨胀并存 | 成功经验不一定适配新任务,失败经验可能污染决策;效果依赖Retriever、长Context和外部Memory Manager,难与模型参数能力分离 |
| 上下文压缩 | 压缩可能永久丢失后续决策所需的信息 | 额外Compressor增加训练成本和推理Latency;压缩目标与最终任务成功率可能不一致,部分结果采用自定义Accuracy,难与官方TGC/SGC直接比较 |
| 多Agent、企业系统与广义规划 | 系统成本、Latency和调试复杂度最高 | 子Agent错误会级联传播,增益难归因到单一模块;Test-time Verifier、多任务联合输入或反复Debug形成非标准协议,不能与逐任务单Policy Agent直接比较 |
Test-N/Test-C、TGC/SGC、Avg@k/Pass@k、Dev/Test、自定义Accuracy及交互预算差异较大,单一分数不适合直接排序。AppWorld是所有工作的Benchmark与评测基础,不计入八条方法路线。主要训练或推理机制为准。例如SAGE虽在推理期保留Skill Library,但核心贡献是Skill-integrated RL,因此归入训练期Skill增强RL。从近到远排列;实验口径不同的结果只并列展示,不直接据此判断SOTA。相同技术路线分表,避免一张大表中不同方法混排。学习方式不仅回答是否训练,还说明优化的是Agent Policy、Compressor还是外部Skill/Memory。训练/构建预算区分RL Rollout与外部知识构建预算;两者不能直接比较。Test-N TGC/SGC;Test-C TGC/SGC。Avg@4、Pass@4、Dev Accuracy或自定义Acc会明确标记。推理期依赖用于区分模型参数能力与Skill、Memory、Planner、Compressor等系统能力。| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2407) AppWorld | GPT-4o等 | 不训练;构建Benchmark | 250 Scenarios / 750 Tasks | State-based Unit Tests | 标准环境 + API Docs | GPT-4o ReAct:N 48.8/32.1;C 30.2/13.0 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2502) LOOP | Qwen2.5-32B | LoRA RL;LOO-PPO | 72 Tasks;rollout.n=6 | Unit-test Pass Fraction | 无额外模块 | N 71.3/53.6;C 45.7/26.6 |
| (2602) 本文 | Qwen3-14B | Full-parameter GRPO | 90 Tasks;rollout.n=32 | Exact Binary Outcome | 无辅助Learned/Retrieval模块 | 历史官方:N 86.9/80.4;C 67.6/50.4 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2510) SALT | Qwen2.5-32B | RLOO/GRPO + Trajectory Graph | 任务范围未报告;n=8 | Binary Outcome;跨轨迹Step匹配 | 无额外模块 | N 66.2/47.9;C 36.8/20.9;不是Process Reward |
| (2606) GVPO | Qwen2.5-32B | GRPO + Advantage Shaping | 72 Tasks;n=8 | Pass Fraction + Execution Process Signal | 无额外模块 | N 72.6/55.4;C 49.4/28.8 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2606) SIRI | Qwen2.5-7B | GiGPO + Skill Internalization | 无AppWorld;n=8 | Self-mined Skill Utility + Action Advantage | 无;最终删除Skill Bank | 无AppWorld结果;ALFWorld 0.930,WebShop Success 0.813 |
| (2604) Skill-SD | Qwen3-4B | GRPO + Self-Distillation | 90 Train;n=4 | Completion Fraction + Skill Teacher | 无;Skill只在训练期 | Dev Acc./Comp. 64.9/84.9;无Test-N/C |
| (2512) SAGE / SkillRL | Qwen2.5-32B | SFT + Skill-integrated RL | 1,129 SFT样本;72 RL Tasks;n=8 | Completion + Skill Generation/Reuse Bonus | Skill Library + Retriever | N 72.0/60.7;C 50.1/32.4 |
| (2511) AgentEvolver | Qwen2.5-7B/14B | Self-evolving RL | 主任务规模与n未完整报告 | Outcome/Judge + Experience + Step Attribution | 完整系统可检索经验;另有内化消融 | 14B N 48.7 Avg@8 / 69.4 Best@8 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2512) CuES | Qwen2.5-14B | 合成数据 + 下游SFT/RL | 90原始→625合成任务 | 环境探索 + 重执行验证 | 无合成模块 | N TGC 45.24 Greedy;无SGC/Test-C;RL细节不足 |
| (2605) CoEvolve | Qwen2.5-7B;Qwen3-4B/30B-A3B | 动态数据 + GRPO | 100初始任务;n=8;每10 Steps更新 | Binary Outcome + Forgetting/Boundary/Rare Signal | 无数据生成模块 | 30B:N 54.76/33.93;C 31.65/16.55 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2604) SkillX | GLM-4.6构建;Qwen3-32B/Kimi-K2/GLM执行 | 不训练Policy;构建SkillKB | 90 Tasks;每Task 4+1条构建/探索轨迹 | Planning/Functional/Atomic Skill | SkillKB + Retriever + Pseudo-plan | GLM N 64.88 Avg@4 / 88.69 Pass@4 |
| (2606) ASSAY | GPT-5.x、DeepSeek-V3.2等 | 不训练;Skill因果治理 | 90 Train + 15 Dev;每模型180条归因Rollout | Skill×Task Randomized Attribution | Skill Library + Per-task Causal Masking | DeepSeek N/C TGC 83.3/69.3;高预算外部治理 |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2506) Agent ICL | GPT-4o | 不训练;Trajectory ICL | Train+Dev 147 Tasks;141条成功ReAct轨迹 | 完整成功Trajectory | Trajectory Pool + Retriever + 大Context | N 65.8/53.6;C 38.7/24.8 |
| (2510) ACE | DeepSeek-V3.1-671B | 不训练;增量Playbook优化 | 90 Train + 57 Dev;最多5 Epoch | Trajectory/Test Feedback | Generator + Reflector + Curator + Playbook | Offline N 76.2/64.3;C 57.3/39.6 |
| (2512) ReMe | Qwen3-8B/14B/32B | 不训练;Procedural Memory | 90 Tasks;每Task 8条构建轨迹 | 成功/失败/对比经验 | Vector DB + Rerank + Rewrite + Reflection | 32B N 42.02 Avg@4 / 63.49 Pass@4 |
| (2606) METIS | GPT-4o Executor + Claude Reflector | 不训练;Text/Code Memory | 90 Tasks顺序构建一次 | Plan/Fact/Pitfall + Recurrence-gated Tool | Memory Manager + Retriever + Sandbox | Official N TGC 60.1;无Test-C |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2510) ACON | GPT-4.1 Agent;Qwen3-8B/14B等Compressor | 仅优化/蒸馏Compressor | 90 Tasks;每Task压缩/不压缩各1条 | 执行反馈驱动Compression Guideline | 独立Compressor | N TGC 56.5、Peak 7.33K;可能增加Latency |
| (2512) PAACE | GPT-OSS-120B Teacher + Qwen3-4B | 仅训练Compressor | 约120万Synthetic Workflows | Next-k Plan + Outcome-preserving Supervision | Plan + Qwen3-4B Compressor | 自定义Acc 59.0、Peak 6.23K;不是官方TGC/SGC |
| 时间 / 工作 | Backbone | 学习方式 | 训练/构建预算 | Reward / 知识来源 | 推理期依赖 | 关键结果与口径 |
|---|---|---|---|---|---|---|
| (2509) ProST | Qwen2.5-Coder 7B/14B/32B等 | 多Agent SFT | Train+Dev 147 Tasks;2,708条多Agent轨迹 | 验证后的多角色Trajectory | Orchestrator + Executor + Critic | Phi-4:N 46.4/28.6;C 17.8/8.6 |
| (2510) CUGA | GPT-4.1 | 不训练;系统编排 | 无AppWorld训练 | Planner/Ledger + Tool Feedback | 多子Agent + Retriever + Sandbox + Retry | N 73.2/62.5;C 57.6/48.2 |
| (2605) HCL-GP | Claude Sonnet 4.6;GPT-OSS-120B | 不训练;Policy/Component Synthesis | 90 Tasks→159 Seed Components | Scenario多任务结构 + Component Reuse | Repository + 多Agent + Test-time Verifier/Debug | Claude N 98.2/98.2;C 98.3/97.8;非标准逐Task协议 |
未明确报告表示论文正文与附录均未给出,不能按常见实现补齐。Loss / Mask区分Loss聚合粒度、Policy Token与Environment Observation是否参与梯度;KL区分Policy–Reference约束和Teacher–Student蒸馏。单次生成指每个Agent Turn或论文定义的Response上限;它不同于总Context、总Response Budget和最大交互轮数。| 工作 | Loss / Mask | Clip / KL / Entropy | Reward / Advantage | Policy、数据与Rollout | 生成预算与异常轨迹 |
|---|---|---|---|---|---|
| (2602) 本文 | DAPO Token-Level Loss(Token-mean);Env Loss Mask,仅Policy Token | Clip 0.2/0.2;KL 1e-4;No Entropy Reward | Exact Binary 1/0;无中间Reward与中间Advantage | Strict On-policy;L1/L2/L3混合;n=32;Thinking | Env返回4K/turn;LLM单次生成无独立上限;总Response Cap 32K;错误轨迹丢弃 + Fake Data |
| (2502) LOOP | Per-token PPO Ratio;每轨迹仅对Agent Token取均值 | Clip值未报告;无Reference KL;Entropy未报告 | Unit-test Pass Fraction;Trajectory LOO Advantage | Rollout Reuse,非Strict On-policy;仅L1/L2;n=6;ReAct CoT | 1.5K/turn;Env返回3K截断;低Advantage轨迹过滤,超时记失败 |
| (2606) GVPO | Sequence-mean-token-mean;Observation Token置零 | Clip 0.2/0.28;KL 0;Entropy 0 | Pass Fraction + Execution Failure Shaping | Current-policy Group Rollout;仅L1/L2;n=8;ReAct CoT | 512/turn;Env返回3K截断;超预算记失败,不丢弃错误Step |
| (2510) SALT | Action-step Advantage;Policy Loss粒度与Env Mask未报告 | Clip 0.2;KL 0;Entropy未报告 | Binary Outcome经Trajectory Graph重分配;无Process Reward | GRPO/RLOO Group Rollout;任务难度未报告;n=8;Thinking未报告 | 1.5K/turn;40 Turns;异常轨迹处理未报告 |
| (2606) SIRI | 只蒸馏正Utility、正Advantage Action Token;GiGPO聚合未报告 | 对称Clip但值未报告;含KL但系数未报告;Entropy未报告 | Benchmark Return + Episode/Step Advantage + Skill Utility | Current-policy Paired Rollout;无AppWorld;n=8;显式Think/Action格式 | 512 Response;只内化筛选后的正向轨迹,Fake Data未报告 |
| (2604) Skill-SD | DAPO Token-Level Loss(Token-mean);Valid Action Token | Clip 0.2/0.28;无Policy–Reference KL;SDL Reverse-KL λ=0.001;Entropy 0 | Completion Fraction + Token-level Distillation | Student-owned On-policy;全部90 Tasks;n=4;ReAct | Max Response 20,480;40 Turns;未报告错误轨迹丢弃或Fake Data |
| (2512) SAGE / SkillRL | Token-level Ratio;仅LLM Generation,Environment Mask | Clip值未报告;KL 0;Entropy未报告 | Completion Fraction + Skill Bonus + No-code Penalty | Strict On-policy、无PPO Epoch;仅L1/L2;n=8;ReAct | 1.5K/turn;Env返回12K字符截断;超Context停止,RL错误轨迹/Fake Data未报告 |
| (2511) AgentEvolver | Step Advantage广播到Token;Loss reduction与Env Mask未报告 | Clip 0.28/0.28,正样本High扩至0.6;KL 0.001;Entropy未报告 | Continuous Outcome/Judge + GOOD/BAD Attribution | Vanilla与Experience-guided各50%;40 Epochs/update;存在Prompt Stripping Off-policy Mismatch;n未报告 | 30 Steps;单次Token上限未报告;合成任务会过滤,RL错误轨迹/Fake Data未报告 |
| (2605) CoEvolve | Objective按Trajectory Position求和并以总长度归一;Env Mask未报告 | Clip 0.2/0.28;KL 1e-3;Entropy未报告 | Binary Success 1/0;无Process Advantage | Current-policy GRPO + 动态任务集;100条初始合成任务;n=8;Thinking未报告 | Max Response 4,096;30 Steps;无效合成任务过滤,RL错误轨迹/Fake Data未报告 |
| (2512) CuES | 下游Policy Loss与Env Mask均未报告 | Clip、KL、Entropy均未报告 | 下游RL Reward/Advantage未报告 | AppWorld 90→625合成任务;算法、On-policy状态、n与难度混合均未报告 | 20,480仅为数据生成上限;无效合成任务过滤,RL轨迹处理未报告 |
9个App,共457个API。3个Contrastive Task。State-based Unit Tests检查任务目标、最终答案和Collateral Damage。TGC与更严格的SGC。250 Scenarios、750 Tasks;Train 105、Dev 60、Test-N 168、Test-C 417。rollout.n与RL Reward不适用。48.8/32.1 TGC/SGC,Test-C 30.2/13.0。58.3降至Level-3 21.0。54.8/35.2,说明瓶颈不只是API检索。Leave-One-Out Advantage + PPO Clip + Rollout Reuse。Per-trajectory / Per-turn / Per-token Importance Ratio。Agent生成Token计算Loss;推理时没有Planner、Memory或Skill Library。Qwen2.5-32B-Instruct;LoRA Rank 16、Alpha 32。24 Scenarios、72 Tasks;每轮抽40 Tasks。rollout.n=6。5e-5;16×H100;最佳Run约42小时。Per-token Importance Ratio,每条轨迹只对Agent生成Token求平均;这不同于DAPO跨Batch直接Token-mean。不是Strict On-policy;只训练L1/L2,论文明确报告加入L3反而下降。1,500 Tokens,API Response超过3K Tokens截断;低Advantage轨迹会过滤,超交互预算记失败,Fake Data处理未报告。71.3/53.6,Test-C 45.7/26.6。53.3/64.1/71.3。71.3降至61.9。Trajectory Graph。BGE-M3匹配语义相似的State/Action Edge,并对其原Trajectory Advantage求平均。独特Step保留原Advantage;构图模块只用于训练。Qwen2.5-32B-Instruct;RLOO/GRPO及其SALT版本。Strict Binary Terminal Reward;rollout.n=8;Minibatch 32。1e-6;KL 0;100 Steps;Clip 0.2。0.2/0.2、KL=0;Entropy Bonus/Reward未报告。rollout.n=8;是否Fresh On-policy、是否复用轨迹以及L1/L2/L3组成均未明确报告。1,500 Tokens、最多40轮;错误/超时轨迹是否丢弃及Fake Data处理未报告。66.2/47.9,Test-C 36.8/20.9。61.5/41.4,Test-C 36.3/17.0。67.5→76.2,D3从35.5→41.6;但Test-C D1出现下降。Outcome-only Step Credit,不能写成Process Reward方法。Unit-test Pass Fraction提供Trajectory Outcome。Success/Failure Step,对失败Step做条件性负向Shaping。Observation Token Advantage=0;使用Asymmetric Clip和Sequence-Mean-Token-Mean。不使用KL与Reward Std Normalization。Qwen2.5-32B;L1/L2共24 Scenarios、72 Tasks;每轮抽32 Tasks。rollout.n=8;训练144 Steps;LR 1e-5;Clip (0.2,0.28);Process Penalty b=0.2。Sequence-Mean-Token-Mean;只更新Reasoning/Code Generation Token,Observation Token Advantage置0。0.2/0.28,明确不使用KL;Entropy Coefficient为0.0。rollout.n=8,使用ReAct CoT。512 Tokens,API Response超过3K Tokens截断;错误Step不会丢弃,而是获得Process Penalty,超预算Episode记失败。72.6/55.4,Test-C 49.4/28.8。1.3/3.7。34.6/15.1;加回Std Normalization后为42.8/23.7。b=0.1的单项Test-C TGC为53.1,高于主配置49.4,因此主配置并非每个Split都最优。Phase 0—GiGPO Warmup:先获得可靠成功轨迹。Phase 1—Skill Mining & Validation:从成功Plain Rollout挖掘Skill,通过Skill/No-Skill配对Rollout估计Utility。Phase 2—Skill Internalization:只蒸馏正Utility Trajectory中的正Advantage Action Token。没有AppWorld实验,只评测ALFWorld与WebShop。Qwen2.5-7B;Batch 16;rollout.n=8;Warmup 30–50 Steps。正Utility + 正Advantage的Action Token,并排除Reasoning与其他Natural-language Token;基础RL Loss聚合未报告。rollout.n=8;没有AppWorld数据,因而不存在AppWorld三难度混合设置;Prompt显式要求<think>/<action>格式。512 Tokens;只内化通过Utility Gate的正向轨迹,但没有报告Fake Data机制。0.908,SkillRL 0.899,SIRI 0.930。0.844/0.728,SIRI 0.899/0.813。0.898/0.805;完整SIRI无Skill推理为0.899/0.813。成功经验、错误和Workflow,按任务维护Skill Buffer并用UCB选择。Teacher每轮同步Student参数,但额外看到Skill Prompt。GRPO + Importance-weighted Reverse-KL。Teacher、Summarizer和Skill Bank。Qwen3-4B-Instruct-2507;AppWorld全部90 Train、57 Dev;最多40轮。rollout.n=4;Train Batch 16;Optimization Epoch 1。1e-6;Clip (0.2,0.28);SDL λ=0.001;8×L40S。Token-Level Loss(Token-mean),只统计Valid Action Token;Student生成的同一批Token由Teacher重评分。0.2/0.28;没有Policy–Reference KL,但有λ=0.001的Teacher–Student Reverse-KL蒸馏项;Entropy Coefficient为0.0。Student-owned Strict On-policy、每批只更新1 Epoch;混合全部90个L1/L2/L3任务,rollout.n=4,使用ReAct轨迹。20,480 Tokens、最多40轮;论文没有报告错误轨迹丢弃或Fake Data处理。8.8/39.1,Vanilla GRPO 50.9/76.3,Skill-SD 64.9/84.9 Accuracy/Completion。42.1/76.1。SFT Warmup。Task Chain。Skill-integrated Reward同时奖励任务完成、Skill Generation和后续Skill Reuse。外部Python Skill。Qwen2.5-32B-Instruct,全参数SFT+RL;Teacher为Claude-3.5-Sonnet-v2。rollout.n=8;每Step 384 Rollout Units。1e-6;4×8 H100。KL=0且不做Advantage Std,Entropy Bonus/Reward未报告。-1,不是Sparse Binary Outcome-only;训练为Strict On-policy且无PPO Epoch。1,500 Tokens,Environment Output超过12,000字符截断;超28,048 Context停止。RL错误轨迹丢弃与Fake Data未报告,只有SFT数据构建明确使用Rejection Sampling。72.0/60.7,Test-C 50.1/32.4。69.2/51.8、C 40.7/26.9;SFT-only为N 55.2/41.7。71.4/54.8,说明Policy本身和外部Skill都贡献能力。环境→任务→经验→反馈闭环,让Agent自己决定学什么、如何探索和如何归因。Self-Questioning:探索环境、合成任务并重执行验证。Self-Navigating:检索历史经验引导一半Rollout,更新前移除经验文本并使用Selective Boosting。Self-Attributing:外部LLM为Action标记GOOD/BAD,与Outcome Advantage组合。Qwen2.5-7B/14B-Instruct;GRPO-style;LR 1e-6;Batch 32;每次Policy Update 40 Epochs;KL 0.001;8×A100-80G。α=0.1, β=1。rollout.n和主实验任务规模没有完整披露。0.28/0.28,正Advantage经验轨迹的Clip-High扩至0.6;KL为0.001,Entropy项未报告。GOOD/BAD Step Attribution。Vanilla与经验引导轨迹各50%,去掉经验Prompt后形成显式Off-policy Mismatch。1.8/5.6 → AgentEvolver 32.4/51.2 Avg@8/Best@8。18.0/31.4 → 48.7/69.4。51.5/69.8,Self-Navigating为64.7/85.9。Requirement Confirmation提取Concept Pool。Curious Exploration用环境记忆避免重复探索。Task Abstraction生成Goal与Action Guideline,随后由Execution Agent重执行验证。Goal Rewrite改变提示信息和难度,构建训练课程。qwen-plus-latest;Temperature 0.7;Max Tokens 20,480。500条Exploration Rollout、每条最多30 Steps。90个原始任务扩展到625条合成任务。Qwen2.5-14B;RL算法、LR、Batch、Epoch、rollout.n和资源未完整报告。20,480 Tokens是CuES数据生成模型上限,不能写成下游RL Agent的生成上限;候选合成任务只有Reward=1才进入后续阶段,但RL错误轨迹丢弃与Fake Data未报告。11.76 Avg@8 / 14.29 Greedy,CuES 45.54/45.24。63.55/64.10,BFCL-v3为43.00/44.15。Forgetting、Boundary和Rare Action Pattern。Qwen3-Max根据弱点重新探索环境,生成Action–Observation Triplet。Task–Solution Pair,经真实环境验证后加入下一轮GRPO训练集。Qwen2.5-7B、Qwen3-4B、Qwen3-30B-A3B。rollout.n=8;Batch 32;LR 1e-6;Clip (0.2,0.28);KL 0.001。0.2/0.28、KL 1e-3;Entropy Bonus/Reward未报告。rollout.n=8。4,096 Tokens、最多30 Steps;验证阶段会过滤无效合成任务,但RL错误轨迹丢弃与Fake Data处理未报告。16.67,GRPO 28.57,CoEvolve 35.71 TGC。54.76/33.93,Test-C 31.65/16.55。28.57、Random Exploration 30.36提升到Feedback-driven 35.71。27.38,说明环境验证是关键质量门。三级Skill:Planning、Functional、Atomic。Rollout–Extract–Merge/Filter–Add/Modify/Keep迭代精炼。Experience-guided Exploration。Pseudo-plan,再按Step检索Functional/Atomic Skill。GLM-4.6;每个AppWorld训练任务4条Trajectory,另做1次Exploration。Qwen3-32B、Kimi-K2、GLM-4.6;AppWorld 90 Train、168 Test-N。rollout.n。27.68/47.62 → SkillX 35.12/58.93 Avg@4/Pass@4。46.88/70.24 → 56.40/81.55。60.27/83.33 → 64.88/88.69。随机Mask Skill,估计Skill×Task Difference-in-means Matrix。Heterogeneity做Split、根据全局低贡献做Retire、根据Embedding做Merge。每个Skill的因果效应并Mask有害Skill。90 Train、15 Dev、Test-N 168、Test-C 417。12×15=180条归因Rollout;Keep Probability 0.4。69.1/47.0,ACE 78.0/63.1,ASSAY 83.3/69.3 TGC。61.9/52.5,ASSAY 77.4/66.4。成功Trajectory Pool。Task级检索1–2条完整轨迹;Subtask级使用Planner-and-Executor;Step级检索Thought Snippet。推理期ICL与Retriever。GPT-4o-2024-08-06;迁移实验使用GPT-4o-mini。141条ReAct成功轨迹、134条PnE轨迹和833个Subtask。rollout.n与RL Reward不适用。35.1/15.2,固定1条轨迹50.6/30.4,Set-BSR选2条为65.8/53.6。38.7/24.8。21.9降到11.5;已有完整轨迹后再加Step Snippet几乎无增益。Generator执行任务,Reflector根据轨迹和反馈诊断,Curator输出Add/Update/Delete Delta。Itemized Playbook。Offline多Epoch和Online Test-time Adaptation。DeepSeek-V3.1-671B Non-thinking同时作为Generator/Reflector/Curator。63.7/42.9、41.5/21.6 TGC/SGC。76.2/64.3、C 57.3/39.6。69.6/53.6、C 66.0/48.9。Keypoint-level经验。Usage-scenario Embedding检索,并进行Rerank和Task-adaptive Rewrite。选择性添加 + 失败反思 + Utility-based删除。Qwen3-Instruct 8B/14B/32B;Summarizer与Executor使用相同LLM。14.97/32.85 → 24.70/42.06 Avg@4/Pass@4。22.57/41.07 → 34.32/52.98。27.23/50.59 → 42.02/63.49。Plan、Environment Fact和Pitfall。Recurrence Gate触发Code化。Dependency Closure + Sandbox Compile和一次修复后入库。Memory Manager联合检索Text与Tool。GPT-4o ReAct Executor + Claude Sonnet 4.6 Reflector;Embedding为text-embedding-3-large。51.8/112.6K/14.55,METIS为60.1/97.4K/11.25。54.8,METIS 66.1 TGC。4,096 Tokens时压缩历史,Observation超过1,024 Tokens时单独压缩。无压缩成功、压缩失败的对比轨迹产生反馈。Utility Optimization + Compression Optimization更新Guideline,再蒸馏到Qwen3/Phi-4 Compressor。GPT-4.1,Optimizer为o3;AppWorld 90 Train、168 Test-N。1e-4、3 Epoch、1×A100-80G。56.0、Peak 9.93K。56.5、Peak 7.33K;Observation ACON为53.6/7.43K。k个Plan Step为条件的压缩策略,保留后续Workflow真正需要的信息。PAACE-Syn生成5–30 Step的合成Workflow与噪声Context。GPT-OSS-120B根据完整Context和Next-k Plan生成压缩文本。重执行 + Embedding相似度 + LLM Judge过滤,再蒸馏到Qwen3-4B。Compressor + Future Plan。GPT-OSS-120B,Student Qwen3-4B-Instruct。120万Synthetic Workflow、压缩前约95亿Tokens。56.0、Peak 9.93K;PAACE:59.0/6.23K。k=1/2/3的Acc为56.5/59.0/58.6。Llama-3.3-70B生成单Agent轨迹,Claude-3.7-Sonnet改写并验证为三Agent轨迹。ProST在5个Epoch中逐步加入Task-specific Subtask,并Mask错误Step。Orchestrator–Executor–Critic三角色系统。147 Tasks,得到2,844条单Agent和2,708条多Agent轨迹。Qwen2.5-Coder 7B/14B/32B、Llama-3.1-8B、Phi-4-14B。2e-4、5 Epoch、Max Sequence 20,480;4×H100。rollout.n与Reward不适用。42.3/26.8,Phi-4 46.4/28.6,Llama8B 32.7/19.6。14.1/5.8,Phi-4 17.8/8.6。Task Analyzer / Decomposer / Plan Controller维护Durable Ledger。API / Web / CLI / Domain Agent。API Shortlister、Code Planner、Sandbox、Schema Validation、Reflective Retry和Provenance Log。GPT-4.1;无SFT/RL。73.2/62.5 TGC/SGC,Test-C 57.6/48.2。91.2/77.1/54.0;Test-C为91.7/58.7/44.1。共享Step、Policy Signature和Parameter Binding。参数化Policy,并在全部Task Instance上执行、验证和Debug。自动分解、泛化、去重并写入Repository。30 Train Scenarios、90 Tasks;Claude两轮构建出101→159个Component。Claude Sonnet 4.6与GPT-OSS-120B。rollout.n;测试时持续使用Verifier与Repository。98.2/98.2,Test-C 98.3/97.8。96.4/96.4、C 83.2/82.0。62.5/62.5、C 41.0/41.0;无复用时接近0。| 能力来源 | 代表工作 | 优点 | 主要代价 |
|---|---|---|---|
| Policy Update | LOOP、SALT、GVPO、本文 | 推理简单,能直接测量参数能力 | 环境Rollout贵,长轨迹训练不稳定 |
| 训练期经验与Skill增强RL | SIRI、Skill-SD、SAGE、AgentEvolver | 可利用Skill或经验增强Policy训练 | 训练链路复杂;SAGE推理期仍依赖外部Skill Library |
| Task Distribution | CuES、CoEvolve | 缓解任务不足与覆盖问题 | 数据质量控制和外部探索成本高 |
| External Skill/Memory | SkillX、ASSAY、ICL、ACE、ReMe、METIS | 更新快、可持续积累 | 检索错误、Context成本、系统状态复杂 |
| Context Compressor | ACON、PAACE | 降低Token与Context Rot | 额外模型调用和Latency |
| Agent Architecture | ProST、CUGA、HCL-GP | 规划、验证和复用能力强 | 难隔离Policy能力,协议与成本不统一 |
核心研究问题
经验生成、结果验证、长轨迹更新被联合设计后,仅依靠环境交互RL,单Policy Agent能提升到什么程度?三阶段闭环
Current-policy Experience Generation:混合全部L1/L2/L3任务,同任务32条Thinking Rollout;环境每轮最多返回4K Tokens,LLM单次生成不设独立上限。Exact Outcome Verification:全部Required Tests通过才给1,否则为0;没有Intermediate Reward,也没有Intermediate Advantage。Fresh and Conservative Update:错误轨迹隔离并做Fake Data处理;使用Env Loss Mask,仅对Policy Token采用DAPO Token-Level Loss(Token-mean),一次Fresh Update,配合对称Clip与KL Anchor,且不加Entropy Reward。最直接相关工作
| 项目 | 本文设置/结果 | 写作边界 |
|---|---|---|
| Backbone | Qwen3-14B,无AppWorld Domain SFT | 不写成新模型或新Optimizer |
| 训练数据 | 全部90 Tasks;L1/L2/L3=36/36/18 | w/o L3同时改变任务数与计算量,不能只归因为难度 |
| Loss / Mask | DAPO Token-Level Loss(Token-mean);Env Loss Mask;仅Policy Token | 是行业常规实现,不单独包装成算法创新 |
| Clip / KL / Entropy | GRPO Clip-Low/High=0.2/0.2;KL Loss=1e-4;No Entropy Reward | KL用于后期训练稳定;不写成新正则项 |
| Reward / Advantage | All-or-Nothing Terminal Reward;全部正确为1,否则为0;无Intermediate Reward/Advantage | 是整体流程组件,不是唯一创新;与LOOP Pass Fraction区分 |
| Policy Freshness | Strict On-policy;ppo_epochs=1;每批Fresh Rollout只更新一次 | 不写成提出On-policy RL,强调避免长轨迹Staleness |
| Rollout / Mode | n=32;Thinking Mode;50 Turns | 没有Matched n Sweep,不能宣称32最优 |
| Generation / Environment | Environment单次返回上限4K Tokens;LLM单次生成不设独立上限;总Response Cap 32K | “单次不设限”不等于无限总预算,必须同时写清总Cap |
| Invalid Trajectory | 丢弃错误轨迹,并做Fake Data处理 | 需要在Methods中定义错误判定与Fake Data用途,避免被理解为Reward Filtering |
| Optimizer | GRPO;LR 3e-6 | 不称为新GRPO,强调训练配置协同 |
| Matched mean@4 | Base→RL:Dev 32.02→87.72;Test-N 32.44→83.18;Test-C 19.66→66.13 | 不能与Official mean@1混用 |
| 历史官方结果 | Test-N 86.9/80.4;Test-C 67.6/50.4 | 写2026年2月历史强结果,不写Current SOTA |
| SWE补充 | Qwen3.5-9B,31.3→47.9 mean@4 | 只作为初步迁移证据 |
Env Loss Mask或DAPO Token-Level Loss(Token-mean)单独写成创新;它们是与行业常见AgentRL一致的训练规则。32K总Response Cap与50轮交互预算。KL Loss应写成后期稳定器,不写成主要方法贡献;No-KL消融用于支持稳定性作用。rollout.n=32已经被证明最优。without auxiliary learned or retrieval-based inference modules beyond the standard environment interface。