Skip to content

AppWorld 相关论文总结

📅 发表于 2026/07/13
🔄 更新于 2026/08/05
👁️ — 次访问
📝 12238 字
43 分钟
Appworld-Summary
#AppWorld
#AgentRL
#Process-Reward
#Skill
#Memory
#Context-Engineering
#Agent-Architecture

AppWorld 相关工作分类总结

整理范围:本地 AppWorld相关论文 目录中的 21 篇论文。
时间格式:(YYMM),例如 (2605) 表示 2026 年 5 月。
详细笔记:AgentRLAgent架构上下文与记忆合成数据Skill与经验知识

🌺 总结摘要

核心结论
  • 这份笔记按照能力提升发生的位置组织相关工作,而不是按模型或论文时间简单罗列。八条细分路线可进一步归纳为Policy-Centric AgentRL、Data-Centric Training、External Knowledge & Context、System-Centric Agent四类主流范式。
  • 与本文最直接相关的是三类Policy训练方法:普通Outcome AgentRLStep Credit与Process Reward训练期经验与Skill增强RL。其中,LOOP只使用Outcome Reward;SALT重新分配Outcome Advantage但不使用Process Reward;GVPO显式引入执行过程信号;SIRI、Skill-SD、SAGE和AgentEvolver则在训练中利用Skill或经验。
  • Skill+RL方法的部署形态并不相同:SIRI和Skill-SD最终删除Skill BankSAGE推理期继续使用外部Skill Library,AgentEvolver完整系统也会检索历史经验。因此,训练方式相似不等于推理成本和模型内化程度相同。
  • 本文定位为Simple and Strong Outcome AgentRL:采用DAPO Token-Level Loss(Token-mean)与Env Loss Mask,混合L1/L2/L3任务进行n=32 Strict On-policy训练,使用Exact Binary Outcome、KL稳定约束、错误轨迹隔离和Fake Data处理,并允许LLM单次生成不设独立上限
  • 横向比较时必须区分Policy参数能力外部系统能力,同时标明Test-N/Test-CTGC/SGCmean@1/mean@k及测试协议。Skill、Memory、Retriever、Planner或多Agent系统带来的增益不能直接归因于Policy训练。

分类介绍

分类的核心依据是主要创新作用于Agent生命周期的哪个位置。为兼顾整体理解和具体检索,本节先将相关工作归纳为四类主流范式,再保留八类细分技术路线。同一工作可能同时包含任务生成、经验检索和Policy优化,但本笔记只保留一个主类别,并在具体条目中注明辅助机制和推理期依赖。

四类主流方法概览

主流范式覆盖的八类细分核心含义主要优点主要缺点代表工作
Policy-Centric AgentRL普通Outcome AgentRL;Step Credit与Process Reward;训练期经验与Skill增强RL通过Outcome、过程信号、Skill或经验直接更新Agent Policy能力进入模型参数;多数方法推理路径简单;适合分析Policy本身的提升环境Rollout昂贵,长轨迹信用分配和训练稳定性困难;Skill增强方法还可能依赖Teacher或外部Skill(2606) GVPO、SIRI;(2604) Skill-SD;(2602) 本文;(2512) SAGE;(2502) LOOP
Data-Centric Training任务合成与数据演化扩展训练任务,或根据当前Policy弱点动态更新任务分布扩大任务覆盖并形成课程;数据生成模块通常不进入推理路径任务生成、重执行和Verifier成本高;容易产生重复、无效或分布偏移的数据(2605) CoEvolve;(2512) CuES
External Knowledge & ContextSkill Library构建与治理;Memory与In-Context Experience;上下文压缩在推理时检索Skill/Memory,或压缩与重组长上下文无需反复更新Agent Policy;知识更新快,能够复用历史经验并缓解Context压力能力依赖外部库、Retriever或Compressor;存在检索错误、信息丢失、Context成本和额外Latency(2606) ASSAY、METIS;(2604) SkillX;(2512) ReMe、PAACE;(2510) ACE、ACON
System-Centric Agent多Agent、企业系统与广义规划通过角色分工、规划、验证、Sandbox和组件复用增强完整Agent系统模块化、可验证、便于错误恢复;适合复杂Workflow与生产约束系统成本和调试复杂度高,错误可能级联;测试协议通常更重,难与单Policy Agent直接比较(2605) HCL-GP;(2510) CUGA;(2509) ProST

八类细分技术路线

技术类型主要解决的问题是否训练Policy推理期额外依赖代表工作
普通Outcome AgentRL如何仅依靠任务结果稳定训练长程Agent通常无(2602) 本文、(2502) LOOP
Step Credit与Process Reward如何给长轨迹中的Action分配更细粒度的训练信号通常无(2606) GVPO、(2510) SALT
训练期经验与Skill增强RL如何在RL或蒸馏中利用Skill、Teacher或历史经验因方法而异(2606) SIRI、(2604) Skill-SD、(2512) SAGE、(2511) AgentEvolver
任务合成与数据演化训练任务从哪里来,以及如何随Policy能力动态更新通常训练下游Policy生成模块通常不保留(2605) CoEvolve、(2512) CuES
Skill Library构建与治理如何构建、检索、筛选和治理可复用SkillSkillKB、Retriever或Causal Mask(2606) ASSAY、(2604) SkillX
Memory与In-Context Experience如何复用成功轨迹、Playbook和Procedural MemoryMemory、Retriever及额外Context(2606) METIS、(2512) ReMe、(2510) ACE、(2506) Agent ICL
上下文压缩如何在长程交互中降低Context长度并保留决策信息不训练Agent Policy独立Compressor或Plan模块(2512) PAACE、(2510) ACON
多Agent、企业系统与广义规划如何通过角色分工、规划、验证和组件复用提升系统能力SFT或不训练多Agent、Repository、Verifier或Sandbox(2605) HCL-GP、(2510) CUGA、(2509) ProST

各类方法的当前缺点

技术类型当前主要缺点具体风险与对比边界
普通Outcome AgentRL延迟Reward难以定位错误Action,长轨迹Rollout与更新成本高Binary Outcome在同组全失败或全成功时缺少有效Advantage;训练稳定性对Loss聚合、Clip、KL、轨迹复用和生成截断较敏感
Step Credit与Process Reward细粒度信号不一定等价于真实因果贡献Trajectory Graph、执行成功率或人工规则都可能引入偏差;Process Signal依赖环境反馈,跨环境迁移和额外计算成本仍未充分验证
训练期经验与Skill增强RL训练链路复杂,容易依赖Teacher、Summarizer或Skill质量可能出现Teacher–Student Off-policy、Train/Test Prompt不一致和错误Skill放大;SAGE推理期仍保留Skill Library,SIRI无AppWorld结果,现有实验口径并不统一
任务合成与数据演化高质量任务生成与验证成本高容易产生重复、不可执行或偏离真实分布的任务;能力上限受外部生成模型和Verifier限制,部分工作对下游RL配置披露不足
Skill Library构建与治理能力主要保存在外部库中,没有证明Policy完成内化错误检索或有害Skill可能降低性能;Skill构建、因果归因和逐任务Mask需要大量额外Rollout,随Skill与Task数量增长时扩展成本高
Memory与In-Context Experience检索噪声、Memory过时与Context膨胀并存成功经验不一定适配新任务,失败经验可能污染决策;效果依赖Retriever、长Context和外部Memory Manager,难与模型参数能力分离
上下文压缩压缩可能永久丢失后续决策所需的信息额外Compressor增加训练成本和推理Latency;压缩目标与最终任务成功率可能不一致,部分结果采用自定义Accuracy,难与官方TGC/SGC直接比较
多Agent、企业系统与广义规划系统成本、Latency和调试复杂度最高子Agent错误会级联传播,增益难归因到单一模块;Test-time Verifier、多任务联合输入或反复Debug形成非标准协议,不能与逐任务单Policy Agent直接比较
跨类别共性瓶颈
  • 能力归因不清晰:Policy、外部知识、强Teacher、Verifier和测试时搜索经常同时变化,最终分数无法回答“模型本身学会了多少”。
  • 评测协议不统一Test-N/Test-CTGC/SGCAvg@k/Pass@k、Dev/Test、自定义Accuracy及交互预算差异较大,单一分数不适合直接排序。
  • 成本披露不足:不少工作没有完整报告训练Rollout、外部模型调用、Skill/Memory构建、测试时重试和总Token成本。
  • 长期泛化仍不充分:现有结果主要集中在固定AppWorld环境,Skill、Memory、Process Signal和合成任务能否迁移到新工具、新App和分布外任务仍缺少统一验证。
分类边界
  • AppWorld是所有工作的Benchmark与评测基础,不计入八条方法路线。
  • 分类以主要训练或推理机制为准。例如SAGE虽在推理期保留Skill Library,但核心贡献是Skill-integrated RL,因此归入训练期Skill增强RL。
  • 上方分类表中的代表工作按照时间从近到远排列;实验口径不同的结果只并列展示,不直接据此判断SOTA。

一、工作概览表

表格阅读口径
  • 不再单列“类别”,而是直接按相同技术路线分表,避免一张大表中不同方法混排。
  • 学习方式不仅回答是否训练,还说明优化的是Agent Policy、Compressor还是外部Skill/Memory。
  • 训练/构建预算区分RL Rollout与外部知识构建预算;两者不能直接比较。
  • 关键结果默认写作Test-N TGC/SGC;Test-C TGC/SGC。Avg@4、Pass@4、Dev Accuracy或自定义Acc会明确标记。
  • 推理期依赖用于区分模型参数能力与Skill、Memory、Planner、Compressor等系统能力。

1.1 基准与评测

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2407) AppWorldGPT-4o等不训练;构建Benchmark250 Scenarios / 750 TasksState-based Unit Tests标准环境 + API DocsGPT-4o ReAct:N 48.8/32.1;C 30.2/13.0

1.2 普通Outcome AgentRL

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2502) LOOPQwen2.5-32BLoRA RL;LOO-PPO72 Tasks;rollout.n=6Unit-test Pass Fraction无额外模块N 71.3/53.6;C 45.7/26.6
(2602) 本文Qwen3-14BFull-parameter GRPO90 Tasks;rollout.n=32Exact Binary Outcome无辅助Learned/Retrieval模块历史官方:N 86.9/80.4;C 67.6/50.4

1.3 Step Credit与Process Reward

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2510) SALTQwen2.5-32BRLOO/GRPO + Trajectory Graph任务范围未报告;n=8Binary Outcome;跨轨迹Step匹配无额外模块N 66.2/47.9;C 36.8/20.9不是Process Reward
(2606) GVPOQwen2.5-32BGRPO + Advantage Shaping72 Tasks;n=8Pass Fraction + Execution Process Signal无额外模块N 72.6/55.4;C 49.4/28.8

1.4 训练期经验与Skill增强RL

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2606) SIRIQwen2.5-7BGiGPO + Skill Internalization无AppWorld;n=8Self-mined Skill Utility + Action Advantage无;最终删除Skill Bank无AppWorld结果;ALFWorld 0.930,WebShop Success 0.813
(2604) Skill-SDQwen3-4BGRPO + Self-Distillation90 Train;n=4Completion Fraction + Skill Teacher无;Skill只在训练期Dev Acc./Comp. 64.9/84.9;无Test-N/C
(2512) SAGE / SkillRLQwen2.5-32BSFT + Skill-integrated RL1,129 SFT样本;72 RL Tasks;n=8Completion + Skill Generation/Reuse BonusSkill Library + RetrieverN 72.0/60.7;C 50.1/32.4
(2511) AgentEvolverQwen2.5-7B/14BSelf-evolving RL主任务规模与n未完整报告Outcome/Judge + Experience + Step Attribution完整系统可检索经验;另有内化消融14B N 48.7 Avg@8 / 69.4 Best@8

1.5 任务合成与数据演化

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2512) CuESQwen2.5-14B合成数据 + 下游SFT/RL90原始→625合成任务环境探索 + 重执行验证无合成模块N TGC 45.24 Greedy;无SGC/Test-C;RL细节不足
(2605) CoEvolveQwen2.5-7B;Qwen3-4B/30B-A3B动态数据 + GRPO100初始任务;n=8;每10 Steps更新Binary Outcome + Forgetting/Boundary/Rare Signal无数据生成模块30B:N 54.76/33.93;C 31.65/16.55

1.6 Skill Library构建与治理

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2604) SkillXGLM-4.6构建;Qwen3-32B/Kimi-K2/GLM执行不训练Policy;构建SkillKB90 Tasks;每Task 4+1条构建/探索轨迹Planning/Functional/Atomic SkillSkillKB + Retriever + Pseudo-planGLM N 64.88 Avg@4 / 88.69 Pass@4
(2606) ASSAYGPT-5.x、DeepSeek-V3.2等不训练;Skill因果治理90 Train + 15 Dev;每模型180条归因RolloutSkill×Task Randomized AttributionSkill Library + Per-task Causal MaskingDeepSeek N/C TGC 83.3/69.3;高预算外部治理

1.7 Memory与In-Context Experience

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2506) Agent ICLGPT-4o不训练;Trajectory ICLTrain+Dev 147 Tasks;141条成功ReAct轨迹完整成功TrajectoryTrajectory Pool + Retriever + 大ContextN 65.8/53.6;C 38.7/24.8
(2510) ACEDeepSeek-V3.1-671B不训练;增量Playbook优化90 Train + 57 Dev;最多5 EpochTrajectory/Test FeedbackGenerator + Reflector + Curator + PlaybookOffline N 76.2/64.3;C 57.3/39.6
(2512) ReMeQwen3-8B/14B/32B不训练;Procedural Memory90 Tasks;每Task 8条构建轨迹成功/失败/对比经验Vector DB + Rerank + Rewrite + Reflection32B N 42.02 Avg@4 / 63.49 Pass@4
(2606) METISGPT-4o Executor + Claude Reflector不训练;Text/Code Memory90 Tasks顺序构建一次Plan/Fact/Pitfall + Recurrence-gated ToolMemory Manager + Retriever + SandboxOfficial N TGC 60.1;无Test-C

1.8 上下文压缩

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2510) ACONGPT-4.1 Agent;Qwen3-8B/14B等Compressor仅优化/蒸馏Compressor90 Tasks;每Task压缩/不压缩各1条执行反馈驱动Compression Guideline独立CompressorN TGC 56.5、Peak 7.33K;可能增加Latency
(2512) PAACEGPT-OSS-120B Teacher + Qwen3-4B仅训练Compressor约120万Synthetic WorkflowsNext-k Plan + Outcome-preserving SupervisionPlan + Qwen3-4B Compressor自定义Acc 59.0、Peak 6.23K;不是官方TGC/SGC

1.9 多Agent、企业系统与广义规划

时间 / 工作Backbone学习方式训练/构建预算Reward / 知识来源推理期依赖关键结果与口径
(2509) ProSTQwen2.5-Coder 7B/14B/32B等多Agent SFTTrain+Dev 147 Tasks;2,708条多Agent轨迹验证后的多角色TrajectoryOrchestrator + Executor + CriticPhi-4:N 46.4/28.6;C 17.8/8.6
(2510) CUGAGPT-4.1不训练;系统编排无AppWorld训练Planner/Ledger + Tool Feedback多子Agent + Retriever + Sandbox + RetryN 73.2/62.5;C 57.6/48.2
(2605) HCL-GPClaude Sonnet 4.6;GPT-OSS-120B不训练;Policy/Component Synthesis90 Tasks→159 Seed ComponentsScenario多任务结构 + Component ReuseRepository + 多Agent + Test-time Verifier/DebugClaude N 98.2/98.2;C 98.3/97.8;非标准逐Task协议

1.10 RL训练配置专项对比

阅读口径
  • 该表只比较涉及Policy RL的工作;未明确报告表示论文正文与附录均未给出,不能按常见实现补齐。
  • Loss / Mask区分Loss聚合粒度、Policy Token与Environment Observation是否参与梯度;KL区分Policy–Reference约束和Teacher–Student蒸馏。
  • 单次生成指每个Agent Turn或论文定义的Response上限;它不同于总Context、总Response Budget和最大交互轮数。
工作Loss / MaskClip / KL / EntropyReward / AdvantagePolicy、数据与Rollout生成预算与异常轨迹
(2602) 本文DAPO Token-Level Loss(Token-mean);Env Loss Mask,仅Policy TokenClip 0.2/0.2;KL 1e-4;No Entropy RewardExact Binary 1/0;无中间Reward与中间AdvantageStrict On-policy;L1/L2/L3混合;n=32;ThinkingEnv返回4K/turn;LLM单次生成无独立上限;总Response Cap 32K;错误轨迹丢弃 + Fake Data
(2502) LOOPPer-token PPO Ratio;每轨迹仅对Agent Token取均值Clip值未报告;无Reference KL;Entropy未报告Unit-test Pass Fraction;Trajectory LOO AdvantageRollout Reuse,非Strict On-policy;仅L1/L2;n=6;ReAct CoT1.5K/turn;Env返回3K截断;低Advantage轨迹过滤,超时记失败
(2606) GVPOSequence-mean-token-mean;Observation Token置零Clip 0.2/0.28;KL 0;Entropy 0Pass Fraction + Execution Failure ShapingCurrent-policy Group Rollout;仅L1/L2;n=8;ReAct CoT512/turn;Env返回3K截断;超预算记失败,不丢弃错误Step
(2510) SALTAction-step Advantage;Policy Loss粒度与Env Mask未报告Clip 0.2;KL 0;Entropy未报告Binary Outcome经Trajectory Graph重分配;无Process RewardGRPO/RLOO Group Rollout;任务难度未报告;n=8;Thinking未报告1.5K/turn;40 Turns;异常轨迹处理未报告
(2606) SIRI只蒸馏正Utility、正Advantage Action Token;GiGPO聚合未报告对称Clip但值未报告;含KL但系数未报告;Entropy未报告Benchmark Return + Episode/Step Advantage + Skill UtilityCurrent-policy Paired Rollout;无AppWorld;n=8;显式Think/Action格式512 Response;只内化筛选后的正向轨迹,Fake Data未报告
(2604) Skill-SDDAPO Token-Level Loss(Token-mean);Valid Action TokenClip 0.2/0.28;无Policy–Reference KL;SDL Reverse-KL λ=0.001;Entropy 0Completion Fraction + Token-level DistillationStudent-owned On-policy;全部90 Tasks;n=4;ReActMax Response 20,480;40 Turns;未报告错误轨迹丢弃或Fake Data
(2512) SAGE / SkillRLToken-level Ratio;仅LLM Generation,Environment MaskClip值未报告;KL 0;Entropy未报告Completion Fraction + Skill Bonus + No-code PenaltyStrict On-policy、无PPO Epoch;仅L1/L2;n=8;ReAct1.5K/turn;Env返回12K字符截断;超Context停止,RL错误轨迹/Fake Data未报告
(2511) AgentEvolverStep Advantage广播到Token;Loss reduction与Env Mask未报告Clip 0.28/0.28,正样本High扩至0.6;KL 0.001;Entropy未报告Continuous Outcome/Judge + GOOD/BAD AttributionVanilla与Experience-guided各50%;40 Epochs/update;存在Prompt Stripping Off-policy Mismatch;n未报告30 Steps;单次Token上限未报告;合成任务会过滤,RL错误轨迹/Fake Data未报告
(2605) CoEvolveObjective按Trajectory Position求和并以总长度归一;Env Mask未报告Clip 0.2/0.28;KL 1e-3;Entropy未报告Binary Success 1/0;无Process AdvantageCurrent-policy GRPO + 动态任务集;100条初始合成任务;n=8;Thinking未报告Max Response 4,096;30 Steps;无效合成任务过滤,RL错误轨迹/Fake Data未报告
(2512) CuES下游Policy Loss与Env Mask均未报告Clip、KL、Entropy均未报告下游RL Reward/Advantage未报告AppWorld 90→625合成任务;算法、On-policy状态、n与难度混合均未报告20,480仅为数据生成上限;无效合成任务过滤,RL轨迹处理未报告

二、基准与评测基础

(2407) AppWorld

问题背景 & Motivation
  • 既有Tool-use Benchmark通常工具少、调用链短,环境状态也难以稳定复现。
  • 参考轨迹或文本匹配无法覆盖多种正确解法,也难检测Agent造成的额外副作用。
  • Motivation:构建一个可重置、Stateful、跨App并能直接验证最终状态的长程Agent环境。
核心方法
  • 模拟Gmail、Amazon、Spotify、Venmo等9个App,共457个API
  • 每个Scenario实例化3个Contrastive Task
  • 使用State-based Unit Tests检查任务目标、最终答案和Collateral Damage。
  • 定义TGC与更严格的SGC
实验设置
  • 数据规模250 Scenarios、750 Tasks;Train 105、Dev 60、Test-N 168、Test-C 417。
  • Test-N/Test-C平均涉及1.5/2.0个App、8.2/10.5个Unique API。
  • 基线包含ReAct、Plan-and-Execute、Full Code+Reflexion、CodeAct等;模型包含GPT-4o、GPT-4 Turbo、Llama-3等。
  • 该论文不训练权重,rollout.n与RL Reward不适用。
关键结果
  • GPT-4o + ReAct:Test-N 48.8/32.1 TGC/SGC,Test-C 30.2/13.0
  • GPT-4o的TGC从Level-1 58.3降至Level-3 21.0
  • Oracle API Retrieval仅把Test-N/Test-C TGC提高到54.8/35.2,说明瓶颈不只是API检索。

三、普通Outcome AgentRL

(2502) LOOP: Reinforcement Learning for Long-Horizon Interactive LLM Agents

问题背景 & Motivation
  • AppWorld需要数十轮Stateful Python交互,Instruction Model没有针对环境目标进行训练。
  • 标准PPO需要Policy、Reference、Critic等多份大模型,32B训练成本高。
  • Motivation:只用任务完成Reward训练单Policy,并研究长轨迹中哪种更新粒度最稳定。
核心方法
  • Leave-One-Out Advantage + PPO Clip + Rollout Reuse
  • 比较Per-trajectory / Per-turn / Per-token Importance Ratio
  • 只对Agent生成Token计算Loss;推理时没有Planner、Memory或Skill Library。
实验设置
  • 模型Qwen2.5-32B-Instruct;LoRA Rank 16、Alpha 32。
  • 训练数据:L1/L2共24 Scenarios、72 Tasks;每轮抽40 Tasks。
  • Unit-test Pass Fraction Reward,R[0,1]rollout.n=6
  • 训练最多40轮,评测最多50轮;LR 5e-5;16×H100;最佳Run约42小时。
  • Loss / Mask:使用Per-token Importance Ratio,每条轨迹只对Agent生成Token求平均;这不同于DAPO跨Batch直接Token-mean。
  • Regularization:论文没有给出Clip数值;LOOP本身不维护Reference KL,Entropy Bonus/Reward未报告。
  • Policy / Data:同批轨迹会被多次更新复用,因此不是Strict On-policy;只训练L1/L2,论文明确报告加入L3反而下降。
  • Generation / Invalid:每轮LLM最多1,500 Tokens,API Response超过3K Tokens截断;低Advantage轨迹会过滤,超交互预算记失败,Fake Data处理未报告。
关键结果
  • LOOP-token:Test-N 71.3/53.6,Test-C 45.7/26.6
  • LOOP-bandit/turn/token的Test-N TGC为53.3/64.1/71.3
  • 加入Reward Std Normalization后,Test-N TGC从71.3降至61.9
  • 行为上更常查询API Docs,减少Open-loop代码和无依据假设。

四、过程反馈与细粒度信用分配

(2510) SALT: Step-level Advantage Assignment via Trajectory Graph

问题背景 & Motivation
  • GRPO/RLOO把同一个终局Advantage广播给整条轨迹,无法区分有益、无关和错误步骤。
  • 同一合理动作可能在成功轨迹中被奖励、在失败轨迹中被惩罚,形成Credit Conflict。
  • Motivation:不引入Process Reward Model或Step Label,仅利用同任务多轨迹结构获得Step-level Advantage。
核心方法
  • 在同一Rollout Group内构建Trajectory Graph
  • BGE-M3匹配语义相似的State/Action Edge,并对其原Trajectory Advantage求平均。
  • 独特Step保留原Advantage;构图模块只用于训练。
实验设置
  • 模型Qwen2.5-32B-Instruct;RLOO/GRPO及其SALT版本。
  • RewardStrict Binary Terminal Rewardrollout.n=8;Minibatch 32。
  • 最大40轮;LR 1e-6;KL 0;100 Steps;Clip 0.2。
  • AppWorld训练任务数量、难度组成、GPU和总耗时未完整报告。
  • Loss / Mask:SALT在Action Step层重分配Advantage,但论文没有明确Policy Loss使用Token-mean还是Sequence-mean,也没有明确Environment Token Mask。
  • Regularization:对称Clip 0.2/0.2KL=0;Entropy Bonus/Reward未报告。
  • Policy / Data:按GRPO/RLOO Group Rollout训练,rollout.n=8;是否Fresh On-policy、是否复用轨迹以及L1/L2/L3组成均未明确报告。
  • Generation / Invalid:每轮最多1,500 Tokens、最多40轮;错误/超时轨迹是否丢弃及Fake Data处理未报告。
关键结果
  • GRPO+SALT:Test-N 66.2/47.9,Test-C 36.8/20.9
  • 普通GRPO:Test-N 61.5/41.4,Test-C 36.3/17.0
  • Test-N D2 TGC从67.5→76.2,D3从35.5→41.6;但Test-C D1出现下降。
  • SALT属于Outcome-only Step Credit,不能写成Process Reward方法。

(2606) GVPO: Group Verification-based Policy Optimization

问题背景 & Motivation
  • Outcome Advantage会奖励成功轨迹里的错误Step,也会惩罚失败轨迹里的合理Step。
  • Syntax Error、Runtime Exception等确定性环境反馈没有被标准GRPO利用。
  • Motivation:把最终Outcome Verifier与中间Execution Verifier统一进Advantage Shaping。
核心方法
  • Unit-test Pass Fraction提供Trajectory Outcome。
  • 按代码是否成功执行划分Success/Failure Step,对失败Step做条件性负向Shaping。
  • Observation Token Advantage=0;使用Asymmetric ClipSequence-Mean-Token-Mean
  • 不使用KL与Reward Std Normalization
实验设置
  • 模型与数据Qwen2.5-32B;L1/L2共24 Scenarios、72 Tasks;每轮抽32 Tasks。
  • rollout.n=8;训练144 Steps;LR 1e-5;Clip (0.2,0.28);Process Penalty b=0.2
  • 训练/评测最多40/50轮;8×H100;veRL + FSDP2 + vLLM。
  • 推理仍是标准单Policy ReAct,不需要Process Reward模块。
  • Loss / Mask:采用Sequence-Mean-Token-Mean;只更新Reasoning/Code Generation Token,Observation Token Advantage置0。
  • Regularization:Asymmetric Clip 0.2/0.28,明确不使用KL;Entropy Coefficient为0.0
  • Policy / Data:Current Behavior Policy产生Group Rollout,未报告PPO式轨迹复用;只训练L1/L2,rollout.n=8,使用ReAct CoT。
  • Generation / Invalid:每轮最多512 Tokens,API Response超过3K Tokens截断;错误Step不会丢弃,而是获得Process Penalty,超预算Episode记失败。
关键结果
  • Test-N 72.6/55.4,Test-C 49.4/28.8
  • 相比LOOP,Test-N/Test-C TGC提高1.3/3.7
  • 改为Token-mean后Test-C降至34.6/15.1;加回Std Normalization后为42.8/23.7
  • b=0.1的单项Test-C TGC为53.1,高于主配置49.4,因此主配置并非每个Split都最优。

五、训练期经验与Skill增强RL

(2606) SIRI: Self-Internalizing RL with Intrinsic Skills

问题背景 & Motivation
  • 现有Skill Agent常依赖外部模型提炼Skill,并在推理期持续检索Skill Bank。
  • 从弱Policy的偶然轨迹直接总结Skill容易引入噪声。
  • Motivation:让Policy自己挖掘、验证和内化Skill,最终完全删除Skill Bank。
核心方法
  • Phase 0—GiGPO Warmup:先获得可靠成功轨迹。
  • Phase 1—Skill Mining & Validation:从成功Plain Rollout挖掘Skill,通过Skill/No-Skill配对Rollout估计Utility。
  • Phase 2—Skill Internalization:只蒸馏正Utility Trajectory中的正Advantage Action Token。
实验设置
  • 评测范围没有AppWorld实验,只评测ALFWorld与WebShop。
  • 模型Qwen2.5-7B;Batch 16;rollout.n=8;Warmup 30–50 Steps。
  • 每10 Steps做Skill Mining/Validation;8×A100;Qwen3-0.6B-Embedding仅训练期使用。
  • Optimizer、LR、Clip、KL和精确Reward未完整报告。
  • Loss / Mask:GiGPO使用Episode/Step Advantage;内化阶段只蒸馏正Utility + 正Advantage的Action Token,并排除Reasoning与其他Natural-language Token;基础RL Loss聚合未报告。
  • Regularization:论文写明使用对称Clip和KL,但没有报告Clip数值与KL系数;Entropy Bonus/Reward未报告。
  • Policy / Data:Current Policy做Skill/No-Skill Paired Rollout,rollout.n=8;没有AppWorld数据,因而不存在AppWorld三难度混合设置;Prompt显式要求<think>/<action>格式。
  • Generation / Invalid:Max Response Length为512 Tokens;只内化通过Utility Gate的正向轨迹,但没有报告Fake Data机制。
关键结果
  • ALFWorld Success:GiGPO 0.908,SkillRL 0.899,SIRI 0.930
  • WebShop Score/Success:GiGPO 0.844/0.728,SIRI 0.899/0.813
  • 不内化但保留Skill推理为0.898/0.805;完整SIRI无Skill推理为0.899/0.813
  • 该论文只能作为训练期Skill内化的相关证据,不能列入AppWorld数值比较。

(2604) Skill-SD: Skill-Conditioned Self-Distillation

问题背景 & Motivation
  • 长程Agent只有延迟Outcome Reward,直接把Skill注入Student Prompt容易造成Train/Test不一致。
  • 由Teacher生成Rollout又会产生Off-policy偏移并导致训练崩溃。
  • Motivation:Skill只给Teacher看,Student始终Plain-Prompt On-policy Rollout,再把Token偏好蒸馏进参数。
核心方法
  • 从Trajectory总结成功经验、错误和Workflow,按任务维护Skill Buffer并用UCB选择。
  • Teacher每轮同步Student参数,但额外看到Skill Prompt。
  • 对同一批Student Token进行师生重评分,联合GRPO + Importance-weighted Reverse-KL
  • 测试时删除Teacher、Summarizer和Skill Bank
实验设置
  • 模型与数据Qwen3-4B-Instruct-2507;AppWorld全部90 Train、57 Dev;最多40轮。
  • Reward为验证条件完成比例;rollout.n=4;Train Batch 16;Optimization Epoch 1。
  • LR 1e-6;Clip (0.2,0.28);SDL λ=0.001;8×L40S。
  • 只报告Dev Pass@1/Completion,没有Test-N/Test-C。
  • Loss / Mask:GRPO与SDL都使用DAPO式Token-Level Loss(Token-mean),只统计Valid Action Token;Student生成的同一批Token由Teacher重评分。
  • Regularization:Asymmetric Clip 0.2/0.28;没有Policy–Reference KL,但有λ=0.001的Teacher–Student Reverse-KL蒸馏项;Entropy Coefficient为0.0
  • Policy / DataStudent-owned Strict On-policy、每批只更新1 Epoch;混合全部90个L1/L2/L3任务,rollout.n=4,使用ReAct轨迹。
  • Generation / Invalid:Max Response Length为20,480 Tokens、最多40轮;论文没有报告错误轨迹丢弃或Fake Data处理。
关键结果
  • Base 8.8/39.1,Vanilla GRPO 50.9/76.3,Skill-SD 64.9/84.9 Accuracy/Completion
  • 直接将Skill给Student的Skill-Augmented GRPO只有42.1/76.1
  • Off-policy Teacher Rollout在训练中期崩溃,说明Student-owned On-policy Rollout是关键。

(2512) SAGE / SkillRL: RL with Skill Library

问题背景 & Motivation
  • 仅靠Prompt生成和调用Skill不稳定,普通Per-task RL也无法奖励“任务1生成、任务2复用”的跨任务价值。
  • Motivation:让Policy与Executable Skill Library共同演化,并学习何时生成、保存和调用Skill。
核心方法
  • 先用Claude成功轨迹做SFT Warmup
  • RL时将同Scenario两个任务串成Task Chain
  • Skill-integrated Reward同时奖励任务完成、Skill Generation和后续Skill Reuse。
  • 推理期继续维护、检索和执行外部Python Skill
实验设置
  • 模型Qwen2.5-32B-Instruct,全参数SFT+RL;Teacher为Claude-3.5-Sonnet-v2
  • RL使用L1/L2共24 Scenarios;rollout.n=8;每Step 384 Rollout Units。
  • Fresh On-policy;无KL、无Advantage Std;LR 1e-6;4×8 H100。
  • 最多40轮、每轮1,500 Tokens、Context 28,048。
  • Loss / Mask:Policy Objective使用Token-level Ratio,只对LLM Generation计算Loss,Environment Observation显式Mask。
  • Regularization:论文未报告Clip数值;明确KL=0且不做Advantage Std,Entropy Bonus/Reward未报告。
  • Reward / Policy:Reward是Completion Fraction叠加Skill Generation/Reuse Bonus,并对无代码终止施加-1,不是Sparse Binary Outcome-only;训练为Strict On-policy且无PPO Epoch。
  • Generation / Invalid:每轮最多1,500 Tokens,Environment Output超过12,000字符截断;超28,048 Context停止。RL错误轨迹丢弃与Fake Data未报告,只有SFT数据构建明确使用Rejection Sampling。
关键结果
  • SAGE:Test-N 72.0/60.7,Test-C 50.1/32.4
  • 普通GRPO为N 69.2/51.8、C 40.7/26.9;SFT-only为N 55.2/41.7
  • 去掉Skill推理后Test-N为71.4/54.8,说明Policy本身和外部Skill都贡献能力。

(2511) AgentEvolver: Towards Efficient Self-Evolving Agent System

问题背景 & Motivation
  • AgentRL同时面临训练任务稀缺、重复低价值探索和终局Reward难以归因的问题。
  • 新环境可能只有工具,没有预定义任务与Verifier。
  • Motivation:自动化环境→任务→经验→反馈闭环,让Agent自己决定学什么、如何探索和如何归因。
核心方法
  • Self-Questioning:探索环境、合成任务并重执行验证。
  • Self-Navigating:检索历史经验引导一半Rollout,更新前移除经验文本并使用Selective Boosting
  • Self-Attributing:外部LLM为Action标记GOOD/BAD,与Outcome Advantage组合。
实验设置
  • 模型Qwen2.5-7B/14B-Instruct;GRPO-style;LR 1e-6;Batch 32;每次Policy Update 40 Epochs;KL 0.001;8×A100-80G。
  • Self-Navigating Top-K 5;经验轨迹比例0.5;Attribution权重α=0.1, β=1
  • 评测最多30 Steps,报告Test-N TGC Avg@8/Best@8。
  • 训练rollout.n和主实验任务规模没有完整披露。
  • Loss / Mask:Step Advantage会广播到该Step的Token,但论文未报告最终Loss Reduction及Environment Observation Mask。
  • Regularization:Vanilla/经验轨迹使用Clip 0.28/0.28,正Advantage经验轨迹的Clip-High扩至0.6;KL为0.001,Entropy项未报告。
  • Reward / Policy:不是Sparse Binary Outcome-only;它融合Continuous Outcome/Judge与GOOD/BAD Step Attribution。Vanilla与经验引导轨迹各50%,去掉经验Prompt后形成显式Off-policy Mismatch。
  • Generation / Invalid:最多30 Steps,但单次生成Token上限未报告;合成任务有质量过滤,RL错误轨迹是否丢弃及Fake Data处理未报告。
关键结果
  • 7B:Base 1.8/5.6 → AgentEvolver 32.4/51.2 Avg@8/Best@8
  • 14B:Base 18.0/31.448.7/69.4
  • 14B Dev中Vanilla RL为51.5/69.8,Self-Navigating为64.7/85.9
  • 方法同时使用任务合成、经验检索和外部Step Attribution,不能视为纯Outcome-only RL。

六、任务合成与数据演化

(2512) CuES: Curiosity-driven Environment-grounded Synthesis

问题背景 & Motivation
  • 新环境常只有工具和接口,没有可直接用于RL的训练任务。
  • 从人工Seed或外部语料改写,容易生成不可执行、重复或脱离环境能力的任务。
  • Motivation:完全从环境结构和真实交互中生成可执行、相关且多样的训练任务。
核心方法
  • Requirement Confirmation提取Concept Pool。
  • Curious Exploration用环境记忆避免重复探索。
  • Task Abstraction生成Goal与Action Guideline,随后由Execution Agent重执行验证。
  • Goal Rewrite改变提示信息和难度,构建训练课程。
实验设置
  • 生成模型qwen-plus-latest;Temperature 0.7;Max Tokens 20,480。
  • 探索预算:每环境500条Exploration Rollout、每条最多30 Steps。
  • 数据规模:AppWorld从90个原始任务扩展到625条合成任务
  • 执行模型Qwen2.5-14B;RL算法、LR、Batch、Epoch、rollout.n和资源未完整报告。
  • RL配置披露边界:论文没有明确下游Policy的Loss/Env Mask、Clip、KL、Entropy、Reward/Advantage、On-policy状态、AppWorld难度混合与Thinking模式。
  • Generation / Invalid20,480 Tokens是CuES数据生成模型上限,不能写成下游RL Agent的生成上限;候选合成任务只有Reward=1才进入后续阶段,但RL错误轨迹丢弃与Fake Data未报告。
关键结果
  • AppWorld Test-N:Base 11.76 Avg@8 / 14.29 Greedy,CuES 45.54/45.24
  • WebShop为63.55/64.10,BFCL-v3为43.00/44.15
  • AppWorld只报告Test-N TGC,无SGC与Test-C。

(2605) CoEvolve: Agent–Data Mutual Evolution

问题背景 & Motivation
  • 固定人工或离线合成任务不会随Policy能力变化,容易反复采样已掌握任务并遗漏新弱点。
  • Motivation:从当前Policy Rollout发现遗忘、不稳定边界和低频行为,再定向生成新任务。
核心方法
  • 从Rollout提取ForgettingBoundaryRare Action Pattern
  • Qwen3-Max根据弱点重新探索环境,生成Action–Observation Triplet。
  • 将Triplet抽象为Task–Solution Pair,经真实环境验证后加入下一轮GRPO训练集。
实验设置
  • 模型Qwen2.5-7B、Qwen3-4B、Qwen3-30B-A3B
  • GRPO rollout.n=8;Batch 32;LR 1e-6;Clip (0.2,0.28);KL 0.001。
  • Binary Terminal Reward;初始100条合成任务;训练120 Steps,每10 Steps更新数据。
  • 4B/7B使用8×H20,30B-A3B使用16×H20。
  • Loss / Mask:目标函数对Trajectory Position求和并按总长度归一;论文没有明确它是否等价于DAPO Token-mean,也没有明确Environment Token Mask。
  • Regularization:Asymmetric Clip 0.2/0.28、KL 1e-3;Entropy Bonus/Reward未报告。
  • Policy / Data:Current-policy GRPO与动态任务集共同演化,未报告轨迹复用;初始100条合成任务,AppWorld L1/L2/L3组成与Thinking模式未报告,rollout.n=8
  • Generation / Invalid:Max Response Length为4,096 Tokens、最多30 Steps;验证阶段会过滤无效合成任务,但RL错误轨迹丢弃与Fake Data处理未报告。
关键结果
  • Qwen3-4B Test-N:Zero-shot 16.67,GRPO 28.57,CoEvolve 35.71 TGC
  • Qwen3-30B-A3B:Test-N 54.76/33.93,Test-C 31.65/16.55
  • 4B从Static Data 28.57、Random Exploration 30.36提升到Feedback-driven 35.71
  • 去掉Task Validation降至27.38,说明环境验证是关键质量门。

七、Skill Library构建与治理

(2604) SkillX: Automatically Constructing Skill Knowledge Bases

问题背景 & Motivation
  • Agent在不同任务上重复探索,且只从自身轨迹提取经验会受基座模型能力限制。
  • 原始Trajectory、Workflow和API Tip难以同时满足可迁移、易检索和可执行。
  • Motivation:由强模型预建可跨Agent复用的Plug-and-Play SkillKB。
核心方法
  • 三级Skill:Planning、Functional、Atomic。
  • 通过Rollout–Extract–Merge/Filter–Add/Modify/Keep迭代精炼。
  • 针对高失败率或从未调用的Tool做Experience-guided Exploration
  • 推理时先生成Pseudo-plan,再按Step检索Functional/Atomic Skill。
实验设置
  • 构建模型GLM-4.6;每个AppWorld训练任务4条Trajectory,另做1次Exploration。
  • 执行模型Qwen3-32B、Kimi-K2、GLM-4.6;AppWorld 90 Train、168 Test-N。
  • Qwen3-Embedding-8B;最多3轮Refinement;最终最多注入8个Skill。
  • 不训练Agent权重,无RL rollout.n
关键结果
  • Qwen3-32B:No-memory 27.68/47.62 → SkillX 35.12/58.93 Avg@4/Pass@4
  • Kimi-K2:46.88/70.2456.40/81.55
  • GLM-4.6:60.27/83.3364.88/88.69
  • 不同模型的最佳Skill层级不同,说明Skill不是注入越多越好。

(2606) ASSAY: Not All Skills Help

问题背景 & Motivation
  • LLM生成的Skill看起来合理,不代表它在不同任务上都有正效应。
  • 同一个Skill可能帮助任务A、伤害任务B,Global Average会让正负作用互相抵消。
  • Motivation:用跨任务随机实验测量Skill的条件性因果贡献,并按Task选择Skill。
核心方法
  • 在15个Dev Task上随机Mask Skill,估计Skill×Task Difference-in-means Matrix。
  • 根据Heterogeneity做Split、根据全局低贡献做Retire、根据Embedding做Merge。
  • 测试时检索Top-8相似Dev Task,预测每个Skill的因果效应并Mask有害Skill。
实验设置
  • 数据:AppWorld 90 Train、15 Dev、Test-N 168、Test-C 417
  • 每模型额外12×15=180条归因Rollout;Keep Probability 0.4。
  • ReAct 40 Steps,Temperature 0;覆盖GPT-5.x、DeepSeek-V3.2、Sonnet 4.5、Gemini 2.5 Pro等。
  • 不训练模型权重,但推理依赖完整Skill Library和Causal Masking。
关键结果
  • DeepSeek-V3.2:ReAct N/C 69.1/47.0,ACE 78.0/63.1,ASSAY 83.3/69.3 TGC
  • GPT-5.1:ReAct 61.9/52.5,ASSAY 77.4/66.4
  • GPT-5.1 Test-N顺序消融:ReAct 61.9 → Templates 67.9 → Restructuring 69.9 → Per-task Masking 77.4。
  • 结果属于高预算外部Skill治理,不能等同于单Policy训练提升。

八、Memory与In-Context Experience

(2506) Leveraging In-Context Learning for Language Model Agents

问题背景 & Motivation
  • Agent ICL的瓶颈不只是放几个示例,而是成功轨迹如何获得、选择、裁剪和放置。
  • 完整长轨迹包含大量与当前任务无关的信息,但局部Snippet又可能缺失完整Workflow。
  • Motivation:系统比较Task/Subtask/Step三种经验粒度。
核心方法
  • 迭代标注Train+Dev,建立成功Trajectory Pool
  • Task级检索1–2条完整轨迹;Subtask级使用Planner-and-Executor;Step级检索Thought Snippet。
  • 不更新模型权重,完全依靠推理期ICL与Retriever
实验设置
  • 模型GPT-4o-2024-08-06;迁移实验使用GPT-4o-mini。
  • 经验库:AppWorld Train 90 + Dev 57,得到141条ReAct成功轨迹、134条PnE轨迹和833个Subtask
  • 标注Temperature 0.1、Top-p 0.5、50 Steps;评测使用1M Context。
  • rollout.n与RL Reward不适用。
关键结果
  • GPT-4o ReAct Test-N:Zero-shot 35.1/15.2,固定1条轨迹50.6/30.4,Set-BSR选2条为65.8/53.6
  • Test-C为38.7/24.8
  • 平均步数从21.9降到11.5;已有完整轨迹后再加Step Snippet几乎无增益。
  • 两条完整轨迹相对一条平均成本增加约40%。

(2510) ACE: Agentic Context Engineering

问题背景 & Motivation
  • 现有Prompt/Context Optimization容易产生Brevity Bias,或把知识堆入单一长Context造成结构坍塌。
  • Motivation:像维护软件手册一样,持续增量维护结构化Playbook,而不是更新Policy权重。
核心方法
  • Generator执行任务,Reflector根据轨迹和反馈诊断,Curator输出Add/Update/Delete Delta。
  • 通过确定性Merge/Dedup维护Itemized Playbook
  • 支持Offline多EpochOnline Test-time Adaptation
实验设置
  • 模型DeepSeek-V3.1-671B Non-thinking同时作为Generator/Reflector/Curator。
  • AppWorld 90 Train、57 Dev、Test-N/Test-C;Batch 1;最多5轮Reflection与5个Offline Epoch。
  • GT版使用Unit-test Outcome,No-GT版使用自然执行成败。
  • 不训练模型权重;推理持续注入外部Playbook。
关键结果
  • ReAct Test-N/C为63.7/42.941.5/21.6 TGC/SGC
  • Offline ACE-GT为N 76.2/64.3、C 57.3/39.6
  • Online No-GT为N 69.6/53.6、C 66.0/48.9
  • Online结果包含测试时持续经验更新,不应与Frozen Agent协议直接横比。

(2512) ReMe: Dynamic Procedural Memory

问题背景 & Motivation
  • Append-only Memory会积累过时或有害经验;整轨迹粒度过粗,直接复用又难适应新任务。
  • Motivation:闭环管理经验获取、适配复用和Utility-based删除,让较小模型通过外部记忆补偿能力。
核心方法
  • 从成功、失败和成功–失败对比轨迹提取Keypoint-level经验
  • 使用Usage-scenario Embedding检索,并进行Rerank和Task-adaptive Rewrite。
  • 动态版选择性添加 + 失败反思 + Utility-based删除
实验设置
  • 模型Qwen3-Instruct 8B/14B/32B;Summarizer与Executor使用相同LLM。
  • AppWorld 90 Train构建Memory,168 Test-N;每个训练任务采样8条轨迹。
  • Temperature 0.9;Top-K 5;最多30 Execution Iterations。
  • 8条轨迹是Memory Construction Budget,不是RL Group Size。
关键结果
  • Qwen3-8B:14.97/32.8524.70/42.06 Avg@4/Pass@4
  • Qwen3-14B:22.57/41.0734.32/52.98
  • Qwen3-32B:27.23/50.5942.02/63.49
  • Qwen8B平均Latency从21.42增加到23.96秒/任务。

(2606) METIS: Bridging Text and Code Memory

问题背景 & Motivation
  • Text Memory易构建和迁移,但每次执行都要重新读Context;Code Memory执行快,但构建昂贵、跨任务脆弱。
  • Motivation:先用Text作为低成本暂存层,只将高频稳定Plan选择性“结晶”为Callable Tool。
核心方法
  • Text层保存Plan、Environment Fact和Pitfall
  • Plan被不同Query反复选中后通过Recurrence Gate触发Code化。
  • Codifier只看Plan与Query,经Dependency Closure + Sandbox Compile和一次修复后入库。
  • Memory Manager联合检索Text与Tool。
实验设置
  • 模型GPT-4o ReAct Executor + Claude Sonnet 4.6 Reflector;Embedding为text-embedding-3-large。
  • 90 Train按固定顺序构建Memory,Freeze后评测Test-N。
  • 另做Task-level Resampled Split;明确不评测Test-C。
  • 关键Recurrence Threshold、Top-k和最大Step Budget未报告。
关键结果
  • Official Split:No-memory TGC/Tokens/Turns为51.8/112.6K/14.55,METIS为60.1/97.4K/11.25
  • Resampled:No-memory 54.8,METIS 66.1 TGC
  • Dev消融:Text-only 62.3、Code-only 60.2、Eager 63.2、Full 66.7。
  • Eager Code化成本更高且准确率更低,说明不是Tool越多越好。

九、上下文压缩

(2510) ACON: Optimizing Context Compression

问题背景 & Motivation
  • 长程历史持续增长,带来Token/显存开销和Attention Dilution。
  • 启发式压缩容易误删信息,独立Compressor调用又可能增加Latency。
  • Motivation:冻结Agent,通过执行反馈自动优化Compression Guideline,并蒸馏给小模型。
核心方法
  • History超过4,096 Tokens时压缩历史,Observation超过1,024 Tokens时单独压缩。
  • 无压缩成功、压缩失败的对比轨迹产生反馈。
  • Utility Optimization + Compression Optimization更新Guideline,再蒸馏到Qwen3/Phi-4 Compressor。
实验设置
  • 模型:Agent/Compressor为GPT-4.1,Optimizer为o3;AppWorld 90 Train、168 Test-N。
  • 每个训练任务收集Compressed/Uncompressed两条轨迹;每轮采样5个Candidate Prompt。
  • Student LoRA Rank 16、LR 1e-4、3 Epoch、1×A100-80G。
  • 主Agent Policy不更新,推理保留独立Compressor。
关键结果
  • GPT-4.1 No Compression:TGC 56.0、Peak 9.93K
  • History ACON:TGC 56.5、Peak 7.33K;Observation ACON为53.6/7.43K
  • GPT-4.1 Agent + Qwen14B Compressor降低美元成本,但Latency从73.24秒增至87.68/101.92秒。

(2512) PAACE: Plan-Aware Context Engineering

问题背景 & Motivation
  • 普通摘要、FIFO和Query-aware Compression只看当前问题,没有显式考虑未来Plan的变量与依赖。
  • Motivation:学习一个以未来k个Plan Step为条件的压缩策略,保留后续Workflow真正需要的信息。
核心方法
  • PAACE-Syn生成5–30 Step的合成Workflow与噪声Context。
  • GPT-OSS-120B根据完整Context和Next-k Plan生成压缩文本。
  • 重执行 + Embedding相似度 + LLM Judge过滤,再蒸馏到Qwen3-4B。
  • 推理每一步调用Compressor + Future Plan
实验设置
  • 模型:Teacher GPT-OSS-120B,Student Qwen3-4B-Instruct
  • 数据规模:约120万Synthetic Workflow、压缩前约95亿Tokens
  • 使用Causal LM Loss做监督蒸馏,不是PPO/GRPO。
  • AppWorld Agent Backbone、任务数、Split和运行次数未完整报告。
关键结果
  • 论文使用自定义Easy/Medium/Hard平均Acc,不是官方TGC/SGC。
  • No Compression:Acc 56.0、Peak 9.93K;PAACE:59.0/6.23K
  • k=1/2/3的Acc为56.5/59.0/58.6
  • 论文报告Student保留Teacher约97–98%性能。

十、多Agent、企业系统与广义规划

(2509) ProST: Progressive Sub-task Training for Multi-Agent Systems

问题背景 & Motivation
  • 小模型用普通SFT难以一次掌握长轨迹的规划、执行和检查能力。
  • 多Agent可以分工,但增加推理成本,需要在效果与FLOPs之间权衡。
  • Motivation:用课程式SFT逐步训练Orchestrator、Executor和Critic。
核心方法
  • Llama-3.3-70B生成单Agent轨迹,Claude-3.7-Sonnet改写并验证为三Agent轨迹。
  • ProST在5个Epoch中逐步加入Task-specific Subtask,并Mask错误Step。
  • 推理保留Orchestrator–Executor–Critic三角色系统。
实验设置
  • 数据规模:使用AppWorld Train+Dev 147 Tasks,得到2,844条单Agent和2,708条多Agent轨迹
  • 模型Qwen2.5-Coder 7B/14B/32B、Llama-3.1-8B、Phi-4-14B
  • LoRA Rank 16、LR 2e-4、5 Epoch、Max Sequence 20,480;4×H100。
  • 方法是SFT而非RL,rollout.n与Reward不适用。
关键结果
  • Test-N:Qwen14B 42.3/26.8,Phi-4 46.4/28.6,Llama8B 32.7/19.6
  • Test-C:Qwen14B 14.1/5.8,Phi-4 17.8/8.6
  • 结果来自训练后的多Agent系统,不能等同于单Policy模型能力。

(2510) CUGA: IBM Generalist Agent

问题背景 & Motivation
  • 企业Agent不仅要求Benchmark Success,还要求跨API/Web/CLI、可审计、可治理和故障恢复。
  • 单一ReAct难以同时满足这些生产约束。
  • Motivation:构建能从研究Benchmark延展到企业部署的Generalist Agent System。
核心方法
  • 外层Task Analyzer / Decomposer / Plan Controller维护Durable Ledger。
  • 内层包含API / Web / CLI / Domain Agent
  • 额外使用API Shortlister、Code Planner、Sandbox、Schema Validation、Reflective Retry和Provenance Log
实验设置
  • 模型:AppWorld Backbone为GPT-4.1;无SFT/RL。
  • 未报告统一Max Turns/Tokens;实际平均交互数Test-N 10.69、Test-C 8.40。
  • 多Agent、检索、Sandbox和验证全部保留在推理路径。
关键结果
  • Test-N 73.2/62.5 TGC/SGC,Test-C 57.6/48.2
  • Test-N L1/L2/L3 TGC为91.2/77.1/54.0;Test-C为91.7/58.7/44.1
  • 高分同时来自模型与厚系统架构,不能作为纯Policy训练基线。

(2605) HCL-GP: Hierarchical Generalized Planning

问题背景 & Motivation
  • Interactive Coding Agent逐Task重复发现相似Workflow,无法利用同Scenario任务共享结构。
  • Motivation:将Generalized Planning与HTN式分解实现为参数化Python Policy和可复用Component。
核心方法
  • 同时读取一个Scenario的多个Task,抽象共享Step、Policy Signature和Parameter Binding
  • 检索历史Component,生成参数化Policy,并在全部Task Instance上执行、验证和Debug。
  • 成功Policy再自动分解、泛化、去重并写入Repository。
实验设置
  • 构建数据30 Train Scenarios、90 Tasks;Claude两轮构建出101→159个Component
  • 测试模型Claude Sonnet 4.6GPT-OSS-120B
  • Top-20 Component + Top-20 API;Clustering Threshold 0.85;每轮最多3次Debug。
  • 无权重训练,无RL rollout.n;测试时持续使用Verifier与Repository。
关键结果
  • Claude HCL-GP:Test-N 98.2/98.2,Test-C 98.3/97.8
  • 无复用Claude GP为N 96.4/96.4、C 83.2/82.0
  • GPT-OSS HCL-GP为N 62.5/62.5、C 41.0/41.0;无复用时接近0。
  • 方法一次读取Scenario多个测试任务并多轮Debug,98%不能与标准逐Task AgentRL直接比较。

十一、横向比较与本文定位

11.1 能力到底来自哪里

能力来源代表工作优点主要代价
Policy UpdateLOOP、SALT、GVPO、本文推理简单,能直接测量参数能力环境Rollout贵,长轨迹训练不稳定
训练期经验与Skill增强RLSIRI、Skill-SD、SAGE、AgentEvolver可利用Skill或经验增强Policy训练训练链路复杂;SAGE推理期仍依赖外部Skill Library
Task DistributionCuES、CoEvolve缓解任务不足与覆盖问题数据质量控制和外部探索成本高
External Skill/MemorySkillX、ASSAY、ICL、ACE、ReMe、METIS更新快、可持续积累检索错误、Context成本、系统状态复杂
Context CompressorACON、PAACE降低Token与Context Rot额外模型调用和Latency
Agent ArchitectureProST、CUGA、HCL-GP规划、验证和复用能力强难隔离Policy能力,协议与成本不统一

11.2 本文建议定位

A Simple and Strong AgentRL Training Stack

核心研究问题

  • 经验生成、结果验证、长轨迹更新被联合设计后,仅依靠环境交互RL,单Policy Agent能提升到什么程度?

三阶段闭环

  1. Current-policy Experience Generation:混合全部L1/L2/L3任务,同任务32条Thinking Rollout;环境每轮最多返回4K Tokens,LLM单次生成不设独立上限。
  2. Exact Outcome Verification:全部Required Tests通过才给1,否则为0;没有Intermediate Reward,也没有Intermediate Advantage。
  3. Fresh and Conservative Update:错误轨迹隔离并做Fake Data处理;使用Env Loss Mask,仅对Policy Token采用DAPO Token-Level Loss(Token-mean),一次Fresh Update,配合对称Clip与KL Anchor,且不加Entropy Reward。

最直接相关工作

  • 普通Outcome AgentRL:LOOP。
  • Step Credit与Process Feedback:SALT、GVPO。
  • Skill/经验增强RL:SIRI、Skill-SD、SAGE、AgentEvolver。

11.3 本文实验事实核对卡

项目本文设置/结果写作边界
BackboneQwen3-14B,无AppWorld Domain SFT不写成新模型或新Optimizer
训练数据全部90 Tasks;L1/L2/L3=36/36/18w/o L3同时改变任务数与计算量,不能只归因为难度
Loss / MaskDAPO Token-Level Loss(Token-mean);Env Loss Mask;仅Policy Token是行业常规实现,不单独包装成算法创新
Clip / KL / EntropyGRPO Clip-Low/High=0.2/0.2;KL Loss=1e-4;No Entropy RewardKL用于后期训练稳定;不写成新正则项
Reward / AdvantageAll-or-Nothing Terminal Reward;全部正确为1,否则为0;无Intermediate Reward/Advantage是整体流程组件,不是唯一创新;与LOOP Pass Fraction区分
Policy FreshnessStrict On-policy;ppo_epochs=1;每批Fresh Rollout只更新一次不写成提出On-policy RL,强调避免长轨迹Staleness
Rollout / Moden=32;Thinking Mode;50 Turns没有Matched n Sweep,不能宣称32最优
Generation / EnvironmentEnvironment单次返回上限4K Tokens;LLM单次生成不设独立上限;总Response Cap 32K“单次不设限”不等于无限总预算,必须同时写清总Cap
Invalid Trajectory丢弃错误轨迹,并做Fake Data处理需要在Methods中定义错误判定与Fake Data用途,避免被理解为Reward Filtering
OptimizerGRPO;LR 3e-6不称为新GRPO,强调训练配置协同
Matched mean@4Base→RL:Dev 32.02→87.72;Test-N 32.44→83.18;Test-C 19.66→66.13不能与Official mean@1混用
历史官方结果Test-N 86.9/80.4;Test-C 67.6/50.42026年2月历史强结果,不写Current SOTA
SWE补充Qwen3.5-9B31.3→47.9 mean@4只作为初步迁移证据

11.4 不应使用的包装

Claim边界
  • 不写“现有工作都依赖臃肿Scaffold”;LOOP、SALT、GVPO、Skill-SD和SIRI都能保持简单推理。
  • 不把Binary Reward包装成完整方法;GVPO说明Process Reward有效,LOOP也说明Fractional Reward可以训练。
  • 不把Env Loss MaskDAPO Token-Level Loss(Token-mean)单独写成创新;它们是与行业常见AgentRL一致的训练规则。
  • 不把“LLM单次生成不设限”写成无限Context或无限总生成;本文仍有32K总Response Cap与50轮交互预算。
  • KL Loss应写成后期稳定器,不写成主要方法贡献;No-KL消融用于支持稳定性作用。
  • 不声称rollout.n=32已经被证明最优。
  • 不写Current SOTA、训练Reward精确等于1,或已经证明跨领域普适性。
  • 推荐表述:without auxiliary learned or retrieval-based inference modules beyond the standard environment interface
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026