(2604) Agent-World (65.4分, Renmin University & ByteDance Seed)
🌺 论文摘要
参考链接
核心方法
Agent-World框架- 一个通用智能体训练竞技场,结合了
可扩展的真实世界环境合成与持续自我进化的训练机制。
- 一个通用智能体训练竞技场,结合了
Agentic Environment-Task Discovery(环境与任务发现)- 从真实世界主题(如MCP Server)自主挖掘数据库和工具集,合成带执行验证的高难度任务(图方法+编程方法)。
Continuous Self-Evolving Agent Training(持续自我进化训练)- 在多环境下进行强化学习(RL),并通过智能体诊断竞技场动态识别能力缺陷,针对性生成新任务形成闭环。
模型效果(Agent-World-14B)
- 在23个智能体基准上表现优异,超越了强大的闭源模型和现有环境扩展基准。
τ2-Bench达65.4%,BFCL V4达55.8%,超越千亿参数开源模型(如DeepSeek-V3.2-685B)。
重要结论
- 随着合成环境数量的增加(从10到2000),智能体下游性能呈现显著的正向扩展定律(Scaling Law)。
自我进化循环(Self-Evolution)能有效识别环境弱点并针对性提升,比单次静态训练带来更持续的性能增益。
关键贡献
- 提出了将大规模真实环境合成与RL闭环自我诊断相统一的方法,为通用智能体提供了协同进化的训练范式。
问题背景
❓问题背景
现有训练环境的局限性
真实环境构建成本高
- 构建具有复杂交互逻辑、状态跟踪和多工具调用的开放世界环境(如航班预订)需要耗费大量人工,难以扩展。
当前环境合成方法的缺陷
纯LLM模拟器环境:容易产生幻觉,偏离真实的系统动态和交互逻辑。静态合成环境:基于有限的开源工具链构建,复杂度低,且通常只支持单轮静态训练,缺乏机制去动态诊断模型弱点并持续改进。- 导致模型在长视野(Long-horizon)、密集状态转移的真实任务(如MCP协议场景)中表现不佳。
Agent-World 核心方法
📕核心方法
1. 智能体环境与任务发现 (Environment-Task Discovery)
环境主题收集与数据库挖掘
- 从真实的MCP Servers、工具文档和工业产品需求文档(PRD)中收集数千个主题。
Agentic Database Mining:利用深度研究智能体(搭载搜索、代码和OS工具)在Web上自主挖掘并构建结构化数据库,并进行复杂化扩展。
工具接口生成与验证
- 编程智能体为数据库生成Python可执行工具及单元测试,通过交叉验证(编译+执行)过滤,最终形成含1978个环境和近2万个工具的庞大生态。
可验证任务合成
基于图的任务合成 (Graph-Based):构建工具依赖图,通过带权随机游走生成逻辑工具链,沙盒执行获取真实轨迹后,由LLM生成自然语言查询和Rubric评估标准。程序化任务合成 (Programmatic):生成复杂的非线性推理任务(条件、循环),并生成Python验证脚本(Verifier Script)来校验答案。- 通过拉长工具链和隐写任务描述,动态扩展任务难度。
2. 持续自我进化智能体训练 (Self-Evolving Training)
多环境强化学习 (Multi-Environment Agent RL)
- 智能体在
沙盒环境 + 数据库 + 工具集中闭环交互。 - 采用 GRPO 算法,基于执行反馈分配奖励:图任务基于Rubric裁判打分,程序化任务基于验证脚本执行是否通过。
自我进化竞技场 (Self-Evolving Agent Arena)
动态评估:在保留的竞技场环境中合成新任务,评估当前策略。智能体诊断 (Agentic Diagnosis):诊断智能体分析错误轨迹(如错误工具调用、状态更新失败),输出特定环境的任务生成指南和“弱点环境”列表。针对性进化:基于诊断报告,对弱点环境进行数据库复杂化并合成高难度目标任务,加入下一轮RL训练,实现环境与策略的协同进化。
实验设置
✍️实验设置
基础模型
- 基于 Qwen3-8B 和 Qwen3-14B,首先使用40K冷启动SFT数据进行微调,随后进行RLVR训练。
评测基准
- 涵盖23个基准,包括工具调用(MCP-Mark, BFCL V4, τ2-Bench)、高级AI助手(SkillsBench, Claw-Eval)、通用推理(MATH500, AIME25)和代码搜索(SWE-Bench, GAIA)。
RL训练超参
- 算法:GRPO
- KL惩罚约束,优势裁剪(Clip ratio = 0.2~0.28)。
- Global Batch Size:每次采样32个任务,每个任务进行8次Rollout,最大轨迹长度80K Tokens。
- 温度(Temperature)= 1.0,Top_p = 1.0。
关键结果
🍑关键结果
多基准模型效果
- Agent-World-14B 实现了全面的性能提升:在长视野交互和真实MCP Server上表现出强劲的鲁棒性,甚至在
BFCL V4和核心代码搜索任务上超越了千亿规模的模型(Qwen3-235B, DeepSeek-V3.2-685B)。
环境规模的 Scaling Law
- 实验证明,下游智能体性能与合成的训练环境数量呈正相关。当环境从10个激增到500个时,提升最为迅猛(捕获了高价值的交互模式);继续扩展到2000个时收益虽然边际递减,但依然保持正向增长。
自我进化带来的持续增益
- 连续两轮的自我进化训练显示出一致的增益。尤其在困难的
MCP-Mark测试上,自我进化让 Agent-World-14B 提升了8.6分,证明针对性诊断并生成补板任务的闭环机制远优于静态One-pass训练。
未来方向
⛳ 未来方向
局限性与改进
网络与真实世界的动态性:当前环境基于本地静态数据库(JSON/CSV)和沙盒代码模拟现实接口,尚未完全面对真实Web API的高延迟、动态变化和权限认证等问题。- 探索更高级的奖励信号设计(如细粒度的步骤级奖励或多智能体对抗评估),以缓解长序列任务中的信用分配问题。
研究方向
- 将闭环诊断竞技场扩展至多模态(GUI界面、屏幕控制)环境。
- 将模型能力的提升反哺给更强大的诊断 Agent,探索 Agent 之间无人类干预的无限自我博弈进化。
(2602) Agent World Model (AWM) (Snowflake & UNC)
🌺 论文摘要
参考链接
核心方法
Agent World Model (AWM)- 一套全合成的可执行环境生成流水线。模拟真实软件开发流程,自动化构建包含后端数据库和前端API的交互环境。
环境设计:场景+任务+SQLite数据库+MCP统一接口+验证代码。训练方法:基于环境进行在线强化学习 (GRPO),结合单步格式奖励与代码增强的LLM裁判反馈。
环境规模与质量
- 包含1,000个真实场景(电商、金融、社交等),35,062个工具(平均每个环境35个),10,000个任务。
- 代码驱动,100%可执行,天然支持并行沙盒实例化。
重要结论
基于代码和数据库的环境比LLM直接模拟的环境提供了更可靠的状态一致性和更稳定的强化学习信号。纯合成环境训练可以产生强大的分布外泛化能力 (OOD),在真实基准上表现优异。代码增强的LLM裁判比单纯依赖代码规则或纯LLM判断更具鲁棒性,能有效处理偶发环境错误。
关键贡献
- 开源了目前规模最大的工具调用环境集(1,000个),为Agentic RL提供了即插即用的高质量基础设施。
问题背景
❓问题背景
Agentic RL 缺乏大规模高质量环境
真实环境难扩展且昂贵
- 现实场景通常不提供公开API。
- RL训练需要数千次高效、稳定的交互,真实环境容易遇到速率限制、成本高、易崩溃等问题。
人工构建环境多样性匮乏
- 现有基准(如
-bench,TheMCPCompany)只有极少数环境(3~5个),远不足以训练通用AI Agent。
现有合成环境的局限性
LLM直接模拟器 (LLM-based simulation)- 思想:让LLM直接根据Agent动作“想象”出下一状态和观察。
- 缺点:严重受限于状态幻觉,缺乏严格的状态一致性;且每步交互都需要调用LLM,推理成本极高,拖慢RL效率。
静态合成数据- 思想:只合成API文档和单轮/静态的轨迹用于SFT。
- 缺点:Agent无法在环境中探索不同动作并获得真实状态变化的反馈,难以用于RL。
并发的编程环境合成 (如 EnvScaler, AutoEnv)- 缺点:依赖人类先验(如给定现成任务集或API文档),缺乏强大的数据库后端支持复杂状态转移,规模有限。
Agent World Model (AWM) 核心方法
📕核心方法
环境合成流水线 (Environment Synthesis Pipeline)
核心思想
- 自下而上的软件工程模拟:不依赖预设API,从零开始生成“数据库-接口-验证”完整生态,通过轻量级执行和自我纠错(Self-Correction)保障质量。
合成步骤
场景合成 (Scenario Generation)- 给出100个知名域名种子,利用LLM扩展出1000个强调CRUD(增删改查)的动态应用场景。
任务合成 (Task Generation)- 为每个场景生成10个“可通过API解决”的用户核心任务。
数据库与数据合成 (Database & Data Synthesis)- 状态空间定义:生成SQLite的DDL建表语句。
- 初始状态填充:根据任务需求生成真实合理的INSERT语句,确保所有任务初始可执行。
接口生成 (Interface Synthesis)- 先生成MCP (Model Context Protocol) 接口规范,再生成具体的 Python (FastAPI + SQLAlchemy) 后端代码。
验证代码生成 (Verification Synthesis)- 编写Python脚本,对比Agent动作执行前后的数据库状态差异 (State Diff),用于判断任务是否成功。
执行与自我纠错 (Execution-based Self-Correction)- 每步生成的代码都会在隔离沙盒中运行,若报错,将错误栈返回给LLM重试(平均只需1.13次尝试即可修复)。
Agentic RL 设计
单步格式奖励 (Step-level Format Correctness)
- 规则检验:Agent必须遵循规范的XML工具调用格式,且必须先调用
list_tools探索环境。 - 提前终止:一旦出现格式错误、调用了幻觉工具或引发了服务器致命报错,立刻终止Rollout并给予惩罚 (
)。极大提升了长序列探索的训练效率。
代码增强的LLM裁判 (Code-augmented LLM-as-a-Judge)
- 痛点:由于合成环境的偶发不完美(API超时、工具幂等性),纯代码校验(严格匹配数据库Diff)容易产生假阴性;纯LLM裁判容易产生假阳性(被Agent的幻觉骗过)。
- 解法:先用验证代码提取数据库的前后状态变化,将其作为“确凿证据”输入给GPT-5,结合Agent的交互轨迹进行最终裁决。
- 奖励:成功得 1.0,部分完成得 0.1,失败得 0.0。
历史感知训练 (History-Aware Training)
- 对齐推理与训练:实际部署时上下文窗口通常会被截断(Truncation)以提高效率。AWM在GRPO训练中引入样本拆分,让模型直接在被截断的历史视图下计算梯度,解决由于RL全历史优化带来的分布偏移问题。
实验设置
✍️实验设置
基础模型
- Qwen2.5/3 系列模型 (4B, 8B, 14B),具有推理和工具调用能力的基础模型。
训练任务/数据
- 从AWM生成的1000个环境中抽取 526个环境 和 3,315个任务 进行训练。
- 每个训练步启动 1,024个独立的数据库沙盒实例,支持高度并发验证。
评测基准 (均为分布外 Out-of-Distribution)
SWE-Bench 变体/MCP-Universe:真实的MCP工具使用基准。BFCLv3:函数调用能力全面测试。$\tau^2$-bench:涵盖对话与环境交互的多轮验证基准。
算法/策略
- GRPO,最大优化步数96步,固定学习率
,Rollout采样数 G=16。
关键结果
🍑关键结果
模型全面超越基准
- 在三大OOD基准上,AWM训练的模型全面超越了未RL的Base模型。
- 对比并发的
EnvScaler工作和基于LLM交互的Simulator基线,AWM在绝大多数指标上取得最优结果 (SOTA)。比如在 BFCLv3 上,8B模型总分从 53.83 提升至 65.94。
真实代码驱动优于LLM环境模拟
- 数据表明,基于SQLite和真实Python后端的强状态一致性环境,比LLM动态编造回复的环境 (
Simulator) 能提供更清晰的梯度信号,且大幅节约了训练期环境推理的时间开销。
环境规模的 Scaling Law
- 实验证明环境多样性的重要性:随着训练环境数量从 10 扩大到 100 再到 526,Agent在三大真实基准上的得分呈现出稳定单调的增长曲线。这表明AWM管线生产的环境具有极高的数据价值且不会快速陷入同质化衰退。
验证机制的消融结论
代码增强裁判 (Code-Augmented)胜过纯LLM和纯代码验证。带格式限制早停比无格式限制训练收敛速度快得多,且最终任务成功率更高。
未来方向
⛳ 未来方向
Agent 自我进化 (Self-Evolving)
- 当前流水线是静态一次性生成的。未来可让强化学习训练好的高级Agent自主去发掘新需求、合成更复杂的环境,形成“模型与环境共同进化”的闭环。
合成管线深度优化
- 当前的自我纠错(Self-Correction)主要依赖捕捉Python运行时报错(Trial-and-Error)。
- 未来可引入LLM进行深度的语义校验,主动发现那些代码不报错但逻辑违背数据库约束或任务意图的隐蔽Bug。
- 合成跨越多个环境的“复合型长序列任务”(如:先在“招聘系统”筛选简历,再在“邮件系统”发送通知)。
算力与模型扩展
- 扩大训练规模,利用完整的1000个(甚至更多)环境进行更大规模参数模型的RL探索,释放Scaling潜力。
(2602) SWE-World (68.2分, RUC & BOSS Zhipin)
🌺 论文摘要
参考链接
核心方法(SWE-World Docker-Free 环境框架)
基础Sandbox:文件读写功能,无需安装依赖。环境步骤反馈模型 SWT:预测中间执行反馈轨迹奖励评估模型SWR:生成测试报告和奖励。任务扩展+收集轨迹+SFT+RL训练(GRPO++ 算法)
模型效果(SWEV, Qwen2.5-32B, SFT+RL)
- SWE-V
SFT达52分,RL达55分,TTS@8 达68.2分。 - SWR-32B 准确率75.4,SWR-72B 准确率77,超过GLM-4.7。
重要结论
SWE-World作为环境训练的模型效果不错,甚至略微超过真实Docker。- SWE-World-32B 55 > FrogBoss 54.6
SWT和真实环境仍有差距,MiniMax2.1,真实环境 vs SWT-72B,68.4 -> 60.2。CoT对SWR很重重要:加入CoT准确率提升58->71,且有效避免Reward Hacking。- 无Docker限制
解锁了大量无法构建镜像的开源仓库数据。
关键贡献
- 提出了
Docker-Free的SWE-World-Model及训练范式,降低门槛及扩大可用数据。
问题背景
Docker环境存在局限性
❓问题背景
SWE 依赖Docker 构建成本高
- leetcode只需python解释器,但SWE对仓库需要安装各种库,获取执行反馈,非常难构建。
数据扩展性受限
- 很多仓库
难以构建docker环境,会导致很多数据无法被使用。
训练扩展性受限
- docker存储/管理/
大规模rollout启动,吃资源且复杂,
测试扩展性受限
- TTS依赖执行试错,但docker需要大量时间和资源,
推理阶段难以大规模尝试和探索。
SWE 相关动作
动作1:
看文件改代码、占大多数- 无需任何依赖包,即可跑起来。
动作2:
运行代码跑测试、占少数- 需要安装库,docker环境,才可以运行,
SWE-World 核心思想
📕核心方法
核心思想
- 解耦Action:将
轻量级文件操作与特定仓库代码执行分离。
轻量级沙盒(Sandbox)
- 确定性地处理文件
查看编辑等操作,保持文件状态绝对正确,避免模型产生幻觉。- 如
ls,grep,vim
- 如
环境步骤反馈模型 SWT
- 用LLM
代替docker环境,预测action执行结果,步骤级
轨迹奖励评估模型 SWR
- 生成测试报告,给出二元奖励。f2p, p2p等。
SWT 状态转移模型(步骤级环境)
SWT 核心功能
目标
- 使用LLM
模拟仓库代码执行命令并给出step-level 反馈(如python run.py,pytest),。
机制
上下文:
实例元数据+当前代码补丁+执行命令、相关代码。输出模拟结果:
stdout、stderr和exit_code。
效果
- 无需启动容器,能够根据当前代码的修改动态
预测逼真的日志输出和错误回溯。
SWT 训练过程 (蒸馏数据+SFT)
模型
- Qwen2.5-Instruct-
32B/72B
核心思想
SWE-Agent+真实Docker环境,收集轨迹。
任务数据源
逆向推理补充CoT部分
逆向推理,填充CoT部分,并使用LLM-as-Judge评估CoT质量。
算法(SFT)
预测环境输出。
SWR 奖励测试验证模型(跑测试环境)
SWR 核心功能
目标
- 充当
虚拟测试运行器,提交最终patch后,生成测试报告和评估分数。
输入内容
问题描述、测试命令、测试代码、Model Patch、Gold Patch、F2P列表、P2P列表
输出内容
CoT Reasoning、结构化测试报告、最终奖励分数
传统分数计算(黑盒,不可靠)
- 输入
Agent轨迹,使用tokenYES和NO的对数概率计算分数。
SWR 训练过程 (蒸馏数据+SFT)
- 整体同SWT,利用
swe-agent+真实docker收集数据,做CoT反向填充,利用SFT训练。 - 区别是
预测测试结果。
SWE-World 轨迹数据蒸馏(Docker-Free)
训练任务
- 开源数据:4.6k R2E-Gym + 2.4k SWE-Gym + 6.5k SWE-rebench
- 全新爬取构建
SWE-World 数据:16.6k 任务,3.7k 仓库。
训练轨迹蒸馏
- 每个
实例,使用GLM4.6/MiniMax-M2模型,使用SWE-World-Env(SWT + 沙箱) - 两阶段过滤:
- 规则过滤:超时、超出
长度80k、超出轮次100轮、无效工具使用等。 - SWR过滤:
只保留r=1的轨迹。
- 规则过滤:超时、超出
实验设置(SWE训练, SFT+RL)
✍️实验设置
模型
- 环境模型(SWT/SWR): 基于 Qwen2.5-Instruct-
32B / 72B。 - 策略模型(SFT,RL):
Qwen2.5-Coder-32B,Qwen3-4B训练。
环境模型Rollout参数
- SWT-32B, SWR-32B:
128k,temp=0, SWE-World:SWT 步骤反馈+SWR 轨迹打分
SFT 设置
- 数据:开源+新收集的任务,蒸馏的轨迹。
- 超参:
bs=256,80k,lr 5e-5, 5e-6, wamup=0.1,5epoch
RL 设置
数据:R2E-Gym + SWE-Gym + SWE-rebench
环境:
SWE-World:SWT 步骤反馈+SWR 轨迹打分初始模型:SWE-World-
4B/32B-SFT算法:GRPO++ 算法
奖励设置
超参:
常量lr=1e-6,bs=32,rollout=4150轮,108k长度,1.5小时
关键结果(Qwen2.5-32B, SFT+RL)
🍑关键结果
模型效果(SWEV, Qwen2.5-32B, SFT+RL)
- SWE-V
SFT达52分,RL达55分,TTS@8 达68.2分。 - SWR-32B 准确率75.4,SWR-72B 准确率77,超过GLM-4.7。
重要结论
SWE-World作为环境训练的模型效果不错,甚至略微超过真实Docker。(SWE-World-32B 55 > FrogBoss 54.6)SWT和真实环境仍有差距,MiniMax2.1,真实环境 vs SWT-72B,68.4 -> 60.2。CoT对SWR很重重要:加入CoT准确率提升58->71,且有效避免Reward Hacking。
未来方向
⛳ 未来方向
研究潜力
- 解锁之前因构建失败而无法使用的海量 GitHub 数据,进一步推进真实世界复杂软件工程任务的数据扩展。
- 为高成本的物理或系统交互任务(不仅限于代码工程)提供更普适的 World Model 代理环境训练思路。