Skip to content

SWE 环境相关

📅 发表于 2026/04/30
🔄 更新于 2026/08/05
👁️ — 次访问
📝 5219 字
15 分钟

(2604) Agent-World (65.4分, Renmin University & ByteDance Seed)

🌺 论文摘要

Agent-World 摘要

参考链接

核心方法

  • Agent-World框架
    • 一个通用智能体训练竞技场,结合了可扩展的真实世界环境合成持续自我进化的训练机制
  • Agentic Environment-Task Discovery(环境与任务发现)
    • 从真实世界主题(如MCP Server)自主挖掘数据库和工具集,合成带执行验证的高难度任务(图方法+编程方法)。
  • Continuous Self-Evolving Agent Training(持续自我进化训练)
    • 在多环境下进行强化学习(RL),并通过智能体诊断竞技场动态识别能力缺陷,针对性生成新任务形成闭环。

模型效果(Agent-World-14B)

  • 在23个智能体基准上表现优异,超越了强大的闭源模型和现有环境扩展基准。
  • τ2-Bench65.4%BFCL V455.8%,超越千亿参数开源模型(如DeepSeek-V3.2-685B)。

重要结论

  • 随着合成环境数量的增加(从10到2000),智能体下游性能呈现显著的正向扩展定律(Scaling Law)。
  • 自我进化循环(Self-Evolution)能有效识别环境弱点并针对性提升,比单次静态训练带来更持续的性能增益。

关键贡献

  • 提出了将大规模真实环境合成与RL闭环自我诊断相统一的方法,为通用智能体提供了协同进化的训练范式。

问题背景

问题背景

现有训练环境的局限性

问题背景

真实环境构建成本高

  • 构建具有复杂交互逻辑、状态跟踪和多工具调用的开放世界环境(如航班预订)需要耗费大量人工,难以扩展。

当前环境合成方法的缺陷

  • 纯LLM模拟器环境:容易产生幻觉,偏离真实的系统动态和交互逻辑。
  • 静态合成环境:基于有限的开源工具链构建,复杂度低,且通常只支持单轮静态训练,缺乏机制去动态诊断模型弱点并持续改进。
  • 导致模型在长视野(Long-horizon)、密集状态转移的真实任务(如MCP协议场景)中表现不佳。

Agent-World 核心方法

📕核心方法

1. 智能体环境与任务发现 (Environment-Task Discovery)

环境与数据挖掘

环境主题收集与数据库挖掘

  • 从真实的MCP Servers、工具文档和工业产品需求文档(PRD)中收集数千个主题。
  • Agentic Database Mining:利用深度研究智能体(搭载搜索、代码和OS工具)在Web上自主挖掘并构建结构化数据库,并进行复杂化扩展。

工具接口生成与验证

  • 编程智能体为数据库生成Python可执行工具及单元测试,通过交叉验证(编译+执行)过滤,最终形成含1978个环境和近2万个工具的庞大生态。

可验证任务合成

  • 基于图的任务合成 (Graph-Based):构建工具依赖图,通过带权随机游走生成逻辑工具链,沙盒执行获取真实轨迹后,由LLM生成自然语言查询和Rubric评估标准。
  • 程序化任务合成 (Programmatic):生成复杂的非线性推理任务(条件、循环),并生成Python验证脚本(Verifier Script)来校验答案。
  • 通过拉长工具链和隐写任务描述,动态扩展任务难度。

2. 持续自我进化智能体训练 (Self-Evolving Training)

自我进化闭环训练

多环境强化学习 (Multi-Environment Agent RL)

  • 智能体在 沙盒环境 + 数据库 + 工具集 中闭环交互。
  • 采用 GRPO 算法,基于执行反馈分配奖励:图任务基于Rubric裁判打分,程序化任务基于验证脚本执行是否通过。

自我进化竞技场 (Self-Evolving Agent Arena)

  • 动态评估:在保留的竞技场环境中合成新任务,评估当前策略。
  • 智能体诊断 (Agentic Diagnosis):诊断智能体分析错误轨迹(如错误工具调用、状态更新失败),输出特定环境的任务生成指南和“弱点环境”列表。
  • 针对性进化:基于诊断报告,对弱点环境进行数据库复杂化并合成高难度目标任务,加入下一轮RL训练,实现环境与策略的协同进化。

实验设置

✍️实验设置

实验设置

基础模型

  • 基于 Qwen3-8B 和 Qwen3-14B,首先使用40K冷启动SFT数据进行微调,随后进行RLVR训练。

评测基准

  • 涵盖23个基准,包括工具调用(MCP-Mark, BFCL V4, τ2-Bench)、高级AI助手(SkillsBench, Claw-Eval)、通用推理(MATH500, AIME25)和代码搜索(SWE-Bench, GAIA)。

RL训练超参

  • 算法:GRPO
  • KL惩罚约束,优势裁剪(Clip ratio = 0.2~0.28)。
  • Global Batch Size:每次采样32个任务,每个任务进行8次Rollout,最大轨迹长度80K Tokens。
  • 温度(Temperature)= 1.0,Top_p = 1.0。

关键结果

🍑关键结果

关键结果

多基准模型效果

  • Agent-World-14B 实现了全面的性能提升:在长视野交互和真实MCP Server上表现出强劲的鲁棒性,甚至在 BFCL V4 和核心代码搜索任务上超越了千亿规模的模型(Qwen3-235B, DeepSeek-V3.2-685B)。

环境规模的 Scaling Law

  • 实验证明,下游智能体性能与合成的训练环境数量呈正相关。当环境从10个激增到500个时,提升最为迅猛(捕获了高价值的交互模式);继续扩展到2000个时收益虽然边际递减,但依然保持正向增长。

自我进化带来的持续增益

  • 连续两轮的自我进化训练显示出一致的增益。尤其在困难的 MCP-Mark 测试上,自我进化让 Agent-World-14B 提升了8.6分,证明针对性诊断并生成补板任务的闭环机制远优于静态One-pass训练。

未来方向

未来方向

未来方向

局限性与改进

  • 网络与真实世界的动态性:当前环境基于本地静态数据库(JSON/CSV)和沙盒代码模拟现实接口,尚未完全面对真实Web API的高延迟、动态变化和权限认证等问题。
  • 探索更高级的奖励信号设计(如细粒度的步骤级奖励或多智能体对抗评估),以缓解长序列任务中的信用分配问题。

研究方向

  • 将闭环诊断竞技场扩展至多模态(GUI界面、屏幕控制)环境。
  • 将模型能力的提升反哺给更强大的诊断 Agent,探索 Agent 之间无人类干预的无限自我博弈进化。

(2602) Agent World Model (AWM) (Snowflake & UNC)

🌺 论文摘要

Agent World Model 摘要

参考链接

核心方法

  • Agent World Model (AWM)
    • 一套全合成的可执行环境生成流水线。模拟真实软件开发流程,自动化构建包含后端数据库和前端API的交互环境。
  • 环境设计场景 + 任务 + SQLite数据库 + MCP统一接口 + 验证代码
  • 训练方法:基于环境进行在线强化学习 (GRPO),结合单步格式奖励与代码增强的LLM裁判反馈。

环境规模与质量

  • 包含1,000个真实场景(电商、金融、社交等),35,062个工具(平均每个环境35个),10,000个任务
  • 代码驱动,100%可执行,天然支持并行沙盒实例化。

重要结论

  • 基于代码和数据库的环境LLM直接模拟的环境 提供了更可靠的状态一致性更稳定的强化学习信号
  • 纯合成环境训练可以产生强大的分布外泛化能力 (OOD),在真实基准上表现优异。
  • 代码增强的LLM裁判 比单纯依赖代码规则或纯LLM判断更具鲁棒性,能有效处理偶发环境错误。

关键贡献

  • 开源了目前规模最大的工具调用环境集(1,000个),为Agentic RL提供了即插即用的高质量基础设施。

问题背景

问题背景

Agentic RL 缺乏大规模高质量环境

问题背景

真实环境难扩展且昂贵

  • 现实场景通常不提供公开API。
  • RL训练需要数千次高效、稳定的交互,真实环境容易遇到速率限制、成本高、易崩溃等问题。

人工构建环境多样性匮乏

  • 现有基准(如 τ2-bench,TheMCPCompany)只有极少数环境(3~5个),远不足以训练通用AI Agent。

现有合成环境的局限性

  • LLM直接模拟器 (LLM-based simulation)
    • 思想:让LLM直接根据Agent动作“想象”出下一状态和观察。
    • 缺点:严重受限于状态幻觉,缺乏严格的状态一致性;且每步交互都需要调用LLM,推理成本极高,拖慢RL效率。
  • 静态合成数据
    • 思想:只合成API文档和单轮/静态的轨迹用于SFT。
    • 缺点:Agent无法在环境中探索不同动作并获得真实状态变化的反馈,难以用于RL。
  • 并发的编程环境合成 (如 EnvScaler, AutoEnv)
    • 缺点:依赖人类先验(如给定现成任务集或API文档),缺乏强大的数据库后端支持复杂状态转移,规模有限。

Agent World Model (AWM) 核心方法

📕核心方法

环境合成流水线 (Environment Synthesis Pipeline)

AWM 环境生成架构

核心思想

  • 自下而上的软件工程模拟:不依赖预设API,从零开始生成“数据库-接口-验证”完整生态,通过轻量级执行和自我纠错(Self-Correction)保障质量。

合成步骤

  1. 场景合成 (Scenario Generation)
    • 给出100个知名域名种子,利用LLM扩展出1000个强调CRUD(增删改查)的动态应用场景。
  2. 任务合成 (Task Generation)
    • 为每个场景生成10个“可通过API解决”的用户核心任务。
  3. 数据库与数据合成 (Database & Data Synthesis)
    • 状态空间定义:生成SQLite的DDL建表语句。
    • 初始状态填充:根据任务需求生成真实合理的INSERT语句,确保所有任务初始可执行。
  4. 接口生成 (Interface Synthesis)
    • 先生成MCP (Model Context Protocol) 接口规范,再生成具体的 Python (FastAPI + SQLAlchemy) 后端代码。
  5. 验证代码生成 (Verification Synthesis)
    • 编写Python脚本,对比Agent动作执行前后的数据库状态差异 (State Diff),用于判断任务是否成功。
  6. 执行与自我纠错 (Execution-based Self-Correction)
    • 每步生成的代码都会在隔离沙盒中运行,若报错,将错误栈返回给LLM重试(平均只需1.13次尝试即可修复)。

Agentic RL 设计

Agentic 强化学习机制

单步格式奖励 (Step-level Format Correctness)

  • 规则检验:Agent必须遵循规范的XML工具调用格式,且必须先调用 list_tools 探索环境。
  • 提前终止:一旦出现格式错误、调用了幻觉工具或引发了服务器致命报错,立刻终止Rollout并给予惩罚 (rt=1.0)。极大提升了长序列探索的训练效率。

代码增强的LLM裁判 (Code-augmented LLM-as-a-Judge)

  • 痛点:由于合成环境的偶发不完美(API超时、工具幂等性),纯代码校验(严格匹配数据库Diff)容易产生假阴性;纯LLM裁判容易产生假阳性(被Agent的幻觉骗过)。
  • 解法:先用验证代码提取数据库的前后状态变化,将其作为“确凿证据”输入给GPT-5,结合Agent的交互轨迹进行最终裁决。
  • 奖励:成功得 1.0,部分完成得 0.1,失败得 0.0。

历史感知训练 (History-Aware Training)

  • 对齐推理与训练:实际部署时上下文窗口通常会被截断(Truncation)以提高效率。AWM在GRPO训练中引入样本拆分,让模型直接在被截断的历史视图下计算梯度,解决由于RL全历史优化带来的分布偏移问题。

实验设置

✍️实验设置

实验设置

基础模型

  • Qwen2.5/3 系列模型 (4B, 8B, 14B),具有推理和工具调用能力的基础模型。

训练任务/数据

  • 从AWM生成的1000个环境中抽取 526个环境3,315个任务 进行训练。
  • 每个训练步启动 1,024个独立的数据库沙盒实例,支持高度并发验证。

评测基准 (均为分布外 Out-of-Distribution)

  • SWE-Bench 变体 / MCP-Universe:真实的MCP工具使用基准。
  • BFCLv3:函数调用能力全面测试。
  • $\tau^2$-bench:涵盖对话与环境交互的多轮验证基准。

算法/策略

  • GRPO,最大优化步数96步,固定学习率 7×107,Rollout采样数 G=16。

关键结果

🍑关键结果

关键结果

模型全面超越基准

  • 在三大OOD基准上,AWM训练的模型全面超越了未RL的Base模型。
  • 对比并发的 EnvScaler 工作和基于LLM交互的 Simulator 基线,AWM在绝大多数指标上取得最优结果 (SOTA)。比如在 BFCLv3 上,8B模型总分从 53.83 提升至 65.94。

真实代码驱动优于LLM环境模拟

  • 数据表明,基于SQLite和真实Python后端的强状态一致性环境,比LLM动态编造回复的环境 (Simulator) 能提供更清晰的梯度信号,且大幅节约了训练期环境推理的时间开销。

环境规模的 Scaling Law

  • 实验证明环境多样性的重要性:随着训练环境数量从 10 扩大到 100 再到 526,Agent在三大真实基准上的得分呈现出稳定单调的增长曲线。这表明AWM管线生产的环境具有极高的数据价值且不会快速陷入同质化衰退。

验证机制的消融结论

  • 代码增强裁判 (Code-Augmented) 胜过 纯LLM纯代码验证
  • 带格式限制早停无格式限制 训练收敛速度快得多,且最终任务成功率更高。

未来方向

未来方向

未来方向

Agent 自我进化 (Self-Evolving)

  • 当前流水线是静态一次性生成的。未来可让强化学习训练好的高级Agent自主去发掘新需求、合成更复杂的环境,形成“模型与环境共同进化”的闭环。

合成管线深度优化

  • 当前的自我纠错(Self-Correction)主要依赖捕捉Python运行时报错(Trial-and-Error)。
  • 未来可引入LLM进行深度的语义校验,主动发现那些代码不报错但逻辑违背数据库约束或任务意图的隐蔽Bug。
  • 合成跨越多个环境的“复合型长序列任务”(如:先在“招聘系统”筛选简历,再在“邮件系统”发送通知)。

算力与模型扩展

  • 扩大训练规模,利用完整的1000个(甚至更多)环境进行更大规模参数模型的RL探索,释放Scaling潜力。

(2602) SWE-World (68.2分, RUC & BOSS Zhipin)

🌺 论文摘要

SWE-World 摘要

参考链接

核心方法(SWE-World Docker-Free 环境框架)

  • 基础Sandbox:文件读写功能,无需安装依赖。
  • 环境步骤反馈模型 SWT:预测中间执行反馈
  • 轨迹奖励评估模型SWR:生成测试报告和奖励。
  • 任务扩展 + 收集轨迹 + SFT + RL训练(GRPO++ 算法)

模型效果(SWEV, Qwen2.5-32B, SFT+RL)

  • SWE-V SFT达52分RL达55分,TTS@8 达68.2分。
  • SWR-32B 准确率75.4,SWR-72B 准确率77,超过GLM-4.7。

重要结论

  • SWE-World作为环境训练的模型效果不错,甚至略微超过真实Docker。
  • SWT和真实环境仍有差距,MiniMax2.1, 真实环境 vs SWT-72B68.4 -> 60.2
  • CoT对SWR很重重要:加入CoT准确率提升58->71,且有效避免Reward Hacking。
  • 无Docker限制解锁了大量无法构建镜像的开源仓库数据

关键贡献

  • 提出了Docker-Free的SWE-World-Model及训练范式,降低门槛扩大可用数据

问题背景

Docker环境存在局限性

问题背景

Docker 存在局限性

SWE 依赖Docker 构建成本高

  • leetcode只需python解释器,但SWE对仓库需要安装各种库,获取执行反馈,非常难构建。

数据扩展性受限

  • 很多仓库难以构建docker环境,会导致很多数据无法被使用

训练扩展性受限

  • docker存储/管理/大规模rollout启动吃资源且复杂

测试扩展性受限

  • TTS依赖执行试错,但docker需要大量时间和资源,推理阶段难以大规模尝试和探索

SWE 相关动作

SWE 主流动作
  • 动作1:看文件改代码占大多数

    • 无需任何依赖包,即可跑起来。
  • 动作2:运行代码跑测试占少数

    • 需要安装库,docker环境,才可以运行,

SWE-World 核心思想

📕核心方法

SWE-World 核心思想

核心思想

  • 解耦Action:将轻量级文件操作特定仓库代码执行分离。

轻量级沙盒(Sandbox)

  • 确定性地处理文件查看编辑等操作,保持文件状态绝对正确,避免模型产生幻觉。
    • ls, grep, vim

环境步骤反馈模型 SWT

  • 用LLM代替docker环境预测action执行结果步骤级

轨迹奖励评估模型 SWR

  • 生成测试报告,给出二元奖励。f2p, p2p等。

SWT 状态转移模型(步骤级环境)

SWT 核心功能

SWE-World Transition Model 功能

目标

  • 使用LLM模拟仓库代码执行命令给出step-level 反馈(如 python run.py, pytest),。

机制

  • 上下文:实例元数据 + 当前代码补丁 + 执行命令相关代码

  • 输出模拟结果:stdoutstderrexit_code

    y^t=<stdout, stderr, exit_code>∼MSWT(KtSWT)

效果

  • 无需启动容器,能够根据当前代码的修改动态预测逼真的日志输出错误回溯

SWT 训练过程 (蒸馏数据+SFT)

SWT 训练

模型

  • Qwen2.5-Instruct-32B/72B

核心思想

  • SWE-Agent + 真实Docker环境收集轨迹

任务数据源

逆向推理补充CoT部分

  • 逆向推理填充CoT部分,并使用LLM-as-Judge评估CoT质量CoTπteacher(Reasoning|k,yGT)

算法(SFT)

  • 预测环境输出

SWR 奖励测试验证模型(跑测试环境)

SWR 核心功能

SWE-World Reward Model (SWR)

目标

  • 充当虚拟测试运行器提交最终patch后,生成测试报告评估分数

输入内容

  • 问题描述、测试命令、测试代码Model PatchGold PatchF2P列表P2P列表

输出内容

  • CoT Reasoning结构化测试报告最终奖励分数

传统分数计算(黑盒,不可靠)

  • 输入Agent轨迹,使用token YES和NO的对数概率计算分数。r^=exp(lYES)exp(lYES)+exp(lNO)

SWR 训练过程 (蒸馏数据+SFT)

SWR 训练
  • 整体同SWT,利用swe-agent+真实docker 收集数据,做CoT反向填充,利用SFT训练
  • 区别是预测测试结果

SWE-World 轨迹数据蒸馏(Docker-Free)

SWE-World 轨迹数据蒸馏

训练任务

训练轨迹蒸馏

  • 每个实例,使用GLM4.6/MiniMax-M2模型,使用SWE-World-Env(SWT + 沙箱)
  • 两阶段过滤
    • 规则过滤:超时、超出长度80k、超出轮次100轮、无效工具使用等。
    • SWR过滤只保留r=1的轨迹

实验设置(SWE训练, SFT+RL)

✍️实验设置

实验设置

模型

  • 环境模型(SWT/SWR): 基于 Qwen2.5-Instruct-32B / 72B
  • 策略模型(SFT,RL): Qwen2.5-Coder-32B, Qwen3-4B 训练。

环境模型Rollout参数

  • SWT-32B, SWR-32B:128k,temp=0,
  • SWE-WorldSWT 步骤反馈 + SWR 轨迹打分

SFT 设置

  • 数据:开源+新收集的任务,蒸馏的轨迹。
  • 超参:bs=256, 80k, lr 5e-5, 5e-6, wamup=0.1, 5epoch

RL 设置

  • 数据:R2E-Gym + SWE-Gym + SWE-rebench

  • 环境:SWE-WorldSWT 步骤反馈 + SWR 轨迹打分

  • 初始模型:SWE-World-4B/32B-SFT

  • 算法:GRPO++ 算法

  • 奖励设置

    Ri={r^i,if rollout with submitαr^i,其他情况
  • 超参:

    • 常量lr=1e-6,bs=32,rollout=4
    • 150轮108k长度1.5小时

关键结果(Qwen2.5-32B, SFT+RL)

🍑关键结果

关键结果

模型效果(SWEV, Qwen2.5-32B, SFT+RL)

  • SWE-V SFT达52分RL达55分,TTS@8 达68.2分。
  • SWR-32B 准确率75.4,SWR-72B 准确率77,超过GLM-4.7。

重要结论

  • SWE-World作为环境训练的模型效果不错,甚至略微超过真实Docker。(SWE-World-32B 55 > FrogBoss 54.6)
  • SWT和真实环境仍有差距,MiniMax2.1, 真实环境 vs SWT-72B68.4 -> 60.2
  • CoT对SWR很重重要:加入CoT准确率提升58->71,且有效避免Reward Hacking。

未来方向

未来方向

未来方向

研究潜力

  • 解锁之前因构建失败而无法使用的海量 GitHub 数据,进一步推进真实世界复杂软件工程任务的数据扩展。
  • 为高成本的物理或系统交互任务(不仅限于代码工程)提供更普适的 World Model 代理环境训练思路。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026