AppWorld 合成数据相关
📅 发表于 2026/03/18
🔄 更新于 2026/08/05
👁️ — 次访问
📝 3286 字
⏳ 11 分钟
Appworld-Data
#CoEvolve
#CuES
#Agent-Data Mutual Evolution
🌺 论文摘要
参考链接
核心方法
核心想法:训练数据不能一次合成完就固定,而要跟着当前Policy的弱点一起变化。Weakness Signal: Forgetting:以前会做、现在又失败。Boundary:同一任务有时成功、有时失败。Rare Pattern:某些Action Pattern几乎没有探索。定向探索,而不是继续随机生成任务。Task-Solution Pair,经过真实环境验证后,再加入下一轮GRPO训练。Agent训练 -> 发现弱点 -> 生成针对性数据 -> 继续训练。模型效果
3.08提升到22.51,绝对提升19.43。11.72提升到27.30,绝对提升15.58。22.64提升到40.78,绝对提升18.14。TGC/SGC 54.76/33.93;Test-C:31.65/16.55。重要结论
冷启动很有效,但Policy变强后,原来的数据会逐渐跟不上当前弱点。Random Exploration也有用,但读取当前Policy失败信号的定向探索更有效。Forgetting Signal最重要:训练中的能力回退不只是噪声,也可以直接变成新的训练任务。训练数据分布更新。关键贡献
❓问题背景
人工数据的问题
普通合成数据的问题
CoEvolve观点
失败分布,新的失败分布又应该决定下一批训练数据。Agent Evolving <-> Data Evolving。📕核心方法
基础训练
Forgetting Signal
已经学会又忘掉的能力,应该优先补数据,而不是等它继续退化。Boundary Signal
Rare Signal
几乎没见过的工具组合。Signal-conditioned Context
双维度探索
Multi-round:从同一Context启动多个独立探索,增加行为多样性。Multi-step:每个探索根据中间Observation连续修正Action。(action, observation) Triplet。✍️实验设置
基础模型
Qwen2.5-7B-Instruct。Qwen3-4B-Instruct。Qwen3-30B-A3B-Instruct。训练环境
8,Learning Rate 0.9,最大30个环境Step。评测
比较
🍑关键结果
| Backbone | AppWorld Test-N TGC / SGC | AppWorld Test-C TGC / SGC | BFCL | Avg. |
|---|---|---|---|---|
| Qwen2.5-7B | 1.19 / 0.00 | 0.72 / 0.00 | 13.50 | 3.08 |
| + CoEvolve | 27.98 / 12.50 | 8.39 / 2.16 | 61.50 | 22.51 |
| Qwen3-4B | 16.67 / 5.36 | 7.91 / 2.16 | 26.50 | 11.72 |
| + CoEvolve | 35.71 / 14.28 | 17.03 / 6.47 | 63.00 | 27.30 |
| Qwen3-30B-A3B | 31.55 / 12.50 | 19.90 / 5.76 | 43.50 | 22.64 |
| + CoEvolve | 54.76 / 33.93 | 31.65 / 16.55 | 67.00 | 40.78 |
相对标准GRPO
28.57 -> CoEvolve 35.71。48.81 -> CoEvolve 54.76。Closed-loop Data Evolution与GRPO确实互补。阶段消融 (Qwen3-4B, AppWorld/BFCL平均)
21.59。43.29。45.43。49.36。Signal消融
35.71/63.00。30.36/60.00,影响最大。33.92/60.50。33.33/61.00。Signal分布
51.4%、BFCL 45.5%,说明大量任务位于Policy成功/失败边界。多样性与跨域
0.4-0.7,不是简单复制。26.50提升到45.00;BFCL训练使AppWorld从16.67提升到19.04。成本
9.67%、BFCL 12.76%训练时间。28.57提升到约35,相对增益约22.9%。⛳未来方向
🌺 论文摘要
参考链接
核心方法
CuES 框架:好奇心驱动(Curiosity-driven) + 环境落地(Environment-grounded) 的任务合成框架。解决核心问题:Task Scarcity(任务稀缺)。在没有预定义任务的环境中,如何让Agent自主生成任务并学习。5阶段流程: 需求确认:提取环境概念和原则。好奇探索:基于环境记忆(Memory)的自底向上探索,生成轨迹。任务抽象:将轨迹抽象为Guideline和可执行目标。质量控制:自我验证(Self-Verification),确保任务可执行性。目标重写:通过Hint调整任务难度,生成课程数据。数据来源:完全自主生成,无需人工种子目标或外部语料库。模型效果 (Qwen2.5-14B + CuES)
AppWorld (Test Normal, TGC):达45.24%,远超基座模型(14.29%),甚至超过Qwen3-32B (32.12%)。WebShop:达64.10%,相比基座(23.74%)提升显著。BFCL v3:达44.15%,在此指标上超过DeepSeek-V3 (43.5%)。重要结论
自主生成的任务在多样性和可执行性上匹配甚至超过人工构建数据集。好奇心驱动 + 环境感知 可以有效替代昂贵的人工任务设计。不仅学怎么做(How),还要学做什么(What)"的问题。关键贡献
Agentic RL的任务生成问题。CuES框架,结合自底向上探索和自顶向下指导,实现高质量训练任务合成。❓问题背景
现实困境
在复杂环境(如AppWorld, OS, Web),但缺乏结构化的训练任务。可以交互,但不知做什么任务来提升自己。现有方法局限
依赖预定义任务:依赖预定任务+RL训练,但这在未知环境中不存在。人工设计昂贵:手动构建 多样可执行任务非常困难合成数据局限:现有合成方法通常依赖人工种子目标或外部数据,无法做到完全自主。核心问题
没有预定义任务,如何让Agent利用环境,自主生成 多样+可解+有意义的训练任务?1. 需求确认 (Requirement Confirmation)
输入:环境描述 (用户需求/种子目标。输出:概念池 (行动原则 (作用:建立对环境实体、动作和约束的结构化理解,作为自顶向下的指导。2. 好奇探索 (Curious Exploration)
核心:Explorer Agent 基于环境记忆树 进行自底向上的交互。策略:优先尝试当前环境状态下未执行过的动作,避免冗余探索。产出:带有环境反馈的原始交互轨迹。3. 任务抽象 (Task Abstraction)
目标:将低级交互轨迹(可重用的任务Schema。输出: Guideline (动作序列。Executable Goal (目标。置信度过滤:LLM Judge 评估轨迹的一致性和清晰度。4. 质量控制 (Quality Control / Self-Verification)
机制:Agent 尝试解决生成的任务 (目的:确保生成任务 合理+可执行。仅保留通过验证的任务。5. 目标重写 (Goal Rewrite)
难例挖掘:隐藏Guideline细节,利用Rewrite Hints (参数/前提条件) 调整目标描述。课程生成:生成不同难度层级 (简单指令到抽象意图,构建多样化训练集。
F_task 映射的三要素
Executability (可执行性):合法+能通过验证,避免噪声监督。Diversity (多样性):覆盖不同的实体、动作和约束,防止坍缩到简单模板。Relevance (相关性):任务语义和难度应与目标评估环境相关,避免跑题。AppWorld 合成625个任务。

✍️实验设置
基础模型
训练任务/数据
CuES 框架自主生成,无人工种子任务。 AppWorld:模拟手机操作环境,生成API调用任务。WebShop:模拟电商购物,生成搜索与购买任务。BFCL v3:函数调用任务。(Task, Trajectory)对。多样性和可执行性 (Executability)。评测任务/数据
TGC , 未评估 SGC 。Test Normal ,未评估 Test ChallengeScore (平均得分), SR (Success Rate)AST Accuracy, Executable Accuracy算法/策略
阶段3高质量成功轨迹做微调 (Behavior Cloning)。可执行任务作为环境做训练,解决任务稀疏问题。超参
🍑关键结果
AppWorld (Test Normal - TGC指标)
45.24% (Greedy), 45.54% (avg@8)WebShop (Score)
64.10%,超过Baseline: Qwen2.5-14B 23分,Qwen3-32B 36分。BFCL v3 (Multi-Turn Base)
44.15%DeepSeek-V3 43分, GPT-4o-mini 43分。多样性与分布 (t-SNE & Metrics)
覆盖原始数据分布,且漂移很小,保证了相关性。比原始数据更广,自冗余度更低,说明生成了多样化购物意图。可执行性显著提升 (如在AppWorld上从0.61->0.72)。
⛳ 未来方向
On-Policy Synthesis
离线生成数据。在线合成策略,训练时根据当前能力 动态生成适合自己的任务。环境特定的奖励模型
Reward Model,解决稀疏奖励问题。跨域适应
更开放、非结构化环境(如通用OS操作)中的有效性。