Skip to content

Claw SFT 训练相关

📅 发表于 2026/05/06
🔄 更新于 2026/05/06
👁️ -- 次访问
📝 0 字
0 分钟

(2604) ClawGym (Claw-style Agent 框架, RUC & IQuest)

🌺 论文摘要

ClawGym 摘要

参考链接

核心方法

  • ClawGym 框架:首个支持“数据合成-智能体训练-诊断评测”全生命周期的可扩展框架。
  • 双路数据合成 (ClawGym-SynData):结合自顶向下 (用户画像驱动)自底向上 (技能基石驱动)策略,生成并过滤出 13.5K 训练任务,搭配自动生成的 mock 工作区和代码+量规混合验证器
  • 模型训练 (ClawGym-Agents):在 OpenClaw 黑盒环境中 Rollout 收集轨迹,进行 SFT,并引入轻量级沙盒并发 RL 进行强化学习。
  • 评测基准 (ClawGym-Bench):200 个经过难度过滤和人类-LLM协作审查的高质量基准测试。

模型效果

  • 在 PinchBench 和 ClawGym-Bench 上,经过 SFT 训练的基座模型均获得显著提升。
  • Qwen3-8B 在 PinchBench 上提升 38.90%,在 ClawGym-Bench 上提升 43.46%。
  • ClawGym-30A3B 在 PinchBench 取得 86.0 分,超越 Claude-4.7-Opus 等闭源前沿模型,在 ClawGym-Bench 取得 56.82 分。

重要结论

  • 混合合成策略 (画像+技能) 极具协同效应,效果优于单一策略。
  • 采用简单的 Reward 阈值过滤 (0.5) 能有效平衡任务完成度和数据多样性。
  • 轻量级的沙盒并发 RL 能在 SFT 的基础上进一步稳定提升智能体性能。

关键贡献

  • 提出了 ClawGym 框架,解决了 Claw-style 环境下长期缺乏大规模、可验证训练数据及系统性评测方案的问题。

问题背景

问题背景

问题背景

Claw-style 任务的独特性与挑战

  • 环境复杂性:与传统孤立对话框或纯文本推理(如AIME)不同,Claw-style Agent 部署在用户的计算机环境中,需要调用系统工具、管理本地文件并进行多步长工作流。
  • 执行环境不透明:系统接口通常是黑盒的,Agent 需要处理模糊的指令、未预期的工作区状态、工具报错以及跨 session 的长上下文依赖。

现有训练与评测数据的局限性

  • 个性化场景难以覆盖:用户日常任务极具多样性,很难定义具备代表性的静态数据集。
  • 长视野任务难以自动验证:涉及文件修改、数据转换等,单靠文本对比无法验证。
  • 缺乏逼真的工作区环境:需要安全的、特定任务绑定的 mock 文件和资源,而不是依赖用户真实隐私文件。

ClawGym 核心方法

📕核心方法

数据合成 (ClawGym-SynData)

ClawGym-SynData 双路合成机制

核心思想

  • 结合两种互补策略生成指令,并自动挂载验证器和运行环境。产出 13.5K 高质量任务。

1. 自顶向下 (Persona-Driven) 合成

  • 基于画像驱动:从 10 亿画像中采样,结合 43 个场景子类、26 种原子操作构建 Task Seed
  • 特点:保障了任务场景的多样性和贴近真实用户需求的业务逻辑。

2. 自底向上 (Skill-Grounded) 合成

  • 基于技能组装:从 ClawHub 中提取约 30K 真实技能(如文件操作、网页交互),过滤出 16K 可用技能。抽取 1 个主要技能 + N 个辅助技能组合生成任务。
  • 特点:保障了任务在 OpenClaw 框架中的可执行性和工具调用的落地性。

3. 资源生成与混合验证 (Hybrid Verification)

  • 资源准备:自动生成轻量级 mock 文件(如 csv, json, md),构建独立的初始环境状态。
  • 代码验证 (权重0.7):生成 Python 脚本校验文件是否存在、schema 是否合规、计算是否正确。
  • 量规验证 (权重0.3):生成 Rubric,通过 LLM 评估回复的语气、连贯性和总结全面性。
  • 质量自动化审计:使用强大的 LLM (GPT-5.4) 审计任务的合理性、新颖度以及验证器是否存在过度严格或无效判断的问题。

模型训练 (ClawGym-Agents)

ClawGym-Agents 训练策略

1. 黑盒 Rollout 轨迹收集

  • 使用 Teacher Models (MiniMax-M2.5, GLM-5.1) 直接在 OpenClaw 系统的 Docker 环境中进行交互。
  • 引入代理层截获系统与模型的交互,还原多轮完整轨迹,清洗掉无用的心跳检测 (heartbeat)。

2. 轨迹过滤与 SFT

  • 采用阈值过滤 (Reward > 0.5),选出 24.5K 条兼顾完成度和行为多样性的高质量轨迹。
  • 对 Qwen3 系列模型应用 YaRN 将上下文长度拉升至 64K。
  • Loss Masking:训练时对 Docker 返回的环境观测反馈不计算 loss,强制模型学习“如何决策和调用工具”,而非“死记硬背环境回显”。

3. 沙盒并发强化学习 (RL)

  • 采用轻量级的 Sandbox-Parallel Pipeline,使每个任务在独立的 Docker 虚拟沙盒中运行。
  • 算法:基于 GRPO,仅使用代码验证器给出的 Outcome Reward 信号进行优化。
  • 不管是基座模型还是 SFT 后的模型,该 RL 流程均能带来持续的性能攀升。

评测基准 (ClawGym-Bench)

ClawGym-Bench

构建流程

  • 从未见过的合成任务池中,通过大/小模型对战进行难度过滤(剔除太简单或连大模型都做不出的题目)。
  • 人类-LLM协作审查:GPT-5.4 初审寻找漏洞,人类复核并修正细节。
  • 最终沉淀出 200 个高质量基准测试,分为 6 大核心场景(生产力、系统自动化、分析推理、软件开发等)。

实验设置

✍️实验设置

实验设置

基座模型与对比模型

  • 闭源前沿:Claude-4.7-Opus, Claude-4.6, Gemini-3-Flash, GPT-5.4
  • 开源前沿:DeepSeek-V3.2, GLM-5.1, MiniMax-M2.7, Kimi-K2.6, Qwen3.5-Plus
  • 训练基座:Qwen3-4B-Instruct, Qwen3-8B, Qwen3-30B-A3B-Instruct

评测任务

  • ClawGym-Bench:本文构建的 200 个诊断级任务。
  • PinchBench:外部的第三方评测基准(保留 30 个非多模态任务)。

关键超参与设置

  • SFT 上下文窗口:64K
  • RL 算法配置:GRPO,学习率 1e-6,Batch Size=8,Rollouts=8,步数 100 步。

关键结果

🍑关键结果

关键结果

1. 模型效果 (ClawGym-Agents SFT)

  • 经过合成数据 SFT,小模型获得了极大的智能体能力跨越。
  • ClawGym-4B/8B/30A3B 在 ClawGym-Bench 上分别达到 47.73 / 50.24 / 56.82 分,稳定超越原始的 Qwen 基座。
  • 在外部不可见的 PinchBench 上,ClawGym-30A3B 取得 86.00 分,超过了极高比例的专有大模型(如 Claude-4.7-Opus 获得 79.40 分),证明了学习到的 Agent 原理具备极强的泛化性

2. 混合成效消融实验 (Synergy)

  • 实验证明 Mixed Synthesis (混合合成) 的表现显著高于单纯依靠 PersonaSkill 进行合成。只有将“抽象用户需求多样性”与“具体工具执行边界”结合,模型才能真正举一反三。

3. RL 提升与过滤策略

  • 轨迹清洗阈值设为 0.5 最优:阈值过低引入脏数据,阈值过高 (如 0.9) 会抹杀掉模型在出错边缘尝试挽回的宝贵探究行为(丢失多样性)。
  • 基于沙盒并发的 RL 成功拔高了模型的上限,例如 Qwen3-4B 从基础表现稳定攀升到了 35.7% 左右。

4. 行为洞察 (Behavioral Analysis)

  • 长视野执行鲁棒性:强模型出错后会重置状态重新执行并自查;弱模型会死循环或卡在授权环节。
  • 细粒度指令遵循:弱模型喜欢生成“看起来正确”的文件格式,但在底层过滤条件(如商品数量阈值)上经常把控失败并将其扩散到下游。

未来方向

未来方向

未来方向

评估维度的扩展

  • 当前的评估主要聚焦于 Final-State Correctness(最终文件状态的正确性)。
  • 未来需要进一步引入对中间 Agent 轨迹的精细化评估:包括动作的安全性 (Safety)执行效率 (Efficiency) 以及面对复杂突发报错时的错误恢复能力 (Error Recovery)

连续 Reward 分数的轨迹筛选

  • 目前的阈值过滤(基于 0.5 切分)属于经验设计。混合验证器返回的是 [0, 1] 的连续分数,未来将探索更科学且系统化的连续分数样本选择方法。

(2603) OpenClaw-RL (Gen-Verse / OpenClaw)

�� 论文摘要

OpenClaw-RL 摘要

参考链接

核心方法

  • OpenClaw-RL 框架
    • 将用户交互终端的数据流实时转化为强化学习(RL)信号,实现**“边用边学”**的在线进化。
  • 提取两类互补信号
    • 从用户的“下一状态(Next-State)”反馈中,异步提取评测性信号(Evaluative,标量)指导性信号(Directive,Token级)
  • 重叠引导与混合RL
    • 提出重叠引导的提示选择(Overlap-Guided Hint Selection)机制来稳定在线知识蒸馏,并将标量奖励与Token级指导统一在同一个混合RL目标中。

模型效果

  • 个性化智能体(Personal Agents)场景中,平均仅需 10.3 个对话 Session 即可完美对齐用户专属偏好。
  • 通用智能体(General Agents)场景中,能够跨越 Terminal、GUI、SWE 和 Tool-call 场景,相比纯结果奖励(Outcome-only)的基线获得明显性能提升(例如 GUI 场景准确率 0.31 -> 0.33,Tool-call 0.19 -> 0.25)。

重要结论

  • Hybrid RL (混合RL) 比单纯的 GRPO(标量奖励)或 OPD(在策略蒸馏)效率都更高,因为两者在“出现频率”和“信息密度”上完美互补。
  • Overlap-Guided (重叠引导)对数概率截断 极大缓解了 Teacher-Student 模型在知识蒸馏中的分布偏移问题,保障了训练的稳定性。

关键贡献

  • 构建了第一个统一各类现实世界Agent部署场景(个性化对话、云端并发工具等)的开源在线 RL 基础设施,实现了服务、推理、奖励模型评判和训练的完全异步解耦。

问题背景

问题背景

现有RL框架的离线/静态限制

问题背景

RL 基础设施不支持实时“活”数据

  • 目前大多数RL系统(如 OpenRLHF, veRL 等)假设在独立阶段使用预先收集好的固定数据集进行批量训练。
  • 然而,真实世界的智能体在使用时,每次操作都会产生巨大的“下个状态”信号(如用户的纠正、API返回的错误日志、界面状态变化)。目前的系统无法在线、无阻塞地将这些交互转化为实时的策略梯度。

标量奖励与Token级蒸馏的痛点

  • RLVR(可验证奖励RL)局限:只支持标量奖励(对或错)。比如用户骂了一句“你搞错了,应该先查文件”,RLVR 只能提取出一个 -1 分,浪费了具体“怎么改”的语义信息。
  • OPD(在策略蒸馏)的缺陷:利用Teacher模型结合Hint(提示)来教Student模型,虽然提供了Token级别的密集信号,但经常遭遇 Teacher-Student 分布不匹配。当Teacher纠正的方向是Student压根没见过的词时,会导致重要性采样比率爆炸,训练极不稳定。
  • 此外,单纯依赖自然语言反馈或者纯结果,缺乏长序列(Long-Horizon)复杂Agent任务的信用分配能力。

OpenClaw-RL

�� 核心方法

异步在线架构 (Infrastructure)

异步系统与服务架构

灵活的 C/S 架构

  • RL Server 托管模型和API;用户的 Agent 终端通过 HTTP 将交互过程流式传回。不论客户端怎么更换工具,服务器端都可做到无缝接入。

全解耦与异步执行 (Asynchronous)

  • 包含四个全解耦组件:模型推理服务(SGLang)环境服务器PRM奖励与评价服务器策略训练引擎(Megatron)
  • 提取信号、计算Reward和更新模型权重均在后台异步进行,零阻塞(Zero Serving Interruption),完全不影响在线用户的推理延迟。

两种互补信号与混合RL (Methodology)

混合强化学习目标

两类互补的反馈信号 (Next-State Signals)

  • 评测性信号 (Evaluative): 由 PRM 判断上一步动作的好坏,给出一个标量分数 rt{+1,1,0}特点:极度密集(每次对话都有),但信息量低。
  • 指导性信号 (Directive): 若 PRM 认为错误反馈中有明确的指导价值,就会抽取出一句结构化的纠正 Hint(提示)。将 Hint 拼入 Prompt 让 Teacher 跑一遍,生成 Token 级的概率分布来监督 Student。特点:极度稀疏(只有报错/明确反馈时才有),但信息量大。

混合 RL 目标 (Hybrid RL)

  • 算法将上述两者融合进一个单一更新公式:Lhybrid=wRLLGRPO+wOPDLOPD
  • 共享同样的轨迹和策略更新,集高频低质与低频高质的优势于一身。

稳定蒸馏的核心机制

训练稳定性创新

重叠引导的提示选择 (Overlap-Guided Hint Selection)

  • 解决分布不匹配:在多个候选 Hint 中,通过计算引入 Hint 后的 Teacher 分布的 Top-k 词表 与 当前 Student 分布的 Top-k 词表的 交集大小(Overlap)
  • 选择策略:选择重叠度最高的那个 Hint。这意味着 Teacher 要求的纠正方向,已经在 Student 的“高概率舒适区”内,防止了强行逼迫 Student 学习完全陌生的 Token,把重要性权重比率稳在 1 附近。

对数概率差截断 (Log-Probability Difference Clip)

  • 将 Teacher 和 Student 的 Log-Probability 差值限制在 [C,+C] 范围内,控制单次蒸馏更新的 Advantage 上限,大幅抑制极端梯度导致的模型崩溃。

整合长程任务步骤奖励 (Step-wise Reward)

  • 针对通用 Agent 长步骤难以训练的问题,将每次 PRM 给出的“过程奖励均值”直接与最终的“Outcome 奖励”相加,大幅改善信用分配。

实验设置

✍️ 实验设置

实验设置

任务与场景

  • Personal Agents(个性化智能体):模拟 学生(防AI特征)、助教(要求长文打分)、老师(要求语气友好) 三个角色并发使用 OpenClaw 办公,衡量模型自动对齐各用户偏好的效率。
  • General Agents(通用智能体):终端 (Terminal, SETA)、图形界面 (GUI, OSWorld)、代码开发 (SWE, SWE-Bench)、工具调用 (Tool-Call, DAPO)。

基础模型

  • 个性化 RL:Qwen3-4B-Thinking-2507
  • 通用 RL:涵盖 Qwen3-8B, Qwen3VL-8B-Thinking, Qwen3-4B-SFT

超参设置

  • 学习率:1×105(个性化)或 1×106(通用)
  • 损失权重:wRL=wOPD=1
  • Top-k 设定:k=4
  • 混合 PPO 截断参数:ϵlo=0.2,ϵhi=0.28,对数概率截断 C=12

关键结果

�� 关键结果

关键结果

极高的在线个性化效率

  • 在联合优化(多用户并发)下,OpenClaw-RL 平均仅需 10.3 个 Session 就能完成用户偏好对齐,远超单独使用 GRPO (14.1) 和单独的 OPD (29.7),同时也超过了基于外部记忆的 Mem0 等方法,证明了修改模型参数(权重更新)的高效性与可持续性。

通用智能体的规模化突破

  • 第一个成功将 Terminal / GUI / SWE / Tool-call 统一在同一个 RL 流程中的平台。
  • 引入 PRM 和联合奖励后,相比于只能拿到最终结果的纯 Outcome 基线,表现全面跃升:
    • Tool-call (ReTool) 场景下,准确率从 0.19 升至 0.25
    • GUI 场景下,准确率从 0.31 升至 0.33

稳定性策略的消融有效性

  • Hint 选择机制:Overlap 引导(无论是序列最优还是Token最优)的效率与稳定性均大幅优于 Random(随机选择Hint),随机选甚至会导致训练在中途崩溃。
  • 概率截断机制:在无 Clip 设置下,Agent回复长度会出现不受控的爆炸性增长(为了迎合蒸馏信号),导致最终被截断的比例高达 0.5;引入截断后,该问题被彻底解决。

未来方向

未来方向

未来方向

反馈安全性与数据投毒

  • 将模型暴露给真实用户的在线反馈存在风险:恶意的纠正、带误导性的对抗指令可能直接对模型权重进行“投毒”,下一步需要引入更强大的训练数据过滤与防御机制

个人隐私与安全

  • 经过专门针对个人使用习惯和工作数据在线优化后的模型,极大程度地编码了该用户的偏好甚至私密信息。如何保护这种本地/私人化学习的数据不被逆向攻击提取,是必须解决的关键问题。
总访客数:   ·   总访问量:
PLM's Blog @ 2016 - 2026