Claw SFT 训练相关
📅 发表于 2026/05/06
🔄 更新于 2026/05/06
👁️ -- 次访问
📝 0 字
⏳ 0 分钟
🌺 论文摘要
参考链接
核心方法
ClawGym 框架:首个支持“数据合成-智能体训练-诊断评测”全生命周期的可扩展框架。双路数据合成 (ClawGym-SynData):结合自顶向下 (用户画像驱动)和自底向上 (技能基石驱动)策略,生成并过滤出 13.5K 训练任务,搭配自动生成的 mock 工作区和代码+量规混合验证器。模型训练 (ClawGym-Agents):在 OpenClaw 黑盒环境中 Rollout 收集轨迹,进行 SFT,并引入轻量级沙盒并发 RL 进行强化学习。评测基准 (ClawGym-Bench):200 个经过难度过滤和人类-LLM协作审查的高质量基准测试。模型效果
Qwen3-8B 在 PinchBench 上提升 38.90%,在 ClawGym-Bench 上提升 43.46%。ClawGym-30A3B 在 PinchBench 取得 86.0 分,超越 Claude-4.7-Opus 等闭源前沿模型,在 ClawGym-Bench 取得 56.82 分。重要结论
混合合成策略 (画像+技能) 极具协同效应,效果优于单一策略。Reward 阈值过滤 (0.5) 能有效平衡任务完成度和数据多样性。沙盒并发 RL 能在 SFT 的基础上进一步稳定提升智能体性能。关键贡献
ClawGym 框架,解决了 Claw-style 环境下长期缺乏大规模、可验证训练数据及系统性评测方案的问题。❓问题背景
Claw-style 任务的独特性与挑战
环境复杂性:与传统孤立对话框或纯文本推理(如AIME)不同,Claw-style Agent 部署在用户的计算机环境中,需要调用系统工具、管理本地文件并进行多步长工作流。执行环境不透明:系统接口通常是黑盒的,Agent 需要处理模糊的指令、未预期的工作区状态、工具报错以及跨 session 的长上下文依赖。现有训练与评测数据的局限性
个性化场景难以覆盖:用户日常任务极具多样性,很难定义具备代表性的静态数据集。长视野任务难以自动验证:涉及文件修改、数据转换等,单靠文本对比无法验证。缺乏逼真的工作区环境:需要安全的、特定任务绑定的 mock 文件和资源,而不是依赖用户真实隐私文件。📕核心方法
核心思想
1. 自顶向下 (Persona-Driven) 合成
基于画像驱动:从 10 亿画像中采样,结合 43 个场景子类、26 种原子操作构建 Task Seed。特点:保障了任务场景的多样性和贴近真实用户需求的业务逻辑。2. 自底向上 (Skill-Grounded) 合成
基于技能组装:从 ClawHub 中提取约 30K 真实技能(如文件操作、网页交互),过滤出 16K 可用技能。抽取 1 个主要技能 + N 个辅助技能组合生成任务。特点:保障了任务在 OpenClaw 框架中的可执行性和工具调用的落地性。3. 资源生成与混合验证 (Hybrid Verification)
资源准备:自动生成轻量级 mock 文件(如 csv, json, md),构建独立的初始环境状态。代码验证 (权重0.7):生成 Python 脚本校验文件是否存在、schema 是否合规、计算是否正确。量规验证 (权重0.3):生成 Rubric,通过 LLM 评估回复的语气、连贯性和总结全面性。质量自动化审计:使用强大的 LLM (GPT-5.4) 审计任务的合理性、新颖度以及验证器是否存在过度严格或无效判断的问题。1. 黑盒 Rollout 轨迹收集
2. 轨迹过滤与 SFT
阈值过滤 (Reward > 0.5),选出 24.5K 条兼顾完成度和行为多样性的高质量轨迹。Loss Masking:训练时对 Docker 返回的环境观测反馈不计算 loss,强制模型学习“如何决策和调用工具”,而非“死记硬背环境回显”。3. 沙盒并发强化学习 (RL)
Sandbox-Parallel Pipeline,使每个任务在独立的 Docker 虚拟沙盒中运行。算法:基于 GRPO,仅使用代码验证器给出的 Outcome Reward 信号进行优化。构建流程
大/小模型对战进行难度过滤(剔除太简单或连大模型都做不出的题目)。人类-LLM协作审查:GPT-5.4 初审寻找漏洞,人类复核并修正细节。200 个高质量基准测试,分为 6 大核心场景(生产力、系统自动化、分析推理、软件开发等)。✍️实验设置
基座模型与对比模型
闭源前沿:Claude-4.7-Opus, Claude-4.6, Gemini-3-Flash, GPT-5.4开源前沿:DeepSeek-V3.2, GLM-5.1, MiniMax-M2.7, Kimi-K2.6, Qwen3.5-Plus训练基座:Qwen3-4B-Instruct, Qwen3-8B, Qwen3-30B-A3B-Instruct评测任务
ClawGym-Bench:本文构建的 200 个诊断级任务。PinchBench:外部的第三方评测基准(保留 30 个非多模态任务)。关键超参与设置
64KGRPO,学习率 1e-6,Batch Size=8,Rollouts=8,步数 100 步。🍑关键结果
1. 模型效果 (ClawGym-Agents SFT)
ClawGym-4B/8B/30A3B 在 ClawGym-Bench 上分别达到 47.73 / 50.24 / 56.82 分,稳定超越原始的 Qwen 基座。ClawGym-30A3B 取得 86.00 分,超过了极高比例的专有大模型(如 Claude-4.7-Opus 获得 79.40 分),证明了学习到的 Agent 原理具备极强的泛化性。2. 混合成效消融实验 (Synergy)
Mixed Synthesis (混合合成) 的表现显著高于单纯依靠 Persona 或 Skill 进行合成。只有将“抽象用户需求多样性”与“具体工具执行边界”结合,模型才能真正举一反三。3. RL 提升与过滤策略
0.5 最优:阈值过低引入脏数据,阈值过高 (如 0.9) 会抹杀掉模型在出错边缘尝试挽回的宝贵探究行为(丢失多样性)。4. 行为洞察 (Behavioral Analysis)
长视野执行鲁棒性:强模型出错后会重置状态重新执行并自查;弱模型会死循环或卡在授权环节。细粒度指令遵循:弱模型喜欢生成“看起来正确”的文件格式,但在底层过滤条件(如商品数量阈值)上经常把控失败并将其扩散到下游。⛳ 未来方向
评估维度的扩展
Final-State Correctness(最终文件状态的正确性)。安全性 (Safety)、执行效率 (Efficiency) 以及面对复杂突发报错时的错误恢复能力 (Error Recovery)。连续 Reward 分数的轨迹筛选
[0, 1] 的连续分数,未来将探索更科学且系统化的连续分数样本选择方法。�� 论文摘要
参考链接
核心方法
OpenClaw-RL 框架提取两类互补信号评测性信号(Evaluative,标量)和指导性信号(Directive,Token级)。重叠引导与混合RL模型效果
10.3 个对话 Session 即可完美对齐用户专属偏好。重要结论
Hybrid RL (混合RL) 比单纯的 GRPO(标量奖励)或 OPD(在策略蒸馏)效率都更高,因为两者在“出现频率”和“信息密度”上完美互补。Overlap-Guided (重叠引导) 和 对数概率截断 极大缓解了 Teacher-Student 模型在知识蒸馏中的分布偏移问题,保障了训练的稳定性。关键贡献
❓ 问题背景
RL 基础设施不支持实时“活”数据
标量奖励与Token级蒸馏的痛点
RLVR(可验证奖励RL)局限:只支持标量奖励(对或错)。比如用户骂了一句“你搞错了,应该先查文件”,RLVR 只能提取出一个 -1 分,浪费了具体“怎么改”的语义信息。OPD(在策略蒸馏)的缺陷:利用Teacher模型结合Hint(提示)来教Student模型,虽然提供了Token级别的密集信号,但经常遭遇 Teacher-Student 分布不匹配。当Teacher纠正的方向是Student压根没见过的词时,会导致重要性采样比率爆炸,训练极不稳定。�� 核心方法
灵活的 C/S 架构
全解耦与异步执行 (Asynchronous)
两类互补的反馈信号 (Next-State Signals)
评测性信号 (Evaluative): 由 PRM 判断上一步动作的好坏,给出一个标量分数 指导性信号 (Directive): 若 PRM 认为错误反馈中有明确的指导价值,就会抽取出一句结构化的纠正 Hint(提示)。将 Hint 拼入 Prompt 让 Teacher 跑一遍,生成 Token 级的概率分布来监督 Student。特点:极度稀疏(只有报错/明确反馈时才有),但信息量大。混合 RL 目标 (Hybrid RL)
重叠引导的提示选择 (Overlap-Guided Hint Selection)
解决分布不匹配:在多个候选 Hint 中,通过计算引入 Hint 后的 Teacher 分布的 Top-选择策略:选择重叠度最高的那个 Hint。这意味着 Teacher 要求的纠正方向,已经在 Student 的“高概率舒适区”内,防止了强行逼迫 Student 学习完全陌生的 Token,把重要性权重比率稳在 1 附近。对数概率差截断 (Log-Probability Difference Clip)
整合长程任务步骤奖励 (Step-wise Reward)
✍️ 实验设置
任务与场景
Personal Agents(个性化智能体):模拟 学生(防AI特征)、助教(要求长文打分)、老师(要求语气友好) 三个角色并发使用 OpenClaw 办公,衡量模型自动对齐各用户偏好的效率。General Agents(通用智能体):终端 (Terminal, SETA)、图形界面 (GUI, OSWorld)、代码开发 (SWE, SWE-Bench)、工具调用 (Tool-Call, DAPO)。基础模型
Qwen3-4B-Thinking-2507Qwen3-8B, Qwen3VL-8B-Thinking, Qwen3-4B-SFT。超参设置
�� 关键结果
极高的在线个性化效率
通用智能体的规模化突破
Tool-call (ReTool) 场景下,准确率从 0.19 升至 0.25。GUI 场景下,准确率从 0.31 升至 0.33。稳定性策略的消融有效性
Hint 选择机制:Overlap 引导(无论是序列最优还是Token最优)的效率与稳定性均大幅优于 Random(随机选择Hint),随机选甚至会导致训练在中途崩溃。概率截断机制:在无 Clip 设置下,Agent回复长度会出现不受控的爆炸性增长(为了迎合蒸馏信号),导致最终被截断的比例高达 0.5;引入截断后,该问题被彻底解决。⛳ 未来方向
反馈安全性与数据投毒
个人隐私与安全