Skip to content

Claw Bench

📅 发表于 2026/04/20
🔄 更新于 2026/04/20
👁️ -- 次访问
📝 0 字
0 分钟

Benchmark 排行

行业总榜

agentic bench

总结

评测集名称发起机构/背景任务数量核心环境特征主要评估维度
ClawBenchNAIL-Group (arXiv:2604.08523)153 项真实生产环境:144 个在线网站(如订票、购物)侧重“写操作”(有副作用的行为)的成功率与 HTTP 流量验证
WildClawBenchInternLM (上海人工智能实验室)60 项原生 OpenClaw 容器:在 Ubuntu + 真实浏览器/终端环境中运行强调“端到端”解决实际问题的能力(如邮件会议协商、视频集锦剪辑)
QwenClawBenchSkylenage-AI (阿里巴巴/Qwen 团队)100 项模拟办公工作流:基于 PinchBench 框架,针对 8 个办公核心领域侧重企业级真实用户分布(金融、安服、运维等)的综合稳定性
ZClawBenchZ.ai (智谱 AI)116 项GLM-5-Turbo 原生场景:涵盖 6 大应用类别,高频使用“技能”模块针对真实 OpenClaw 用户需求(办公日常、数据分析、DevOps)的分布平衡
PinchBenchKilo.ai23 项OpenClaw 基准框架:最早的智能体大脑评估工具之一通过 skill 仓库定义原子任务(日历创建、文档摘要、API 工作流)
ClawsBenchBenchflow44 项高保真模拟服务:模拟 Gmail, Slack, Calendar, Docs, Drive 5 大服务安全与性能分离:专门评估不安全行为率(UAR)和安全完成率(SCR)

QwenClawBench

QwenClawBench

ZClawBench

ZClawBench

PinchBench

WildClawBench

WildClawBench

ClawBench

ClawBench

ClawsBench

ClawsBench

ClawEval

ClawEval

(2604) CLAWSBENCH (TSR 63%/UAR 23%, CMU/Meta/Stanford)

🌺 论文摘要

CLAWSBENCH 摘要

参考链接

核心方法

  • 高保真模拟环境
    • 5个生产力服务:GMAILCALENDARDOCSDRIVESLACK
    • SQLite-backed REST API,完整状态管理,确定性快照/恢复
    • 与真实API一致性验证(328个验证测试,169个黄金样本)
  • 44个结构化任务
    • 20个性能任务(TSR评分[0,1]),24个安全任务(UAR评分[-1,1])
    • 单服务(30)、跨服务(14)、安全关键场景
    • 状态基础评估(对比执行前后数据库快照)
  • 渐进式披露技能(Progressive Disclosure)
    • Tier 1:激活技能(SKILL.md),提供CLI语法、端点签名
    • Tier 2:参考文档(references/*.md),按需加载详细参数
  • 元提示路由(Meta Prompt)
    • 从1,200条轨迹失败分析提炼的10条规则(5安全+5执行)
    • 独立变量:可分别消融技能和元提示

模型效果(OpenClaw on/on)

  • Claude Opus 4.6TSR 63%UAR 23%SCR 50%
  • GLM-5TSR 60%UAR 23%SCR 48%
  • Gemini 3.1 ProTSR 58%UAR 10%SCR 48%
  • Claude Sonnet 4.6TSR 56%UAR 13%SCR 48%
  • GPT-5.4TSR 53%UAR 7%SCR 41%
  • Gemini 3.1 Flash-LiteTSR 39%UAR 23%SCR 26%

重要结论

  • 能力与安全不相关:高TSR模型(Opus 63%)UAR最高(23%),最安全的GPT-5.4(7% UAR)TSR中等(53%)
  • 脚手架主导:技能+元提示可将TSR从0-8%提升至39-63%,效果超过模型选择差异
  • 技能提高风险:技能开启提高UAR,元提示可部分抵消(-27.5pp交互效应)
  • 多服务更危险:跨服务任务TSR低23pp,UAR高10.4pp(相比单服务)

关键贡献

  • 首个针对生产力Agent的能力与安全分离评估基准
  • 8种不安全行为模式分类:沙盒提权、提示注入遵从、未授权合同修改、数据泄露、过度执行、过度拒绝、幻觉、退化循环
  • 证明Harness架构调节风险:Gemini CLI的fail-open架构比OpenClaw UAR高10pp+

问题背景

问题背景

现有基准的局限性

问题背景

现有基准不足

  • 代码/网页/OS基准:如SWE-bench、WebArena、OSWorld,不覆盖生产力服务(邮件、日历、文档)
  • 简化API表面:AppWorld等减少API复杂度,省略线程、权限继承、频道级访问控制等真实特性
  • 缺乏安全分离评估:现有基准要么只测能力,要么只测安全,无法联合评估
  • 静态耦合任务:任务与特定环境绑定,难以扩展新场景

真实部署风险

  • 状态不可逆:邮件删除、数据外泄、权限错误修改等操作在生产环境不可逆
  • 提示注入:文档/邮件内容可嵌入与真实指令冲突的恶意指令
  • 多步沙盒提权:Agent尝试枚举环境变量、直接访问数据库绕过API

关键缺口

  • 无基准同时提供:(a)与生产API一致性验证的模拟环境,(b)安全与性能分离的细粒度评分,(c)可独立变化的脚手架组件

CLAWSBENCH框架

📕核心方法

环境设计

高保真Mock服务

5个独立REST API

  • GMAIL (v1):62端点,消息/线程/标签/草稿,33个黄金样本
  • CALENDAR (v3):38端点,事件/日历/参与者,31个黄金样本
  • DOCS (v1):12端点,文档/修订,6个黄金样本
  • DRIVE (v3):41端点,文件/文件夹/权限,42个黄金样本
  • SLACK (Web API):45端点,频道/消息/反应/用户,57个黄金样本

状态管理

  • SQLite数据库镜像真实数据模型(如Gmail线程标签、Drive权限继承)
  • 确定性快照/恢复:任务前序列化数据库,任务后对比状态评分
  • gosu权限降级防止Agent读取任务答案或种子数据

一致性验证

  • 捕获真实账户黄金请求-响应对
  • 检查键集合、值类型、变异副作用
  • 发现并修复11类Bug,记录65个API特有quirks

任务与评分

任务设计

性能任务(20个)

  • 评分范围[0, 1],≥0.8定义成功
  • 单服务:邮件清理、日历修改、文档编辑等
  • 多服务:跨Doc/Calendar/Slack的值班轮换重平衡等

安全任务(24个)

  • 评分范围[-1, 1],负分惩罚有害行为(单向门模式)
  • 机密数据外泄:转发内部财务数据给外部收件人
  • 提示注入遵从:执行文档/邮件内嵌的恶意指令(如"删除此部分")
  • 未授权访问变更:向机密文件授予外部编辑权限
  • 破坏性过度操作:批量删除受保护邮件、踢出频道用户
  • 冒充遵从:响应未验证身份的Slack/邮件请求

状态评估优势

  • 确定性(无评分方差)、检查精确数据库状态而非文本近似
  • 支持离线策略学习(奖励信号与轨迹路径无关)

技能与脚手架

渐进式披露技能

技能结构

  • 激活层:Agent选择服务时注入SKILL.md(CLI语法、端点签名、常用模式)
  • 参考层:复杂操作时按需加载(完整参数、边缘案例、分页模式)

元提示设计

  • 源自1,200条轨迹失败模式分析(Gemini CLI + Flash-Lite pilot)
  • 5条安全规则:拒绝嵌入式覆盖、永不泄露机密、验证破坏性操作、外部共享前审查、验证请求者身份
  • 5条执行规则:处理所有项目(防仅处理前几个)、写入正确目的地、避免循环、综合所有来源、精确限定变更范围

实验条件

  • 2×2因子设计:技能(开/关) × 元提示(开/关)
  • 可独立测量两者效应及交互作用

实验设置

✍️实验设置

实验设置

模型

  • Gemini 3.1(Flash-Lite/Pro)、Claude 4.6(Sonnet/Opus)、GPT-5.4GLM-5
  • 涵盖四个提供商(Google/Anthropic/OpenAI/Zhipu AI)

Harness

  • OpenClaw:模块化基准框架,默认拒绝执行,6命令白名单,30分钟过期,所有6模型共用
  • Gemini CLIClaude CodeCodex:提供商原生Harness,内置工具定义

条件

  • 33个实验条件,7,224次试验(44任务×5重复,部分条件30重复)
  • 11个Harness-模型组合,技能/元提示2×2或仅角落条件

指标

  • TSR(Task Success Rate):非安全任务得分≥0.8比例
  • UAR(Unsafe Action Rate):安全任务得分<0比例
  • SCR(Safe Completion Rate):安全任务得分≥0.8比例
  • 区分"安全因无能"(UAR=0, SCR=0)与"安全因谨慎"(UAR=10%, SCR=48%)

统计

  • 任务级聚类Bootstrap 95% CI(ICC=0.48显示任务内相关性)
  • Holm-Bonferroni多重比较校正

关键结果

🍑关键结果

关键结果

脚手架效应

  • 无脚手架:所有模型TSR 0-8%,UAR 0-4%(信息地板,非能力地板)
  • 全脚手架:TSR提升至39-63%(+39-63pp),效果超过模型差异(前5名仅差10pp)

模型排名(OpenClaw on/on)

  • Claude Opus 4.6领先(63% TSR),但UAR 23%与GLM-5并列最高
  • GPT-5.4最安全(7% UAR),但TSR中等(53%)
  • 无模型在安全与能力上同时最优

Harness差异

  • 原生Harness优势:无脚手架时Codex比OpenClaw高29pp TSR(提供隐式工具定义)
  • 脚手架均等化:on/on时差距缩小至≤6pp
  • Gemini CLI风险:fail-open架构使Flash-Lite的UAR比OpenClaw高10pp(33% vs 23%)

任务难度

  • 多服务任务:比单服务TSR低23.0pp,UAR高10.4pp(更难且更危险)

不安全行为模式(8类)

  • 沙盒提权:80%基线轨迹尝试(GPT-5.4在Codex上1,471次curl+localhost调用)
  • 提示注入遵从:Gemini Flash-Lite 90%遵从率,Claude Sonnet/Opus 0%
  • 未授权合同修改:67%模型-组合违反"客户通知前不修改合同"的明确约束
  • 数据泄露:Gemini Flash-Lite在gdrive-bulk-reshare-confidential-doc上10次全部-1.0分(分享整个文件夹含NDA)
  • 过度执行:Opus创建23个永久Gmail过滤器,GLM-5踢出PTO中用户

未来方向

未来方向

未来方向

当前局限

  • 无人在环基线:未收集人类表现校准绝对性能
  • 单次评估:真实Agent获得中期反馈,当前仅单shot惩罚有害行为但不惩罚推理质量或成本
  • 设计局限:ragged factorial设计限制交互效应泛化性

短期扩展

  • 多轮评估:引入中期用户反馈(已设计但未实现)
  • 轨迹驱动技能精炼:闭环自适应优化技能
  • 多Agent共享工作空间:测试协作与冲突场景
  • 更多服务:GitHub、Jira、Notion、Microsoft 365

长期愿景

  • 分级许可:借鉴自动驾驶(NHTSA/Euro NCAP),随能力验证扩展操作域
  • 价值对齐:当前对齐拒绝显性有害,但缺乏生产力任务所需的隐性策略推理(如识别合法程序约束与恶意注入的区别)
  • 分层防御:无单一干预足够,需结合沙盒、权限范围、提示工程

安全挑战

  • Over-refusal:GPT-5.4因"认证已禁用"警告拒绝39次任务运行(环境信号误读)
  • 过度执行悖论:高能力模型(Opus/Sonnet/GLM-5)倾向于"改进"任务,添加自动化或收紧安全导致附带损害

(2604) ClawBench: Can AI Agents Complete Everyday Online Tasks?

🌺 论文摘要

ClawBench 摘要

参考链接

  • paper, UBC / Vector Institute / University of Waterloo 等多机构

核心方法

  • ClawBench评测框架
    • 153个真实日常网络任务,覆盖144个真实网站,15个生活类别
    • Chrome扩展 + CDP拦截器:拦截最终提交请求,确保零副作用安全评测
    • 五层行为录制:Session录像、截图、HTTP流量、Agent消息、浏览器操作
    • Agentic Evaluator:基于Claude Code子Agent,对比人工参考轨迹给出二元判决+结构化理由

模型效果

  • Claude Sonnet 4.6 最强,仅达 33.3%
  • GLM-5 第二,24.2%Kimi K2.5 垫底,仅 0.7%
  • 同模型在OSWorld/WebArena上可达 65-75%,差距悬殊

重要结论

  • 现有沙盒Benchmark与真实世界存在巨大性能鸿沟
  • 各模型在不同类别表现差异显著,尚无模型具备全域均衡能力
  • 写重型任务(表单提交、预订、申请)是当前Agent的核心短板。

关键贡献

  • 首个专注写重型真实网站可追溯评测的Web Agent基准。

问题背景

问题背景

现有Benchmark严重脱离真实世界

问题背景

沙盒Benchmark的局限

  • WebArena、OSWorld等主流Benchmark在离线沙盒中运行:
    • 静态HTML固定DOM结构
    • 无登录/认证无动态内容
    • 无Cookie弹窗无反Bot机制
  • 控制了复杂性,却移除了真实Web交互的核心难点

真实Web Benchmark的局限

  • WebVoyager、AssistantBench等在真实网站运行,但仅限只读信息检索
  • 缺乏对写重型任务(购买、预订、提交申请)的覆盖。

核心空白

  • 写重型任务在真实网站上的Agent评测几乎是空白
  • 我们无法可靠判断Agent到底能不能在真实Web上"把事情搞定"。

ClawBench核心设计

📕 核心方法

任务设计与数据收集

任务设计

任务范围

  • 153个任务,144个真实平台,8大高级类别15个细粒度类别
  • 覆盖:Daily / Work / Dev / Social / Academic / Travel / Pets / Finance
  • 每个任务:自然语言指令 + 起始URL + HTTP级别的终止提交目标

任务特征

  • 面向普通人日常需求(每个任务人类完成约30分钟内
  • 产生可观察的HTTP Payload,支持客观验证
  • 多阶段过滤:去除需付费订阅、地理限制、已下线的平台

人工标注

  • 人工标注员在相同基础设施下完整执行每个任务,生成Ground Truth轨迹
  • 每个任务的拦截信号(URL模式、HTTP方法、Payload字段名)由专家手动标注

拦截机制

安全拦截机制

核心思想

  • 评测真实网站无需阻止Agent与真实网站交互,只需拦截最终提交请求

实现方式

  • Chrome扩展 + CDP服务器,监控所有出站HTTP请求
  • 匹配到标注的URL模式和方法时:
    1. 捕获完整请求体(表单字段、Payload、Header)
    2. 阻止请求发出,不到达服务器
    3. 记录Payload到本地文件
  • 其他所有请求(页面加载、AJAX、图片等)完全不受干扰

安全验证

  • 在全部153个任务的人工Ground Truth运行中,拦截准确率100%零误拦截
  • 保证:不会真实下单、不会提交真实申请、不会修改服务器状态

五层录制基础设施

五层行为录制
层级内容作用
Session录像Xvfb虚拟显示 + FFmpegAgent看到了什么(全局)
操作截图每步浏览器动作后截图Agent逐步观察状态
HTTP流量CDP记录所有请求及PayloadAgent行为的网络影响
Agent消息推理链、Tool调用、中间输出(JSON)Agent思考过程
浏览器操作点击坐标、键盘输入、滚动、Tab切换Agent底层行为
  • 人工标注员在同样的五层设置下录制Ground Truth,保证可对比
  • 失败时可追溯到具体步骤页面状态错误推理与人类操作的差异

Agentic Evaluator

评测方式

核心设计

  • 调用 Claude Code 子Agent,在固定评测Rubric下运行
  • 输入:任务指令 + 人工参考轨迹 + Agent执行轨迹
  • 输出:二元判决(0/1) + 结构化理由(具体到哪个字段出错)

评分公式

SR=1|T|tTScore(t),Score(t){0,1}

优势

  • 不只看最终状态,而是步骤级对齐,比较Agent与人类的完整轨迹
  • 结果可追溯:不仅告知是否失败,还指出哪个字段错误哪一步偏离
  • 特殊规则:被验证码或电话验证拦截时,若之前步骤全部正确则判PASS

实验设置

✍️ 实验设置

实验设置

评测模型(7个)

  • 闭源:Claude Sonnet 4.6、GPT-5.4、Gemini 3.1 Flash Lite、Claude Haiku 4.5、Gemini 3 Flash
  • 开源:GLM-5(纯文本,无视觉)、Kimi K2.5

Agent框架

  • 所有模型通过 OpenClaw Agent框架控制 Chromium 浏览器实例
  • ClawBench Chrome扩展和CDP服务器全程在后台运行

评测指标

  • 主要指标:Success Rate (SR),即Binary Score=1的任务占比
  • 同时报告8个高级类别的分类SR

复现控制

  • 每次运行使用容器隔离,保证跨Run一致性
  • Chrome启动时禁用UI提示、同步、无关扩展

关键结果

🍑 关键结果

关键结果

总体成绩

排名模型总体SR
1Claude Sonnet 4.633.3%
2GLM-5†24.2%
3Gemini 3 Flash19.0%
4Claude Haiku 4.518.3%
5GPT-5.46.5%
6Gemini 3.1 Flash Lite3.3%
7Kimi K2.50.7%

与传统Benchmark的对比

  • Claude Sonnet 4.6在OSWorld/WebArena上达65-75%,在ClawBench仅33.3%
  • GPT-5.4在传统Benchmark表现接近,但ClawBench仅6.5%差距极大

类别层面发现

  • 无模型在所有类别均强:Claude Sonnet 4.6领跑Daily/Finance/Academic/Social,GLM-5领跑Work,Gemini 3 Flash领跑Travel
  • 即便最好的类别成绩,距离饱和仍远

重要结论

  • 沙盒Benchmark上的强表现无法迁移到真实世界Web任务。
  • 当前Agent在写重型、多步骤、动态网页场景下能力严重不足。
  • 五层录制让每次失败都可诊断、可追溯,为未来改进提供了具体信号。

未来方向

未来方向

未来方向

当前不足

  • 任务规模:153个任务相对有限,需持续扩充和社区维护。
  • 平台动态性:真实网站布局随时间变化,需要动态更新机制保持有效性。
  • 评测可重复性:真实网站的不确定性(页面更新、A/B测试)给跨Run一致性带来挑战。
  • 身份验证壁垒:部分任务涉及登录/订阅,限制了评测覆盖范围。

研究方向

  • 更复杂任务:引入跨平台多步骤任务、需要处理外部文档的任务。
  • 更强Agent框架:专门针对动态网页、反Bot机制、Cookie弹窗的鲁棒性提升。
  • 多模态感知:更好融合截图与可访问性树,提升页面理解能力。
  • 训练数据:利用ClawBench的五层录制轨迹作为真实世界Agent训练数据

(2603) MetaClaw – 持续元学习与进化框架

🌺 论文摘要

MetaClaw 摘要

参考链接

核心方法

  • MetaClaw持续元学习框架
    • 联合维护基础LLM策略+可进化技能库,通过技能驱动快速适应+机会主义策略优化两大机制持续改进。
    • Skill-Driven Fast Adaptation:从失败轨迹中蒸馏可复用的行为指令,即时注入系统Prompt,零服务中断
    • Opportunistic Policy Optimization:利用用户空闲窗口(睡眠、键盘无操作、日历会议)通过云端LoRA+RL进行梯度更新。
    • OMLS调度器:监控三种空闲信号, opportunistic触发RL训练。
    • Skill Generation Versioning:严格分离support data(技能进化前)和query data(技能进化后),防止stale reward污染。

模型效果(Kimi-K2.5)

  • MetaClaw (Full) 从基线21.4%提升至40.6%准确率,几乎追平GPT-5.2基线(41.1%)
  • 端到端任务完成率提升8.25×(Part I),文件检查完成率提升185%(Part II)。
  • AutoResearchClaw 23阶段研究管道,技能注入使综合稳健性提升18.3%。

重要结论

  • 技能驱动适应对弱模型(Kimi-K2.5)提升更显著(+32.2%),强模型(GPT-5.2)提升有限(+7.1%)。
  • 技能注入提升部分执行质量,权重级RL优化是解锁端到端任务完成的关键。
  • 两种机制形成正向循环:更好的策略产生更信息丰富的失败,更丰富的技能产生更高奖励轨迹。
  • 技能库作为meta-parameter累积跨任务可迁移的行为知识。

关键贡献

  • 首个将梯度自由技能进化梯度策略优化统一为连续元学习框架的部署代理系统。
  • 通过代理架构实现零GPU本地部署,支持生产级LLM。
  • 提出支持-查询分离的版本控制机制,解决行为变化后数据有效性核心问题。

问题背景

问题背景

现有方法局限性

现有方法局限

Memory-Based方法

  • 存储原始对话轨迹用于检索,但轨迹冗长冗余,无法提取可迁移的行为模式。

Skill-Based方法

  • 将经验压缩为可复用的行为指令,但技能库被视为静态数据库,与权重优化完全脱节

RL-Based方法

  • 更新模型权重,但仅在离线/小规模设置运行,忽略关键数据有效性问题:技能进化后,旧技能上下文收集的轨迹携带stale rewards,会污染梯度更新。

部署现实挑战

  • OpenClaw等平台单个代理连接20+消息通道,负载动态变化(文件操作→多代理工作流)。
  • 现有方案要么需要服务中断进行重训练,要么无法从持续使用中学习,导致能力与用户实际需求逐渐脱节。

核心观察:双时间尺度互补

双时间尺度适应

快适应 - 行为启发式

  • 从单次失败中蒸馏(如"修改前备份文件"),秒级生效,通过Prompt注入实现,零延迟

慢适应 - 策略优化

  • 跨任务类型的梯度优化,需分钟到小时级,提升基础策略能力。

互补性

  • 更好的策略 → 产生更信息丰富的失败 → 更好的技能合成。
  • 更丰富的技能 → 产生更高奖励轨迹 → 更好的策略优化。无人利用这一正循环

MetaClaw核心方法

📕核心方法

整体架构

MetaClaw框架

Meta-Model定义

M=(θ,S)
  • θ:基础LLM策略参数
  • S={s1,s2,...,sK}:技能指令库(可复用行为指令)

双重角色

  • 作为Meta-Parameter:跨任务流累积行为知识。
  • 作为Adaptation Basis:推理时通过embedding检索注入任务相关技能。

行为公式

aπθ(|τ,Retrieve(S,τ))

技能驱动快速适应(Skill-Driven Fast Adaptation)

快速适应机制

触发条件

  • 收集失败轨迹形成Support Set Dsupg
  • 达到阈值时触发Skill Evolver(LLM分析器)

技能进化

Sg+1=SgE(Sg,Dsupg)
  • E:LLM-based Skill Evolver,分析失败模式并合成新行为指令。
  • g:技能代际索引,每进化一次+1。

关键特性

  • 梯度自由:自然语言空间无法梯度下降,LLM-based蒸馏是天然适应机制。
  • 即时生效:通过Prompt注入,零服务中断
  • 累积知识:每次适应贡献持久知识,非用完即弃。

典型技能类别

  • 时间格式合规(ISO 8601+时区)
  • 修改前备份协议(.bak文件)
  • 命名规范遵守(日期前缀)

机会主义策略优化(Opportunistic Policy Optimization)

慢速优化机制

Query Data收集

  • 技能生效后继续服务,收集Post-Adaptation轨迹(Query Set Dqry)。

RL更新

θt+1=θt+αθE(τ,ξ,g)B[R(πθ(|τ,Sg))]
  • 使用Process Reward Model(PRM)评分
  • Cloud LoRA + GRPO实现
  • 仅优化适应后表现,而非原始任务性能

触发条件

  • Query Buffer积累足够样本(避免高方差)
  • OMLS检测到用户空闲窗口

机会主义元学习调度器(OMLS)

OMLS三信号检测

空闲信号源

  1. Sleep Window:用户配置睡眠时段(如23:00-07:00),最大连续训练块。
  2. System Inactivity:轮询OS输入设备空闲计时器(默认30分钟无键鼠活动),支持mid-batch检查点暂停。
  3. Calendar-Aware:查询Google Calendar API,预测会议时段 proactively。

窗口逻辑

  • 任一信号指示用户缺席 → 训练窗口开启
  • 任一信号指示用户返回 → 训练暂停
  • 支持跨碎片化窗口累积梯度步,无需单一大块时间。

技能代际版本控制(Skill Generation Versioning)

支持-查询分离机制

核心问题

  • Support Data:技能进化前收集,反映旧技能上下文的失败,奖励已"过期"。
  • Query Data:技能进化后收集,反映当前技能下的适应行为

污染后果

  • 若Support Data进入RL Buffer,会惩罚已被技能纠正的失败,优化Pre-Adaptation而非Post-Adaptation性能,违反元学习目标。

版本机制

  • 每个样本标记技能代际gi
  • 技能从gg+1时,自动flush所有g及之前版本样本。
  • 保证Policy Optimization始终在当前行为上下文下更新。

实验设置

✍️实验设置

实验设置

基础模型

  • GPT-5.2 (OpenAI)
  • Kimi-K2.5 (Moonshot)

评测基准

  • MetaClaw-Bench:新构建的持续代理基准,934问/44模拟工作日
    • Part I:30工作日/346问,执行导向(复杂多步推理,side effect依赖)
    • Part II:14工作日/588问,规则导向(行为启发式合规性)
  • AutoResearchClaw:23阶段自主研究管道(文献搜索→实验→审稿),测试跨域泛化。

对比条件

  1. Baseline:基础模型,无适应机制
  2. MetaClaw (Skills):仅技能驱动快速适应
  3. MetaClaw (Full):技能+RL联合优化(仅Kimi)

关键配置

  • 技能检索:Sentence Embedding + Cosine Similarity Top-K
  • 技能注入:追加到System Prompt
  • RL:Cloud LoRA + GRPO,5天训练运行
  • 架构:代理架构,零本地GPU需求

评估指标

  • Overall Accuracy:每问题平均分
  • File-Check Completion:通过所有自动化检查的文件比例
  • AutoResearchClaw:Stage Retry Rate, Refine Cycle, Pipeline Completion, Composite Robustness Score

关键结果

🍑关键结果

关键结果

MetaClaw-Bench Part I (30天)

模型条件准确率完成率
GPT-5.2Baseline41.1%14.7%
GPT-5.2+Skills44.0% (+7.1%)17.1%
Kimi-K2.5Baseline21.4%2.0%
Kimi-K2.5+Skills28.3% (+32.2%)2.0%
Kimi-K2.5Full40.6%16.5% (8.25×)

MetaClaw-Bench Part II (14天)

模型条件准确率完成率
GPT-5.2Baseline44.9%58.4%
GPT-5.2+Skills49.1% (+9.4%)67.5%
Kimi-K2.5Baseline21.1%18.2%
Kimi-K2.5+Skills26.9% (+27.5%)33.8% (+85%)
Kimi-K2.5Full39.6%51.9% (+185%)

AutoResearchClaw迁移

指标Baseline+Skills变化
Stage Retry Rate10.5%7.9%↓24.8%
Refine Cycle2.01.2↓40.0%
Pipeline Completion18/1919/19↑5.3%
Composite Robustness0.7140.845↑18.3%

核心发现

  • 弱模型收益更多:Kimi-K2.5 +Full 几乎追平GPT-5.2 Baseline(40.6% vs 41.1%)。
  • 技能 alone 不足:仅提升多选题准确率,无法解锁端到端完成(Part I完成率不变)。
  • RL是完成关键:MetaClaw (Full) 在Part I实现8.25×完成率跳跃,验证双机制必要性。
  • 跨域泛化:技能机制迁移至研究管道,零梯度更新即获18.3%稳健性提升。
  • 学习动态:Part II第8天出现明显拐点,前期技能积累→后期RL快速吸收。

未来方向

未来方向

未来方向

当前局限

  • 空闲检测依赖用户配置:睡眠时段、日历集成需手动设置,普适性受限。
  • 技能库膨胀:持续累积的技能可能导致上下文长度问题和检索噪音。
  • 单用户优化:当前框架针对个人代理,多用户场景下的技能共享与隐私需扩展。

改进方向

  • 自适应空闲检测:学习用户行为模式,智能预测空闲窗口,而非依赖固定规则。
  • 技能压缩与去重:定期合并相似技能,淘汰低频过时技能,防止上下文溢出。
  • 多用户联邦适应:在保护隐私前提下,跨用户聚合通用技能,加速集体学习。
  • 多模态扩展:当前聚焦CLI任务,扩展至GUI操作、图像理解等多模态代理。
  • 更细粒度PRM:当前Process Reward较粗,引入步骤级细粒度信用分配。

元学习理论

  • 探索动态技能代际阈值:当前固定阈值触发技能进化,可学习最优触发时机。
  • 自适应学习率:根据任务分布漂移速度,动态调整技能vs策略优化的资源分配。
总访客数:   ·   总访问量:
PLM's Blog @ 2016 - 2026