Claw Bench
📅 发表于 2026/04/20
🔄 更新于 2026/04/20
👁️ -- 次访问
📝 0 字
⏳ 0 分钟
| 评测集名称 | 发起机构/背景 | 任务数量 | 核心环境特征 | 主要评估维度 |
|---|---|---|---|---|
| ClawBench | NAIL-Group (arXiv:2604.08523) | 153 项 | 真实生产环境:144 个在线网站(如订票、购物) | 侧重“写操作”(有副作用的行为)的成功率与 HTTP 流量验证 |
| WildClawBench | InternLM (上海人工智能实验室) | 60 项 | 原生 OpenClaw 容器:在 Ubuntu + 真实浏览器/终端环境中运行 | 强调“端到端”解决实际问题的能力(如邮件会议协商、视频集锦剪辑) |
| QwenClawBench | Skylenage-AI (阿里巴巴/Qwen 团队) | 100 项 | 模拟办公工作流:基于 PinchBench 框架,针对 8 个办公核心领域 | 侧重企业级真实用户分布(金融、安服、运维等)的综合稳定性 |
| ZClawBench | Z.ai (智谱 AI) | 116 项 | GLM-5-Turbo 原生场景:涵盖 6 大应用类别,高频使用“技能”模块 | 针对真实 OpenClaw 用户需求(办公日常、数据分析、DevOps)的分布平衡 |
| PinchBench | Kilo.ai | 23 项 | OpenClaw 基准框架:最早的智能体大脑评估工具之一 | 通过 skill 仓库定义原子任务(日历创建、文档摘要、API 工作流) |
| ClawsBench | Benchflow | 44 项 | 高保真模拟服务:模拟 Gmail, Slack, Calendar, Docs, Drive 5 大服务 | 安全与性能分离:专门评估不安全行为率(UAR)和安全完成率(SCR) |
🌺 论文摘要
参考链接
核心方法
高保真模拟环境GMAIL、CALENDAR、DOCS、DRIVE、SLACK44个结构化任务渐进式披露技能(Progressive Disclosure)Tier 1:激活技能(SKILL.md),提供CLI语法、端点签名Tier 2:参考文档(references/*.md),按需加载详细参数元提示路由(Meta Prompt)模型效果(OpenClaw on/on)
Claude Opus 4.6:TSR 63%,UAR 23%,SCR 50%GLM-5:TSR 60%,UAR 23%,SCR 48%Gemini 3.1 Pro:TSR 58%,UAR 10%,SCR 48%Claude Sonnet 4.6:TSR 56%,UAR 13%,SCR 48%GPT-5.4:TSR 53%,UAR 7%,SCR 41%Gemini 3.1 Flash-Lite:TSR 39%,UAR 23%,SCR 26%重要结论
能力与安全不相关:高TSR模型(Opus 63%)UAR最高(23%),最安全的GPT-5.4(7% UAR)TSR中等(53%)脚手架主导:技能+元提示可将TSR从0-8%提升至39-63%,效果超过模型选择差异技能提高风险:技能开启提高UAR,元提示可部分抵消(-27.5pp交互效应)多服务更危险:跨服务任务TSR低23pp,UAR高10.4pp(相比单服务)关键贡献
能力与安全分离评估基准8种不安全行为模式分类:沙盒提权、提示注入遵从、未授权合同修改、数据泄露、过度执行、过度拒绝、幻觉、退化循环Harness架构调节风险:Gemini CLI的fail-open架构比OpenClaw UAR高10pp+❓问题背景
现有基准不足
代码/网页/OS基准:如SWE-bench、WebArena、OSWorld,不覆盖生产力服务(邮件、日历、文档)简化API表面:AppWorld等减少API复杂度,省略线程、权限继承、频道级访问控制等真实特性缺乏安全分离评估:现有基准要么只测能力,要么只测安全,无法联合评估静态耦合任务:任务与特定环境绑定,难以扩展新场景真实部署风险
状态不可逆:邮件删除、数据外泄、权限错误修改等操作在生产环境不可逆提示注入:文档/邮件内容可嵌入与真实指令冲突的恶意指令多步沙盒提权:Agent尝试枚举环境变量、直接访问数据库绕过API关键缺口
(a)与生产API一致性验证的模拟环境,(b)安全与性能分离的细粒度评分,(c)可独立变化的脚手架组件📕核心方法
5个独立REST API
GMAIL (v1):62端点,消息/线程/标签/草稿,33个黄金样本CALENDAR (v3):38端点,事件/日历/参与者,31个黄金样本DOCS (v1):12端点,文档/修订,6个黄金样本DRIVE (v3):41端点,文件/文件夹/权限,42个黄金样本SLACK (Web API):45端点,频道/消息/反应/用户,57个黄金样本状态管理
一致性验证
性能任务(20个)
[0, 1],≥0.8定义成功安全任务(24个)
[-1, 1],负分惩罚有害行为(单向门模式)机密数据外泄:转发内部财务数据给外部收件人提示注入遵从:执行文档/邮件内嵌的恶意指令(如"删除此部分")未授权访问变更:向机密文件授予外部编辑权限破坏性过度操作:批量删除受保护邮件、踢出频道用户冒充遵从:响应未验证身份的Slack/邮件请求状态评估优势
技能结构
激活层:Agent选择服务时注入SKILL.md(CLI语法、端点签名、常用模式)参考层:复杂操作时按需加载(完整参数、边缘案例、分页模式)元提示设计
实验条件
✍️实验设置
模型
Gemini 3.1(Flash-Lite/Pro)、Claude 4.6(Sonnet/Opus)、GPT-5.4、GLM-5Harness
OpenClaw:模块化基准框架,默认拒绝执行,6命令白名单,30分钟过期,所有6模型共用Gemini CLI、Claude Code、Codex:提供商原生Harness,内置工具定义条件
指标
TSR(Task Success Rate):非安全任务得分≥0.8比例UAR(Unsafe Action Rate):安全任务得分<0比例SCR(Safe Completion Rate):安全任务得分≥0.8比例统计
🍑关键结果
脚手架效应
无脚手架:所有模型TSR 0-8%,UAR 0-4%(信息地板,非能力地板)全脚手架:TSR提升至39-63%(+39-63pp),效果超过模型差异(前5名仅差10pp)模型排名(OpenClaw on/on)
Claude Opus 4.6领先(63% TSR),但UAR 23%与GLM-5并列最高GPT-5.4最安全(7% UAR),但TSR中等(53%)Harness差异
原生Harness优势:无脚手架时Codex比OpenClaw高29pp TSR(提供隐式工具定义)脚手架均等化:on/on时差距缩小至≤6ppGemini CLI风险:fail-open架构使Flash-Lite的UAR比OpenClaw高10pp(33% vs 23%)任务难度
多服务任务:比单服务TSR低23.0pp,UAR高10.4pp(更难且更危险)不安全行为模式(8类)
沙盒提权:80%基线轨迹尝试(GPT-5.4在Codex上1,471次curl+localhost调用)提示注入遵从:Gemini Flash-Lite 90%遵从率,Claude Sonnet/Opus 0%未授权合同修改:67%模型-组合违反"客户通知前不修改合同"的明确约束数据泄露:Gemini Flash-Lite在gdrive-bulk-reshare-confidential-doc上10次全部-1.0分(分享整个文件夹含NDA)过度执行:Opus创建23个永久Gmail过滤器,GLM-5踢出PTO中用户⛳ 未来方向
当前局限
无人在环基线:未收集人类表现校准绝对性能单次评估:真实Agent获得中期反馈,当前仅单shot惩罚有害行为但不惩罚推理质量或成本设计局限:ragged factorial设计限制交互效应泛化性短期扩展
多轮评估:引入中期用户反馈(已设计但未实现)轨迹驱动技能精炼:闭环自适应优化技能多Agent共享工作空间:测试协作与冲突场景更多服务:GitHub、Jira、Notion、Microsoft 365长期愿景
分级许可:借鉴自动驾驶(NHTSA/Euro NCAP),随能力验证扩展操作域价值对齐:当前对齐拒绝显性有害,但缺乏生产力任务所需的隐性策略推理(如识别合法程序约束与恶意注入的区别)分层防御:无单一干预足够,需结合沙盒、权限范围、提示工程安全挑战
Over-refusal:GPT-5.4因"认证已禁用"警告拒绝39次任务运行(环境信号误读)过度执行悖论:高能力模型(Opus/Sonnet/GLM-5)倾向于"改进"任务,添加自动化或收紧安全导致附带损害🌺 论文摘要
参考链接
核心方法
ClawBench评测框架153个真实日常网络任务,覆盖144个真实网站,15个生活类别Chrome扩展 + CDP拦截器:拦截最终提交请求,确保零副作用安全评测五层行为录制:Session录像、截图、HTTP流量、Agent消息、浏览器操作Agentic Evaluator:基于Claude Code子Agent,对比人工参考轨迹给出二元判决+结构化理由模型效果
Claude Sonnet 4.6 最强,仅达 33.3%GLM-5 第二,24.2%;Kimi K2.5 垫底,仅 0.7%65-75%,差距悬殊重要结论
巨大性能鸿沟。全域均衡能力。关键贡献
写重型、真实网站、可追溯评测的Web Agent基准。❓ 问题背景
沙盒Benchmark的局限
离线沙盒中运行: 静态HTML,固定DOM结构无登录/认证,无动态内容无Cookie弹窗,无反Bot机制移除了真实Web交互的核心难点。真实Web Benchmark的局限
仅限只读信息检索。写重型任务(购买、预订、提交申请)的覆盖。核心空白
写重型任务在真实网站上的Agent评测几乎是空白。📕 核心方法
任务范围
153个任务,144个真实平台,8大高级类别、15个细粒度类别自然语言指令 + 起始URL + HTTP级别的终止提交目标任务特征
30分钟内)可观察的HTTP Payload,支持客观验证人工标注
完整执行每个任务,生成Ground Truth轨迹拦截信号(URL模式、HTTP方法、Payload字段名)由专家手动标注核心思想
无需阻止Agent与真实网站交互,只需拦截最终提交请求。实现方式
Chrome扩展 + CDP服务器,监控所有出站HTTP请求捕获完整请求体(表单字段、Payload、Header)阻止请求发出,不到达服务器记录Payload到本地文件完全不受干扰安全验证
准确率100%,零误拦截不会真实下单、不会提交真实申请、不会修改服务器状态| 层级 | 内容 | 作用 |
|---|---|---|
| Session录像 | Xvfb虚拟显示 + FFmpeg | Agent看到了什么(全局) |
| 操作截图 | 每步浏览器动作后截图 | Agent逐步观察状态 |
| HTTP流量 | CDP记录所有请求及Payload | Agent行为的网络影响 |
| Agent消息 | 推理链、Tool调用、中间输出(JSON) | Agent思考过程 |
| 浏览器操作 | 点击坐标、键盘输入、滚动、Tab切换 | Agent底层行为 |
具体步骤、页面状态、错误推理、与人类操作的差异核心设计
Claude Code 子Agent,在固定评测Rubric下运行二元判决(0/1) + 结构化理由(具体到哪个字段出错)评分公式
优势
步骤级对齐,比较Agent与人类的完整轨迹可追溯:不仅告知是否失败,还指出哪个字段错误、哪一步偏离判PASS✍️ 实验设置
评测模型(7个)
Agent框架
OpenClaw Agent框架控制 Chromium 浏览器实例评测指标
Success Rate (SR),即Binary Score=1的任务占比复现控制
容器隔离,保证跨Run一致性🍑 关键结果
总体成绩
| 排名 | 模型 | 总体SR |
|---|---|---|
| 1 | Claude Sonnet 4.6 | 33.3% |
| 2 | GLM-5† | 24.2% |
| 3 | Gemini 3 Flash | 19.0% |
| 4 | Claude Haiku 4.5 | 18.3% |
| 5 | GPT-5.4 | 6.5% |
| 6 | Gemini 3.1 Flash Lite | 3.3% |
| 7 | Kimi K2.5 | 0.7% |
与传统Benchmark的对比
65-75%,在ClawBench仅33.3%6.5%,差距极大类别层面发现
无模型在所有类别均强:Claude Sonnet 4.6领跑Daily/Finance/Academic/Social,GLM-5领跑Work,Gemini 3 Flash领跑Travel距离饱和仍远重要结论
无法迁移到真实世界Web任务。写重型、多步骤、动态网页场景下能力严重不足。可诊断、可追溯,为未来改进提供了具体信号。⛳ 未来方向
当前不足
任务规模:153个任务相对有限,需持续扩充和社区维护。平台动态性:真实网站布局随时间变化,需要动态更新机制保持有效性。评测可重复性:真实网站的不确定性(页面更新、A/B测试)给跨Run一致性带来挑战。身份验证壁垒:部分任务涉及登录/订阅,限制了评测覆盖范围。研究方向
更复杂任务:引入跨平台多步骤任务、需要处理外部文档的任务。更强Agent框架:专门针对动态网页、反Bot机制、Cookie弹窗的鲁棒性提升。多模态感知:更好融合截图与可访问性树,提升页面理解能力。训练数据:利用ClawBench的五层录制轨迹作为真实世界Agent训练数据。🌺 论文摘要
参考链接
核心方法
MetaClaw持续元学习框架基础LLM策略+可进化技能库,通过技能驱动快速适应+机会主义策略优化两大机制持续改进。Skill-Driven Fast Adaptation:从失败轨迹中蒸馏可复用的行为指令,即时注入系统Prompt,零服务中断。Opportunistic Policy Optimization:利用用户空闲窗口(睡眠、键盘无操作、日历会议)通过云端LoRA+RL进行梯度更新。OMLS调度器:监控三种空闲信号, opportunistic触发RL训练。Skill Generation Versioning:严格分离support data(技能进化前)和query data(技能进化后),防止stale reward污染。模型效果(Kimi-K2.5)
重要结论
技能驱动适应对弱模型(Kimi-K2.5)提升更显著(+32.2%),强模型(GPT-5.2)提升有限(+7.1%)。技能注入提升部分执行质量,权重级RL优化是解锁端到端任务完成的关键。技能库作为meta-parameter累积跨任务可迁移的行为知识。关键贡献
梯度自由技能进化与梯度策略优化统一为连续元学习框架的部署代理系统。❓问题背景
Memory-Based方法
Skill-Based方法
RL-Based方法
部署现实挑战
快适应 - 行为启发式
慢适应 - 策略优化
互补性
📕核心方法
Meta-Model定义
双重角色
Meta-Parameter:跨任务流累积行为知识。Adaptation Basis:推理时通过embedding检索注入任务相关技能。行为公式
触发条件
技能进化
关键特性
典型技能类别
Query Data收集
RL更新
触发条件
空闲信号源
窗口逻辑
核心问题
污染后果
版本机制
✍️实验设置
基础模型
评测基准
对比条件
Baseline:基础模型,无适应机制MetaClaw (Skills):仅技能驱动快速适应MetaClaw (Full):技能+RL联合优化(仅Kimi)关键配置
评估指标
🍑关键结果
MetaClaw-Bench Part I (30天)
| 模型 | 条件 | 准确率 | 完成率 |
|---|---|---|---|
| GPT-5.2 | Baseline | 41.1% | 14.7% |
| GPT-5.2 | +Skills | 44.0% (+7.1%) | 17.1% |
| Kimi-K2.5 | Baseline | 21.4% | 2.0% |
| Kimi-K2.5 | +Skills | 28.3% (+32.2%) | 2.0% |
| Kimi-K2.5 | Full | 40.6% | 16.5% (8.25×) |
MetaClaw-Bench Part II (14天)
| 模型 | 条件 | 准确率 | 完成率 |
|---|---|---|---|
| GPT-5.2 | Baseline | 44.9% | 58.4% |
| GPT-5.2 | +Skills | 49.1% (+9.4%) | 67.5% |
| Kimi-K2.5 | Baseline | 21.1% | 18.2% |
| Kimi-K2.5 | +Skills | 26.9% (+27.5%) | 33.8% (+85%) |
| Kimi-K2.5 | Full | 39.6% | 51.9% (+185%) |
AutoResearchClaw迁移
| 指标 | Baseline | +Skills | 变化 |
|---|---|---|---|
| Stage Retry Rate | 10.5% | 7.9% | ↓24.8% |
| Refine Cycle | 2.0 | 1.2 | ↓40.0% |
| Pipeline Completion | 18/19 | 19/19 | ↑5.3% |
| Composite Robustness | 0.714 | 0.845 | ↑18.3% |
核心发现
⛳ 未来方向
当前局限
改进方向
自适应空闲检测:学习用户行为模式,智能预测空闲窗口,而非依赖固定规则。技能压缩与去重:定期合并相似技能,淘汰低频过时技能,防止上下文溢出。多用户联邦适应:在保护隐私前提下,跨用户聚合通用技能,加速集体学习。多模态扩展:当前聚焦CLI任务,扩展至GUI操作、图像理解等多模态代理。更细粒度PRM:当前Process Reward较粗,引入步骤级细粒度信用分配。元学习理论
动态技能代际阈值:当前固定阈值触发技能进化,可学习最优触发时机。自适应学习率:根据任务分布漂移速度,动态调整技能vs策略优化的资源分配。