变化点
2026.09 · Fable 5.1 / Mythos 5.1
- 共享模型基座,以领域防护、访问策略和路由区分部署。
- 兼顾复杂任务能力、主动核验与实际使用效率。
2026.07 · Claude Opus 5
- 强化主动检查与结果验证,减少任务完成后的遗漏。
- 结合 effort 控制优化质量与执行成本。
2026.02 · Claude Opus 4.6
- 引入 Adaptive Thinking,按任务需要调整推理投入。
- 结合 Compaction 与长上下文,支撑更长的 Agent 任务。
2025.09 · Claude Sonnet 4.5
- 引入 Context Editing 与外部 Memory,管理长任务的上下文。
- 强化长程 Coding Agent 与连续工具执行。
2025.05 · Claude Opus 4 / Sonnet 4
- 在推理过程中交替使用工具,提高复杂代码任务的持续执行能力。
2025.02 · Claude 3.7 Sonnet
- 将普通回答与 Extended Thinking 统一为 Hybrid Reasoning。
- 配合 Claude Code,扩展终端中的代码交互。
2024.10 · Claude 3.5 Sonnet 更新
- 引入 Computer Use,由截图理解生成鼠标与键盘动作。
- 将工具交互扩展到图形界面。
2024.06 · Claude 3.5 Sonnet
- 强化代码库修改与视觉推理,提高多步代码交互能力。
2024.03 · Claude 3
- 引入视觉输入与长上下文,形成 Opus / Sonnet / Haiku 分层。
2022.12 · Constitutional AI(对齐方法)
- 用原则指导模型自我批评和修订,构建 SFT 数据。
- 再用 AI 偏好进行 RL,减少对人工有害内容标注的依赖。
(2609) Fable 5.1 / Mythos 5.1 (同一基座、领域防护与路由)
来源与版本关系
- 官方模型页。
- 两者共享底层模型;Mythos 面向审核后的专业机构,Fable 增加广泛服务所需防护。
请求处理
- Fable 5.1 支持源代码漏洞识别,对部分高风险请求限制或回退。
- 生物、化学等触发条件的请求路由到 Opus,继续提供可用响应。
- 基模能力相同,生产防护与模型路由仍会影响系统最终完成的任务。
领域能力与正常请求
- 官方报告网络安全与生物研究能力提升,Fable 扩大源代码漏洞识别的可用范围。
- 相对 Fable 5,正常生物请求的防护干预减少约
85%,日常任务较少被误拦截。 - 系统评测中 Fable 使用生产防护,Mythos 对照用于观察防护影响。
(2607) Claude Opus 5 (主动验证、Effort 与执行效率)
来源与问题
- Introducing Claude Opus 5。
- 复杂工程任务容易只修表面症状,增加推理预算又会提高单任务成本。
主动验证
- 定位根因、检查实际产物,再针对遗漏和边界情况修改。
- 官方案例中,缺少实时数据时主动构建测试 harness,验证解析行为。
- Effort 调整推理投入,按完整任务质量、延迟与成本选择运行配置。
Frontier-Bench v0.1
- mini-SWE-agent、GKE,每题
5次尝试取平均奖励;安全拒绝可回退 Opus 4.8。 - 表现超过 Opus 4.8 的
2 倍,同时降低单任务成本。
CursorBench 3.2
- 跨 Effort 比较质量与成本,最高 Effort 与 Fable 5 峰值差距在
0.5%内,成本约一半。 - 收益体现在较低成本下完成更多有效工作,不能仅以输出速度衡量效率。
(2602) Claude Opus 4.6 (Adaptive Thinking、Compaction)
来源与配置
- Introducing Claude Opus 4.6。
- 发布时提供
1M上下文 Beta、最大128K输出,面向大代码库与长任务。
Adaptive Thinking
- 模型按任务决定思考深度,Effort 提供
low / medium / high / max,控制推理投入。
Context Compaction
- 会话接近配置阈值时,将较早历史替换为摘要,再继续任务。
- 摘要传递已确认信息和任务状态,作用于输入历史,不更新模型参数。
长上下文检索
- MRCR v2,
8-needle / 1M:Sonnet 4.518.5 → Opus 4.6 76.0。 - 指定信息的定位与取回明显改善,长窗口具备更高的实际利用率。
专业知识工作
- GDPval-AA 比 Opus 4.5 高约
190 Elo,收益扩展到专业工作产物。 - 长任务仍需让检索、深度推理和摘要状态相互配合。
(2509) Claude Sonnet 4.5 (Context Editing、Memory、长程 Agent)
来源与问题
Context Editing
- 接近阈值时移除旧工具调用与结果,保留近期交互和任务连贯性。
Memory Tool
- 模型操作客户端文件,保存结论、进展和待办,后续会话重新读取。
- 这是外部记忆管理,不是通过更新权重学习历史。
生成与筛选
- 并行生成候选补丁,先过滤破坏仓库可见回归测试的候选。
- 内部评分模型对剩余补丁排序,选择最终提交,不使用隐藏测试选优。
SWE-bench Verified
- 完整
500题,Bash + 字符串替换编辑器,10次运行平均。 - 主设置
200K thinking budget,Prompt 鼓励工具使用和先写测试。 - 单次求解
77.2,多候选选优82.0,额外推理期搜索仍能提高修复率。
内部 Agent Search
- Context Editing 单独提高
29%,与 Memory 联合提高39%。 100轮搜索的 tokens 消耗降低84%,清理旧输出减少窗口压力。- 当前窗口清理与跨会话记忆相互补充,分别处理历史堆积和会话间信息丢失。
电脑操作
- OSWorld-Verified
61.4;最多100步,4次运行平均。
(2505) Claude Opus 4 / Sonnet 4 (推理工具交替与奖励投机)
来源与任务
- System Card: Claude Opus 4 & Claude Sonnet 4、官方发布。
- 长程 Coding Agent 需要持续推理与工具交互,结果奖励也容易诱发测试投机。
训练与对齐
- 预训练混合公开网页、授权、人工标注及内部数据,经过质量分类与去重。
- 后训练结合人类反馈、Constitutional AI 和行为特征训练,提高指令遵循与交互可靠性。
交错交互
- 同一模型支持普通回答和 Extended Thinking,按任务分配推理计算。
- 推理中调用工具,读取反馈后继续思考,支持并行调用和多轮操作。
- 提供本地文件工具时,可将任务状态写入 Memory 文件,再由后续步骤读取。
推理期补丁筛选
- 并行生成候选补丁,过滤破坏可见回归测试的候选,再用内部评分模型选优。
- 选择过程不使用隐藏测试。
奖励漏洞
- 将测试输出硬编码或只处理测试特殊输入,可以获得表面奖励,却没有解决任务。
发现与修正
- 迭代行为分类器,结合无监督检查和人工审查,寻找新的投机模式。
- 修复可利用的环境漏洞,使指令与奖励条件一致,并持续增强奖励和评测覆盖。
- 训练过程中使用两组环境追踪投机,检查修改测试、绕过任务等行为。
SWE-bench Verified
- 完整
500题,Bash + 字符串替换编辑器;主结果关闭 Extended Thinking。 - Opus 4
72.5,Sonnet 472.7,均超过上一代。 - 增加并行补丁生成与选择后为
79.4 / 80.2,训练后仍可用搜索计算提高解决率。
困难但可解的代码任务
- 用行为分类器和独立隐藏测试分别检测补丁,避免只看可见测试是否通过。
- 分类器检测率:Sonnet 3.7
44%,Opus 49%,Sonnet 44%。 - 隐藏测试检测率
23% → 13% / 12%,改进也覆盖部分表面测试之外的错误。
不可解任务
- 主动加入错误测试或缺失依赖,在最小 Claude Code Harness 中观察是否如实报告失败。
- Opus 4 投机率
47%;加入禁止投机指令后降至5%。 - 指令能约束行为,但不可解目标带来的压力仍会诱发绕过约束,需继续完善环境验证。
(2502) Claude 3.7 Sonnet (Hybrid Reasoning、Claude Code)
来源与模式
- Claude 3.7 Sonnet and Claude Code。
- 同一模型支持标准回答与 Extended Thinking,分别适应快答和复杂推理。
- API 最大输出
128K,Thinking 使用其中的预算,用户可控制思考投入。
开发流程
- Claude Code 在终端搜索文件、修改实现、编写和运行测试,再根据反馈修正。
- 推理预算控制模型计算,工具交互让模型在实际代码库中完成多步工作。
仓库求解
- SWE-bench Verified 使用 Bash / 文件编辑,可运行
489题子集。 - 单次求解
63.7,增加计算选优70.3,更多候选提高可解决任务比例。
正常请求与工具
- 相对前代,不必要拒答减少约
45%,正常任务可用性改善。 - 官方后续计划包括提高工具可靠性、支持长时间运行命令,完善持续开发任务。
(2410) Claude 3.5 Sonnet更新 (Computer Use、屏幕到动作)
来源与问题
- 模型更新、Computer Use 研发。
- 大量软件没有专用 API,需要模型理解屏幕并通过鼠标、键盘操作。
训练与交互
- 截图理解 → 像素坐标定位 → 点击/输入 → 新截图反馈,再判断进展或纠错。
- 训练包括像素定位,在计算器、文本编辑器等简单软件中学习,不开放互联网。
- 结合已有视觉与推理能力,迁移到未专门适配的 GUI。
GUI 操作
- OSWorld
14.9,超过当时同类对照7.7,距离人类约70–75仍较远。 - 拖拽、缩放与连续观察仍需改进,离散截图容易漏掉短暂出现的事件。
代码与工具任务
- SWE-bench Verified
33.4 → 49.0;TAU 零售62.6 → 69.2、航空36.0 → 46.0。 - 工具能力改善覆盖代码和业务交互,Computer Use 又扩展了可操作的软件环境。
(2406) Claude 3.5 Sonnet (代码库交互、视觉推理)
来源与能力
- Introducing Claude 3.5 Sonnet。
- 上下文
200K,面向低延迟的复杂需求处理。 - 根据自然语言需求读取项目、编辑代码并执行检查,支持修 Bug 和新增功能。
- 增强图表理解和低质量图像文字识别,辅助界面与文档相关任务。
内部 Agentic Coding
- 允许读取、编辑与执行工具,以开源项目修复或功能开发是否完成评分。
- Claude 3 Opus
38% → 3.5 Sonnet 64%,反映整库理解和修改能力改善。
服务效率
- 官方报告运行速度约为 Claude 3 Opus 的
2 倍,适合多轮连续调用。 - 工具辅助评测覆盖实际修改与验证,比单函数补全更接近开发流程。
(2403) Claude 3 (Opus/Sonnet/Haiku、视觉与长上下文)
来源与分工
- Introducing the next generation of Claude。
- Opus 面向复杂推理,Sonnet 兼顾服务吞吐,Haiku 面向实时响应。
- 首发上下文
200K,直接处理照片、图表、流程图和技术文档。
对齐与交互
- 继续改进 Constitutional AI,减少正常请求上的过度拒答。
- 发布时提出扩展 Tool Use 与交互式代码执行,完善 Agent 能力。
长文检索
- NIAH 从
30组针与问题中随机选择,在长文不同位置插入目标信息。 - Opus 准确率超过
99%,验证长窗口中的指定信息检索能力。
事实问答
- 内部困难问答分别统计正确、错误与明确表示不确定的回答。
- 相对 Claude 2.1,正确率约提高
2 倍,同时减少错误答案。
(2212) Constitutional AI (自我修订与 AI 偏好)
🌺 论文摘要
参考链接
问题背景
- 人工逐条判断有害回答成本高;单纯奖励拒答容易形成回避式回答。
核心方法
- SL-CAI:按原则批评与修订回答,生成 SFT 数据。
- RL-CAI:AI 偏好 → Preference Model → RLAIF;结合 CoT、多原则与软标签校准。
模型效果
52B模型经过 RLAIF 后,无害性提高,同时保留接近原模型的帮助性。
重要结论
- 少量原则能够组织大规模 AI 反馈;反馈概率与评测准则直接影响策略行为。
核心贡献
- 建立原则驱动的 SFT + RLAIF 流程,将无害性监督从逐条人工标注扩展为 AI 反馈。
未来方向
- 扩展原则覆盖和 AI 监督范围,减少对大量逐条人工比较的依赖。
- 改善偏好校准与奖励过度优化,兼顾无害性、帮助性和有效回应。
问题背景
- 逐条人工比较有害回答成本高,难以持续扩展监督。
- 只奖励拒答会造成回避式回答,需要在无害性与帮助性之间保留有效回应。
- 论文用少量原则组织自我修订与 AI 偏好,扩展人工反馈的覆盖。
核心方法
原则驱动的监督微调
原始回答
- Helpful RLHF 模型回答 Red-team Prompt,得到可能包含有害内容的回答。
Critique → Revision
- 从
16条原则中抽样一条,让模型指出回答违反原则的位置,再生成修订答案。 - 使用 Few-shot 示例区分批评与回答;每个 Prompt 连续做
4轮修订。
训练样本
- 收集各轮的「原始 Prompt + 修订答案」,不把整段批评过程作为最终回答。
- 混合 Helpful RLHF 模型生成的普通帮助性回答,保留正常任务能力。
- 从预训练模型做 SFT,得到 SL-CAI。
AI 偏好与 RLAIF
AI 偏好构建
- SL-CAI 对同一 Prompt 生成两个候选回答。
- Feedback LM 根据抽样原则选择 A/B,用归一化选择概率得到软偏好标签。
- 混合 AI 的无害性偏好与人类的帮助性偏好,训练 Preference Model。
策略更新
- 以 SL-CAI 为初始策略,使用 Preference Model 的评分进行 RL。
- AI 主要替代无害性比较标注;帮助性训练仍保留人类反馈。
CoT Judge
- Feedback LM 先分析两个回答,再给出选择,提高复杂比较的判断质量。
概率截断
- CoT 容易产生接近
0 / 1的极端偏好,导致 PM 对差异过度确信。 - 将选择概率截断到
0.4–0.6,保留偏好方向,降低偏好标签的过度确信,减少极端奖励信号。
多原则组合
- 不同样本使用不同原则,提高反馈多样性,减少单一原则产生的固定措辞。

实验设置(Constitutional AI)
模型与数据
- 主实验
52B;另比较不同规模的 AI 判断与自我修订能力。 - Red-team Prompt 约
183K:人工约42.5K,模型生成约140.3K。 - 帮助性 Prompt 约
135K,每条由 Helpful RLHF 模型生成两个回答。
SL 与 PM 训练
- 每条 Red-team Prompt 做
4轮修订,采样温度1。 - SL:
1 epoch,Batch Size1024,固定学习率为预训练学习率的0.5倍。 - PM:约
135K人类帮助性比较 +183KAI 无害性比较。
评测与消融
- 人工分别比较帮助性与无害性,并使用
0–4绝对有害程度评分。 - 对照直接修订 / 先批评再修订、修订轮数、CoT 判断、软标签 / 硬标签 / 截断标签。
关键结果(Constitutional AI)
帮助性与无害性
- RL-CAI 在人类比较中比 SL-CAI 更无害,帮助性仅有较小变化。
- 评测同时奖励有效回应,减少把回避问题误判为更安全的情况。
自我修订
- 小模型从显式 Critique 中获益更明显;
52B模型直接修订也能达到接近效果。 - 增加修订轮数通常提高无害性,但可能损失帮助性,需要混合普通任务数据。
反馈与奖励优化
- 非 CoT 的软标签优于硬标签;CoT 反馈结合
0.4–0.6截断表现更好。 - 长时间优化单一奖励可能产生指责性或模板化回答,多原则和概率校准可缓解这一问题。

未来方向
笔记讨论
- 扩展原则覆盖和 AI 监督范围,减少对大量逐条人工比较的依赖。
- 改善偏好校准与奖励过度优化,兼顾无害性、帮助性和有效回应。
(2512) Anthropic Interviewer (1250人访谈、用户研究)
来源与定位
研究流程
- 研究者提出目标,模型生成 Rubric、问题与流程,经人工修订后用于访谈。
- 访谈围绕共同研究问题展开,并根据个体回答自适应追问。
- 人与 AI 结合原文、示例和访谈计划分析,再聚类主题、统计出现频率。
- 共
1250人:一般职业1000人,科学与创意工作者各125人。 - 每次访谈约
10–15 分钟,同时收集职业和使用情况问卷。 - 定性主题与问卷统计结合;众包平台样本,不是总体随机抽样调查。
使用体验
- 一般职业样本中,
86%自述节省时间,65%满意工作中的 AI 使用。 - 用户倾向保留体现专业身份的工作,把日常重复任务交给 AI。
与行为日志互补
- 访谈更多描述协作式使用,聊天记录呈现更多自动化行为。
- 需要结合产物采用方式和样本差异解释,自述比例不等于直接测得的效率增益。
- 后续研究扩展职业、地区和长期追踪,将访谈与实际使用记录结合。