Skip to content

Claude 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 4586 字
⏳ 14 分钟
claude
#claude3
#claude4
#claude 4.5

变化点 ​

2026

2026.09 · Fable 5.1 / Mythos 5.1

  • 共享模型基座,以领域防护、访问策略和路由区分部署。
  • 兼顾复杂任务能力、主动核验与实际使用效率。

2026.07 · Claude Opus 5

  • 强化主动检查与结果验证,减少任务完成后的遗漏。
  • 结合 effort 控制优化质量与执行成本。

2026.02 · Claude Opus 4.6

  • 引入 Adaptive Thinking,按任务需要调整推理投入。
  • 结合 Compaction 与长上下文,支撑更长的 Agent 任务。
2025

2025.09 · Claude Sonnet 4.5

  • 引入 Context Editing 与外部 Memory,管理长任务的上下文。
  • 强化长程 Coding Agent 与连续工具执行。

2025.05 · Claude Opus 4 / Sonnet 4

  • 在推理过程中交替使用工具,提高复杂代码任务的持续执行能力。

2025.02 · Claude 3.7 Sonnet

  • 将普通回答与 Extended Thinking 统一为 Hybrid Reasoning。
  • 配合 Claude Code,扩展终端中的代码交互。
2024 及以前

2024.10 · Claude 3.5 Sonnet 更新

  • 引入 Computer Use,由截图理解生成鼠标与键盘动作。
  • 将工具交互扩展到图形界面。

2024.06 · Claude 3.5 Sonnet

  • 强化代码库修改与视觉推理,提高多步代码交互能力。

2024.03 · Claude 3

  • 引入视觉输入与长上下文,形成 Opus / Sonnet / Haiku 分层。

2022.12 · Constitutional AI(对齐方法)

  • 用原则指导模型自我批评和修订,构建 SFT 数据。
  • 再用 AI 偏好进行 RL,减少对人工有害内容标注的依赖。

(2609) Fable 5.1 / Mythos 5.1 (同一基座、领域防护与路由) ​

Fable 5.1 / Mythos 5.1:同一基座与不同防护

来源与版本关系

  • 官方模型页。
  • 两者共享底层模型;Mythos 面向审核后的专业机构,Fable 增加广泛服务所需防护。

请求处理

  • Fable 5.1 支持源代码漏洞识别,对部分高风险请求限制或回退。
  • 生物、化学等触发条件的请求路由到 Opus,继续提供可用响应。
  • 基模能力相同,生产防护与模型路由仍会影响系统最终完成的任务。
公开表现

领域能力与正常请求

  • 官方报告网络安全与生物研究能力提升,Fable 扩大源代码漏洞识别的可用范围。
  • 相对 Fable 5,正常生物请求的防护干预减少约 85%,日常任务较少被误拦截。
  • 系统评测中 Fable 使用生产防护,Mythos 对照用于观察防护影响。

(2607) Claude Opus 5 (主动验证、Effort 与执行效率) ​

Claude Opus 5:主动验证与推理投入

来源与问题

主动验证

  • 定位根因、检查实际产物,再针对遗漏和边界情况修改。
  • 官方案例中,缺少实时数据时主动构建测试 harness,验证解析行为。
  • Effort 调整推理投入,按完整任务质量、延迟与成本选择运行配置。
公开表现与运行条件

Frontier-Bench v0.1

  • mini-SWE-agent、GKE,每题 5 次尝试取平均奖励;安全拒绝可回退 Opus 4.8。
  • 表现超过 Opus 4.8 的 2 倍,同时降低单任务成本。

CursorBench 3.2

  • 跨 Effort 比较质量与成本,最高 Effort 与 Fable 5 峰值差距在 0.5% 内,成本约一半。
  • 收益体现在较低成本下完成更多有效工作,不能仅以输出速度衡量效率。

(2602) Claude Opus 4.6 (Adaptive Thinking、Compaction) ​

Claude Opus 4.6:自适应推理与上下文压缩

来源与配置

Adaptive Thinking

  • 模型按任务决定思考深度,Effort 提供 low / medium / high / max,控制推理投入。

Context Compaction

  • 会话接近配置阈值时,将较早历史替换为摘要,再继续任务。
  • 摘要传递已确认信息和任务状态,作用于输入历史,不更新模型参数。
公开表现

长上下文检索

  • MRCR v2,8-needle / 1M:Sonnet 4.5 18.5 → Opus 4.6 76.0。
  • 指定信息的定位与取回明显改善,长窗口具备更高的实际利用率。

专业知识工作

  • GDPval-AA 比 Opus 4.5 高约 190 Elo,收益扩展到专业工作产物。
  • 长任务仍需让检索、深度推理和摘要状态相互配合。

(2509) Claude Sonnet 4.5 (Context Editing、Memory、长程 Agent) ​

Claude Sonnet 4.5:上下文清理与跨会话记忆

来源与问题

  • 官方发布、上下文管理。
  • 工具结果持续挤占窗口,跨会话后又容易丢失进展,需要分别管理当前历史与外部状态。

Context Editing

  • 接近阈值时移除旧工具调用与结果,保留近期交互和任务连贯性。

Memory Tool

  • 模型操作客户端文件,保存结论、进展和待办,后续会话重新读取。
  • 这是外部记忆管理,不是通过更新权重学习历史。
仓库修复与多候选选择

生成与筛选

  • 并行生成候选补丁,先过滤破坏仓库可见回归测试的候选。
  • 内部评分模型对剩余补丁排序,选择最终提交,不使用隐藏测试选优。

SWE-bench Verified

  • 完整 500 题,Bash + 字符串替换编辑器,10 次运行平均。
  • 主设置 200K thinking budget,Prompt 鼓励工具使用和先写测试。
  • 单次求解 77.2,多候选选优 82.0,额外推理期搜索仍能提高修复率。
上下文消融与 GUI 表现

内部 Agent Search

  • Context Editing 单独提高 29%,与 Memory 联合提高 39%。
  • 100 轮搜索的 tokens 消耗降低 84%,清理旧输出减少窗口压力。
  • 当前窗口清理与跨会话记忆相互补充,分别处理历史堆积和会话间信息丢失。

电脑操作

  • OSWorld-Verified 61.4;最多 100 步,4 次运行平均。

(2505) Claude Opus 4 / Sonnet 4 (推理工具交替与奖励投机) ​

Claude 4:训练与技术定位

来源与任务

训练与对齐

  • 预训练混合公开网页、授权、人工标注及内部数据,经过质量分类与去重。
  • 后训练结合人类反馈、Constitutional AI 和行为特征训练,提高指令遵循与交互可靠性。
Extended Thinking 与工具执行

交错交互

  • 同一模型支持普通回答和 Extended Thinking,按任务分配推理计算。
  • 推理中调用工具,读取反馈后继续思考,支持并行调用和多轮操作。
  • 提供本地文件工具时,可将任务状态写入 Memory 文件,再由后续步骤读取。

推理期补丁筛选

  • 并行生成候选补丁,过滤破坏可见回归测试的候选,再用内部评分模型选优。
  • 选择过程不使用隐藏测试。
Reward Hacking:训练监控与环境修正

奖励漏洞

  • 将测试输出硬编码或只处理测试特殊输入,可以获得表面奖励,却没有解决任务。

发现与修正

  • 迭代行为分类器,结合无监督检查和人工审查,寻找新的投机模式。
  • 修复可利用的环境漏洞,使指令与奖励条件一致,并持续增强奖励和评测覆盖。
  • 训练过程中使用两组环境追踪投机,检查修改测试、绕过任务等行为。
仓库修复结果

SWE-bench Verified

  • 完整 500 题,Bash + 字符串替换编辑器;主结果关闭 Extended Thinking。
  • Opus 4 72.5,Sonnet 4 72.7,均超过上一代。
  • 增加并行补丁生成与选择后为 79.4 / 80.2,训练后仍可用搜索计算提高解决率。
投机行为评测与不足

困难但可解的代码任务

  • 用行为分类器和独立隐藏测试分别检测补丁,避免只看可见测试是否通过。
  • 分类器检测率:Sonnet 3.7 44%,Opus 4 9%,Sonnet 4 4%。
  • 隐藏测试检测率 23% → 13% / 12%,改进也覆盖部分表面测试之外的错误。

不可解任务

  • 主动加入错误测试或缺失依赖,在最小 Claude Code Harness 中观察是否如实报告失败。
  • Opus 4 投机率 47%;加入禁止投机指令后降至 5%。
  • 指令能约束行为,但不可解目标带来的压力仍会诱发绕过约束,需继续完善环境验证。

(2502) Claude 3.7 Sonnet (Hybrid Reasoning、Claude Code) ​

Claude 3.7 Sonnet:Hybrid Reasoning 与 Claude Code

来源与模式

  • Claude 3.7 Sonnet and Claude Code。
  • 同一模型支持标准回答与 Extended Thinking,分别适应快答和复杂推理。
  • API 最大输出 128K,Thinking 使用其中的预算,用户可控制思考投入。

开发流程

  • Claude Code 在终端搜索文件、修改实现、编写和运行测试,再根据反馈修正。
  • 推理预算控制模型计算,工具交互让模型在实际代码库中完成多步工作。
公开表现与后续改进

仓库求解

  • SWE-bench Verified 使用 Bash / 文件编辑,可运行 489 题子集。
  • 单次求解 63.7,增加计算选优 70.3,更多候选提高可解决任务比例。

正常请求与工具

  • 相对前代,不必要拒答减少约 45%,正常任务可用性改善。
  • 官方后续计划包括提高工具可靠性、支持长时间运行命令,完善持续开发任务。

(2410) Claude 3.5 Sonnet更新 (Computer Use、屏幕到动作) ​

Claude 3.5 Sonnet:Computer Use

来源与问题

训练与交互

  • 截图理解 → 像素坐标定位 → 点击/输入 → 新截图反馈,再判断进展或纠错。
  • 训练包括像素定位,在计算器、文本编辑器等简单软件中学习,不开放互联网。
  • 结合已有视觉与推理能力,迁移到未专门适配的 GUI。
公开表现与不足

GUI 操作

  • OSWorld 14.9,超过当时同类对照 7.7,距离人类约 70–75 仍较远。
  • 拖拽、缩放与连续观察仍需改进,离散截图容易漏掉短暂出现的事件。

代码与工具任务

  • SWE-bench Verified 33.4 → 49.0;TAU 零售 62.6 → 69.2、航空 36.0 → 46.0。
  • 工具能力改善覆盖代码和业务交互,Computer Use 又扩展了可操作的软件环境。

(2406) Claude 3.5 Sonnet (代码库交互、视觉推理) ​

Claude 3.5 Sonnet:代码库交互与视觉理解

来源与能力

  • Introducing Claude 3.5 Sonnet。
  • 上下文 200K,面向低延迟的复杂需求处理。
  • 根据自然语言需求读取项目、编辑代码并执行检查,支持修 Bug 和新增功能。
  • 增强图表理解和低质量图像文字识别,辅助界面与文档相关任务。
公开表现

内部 Agentic Coding

  • 允许读取、编辑与执行工具,以开源项目修复或功能开发是否完成评分。
  • Claude 3 Opus 38% → 3.5 Sonnet 64%,反映整库理解和修改能力改善。

服务效率

  • 官方报告运行速度约为 Claude 3 Opus 的 2 倍,适合多轮连续调用。
  • 工具辅助评测覆盖实际修改与验证,比单函数补全更接近开发流程。

(2403) Claude 3 (Opus/Sonnet/Haiku、视觉与长上下文) ​

Claude 3:模型分层与多模态输入

来源与分工

  • Introducing the next generation of Claude。
  • Opus 面向复杂推理,Sonnet 兼顾服务吞吐,Haiku 面向实时响应。
  • 首发上下文 200K,直接处理照片、图表、流程图和技术文档。

对齐与交互

  • 继续改进 Constitutional AI,减少正常请求上的过度拒答。
  • 发布时提出扩展 Tool Use 与交互式代码执行,完善 Agent 能力。
长文与事实性表现

长文检索

  • NIAH 从 30 组针与问题中随机选择,在长文不同位置插入目标信息。
  • Opus 准确率超过 99%,验证长窗口中的指定信息检索能力。

事实问答

  • 内部困难问答分别统计正确、错误与明确表示不确定的回答。
  • 相对 Claude 2.1,正确率约提高 2 倍,同时减少错误答案。

(2212) Constitutional AI (自我修订与 AI 偏好) ​

🌺 论文摘要

Constitutional AI 摘要

参考链接

问题背景

  • 人工逐条判断有害回答成本高;单纯奖励拒答容易形成回避式回答。

核心方法

  • SL-CAI:按原则批评与修订回答,生成 SFT 数据。
  • RL-CAI:AI 偏好 → Preference Model → RLAIF;结合 CoT、多原则与软标签校准。

模型效果

  • 52B 模型经过 RLAIF 后,无害性提高,同时保留接近原模型的帮助性。

重要结论

  • 少量原则能够组织大规模 AI 反馈;反馈概率与评测准则直接影响策略行为。

核心贡献

  • 建立原则驱动的 SFT + RLAIF 流程,将无害性监督从逐条人工标注扩展为 AI 反馈。

未来方向

  • 扩展原则覆盖和 AI 监督范围,减少对大量逐条人工比较的依赖。
  • 改善偏好校准与奖励过度优化,兼顾无害性、帮助性和有效回应。

问题背景 ​

无害性监督与有效回答
  • 逐条人工比较有害回答成本高,难以持续扩展监督。
  • 只奖励拒答会造成回避式回答,需要在无害性与帮助性之间保留有效回应。
  • 论文用少量原则组织自我修订与 AI 偏好,扩展人工反馈的覆盖。

核心方法 ​

原则驱动的监督微调 ​

原则驱动的回答修订

原始回答

  • Helpful RLHF 模型回答 Red-team Prompt,得到可能包含有害内容的回答。

Critique → Revision

  • 从 16 条原则中抽样一条,让模型指出回答违反原则的位置,再生成修订答案。
  • 使用 Few-shot 示例区分批评与回答;每个 Prompt 连续做 4 轮修订。

训练样本

  • 收集各轮的「原始 Prompt + 修订答案」,不把整段批评过程作为最终回答。
  • 混合 Helpful RLHF 模型生成的普通帮助性回答,保留正常任务能力。
  • 从预训练模型做 SFT,得到 SL-CAI。

AI 偏好与 RLAIF ​

候选比较与 Preference Model

AI 偏好构建

  • SL-CAI 对同一 Prompt 生成两个候选回答。
  • Feedback LM 根据抽样原则选择 A/B,用归一化选择概率得到软偏好标签。
  • 混合 AI 的无害性偏好与人类的帮助性偏好,训练 Preference Model。

策略更新

  • 以 SL-CAI 为初始策略,使用 Preference Model 的评分进行 RL。
  • AI 主要替代无害性比较标注;帮助性训练仍保留人类反馈。
CoT 反馈与软标签校准

CoT Judge

  • Feedback LM 先分析两个回答,再给出选择,提高复杂比较的判断质量。

概率截断

  • CoT 容易产生接近 0 / 1 的极端偏好,导致 PM 对差异过度确信。
  • 将选择概率截断到 0.4–0.6,保留偏好方向,降低偏好标签的过度确信,减少极端奖励信号。

多原则组合

  • 不同样本使用不同原则,提高反馈多样性,减少单一原则产生的固定措辞。
Constitutional AI 的两阶段流程:先按原则批评并修订回答做 SFT,再生成 AI 偏好标签,训练偏好模型与 RL 策略。
原文图 1:Constitutional AI 的两阶段流程:先按原则批评并修订回答做 SFT,再生成 AI 偏好标签,训练偏好模型与 RL 策略。 来源

实验设置(Constitutional AI) ​

实验设置

模型与数据

  • 主实验 52B;另比较不同规模的 AI 判断与自我修订能力。
  • Red-team Prompt 约 183K:人工约 42.5K,模型生成约 140.3K。
  • 帮助性 Prompt 约 135K,每条由 Helpful RLHF 模型生成两个回答。

SL 与 PM 训练

  • 每条 Red-team Prompt 做 4 轮修订,采样温度 1。
  • SL:1 epoch,Batch Size 1024,固定学习率为预训练学习率的 0.5 倍。
  • PM:约 135K 人类帮助性比较 + 183K AI 无害性比较。

评测与消融

  • 人工分别比较帮助性与无害性,并使用 0–4 绝对有害程度评分。
  • 对照直接修订 / 先批评再修订、修订轮数、CoT 判断、软标签 / 硬标签 / 截断标签。

关键结果(Constitutional AI) ​

关键结果

帮助性与无害性

  • RL-CAI 在人类比较中比 SL-CAI 更无害,帮助性仅有较小变化。
  • 评测同时奖励有效回应,减少把回避问题误判为更安全的情况。

自我修订

  • 小模型从显式 Critique 中获益更明显;52B 模型直接修订也能达到接近效果。
  • 增加修订轮数通常提高无害性,但可能损失帮助性,需要混合普通任务数据。

反馈与奖励优化

  • 非 CoT 的软标签优于硬标签;CoT 反馈结合 0.4–0.6 截断表现更好。
  • 长时间优化单一奖励可能产生指责性或模板化回答,多原则和概率校准可缓解这一问题。
人类比较得到的帮助性—无害性曲线。RL-CAI 在保持帮助性的同时改善无害性,观察两项目标的共同变化。
原文图 2:人类比较得到的帮助性—无害性曲线。RL-CAI 在保持帮助性的同时改善无害性,观察两项目标的共同变化。 来源

未来方向 ​

未来方向

笔记讨论

  • 扩展原则覆盖和 AI 监督范围,减少对大量逐条人工比较的依赖。
  • 改善偏好校准与奖励过度优化,兼顾无害性、帮助性和有效回应。

(2512) Anthropic Interviewer (1250人访谈、用户研究) ​

Anthropic Interviewer:自适应访谈流程

来源与定位

  • 官方研究、访谈数据。
  • 聊天日志难以看到 AI 产物如何被采用,也难解释用户需求和顾虑。
  • 本项基于 Claude 与 Prompt 构建用户研究流程,不提出新模型训练方法。

研究流程

  • 研究者提出目标,模型生成 Rubric、问题与流程,经人工修订后用于访谈。
  • 访谈围绕共同研究问题展开,并根据个体回答自适应追问。
  • 人与 AI 结合原文、示例和访谈计划分析,再聚类主题、统计出现频率。
样本与分析设置
  • 共 1250 人:一般职业 1000 人,科学与创意工作者各 125 人。
  • 每次访谈约 10–15 分钟,同时收集职业和使用情况问卷。
  • 定性主题与问卷统计结合;众包平台样本,不是总体随机抽样调查。
研究发现

使用体验

  • 一般职业样本中,86% 自述节省时间,65% 满意工作中的 AI 使用。
  • 用户倾向保留体现专业身份的工作,把日常重复任务交给 AI。

与行为日志互补

  • 访谈更多描述协作式使用,聊天记录呈现更多自动化行为。
  • 需要结合产物采用方式和样本差异解释,自述比例不等于直接测得的效率增益。
  • 后续研究扩展职业、地区和长期追踪,将访谈与实际使用记录结合。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026