Skip to content

OpenAI 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 1986 字
⏳ 6 分钟
openai
#gpt5
#gpt5-codex
#gpt-oss
#o1
#o1mini
#o3
#o3-mini
#GPT4
#ChatGPT
#InstructGPT
#CodeX

变化点 ​

2026

2026.09 · GPT-6 Astra

  • 扩大推理 RL 与长任务训练,强化多步工具执行和主动检查。
  • 将模型研发任务纳入评测,关注端到端研发能力。

2026.02 · GPT-5.3-Codex

  • 进一步结合代码推理、终端执行与计算机操作。
  • 强化长程 Coding Agent,从局部修改扩展到连续工程任务。
2025

2025.09 · GPT-5-Codex

  • 围绕真实软件任务进行专项训练,强化代码修改与工具执行。
  • 面向 Coding Agent 优化,支持持续完成多步开发任务。

2025.08 · GPT-5

  • 强化复杂代码任务、推理与指令遵循,扩展通用模型的开发能力。

2025.08 · gpt-oss

  • 开放 120B / 20B 两档 MoE 权重,支持本地部署。
2025(续)

2025.05 · Codex-1

  • 在 o3 基础上,用真实编码任务 RL 强化补丁生成、指令遵循与反复测试修正。
  • 在仓库沙箱内读取文件、执行命令并验证结果,形成可交付的任务执行流程。

2025.04 · o3 / o4-mini

  • 继续强化复杂推理、代码与工具使用,扩展 o 系列的任务能力。

2025.04 · GPT-4.1

  • 扩展至 1M 上下文,强化代码编辑与复杂指令遵循。(blog)
2024 及以前

2024.09 · o1 / o1-mini

  • 引入长思考的推理模型路线,先进行内部推理再回答。
  • 面向数学、代码等复杂问题增加推理时计算。

2024.05–07 · GPT-4o / GPT-4o mini

  • GPT-4o 统一文本、图像与音频交互。
  • GPT-4o mini 进一步面向低成本、高吞吐场景。

2023.09 · GPT-4V

  • 在 GPT-4 能力基础上接入视觉输入,扩展图像理解任务。

2022.11 · ChatGPT / GPT-3.5

  • 通过对话式指令训练与 RLHF,将模型组织为多轮交互助手。
2024 及以前(续)

2022.03 报告 · InstructGPT

  • 建立 SFT → Reward Model → PPO 流程,以人类偏好对齐指令输出。

2021 · Codex

  • 基于 GPT-3 强化 GitHub 代码训练,将自然语言需求映射为代码。

2020 · GPT-3

  • 扩大语言模型预训练,突出无需梯度更新的 zero-shot / few-shot 学习。

2018–2019 · GPT-1 / GPT-2

  • 建立生成式预训练路线,通过扩大数据与模型提升通用语言能力。

(2609) GPT-6 Astra (推理 RL、长任务、研发评测) ​

GPT-6 Astra:推理 RL 与研发任务

来源与技术定位

  • GPT-6 Astra System Card、官方发布。
  • 通过推理 RL 结合思考与工具执行,依据运行反馈调整后续步骤。
  • 研发任务包括读取日志、修改代码、运行实验与提交产物,超出单轮答题。
  • 系统卡介绍推理 RL 和数据过滤,未提供完整预训练、SFT、RL 配方。
PostTrainBench Lite:评估模型后训练能力

任务与资源

  • Agent 获得已有 Base 模型,自行准备数据、运行训练并提交 checkpoint。
  • 覆盖 3 个 Base 模型 × 4 个任务;每次提供 1 张 H100, 5 小时。

评分方法

  • 提交模型相对 Base 的增益,除以参考 Instruct 相对 Base 的增益,截到 [0,1]。
  • 例:Base 40、Instruct 60、提交模型 50,得分 0.5;使用评测数据训练的提交计零分。
  • 固定资源约束让评测同时覆盖实验选择、反馈利用与实际产物质量。
公开表现

研发与电脑操作

  • 内部研究调试任务 78.05%,任务要求处理研究代码与实验问题。
  • OSWorld 2.0 官方延迟模拟:Astra 72.6、约 40 分钟/任务。
  • 对照 GPT-5.6 Sol 为 65.7、约 75 分钟/任务,得分与执行效率同时改善。

(2602) GPT-5.3-Codex (终端执行、长程 Coding Agent) ​

GPT-5.3-Codex:完整开发工作流

来源与能力

  • Introducing GPT-5.3-Codex。
  • 整合 Coding 与通用推理,从代码修改扩展到终端执行、环境处理和测试验证。
  • 工具反馈进入后续决策,执行过程中可接收新要求,调整已有计划与操作。

模型辅助研发

  • 早期版本用于定位训练问题、诊断评测失败与辅助部署,研发团队结合实验反馈决策。
  • 发布材料未给出完整训练数据量和 SFT/RL 超参。
公开表现(GPT-5.2-Codex → 5.3-Codex)

Xhigh 评测

  • SWE-bench Pro Public 56.4 → 56.8,仓库修复增益较小。
  • Terminal-Bench 2.0 64.0 → 77.3,OSWorld-Verified 38.2 → 64.7。
  • 主要收益在终端和电脑操作,体现连续执行能力向代码补丁之外扩展。

数据集 ​

数据集

(2509 )GPT5-Codex ​

参考文章
GPT5-Codex 概览

核心技术

  • Agentic Coding,关键技术:
    • 真实软件工程 RL学习,
    • 沙盒执行,
    • 可控工具使用等。

关键结果

  • 外部评论:效果比GPT5好

(2508) GPT5 ​

GPT5 概览

GPT5

  • 最强大的代码模型。

(2508) GPT-OSS ​

GPT-OSS 概览

核心

  • MoE,OpenAI 开源。
  • gpt-oss-120b, gpt-oss-20b

(2505) Codex-1 (o3、真实编码任务 RL) ​

Codex-1

参考链接

核心变化

  • 基于 o3,在多种真实编码环境中进行 RL,面向仓库级软件任务。
  • 训练目标包括遵循指令、生成符合偏好的补丁,以及反复测试和修正。
  • 任务从单段代码生成,扩展到读取仓库、修改文件和验证结果。
仓库沙箱与验证

执行过程

  • 每个任务使用独立环境,模型可读取和编辑文件、执行终端命令。
  • 通过测试、linter 和类型检查获得反馈,继续修正代码。
  • 交付补丁与终端日志,提供可检查的执行证据。

首发评测设置

  • SWE-bench Verified 使用 192K 上下文、medium reasoning effort。
  • 排除内部环境无法运行的 23 个任务,评测子集为 477 题。

(2409) O系列 ​

O系列概览

核心思想

  • 以推理思维链、内部深思为核心。旨在解决复杂问题,比如编程等。

o1, o1-mini

  • 首次引入 Step-by-step 内部推理,思考后再做回答。
  • o1-mini在软件任务上效果好。

o3, o3-mini

  • 扩展上下文长度、优化了repo-level的代码编辑能力等。
  • SWE-Bench超越GPT4。

(2309) GPT4 ​

GPT4 概览

关键结果

  • 相比GPT3,具有更强推理和代码能力。
  • GPT4-Turbo:提高生产环境效率。
  • GPT-4o:多模态,集成文本、图像和音频, 保留强大代码能力。
  • GPT-4o-mini:强调成本效率。
  • GPT-4.1:扩展长上下文和代码编辑能力,可在Repo-Level做编辑。

(2211) ChatGPT/GPT3.5 ​

参考文章
ChatGPT 概览

核心技术

  • 基于InstructGPT开发,GPT3拓展版本,增加以下能力
    • 额外的指令微调和RLHF
    • 稳定的多轮对话能力,最核心。
    • 增加安全拒识行为等内容。

关键结果

  • 大火。
  • 第一个被广泛应用的对话式LLM。
  • 具有较好编程能力,在各IDE工作流中使用。

(2203) InstructGPT ​

参考文章
Instruct GPT 概览

问题背景

  • GPT3虽然懂得多,但经常答非所问、不安全、和人类需求不对齐。

核心技术

  • 通过人类反馈RLHF,和人类偏好进行对齐。OpenAI 护城河。
  • 人类偏好 Reward Model (偏好打分)、PPO训练等。

关键结果

  • 模型更受人类青睐:幻觉更少、行为更安全。
  • 小参数对齐模型 超越 大参数GPT3模型

Code X ​

Code X 概览

核心技术

  • GPT3编程特别版,GPT3+GitHub代码预训练。

关键结果

  • 在HumanEval代码生成和补全Benchmark上表现不错,早期的代码对齐LLM。
  • 催生了Github Copilot这种商业产品,解决了自然语言 -> 可执行代码的翻译问题。

GPT 3 ​

GPT3 概览

核心技术

  • 在大规模web和文本数据上做ScaleUp。

关键结果

  • 强大的上下文学习能力(zero-shot/few-shot),无需梯度更新也能适应理解、代码、推理等任务。

GPT 1-2 ​

GPT1-2 系列概览

核心

  • 验证了生成式预训练可行,开源了权重。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026