OpenAI 系列
📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 1986 字
⏳ 6 分钟
openai
#gpt5
#gpt5-codex
#gpt-oss
#o1
#o1mini
#o3
#o3-mini
#GPT4
#ChatGPT
#InstructGPT
#CodeX
2026.09 · GPT-6 Astra
2026.02 · GPT-5.3-Codex
2025.09 · GPT-5-Codex
2025.08 · GPT-5
2025.08 · gpt-oss
120B / 20B 两档 MoE 权重,支持本地部署。2025.05 · Codex-1
2025.04 · o3 / o4-mini
2025.04 · GPT-4.1
1M 上下文,强化代码编辑与复杂指令遵循。(blog)2024.09 · o1 / o1-mini
2024.05–07 · GPT-4o / GPT-4o mini
2023.09 · GPT-4V
2022.11 · ChatGPT / GPT-3.5
2022.03 报告 · InstructGPT
SFT → Reward Model → PPO 流程,以人类偏好对齐指令输出。2021 · Codex
2020 · GPT-3
2018–2019 · GPT-1 / GPT-2
来源与技术定位
任务与资源
3 个 Base 模型 × 4 个任务;每次提供 1 张 H100, 5 小时。评分方法
[0,1]。40、Instruct 60、提交模型 50,得分 0.5;使用评测数据训练的提交计零分。研发与电脑操作
78.05%,任务要求处理研究代码与实验问题。72.6、约 40 分钟/任务。65.7、约 75 分钟/任务,得分与执行效率同时改善。来源与能力
模型辅助研发
Xhigh 评测
56.4 → 56.8,仓库修复增益较小。64.0 → 77.3,OSWorld-Verified 38.2 → 64.7。核心技术
真实软件工程 RL学习,沙盒执行,关键结果
GPT5
核心
参考链接
核心变化
执行过程
首发评测设置
192K 上下文、medium reasoning effort。23 个任务,评测子集为 477 题。核心思想
推理思维链、内部深思为核心。旨在解决复杂问题,比如编程等。o1, o1-mini
o3, o3-mini
扩展上下文长度、优化了repo-level的代码编辑能力等。关键结果
图像和音频, 保留强大代码能力。扩展长上下文和代码编辑能力,可在Repo-Level做编辑。核心技术
指令微调和RLHF稳定的多轮对话能力,最核心。安全拒识行为等内容。关键结果
问题背景
经常答非所问、不安全、和人类需求不对齐。核心技术
人类反馈RLHF,和人类偏好进行对齐。OpenAI 护城河。Reward Model (偏好打分)、PPO训练等。关键结果
幻觉更少、行为更安全。小参数对齐模型 超越 大参数GPT3模型核心技术
GPT3+GitHub代码预训练。关键结果
HumanEval代码生成和补全Benchmark上表现不错,早期的代码对齐LLM。自然语言 -> 可执行代码的翻译问题。核心技术
大规模web和文本数据上做ScaleUp。关键结果
上下文学习能力(zero-shot/few-shot),无需梯度更新也能适应理解、代码、推理等任务。核心
生成式预训练可行,开源了权重。