AllenAI Olmo 系列
📅 发表于 2026/09/23
🔄 更新于 2026/09/23
👁️ — 次访问
📝 3312 字
⏳ 10 分钟
mainllm
#基模
#Pretrain
#SFT
#RL
2025.12 · Olmo 3
🌺 论文摘要
参考链接
问题背景
核心方法
3:1 局部/全局 Attention;用 Token 预算约束的数据混合与质量感知上采样训练 Dolma 3 语料。100B 高质量 Dolmino 数据增强数学、代码和后训练基础,再用 Longmino 混合长短文本将上下文从 8K 扩至 65K。2.25M 条 SFT 数据、200K 对高能力差异的偏好数据,再用数学、代码、指令与聊天组成的 OlmoRL 训练。模型效果(Olmo 3 Think 32B + SFT/DPO/OlmoRL)
66.2 → 70.7 → 72.5,LiveCodeBench v3 75.8 → 81.9 → 83.5。78.1、IFBench 达到 68.1。重要结论
70.3 → 64.5;将它与弱模型回答配对做 DPO,均分达到 72.9。100B Token 的对照中,加入后 OlmoBaseEval 均分 48.8 → 50.7。关键贡献
未来方向
32 / 64 层、隐藏维度 4096 / 5120,使用 SwiGLU、RMSNorm 与 QK-Norm。32 个 Query / KV Heads 的 MHA;32B 为 40 个 Query Heads、8 个 KV Heads 的 GQA。4096 Token 窗口,一层使用全局 Attention,最后一层保持全局。8192;7B 训练 5.93T tokens,32B 的原定余弦计划在 5.5T tokens 处结束,进入中训练。Dolma 3 Mix
9.31T Token 池形成约 5.93T 的训练混合:Common Crawl 76.1%、olmOCR 科学 PDF 13.6%、Stack-Edu 代码 6.89%、FineMath 2.56%,其余为 arXiv 与百科数据。Token 约束混合
30M 参数代理模型,每个训练 3B tokens;从以自然分布为中心的 Dirichlet 分布采样数据比例。4~7 次。质量感知上采样
2.19T Token 池采样约 100B;混合数学、代码、QA、推理轨迹、指令与高质量自然文本。10B Stack-Edu FIM 与 10B CraneCode;数学包含 Dolmino Math、CraneMath、TinyMATH 等。100B 中训练,再平均两支检查点权重;两次是独立分支。639B Token 的长文本池,以科学 PDF 为主;添加跨段词频统计 CWE 与跨片段表达改写 REX,增强聚合信息的训练信号。34% 长文本与 66% 中训练短文本混合;7B 训练 50B、32B 训练 100B tokens。8-way Context Parallelism 将每个 65K 序列分到八张卡;32B 最后平均长上下文阶段的三个检查点。Dolci Think SFT
2.268M / 2.254M 条样本,覆盖数学、代码、指令、聊天、安全、科学和多语言。32K,仍不完整则丢弃。2 epochs,最后合并两个不同学习率的 SFT 检查点。Delta Learning DPO
200K 对偏好数据。1 epoch,搜索学习率与数据规模,避免更多偏好数据造成退化。数据和奖励
104869 个 Prompt:数学、代码、精确指令和一般聊天;7B 离线每题采样 8 次,去掉通过率超过 62.5% 的过易题。[0,1] 分,可使用参考答案,也可直接评价开放回答。80% 的问题,并去掉失败测试。训练目标
r_i − mean_group(r),不做组内标准差归一化;按 Batch 总 Token 数归一化损失,去掉 KL。ε_low=0.2、ε_high=0.272;每题采样 8 条,温度 1.0。2.0。32768;初版 32B 训练 750 steps,同报告的 Olmo 3.1 Think 延长至 2300 steps。14628、上限 32K,静态组批可浪费约 54% 计算。15 天缩至 6 天。Olmo 3 Instruct
2.152M 条 Instruct SFT 数据,其中工具数据约 228K 条。100 tokens,缓解偏好训练学到的冗长倾向。8K / 16K;使用较容易的数学、代码数据,并跳过 Think 分支的离线难度筛选。Olmo 3 RL-Zero
8/8 全部答对的问题,保留约 13.3K 个 Prompt。16K,评测上限 32K、温度 1.0,同时观察 pass@1 和 pass@k。43 项任务,分小模型开发用的 Easy 与最终模型用的 Main;另保留 MMLU Pro、DeepMind Math、LBPP、BBH 四个未用于发布前开发的测试集。32K 上下文上限、温度 0.6、Top-p 0.95。0、最多 10 轮,运行三次取均值。32B:SFT → DPO → 初版 Olmo 3 Think
73.5 → 76.0 → 76.8;AIME 2025:66.2 → 70.7 → 72.5。75.8 → 81.9 → 83.5;IFBench:37.0 → 34.4 → 47.6。83.9 降至 80.6,RL 后提高到 89.0。32B:初版 RL → Olmo 3.1 延长 RL
750 → 2300 steps 后,AIME 2025 72.5 → 78.1,IFBench 47.6 → 68.1。83.5 → 83.3;AlpacaEval 2 LC 从 74.2 → 69.1,延长 RL 并非所有能力都同步提高。100B tokens 的中间混合对照中,Base 均分 48.8 → 50.7,数学 43.1 → 48.7、代码 23.3 → 24.4。70.3;继续模仿 Qwen3 32B Chosen 后降至 64.5,与 0.6B Rejected 配对 DPO 后提高到 72.9。1000 RL steps 的比较中,SFT+RL 均分 71.9,SFT+DPO+RL 为 74.1;两者分别用各自起点筛选 RL 数据。10B Token 上下文扩展消融中,长/短 66/34 使基础任务均分降低 2.5pt,调整为 34/66 后只降 0.8pt。44.5 → 47.8,MATH 60.3 → 65.9;最终输出仍保持简洁。881 → 975 → 1358 → 2949 tokens/s,生成中更新带来的增量最大。