Meta 系列
📅 发表于 2026/09/23
🔄 更新于 2026/09/23
👁️ — 次访问
📝 6825 字
⏳ 20 分钟
mainllm
#基模
#Pretrain
#SFT
#RL
2025.10 · CWM
2024.07 · Llama 3 / 3.1
🌺 论文摘要
参考链接
问题背景
核心方法
8T 通用预训练 → 5T MidTrain,混合局部/全局注意力支持 131K。模型效果(CWM-32B,SFT + Joint RL)
53.9%,生成候选与测试后 best@16 达 65.8%。68.6%;CruxEval-O 推理模式 94.3%,完整执行轨迹预测 87.7%。重要结论
核心贡献
未来方向
执行状态监督不足
仓库交互成本高
仓库环境
35K 个仓库镜像,支持程序追踪与 Agent 交互。函数与仓库追踪
120M 个函数。21K 个可追踪仓库镜像,通过测试执行捕获不同提交版本的调用轨迹。自然语言轨迹
任务构建
3M 条轨迹,来自 10.2K 个镜像、3.15K 个仓库。55%:回到 Bug 修复前的提交,根据 Issue 与测试反馈生成修复轨迹。45%:修改 AST、删除语句或替换运算符,仅保留会使原测试失败的变异。数据筛选与训练目标
50% 的损失,降低低信息反馈的训练占比。模型架构
32B Dense,64 层,局部注意力与全局注意力按 3:1 交替。8K,全局窗口 131K;文档之间使用 attention mask 隔离。通用预训练 → 世界模型 MidTrain
8T tokens,上下文 8K,代码占 30%。5T tokens,上下文扩展到 131K,延续预训练优化器与学习率调度。30% CWM 相关数据 + 40% 通用代码 + 30% 通用预训练数据回放。长序列训练
30% 文档超过 65K。三轮自举
1。SFT 数据与目标
30% MidTrain 数据回放,学习通用能力与执行状态预测。<think> 标签,引入新的推理格式,增加初始探索空间。SWE 任务
12.6K 个任务。bash + edit + create + submit;最多 128 轮,保留历史推理。+1;失败时,patch 相似度高于阈值给 0,否则 -1。竞赛编程与 Agentic Coding
81K 个编程问题,去重并排除评测污染;答案通过全部单测才获得正奖励。数学任务
278K 道可验证问题,去除 SFT 模型不推理也能全部答对的简单题。+1,错误 -1。4 次。优势与损失
return − 组内基线,去掉标准差归一化,减少题目难度偏置。稳定训练
εlow=0.2, εhigh=0.25,比例截断区间为 [0.8, 1.25];不加 KL 正则。长度奖励调度
8K 逐步提高到 64K,先学习有效推理,再释放更长推理预算。任务混合
40%/40%/20% 采样;后续调整为 30%/50%/20%。0.1–0.7 的有效学习任务。1/3 用于 SFT 数据回放,NLL 系数 0.1,减轻能力遗忘。异步 rollout
4 个更新步向 worker 广播权重。100 步时丢弃。基础模型与训练超参
32B;预训练与 MidTrain 共 13T tokens,峰值学习率 8e-4。100B tokens,50K 步,上下文 32K,batch 约 2M tokens,学习率 1e-5。172B tokens,学习率 2.5e-7,每题 8 条 rollout。8.4M 增至 16.8M tokens;最大上下文 131K,梯度裁剪 0.1。2048 H100;RL 使用约 2560–4608 H100,采样与训练分开部署。数据消融
8B 模型统一预训练 6T,再用 1T MidTrain 比较 PR、执行轨迹、Forager 数据组合。评测协议
temperature=1.0, top-p=0.95;SWE 单次结果取 4 轮评测平均。16 个 patch 和 40 个新测试。Top-5 多数测试。执行理解与 Agent 交互分别获益
8B 消融中,加入执行轨迹后 CruxEval-O 从 44.6 → 73.9,运行语义预测明显提升。18.4 → 22.1,同时降低 Agent 轨迹 NLL。世界模型与自然语言推理互补
94.3%,完整执行轨迹预测 87.7%。497 tokens,自然语言推理约 1164 tokens,执行表示更紧凑。候选选择决定 TTS 收益
53.9%,测试辅助 best@16 达 65.8%;单纯 patch 多数投票为 58.4%。40 个候选的 pass@40 达 80.4%,但 best@k 在约 16 个候选后趋于饱和。RL 学习实际工作习惯
4000 步中,主动运行测试的轨迹比例从 57% → 74%。58% → 66%,文件定位随 RL 改善。128 轮时得分 42.6%;原 Harness 的 bash-only 为 42.1%。代码与数学能力
68.6%/63.5%,具备同规模模型中较强的竞赛编程能力。96.6%、AIME 2024 76.0%;数学能力仍弱于部分同规模专门推理模型。🌺 论文摘要
参考链接
2024.07 发布的 Llama 3.1。问题背景
核心方法
15.6T tokens,上下文 8K → 128K。6 轮,加入格式 mask 与 chosen NLL。模型效果(Llama 3.1-405B-Instruct,SFT + DPO)
89.0、MATH 73.8、IFEval 88.6、BFCL 88.5。重要结论
405B 直接学习自身未验证的代码输出收益有限,执行反馈与纠错 是合成数据的关键。核心贡献
8B/70B/405B 基础与指令模型,给出数据处理、后训练和大规模训练的完整工程路线。未来方向
系列变化
8B/70B,主要面向英语,上下文 8K。405B,统一扩展到 128K,增强多语言与工具调用。训练难点
网页处理
领域筛选与数据配比
50%、数学/推理 25%、代码 17%、多语言 8%。高质量数据验证
8B 模型做短程退火,混入候选数据,低成本判断小数据源是否有效。架构调整
8 个 KV heads,降低解码缓存开销。128K,增加非英语 token,提高文本压缩率与多语言表示效率。500K;同一 packed sequence 的不同文档之间屏蔽 attention。预训练流程
8K 上下文完成主体预训练,随后用约 800B tokens 逐步适配长序列。6 个阶段扩展至 128K;每阶段检查短文本效果恢复与长文档检索能力。0,并对末期 checkpoint 做参数平均。405B 按计算预算选取规模;8B/70B 训练更充分,以降低部署时的计算需求。4D 并行
FP8 推理
人类偏好与 RM
拒绝采样与 SFT
10–30 个回答,使用 RM 选择最优候选。405B 的输出还用于改善 8B/70B 的后训练数据质量。迭代更新
6 轮。DPO 修改
0.2,防止其生成概率下降并保持格式稳定。质量、难度与多样性
事实性与安全数据
领域专家
1T tokens,代码占比超过 85%。16K,再做代码 SFT/DPO,辅助标注与拒绝采样。执行反馈合成
stdout/stderr/return code 回传模型,迭代修正代码或测试。20% 解法经过自纠正。语言翻译与回译
2.7M 条,覆盖生成、解释、文档与调试。推理数据
长上下文 SFT
8K 片段生成 QA,训练时提供完整文档,要求定位相关信息。16K/32K/64K/128K 分桶,约 0.1% 长上下文样本即可兼顾短长任务。多语言补充
工具任务合成
人类反馈
新工具泛化
视觉接入
6B 图文对训练,再进行高分辨率退火与多模态 SFT/DPO。语音接入
15M 小时音频做自监督训练,再由 adapter 转成语言模型输入表示。模型与预训练
8B/70B/405B;主要报告 405B 的完整训练流程。405B:126 层、hidden size 16384、128 个 attention heads,训练 15.6T tokens。8e-5,warmup 8000 步;batch 从 4M → 8M → 16M tokens。16K H100,长上下文阶段开启 CP;比较小模型与大模型的 scaling 预测。后训练
1e-5,每轮约 8.5K–9K 步,prompt token 不计算损失。1e-5、β=0.1,chosen NLL 系数 0.2。评测任务
pass@1。8-shot CoT、MATH 0-shot CoT;通用:MMLU、MMLU-Pro、IFEval。7000 个 prompt,覆盖单轮、多轮及多语言;按能力与难度分层采样。代码与推理
8B/70B/405B 分别为 72.6/80.5/89.0,模型扩大带来稳定收益。405B 的 HumanEval+ 为 82.3,更严格的测试仍会暴露原始单测未覆盖的错误。51.9/68.0/73.8;大模型改善数学能力,复杂推理仍未全面达到同期最强模型。指令、工具与多语言
405B 的 IFEval 为 88.6,BFCL 为 88.5,多轮偏好对齐与工具数据有效。91.6,多语言专家和推理数据扩充改善非英语数学能力。长上下文
405B Multi-needle 平均召回 98.1,InfiniteBench En.MC 83.4。128K 适配需要预训练与 SFT 数据共同支持。合成数据需要验证
405B 使用自身未经验证的输出,可能没有收益甚至退化。长上下文与对齐可以兼顾
效率与多模态扩展
405B 大规模训练 BF16 MFU 约 38%–43%;FP8 推理的 prefill 吞吐最高提升约 50%。405B-V 的 MMMU 为 64.5、DocVQA 为 92.6,冻结语言骨干仍能扩展视觉能力。