变化点
2026.06 · Nemotron 3 Ultra
- 扩大混合架构至
550B-A55B,强化复杂推理与专业任务。 - 训练领域教师,再通过 MOPD 汇聚到统一模型。
2026.04 · Nemotron 3 Super
- 引入 LatentMoE 与 NVFP4,兼顾模型容量和训练效率。
- 扩展多环境 RL,并加强 SWE 任务训练。
2025.12 · Nemotron 3 Nano
- 采用
25T tokens预训练,构建高效小激活模型。 - 结合多环境 RL 与长度控制,强化 Agent 能力。
2025.04 · Nemotron-H
- 引入 Mamba / Attention 混合架构与 FP8,降低生成成本。
- 通过 MiniPuzzle 剪枝与蒸馏,形成不同规模模型。
(2606) Nemotron 3 Ultra (550B-A55B, 多教师MOPD)
🌺 论文摘要
参考链接
问题背景
- 大规模多环境 RL 可以提高通用能力,但每个领域分到的训练样本减少,难以同时达到各领域最优。
- 长上下文、长输出和大模型训练成本,需要架构、低精度与后训练系统共同优化。
核心方法
- 架构与效率:
550B-A55BMamba-Attention + LatentMoE,结合 NVFP4、共享 MTP 与草稿 head 蒸馏。 - 基模训练:
20T预训练 +33B长上下文 CPT,支持1M上下文。 - 领域训练:学生两阶段 SFT + 统一 RLVR;独立优化 SWE、Terminal、办公、搜索、推理等专业教师。
- 多教师整合:轻量 warmup 后进行两轮 MOPD,在学生自己的轨迹上学习教师逐 token 指导。
模型效果(Ultra BF16,完整后训练)
- SWE-bench Verified
70.7,Terminal-Bench 2.156.4,RULER 1M94.7。 - Warmup 后,GDPVal 的 MOPD 结果由
35.3提高到46.7,说明教师与学生的轨迹匹配很重要。
重要结论
- MOPD 易于传递工具选择与工作流程;学生难以采出的深层推理路径,仅靠局部教师指导难以补齐。
核心贡献
- 将大规模高效基模、多领域专业教师与异步 on-policy 蒸馏形成可迭代的训练体系。
未来方向
- 改进教师/学生分布匹配,扩展端到端长程 MOPD,并研究训练稳定性与计算效率。
问题背景
专业能力被混合训练摊薄
- 环境种类增加后,每个 batch 中单一领域样本变少,领域能力难以持续突破。
- 不同领域需要不同数据、奖励与工作流程,独立教师便于针对性训练。
长任务的系统要求
- 大模型需要处理长历史并持续生成,模型参数、KV cache 与 rollout 等待同时影响成本。
- Ultra 延续 Super 的混合架构,同时重构教师整合与推理加速流程。
核心方法
混合架构与高效计算
主干
550B总参数、55B激活参数,108层,model dimension8192。- Mamba-2 用递归状态处理序列;Attention 保留对历史 token 的直接读取。
LatentMoE
- routed experts 在
2048维latent 空间计算,再映射回主干维度。 - 每层
512个routed experts,激活22个;低维专家降低通信与专家计算成本。 - 共享专家与主干保留各自功能,不把整个模型压到 latent 维度。
MTP
- 预训练使用两个共享权重的 MTP heads,包含 Attention 与 MoE。
- 同一 head 可递归产生更长草稿,避免每增加预测步都新增独立参数。
主要矩阵乘法
- 采用 NVFP4 的 E2M1 数据类型,覆盖前向、输入梯度与权重梯度 GEMM。
- 权重采用二维 block quantization;wgrad 输入使用 Random Hadamard Transform,梯度采用随机舍入。
高精度保留
- 最后约
15%网络、Mamba 输出投影、latent 投影、Attention 投影与 MTP 保留较高精度。 - embedding 等敏感位置同样避免统一降到 FP4,平衡效率与数值稳定性。
训练与推理差异
- 普通 teacher-forcing 训练的 hidden states 与递归草稿时的混合状态不同。
- 草稿越深,前面预测误差越容易累积,导致后续 token 接受率下降。
Head-only 蒸馏
- 冻结主模型,只更新 MTP head,使用主模型分布作为教师。
- 训练时混合不同预测步产生的 hidden states,模拟推理时的输入扰动。
- 使用温度化 forward KL,学习主模型完整分布,而不是只拟合单个标准 token。
预训练与上下文扩展
20T 预训练
- 前段重视领域覆盖,后段提高高质量 PDF、知识问答和 SFT 风格材料。
- 刷新 GitHub 代码,并补充法律、事实知识及合成任务。
- 使用 checkpoint merging 平衡知识、数学与代码能力,再选取扩窗起点。
33B 长上下文 CPT
- 数据混合为
46%长上下文材料 + 54%前阶段材料,加入文档 QA 与长上下文指令样本。 92%迭代使用1M,其余8%使用4K数学与代码材料,维持短任务能力。- 每个迭代使用一种长度,长短序列在迭代之间交替。
领域数据与教师训练
Terminal 与 SWE
- Terminal 约
370K多轮对话,以真实终端反馈组织操作与错误恢复。 - SWE 使用不同教师与 OpenHands、SWE-Agent、Mini-SWE-Agent、OpenCode 生成轨迹。
- 过滤未提交、无效工具调用、循环修改、只探索不修复,以及修改后从不测试等行为。
数学、代码与工业任务
- 数学分别构建有工具与无工具推理,证明任务加入生成、验证与修订。
- 竞赛代码通过测试筛选推理轨迹,覆盖 Python、C++ 与 Python 工具调用。
- 约
100K CUDA样本同时验证编译、数值和运行性能,并包含报错修复与 profiling 优化。 - RTL 数据覆盖规格生成、功能编辑与缺陷修复,使用语法和语义检查筛选。
Packing
- 按长度 best-fit 放入多个完整对话,减少 padding;不截断、不拆分原始对话。
- 包内去重,跨来源交错读取并最终 shuffle,避免一个 pack 长期集中于单一领域。
推理预算
- 加入 medium-effort 示范,以及保留答案、随机截短思考的训练样本。
- 对人工截断位置的
</think>屏蔽 loss,避免把被截断当成应该主动结束的监督。
环境覆盖
- 同时训练 Terminal、办公、SWE、搜索、工具调用、数学、代码、指令遵循与长上下文任务。
- 对相同任务使用多种 harness 与交互格式,减少对单一运行框架的依赖。
数据课程
- 先测量 reward 分布,再根据难度组织采样。
- 使用异步 GRPO 训练学生,为后续领域教师整合提供较全面的能力起点。
SWE 教师
- Agent SFT → 单步 PivotRL → 端到端 SWE-RL。
- 多轮修改仓库后运行隐藏测试,以二元奖励训练;未完成轨迹屏蔽 loss,格式错误 token 给予负优势。
- 任务仓库重建到 base commit,删除未来历史并限制从远程恢复参考补丁。
办公、Terminal 与搜索
- 办公任务围绕参考文件与交付物构造轨迹,学习文档、表格等专业工作流程。
- Terminal 使用长时限任务与 PivotRL,在准确率饱和后重新评估任务难度。
- Search 用带历史丢弃或摘要压缩行为的轨迹做 SFT,训练有限窗口下的持续搜索。
推理、对话与可靠性
- STEM 与竞赛代码教师追加专项 SFT / RL,学习更复杂的推理路径。
- Chat 教师由 Ultra GenRM 提供偏好信号,支持按具体原则评价回答。
- 指令与事实教师训练格式遵循和不确定时弃答;安全教师使用工具轨迹验证 prompt injection 防御。
多教师 On-Policy 蒸馏
Warmup
- 不同 SFT 路线会形成不同解题习惯,学生轨迹可能落到教师不熟悉的状态。
- MOPD 前用少量教师训练分布的数据做轻量 SFT,使学生先掌握对应工作流程。
两轮 MOPD
- 学生在各领域生成自己的轨迹,对应教师提供逐 token 指导。
- 第一轮后从更强学生继续训练部分教师,再与保留教师一起进行第二轮整合。
- 没有专项教师的领域,使用原学生作为 self-teacher,帮助保持已有能力。
Token 级优势
- 教师比近端学生更认可已采出的 token,该位置得到正指导;反之为负。
- 例如教师概率
0.4、近端学生0.2,优势为ln 2;它表达相对偏好,不是独立任务奖励。
两个概率比
π_prox / π_behav:修正异步 rollout 旧策略与近端策略的差异,停止梯度。π_θ / π_prox:衡量本次更新的幅度,使用 PPO 式裁剪。- IcePop 对 token 做 mask,抑制不适合当前更新的数据。
- rollout、教师打分和学生更新流水并行;多数 Agent 蒸馏使用单轮片段控制成本。
实验设置(Ultra预训练、RLVR与MOPD)
预训练与扩窗
- 预训练
20T tokens;CPT33B tokens,固定学习率2.5e-6。 - GB200 上采用
CP=32、TP=8、EP=128、PP=2进行长上下文训练。
两阶段 SFT
- 阶段1:packing
294912,batch64,204800个 packed samples,峰值学习率1.5e-5。 - 阶段2:packing
515000,batch64,19200个 packed samples,峰值学习率1e-5。 - packed samples 指打包后的训练序列,一个序列可以含多个完整对话。
RLVR 与教师
- 统一 RLVR:global batch
8192,每样本16条 rollout,生成长度48K → 64K。 - SWE 教师端到端训练:最大生成
192K、最多200轮Agent 交互。
MOPD 与 MTP
- MOPD:每批
1024个 prompts,每 prompt1条 rollout,最大生成192K。 - MTP Boosting:
12K步、batch=64、8K序列,KL 温度2,训练7步预测。 - 对比 warmup、两轮 MOPD、领域教师,以及 MTP Boosting 前后的接受长度。
关键结果(Nemotron 3 Ultra,RLVR + MOPD)
MOPD 持续改善 Agent
- 阶段对照中,SWE-bench Verified:RLVR
65.8 → MOPD1 70.1 → MOPD2 71.7。 - Terminal-Bench 2.0:
44.5 → 50.8 → 54.0,显示多轮教师整合的持续收益。 - 最终统一 BF16 评测中,SWE-bench Verified 为
70.7,Terminal-Bench 2.1 为56.4。
Warmup 对工作流程更有效
- GDPVal:无 warmup
35.3,有 warmup46.7;BrowseComp:33.0 → 44.4。 - HLE 仅
26.3 → 26.7;浅层轨迹匹配无法补齐学生原本不具备的复杂推理路径。
教师能力并非全部转移
- MOPD2 的 BrowseComp
44.4,教师51.0;HLE26.7,教师32.1。 - 作者认为,学生很少访问的推理路径难以通过 on-policy token 指导获得充分监督。
长上下文
- 最终 BF16 模型在 RULER
1M上达到94.7,保持较强的长历史检索与关联能力。
MTP Boosting
- SPEED-Bench 贪心解码平均接受长度约
4.39 → 4.58,深层草稿位置收益更明显。 - 改善草稿与主干的一致性可以增加接受 token,且不必更新主模型参数。
推理负载
- GB200 上
8K输入 / 64K输出的吞吐配置中,相对 GLM-5.1 达5.9×。 - 长输入、短输出场景更受 prefill 影响,混合架构的优势需要结合具体负载判断。
未来方向
教师/学生分布匹配
- 比较统一 SFT 起点、教师先生成 SFT 数据等路线,让教师指导覆盖学生的实际状态。
- 研究何时使用采样 token 指导、何时使用更完整的分布匹配。
端到端长程蒸馏
- 从单轮片段扩展到完整 Agent rollout,处理任务时长差异与异步策略过期。
- 更好地协调推理与交互任务的采样、判分和教师服务,控制端到端训练成本。
训练稳定性
- 持续分析专家负载、残差尺度与低精度梯度问题,减少大规模训练发散。
(2604) Nemotron 3 Super (LatentMoE, NVFP4, 多环境RL)
🌺 论文摘要
参考链接
问题背景
- 长程 Agent 同时需要长上下文、稳定工具调用与较低推理成本,单独扩大模型难以兼顾。
- 单领域后训练容易损伤其他能力;长程 SWE rollout 又会拖慢混合 RL 的采样。
核心方法
- 混合架构:
120B-A12BMamba-2 + Attention + LatentMoE,结合共享 MTP 与分模块量化。 - 基模训练:NVFP4 预训练
25T tokens,再以51B tokens扩展到1M上下文。 - Agent 数据与 SFT:真实 Issue、Terminal、搜索和工具轨迹;先按 token、再按 conversation 平均 loss。
- 多领域后训练:
21个环境、37套数据联合 RLVR → 独立 SWE-RL → RLHF → MTP healing。
模型效果(Nemotron 3 Super,完整后训练)
- SWE-bench Verified:OpenHands
60.47、OpenCode59.20、Codex53.73。 - AIME25 无工具
90.21,RULER 1M91.64,兼顾推理与长上下文。
重要结论
- 多环境联合 RL 保留通用能力;慢速 SWE 单独训练,解决采样效率与任务覆盖之间的冲突。
- SFT 的归一化单位也影响能力:长回答占据过大权重,会损害长输入、短输出任务。
核心贡献
- 将低成本混合架构、可执行 Agent 数据与分阶段 RL 整合为开放模型训练路线。
未来方向
- 进一步优化跨 harness 泛化、长程交互成本和长上下文实际任务能力。
问题背景
长程推理
- 历史越来越长,工具调用需要持续读取上下文,推理速度和显存共同限制任务长度。
- 模型既要学习推理,也要掌握真实工具的输入格式、反馈处理和多步操作。
多领域后训练
- 只训练单一环境容易让其他 benchmark 回退,需要在训练中保留多任务分布。
- SWE 的容器执行和长轨迹明显慢于数学题,统一采样会受到慢任务拖累。
核心方法
混合架构与推理优化
混合主干
- 约
120B总参数、12B激活参数,88层,hidden size4096。 - Mamba-2 使用固定大小的递归状态;少量 Attention 作为全局信息交互节点。
- Attention 使用
32个Q heads、2个KV heads,减少 KV cache。
LatentMoE
- routed experts 的输入由
4096维投影到1024维,专家聚合后再映射回主干维度。 - 专家计算与跨设备通信发生在低维空间,节省的开销用于增加专家数量与激活数量。
- 每层
512个专家、Top-22;router 和 shared expert 保持主干维度。


训练方式
- 两个 MTP heads 共享参数,在多个预测偏移上训练,辅助损失权重
0.3。 - 同一个 head 可以递归生成更多草稿 token,再由主模型并行验证。
后训练恢复
- SFT 继续训练 MTP;RL 完成后,冻结主模型,只对 MTP heads 做 healing。
- 复用 RLVR prompts 和生成回答,以 NLL 训练草稿 head,恢复其与最终模型的匹配。
混合量化
- FP4 权重量化离线搜索最小 MSE 的 block scale;激活使用运行时 max scale。
- AutoQuantize 根据算子敏感性和成本,将少量层提升为 FP8/BF16,主要 routed experts 保持 FP4。
SSM 状态误差
- Mamba 状态反复更新,确定性舍入偏差可能积累,导致输出变长。
- FP16 cache 使用随机舍入,减少系统性漂移,同时保留较低状态存储成本。
预训练与上下文扩展
NVFP4
- 主要线性层以 NVFP4 进行前向和反向矩阵乘法,权重采用二维 block scaling。
- 权重梯度计算使用 Random Hadamard Transform,梯度量化使用随机舍入。
- 最后约
15%网络、Attention 和 latent projections 保持 BF16;Mamba output projection 使用 MXFP8。
预训练数据
25T tokens:前20T强调来源多样性,后5T提高优质数据比例。- 包含网页、代码、数学、多语言、学术材料,以及带推理过程的合成任务。
- Code Concepts:组合编程概念生成题目,教师生成解答,再检查 import 一致性和 Python AST。
- 补充边界条件、单元测试、形式逻辑与多选题数据,增强代码执行和结构化推理。
长上下文 CPT
34B tokens使用1M序列;随后17B tokens交替训练1M/4K序列。- 数据中
20%为长文档 QA,其余来自预训练末期数据;短序列用于保持数学等能力。
Agent 数据与 SFT
SWE 与 Agentic Programming
- 从 SWE-Gym、R2E-Gym、SWE-rebench 取得 Issue 和容器,用 Qwen3-Coder 教师采集 OpenHands 轨迹。
- CLI 数据按
24类操作生成任务;合成任务加入 AGENTS.md 约束,学习规划、并行工具和技能使用。 - 在 Codex、OpenCode、Qwen Code 等环境中记录交互,统一为带 tool definitions 的对话格式。
Terminal
- 约
85K条轨迹,混合技能分类合成题与已有数学、代码任务。 - DeepSeek-V3.2 在隔离容器中执行,用 Terminus 2 记录命令、结果与修正过程。
Search
- 从 Wikidata 进行
4–8跳图遍历,构造答案已知的多跳问题。 - 隐藏中间实体,避免问题直接暴露搜索链;教师通过真实搜索采集带来源的完整轨迹。
业务工具数据
- 流程:领域 → 业务规则与工具 → 用户场景 → 多次模拟交互 → 过程/结果验证 → SFT 筛选。
- 每个场景模拟
16次交互,剔除全成功或全失败场景,从其余场景保留成功轨迹。 - 最终约
279K段对话,覆盖838个领域。
通用工具数据
- User、Assistant、Tool 三种 LLM 角色模拟任务与调用,结合逐轮规则检查和整段质量评估。
- 构建约
1.5M条轨迹,覆盖单轮、多轮和多步工具任务。 - SQL 数据加入无关表/列,训练模型从混杂 schema 中选择正确字段。
两种损失
- Stage 1:所有输出 token 统一平均,充分学习长推理轨迹。
- Stage 2:先在每段 conversation 内平均,再对 conversation 平均,降低长输出的权重优势。
- 第二阶段沿用
85%原数据,加入15%长上下文数据,强化长输入、短输出场景。
三种推理模式
- 支持 reasoning-off、regular、low-effort;SFT 引入短推理示范和去除推理过程的回答。
- 增加短期 semi-on-policy SFT:采集自身回答,把部分思考截断到不同预算,学习按预算收束。
- RL 对 low-effort prompts 同时考虑正确性与生成长度,优化质量和成本的取舍。
多环境 RL 与偏好训练
环境与课程
21个环境、37套数据覆盖数学、代码、STEM、指令遵循、长上下文、工具、Terminal 等。- 过滤 SFT 模型稳定解出的简单题,再按难度安排课程;每次更新保留多领域任务。
异步 GRPO
- 推理和训练分配到不同 GPU,rollout buffer 持续收集轨迹,参数更新后及时推送。
- 推理策略最多落后一步,减少长轨迹造成的策略陈旧。
- 对训练与推理 log-prob 的重要性比率做 mask,抑制异步及训练/推理差异。
PivotRL
- 复用离线专家轨迹,在模型对下一步动作不确定的关键 turn 进行 RL。
- 用领域奖励评价动作与专家动作的匹配,允许语义相近的操作,降低完整在线交互成本。
SWE-RL
- 每条 rollout 启动 Apptainer 容器,Agent 处理 Issue、生成补丁,以真实测试给出二值奖励。
- 在 OpenHands 内实现 OpenCode/Codex 风格的工具与提示,训练时切换交互形式。
- 单独配置长轨迹的采样与 batch,避免拖慢前面的短任务 RLVR。
RLHF
- 以 Qwen3-235B-A22B-Thinking 初始化 principle-following GenRM。
- 使用 HelpSteer3、偏好比较数据训练评价模型,对指令、交互质量和行为规则提供监督。
- GenRM 参与混合 RL,并在最后单独进行 RLHF。
实验设置(Super预训练、SFT与RL)
基模训练
- PreTrain:AdamW,
25T tokens,seq8192,batch3072条。 - WSD:前
200B tokenswarmup 到4.5e-4,最后5T tokens衰减到4.5e-6。 - 长上下文 CPT:
51B tokens,batch16,lr4.5e-6,GB200 上使用 Context Parallel。
SFT 与 RL
- SFT 超过
7M条;阶段1 packing256K、batch64,阶段2512K、batch32,lr 均1e-5。 - RLVR:每步
256个prompts × 16条rollout,batch4096,每批一次梯度更新。 - 最大生成长度从
49K增至64K;SWE 使用独立长程交互阶段。
评测协议
- 推理评测分别记录有工具/无工具;SWE-bench Verified 分别使用 OpenHands、OpenCode、Codex。
- 长上下文:RULER 每个任务
100个样本,另测 AA-LCR 文档推理。 - 使用 NeMo Evaluator/Skills;Terminal、Tau2 等采用对应 benchmark 的环境。
关键结果(Nemotron 3 Super,多环境RL + SWE-RL)
推理与代码
- AIME25 无工具
90.21,LiveCodeBench v581.19,具备较强数学与代码求解能力。 - GPQA 从无工具
79.23到有工具82.70,体现工具执行对科学推理的补充作用。
跨 Harness 的 SWE 能力
- SWE-bench Verified:OpenHands
60.47、OpenCode59.20、Codex53.73。 - 同一模型在不同交互协议下差距明显,多 harness 训练改善适应能力,但模型与框架仍需配合。
长上下文
- RULER:
256K 96.83 → 512K 95.22 → 1M 91.64,扩展窗口后仍能保持较强检索能力。 - AA-LCR 为
58.31;长文档综合推理比单纯找到远处信息更难。
训练与推理设计
- 两阶段 SFT 恢复长输入、短输出能力,说明训练样本的加权方式会改变能力分布。
- 多环境 RL 比单环境训练更能避免其他任务回退;SWE 独立阶段兼顾任务时延差异。
- SPEED-Bench 上 MTP 平均接受长度
3.45,结合混合架构提升吞吐;报告最高达 GPT-OSS-120B 的2.2倍。
未来方向
长程训练效率
- 比较 PivotRL 与端到端 RL 的互补作用,减少容器采样成本并保持真实任务完成率。
跨环境泛化
- 扩展训练工具和 harness 多样性,减少更换交互协议后的性能下降。
长上下文与量化
- 从 RULER 检索继续优化文档推理和长任务执行;联合观察准确率、输出长度与端到端耗时。
(2512) Nemotron 3 Nano (25T, 多环境RL, 长度控制)
🌺 论文摘要
参考链接
问题背景
- 小型 Agent 模型需要兼顾推理、工具和长上下文,不能只优化单一 benchmark。
- 大量 SFT 后仍需探索更优解法;RLHF 又容易产生冗长思考,增加部署成本。
核心方法
- 混合架构:Mamba-2 + 少量 Attention + MoE,约
31.6B总参数、3.2B激活参数,部署采用选择性 FP8。 - 基模训练:
25T tokens预训练,121B tokens长短混合 CPT。 - 多领域 SFT:超过
18M条样本,包含真实 SWE 轨迹、工具推理、Lean 证明与 Terminal 操作。 - RL 与长度控制:GRPO 联合难度课程;GenRM 环形比较与组内长度奖励,兼顾回答质量和推理成本。
模型效果(Nemotron 3 Nano BF16,SFT + RL)
- AIME25:无工具
89.06、有工具99.17;LiveCodeBench v668.25。 - SWE-bench Verified/OpenHands
38.76;RULER 1M86.34。
重要结论
- RLVR 可以超过充分训练的 SFT;多环境联合训练比单领域优化更能保持综合能力。
- 长度奖励需要在相同问题内比较,并兼顾回答质量,避免一味鼓励短输出。
核心贡献
- 以较低激活参数提供多领域 Agent 能力,并公开从数据到 RL 环境的训练配套。
未来方向
- 补强复杂 Terminal、多语言知识和长文档推理,继续改善长程任务的效率与泛化。
问题背景
通用能力
- 数学、代码、工具与对话的训练目标不同,单领域 RL 可能使其他能力持续退化。
- SFT 能学习教师示范,但仅增加训练轮数,未必能找到更好的任务求解策略。
推理成本
- Agent 需要多次生成并读取长历史,激活参数量和 KV cache 都影响吞吐。
- 对话任务不总需要长思考,必须让模型学会推理开关与预算控制。
核心方法
混合架构与量化
序列建模
52层,hidden size2688;Mamba-2 以递归状态处理历史,保留6层Attention进行直接 token 交互。- Attention 使用
32个Q heads、2个KV heads;不使用位置编码,采用 RMSNorm。
稀疏容量
- 用 MoE 替换普通 FFN;每层
128个routed experts,每 token 激活6个,另有2个shared experts。 - 总参数约
31.6B,非 embedding 激活参数约3.2B,以稀疏激活控制单步计算量。
校准数据
- 使用
1K条推理 SFT 数据校准,更贴合最终模型的激活分布。
敏感模块
6层Attention及其前面的6层Mamba保留 BF16,其他适合的权重/激活使用 FP8。- KV cache 使用 FP8,Mamba 的 Conv1D 保持 BF16,在显存与精度间取舍。
预训练与上下文扩展
数据来源
- 覆盖网页、GitHub、数学、学术文本、多语言和合成推理等
15类数据。 - 网页代码用 Lynx + LLM 提取,保留代码和公式,减少 HTML 噪声。
- GitHub 数据经过规则过滤、去重与质量筛选;合成代码加入概念组合、边界条件和解题过程。
两阶段课程
- 前
23.5T tokens强调覆盖与多样性,最后1.5T tokens提高优质来源权重。 - 学习率使用 WSD;数据质量课程与学习率衰减分别控制。
长上下文 CPT
- 额外训练
121B tokens,混合512K/4K序列,保留短任务能力。 - 数据配比:
20%长文档 QA、1%合成检索,其余来自高质量预训练数据。 - 训练扩展长度为
512K,模型同时报告1M窗口的长上下文评测。
多领域 SFT 数据
推理与代码
- 数学引入 GPT-OSS-120B 的 Python 工具推理;竞赛代码使用 DeepSeek-R1-0528 解答。
- Lean 数据将自然语言定理形式化,再多次生成与修正证明,以编译验证筛选约
300K条样本。 - CUDA 数据要求成功编译,且数值结果与 PyTorch reference 一致。
SWE 与 Terminal
- SWE-Gym、R2E-Gym 提供 Issue 和执行环境,Qwen3-Coder 教师采集修复过程。
- 覆盖 OpenHands、SWE-Agent、Mini-SWE-Agent,保留代码探索、复现和修改动作。
- Terminal 把数学、代码、长文档和文件操作包装为可验证任务,用 Terminus 记录交互。
工具与指令
- 用 LLM 模拟 User、Agent 和工具环境,再检查各角色的行为与任务目标是否一致。
- 指令数据先通过规则 verifier,再用 LLM judge 剔除只在表面满足约束的回答。
- 统一过滤缺工具定义、错误结构和重复推理轨迹。
数据权重
- 总计训练超过
18M条样本,根据单领域效果确定配比;小数据集可重复多轮。 - 包含对话、推理、Agent、多语言与安全数据,不只蒸馏成功解题结果。
推理历史
- 同一用户任务内多次工具调用,保留当前轮的思考,便于后续动作复用。
- 新用户消息到来后,丢弃旧轮次思考,避免历史推理持续挤占上下文。
推理开关与预算
- 随机
10%样本去掉推理过程,训练直接回答模式。 - 随机
3%样本将思考截断到不同预算,接回最终回答,训练按预算结束思考。
多环境 RL 与长度控制
可验证任务
- 数学、竞赛代码、STEM QA、指令、JSON schema、长文档与业务工具任务共同训练。
- 数学采用 DAPO/SkyWorks 数据;代码限制每题最多
50个测试,控制奖励计算时间。 - 工具任务通过沙盒数据库状态验证,长文档任务要求综合至少五份文档。
训练算法
- 同步 GRPO:
128个prompts × 16条rollout,整批一次更新。 - masked importance sampling 减少训练/推理概率差异;超长样本做 overlong filtering。
- 冻结 MoE router 权重,继续更新专家负载均衡 bias,稳定路由。
训练顺序
- SFT 后进行多环境 RLVR,再训练 RLHF,之后追加一轮多环境 RLVR。
- RLVR 全程混合各环境,保留通用任务分布。
初始难度
- 用 SFT checkpoint 测量各题通过率,过滤已经
100%解出的题目。 - 每个 batch 固定各领域比例,避免课程调整改变领域分布。
采样规则
- 每个领域按通过率建立高斯采样分布,目标均值随训练逐步降低。
- 初期较多采样容易题,后期转向困难题;保留难度分布宽度,避免只学极端样本。
- 训练进入平台期后,用最佳 checkpoint 重新测量通过率,再构造新课程。
GenRM 训练
- 以 Qwen3-235B-A22B-Thinking 初始化,输入对话与两个候选回答,输出分析、helpfulness 分和排序。
- GRPO 奖励惩罚格式错误、helpfulness 预测误差和排序误差。
- 使用 HelpSteer3、人类偏好数据与合成安全数据,交换回答位置减少位置偏差。
环形比较
16个候选若两两比较,需要120次评价;改为相邻候选构成环,只需16次。- 每个回答分别作为左右候选出现一次,其奖励取两次分数的平均。
- Helpfulness 同分时,利用排序分进一步拉开优劣。
组内比较
- 将输出拆成 thinking 与 answer,分别在同一问题的候选组内归一化长度。
- 短输出得到较高长度分,再减去组均值,保持长度调整在组内零和。
质量约束
- 对最短思考、最短回答追加奖励前,要求其基础质量处于该组前
20%。 - 困难问题可以整体回答较长;该方法主要鼓励同一道题中较高效的解法。
实验设置(Nano预训练、SFT与多环境RL)
预训练
25T tokens,seq8192,batch3072;AdamW,weight decay0.1。- WSD 峰值 lr
1e-3,最后5T tokens衰减到1e-5。 - CPT:
121B tokens,长短序列混合,batch48,lr1e-5。
SFT 与 RL
- SFT:
13000步,batch64,packing256K,lr5e-5,warmup800步。 - RLVR:prompt batch
128,每题16条,train batch2048,最大生成49K。 - GenRM:每批
128个prompts、每题8条;RLHF 每题16个候选。
评测与对照
- 对照 Qwen3-30B-A3B-Thinking-2507、GPT-OSS-20B,SWE 使用 OpenHands。
- RULER 关闭 reasoning,AA-LCR 开启 reasoning;数学分别测试有工具与无工具。
- 吞吐:单 H200,
8K输入/16K输出,各模型选 vLLM/TRT-LLM 中表现更好的配置。
关键结果(Nemotron 3 Nano,SFT + RLVR + RLHF)
推理与 Agent
- AIME25 从无工具
89.06到有工具99.17,执行反馈显著补充数学求解。 - LiveCodeBench v6
68.25,SWE-bench Verified38.76,Tau2 平均49.04。 - Terminal hard subset 只有
8.51,复杂系统操作仍明显难于结构较清晰的解题任务。
RL 相比继续 SFT
- 对比约
3轮和充分训练约5轮的 SFT checkpoint,RLVR 在评测领域超过或达到充分 SFT 的效果。 - 固定领域比例时,课程采样比随机采样学习更稳定,关键是难度分配而非额外增加某个领域的数据。
长度控制
- Group Relative Length Control 将冗长程度降低约
30%,同时保持准确率。 - 组内比较加质量门槛,让长度优化依赖具体问题与回答质量。
长上下文与部署
- RULER 1M
86.34,但 AA-LCR35.85,说明长窗口检索不等于复杂文档推理。 - 选择性 FP8 的中位准确率恢复约
99%;单 H200 长输出吞吐最高为 Qwen3 同级模型的3.3倍。 - MMLU-ProX
59.50,多语言知识仍是相对短板。
未来方向
复杂 Agent 任务
- 加强 Terminal 和长程环境反馈,提高文件、程序、系统状态的联合操作能力。
通用能力平衡
- 在增加推理与 Agent 数据时补强多语言知识,持续检查领域之间的能力回退。
计算效率
- 将长度控制扩展到工具次数和端到端时延,联合优化任务成功率与执行成本。
(2504) Nemotron-H (混合架构, FP8, MiniPuzzle)
🌺 论文摘要
参考链接
问题背景
- Transformer 的长上下文推理受 KV cache 和访存限制,需要提高相同硬件下的吞吐。
- 高效架构还要能完成预训练、压缩、视觉扩展和推理后训练,形成可用模型系列。
核心方法
- 混合架构:约
8%层为 Attention,其余以 Mamba-2 与 FFN 为主。 - FP8 预训练:主要线性层前向/反向使用 FP8,首尾敏感层保持 BF16。
- MiniPuzzle:重要性估计 → 显存约束架构搜索 → KL 蒸馏,将
56B压缩到47B。 - 扩展分支:VLM 使用视觉编码器与两阶段训练;Reasoning 使用分阶段 SFT、长上下文训练和 GRPO。
模型效果(Base与Reasoning分支)
- Base 的 MMLU-Pro:
56B 60.5、47B 61.8;47B 保持接近原模型的综合能力。 - 47B-Reasoning:AIME25
54.2,LiveCodeBench50.2,IFEval Prompt84.5。
重要结论
- 大幅减少 Attention 仍能保留较强语言与后训练能力,并降低长上下文推理成本。
- 压缩候选应在短期蒸馏后比较;直接剪枝后的分数不能充分预测恢复后的表现。
核心贡献
- 系统验证混合架构、低精度预训练与硬件约束压缩的组合路线。
未来方向
- 继续优化混合模型推理实现,并研究更稳健的压缩与长上下文能力。
问题背景
Attention 成本
- 自回归生成持续读取历史 KV,长上下文增加显存占用,也限制可用 batch size。
- Mamba-2 的递归状态大小固定,但纯递归模型对历史信息的直接检索能力有限。
架构目标
- 用少量 Attention 补充全局读取,大部分层使用 Mamba-2,兼顾能力与吞吐。
- 再通过低精度训练和压缩降低训练、部署成本。
核心方法
混合模型架构
混合布局
- 8B:
52层中含4层Attention;56B:118层中含10层Attention。 - Attention 均匀分布,其余层由 Mamba-2 与 FFN 构成;Attention 后接 FFN。
- Mamba-2 压缩历史状态,Attention 保留 token 级直接交互。
主要参数
- 8B hidden size
4096,56B 为8192;两者均使用8个KV heads。 - 使用 RMSNorm、squared ReLU,不使用位置编码;各层保留 residual connection。
受控对照
- 同时训练 Nemotron-T-8B,保持相同数据,比较纯 Transformer 与混合结构。
预训练与 FP8 计算
数据组合
- 网页、代码、数学、学术、多语言等真实数据,搭配合成解题与知识数据。
- 按来源质量分配权重,提高优质数据比例,同时保持领域覆盖。
- 8B 训练
15T tokens,56B 训练20T tokens。
FP8 配方
- 56B 的线性层前向/反向采用 FP8,首
4层与末4层保持 BF16。 - 权重、激活使用 E4M3;梯度使用动态范围更大的 E5M2。
- 每个 tensor 根据最大绝对值动态缩放,再转换为 FP8。
训练稳定性
- 配合异常检测、checkpoint 与自动恢复处理大规模训练故障。
- 同时观察 loss 与下游任务,低精度带来的 loss 差异未必对应任务能力差异。
模型剪枝与蒸馏
层重要性
- 临时移除某层,比较完整模型与剪枝模型在 LM head 前的 hidden states。
- 用 MSE 衡量变化,在小校准集上平均;变化小的层更适合删除。
FFN 神经元重要性
- 统计 FFN 中间神经元的激活强度,优先保留贡献较大的维度。
- 搜索深度与 FFN 宽度;直接剪 Mamba head/state 维度会明显损害能力。
显存约束搜索
- 枚举各类层数与 FFN 宽度,筛选满足
32GiB GPU部署预算的结构。 - 约
400个候选先按 next-token accuracy 和 parent agreement 排序,再用任务评测筛到三个。 - 搜索预算同时计入 FP4 权重、
1M上下文 cache 和运行缓冲。
候选比较
- 三个候选各用约
7B tokens短期蒸馏,观察剪枝后的可恢复程度。 - 选择恢复效果最好的候选,再用
63B tokens完整蒸馏。
训练目标
- Teacher 为 56B,Student 为剪枝后的 47B,只优化输出分布的 forward KL。
- 目标是让 Student 恢复 Teacher 的预测分布,而非重新从头学习语料。
最终结构
- Attention 从
10层减到5层,Mamba 从54层减到44层,FFN 为49层。 - FFN intermediate size 从
32768压缩到30720。

多模态与推理后训练
图像编码
- InternViT-300M 编码图像;动态切成最多
12个448×448 tiles,另加全图 thumbnail。 - 相邻四个视觉 token 合并,每个 tile 从
1024压缩到256 tokens。 - 加入 tile ID,经两层 FFN projector 映射到语言模型空间。
训练流程
- VL PreTrain:冻结视觉编码器和 LLM,只训练 projector,完成模态对齐。
- VL SFT:图像问答、OCR、图表和文档任务联合训练视觉编码器、projector 与 LLM。
STEM 阶段
- 优先训练数学、科学与代码,推理/直接回答样本约
5:1。 - 推理轨迹包含多种解法和修正,另保留去掉思考的配对回答。
通用对话阶段
- 加入指令、安全和多轮对话,同时回采 STEM 数据,减少能力回退。
- 第二阶段数据量约为第一阶段的
1/10,推理与非推理样本更均衡。
模式控制
- Chat template 根据 reasoning 标签添加
<think>或空思考前缀,控制是否显式推理。
长上下文构造
- 拼接短对话到
512K,插入对早先对话的引用问答,训练跨长距离检索。 - 将相关主题片段分散到历史,再提综合问题;另加入文档聚合 QA 和带干扰的高频词检索。
- 生成器只处理局部相关片段,避免生成长样本时依赖教师的完整长上下文能力。
GRPO
- 为指令等任务构建自动 verifier,按任务阶段优化,再用通用 Reward Model 提高 helpfulness。
- 指令阶段使用约
16K个LMSYS prompts附加 IFEval 风格约束,以规则判分。 - 最后用基于 Qwen-32B 的 Reward Model,在 HelpSteer2 prompts 上进行 GRPO。
架构对照实验
- 另有同数据 8B Hybrid/Transformer 的 SFT 与 DPO/RPO 对照,用于检查混合架构的可对齐性。
- 该对照与最终 Reasoning 分支分别记录,不混为一条训练流程。
实验设置(Base、MiniPuzzle与Reasoning分支)
基模
- 8B:
15T tokens,峰值 lr8e-4;56B:20T tokens,峰值 lr4e-4。 - Seq
8192,batch768条,AdamW;cosine decay 到峰值的1%。
剪枝蒸馏
- 层重要性使用
128个样本,FFN 重要性使用1024个样本。 - 蒸馏使用 FP8、temperature
1、seq8192、batch768。
后训练与评测
- Reasoning 的指令 GRPO lr
1e-6,TRT-LLM 采集 rollout;VLM 使用独立图文训练数据。 - Base 使用 few-shot 数学/知识和代码执行测试;Reasoning 使用 AIME、GPQA、LCB、IFEval 等。
- 吞吐测试:H100,输入
65536、输出1024 tokens,尽量增大 batch,按每 GPU 归一化。
关键结果(Nemotron-H Base与后训练分支)
Base 与压缩
- MMLU-Pro:56B
60.5、47B61.8;HumanEval:60.4 → 61.0。 - 剪枝蒸馏基本保留综合能力;少量任务波动,核心收益是更小部署体积和更高吞吐。
64K输入/1K输出时,47B 每 GPU 吞吐约为 Qwen2.5-72B 的2.9倍。
候选排序
- 短期蒸馏后,不同候选的差距明显缩小,部分初始较弱的结构也能恢复。
- 因此搜索不能只看刚剪完的分数,需要把恢复训练纳入结构选择。
FP8
- FP8 的 loss 略高,但下游能力可达到 BF16 水平,训练 loss 不足以单独决定精度方案。
Reasoning 与视觉
- 47B-Reasoning 的 AIME25
54.2、LCB50.2、IFEval Prompt84.5,可继续获得推理和指令能力。 - 相比 Qwen3-32B,代码仍有差距:LCB
50.2 vs 64.2,混合架构优势主要在能力与效率的组合。 - 56B-VLM 的 MathVista
70.7、DocVQA93.2,说明该主干也能承接图文理解训练。
未来方向
推理实现
- 作者预期继续优化混合模型 kernel 与推理系统,释放尚未充分优化的吞吐空间。
压缩策略(笔记整理)
- 将硬件显存、时延和目标任务一起纳入搜索,比较短期蒸馏对结构排序的预测价值。
能力扩展(笔记整理)
- 继续补强代码和长文档推理,研究递归状态与直接 Attention 的合适比例。
(2406) Nemotron-4 340B (合成对齐数据, Reward Model, RPO)
🌺 论文摘要
参考链接
问题背景
- 高质量对齐数据依赖昂贵的人工标注,需要扩大数据覆盖,同时控制合成回答的质量。
- 仅用 chosen/rejected 的二值偏好,会忽略回答质量差距,也可能损伤较好的 rejected 回答。
核心方法
- Base:
340B Dense,8T预训练 + 1T CPT。 - Reward Model:基于 HelpSteer2,分别回归 helpfulness、correctness 等五个属性。
- 数据迭代:合成 prompts / 对话 → 奖励筛选与配对 → 训练更强模型 → 更新生成器。
- 对齐训练:Code / General SFT → DPO → 三轮 RPO;使策略奖励差匹配 RM 质量差,保留偏好强弱。
模型效果(Nemotron-4-340B-Instruct/Reward)
- Instruct:HumanEval
73.2,GSM8K92.3,IFEval Prompt-Strict79.9。 - Reward:RewardBench
92.0,为合成数据质量筛选与偏好排序提供基础。
重要结论
- 超过
98%的对齐数据可以由模型生成,但少量高质量人工监督仍负责建立评价标准。 - 分阶段 SFT 与多轮偏好训练相互补充;代码和通用能力需要持续平衡。
核心贡献
- 公开 Base、Instruct、Reward 和合成数据流程,形成可用于训练其他模型的完整配套。
未来方向
- 继续扩展数据生成工具,并改善合成任务难度、奖励泛化和迭代训练稳定性。
问题背景
数据规模
- 真实人工对话昂贵,已有公开数据难以持续提供足够广的任务和指令组合。
- 合成数据可控、可扩展,但生成错误和偏好排序偏差会被后续训练放大。
训练目标
- 同样是 rejected,有的回答只稍差,有的明显错误;二值排序丢失了这个区别。
- 模型需要学习真实质量差距,避免不断拉大偏好间隔而破坏已有能力。
核心方法
Base 模型与预训练
模型架构
340B Dense Transformer,96层,hidden size18432,上下文4096。- 使用 GQA:
96个Q heads、8个KV heads;RoPE、squared ReLU、输入输出 embedding 不共享。
数据与阶段
- 英文
70%、多语言15%、代码15%,覆盖53种自然语言、43种编程语言。 - 先进行
8T tokens预训练,再用1T tokens调整数据分布和学习率,完成 CPT。
多维奖励模型
训练数据
- HelpSteer2 提供约
10K条人工标注,建立不同回答质量属性的监督信号。 - 在 340B Base 上替换输出层,以线性 reward head 输出五维分数。
属性分解
- Helpfulness、Correctness、Coherence、Complexity、Verbosity 分开回归。
- 把“是否有帮助”与“是否更长、更复杂”分开,减少模型只偏爱长回答的倾向。
- 使用时按权重合成总分,支持质量过滤与候选排序。
合成数据与迭代
Prompt 多样性
- 按任务、主题、指令三条维度构造 prompts,覆盖开放问答、写作、文档问答、数学和代码。
- 从宏观主题扩展子主题,再细化问题;附加格式、段落数等可验证约束。
- 混合 LMSYS 等真实 prompts,增加真实用户请求的复杂度。
多轮对话
- 模型轮流扮演 User 和 Assistant,结合用户画像生成多轮交流。
- Reward Model 给整段对话打分,筛除低质量示范;SFT 与偏好 prompts 分开。
偏好配对
- 从多个中间模型和同一强模型的多次采样中生成候选,兼顾多样性和细粒度差异。
- 数学、指令等任务优先使用正确答案或程序 verifier;开放任务使用 Reward Model。
- 早期 LLM judge 通过交换回答顺序检查一致性,后期转向更准确的 Reward Model。

迭代路线
- 初期用 Mixtral-8x7B-Instruct 生成数据,对齐更强的 340B Base 中间 checkpoint。
- 将得到的 Instruct 模型用作新生成器,重新生成更高质量的数据,再训练后续 Base。
- 基模预训练与数据生成并行推进,模型能力与数据质量共同改进。
人工监督
- 人工数据约
20K条:一部分用于 SFT,另一部分 HelpSteer2 用于奖励与偏好训练。 - 超过
98%对齐数据为合成,人工监督主要建立初始示范和可靠评价标准。
SFT 与偏好优化
Code SFT
- Genetic Instruct 从高质量种子出发,通过 self-instruction 与任务变异扩充题目和解答。
- 用 LLM 评价正确性与质量,通过筛选的样本回到种子池继续扩展。
- 去重后约
800K条,先单独训练代码,减少与其他行为混合学习的冲突。
General SFT
- 再用
200K条混合任务训练对话和指令,回采2%代码数据降低遗忘。 - 两阶段都 mask User turns,只在 Assistant 输出上计算损失。
DPO 的问题与修正
- 偏好间隔增加时,chosen 与 rejected 的概率可能一起下降,长时间训练也可能损害其他任务。
- 在 DPO 外加入 chosen SFT loss,约束高质量回答,减少偏离训练数据。
RPO 的目标
- 令策略的隐式奖励差为两条回答相对 reference 的 log-prob 差。
- 将该差距匹配 Reward Model 的分差,回答质量接近时,不要求形成很大的偏好间隔。
优化方式
- 通过 sigmoid 将两种分差转为软偏好概率,最小化相应分布差异,保留质量差距信息。
- 从 DPO checkpoint 开始,RPO 每轮以上一轮模型作为初始化和 reference。
- 连续三轮 RPO,并保留较小权重的 chosen SFT loss。
实验设置(340B预训练与合成数据对齐)
预训练
768个DGX H100节点,每节点8卡;TP8、PP12,逐步扩大 data parallel。- Seq
4096,global batch 从768 → 1536 → 2304,合计9T tokens。
SFT
- Code:
800K条、1 epoch、batch128、lr3e-7。 - General:
200K条、3 epochs、batch128,lr 在1e-7–5e-7范围选择。
偏好训练
- DPO:
160K条、1 epoch、batch256,附加 chosen SFT loss。 - RPO:
300K条、3轮,lr3e-7,reward scaleη=1,chosen SFT 系数1e-5。 - 每轮更新 reference;Reward Model 独立使用 HelpSteer2 训练。
评测
- Base/各后训练阶段分别评测;代码使用 HumanEval,指令使用 IFEval,对话使用 MT-Bench。
- Reward Model 使用 RewardBench;另进行人工偏好和安全评测。
关键结果(Nemotron-4-340B,分阶段SFT + DPO/RPO)
Code 与通用能力的取舍
- HumanEval 从 Base
57.3提高到 Code SFT70.7;General SFT 后降到66.5。 - 同时 General SFT 改善对话和知识,说明不同任务的最佳训练配比和顺序存在冲突。
RPO 的增益
- DPO 到最终 RPO:IFEval Prompt-Strict
61.7 → 79.9,GSM8K88.5 → 92.3。 - HumanEval 恢复到
73.2,MT-Bench 从7.90提高到8.22,综合能力继续改善。 - 各轮个别分数仍有波动,多轮训练的价值是总体改善,不是每项指标单调增长。
奖励模型
- RewardBench
92.0,Chat-Hard87.1;能够更好地区分两个质量接近的回答。 - 高质量评分使合成偏好数据可用,数据量扩展需要与筛选能力同步。
合成数据迭代
- 强 Base 配合筛选后的弱教师数据,可以超过初始生成器,再成为下一轮更强的数据来源。
- 这条路线同时依赖基模改进与数据改进,不能只增加重复生成次数。
未来方向
工具开放
- 作者计划继续提供面向合成数据生成的部署与服务工具,降低使用门槛。
任务与奖励(笔记整理)
- 合成 prompts 通常比真实请求简单,可扩大真实复杂指令和多轮任务覆盖。
- 检查 Reward Model 在新领域的排序可靠性,减少多轮生成训练对同一评价偏好的放大。
训练平衡(笔记整理)
- 研究代码、对话与指令能力的混合比例和阶段顺序,降低通用 SFT 后的领域回退。