Skip to content

Nvidia 系列

📅 发表于 2025/01/02
🔄 更新于 2026/08/05
👁️ — 次访问
📝 12443 字
⏳ 37 分钟
nvidia
#nvidia

变化点 ​

2026

2026.06 · Nemotron 3 Ultra

  • 扩大混合架构至 550B-A55B,强化复杂推理与专业任务。
  • 训练领域教师,再通过 MOPD 汇聚到统一模型。

2026.04 · Nemotron 3 Super

  • 引入 LatentMoE 与 NVFP4,兼顾模型容量和训练效率。
  • 扩展多环境 RL,并加强 SWE 任务训练。
2025

2025.12 · Nemotron 3 Nano

  • 采用 25T tokens 预训练,构建高效小激活模型。
  • 结合多环境 RL 与长度控制,强化 Agent 能力。

2025.04 · Nemotron-H

  • 引入 Mamba / Attention 混合架构与 FP8,降低生成成本。
  • 通过 MiniPuzzle 剪枝与蒸馏,形成不同规模模型。
2024 及以前

2024.06 · Nemotron-4 340B

  • 构建合成对齐数据与 Reward Model,以质量筛选扩大训练数据。
  • 结合 DPO / RPO 训练,形成可复用的数据合成路线。

(2606) Nemotron 3 Ultra (550B-A55B, 多教师MOPD) ​

🌺 论文摘要

Nemotron 3 Ultra 论文摘要

参考链接

问题背景

  • 大规模多环境 RL 可以提高通用能力,但每个领域分到的训练样本减少,难以同时达到各领域最优。
  • 长上下文、长输出和大模型训练成本,需要架构、低精度与后训练系统共同优化。

核心方法

  • 架构与效率:550B-A55B Mamba-Attention + LatentMoE,结合 NVFP4、共享 MTP 与草稿 head 蒸馏。
  • 基模训练:20T 预训练 + 33B 长上下文 CPT,支持 1M 上下文。
  • 领域训练:学生两阶段 SFT + 统一 RLVR;独立优化 SWE、Terminal、办公、搜索、推理等专业教师。
  • 多教师整合:轻量 warmup 后进行两轮 MOPD,在学生自己的轨迹上学习教师逐 token 指导。

模型效果(Ultra BF16,完整后训练)

  • SWE-bench Verified 70.7,Terminal-Bench 2.1 56.4,RULER 1M 94.7。
  • Warmup 后,GDPVal 的 MOPD 结果由 35.3 提高到 46.7,说明教师与学生的轨迹匹配很重要。

重要结论

  • MOPD 易于传递工具选择与工作流程;学生难以采出的深层推理路径,仅靠局部教师指导难以补齐。

核心贡献

  • 将大规模高效基模、多领域专业教师与异步 on-policy 蒸馏形成可迭代的训练体系。

未来方向

  • 改进教师/学生分布匹配,扩展端到端长程 MOPD,并研究训练稳定性与计算效率。

问题背景 ​

多领域训练与长程成本

专业能力被混合训练摊薄

  • 环境种类增加后,每个 batch 中单一领域样本变少,领域能力难以持续突破。
  • 不同领域需要不同数据、奖励与工作流程,独立教师便于针对性训练。

长任务的系统要求

  • 大模型需要处理长历史并持续生成,模型参数、KV cache 与 rollout 等待同时影响成本。
  • Ultra 延续 Super 的混合架构,同时重构教师整合与推理加速流程。

核心方法 ​

混合架构与高效计算 ​

Mamba-Attention 与 LatentMoE

主干

  • 550B总参数、55B激活参数,108层,model dimension 8192。
  • Mamba-2 用递归状态处理序列;Attention 保留对历史 token 的直接读取。

LatentMoE

  • routed experts 在 2048维 latent 空间计算,再映射回主干维度。
  • 每层 512个 routed experts,激活 22个;低维专家降低通信与专家计算成本。
  • 共享专家与主干保留各自功能,不把整个模型压到 latent 维度。

MTP

  • 预训练使用两个共享权重的 MTP heads,包含 Attention 与 MoE。
  • 同一 head 可递归产生更长草稿,避免每增加预测步都新增独立参数。
NVFP4 训练与敏感模块

主要矩阵乘法

  • 采用 NVFP4 的 E2M1 数据类型,覆盖前向、输入梯度与权重梯度 GEMM。
  • 权重采用二维 block quantization;wgrad 输入使用 Random Hadamard Transform,梯度采用随机舍入。

高精度保留

  • 最后约 15% 网络、Mamba 输出投影、latent 投影、Attention 投影与 MTP 保留较高精度。
  • embedding 等敏感位置同样避免统一降到 FP4,平衡效率与数值稳定性。
MTP Boosting

训练与推理差异

  • 普通 teacher-forcing 训练的 hidden states 与递归草稿时的混合状态不同。
  • 草稿越深,前面预测误差越容易累积,导致后续 token 接受率下降。

Head-only 蒸馏

  • 冻结主模型,只更新 MTP head,使用主模型分布作为教师。
  • 训练时混合不同预测步产生的 hidden states,模拟推理时的输入扰动。
  • 使用温度化 forward KL,学习主模型完整分布,而不是只拟合单个标准 token。

预训练与上下文扩展 ​

预训练与长上下文 CPT

20T 预训练

  • 前段重视领域覆盖,后段提高高质量 PDF、知识问答和 SFT 风格材料。
  • 刷新 GitHub 代码,并补充法律、事实知识及合成任务。
  • 使用 checkpoint merging 平衡知识、数学与代码能力,再选取扩窗起点。

33B 长上下文 CPT

  • 数据混合为 46%长上下文材料 + 54%前阶段材料,加入文档 QA 与长上下文指令样本。
  • 92% 迭代使用 1M,其余 8% 使用 4K 数学与代码材料,维持短任务能力。
  • 每个迭代使用一种长度,长短序列在迭代之间交替。

领域数据与教师训练 ​

Agent 轨迹与执行验证

Terminal 与 SWE

  • Terminal 约 370K 多轮对话,以真实终端反馈组织操作与错误恢复。
  • SWE 使用不同教师与 OpenHands、SWE-Agent、Mini-SWE-Agent、OpenCode 生成轨迹。
  • 过滤未提交、无效工具调用、循环修改、只探索不修复,以及修改后从不测试等行为。

数学、代码与工业任务

  • 数学分别构建有工具与无工具推理,证明任务加入生成、验证与修订。
  • 竞赛代码通过测试筛选推理轨迹,覆盖 Python、C++ 与 Python 工具调用。
  • 约 100K CUDA 样本同时验证编译、数值和运行性能,并包含报错修复与 profiling 优化。
  • RTL 数据覆盖规格生成、功能编辑与缺陷修复,使用语法和语义检查筛选。
完整对话 Packing 与推理控制

Packing

  • 按长度 best-fit 放入多个完整对话,减少 padding;不截断、不拆分原始对话。
  • 包内去重,跨来源交错读取并最终 shuffle,避免一个 pack 长期集中于单一领域。

推理预算

  • 加入 medium-effort 示范,以及保留答案、随机截短思考的训练样本。
  • 对人工截断位置的 </think> 屏蔽 loss,避免把被截断当成应该主动结束的监督。
混合环境 RLVR

环境覆盖

  • 同时训练 Terminal、办公、SWE、搜索、工具调用、数学、代码、指令遵循与长上下文任务。
  • 对相同任务使用多种 harness 与交互格式,减少对单一运行框架的依赖。

数据课程

  • 先测量 reward 分布,再根据难度组织采样。
  • 使用异步 GRPO 训练学生,为后续领域教师整合提供较全面的能力起点。
专业教师的数据与训练路线

SWE 教师

  • Agent SFT → 单步 PivotRL → 端到端 SWE-RL。
  • 多轮修改仓库后运行隐藏测试,以二元奖励训练;未完成轨迹屏蔽 loss,格式错误 token 给予负优势。
  • 任务仓库重建到 base commit,删除未来历史并限制从远程恢复参考补丁。

办公、Terminal 与搜索

  • 办公任务围绕参考文件与交付物构造轨迹,学习文档、表格等专业工作流程。
  • Terminal 使用长时限任务与 PivotRL,在准确率饱和后重新评估任务难度。
  • Search 用带历史丢弃或摘要压缩行为的轨迹做 SFT,训练有限窗口下的持续搜索。

推理、对话与可靠性

  • STEM 与竞赛代码教师追加专项 SFT / RL,学习更复杂的推理路径。
  • Chat 教师由 Ultra GenRM 提供偏好信号,支持按具体原则评价回答。
  • 指令与事实教师训练格式遵循和不确定时弃答;安全教师使用工具轨迹验证 prompt injection 防御。

多教师 On-Policy 蒸馏 ​

Warmup 与两轮整合

Warmup

  • 不同 SFT 路线会形成不同解题习惯,学生轨迹可能落到教师不熟悉的状态。
  • MOPD 前用少量教师训练分布的数据做轻量 SFT,使学生先掌握对应工作流程。

两轮 MOPD

  • 学生在各领域生成自己的轨迹,对应教师提供逐 token 指导。
  • 第一轮后从更强学生继续训练部分教师,再与保留教师一起进行第二轮整合。
  • 没有专项教师的领域,使用原学生作为 self-teacher,帮助保持已有能力。
蒸馏优势与异步策略修正

Token 级优势

A^t=sg[log⁡πT(yt∣st)−log⁡πprox(yt∣st)]
  • 教师比近端学生更认可已采出的 token,该位置得到正指导;反之为负。
  • 例如教师概率 0.4、近端学生 0.2,优势为 ln 2;它表达相对偏好,不是独立任务奖励。

两个概率比

  • π_prox / π_behav:修正异步 rollout 旧策略与近端策略的差异,停止梯度。
  • π_θ / π_prox:衡量本次更新的幅度,使用 PPO 式裁剪。
  • IcePop 对 token 做 mask,抑制不适合当前更新的数据。
  • rollout、教师打分和学生更新流水并行;多数 Agent 蒸馏使用单轮片段控制成本。

实验设置(Ultra预训练、RLVR与MOPD) ​

实验设置

预训练与扩窗

  • 预训练 20T tokens;CPT 33B tokens,固定学习率 2.5e-6。
  • GB200 上采用 CP=32、TP=8、EP=128、PP=2 进行长上下文训练。

两阶段 SFT

  • 阶段1:packing 294912,batch 64,204800个 packed samples,峰值学习率 1.5e-5。
  • 阶段2:packing 515000,batch 64,19200个 packed samples,峰值学习率 1e-5。
  • packed samples 指打包后的训练序列,一个序列可以含多个完整对话。

RLVR 与教师

  • 统一 RLVR:global batch 8192,每样本 16条 rollout,生成长度 48K → 64K。
  • SWE 教师端到端训练:最大生成 192K、最多 200轮 Agent 交互。

MOPD 与 MTP

  • MOPD:每批 1024个 prompts,每 prompt 1条 rollout,最大生成 192K。
  • MTP Boosting:12K步、batch=64、8K序列,KL 温度 2,训练 7步 预测。
  • 对比 warmup、两轮 MOPD、领域教师,以及 MTP Boosting 前后的接受长度。

关键结果(Nemotron 3 Ultra,RLVR + MOPD) ​

领域能力整合

MOPD 持续改善 Agent

  • 阶段对照中,SWE-bench Verified:RLVR 65.8 → MOPD1 70.1 → MOPD2 71.7。
  • Terminal-Bench 2.0:44.5 → 50.8 → 54.0,显示多轮教师整合的持续收益。
  • 最终统一 BF16 评测中,SWE-bench Verified 为 70.7,Terminal-Bench 2.1 为 56.4。

Warmup 对工作流程更有效

  • GDPVal:无 warmup 35.3,有 warmup 46.7;BrowseComp:33.0 → 44.4。
  • HLE 仅 26.3 → 26.7;浅层轨迹匹配无法补齐学生原本不具备的复杂推理路径。

教师能力并非全部转移

  • MOPD2 的 BrowseComp 44.4,教师 51.0;HLE 26.7,教师 32.1。
  • 作者认为,学生很少访问的推理路径难以通过 on-policy token 指导获得充分监督。
长上下文与效率

长上下文

  • 最终 BF16 模型在 RULER 1M 上达到 94.7,保持较强的长历史检索与关联能力。

MTP Boosting

  • SPEED-Bench 贪心解码平均接受长度约 4.39 → 4.58,深层草稿位置收益更明显。
  • 改善草稿与主干的一致性可以增加接受 token,且不必更新主模型参数。

推理负载

  • GB200 上 8K输入 / 64K输出 的吞吐配置中,相对 GLM-5.1 达 5.9×。
  • 长输入、短输出场景更受 prefill 影响,混合架构的优势需要结合具体负载判断。

未来方向 ​

MOPD 与训练系统

教师/学生分布匹配

  • 比较统一 SFT 起点、教师先生成 SFT 数据等路线,让教师指导覆盖学生的实际状态。
  • 研究何时使用采样 token 指导、何时使用更完整的分布匹配。

端到端长程蒸馏

  • 从单轮片段扩展到完整 Agent rollout,处理任务时长差异与异步策略过期。
  • 更好地协调推理与交互任务的采样、判分和教师服务,控制端到端训练成本。

训练稳定性

  • 持续分析专家负载、残差尺度与低精度梯度问题,减少大规模训练发散。

(2604) Nemotron 3 Super (LatentMoE, NVFP4, 多环境RL) ​

🌺 论文摘要

Nemotron 3 Super 论文摘要

参考链接

问题背景

  • 长程 Agent 同时需要长上下文、稳定工具调用与较低推理成本,单独扩大模型难以兼顾。
  • 单领域后训练容易损伤其他能力;长程 SWE rollout 又会拖慢混合 RL 的采样。

核心方法

  • 混合架构:120B-A12B Mamba-2 + Attention + LatentMoE,结合共享 MTP 与分模块量化。
  • 基模训练:NVFP4 预训练 25T tokens,再以 51B tokens 扩展到 1M 上下文。
  • Agent 数据与 SFT:真实 Issue、Terminal、搜索和工具轨迹;先按 token、再按 conversation 平均 loss。
  • 多领域后训练:21个环境、37套数据联合 RLVR → 独立 SWE-RL → RLHF → MTP healing。

模型效果(Nemotron 3 Super,完整后训练)

  • SWE-bench Verified:OpenHands 60.47、OpenCode 59.20、Codex 53.73。
  • AIME25 无工具 90.21,RULER 1M 91.64,兼顾推理与长上下文。

重要结论

  • 多环境联合 RL 保留通用能力;慢速 SWE 单独训练,解决采样效率与任务覆盖之间的冲突。
  • SFT 的归一化单位也影响能力:长回答占据过大权重,会损害长输入、短输出任务。

核心贡献

  • 将低成本混合架构、可执行 Agent 数据与分阶段 RL 整合为开放模型训练路线。

未来方向

  • 进一步优化跨 harness 泛化、长程交互成本和长上下文实际任务能力。

问题背景 ​

Agent 训练与部署成本

长程推理

  • 历史越来越长,工具调用需要持续读取上下文,推理速度和显存共同限制任务长度。
  • 模型既要学习推理,也要掌握真实工具的输入格式、反馈处理和多步操作。

多领域后训练

  • 只训练单一环境容易让其他 benchmark 回退,需要在训练中保留多任务分布。
  • SWE 的容器执行和长轨迹明显慢于数学题,统一采样会受到慢任务拖累。

核心方法 ​

混合架构与推理优化 ​

混合主干与低维专家

混合主干

  • 约 120B总参数、12B激活参数,88层,hidden size 4096。
  • Mamba-2 使用固定大小的递归状态;少量 Attention 作为全局信息交互节点。
  • Attention 使用 32个Q heads、2个KV heads,减少 KV cache。

LatentMoE

  • routed experts 的输入由 4096维投影到 1024维,专家聚合后再映射回主干维度。
  • 专家计算与跨设备通信发生在低维空间,节省的开销用于增加专家数量与激活数量。
  • 每层 512个专家、Top-22;router 和 shared expert 保持主干维度。
标准 MoE 与 LatentMoE 对照:先降低专家计算的特征维度,再把节省的参数读取和通信预算用于更多专家。标准 MoE 与 LatentMoE 对照:先降低专家计算的特征维度,再把节省的参数读取和通信预算用于更多专家。
原文图 3:标准 MoE 与 LatentMoE 对照:先降低专家计算的特征维度,再把节省的参数读取和通信预算用于更多专家。 来源
共享权重 MTP

训练方式

  • 两个 MTP heads 共享参数,在多个预测偏移上训练,辅助损失权重 0.3。
  • 同一个 head 可以递归生成更多草稿 token,再由主模型并行验证。

后训练恢复

  • SFT 继续训练 MTP;RL 完成后,冻结主模型,只对 MTP heads 做 healing。
  • 复用 RLVR prompts 和生成回答,以 NLL 训练草稿 head,恢复其与最终模型的匹配。
推理量化与 SSM Cache

混合量化

  • FP4 权重量化离线搜索最小 MSE 的 block scale;激活使用运行时 max scale。
  • AutoQuantize 根据算子敏感性和成本,将少量层提升为 FP8/BF16,主要 routed experts 保持 FP4。

SSM 状态误差

  • Mamba 状态反复更新,确定性舍入偏差可能积累,导致输出变长。
  • FP16 cache 使用随机舍入,减少系统性漂移,同时保留较低状态存储成本。

预训练与上下文扩展 ​

NVFP4 预训练与长上下文 CPT

NVFP4

  • 主要线性层以 NVFP4 进行前向和反向矩阵乘法,权重采用二维 block scaling。
  • 权重梯度计算使用 Random Hadamard Transform,梯度量化使用随机舍入。
  • 最后约 15% 网络、Attention 和 latent projections 保持 BF16;Mamba output projection 使用 MXFP8。

预训练数据

  • 25T tokens:前 20T 强调来源多样性,后 5T 提高优质数据比例。
  • 包含网页、代码、数学、多语言、学术材料,以及带推理过程的合成任务。
  • Code Concepts:组合编程概念生成题目,教师生成解答,再检查 import 一致性和 Python AST。
  • 补充边界条件、单元测试、形式逻辑与多选题数据,增强代码执行和结构化推理。

长上下文 CPT

  • 34B tokens 使用 1M 序列;随后 17B tokens 交替训练 1M/4K 序列。
  • 数据中 20% 为长文档 QA,其余来自预训练末期数据;短序列用于保持数学等能力。

Agent 数据与 SFT ​

SWE、Terminal 与搜索轨迹

SWE 与 Agentic Programming

  • 从 SWE-Gym、R2E-Gym、SWE-rebench 取得 Issue 和容器,用 Qwen3-Coder 教师采集 OpenHands 轨迹。
  • CLI 数据按 24类操作生成任务;合成任务加入 AGENTS.md 约束,学习规划、并行工具和技能使用。
  • 在 Codex、OpenCode、Qwen Code 等环境中记录交互,统一为带 tool definitions 的对话格式。

Terminal

  • 约 85K条轨迹,混合技能分类合成题与已有数学、代码任务。
  • DeepSeek-V3.2 在隔离容器中执行,用 Terminus 2 记录命令、结果与修正过程。

Search

  • 从 Wikidata 进行 4–8跳图遍历,构造答案已知的多跳问题。
  • 隐藏中间实体,避免问题直接暴露搜索链;教师通过真实搜索采集带来源的完整轨迹。
工具交互与数据筛选

业务工具数据

  • 流程:领域 → 业务规则与工具 → 用户场景 → 多次模拟交互 → 过程/结果验证 → SFT 筛选。
  • 每个场景模拟 16次交互,剔除全成功或全失败场景,从其余场景保留成功轨迹。
  • 最终约 279K段对话,覆盖 838个领域。

通用工具数据

  • User、Assistant、Tool 三种 LLM 角色模拟任务与调用,结合逐轮规则检查和整段质量评估。
  • 构建约 1.5M条轨迹,覆盖单轮、多轮和多步工具任务。
  • SQL 数据加入无关表/列,训练模型从混杂 schema 中选择正确字段。
两阶段 SFT 与推理控制

两种损失

  • Stage 1:所有输出 token 统一平均,充分学习长推理轨迹。
  • Stage 2:先在每段 conversation 内平均,再对 conversation 平均,降低长输出的权重优势。
  • 第二阶段沿用 85% 原数据,加入 15% 长上下文数据,强化长输入、短输出场景。

三种推理模式

  • 支持 reasoning-off、regular、low-effort;SFT 引入短推理示范和去除推理过程的回答。
  • 增加短期 semi-on-policy SFT:采集自身回答,把部分思考截断到不同预算,学习按预算收束。
  • RL 对 low-effort prompts 同时考虑正确性与生成长度,优化质量和成本的取舍。

多环境 RL 与偏好训练 ​

联合训练与异步 GRPO

环境与课程

  • 21个环境、37套数据覆盖数学、代码、STEM、指令遵循、长上下文、工具、Terminal 等。
  • 过滤 SFT 模型稳定解出的简单题,再按难度安排课程;每次更新保留多领域任务。

异步 GRPO

  • 推理和训练分配到不同 GPU,rollout buffer 持续收集轨迹,参数更新后及时推送。
  • 推理策略最多落后一步,减少长轨迹造成的策略陈旧。
  • 对训练与推理 log-prob 的重要性比率做 mask,抑制异步及训练/推理差异。

PivotRL

  • 复用离线专家轨迹,在模型对下一步动作不确定的关键 turn 进行 RL。
  • 用领域奖励评价动作与专家动作的匹配,允许语义相近的操作,降低完整在线交互成本。
长程 SWE 与偏好训练

SWE-RL

  • 每条 rollout 启动 Apptainer 容器,Agent 处理 Issue、生成补丁,以真实测试给出二值奖励。
  • 在 OpenHands 内实现 OpenCode/Codex 风格的工具与提示,训练时切换交互形式。
  • 单独配置长轨迹的采样与 batch,避免拖慢前面的短任务 RLVR。

RLHF

  • 以 Qwen3-235B-A22B-Thinking 初始化 principle-following GenRM。
  • 使用 HelpSteer3、偏好比较数据训练评价模型,对指令、交互质量和行为规则提供监督。
  • GenRM 参与混合 RL,并在最后单独进行 RLHF。
Nemotron 3 Super 后训练全流程:把 SFT、多环境 RL、SWE 专项训练和偏好训练放回同一条训练链路理解。
原文图 12:Nemotron 3 Super 后训练全流程:把 SFT、多环境 RL、SWE 专项训练和偏好训练放回同一条训练链路理解。 来源

实验设置(Super预训练、SFT与RL) ​

训练与评测配置

基模训练

  • PreTrain:AdamW,25T tokens,seq 8192,batch 3072条。
  • WSD:前 200B tokens warmup 到 4.5e-4,最后 5T tokens 衰减到 4.5e-6。
  • 长上下文 CPT:51B tokens,batch 16,lr 4.5e-6,GB200 上使用 Context Parallel。

SFT 与 RL

  • SFT 超过 7M条;阶段1 packing 256K、batch64,阶段2 512K、batch32,lr 均 1e-5。
  • RLVR:每步 256个prompts × 16条rollout,batch 4096,每批一次梯度更新。
  • 最大生成长度从 49K 增至 64K;SWE 使用独立长程交互阶段。

评测协议

  • 推理评测分别记录有工具/无工具;SWE-bench Verified 分别使用 OpenHands、OpenCode、Codex。
  • 长上下文:RULER 每个任务 100个样本,另测 AA-LCR 文档推理。
  • 使用 NeMo Evaluator/Skills;Terminal、Tau2 等采用对应 benchmark 的环境。

关键结果(Nemotron 3 Super,多环境RL + SWE-RL) ​

推理、交互与效率

推理与代码

  • AIME25 无工具 90.21,LiveCodeBench v5 81.19,具备较强数学与代码求解能力。
  • GPQA 从无工具 79.23 到有工具 82.70,体现工具执行对科学推理的补充作用。

跨 Harness 的 SWE 能力

  • SWE-bench Verified:OpenHands 60.47、OpenCode 59.20、Codex 53.73。
  • 同一模型在不同交互协议下差距明显,多 harness 训练改善适应能力,但模型与框架仍需配合。

长上下文

  • RULER:256K 96.83 → 512K 95.22 → 1M 91.64,扩展窗口后仍能保持较强检索能力。
  • AA-LCR 为 58.31;长文档综合推理比单纯找到远处信息更难。

训练与推理设计

  • 两阶段 SFT 恢复长输入、短输出能力,说明训练样本的加权方式会改变能力分布。
  • 多环境 RL 比单环境训练更能避免其他任务回退;SWE 独立阶段兼顾任务时延差异。
  • SPEED-Bench 上 MTP 平均接受长度 3.45,结合混合架构提升吞吐;报告最高达 GPT-OSS-120B 的 2.2倍。

未来方向 ​

后续研究(笔记整理)

长程训练效率

  • 比较 PivotRL 与端到端 RL 的互补作用,减少容器采样成本并保持真实任务完成率。

跨环境泛化

  • 扩展训练工具和 harness 多样性,减少更换交互协议后的性能下降。

长上下文与量化

  • 从 RULER 检索继续优化文档推理和长任务执行;联合观察准确率、输出长度与端到端耗时。

(2512) Nemotron 3 Nano (25T, 多环境RL, 长度控制) ​

🌺 论文摘要

Nemotron 3 Nano 论文摘要

参考链接

问题背景

  • 小型 Agent 模型需要兼顾推理、工具和长上下文,不能只优化单一 benchmark。
  • 大量 SFT 后仍需探索更优解法;RLHF 又容易产生冗长思考,增加部署成本。

核心方法

  • 混合架构:Mamba-2 + 少量 Attention + MoE,约 31.6B总参数、3.2B激活参数,部署采用选择性 FP8。
  • 基模训练:25T tokens 预训练,121B tokens 长短混合 CPT。
  • 多领域 SFT:超过 18M条 样本,包含真实 SWE 轨迹、工具推理、Lean 证明与 Terminal 操作。
  • RL 与长度控制:GRPO 联合难度课程;GenRM 环形比较与组内长度奖励,兼顾回答质量和推理成本。

模型效果(Nemotron 3 Nano BF16,SFT + RL)

  • AIME25:无工具 89.06、有工具 99.17;LiveCodeBench v6 68.25。
  • SWE-bench Verified/OpenHands 38.76;RULER 1M 86.34。

重要结论

  • RLVR 可以超过充分训练的 SFT;多环境联合训练比单领域优化更能保持综合能力。
  • 长度奖励需要在相同问题内比较,并兼顾回答质量,避免一味鼓励短输出。

核心贡献

  • 以较低激活参数提供多领域 Agent 能力,并公开从数据到 RL 环境的训练配套。

未来方向

  • 补强复杂 Terminal、多语言知识和长文档推理,继续改善长程任务的效率与泛化。

问题背景 ​

小模型的能力与效率

通用能力

  • 数学、代码、工具与对话的训练目标不同,单领域 RL 可能使其他能力持续退化。
  • SFT 能学习教师示范,但仅增加训练轮数,未必能找到更好的任务求解策略。

推理成本

  • Agent 需要多次生成并读取长历史,激活参数量和 KV cache 都影响吞吐。
  • 对话任务不总需要长思考,必须让模型学会推理开关与预算控制。

核心方法 ​

混合架构与量化 ​

Hybrid Mamba-Transformer MoE

序列建模

  • 52层,hidden size 2688;Mamba-2 以递归状态处理历史,保留 6层Attention进行直接 token 交互。
  • Attention 使用 32个Q heads、2个KV heads;不使用位置编码,采用 RMSNorm。

稀疏容量

  • 用 MoE 替换普通 FFN;每层 128个routed experts,每 token 激活 6个,另有 2个shared experts。
  • 总参数约 31.6B,非 embedding 激活参数约 3.2B,以稀疏激活控制单步计算量。
选择性 FP8 量化

校准数据

  • 使用 1K条推理 SFT 数据校准,更贴合最终模型的激活分布。

敏感模块

  • 6层Attention及其前面的 6层Mamba保留 BF16,其他适合的权重/激活使用 FP8。
  • KV cache 使用 FP8,Mamba 的 Conv1D 保持 BF16,在显存与精度间取舍。

预训练与上下文扩展 ​

预训练数据与长上下文扩展

数据来源

  • 覆盖网页、GitHub、数学、学术文本、多语言和合成推理等 15类数据。
  • 网页代码用 Lynx + LLM 提取,保留代码和公式,减少 HTML 噪声。
  • GitHub 数据经过规则过滤、去重与质量筛选;合成代码加入概念组合、边界条件和解题过程。

两阶段课程

  • 前 23.5T tokens强调覆盖与多样性,最后 1.5T tokens提高优质来源权重。
  • 学习率使用 WSD;数据质量课程与学习率衰减分别控制。

长上下文 CPT

  • 额外训练 121B tokens,混合 512K/4K序列,保留短任务能力。
  • 数据配比:20%长文档 QA、1%合成检索,其余来自高质量预训练数据。
  • 训练扩展长度为 512K,模型同时报告 1M窗口的长上下文评测。

多领域 SFT 数据 ​

执行验证与 Agent 轨迹

推理与代码

  • 数学引入 GPT-OSS-120B 的 Python 工具推理;竞赛代码使用 DeepSeek-R1-0528 解答。
  • Lean 数据将自然语言定理形式化,再多次生成与修正证明,以编译验证筛选约 300K条样本。
  • CUDA 数据要求成功编译,且数值结果与 PyTorch reference 一致。

SWE 与 Terminal

  • SWE-Gym、R2E-Gym 提供 Issue 和执行环境,Qwen3-Coder 教师采集修复过程。
  • 覆盖 OpenHands、SWE-Agent、Mini-SWE-Agent,保留代码探索、复现和修改动作。
  • Terminal 把数学、代码、长文档和文件操作包装为可验证任务,用 Terminus 记录交互。

工具与指令

  • 用 LLM 模拟 User、Agent 和工具环境,再检查各角色的行为与任务目标是否一致。
  • 指令数据先通过规则 verifier,再用 LLM judge 剔除只在表面满足约束的回答。
  • 统一过滤缺工具定义、错误结构和重复推理轨迹。
数据混合与上下文管理

数据权重

  • 总计训练超过 18M条样本,根据单领域效果确定配比;小数据集可重复多轮。
  • 包含对话、推理、Agent、多语言与安全数据,不只蒸馏成功解题结果。

推理历史

  • 同一用户任务内多次工具调用,保留当前轮的思考,便于后续动作复用。
  • 新用户消息到来后,丢弃旧轮次思考,避免历史推理持续挤占上下文。

推理开关与预算

  • 随机 10%样本去掉推理过程,训练直接回答模式。
  • 随机 3%样本将思考截断到不同预算,接回最终回答,训练按预算结束思考。

多环境 RL 与长度控制 ​

多任务环境与同步 GRPO

可验证任务

  • 数学、竞赛代码、STEM QA、指令、JSON schema、长文档与业务工具任务共同训练。
  • 数学采用 DAPO/SkyWorks 数据;代码限制每题最多 50个测试,控制奖励计算时间。
  • 工具任务通过沙盒数据库状态验证,长文档任务要求综合至少五份文档。

训练算法

  • 同步 GRPO:128个prompts × 16条rollout,整批一次更新。
  • masked importance sampling 减少训练/推理概率差异;超长样本做 overlong filtering。
  • 冻结 MoE router 权重,继续更新专家负载均衡 bias,稳定路由。

训练顺序

  • SFT 后进行多环境 RLVR,再训练 RLHF,之后追加一轮多环境 RLVR。
  • RLVR 全程混合各环境,保留通用任务分布。
基于通过率的课程采样

初始难度

  • 用 SFT checkpoint 测量各题通过率,过滤已经 100%解出的题目。
  • 每个 batch 固定各领域比例,避免课程调整改变领域分布。

采样规则

  • 每个领域按通过率建立高斯采样分布,目标均值随训练逐步降低。
  • 初期较多采样容易题,后期转向困难题;保留难度分布宽度,避免只学极端样本。
  • 训练进入平台期后,用最佳 checkpoint 重新测量通过率,再构造新课程。
奖励模型与环形比较

GenRM 训练

  • 以 Qwen3-235B-A22B-Thinking 初始化,输入对话与两个候选回答,输出分析、helpfulness 分和排序。
  • GRPO 奖励惩罚格式错误、helpfulness 预测误差和排序误差。
  • 使用 HelpSteer3、人类偏好数据与合成安全数据,交换回答位置减少位置偏差。

环形比较

  • 16个候选若两两比较,需要 120次评价;改为相邻候选构成环,只需 16次。
  • 每个回答分别作为左右候选出现一次,其奖励取两次分数的平均。
  • Helpfulness 同分时,利用排序分进一步拉开优劣。
组内长度奖励与质量门槛

组内比较

  • 将输出拆成 thinking 与 answer,分别在同一问题的候选组内归一化长度。
  • 短输出得到较高长度分,再减去组均值,保持长度调整在组内零和。
Ri=Ribase+0.5w~ithink+0.5w~ianswer

质量约束

  • 对最短思考、最短回答追加奖励前,要求其基础质量处于该组前 20%。
  • 困难问题可以整体回答较长;该方法主要鼓励同一道题中较高效的解法。

实验设置(Nano预训练、SFT与多环境RL) ​

训练和评测配置

预训练

  • 25T tokens,seq 8192,batch 3072;AdamW,weight decay 0.1。
  • WSD 峰值 lr 1e-3,最后 5T tokens衰减到 1e-5。
  • CPT:121B tokens,长短序列混合,batch 48,lr 1e-5。

SFT 与 RL

  • SFT:13000步,batch 64,packing 256K,lr 5e-5,warmup 800步。
  • RLVR:prompt batch 128,每题 16条,train batch 2048,最大生成 49K。
  • GenRM:每批 128个prompts、每题 8条;RLHF 每题 16个候选。

评测与对照

  • 对照 Qwen3-30B-A3B-Thinking-2507、GPT-OSS-20B,SWE 使用 OpenHands。
  • RULER 关闭 reasoning,AA-LCR 开启 reasoning;数学分别测试有工具与无工具。
  • 吞吐:单 H200,8K输入/16K输出,各模型选 vLLM/TRT-LLM 中表现更好的配置。

关键结果(Nemotron 3 Nano,SFT + RLVR + RLHF) ​

能力、消融与取舍

推理与 Agent

  • AIME25 从无工具 89.06 到有工具 99.17,执行反馈显著补充数学求解。
  • LiveCodeBench v6 68.25,SWE-bench Verified 38.76,Tau2 平均 49.04。
  • Terminal hard subset 只有 8.51,复杂系统操作仍明显难于结构较清晰的解题任务。

RL 相比继续 SFT

  • 对比约 3轮和充分训练约 5轮的 SFT checkpoint,RLVR 在评测领域超过或达到充分 SFT 的效果。
  • 固定领域比例时,课程采样比随机采样学习更稳定,关键是难度分配而非额外增加某个领域的数据。

长度控制

  • Group Relative Length Control 将冗长程度降低约 30%,同时保持准确率。
  • 组内比较加质量门槛,让长度优化依赖具体问题与回答质量。

长上下文与部署

  • RULER 1M 86.34,但 AA-LCR 35.85,说明长窗口检索不等于复杂文档推理。
  • 选择性 FP8 的中位准确率恢复约 99%;单 H200 长输出吞吐最高为 Qwen3 同级模型的 3.3倍。
  • MMLU-ProX 59.50,多语言知识仍是相对短板。

未来方向 ​

后续研究(笔记整理)

复杂 Agent 任务

  • 加强 Terminal 和长程环境反馈,提高文件、程序、系统状态的联合操作能力。

通用能力平衡

  • 在增加推理与 Agent 数据时补强多语言知识,持续检查领域之间的能力回退。

计算效率

  • 将长度控制扩展到工具次数和端到端时延,联合优化任务成功率与执行成本。

(2504) Nemotron-H (混合架构, FP8, MiniPuzzle) ​

🌺 论文摘要

Nemotron-H 论文摘要

参考链接

问题背景

  • Transformer 的长上下文推理受 KV cache 和访存限制,需要提高相同硬件下的吞吐。
  • 高效架构还要能完成预训练、压缩、视觉扩展和推理后训练,形成可用模型系列。

核心方法

  • 混合架构:约 8%层为 Attention,其余以 Mamba-2 与 FFN 为主。
  • FP8 预训练:主要线性层前向/反向使用 FP8,首尾敏感层保持 BF16。
  • MiniPuzzle:重要性估计 → 显存约束架构搜索 → KL 蒸馏,将 56B压缩到 47B。
  • 扩展分支:VLM 使用视觉编码器与两阶段训练;Reasoning 使用分阶段 SFT、长上下文训练和 GRPO。

模型效果(Base与Reasoning分支)

  • Base 的 MMLU-Pro:56B 60.5、47B 61.8;47B 保持接近原模型的综合能力。
  • 47B-Reasoning:AIME25 54.2,LiveCodeBench 50.2,IFEval Prompt 84.5。

重要结论

  • 大幅减少 Attention 仍能保留较强语言与后训练能力,并降低长上下文推理成本。
  • 压缩候选应在短期蒸馏后比较;直接剪枝后的分数不能充分预测恢复后的表现。

核心贡献

  • 系统验证混合架构、低精度预训练与硬件约束压缩的组合路线。

未来方向

  • 继续优化混合模型推理实现,并研究更稳健的压缩与长上下文能力。

问题背景 ​

长上下文与模型部署

Attention 成本

  • 自回归生成持续读取历史 KV,长上下文增加显存占用,也限制可用 batch size。
  • Mamba-2 的递归状态大小固定,但纯递归模型对历史信息的直接检索能力有限。

架构目标

  • 用少量 Attention 补充全局读取,大部分层使用 Mamba-2,兼顾能力与吞吐。
  • 再通过低精度训练和压缩降低训练、部署成本。

核心方法 ​

混合模型架构 ​

Hybrid Mamba-Transformer 架构

混合布局

  • 8B:52层中含 4层Attention;56B:118层中含 10层Attention。
  • Attention 均匀分布,其余层由 Mamba-2 与 FFN 构成;Attention 后接 FFN。
  • Mamba-2 压缩历史状态,Attention 保留 token 级直接交互。

主要参数

  • 8B hidden size 4096,56B 为 8192;两者均使用 8个KV heads。
  • 使用 RMSNorm、squared ReLU,不使用位置编码;各层保留 residual connection。

受控对照

  • 同时训练 Nemotron-T-8B,保持相同数据,比较纯 Transformer 与混合结构。
Nemotron-H 的混合层排列:少量 Attention 层穿插在 Mamba-2 与 FFN 中,兼顾跨位置关联和低缓存开销。
原文图 2:Nemotron-H 的混合层排列:少量 Attention 层穿插在 Mamba-2 与 FFN 中,兼顾跨位置关联和低缓存开销。 来源

预训练与 FP8 计算 ​

预训练数据与 FP8

数据组合

  • 网页、代码、数学、学术、多语言等真实数据,搭配合成解题与知识数据。
  • 按来源质量分配权重,提高优质数据比例,同时保持领域覆盖。
  • 8B 训练 15T tokens,56B 训练 20T tokens。

FP8 配方

  • 56B 的线性层前向/反向采用 FP8,首 4层与末 4层保持 BF16。
  • 权重、激活使用 E4M3;梯度使用动态范围更大的 E5M2。
  • 每个 tensor 根据最大绝对值动态缩放,再转换为 FP8。

训练稳定性

  • 配合异常检测、checkpoint 与自动恢复处理大规模训练故障。
  • 同时观察 loss 与下游任务,低精度带来的 loss 差异未必对应任务能力差异。

模型剪枝与蒸馏 ​

重要性估计与条件架构搜索

层重要性

  • 临时移除某层,比较完整模型与剪枝模型在 LM head 前的 hidden states。
  • 用 MSE 衡量变化,在小校准集上平均;变化小的层更适合删除。

FFN 神经元重要性

  • 统计 FFN 中间神经元的激活强度,优先保留贡献较大的维度。
  • 搜索深度与 FFN 宽度;直接剪 Mamba head/state 维度会明显损害能力。

显存约束搜索

  • 枚举各类层数与 FFN 宽度,筛选满足 32GiB GPU部署预算的结构。
  • 约 400个候选先按 next-token accuracy 和 parent agreement 排序,再用任务评测筛到三个。
  • 搜索预算同时计入 FP4 权重、1M上下文 cache 和运行缓冲。
短期筛选与完整 KL 蒸馏

候选比较

  • 三个候选各用约 7B tokens短期蒸馏,观察剪枝后的可恢复程度。
  • 选择恢复效果最好的候选,再用 63B tokens完整蒸馏。

训练目标

  • Teacher 为 56B,Student 为剪枝后的 47B,只优化输出分布的 forward KL。
  • 目标是让 Student 恢复 Teacher 的预测分布,而非重新从头学习语料。

最终结构

  • Attention 从 10层减到 5层,Mamba 从 54层减到 44层,FFN 为 49层。
  • FFN intermediate size 从 32768压缩到 30720。
MiniPuzzle 的三步压缩:估计层重要性、按显存约束搜索候选,再用短期筛选与完整蒸馏恢复模型能力。
原文图 8:MiniPuzzle 的三步压缩:估计层重要性、按显存约束搜索候选,再用短期筛选与完整蒸馏恢复模型能力。 来源

多模态与推理后训练 ​

视觉语言分支:NVLM-D

图像编码

  • InternViT-300M 编码图像;动态切成最多 12个448×448 tiles,另加全图 thumbnail。
  • 相邻四个视觉 token 合并,每个 tile 从 1024压缩到 256 tokens。
  • 加入 tile ID,经两层 FFN projector 映射到语言模型空间。

训练流程

  • VL PreTrain:冻结视觉编码器和 LLM,只训练 projector,完成模态对齐。
  • VL SFT:图像问答、OCR、图表和文档任务联合训练视觉编码器、projector 与 LLM。
分阶段推理 SFT

STEM 阶段

  • 优先训练数学、科学与代码,推理/直接回答样本约 5:1。
  • 推理轨迹包含多种解法和修正,另保留去掉思考的配对回答。

通用对话阶段

  • 加入指令、安全和多轮对话,同时回采 STEM 数据,减少能力回退。
  • 第二阶段数据量约为第一阶段的 1/10,推理与非推理样本更均衡。

模式控制

  • Chat template 根据 reasoning 标签添加 <think> 或空思考前缀,控制是否显式推理。
长距离关联数据与 GRPO

长上下文构造

  • 拼接短对话到 512K,插入对早先对话的引用问答,训练跨长距离检索。
  • 将相关主题片段分散到历史,再提综合问题;另加入文档聚合 QA 和带干扰的高频词检索。
  • 生成器只处理局部相关片段,避免生成长样本时依赖教师的完整长上下文能力。

GRPO

  • 为指令等任务构建自动 verifier,按任务阶段优化,再用通用 Reward Model 提高 helpfulness。
  • 指令阶段使用约 16K个LMSYS prompts附加 IFEval 风格约束,以规则判分。
  • 最后用基于 Qwen-32B 的 Reward Model,在 HelpSteer2 prompts 上进行 GRPO。

架构对照实验

  • 另有同数据 8B Hybrid/Transformer 的 SFT 与 DPO/RPO 对照,用于检查混合架构的可对齐性。
  • 该对照与最终 Reasoning 分支分别记录,不混为一条训练流程。

实验设置(Base、MiniPuzzle与Reasoning分支) ​

训练与评测

基模

  • 8B:15T tokens,峰值 lr 8e-4;56B:20T tokens,峰值 lr 4e-4。
  • Seq 8192,batch 768条,AdamW;cosine decay 到峰值的 1%。

剪枝蒸馏

  • 层重要性使用 128个样本,FFN 重要性使用 1024个样本。
  • 蒸馏使用 FP8、temperature 1、seq 8192、batch 768。

后训练与评测

  • Reasoning 的指令 GRPO lr 1e-6,TRT-LLM 采集 rollout;VLM 使用独立图文训练数据。
  • Base 使用 few-shot 数学/知识和代码执行测试;Reasoning 使用 AIME、GPQA、LCB、IFEval 等。
  • 吞吐测试:H100,输入 65536、输出 1024 tokens,尽量增大 batch,按每 GPU 归一化。

关键结果(Nemotron-H Base与后训练分支) ​

架构、压缩与扩展能力

Base 与压缩

  • MMLU-Pro:56B 60.5、47B 61.8;HumanEval:60.4 → 61.0。
  • 剪枝蒸馏基本保留综合能力;少量任务波动,核心收益是更小部署体积和更高吞吐。
  • 64K输入/1K输出时,47B 每 GPU 吞吐约为 Qwen2.5-72B 的 2.9倍。

候选排序

  • 短期蒸馏后,不同候选的差距明显缩小,部分初始较弱的结构也能恢复。
  • 因此搜索不能只看刚剪完的分数,需要把恢复训练纳入结构选择。

FP8

  • FP8 的 loss 略高,但下游能力可达到 BF16 水平,训练 loss 不足以单独决定精度方案。

Reasoning 与视觉

  • 47B-Reasoning 的 AIME25 54.2、LCB 50.2、IFEval Prompt 84.5,可继续获得推理和指令能力。
  • 相比 Qwen3-32B,代码仍有差距:LCB 50.2 vs 64.2,混合架构优势主要在能力与效率的组合。
  • 56B-VLM 的 MathVista 70.7、DocVQA 93.2,说明该主干也能承接图文理解训练。

未来方向 ​

进一步优化

推理实现

  • 作者预期继续优化混合模型 kernel 与推理系统,释放尚未充分优化的吞吐空间。

压缩策略(笔记整理)

  • 将硬件显存、时延和目标任务一起纳入搜索,比较短期蒸馏对结构排序的预测价值。

能力扩展(笔记整理)

  • 继续补强代码和长文档推理,研究递归状态与直接 Attention 的合适比例。

(2406) Nemotron-4 340B (合成对齐数据, Reward Model, RPO) ​

🌺 论文摘要

Nemotron-4 340B 论文摘要

参考链接

问题背景

  • 高质量对齐数据依赖昂贵的人工标注,需要扩大数据覆盖,同时控制合成回答的质量。
  • 仅用 chosen/rejected 的二值偏好,会忽略回答质量差距,也可能损伤较好的 rejected 回答。

核心方法

  • Base:340B Dense,8T预训练 + 1T CPT。
  • Reward Model:基于 HelpSteer2,分别回归 helpfulness、correctness 等五个属性。
  • 数据迭代:合成 prompts / 对话 → 奖励筛选与配对 → 训练更强模型 → 更新生成器。
  • 对齐训练:Code / General SFT → DPO → 三轮 RPO;使策略奖励差匹配 RM 质量差,保留偏好强弱。

模型效果(Nemotron-4-340B-Instruct/Reward)

  • Instruct:HumanEval 73.2,GSM8K 92.3,IFEval Prompt-Strict 79.9。
  • Reward:RewardBench 92.0,为合成数据质量筛选与偏好排序提供基础。

重要结论

  • 超过 98%的对齐数据可以由模型生成,但少量高质量人工监督仍负责建立评价标准。
  • 分阶段 SFT 与多轮偏好训练相互补充;代码和通用能力需要持续平衡。

核心贡献

  • 公开 Base、Instruct、Reward 和合成数据流程,形成可用于训练其他模型的完整配套。

未来方向

  • 继续扩展数据生成工具,并改善合成任务难度、奖励泛化和迭代训练稳定性。

问题背景 ​

合成数据与偏好质量

数据规模

  • 真实人工对话昂贵,已有公开数据难以持续提供足够广的任务和指令组合。
  • 合成数据可控、可扩展,但生成错误和偏好排序偏差会被后续训练放大。

训练目标

  • 同样是 rejected,有的回答只稍差,有的明显错误;二值排序丢失了这个区别。
  • 模型需要学习真实质量差距,避免不断拉大偏好间隔而破坏已有能力。

核心方法 ​

Base 模型与预训练 ​

Base 架构与预训练

模型架构

  • 340B Dense Transformer,96层,hidden size 18432,上下文 4096。
  • 使用 GQA:96个Q heads、8个KV heads;RoPE、squared ReLU、输入输出 embedding 不共享。

数据与阶段

  • 英文 70%、多语言 15%、代码 15%,覆盖 53种自然语言、43种编程语言。
  • 先进行 8T tokens预训练,再用 1T tokens调整数据分布和学习率,完成 CPT。

多维奖励模型 ​

五维 Reward Model

训练数据

  • HelpSteer2 提供约 10K条人工标注,建立不同回答质量属性的监督信号。
  • 在 340B Base 上替换输出层,以线性 reward head 输出五维分数。

属性分解

  • Helpfulness、Correctness、Coherence、Complexity、Verbosity 分开回归。
  • 把“是否有帮助”与“是否更长、更复杂”分开,减少模型只偏爱长回答的倾向。
  • 使用时按权重合成总分,支持质量过滤与候选排序。

合成数据与迭代 ​

Prompt、对话与偏好构建

Prompt 多样性

  • 按任务、主题、指令三条维度构造 prompts,覆盖开放问答、写作、文档问答、数学和代码。
  • 从宏观主题扩展子主题,再细化问题;附加格式、段落数等可验证约束。
  • 混合 LMSYS 等真实 prompts,增加真实用户请求的复杂度。

多轮对话

  • 模型轮流扮演 User 和 Assistant,结合用户画像生成多轮交流。
  • Reward Model 给整段对话打分,筛除低质量示范;SFT 与偏好 prompts 分开。

偏好配对

  • 从多个中间模型和同一强模型的多次采样中生成候选,兼顾多样性和细粒度差异。
  • 数学、指令等任务优先使用正确答案或程序 verifier;开放任务使用 Reward Model。
  • 早期 LLM judge 通过交换回答顺序检查一致性,后期转向更准确的 Reward Model。
不同任务的合成 prompt 构建方式:开放问答、写作、闭合问答、数学与代码分别组织输入。
原文图 2:不同任务的合成 prompt 构建方式:开放问答、写作、闭合问答、数学与代码分别组织输入。 来源
生成器与模型共同迭代

迭代路线

  • 初期用 Mixtral-8x7B-Instruct 生成数据,对齐更强的 340B Base 中间 checkpoint。
  • 将得到的 Instruct 模型用作新生成器,重新生成更高质量的数据,再训练后续 Base。
  • 基模预训练与数据生成并行推进,模型能力与数据质量共同改进。

人工监督

  • 人工数据约 20K条:一部分用于 SFT,另一部分 HelpSteer2 用于奖励与偏好训练。
  • 超过 98%对齐数据为合成,人工监督主要建立初始示范和可靠评价标准。
Weak-to-Strong 迭代:模型生成数据、Reward Model 筛选数据、下一轮模型继续提升,观察数据与模型如何共同更新。
原文图 4:Weak-to-Strong 迭代:模型生成数据、Reward Model 筛选数据、下一轮模型继续提升,观察数据与模型如何共同更新。 来源

SFT 与偏好优化 ​

Genetic Instruct 与 Code/General SFT

Code SFT

  • Genetic Instruct 从高质量种子出发,通过 self-instruction 与任务变异扩充题目和解答。
  • 用 LLM 评价正确性与质量,通过筛选的样本回到种子池继续扩展。
  • 去重后约 800K条,先单独训练代码,减少与其他行为混合学习的冲突。

General SFT

  • 再用 200K条混合任务训练对话和指令,回采 2%代码数据降低遗忘。
  • 两阶段都 mask User turns,只在 Assistant 输出上计算损失。
DPO 与 Reward-aware Preference Optimization

DPO 的问题与修正

  • 偏好间隔增加时,chosen 与 rejected 的概率可能一起下降,长时间训练也可能损害其他任务。
  • 在 DPO 外加入 chosen SFT loss,约束高质量回答,减少偏离训练数据。

RPO 的目标

  • 令策略的隐式奖励差为两条回答相对 reference 的 log-prob 差。
  • 将该差距匹配 Reward Model 的分差,回答质量接近时,不要求形成很大的偏好间隔。
Δπ=βlog⁡π(yc∣x)πref(yc∣x)−βlog⁡π(yl∣x)πref(yl∣x),Δr=η(r(yc)−r(yl))

优化方式

  • 通过 sigmoid 将两种分差转为软偏好概率,最小化相应分布差异,保留质量差距信息。
  • 从 DPO checkpoint 开始,RPO 每轮以上一轮模型作为初始化和 reference。
  • 连续三轮 RPO,并保留较小权重的 chosen SFT loss。

实验设置(340B预训练与合成数据对齐) ​

模型、数据与超参

预训练

  • 768个DGX H100节点,每节点 8卡;TP 8、PP 12,逐步扩大 data parallel。
  • Seq 4096,global batch 从 768 → 1536 → 2304,合计 9T tokens。

SFT

  • Code:800K条、1 epoch、batch128、lr3e-7。
  • General:200K条、3 epochs、batch128,lr 在 1e-7–5e-7范围选择。

偏好训练

  • DPO:160K条、1 epoch、batch256,附加 chosen SFT loss。
  • RPO:300K条、3轮,lr 3e-7,reward scale η=1,chosen SFT 系数 1e-5。
  • 每轮更新 reference;Reward Model 独立使用 HelpSteer2 训练。

评测

  • Base/各后训练阶段分别评测;代码使用 HumanEval,指令使用 IFEval,对话使用 MT-Bench。
  • Reward Model 使用 RewardBench;另进行人工偏好和安全评测。

关键结果(Nemotron-4-340B,分阶段SFT + DPO/RPO) ​

数据、算法与能力变化

Code 与通用能力的取舍

  • HumanEval 从 Base 57.3提高到 Code SFT 70.7;General SFT 后降到 66.5。
  • 同时 General SFT 改善对话和知识,说明不同任务的最佳训练配比和顺序存在冲突。

RPO 的增益

  • DPO 到最终 RPO:IFEval Prompt-Strict 61.7 → 79.9,GSM8K 88.5 → 92.3。
  • HumanEval 恢复到 73.2,MT-Bench 从 7.90提高到 8.22,综合能力继续改善。
  • 各轮个别分数仍有波动,多轮训练的价值是总体改善,不是每项指标单调增长。

奖励模型

  • RewardBench 92.0,Chat-Hard 87.1;能够更好地区分两个质量接近的回答。
  • 高质量评分使合成偏好数据可用,数据量扩展需要与筛选能力同步。

合成数据迭代

  • 强 Base 配合筛选后的弱教师数据,可以超过初始生成器,再成为下一轮更强的数据来源。
  • 这条路线同时依赖基模改进与数据改进,不能只增加重复生成次数。

未来方向 ​

数据生成与偏好学习

工具开放

  • 作者计划继续提供面向合成数据生成的部署与服务工具,降低使用门槛。

任务与奖励(笔记整理)

  • 合成 prompts 通常比真实请求简单,可扩大真实复杂指令和多轮任务覆盖。
  • 检查 Reward Model 在新领域的排序可靠性,减少多轮生成训练对同一评价偏好的放大。

训练平衡(笔记整理)

  • 研究代码、对话与指令能力的混合比例和阶段顺序,降低通用 SFT 后的领域回退。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026