Skip to content

On Policy Distillation

📅 发表于 2026/05/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 3979 字
12 分钟

(2504) 知乎-从主流开源模型看 OPD 在后训练中的角色

(2604) Rethinking On-Policy Distillation (Tsinghua University)

🌺 论文摘要

Rethinking On-Policy Distillation 摘要

参考链接

核心方法

  • OPD机制系统性探究
    • 揭示了决定同策略蒸馏(On-Policy Distillation, OPD)成败的两个核心前提:思维模式一致性新知识的引入
    • 探究了Token级别的底层机制:有效的OPD表现为在学生模型访问的状态下,高概率Token的渐进式对齐
  • 挽救失效OPD的两种策略
    • 离线冷启动(Off-policy cold start):先用教师Rollout进行SFT。
    • 教师对齐提示词(Teacher-aligned prompts):使用教师后训练数据中的Prompt。

模型效果

  • 在共享高概率Token(重叠Token)上,学生和教师模型集中了97%–99%的概率质量。仅对这些重叠Token进行优化,即可达到完整Top-k OPD的性能。Overlap Sufficiency
  • SFT冷启动和对齐提示词能有效修正初始化时的“思维模式鸿沟”,在多项数学基准上稳定提升最终性能。

重要结论

  • 能力强 ≠ 可蒸馏:如果思维模式差异过大,即使教师模型在基准测试上得分更高,也可能完全无法提升学生模型(甚至导致能力倒退)。Failure Mode
  • 高得分 ≠ 新知识:仅靠参数规模放大(如1.5B到7B)带来的分数提升,不足以为OPD提供增量信息。教师必须拥有学生未曾见过的“新知识”(如经过额外的RL微调)。
  • 长序列质量退化:OPD密集奖励在长序列轨迹后期(10K-15K Token)会发生质量崩塌,导致熵增并反向传播破坏整体优化。Depth Degradation

关键贡献

  • 对大语言模型OPD训练动态进行了现象学、底层机制到实用配方的系统性剖析,解释了“为何更强的教师不一定能教出更好的学生”,并指出了长上下文场景下密集奖励的固有缺陷。

问题背景

问题背景

OPD的现状与局限

问题背景

在线蒸馏(OPD)成为核心范式

  • 近期多个前沿模型(Qwen3, MiMo, GLM-5)将OPD作为后训练核心管线。
  • 相比固定依赖教师数据的离线蒸馏(Off-policy KD),OPD让学生模型生成自身轨迹,避免了曝光偏差(Exposure Bias)Exposure Bias
  • 它被认为是一种高效的密集奖励替代方案,甚至能用于单一模型的自我蒸馏以实现自我改进。

当前面临的挑战

  • 训练动态极度脆弱且黑盒:在实践中,OPD极易失败。
  • 反直觉的失败模式:一个能力远超学生的强大教师模型,可能会在蒸馏中完全失败;而一个较弱的教师却能成功提升学生。Thinking Pattern 业界缺乏对“哪些条件决定了OPD的成败”以及“其Token级作用机制是什么”的清晰认知。

核心方法

📕核心方法

现象学分析:OPD成功的两大条件

决定成败的前提

条件一:思维模式一致性(Thinking-Pattern Consistency)

  • 教师和学生必须拥有高度兼容的“思考方式”。
  • 逆向蒸馏验证:将RL后验模型反向蒸馏至其Pre-RL检查点会导致能力完全退化;而用更高分的同系7B模型进行蒸馏,竟产生一模一样的退化轨迹Reverse Distill 这证明OPD本质上是在学习思维模式,而不仅仅是受益于一致性,且训练动态可与基准分数完全脱钩。

条件二:新知识(New Knowledge, Not Just Scale)

  • 同一管线训练出的教师模型,即使规模更大、分数更高,也只能带来微小的提升。
  • 只有经过额外RL后训练的教师(掌握了学生在训练阶段未见过的“新知识”),才能通过OPD实现显著的能力跨越(间隙恢复率:58.6% vs 15.6%)。RL Post-trained Teachers

机制探究:高概率Token的渐进式对齐

Token级别的底层机制

渐进式对齐(Progressive Alignment)

  • 在成功的OPD中,学生和教师Top-k集合的重叠率(Overlap Ratio)会稳步上升(例如从72%升至91%以上)。Overlap Growth
  • 双方策略分布的熵隙(Entropy Gap)缩小,且重叠集上的优势值向0收敛。失败的OPD在这些指标上则从一开始就陷入停滞。

重叠区的充分性(Overlap Sufficiency)

  • 分割实验证明,仅对学生和教师共享的Top-k重叠Token进行优化,就能达到与完整Top-k OPD几乎相同的效果。非重叠Token对梯度的贡献微乎其微。这揭示了OPD的自我强化动态:一旦Token进入重叠区,Reverse-KL会放大其权重,将非重叠Token逐渐挤出。

实践配方:如何挽救失效的OPD

挽救失败OPD的策略

针对思维模式不匹配导致的OPD失败,提出了两种缩小差距的方案:

1. 离线冷启动(Off-Policy Cold Start)

  • 操作:在进行OPD前,先使用教师模型生成的Rollout对学生模型进行SFT。
  • 效果:显著提高了初始阶段的Token重叠率,使得教师的底层监督信号在OPD启动时立即可用,带来更稳定和更高上限的最终性能。Cold Start

2. 教师对齐提示词(Teacher-Aligned Prompts)

  • 操作:直接使用教师模型在后训练时见过的Prompt格式或内容进行蒸馏。
  • 效果:哪怕只是对齐Prompt模板,也能大幅提高对齐效率。但需注意,完全使用对齐Prompt会导致学生模型策略熵过度降低,需混合分布外数据以维持探索能力。Aligned Prompts

实验设置

✍️实验设置

实验设置

基础模型与数据

  • 模型族:Qwen3系列 (1.7B, 4B), DeepSeek系列 (R1-Distill-1.5B/7B/14B, JustRL-1.5B, Skywork-OR1-Math-7B)
  • 数据集:DAPO-Math-17K, OpenThoughts3-1.2M, DeepMath。

评测基准

  • 包含 AIME 2024, AIME 2025, AMC 2023。
  • 采用 avg@16 作为核心评测指标(温度=0.7, top-p=0.95)。Eval Metric

训练超参

  • 默认配置:全局Batch Size 64,学习率 1e-6,KL系数 0.0,Rollout数 4,Top-k为16。Hyperparameters

关键结果

🍑关键结果

关键结果与发现

长序列的奖励退化(Trajectory Depth Limitation)

  • 随着轨迹长度加深,教师奖励质量急剧下降。在短到中等长度(3K-7K)时表现最好;而在长响应(10K-15K)时,后期会发生训练崩塌。高熵表现总是从生成的尾部出现,并随着训练逐步反向污染前面的Token。

全局有用的奖励 ≠ 局部可优化

  • 即使是导致OPD失败的7B教师模型,它给出的序列级平均奖励也与Rollout的正确性高度相关(AUROC达0.75)。失败并非因为奖励“全局无用”,而是因为局部梯度优化空间的高度各向异性导致了信号抵消。

采样单Token(Sampled-token)已足够

  • 实验证明,计算每个位置的Top-k KL散度是不必要的。只要避开Top-1(会导致模式崩溃),简单的单Token采样(Sampled-token)OPD就能达到和Top-64同等的性能水平。Top-K vs Sampled

未来方向

未来方向

未来方向

领域的拓展

  • 当前结论均基于数学推理基准,在代码生成及开放式对话(Open-ended settings)中是否遵循相同的Token级机制仍是开放问题。Future Domains

预训练数据的影响

  • 难以剥离不同模型家族间的Tokenzier及架构差异以纯粹衡量预训练数据差异对OPD的实质性影响,这是当前的难点。Pretraining Impact

自我蒸馏机制(Self-Distillation)

  • 如何将这些动态洞察扩展到单模型自我蒸馏领域(此时思维模式天然一致,但新知识来源于特权信息的访问)。Self-Distillation

长视野Agent场景(Long-Horizon & Agentic)

  • 针对长上下文下密集奖励的衰退,探索结合短期密集Token级监督与长期稀疏结果奖励(Outcome-level rewards)的混合方法及课程学习策略。Hybrid Approaches

(2510) On-Policy Distillation (50-100x算力效率, Thinking Machines Lab)

🌺 论文摘要

On-Policy Distillation 摘要

参考链接

核心方法

  • On-Policy Distillation (在线策略蒸馏)
    • 结合了RL(强化学习)的在线策略相关性SFT蒸馏的密集奖励信号
    • 通过学生模型自行采样生成轨迹,并使用强大的教师模型为每个Token打分(计算Reverse KL散度)作为奖励信号,最后用RL算法更新。

模型效果(Qwen3-8B)

  • 数学推理 (AIME'24):在Qwen3-8B上,通过在线蒸馏达到了70%的AIME'24得分,达到与RL相似的性能,但减少了7-10倍的梯度更新步数
  • 个性化与持续学习:在注入内部文档知识导致指令遵循能力(IF-eval)从85%灾难性遗忘降至45%后,在线蒸馏能将其低成本恢复至83%,同时保留新学到的内部知识。

重要结论

  • RL本质上是在搜索语义策略,计算成本极高;一旦找到好策略,在线蒸馏是学习该最终策略的捷径
  • 与传统RL相比,在线蒸馏的算力效率提升了 50-100倍
  • 相比Off-Policy SFT,在线蒸馏避免了分布偏移(曝光偏差),即使在自身的样本上训练也不会导致性能退化,是持续学习(Continual Learning)的极佳工具。

关键贡献

  • 提出了一种低成本的后训练范式,将学生生成的On-Policy轨迹与教师的密集反馈结合。
  • 证明了Token级别的密集奖励能够大幅度提升数据效率(单Prompt多Epoch训练不过拟合)与计算效率。

问题背景

问题背景

后训练(Post-training)的两难困境

问题背景

RL (On-Policy) 的痛点:反馈稀疏

  • 奖励稀疏且昂贵:传统的RL(如PPO)只在序列结束时给出环境奖励。
  • 学习效率低:无论生成了多少Token,每个Episode仅提供固定比特的反馈。学生模型知道“答案错了”,但不知道“哪一步算错了”。这使得RL的计算成本和试错成本极高。

SFT/离线蒸馏 (Off-Policy) 的痛点:分布偏移与误差累积

  • 无法学习错误恢复:学生模型只在教师模型的高质量状态分布下学习。在实际推理中,一旦学生模型犯了教师从未犯过的早期错误,就会偏离训练状态,导致误差复合累积(Compounding Error)
  • 难以持续改进:用模型自己生成的样本去进行SFT(即便预期KL散度为0),由于有限Batch带来的非零梯度更新,会导致模型策略漂移,造成能力(如指令遵循)的退化。

想法

  • 结合两者优势:既要有RL的在线状态覆盖(自己犯错自己学),又要有蒸馏的密集反馈(每一步都有名师指导)。

On-Policy Distillation 核心方法

📕核心方法

核心思想

On-Policy Distillation

核心机制

  • 采样:让学生模型(Student)在环境中自由探索,生成完整或部分的思维/推理轨迹。
  • 密集奖励:使用强大的教师模型(Teacher)针对学生生成的每一步Token计算概率分布。
  • 优化目标:计算每一步的 Reverse KL 散度,并将其取负作为RL的优势函数(Advantage)进行优化。KL(πθ||πteacher)=Exπθ[logπθ(xt+1|x1..t)logπteacher(xt+1|x1..t)]

算法特性

  • 模式寻求 (Mode seeking):Reverse KL 倾向于让学生模型学习教师的一种特定高概率行为,而不是在多个次优选项中平均分布。
  • 无监督漏洞 (Unhackable):低KL散度总是直接对应于教师模型视角下的高概率理想行为,不像传统的Reward Model容易被模型Hack(漏洞利用)。
  • 无需跑完完整序列:因为Token级别的概率计算是即时的,不需要等待环境反馈,可以使用更短或截断的轨迹进行训练。

具体实现流程

具体实现流程与步骤

执行步骤 (基于Tinker API)

  1. 初始化教师客户端:采用纯采样/推理客户端,无需保存计算图或反向传播。
  2. 学生采样轨迹:像常规RL一样让学生模型 rollout 轨迹,并记录下学生自身在该轨迹上的 logprobs
  3. 计算奖励:将学生采样的轨迹送入教师模型进行一次前向传播,计算教师的 logprobs。得出 Reverse KL,将其取负值作为每个 Token 的奖励(Advantages = -Reverse KL)。
  4. RL策略更新:使用强化学习的 Importance Sampling (重要性采样) 损失函数来更新学生模型的权重。

防灾难性遗忘与个性化训练

  • 在注入新领域知识(如内部文档SFT)后,模型原有的指令遵循能力会发生灾难性遗忘。
  • 训练前的模型旧版本作为教师,利用On-Policy Distillation在通用指令集上训练,可以完美找回丢失的能力(Chat/IF-eval恢复),且不影响新学到的领域知识。

实验设置

✍️实验设置

实验设置

基础模型与角色

  • 学生模型:Qwen3-8B-Base 或 Qwen3-8B-Instruct
  • 教师模型:Qwen3-32B 或 Qwen3-235B (或经过RL训练后的专家模型)

评测任务与数据集

  • 数学推理:AIME'24(使用 OpenThoughts-3 数据集初始化)。
  • 个性化/持续学习:企业内部文档知识注入 (Internal QA Eval) + 指令遵循测试 (IF-eval),使用 Tulu3 提示词。

计算与对比基线

  • Baseline 1:纯SFT (Off-Policy Distillation) 大规模数据扩展。
  • Baseline 2:标准的强化学习 (PPO/RL)。

关键结果

🍑关键结果

关键结果

数学推理能力 (AIME'24)

  • 从SFT基础版本(60%)出发,On-Policy Distillation 仅需约 150 步 即可提升至 70%
  • 达到类似性能的前提下,计算量比标准RL减少了约 50-100倍(只需 7-10 倍更少的梯度步数)。
  • 成本对比:如果计入获取SFT数据的成本,在线蒸馏的成本是扩展SFT数据集方案的 1/9 到 1/30

卓越的数据效率

  • 极强抗过拟合:传统RL对同一Prompt训练多轮会变成简单记忆最终答案,而在单条Prompt上使用在线蒸馏连续训练 20 步(5120次评估),依然能稳定贴近教师模型的真实分布能力。

个性化与持续学习完美融合

  • 在注入内部文档导致通用指令得分(IF-eval) 从 85% 暴跌至 45% 后。
  • 使用在线蒸馏进行干预,使 IF-eval 成功恢复至 83%,同时内部知识准确率稳定保持在 41%(原版Base模型仅为18%),实现了无损的知识与行为融合。

未来方向

未来方向

未来方向

机制深层理解

  • RL 是搜索,蒸馏是捷径:强化学习本质上是在高维语义策略空间中进行“搜索”,而梯度更新占比不大。一旦RL找到了优秀的策略,直接通过On-Policy Distillation学习这个“最终策略”,能省去大量搜索带来的算力开销。

未来研究可能

  • 混合奖励机制:结合蒸馏的Token级密集奖励和环境反馈的Sequence级奖励(如是否通过测试用例),以期达到更高的上限。
  • 解决持续学习难题:Off-Policy的SFT用模型自身数据训练会导致漂移,而On-Policy Distillation因为教师分布锚定,不会产生退化。未来这可能成为大模型Test-time Training(测试时训练)和 Continual Learning 的标准范式。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026