On Policy Distillation
📅 发表于 2026/05/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 3979 字
⏳ 12 分钟
🌺 论文摘要
参考链接
核心方法
OPD机制系统性探究挽救失效OPD的两种策略离线冷启动(Off-policy cold start):先用教师Rollout进行SFT。教师对齐提示词(Teacher-aligned prompts):使用教师后训练数据中的Prompt。模型效果
重要结论
能力强 ≠ 可蒸馏:如果思维模式差异过大,即使教师模型在基准测试上得分更高,也可能完全无法提升学生模型(甚至导致能力倒退)。Failure Mode高得分 ≠ 新知识:仅靠参数规模放大(如1.5B到7B)带来的分数提升,不足以为OPD提供增量信息。教师必须拥有学生未曾见过的“新知识”(如经过额外的RL微调)。长序列质量退化:OPD密集奖励在长序列轨迹后期(10K-15K Token)会发生质量崩塌,导致熵增并反向传播破坏整体优化。Depth Degradation关键贡献
❓问题背景
在线蒸馏(OPD)成为核心范式
当前面临的挑战
训练动态极度脆弱且黑盒:在实践中,OPD极易失败。反直觉的失败模式:一个能力远超学生的强大教师模型,可能会在蒸馏中完全失败;而一个较弱的教师却能成功提升学生。Thinking Pattern 业界缺乏对“哪些条件决定了OPD的成败”以及“其Token级作用机制是什么”的清晰认知。📕核心方法
条件一:思维模式一致性(Thinking-Pattern Consistency)
条件二:新知识(New Knowledge, Not Just Scale)
渐进式对齐(Progressive Alignment)
重叠区的充分性(Overlap Sufficiency)
针对思维模式不匹配导致的OPD失败,提出了两种缩小差距的方案:
1. 离线冷启动(Off-Policy Cold Start)
2. 教师对齐提示词(Teacher-Aligned Prompts)
✍️实验设置
基础模型与数据
评测基准
训练超参
🍑关键结果
长序列的奖励退化(Trajectory Depth Limitation)
全局有用的奖励 ≠ 局部可优化
采样单Token(Sampled-token)已足够
⛳ 未来方向
领域的拓展
预训练数据的影响
自我蒸馏机制(Self-Distillation)
长视野Agent场景(Long-Horizon & Agentic)
🌺 论文摘要
参考链接
核心方法
On-Policy Distillation (在线策略蒸馏)RL(强化学习)的在线策略相关性和SFT蒸馏的密集奖励信号。学生模型自行采样生成轨迹,并使用强大的教师模型为每个Token打分(计算Reverse KL散度)作为奖励信号,最后用RL算法更新。模型效果(Qwen3-8B)
70%的AIME'24得分,达到与RL相似的性能,但减少了7-10倍的梯度更新步数。45%后,在线蒸馏能将其低成本恢复至83%,同时保留新学到的内部知识。重要结论
RL本质上是在搜索语义策略,计算成本极高;一旦找到好策略,在线蒸馏是学习该最终策略的捷径。50-100倍。避免了分布偏移(曝光偏差),即使在自身的样本上训练也不会导致性能退化,是持续学习(Continual Learning)的极佳工具。关键贡献
❓问题背景
RL (On-Policy) 的痛点:反馈稀疏
奖励稀疏且昂贵:传统的RL(如PPO)只在序列结束时给出环境奖励。学习效率低:无论生成了多少Token,每个Episode仅提供固定比特的反馈。学生模型知道“答案错了”,但不知道“哪一步算错了”。这使得RL的计算成本和试错成本极高。SFT/离线蒸馏 (Off-Policy) 的痛点:分布偏移与误差累积
无法学习错误恢复:学生模型只在教师模型的高质量状态分布下学习。在实际推理中,一旦学生模型犯了教师从未犯过的早期错误,就会偏离训练状态,导致误差复合累积(Compounding Error)。难以持续改进:用模型自己生成的样本去进行SFT(即便预期KL散度为0),由于有限Batch带来的非零梯度更新,会导致模型策略漂移,造成能力(如指令遵循)的退化。想法
RL的在线状态覆盖(自己犯错自己学),又要有蒸馏的密集反馈(每一步都有名师指导)。📕核心方法
核心机制
采样:让学生模型(Student)在环境中自由探索,生成完整或部分的思维/推理轨迹。密集奖励:使用强大的教师模型(Teacher)针对学生生成的每一步Token计算概率分布。优化目标:计算每一步的 Reverse KL 散度,并将其取负作为RL的优势函数(Advantage)进行优化。算法特性
模式寻求 (Mode seeking):Reverse KL 倾向于让学生模型学习教师的一种特定高概率行为,而不是在多个次优选项中平均分布。无监督漏洞 (Unhackable):低KL散度总是直接对应于教师模型视角下的高概率理想行为,不像传统的Reward Model容易被模型Hack(漏洞利用)。无需跑完完整序列:因为Token级别的概率计算是即时的,不需要等待环境反馈,可以使用更短或截断的轨迹进行训练。执行步骤 (基于Tinker API)
logprobs。logprobs。得出 Reverse KL,将其取负值作为每个 Token 的奖励(Advantages = -Reverse KL)。Importance Sampling (重要性采样) 损失函数来更新学生模型的权重。防灾难性遗忘与个性化训练
训练前的模型旧版本作为教师,利用On-Policy Distillation在通用指令集上训练,可以完美找回丢失的能力(Chat/IF-eval恢复),且不影响新学到的领域知识。✍️实验设置
基础模型与角色
学生模型:Qwen3-8B-Base 或 Qwen3-8B-Instruct教师模型:Qwen3-32B 或 Qwen3-235B (或经过RL训练后的专家模型)评测任务与数据集
计算与对比基线
🍑关键结果
数学推理能力 (AIME'24)
150 步 即可提升至 70%。减少了约 50-100倍(只需 7-10 倍更少的梯度步数)。扩展SFT数据集方案的 1/9 到 1/30。卓越的数据效率
极强抗过拟合:传统RL对同一Prompt训练多轮会变成简单记忆最终答案,而在单条Prompt上使用在线蒸馏连续训练 20 步(5120次评估),依然能稳定贴近教师模型的真实分布能力。个性化与持续学习完美融合
85% 暴跌至 45% 后。恢复至 83%,同时内部知识准确率稳定保持在 41%(原版Base模型仅为18%),实现了无损的知识与行为融合。⛳ 未来方向
机制深层理解
RL 是搜索,蒸馏是捷径:强化学习本质上是在高维语义策略空间中进行“搜索”,而梯度更新占比不大。一旦RL找到了优秀的策略,直接通过On-Policy Distillation学习这个“最终策略”,能省去大量搜索带来的算力开销。未来研究可能
混合奖励机制:结合蒸馏的Token级密集奖励和环境反馈的Sequence级奖励(如是否通过测试用例),以期达到更高的上限。解决持续学习难题:Off-Policy的SFT用模型自身数据训练会导致漂移,而On-Policy Distillation因为教师分布锚定,不会产生退化。未来这可能成为大模型Test-time Training(测试时训练)和 Continual Learning 的标准范式。