变化点
2026.08 · Qwen3.8
- 扩大至
2.4T 总参数 / 95B 激活,继续强化长程 Agent 与工具执行。 - 结合 effort 控制和历史思考保留,调整不同任务的推理开销。
2026.06 · Qwen-AgentWorld(环境模型)
- 用
10M+七域轨迹训练环境反馈预测,形成可控 Language World Model。 - CPT/SFT/RL 校准预测,可用于模拟环境,也可预热 Policy 的动作后果预测能力。
2026.04 · Qwen3.6-35B-A3B
- 训练中强化
Thinking Preservation,保留跨轮推理状态。 - 减少长任务重复分析,提高小激活模型的连续执行能力。
2026.04 · Qwen3.5-Omni
- Thinker–Talker 统一图文音视频,ARIA 自适应交错文本和语音,实现流式生成。
- Thinker 结合领域蒸馏、文本向音频 OPD 与交互 RL;Talker 结合 CPT、DPO 和 GSPO。
2026.03 · Qwen3-Coder-Next
- 基于 Qwen3-Next,构建
800K+可验证任务与执行环境,强化代码和 Agent 能力。 - MidTrain、SFT 后分别训练领域专家,再蒸馏到统一模型,适配多种工具格式。
2026.02 · Qwen3.5-397B-A17B
- 改用
Gated DeltaNet + 全局注意力,并引入原生多模态训练。 - 结合异步 RL 与路由重放,提高 Agent 训练效率和稳定性。
2025.07 · Qwen3-Coder
- 加强文件、仓库级代码预训练,形成
480B-A35B代码基座。 - 由 Code RL 扩展到可执行环境中的 Agent RL。
2025.05 报告 · Qwen3
- 统一 thinking / non-thinking,通过四阶段后训练融合推理与通用能力。
- 大模型训练后进行强到弱蒸馏,将能力迁移至小模型。
2024.12 报告 · Qwen2.5
- 扩大高质量预训练数据至
18T tokens,强化知识、代码与数学。 - 后训练结合复杂指令 SFT、离线 DPO 与在线 GRPO。
2024.09 · Qwen2.5-Coder
- 强化文件级、仓库级 CPT 与 FIM,学习跨文件代码关系。
- 执行验证筛选代码数据,再结合 SFT 与 DPO。
2024.07 报告 · Qwen2
- 扩大多语言预训练,结合 GQA、Dense/MoE 与长上下文训练。
- 采用离线和在线 DPO,增强指令遵循与偏好对齐。
(2608) Qwen3.8 (2.4T-A95B, 长程 Agent)
参考链接
架构与运行形态
- 面向研发、专业分析和长程 Agent,重点是完整执行任务和延续多轮推理。
2.4T-A95BMoE;92层按3×Gated DeltaNet + 1×Gated Attention组合。- 递归状态降低长历史开销,周期性 Attention 补充精确检索;每层
512个路由专家,激活10个。 - 开放权重为 text-only thinking 模型,原生
256K;Max 服务增加视觉、non-thinking、默认1M和工具。
两个控制项
reasoning_effort=xhigh / medium / low调整当前推理投入。preserve_thinking将前轮分析与消息一并保留,后轮沿用已排除原因和未完成计划。- 预算控制决定本轮思考深度,历史保留决定下一轮还能使用哪些推理信息。
训练与生成
- 预训练与后训练强化代码、专业任务和环境反馈处理;模型卡未展开完整 RL 配方。
- 权重建议
temperature=1, top_p=0.95, top_k=20,默认xhigh。
同系列对照
- 相对 Qwen3.7-Max:Terminal-Bench 2.1
74.5 → 86.6,SWE-bench Pro60.6 → 67.7。 - PaperBench
64.8 → 93.0,为复现任务的分项评分;NL2Repo47.2 → 55.9。 - Toolathlon Verified
49.7 → 72.5,Automation-Bench14.2 → 27.3。 - GPQA
92.4 → 92.6;相较知识问答,本轮改善主要体现在完整 Agent 工作流。
评测条件
- Terminal 使用 Claude Code,
avg@10, timeout=5h, max_tokens=131072。 - SWE-Pro 使用 Claude Code、
256K上下文和修正后的任务集。 - PaperBench 使用 BasicAgent Code-Dev、Opus 4.6 judge,
3次平均,每次最多12h。
(2606) Qwen-AgentWorld (七域环境模型)
核心内容
- 用
10M+七域轨迹训练环境反馈预测,形成可控 Language World Model。 - CPT/SFT/RL 校准预测,可用于模拟环境,也可预热 Policy 的动作后果预测能力。
详细笔记
(2604) Qwen3.6-35B-A3B (Thinking Preservation)
参考链接
架构与目标
- 面向定位、编辑、测试和错误恢复的多轮 Coding Agent。
35B-A3B多模态 MoE;40层、3:1Gated DeltaNet / Gated Attention,原生256K。- 每层
256个路由专家,激活8个并使用共享专家;采用多步 MTP。
历史推理适配
- 默认保留当前用户轮次内部的 thinking,较早用户轮次的 thinking 会被清除。
- Qwen3.6 额外训练模型读取历史推理;开启
preserve_thinking=True后沿用前轮分析。 - 例如保留已排查的调用关系,后轮继续验证修改,减少重复分析。
运行控制
enable_thinking控制当前是否思考;preserve_thinking控制是否保留历史思考。- 历史保留会增加输入长度,需要与工具输出共同管理;复杂任务建议至少
128K上下文。
代码与工具任务
- 相对 Qwen3.5-35B-A3B:SWE-bench Verified
70.0 → 73.4,Pro44.6 → 49.5。 - Terminal-Bench 2.0
40.5 → 51.5,NL2Repo20.5 → 29.4,收益扩展到终端和整项目执行。 - SWE 使用内部 bash/file-edit harness、
200K上下文;Terminal 使用 Terminus-2、3h超时、5次平均。
执行稳定性
- Claw-Eval Avg
65.4 → 68.7,Pass^351.0 → 50.0;平均效果提高,连续成功率仍有短板。 - MMLU-Pro
85.3 → 85.2,知识分数基本持平;这些是整体版本升级效果。
(2604) Qwen3.5-Omni (Thinker–Talker、ARIA、交互 RL)
🌺 论文摘要
参考链接
问题背景
- 音视频理解、语言推理与流式语音生成需要统一,同时维持长上下文与低延迟。
- 文本与语音 Token 速率不同,固定对齐容易漏词、错读;音频提问的回答质量也弱于文本提问。
核心方法
- 流式架构:Thinker–Talker 均采用 Hybrid Attention MoE;ARIA 自适应交错文本、语音 tokens。
- Omni 预训练:编码器对齐 → 全参数图文音视频联合训练 →
256K长上下文扩展。 - Thinker 后训练:领域专家 SFT/RL → 专家蒸馏 → 文本向音频 OPD → 多轮交互 RL。
- Talker 后训练:大规模语音训练 → 高质量 CPT → DPO + GSPO → 轻量说话人微调。
模型效果(Qwen3.5-Omni-Plus + 蒸馏/RL)
- VoiceBench
93.1,Gemini-3.1 Pro 为88.9;FLEURS Top60 ASR WER 为6.55。 - SEED-TTS:英文 WER 从 Qwen3-Omni 的
1.39降至1.26;中文为0.99。 - OmniGAIA:多模态工具使用
57.2;Gemini-3.1 Pro 为68.9。
重要结论
- 扩展音频交互后仍保留同级 Qwen3.5 的主要文本、视觉能力,但各任务收益不同;视频理解提升更明显。
- 单语说话人微调可迁移到多语言,模型无需为每种目标语言分别训练同一音色。
核心贡献
- 统一多模态理解、实时语音与工具动作;提出 ARIA,改善流式文字—语音对齐。
未来方向
- 以原生多模态训练为基础,发展能够实时理解、交互与行动的通用 Omni Agent。
问题背景
跨模态交互质量不一致
- 同一问题改成语音输入后,回答的流畅性、推理与任务完成质量下降。
- 长对话还会出现意外语言切换、人设变化和指令遗忘,需要直接优化多轮交互。
流式生成与长序列成本
- 文本、语音 Tokenizer 的编码速率不同,固定交错比例容易造成漏词、发音和数字朗读错误。
- 长音视频的 KV Cache 与稀疏时间位置影响效率和时间理解,限制实时服务并发。
核心方法
Thinker–Talker 与流式生成
Thinker:多模态输入与文本输出
- 图像、视频通过视觉编码器;音频通过 AuT,与文本组成统一输入序列。
- 生成文本、工具调用和高层表示,支持搜索、Function Call 与音视频指令 Coding。
- Thinker 与 Talker 均采用
Hybrid Attention MoE;Gated DeltaNet 减少长序列 KV 访问。
Talker:上下文相关的语音输出
- 接收历史文本、多模态表示与当前流式文本,决定语音内容、语调、音量和情绪。
- 自回归预测 RVQ 语音码;轻量 MTP 补全当前帧的残差 Codebooks。
- Code2Wav 使用因果 ConvNet,逐帧合成波形;无需等待完整句子或全部语音 tokens。
单流交错生成
- 原先的文本、语音双轨改成一个交错序列,减少两个生成轨道之间的同步开销。
- 对任意前缀,累计语音 / 文本 Token 比例不超过该样本的整体比例。
- 以样本自身比例适配不同语言,不依赖固定交错速率或 MFA 强制对齐。
- 支持先给定任意长度的文本前缀,再继续生成连贯语音。
流式输入与声音控制
- Chunked Prefill:音视频按时间分块处理,提前启动 Thinker 和 Talker。
- Talker System Prompt:用文字描述、参考语音 Codec 指定音色,支持 Zero-Shot Voice Cloning。
- 上下文与指令共同控制语速、音量、情绪;原生轮次意图识别支持语义打断。
多模态预训练与上下文扩展
AuT 编码器训练
- 从头训练音频 Encoder–Decoder,使用 Qwen3-ASR 生成的音频—文本配对数据。
- Mel 特征经
4层 Conv2D下采样16倍,输出频率6.25Hz,每帧约对应160ms音频。 - 动态 Attention Window 训练,兼顾实时 Prefill Cache 与离线音频理解。
音视频时间对齐
- 沿用 TM-RoPE,为音频、视频分配按实际时间对应的位置编号。
- 每个视频时间块加入秒级文本时间戳,音频随机间隔插入时间戳。
- 显式时间文本补充位置编码,改善长音视频中的时间定位与跨模态同步。
编码器对齐
- LLM 与视觉编码器初始化自 Qwen3.5,音频编码器初始化自 AuT。
- 冻结 LLM,图像—文本和音频—文本分别训练;先训练 Adapter,再训练对应编码器。
联合训练与长上下文
- General Stage:解冻全部参数,混合纯文本、图文、音文、视频、音视频及音视频文本。
- 从早期同时加入单模态与跨模态数据,使用多样自然语言指令覆盖不同理解任务。
- Long Context Stage:提高长音频、长视频比例,将序列长度从
32K扩展到256K。 - 统一输入支持长音频理解与带声音的视频,输出可包含场景分段、时间戳与人物—声音对应。
Thinker 领域蒸馏与交互 RL
Specialist Distillation
- 从预训练 Qwen3.5 Base 分别训练文本、视觉、音频等领域教师,各自执行 SFT 与 RL。
- 文本领域覆盖 Agent、Coding 与基础推理;教师生成领域数据,再蒸馏到统一 Thinker。
- 对话统一为 ChatML,混合纯文本、视觉、音频和跨模态交互轨迹。
文本条件回答监督音频条件回答
- 同一问题保留音频与文本两种输入,先由文本条件生成高质量回答。
- 将该回答作为相应音频输入的蒸馏目标,执行报告中的 On-Policy Distillation。
- 重点缩小语音提问在推理、流畅性和任务完成度上的差距,保持两种输入行为一致。
- 构建多轮交互轨迹,直接覆盖长期对话中的语言、人设与指令约束。
- 围绕 语言一致性、人设稳定性、长上下文指令遵循设计奖励。
- 在领域蒸馏与文本—音频迁移之后继续 RL,优化完整交互体验。
Talker 语音训练与偏好对齐
General Stage
- 大规模多语言语音与多模态上下文配对,不只训练文字到声音的映射。
- 加入指令控制语音生成任务,让韵律、情绪和表达方式适应当前对话。
Long-Context Stage
- 对数据做质量分层,使用高质量子集继续预训练,减少噪声语料引入的幻觉。
- 结合 Qwen3-Omni-Captioner 增强语料,扩展到
64K上下文。
人类偏好与规则反馈
- 人工标注多语言语音偏好对,用 DPO 优化自然度与表达质量。
- 结合规则奖励执行 GSPO,进一步提高任务能力与训练稳定性。
声音定制
- 最后执行轻量说话人微调,强化目标音色、自然度和可控表达。
- 与参考语音提示驱动的 Zero-Shot Voice Cloning 同时提供不同定制方式。
实验设置(Qwen3.5-Omni-Plus / Flash)
模型和数据
- 评测 Plus 与 Flash 两个 Instruct 版本;输入窗口均为
256K。 - 总体训练语料包含超过
1亿小时音视频;AuT 独立训练使用4000万小时音频—文本对。 - AuT 中文、英文、其他语言比例
3.5:3.5:3;Talker 初始训练超过2000万小时多语言语音。 - Omni General Stage 约
4T tokens;Thinker 长度32K→256K,Talker CPT 扩展至64K。
评测对象与条件
- 文本、视觉:对照 Qwen3.5-Plus-Instruct;音频、音视频:对照 Gemini-3.1 Pro。
- OmniGAIA:不加 Thinking Prompt 与 Answer 格式,用 DeepSeek-V3.2-Thinking 做 Judge。
- 语音生成:SEED-TTS、公开多语言 TTS、FLEURS 内部集与 CV3-Eval,测 WER / CER、Speaker Similarity。
- 流式延迟:内部 vLLM,MTP 与 Codec 使用 Torch Compile / CUDA Graph;分别测
1 / 4 / 8并发。
关键结果(Qwen3.5-Omni-Plus + 蒸馏/DPO/GSPO)
对照 Gemini-3.1 Pro
- VoiceBench:
88.9→93.1,语音对话表现更强;MMAU:81.1→82.2。 - FLEURS Top60:ASR WER
7.32→6.55;LibriSpeech clean / other 为1.11 / 2.23。 - DailyOmni:
82.7→84.6;Omni-Cloze:57.2→64.8,强化音视频理解与细节描述。 - OmniGAIA:
57.2,仍低于 Gemini-3.1 Pro 的68.9;工具使用还有差距。
- 对照 Qwen3.5-Plus-Instruct,IFEval 同为
89.7;MMMU-Pro 为73.8→73.9。 - 视频任务提高:MVBench
76.7→79.0,LVBench68.6→71.2。 - GPQA 为
85.9→83.9,LiveCodeBench v6 为67.1→65.6,整体能力接近原同级模型。 - 多模态能力扩展与文本、视觉能力保留可以兼顾,但各任务收益并不相同。
语音准确性和声音迁移
- 对照 Qwen3-Omni-30B-A3B,SEED-TTS 中文 WER
1.07→0.99,英文1.39→1.26。 - 多语言 TTS 对照中,
29种语言有22种取得最低 WER,同时保留较高说话人相似度。 - 跨语言 Voice Cloning 的
12个方向中有10个最优,覆盖不同原音色与目标语言组合。 - 仅用单语做说话人微调,目标声音仍能迁移到所测
29种语言。
首包与并发
- 单并发音频输入的理论首包延迟:Flash
235ms,Plus435ms。 - Plus 从
1并发扩到8并发,音频首包为435ms→955ms,Generation RTF 仍为0.334。 - 生成速度快于实际播放速度,为连续语音输出保留缓冲余量。
未来方向
- 继续扩大原生多模态训练,使模型在同一系统内完成感知、推理、实时交互与工具行动。
(2603) Qwen3-Coder-Next (可验证任务、专家蒸馏)
核心内容
- 基于 Qwen3-Next,构建
800K+可验证任务与执行环境,强化代码和 Agent 能力。 - MidTrain、SFT 后分别训练领域专家,再蒸馏到统一模型,适配多种工具格式。
详细笔记
(2602) Qwen3.5-397B-A17B (混合注意力, 原生多模态)
参考链接
原生多模态
- 预训练即融合文本与视觉 tokens,扩展 STEM、视频、多语言材料并加强数据过滤。
- 语言与方言覆盖
119 → 201,词表约250K;原生256K,可扩展约1M。
混合主干
397B-A17B;60层按3×Gated DeltaNet + 1×Gated Attention组合。- DeltaNet 控制长历史成本,全局 Attention 保留精确检索;多步 MTP 支持生成加速。
512个路由专家,激活10个并使用共享专家,降低 FFN 的每 token 计算量。
环境扩展
- 扩展文本、多模态、多轮任务及任务难度,覆盖更多 Agent 执行环境。
- 异步解耦 rollout 与参数训练,动态分配负载并支持细粒度故障恢复。
稳定性与效率
- Router Replay 复用采样时的专家路由;Multi-turn Rollout Locking 管理交互中的策略版本。
- 控制数据过期程度与任务采样平衡,减少异步等待和快慢任务造成的分布偏斜。
- 视觉编码器、语言主干采用异构并行;敏感计算保留 BF16,其他部分利用 FP8 加速。
- 官方报告 FP8 减少约一半激活显存,异步 RL 系统整体加速约
3–5×。
能力变化
- 对比 Qwen3-Max-Thinking:SWE-V
75.3 → 76.4,Terminal-Bench 2.022.5 → 52.5。 - LiveCodeBench v6
85.9 → 83.6,终端改善没有同步转为竞赛代码提升。 - 对比 Qwen3-VL-235B-A22B:MMMU-Pro
69.3 → 79.0,MathVision74.6 → 88.6。
上下文策略
- BrowseComp:simple context-folding
69.0,discard-all78.6;结果依赖历史如何清理与重建。 - 多数搜索评测采用
256K;WideSearch 不做上下文管理,得分74.0。
(2507) Qwen3-Coder (480B-A35B, Code RL + Agent RL)
参考链接
训练基础
- 仓库任务需要代码知识、长上下文和执行反馈,单轮竞赛代码难以覆盖完整开发流程。
7.5T tokens,代码占70%;用 Qwen2.5-Coder 清洗、重写噪声数据。480B-A35BMoE,原生256K,通过 YaRN 扩展至1M,包含仓库和 PR 材料。
执行反馈
- Code RL 从竞赛题扩展到编辑、SQL、软件开发、多语言和数据分析。
- 自动扩展测试用例,通过代码执行结果提供奖励,利用“求解难、验证容易”的任务。
多轮训练
- Agent RL 连续进行规划、工具调用、读取反馈和修改,学习根据失败测试调整方案。
- 云端系统支持最多
20K个独立环境,为长轨迹持续提供交互和验证。
- Qwen Code 基于 Gemini CLI 改造,适配提示词、工具和 function-call 协议,也支持 Cline。
- 模型生成调用 → parser 解析 → harness 执行 → 结果回传,形成连续开发流程。
- Instruct 权重为 non-thinking 模式;建议
temperature=0.7, top_p=0.8, top_k=20。
交互预算
- SWE-bench Verified + OpenHands:最多
100轮得67.0,500轮得69.6。 - 同框架 Sonnet 4 分别为
68.0 / 70.4;增加执行轮数能带来额外解决率。
任务覆盖
- Terminal-Bench
37.5,SWE Multilingual54.7,Aider-Polyglot61.8。 - SWE-bench Live
26.3,比 Verified 更困难,仓库修复能力仍受任务分布影响。 - Code RL 曲线中编辑、SQL、开发等任务均有改善,说明执行反馈训练可以覆盖更多真实代码工作。
(2505) Qwen3 (四阶段后训练、强到弱蒸馏)
🌺 论文摘要
参考链接
问题背景
- 复杂推理需要更多计算,简单任务需要快速回答;各尺寸分别做完整 RL 成本高。
核心方法
- 预训练:
36T tokens,通识 → 推理数据增强 → 长上下文。 - 旗舰后训练:Long-CoT SFT → Reasoning RL → 模式融合 SFT → General RL。
- 小模型蒸馏:Off-policy 示范 → On-policy Logits 对齐。
模型效果
- 235B-A22B Thinking:AIME’25
81.5、LiveCodeBench v570.7、BFCL v370.8。
重要结论
- 统一快慢模式可控制推理预算;强教师蒸馏能以较低训练成本提升小模型。
核心贡献
- 将推理控制、通用任务 RL 与强到弱蒸馏整合为全系列训练路线。
未来方向
- 继续提高预训练数据质量和多样性,优化模型压缩与超长上下文。
- 扩大基于环境反馈的 Agent RL,并研究更高推理预算下的性能扩展。
问题背景
- 推理、普通对话和 Agent 任务需要不同的响应方式;小模型直接进行大规模 RL 成本较高。
核心方法
架构与预训练
基础结构
- GQA、SwiGLU、RoPE 和 RMSNorm;移除 QKV Bias,加入 QK-Norm 稳定训练。
MoE
- 旗舰
235B-A22B;每层128个专家,每个 Token 选择8个,无共享专家。 - 使用 Global-batch Load Balancing Loss,在整个 Batch 上平衡负载,保留专家分工。
语料扩展
- Qwen2.5-VL 识别 PDF 文字,再由 Qwen2.5 修订,增加高质量文档数据。
- Qwen2.5 / Math / Coder 合成教材、QA、指令和代码,扩大 STEM 与推理覆盖。
- 多语言数据扩展到
119种语言及方言,总计约36T tokens。
样本级配比
- 对超过
30T tokens标注教育价值、领域和安全等属性。 - 小型 Proxy Model 做配比消融,根据细粒度标签调整样本,而非只按数据源混合。
- S1:超过
30T tokens,长度4K,训练语言和通识能力。 - S2:约
5T tokens,增加 STEM、代码与合成推理数据,加快学习率衰减。 - 长上下文:数千亿 Tokens,长度
32K;长文本16–32K占75%。 - RoPE Base 提高至
1M,推理时配合 YaRN / DCA 扩展至128K。
四阶段后训练
问题筛选
- Qwen2.5-72B-Instruct 去除难以验证的问题,以及无需 CoT 即可答对的简单题。
- 按领域平衡数学、代码、逻辑与 STEM,预留独立验证题。
回答筛选
- QwQ-32B 生成多个候选,保留正确且推理一致的回答。
- 过滤重复、猜测、推理与答案矛盾、语言混杂及与验证题相似的样本。
- 少量样本、较少训练步数建立推理格式,保留后续 RL 的探索空间。
- 选择与冷启动不重合、模型仍可学会且尽量困难的问题,共
3995个 Query–Verifier 对。 - 采用 GRPO、大 Batch、多 Rollout,并利用 Off-policy 训练提高样本效率。
- 控制策略熵稳定或缓慢上升,避免过早失去探索多样性。
混合 SFT 数据
- Thinking:RL 模型在冷启动题目上做 Rejection Sampling,保持已有推理能力。
- Non-thinking:覆盖写作、代码、问答、多语言等,用自动 Checklist 筛选回答。
模式控制
/think与/no_think共用模板;直接回答保留空的<think>区域。- 多轮对话遵循最后一个模式标记,可在同一会话里切换。
Thinking Budget
- 达到预算后插入结束思考指令,让模型基于已有推理生成最终答案。
- 预算适应能力来自模式融合,报告没有单独训练每档预算。
奖励类型
- 规则奖励:判断答案、格式与可验证约束。
- 带参考答案的模型奖励:Qwen2.5-72B-Instruct 对照参考答案评分。
- 无参考答案的偏好奖励:人类偏好训练的 RM,评价开放任务的帮助性与风格。
任务覆盖
- 覆盖
20+类任务,包括指令遵循、格式、偏好、RAG 和 Agent。 - Agent Rollout 执行完整多轮工具交互,从真实环境反馈中学习。
强到弱蒸馏
Off-policy
- 用 Qwen3-32B / 235B-A22B 的两种模式示范,训练小模型的基础能力与模式切换。
On-policy
- 学生自行生成回答,教师在学生生成的上下文上给出 Logits。
- 最小化学生与教师分布的 KL,使监督覆盖学生实际访问的状态。
实验设置(Qwen3)
模型与训练
- Dense
0.6B–32B,MoE30B-A3B / 235B-A22B。 - 32B 与 235B-A22B 走四阶段后训练;其余小模型走强到弱蒸馏。
- 旗舰 Reasoning RL:
3995个 Query–Verifier 对,示例训练170步。
评测与对照
- AIME 每题采样
64次,主分数取平均准确率;另报 Pass@64。 - Thinking Budget 对照覆盖数学、代码与 STEM。
- 蒸馏消融:同一个 Off-policy 8B Checkpoint,分别继续直接 RL 或 On-policy 蒸馏。
关键结果(Qwen3)
推理与 Agent
- 旗舰 Reasoning RL 的 AIME’24 从
70.1 → 85.1,难题选择与稳定探索持续提高推理能力。 - 最终 Thinking 模型:AIME’25
81.5、LCB v570.7、BFCL v370.8,兼顾推理和工具调用。
小模型训练效率
- 8B 的 AIME’25:继续 RL 为
55.5,On-policy 蒸馏为65.5;LCB 为52.9 / 60.3。 - 对应训练约
17,920 / 1,800 GPU hours,该对照中蒸馏成本约为直接 RL 的十分之一。 - AIME’25 Pass@64 从
83.3 → 86.7,教师监督也扩展了学生能够解决的问题范围。
能力与预算
- 增大 Thinking Budget 时,数学、代码和 STEM 表现平滑提升。
- General RL 改善指令与通用行为,仍需同时跟踪专项推理能力的变化。
未来方向
原文未来方向
- 继续提高预训练数据质量和多样性,优化模型压缩与超长上下文。
- 扩大基于环境反馈的 Agent RL,并研究更高推理预算下的性能扩展。
(2412) Qwen2.5 (18T、DPO → GRPO)
🌺 论文摘要
参考链接
问题背景
- 通用模型需要改善数学代码、长回答、结构化理解和复杂指令遵循。
核心方法
- 预训练:
18T tokens,模型筛选、领域合成与数据配比优化。 - SFT:超过
1M样本,重点补充可验证约束、长回答、代码与结构化任务。 - 后续对齐:Offline DPO → Online GRPO,执行核验与 RM 分工。
模型效果
- 72B-Instruct:MATH
83.1、HumanEval86.6、Arena-Hard81.2。
重要结论
- 高质量数据与多阶段对齐共同提升能力;RM 榜单得分不一定预测实际 RL 收益。
核心贡献
- 形成从大规模数据构建到分阶段偏好优化的通用模型训练路线。
未来方向
- 持续优化高质量与多样化数据,并把文本、视觉和音频纳入统一多模态框架。
- 扩大推理时计算,提高复杂推理能力。
- 改进 RM 评估,使其更能预测实际 RL 训练收益。
问题背景
- 需要提升知识、代码、数学和复杂指令的共同表现,并改善长回答与长上下文能力。
核心方法
预训练与长上下文
质量筛选与领域配比
- Qwen2-Instruct 从多个维度评估语料质量,覆盖更多语言。
- 下采样重复的电商、社交、娱乐内容,上采样科技、科学和学术内容。
- 把 Qwen2.5-Math / Coder 的领域数据加入通用预训练。
合成数据
- Qwen2-72B-Instruct 与 Math 模型生成数学、代码和知识数据。
- 通用 RM 与数学 RM 筛选合成内容,再与真实语料混合。
超参数选择
- 小规模 Dense / MoE 实验拟合模型量、数据量与最优学习率、Batch Size 的关系。
- 按预测结果配置不同尺寸模型,兼顾总参数与激活参数。
普通分支
- 训练长度从
4K → 32K,RoPE Base 提高至1M。 - 推理时用 YaRN / DCA 扩展上下文;7B 及以上开放模型支持
128K。
Turbo 分支
- 训练长度按
32K → 64K → 128K → 256K扩展,每阶段混合最长序列40%与短序列60%。 - 先做短指令 SFT,再混合长短指令;RL 仍用短指令,推理窗口扩展至
1M。
SFT 数据构建
长回答
- 从预训练长文反向构造问题,加入输出长度约束,再筛选问题与答案的一致性。
数学与代码
- 数学用已验证答案、RM 和 Rejection Sampling 筛选 CoT。
- 代码使用语言专属 Agent 协作生成指令,覆盖约
40种编程语言。 - 对代码做静态检查,并在多语言 Sandbox 中执行单测。
可验证约束
- 模型同时生成指令、验证函数及交叉检查的单测,用执行结果筛选答案。
- 例如要求特定字段或长度时,用验证代码判断回答是否满足要求。
数据覆盖
- 表格问答、事实核查和结构理解加入推理过程;逻辑推理新增约
70K问题。 - 高资源语言指令翻译到低资源语言,并检查回答的语义一致性。
- 加入数百种 System Prompt;Critic 与多 Agent 打分共同筛选回答。
离线与在线偏好优化
- SFT 模型在新问题上重新采样,覆盖数学、代码、逻辑和指令约束。
- 答案匹配或执行通过作为正例,失败作为负例,再做人工与自动检查。
- 固定偏好对执行 DPO,Online Merging Optimizer 缓解对齐后的能力损失。
Reward Model
- 同一问题由不同训练阶段的 SFT / DPO / RL Checkpoint 生成候选,并使用不同温度。
- 人工与自动偏好标注共同训练 RM,覆盖真实性、帮助性、简洁性等维度。
GRPO
- 每题采样
8个回答,用 RM 评分进行组内相对优化。 - 优先训练候选得分方差较大的问题,使同组回答提供更有效的区分信号。
实验设置(Qwen2.5)
模型与预训练
- 开放 Dense
0.5B–72B;Turbo / Plus 使用 MoE。 - 超参数实验覆盖 Dense
44M–14B、MoE 激活参数44M–1B,训练数据0.8B–600B。
SFT 与 DPO
- SFT:
1M+样本、2 epochs、长度32K;学习率7e-6 → 7e-7。 - Weight Decay
0.1,Gradient Clip1.0。 - DPO:约
150K偏好对、1 epoch,学习率7e-7。
Online RL 与评测
- GRPO:每题
8个回答,Global Batch Size2048,每 Episode2048个问答样本。 - 分别评估 Base、Instruct、长上下文与 RM;RM 另测 RewardBench、RMB、PPE 和中文偏好。
关键结果(Qwen2.5)
推理与对齐
- 72B-Instruct 的 MATH 达
83.1,高于 Qwen2-72B 的69.0;HumanEval 达86.6。 - Arena-Hard 达
81.2,多阶段后训练明显改善开放任务的回答质量。
长上下文
- Turbo 分支扩展到
1M窗口;长文本训练与长指令 SFT 共同支持长文检索和理解。
RM 选择
- 不同 RM 在 RewardBench、RMB 和 PPE 上的排名不同,单一榜单无法全面衡量反馈质量。
- 报告发现 RM 测试分数更高时,训练出的策略未必更好;需结合下游 RL 结果选择 RM。

未来方向
原文未来方向
- 持续优化高质量与多样化数据,并把文本、视觉和音频纳入统一多模态框架。
- 扩大推理时计算,提高复杂推理能力。
- 改进 RM 评估,使其更能预测实际 RL 训练收益。
(2409) Qwen2.5-Coder (文件与仓库 CPT、SFT+DPO)
🌺 论文摘要
参考链接
问题背景
- Code 模型需缩小与闭源模型的差距,同时保持数学、自然语言与多语言代码能力。
核心方法
- CPT:文件级
5.2T+ 仓库级300B,联合 NTP / FIM。 - 数据构建:网页分层筛选、多语言 Agent 合成、Checklist 与执行验证。
- 后训练:Coarse-to-fine SFT,混入 FIM,再做 Offline DPO。
模型效果
- 32B-Instruct:HumanEval
92.7、BigCodeBench Instruct49.6、Aider Pass@160.9。
重要结论
- 高质量文字—代码关联数据有效;混合通用文本与数学数据可保持更全面的能力。
核心贡献
- 提供从代码语料、仓库上下文到执行反馈偏好的完整 Code 模型训练路线。
未来方向
- 继续扩展代码数据与模型规模,并提高代码推理能力。
- 研究更有效的 Code / Text / Math 配比,解释跨领域数据带来的迁移收益。
问题背景
- Code 模型需要同时理解文件和仓库结构,指令数据还要覆盖大量低资源编程语言。
核心方法
Code 数据与继续预训练
源码
- 收集
2024-02前 GitHub 仓库,覆盖92种编程语言,按规则清洗。 - 同时收集 PR、Commit、Notebook 和 Kaggle,扩充代码上下文。
Text-Code Grounding
- 从 Common Crawl 提取文档、教程和博客,保留文字与代码的对应关系。
- 用 fastText 等小模型做
4层由粗到细的筛选,每层分别控制相关性与质量。 - 保留各层质量分,供后续数据混合使用。
合成与混合
- CodeQwen1.5 合成代码,经 Executor 验证后保留可执行样本。
- 加入 Qwen2.5 的通用文本和 Math 数据;通用文本先移除代码,减少来源重叠。
File-level
- 从 Qwen2.5 开始继续预训练,
5.2T tokens、长度8K。 - 联合 Next-token Prediction 与 FIM,输入缺口前后文,预测中间代码。
Repo-level
- 继续训练约
300B tokens,长度扩至32K,RoPE Base 提至1M。 - 用 Repo Name、File Separator 与文件路径组织上下文,把 FIM 扩展到多文件代码。
- 推理时通过 YaRN 外推至
128K。
多语言指令数据
指令来源
- 从 GitHub 代码片段反向生成问题,再由 Code LLM 生成回答、评分筛选。
- 混合开源多语言指令;CodeBERT 识别编程语言,控制各语言及无代码样本比例。
多 Agent 协作
- 每种语言由专属 Agent 生成指令和解法,再通过跨语言讨论共享问题模式。
- Memory 记录生成历史,减少重复;根据各语言的知识缺口补充新问题。
质量打分
- 检查问答一致性、难度、代码正确性、规范、可读性和教学价值,按权重汇总。
代码验证
- 解析 AST,过滤语法错误。
- 对可独立运行的算法题自动生成单测,检查正常输入和边界情况。
- Sandbox 负责隔离执行、超时控制和结果比较,保留通过验证的数据。
SFT 与偏好优化
Coarse-to-fine
- 第一阶段使用数千万条多样化合成指令,扩大任务覆盖。
- 第二阶段使用数百万高质量样本;同题生成多个候选,评分后选优做 SFT。
Mixed Tuning
- 主要使用普通 SFT 样本,混入少量 FIM 指令,保持补全与长上下文能力。
- Tree-sitter 解析 AST,抽取表达式、语句或函数等逻辑块作为待补全内容。
- 算法题、独立代码:用多语言 Sandbox 的测试通过情况构造偏好。
- 复杂代码:LLM-as-a-Judge 比较候选质量。
- 代码偏好与通用偏好数据混合,执行 Offline DPO。
实验设置(Qwen2.5-Coder)
模型与预训练
- Qwen2.5 基座,
0.5B / 1.5B / 3B / 7B / 14B / 32B六档。 - 总 CPT 约
5.5T tokens;文件阶段 Code / Text / Math 为70 / 20 / 10。
数据消融
- 1.5B 比较解释性网页逐层过滤;7B 比较纯 Code 与不同混合配比。
- Base 评估生成、FIM、仓库补全、推理和长上下文;Instruct 另评编辑、SQL 与表格任务。
后训练
- 大规模多样 SFT → 高质量 Rejection Sampling SFT → Offline DPO。
- 代码执行验证适用于可独立运行的片段;其余代码使用模型评审。
关键结果(Qwen2.5-Coder)
生成与编辑
- 32B-Instruct 的 HumanEval
92.7、BigCodeBench Instruct49.6,提升覆盖标准题和更复杂依赖代码。 - Aider Pass@1
60.9,说明收益也覆盖根据要求修改现有代码。
数据质量
- 1.5B 的 HumanEval / MBPP 平均分在网页分层筛选后从
41.6 → 46.8。 - 文字解释与代码关联数据提供了纯源码之外的监督,筛选比直接扩大网页量更有效。
混合配比
- 加入 Text / Math 明显改善通用与数学任务,同时保持代码能力。
- 代码比例不是越高越好,配比应结合代码表现与通用能力共同选择。
未来方向
原文未来方向
- 继续扩展代码数据与模型规模,并提高代码推理能力。
- 研究更有效的 Code / Text / Math 配比,解释跨领域数据带来的迁移收益。
(2407) Qwen2 (7T、离线与在线 DPO)
🌺 论文摘要
参考链接
问题背景
- 通用模型需要同时增强代码、数学、多语言和长上下文,并降低高质量对齐数据的标注成本。
核心方法
- 架构:GQA Dense,细粒度 MoE 由 7B Upcycling。
- 数据:高质量
7T语料;指令标签、难度演化与按任务自动验证。 - 后训练:SFT → Offline DPO → 当前策略采样的 Online DPO。
模型效果
- 72B-Instruct:HumanEval
86.0、MATH69.0、Arena-Hard48.1。
重要结论
- 扩大数据要保持质量;自动执行与答案核验可同时产生示范和偏好数据。
核心贡献
- 建立可扩展的数据对齐流程,并将 Dense / MoE 与长上下文纳入同一模型系列。
未来方向
- 提高小模型后训练数据的质量,尤其是复杂指令和约束遵循。
- 继续优化数据过滤与领域配比,提高扩充数据时的有效信息密度。
问题背景
- 扩大多语言与代码能力后,仍需提升指令遵循和用户偏好对齐,并兼顾模型推理效率。
核心方法
架构与预训练
Dense
- GQA 减少 KV Cache;SwiGLU、RoPE、RMSNorm 与 Pre-norm 保持训练稳定。
MoE
- 57B-A14B 从 Qwen2-7B Upcycling,使用细粒度路由专家和共享专家。
- 每层
64个路由专家,选择8个,另有8个共享专家。 - 复制 Dense FFN,沿中间维度打乱并切分为小专家,再随机重初始化一半参数。
- 不同专家保留基座知识,同时增加初始化差异,减少所有专家学习相同功能。
数据质量
- 规则与 Qwen 模型联合过滤,扩充代码、数学和约
30种语言的数据。 - 小模型实验优化来源与领域配比,加入高质量指令数据增强 ICL。
长上下文
- 预训练末期从
4K → 32K,增加长文,RoPE Base 从10K → 1M。 - DCA 处理块内与块间相对位置,配合 YaRN 做长度外推。
指令数据与偏好训练
指令选择
- InsTag 提取细粒度标签,人工修订后按多样性、复杂度和意图完整性选题。
- Qwen 给已有指令增加约束,扩展难度层次。
人工偏好
- 不同尺寸模型与采样策略生成多个回答,人工排序。
- 最佳回答用于 SFT,正负回答对用于后续 DPO。
数学与代码
- 数学:多条推理路径采样,保留答案正确且过程合理的路径,正误配对形成偏好。
- 代码:生成解法与测试,编译执行后同时得到示范与偏好数据。
指令、写作与角色
- 约束指令:生成 Python 验证函数,检查长度、格式等条件。
- 写作:从高质量作品反向生成不同细度的指令。
- 角色:基于人物资料生成问答,保持角色信息一致。
Constitutional Feedback
- 根据预设原则生成遵循与违反原则的回答,为安全任务提供正负反馈。
SFT
- 混合指令、代码、数学、逻辑、角色、多语言和安全任务,学习完整回答。
Offline DPO
- 固定人工与合成偏好对,提高正例相对负例的生成概率。
Online DPO
- 当前策略对问题生成多个回答,由 RM 选择最好和最差的候选。
- 每个 Episode 重新构造偏好对,继续做 DPO;使用 Online Merging Optimizer 缓解对齐损失。
实验设置(Qwen2)
模型与数据
- Dense
0.5B / 1.5B / 7B / 72B,MoE57B-A14B。 - 多数 Dense 训练
7T tokens,0.5B 使用12T;MoE Upcycling 后追加4.5T。
SFT
- 超过
500K样本、2 epochs、长度32K。 - 学习率
7e-6 → 7e-7,Weight Decay0.1,Gradient Clip1.0。
评测与对照
- 分别测 Base 和 Instruct,覆盖代码、数学、通用、多语言、指令与长上下文。
- 以 Qwen1.5、同量级 Dense / MoE 为对照;数据实验比较高质量
7T与放宽筛选后的12T。
关键结果(Qwen2)
代码与数学
- 72B-Instruct 相对 Qwen1.5-72B:HumanEval
71.3 → 86.0,MATH42.5 → 69.0。 - 多语言代码 MultiPL-E 从
48.1 → 69.2,收益覆盖 Python 之外的语言。
对齐与数据
- Arena-Hard 从
36.1 → 48.1,说明后训练也改善开放任务的偏好表现。 - 放宽质量门槛得到
12T后未出现明显收益,大模型选择使用更高质量的7T。
小模型短板
- 7B 代码能力有竞争力,但复杂指令遵循仍落后于 Llama-3-8B。
- 领域分数提升不能代替指令评估,需专门补充高质量约束任务。
未来方向
原文讨论的方向
- 提高小模型后训练数据的质量,尤其是复杂指令和约束遵循。
- 继续优化数据过滤与领域配比,提高扩充数据时的有效信息密度。