Skip to content

Qwen 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 10270 字
⏳ 31 分钟

变化点 ​

2026

2026.08 · Qwen3.8

  • 扩大至 2.4T 总参数 / 95B 激活,继续强化长程 Agent 与工具执行。
  • 结合 effort 控制和历史思考保留,调整不同任务的推理开销。

2026.06 · Qwen-AgentWorld(环境模型)

  • 用 10M+ 七域轨迹训练环境反馈预测,形成可控 Language World Model。
  • CPT/SFT/RL 校准预测,可用于模拟环境,也可预热 Policy 的动作后果预测能力。

2026.04 · Qwen3.6-35B-A3B

  • 训练中强化 Thinking Preservation,保留跨轮推理状态。
  • 减少长任务重复分析,提高小激活模型的连续执行能力。
2026(续)

2026.04 · Qwen3.5-Omni

  • Thinker–Talker 统一图文音视频,ARIA 自适应交错文本和语音,实现流式生成。
  • Thinker 结合领域蒸馏、文本向音频 OPD 与交互 RL;Talker 结合 CPT、DPO 和 GSPO。

2026.03 · Qwen3-Coder-Next

  • 基于 Qwen3-Next,构建 800K+ 可验证任务与执行环境,强化代码和 Agent 能力。
  • MidTrain、SFT 后分别训练领域专家,再蒸馏到统一模型,适配多种工具格式。

2026.02 · Qwen3.5-397B-A17B

  • 改用 Gated DeltaNet + 全局注意力,并引入原生多模态训练。
  • 结合异步 RL 与路由重放,提高 Agent 训练效率和稳定性。
2025

2025.07 · Qwen3-Coder

  • 加强文件、仓库级代码预训练,形成 480B-A35B 代码基座。
  • 由 Code RL 扩展到可执行环境中的 Agent RL。

2025.05 报告 · Qwen3

  • 统一 thinking / non-thinking,通过四阶段后训练融合推理与通用能力。
  • 大模型训练后进行强到弱蒸馏,将能力迁移至小模型。
2024 及以前

2024.12 报告 · Qwen2.5

  • 扩大高质量预训练数据至 18T tokens,强化知识、代码与数学。
  • 后训练结合复杂指令 SFT、离线 DPO 与在线 GRPO。

2024.09 · Qwen2.5-Coder

  • 强化文件级、仓库级 CPT 与 FIM,学习跨文件代码关系。
  • 执行验证筛选代码数据,再结合 SFT 与 DPO。

2024.07 报告 · Qwen2

  • 扩大多语言预训练,结合 GQA、Dense/MoE 与长上下文训练。
  • 采用离线和在线 DPO,增强指令遵循与偏好对齐。

(2608) Qwen3.8 (2.4T-A95B, 长程 Agent) ​

Qwen3.8 概况

参考链接

架构与运行形态

  • 面向研发、专业分析和长程 Agent,重点是完整执行任务和延续多轮推理。
  • 2.4T-A95B MoE;92 层按 3×Gated DeltaNet + 1×Gated Attention 组合。
  • 递归状态降低长历史开销,周期性 Attention 补充精确检索;每层 512 个路由专家,激活 10 个。
  • 开放权重为 text-only thinking 模型,原生 256K;Max 服务增加视觉、non-thinking、默认 1M 和工具。
推理预算与历史保留

两个控制项

  • reasoning_effort=xhigh / medium / low 调整当前推理投入。
  • preserve_thinking 将前轮分析与消息一并保留,后轮沿用已排除原因和未完成计划。
  • 预算控制决定本轮思考深度,历史保留决定下一轮还能使用哪些推理信息。

训练与生成

  • 预训练与后训练强化代码、专业任务和环境反馈处理;模型卡未展开完整 RL 配方。
  • 权重建议 temperature=1, top_p=0.95, top_k=20,默认 xhigh。
Qwen3.8-Max 公开表现

同系列对照

  • 相对 Qwen3.7-Max:Terminal-Bench 2.1 74.5 → 86.6,SWE-bench Pro 60.6 → 67.7。
  • PaperBench 64.8 → 93.0,为复现任务的分项评分;NL2Repo 47.2 → 55.9。
  • Toolathlon Verified 49.7 → 72.5,Automation-Bench 14.2 → 27.3。
  • GPQA 92.4 → 92.6;相较知识问答,本轮改善主要体现在完整 Agent 工作流。

评测条件

  • Terminal 使用 Claude Code,avg@10, timeout=5h, max_tokens=131072。
  • SWE-Pro 使用 Claude Code、256K 上下文和修正后的任务集。
  • PaperBench 使用 BasicAgent Code-Dev、Opus 4.6 judge,3 次平均,每次最多 12h。

(2606) Qwen-AgentWorld (七域环境模型) ​

Qwen-AgentWorld(环境模型)

核心内容

  • 用 10M+ 七域轨迹训练环境反馈预测,形成可控 Language World Model。
  • CPT/SFT/RL 校准预测,可用于模拟环境,也可预热 Policy 的动作后果预测能力。

详细笔记

(2604) Qwen3.6-35B-A3B (Thinking Preservation) ​

Qwen3.6-35B-A3B

参考链接

架构与目标

  • 面向定位、编辑、测试和错误恢复的多轮 Coding Agent。
  • 35B-A3B 多模态 MoE;40 层、3:1 Gated DeltaNet / Gated Attention,原生 256K。
  • 每层 256 个路由专家,激活 8 个并使用共享专家;采用多步 MTP。
Thinking Preservation

历史推理适配

  • 默认保留当前用户轮次内部的 thinking,较早用户轮次的 thinking 会被清除。
  • Qwen3.6 额外训练模型读取历史推理;开启 preserve_thinking=True 后沿用前轮分析。
  • 例如保留已排查的调用关系,后轮继续验证修改,减少重复分析。

运行控制

  • enable_thinking 控制当前是否思考;preserve_thinking 控制是否保留历史思考。
  • 历史保留会增加输入长度,需要与工具输出共同管理;复杂任务建议至少 128K 上下文。
同规模版本升级结果

代码与工具任务

  • 相对 Qwen3.5-35B-A3B:SWE-bench Verified 70.0 → 73.4,Pro 44.6 → 49.5。
  • Terminal-Bench 2.0 40.5 → 51.5,NL2Repo 20.5 → 29.4,收益扩展到终端和整项目执行。
  • SWE 使用内部 bash/file-edit harness、200K 上下文;Terminal 使用 Terminus-2、3h 超时、5 次平均。

执行稳定性

  • Claw-Eval Avg 65.4 → 68.7,Pass^3 51.0 → 50.0;平均效果提高,连续成功率仍有短板。
  • MMLU-Pro 85.3 → 85.2,知识分数基本持平;这些是整体版本升级效果。

(2604) Qwen3.5-Omni (Thinker–Talker、ARIA、交互 RL) ​

🌺 论文摘要

Qwen3.5-Omni 论文摘要

参考链接

问题背景

  • 音视频理解、语言推理与流式语音生成需要统一,同时维持长上下文与低延迟。
  • 文本与语音 Token 速率不同,固定对齐容易漏词、错读;音频提问的回答质量也弱于文本提问。

核心方法

  • 流式架构:Thinker–Talker 均采用 Hybrid Attention MoE;ARIA 自适应交错文本、语音 tokens。
  • Omni 预训练:编码器对齐 → 全参数图文音视频联合训练 → 256K 长上下文扩展。
  • Thinker 后训练:领域专家 SFT/RL → 专家蒸馏 → 文本向音频 OPD → 多轮交互 RL。
  • Talker 后训练:大规模语音训练 → 高质量 CPT → DPO + GSPO → 轻量说话人微调。

模型效果(Qwen3.5-Omni-Plus + 蒸馏/RL)

  • VoiceBench 93.1,Gemini-3.1 Pro 为 88.9;FLEURS Top60 ASR WER 为 6.55。
  • SEED-TTS:英文 WER 从 Qwen3-Omni 的 1.39 降至 1.26;中文为 0.99。
  • OmniGAIA:多模态工具使用 57.2;Gemini-3.1 Pro 为 68.9。

重要结论

  • 扩展音频交互后仍保留同级 Qwen3.5 的主要文本、视觉能力,但各任务收益不同;视频理解提升更明显。
  • 单语说话人微调可迁移到多语言,模型无需为每种目标语言分别训练同一音色。

核心贡献

  • 统一多模态理解、实时语音与工具动作;提出 ARIA,改善流式文字—语音对齐。

未来方向

  • 以原生多模态训练为基础,发展能够实时理解、交互与行动的通用 Omni Agent。

问题背景 ​

多模态理解与实时语音的衔接

跨模态交互质量不一致

  • 同一问题改成语音输入后,回答的流畅性、推理与任务完成质量下降。
  • 长对话还会出现意外语言切换、人设变化和指令遗忘,需要直接优化多轮交互。

流式生成与长序列成本

  • 文本、语音 Tokenizer 的编码速率不同,固定交错比例容易造成漏词、发音和数字朗读错误。
  • 长音视频的 KV Cache 与稀疏时间位置影响效率和时间理解,限制实时服务并发。

核心方法 ​

Thinker–Talker 与流式生成 ​

理解与语音生成分工

Thinker:多模态输入与文本输出

  • 图像、视频通过视觉编码器;音频通过 AuT,与文本组成统一输入序列。
  • 生成文本、工具调用和高层表示,支持搜索、Function Call 与音视频指令 Coding。
  • Thinker 与 Talker 均采用 Hybrid Attention MoE;Gated DeltaNet 减少长序列 KV 访问。

Talker:上下文相关的语音输出

  • 接收历史文本、多模态表示与当前流式文本,决定语音内容、语调、音量和情绪。
  • 自回归预测 RVQ 语音码;轻量 MTP 补全当前帧的残差 Codebooks。
  • Code2Wav 使用因果 ConvNet,逐帧合成波形;无需等待完整句子或全部语音 tokens。
ARIA 自适应文字—语音对齐

单流交错生成

  • 原先的文本、语音双轨改成一个交错序列,减少两个生成轨道之间的同步开销。
  • 对任意前缀,累计语音 / 文本 Token 比例不超过该样本的整体比例。
  • 以样本自身比例适配不同语言,不依赖固定交错速率或 MFA 强制对齐。
  • 支持先给定任意长度的文本前缀,再继续生成连贯语音。

流式输入与声音控制

  • Chunked Prefill:音视频按时间分块处理,提前启动 Thinker 和 Talker。
  • Talker System Prompt:用文字描述、参考语音 Codec 指定音色,支持 Zero-Shot Voice Cloning。
  • 上下文与指令共同控制语速、音量、情绪;原生轮次意图识别支持语义打断。

多模态预训练与上下文扩展 ​

AuT 音频编码与时间同步

AuT 编码器训练

  • 从头训练音频 Encoder–Decoder,使用 Qwen3-ASR 生成的音频—文本配对数据。
  • Mel 特征经 4层 Conv2D 下采样 16倍,输出频率 6.25Hz,每帧约对应 160ms 音频。
  • 动态 Attention Window 训练,兼顾实时 Prefill Cache 与离线音频理解。

音视频时间对齐

  • 沿用 TM-RoPE,为音频、视频分配按实际时间对应的位置编号。
  • 每个视频时间块加入秒级文本时间戳,音频随机间隔插入时间戳。
  • 显式时间文本补充位置编码,改善长音视频中的时间定位与跨模态同步。
三阶段 Omni 预训练

编码器对齐

  • LLM 与视觉编码器初始化自 Qwen3.5,音频编码器初始化自 AuT。
  • 冻结 LLM,图像—文本和音频—文本分别训练;先训练 Adapter,再训练对应编码器。

联合训练与长上下文

  • General Stage:解冻全部参数,混合纯文本、图文、音文、视频、音视频及音视频文本。
  • 从早期同时加入单模态与跨模态数据,使用多样自然语言指令覆盖不同理解任务。
  • Long Context Stage:提高长音频、长视频比例,将序列长度从 32K 扩展到 256K。
  • 统一输入支持长音频理解与带声音的视频,输出可包含场景分段、时间戳与人物—声音对应。

Thinker 领域蒸馏与交互 RL ​

领域能力整合与文本—音频迁移

Specialist Distillation

  • 从预训练 Qwen3.5 Base 分别训练文本、视觉、音频等领域教师,各自执行 SFT 与 RL。
  • 文本领域覆盖 Agent、Coding 与基础推理;教师生成领域数据,再蒸馏到统一 Thinker。
  • 对话统一为 ChatML,混合纯文本、视觉、音频和跨模态交互轨迹。

文本条件回答监督音频条件回答

  • 同一问题保留音频与文本两种输入,先由文本条件生成高质量回答。
  • 将该回答作为相应音频输入的蒸馏目标,执行报告中的 On-Policy Distillation。
  • 重点缩小语音提问在推理、流畅性和任务完成度上的差距,保持两种输入行为一致。
Interaction-Aligned RL
  • 构建多轮交互轨迹,直接覆盖长期对话中的语言、人设与指令约束。
  • 围绕 语言一致性、人设稳定性、长上下文指令遵循设计奖励。
  • 在领域蒸馏与文本—音频迁移之后继续 RL,优化完整交互体验。

Talker 语音训练与偏好对齐 ​

语音预训练与高质量 CPT

General Stage

  • 大规模多语言语音与多模态上下文配对,不只训练文字到声音的映射。
  • 加入指令控制语音生成任务,让韵律、情绪和表达方式适应当前对话。

Long-Context Stage

  • 对数据做质量分层,使用高质量子集继续预训练,减少噪声语料引入的幻觉。
  • 结合 Qwen3-Omni-Captioner 增强语料,扩展到 64K 上下文。
DPO、GSPO 与说话人微调

人类偏好与规则反馈

  • 人工标注多语言语音偏好对,用 DPO 优化自然度与表达质量。
  • 结合规则奖励执行 GSPO,进一步提高任务能力与训练稳定性。

声音定制

  • 最后执行轻量说话人微调,强化目标音色、自然度和可控表达。
  • 与参考语音提示驱动的 Zero-Shot Voice Cloning 同时提供不同定制方式。

实验设置(Qwen3.5-Omni-Plus / Flash) ​

模型与训练数据

模型和数据

  • 评测 Plus 与 Flash 两个 Instruct 版本;输入窗口均为 256K。
  • 总体训练语料包含超过 1亿小时 音视频;AuT 独立训练使用 4000万小时 音频—文本对。
  • AuT 中文、英文、其他语言比例 3.5:3.5:3;Talker 初始训练超过 2000万小时 多语言语音。
  • Omni General Stage 约 4T tokens;Thinker 长度 32K → 256K,Talker CPT 扩展至 64K。

评测对象与条件

  • 文本、视觉:对照 Qwen3.5-Plus-Instruct;音频、音视频:对照 Gemini-3.1 Pro。
  • OmniGAIA:不加 Thinking Prompt 与 Answer 格式,用 DeepSeek-V3.2-Thinking 做 Judge。
  • 语音生成:SEED-TTS、公开多语言 TTS、FLEURS 内部集与 CV3-Eval,测 WER / CER、Speaker Similarity。
  • 流式延迟:内部 vLLM,MTP 与 Codec 使用 Torch Compile / CUDA Graph;分别测 1 / 4 / 8 并发。

关键结果(Qwen3.5-Omni-Plus + 蒸馏/DPO/GSPO) ​

音频理解与交互

对照 Gemini-3.1 Pro

  • VoiceBench:88.9 → 93.1,语音对话表现更强;MMAU:81.1 → 82.2。
  • FLEURS Top60:ASR WER 7.32 → 6.55;LibriSpeech clean / other 为 1.11 / 2.23。
  • DailyOmni:82.7 → 84.6;Omni-Cloze:57.2 → 64.8,强化音视频理解与细节描述。
  • OmniGAIA:57.2,仍低于 Gemini-3.1 Pro 的 68.9;工具使用还有差距。
文本与视觉能力保留
  • 对照 Qwen3.5-Plus-Instruct,IFEval 同为 89.7;MMMU-Pro 为 73.8 → 73.9。
  • 视频任务提高:MVBench 76.7 → 79.0,LVBench 68.6 → 71.2。
  • GPQA 为 85.9 → 83.9,LiveCodeBench v6 为 67.1 → 65.6,整体能力接近原同级模型。
  • 多模态能力扩展与文本、视觉能力保留可以兼顾,但各任务收益并不相同。
语音生成与流式效率

语音准确性和声音迁移

  • 对照 Qwen3-Omni-30B-A3B,SEED-TTS 中文 WER 1.07 → 0.99,英文 1.39 → 1.26。
  • 多语言 TTS 对照中,29种语言有 22种取得最低 WER,同时保留较高说话人相似度。
  • 跨语言 Voice Cloning 的 12个方向中有 10个最优,覆盖不同原音色与目标语言组合。
  • 仅用单语做说话人微调,目标声音仍能迁移到所测 29种语言。

首包与并发

  • 单并发音频输入的理论首包延迟:Flash 235ms,Plus 435ms。
  • Plus 从 1并发扩到 8并发,音频首包为 435ms → 955ms,Generation RTF 仍为 0.334。
  • 生成速度快于实际播放速度,为连续语音输出保留缓冲余量。

未来方向 ​

通用 Omni Agent
  • 继续扩大原生多模态训练,使模型在同一系统内完成感知、推理、实时交互与工具行动。

(2603) Qwen3-Coder-Next (可验证任务、专家蒸馏) ​

Qwen3-Coder-Next

核心内容

  • 基于 Qwen3-Next,构建 800K+ 可验证任务与执行环境,强化代码和 Agent 能力。
  • MidTrain、SFT 后分别训练领域专家,再蒸馏到统一模型,适配多种工具格式。

详细笔记

(2602) Qwen3.5-397B-A17B (混合注意力, 原生多模态) ​

Qwen3.5 架构与预训练

参考链接

原生多模态

  • 预训练即融合文本与视觉 tokens,扩展 STEM、视频、多语言材料并加强数据过滤。
  • 语言与方言覆盖 119 → 201,词表约 250K;原生 256K,可扩展约 1M。

混合主干

  • 397B-A17B;60 层按 3×Gated DeltaNet + 1×Gated Attention 组合。
  • DeltaNet 控制长历史成本,全局 Attention 保留精确检索;多步 MTP 支持生成加速。
  • 512 个路由专家,激活 10 个并使用共享专家,降低 FFN 的每 token 计算量。
多任务 RL 与异步训练

环境扩展

  • 扩展文本、多模态、多轮任务及任务难度,覆盖更多 Agent 执行环境。
  • 异步解耦 rollout 与参数训练,动态分配负载并支持细粒度故障恢复。

稳定性与效率

  • Router Replay 复用采样时的专家路由;Multi-turn Rollout Locking 管理交互中的策略版本。
  • 控制数据过期程度与任务采样平衡,减少异步等待和快慢任务造成的分布偏斜。
  • 视觉编码器、语言主干采用异构并行;敏感计算保留 BF16,其他部分利用 FP8 加速。
  • 官方报告 FP8 减少约一半激活显存,异步 RL 系统整体加速约 3–5×。
多模态与 Agent 表现

能力变化

  • 对比 Qwen3-Max-Thinking:SWE-V 75.3 → 76.4,Terminal-Bench 2.0 22.5 → 52.5。
  • LiveCodeBench v6 85.9 → 83.6,终端改善没有同步转为竞赛代码提升。
  • 对比 Qwen3-VL-235B-A22B:MMMU-Pro 69.3 → 79.0,MathVision 74.6 → 88.6。

上下文策略

  • BrowseComp:simple context-folding 69.0,discard-all 78.6;结果依赖历史如何清理与重建。
  • 多数搜索评测采用 256K;WideSearch 不做上下文管理,得分 74.0。

(2507) Qwen3-Coder (480B-A35B, Code RL + Agent RL) ​

Qwen3-Coder 数据与模型

参考链接

训练基础

  • 仓库任务需要代码知识、长上下文和执行反馈,单轮竞赛代码难以覆盖完整开发流程。
  • 7.5T tokens,代码占 70%;用 Qwen2.5-Coder 清洗、重写噪声数据。
  • 480B-A35B MoE,原生 256K,通过 YaRN 扩展至 1M,包含仓库和 PR 材料。
Code RL 与 Agent RL

执行反馈

  • Code RL 从竞赛题扩展到编辑、SQL、软件开发、多语言和数据分析。
  • 自动扩展测试用例,通过代码执行结果提供奖励,利用“求解难、验证容易”的任务。

多轮训练

  • Agent RL 连续进行规划、工具调用、读取反馈和修改,学习根据失败测试调整方案。
  • 云端系统支持最多 20K 个独立环境,为长轨迹持续提供交互和验证。
Qwen Code 与工具接口
  • Qwen Code 基于 Gemini CLI 改造,适配提示词、工具和 function-call 协议,也支持 Cline。
  • 模型生成调用 → parser 解析 → harness 执行 → 结果回传,形成连续开发流程。
  • Instruct 权重为 non-thinking 模式;建议 temperature=0.7, top_p=0.8, top_k=20。
公开代码评测

交互预算

  • SWE-bench Verified + OpenHands:最多 100 轮得 67.0,500 轮得 69.6。
  • 同框架 Sonnet 4 分别为 68.0 / 70.4;增加执行轮数能带来额外解决率。

任务覆盖

  • Terminal-Bench 37.5,SWE Multilingual 54.7,Aider-Polyglot 61.8。
  • SWE-bench Live 26.3,比 Verified 更困难,仓库修复能力仍受任务分布影响。
  • Code RL 曲线中编辑、SQL、开发等任务均有改善,说明执行反馈训练可以覆盖更多真实代码工作。

(2505) Qwen3 (四阶段后训练、强到弱蒸馏) ​

🌺 论文摘要

Qwen3 摘要

参考链接

问题背景

  • 复杂推理需要更多计算,简单任务需要快速回答;各尺寸分别做完整 RL 成本高。

核心方法

  • 预训练:36T tokens,通识 → 推理数据增强 → 长上下文。
  • 旗舰后训练:Long-CoT SFT → Reasoning RL → 模式融合 SFT → General RL。
  • 小模型蒸馏:Off-policy 示范 → On-policy Logits 对齐。

模型效果

  • 235B-A22B Thinking:AIME’25 81.5、LiveCodeBench v5 70.7、BFCL v3 70.8。

重要结论

  • 统一快慢模式可控制推理预算;强教师蒸馏能以较低训练成本提升小模型。

核心贡献

  • 将推理控制、通用任务 RL 与强到弱蒸馏整合为全系列训练路线。

未来方向

  • 继续提高预训练数据质量和多样性,优化模型压缩与超长上下文。
  • 扩大基于环境反馈的 Agent RL,并研究更高推理预算下的性能扩展。

问题背景 ​

问题背景
  • 推理、普通对话和 Agent 任务需要不同的响应方式;小模型直接进行大规模 RL 成本较高。

核心方法 ​

架构与预训练 ​

Dense / MoE 架构

基础结构

  • GQA、SwiGLU、RoPE 和 RMSNorm;移除 QKV Bias,加入 QK-Norm 稳定训练。

MoE

  • 旗舰 235B-A22B;每层 128 个专家,每个 Token 选择 8 个,无共享专家。
  • 使用 Global-batch Load Balancing Loss,在整个 Batch 上平衡负载,保留专家分工。
PDF 提取、领域合成与细粒度配比

语料扩展

  • Qwen2.5-VL 识别 PDF 文字,再由 Qwen2.5 修订,增加高质量文档数据。
  • Qwen2.5 / Math / Coder 合成教材、QA、指令和代码,扩大 STEM 与推理覆盖。
  • 多语言数据扩展到 119 种语言及方言,总计约 36T tokens。

样本级配比

  • 对超过 30T tokens 标注教育价值、领域和安全等属性。
  • 小型 Proxy Model 做配比消融,根据细粒度标签调整样本,而非只按数据源混合。
General → Reasoning → Long Context
  • S1:超过 30T tokens,长度 4K,训练语言和通识能力。
  • S2:约 5T tokens,增加 STEM、代码与合成推理数据,加快学习率衰减。
  • 长上下文:数千亿 Tokens,长度 32K;长文本 16–32K 占 75%。
  • RoPE Base 提高至 1M,推理时配合 YaRN / DCA 扩展至 128K。

四阶段后训练 ​

Long-CoT 冷启动

问题筛选

  • Qwen2.5-72B-Instruct 去除难以验证的问题,以及无需 CoT 即可答对的简单题。
  • 按领域平衡数学、代码、逻辑与 STEM,预留独立验证题。

回答筛选

  • QwQ-32B 生成多个候选,保留正确且推理一致的回答。
  • 过滤重复、猜测、推理与答案矛盾、语言混杂及与验证题相似的样本。
  • 少量样本、较少训练步数建立推理格式,保留后续 RL 的探索空间。
Reasoning RL:GRPO 与难题筛选
  • 选择与冷启动不重合、模型仍可学会且尽量困难的问题,共 3995 个 Query–Verifier 对。
  • 采用 GRPO、大 Batch、多 Rollout,并利用 Off-policy 训练提高样本效率。
  • 控制策略熵稳定或缓慢上升,避免过早失去探索多样性。
Thinking Mode Fusion

混合 SFT 数据

  • Thinking:RL 模型在冷启动题目上做 Rejection Sampling,保持已有推理能力。
  • Non-thinking:覆盖写作、代码、问答、多语言等,用自动 Checklist 筛选回答。

模式控制

  • /think 与 /no_think 共用模板;直接回答保留空的 <think> 区域。
  • 多轮对话遵循最后一个模式标记,可在同一会话里切换。

Thinking Budget

  • 达到预算后插入结束思考指令,让模型基于已有推理生成最终答案。
  • 预算适应能力来自模式融合,报告没有单独训练每档预算。
General RL:多任务奖励

奖励类型

  • 规则奖励:判断答案、格式与可验证约束。
  • 带参考答案的模型奖励:Qwen2.5-72B-Instruct 对照参考答案评分。
  • 无参考答案的偏好奖励:人类偏好训练的 RM,评价开放任务的帮助性与风格。

任务覆盖

  • 覆盖 20+ 类任务,包括指令遵循、格式、偏好、RAG 和 Agent。
  • Agent Rollout 执行完整多轮工具交互,从真实环境反馈中学习。

强到弱蒸馏 ​

Strong-to-Weak Distillation

Off-policy

  • 用 Qwen3-32B / 235B-A22B 的两种模式示范,训练小模型的基础能力与模式切换。

On-policy

  • 学生自行生成回答,教师在学生生成的上下文上给出 Logits。
  • 最小化学生与教师分布的 KL,使监督覆盖学生实际访问的状态。
Qwen3 后训练总流程:大模型依次学习长 CoT、推理 RL、模式融合和通用 RL,再将能力迁移到小模型。
原文图 1:Qwen3 后训练总流程:大模型依次学习长 CoT、推理 RL、模式融合和通用 RL,再将能力迁移到小模型。 来源

实验设置(Qwen3) ​

实验设置

模型与训练

  • Dense 0.6B–32B,MoE 30B-A3B / 235B-A22B。
  • 32B 与 235B-A22B 走四阶段后训练;其余小模型走强到弱蒸馏。
  • 旗舰 Reasoning RL:3995 个 Query–Verifier 对,示例训练 170 步。

评测与对照

  • AIME 每题采样 64 次,主分数取平均准确率;另报 Pass@64。
  • Thinking Budget 对照覆盖数学、代码与 STEM。
  • 蒸馏消融:同一个 Off-policy 8B Checkpoint,分别继续直接 RL 或 On-policy 蒸馏。

关键结果(Qwen3) ​

关键结果

推理与 Agent

  • 旗舰 Reasoning RL 的 AIME’24 从 70.1 → 85.1,难题选择与稳定探索持续提高推理能力。
  • 最终 Thinking 模型:AIME’25 81.5、LCB v5 70.7、BFCL v3 70.8,兼顾推理和工具调用。

小模型训练效率

  • 8B 的 AIME’25:继续 RL 为 55.5,On-policy 蒸馏为 65.5;LCB 为 52.9 / 60.3。
  • 对应训练约 17,920 / 1,800 GPU hours,该对照中蒸馏成本约为直接 RL 的十分之一。
  • AIME’25 Pass@64 从 83.3 → 86.7,教师监督也扩展了学生能够解决的问题范围。

能力与预算

  • 增大 Thinking Budget 时,数学、代码和 STEM 表现平滑提升。
  • General RL 改善指令与通用行为,仍需同时跟踪专项推理能力的变化。
Thinking Budget 与任务表现的关系。数学、代码和科学推理对额外推理计算的收益不同,应按任务选择预算。
原文图 2:Thinking Budget 与任务表现的关系。数学、代码和科学推理对额外推理计算的收益不同,应按任务选择预算。 来源

未来方向 ​

未来方向

原文未来方向

  • 继续提高预训练数据质量和多样性,优化模型压缩与超长上下文。
  • 扩大基于环境反馈的 Agent RL,并研究更高推理预算下的性能扩展。

(2412) Qwen2.5 (18T、DPO → GRPO) ​

🌺 论文摘要

Qwen2.5 摘要

参考链接

问题背景

  • 通用模型需要改善数学代码、长回答、结构化理解和复杂指令遵循。

核心方法

  • 预训练:18T tokens,模型筛选、领域合成与数据配比优化。
  • SFT:超过 1M 样本,重点补充可验证约束、长回答、代码与结构化任务。
  • 后续对齐:Offline DPO → Online GRPO,执行核验与 RM 分工。

模型效果

  • 72B-Instruct:MATH 83.1、HumanEval 86.6、Arena-Hard 81.2。

重要结论

  • 高质量数据与多阶段对齐共同提升能力;RM 榜单得分不一定预测实际 RL 收益。

核心贡献

  • 形成从大规模数据构建到分阶段偏好优化的通用模型训练路线。

未来方向

  • 持续优化高质量与多样化数据,并把文本、视觉和音频纳入统一多模态框架。
  • 扩大推理时计算,提高复杂推理能力。
  • 改进 RM 评估,使其更能预测实际 RL 训练收益。

问题背景 ​

问题背景
  • 需要提升知识、代码、数学和复杂指令的共同表现,并改善长回答与长上下文能力。

核心方法 ​

预训练与长上下文 ​

18T 预训练数据

质量筛选与领域配比

  • Qwen2-Instruct 从多个维度评估语料质量,覆盖更多语言。
  • 下采样重复的电商、社交、娱乐内容,上采样科技、科学和学术内容。
  • 把 Qwen2.5-Math / Coder 的领域数据加入通用预训练。

合成数据

  • Qwen2-72B-Instruct 与 Math 模型生成数学、代码和知识数据。
  • 通用 RM 与数学 RM 筛选合成内容,再与真实语料混合。
Scaling Law 与长上下文

超参数选择

  • 小规模 Dense / MoE 实验拟合模型量、数据量与最优学习率、Batch Size 的关系。
  • 按预测结果配置不同尺寸模型,兼顾总参数与激活参数。

普通分支

  • 训练长度从 4K → 32K,RoPE Base 提高至 1M。
  • 推理时用 YaRN / DCA 扩展上下文;7B 及以上开放模型支持 128K。

Turbo 分支

  • 训练长度按 32K → 64K → 128K → 256K 扩展,每阶段混合最长序列 40% 与短序列 60%。
  • 先做短指令 SFT,再混合长短指令;RL 仍用短指令,推理窗口扩展至 1M。

SFT 数据构建 ​

长回答、数学与代码

长回答

  • 从预训练长文反向构造问题,加入输出长度约束,再筛选问题与答案的一致性。

数学与代码

  • 数学用已验证答案、RM 和 Rejection Sampling 筛选 CoT。
  • 代码使用语言专属 Agent 协作生成指令,覆盖约 40 种编程语言。
  • 对代码做静态检查,并在多语言 Sandbox 中执行单测。
指令约束与通用任务

可验证约束

  • 模型同时生成指令、验证函数及交叉检查的单测,用执行结果筛选答案。
  • 例如要求特定字段或长度时,用验证代码判断回答是否满足要求。

数据覆盖

  • 表格问答、事实核查和结构理解加入推理过程;逻辑推理新增约 70K 问题。
  • 高资源语言指令翻译到低资源语言,并检查回答的语义一致性。
  • 加入数百种 System Prompt;Critic 与多 Agent 打分共同筛选回答。

离线与在线偏好优化 ​

Offline DPO:执行反馈构造偏好
  • SFT 模型在新问题上重新采样,覆盖数学、代码、逻辑和指令约束。
  • 答案匹配或执行通过作为正例,失败作为负例,再做人工与自动检查。
  • 固定偏好对执行 DPO,Online Merging Optimizer 缓解对齐后的能力损失。
Online GRPO:RM 与采样顺序

Reward Model

  • 同一问题由不同训练阶段的 SFT / DPO / RL Checkpoint 生成候选,并使用不同温度。
  • 人工与自动偏好标注共同训练 RM,覆盖真实性、帮助性、简洁性等维度。

GRPO

  • 每题采样 8 个回答,用 RM 评分进行组内相对优化。
  • 优先训练候选得分方差较大的问题,使同组回答提供更有效的区分信号。

实验设置(Qwen2.5) ​

实验设置

模型与预训练

  • 开放 Dense 0.5B–72B;Turbo / Plus 使用 MoE。
  • 超参数实验覆盖 Dense 44M–14B、MoE 激活参数 44M–1B,训练数据 0.8B–600B。

SFT 与 DPO

  • SFT:1M+ 样本、2 epochs、长度 32K;学习率 7e-6 → 7e-7。
  • Weight Decay 0.1,Gradient Clip 1.0。
  • DPO:约 150K 偏好对、1 epoch,学习率 7e-7。

Online RL 与评测

  • GRPO:每题 8 个回答,Global Batch Size 2048,每 Episode 2048 个问答样本。
  • 分别评估 Base、Instruct、长上下文与 RM;RM 另测 RewardBench、RMB、PPE 和中文偏好。

关键结果(Qwen2.5) ​

关键结果

推理与对齐

  • 72B-Instruct 的 MATH 达 83.1,高于 Qwen2-72B 的 69.0;HumanEval 达 86.6。
  • Arena-Hard 达 81.2,多阶段后训练明显改善开放任务的回答质量。

长上下文

  • Turbo 分支扩展到 1M 窗口;长文本训练与长指令 SFT 共同支持长文检索和理解。

RM 选择

  • 不同 RM 在 RewardBench、RMB 和 PPE 上的排名不同,单一榜单无法全面衡量反馈质量。
  • 报告发现 RM 测试分数更高时,训练出的策略未必更好;需结合下游 RL 结果选择 RM。
Qwen2.5-Turbo 的 1M Passkey Retrieval:横轴是上下文长度,纵轴是目标位置,观察长窗口内不同深度的检索覆盖。
原文图 2:Qwen2.5-Turbo 的 1M Passkey Retrieval:横轴是上下文长度,纵轴是目标位置,观察长窗口内不同深度的检索覆盖。 来源

未来方向 ​

未来方向

原文未来方向

  • 持续优化高质量与多样化数据,并把文本、视觉和音频纳入统一多模态框架。
  • 扩大推理时计算,提高复杂推理能力。
  • 改进 RM 评估,使其更能预测实际 RL 训练收益。

(2409) Qwen2.5-Coder (文件与仓库 CPT、SFT+DPO) ​

🌺 论文摘要

Qwen2.5-Coder 摘要

参考链接

问题背景

  • Code 模型需缩小与闭源模型的差距,同时保持数学、自然语言与多语言代码能力。

核心方法

  • CPT:文件级 5.2T + 仓库级 300B,联合 NTP / FIM。
  • 数据构建:网页分层筛选、多语言 Agent 合成、Checklist 与执行验证。
  • 后训练:Coarse-to-fine SFT,混入 FIM,再做 Offline DPO。

模型效果

  • 32B-Instruct:HumanEval 92.7、BigCodeBench Instruct 49.6、Aider Pass@1 60.9。

重要结论

  • 高质量文字—代码关联数据有效;混合通用文本与数学数据可保持更全面的能力。

核心贡献

  • 提供从代码语料、仓库上下文到执行反馈偏好的完整 Code 模型训练路线。

未来方向

  • 继续扩展代码数据与模型规模,并提高代码推理能力。
  • 研究更有效的 Code / Text / Math 配比,解释跨领域数据带来的迁移收益。

问题背景 ​

问题背景
  • Code 模型需要同时理解文件和仓库结构,指令数据还要覆盖大量低资源编程语言。

核心方法 ​

Code 数据与继续预训练 ​

源码、解释性网页与合成数据

源码

  • 收集 2024-02 前 GitHub 仓库,覆盖 92 种编程语言,按规则清洗。
  • 同时收集 PR、Commit、Notebook 和 Kaggle,扩充代码上下文。

Text-Code Grounding

  • 从 Common Crawl 提取文档、教程和博客,保留文字与代码的对应关系。
  • 用 fastText 等小模型做 4 层由粗到细的筛选,每层分别控制相关性与质量。
  • 保留各层质量分,供后续数据混合使用。

合成与混合

  • CodeQwen1.5 合成代码,经 Executor 验证后保留可执行样本。
  • 加入 Qwen2.5 的通用文本和 Math 数据;通用文本先移除代码,减少来源重叠。
文件级与仓库级 CPT

File-level

  • 从 Qwen2.5 开始继续预训练,5.2T tokens、长度 8K。
  • 联合 Next-token Prediction 与 FIM,输入缺口前后文,预测中间代码。

Repo-level

  • 继续训练约 300B tokens,长度扩至 32K,RoPE Base 提至 1M。
  • 用 Repo Name、File Separator 与文件路径组织上下文,把 FIM 扩展到多文件代码。
  • 推理时通过 YaRN 外推至 128K。

多语言指令数据 ​

指令合成与语言协作

指令来源

  • 从 GitHub 代码片段反向生成问题,再由 Code LLM 生成回答、评分筛选。
  • 混合开源多语言指令;CodeBERT 识别编程语言,控制各语言及无代码样本比例。

多 Agent 协作

  • 每种语言由专属 Agent 生成指令和解法,再通过跨语言讨论共享问题模式。
  • Memory 记录生成历史,减少重复;根据各语言的知识缺口补充新问题。
Checklist 与多语言 Sandbox

质量打分

  • 检查问答一致性、难度、代码正确性、规范、可读性和教学价值,按权重汇总。

代码验证

  • 解析 AST,过滤语法错误。
  • 对可独立运行的算法题自动生成单测,检查正常输入和边界情况。
  • Sandbox 负责隔离执行、超时控制和结果比较,保留通过验证的数据。

SFT 与偏好优化 ​

两阶段 SFT 与 FIM 混合

Coarse-to-fine

  • 第一阶段使用数千万条多样化合成指令,扩大任务覆盖。
  • 第二阶段使用数百万高质量样本;同题生成多个候选,评分后选优做 SFT。

Mixed Tuning

  • 主要使用普通 SFT 样本,混入少量 FIM 指令,保持补全与长上下文能力。
  • Tree-sitter 解析 AST,抽取表达式、语句或函数等逻辑块作为待补全内容。
Qwen2.5-Coder 的三阶段训练:文件级训练积累代码能力,仓库级训练建立跨文件联系,再以指令训练对齐开发任务。
原文图 2:Qwen2.5-Coder 的三阶段训练:文件级训练积累代码能力,仓库级训练建立跨文件联系,再以指令训练对齐开发任务。 来源
执行反馈与模型偏好
  • 算法题、独立代码:用多语言 Sandbox 的测试通过情况构造偏好。
  • 复杂代码:LLM-as-a-Judge 比较候选质量。
  • 代码偏好与通用偏好数据混合,执行 Offline DPO。

实验设置(Qwen2.5-Coder) ​

实验设置

模型与预训练

  • Qwen2.5 基座,0.5B / 1.5B / 3B / 7B / 14B / 32B 六档。
  • 总 CPT 约 5.5T tokens;文件阶段 Code / Text / Math 为 70 / 20 / 10。

数据消融

  • 1.5B 比较解释性网页逐层过滤;7B 比较纯 Code 与不同混合配比。
  • Base 评估生成、FIM、仓库补全、推理和长上下文;Instruct 另评编辑、SQL 与表格任务。

后训练

  • 大规模多样 SFT → 高质量 Rejection Sampling SFT → Offline DPO。
  • 代码执行验证适用于可独立运行的片段;其余代码使用模型评审。

关键结果(Qwen2.5-Coder) ​

关键结果

生成与编辑

  • 32B-Instruct 的 HumanEval 92.7、BigCodeBench Instruct 49.6,提升覆盖标准题和更复杂依赖代码。
  • Aider Pass@1 60.9,说明收益也覆盖根据要求修改现有代码。

数据质量

  • 1.5B 的 HumanEval / MBPP 平均分在网页分层筛选后从 41.6 → 46.8。
  • 文字解释与代码关联数据提供了纯源码之外的监督,筛选比直接扩大网页量更有效。

混合配比

  • 加入 Text / Math 明显改善通用与数学任务,同时保持代码能力。
  • 代码比例不是越高越好,配比应结合代码表现与通用能力共同选择。

未来方向 ​

未来方向

原文未来方向

  • 继续扩展代码数据与模型规模,并提高代码推理能力。
  • 研究更有效的 Code / Text / Math 配比,解释跨领域数据带来的迁移收益。

(2407) Qwen2 (7T、离线与在线 DPO) ​

🌺 论文摘要

Qwen2 摘要

参考链接

问题背景

  • 通用模型需要同时增强代码、数学、多语言和长上下文,并降低高质量对齐数据的标注成本。

核心方法

  • 架构:GQA Dense,细粒度 MoE 由 7B Upcycling。
  • 数据:高质量 7T 语料;指令标签、难度演化与按任务自动验证。
  • 后训练:SFT → Offline DPO → 当前策略采样的 Online DPO。

模型效果

  • 72B-Instruct:HumanEval 86.0、MATH 69.0、Arena-Hard 48.1。

重要结论

  • 扩大数据要保持质量;自动执行与答案核验可同时产生示范和偏好数据。

核心贡献

  • 建立可扩展的数据对齐流程,并将 Dense / MoE 与长上下文纳入同一模型系列。

未来方向

  • 提高小模型后训练数据的质量,尤其是复杂指令和约束遵循。
  • 继续优化数据过滤与领域配比,提高扩充数据时的有效信息密度。

问题背景 ​

问题背景
  • 扩大多语言与代码能力后,仍需提升指令遵循和用户偏好对齐,并兼顾模型推理效率。

核心方法 ​

架构与预训练 ​

GQA 与细粒度 MoE

Dense

  • GQA 减少 KV Cache;SwiGLU、RoPE、RMSNorm 与 Pre-norm 保持训练稳定。

MoE

  • 57B-A14B 从 Qwen2-7B Upcycling,使用细粒度路由专家和共享专家。
  • 每层 64 个路由专家,选择 8 个,另有 8 个共享专家。
  • 复制 Dense FFN,沿中间维度打乱并切分为小专家,再随机重初始化一半参数。
  • 不同专家保留基座知识,同时增加初始化差异,减少所有专家学习相同功能。
预训练数据与长上下文

数据质量

  • 规则与 Qwen 模型联合过滤,扩充代码、数学和约 30 种语言的数据。
  • 小模型实验优化来源与领域配比,加入高质量指令数据增强 ICL。

长上下文

  • 预训练末期从 4K → 32K,增加长文,RoPE Base 从 10K → 1M。
  • DCA 处理块内与块间相对位置,配合 YaRN 做长度外推。

指令数据与偏好训练 ​

指令标签与难度演化

指令选择

  • InsTag 提取细粒度标签,人工修订后按多样性、复杂度和意图完整性选题。
  • Qwen 给已有指令增加约束,扩展难度层次。

人工偏好

  • 不同尺寸模型与采样策略生成多个回答,人工排序。
  • 最佳回答用于 SFT,正负回答对用于后续 DPO。
按任务构造自动监督

数学与代码

  • 数学:多条推理路径采样,保留答案正确且过程合理的路径,正误配对形成偏好。
  • 代码:生成解法与测试,编译执行后同时得到示范与偏好数据。

指令、写作与角色

  • 约束指令:生成 Python 验证函数,检查长度、格式等条件。
  • 写作:从高质量作品反向生成不同细度的指令。
  • 角色:基于人物资料生成问答,保持角色信息一致。

Constitutional Feedback

  • 根据预设原则生成遵循与违反原则的回答,为安全任务提供正负反馈。
SFT → Offline DPO → Online DPO

SFT

  • 混合指令、代码、数学、逻辑、角色、多语言和安全任务,学习完整回答。

Offline DPO

  • 固定人工与合成偏好对,提高正例相对负例的生成概率。

Online DPO

  • 当前策略对问题生成多个回答,由 RM 选择最好和最差的候选。
  • 每个 Episode 重新构造偏好对,继续做 DPO;使用 Online Merging Optimizer 缓解对齐损失。

实验设置(Qwen2) ​

实验设置

模型与数据

  • Dense 0.5B / 1.5B / 7B / 72B,MoE 57B-A14B。
  • 多数 Dense 训练 7T tokens,0.5B 使用 12T;MoE Upcycling 后追加 4.5T。

SFT

  • 超过 500K 样本、2 epochs、长度 32K。
  • 学习率 7e-6 → 7e-7,Weight Decay 0.1,Gradient Clip 1.0。

评测与对照

  • 分别测 Base 和 Instruct,覆盖代码、数学、通用、多语言、指令与长上下文。
  • 以 Qwen1.5、同量级 Dense / MoE 为对照;数据实验比较高质量 7T 与放宽筛选后的 12T。

关键结果(Qwen2) ​

关键结果

代码与数学

  • 72B-Instruct 相对 Qwen1.5-72B:HumanEval 71.3 → 86.0,MATH 42.5 → 69.0。
  • 多语言代码 MultiPL-E 从 48.1 → 69.2,收益覆盖 Python 之外的语言。

对齐与数据

  • Arena-Hard 从 36.1 → 48.1,说明后训练也改善开放任务的偏好表现。
  • 放宽质量门槛得到 12T 后未出现明显收益,大模型选择使用更高质量的 7T。

小模型短板

  • 7B 代码能力有竞争力,但复杂指令遵循仍落后于 Llama-3-8B。
  • 领域分数提升不能代替指令评估,需专门补充高质量约束任务。

未来方向 ​

未来方向

原文讨论的方向

  • 提高小模型后训练数据的质量,尤其是复杂指令和约束遵循。
  • 继续优化数据过滤与领域配比,提高扩充数据时的有效信息密度。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026