Skip to content

腾讯系列

📅 发表于 2025/12/31
🔄 更新于 2026/08/05
👁️ — 次访问
📝 5196 字
⏳ 16 分钟

变化点 ​

2026

2026.08 · Hy4 preview

  • 采用 Gated DSA + IndexCache,复用历史选择结果,支持 1M 上下文。
  • 扩大预训练与后训练,加入多个行业的专家数据。

2026.07 · Hy3

  • 将产品反馈纳入多轮 SFT 与 RL,强化真实任务交付。
  • 重点改善复杂约束遵循、多轮操作与失败恢复。
2025

2025.06 · Hunyuan-A13B

  • 以 80B 总参数 / 13B 激活 降低计算开销,支持快慢两种思考模式。
  • 通过分阶段 SFT 与 RL 融合推理和通用能力。
2024 及以前

2024.11 · Hunyuan-Large

  • 采用大规模 MoE,CLA 共享 KV,Recycle Routing 提高专家利用率。
  • 结合预训练与偏好对齐,建立混元大模型基座。

(2608) Hy4 preview (Gated DSA、IndexCache、1M) ​

Hy4 preview

参考链接

架构优化

  • 主干 770B-A49B、1M 上下文;每 token 选择 8 个路由专家并使用共享专家。
  • Gated DSA 选择 Top-2048 历史位置;IndexCache 跨层复用位置索引,减少重复筛选。
  • iHC 使用 4 条残差流;额外 1 层 MTP 生成 Draft Token,由主模型批量验证。
专家数据与产品迭代
  • 扩展预训练与后训练,软件、游戏、金融、安全专家共同构建真实工作数据。
  • 训练面向跨文件调试、多资料文档、可玩原型和科研分析,强调可使用的最终产物。
  • 与 CodeBuddy、WorkBuddy 联合迭代;开放 BF16/FP8 权重与原生 MTP。
内部工程盲测
  • 163 名专家评审 203 项任务,采用匿名并排比较与四分制评分。
  • Hy4 均分 2.99,Kimi K3 2.94、GLM-5.3 2.92,该任务集上小幅领先。
  • 对 Kimi K3:51.2%胜 / 7.9%平 / 40.9%负;仍有较多任务不占优。
  • 官方仍观察到思考过久和重复自检,复杂任务需要同时优化完成质量与耗时。

(2607) Hy3 (产品反馈、多轮 SFT + RL) ​

Hy3

参考链接

模型与训练

  • 295B-A21B MoE、256K 上下文;GQA + MTP,提供 no_think / low / high。
  • 利用 50+ 产品反馈扩展 SFT 与 RL 数据,针对工具错误、知识混淆和多轮约束丢失。

后训练重点

  • 工具:稳定调用和参数,训练报错后的恢复,适配不同 harness。
  • 知识:清洗来源混淆、虚构数据与常识错误,训练基于证据的回答。
  • 多轮:恢复省略和指代信息,保持长期意图、早期约束及后续需求修改。
任务表现与错误变化
  • 内部 270 名专家工作盲测:Hy3 2.67/4,GLM-5.1 2.51/4。
  • 内部幻觉率 12.5% → 5.4%,常识错误率 25.4% → 12.7%。
  • 多轮问题率 17.4% → 7.9%,体现跨轮约束保持和意图跟踪的改善。
  • SWE-V 在 CodeBuddy、Cline、KiloCode 等 harness 下的波动控制在官方报告的 4% 以内。

(2506) Hunyuan-A13B (80B-A13B、四阶段后训练、双模式思考) ​

🌺 论文摘要

Hunyuan-A13B 论文摘要

参考链接

问题背景

  • 大模型推理成本较高;希望以更低激活量保留推理、代码与 Agent 能力,并按任务控制思考开销。

核心方法

  • 架构与预训练:80B-A13B MoE + GQA;20T 基础训练、300B 退火,再扩展到 256K。
  • 推理 SFT → GRPO:使用 150K 数学/代码/逻辑/科学任务,Verifier 与 Sandbox 提供奖励。
  • 通用 SFT → RL:五角色合成 Agent 轨迹,覆盖多工具反馈与 20K 格式;Dual-CoT 统一快慢思考。

模型效果(A13B-Instruct,快思考 → 慢思考)

  • AIME 2024:30.6 → 87.3;BFCL v3:65.9 → 78.3。
  • LongBench-v2 55.0,高于报告中的 Qwen3-A22B 48.4。

重要结论

  • 慢思考对数学、逻辑和部分工具任务收益明显;快慢模式的优劣仍取决于具体任务。
  • Base 相比 Hunyuan-Large,在 12/14 项评测上改善,激活参数由 52B 降至 13B。

核心贡献

  • 给出低激活 MoE、推理与通用分阶段后训练、双思考模式的完整训练方案,并开放 Base/Instruct 权重。

未来方向

  • 补强复杂代码与多跳 RAG;进一步按任务收益分配快慢思考预算。

问题背景 ​

推理能力与使用成本

激活规模与成本

  • 大模型完整激活会增加推理延迟和硬件开销;MoE 用部分专家计算,降低每 token 的成本。

推理深度与任务需求

  • 数学、代码需要较长推理;日常问答若总生成长 CoT,会增加无必要的等待。
  • 后训练同时需要保留通用交互能力,避免模型只适合可验证推理题。

核心方法 ​

架构与预训练 ​

模型结构

MoE

  • 32层,80B 总参数,13B 激活;共享专家与路由专家的中间维度相同。
  • 1个共享专家始终激活,从 64个路由专家中选择 Top-8。
  • 共享专家负责可复用计算;报告的结构探索发现,增加至一个共享专家收益明显,继续增加收益减弱。

Attention 与词表

  • GQA:32个 Query Head / 8个 KV Head,减少 KV Cache。
  • hidden=4096, FFN=3072,SwiGLU;沿用 Hunyuan-Large 的 128K 词表。
预训练语料

清洗流程

  • 预处理去重、去噪、低质量过滤和主题标注,再由模型抽取正文。
  • 对抽取文本继续做质量过滤与语义去重,减少重复、格式残留和无效内容。

STEM 与难度分级

  • 优化 STEM 获取与清洗,提取 250B tokens 高质量 STEM 语料。
  • 细化知识标签,并从多个维度标注难度,使语料筛选能覆盖不同知识和推理需求。
预训练课程

基础训练与快速退火

  • 基础阶段 20T tokens,固定 4K 长度;学习率先预热、再余弦下降,最后保持最低值。
  • 快速退火追加 300B tokens,上下文扩到 8K,用更低学习率巩固能力。

长上下文扩展

  • 分两阶段训练至 32K、256K,使用 NTK-aware 位置编码。
  • 增加可处理长度后,用真实长文理解与多跳任务检查模型是否能有效利用远处信息。

推理 SFT 与 RL ​

推理数据构建

数学与代码

  • 数学:教材、标准化考试、竞赛题;结合生成式奖励模型与自动验证筛选长 CoT。
  • 代码:从开源仓库抽取代码,合成指令和推理过程,由 Critic 与 Sandbox 检查正确性。

逻辑与科学

  • 逻辑:按题型和难度合成谜题,常规题用模型验证,复杂题加入人工复核。
  • 科学:覆盖物理、化学、生物,Verifier 检查单位换算、数值近似和化学符号等细节。
  • 四类数据都保留明确推理过程,拒绝验证失败的样本。
推理 RL

奖励来源

  • Outcome Verifier:比较最终答案与参考答案,输出 0/1,兼容等价格式、单位和同义表达。
  • Code Sandbox:执行代码与测试,覆盖 36种语言,通过分布式 CPU 集群并发运行。

可学习样本

  • 从 SFT 模型表现不稳定的题目中选取 RL 数据,保留当前模型有提升空间的任务。
  • 排除选择、判断和证明题,减少猜中答案或难以判定正确性的奖励噪声。
  • 采用 GRPO,逐阶段延长上下文;去掉 KL 约束,结合近 On-Policy、大 Batch 和较多 Rollout。

通用能力与快慢思考 ​

通用能力数据

任务混合

  • 混合部分推理数据,以及写作、理解、翻译、多轮对话、知识问答、复杂指令和角色扮演。
  • 复杂指令数据包含多约束与跨文本信息整合,并用规则检查约束是否满足。
  • 知识问答由 Critic 过滤无依据内容;多轮数据混合开源、采购、合成与模拟对话。

Agent 合成

  • 使用 User、Planner、Tool、Agent、Checker 五角色引擎生成多方交互。
  • 工具反馈来自 Sandbox、MCP 与合成工具,扩展工具种类和环境反馈。
  • 设计 30余类 System Instruction,组合工具、动作和回答格式,形成 20K 格式组合。
  • 补充快慢思考数据,并强化 Excel、Deep Search 等高频工作任务。
领域奖励服务

GRM

  • 以参考回答为判断依据,比较候选质量;开放任务用语义参考,确定性任务用标准答案。
  • 可结合 CoT、外部工具、长度统计与约束检查,适应不同领域。
  • 覆盖 16个子主题、30余个评分服务,通过动态采样平衡任务。

Agent 与长对话

  • 格式奖励:工具特殊标记及顺序正确记 1,否则 0,保证调用可解析。
  • 正确性奖励:比较工具、参数及参数值与参考调用的一致性。
  • 长上下文增加幻觉检测奖励;多轮对话挖掘不稳定样本,改进上下文连贯性。
双模式统一训练

统一格式

  • 快慢样本共用输出格式;快思考保留空 Thinking 内容,慢思考包含逐步推理。
  • 两种模式在同一后训练结构中优化,使用一个模型提供不同推理深度。

推理选择

  • 快思考处理直接问答,减少生成开销;慢思考支持反思、回溯和复杂推理。
  • 通过 /no_think 与 /think 控制;未指定时默认慢思考。

实验设置(A13B,四阶段后训练) ​

✍️ 实验设置

训练配置

基础模型与预训练

  • Hunyuan-A13B:80B-A13B,32层,共享专家 1、路由专家 64/Top-8。
  • 基础训练:20T tokens, seq_len=4K, peak_lr=3e-4。
  • 学习率在 13.5T tokens 内余弦降到 3e-5,剩余基础训练保持该值。
  • 快速退火:300B tokens, seq_len=8K, lr=3e-5→8e-6。
  • 长上下文:32K → 256K,NTK-aware 的 alpha=50 → 1000。

推理 RL 数据与超参

  • 150K 任务;数学:代码:逻辑:科学=2:2:1:1。
  • 与 SFT 重合 10%,新增任务 90%;训练长度 24K → 32K。
  • GRPO:移除 KL 约束,采样温度 0.6~0.8。
  • 四阶段顺序:推理 SFT → 推理 RL → 通用 SFT → 通用 RL。
评测配置

Base 评测

  • 通用:MMLU/MMLU-Pro 5-shot,BBH 3-shot。
  • 代码:EvalPlus、MultiPL-E 0-shot,MBPP 3-shot;数学 MATH 4-shot CoT。

Instruct 评测

  • 快、慢思考分别评估数学、代码、逻辑、指令遵循和 Agent,不混成同一模式成绩。
  • Agent:BFCL v3、τ-Bench、ComplexFuncBench、C3-Bench。
  • 长文本:PenguinScrolls、LongBench-v2、FRAMES;RULER QA 按长度分组至 128K。

吞吐测试

  • 精度 W16A16/KV16,输入 2048,对比不同 Batch 与输出长度。

关键结果(Hunyuan-A13B,Base 与 SFT/RL) ​

🍑 关键结果

Base 与后训练表现

低激活 Base

  • 与 Hunyuan-Large 对比,13B 激活替代 52B,12/14 项评测更好。
  • MMLU-Pro 60.20 → 67.23,MBPP 72.60 → 83.86,说明较低激活量仍能改善知识和代码能力。

慢思考 Instruct

  • AIME 2024 87.3,Qwen3-A22B 85.7;AIME 2025 76.8,低于对照的 81.5。
  • LiveCodeBench 63.9,低于 Qwen3-A22B 70.7;复杂代码仍有提升空间。
  • BFCL v3 78.3,高于 Qwen3-A22B 70.8;工具调用是本模型较突出的方向。
快慢思考与长上下文

快思考 → 慢思考

  • AIME 2024:30.6 → 87.3;LiveCodeBench:27.4 → 63.9,复杂推理明显受益。
  • BFCL v3:65.9 → 78.3;但 ComplexFuncBench:74.0 → 61.2。
  • 因而慢思考不保证所有工具任务更好,模式选择应结合任务与实际质量。

长文本能力

  • LongBench-v2 55.0,高于 Qwen3-A22B 48.4;FRAMES 81.1,低于对照 84.0。
  • RULER QA 的 64K~128K 组为 73.9,优于报告中 R1 65.6 与 Qwen3-A22B 66.6。
  • 长输入利用较稳定,但跨来源检索与推理仍弱于部分对照,扩窗口不等于解决多跳 RAG。

未来方向 ​

后续改进方向

报告中的不足

  • 代码推理:LiveCodeBench 等复杂编程任务与更强模型仍有差距。
  • 多跳 RAG:继续改进检索结果整合与事实推理,提高 FRAMES 类任务表现。

笔记归纳

  • 按任务比较快慢模式的质量与耗时,训练更准确的推理深度选择,减少无收益的长 CoT。

(2411) Hunyuan-Large (389B-A52B、CLA、Recycle Routing) ​

🌺 论文摘要

Hunyuan-Large 论文摘要

参考链接

问题背景

  • 大规模 MoE 需要同时处理长文 KV Cache、专家负载不均和高质量训练数据不足。

核心方法

  • 架构与专家优化:389B-A52B MoE,GQA/CLA 共享 KV;Recycle Routing 将过载 token 重分配到空闲专家。
  • 数据与预训练:7T tokens,含约 1.5T 合成数据;结合 MoE Scaling Law、专家独立学习率与长上下文训练。
  • SFT 与偏好优化:1M+ 数据 SFT → 离线/在线混合 DPO,加入 Chosen SFT Loss 与 EMA。

模型效果(Hunyuan-Large-Instruct,SFT+DPO)

  • MMLU 89.9、MATH 77.4、HumanEval 90.0;Llama3.1-405B-Instruct 分别为 87.3、73.8、89.0。
  • PenguinScrolls 85.23,对照 Llama3.1-70B-Instruct 69.37。

重要结论

  • 低激活 MoE 可以取得较强通用能力,但 GPQA 等专业推理仍弱于部分更大模型。
  • 长文效果需要按长度评估:短上下文不一定领先,64K~128K 的稳定性更突出。

核心贡献

  • 给出合成数据、KV 共享、专家路由和偏好训练结合的大规模 MoE 方案,开放 Base/Instruct 权重。

未来方向

  • 用更贴近真实文档与多轮场景的评测推进长上下文能力,并继续优化 MoE 训练效率。

问题背景 ​

MoE 规模化的训练与推理难点

长文缓存与路由负载

  • KV Cache 随长度和层数增长,限制长上下文推理的显存与并发。
  • 热门专家超过容量后会丢弃 token;单纯增加容量又降低计算效率。

数据与优化差异

  • 自然语料中的数学、代码和低资源领域覆盖不足,需要可验证的高质量补充。
  • 共享专家处理所有 token,路由专家只处理一部分,同一全局 Batch 对应不同有效 Batch。

核心方法 ​

架构与专家优化 ​

两个维度共享 KV

Head 共享

  • 80个 Query Head 共用 8组 KV Head,先通过 GQA 减少 KV 副本。

跨层共享

  • CLA 让相邻 2层共享 KV Cache,在 Head 共享基础上进一步减半。
  • 该配置的 KV 规模约为普通 MHA 的 (8/80) × (1/2)=5%。
  • Query 仍按层计算;共享的是用于读取历史的 KV,目标是减少长文缓存开销。
专家分工与溢出处理

混合路由

  • 1个共享专家处理所有 token,学习共通知识。
  • 16个路由专家按 token 分配,每次激活分数最高的 1个。

Recycle Routing

  • 专家达到容量上限后,把原本会被丢弃的 token 分配到其他未满专家。
  • 例:Expert 1 已满,原路由到它的 token D 改交有余量的 Expert 4。
  • 保留这些 token 的训练信号,同时避免所有专家按最大负载分配计算资源。
按有效 Batch 调整学习率

有效 Batch 不同

  • 共享专家每步接收全部 B 个 token;负载均衡时,单个路由专家约接收 B/16。
  • 因此共享专家与路由专家的梯度统计不同,不应只根据全局 Batch 设置统一学习率。

优化策略

  • 使用 AdamW,根据有效 Batch 与梯度噪声规模估计适合的学习率。
  • 对共享专家和路由专家分别设置学习率尺度,改善训练效率与稳定性。

数据与预训练 ​

1.5T 合成语料

指令生成与演化

  • 从网页、问答、代码和书籍提取知识丰富的种子,组合不同 Prompt 生成指令。
  • 改善指令清晰度,扩充低资源领域,并逐步增加题目难度。

答案生成与筛选

  • 多个领域专长模型生成答案,补充数学、代码和高教育价值内容。
  • Critique Model 检查质量,客观题用多答案自一致性排除不可靠样本。
  • 合成语料约 1.5T tokens,与自然文本一起进入 7T 预训练。
语料处理与 Tokenizer

语料质量

  • 按写作质量、教育价值和有害内容筛选,以中文、英文为主。
  • 分类标签用于控制不同数据类型的比例,并处理隐私信息。

Tokenizer

  • 128K 词表:100K tiktoken 词条 + 28K 中文词条。
  • 增加中文压缩效率,减少同一文本需要的 token 数量。
激活参数与训练数据分配

小规模探索

  • 用不同激活参数规模和训练数据量构造 IsoFLOP 对照,拟合固定算力下的模型/数据分配。
  • 计算预算纳入 MoE 激活量、Attention 开销与 Batch 效率,避免直接套 Dense 的总参数公式。
  • 在较平坦的最优区域选择 52B 激活与 7T tokens,兼顾训练效果和实际资源。

训练日程

  • 预热 → 长阶段缓慢衰减 → 最后 5% tokens 快速退火。
  • 退火阶段使用更高质量语料,学习率降到峰值的 1/10。
两阶段长度扩展

数据混合

  • 以书籍和代码等自然长文本为主,长文本约 25%、普通长度数据约 75%。
  • 保留短文本训练,扩展长度时兼顾原有通用能力。

训练设置

  • 依次训练 32K 和 256K,每阶段约 10B tokens。
  • 256K 阶段将 RoPE Base 调整到 1e9。

SFT 与偏好优化 ​

指令数据 Pipeline

提取与扩展

  • 领域模型从公开资料提取指令和参考答案,覆盖数学、逻辑、知识问答等。
  • 训练指令泛化模型,将简单指令扩成更复杂任务,定向补充薄弱类别。
  • 对候选数据做多维标签与类型平衡,减少近义重复和领域失衡。

质量筛选

  • 从 10M+ 候选中筛选 1M+ 条 SFT 数据。
  • 规则处理截断、乱码、重复和格式问题。
  • 基于 Hunyuan 70B Dense 的 Critique Model 按准确、相关、完整、有用、清晰评分。
  • 最后加入人工复核,保证任务回答符合预期。
DPO 对齐

偏好数据

  • 离线部分使用预先整理的偏好对,提供稳定的行为约束。
  • 在线部分由当前 Policy 同题生成多个答案,Reward Model 选出最优与最差回答。
  • 两类数据在同一阶段训练,使偏好样本既覆盖原有要求,也反映当前模型的错误。

稳定训练

  • DPO 外加入 Chosen 回答的 SFT Loss,避免好回答的概率随训练一起下降。
  • 使用 EMA 平滑更新,减轻 Reward Hacking 与通用能力损失。
  • 报告将该阶段置于 RLHF 小节,具体优化算法是 DPO。

实验设置(Hunyuan-Large,预训练 + SFT/DPO) ​

✍️ 实验设置

模型与训练

基础模型

  • 389B-A52B,64层,hidden=6400;共享专家 1,路由专家 16/Top-1。
  • GQA 80 Query / 8 KV;CLA 每 2层共享 KV,RoPE + SwiGLU。

数据与超参

  • 预训练 7T tokens,合成数据约 1.5T;优化器 AdamW。
  • 长上下文训练 32K → 256K,各 10B tokens,长/短文本约 1:3。
  • SFT 1M+ 条、3 epochs,lr=2e-5→2e-6。
  • SFT 正则:attention_dropout=0.1, hidden_dropout=0.2;随后进行离线/在线混合 DPO。

Scaling Law 实验

  • MoE 激活参数从 10M 到 1B,训练数据从 10B 到 100B tokens。
  • 用不同预算下的 IsoFLOP 曲线估计适合的激活参数与数据量。
评测任务与设置

Base / Instruct

  • Base:MMLU 等 5-shot、BBH/MBPP 3-shot、MATH/GSM8K 4-shot、HumanEval 0-shot。
  • Instruct:通用知识、数学、代码,及 AlignBench、MT-Bench、IFEval、Arena-Hard、AlpacaEval。
  • 对照包含 Llama3.1、Mixtral、DeepSeek,同类 Base 与 Instruct 分开比较。

长上下文

  • RULER、LV-Eval 按长度分段,覆盖到 128K;LV-Eval 使用 LLM Judge。
  • PenguinScrolls 使用真实长文、多轮、中英文任务,包含提取、定位、定性分析和数值推理。

关键结果(Hunyuan-Large-Instruct + SFT/DPO) ​

🍑 关键结果

通用能力与后训练

Base 能力

  • MMLU 88.4,对照 Llama3.1-405B 85.2;MATH 69.8,对照 53.8。
  • 说明 52B 激活的 MoE 配合高质量数据,可以取得较强基础能力。

Instruct 效果

  • MMLU 89.9、MATH 77.4、HumanEval 90.0,均高于报告中的 Llama3.1-405B-Instruct。
  • Arena-Hard 81.8、AlpacaEval-2.0 51.8,开放式指令与偏好任务表现较强。
  • GPQA-Diamond 42.4,低于 Llama3.1-405B-Instruct 51.1,高难科学推理仍是短板。

训练经验

  • 报告发现适当 Dropout 对 MoE SFT 更有帮助,强调大容量稀疏模型同样需要控制过拟合。
  • Chosen SFT Loss 直接保留好回答的学习信号,补充仅拉开偏好差距的 DPO 目标。
长文稳定性与实际任务

长度变化

  • RULER 的 64K~128K 组:Hunyuan 89.53,Llama3.1-70B-Instruct 86.48。
  • 在更短区间,对照模型略高;Hunyuan 的优势主要体现为超长输入下退化较小。
  • LV-Eval 的 64K~128K 组:67.87 对 61.57,含干扰信息的长文问答也改善。

真实文档

  • PenguinScrolls 总分 85.23,对照 69.37;信息定位、定性分析和数值推理均改善。
  • 数值推理为 67.46,低于自身信息提取 91.14,说明读到信息之后的计算仍更困难。

未来方向 ​

长上下文与 MoE 后续研究

报告方向

  • 开放模型与 PenguinScrolls,借助真实文档、多轮和多语言评测继续优化长文本能力。
  • 将 MoE Scaling Law 与训练经验用于后续模型的规模和数据预算分配。

笔记归纳

  • 重点补充科学推理与长文数值推理数据,避免把信息检索能力等同于复杂推理能力。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026