腾讯系列
📅 发表于 2025/12/31
🔄 更新于 2026/08/05
👁️ — 次访问
📝 5196 字
⏳ 16 分钟
2026.08 · Hy4 preview
Gated DSA + IndexCache,复用历史选择结果,支持 1M 上下文。2026.07 · Hy3
参考链接
架构优化
770B-A49B、1M 上下文;每 token 选择 8 个路由专家并使用共享专家。Top-2048 历史位置;IndexCache 跨层复用位置索引,减少重复筛选。4 条残差流;额外 1 层 MTP 生成 Draft Token,由主模型批量验证。163 名专家评审 203 项任务,采用匿名并排比较与四分制评分。2.99,Kimi K3 2.94、GLM-5.3 2.92,该任务集上小幅领先。51.2%胜 / 7.9%平 / 40.9%负;仍有较多任务不占优。参考链接
模型与训练
295B-A21B MoE、256K 上下文;GQA + MTP,提供 no_think / low / high。50+ 产品反馈扩展 SFT 与 RL 数据,针对工具错误、知识混淆和多轮约束丢失。后训练重点
270 名专家工作盲测:Hy3 2.67/4,GLM-5.1 2.51/4。12.5% → 5.4%,常识错误率 25.4% → 12.7%。17.4% → 7.9%,体现跨轮约束保持和意图跟踪的改善。4% 以内。🌺 论文摘要
参考链接
问题背景
核心方法
80B-A13B MoE + GQA;20T 基础训练、300B 退火,再扩展到 256K。150K 数学/代码/逻辑/科学任务,Verifier 与 Sandbox 提供奖励。20K 格式;Dual-CoT 统一快慢思考。模型效果(A13B-Instruct,快思考 → 慢思考)
30.6 → 87.3;BFCL v3:65.9 → 78.3。55.0,高于报告中的 Qwen3-A22B 48.4。重要结论
12/14 项评测上改善,激活参数由 52B 降至 13B。核心贡献
未来方向
激活规模与成本
推理深度与任务需求
MoE
32层,80B 总参数,13B 激活;共享专家与路由专家的中间维度相同。1个共享专家始终激活,从 64个路由专家中选择 Top-8。Attention 与词表
32个 Query Head / 8个 KV Head,减少 KV Cache。hidden=4096, FFN=3072,SwiGLU;沿用 Hunyuan-Large 的 128K 词表。清洗流程
STEM 与难度分级
250B tokens 高质量 STEM 语料。基础训练与快速退火
20T tokens,固定 4K 长度;学习率先预热、再余弦下降,最后保持最低值。300B tokens,上下文扩到 8K,用更低学习率巩固能力。长上下文扩展
32K、256K,使用 NTK-aware 位置编码。数学与代码
逻辑与科学
奖励来源
0/1,兼容等价格式、单位和同义表达。36种语言,通过分布式 CPU 集群并发运行。可学习样本
任务混合
Agent 合成
User、Planner、Tool、Agent、Checker 五角色引擎生成多方交互。30余类 System Instruction,组合工具、动作和回答格式,形成 20K 格式组合。GRM
16个子主题、30余个评分服务,通过动态采样平衡任务。Agent 与长对话
1,否则 0,保证调用可解析。统一格式
推理选择
/no_think 与 /think 控制;未指定时默认慢思考。✍️ 实验设置
基础模型与预训练
80B-A13B,32层,共享专家 1、路由专家 64/Top-8。20T tokens, seq_len=4K, peak_lr=3e-4。13.5T tokens 内余弦降到 3e-5,剩余基础训练保持该值。300B tokens, seq_len=8K, lr=3e-5→8e-6。32K → 256K,NTK-aware 的 alpha=50 → 1000。推理 RL 数据与超参
150K 任务;数学:代码:逻辑:科学=2:2:1:1。10%,新增任务 90%;训练长度 24K → 32K。0.6~0.8。Base 评测
5-shot,BBH 3-shot。0-shot,MBPP 3-shot;数学 MATH 4-shot CoT。Instruct 评测
128K。吞吐测试
W16A16/KV16,输入 2048,对比不同 Batch 与输出长度。🍑 关键结果
低激活 Base
13B 激活替代 52B,12/14 项评测更好。60.20 → 67.23,MBPP 72.60 → 83.86,说明较低激活量仍能改善知识和代码能力。慢思考 Instruct
87.3,Qwen3-A22B 85.7;AIME 2025 76.8,低于对照的 81.5。63.9,低于 Qwen3-A22B 70.7;复杂代码仍有提升空间。78.3,高于 Qwen3-A22B 70.8;工具调用是本模型较突出的方向。快思考 → 慢思考
30.6 → 87.3;LiveCodeBench:27.4 → 63.9,复杂推理明显受益。65.9 → 78.3;但 ComplexFuncBench:74.0 → 61.2。长文本能力
55.0,高于 Qwen3-A22B 48.4;FRAMES 81.1,低于对照 84.0。64K~128K 组为 73.9,优于报告中 R1 65.6 与 Qwen3-A22B 66.6。报告中的不足
笔记归纳
🌺 论文摘要
参考链接
问题背景
核心方法
389B-A52B MoE,GQA/CLA 共享 KV;Recycle Routing 将过载 token 重分配到空闲专家。7T tokens,含约 1.5T 合成数据;结合 MoE Scaling Law、专家独立学习率与长上下文训练。1M+ 数据 SFT → 离线/在线混合 DPO,加入 Chosen SFT Loss 与 EMA。模型效果(Hunyuan-Large-Instruct,SFT+DPO)
89.9、MATH 77.4、HumanEval 90.0;Llama3.1-405B-Instruct 分别为 87.3、73.8、89.0。85.23,对照 Llama3.1-70B-Instruct 69.37。重要结论
64K~128K 的稳定性更突出。核心贡献
未来方向
长文缓存与路由负载
数据与优化差异
Head 共享
80个 Query Head 共用 8组 KV Head,先通过 GQA 减少 KV 副本。跨层共享
2层共享 KV Cache,在 Head 共享基础上进一步减半。(8/80) × (1/2)=5%。混合路由
1个共享专家处理所有 token,学习共通知识。16个路由专家按 token 分配,每次激活分数最高的 1个。Recycle Routing
有效 Batch 不同
B 个 token;负载均衡时,单个路由专家约接收 B/16。优化策略
指令生成与演化
答案生成与筛选
1.5T tokens,与自然文本一起进入 7T 预训练。语料质量
Tokenizer
128K 词表:100K tiktoken 词条 + 28K 中文词条。小规模探索
52B 激活与 7T tokens,兼顾训练效果和实际资源。训练日程
5% tokens 快速退火。1/10。数据混合
25%、普通长度数据约 75%。训练设置
32K 和 256K,每阶段约 10B tokens。256K 阶段将 RoPE Base 调整到 1e9。提取与扩展
质量筛选
10M+ 候选中筛选 1M+ 条 SFT 数据。70B Dense 的 Critique Model 按准确、相关、完整、有用、清晰评分。偏好数据
稳定训练
✍️ 实验设置
基础模型
389B-A52B,64层,hidden=6400;共享专家 1,路由专家 16/Top-1。80 Query / 8 KV;CLA 每 2层共享 KV,RoPE + SwiGLU。数据与超参
7T tokens,合成数据约 1.5T;优化器 AdamW。32K → 256K,各 10B tokens,长/短文本约 1:3。1M+ 条、3 epochs,lr=2e-5→2e-6。attention_dropout=0.1, hidden_dropout=0.2;随后进行离线/在线混合 DPO。Scaling Law 实验
10M 到 1B,训练数据从 10B 到 100B tokens。Base / Instruct
5-shot、BBH/MBPP 3-shot、MATH/GSM8K 4-shot、HumanEval 0-shot。长上下文
128K;LV-Eval 使用 LLM Judge。🍑 关键结果
Base 能力
88.4,对照 Llama3.1-405B 85.2;MATH 69.8,对照 53.8。52B 激活的 MoE 配合高质量数据,可以取得较强基础能力。Instruct 效果
89.9、MATH 77.4、HumanEval 90.0,均高于报告中的 Llama3.1-405B-Instruct。81.8、AlpacaEval-2.0 51.8,开放式指令与偏好任务表现较强。42.4,低于 Llama3.1-405B-Instruct 51.1,高难科学推理仍是短板。训练经验
长度变化
64K~128K 组:Hunyuan 89.53,Llama3.1-70B-Instruct 86.48。64K~128K 组:67.87 对 61.57,含干扰信息的长文问答也改善。真实文档
85.23,对照 69.37;信息定位、定性分析和数值推理均改善。67.46,低于自身信息提取 91.14,说明读到信息之后的计算仍更困难。报告方向
笔记归纳