变化点
2026.01 · LongCat-Flash-Thinking-2601
- 扩大可验证环境和 RL 任务,加入噪声课程增强鲁棒性。
- 在推理端增加 Heavy Thinking 并行探索,扩展高难任务能力。
2025.09 · LongCat-Flash-Thinking
- 加入推理 MidTrain、领域 RL 与参数融合,再进行通用 RL。
- DORA 支撑异步多轮交互训练。
2025.09 · LongCat-Flash
- 引入零计算专家,按 token 动态分配计算量。
- ScMoE 重叠通信与计算,提高 MoE 推理效率。
(2601) LongCat-Flash-Thinking-2601 (环境扩展、噪声 RL、Heavy Thinking)
🌺 论文摘要
参考链接
问题背景
- Agent 长程交互数据稀缺;工具依赖、环境故障和用户表达差异限制跨场景泛化。
- 多环境耗时不均,容易出现异步训练等待、数据失衡和上下文溢出。
核心方法
- 数据与环境:合成 Agent 轨迹做 MidTrain / 冷启动;工具依赖图扩展为
20+领域、上万可执行环境。 - 多环境 RL:GSPO、难度课程、动态预算与过采样;逐步加入指令、工具噪声,训练异常恢复。
- 系统与推理扩展:DORA 支持异步交互;Heavy Thinking 并行探索后汇总,并对汇总阶段单独 RL。
模型效果(560B-A27B,领域 RL + 融合)
- BrowseComp
56.6 → 73.1,对应无/有上下文管理;τ₂ Avg88.2,VitaBench29.3。 - IMO-AnswerBench 普通/Heavy
78.6 / 86.8;SWE-bench Verified70.0,R2E-Gym、Avg@5。
重要结论
- 噪声训练使 VitaBench-Noise
13.3 → 20.5,同时保持正常任务表现,鲁棒性可直接训练。 - 扩环境必须同时维护工具依赖和状态一致性,否则正确行为也可能得到错误负奖励。
核心贡献
- 可验证环境扩展、异步多环境 RL、噪声训练和 Heavy Thinking 的完整训练方案。
未来方向
- 改进异步样本时效管理,开放噪声与随机任务评测,进一步平衡长任务能力和计算成本。
问题背景
数据与环境
- 常规文本缺少主动工具调用、规划和状态跟踪,直接 RL 容易消耗大量无效探索。
- 随机增加工具会破坏依赖和数据库状态,使可解任务变为不可解任务。
训练与部署
- 搜索、代码和多工具任务耗时差异大,同步 batch 被最慢样本拖住。
- 真实用户表达含糊、工具会失败;只在理想环境训练的策略缺少恢复能力。
核心方法
数据与环境构建
文本流程重构
- 从教程、说明和多步流程提取工具 schema,转成多轮用户—Agent 交互。
- 工具拆解:把部分参数藏到环境中,要求模型先查询,再执行原操作。
- 决策扩展:在关键动作处生成候选,让模型比较后选择,显式监督规划与决策。
环境驱动合成
- 实现轻量 Python 工具环境,以参数依赖建立有向图,采样有效执行链。
- 由执行链反向生成用户需求与模拟器提示,执行代码并检查数据库最终状态。
- 将复杂目标拆解与正确首步配对,补充粗到细的规划监督。
通用推理
- 用 K-Center-Greedy 保持样本覆盖,再以滑动窗口 PPL 强调局部难点。
- 每条样本取
512-token窗口的最大平均 PPL,避免长序列平均掩盖关键困难位置。 - 从大语料中选取
210K通用思考样本。
Agent 轨迹
- Coding:要求任务修复且无回归,过滤无效动作;压缩早期步骤,保留长程调试。
- Search:检查问题全部约束,排除凭局部证据碰巧猜对的轨迹。
- Tool-use:覆盖
33类领域冷启动数据;验证最终状态,Mask 失败调用和格式错误的 loss。 - 保留完整历史让模型理解失败语境,但不把错误动作当作正确监督。
领域到可执行工具
- 领域定义 → 工具集 → 统一数据库 schema → 工具代码与状态实现。
- 用单元测试和 Debug Agent 修复,随后构建工具依赖图;每领域包含
60+工具。
任务与状态初始化
- 先采样一条有效工具链,依次创建它所需的数据库对象与前置状态。
- 基于完整工具链生成任务、用户画像和 rubric,并检查可接受的正确解及错误解。
保持可解性的扩展
- 从种子链做 BFS,只有依赖已满足的新工具才加入环境。
- 根据图复杂度、剩余工具和替代路径难度,决定是否加入更多种子链。
- 最终每环境至少
20个工具;增加选择难度的同时,保留可执行正确路径。

多跳关系
- 从 Wikipedia 长尾实体扩展关系图,采样连通子图生成 QA。
- 模糊实体、地点、时间等直接线索,要求模型搜索关系链;验证答案与条件一致。
多条件歧义
- Entity Agent 提取实体属性,Question Agent 抽取部分属性出题。
- Verification Agent 搜索核对全部约束,Answer Agent 尝试找其他满足条件的答案。
- 若发现多解,追加属性重写问题,直到答案唯一;用解题成功率划分难度。
RL 算法与训练策略
训练目标与课程
- 使用 GSPO 的序列级重要性比率和组内优势,主要依赖结果监督,并放宽长轨迹惩罚。
- 课程同时考虑成功率和能力依赖:基础工具调用 → 多步规划 → 组合约束决策。
预算分配
- 根据当前成功率等训练状态估计任务价值,用堆式贪心分配 rollout 预算。
- 多环境异步训练中,用历史成功率决定过采样次数,各重复组独立计算优势。
- 对低吞吐、较难领域增加配额,避免快速领域占满 batch 或等待慢领域形成空转。
Self-Verification
- 生成训练停滞时,启动辅助验证阶段,让模型判断自己的 on-policy 轨迹。
- 聚焦困难样本,并把验证信号与对应生成质量关联,促进生成而非只提高判题分数。
压缩
- 上下文超过
80K时,由模型总结历史工具结果,保留关键证据后继续。 - 冷启动加入
15K高质量摘要样本,使压缩后的证据仍能支持后续决策。
重置
- 达到最大交互轮次时,清空历史,从原问题与系统提示重新开始。
- 训练中逐渐提高丢弃阈值,让困难任务获得更多推理步骤。
- 摘要维持已有探索,重置提供新的搜索机会,两者按不同触发条件组合。
噪声类型
- Instruction Noise:用户表达含糊、交互习惯变化,需要澄清和约束确认。
- Tool Noise:执行失败、返回不一致、部分信息缺失,需要重试、诊断与恢复。
课程控制
- 从轻微扰动开始,根据当前鲁棒性逐步增加噪声难度与种类。
- 始终保留任务可解性,避免将环境被破坏造成的失败作为模型负反馈。
- 用同一任务在正常/噪声环境的差距衡量鲁棒性,而非只看训练奖励。
训练系统与推理扩展
流水线
- RolloutManager 管采样,SampleQueue 管样本时效,Trainer 管经验处理与更新。
- 生成、环境执行、奖励计算按单样本流式推进,完成即入队,不等待整批结束。
- 多版本 rollout 与训练并行;较旧版本限制新增请求,控制样本滞后。
环境扩展
- 轻量全局 Manager 管元数据,多个 Controller 分别管理虚拟 rollout 组。
- 基于 CPU 空闲状态放置环境,支持约
400台机器 / 32K并发环境。
PD 分离
- 长输入的 prefill 与持续 decode 放在不同设备组,避免新请求打断生成图执行。
- KV Cache 分块异步传输,和后续块计算重叠。
CPU Cache
- 设备显存紧张时将 KV Cache 换到 CPU,再按需恢复,避免反复重算长历史。
- 结合请求并发控制,减少长尾 rollout 对设备利用率的影响。
两阶段推理
- Thinking Model 并行生成多个候选,扩大探索宽度。
- Summary Model 比较候选、反思并整合答案;并非仅按答案多数投票。
- 多轮场景保留共享对话历史,各轮候选只保留回答内容,再由汇总模型给出统一回复。
训练与模型
- 汇总阶段额外进行 RL,提高筛选、纠错和整合能力。
- Thinking 与 Summary 可共享参数,也可使用不同模型;Heavy 需要额外推理预算。

结构转换
- 校准 attention 层重要性,将约一半层换成 SSA,其余保留完整 MLA。
- SSA 每层只看
1个 sink块 + 7个局部块,每块128 tokens,共1024 tokens。 - 完整层与局部层交替传播信息,保留跨远距离关联。
继续训练
- 替换后继续长上下文 MidTrain,并用 YaRN 扩至
1M。 - 这是额外发布的 ZigZag 模型;主模型表中的全部结果并非在该结构下取得。
实验设置(LongCat-Flash-Thinking-2601)
模型与阶段
560BMoE,平均激活27B;继承 Flash-Chat 的基础结构与预训练分布。- MidTrain:
500B tokens / 32K→128K,另40B / 256K;冷启动后分领域 RL,再融合。 - Tool-use 领域内部联合多环境训练;DORA 支持异步 GSPO 与领域过采样。
推理协议
- 默认
temperature=1.0, top_p=1.0, top_k=-1。 - 数学以代码工具辅助推理为主:IMO-AnswerBench
Avg@4,其他数学任务Avg@16。 - SWE-bench Verified:R2E-Gym、
Avg@5;LCB 使用2024.08~2025.05的454题 / Avg@4。
Agent 评测
- BrowseComp 分别测试有/无上下文管理;RWSearch
200题,各模型统一无上下文管理。 - τ₂ 使用 GPT-4.1 用户模拟器并修复 airline 问题;Vita 使用更新后的 verifier。
- Noise 测试在同一任务注入扰动;随机复杂任务每次
100题、4+领域,重复三次统计。
关键结果(LongCat-Flash-Thinking-2601,领域 RL + 融合)
噪声训练直接有效
- VitaBench-Noise:无噪声训练
13.3→ 有噪声训练20.5;正常 VitaBench28.6 → 29.3。 - τ₂-Noise:
62.2 → 67.1;正常 τ₂87.1 → 88.2。 - 噪声收益主要体现在异常环境,正常表现也保持稳定,支持将恢复能力纳入训练目标。
跨环境泛化
- 随机复杂任务
35.8,报告对照最高;VitaBench29.3,仍低于 Gemini 3 Pro31.5。 - 噪声 Vita
20.5仍低于正常29.3,扰动造成的能力下降尚未消除。
上下文管理
- BrowseComp
56.6 → 73.1,对应无/有上下文管理;混合压缩与重置有利于扩大搜索预算。 - 摘要阈值消融中
80K优于20K和100K,过早压缩和过晚压缩都可能损失效率。 - RWSearch
79.5,低于 GPT-5.282.0,在真实复杂搜索中接近其表现。
Heavy Thinking
- IMO-AnswerBench
78.6 → 86.8;HMMT-2593.4 → 97.5。 - 工具辅助 AIME-25
99.6 → 100.0;GPQA80.5 → 85.2,汇总推理在困难题上更有价值。
代码与系统
- SWE-bench Verified
70.0,低于表中 DeepSeek-V3.273.1;LCB82.8,保持较强算法代码能力。 - DORA 在不同生产任务中约为同步训练的
2~4倍速度。 - 独立 ZigZag 变体最高约
1.5倍推理加速,并支持1M长上下文。
未来方向
作者计划
- 探索更宽松的时效控制与 staleness-aware 稳定化,提高异步训练利用率。
- 开放噪声注入流程,将随机复杂任务整合进评测平台。
笔记归纳
- 扩展具有真实状态变化的环境,同时持续检查任务可解性和 verifier 一致性。
- 联合优化 Heavy 并行宽度、汇总成本与上下文管理,减少重复探索。
- 分析噪声类型与失败阶段,针对仍有明显性能下降的工具恢复和长程规划继续训练。
(2509) LongCat-Flash-Thinking (领域 RL、DORA、参数融合)
🌺 论文摘要
参考链接
问题背景
- 通用预训练缺少多样的长 CoT;混合领域 RL 中,输出长度和难度差异造成异步数据失衡。
- 长尾 rollout、旧策略样本和推理/训练引擎差异,共同影响大规模 RL 的效率与稳定性。
核心方法
- 数据与冷启动:推理增强 MidTrain + 通用、Lean4、工具推理 SFT;比较有无工具收益筛选任务。
- 领域 RL:STEM、Code、Agentic 独立训练专家,参数融合后再做通用 PPO。
- 异步训练系统:DORA 按策略版本流式采样;结合概率修正、样本时效与异常 Mask,稳定多版本训练。
模型效果(560B-A27B,领域 RL + 融合 + 通用 PPO)
- AIME-25
90.6,LCB79.4;MiniF2F-TestPass@1=67.6。 - AIME-25 使用工具后,输出
19653 → 6965 tokens,准确率90.6 → 90.0。
重要结论
- 工具可承担部分计算,显著缩短模型输出;更长 CoT 并非唯一的推理扩展路线。
- 专家融合在多个领域保留或略超专家表现,支持将训练日程差异与最终单模型部署分开处理。
核心贡献
- 领域并行 RL 与参数融合路线,以及保持采样版本一致的异步训练系统 DORA。
未来方向
- 笔记归纳:优化跨领域能力融合、旧样本利用率与训练稳定性的取舍,增强真实 Agent 任务。
问题背景
推理模式不足
- 通用语料中 STEM、代码比例有限,显式长 CoT 更稀缺,后训练容易形成单一解题模式。
领域与系统差异
- STEM、Code、Agent 的输出长度分布不同,异步混训会使不同 batch 的领域比例明显波动。
- 等待最长回答会降低利用率;强行切换未完成回答的模型版本又需要重新 prefill。
核心方法
训练数据与冷启动
推理语料
- 加入数学、物理、化学与算法编程问题,优先多步逻辑推理而非简单事实问答。
- 规则与 LLM Judge 联合清洗、去重和去污染,混合原有通用语料,保留基础知识能力。
能力检查
- 先在相同结构的小 MoE 上比较
pass@1~pass@128,再将有效配方用于主模型。 - 同时关注一次回答与多次探索能否成功,避免仅优化输出格式而不扩展解题范围。
问题筛选
- 排除题目不完整、答案不一致和过易样本;代码题要求至少
5个测试和可执行评测脚本。 - 用专家成功率确定难度分布,再进行 rejection sampling,保留高质量 CoT。
语句形式化
8B Autoformalizer将自然语言题目与答案转为 Lean4 statement。- 编译检查语法,再由模型核对原题含义,避免形式上合法但题意被改变。
Expert Iteration
- 先用现有 prover 获得可验证证明,再补充自然语言推理,组成
statement + thinking + proof。 - 当前 prover 尝试未解决问题,Lean4 验证成功后加入数据集。
- 聚合新旧数据重新训练 prover,迭代扩充可解题范围。
有/无工具对照
- 同一问题分别生成有工具、无工具轨迹,比较两组成功率。
- 保留无工具较难、有工具可解、两者差距足够大的任务,避免“看似调用工具,实际不需要”。
轨迹合成
- 连接真实 API、MCP 和模拟工具,生成候选交互轨迹。
- Judge 检查答案、逻辑一致性与工具使用完整性,保留合格轨迹。
- 按调用次数、顺序/并行依赖和规划深度分层,供后续课程训练。
领域 RL 与能力融合
可验证任务
- STEM:Reasoning GenRM 比较问题、参考答案与模型答案,识别等价表达和复杂符号结果。
- Code:sandbox 执行测试,支持
20+语言,一次编译供多个测试复用。
开放任务
- 从 SFT 模型训练判别式 RM,偏好数据由人工和模型共同标注。
- 长 CoT 任务只评价最终回答,避免把推理文本风格当作最终质量。
训练数据
- STEM 去掉不适合当前验证方式的多问、选择、判断题;Code 统一输入输出测试格式。
- 以 SFT 模型多次采样,保留有对有错的问题;Code 进一步排除歧义题与错误测试。
独立训练日程
- STEM:固定
64K,逐渐提高难度,动态调整正优势裁剪上界。 - Code:
48K → 56K → 64K,输出长度 90 分位接近上限时扩展。 - Agentic:固定
48K,使用规范 think/tool-call 标签和调用格式奖励。
Task Vector 融合
- 计算每个专家相对同一 SFT 的参数增量
Δθᵢ=θRLᵢ−θSFT。 - Normalization:对齐增量幅度,避免某个领域因更新量大占主导。
- Dropout:删除冗余增量;Erase:去掉方向冲突中的少数方向,缓解参数干扰。
通用对齐
- 融合后整理开放与合成任务,聚类去重、筛选困难高质量问题。
- 最后进行通用 PPO,恢复写作、指令遵循和安全等基础行为。

异步 RL 系统
两个设备组
- Standalone Group:主要执行 rollout;Elastic Group:在采样、经验计算、训练间切换。
- 样本完成即进入下一阶段,不等待最长回答;空闲训练设备可临时加入生成。
同回答保持同版本
- 保留多个旧策略,未完成回答继续使用自己的采样版本,复用或迁移已有 KV Cache。
- 负载均衡同时迁移权重和 Cache;过旧版本退出,相关样本按时效规则处理。
- 更新后逐层同步权重,开始新版本采样。
大规模优化
- Streaming RPC 支持大量交互,图编译减少 kernel 调度开销。
- 高度 Expert Parallel 配合通信计算重叠,提高大 MoE 的 rollout 吞吐。
策略版本差异
- 当前策略与产生样本的旧策略不同,需要重要性比率与裁剪限制更新。
- 去掉 GRPO 的 KL 项;按 token 聚合,用全局最大生成长度归一化,缓解长度偏置。
- 三重裁剪分别控制负优势的大幅更新和正优势的探索上界。
引擎数值差异
- 同一权重在推理与训练引擎中的 logprob 可能不同,不能全归因于策略更新。
- 以训练引擎重算旧策略 logprob,再用截断重要性权重修正与采样引擎的差异。
- 前者约束“模型改了多少”,后者校正“同一模型的两套执行结果差多少”。
有效组与时效
- 过滤组内全对、全错任务,保留存在学习信号的样本组。
- 在线有放回采样;额外生成的数据进入 replay buffer,按比例与新样本混合并打散。
- 超过最大 staleness 的样本重新生成,控制旧数据复用带来的偏差。
Incomplete-Signal Masking
- Sandbox 评分错误的样本屏蔽,避免系统故障被当作模型失败。
- 非重复行为但因长度上限截断的样本也屏蔽,避免把未完成输出直接当作负例。
实验设置(LongCat-Flash-Thinking)
模型与训练
- 从 LongCat-Flash-Base 开始,
560B总参数、平均激活27B。 - SFT:
context=48K, AdamW, lr=3e-5, 2 epochs;RL 计算投入接近预训练的20%。 - STEM、Code、Agentic 分别 RL,随后参数融合与通用 PPO。
评测协议
temperature=1.0, top_p=0.95, top_k=-1。- AIME、HMMT
Mean@32;GPQAMean@16;LCB2024.08~2025.05 / Mean@4。 - MiniF2F-Test
244题,Lean4 验证,统计Pass@1 / 8 / 32。 - 工具任务覆盖 SWE-bench、BFCL、τ₂、VitaBench;另评知识、指令与安全。
对照设计
- 小规模 MidTrain 消融比较推理数据比例;奖励模型比较规则、无推理 GenRM 与有推理 GenRM。
- 分别检查领域专家与融合模型,以及同一模型有/无工具时的正确率和输出长度。
关键结果(LongCat-Flash-Thinking,领域 RL + 参数融合 + PPO)
推理数据与奖励
- 小 MoE 的推理增强 MidTrain 在
pass@1~pass@128均改善,说明收益包含多次探索的可解题范围。 - 人工标注测试集上,规则 RM
80.9%、无推理 GenRM94.0%、Reasoning GenRM98.8%。 - 复杂表达需要语义验证,单纯字符串规则容易把正确答案判错。
专家融合
- AIME-24 专家/融合
93.6 / 94.3;LCB78.0 / 80.1;τ₂ Avg70.3 / 70.6。 - 融合阶段在多个领域保留专家能力,缓解分别训练与单模型部署之间的冲突。
工具使用效率
- AIME-25 输出
19653 → 6965 tokens,减少约64.5%;准确率90.6 → 90.0。 - 将适合执行的计算交给工具,可节省模型输出;完整延迟还需计算工具执行时间。
推理与形式证明
- AIME-25
90.6、HMMT-2583.7;LCB79.4,接近 GPT-580.6。 - MiniF2F-Test
Pass@1=67.6,高于 DeepSeek-V3.149.6;Pass@32=81.6。 - Lean4 迭代证明数据形成了突出的专门能力。
Agent 与通用任务
- SWE-bench
59.4、τ₂ Avg74.0、VitaBench29.5;不同 Agent 场景仍有明显差异。 - MMLU-Pro
82.6、IFEval86.9,领域推理优势没有覆盖所有通用任务。
系统效率
- 图编译带来约
1.5倍rollout 加速;完整 DORA 系统相比同步训练超过3倍。 - 系统收益来自减少长尾等待与角色空闲,为扩大 RL 计算投入提供条件。
未来方向
能力融合
- 分析哪些领域最容易在融合后退化,联合调整任务增量、数据配比与最后的通用 RL。
- 将工具必要性筛选扩展到真实搜索、代码维护和多轮业务任务。
异步稳定性
- 联合控制 replay 比例、策略 staleness 与概率修正,提高旧样本利用率。
- 在相同总计算预算下比较工具推理与更长 CoT,明确延迟、成本和成功率的取舍。
(2509) LongCat-Flash (零计算专家、ScMoE、动态计算)
🌺 论文摘要
参考链接
问题背景
- 不同 token 难度不同,固定激活专家数浪费计算;大规模 MoE 的通信又限制实际吞吐。
- 基模扩展需要同时解决初始化、路由稳定、数据配比及真实 Agent 任务供给。
核心方法
- 动态架构:零计算专家与普通 FFN 共同参与路由,平均激活
27B;ScMoE 扩大计算通信重叠。 - 预训练与扩展:约
20T预训练 → 推理/代码 MidTrain →128K扩窗;超参迁移与路由稳定化支持模型增长。 - 后训练数据:覆盖推理、SWE、工具、长文和安全;按工具依赖、信息处理与交互复杂度合成 Agent 任务。
- 训练与部署系统:确定性训练与故障检测控制恢复成本,配合 SBO、MTP 和调度优化吞吐。
模型效果(LongCat-Flash-Chat,非 Thinking)
- SWE-bench Verified
60.4、TerminalBench39.5、IFEval89.7;VitaBench24.3。 128×H800、约5K上下文的低延迟配置,每用户约100 tokens/s。
重要结论
- 匹配平均计算量的消融中,动态专家降低验证 loss;并非仅通过增加计算获得收益。
- ScMoE 在多种模型规模和注意力结构中保持相近 loss,主要收益来自通信与计算重叠。
核心贡献
- 将动态 MoE 计算、稳定训练和低延迟部署结合,并开放具有 Agent 能力的基座与 Chat 模型。
未来方向
- 笔记归纳:优化动态路由与服务负载协同,补强长上下文推理和基础代码生成。
问题背景
计算分配固定
- 易预测 token 和关键推理 token 都使用相同专家预算,难以按上下文分配算力。
稀疏但仍受通信限制
- token 必须先分发到专家再计算,dispatch/combine 形成串行等待。
- 模型变大后,低秩注意力、细粒度专家和路由器的数值尺度也更容易失衡。
核心方法
动态 MoE 架构
专家池
- 每层
512个 FFN专家 + 256个零计算专家,共同选取Top-12。 - 零计算专家输出输入本身
E(x)=x,不是零向量,也不执行 FFN。 - Top-k 数量固定,选中的实际 FFN 数量随 token 变化。
平均预算控制
- 依据近期使用量调整 FFN 专家的路由 bias,使平均激活约
8个真实专家。 - 零计算专家不单独更新 bias;FFN 使用率达到目标时,剩余份额自然分给恒等专家。
- 再加入设备级负载平衡,避免某些 EP 设备收到过多 token。
结构
- 每个模型 block 包含两组 MLA 及 Dense FFN,并通过跨层 shortcut 连接 MoE。
- 前一块 Dense FFN 的计算可与当前 MoE 的分发、聚合通信并行。
执行
- 训练时再按 token 切块,扩大不同 chunk 之间的重叠。
- 推理采用 Single Batch Overlap,不必依赖两个 batch 交错才能隐藏通信。
- 节省的是设备等待时间,与零计算专家减少实际 FFN 计算互补。
MLA
- Query、KV 低秩路径与 RoPE 路径来源维度不同,初始化方差容易不一致。
- 按模型维度与压缩维度的平方根比缩放低秩路径,使注意力各分量处于可比较尺度。
细粒度专家
- 专家拆得更细时,gate 权重与中间维度同时缩小,聚合输出方差也下降。
- 按拆分系数补偿聚合输出,减少专家数量变化对初始化尺度的影响。
预训练与稳定扩展
宽度迁移
- 在宽度
768的 proxy 搜索初始化与学习率,再按s=8迁移至6144。 - Embedding 保持学习率与初始化方差;Hidden / Unembedding 的两者按
1/s缩放。 - 迁移时保持深度、稀疏度和 batch 等其他结构条件一致。
模型增长
- 先训练
14层同构模型,再整体堆叠两份成为28层。 - 保留样本计数和学习率日程,继续训练;增长时机避免前驱模型过度优化。
Router 平衡
- LM loss 推动专家分工,负载平衡 loss 推动均匀分配;后者过强会使路由失去输入差异。
- 监测专家权重相似度与两类梯度范数比,控制负载平衡梯度不压过 LM 梯度。
Hidden z-loss
- 对最终 LayerNorm 前的极大 hidden 激活施加很小惩罚,降低 BF16 数值不稳定风险。
Adam ε
- 大模型、大 batch 下梯度尺度变小,ε 过大会干扰自适应更新。
- 使用
ε=1e-16,使其远小于观测到的梯度 RMS。
通用预训练
- 网页提取、分类器粗筛、流畅性/完整性细筛、MinHash 去重,并清理模板重复。
- 第一阶段按质量与多样性采样;第二阶段逐步提高 STEM + Code 至约
70%。 - 监控通用验证集 PPL,避免突然降低通用语料比例导致能力退化。
推理与代码 MidTrain
- 从知识图谱遍历、组合概念生成复杂问题,迭代增加难度与 CoT 质量。
- 联合文本推理和代码执行验证,构建高质量合成数据,并复用筛选后的预训练材料。
长上下文
80B tokens将8K→32K,再以20B tokens扩至128K。- 加入书籍和按仓库组织的代码,保留跨文件关系;长文本数据约占混合中的
25%。 - Web / Code 做 13-gram 去污染,合成 QA 再以语义相似度排除测试重叠。
多领域后训练数据
数学与逻辑
- 用不同数学专家 persona 生成问题,多模型答案一致性与推理 GenRM 联合验证。
- 逻辑题控制难度,去掉强推理模型也无法解决的题,将选择题转为填空以减少猜测。
代码与仓库任务
- 公共题、GitHub 片段、论坛与 Evol-Instruct 扩展题库,按主题和难度平衡。
- 筛除题意不清、重复、乱码和错误响应。
- 构建上万个含测试的 Docker 环境,Agent 搜索、定位、修复,保留数千条全测试通过轨迹。
难度控制
- 信息处理:约束数量、推理节点和依赖链长度。
- 工具集:工具依赖图的节点数量、连接密度。
- 用户交互:表达风格、配合程度、信息披露方式,要求少打扰但获取必要信息。
任务生成
- UserProfileAgent 定义用户状态;ToolSetAgent 构建
40领域 / 1600应用 / 80K模拟工具。 - 从工具图随机游走采样子图,InstructionAgent 生成满足复杂度要求的任务。
- EnvironmentAgent 补充商品、地点、时间等状态,并加入容易混淆的选项。
- RubricAgent 生成验收清单;Validator / Deduplicator 检查可评估性与任务重复。
轨迹验收
- 滑动窗口检查长轨迹,持续更新清单完成状态。
- 冷启动保留多样解法,后续任务选择强调值得持续探索的难度。
指令与长文
- 多约束任务先检查冲突;对难以直接合成的约束,由合格答案反向生成问题。
- 长文包括阅读、表格问答和自定义任务,组合相关片段训练多跳推理与跨轮信息利用。
安全与知识不足
- 数据区分不同风险类别与响应方式,经人工复核再作为训练目标。
- 上下文不完整时训练适当说明信息不足,减少缺少证据仍给出确定回答。
训练系统与推理部署
算子与 SDC
- 对照高精度参考检查算子误差;重算敏感算子,以 bitwise 差异检测 Silent Data Corruption。
- 固定 Attention backward、ScatterAdd 等归约顺序,保证相同训练步骤可重现。
并行与恢复
EP=32、CP=8,结合 PP / DP 与 V-ZB 流水线,降低通信和显存峰值。- 异步 checkpoint、自动日志检测与故障恢复,减少大集群训练中断。
模型侧
- SBO 将 dispatch 与 Dense / QKV 计算重叠,combine 与 attention / Dense 重叠。
- 轻量单 Dense MTP 层提出候选,主模型验证;MLA 压缩 KV Cache。
系统侧
- Target、Verification、Draft 合入一张 CUDA Graph,减少多阶段 kernel 启动。
- 多步重叠调度隐藏 CPU 开销;PD 分离并逐层传输 KV,分别优化输入处理和生成。
- FP8 分块量化,按层保留敏感部分的更高精度;零计算专家无需远程 FFN 通信。
实验设置(LongCat-Flash)
模型配置
560B,平均激活27B;28 blocks、hidden=6144、词表=131072。- MLA:
64 heads、KV压缩512、Query压缩1536;512 FFN + 256零计算专家 / Top-12。
训练阶段
- 通用预训练约
20T tokens / seq_len=8K,随后推理代码增强与长上下文扩展。 - 后训练覆盖 reasoning、coding、tool-use 和 general;报告主要展开数据构建,未完整给出优化配方。
对照设计
- 动态专家消融匹配平均 FFN 计算量;ScMoE 在 MLA、MHA、GQA 和不同规模下比较。
- 分别评估 Base 与非 Thinking Chat,覆盖知识、推理、代码、SWE、工具和指令任务。
- 部署测试使用 H800,报告不同吞吐/延迟配置;不能合并为同一运行点。
关键结果(LongCat-Flash,预训练 + 多领域后训练)
动态计算
- 匹配平均
8个 FFN专家时,加入零计算专家的验证 loss 更低。 - 实际激活量随 token 明显变化,平均预算仍稳定,支持按上下文分配计算。
通信重叠
- 多组 ScMoE 消融的 loss 接近基线;训练中未被隐藏的通信占比
25.3% → 8.4%。 - 性能收益主要来自执行效率,结构调整没有显示明显质量损失。
训练稳定
- MLA 尺度校正改善收敛;Model Growth 优于随机初始化;hidden z-loss 压低异常激活。
- 大规模训练约
30天完成,时间可用率98.48%,减少故障造成的计算浪费。
Base 与 Chat
- Base MMLU-Pro
70.3、GPQA51.1,展现较好的激活参数效率。 - Chat IFEval
89.7、COLLIE57.1、Meeseeks-zh43.0,指令与多轮交互是较强项。
代码与 Agent
- SWE-bench Verified
60.4、TerminalBench39.5;后者接近 Claude 4 Sonnet40.7。 - VitaBench
24.3,高于表中 Sonnet23.0;工具交互形成较突出能力。 - HumanEval+
88.4,低于 Qwen394.5;GraphWalks-128K51.1,长文复杂推理仍较弱。
推理效率
128×H800、平均5K上下文:低延迟配置100.5 tokens/s/用户,对应804 tokens/s/GPU。- 同硬件的高吞吐配置可达
3785 tokens/s/GPU,但每用户速度为35 tokens/s。 - 服务部署需要按交互延迟和批量吞吐目标选择运行点。
未来方向
作者指出的系统问题
- 算子数值误差与最终能力的关系仍难低成本评估,需要更有效的精度评测方法。
笔记归纳
- 让动态专家预算与实际服务负载协同,避免平均算力受控但局部设备仍拥堵。
- 加强基础代码生成、长上下文多跳推理,缩小不同任务之间的能力差距。
- 在真实工具延迟下优化完整 Agent 耗时,区分模型生成加速和任务完成加速。