Skip to content

LongCat 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 8689 字
⏳ 26 分钟

变化点 ​

2026

2026.01 · LongCat-Flash-Thinking-2601

  • 扩大可验证环境和 RL 任务,加入噪声课程增强鲁棒性。
  • 在推理端增加 Heavy Thinking 并行探索,扩展高难任务能力。
2025

2025.09 · LongCat-Flash-Thinking

  • 加入推理 MidTrain、领域 RL 与参数融合,再进行通用 RL。
  • DORA 支撑异步多轮交互训练。

2025.09 · LongCat-Flash

  • 引入零计算专家,按 token 动态分配计算量。
  • ScMoE 重叠通信与计算,提高 MoE 推理效率。

(2601) LongCat-Flash-Thinking-2601 (环境扩展、噪声 RL、Heavy Thinking) ​

🌺 论文摘要

LongCat-Flash-Thinking-2601 摘要

参考链接

问题背景

  • Agent 长程交互数据稀缺;工具依赖、环境故障和用户表达差异限制跨场景泛化。
  • 多环境耗时不均,容易出现异步训练等待、数据失衡和上下文溢出。

核心方法

  • 数据与环境:合成 Agent 轨迹做 MidTrain / 冷启动;工具依赖图扩展为 20+领域、上万可执行环境。
  • 多环境 RL:GSPO、难度课程、动态预算与过采样;逐步加入指令、工具噪声,训练异常恢复。
  • 系统与推理扩展:DORA 支持异步交互;Heavy Thinking 并行探索后汇总,并对汇总阶段单独 RL。

模型效果(560B-A27B,领域 RL + 融合)

  • BrowseComp 56.6 → 73.1,对应无/有上下文管理;τ₂ Avg 88.2,VitaBench 29.3。
  • IMO-AnswerBench 普通/Heavy 78.6 / 86.8;SWE-bench Verified 70.0,R2E-Gym、Avg@5。

重要结论

  • 噪声训练使 VitaBench-Noise 13.3 → 20.5,同时保持正常任务表现,鲁棒性可直接训练。
  • 扩环境必须同时维护工具依赖和状态一致性,否则正确行为也可能得到错误负奖励。

核心贡献

  • 可验证环境扩展、异步多环境 RL、噪声训练和 Heavy Thinking 的完整训练方案。

未来方向

  • 改进异步样本时效管理,开放噪声与随机任务评测,进一步平衡长任务能力和计算成本。

问题背景 ​

长程 Agent 的训练瓶颈

数据与环境

  • 常规文本缺少主动工具调用、规划和状态跟踪,直接 RL 容易消耗大量无效探索。
  • 随机增加工具会破坏依赖和数据库状态,使可解任务变为不可解任务。

训练与部署

  • 搜索、代码和多工具任务耗时差异大,同步 batch 被最慢样本拖住。
  • 真实用户表达含糊、工具会失败;只在理想环境训练的策略缺少恢复能力。

核心方法 ​

数据与环境构建 ​

混合轨迹合成

文本流程重构

  • 从教程、说明和多步流程提取工具 schema,转成多轮用户—Agent 交互。
  • 工具拆解:把部分参数藏到环境中,要求模型先查询,再执行原操作。
  • 决策扩展:在关键动作处生成候选,让模型比较后选择,显式监督规划与决策。

环境驱动合成

  • 实现轻量 Python 工具环境,以参数依赖建立有向图,采样有效执行链。
  • 由执行链反向生成用户需求与模拟器提示,执行代码并检查数据库最终状态。
  • 将复杂目标拆解与正确首步配对,补充粗到细的规划监督。
冷启动数据筛选

通用推理

  • 用 K-Center-Greedy 保持样本覆盖,再以滑动窗口 PPL 强调局部难点。
  • 每条样本取 512-token窗口的最大平均 PPL,避免长序列平均掩盖关键困难位置。
  • 从大语料中选取 210K 通用思考样本。

Agent 轨迹

  • Coding:要求任务修复且无回归,过滤无效动作;压缩早期步骤,保留长程调试。
  • Search:检查问题全部约束,排除凭局部证据碰巧猜对的轨迹。
  • Tool-use:覆盖 33类领域冷启动数据;验证最终状态,Mask 失败调用和格式错误的 loss。
  • 保留完整历史让模型理解失败语境,但不把错误动作当作正确监督。
工具依赖图与环境扩展

领域到可执行工具

  • 领域定义 → 工具集 → 统一数据库 schema → 工具代码与状态实现。
  • 用单元测试和 Debug Agent 修复,随后构建工具依赖图;每领域包含 60+工具。

任务与状态初始化

  • 先采样一条有效工具链,依次创建它所需的数据库对象与前置状态。
  • 基于完整工具链生成任务、用户画像和 rubric,并检查可接受的正确解及错误解。

保持可解性的扩展

  • 从种子链做 BFS,只有依赖已满足的新工具才加入环境。
  • 根据图复杂度、剩余工具和替代路径难度,决定是否加入更多种子链。
  • 最终每环境至少 20个工具;增加选择难度的同时,保留可执行正确路径。
可执行环境的构建流程:从领域定义生成工具与数据库,再验证工具依赖关系,为任务扩展提供可运行的基础。
原文图 3:可执行环境的构建流程:从领域定义生成工具与数据库,再验证工具依赖关系,为任务扩展提供可运行的基础。 来源
搜索任务合成

多跳关系

  • 从 Wikipedia 长尾实体扩展关系图,采样连通子图生成 QA。
  • 模糊实体、地点、时间等直接线索,要求模型搜索关系链;验证答案与条件一致。

多条件歧义

  • Entity Agent 提取实体属性,Question Agent 抽取部分属性出题。
  • Verification Agent 搜索核对全部约束,Answer Agent 尝试找其他满足条件的答案。
  • 若发现多解,追加属性重写问题,直到答案唯一;用解题成功率划分难度。

RL 算法与训练策略 ​

课程、动态预算与 Self-Verification

训练目标与课程

  • 使用 GSPO 的序列级重要性比率和组内优势,主要依赖结果监督,并放宽长轨迹惩罚。
  • 课程同时考虑成功率和能力依赖:基础工具调用 → 多步规划 → 组合约束决策。

预算分配

  • 根据当前成功率等训练状态估计任务价值,用堆式贪心分配 rollout 预算。
  • 多环境异步训练中,用历史成功率决定过采样次数,各重复组独立计算优势。
  • 对低吞吐、较难领域增加配额,避免快速领域占满 batch 或等待慢领域形成空转。

Self-Verification

  • 生成训练停滞时,启动辅助验证阶段,让模型判断自己的 on-policy 轨迹。
  • 聚焦困难样本,并把验证信号与对应生成质量关联,促进生成而非只提高判题分数。
混合上下文管理

压缩

  • 上下文超过 80K 时,由模型总结历史工具结果,保留关键证据后继续。
  • 冷启动加入 15K 高质量摘要样本,使压缩后的证据仍能支持后续决策。

重置

  • 达到最大交互轮次时,清空历史,从原问题与系统提示重新开始。
  • 训练中逐渐提高丢弃阈值,让困难任务获得更多推理步骤。
  • 摘要维持已有探索,重置提供新的搜索机会,两者按不同触发条件组合。
Robust RL:噪声课程

噪声类型

  • Instruction Noise:用户表达含糊、交互习惯变化,需要澄清和约束确认。
  • Tool Noise:执行失败、返回不一致、部分信息缺失,需要重试、诊断与恢复。

课程控制

  • 从轻微扰动开始,根据当前鲁棒性逐步增加噪声难度与种类。
  • 始终保留任务可解性,避免将环境被破坏造成的失败作为模型负反馈。
  • 用同一任务在正常/噪声环境的差距衡量鲁棒性,而非只看训练奖励。

训练系统与推理扩展 ​

流式执行与领域调度

流水线

  • RolloutManager 管采样,SampleQueue 管样本时效,Trainer 管经验处理与更新。
  • 生成、环境执行、奖励计算按单样本流式推进,完成即入队,不等待整批结束。
  • 多版本 rollout 与训练并行;较旧版本限制新增请求,控制样本滞后。

环境扩展

  • 轻量全局 Manager 管元数据,多个 Controller 分别管理虚拟 rollout 组。
  • 基于 CPU 空闲状态放置环境,支持约 400台机器 / 32K并发环境。
Prefill-Decode 分离与 KV Cache Swap

PD 分离

  • 长输入的 prefill 与持续 decode 放在不同设备组,避免新请求打断生成图执行。
  • KV Cache 分块异步传输,和后续块计算重叠。

CPU Cache

  • 设备显存紧张时将 KV Cache 换到 CPU,再按需恢复,避免反复重算长历史。
  • 结合请求并发控制,减少长尾 rollout 对设备利用率的影响。
Heavy Thinking:并行探索与汇总 RL

两阶段推理

  • Thinking Model 并行生成多个候选,扩大探索宽度。
  • Summary Model 比较候选、反思并整合答案;并非仅按答案多数投票。
  • 多轮场景保留共享对话历史,各轮候选只保留回答内容,再由汇总模型给出统一回复。

训练与模型

  • 汇总阶段额外进行 RL,提高筛选、纠错和整合能力。
  • Thinking 与 Summary 可共享参数,也可使用不同模型;Heavy 需要额外推理预算。
Heavy Thinking:并行轨迹提供不同探索结果,再由汇总阶段形成答案;重点看探索与综合两个环节如何连接。
原文图 10:Heavy Thinking:并行轨迹提供不同探索结果,再由汇总阶段形成答案;重点看探索与综合两个环节如何连接。 来源
ZigZag:独立长上下文变体

结构转换

  • 校准 attention 层重要性,将约一半层换成 SSA,其余保留完整 MLA。
  • SSA 每层只看 1个 sink块 + 7个局部块,每块 128 tokens,共 1024 tokens。
  • 完整层与局部层交替传播信息,保留跨远距离关联。

继续训练

  • 替换后继续长上下文 MidTrain,并用 YaRN 扩至 1M。
  • 这是额外发布的 ZigZag 模型;主模型表中的全部结果并非在该结构下取得。

实验设置(LongCat-Flash-Thinking-2601) ​

模型与训练

模型与阶段

  • 560B MoE,平均激活 27B;继承 Flash-Chat 的基础结构与预训练分布。
  • MidTrain:500B tokens / 32K→128K,另 40B / 256K;冷启动后分领域 RL,再融合。
  • Tool-use 领域内部联合多环境训练;DORA 支持异步 GSPO 与领域过采样。

推理协议

  • 默认 temperature=1.0, top_p=1.0, top_k=-1。
  • 数学以代码工具辅助推理为主:IMO-AnswerBench Avg@4,其他数学任务 Avg@16。
  • SWE-bench Verified:R2E-Gym、Avg@5;LCB 使用 2024.08~2025.05 的 454题 / Avg@4。

Agent 评测

  • BrowseComp 分别测试有/无上下文管理;RWSearch 200题,各模型统一无上下文管理。
  • τ₂ 使用 GPT-4.1 用户模拟器并修复 airline 问题;Vita 使用更新后的 verifier。
  • Noise 测试在同一任务注入扰动;随机复杂任务每次 100题、4+领域,重复三次统计。

关键结果(LongCat-Flash-Thinking-2601,领域 RL + 融合) ​

环境与鲁棒性消融

噪声训练直接有效

  • VitaBench-Noise:无噪声训练 13.3 → 有噪声训练 20.5;正常 VitaBench 28.6 → 29.3。
  • τ₂-Noise:62.2 → 67.1;正常 τ₂ 87.1 → 88.2。
  • 噪声收益主要体现在异常环境,正常表现也保持稳定,支持将恢复能力纳入训练目标。

跨环境泛化

  • 随机复杂任务 35.8,报告对照最高;VitaBench 29.3,仍低于 Gemini 3 Pro 31.5。
  • 噪声 Vita 20.5 仍低于正常 29.3,扰动造成的能力下降尚未消除。
搜索、推理与代码

上下文管理

  • BrowseComp 56.6 → 73.1,对应无/有上下文管理;混合压缩与重置有利于扩大搜索预算。
  • 摘要阈值消融中 80K 优于 20K 和 100K,过早压缩和过晚压缩都可能损失效率。
  • RWSearch 79.5,低于 GPT-5.2 82.0,在真实复杂搜索中接近其表现。

Heavy Thinking

  • IMO-AnswerBench 78.6 → 86.8;HMMT-25 93.4 → 97.5。
  • 工具辅助 AIME-25 99.6 → 100.0;GPQA 80.5 → 85.2,汇总推理在困难题上更有价值。

代码与系统

  • SWE-bench Verified 70.0,低于表中 DeepSeek-V3.2 73.1;LCB 82.8,保持较强算法代码能力。
  • DORA 在不同生产任务中约为同步训练的 2~4倍速度。
  • 独立 ZigZag 变体最高约 1.5倍推理加速,并支持 1M 长上下文。

未来方向 ​

后续研究

作者计划

  • 探索更宽松的时效控制与 staleness-aware 稳定化,提高异步训练利用率。
  • 开放噪声注入流程,将随机复杂任务整合进评测平台。

笔记归纳

  • 扩展具有真实状态变化的环境,同时持续检查任务可解性和 verifier 一致性。
  • 联合优化 Heavy 并行宽度、汇总成本与上下文管理,减少重复探索。
  • 分析噪声类型与失败阶段,针对仍有明显性能下降的工具恢复和长程规划继续训练。

(2509) LongCat-Flash-Thinking (领域 RL、DORA、参数融合) ​

🌺 论文摘要

LongCat-Flash-Thinking 摘要

参考链接

问题背景

  • 通用预训练缺少多样的长 CoT;混合领域 RL 中,输出长度和难度差异造成异步数据失衡。
  • 长尾 rollout、旧策略样本和推理/训练引擎差异,共同影响大规模 RL 的效率与稳定性。

核心方法

  • 数据与冷启动:推理增强 MidTrain + 通用、Lean4、工具推理 SFT;比较有无工具收益筛选任务。
  • 领域 RL:STEM、Code、Agentic 独立训练专家,参数融合后再做通用 PPO。
  • 异步训练系统:DORA 按策略版本流式采样;结合概率修正、样本时效与异常 Mask,稳定多版本训练。

模型效果(560B-A27B,领域 RL + 融合 + 通用 PPO)

  • AIME-25 90.6,LCB 79.4;MiniF2F-Test Pass@1=67.6。
  • AIME-25 使用工具后,输出 19653 → 6965 tokens,准确率 90.6 → 90.0。

重要结论

  • 工具可承担部分计算,显著缩短模型输出;更长 CoT 并非唯一的推理扩展路线。
  • 专家融合在多个领域保留或略超专家表现,支持将训练日程差异与最终单模型部署分开处理。

核心贡献

  • 领域并行 RL 与参数融合路线,以及保持采样版本一致的异步训练系统 DORA。

未来方向

  • 笔记归纳:优化跨领域能力融合、旧样本利用率与训练稳定性的取舍,增强真实 Agent 任务。

问题背景 ​

推理数据与异步训练

推理模式不足

  • 通用语料中 STEM、代码比例有限,显式长 CoT 更稀缺,后训练容易形成单一解题模式。

领域与系统差异

  • STEM、Code、Agent 的输出长度分布不同,异步混训会使不同 batch 的领域比例明显波动。
  • 等待最长回答会降低利用率;强行切换未完成回答的模型版本又需要重新 prefill。

核心方法 ​

训练数据与冷启动 ​

推理增强 MidTrain

推理语料

  • 加入数学、物理、化学与算法编程问题,优先多步逻辑推理而非简单事实问答。
  • 规则与 LLM Judge 联合清洗、去重和去污染,混合原有通用语料,保留基础知识能力。

能力检查

  • 先在相同结构的小 MoE 上比较 pass@1~pass@128,再将有效配方用于主模型。
  • 同时关注一次回答与多次探索能否成功,避免仅优化输出格式而不扩展解题范围。
通用推理与 Lean4 证明

问题筛选

  • 排除题目不完整、答案不一致和过易样本;代码题要求至少 5个测试和可执行评测脚本。
  • 用专家成功率确定难度分布,再进行 rejection sampling,保留高质量 CoT。
Formal Reasoning

语句形式化

  • 8B Autoformalizer 将自然语言题目与答案转为 Lean4 statement。
  • 编译检查语法,再由模型核对原题含义,避免形式上合法但题意被改变。

Expert Iteration

  • 先用现有 prover 获得可验证证明,再补充自然语言推理,组成 statement + thinking + proof。
  • 当前 prover 尝试未解决问题,Lean4 验证成功后加入数据集。
  • 聚合新旧数据重新训练 prover,迭代扩充可解题范围。
工具必要性筛选

有/无工具对照

  • 同一问题分别生成有工具、无工具轨迹,比较两组成功率。
  • 保留无工具较难、有工具可解、两者差距足够大的任务,避免“看似调用工具,实际不需要”。

轨迹合成

  • 连接真实 API、MCP 和模拟工具,生成候选交互轨迹。
  • Judge 检查答案、逻辑一致性与工具使用完整性,保留合格轨迹。
  • 按调用次数、顺序/并行依赖和规划深度分层,供后续课程训练。

领域 RL 与能力融合 ​

奖励系统

可验证任务

  • STEM:Reasoning GenRM 比较问题、参考答案与模型答案,识别等价表达和复杂符号结果。
  • Code:sandbox 执行测试,支持 20+语言,一次编译供多个测试复用。

开放任务

  • 从 SFT 模型训练判别式 RM,偏好数据由人工和模型共同标注。
  • 长 CoT 任务只评价最终回答,避免把推理文本风格当作最终质量。
Domain-Parallel RL

训练数据

  • STEM 去掉不适合当前验证方式的多问、选择、判断题;Code 统一输入输出测试格式。
  • 以 SFT 模型多次采样,保留有对有错的问题;Code 进一步排除歧义题与错误测试。

独立训练日程

  • STEM:固定 64K,逐渐提高难度,动态调整正优势裁剪上界。
  • Code:48K → 56K → 64K,输出长度 90 分位接近上限时扩展。
  • Agentic:固定 48K,使用规范 think/tool-call 标签和调用格式奖励。
参数融合与 General PPO

Task Vector 融合

  • 计算每个专家相对同一 SFT 的参数增量 Δθᵢ=θRLᵢ−θSFT。
  • Normalization:对齐增量幅度,避免某个领域因更新量大占主导。
  • Dropout:删除冗余增量;Erase:去掉方向冲突中的少数方向,缓解参数干扰。

通用对齐

  • 融合后整理开放与合成任务,聚类去重、筛选困难高质量问题。
  • 最后进行通用 PPO,恢复写作、指令遵循和安全等基础行为。
整体训练路线:MidTrain/SFT 冷启动后并行训练领域专家,再融合并做通用 RL;重点看领域专长如何回到统一模型。
原文图 2:整体训练路线:MidTrain/SFT 冷启动后并行训练领域专家,再融合并做通用 RL;重点看领域专长如何回到统一模型。 来源

异步 RL 系统 ​

流式采样与弹性角色

两个设备组

  • Standalone Group:主要执行 rollout;Elastic Group:在采样、经验计算、训练间切换。
  • 样本完成即进入下一阶段,不等待最长回答;空闲训练设备可临时加入生成。

同回答保持同版本

  • 保留多个旧策略,未完成回答继续使用自己的采样版本,复用或迁移已有 KV Cache。
  • 负载均衡同时迁移权重和 Cache;过旧版本退出,相关样本按时效规则处理。
  • 更新后逐层同步权重,开始新版本采样。

大规模优化

  • Streaming RPC 支持大量交互,图编译减少 kernel 调度开销。
  • 高度 Expert Parallel 配合通信计算重叠,提高大 MoE 的 rollout 吞吐。
DORA 的流式调度:已完成轨迹及时进入训练,未完成轨迹可继续生成;图中同时展示策略版本限制与过期轨迹重采。
原文图 5:DORA 的流式调度:已完成轨迹及时进入训练,未完成轨迹可继续生成;图中同时展示策略版本限制与过期轨迹重采。 来源
异步 GRPO 与训推修正

策略版本差异

  • 当前策略与产生样本的旧策略不同,需要重要性比率与裁剪限制更新。
  • 去掉 GRPO 的 KL 项;按 token 聚合,用全局最大生成长度归一化,缓解长度偏置。
  • 三重裁剪分别控制负优势的大幅更新和正优势的探索上界。

引擎数值差异

  • 同一权重在推理与训练引擎中的 logprob 可能不同,不能全归因于策略更新。
  • 以训练引擎重算旧策略 logprob,再用截断重要性权重修正与采样引擎的差异。
  • 前者约束“模型改了多少”,后者校正“同一模型的两套执行结果差多少”。
在线筛选与异常反馈处理

有效组与时效

  • 过滤组内全对、全错任务,保留存在学习信号的样本组。
  • 在线有放回采样;额外生成的数据进入 replay buffer,按比例与新样本混合并打散。
  • 超过最大 staleness 的样本重新生成,控制旧数据复用带来的偏差。

Incomplete-Signal Masking

  • Sandbox 评分错误的样本屏蔽,避免系统故障被当作模型失败。
  • 非重复行为但因长度上限截断的样本也屏蔽,避免把未完成输出直接当作负例。

实验设置(LongCat-Flash-Thinking) ​

模型、训练与评测

模型与训练

  • 从 LongCat-Flash-Base 开始,560B 总参数、平均激活 27B。
  • SFT:context=48K, AdamW, lr=3e-5, 2 epochs;RL 计算投入接近预训练的 20%。
  • STEM、Code、Agentic 分别 RL,随后参数融合与通用 PPO。

评测协议

  • temperature=1.0, top_p=0.95, top_k=-1。
  • AIME、HMMT Mean@32;GPQA Mean@16;LCB 2024.08~2025.05 / Mean@4。
  • MiniF2F-Test 244题,Lean4 验证,统计 Pass@1 / 8 / 32。
  • 工具任务覆盖 SWE-bench、BFCL、τ₂、VitaBench;另评知识、指令与安全。

对照设计

  • 小规模 MidTrain 消融比较推理数据比例;奖励模型比较规则、无推理 GenRM 与有推理 GenRM。
  • 分别检查领域专家与融合模型,以及同一模型有/无工具时的正确率和输出长度。

关键结果(LongCat-Flash-Thinking,领域 RL + 参数融合 + PPO) ​

训练机制的效果

推理数据与奖励

  • 小 MoE 的推理增强 MidTrain 在 pass@1~pass@128 均改善,说明收益包含多次探索的可解题范围。
  • 人工标注测试集上,规则 RM 80.9%、无推理 GenRM 94.0%、Reasoning GenRM 98.8%。
  • 复杂表达需要语义验证,单纯字符串规则容易把正确答案判错。

专家融合

  • AIME-24 专家/融合 93.6 / 94.3;LCB 78.0 / 80.1;τ₂ Avg 70.3 / 70.6。
  • 融合阶段在多个领域保留专家能力,缓解分别训练与单模型部署之间的冲突。

工具使用效率

  • AIME-25 输出 19653 → 6965 tokens,减少约 64.5%;准确率 90.6 → 90.0。
  • 将适合执行的计算交给工具,可节省模型输出;完整延迟还需计算工具执行时间。
最终模型表现

推理与形式证明

  • AIME-25 90.6、HMMT-25 83.7;LCB 79.4,接近 GPT-5 80.6。
  • MiniF2F-Test Pass@1=67.6,高于 DeepSeek-V3.1 49.6;Pass@32=81.6。
  • Lean4 迭代证明数据形成了突出的专门能力。

Agent 与通用任务

  • SWE-bench 59.4、τ₂ Avg 74.0、VitaBench 29.5;不同 Agent 场景仍有明显差异。
  • MMLU-Pro 82.6、IFEval 86.9,领域推理优势没有覆盖所有通用任务。

系统效率

  • 图编译带来约 1.5倍 rollout 加速;完整 DORA 系统相比同步训练超过 3倍。
  • 系统收益来自减少长尾等待与角色空闲,为扩大 RL 计算投入提供条件。

未来方向 ​

后续研究(笔记归纳)

能力融合

  • 分析哪些领域最容易在融合后退化,联合调整任务增量、数据配比与最后的通用 RL。
  • 将工具必要性筛选扩展到真实搜索、代码维护和多轮业务任务。

异步稳定性

  • 联合控制 replay 比例、策略 staleness 与概率修正,提高旧样本利用率。
  • 在相同总计算预算下比较工具推理与更长 CoT,明确延迟、成本和成功率的取舍。

(2509) LongCat-Flash (零计算专家、ScMoE、动态计算) ​

🌺 论文摘要

LongCat-Flash 摘要

参考链接

问题背景

  • 不同 token 难度不同,固定激活专家数浪费计算;大规模 MoE 的通信又限制实际吞吐。
  • 基模扩展需要同时解决初始化、路由稳定、数据配比及真实 Agent 任务供给。

核心方法

  • 动态架构:零计算专家与普通 FFN 共同参与路由,平均激活 27B;ScMoE 扩大计算通信重叠。
  • 预训练与扩展:约 20T 预训练 → 推理/代码 MidTrain → 128K 扩窗;超参迁移与路由稳定化支持模型增长。
  • 后训练数据:覆盖推理、SWE、工具、长文和安全;按工具依赖、信息处理与交互复杂度合成 Agent 任务。
  • 训练与部署系统:确定性训练与故障检测控制恢复成本,配合 SBO、MTP 和调度优化吞吐。

模型效果(LongCat-Flash-Chat,非 Thinking)

  • SWE-bench Verified 60.4、TerminalBench 39.5、IFEval 89.7;VitaBench 24.3。
  • 128×H800、约 5K 上下文的低延迟配置,每用户约 100 tokens/s。

重要结论

  • 匹配平均计算量的消融中,动态专家降低验证 loss;并非仅通过增加计算获得收益。
  • ScMoE 在多种模型规模和注意力结构中保持相近 loss,主要收益来自通信与计算重叠。

核心贡献

  • 将动态 MoE 计算、稳定训练和低延迟部署结合,并开放具有 Agent 能力的基座与 Chat 模型。

未来方向

  • 笔记归纳:优化动态路由与服务负载协同,补强长上下文推理和基础代码生成。

问题背景 ​

MoE 的计算与扩展效率

计算分配固定

  • 易预测 token 和关键推理 token 都使用相同专家预算,难以按上下文分配算力。

稀疏但仍受通信限制

  • token 必须先分发到专家再计算,dispatch/combine 形成串行等待。
  • 模型变大后,低秩注意力、细粒度专家和路由器的数值尺度也更容易失衡。

核心方法 ​

动态 MoE 架构 ​

Zero-Computation Experts

专家池

  • 每层 512个 FFN专家 + 256个零计算专家,共同选取 Top-12。
  • 零计算专家输出输入本身 E(x)=x,不是零向量,也不执行 FFN。
  • Top-k 数量固定,选中的实际 FFN 数量随 token 变化。

平均预算控制

  • 依据近期使用量调整 FFN 专家的路由 bias,使平均激活约 8个真实专家。
  • 零计算专家不单独更新 bias;FFN 使用率达到目标时,剩余份额自然分给恒等专家。
  • 再加入设备级负载平衡,避免某些 EP 设备收到过多 token。
Shortcut-Connected MoE

结构

  • 每个模型 block 包含两组 MLA 及 Dense FFN,并通过跨层 shortcut 连接 MoE。
  • 前一块 Dense FFN 的计算可与当前 MoE 的分发、聚合通信并行。

执行

  • 训练时再按 token 切块,扩大不同 chunk 之间的重叠。
  • 推理采用 Single Batch Overlap,不必依赖两个 batch 交错才能隐藏通信。
  • 节省的是设备等待时间,与零计算专家减少实际 FFN 计算互补。
MLA 方差校正与专家初始化

MLA

  • Query、KV 低秩路径与 RoPE 路径来源维度不同,初始化方差容易不一致。
  • 按模型维度与压缩维度的平方根比缩放低秩路径,使注意力各分量处于可比较尺度。

细粒度专家

  • 专家拆得更细时,gate 权重与中间维度同时缩小,聚合输出方差也下降。
  • 按拆分系数补偿聚合输出,减少专家数量变化对初始化尺度的影响。

预训练与稳定扩展 ​

超参迁移与 Model Growth

宽度迁移

  • 在宽度 768 的 proxy 搜索初始化与学习率,再按 s=8 迁移至 6144。
  • Embedding 保持学习率与初始化方差;Hidden / Unembedding 的两者按 1/s 缩放。
  • 迁移时保持深度、稀疏度和 batch 等其他结构条件一致。

模型增长

  • 先训练 14层同构模型,再整体堆叠两份成为 28层。
  • 保留样本计数和学习率日程,继续训练;增长时机避免前驱模型过度优化。
Router、激活与优化器稳定性

Router 平衡

  • LM loss 推动专家分工,负载平衡 loss 推动均匀分配;后者过强会使路由失去输入差异。
  • 监测专家权重相似度与两类梯度范数比,控制负载平衡梯度不压过 LM 梯度。

Hidden z-loss

  • 对最终 LayerNorm 前的极大 hidden 激活施加很小惩罚,降低 BF16 数值不稳定风险。

Adam ε

  • 大模型、大 batch 下梯度尺度变小,ε 过大会干扰自适应更新。
  • 使用 ε=1e-16,使其远小于观测到的梯度 RMS。
数据配比与长上下文扩展

通用预训练

  • 网页提取、分类器粗筛、流畅性/完整性细筛、MinHash 去重,并清理模板重复。
  • 第一阶段按质量与多样性采样;第二阶段逐步提高 STEM + Code 至约 70%。
  • 监控通用验证集 PPL,避免突然降低通用语料比例导致能力退化。

推理与代码 MidTrain

  • 从知识图谱遍历、组合概念生成复杂问题,迭代增加难度与 CoT 质量。
  • 联合文本推理和代码执行验证,构建高质量合成数据,并复用筛选后的预训练材料。

长上下文

  • 80B tokens 将 8K→32K,再以 20B tokens 扩至 128K。
  • 加入书籍和按仓库组织的代码,保留跨文件关系;长文本数据约占混合中的 25%。
  • Web / Code 做 13-gram 去污染,合成 QA 再以语义相似度排除测试重叠。

多领域后训练数据 ​

Reasoning 与 SWE

数学与逻辑

  • 用不同数学专家 persona 生成问题,多模型答案一致性与推理 GenRM 联合验证。
  • 逻辑题控制难度,去掉强推理模型也无法解决的题,将选择题转为填空以减少猜测。

代码与仓库任务

  • 公共题、GitHub 片段、论坛与 Evol-Instruct 扩展题库,按主题和难度平衡。
  • 筛除题意不清、重复、乱码和错误响应。
  • 构建上万个含测试的 Docker 环境,Agent 搜索、定位、修复,保留数千条全测试通过轨迹。
Agentic Tool-Use 合成

难度控制

  • 信息处理:约束数量、推理节点和依赖链长度。
  • 工具集:工具依赖图的节点数量、连接密度。
  • 用户交互:表达风格、配合程度、信息披露方式,要求少打扰但获取必要信息。

任务生成

  • UserProfileAgent 定义用户状态;ToolSetAgent 构建 40领域 / 1600应用 / 80K模拟工具。
  • 从工具图随机游走采样子图,InstructionAgent 生成满足复杂度要求的任务。
  • EnvironmentAgent 补充商品、地点、时间等状态,并加入容易混淆的选项。
  • RubricAgent 生成验收清单;Validator / Deduplicator 检查可评估性与任务重复。

轨迹验收

  • 滑动窗口检查长轨迹,持续更新清单完成状态。
  • 冷启动保留多样解法,后续任务选择强调值得持续探索的难度。
指令、长文与安全

指令与长文

  • 多约束任务先检查冲突;对难以直接合成的约束,由合格答案反向生成问题。
  • 长文包括阅读、表格问答和自定义任务,组合相关片段训练多跳推理与跨轮信息利用。

安全与知识不足

  • 数据区分不同风险类别与响应方式,经人工复核再作为训练目标。
  • 上下文不完整时训练适当说明信息不足,减少缺少证据仍给出确定回答。

训练系统与推理部署 ​

确定性训练与故障检测

算子与 SDC

  • 对照高精度参考检查算子误差;重算敏感算子,以 bitwise 差异检测 Silent Data Corruption。
  • 固定 Attention backward、ScatterAdd 等归约顺序,保证相同训练步骤可重现。

并行与恢复

  • EP=32、CP=8,结合 PP / DP 与 V-ZB 流水线,降低通信和显存峰值。
  • 异步 checkpoint、自动日志检测与故障恢复,减少大集群训练中断。
SBO、MTP 与调度

模型侧

  • SBO 将 dispatch 与 Dense / QKV 计算重叠,combine 与 attention / Dense 重叠。
  • 轻量单 Dense MTP 层提出候选,主模型验证;MLA 压缩 KV Cache。

系统侧

  • Target、Verification、Draft 合入一张 CUDA Graph,减少多阶段 kernel 启动。
  • 多步重叠调度隐藏 CPU 开销;PD 分离并逐层传输 KV,分别优化输入处理和生成。
  • FP8 分块量化,按层保留敏感部分的更高精度;零计算专家无需远程 FFN 通信。

实验设置(LongCat-Flash) ​

模型、训练与评测

模型配置

  • 560B,平均激活 27B;28 blocks、hidden=6144、词表=131072。
  • MLA:64 heads、KV压缩512、Query压缩1536;512 FFN + 256零计算专家 / Top-12。

训练阶段

  • 通用预训练约 20T tokens / seq_len=8K,随后推理代码增强与长上下文扩展。
  • 后训练覆盖 reasoning、coding、tool-use 和 general;报告主要展开数据构建,未完整给出优化配方。

对照设计

  • 动态专家消融匹配平均 FFN 计算量;ScMoE 在 MLA、MHA、GQA 和不同规模下比较。
  • 分别评估 Base 与非 Thinking Chat,覆盖知识、推理、代码、SWE、工具和指令任务。
  • 部署测试使用 H800,报告不同吞吐/延迟配置;不能合并为同一运行点。

关键结果(LongCat-Flash,预训练 + 多领域后训练) ​

结构与稳定性消融

动态计算

  • 匹配平均 8个 FFN专家时,加入零计算专家的验证 loss 更低。
  • 实际激活量随 token 明显变化,平均预算仍稳定,支持按上下文分配计算。

通信重叠

  • 多组 ScMoE 消融的 loss 接近基线;训练中未被隐藏的通信占比 25.3% → 8.4%。
  • 性能收益主要来自执行效率,结构调整没有显示明显质量损失。

训练稳定

  • MLA 尺度校正改善收敛;Model Growth 优于随机初始化;hidden z-loss 压低异常激活。
  • 大规模训练约 30天完成,时间可用率 98.48%,减少故障造成的计算浪费。
相同平均计算预算下的消融:零计算专家版本的验证 loss 更低;这里比较的是动态计算分配,不是单纯增加激活参数。
原文图 3(a):相同平均计算预算下的消融:零计算专家版本的验证 loss 更低;这里比较的是动态计算分配,不是单纯增加激活参数。 来源
模型能力与部署表现

Base 与 Chat

  • Base MMLU-Pro 70.3、GPQA 51.1,展现较好的激活参数效率。
  • Chat IFEval 89.7、COLLIE 57.1、Meeseeks-zh 43.0,指令与多轮交互是较强项。

代码与 Agent

  • SWE-bench Verified 60.4、TerminalBench 39.5;后者接近 Claude 4 Sonnet 40.7。
  • VitaBench 24.3,高于表中 Sonnet 23.0;工具交互形成较突出能力。
  • HumanEval+ 88.4,低于 Qwen3 94.5;GraphWalks-128K 51.1,长文复杂推理仍较弱。

推理效率

  • 128×H800、平均5K上下文:低延迟配置 100.5 tokens/s/用户,对应 804 tokens/s/GPU。
  • 同硬件的高吞吐配置可达 3785 tokens/s/GPU,但每用户速度为 35 tokens/s。
  • 服务部署需要按交互延迟和批量吞吐目标选择运行点。

未来方向 ​

后续研究

作者指出的系统问题

  • 算子数值误差与最终能力的关系仍难低成本评估,需要更有效的精度评测方法。

笔记归纳

  • 让动态专家预算与实际服务负载协同,避免平均算力受控但局部设备仍拥堵。
  • 加强基础代码生成、长上下文多跳推理,缩小不同任务之间的能力差距。
  • 在真实工具延迟下优化完整 Agent 耗时,区分模型生成加速和任务完成加速。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026