变化点
2026.06 · Seed2.1
- 以跨工具 RL 统一 GUI、MCP 和代码操作。
- 通过
Seed for Seed将模型用于评测、数据与训练研发。
2026.06 模型卡 · Seed2.0
- 加强真实任务交付、长尾知识与视觉约束处理。
- 按实际工作流组织评测与反馈,关注复杂任务的完成质量。
2025.06 · Seed-Coder
- 以模型判断筛选代码质量,结合文件、仓库、Commit 与网页数据构建训练语料。
- 分别构建 Base、Instruct 与 Reasoning 模型,覆盖补全、指令执行和代码推理。
2025.05 · Seed1.5-VL
- 采用原生分辨率视觉编码器,减少缩放对细节识别的损失。
- 结合联合预训练与混合 PPO,强化视觉推理。
2025.04 · Seed-Thinking-v1.5
- 以长 CoT RL 强化推理,围绕 verifier、奖励与优势估计优化训练。
- 异步训练系统支撑更长轨迹和更大规模采样。
(2606) Seed2.1 (跨工具 RL, Seed for Seed)
参考链接
研究重点
- Pro 面向复杂推理与长程任务;Turbo 面向效率与吞吐。
- 用跨动作空间 RL 训练 Generalist CUA,同时优化感知工具、上下文管理和真实产物评测。
- Seed for Seed:模型参与评测、数据、训练实验和基础设施研发;Deep Think:增加推理时工具验证。
联合动作空间
- 同一 policy 选择截图、点击、搜索、代码执行和 MCP 调用,RL 学习不同工具之间的动作选择。
- MCP / 命令适合文件、属性与批量修改;GUI 负责视觉定位、布局检查及 API 未覆盖的操作。
- CreativeWork 在 Notion、Canva、Figma 中交替使用 MCP 与 GUI,保持同一任务的连续执行。
感知与上下文
- 文档高分辨率渲染,保留小字和图表;视频先覆盖全片,再对相关片段加密抽帧。
- 图片、文档按需分批加载,减少一次读入全部媒体对推理上下文的挤占。
同模型动作空间对照
- OSWorld Pro:GUI-only → Generalist CUA,成功率
72.6% → 78.8%,步数28.2 → 24.2。 - Turbo:成功率
73.2% → 76.4%,步数27.5 → 22.3;联合动作空间同时改善质量和操作效率。
任务来源
- Agent Startup Bench:访谈已有业务验证的团队,由专家整理任务、附件、交付要求与 rubrics。
- SeedClawBench:从
5000+线上任务和600+众测任务中筛选、改写100项任务。 - 多轮对话保留用户不满意轮次的历史上下文,检查模型重新生成后的完整回答。
执行与检查
- Agent-as-Judge 读取轨迹、产物与状态快照,调用只读工具逐条检查 rubrics,并输出对应证据。
- PDF、表格和多模态产物使用相应工具检查,避免只根据模型的完成声明评分。
- Claw-Eval 使用
Pass^3,要求同题三次均成功,关注工作流的重复执行稳定性。
Eval Loop
- 给定外部 benchmark 仓库,Agent 读取规范、接入内部 Harness、配置 verifier,再对齐基线。
- Auto-Eval 生成定向测试;Post-Eval 分析失败轨迹,区分模型能力不足与评测器误判。
Data Loop
- Optimizer 修改数据清洗规则或正则;Evaluator 检查精确率、召回率与误删样本。
- 在精确率门槛
0.95下持续提高召回率;300M tokens预算案例达到43.3%召回率。 - 清洗规则由数据评测决定保留或回退,减少人工逐条诊断和试改。
多角色实验流程
- Master 选择实验方向;Actor 合成数据、启动训练和部署;Critic 独立评价模型。
- 每轮比较学习率与数据配比,保留最佳候选,再按失败分析调整下一轮数据。
- 每轮最多
5个候选,3轮 / 13次实验后,案例任务得分0.40 → 0.70。
GUI 失败数据修正
- 对齐同任务成功、失败轨迹,定位最早分歧动作,利用当步可见状态生成纠错 skill。
- 例如最低价车票任务:失败轨迹只比较默认列表,skill 补充“先检查价格排序”。
- 加入 skill 后重跑验证,将成功与失败轨迹继续用于训练数据构建。
RL 框架迭代
- Actor 实现功能、运行测试和 RL 实验;Critic 检查代码、实验结果与交付标准。
- Monitor 汇总跨轮问题和可复用规则,调整协作流程,减少重复错误。
- 人设定目标和质量门槛;Agent 执行研发任务,训练更新由具体实验流程完成。
Kernel 优化
- 输入 PyTorch 实现和目标设备,生成 Triton kernel;先检查正确性,再测量性能。
- 围绕融合、访存、精度和 launch 配置迭代,无收益改动回退。
- H800 attention decode 案例达到
1.36ms,约为 PyTorch 的5.9×速度。
推理策略
- 针对科研与高级工程任务,将生成扩展为
reason → verify → revise → select。 - 文献检索:搜索领域资料,补充候选方案需要的知识和约束。
- Sandbox 验证:运行代码检验中间假设、数值计算和实现细节,发现问题后修正候选。
- Verifier 与候选选择:结合验证反馈继续迭代,再提交最终方案。
- 搜索、代码执行、verifier、外部 Harness 和领域工具链可以替换,适配不同科研任务。
Seed2.1 Pro → Deep Think
- IMO 2025:
65.2 → 81.0;IMOProof-Adv:54.3 → 83.8,证明类任务收益更明显。 - IPhO 2025:
79.3 → 89.0;FrontierScience-Research:33.3 → 40.7。 - 额外计算用于外部验证和候选修订,帮助模型处理依赖多步推导、可执行检查的问题。
代码与专业工作
- Pro / Turbo:NL2Repo-Bench
47.0 / 43.7,Terminal-Bench 2.171.0 / 67.6。 - Pro 的 GDPval
87.9、OfficeQA-Pro70.9;CreativeWork42.5,表中 GPT-5.5 为30.5。 - 相同仓库和任务的 Claude Code 匿名众测中,相对 Opus 4.6 的偏好胜率为
59.1%。
产物正确与整体体验
- Trae 的
167项有效任务:Pro / Opus 4.7 完全正确产物占比29.3% / 20.4%。 - 综合不可用比例却为
11.4% / 7.8%;越界修改和指令遵循问题会抵消代码质量优势。 - 重构、理解和修复较强,从零开发、严格限定修改范围的任务仍需改善。
(2606) Seed2.0 Model Card (真实任务评测, 长尾知识)
🌺 论文摘要
参考链接
问题背景
- 竞赛推理能力较强,实际工作流仍受长尾专业知识、复杂约束和长程执行限制。
- 单项分数难以解释交付失败,需要同时测能力、完整任务和具体行为。
核心方法
- 模型迭代方向:补充长尾领域知识,强化视觉理解、复杂指令和代码任务能力。
- 真实任务评测:围绕科研、仓库开发、上下文学习和业务交付,构建分层评测。
- 自动行为诊断:汇总指标、推理和工具轨迹,按场景分析失败,再生成能力报告。
- 工具辅助证明:自然语言采用求解、验证、修正;形式化证明接入 Lean 与 Python。
模型效果(Seed2.0 Pro)
- SWE-bench Verified
76.5、SWE-bench Pro46.9、Terminal-Bench 2.055.8。 - NL2Repo-Bench
27.9、Encyclo-K65.7;知识能力和完整工程交付存在不同强弱项。
重要结论
- 任务粒度影响评价:局部代码修复较强,长程仓库开发和多约束整合仍有明显提升空间。
- 行为诊断比总分更具体:可将失败定位到约束冲突、边界遗漏和冗余工具调用。
核心贡献
- 给出面向真实需求的评测框架与大量执行案例,把模型迭代目标连接到最终交付。
未来方向
- 加强长尾知识、复杂约束整合、上下文学习与长程仓库开发。
问题背景
- 领域知识不足:真实需求涉及专业论坛、手册和行业经验,通用问答不能充分覆盖。
- 跨阶段执行失败:完整开发需要规划、依赖安装、跨文件修改和验证,错误会沿流程累积。
- 复杂约束遗漏:模型可能解决主问题,却漏掉用户的格式、条件分支或业务限制。
核心方法
模型能力与迭代目标
优化重点
- 系统补充长尾领域知识,提升专业问题的回答可靠性。
- 多模态重点覆盖截图、扫描文档、图表和结构化信息提取。
- 代码侧关注真实开发中的前端、调试和维护任务;通用侧关注长上下文与复杂指令。
系列分工
- Pro 面向复杂推理和长上下文;Lite 兼顾通用能力与效率;Mini 面向高吞吐应用。
- 本文主要公开能力评测和应用流程,模型规模、训练数据量及 SFT/RL 超参未展开。
任务构建与分层评测
长尾知识
- LPFQA:从专业论坛和社区提取实际问题,覆盖代码、金融、工程等场景。
- Encyclo-K:从书籍提取原子知识,再组合成问题,测知识掌握和上下文学习。
- HLE-Verified:专家检查原始题目,保留清晰、无歧义且能够可靠验证的题目。
复杂指令
- 中文生产场景覆盖格式、条件、内容、措辞、语气、示例与长度要求。
- 将要求分维度评分,区分“主内容正确”与“同时满足全部限制”。
- Scientific Discovery:科研代码实现、生物多模态推理和研究问题求解。
- Vibe Coding:从自然语言需求构建仓库,检查跨文件一致性、依赖和完整功能。
- Context Learning:从技术文档或企业知识库学习规则,再解决包含噪声资料的问题。
- Real-World Tasks:按 rubrics 检查报告、业务产物和多步骤计划的完成情况。
工程与科研
- NL2Repo-Bench:以完整仓库作为交付对象,避免只看单函数生成是否通过。
- AInstein Bench:把科学问题转成可执行计算流程,检查代码实现和计算结果。
业务与上下文
- ToB-Reference Q&A:检索结果包含噪声,模型需识别有效材料并回答真实业务问题。
- ToB-Complex Workflows:联合使用上下文规则与多项指令,测连续任务完成。
- GDPVal-Verified / XPertBench:使用明确 rubrics,检查有实际业务价值的产物。
- 将重复配置整合为预构建镜像,修复失效环境,用内部镜像稳定依赖下载。
- 过滤参考解不通过、运行结果不稳定和异常资源占用等问题任务。
- Terminal-Bench 2.0 去除
3个受网络或安全限制影响的任务,再接入内部 Agent 框架。 - 比较表同时包含官方成绩和内部复测;该评测有环境适配与任务筛选,不完全等同原始榜单。
行为诊断与工具推理
输入与分析
- 数据处理:汇总任务得分、token 用量、格式遵循、轮数及逐样本推理/执行轨迹。
- 场景分析:按搜索、规划、推理和工具任务选择分析流程,定位具体失败模式。
- 报告生成:输出能力差异、策略得失和可追踪案例,辅助下一轮模型迭代。
典型诊断
- 旅行规划:检查时间、地点和价格约束是否互相冲突。
- 数学证明:区分主体推导正确与边界情况、分支穷举遗漏。
- 工具任务:区分有效验证与机械重复调用,分析调用轮数增加的原因。
- 自然语言证明:生成候选证明,检查逻辑缺口,再修正至满足评分要求。
- 形式化证明:在多轮 Agent 环境中调用 Lean 检查证明,Python 辅助计算与探索。
- 科学计算:读取理论和数据,实现数值过程,再根据程序结果调试和验证。
实验设置(Seed2.0 Pro / Lite / Mini)
模型与基础能力
- 主比较:Pro 与 GPT-5.2、Opus 4.5、Sonnet 4.5、Gemini 3 Pro;Lite/Mini 单独比较。
- 视觉评测覆盖
50个图像与24个视频基准,分别检查感知、推理、时序和长上下文。 - 复杂中文指令:
912项测试、17个加权维度,与 Seed1.8 对照。
Agent 与高级任务
- Coding、Search、Tool Use、GUI、Deep Research 分开评估。
- Terminal-Bench 2.0 使用 Terminus2,按前述内部环境处理执行。
- Putnam-200:随机选取
200个形式化题目,Lean/Python 工具交互,报告Pass@8。 - IMO / CMO:使用 solve-verify-refine 流程评估完整证明。
视频输入
- Morse-500 使用
5 FPS;快速运动感知类基准使用2 FPS,对照模型采用同样设置。
关键结果(Seed2.0 Pro / Lite)
知识和视觉
- Encyclo-K
65.7,高于表中 Gemini 3 Pro 的64.9,书籍知识任务表现较强。 - SimpleQA-Verified
36.0,低于 Gemini 3 Pro 的72.1;事实知识覆盖仍不均衡。 - MathVista
89.8、MM LongBench74.8;视觉推理和长文档理解均有较好表现。
复杂指令
- 中文综合得分
72.89% → 75.26%,措辞、语气和 few-shot 约束改善明显。 - 内容维度并非同步提高,说明多项要求之间仍需联合优化。
搜索与工程
- BrowseComp
77.3、BrowseComp-zh82.4,搜索是相对优势领域。 - SWE-bench Verified
76.5,但 SWE-Evo 仅8.5;长程开发比单次修复困难。 - NL2Repo-Bench
27.9,低于表中 GPT-5.2 的49.3;完整仓库构建仍是明确短板。
约束整合与无效交互
- WorldTravel 分析发现,约束变多且交叉依赖时,时间对齐、排序和冲突修复更容易失败。
- τ²-Bench 高分案例平均
31.4轮,低分案例55.0轮;低分行为常陷入重复检查。 - 这些诊断将“任务失败”细化为可改进的行为环节,方便选择后续训练目标。
数学证明
- 迭代证明流程达到 IMO 2025
35/42、CMO 2025114/126,均达到报告给出的金牌线。 - Putnam-200:Pro
Pass@8=35.5%,Lite30.5%;通用模型能够结合形式化工具执行证明搜索。
未来方向
- 长尾知识:补足专业事实与罕见概念,减少领域间能力差异。
- 上下文学习:提高对技术资料、复杂规则与噪声证据的联合使用能力。
- 长程 Coding:强化仓库级规划、跨文件一致性和多阶段功能交付。
- 复杂约束:改进全局冲突检测、边界覆盖与失败后的计划修正。
- 执行效率:减少机械重复和无效工具调用,兼顾成功率与交互成本。
(2506) Seed-Coder (模型筛选数据、Code 预训练)
核心内容
- 以模型判断筛选代码质量,结合文件、仓库、Commit 与网页数据构建训练语料。
- 分别构建 Base、Instruct 与 Reasoning 模型,覆盖补全、指令执行和代码推理。
详细笔记
(2505) Seed1.5-VL (原生分辨率, 混合 PPO)
🌺 论文摘要
参考链接
问题背景
- 视觉低层能力缺少高质量标注,计数、定位、3D 和视频时序不能只靠图文描述学好。
- 高分辨率与长视频增加 token 和计算开销,训练数据还存在明显的长尾分布。
核心方法
- 多模态架构:
532M SeedViT+ MLP adapter + 激活20B的 MoE LLM,支持原生分辨率与动态视频采样。 - 数据构建:分能力构造 OCR、grounding、计数、3D、视频、STEM 和 GUI 数据。
- 预训练与 SFT:ViT 训练 → adapter 对齐 → 联合训练与扩窗 → 精筛多模态 SFT。
- Hybrid PPO / RFT:GenRM 与规则奖励共享 critic;RL 生成正确难题轨迹,反哺下一轮 SFT。
模型效果(Seed1.5-VL + SFT + RL)
- Thinking:MMMU
77.9、MathVista85.6;GUI 上 ScreenSpot-V295.2、OSWorld36.7。
重要结论
- 长尾重采样有取舍:增加稀有概念曝光可提升识别,但过度压低常见类会损伤常见类能力。
- 感知与长推理分工不同:Thinking 提升多模态推理,简单读图任务不一定需要更长思考。
核心贡献
- 给出视觉数据合成、分阶段预训练、混合 RL 与训练系统的完整多模态方案。
未来方向
- 改善细粒度感知、3D 和组合搜索,探索图像生成支持的 visual CoT 与外部工具。
问题背景
- 标注覆盖不足:图文对擅长描述场景,但难以直接教会精确坐标、计数和空间关系。
- 长尾概念稀少:常见物体占据大量样本,罕见物种、地点和商品缺少有效曝光。
- 视觉负载不均:不同样本的图片数、尺寸和视频长度差异大,GPU 容易互相等待。
核心方法
多模态架构与训练系统
编码与压缩
- 保留长宽比例,把图像尺寸调整至
28的倍数,再切成14×14patches。 - 2D RoPE 编码空间位置,多个图像可打包,但 attention mask 隔离不同图像。
- 相邻
2×2特征平均池化,视觉 tokens 压到1/4,再经两层 MLP 接入 LLM。
ViT 三阶段预训练
- MIM:随机遮挡
75%patches,预测 EVA02-CLIP-E 的对应特征,学习局部结构。 - 图文对比:attention pooling 汇总图像,结合 SigLIP 与 SuperClass loss 对齐图文。
- 全模态对齐:MiCo 将视频帧、音频及其描述共同对齐,补充时序与跨模态表征。
- 根据任务使用不同抽帧率,每帧前加时间戳,显式提供时间位置。
- 视频 token 总量受限时,先降低每帧分辨率,尽量保留整段视频的时间覆盖。
- 最低分辨率仍超预算,再均匀减少帧数;避免直接截断导致结尾事件丢失。
- 并行策略:ViT/adapter 用 ZeRO DP,LLM 用 EP、PP、DP、CP,适应组件规模差异。
- 视觉均衡:按图片 FLOPs 降序,将下一张分给当前负载最轻的 GPU,在分组内完成重分布。
- 数据加载:PP 组内只由一个 rank 读取,共享 metadata,减少重复 I/O。
- RL:verl 编排,vLLM 生成,verifier 独立进程隔离故障,actor/critic 分别更新。
多模态数据构建
知识分布
- 图文相似度、图片质量、文本规则和去重共同过滤网页图文对。
- 旧版 VLM 标注领域和命名实体,识别低频概念,增加低频领域样本曝光。
OCR 与问答
- 文档解析提取内容和布局;字体渲染与 LaTeX 合成文字图片,并加入模糊、畸变等增强。
- LLM 生成图表内容与绘图代码,执行得到图像;HTML/LaTeX/Markdown 渲染表格。
- 根据图片及 OCR 结果生成 QA,再过滤问答不匹配项,使数据同时训练识别与理解。
框与点定位
- 检查公开检测标注中的错误、漏标和重复框,再构造定位与空间关系问答。
- 从 caption 提取实体,用 Grounding DINO 自动打框,以 CLIP、NMS 和规则过滤。
- Molmo / CountGD 标注中心点;计数数据先输出框或点,再根据目标数量回答。
- OCR、GUI、定位均使用
[0,999]相对坐标,避免分辨率变化改变标签语义。
3D 数据
- DepthAnything V2 生成相对深度排序,剔除深度差距过小的对象对。
- 用带深度图的公开数据构建绝对深度问答,3D 标注转成物体位置问答。
视频
- 组合 caption、动作识别、时间定位和问答;定位任务直接预测起止时间。
- 将分段 caption / QA 插入对应时间,训练持续读取视频并更新回答。
- 实时解说和逐帧响应数据训练“何时回答”,补足整段视频后一次作答的限制。
STEM 与 GUI
- STEM 同时构造科学图示理解、图表/化学结构合成和题目求解数据。
- GUI 沿 UI-TARS 路线收集元素 metadata、页面变化和多步操作轨迹。
- 将观测、思考、动作串联,训练规划、修正与反思。
预训练与 SFT
- Stage 0:冻结 SeedViT 和 LLM,只训练 adapter,对齐视觉特征与语言输入。
- Stage 1:全参数训练,重点积累图文知识、OCR 与 grounding;少量纯文本保持语言能力。
- Stage 2:平衡各任务数据,增加视频、代码、3D 等领域,并扩展到
128K。 - 按能力分类监测 loss,观察 OCR / grounding loss 与对应下游能力的变化。
精选数据
- 先众包约
13K指令样本,建立偏好对齐的初始 SFT 模型。 - 从
1.5M开源样本按任务聚类、下采样,再生成候选回答。 - 正确性 judge 先过滤错误,RM 再挑偏好较好的回答,最终保留约
30K。
任务升级
- 组合多个简单要求,合成需要多项能力的复杂指令;人工复核生成回答。
- General 与 Long-CoT 使用不同 system prompt,推理时可以切换回答模式。
混合奖励 RL 与迭代 RFT
奖励模型
- 人工排序多个候选,结合真实性、帮助性与信息量,给出问题标注和最小修改示范。
- GenRM 比较当前回答与参考答案,输出偏好指示 token 的概率作为奖励。
- 交换两个回答的位置后再评价,减小位置偏差;参考答案取人工答案或 SFT 的 best-of-N。
Prompt 筛选
- 按能力分层采样,保持任务覆盖。
- 多次生成后,若最大 reward 与均值差距太小,则剔除缺少可区分信号的 prompt。
- 训练早期 reward 与 KL 同时快速上升的简单题降低采样频率。
视觉 STEM
- 选择题去掉选项,要求直接输出答案,减少猜测。
- 过滤不看图片也能解的题,再按 SFT 成功率筛选可学习的难题。
- 答案放入指定格式,SymPy 检查数学等价;复杂短语和多问式题目剔除。
定位与视觉游戏
- Grounding 使用预测框与真值框的 IoU;指令格式用规则检查。
- 视觉谜题生成题目与已知解,答案匹配提供奖励。
- 找不同通过局部图像修补或 SVG 属性修改生成差异,同时监督解释和差异区域定位。
PPO 目标
- 一个 batch 混合开放任务和可验证任务,两类奖励都缩放至
[0,1]。 - 共享 critic 从 RM 初始化,用 SFT rollout 预热,再估计不同任务的 value。
- RM 只看最终 solution,不对 CoT 文本单独评分,给思考过程保留探索空间。
- 开放任务保留小 KL 约束,可验证任务去掉 KL;格式不符合要求时降低或置零奖励。
迭代 RFT
- 当前 RL 模型解决新增难题,verifier 筛选正确轨迹,再过滤重复、过度思考等模式。
- 正确轨迹进入下一轮 SFT,改善 RL 起点;报告完成
4轮此类迭代。
实验设置(Seed1.5-VL + SFT + Hybrid PPO)
模型和数据
- SeedViT
532M;LLM 为预训练 MoE,激活约20B。 - ViT 数据:无标签图像
2.2B、图文对4.8B、视频/音频/文本组合65M。 - VLM 多模态语料约
3T source tokens,覆盖图文、OCR、定位、STEM 和交互。
分阶段设置
- Stage 0:
16B tokens, seq=32K, token-batch=8.4M, peak-lr=2.52e-4,仅 adapter。 - Stage 1:
3T tokens, seq=32K, token-batch=71M, peak-lr=5.22e-5,全参数。 - Stage 2:
240B tokens, seq=128K, token-batch=71M, lr=5.22e-6,全参数。 - AdamW:
β1=0.9, β2=0.95, weight_decay=0.1;Stage 2 继承优化器状态。
SFT
- 精选多模态约
50K,另加纯文本和 Long-CoT;冻结 ViT,其余参数训练。 2 epochs, seq=131072, batch=16 sequences, lr=2e-5→2e-6, warmup=10%。
Hybrid PPO
- STEM 题筛选:
rollout=16,保留成功率0<p≤0.75。 context=8192, max_output=16384, episode=4096 rollouts, mini-batch=512,每轮8次更新。actor_lr=6e-7, critic_lr=7.5e-7, clip=0.2;critic 预热100步。- 开放任务
rollout=1, kl=1e-5;可验证任务rollout=4/8, kl=0。
评测
- 公共视觉、视频与 GUI 基准共
60项,区分 Thinking / Non-thinking。 - 视频默认
1 FPS,精细时序2 FPS,计数和跟踪5 FPS;每视频最多81920tokens。 - Poki 游戏
14项,多次运行,每次最多100步。
关键结果(Seed1.5-VL + SFT + Hybrid PPO)
长推理的收益
- MMMU:Non-thinking
73.6→ Thinking77.9;MathVista83.0 → 85.6。 - 简单读图并非均受益:TextVQA 的 Non-thinking
84.2高于 Thinking81.8。 - 需要分任务选择推理预算,避免把更长思考等同于更好的感知。
GUI 交互
- ScreenSpot-V2
95.2、ScreenSpot-Pro60.9,定位能力较强。 - OSWorld
36.7%、WebVoyager87.2%、AndroidWorld62.1%,展示跨平台执行能力。 - GUI 成功率仍显著低于单步定位,长程操作还依赖规划与错误恢复。
长尾数据消融
- 固定
12B tokens,每物种最多1000条后,Rare2k10.46 → 44.85,常见类基本保持。 - 进一步限制到每类
100条,Rare2k 升至89.41,但常见类降至60.31。 - 稀有概念需要重复曝光,同时要保留常见概念的多样性。
训练阶段与扩展
- Stage 0 仅对齐 adapter 优于同时更新 ViT,支持先保持视觉表征再联合训练。
- OCR / grounding loss 随数据量持续下降,局部范围内可用于预测对应下游能力。
- 更强的 RFT 冷启动改善后续 RL 终点,正确难题轨迹可在迭代中继续积累。
未来方向
- 细粒度感知:改善遮挡、密集物体计数、微小差异和区域定位。
- 空间与时序:加强 3D 操作、多视角、多图逻辑和动作先后关系。
- 组合搜索:接入代码与外部工具,解决单靠文本推理困难的迷宫、拼图等问题。
- Visual CoT:结合图像生成和中间视觉标记,辅助空间想象与推理。
- 视觉幻觉:减少语言先验覆盖真实图像证据的情况,并继续扩大模型与训练算力。
(2504) Seed-Thinking-v1.5 (200B-A20B, 长 CoT RL)
🌺 论文摘要
参考链接
问题背景
- 长 CoT RL 容易出现奖励误判、value 偏差和终局反馈衰减,训练不稳定。
- 不同任务难度和评分方式差异大,混合训练会相互干扰;长尾 rollout 还会拖慢整轮训练。
核心方法
- 模型与数据:
200B-A20BMoE,400KSFT 冷启动,再混合 STEM、代码、逻辑和开放任务 RL。 - 奖励:Thinking-Verifier 判断答案等价;开放问题用 pairwise GenRM。
- 长 CoT 优化:Value 预训练、解耦与长度自适应 GAE,结合 Clip-Higher、token loss 和正例 NLL。
- 采样系统:HybridFlow + Streaming Rollout System,以版本快照继续生成长尾样本。
模型效果(Seed-Thinking-v1.5 + SFT + RL)
- AIME 2024 / 2025
86.7 / 74.0,GPQA Diamond77.3。 - Codeforces
avg@8=36.3、pass@8=55.0;SWE-bench Verified 内部 sandbox47.0。
重要结论
- Verifier 质量影响训练目标:困难判断集准确率
82.7% → 99.3%,思考式验证减少等价答案误判。 - RFT 并非总能改善 RL 终点:消融中收敛更快,但 AIME
58 → 54。
核心贡献
- 系统整理长 CoT RL 的数据、奖励、优势估计和异步采样方法,并构建 BeyondAIME。
未来方向
- 提高 RL 效率,扩展更难任务,缩小通用奖励模型与 verifier 的准确性差距。
问题背景
- 奖励不可靠:格式不同的等价答案可能被判错,策略也可能利用 verifier 的漏洞。
- Value 初始化失配:critic 不熟悉 SFT policy 的长推理轨迹,早期 advantage 容易有偏。
- 远期奖励衰减:回答越长,最终正确性反馈越难传到前面的 token。
- 领域干扰:简单偏好题优化过快,可能挤压难题探索空间。
- Rollout 长尾:同 batch 响应长度差异大,同步训练等待最慢样本。
核心方法
训练数据与冷启动
STEM
- 数学占主要部分,先去除题干不全、符号冲突和要求不清楚的题目。
- 多次采样都正确的题目视为过易,剔除;模型高度一致却与参考答案冲突的题目交给专家复核。
- 选择题改为填空或短答,减少猜测;清洗后保留约
100KSTEM 问题。
代码与逻辑
- 代码题必须有完整说明、单元测试和 checker,以 sandbox 执行结果提供奖励。
- 为
22类逻辑任务实现 generator + verifier,生成约10K题。 - 根据模型当前表现调整数独、迷宫等任务难度,持续提供可学习的样本。
开放任务
- 写作、翻译、知识问答和角色扮演来自 Doubao-Pro 1.5 数据。
- 同题生成多个回答,用 RM 评分,过滤分数方差低、区分空间小的 prompt。
- 已在早期训练中快速提高 reward 的简单题降采样,避免反复强化狭窄行为。
Long-CoT 冷启动
- 专家通过提示和多轮交互整理少量高质量推理示范,先训练初始 reasoning 模型。
- 模型继续生成候选,Seed-Verifier 选出正确轨迹,扩展到数学、代码、逻辑与开放任务。
- SFT 使用
300K可验证任务和100K开放任务,建立可读且稳定的推理模式。
奖励与答案验证
Seed-Verifier
- 输入问题、参考答案与模型答案,按照数学含义判断是否等价,输出 YES / NO。
- 例如
2^19与524288应视为同一答案,不能只比较字符串。
Seed-Thinking-Verifier
- 先展开两种表达的关系,再输出判断;将验证本身作为可验证任务,与数学任务共同优化。
- 重点减少格式变化引起的不一致、边界案例误判和 reward hacking。
- 开放任务比较两个回答,使用 YES / NO 概率表示相对偏好。
- 相较无界打分,这种奖励较少出现极端值,更容易与 verifier 信号共同训练。
- RL 混合三类数据:仅 verifier、仅 RM,以及两者共同评分的任务。
- 在线数据分布调整:根据难度和训练表现改变 prompt 配比,缓解不同领域互相干扰。
长 CoT 的价值估计与策略更新
Value 预训练
- 固定 SFT policy 生成轨迹,用实际 Monte Carlo return 训练 critic。
- critic 先适应当前 policy 的回答模式,再参与 RL,减少初始 value 误差破坏 CoT。
Decoupled-GAE
- critic 与 actor 使用不同的 GAE 参数,分别构造 value 目标和 policy advantage。
- 例如
λ_value=1减少 value 目标偏差,λ_policy=0.95平衡策略梯度偏差与方差。
- GAE 将后续 TD error 加权传回当前 token,固定
λ<1时,远处反馈随距离衰减。 - 使用回答长度
l调整 policy 的 λ,长回答的 λ 更接近1。
- 蓝色
αl控制衰减尺度,使长短回答中的早期 token 都能获得终局信号。 - 此处
α是优势估计超参,与采样系统的完成比例分别定义。
探索空间
- 概率比
r=π_current/π_old控制新策略相对采样策略的变化。 - Clip-Higher 分离上下裁剪边界,放宽上界,为低概率但正优势的 token 留出增长空间。
样本利用
- Token-level loss:在全部 tokens 上聚合,避免按回答平均时长回答每个 token 的权重过低。
- Positive Example LM Loss:对正确样本额外加 NLL,强化已验证有效的推理轨迹。
- 红色项只学习正例,
μ控制监督学习信号相对 RL 的强度。
流式采样系统
执行流程
- HybridFlow 的单控制器编排数据流,worker groups 分别执行生成、评分和模型更新。
- 主要计算资源在生成和训练之间切换,减少 GPU 空闲。
- 最新策略完成指定比例的样本后推进训练,未完成的长轨迹交给独立资源继续生成。
版本管理
- 继续生成使用对应的策略快照,后续训练因此混合新旧版本样本。
- 通过完成比例调节 on/off-policy 混合程度,在等待长尾和样本时效之间取舍。
- attention 使用 TP/CP,MoE 使用 EP,再结合 FSDP 分摊参数和优化器。
- KARP 重排同 mini-batch 的序列,平衡不同 micro-batch 的有效长度。
- 激活重算、activation/optimizer offload 支持更大 micro-batch,增加通信重叠。
- AutoTuner 按实测内存与性能选择配置;ByteCheckpoint 支持切换并行配置后恢复。
实验设置(Seed-Thinking-v1.5 + SFT + RL)
模型和训练
- MoE:总参数
200B,激活20B。 - SFT:
400K数据,2 epochs, max_length=32000, lr=2e-5→2e-6,cosine decay。 - RL:混合 STEM、代码、逻辑与开放任务,使用前述 value / policy 优化及动态数据配比。
- 完整 RL rollout、batch 和硬件配置未在报告集中列出。
评测协议
- 数学:每题
32次回答取平均;GPQA:8次平均。 - Codeforces:最近
12场比赛,分别报告avg@8和pass@8。 - BeyondAIME:专家构造
100个高难整数答案问题,避免简单猜测和直接复用原题。 - SWE-bench Verified:内部 sandbox,同环境比较模型。
- Verifier:额外人工标注
456个原 verifier 难以稳定处理的样本。
消融与人工评价
- RFT 初始化:比较有无 RFT 的 RL 最终表现。
- 算法对照:Qwen-32B-Dense 与 Seed-150B-MoE;后者是有限步数的消融模型。
- 开放任务:多轮 session 匿名比较,以
0–4分评价每轮,并判断整段交互偏好。
关键结果(Seed-Thinking-v1.5 + SFT + RL)
数学和科学
- AIME 2024
86.7、AIME 202574.0、BeyondAIME48.0,均高于表中 DeepSeek-R1。 - GPQA Diamond
77.3,但 SimpleQA12.9;推理提升没有自动补齐事实知识。
代码与逻辑
- Codeforces
avg@8=36.3、pass@8=55.0;增加尝试可以覆盖更多问题。 - ARC-AGI
39.9,高于表中 R1 的18.3,逻辑任务是较强项。 - SWE-bench Verified 内部环境
47.0,同环境 R146.2;仓库修复改善相对有限。
Verifier 改善
- 困难判断集上,普通 verifier
82.7%,Thinking-Verifier99.3%。 - 主要收益是减少等价表达和边界答案误判,为 policy 提供更一致的优化目标。
初始化和算法
- RFT 初始化更快饱和,但 AIME
avg@32从58%降至54%,需要同时检查探索能力。 - Qwen-32B:DAPO / VAPO
50 / 60;Seed-150B-MoE:73 / 79。 - 两个消融模型的算法排序一致,支持先用较小模型筛选训练方案。
系统效率
- 流式采样的系统迭代约
3×加速,主要减少不同回答长度造成的同步等待。
未来方向
- 高效 RL:进一步改善训练稳定性与计算效率,减少长推理训练成本。
- 更难任务:扩大 Thinking 模式的任务覆盖,继续检验复杂推理的能力上限。
- 通用奖励:让开放任务 RM 接近可验证任务 verifier 的准确性,减少混合训练中的奖励噪声。