Skip to content

Seed 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 8835 字
⏳ 26 分钟

变化点 ​

2026

2026.06 · Seed2.1

  • 以跨工具 RL 统一 GUI、MCP 和代码操作。
  • 通过 Seed for Seed 将模型用于评测、数据与训练研发。

2026.06 模型卡 · Seed2.0

  • 加强真实任务交付、长尾知识与视觉约束处理。
  • 按实际工作流组织评测与反馈,关注复杂任务的完成质量。
2025

2025.06 · Seed-Coder

  • 以模型判断筛选代码质量,结合文件、仓库、Commit 与网页数据构建训练语料。
  • 分别构建 Base、Instruct 与 Reasoning 模型,覆盖补全、指令执行和代码推理。

2025.05 · Seed1.5-VL

  • 采用原生分辨率视觉编码器,减少缩放对细节识别的损失。
  • 结合联合预训练与混合 PPO,强化视觉推理。

2025.04 · Seed-Thinking-v1.5

  • 以长 CoT RL 强化推理,围绕 verifier、奖励与优势估计优化训练。
  • 异步训练系统支撑更长轨迹和更大规模采样。

(2606) Seed2.1 (跨工具 RL, Seed for Seed) ​

Seed2.1 概况

参考链接

研究重点

  • Pro 面向复杂推理与长程任务;Turbo 面向效率与吞吐。
  • 用跨动作空间 RL 训练 Generalist CUA,同时优化感知工具、上下文管理和真实产物评测。
  • Seed for Seed:模型参与评测、数据、训练实验和基础设施研发;Deep Think:增加推理时工具验证。
跨工具 RL 与多模态感知

联合动作空间

  • 同一 policy 选择截图、点击、搜索、代码执行和 MCP 调用,RL 学习不同工具之间的动作选择。
  • MCP / 命令适合文件、属性与批量修改;GUI 负责视觉定位、布局检查及 API 未覆盖的操作。
  • CreativeWork 在 Notion、Canva、Figma 中交替使用 MCP 与 GUI,保持同一任务的连续执行。

感知与上下文

  • 文档高分辨率渲染,保留小字和图表;视频先覆盖全片,再对相关片段加密抽帧。
  • 图片、文档按需分批加载,减少一次读入全部媒体对推理上下文的挤占。

同模型动作空间对照

  • OSWorld Pro:GUI-only → Generalist CUA,成功率 72.6% → 78.8%,步数 28.2 → 24.2。
  • Turbo:成功率 73.2% → 76.4%,步数 27.5 → 22.3;联合动作空间同时改善质量和操作效率。
真实任务构建与产物验收

任务来源

  • Agent Startup Bench:访谈已有业务验证的团队,由专家整理任务、附件、交付要求与 rubrics。
  • SeedClawBench:从 5000+ 线上任务和 600+ 众测任务中筛选、改写 100 项任务。
  • 多轮对话保留用户不满意轮次的历史上下文,检查模型重新生成后的完整回答。

执行与检查

  • Agent-as-Judge 读取轨迹、产物与状态快照,调用只读工具逐条检查 rubrics,并输出对应证据。
  • PDF、表格和多模态产物使用相应工具检查,避免只根据模型的完成声明评分。
  • Claw-Eval 使用 Pass^3,要求同题三次均成功,关注工作流的重复执行稳定性。
Seed for Seed:评测与数据迭代

Eval Loop

  • 给定外部 benchmark 仓库,Agent 读取规范、接入内部 Harness、配置 verifier,再对齐基线。
  • Auto-Eval 生成定向测试;Post-Eval 分析失败轨迹,区分模型能力不足与评测器误判。

Data Loop

  • Optimizer 修改数据清洗规则或正则;Evaluator 检查精确率、召回率与误删样本。
  • 在精确率门槛 0.95 下持续提高召回率;300M tokens 预算案例达到 43.3% 召回率。
  • 清洗规则由数据评测决定保留或回退,减少人工逐条诊断和试改。
Seed for Seed:SFT 实验与轨迹修正

多角色实验流程

  • Master 选择实验方向;Actor 合成数据、启动训练和部署;Critic 独立评价模型。
  • 每轮比较学习率与数据配比,保留最佳候选,再按失败分析调整下一轮数据。
  • 每轮最多 5 个候选,3轮 / 13次 实验后,案例任务得分 0.40 → 0.70。

GUI 失败数据修正

  • 对齐同任务成功、失败轨迹,定位最早分歧动作,利用当步可见状态生成纠错 skill。
  • 例如最低价车票任务:失败轨迹只比较默认列表,skill 补充“先检查价格排序”。
  • 加入 skill 后重跑验证,将成功与失败轨迹继续用于训练数据构建。
Seed for Seed:RL 框架与 Kernel 研发

RL 框架迭代

  • Actor 实现功能、运行测试和 RL 实验;Critic 检查代码、实验结果与交付标准。
  • Monitor 汇总跨轮问题和可复用规则,调整协作流程,减少重复错误。
  • 人设定目标和质量门槛;Agent 执行研发任务,训练更新由具体实验流程完成。

Kernel 优化

  • 输入 PyTorch 实现和目标设备,生成 Triton kernel;先检查正确性,再测量性能。
  • 围绕融合、访存、精度和 launch 配置迭代,无收益改动回退。
  • H800 attention decode 案例达到 1.36ms,约为 PyTorch 的 5.9× 速度。
Deep Think:工具验证与候选修订

推理策略

  • 针对科研与高级工程任务,将生成扩展为 reason → verify → revise → select。
  • 文献检索:搜索领域资料,补充候选方案需要的知识和约束。
  • Sandbox 验证:运行代码检验中间假设、数值计算和实现细节,发现问题后修正候选。
  • Verifier 与候选选择:结合验证反馈继续迭代,再提交最终方案。
  • 搜索、代码执行、verifier、外部 Harness 和领域工具链可以替换,适配不同科研任务。

Seed2.1 Pro → Deep Think

  • IMO 2025:65.2 → 81.0;IMOProof-Adv:54.3 → 83.8,证明类任务收益更明显。
  • IPhO 2025:79.3 → 89.0;FrontierScience-Research:33.3 → 40.7。
  • 额外计算用于外部验证和候选修订,帮助模型处理依赖多步推导、可执行检查的问题。
交付表现与行为问题

代码与专业工作

  • Pro / Turbo:NL2Repo-Bench 47.0 / 43.7,Terminal-Bench 2.1 71.0 / 67.6。
  • Pro 的 GDPval 87.9、OfficeQA-Pro 70.9;CreativeWork 42.5,表中 GPT-5.5 为 30.5。
  • 相同仓库和任务的 Claude Code 匿名众测中,相对 Opus 4.6 的偏好胜率为 59.1%。

产物正确与整体体验

  • Trae 的 167 项有效任务:Pro / Opus 4.7 完全正确产物占比 29.3% / 20.4%。
  • 综合不可用比例却为 11.4% / 7.8%;越界修改和指令遵循问题会抵消代码质量优势。
  • 重构、理解和修复较强,从零开发、严格限定修改范围的任务仍需改善。

(2606) Seed2.0 Model Card (真实任务评测, 长尾知识) ​

🌺 论文摘要

Seed2.0 Model Card 摘要

参考链接

问题背景

  • 竞赛推理能力较强,实际工作流仍受长尾专业知识、复杂约束和长程执行限制。
  • 单项分数难以解释交付失败,需要同时测能力、完整任务和具体行为。

核心方法

  • 模型迭代方向:补充长尾领域知识,强化视觉理解、复杂指令和代码任务能力。
  • 真实任务评测:围绕科研、仓库开发、上下文学习和业务交付,构建分层评测。
  • 自动行为诊断:汇总指标、推理和工具轨迹,按场景分析失败,再生成能力报告。
  • 工具辅助证明:自然语言采用求解、验证、修正;形式化证明接入 Lean 与 Python。

模型效果(Seed2.0 Pro)

  • SWE-bench Verified 76.5、SWE-bench Pro 46.9、Terminal-Bench 2.0 55.8。
  • NL2Repo-Bench 27.9、Encyclo-K 65.7;知识能力和完整工程交付存在不同强弱项。

重要结论

  • 任务粒度影响评价:局部代码修复较强,长程仓库开发和多约束整合仍有明显提升空间。
  • 行为诊断比总分更具体:可将失败定位到约束冲突、边界遗漏和冗余工具调用。

核心贡献

  • 给出面向真实需求的评测框架与大量执行案例,把模型迭代目标连接到最终交付。

未来方向

  • 加强长尾知识、复杂约束整合、上下文学习与长程仓库开发。

问题背景 ​

竞赛能力与实际交付之间的差距
  • 领域知识不足:真实需求涉及专业论坛、手册和行业经验,通用问答不能充分覆盖。
  • 跨阶段执行失败:完整开发需要规划、依赖安装、跨文件修改和验证,错误会沿流程累积。
  • 复杂约束遗漏:模型可能解决主问题,却漏掉用户的格式、条件分支或业务限制。

核心方法 ​

模型能力与迭代目标 ​

面向真实需求的模型迭代

优化重点

  • 系统补充长尾领域知识,提升专业问题的回答可靠性。
  • 多模态重点覆盖截图、扫描文档、图表和结构化信息提取。
  • 代码侧关注真实开发中的前端、调试和维护任务;通用侧关注长上下文与复杂指令。

系列分工

  • Pro 面向复杂推理和长上下文;Lite 兼顾通用能力与效率;Mini 面向高吞吐应用。
  • 本文主要公开能力评测和应用流程,模型规模、训练数据量及 SFT/RL 超参未展开。

任务构建与分层评测 ​

长尾知识与复杂指令

长尾知识

  • LPFQA:从专业论坛和社区提取实际问题,覆盖代码、金融、工程等场景。
  • Encyclo-K:从书籍提取原子知识,再组合成问题,测知识掌握和上下文学习。
  • HLE-Verified:专家检查原始题目,保留清晰、无歧义且能够可靠验证的题目。

复杂指令

  • 中文生产场景覆盖格式、条件、内容、措辞、语气、示例与长度要求。
  • 将要求分维度评分,区分“主内容正确”与“同时满足全部限制”。
科研、仓库开发与业务任务
  • Scientific Discovery:科研代码实现、生物多模态推理和研究问题求解。
  • Vibe Coding:从自然语言需求构建仓库,检查跨文件一致性、依赖和完整功能。
  • Context Learning:从技术文档或企业知识库学习规则,再解决包含噪声资料的问题。
  • Real-World Tasks:按 rubrics 检查报告、业务产物和多步骤计划的完成情况。
代表性评测设计

工程与科研

  • NL2Repo-Bench:以完整仓库作为交付对象,避免只看单函数生成是否通过。
  • AInstein Bench:把科学问题转成可执行计算流程,检查代码实现和计算结果。

业务与上下文

  • ToB-Reference Q&A:检索结果包含噪声,模型需识别有效材料并回答真实业务问题。
  • ToB-Complex Workflows:联合使用上下文规则与多项指令,测连续任务完成。
  • GDPVal-Verified / XPertBench:使用明确 rubrics,检查有实际业务价值的产物。
Agent 环境与评测稳定性
  • 将重复配置整合为预构建镜像,修复失效环境,用内部镜像稳定依赖下载。
  • 过滤参考解不通过、运行结果不稳定和异常资源占用等问题任务。
  • Terminal-Bench 2.0 去除 3 个受网络或安全限制影响的任务,再接入内部 Agent 框架。
  • 比较表同时包含官方成绩和内部复测;该评测有环境适配与任务筛选,不完全等同原始榜单。

行为诊断与工具推理 ​

Model-on-Model 行为诊断

输入与分析

  • 数据处理:汇总任务得分、token 用量、格式遵循、轮数及逐样本推理/执行轨迹。
  • 场景分析:按搜索、规划、推理和工具任务选择分析流程,定位具体失败模式。
  • 报告生成:输出能力差异、策略得失和可追踪案例,辅助下一轮模型迭代。

典型诊断

  • 旅行规划:检查时间、地点和价格约束是否互相冲突。
  • 数学证明:区分主体推导正确与边界情况、分支穷举遗漏。
  • 工具任务:区分有效验证与机械重复调用,分析调用轮数增加的原因。
求解、验证与修正
  • 自然语言证明:生成候选证明,检查逻辑缺口,再修正至满足评分要求。
  • 形式化证明:在多轮 Agent 环境中调用 Lean 检查证明,Python 辅助计算与探索。
  • 科学计算:读取理论和数据,实现数值过程,再根据程序结果调试和验证。

实验设置(Seed2.0 Pro / Lite / Mini) ​

模型、任务与协议

模型与基础能力

  • 主比较:Pro 与 GPT-5.2、Opus 4.5、Sonnet 4.5、Gemini 3 Pro;Lite/Mini 单独比较。
  • 视觉评测覆盖 50 个图像与 24 个视频基准,分别检查感知、推理、时序和长上下文。
  • 复杂中文指令:912 项测试、17 个加权维度,与 Seed1.8 对照。

Agent 与高级任务

  • Coding、Search、Tool Use、GUI、Deep Research 分开评估。
  • Terminal-Bench 2.0 使用 Terminus2,按前述内部环境处理执行。
  • Putnam-200:随机选取 200 个形式化题目,Lean/Python 工具交互,报告 Pass@8。
  • IMO / CMO:使用 solve-verify-refine 流程评估完整证明。

视频输入

  • Morse-500 使用 5 FPS;快速运动感知类基准使用 2 FPS,对照模型采用同样设置。

关键结果(Seed2.0 Pro / Lite) ​

基础能力与真实任务

知识和视觉

  • Encyclo-K 65.7,高于表中 Gemini 3 Pro 的 64.9,书籍知识任务表现较强。
  • SimpleQA-Verified 36.0,低于 Gemini 3 Pro 的 72.1;事实知识覆盖仍不均衡。
  • MathVista 89.8、MM LongBench 74.8;视觉推理和长文档理解均有较好表现。

复杂指令

  • 中文综合得分 72.89% → 75.26%,措辞、语气和 few-shot 约束改善明显。
  • 内容维度并非同步提高,说明多项要求之间仍需联合优化。

搜索与工程

  • BrowseComp 77.3、BrowseComp-zh 82.4,搜索是相对优势领域。
  • SWE-bench Verified 76.5,但 SWE-Evo 仅 8.5;长程开发比单次修复困难。
  • NL2Repo-Bench 27.9,低于表中 GPT-5.2 的 49.3;完整仓库构建仍是明确短板。
诊断结论与工具推理

约束整合与无效交互

  • WorldTravel 分析发现,约束变多且交叉依赖时,时间对齐、排序和冲突修复更容易失败。
  • τ²-Bench 高分案例平均 31.4 轮,低分案例 55.0 轮;低分行为常陷入重复检查。
  • 这些诊断将“任务失败”细化为可改进的行为环节,方便选择后续训练目标。

数学证明

  • 迭代证明流程达到 IMO 2025 35/42、CMO 2025 114/126,均达到报告给出的金牌线。
  • Putnam-200:Pro Pass@8=35.5%,Lite 30.5%;通用模型能够结合形式化工具执行证明搜索。

未来方向 ​

作者提出的能力缺口
  • 长尾知识:补足专业事实与罕见概念,减少领域间能力差异。
  • 上下文学习:提高对技术资料、复杂规则与噪声证据的联合使用能力。
  • 长程 Coding:强化仓库级规划、跨文件一致性和多阶段功能交付。
  • 复杂约束:改进全局冲突检测、边界覆盖与失败后的计划修正。
  • 执行效率:减少机械重复和无效工具调用,兼顾成功率与交互成本。

(2506) Seed-Coder (模型筛选数据、Code 预训练) ​

Seed-Coder

核心内容

  • 以模型判断筛选代码质量,结合文件、仓库、Commit 与网页数据构建训练语料。
  • 分别构建 Base、Instruct 与 Reasoning 模型,覆盖补全、指令执行和代码推理。

详细笔记

(2505) Seed1.5-VL (原生分辨率, 混合 PPO) ​

🌺 论文摘要

Seed1.5-VL 摘要

参考链接

问题背景

  • 视觉低层能力缺少高质量标注,计数、定位、3D 和视频时序不能只靠图文描述学好。
  • 高分辨率与长视频增加 token 和计算开销,训练数据还存在明显的长尾分布。

核心方法

  • 多模态架构:532M SeedViT + MLP adapter + 激活 20B 的 MoE LLM,支持原生分辨率与动态视频采样。
  • 数据构建:分能力构造 OCR、grounding、计数、3D、视频、STEM 和 GUI 数据。
  • 预训练与 SFT:ViT 训练 → adapter 对齐 → 联合训练与扩窗 → 精筛多模态 SFT。
  • Hybrid PPO / RFT:GenRM 与规则奖励共享 critic;RL 生成正确难题轨迹,反哺下一轮 SFT。

模型效果(Seed1.5-VL + SFT + RL)

  • Thinking:MMMU 77.9、MathVista 85.6;GUI 上 ScreenSpot-V2 95.2、OSWorld 36.7。

重要结论

  • 长尾重采样有取舍:增加稀有概念曝光可提升识别,但过度压低常见类会损伤常见类能力。
  • 感知与长推理分工不同:Thinking 提升多模态推理,简单读图任务不一定需要更长思考。

核心贡献

  • 给出视觉数据合成、分阶段预训练、混合 RL 与训练系统的完整多模态方案。

未来方向

  • 改善细粒度感知、3D 和组合搜索,探索图像生成支持的 visual CoT 与外部工具。

问题背景 ​

视觉能力与训练效率
  • 标注覆盖不足:图文对擅长描述场景,但难以直接教会精确坐标、计数和空间关系。
  • 长尾概念稀少:常见物体占据大量样本,罕见物种、地点和商品缺少有效曝光。
  • 视觉负载不均:不同样本的图片数、尺寸和视频长度差异大,GPU 容易互相等待。

核心方法 ​

多模态架构与训练系统 ​

SeedViT 原生分辨率

编码与压缩

  • 保留长宽比例,把图像尺寸调整至 28 的倍数,再切成 14×14 patches。
  • 2D RoPE 编码空间位置,多个图像可打包,但 attention mask 隔离不同图像。
  • 相邻 2×2 特征平均池化,视觉 tokens 压到 1/4,再经两层 MLP 接入 LLM。

ViT 三阶段预训练

  • MIM:随机遮挡 75% patches,预测 EVA02-CLIP-E 的对应特征,学习局部结构。
  • 图文对比:attention pooling 汇总图像,结合 SigLIP 与 SuperClass loss 对齐图文。
  • 全模态对齐:MiCo 将视频帧、音频及其描述共同对齐,补充时序与跨模态表征。
Dynamic Frame-Resolution Sampling
  • 根据任务使用不同抽帧率,每帧前加时间戳,显式提供时间位置。
  • 视频 token 总量受限时,先降低每帧分辨率,尽量保留整段视频的时间覆盖。
  • 最低分辨率仍超预算,再均匀减少帧数;避免直接截断导致结尾事件丢失。
多模态训练系统
  • 并行策略:ViT/adapter 用 ZeRO DP,LLM 用 EP、PP、DP、CP,适应组件规模差异。
  • 视觉均衡:按图片 FLOPs 降序,将下一张分给当前负载最轻的 GPU,在分组内完成重分布。
  • 数据加载:PP 组内只由一个 rank 读取,共享 metadata,减少重复 I/O。
  • RL:verl 编排,vLLM 生成,verifier 独立进程隔离故障,actor/critic 分别更新。

多模态数据构建 ​

图文知识与 OCR

知识分布

  • 图文相似度、图片质量、文本规则和去重共同过滤网页图文对。
  • 旧版 VLM 标注领域和命名实体,识别低频概念,增加低频领域样本曝光。

OCR 与问答

  • 文档解析提取内容和布局;字体渲染与 LaTeX 合成文字图片,并加入模糊、畸变等增强。
  • LLM 生成图表内容与绘图代码,执行得到图像;HTML/LaTeX/Markdown 渲染表格。
  • 根据图片及 OCR 结果生成 QA,再过滤问答不匹配项,使数据同时训练识别与理解。
Grounding、计数与 3D

框与点定位

  • 检查公开检测标注中的错误、漏标和重复框,再构造定位与空间关系问答。
  • 从 caption 提取实体,用 Grounding DINO 自动打框,以 CLIP、NMS 和规则过滤。
  • Molmo / CountGD 标注中心点;计数数据先输出框或点,再根据目标数量回答。
  • OCR、GUI、定位均使用 [0,999] 相对坐标,避免分辨率变化改变标签语义。

3D 数据

  • DepthAnything V2 生成相对深度排序,剔除深度差距过小的对象对。
  • 用带深度图的公开数据构建绝对深度问答,3D 标注转成物体位置问答。
视频、STEM 与 GUI

视频

  • 组合 caption、动作识别、时间定位和问答;定位任务直接预测起止时间。
  • 将分段 caption / QA 插入对应时间,训练持续读取视频并更新回答。
  • 实时解说和逐帧响应数据训练“何时回答”,补足整段视频后一次作答的限制。

STEM 与 GUI

  • STEM 同时构造科学图示理解、图表/化学结构合成和题目求解数据。
  • GUI 沿 UI-TARS 路线收集元素 metadata、页面变化和多步操作轨迹。
  • 将观测、思考、动作串联,训练规划、修正与反思。

预训练与 SFT ​

Adapter 对齐与联合训练
  • Stage 0:冻结 SeedViT 和 LLM,只训练 adapter,对齐视觉特征与语言输入。
  • Stage 1:全参数训练,重点积累图文知识、OCR 与 grounding;少量纯文本保持语言能力。
  • Stage 2:平衡各任务数据,增加视频、代码、3D 等领域,并扩展到 128K。
  • 按能力分类监测 loss,观察 OCR / grounding loss 与对应下游能力的变化。
SFT 数据精筛与复杂指令

精选数据

  • 先众包约 13K 指令样本,建立偏好对齐的初始 SFT 模型。
  • 从 1.5M 开源样本按任务聚类、下采样,再生成候选回答。
  • 正确性 judge 先过滤错误,RM 再挑偏好较好的回答,最终保留约 30K。

任务升级

  • 组合多个简单要求,合成需要多项能力的复杂指令;人工复核生成回答。
  • General 与 Long-CoT 使用不同 system prompt,推理时可以切换回答模式。

混合奖励 RL 与迭代 RFT ​

开放任务 GenRM

奖励模型

  • 人工排序多个候选,结合真实性、帮助性与信息量,给出问题标注和最小修改示范。
  • GenRM 比较当前回答与参考答案,输出偏好指示 token 的概率作为奖励。
  • 交换两个回答的位置后再评价,减小位置偏差;参考答案取人工答案或 SFT 的 best-of-N。

Prompt 筛选

  • 按能力分层采样,保持任务覆盖。
  • 多次生成后,若最大 reward 与均值差距太小,则剔除缺少可区分信号的 prompt。
  • 训练早期 reward 与 KL 同时快速上升的简单题降低采样频率。
可验证视觉任务

视觉 STEM

  • 选择题去掉选项,要求直接输出答案,减少猜测。
  • 过滤不看图片也能解的题,再按 SFT 成功率筛选可学习的难题。
  • 答案放入指定格式,SymPy 检查数学等价;复杂短语和多问式题目剔除。

定位与视觉游戏

  • Grounding 使用预测框与真值框的 IoU;指令格式用规则检查。
  • 视觉谜题生成题目与已知解,答案匹配提供奖励。
  • 找不同通过局部图像修补或 SVG 属性修改生成差异,同时监督解释和差异区域定位。
共享 Critic 与 RFT 更新

PPO 目标

  • 一个 batch 混合开放任务和可验证任务,两类奖励都缩放至 [0,1]。
  • 共享 critic 从 RM 初始化,用 SFT rollout 预热,再估计不同任务的 value。
  • RM 只看最终 solution,不对 CoT 文本单独评分,给思考过程保留探索空间。
  • 开放任务保留小 KL 约束,可验证任务去掉 KL;格式不符合要求时降低或置零奖励。

迭代 RFT

  • 当前 RL 模型解决新增难题,verifier 筛选正确轨迹,再过滤重复、过度思考等模式。
  • 正确轨迹进入下一轮 SFT,改善 RL 起点;报告完成 4 轮此类迭代。

实验设置(Seed1.5-VL + SFT + Hybrid PPO) ​

模型与预训练

模型和数据

  • SeedViT 532M;LLM 为预训练 MoE,激活约 20B。
  • ViT 数据:无标签图像 2.2B、图文对 4.8B、视频/音频/文本组合 65M。
  • VLM 多模态语料约 3T source tokens,覆盖图文、OCR、定位、STEM 和交互。

分阶段设置

  • Stage 0:16B tokens, seq=32K, token-batch=8.4M, peak-lr=2.52e-4,仅 adapter。
  • Stage 1:3T tokens, seq=32K, token-batch=71M, peak-lr=5.22e-5,全参数。
  • Stage 2:240B tokens, seq=128K, token-batch=71M, lr=5.22e-6,全参数。
  • AdamW:β1=0.9, β2=0.95, weight_decay=0.1;Stage 2 继承优化器状态。
后训练与评测

SFT

  • 精选多模态约 50K,另加纯文本和 Long-CoT;冻结 ViT,其余参数训练。
  • 2 epochs, seq=131072, batch=16 sequences, lr=2e-5→2e-6, warmup=10%。

Hybrid PPO

  • STEM 题筛选:rollout=16,保留成功率 0<p≤0.75。
  • context=8192, max_output=16384, episode=4096 rollouts, mini-batch=512,每轮 8 次更新。
  • actor_lr=6e-7, critic_lr=7.5e-7, clip=0.2;critic 预热 100 步。
  • 开放任务 rollout=1, kl=1e-5;可验证任务 rollout=4/8, kl=0。

评测

  • 公共视觉、视频与 GUI 基准共 60 项,区分 Thinking / Non-thinking。
  • 视频默认 1 FPS,精细时序 2 FPS,计数和跟踪 5 FPS;每视频最多 81920 tokens。
  • Poki 游戏 14 项,多次运行,每次最多 100 步。

关键结果(Seed1.5-VL + SFT + Hybrid PPO) ​

推理、感知与 Agent

长推理的收益

  • MMMU:Non-thinking 73.6 → Thinking 77.9;MathVista 83.0 → 85.6。
  • 简单读图并非均受益:TextVQA 的 Non-thinking 84.2 高于 Thinking 81.8。
  • 需要分任务选择推理预算,避免把更长思考等同于更好的感知。

GUI 交互

  • ScreenSpot-V2 95.2、ScreenSpot-Pro 60.9,定位能力较强。
  • OSWorld 36.7%、WebVoyager 87.2%、AndroidWorld 62.1%,展示跨平台执行能力。
  • GUI 成功率仍显著低于单步定位,长程操作还依赖规划与错误恢复。
数据与训练经验

长尾数据消融

  • 固定 12B tokens,每物种最多 1000 条后,Rare2k 10.46 → 44.85,常见类基本保持。
  • 进一步限制到每类 100 条,Rare2k 升至 89.41,但常见类降至 60.31。
  • 稀有概念需要重复曝光,同时要保留常见概念的多样性。

训练阶段与扩展

  • Stage 0 仅对齐 adapter 优于同时更新 ViT,支持先保持视觉表征再联合训练。
  • OCR / grounding loss 随数据量持续下降,局部范围内可用于预测对应下游能力。
  • 更强的 RFT 冷启动改善后续 RL 终点,正确难题轨迹可在迭代中继续积累。

未来方向 ​

感知与推理的不足
  • 细粒度感知:改善遮挡、密集物体计数、微小差异和区域定位。
  • 空间与时序:加强 3D 操作、多视角、多图逻辑和动作先后关系。
  • 组合搜索:接入代码与外部工具,解决单靠文本推理困难的迷宫、拼图等问题。
  • Visual CoT:结合图像生成和中间视觉标记,辅助空间想象与推理。
  • 视觉幻觉:减少语言先验覆盖真实图像证据的情况,并继续扩大模型与训练算力。

(2504) Seed-Thinking-v1.5 (200B-A20B, 长 CoT RL) ​

🌺 论文摘要

Seed-Thinking-v1.5 摘要

参考链接

问题背景

  • 长 CoT RL 容易出现奖励误判、value 偏差和终局反馈衰减,训练不稳定。
  • 不同任务难度和评分方式差异大,混合训练会相互干扰;长尾 rollout 还会拖慢整轮训练。

核心方法

  • 模型与数据:200B-A20B MoE,400K SFT 冷启动,再混合 STEM、代码、逻辑和开放任务 RL。
  • 奖励:Thinking-Verifier 判断答案等价;开放问题用 pairwise GenRM。
  • 长 CoT 优化:Value 预训练、解耦与长度自适应 GAE,结合 Clip-Higher、token loss 和正例 NLL。
  • 采样系统:HybridFlow + Streaming Rollout System,以版本快照继续生成长尾样本。

模型效果(Seed-Thinking-v1.5 + SFT + RL)

  • AIME 2024 / 2025 86.7 / 74.0,GPQA Diamond 77.3。
  • Codeforces avg@8=36.3、pass@8=55.0;SWE-bench Verified 内部 sandbox 47.0。

重要结论

  • Verifier 质量影响训练目标:困难判断集准确率 82.7% → 99.3%,思考式验证减少等价答案误判。
  • RFT 并非总能改善 RL 终点:消融中收敛更快,但 AIME 58 → 54。

核心贡献

  • 系统整理长 CoT RL 的数据、奖励、优势估计和异步采样方法,并构建 BeyondAIME。

未来方向

  • 提高 RL 效率,扩展更难任务,缩小通用奖励模型与 verifier 的准确性差距。

问题背景 ​

长 CoT RL 的训练难点
  • 奖励不可靠:格式不同的等价答案可能被判错,策略也可能利用 verifier 的漏洞。
  • Value 初始化失配:critic 不熟悉 SFT policy 的长推理轨迹,早期 advantage 容易有偏。
  • 远期奖励衰减:回答越长,最终正确性反馈越难传到前面的 token。
  • 领域干扰:简单偏好题优化过快,可能挤压难题探索空间。
  • Rollout 长尾:同 batch 响应长度差异大,同步训练等待最慢样本。

核心方法 ​

训练数据与冷启动 ​

可验证任务与难度筛选

STEM

  • 数学占主要部分,先去除题干不全、符号冲突和要求不清楚的题目。
  • 多次采样都正确的题目视为过易,剔除;模型高度一致却与参考答案冲突的题目交给专家复核。
  • 选择题改为填空或短答,减少猜测;清洗后保留约 100K STEM 问题。

代码与逻辑

  • 代码题必须有完整说明、单元测试和 checker,以 sandbox 执行结果提供奖励。
  • 为 22 类逻辑任务实现 generator + verifier,生成约 10K 题。
  • 根据模型当前表现调整数独、迷宫等任务难度,持续提供可学习的样本。
开放任务与 SFT 轨迹

开放任务

  • 写作、翻译、知识问答和角色扮演来自 Doubao-Pro 1.5 数据。
  • 同题生成多个回答,用 RM 评分,过滤分数方差低、区分空间小的 prompt。
  • 已在早期训练中快速提高 reward 的简单题降采样,避免反复强化狭窄行为。

Long-CoT 冷启动

  • 专家通过提示和多轮交互整理少量高质量推理示范,先训练初始 reasoning 模型。
  • 模型继续生成候选,Seed-Verifier 选出正确轨迹,扩展到数学、代码、逻辑与开放任务。
  • SFT 使用 300K 可验证任务和 100K 开放任务,建立可读且稳定的推理模式。

奖励与答案验证 ​

答案等价性判断

Seed-Verifier

  • 输入问题、参考答案与模型答案,按照数学含义判断是否等价,输出 YES / NO。
  • 例如 2^19 与 524288 应视为同一答案,不能只比较字符串。

Seed-Thinking-Verifier

  • 先展开两种表达的关系,再输出判断;将验证本身作为可验证任务,与数学任务共同优化。
  • 重点减少格式变化引起的不一致、边界案例误判和 reward hacking。
Pairwise GenRM 与混合数据
  • 开放任务比较两个回答,使用 YES / NO 概率表示相对偏好。
  • 相较无界打分,这种奖励较少出现极端值,更容易与 verifier 信号共同训练。
  • RL 混合三类数据:仅 verifier、仅 RM,以及两者共同评分的任务。
  • 在线数据分布调整:根据难度和训练表现改变 prompt 配比,缓解不同领域互相干扰。

长 CoT 的价值估计与策略更新 ​

Value-Pretraining 与 Decoupled-GAE

Value 预训练

  • 固定 SFT policy 生成轨迹,用实际 Monte Carlo return 训练 critic。
  • critic 先适应当前 policy 的回答模式,再参与 RL,减少初始 value 误差破坏 CoT。

Decoupled-GAE

  • critic 与 actor 使用不同的 GAE 参数,分别构造 value 目标和 policy advantage。
  • 例如 λ_value=1 减少 value 目标偏差,λ_policy=0.95 平衡策略梯度偏差与方差。
Length-Adaptive GAE
  • GAE 将后续 TD error 加权传回当前 token,固定 λ<1 时,远处反馈随距离衰减。
  • 使用回答长度 l 调整 policy 的 λ,长回答的 λ 更接近 1。
λpolicy=1−1αl
  • 蓝色 αl 控制衰减尺度,使长短回答中的早期 token 都能获得终局信号。
  • 此处 α 是优势估计超参,与采样系统的完成比例分别定义。
Clip-Higher 与正例学习

探索空间

  • 概率比 r=π_current/π_old 控制新策略相对采样策略的变化。
  • Clip-Higher 分离上下裁剪边界,放宽上界,为低概率但正优势的 token 留出增长空间。

样本利用

  • Token-level loss:在全部 tokens 上聚合,避免按回答平均时长回答每个 token 的权重过低。
  • Positive Example LM Loss:对正确样本额外加 NLL,强化已验证有效的推理轨迹。
L(θ)=LPPO(θ)+μLNLL,positive(θ)
  • 红色项只学习正例,μ 控制监督学习信号相对 RL 的强度。

流式采样系统 ​

长尾采样与策略快照

执行流程

  • HybridFlow 的单控制器编排数据流,worker groups 分别执行生成、评分和模型更新。
  • 主要计算资源在生成和训练之间切换,减少 GPU 空闲。
  • 最新策略完成指定比例的样本后推进训练,未完成的长轨迹交给独立资源继续生成。

版本管理

  • 继续生成使用对应的策略快照,后续训练因此混合新旧版本样本。
  • 通过完成比例调节 on/off-policy 混合程度,在等待长尾和样本时效之间取舍。
并行与内存优化
  • attention 使用 TP/CP,MoE 使用 EP,再结合 FSDP 分摊参数和优化器。
  • KARP 重排同 mini-batch 的序列,平衡不同 micro-batch 的有效长度。
  • 激活重算、activation/optimizer offload 支持更大 micro-batch,增加通信重叠。
  • AutoTuner 按实测内存与性能选择配置;ByteCheckpoint 支持切换并行配置后恢复。

实验设置(Seed-Thinking-v1.5 + SFT + RL) ​

模型、数据与评测

模型和训练

  • MoE:总参数 200B,激活 20B。
  • SFT:400K 数据,2 epochs, max_length=32000, lr=2e-5→2e-6,cosine decay。
  • RL:混合 STEM、代码、逻辑与开放任务,使用前述 value / policy 优化及动态数据配比。
  • 完整 RL rollout、batch 和硬件配置未在报告集中列出。

评测协议

  • 数学:每题 32 次回答取平均;GPQA:8 次平均。
  • Codeforces:最近 12 场比赛,分别报告 avg@8 和 pass@8。
  • BeyondAIME:专家构造 100 个高难整数答案问题,避免简单猜测和直接复用原题。
  • SWE-bench Verified:内部 sandbox,同环境比较模型。
  • Verifier:额外人工标注 456 个原 verifier 难以稳定处理的样本。

消融与人工评价

  • RFT 初始化:比较有无 RFT 的 RL 最终表现。
  • 算法对照:Qwen-32B-Dense 与 Seed-150B-MoE;后者是有限步数的消融模型。
  • 开放任务:多轮 session 匿名比较,以 0–4 分评价每轮,并判断整段交互偏好。

关键结果(Seed-Thinking-v1.5 + SFT + RL) ​

推理与工程能力

数学和科学

  • AIME 2024 86.7、AIME 2025 74.0、BeyondAIME 48.0,均高于表中 DeepSeek-R1。
  • GPQA Diamond 77.3,但 SimpleQA 12.9;推理提升没有自动补齐事实知识。

代码与逻辑

  • Codeforces avg@8=36.3、pass@8=55.0;增加尝试可以覆盖更多问题。
  • ARC-AGI 39.9,高于表中 R1 的 18.3,逻辑任务是较强项。
  • SWE-bench Verified 内部环境 47.0,同环境 R1 46.2;仓库修复改善相对有限。
奖励、初始化与算法消融

Verifier 改善

  • 困难判断集上,普通 verifier 82.7%,Thinking-Verifier 99.3%。
  • 主要收益是减少等价表达和边界答案误判,为 policy 提供更一致的优化目标。

初始化和算法

  • RFT 初始化更快饱和,但 AIME avg@32 从 58% 降至 54%,需要同时检查探索能力。
  • Qwen-32B:DAPO / VAPO 50 / 60;Seed-150B-MoE:73 / 79。
  • 两个消融模型的算法排序一致,支持先用较小模型筛选训练方案。

系统效率

  • 流式采样的系统迭代约 3× 加速,主要减少不同回答长度造成的同步等待。

未来方向 ​

作者提出的方向
  • 高效 RL:进一步改善训练稳定性与计算效率,减少长推理训练成本。
  • 更难任务:扩大 Thinking 模式的任务覆盖,继续检验复杂推理的能力上限。
  • 通用奖励:让开放任务 RM 接近可验证任务 verifier 的准确性,减少混合训练中的奖励噪声。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026