Skip to content

MiroMind 系列

📅 发表于 2026/09/23
🔄 更新于 2026/09/23
👁️ — 次访问
📝 4564 字
⏳ 13 分钟
mainllm
#基模
#Pretrain
#SFT
#RL

变化点 ​

2026

2026.03 · MiroThinker 1.7 / H1

  • 通过 Agentic MidTrain 与高难搜索任务训练,强化长程搜索和推理。
  • H1 在 1.7 上增加局部、全局验证,以更高推理预算检查工具动作与候选答案。
2025

2025.11 · MiroThinker v1.0

  • 多文档合成复杂研究任务,结合 SFT、DPO 与在线 GRPO 训练搜索 Agent。
  • 通过上下文管理和交互次数扩展,在外部反馈中持续获取信息与修正答案。

(2603) MiroThinker-1.7 & H1 (Agentic MidTrain、WebHop、双层验证) ​

🌺 论文摘要

MiroThinker-1.7 & H1 论文摘要

参考链接

问题背景

  • 增加交互轮数会放大错误规划、低效搜索与错误假设;长轨迹需要更可靠的单步决策。
  • 最终答案的可靠性取决于完整证据链,需要在中间步骤和整体结论两层进行验证。

核心方法

  • 任务构建:语料多文档 QA + WebHop 推理树,控制跳数、隐去捷径,按求解难度分层训练。
  • Agentic MidTrain:单独训练初始规划与中间推理,再用完整轨迹 SFT、DPO 衔接多轮行为。
  • 在线 GRPO:真实工具反馈、长轨迹调度;对负优势的低概率动作加强 KL,维持策略熵。
  • H1 双层验证:Local Verifier 修正中间决策,Global Verifier 检查证据链并扩展推理计算。

模型效果(MiroThinker-1.7 / H1)

  • HLE 42.9 / 47.7、GAIA 82.7 / 88.5,H1 在更高计算预算下进一步提升。
  • H1 BrowseComp 达 85.9(16×预算)、88.2(64×预算)。

重要结论

  • 单步质量:同规模模型在表现提高的同时减少交互轮数,收益来自规划与搜索效率。
  • 局部验证:及时修正错误路径,减少整条任务反复重试;全局验证进一步补全证据链。

核心贡献

  • 从增加轨迹长度转向提升有效交互,以单步训练和双层验证共同提高长程研究可靠性。

问题背景 ​

长轨迹中的错误累积

行动质量限制交互扩展

  • 错误的搜索范围、过早确定的候选答案,会让后续调用围绕错误方向继续展开。
  • 增加步数容易重复已有信息;模型需要更强的规划、证据整合与路径修正能力。

中间正确不等于最终充分

  • 单次检索有效,仍可能遗漏其他约束或缺少证据之间的连接。
  • 需要同时检查中间决策与最终证据链,再决定是否补充检索、重采样或提交答案。

核心方法 ​

多文档 QA 与 WebHop 难度分层 ​

语料任务与可控多跳任务

Corpus-based QA

  • 从 Wikipedia、OpenAlex 等构建关联文档子图,提取跨文档事实并组合为多跳问题。
  • 模糊实体名与直接约束,保持领域覆盖和批量生成效率。
  • 此类任务的难度由文档关系隐式决定,WebHop 进一步控制推理结构。

WebHop 推理树

  • 以标准答案实体为根节点,网页检索扩展子实体,每条边对应可验证的语义关系。
  • 树深控制推理跳数;只保留父子节点关系,避免跨层事实形成捷径。
  • 从开放网页扩展实体,避开百科来源,增加证据来源和知识类型的多样性。

逐层验证与线索隐藏

  • 用子节点事实检查父节点能否被定位,根节点必须能由匿名的一跳事实表唯一恢复。
  • 叶节点改为功能或属性描述;若 LLM 可直接猜出被隐藏实体,则丢弃并重新生成。
  • 最终问题仅使用推理树关系与叶节点约束,答案保持为根实体。

难度分层

  • 弱搜索 Agent 可解的任务用于早期 SFT;强 Agent 仍难以解决的任务进入后续 RL。
  • 训练前期以语料 QA 为主,随后逐步增加 WebHop,提升检索深度与约束组合难度。

Agentic MidTrain 与轨迹对齐 ​

单步规划与推理训练

初始规划

  • 输入问题,生成结构化计划与首个工具调用,先训练检索范围和行动顺序。
  • Planner–Judge 按逻辑推理、多跳检索、直接检索等任务类型评审计划。
  • 过滤复述问题、搜索约束过强、过早猜答案及覆盖不全的计划;重采样后仍不合格则丢弃。

中间推理与证据汇总

  • 从验证成功的多轮轨迹中抽取一个 Assistant 轮次,给定此前历史与工具观察,重写该轮输出。
  • 重写目标包括下一步分析与工具调用,也包括阶段性的证据整合和答案归纳。
  • 随机压缩历史上下文,让模型在信息不完整的情况下继续分析。
  • 仅对重写的目标轮计算 Loss;混入通用指令与知识数据,保持原有能力。
完整交互 SFT 与偏好训练

SFT

  • 使用完整专家轨迹,将单步规划、推理与工具使用衔接为连续行为。
  • 清理重复内容、无效工具及参数、工具失败后未重试等低质量轨迹。
  • Assistant 思考和动作参与监督;工具观察作为上下文。

DPO 与小模型偏好蒸馏

  • 按最终答案正确性对轨迹排序,要求正负样本均完整、格式有效。
  • 不固定轨迹长度和规划模板;DPO 同时加入 Chosen 轨迹 SFT Loss。
  • 1.7-mini 额外利用更强模型的偏好监督,使小模型学习更有效的多步决策。

在线 GRPO 与长轨迹执行 ​

奖励、熵控制与采样调度

在线策略优化

  • 在实时网页、搜索和沙箱中采样,奖励由答案正确性与格式惩罚组成。
  • 组内奖励均值作为优势基线,每批轨迹只进行一次在线策略更新。
  • 共享队列持续接收完成轨迹,并优先处理长尾任务,避免长任务被训练批次系统性排除。

负优势低概率动作的熵控制

  • 负优势会进一步降低动作概率;对已经很低概率的 Token 反复施压,容易导致策略熵过早下降。
  • 仅当 优势为负 且 动作 Log-prob 低于阈值 时,额外增大 KL 系数。
  • 增强对参考策略的 KL 约束,抑制这类过度更新,保留后续探索空间。
βKL(t,H)=β0+βentI[A^<0 ∧ log⁡p(at∣st)<τ]
  • β₀ 为基础 KL 系数;βent 为满足条件时追加的约束强度,τ 控制低概率范围。
ReAct 执行与双层重试

单轮交互

  • Google Search 检索,Jina 与备用抓取器提取网页,LLM 进一步筛选相关证据。
  • E2B 沙箱执行代码并交换文件;框架在执行前修复工具名、路由和参数字段。
  • 保留思考和动作历史,只保留最近 5轮 观察;单次观察过长时截断并标记。

任务级重试

  • 超出轮数预算,或格式错误持续到无法输出有效答案时,重新从原始问题开始。
  • 新一轮丢弃此前交互历史,最多重试 5次;达到总限制后输出当前最优答案。
  • 任务级重试与单轮工具反馈分别处理,避免在持续失效的历史上反复追加动作。

H1 局部与全局验证 ​

Local Verifier 与 Global Verifier

局部验证:修正中间路径

  • 在关键决策处审查计划、工具调用和当前假设,检查是否沿着惯性答案继续探索。
  • 结合环境反馈考察替代行动,修正低质量步骤,减少错误累积与反复重试。

全局验证:补全证据链

  • 汇总整条轨迹的证据,检查约束覆盖、事实一致性和结论是否充分。
  • 证据不足时继续推理或重采样,在给定预算内选择依据更完整的答案。
  • H1 是基于 1.7 的验证式推理系统;额外计算用于中间审查、证据补充与最终选择。

实验设置 ​

基础模型、任务与验证预算

模型与训练

  • 基于 Qwen3 MoE;1.7-mini 总参数 30B,激活参数 3B。
  • Agentic MidTrain → SFT → DPO → 在线 GRPO;mini 增加偏好蒸馏。
  • H1 在 1.7 上增加 Local / Global Verifier,默认推理预算为基础配置的 16倍。

任务设置

  • 检索与研究:BrowseComp、BrowseComp-ZH、HLE、GAIA、xbench、SEAL-0、DeepSearchQA。
  • 专业任务:FrontierScience-Olympiad、SUPERChem、FinSearchComp、MedBrowseComp。
  • HLE 使用 2158道 纯文本题,SUPERChem 使用文本子集,FinSearchComp 使用 T2 / T3。
  • Local Verifier 消融选择 BrowseComp 中基础模型经常失败的 295道 题。
  • 长报告:DeepResearchEval 生成的 50 个研究问题,评估报告质量与事实性。

推理参数

  • temperature=1、top_p=0.95,上下文 256K,单次最大输出 16384 tokens。
  • 一般任务最多 200轮;BrowseComp、BrowseComp-ZH、DeepSearchQA 最多 300轮。
  • BrowseComp 等主要检索任务运行 3次;GAIA、xbench、SEAL-0 运行 8次。
  • H1 在 BrowseComp 额外评测 64倍 预算;步骤统计包含任务重试。

关键结果 ​

单步质量与双层验证的收益

同规模模型减少无效交互

  • 30B 1.5 → 1.7-mini:平均表现相对提高 16.7%,交互轮数减少 43%。
  • HLE 表现相对提高 17.4%,轮数减少 61.6%,更强决策可同时改善正确率与效率。
  • 训练收益主要表现为更有效的规划与搜索,而非单纯延长轨迹。

局部验证减少错误路径和重试

  • BrowseComp 困难子集正确率 32.1 → 58.5,提高 26.4个百分点。
  • 包含重试的总步骤数 1185.2 → 210.8,局部修正减少整条任务链反复重做。

完整 H1 扩展任务能力

  • 1.7 → H1:HLE 42.9 → 47.7,GAIA 82.7 → 88.5。
  • DeepSearchQA 72.1 → 80.6,SEAL-0 53.0 → 61.3,改善多约束检索与噪声证据推理。
  • FrontierScience 71.5 → 79.0,FinSearchComp 67.9 → 73.9,收益延伸至专业研究。

计算预算与长报告质量

  • BrowseComp 在 16倍 预算下为 85.9,扩大至 64倍 后为 88.2,继续扩展的收益趋缓。
  • 长报告评测中,1.7 / H1 的 Report Quality 为 76.5 / 76.8,Factuality 为 78.5 / 79.1。
  • H1 的报告质量较强,事实准确性仍低于该评测中 ChatGPT-5.4 Deep Research 的 85.5。
关键结论

有效交互扩展

  • 单步能力训练提高规划与推理质量,局部验证及时修正路径,全局验证组织完整证据链。
  • 训练与验证协同,可在复杂研究任务中减少无效交互,并利用额外计算进一步提高可靠性。

(2511) MiroThinker v1.0 (交互扩展、多文档 QA、在线 GRPO) ​

🌺 论文摘要

MiroThinker v1.0 论文摘要

参考链接

问题背景

  • 复杂研究任务需要反复检索、核对证据;扩大模型与上下文,仍难以保证长链路工具交互的可靠性。
  • 训练需覆盖真实搜索反馈、长轨迹与多跳问题,使模型根据新证据持续修正判断。

核心方法

  • 任务合成:连接多篇文档,提取跨文档事实、模糊实体约束,构建需要多跳检索的 QA。
  • 后训练:专家轨迹 SFT → 正误轨迹 DPO → 真实工具环境在线 GRPO。
  • 交互扩展:单 Agent ReAct,保留完整思考与动作、最近 5轮 工具观察,支持 256K 上下文。

模型效果(MiroThinker-v1.0-72B)

  • GAIA 81.9、BrowseComp 47.1、HLE 37.7;HLE 使用纯文本子集。
  • 30B SFT → RL:BrowseComp 32.2 → 41.2,GAIA 65.4 → 73.5。

重要结论

  • 在线 RL 后,模型执行更长的检索与验证过程;外部反馈扩展了复杂任务的求解能力。
  • 更大模型在相同工具框架下持续获益;交互次数也会带来冗余检索,需要同时关注行动质量。

核心贡献

  • 将模型规模、上下文规模与交互规模结合,公开 8B / 30B / 72B Research Agent 与工具链。

未来方向

  • 减少无效工具调用和重复思考,改善非英语一致性与沙箱执行稳定性。

问题背景 ​

长程研究任务的训练难点

证据需要多次交互才能获得

  • 多跳问题的约束分散在不同网页;一次检索难以完成实体定位、事实核对与答案整合。
  • 长链路中的错误工具调用和过早结论会逐步累积,需要根据环境反馈调整计划。

交互轨迹与有效上下文

  • 现成 QA 通常只有问题和答案,缺少高质量的搜索、执行与验证轨迹。
  • 完整网页观察占用大量上下文;轨迹变长后,历史噪声与计算成本同时增加。

核心方法 ​

多文档 QA 与专家轨迹构建 ​

MultiDocQA 多跳任务合成

文档组织

  • 从 Wikipedia、Common Crawl 和精选网页中清洗正文,保留超链接及文档元数据。
  • 按主题采样种子文档,沿内部链接递归扩展,构成相互关联的文档子图。
  • 将子图转为 Markdown,移除子图以外的链接,形成任务生成所需的证据集合。

事实与问题合成

  • 提取与种子实体相关的事实,优先选择需要连接不同文档才能获得的关系。
  • 模糊直接线索:具体日期改为季节或年代,实体名改为属性描述。
  • 组合多个约束生成 QA,要求模型通过检索定位实体,再完成事实推理。
轨迹生成与数据补充

专家轨迹

  • 使用单 Agent ReAct 与 MiroFlow 多 Agent 框架,生成思考—动作—观察轨迹。
  • 轨迹教师包括 GPT-OSS、DeepSeek-V3.1 等模型;工具接口覆盖 Function Call 与 MCP。
  • 多 Agent 用于合成训练轨迹,最终 MiroThinker 采用单 Agent ReAct 执行任务。

开放任务与通用能力

  • MuSiQue、HotpotQA、WebWalkerQA、MegaScience、TaskCraft 等只取 QA,重新生成工具轨迹。
  • 混入 AM-Thinking、Nemotron 等推理与指令数据,保持非工具任务的通用能力。

SFT、DPO 与在线 GRPO ​

专家模仿与完整轨迹偏好学习

SFT

  • 清理重复内容、跨轮复述、错误工具名和不合法参数,保留连贯的完整交互轨迹。
  • 仅对 Assistant 的思考和动作计算 Loss;工具观察作为上下文,不参与监督。
  • SFT 直接读取已采集的观察,训练期间无需重新执行工具。

DPO

  • 用 SFT 策略采样轨迹,以最终答案正确性构造 Chosen / Rejected。
  • 两条轨迹均需具有完整、有效的答案,排除格式损坏、截断和重复循环造成的伪偏好。
  • 不预设固定思考长度或工具步数,让偏好学习保留不同的有效解决路径。
  • 冻结 SFT 模型作为参考策略;DPO 同时加入 Chosen 轨迹的辅助 SFT Loss。
真实工具环境在线 GRPO

奖励与策略更新

  • 当前策略在搜索、网页提取、Python 与 Linux 沙箱中完成任务,收集真实交互反馈。
  • LLM Grader 对照标准答案判断正确性,并扣除格式错误惩罚。
  • 同组轨迹以奖励均值为基线计算优势,加入参考策略 KL 约束。
  • 每批在线采样仅更新策略一次,减少反复复用旧轨迹带来的策略偏移。

轨迹筛选

  • 正确轨迹仍需过滤连续 API 报错、无效重试和严重超时。
  • 错误轨迹排除简单格式失败、循环和过早终止,保留有训练价值的失败过程。

长轨迹调度

  • 多个 Worker 从共享队列领取任务,完成足够轨迹后形成训练批次。
  • 尚未完成的任务回到队列,继续用于后续迭代,减少等待少数长任务造成的空转。

工具交互与上下文管理 ​

单 Agent ReAct 与历史观察裁剪

工具集合

  • Google Search 检索网页;网页提取工具抓取正文,并用轻量 LLM 提取任务相关证据。
  • Linux 沙箱执行命令和 Python;文件工具负责上传、下载与结果传递。
  • 模型交替生成思考、工具调用与答案,依据每轮工具反馈修正后续行动。

上下文裁剪

  • 保留全部历史思考与动作,只保留最近 5轮 工具观察。
  • 较早的网页正文退出上下文,已形成的分析与行动记录继续保留。
  • 单次观察过长时截断,并用标记提示;支持 256K 上下文与最多 600轮 交互。

实验设置 ​

模型、任务与推理参数

基础模型与训练路线

  • 基于 Qwen2.5 / Qwen3,构建 8B、30B、72B 三种规模。
  • 训练路线:SFT → DPO → 在线 GRPO;使用相同 Research Agent 工具框架评测。

评测任务

  • 多跳检索:BrowseComp、BrowseComp-ZH、WebWalkerQA、FRAMES、SEAL-0。
  • 综合研究:GAIA、HLE、xbench-DeepSearch。
  • HLE 使用 2158道 纯文本题;GAIA 使用 103道 纯文本题。

推理设置

  • temperature=1、top_p=0.95,上下文 256K,单次最大输出 16384 tokens。
  • 最多 600轮 交互,保留最近 5轮 工具观察。
  • GAIA、xbench、SEAL-0 取 8次 运行均值;其余主要任务取 3次 均值。

关键结果 ​

交互扩展与模型规模

在线 RL 改善多跳求解

  • 30B SFT → RL:BrowseComp 32.2 → 41.2,BrowseComp-ZH 37.6 → 47.8。
  • HLE 24.1 → 33.4,GAIA 65.4 → 73.5,收益同时覆盖检索与复杂推理。
  • RL 后轨迹更长,模型增加检索、核对与修正;长程交互能力随训练得到改善。

更大模型更能利用工具反馈

  • 8B → 30B → 72B:GAIA 66.4 → 73.5 → 81.9。
  • BrowseComp 31.1 → 41.2 → 47.1,HLE 21.5 → 33.4 → 37.7。
  • 在一致的工具框架下,模型规模扩大带来稳定提升,交互训练与模型容量可以共同扩展。

72B 的覆盖面

  • BrowseComp-ZH 55.6、WebWalkerQA 62.1、FRAMES 87.1,覆盖中英文多源检索。
  • HLE 达到 37.7,高于论文所列 GPT-5-high 的 35.2;BrowseComp 仍低于后者的 54.9。
  • 不同任务的剩余差距不同,长交互能力不能直接等同于所有研究任务上的领先。

未来方向 ​

交互效率与执行可靠性

减少冗余探索

  • 减少边际信息量低的工具调用,优化每一步获得的有效证据。
  • 压缩重复、过长的思考,降低任务延迟并改善可读性。

语言与工具稳定性

  • 改善非英语场景中的语言混杂,保持中文回答与思考的一致性。
  • 减少沙箱命令超时、错误工具选择和沙箱 ID 遗漏,增强复杂执行链的可靠性。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026