MiroMind 系列
📅 发表于 2026/09/23
🔄 更新于 2026/09/23
👁️ — 次访问
📝 4564 字
⏳ 13 分钟
mainllm
#基模
#Pretrain
#SFT
#RL
2026.03 · MiroThinker 1.7 / H1
2025.11 · MiroThinker v1.0
🌺 论文摘要
参考链接
问题背景
核心方法
模型效果(MiroThinker-1.7 / H1)
42.9 / 47.7、GAIA 82.7 / 88.5,H1 在更高计算预算下进一步提升。85.9(16×预算)、88.2(64×预算)。重要结论
核心贡献
行动质量限制交互扩展
中间正确不等于最终充分
Corpus-based QA
WebHop 推理树
逐层验证与线索隐藏
难度分层
初始规划
中间推理与证据汇总
SFT
DPO 与小模型偏好蒸馏
在线策略优化
负优势低概率动作的熵控制
β₀ 为基础 KL 系数;βent 为满足条件时追加的约束强度,τ 控制低概率范围。单轮交互
5轮 观察;单次观察过长时截断并标记。任务级重试
5次;达到总限制后输出当前最优答案。局部验证:修正中间路径
全局验证:补全证据链
模型与训练
30B,激活参数 3B。16倍。任务设置
2158道 纯文本题,SUPERChem 使用文本子集,FinSearchComp 使用 T2 / T3。295道 题。50 个研究问题,评估报告质量与事实性。推理参数
temperature=1、top_p=0.95,上下文 256K,单次最大输出 16384 tokens。200轮;BrowseComp、BrowseComp-ZH、DeepSearchQA 最多 300轮。3次;GAIA、xbench、SEAL-0 运行 8次。64倍 预算;步骤统计包含任务重试。同规模模型减少无效交互
16.7%,交互轮数减少 43%。17.4%,轮数减少 61.6%,更强决策可同时改善正确率与效率。局部验证减少错误路径和重试
32.1 → 58.5,提高 26.4个百分点。1185.2 → 210.8,局部修正减少整条任务链反复重做。完整 H1 扩展任务能力
42.9 → 47.7,GAIA 82.7 → 88.5。72.1 → 80.6,SEAL-0 53.0 → 61.3,改善多约束检索与噪声证据推理。71.5 → 79.0,FinSearchComp 67.9 → 73.9,收益延伸至专业研究。计算预算与长报告质量
16倍 预算下为 85.9,扩大至 64倍 后为 88.2,继续扩展的收益趋缓。76.5 / 76.8,Factuality 为 78.5 / 79.1。85.5。有效交互扩展
🌺 论文摘要
参考链接
问题背景
核心方法
5轮 工具观察,支持 256K 上下文。模型效果(MiroThinker-v1.0-72B)
81.9、BrowseComp 47.1、HLE 37.7;HLE 使用纯文本子集。32.2 → 41.2,GAIA 65.4 → 73.5。重要结论
核心贡献
8B / 30B / 72B Research Agent 与工具链。未来方向
证据需要多次交互才能获得
交互轨迹与有效上下文
文档组织
事实与问题合成
专家轨迹
开放任务与通用能力
SFT
DPO
奖励与策略更新
轨迹筛选
长轨迹调度
工具集合
上下文裁剪
5轮 工具观察。256K 上下文与最多 600轮 交互。基础模型与训练路线
8B、30B、72B 三种规模。评测任务
2158道 纯文本题;GAIA 使用 103道 纯文本题。推理设置
temperature=1、top_p=0.95,上下文 256K,单次最大输出 16384 tokens。600轮 交互,保留最近 5轮 工具观察。8次 运行均值;其余主要任务取 3次 均值。在线 RL 改善多跳求解
32.2 → 41.2,BrowseComp-ZH 37.6 → 47.8。24.1 → 33.4,GAIA 65.4 → 73.5,收益同时覆盖检索与复杂推理。更大模型更能利用工具反馈
66.4 → 73.5 → 81.9。31.1 → 41.2 → 47.1,HLE 21.5 → 33.4 → 37.7。72B 的覆盖面
55.6、WebWalkerQA 62.1、FRAMES 87.1,覆盖中英文多源检索。37.7,高于论文所列 GPT-5-high 的 35.2;BrowseComp 仍低于后者的 54.9。减少冗余探索
语言与工具稳定性