Mistral 系列
📅 发表于 2026/09/23
🔄 更新于 2026/09/23
👁️ — 次访问
📝 4345 字
⏳ 13 分钟
mainllm
#基模
#Pretrain
#SFT
#RL
2025.12 · Devstral 2
256K 仓库上下文与跨文件修改。2025.06 · Magistral
2025.05 · Devstral
2024.05 · Codestral-22B
32K 上下文。2024.01 · Mixtral 8x7B
核心内容
256K 仓库上下文与跨文件修改。详细笔记
🌺 论文摘要
参考链接
问题背景
核心方法
699K 缩至 38K,代码题清洗测试后保留 35K;Medium 直接 RL,Small 24B 用 Medium 轨迹 SFT 后 RL。0.1、完全正确 0.9,叠加柔性长度惩罚与语言一致性奖励。模型效果(Mistral Medium 3 Instruct + RL)
26.8 → 73.6;LiveCodeBench v5:29.1 → 59.4;Aider Polyglot:28.9 → 47.1。55.6 → 62.8,LiveCodeBench v5 52.2 → 55.8。重要结论
65.8 与蒸馏 SFT 65.4 接近;SFT+RL 达到 70.7。2pt。关键贡献
未来方向
数学:699K → 501K → 38K
16 次,过滤从未解出和过易题,用留下的数据训练一个用于筛选的 24B RL 模型。16 次,保留适中难度问题,避免弱筛选器误删有价值的难题。代码:35K 道题
Mistral Medium 3 Instruct,直接进行推理 RL;随能力提升加入更难数据,未惩罚长度上限依次为 16K → 24K → 32K,Batch 从 8K → 4K → 2K 条序列递减。Mistral Small 3 Instruct 24B;收集 Medium RL 中答对且具有足够长推理的轨迹,限制每题重复量并上采样难题,再让 Medium 回答 OpenThoughts / OpenR1 Code 中筛选后的多样 Prompt。10% 通用指令数据,SFT 4 epochs,根据 AIME 2024 选择 RL 起点。2048 条序列,未惩罚长度上限 32K,采样温度 1.0;因 SFT 起点熵较低,将 ε_high 设为 0.3。损失与优势
A_i = r_i − mean_group(r),不除以组内奖励标准差;随后按 Minibatch 内各序列优势的均值与标准差归一化。探索控制
[1−ε_low, 1+ε_high],提高上界,让原本低概率的有效 Token 更容易增加概率。ε_high 调节在 0.26~0.28,结合熵变化保持训练稳定。基础奖励
<think> 开始,且只有一组 <think>...</think>;数学最终答案放在推理之后的 \boxed{} 中,代码放在带语言标记的 Markdown 代码块中。0,停止后续验证;格式合格先得 0.1。0.9。20 个测试,同组回答使用相同测试,全部通过再得 0.9。C++20 编译,编译超时 10s;每个测试限时 4s、内存 300MB。附加项
l_max−l_cache 前不惩罚,此后随长度线性降到 −0.1,超出最大长度时保持 −0.1。10% 英文题翻译为法、西、意、德、中、俄六种语言;去掉 LaTeX 和代码后,用 fastText 判断题目、推理、答案的语言,三者一致奖励 +0.1。5s;正在生成的回答继续运行,保留之前权重计算出的 KV Cache。19%。n_async / n_batch ≤ 2,并让 n_batch = n_minibatch,减少同批数据上的重复更新与异步滞后叠加。24B 起点分别做 SFT、RL-only、SFT+RL。0.7;数学与 GPQA 的 Top-p 为 1.0,代码为 0.95。40K,其余任务 32K;AIME 平均 64 次采样估计 pass@1,并报告 maj@64,LiveCodeBench 平均 16 次。4096、固定学习率,改变 Batch / Minibatch。1.3M 条开源 R1 轨迹训练 Medium 后再 RL;与主实验的纯 RL Medium 分开报告。Mistral Medium 3 Instruct → Magistral Medium
26.8 → 73.6;maj@64:43.4 → 90.0。21.2 → 64.9;GPQA:59.6 → 70.8。29.1 → 59.4;v6:30.0 → 50.3;Aider Polyglot:28.9 → 47.1。Small 24B:SFT / RL-only / SFT+RL
65.4 / 65.8 / 70.7;AIME 2025:55.6 / 51.9 / 62.8。52.2 / 46.4 / 55.8;v6:44.6 / 42.4 / 47.4。83.3,低于 SFT 的 90.0;不能把 pass@1 的提升等同为所有采样指标都提升。22.7 → 38.3;仅代码 RL,使未训练的 AIME 2024 从 32.2 → 49.7。250 steps 消融中,按测试通过比例奖励使丢弃数据降为约三分之一,但 LiveCodeBench 低约 2pt,输出长度增长也较慢。ε_high 更容易控制训练。核心内容
详细笔记
🌺 论文摘要
参考链接
问题背景
核心方法
32K 上下文;指令模型依次进行 SFT 与 DPO。模型效果(Mixtral 8x7B Base,论文统一评测)
29.3 → 40.2、MBPP 49.8 → 60.7、MATH 13.8 → 28.4。8.30,同表 GPT-3.5 Turbo 1106 为 8.32。重要结论
13B 活跃参数降低计算,但模型仍需存储约 47B 参数,部署收益取决于批量和设备条件。关键贡献
未来方向
网络配置
32 层、隐藏维度 4096、FFN 中间维度 14336;32 个 Query Heads、8 个 KV Heads,Head Dimension 为 128。32000,完整 Attention 的上下文长度为 32768。8 个独立 SwiGLU 专家;同一 Token 在不同层可以选择不同专家。路由与计算
47B,每 Token 活跃参数约为 13B。预训练
32K 上下文,长文本能力通过 Passkey Retrieval 与 ProofPile 困惑度评估。指令对齐
0-shot;MBPP 为 3-shot,使用人工核验的子集。5-shot;表 2 的 GSM8K 为 8-shot / maj@8,MATH 为 4-shot / maj@4。2023-12-22 的榜单快照。Llama 2 70B → Mixtral 8x7B
69.9 → 70.6。29.3 → 40.2;MBPP:49.8 → 60.7。13.8 → 28.4;GSM8K:69.6 → 74.4,均为表 2 的多数投票口径。64.3 → 70.9、德语 64.2 → 71.5、西班牙语 66.0 → 72.5、意大利语 65.1 → 70.9。指令与长上下文
8.30,Llama 2 70B Chat 为 6.86。32K 范围内不同插入位置均达到 100%;ProofPile 困惑度随可用上下文增加而下降。self、缩进和英语中的重复结构呈现相似专家选择。28.1%,随机基线为 12.5%;两个专家集合有交集的比例为 66.9%,随机基线约 46%。