变化点
2026.09 · Gemini 3.8 Live(实时交互分支)
- 结合实时语音、后台推理与异步工具执行。
- 说话与任务处理并行,支持连续交互。
2026.07 报告 · Gemma 4
- 开放 Dense / MoE 多模态家族并加入 Thinking;12B 直接处理图像 Patch 和原始音频块。
- 按型号结合 K=V、跨层 KV 共享及 QAT/MTP,降低长上下文与端侧推理开销。
2026.05 · Gemini 3.5 Flash
- 强化长程 Agent 与 Subagent 协作。
- 重点优化连续任务执行效率,减少等待与重复操作。
2026.02 · Gemini 3.1 Pro
- 在 Gemini 3 上强化复杂推理与代码库交互。
- 面向多文件、整库任务提高分析与执行能力。
2025.11 · Gemini 3 Pro
- 继续扩展原生多模态 MoE,将多步 RL 用于推理和工具任务。
2025.07 报告 · Gemini 2.5
- 扩大后训练 RL,形成 Thinking 与可控推理预算。
- 通过蒸馏与效率优化构建 Flash,覆盖不同能力和成本需求。
2025.03 · Gemma 3
- 局部/全局 Attention 改为
5:1,加入冻结 SigLIP 与 Pan & Scan,扩展视觉和128K上下文。 - 全系列采用教师分布预训练,结合 IT 蒸馏、多任务 RL 和 QAT。
2024.07 报告 · Gemma 2
- 2B / 9B 改用教师概率分布预训练,提高小模型在长训练中的学习效率。
- 结合局部/全局 Attention、SFT/RLHF 与权重平均,开放 2B / 9B / 27B。
2024.06 · CodeGemma
- 在 Gemma 基座上强化代码预训练,以较高 FIM 比例学习 PSM/SPM 补全。
- 结合依赖关系和单元测试做多文件打包;2B 面向补全,7B 扩展对话与代码推理。
2024.03 报告 · Gemini 1.5
- 引入 Sparse MoE,扩展到百万级上下文。
- 通过在线蒸馏构建 Flash,形成 Pro / Flash 分层。
2023.12 · Gemini 1.0
- 由文本模型扩展为原生多模态训练,联合处理文本、图像、音频与视频。
- 结合 SFT 与 RLHF,形成 Ultra / Pro / Nano 系列。
2023.05 · PaLM 2
- 从单纯扩大参数转向计算预算、数据量与模型规模的共同优化。
- 增强多语言、代码和推理数据,结合多种训练目标。
2022.04 · PaLM
- 以
540B Dense与 Pathways 扩大训练规模,强化少样本语言和推理能力。
(2609) Gemini 3.8 Live (实时语音、后台推理)
来源与问题
交互机制
- 原生 Speech-to-Speech 直接处理语音输入与输出,并结合实时视觉理解当前场景。
- Extended Thinking 在后台完成复杂推理,前台继续回应,允许用户补充要求。
- 工具异步执行,结果返回后继续任务,使实时对话和后台工作并行。
τ-Voice=68.6,覆盖语音中的多步工具任务。- 银行业务子集
τ-Voice-banking=35.1,复杂业务完成率仍明显较低。 - 语音模型除响应自然度外,还需要以任务是否完成衡量执行能力。
(2607) Gemma 4 (Thinking、无编码器 12B、QAT/MTP)
🌺 论文摘要
参考链接
问题背景
- 多模态模型需要同时适配端侧与 GPU,控制模态编码、长上下文和逐 Token 解码成本。
核心方法
- 多模态架构:Dense 与
26B-A4B MoE分工;12B 去除独立编码器,直接把图像 Patch 和原始音频投影到语言模型。 - KV Cache 优化:局部/全局注意力配合 p-RoPE;大模型全局层
K=V,E2B / E4B 使用跨层 KV 共享。 - 多模态训练与 Thinking:混合网页、代码、图像和部分型号的音频数据;后训练加入先推理再回答的模式。
- QAT 与 MTP:量化语言模型及模态编码器;小型 Drafter 复用主模型的隐藏状态和 KV,提出待验证的后续 Token。
模型效果(Gemma 4 31B IT + Thinking,代码/数学/Agent)
- 相对 Gemma 3 27B、Non-Thinking:LiveCodeBench v6
29.1→80.0,AIME 2026 无工具20.8→89.2。 - Terminal Bench Hard
4.0→36.0;关闭 Thinking 的长文评测中,128K RULER66.0→96.4。
重要结论
- 低激活 MoE 的收益因任务而异:26B-A4B 的 LiveCodeBench 为
77.1,接近 31B 的80.0;Terminal Bench Hard 为14.0,长程执行差距更大。 - 无独立编码器路线可行:12B 直接处理原始音视频,在视觉问答和语音识别上形成可用能力,支持将模态处理并入统一模型。
关键贡献
- 以 Apache 2.0 开放多模态 Dense / MoE 家族、量化版本与 MTP Drafter,提供面向不同硬件的模型组件。
未来方向
- 支持面向不同硬件的多模态定制,并持续开展下游能力评估。
问题背景
- 统一模型难以适配全部硬件:手机、大显存 GPU 对参数、缓存和解码吞吐的限制不同,需要多尺寸 Dense / MoE 配置。
- 长上下文缓存持续增长:即使权重能放入设备,KV 仍可能成为主要开销,需要同时优化层间共享和缓存表示。
- 独立编码器增加部署碎片:音频、视觉各有独立网络;12B 尝试只保留轻量投影,让语言主干学习模态处理。
- 逐 Token 解码开销高:小 Drafter 复用主模型状态,预先生成多个候选,再由主模型验证。
核心方法
Dense、MoE 与多模态输入
语言主干
- Dense:E2B、E4B、12B、31B;均采用 Decoder-Only Transformer,配合前后 RMSNorm 与 QK-Norm。
- E2B / E4B:使用 Per-Layer Embeddings,总参数约
5B / 8B,有效参数约2.3B / 4.5B。 - 26B-A4B:总参数约
26B、激活约3.8B的 MoE,以较低每 Token 计算处理较大的模型容量。
独立编码器分支
- E2B / E4B 使用
150M视觉编码器;26B-A4B / 31B 使用550M视觉编码器。 - ViT 支持可变宽高比,结合轴向
2D-RoPE、非因果注意力和二维绝对位置编码。 - 可选视觉预算为
70 / 140 / 280 / 560 / 1120 tokens,用于调整细节保留与处理成本。 - E2B / E4B 另有
305M音频编码器:两层下采样卷积加12层 Conformer,输入为 Mel Filterbank。 - 音频以
40ms块处理,连续表示直接送入语言模型;独立视觉、音频编码器在预训练时冻结。
图像路径
- 把图像切成
48 × 48 × 3RGB Patch,以约35M参数的单个大型矩阵投影替代视觉编码器。 - 在 Patch 表示中加入二维坐标位置 Embedding,再经 LayerNorm 接入语言模型。
音频路径
- 原始
16KHz音频按40ms划分,每块得到640维向量,直接投影到语言 Embedding 空间。 - 音频顺序由序列位置承载,不额外添加模态专用位置编码。
- 12B 从头联合训练,使语言主干承担原先由独立视觉、音频编码器执行的表示学习。
局部注意力与 KV Cache 共享
局部与全局分工
- E2B 的局部/全局层比例为
4:1,其他型号为5:1。 - 局部层采用 RoPE,频率基数
10K;全局层采用p-RoPE, p=0.25,频率基数1M。
按型号压缩 KV
- 除 E2B / E4B 外,全局层复用 Key 作为 Value,即
V=K,减少重复缓存。 - 与部分旋转位置编码配合,原文给出的全局 KV Cache 节省为
37.5%。 - E2B / E4B 则使用跨层 KV 共享,报告中的共享比例分别为
20/35、18/42。
预训练数据与 Thinking 后训练
预训练
- 数据覆盖网页、代码和图像;音频训练仅用于 E2B、E4B 与 12B。
- 语料截止至
2025.01;使用约262K词表的 SentencePiece,保留空格并拆分数字。 - 去除评测污染、敏感信息及不合适内容,减少训练语料复现。
- 大模型训练采用 Slice-Granularity Elasticity,局部 TPU 故障时减少活动 Slice 并继续运行。
Thinking 与数据过滤
- 后训练沿用 Gemma 3 的整体方向,新增先输出推理轨迹、再给最终回答的 Thinking 模式。
- 过滤重复内容、错误自我身份和不合适示范,并增加依据引用、不确定性表达与必要拒答数据。
- Thinking 开关和 Function Calling 使用专用对话格式;IT 输出以
<turn|>结束,PT 则使用<eos>。
QAT 与多 Token 推测解码
端侧与通用量化
- Mobile Quantization:权重按通道混合
INT2 / INT4,激活使用INT8。 - Q4_0:使用分块量化格式,适配常用开源推理引擎。
- 在各 Block 引入标量 Scale,限制激活范围,使 FP16 推理保持稳定。
模态编码器
150M视觉编码器使用W8A8QAT;连同设备编译开销,前向内存从400MB降至200MB。- 音频编码器使用
INT8激活,按层组选择2 / 4 / 8-bit权重;量化后磁盘体积为87MB。
状态输入与候选生成
- Drafter 读取主模型上一时刻的最后层激活与 Token Embedding,自回归生成后续候选 Token。
- 独立 Embedding 配合
4层 Transformer;其中3个局部层、1个全局层,并交叉访问主模型 KV。 - 直接复用主模型缓存,省去 Drafter 独立 Prefill,支持按需选择草稿长度。
小型号解码优化
- E2B / E4B 将完整词表投影换成 Token Cluster 上的 Top-K 操作。
- 输出矩阵由
d × 262000缩至d × 4096,在保持相近接受率的同时降低草稿生成开销。
实验设置(Gemma 4 IT,Thinking 与 Non-Thinking 分开)
主对照
- Gemma 4 E2B / E4B / 12B / 26B-A4B / 31B,对照 Gemma 3 27B;音频另与 Gemma 3n 同尺寸型号比较。
- 文本主表的 Gemma 4 默认开启 Thinking;Gemma 3 27B 为 Non-Thinking。
- 视觉主表使用
1120 vision tokens;Gemma 3 27B 关闭 Thinking 并启用 Pan & Scan。
专项设置
- 长上下文表统一关闭 Thinking,测
32K / 128KRULER、128K LOFT,以及部分型号约256K的 MTOB。 - 音频测 FLEURS 的 WER/CER;CoVoST 使用“先转录、再翻译”提示并计算 CorpusBLEU。
- 显存表为纯文本输入、
32K上下文、INT8 KV Cache;E2B / E4B 用 Mobile Quantization,较大型号用 Q4_0。 - Arena 使用人工盲测,报告快照日期为
2026-06-19。
关键结果(Gemma 4 IT + Thinking,代码与多模态)
31B 对照 Gemma 3 27B
- LiveCodeBench v6
29.1→80.0;Codeforces Elo110→2150。 - AIME 2026 无工具
20.8→89.2;GPQA Diamond42.4→84.3。 - Terminal Bench Hard
4.0→36.0;Tau2 Airline39.0→75.0,Retail6.6→86.4。 - 以上为新一代 Thinking 模型与前代 Non-Thinking 模型的整体比较。
Dense 与低激活 MoE
- 26B-A4B:AIME
88.3、LiveCodeBench77.1,接近 31B 的89.2 / 80.0。 - Terminal Bench Hard 为
14.0,低于 31B 的36.0;模型选择需要同时检查 Agent 任务表现。 - 同表 Arena Elo:31B
1451、26B-A4B1438,前代 Gemma 3 27B 为1366。
视觉与无编码器模型
- 31B:MMMU Pro
76.9、MATH-Vision85.6;12B 分别为69.1 / 79.7。 - 12B 不依赖独立音频编码器,FLEURS 英语 WER 为
0.063、德语为0.053,显示直接音频投影路线可行。
端侧音频
- E4B 相对 Gemma 3n E4B:CoVoST 平均 BLEU
34.7→38.2;FLEURS 平均错误率0.085→0.075。 - 音频编码器量化后体积由
390MB降至87MB,模型压缩与任务质量同时改善。
关闭 Thinking 的长文能力
- 31B 相对 Gemma 3 27B:128K RULER
66.0→96.4;LOFT Text Retrieval8.6→79.5。 - E4B:128K RULER
86.6、LOFT58.5;更小有效参数量也能改善跨长文检索。 - GraphWalks F1:前代
32.8,31B82.3、26B-A4B72.6,收益覆盖需要跟踪关系的长文任务。
未来方向
- 开放端侧研究:以 Dense、MoE、无编码器模型和推理组件作为可定制基础,支持社区扩展不同硬件上的多模态推理。
- 持续下游评估:作者计划继续监测模型使用,并随多模态能力扩展更新评估与缓解措施。
(2605) Gemini 3.5 Flash (长程 Agent、执行效率)
来源与配置
任务执行
- Thinking Levels 按任务复杂度选择推理投入,兼顾多步执行效果与调用成本。
- 围绕计划、操作、测试和修正持续工作,工具反馈用于后续决策。
- Antigravity 将开发、测试等独立工作分给 Subagent,再汇总结果、处理共同约束。
工具与多模态任务
- Terminal-Bench 2.1,Terminus-2 harness:
58.0 → 76.2,多步终端执行改善。 - MCP Atlas
62.0 → 83.6,收益覆盖工具选择与调用。 - CharXiv Reasoning
84.2,支持在工作中结合科研图表和文字推理。
(2602) Gemini 3.1 Pro (复杂推理、整库任务)
来源与配置
- Gemini 3.1 Pro Model Card。
- 在 Gemini 3 Pro 基础上迭代,原生多模态,支持
1M输入上下文。
技术重点
- 联合处理文档、图像、代码与工具反馈,在任务中推理、调用工具并调整后续操作。
- 重点改善复杂推理与仓库求解;模型卡未详细公开新增训练 recipe。
High Thinking 评测
- ARC-AGI-2
31.1 → 77.1,抽象规则识别与推理明显进步。 - SWE-bench Verified
76.2 → 80.6;每次完整工具交互提交一个补丁,平均10次运行。 - MRCR v2
8-needle / 1M仍为26.3,指定长文检索设置没有同步改善。 - 推理和仓库能力提高,尚未自动解决长上下文中的分散信息定位。
(2511) Gemini 3 Pro (原生多模态 MoE、多步 RL)
来源与配置
- Model Card、官方发布。
- 原生多模态 Sparse MoE,输入
1M、输出64K;使用 TPU、JAX / Pathways 训练。
训练路线
- 多模态预训练联合学习文本、视觉等信息,MoE 按输入选择部分专家,控制单 token 计算。
- 指令数据学习响应与交互形式,偏好与 RL 数据进一步优化行为。
- RL 覆盖多步推理,使模型在连续任务中处理视觉、代码和工具反馈。
代码任务
- SWE-bench Verified
76.2;完整交互读取仓库、定位、修改并测试,每次提交一个补丁。 - 结果为
10次运行平均,覆盖比单函数生成更完整的工程过程。
科学与多模态推理
- GPQA Diamond
91.9,HLE 无工具37.5,覆盖专业知识与高难推理。 - MMMU-Pro
81.0、Video-MMMU87.6,能力覆盖复杂图文与视频理解。
(2507) Gemini 2.5 (Thinking、多步 RL、Flash 蒸馏)
🌺 论文摘要
参考链接
问题背景
- 复杂推理、整库开发和长任务需要更大的后训练投入,同时要控制服务成本。
核心方法
- 多模态 MoE:联合学习文本、视觉和音频;扩大代码与工程任务覆盖。
- SFT/RM/RL:提高数据质量与 RL 计算,结合可验证奖励、生成式奖励。
- Thinking:RL 学习推理,预算控制计算开销;Flash 蒸馏教师稀疏概率分布。
- 训练系统:跨数据中心弹性训练与静默错误定位,减少局部故障造成的全局等待。
模型效果
- Pro 相对 1.5 Pro:单次 SWE Verified
22.3 → 59.6,Aider16.9 → 82.2。
重要结论
- 推理预算与多步后训练增强复杂求解;长窗口仍不能替代可靠的历史检索。
核心贡献
- 将 Thinking、原生多模态、教师蒸馏和工具型后训练整合成基模家族。
未来方向
- 加强长期规划和状态管理,改进多模态 Agent 的执行可靠性。
问题背景
- 整库开发、多模态推理和多步工具任务需要扩大后训练覆盖。
- 长思考与大型模型增加服务成本,需结合推理预算和蒸馏形成 Pro / Flash 分工。
- 跨数据中心训练频繁遭遇局部故障,容错效率影响可用训练规模。
核心方法
多模态架构与数据
模型与语料
- Pro 与 Flash 使用 Sparse MoE,按 token 选择部分专家,原生支持文本、图像、音频和视频。
- 扩展仓库与 Web 代码语料,提高语言、任务和工程场景覆盖。
- 后训练加入整库操作、IDE 和多模态应用开发等工程任务。
音频与视频表示
- 因果音频表示支持低延迟流式输入输出,后训练结合 thinking、场景感知和工具调用。
- 以更少的视觉 token 表示每帧,为长视频留出更多上下文空间。
多步后训练与奖励反馈
- 数据质量:模型辅助检查 SFT、Reward Modeling 与 RL 数据,提高筛选效率。
- 可验证奖励:正确答案或可执行检查提供反馈;适合能明确判断结果的任务。
- 生成式奖励:评价模型提供更丰富反馈,覆盖难以仅靠硬规则判断的任务。
- 多步环境:训练扩展到需要连续动作和工具调用的任务,学习从反馈中调整后续行为。
- 搜索应用:搜索与内部推理交错,依据已有结果生成后续查询,再验证回答依据。
- 寻找失败:通过人类与模型交互、自动攻击模型,收集违规回答和不必要拒答。
- 修订示范:结合模型生成与人工干预,把失败回复改成合适回答,再用于 SFT。
- DRM:人对候选回答给偏好,训练 Data Reward Model,让评价能力复用到更多样本。
- Critic:按预定义 Rubric 评价回答;修改评分规则可以离线迭代,不必重新收集整批人工偏好。
- RL*F:结合人类偏好与 Critic 反馈训练,同时检查安全和帮助程度;这里的 Critic 是评分模型,不是已披露的 PPO Value Network。
推理预算与教师蒸馏
推理预算
- 动态思考:模型按问题投入推理;外部
thinking budget限制可用预算。 - 预算限制作用于当前问题的推理计算,模型在限制内分配思考步骤。
教师蒸馏
- k-sparse 分布:保存教师最重要的一部分词表概率,让学生学到多个合理的下一 Token,而非只有单个硬标签。
- 取舍:增加训练数据传输和存储,换取小模型质量。
跨数据中心训练系统
- Slice-Granularity Elasticity:局部设备故障时先减少参与训练的 Slice,其他设备继续计算。
- Split-Phase SDC Detection:异常时确定性重放,对比设备中间 Checksum,定位静默数据错误。
- 作用:大型训练集群频繁出现局部故障,系统需要避免“一处故障、全体等待”。
实验设置(Gemini 2.5 Pro / Flash)
模型与训练
- Gemini 2.5 Pro / Flash;多模态预训练 → SFT/RM/RL,Flash 额外使用蒸馏。
- 预训练覆盖 Web、代码、图像、音频和视频。
评测设置
- Pro/Flash 输入
1M、输出64K;主要对照 Gemini 1.5 Pro。 - 代码、数学、知识、长上下文;SWE 分单次求解与多候选重排。
专项评测
- Thinking 预算曲线;多模态输入与 Deep Research Agent;长程游戏案例。
关键结果(Gemini 2.5 Pro / Flash)
代码与数学
- 单次 SWE Verified:1.5 Pro
22.3、2.5 Flash48.9、2.5 Pro59.6。 - 2.5 Pro 多候选重排达
67.2,增加搜索预算进一步提高修复率。 - Aider
16.9 → 82.2,AIME 202517.5 → 88.0,提升覆盖代码编辑与数学推理。
推理预算
- AIME、GPQA 与 LCB 预算曲线总体随计算增加改善,应结合任务收益选择预算。
长上下文
- 1M MRCR v2:1.5 Pro
12.1、2.5 Pro16.4、Flash21.0。 - Pro 并非所有项目都优于 Flash;复杂长文检索仍有明显短板。
视频与训练效率
- 每帧视觉 token 由
258减至66,1M 窗口可容纳约3 小时视频。 - 局部 TPU slice 故障时仍保持约
97%吞吐,弹性训练减少全局等待。
未来方向
原文观察与后续方向
- 加强长期规划和状态管理,改进多模态 Agent 的执行可靠性。
(2503) Gemma 3 (5:1 注意力、视觉输入、蒸馏与 RL)
🌺 论文摘要
参考链接
问题背景
- 长上下文和视觉输入增加缓存与计算开销,需要在消费级硬件预算内扩展能力。
核心方法
- 长上下文架构:局部/全局注意力
5:1,局部窗口缩至1024;4B 及以上从 32K 训练扩展至128K。 - 视觉输入:冻结 SigLIP,把每张图压成
256 tokens;Pan & Scan 在推理时增加裁剪,保留文字和局部细节。 - 预训练蒸馏:全系列学习教师分布,每个位置按教师概率采样
256 logits;增加图文和多语言数据。 - 后训练与量化:IT 教师蒸馏结合 RL,使用人工偏好、代码执行和数学答案奖励;QAT 再用原精度模型监督量化模型。
模型效果(Gemma 3 27B IT + 蒸馏/RL,零样本评测)
- 相对 Gemma 2 27B IT:MATH
55.6→89.0,LiveCodeBench20.4→29.7。 - 新增视觉能力:MMMU
64.9;Bird-SQL Dev54.4,与同表 Gemini 1.5 Pro 持平。
重要结论
- 教师大小需匹配训练时长:短训练时小教师较好,延长训练后大教师占优,不能仅按学生尺寸固定教师规模。
- 视觉文字依赖有效分辨率:27B 开启 Pan & Scan 后,InfoVQA
59.4→76.4,分块输入显著减少缩图的信息损失。
关键贡献
- 开放
1B / 4B / 12B / 27B模型及量化版本,将图像、长上下文和多语言能力纳入消费级硬件可运行的模型家族。
未来方向
- 改善 128K 之外的上下文泛化,并持续评估多模态与推理能力。
问题背景
- 历史越长,KV Cache 越大:全局 Attention 的缓存随上下文增长;提高局部层比例,让少量全局层负责跨长距离访问。
- 统一缩图丢失细节:非方形图片和小字被压到固定分辨率后难以辨认;推理时按需裁剪图像。
- 小模型能力扩展受参数预算限制:以教师分布提供更丰富监督,并用多任务 RL 强化代码、数学和指令执行。
核心方法
局部注意力与长上下文
控制 KV Cache
- 每
5个局部 Attention 层安排1个全局层;局部窗口从 Gemma 2 的4096缩至1024。 - 局部层只保留短窗口缓存,全局层访问全部历史,降低长上下文显存增长。
- 保留 GQA、前后 RMSNorm;用 QK-Norm 替换 Gemma 2 的 Soft-Capping。
扩展上下文
- 先以
32K序列预训练,再在末期把4B / 12B / 27B扩至128K;1B 保留32K。 - 全局层 RoPE Base 从
10K提至1M,局部层仍为10K。 - 全局位置编码再做插值式重缩放,实验选择
8倍缩放因子。
SigLIP 与 Pan & Scan
图像表示
4B / 12B / 27B共用约417M的 SigLIP 视觉编码器,1B 为纯文本模型。- 编码器先针对视觉助手任务适配;语言模型训练时冻结视觉权重,并预先计算图像 Embeddings。
- 以
896 × 896输入,平均池化后保留固定256个视觉 Token,接入语言模型上下文。
Pan & Scan
- 对需要保留局部细节的图像划分等尺寸、不重叠的裁剪,再分别缩放至编码器输入分辨率。
- 根据图像形状按需启用,并限制最大裁剪数,缓解小字和小物体在整图缩放时消失的问题。
- 该策略仅发生在推理时;可以关闭以降低图像处理开销。
多模态语料与预训练蒸馏
图文与多语言
- 混合文本和图像;
1B / 4B / 12B / 27B分别训练2T / 4T / 12T / 14T tokens。 - 增加单语和双语平行数据,调整语言采样,缓解高低资源语言分布不均。
- 使用 Gemini 2.0 的 SentencePiece,约
262K词表,提高非英语 Tokenization 的均衡性。
过滤与重加权
- 去除敏感内容与评测污染,降低训练文本复现。
- 在过滤之外增加质量重加权,减少低质量语料在训练中的占比。
- 每个 Token 位置按教师概率加权采样
256个 Logits,保存这部分监督。 - 未采样的候选概率设为
0,再归一化采样集合上的教师概率。 - 学生通过交叉熵学习该稀疏分布,以较小存储开销接受软标签监督。
- 与 Gemma 2 仅蒸馏 2B / 9B 不同,Gemma 3 全部尺寸都使用预训练蒸馏。
指令蒸馏、RL 与 QAT
教师与优化方法
- 使用更大的 IT 教师做改进的知识蒸馏,再结合基于 BOND、WARM、WARP 改进版本的 RL 阶段。
- BOND、WARM、WARP 分别关联 Best-of-N 蒸馏、奖励模型权重平均和策略权重合并。
奖励来源
- 人工偏好:训练多个 RM 并平均权重,为帮助性、指令遵循和多语言等能力提供反馈。
- 代码执行:运行代码取得执行反馈,指导代码能力优化。
- 数学答案:使用 Ground-Truth 判定回答质量,强化数学与推理。
- 过滤重复、错误自我身份和不合适示范,并加入依据引用与不确定性表达,改善事实性。
- 对已训练模型再进行通常约
5000 steps的 QAT,适配量化误差。 - 使用原精度模型的概率作为目标,训练数据同时匹配预训练和后训练分布。
- 提供 Per-Channel INT4、Per-Block INT4 和 Switched FP8,降低权重显存占用。
实验设置(Gemma 3,蒸馏预训练 + IT 蒸馏/RL)
模型配置
- 主模型:Gemma 3 1B / 4B / 12B / 27B;主对照为对应 Gemma 2 与 Gemini 1.5 / 2.0。
- 文本、代码、数学和视觉结果分别报告;表 6 为最终 IT 模型的
zero-shot评测。 - QAT:通常
5000 steps;显存比较固定32K上下文,KV Cache 使用8-bit。
消融设置
- Attention 比例和窗口实验使用纯文本模型,检查验证 PPL 与缓存占用。
- 教师规模实验固定学生,分别使用小/大教师,改变训练 Token 数。
- Pan & Scan:表 8 使用
4-shot验证集,比较同一视觉 Checkpoint 开关裁剪后的表现。 - Arena 为人工盲测;27B 的分数来自
2025-03-08初步快照。
关键结果(Gemma 3 27B IT,蒸馏与多任务 RL)
相对 Gemma 2 27B IT
- MATH
55.6→89.0,HiddenMath14.8→60.3,数学任务改善最显著。 - LiveCodeBench
20.4→29.7,Bird-SQL Dev46.7→54.4,算法代码和数据库任务均有提升。 - MMLU-Pro
56.9→67.5,GPQA Diamond34.3→42.4。
新增能力与交互
- MMMU Val 为
64.9,接近同表 Gemini 1.5 Pro 的65.9。 - Global MMLU-Lite
68.6→75.1,多语言数据扩展转化为跨语言知识收益。 - 同表 Arena Elo:Gemma 2 27B IT
1220→ Gemma 3 27B IT1338;该榜分数不包含视觉能力。
长上下文和教师选择
- 局部/全局比例升至
7:1时验证 PPL 仍变化很小,支持以更多局部层减少缓存。 - 缩短局部窗口同样只产生较小 PPL 变化;较少全局层与短窗口应一起配置。
- 小教师在短训练中占优;长训练后大教师更好,蒸馏配置需随训练预算选择。
Pan & Scan 与量化
- 27B:DocVQA
85.6→90.4;InfoVQA59.4→76.4;TextVQA68.6→70.2。 - 4B:InfoVQA
44.1→57.0,裁剪对不同模型规模均有效。 - 27B、32K 上下文:原 BF16 权重加 KV 为
72.7GB,Per-Channel INT4 版本为32.8GB。 - 量化减少权重体积后,KV Cache 仍占用较大比例,长上下文部署需同时优化两者。
未来方向
- 上下文外推:RoPE 重缩放后可泛化至
128K,继续增加长度时 PPL 快速退化,窗口外能力仍有限。 - 持续能力评估:作者将继续按模型潜在风险更新评估与缓解方法;多模态与 STEM 能力扩展后需同步检查模型行为。
(2407) Gemma 2 (教师分布预训练、SFT/RLHF)
🌺 论文摘要
参考链接
问题背景
- 小模型长时间预训练的收益趋缓,需要更丰富的监督;推理还受显存与 KV Cache 限制。
核心方法
- 架构优化:局部/全局注意力
1:1交替,结合 GQA、Logit Soft-Capping 与前后 RMSNorm。 - 教师分布预训练:2B / 9B 学习教师的下一 Token 概率分布;27B 使用普通预训练,分别训练
2T / 8T / 13T tokens。 - SFT / RLHF / 合并:教师生成示范并监督学生分布,大型 RM 提供多轮偏好反馈,再平均不同训练配置的权重。
模型效果(Gemma 2 + SFT/RLHF/权重合并,MBPP)
- Gemma 2 9B:PT
52.4→ IT59.2,提升+6.8pt。 - Gemma 2 27B:PT
62.6→ IT67.4,提升+4.8pt。
重要结论
- 同量数据下蒸馏有效:2B 训练
500B tokens,三项基准均分从普通预训练的60.3提高到蒸馏的67.7,收益来自更丰富的监督。 - 架构可兼顾质量和开销:9B 的 GQA 与 MHA 质量接近;局部窗口从
4096缩到2048时验证 PPL 不变。
关键贡献
- 给出适用于长时间训练的小模型概率分布蒸馏路线,并开放多尺寸 PT / IT 权重。
未来方向
- 继续改进事实性、稳健性与推理,扩展小模型可承担的任务。
问题背景
- 单一正确 Token 的监督有限:增加训练长度的收益趋缓;教师概率分布能同时提供多个候选 Token 的相对偏好。
- 消费级设备受显存限制:模型需要在较小总参数量下保持质量;GQA 与局部注意力减少推理开销。
- 预训练不能直接解决多轮对话:需通过教师示范、偏好反馈与权重合并,学习指令执行和持续交互。
核心方法
局部注意力与训练稳定性
控制推理开销
- 局部/全局交替:每隔一层使用全局注意力;局部窗口
4096,全局跨度8192。 - GQA:每个 KV Head 供两个 Query Heads 共享,减少 KV 存储与读取。
- 更深的网络:相同参数预算下,9B 选择更深的布局,替代更宽的布局。
控制激活幅度
- Logit Soft-Capping:用
c × tanh(logit / c)平滑限制 Logit 幅度。 - Attention 的
c=50,最终输出层的c=30,避免极端 Logit 主导计算。 - Attention 与 FFN 子层的输入、输出均使用 RMSNorm,稳定深层训练。
预训练数据与教师分布蒸馏
训练数据
- 以英语为主,覆盖网页、代码、科学文献;通过小规模消融选择混合比例。
- 过滤敏感信息与不合适内容,去除评测污染,减少训练文本复现。
- 沿用 Gemma 1 / Gemini 的 SentencePiece,保留空格、拆分数字,并支持 Byte-Level 编码。
训练目标
- 27B:从头预训练
13T tokens,作为较大规模基座。 - 2B / 9B:分别训练
2T / 8T tokens,用教师分布替换真实下一 Token 的 One-Hot 标签。 - 学生最小化教师分布与自身分布间的交叉熵;每个训练位置都学习候选 Token 的相对概率。
- 蒸馏用于远超计算最优 Token 数的长训练,目标是提高最终质量,而不仅是缩短训练时间。
- 蓝色 教师分布为给定上下文
x_c后各候选 Token 的概率;学生P_S通过交叉熵逼近它。 - 同一位置可获得多个候选词的监督,比只学习原文中出现的一个 Token 更丰富。
教师示范、RLHF 与权重合并
SFT 与蒸馏
- 使用英文、纯文本的真实与合成 Prompt;回答主要由更大的教师生成。
- 对示范做行为克隆,同时在学生生成分布上接受教师监督。
- 引入
LMSYS-chat-1M的 Prompt,不使用其中的原回答。
偏好优化与合并
- RM 由英文人工偏好数据训练,规模约为 Policy 的一个数量级,重点增强多轮对话评价。
- RLHF 沿用 Gemma 1.1 的算法路线,训练 Prompt 与 SFT 阶段同源。
- 对不同超参数运行得到的模型进行权重平均,提高综合表现。
- 移除重复样本、错误自我身份、敏感信息及不合适输出,避免教师错误直接进入学生训练。
- 加入基于上下文引用、表达不确定性、必要时拒答的示范,减少无依据回答。
- 作者观察到这类数据提高事实性指标,同时没有降低其他评测表现。
实验设置(Gemma 2 PT / IT 与蒸馏消融)
完整训练
- 2B / 9B / 27B:分别为
26 / 42 / 46层;训练量2T / 8T / 13T tokens,上下文8192。 - PT 测知识、数学、代码等静态基准;IT 额外测人工偏好、指令遵循和多轮对话。
- 静态结果包括
MMLU 5-shot、GSM8K 5-shot、HumanEval pass@1、MBPP 3-shot。
受控消融
- 蒸馏:固定
2B学生、500B tokens,比较普通训练与7B教师蒸馏。 - 架构:在
9B比较 MHA/GQA、宽/深布局;单独改变推理时局部窗口。 - 人工多轮评测:
500个场景,平均8.4个用户轮次,对满意度和目标完成度打1~5分。
关键结果(Gemma 2,预训练蒸馏 + SFT/RLHF/权重合并)
教师监督
- 2B + 500B tokens:三项基准平均分
60.3→67.7,提升+7.4pt。 - 固定
7B教师,200M / 400M / 1B学生验证 PPL 分别从23 / 19 / 17降至21 / 17 / 15。 - 蒸馏收益在不同学生规模上都存在,支持在小模型训练中增加监督信息量。
架构取舍
- 9B 的四项基准均分:MHA
50.3、GQA50.8;减少 KV Heads 未损失质量。 - 同参数 9B:宽布局
50.8、深布局52.0,深度增加带来小幅一致收益。 - 局部窗口
4096 / 2048 / 1024:验证 PPL1.63 / 1.63 / 1.64,可用小窗口换取推理效率。
代码与知识
- 27B PT:MMLU
75.2、GSM8K74.0、HumanEval51.8、MBPP62.6。 - 9B PT → IT:MMLU
71.3→72.3,MBPP52.4→59.2。 - 27B PT → IT:MMLU
75.2→76.2,MBPP62.6→67.4;对齐同时改善少样本任务表现。
人工交互
- 报告快照中 27B IT 的 Arena Elo 为
1218,9B IT 为1187,2B IT 为1126。 - 多轮目标完成度:Gemma 1.1 7B
3.36,Gemma 2 9B4.08,27B4.24。 - 满意度和目标完成度共同提高,收益覆盖整段对话,而非只改善单轮偏好。
未来方向
- 事实性与稳健性:继续减少错误事实,提高对抗输入下的鲁棒性。
- 推理与对齐:进一步研究小模型的推理能力和行为对齐,扩展开放权重模型可承担的任务。
(2406) CodeGemma (FIM、多文件打包)
核心内容
- 在 Gemma 基座上强化代码预训练,以较高 FIM 比例学习 PSM/SPM 补全。
- 结合依赖关系和单元测试做多文件打包;2B 面向补全,7B 扩展对话与代码推理。
详细笔记
(2403) Gemini 1.5 (Sparse MoE、在线蒸馏、百万上下文)
🌺 论文摘要
参考链接
问题背景
- 整库代码、长文档和长音视频需要跨远距离整合证据,服务成本随长度增加。
核心方法
- Pro:Sparse MoE;Flash:高效 Dense 模型,从 Pro 在线蒸馏。
- 多模态预训练、指令微调与人类偏好训练,扩展长上下文能力。
模型效果
- Pro 在
1M单针检索中准确率超过99.7%;给定语法书后可学习 Kalamang 翻译。 - HumanEval:1.0 Ultra
74.4、1.5 Flash74.3、1.5 Pro84.1。
重要结论
- 长上下文要分别测检索与联合理解;公开代码题还需控制数据污染。
核心贡献
- 确立长上下文 Pro 与高效 Flash 两条产品路线,并扩展多模态长文评测。
未来方向
- 提高长文联合推理能力,减少正常请求上的过度拒答。
问题背景
- 整库代码、长文档和长音视频需要跨远距离整合证据,输入越长,处理成本越高。
- 高能力模型适合复杂任务,低延迟服务还需要更轻量的架构与知识迁移。
核心方法
Pro / Flash 架构与蒸馏
Gemini 1.5 Pro
- Sparse MoE 通过路由选择部分专家,扩大容量同时控制单 token 成本。
- 原生处理图像、音频、视频、文本与代码交错输入。
Gemini 1.5 Flash
- 高效 Dense decoder,并行计算 attention 和 FFN,降低延迟。
- 从 Pro 在线蒸馏,保留长上下文与多模态能力。
多模态预训练与对齐
预训练
- 网页、代码、图像、音频、视频和多语言语料共同训练。
- 部分数据附带分类器控制标签,如毒性标签,供后训练调节行为。
SFT 与 RLHF
- 人或模型寻找有问题的回答,修订后形成 SFT 示范。
- 人类比较候选回答,训练 RM,再利用偏好信号优化模型。
实验设置(Gemini 1.5 Pro / Flash)
模型与训练
- Pro 使用 MoE,Flash 使用 Dense 与在线蒸馏。
- 训练使用跨数据中心的
4096-chip TPUv4 Pod。
评测任务
- HumanEval、Natural2Code、长文档、整库代码与音视频。
- 研究评测包含最长
10M tokens的特定长序列任务。
对照协议
- Code 表11使用
0-shot;对照 Gemini 1.0 Ultra。 - 另做测试数据污染实验,检查评测独立性。
能力层次
- 单针、多针检索检查定位能力;整书和整库任务检查跨位置联合理解。
- 音视频评测检查长时间跨度的事件与信息检索。
长上下文学习
- MTOB:把约
500 页Kalamang 语法书、2K词典项和约400平行句放入上下文。 - 总材料约
250K tokens,直接进行翻译,不更新模型参数。 - 对照无材料、半本书、全套材料,并与阅读相同材料的人类学习者比较。
代码污染对照
- 除公开 HumanEval 外,构建内部新题 Natural2Code。
- 用测试数据混入预训练的对照,检查公开评测被污染后分数变化。
关键结果(Gemini 1.5 Pro / Flash)
长上下文检索与学习
- Pro 在
1M单针检索中超过99.7%;该任务验证信息定位,需与联合推理分开看。 - 英语→Kalamang 的人工翻译评分:无材料
0.0,完整材料5.46/6,人类学习者5.60/6。 - 长窗口容纳语法规则与例句后,模型可在推理时学习低资源语言,无需额外训练。
代码能力
- HumanEval:Ultra
74.4→ Pro84.1;Natural2Code:74.9 → 82.6。 - Flash 的 Natural2Code 为
77.2,在较低服务成本下保持可用代码能力。
数据污染
- 将 HumanEval 测试数据混入继续预训练后,Ultra
74.4 → 89.0。 - 测试泄漏足以造成大幅虚高,内部新题为模型能力提供额外验证。
长文与安全
- 单针检索效果很强,但多针和跨段推理仍需单独测量。
- 降低违规时仍有部分额外拒答,需要兼顾正常请求的可回答性。


未来方向
原文提出的方向
- 提高长文联合推理能力,减少正常请求上的过度拒答。
(2312) Gemini 1.0 (原生多模态、SFT+RLHF)
🌺 论文摘要
参考链接
问题背景
- 通用模型需联合理解多种模态,同时覆盖高性能服务和端侧部署。
核心方法
- 联合预训练:文本、视觉、音频共同学习;Ultra / Pro / Nano 分层。
- 后训练:示范 SFT → 偏好 RM → RLHF,持续更新反馈数据。
- 训练系统:跨 Pod 模型/数据并行,冗余状态恢复与确定性重放处理故障。
模型效果
- Ultra:MMLU
90.0(CoT 多采样),MMMU62.4,HumanEval74.4。
重要结论
- 联合多模态训练能同时支持文本推理与视觉任务;推理策略也影响最终得分。
核心贡献
- 建立原生多模态模型家族,并给出从预训练、后训练到服务的统一路线。
未来方向
- 优化多模态训练数据分布,提高事实性、复杂推理与跨模态理解。
问题背景
- 文字、图像、音频和视频包含互补信息,需要在同一模型中联合理解。
- 高性能服务与端侧部署的算力不同,需要形成 Ultra / Pro / Nano 模型分层。
核心方法
多模态架构与模型分层
联合输入
- Decoder-only Transformer,从预训练开始联合学习文本、图像、音频与视频。
- 视频按帧编码并与文字、音频交错输入;可变图像分辨率保留细粒度信息。
- 音频直接使用
16kHzUSM 特征,保留语气等转写文本容易丢失的信息。
模型分层
- Ultra / Pro:分别面向复杂任务和服务效率。
- Nano:从大 Gemini 蒸馏,
1.8B / 3.25B,部署时使用4-bit量化。

数据构建与对齐训练
- 网页、书籍、代码与多模态语料混合;规则和模型筛选质量,并去除评测重叠数据。
- 小模型消融决定数据权重,训练后期增加目标领域数据比例。
- SentencePiece 使用全语料样本训练,改善非拉丁文字的切分效率。
- Prompt:覆盖真实单轮、多轮任务,来自人工、授权与合成数据。
- SFT:人工示范与经修订的模型回答,学习指令、代码与多模态响应。
- RM:对同一 Prompt 的候选答案收集偏好,覆盖安全、事实性和创造性。
- RLHF:利用 RM 更新策略,再从新策略的不足收集数据,迭代 RM 与策略。

跨集群训练与容错
- Pod 内模型并行、Pod 间数据并行,JAX / Pathways 统一调度。
- 内存保留冗余模型状态,故障时从完整副本恢复;确定性重放定位异常计算。
实验设置(Gemini 1.0)
模型与训练
- 上下文
32K;TPUv4 / TPUv5e;Ultra 使用跨数据中心训练。 - 预训练后分别形成 Apps 与 API 后训练版本。
评测协议
- MMLU:
CoT@32,按答案一致性阈值选择结果,低置信度时回退贪心回答。 - HumanEval 为后训练模型;MMMU 评估学科图文推理。
关键结果(Gemini 1.0)
推理与多模态
- Ultra 的 MMLU:
5-shot 83.7,加入多采样与不确定性选择后达90.0。 - MMMU
62.4,比此前最好结果高约5pt,提升覆盖跨学科图文推理。
代码与系统
- HumanEval
74.4、Natural2Code74.9,后者使用未公开的独立代码题。 - 训练有效运行时间比例由
85% → 97%,故障恢复是扩大训练规模的重要条件。
未来方向
原文讨论的方向
- 优化多模态训练数据分布,提高事实性、复杂推理与跨模态理解。
(2305) PaLM 2 (计算最优、多语言、混合目标)
🌺 论文摘要
参考链接
问题背景
- 只扩参数量会增加服务成本,英语主导的数据也限制多语言能力。
核心方法
- 计算最优:联合扩展数据与参数。
- 混合数据与目标:多语言平行文本、代码、数学及多种预训练目标。
模型效果
- 英语 QA/分类平均分:PaLM
70.4 → PaLM 2-L 76.9。 - Code 训练后的 PaLM 2-S*:HumanEval
37.6,PaLM-Coder 540B 为35.9。
重要结论
- 更小模型也能通过数据和训练组合提高能力;最低 Loss 不一定对应每个任务的最佳配置。
核心贡献
- 提供计算预算、数据多样性和混合目标共同优化的基模路线。
未来方向
- 联合优化数据配比、训练目标与推理成本,进一步提升低资源语言和复杂推理。
问题背景
- 只扩大参数增加服务成本,固定算力下还可能导致训练数据不足。
- 英语主导的语料限制多语言能力,数据配比与训练目标需要共同优化。
核心方法
计算最优规模选择
- 固定 FLOPs,联合选择参数量与训练 token 数,避免模型过大而训练不足。
- 扫描多个计算预算和模型规模,用验证 Loss 拟合最优组合,再检查下游任务。
- 参数与数据应近似同比例扩大;部署延迟也影响最终规模选择。
多语言数据与混合目标
数据构建
- 扩大非英语、数学和代码比例,加入数百种语言的英外平行文本。
- 去重、质量过滤与敏感信息清理,减少重复记忆,提高语料利用率。
训练目标
- 参考 UL2 采用多种预训练目标的混合,学习不同形式的语言理解与生成。
- 少量数据加入 Toxicity 控制 token,推理时通过条件控制减少有害输出。
- Code 分支在通用模型上继续训练代码,提高生成、修复和数据分析能力。
实验设置(PaLM 2)
模型与训练
- S / M / L 三档;正式模型参数与总 token 数未公开。
- Scaling 实验单独扫描 FLOPs、参数和 token 数;代码实验包含追加代码训练的 S*。
评测协议
- QA/分类
1-shot;L 取最后5个 Checkpoint 的平均表现。 - HumanEval / MBPP 的 pass@1 使用贪心生成;ARCADE 使用 New Tasks 子集。
关键结果(PaLM 2)
通用与代码
- 英语 QA/分类:
70.4 → 76.9,更小的 S 也接近 PaLM 540B。 - PaLM 2-S* 相对 PaLM-Coder 540B:HumanEval
35.9 → 37.6,ARCADE7.9 → 16.2。 - 收益不仅来自参数量,代码数据与任务训练可明显改善较小模型。
Scaling 与多语言
- 相同 FLOPs 下,最低 Loss 的规模并非所有下游任务最优,需要结合实际目标选择。
- 增加多语言比例后,英语任务仍提升;两者可以通过更高质量的数据共同改善。

未来方向
笔记讨论
- 联合优化数据配比、训练目标与推理成本,进一步提升低资源语言和复杂推理。
(2204) PaLM (540B Dense、Pathways)
🌺 论文摘要
参考链接
问题背景
- 扩大 Dense 模型需要同时解决跨集群效率,并验证规模对复杂推理的作用。
核心方法
- 540B Dense:SwiGLU、并行 Attention/FFN、MQA。
- Pathways:跨 TPU Pod 同步训练,使用约
780B tokens。 - CoT Prompting:在少样本示例中加入推理过程,再生成答案。
模型效果
- PaLM 540B 的 GSM8K:
8-shot CoT 58.1;常用英语任务中28/29达当时最佳。
重要结论
- 模型规模与 CoT 共同增强推理;部分任务的提升并非线性。
核心贡献
- 验证超大 Dense 模型的跨 Pod 训练,并系统分析规模、代码与少样本推理。
未来方向
- 提高数据与计算效率,扩大多语言覆盖;研究模型规模与推理能力之间的关系。
问题背景
- 超大 Dense 模型需要跨 TPU Pod 训练,计算、通信和显存开销必须共同控制。
- 模型扩大后,还需用多规模对照检验代码、语言与复杂推理收益。
核心方法
Dense 架构优化
计算与显存
- 并行 Attention / FFN:同一归一化输入进入两个分支,合并矩阵计算。
- MQA:多个 Query Head 共享 K/V,减少自回归生成时的 Cache 读取。
训练稳定性
- 使用 SwiGLU、RoPE、输入输出 Embedding 共享,并移除 Dense / LayerNorm Bias。
256KSentencePiece 词表保留空白,数字逐位切分,兼顾代码与多语言。
数据混合与 Pathways 训练
训练数据
- 网页按质量分加权采样;混合社交对话、书籍、代码、Wikipedia 与新闻。
- GitHub 数据按语言和许可证筛选,并按文件相似度去重。
- 按来源设混合比例,整体训练约一轮,避免反复使用某个子集。
分布式训练
- 两组 TPUv4 Pod 使用模型并行与数据并行,不使用 Pipeline Parallel。
- Pathways 统一协调跨 Pod 训练,JAX / T5X 实现训练与评测。
实验设置(PaLM 540B)
模型与数据
- 对照
8B / 62B / 540B,使用相同词表和数据。 - 数据:社交对话
50%、网页27%、书籍13%、代码5%、Wikipedia4%、新闻1%。
硬件与评测
- 540B:
6144 TPUv4,两个 Pod;约780B tokens。 - 推理任务使用
8-shot CoT;主结果为预训练模型,PaLM-Coder 另做代码训练。
关键结果(PaLM 540B)
推理与扩展
- GSM8K 达
58.1,少样本 CoT 可直接激发预训练模型的多步推理能力。 - 约四分之一 BIG-bench 任务在
62B → 540B阶段出现更明显跃升。
训练效率
- 并行 Attention/FFN 在大模型下提速约
15%,62B 消融未见质量下降。 - 540B 的 MFU 为
46.2%,说明跨 Pod 的模型与数据并行可以保持较高利用率。
未来方向
原文讨论的方向
- 提高数据与计算效率,扩大多语言覆盖;研究模型规模与推理能力之间的关系。