Skip to content

Gemini 系列

📅 发表于 2025/12/06
🔄 更新于 2026/08/05
👁️ — 次访问
📝 12775 字
⏳ 39 分钟

变化点 ​

2026

2026.09 · Gemini 3.8 Live(实时交互分支)

  • 结合实时语音、后台推理与异步工具执行。
  • 说话与任务处理并行,支持连续交互。

2026.07 报告 · Gemma 4

  • 开放 Dense / MoE 多模态家族并加入 Thinking;12B 直接处理图像 Patch 和原始音频块。
  • 按型号结合 K=V、跨层 KV 共享及 QAT/MTP,降低长上下文与端侧推理开销。

2026.05 · Gemini 3.5 Flash

  • 强化长程 Agent 与 Subagent 协作。
  • 重点优化连续任务执行效率,减少等待与重复操作。

2026.02 · Gemini 3.1 Pro

  • 在 Gemini 3 上强化复杂推理与代码库交互。
  • 面向多文件、整库任务提高分析与执行能力。
2025

2025.11 · Gemini 3 Pro

  • 继续扩展原生多模态 MoE,将多步 RL 用于推理和工具任务。

2025.07 报告 · Gemini 2.5

  • 扩大后训练 RL,形成 Thinking 与可控推理预算。
  • 通过蒸馏与效率优化构建 Flash,覆盖不同能力和成本需求。

2025.03 · Gemma 3

  • 局部/全局 Attention 改为 5:1,加入冻结 SigLIP 与 Pan & Scan,扩展视觉和 128K 上下文。
  • 全系列采用教师分布预训练,结合 IT 蒸馏、多任务 RL 和 QAT。
2024 及以前

2024.07 报告 · Gemma 2

  • 2B / 9B 改用教师概率分布预训练,提高小模型在长训练中的学习效率。
  • 结合局部/全局 Attention、SFT/RLHF 与权重平均,开放 2B / 9B / 27B。

2024.06 · CodeGemma

  • 在 Gemma 基座上强化代码预训练,以较高 FIM 比例学习 PSM/SPM 补全。
  • 结合依赖关系和单元测试做多文件打包;2B 面向补全,7B 扩展对话与代码推理。

2024.03 报告 · Gemini 1.5

  • 引入 Sparse MoE,扩展到百万级上下文。
  • 通过在线蒸馏构建 Flash,形成 Pro / Flash 分层。
2024 及以前(续)

2023.12 · Gemini 1.0

  • 由文本模型扩展为原生多模态训练,联合处理文本、图像、音频与视频。
  • 结合 SFT 与 RLHF,形成 Ultra / Pro / Nano 系列。

2023.05 · PaLM 2

  • 从单纯扩大参数转向计算预算、数据量与模型规模的共同优化。
  • 增强多语言、代码和推理数据,结合多种训练目标。

2022.04 · PaLM

  • 以 540B Dense 与 Pathways 扩大训练规模,强化少样本语言和推理能力。

(2609) Gemini 3.8 Live (实时语音、后台推理) ​

Gemini 3.8 Live:实时语音与后台任务

来源与问题

交互机制

  • 原生 Speech-to-Speech 直接处理语音输入与输出,并结合实时视觉理解当前场景。
  • Extended Thinking 在后台完成复杂推理,前台继续回应,允许用户补充要求。
  • 工具异步执行,结果返回后继续任务,使实时对话和后台工作并行。
公开表现(Extended Thinking)
  • τ-Voice=68.6,覆盖语音中的多步工具任务。
  • 银行业务子集 τ-Voice-banking=35.1,复杂业务完成率仍明显较低。
  • 语音模型除响应自然度外,还需要以任务是否完成衡量执行能力。

(2607) Gemma 4 (Thinking、无编码器 12B、QAT/MTP) ​

🌺 论文摘要

Gemma 4 论文摘要

参考链接

问题背景

  • 多模态模型需要同时适配端侧与 GPU,控制模态编码、长上下文和逐 Token 解码成本。

核心方法

  • 多模态架构:Dense 与 26B-A4B MoE 分工;12B 去除独立编码器,直接把图像 Patch 和原始音频投影到语言模型。
  • KV Cache 优化:局部/全局注意力配合 p-RoPE;大模型全局层 K=V,E2B / E4B 使用跨层 KV 共享。
  • 多模态训练与 Thinking:混合网页、代码、图像和部分型号的音频数据;后训练加入先推理再回答的模式。
  • QAT 与 MTP:量化语言模型及模态编码器;小型 Drafter 复用主模型的隐藏状态和 KV,提出待验证的后续 Token。

模型效果(Gemma 4 31B IT + Thinking,代码/数学/Agent)

  • 相对 Gemma 3 27B、Non-Thinking:LiveCodeBench v6 29.1 → 80.0,AIME 2026 无工具 20.8 → 89.2。
  • Terminal Bench Hard 4.0 → 36.0;关闭 Thinking 的长文评测中,128K RULER 66.0 → 96.4。

重要结论

  • 低激活 MoE 的收益因任务而异:26B-A4B 的 LiveCodeBench 为 77.1,接近 31B 的 80.0;Terminal Bench Hard 为 14.0,长程执行差距更大。
  • 无独立编码器路线可行:12B 直接处理原始音视频,在视觉问答和语音识别上形成可用能力,支持将模态处理并入统一模型。

关键贡献

  • 以 Apache 2.0 开放多模态 Dense / MoE 家族、量化版本与 MTP Drafter,提供面向不同硬件的模型组件。

未来方向

  • 支持面向不同硬件的多模态定制,并持续开展下游能力评估。

问题背景 ​

多模态推理的计算与内存约束
  • 统一模型难以适配全部硬件:手机、大显存 GPU 对参数、缓存和解码吞吐的限制不同,需要多尺寸 Dense / MoE 配置。
  • 长上下文缓存持续增长:即使权重能放入设备,KV 仍可能成为主要开销,需要同时优化层间共享和缓存表示。
  • 独立编码器增加部署碎片:音频、视觉各有独立网络;12B 尝试只保留轻量投影,让语言主干学习模态处理。
  • 逐 Token 解码开销高:小 Drafter 复用主模型状态,预先生成多个候选,再由主模型验证。

核心方法 ​

Dense、MoE 与多模态输入 ​

模型家族

语言主干

  • Dense:E2B、E4B、12B、31B;均采用 Decoder-Only Transformer,配合前后 RMSNorm 与 QK-Norm。
  • E2B / E4B:使用 Per-Layer Embeddings,总参数约 5B / 8B,有效参数约 2.3B / 4.5B。
  • 26B-A4B:总参数约 26B、激活约 3.8B 的 MoE,以较低每 Token 计算处理较大的模型容量。

独立编码器分支

  • E2B / E4B 使用 150M 视觉编码器;26B-A4B / 31B 使用 550M 视觉编码器。
  • ViT 支持可变宽高比,结合轴向 2D-RoPE、非因果注意力和二维绝对位置编码。
  • 可选视觉预算为 70 / 140 / 280 / 560 / 1120 tokens,用于调整细节保留与处理成本。
  • E2B / E4B 另有 305M 音频编码器:两层下采样卷积加 12 层 Conformer,输入为 Mel Filterbank。
  • 音频以 40ms 块处理,连续表示直接送入语言模型;独立视觉、音频编码器在预训练时冻结。
12B 无独立编码器

图像路径

  • 把图像切成 48 × 48 × 3 RGB Patch,以约 35M 参数的单个大型矩阵投影替代视觉编码器。
  • 在 Patch 表示中加入二维坐标位置 Embedding,再经 LayerNorm 接入语言模型。

音频路径

  • 原始 16KHz 音频按 40ms 划分,每块得到 640 维向量,直接投影到语言 Embedding 空间。
  • 音频顺序由序列位置承载,不额外添加模态专用位置编码。
  • 12B 从头联合训练,使语言主干承担原先由独立视觉、音频编码器执行的表示学习。

局部注意力与 KV Cache 共享 ​

减少长上下文缓存

局部与全局分工

  • E2B 的局部/全局层比例为 4:1,其他型号为 5:1。
  • 局部层采用 RoPE,频率基数 10K;全局层采用 p-RoPE, p=0.25,频率基数 1M。

按型号压缩 KV

  • 除 E2B / E4B 外,全局层复用 Key 作为 Value,即 V=K,减少重复缓存。
  • 与部分旋转位置编码配合,原文给出的全局 KV Cache 节省为 37.5%。
  • E2B / E4B 则使用跨层 KV 共享,报告中的共享比例分别为 20/35、18/42。

预训练数据与 Thinking 后训练 ​

模态数据与指令适配

预训练

  • 数据覆盖网页、代码和图像;音频训练仅用于 E2B、E4B 与 12B。
  • 语料截止至 2025.01;使用约 262K 词表的 SentencePiece,保留空格并拆分数字。
  • 去除评测污染、敏感信息及不合适内容,减少训练语料复现。
  • 大模型训练采用 Slice-Granularity Elasticity,局部 TPU 故障时减少活动 Slice 并继续运行。

Thinking 与数据过滤

  • 后训练沿用 Gemma 3 的整体方向,新增先输出推理轨迹、再给最终回答的 Thinking 模式。
  • 过滤重复内容、错误自我身份和不合适示范,并增加依据引用、不确定性表达与必要拒答数据。
  • Thinking 开关和 Function Calling 使用专用对话格式;IT 输出以 <turn|> 结束,PT 则使用 <eos>。

QAT 与多 Token 推测解码 ​

语言模型与编码器量化

端侧与通用量化

  • Mobile Quantization:权重按通道混合 INT2 / INT4,激活使用 INT8。
  • Q4_0:使用分块量化格式,适配常用开源推理引擎。
  • 在各 Block 引入标量 Scale,限制激活范围,使 FP16 推理保持稳定。

模态编码器

  • 150M 视觉编码器使用 W8A8 QAT;连同设备编译开销,前向内存从 400MB 降至 200MB。
  • 音频编码器使用 INT8 激活,按层组选择 2 / 4 / 8-bit 权重;量化后磁盘体积为 87MB。
复用主模型的 MTP Drafter

状态输入与候选生成

  • Drafter 读取主模型上一时刻的最后层激活与 Token Embedding,自回归生成后续候选 Token。
  • 独立 Embedding 配合 4 层 Transformer;其中 3 个局部层、1 个全局层,并交叉访问主模型 KV。
  • 直接复用主模型缓存,省去 Drafter 独立 Prefill,支持按需选择草稿长度。

小型号解码优化

  • E2B / E4B 将完整词表投影换成 Token Cluster 上的 Top-K 操作。
  • 输出矩阵由 d × 262000 缩至 d × 4096,在保持相近接受率的同时降低草稿生成开销。

实验设置(Gemma 4 IT,Thinking 与 Non-Thinking 分开) ​

模型与评测条件

主对照

  • Gemma 4 E2B / E4B / 12B / 26B-A4B / 31B,对照 Gemma 3 27B;音频另与 Gemma 3n 同尺寸型号比较。
  • 文本主表的 Gemma 4 默认开启 Thinking;Gemma 3 27B 为 Non-Thinking。
  • 视觉主表使用 1120 vision tokens;Gemma 3 27B 关闭 Thinking 并启用 Pan & Scan。

专项设置

  • 长上下文表统一关闭 Thinking,测 32K / 128K RULER、128K LOFT,以及部分型号约 256K 的 MTOB。
  • 音频测 FLEURS 的 WER/CER;CoVoST 使用“先转录、再翻译”提示并计算 CorpusBLEU。
  • 显存表为纯文本输入、32K 上下文、INT8 KV Cache;E2B / E4B 用 Mobile Quantization,较大型号用 Q4_0。
  • Arena 使用人工盲测,报告快照日期为 2026-06-19。

关键结果(Gemma 4 IT + Thinking,代码与多模态) ​

文本推理与 Agent

31B 对照 Gemma 3 27B

  • LiveCodeBench v6 29.1 → 80.0;Codeforces Elo 110 → 2150。
  • AIME 2026 无工具 20.8 → 89.2;GPQA Diamond 42.4 → 84.3。
  • Terminal Bench Hard 4.0 → 36.0;Tau2 Airline 39.0 → 75.0,Retail 6.6 → 86.4。
  • 以上为新一代 Thinking 模型与前代 Non-Thinking 模型的整体比较。

Dense 与低激活 MoE

  • 26B-A4B:AIME 88.3、LiveCodeBench 77.1,接近 31B 的 89.2 / 80.0。
  • Terminal Bench Hard 为 14.0,低于 31B 的 36.0;模型选择需要同时检查 Agent 任务表现。
  • 同表 Arena Elo:31B 1451、26B-A4B 1438,前代 Gemma 3 27B 为 1366。
视觉、音频与长上下文

视觉与无编码器模型

  • 31B:MMMU Pro 76.9、MATH-Vision 85.6;12B 分别为 69.1 / 79.7。
  • 12B 不依赖独立音频编码器,FLEURS 英语 WER 为 0.063、德语为 0.053,显示直接音频投影路线可行。

端侧音频

  • E4B 相对 Gemma 3n E4B:CoVoST 平均 BLEU 34.7 → 38.2;FLEURS 平均错误率 0.085 → 0.075。
  • 音频编码器量化后体积由 390MB 降至 87MB,模型压缩与任务质量同时改善。

关闭 Thinking 的长文能力

  • 31B 相对 Gemma 3 27B:128K RULER 66.0 → 96.4;LOFT Text Retrieval 8.6 → 79.5。
  • E4B:128K RULER 86.6、LOFT 58.5;更小有效参数量也能改善跨长文检索。
  • GraphWalks F1:前代 32.8,31B 82.3、26B-A4B 72.6,收益覆盖需要跟踪关系的长文任务。

未来方向 ​

原文后续方向
  • 开放端侧研究:以 Dense、MoE、无编码器模型和推理组件作为可定制基础,支持社区扩展不同硬件上的多模态推理。
  • 持续下游评估:作者计划继续监测模型使用,并随多模态能力扩展更新评估与缓解措施。

(2605) Gemini 3.5 Flash (长程 Agent、执行效率) ​

Gemini 3.5 Flash:长程 Agent 与执行效率

来源与配置

任务执行

  • Thinking Levels 按任务复杂度选择推理投入,兼顾多步执行效果与调用成本。
  • 围绕计划、操作、测试和修正持续工作,工具反馈用于后续决策。
  • Antigravity 将开发、测试等独立工作分给 Subagent,再汇总结果、处理共同约束。
公开表现(Gemini 3 Flash → 3.5 Flash)

工具与多模态任务

  • Terminal-Bench 2.1,Terminus-2 harness:58.0 → 76.2,多步终端执行改善。
  • MCP Atlas 62.0 → 83.6,收益覆盖工具选择与调用。
  • CharXiv Reasoning 84.2,支持在工作中结合科研图表和文字推理。

(2602) Gemini 3.1 Pro (复杂推理、整库任务) ​

Gemini 3.1 Pro:复杂推理与整库任务

来源与配置

技术重点

  • 联合处理文档、图像、代码与工具反馈,在任务中推理、调用工具并调整后续操作。
  • 重点改善复杂推理与仓库求解;模型卡未详细公开新增训练 recipe。
公开表现(Gemini 3 Pro → 3.1 Pro)

High Thinking 评测

  • ARC-AGI-2 31.1 → 77.1,抽象规则识别与推理明显进步。
  • SWE-bench Verified 76.2 → 80.6;每次完整工具交互提交一个补丁,平均 10 次运行。
  • MRCR v2 8-needle / 1M 仍为 26.3,指定长文检索设置没有同步改善。
  • 推理和仓库能力提高,尚未自动解决长上下文中的分散信息定位。

(2511) Gemini 3 Pro (原生多模态 MoE、多步 RL) ​

Gemini 3 Pro:原生多模态与多步 RL

来源与配置

  • Model Card、官方发布。
  • 原生多模态 Sparse MoE,输入 1M、输出 64K;使用 TPU、JAX / Pathways 训练。

训练路线

  • 多模态预训练联合学习文本、视觉等信息,MoE 按输入选择部分专家,控制单 token 计算。
  • 指令数据学习响应与交互形式,偏好与 RL 数据进一步优化行为。
  • RL 覆盖多步推理,使模型在连续任务中处理视觉、代码和工具反馈。
公开表现

代码任务

  • SWE-bench Verified 76.2;完整交互读取仓库、定位、修改并测试,每次提交一个补丁。
  • 结果为 10 次运行平均,覆盖比单函数生成更完整的工程过程。

科学与多模态推理

  • GPQA Diamond 91.9,HLE 无工具 37.5,覆盖专业知识与高难推理。
  • MMMU-Pro 81.0、Video-MMMU 87.6,能力覆盖复杂图文与视频理解。

(2507) Gemini 2.5 (Thinking、多步 RL、Flash 蒸馏) ​

🌺 论文摘要

Gemini 2.5 Pro / Flash 摘要

参考链接

问题背景

  • 复杂推理、整库开发和长任务需要更大的后训练投入,同时要控制服务成本。

核心方法

  • 多模态 MoE:联合学习文本、视觉和音频;扩大代码与工程任务覆盖。
  • SFT/RM/RL:提高数据质量与 RL 计算,结合可验证奖励、生成式奖励。
  • Thinking:RL 学习推理,预算控制计算开销;Flash 蒸馏教师稀疏概率分布。
  • 训练系统:跨数据中心弹性训练与静默错误定位,减少局部故障造成的全局等待。

模型效果

  • Pro 相对 1.5 Pro:单次 SWE Verified 22.3 → 59.6,Aider 16.9 → 82.2。

重要结论

  • 推理预算与多步后训练增强复杂求解;长窗口仍不能替代可靠的历史检索。

核心贡献

  • 将 Thinking、原生多模态、教师蒸馏和工具型后训练整合成基模家族。

未来方向

  • 加强长期规划和状态管理,改进多模态 Agent 的执行可靠性。

问题背景 ​

复杂任务能力与计算成本
  • 整库开发、多模态推理和多步工具任务需要扩大后训练覆盖。
  • 长思考与大型模型增加服务成本,需结合推理预算和蒸馏形成 Pro / Flash 分工。
  • 跨数据中心训练频繁遭遇局部故障,容错效率影响可用训练规模。

核心方法 ​

多模态架构与数据 ​

原生输入与数据覆盖

模型与语料

  • Pro 与 Flash 使用 Sparse MoE,按 token 选择部分专家,原生支持文本、图像、音频和视频。
  • 扩展仓库与 Web 代码语料,提高语言、任务和工程场景覆盖。
  • 后训练加入整库操作、IDE 和多模态应用开发等工程任务。

音频与视频表示

  • 因果音频表示支持低延迟流式输入输出,后训练结合 thinking、场景感知和工具调用。
  • 以更少的视觉 token 表示每帧,为长视频留出更多上下文空间。

多步后训练与奖励反馈 ​

多步任务训练
  • 数据质量:模型辅助检查 SFT、Reward Modeling 与 RL 数据,提高筛选效率。
  • 可验证奖励:正确答案或可执行检查提供反馈;适合能明确判断结果的任务。
  • 生成式奖励:评价模型提供更丰富反馈,覆盖难以仅靠硬规则判断的任务。
  • 多步环境:训练扩展到需要连续动作和工具调用的任务,学习从反馈中调整后续行为。
  • 搜索应用:搜索与内部推理交错,依据已有结果生成后续查询,再验证回答依据。
从失败回复构造监督
  • 寻找失败:通过人类与模型交互、自动攻击模型,收集违规回答和不必要拒答。
  • 修订示范:结合模型生成与人工干预,把失败回复改成合适回答,再用于 SFT。
  • DRM:人对候选回答给偏好,训练 Data Reward Model,让评价能力复用到更多样本。
  • Critic:按预定义 Rubric 评价回答;修改评分规则可以离线迭代,不必重新收集整批人工偏好。
  • RL*F:结合人类偏好与 Critic 反馈训练,同时检查安全和帮助程度;这里的 Critic 是评分模型,不是已披露的 PPO Value Network。

推理预算与教师蒸馏 ​

Thinking与Flash分工

推理预算

  • 动态思考:模型按问题投入推理;外部 thinking budget 限制可用预算。
  • 预算限制作用于当前问题的推理计算,模型在限制内分配思考步骤。

教师蒸馏

  • k-sparse 分布:保存教师最重要的一部分词表概率,让学生学到多个合理的下一 Token,而非只有单个硬标签。
  • 取舍:增加训练数据传输和存储,换取小模型质量。

跨数据中心训练系统 ​

训练系统
  • Slice-Granularity Elasticity:局部设备故障时先减少参与训练的 Slice,其他设备继续计算。
  • Split-Phase SDC Detection:异常时确定性重放,对比设备中间 Checksum,定位静默数据错误。
  • 作用:大型训练集群频繁出现局部故障,系统需要避免“一处故障、全体等待”。

实验设置(Gemini 2.5 Pro / Flash) ​

实验设置

模型与训练

  • Gemini 2.5 Pro / Flash;多模态预训练 → SFT/RM/RL,Flash 额外使用蒸馏。
  • 预训练覆盖 Web、代码、图像、音频和视频。

评测设置

  • Pro/Flash 输入 1M、输出 64K;主要对照 Gemini 1.5 Pro。
  • 代码、数学、知识、长上下文;SWE 分单次求解与多候选重排。

专项评测

  • Thinking 预算曲线;多模态输入与 Deep Research Agent;长程游戏案例。

关键结果(Gemini 2.5 Pro / Flash) ​

关键结果

代码与数学

  • 单次 SWE Verified:1.5 Pro 22.3、2.5 Flash 48.9、2.5 Pro 59.6。
  • 2.5 Pro 多候选重排达 67.2,增加搜索预算进一步提高修复率。
  • Aider 16.9 → 82.2,AIME 2025 17.5 → 88.0,提升覆盖代码编辑与数学推理。

推理预算

  • AIME、GPQA 与 LCB 预算曲线总体随计算增加改善,应结合任务收益选择预算。

长上下文

  • 1M MRCR v2:1.5 Pro 12.1、2.5 Pro 16.4、Flash 21.0。
  • Pro 并非所有项目都优于 Flash;复杂长文检索仍有明显短板。

视频与训练效率

  • 每帧视觉 token 由 258 减至 66,1M 窗口可容纳约 3 小时 视频。
  • 局部 TPU slice 故障时仍保持约 97% 吞吐,弹性训练减少全局等待。
Gemini 2.5 的 Thinking Budget 曲线。比较 AIME、LiveCodeBench 与 GPQA 随预算增长的收益,避免将更长思考直接视为等比例提升。
原文图 4:Gemini 2.5 的 Thinking Budget 曲线。比较 AIME、LiveCodeBench 与 GPQA 随预算增长的收益,避免将更长思考直接视为等比例提升。 来源

未来方向 ​

未来方向

原文观察与后续方向

  • 加强长期规划和状态管理,改进多模态 Agent 的执行可靠性。

(2503) Gemma 3 (5:1 注意力、视觉输入、蒸馏与 RL) ​

🌺 论文摘要

Gemma 3 论文摘要

参考链接

问题背景

  • 长上下文和视觉输入增加缓存与计算开销,需要在消费级硬件预算内扩展能力。

核心方法

  • 长上下文架构:局部/全局注意力 5:1,局部窗口缩至 1024;4B 及以上从 32K 训练扩展至 128K。
  • 视觉输入:冻结 SigLIP,把每张图压成 256 tokens;Pan & Scan 在推理时增加裁剪,保留文字和局部细节。
  • 预训练蒸馏:全系列学习教师分布,每个位置按教师概率采样 256 logits;增加图文和多语言数据。
  • 后训练与量化:IT 教师蒸馏结合 RL,使用人工偏好、代码执行和数学答案奖励;QAT 再用原精度模型监督量化模型。

模型效果(Gemma 3 27B IT + 蒸馏/RL,零样本评测)

  • 相对 Gemma 2 27B IT:MATH 55.6 → 89.0,LiveCodeBench 20.4 → 29.7。
  • 新增视觉能力:MMMU 64.9;Bird-SQL Dev 54.4,与同表 Gemini 1.5 Pro 持平。

重要结论

  • 教师大小需匹配训练时长:短训练时小教师较好,延长训练后大教师占优,不能仅按学生尺寸固定教师规模。
  • 视觉文字依赖有效分辨率:27B 开启 Pan & Scan 后,InfoVQA 59.4 → 76.4,分块输入显著减少缩图的信息损失。

关键贡献

  • 开放 1B / 4B / 12B / 27B 模型及量化版本,将图像、长上下文和多语言能力纳入消费级硬件可运行的模型家族。

未来方向

  • 改善 128K 之外的上下文泛化,并持续评估多模态与推理能力。

问题背景 ​

多模态与长上下文挤占部署资源
  • 历史越长,KV Cache 越大:全局 Attention 的缓存随上下文增长;提高局部层比例,让少量全局层负责跨长距离访问。
  • 统一缩图丢失细节:非方形图片和小字被压到固定分辨率后难以辨认;推理时按需裁剪图像。
  • 小模型能力扩展受参数预算限制:以教师分布提供更丰富监督,并用多任务 RL 强化代码、数学和指令执行。

核心方法 ​

局部注意力与长上下文 ​

从 1:1 到 5:1

控制 KV Cache

  • 每 5 个局部 Attention 层安排 1 个全局层;局部窗口从 Gemma 2 的 4096 缩至 1024。
  • 局部层只保留短窗口缓存,全局层访问全部历史,降低长上下文显存增长。
  • 保留 GQA、前后 RMSNorm;用 QK-Norm 替换 Gemma 2 的 Soft-Capping。

扩展上下文

  • 先以 32K 序列预训练,再在末期把 4B / 12B / 27B 扩至 128K;1B 保留 32K。
  • 全局层 RoPE Base 从 10K 提至 1M,局部层仍为 10K。
  • 全局位置编码再做插值式重缩放,实验选择 8 倍缩放因子。

SigLIP 与 Pan & Scan ​

冻结视觉编码器

图像表示

  • 4B / 12B / 27B 共用约 417M 的 SigLIP 视觉编码器,1B 为纯文本模型。
  • 编码器先针对视觉助手任务适配;语言模型训练时冻结视觉权重,并预先计算图像 Embeddings。
  • 以 896 × 896 输入,平均池化后保留固定 256 个视觉 Token,接入语言模型上下文。

Pan & Scan

  • 对需要保留局部细节的图像划分等尺寸、不重叠的裁剪,再分别缩放至编码器输入分辨率。
  • 根据图像形状按需启用,并限制最大裁剪数,缓解小字和小物体在整图缩放时消失的问题。
  • 该策略仅发生在推理时;可以关闭以降低图像处理开销。

多模态语料与预训练蒸馏 ​

数据混合与质量处理

图文与多语言

  • 混合文本和图像;1B / 4B / 12B / 27B 分别训练 2T / 4T / 12T / 14T tokens。
  • 增加单语和双语平行数据,调整语言采样,缓解高低资源语言分布不均。
  • 使用 Gemini 2.0 的 SentencePiece,约 262K 词表,提高非英语 Tokenization 的均衡性。

过滤与重加权

  • 去除敏感内容与评测污染,降低训练文本复现。
  • 在过滤之外增加质量重加权,减少低质量语料在训练中的占比。
稀疏教师分布
  • 每个 Token 位置按教师概率加权采样 256 个 Logits,保存这部分监督。
  • 未采样的候选概率设为 0,再归一化采样集合上的教师概率。
  • 学生通过交叉熵学习该稀疏分布,以较小存储开销接受软标签监督。
  • 与 Gemma 2 仅蒸馏 2B / 9B 不同,Gemma 3 全部尺寸都使用预训练蒸馏。

指令蒸馏、RL 与 QAT ​

多任务后训练

教师与优化方法

  • 使用更大的 IT 教师做改进的知识蒸馏,再结合基于 BOND、WARM、WARP 改进版本的 RL 阶段。
  • BOND、WARM、WARP 分别关联 Best-of-N 蒸馏、奖励模型权重平均和策略权重合并。

奖励来源

  • 人工偏好:训练多个 RM 并平均权重,为帮助性、指令遵循和多语言等能力提供反馈。
  • 代码执行:运行代码取得执行反馈,指导代码能力优化。
  • 数学答案:使用 Ground-Truth 判定回答质量,强化数学与推理。
  • 过滤重复、错误自我身份和不合适示范,并加入依据引用与不确定性表达,改善事实性。
量化感知训练
  • 对已训练模型再进行通常约 5000 steps 的 QAT,适配量化误差。
  • 使用原精度模型的概率作为目标,训练数据同时匹配预训练和后训练分布。
  • 提供 Per-Channel INT4、Per-Block INT4 和 Switched FP8,降低权重显存占用。

实验设置(Gemma 3,蒸馏预训练 + IT 蒸馏/RL) ​

训练与评测

模型配置

  • 主模型:Gemma 3 1B / 4B / 12B / 27B;主对照为对应 Gemma 2 与 Gemini 1.5 / 2.0。
  • 文本、代码、数学和视觉结果分别报告;表 6 为最终 IT 模型的 zero-shot 评测。
  • QAT:通常 5000 steps;显存比较固定 32K 上下文,KV Cache 使用 8-bit。

消融设置

  • Attention 比例和窗口实验使用纯文本模型,检查验证 PPL 与缓存占用。
  • 教师规模实验固定学生,分别使用小/大教师,改变训练 Token 数。
  • Pan & Scan:表 8 使用 4-shot 验证集,比较同一视觉 Checkpoint 开关裁剪后的表现。
  • Arena 为人工盲测;27B 的分数来自 2025-03-08 初步快照。

关键结果(Gemma 3 27B IT,蒸馏与多任务 RL) ​

代码、数学与多模态

相对 Gemma 2 27B IT

  • MATH 55.6 → 89.0,HiddenMath 14.8 → 60.3,数学任务改善最显著。
  • LiveCodeBench 20.4 → 29.7,Bird-SQL Dev 46.7 → 54.4,算法代码和数据库任务均有提升。
  • MMLU-Pro 56.9 → 67.5,GPQA Diamond 34.3 → 42.4。

新增能力与交互

  • MMMU Val 为 64.9,接近同表 Gemini 1.5 Pro 的 65.9。
  • Global MMLU-Lite 68.6 → 75.1,多语言数据扩展转化为跨语言知识收益。
  • 同表 Arena Elo:Gemma 2 27B IT 1220 → Gemma 3 27B IT 1338;该榜分数不包含视觉能力。
架构与视觉消融

长上下文和教师选择

  • 局部/全局比例升至 7:1 时验证 PPL 仍变化很小,支持以更多局部层减少缓存。
  • 缩短局部窗口同样只产生较小 PPL 变化;较少全局层与短窗口应一起配置。
  • 小教师在短训练中占优;长训练后大教师更好,蒸馏配置需随训练预算选择。

Pan & Scan 与量化

  • 27B:DocVQA 85.6 → 90.4;InfoVQA 59.4 → 76.4;TextVQA 68.6 → 70.2。
  • 4B:InfoVQA 44.1 → 57.0,裁剪对不同模型规模均有效。
  • 27B、32K 上下文:原 BF16 权重加 KV 为 72.7GB,Per-Channel INT4 版本为 32.8GB。
  • 量化减少权重体积后,KV Cache 仍占用较大比例,长上下文部署需同时优化两者。

未来方向 ​

原文局限与后续方向
  • 上下文外推:RoPE 重缩放后可泛化至 128K,继续增加长度时 PPL 快速退化,窗口外能力仍有限。
  • 持续能力评估:作者将继续按模型潜在风险更新评估与缓解方法;多模态与 STEM 能力扩展后需同步检查模型行为。

(2407) Gemma 2 (教师分布预训练、SFT/RLHF) ​

🌺 论文摘要

Gemma 2 论文摘要

参考链接

问题背景

  • 小模型长时间预训练的收益趋缓,需要更丰富的监督;推理还受显存与 KV Cache 限制。

核心方法

  • 架构优化:局部/全局注意力 1:1 交替,结合 GQA、Logit Soft-Capping 与前后 RMSNorm。
  • 教师分布预训练:2B / 9B 学习教师的下一 Token 概率分布;27B 使用普通预训练,分别训练 2T / 8T / 13T tokens。
  • SFT / RLHF / 合并:教师生成示范并监督学生分布,大型 RM 提供多轮偏好反馈,再平均不同训练配置的权重。

模型效果(Gemma 2 + SFT/RLHF/权重合并,MBPP)

  • Gemma 2 9B:PT 52.4 → IT 59.2,提升 +6.8pt。
  • Gemma 2 27B:PT 62.6 → IT 67.4,提升 +4.8pt。

重要结论

  • 同量数据下蒸馏有效:2B 训练 500B tokens,三项基准均分从普通预训练的 60.3 提高到蒸馏的 67.7,收益来自更丰富的监督。
  • 架构可兼顾质量和开销:9B 的 GQA 与 MHA 质量接近;局部窗口从 4096 缩到 2048 时验证 PPL 不变。

关键贡献

  • 给出适用于长时间训练的小模型概率分布蒸馏路线,并开放多尺寸 PT / IT 权重。

未来方向

  • 继续改进事实性、稳健性与推理,扩展小模型可承担的任务。

问题背景 ​

小模型继续堆数据的收益下降
  • 单一正确 Token 的监督有限:增加训练长度的收益趋缓;教师概率分布能同时提供多个候选 Token 的相对偏好。
  • 消费级设备受显存限制:模型需要在较小总参数量下保持质量;GQA 与局部注意力减少推理开销。
  • 预训练不能直接解决多轮对话:需通过教师示范、偏好反馈与权重合并,学习指令执行和持续交互。

核心方法 ​

局部注意力与训练稳定性 ​

Attention 与归一化

控制推理开销

  • 局部/全局交替:每隔一层使用全局注意力;局部窗口 4096,全局跨度 8192。
  • GQA:每个 KV Head 供两个 Query Heads 共享,减少 KV 存储与读取。
  • 更深的网络:相同参数预算下,9B 选择更深的布局,替代更宽的布局。

控制激活幅度

  • Logit Soft-Capping:用 c × tanh(logit / c) 平滑限制 Logit 幅度。
  • Attention 的 c=50,最终输出层的 c=30,避免极端 Logit 主导计算。
  • Attention 与 FFN 子层的输入、输出均使用 RMSNorm,稳定深层训练。

预训练数据与教师分布蒸馏 ​

语料与模型分工

训练数据

  • 以英语为主,覆盖网页、代码、科学文献;通过小规模消融选择混合比例。
  • 过滤敏感信息与不合适内容,去除评测污染,减少训练文本复现。
  • 沿用 Gemma 1 / Gemini 的 SentencePiece,保留空格、拆分数字,并支持 Byte-Level 编码。

训练目标

  • 27B:从头预训练 13T tokens,作为较大规模基座。
  • 2B / 9B:分别训练 2T / 8T tokens,用教师分布替换真实下一 Token 的 One-Hot 标签。
  • 学生最小化教师分布与自身分布间的交叉熵;每个训练位置都学习候选 Token 的相对概率。
  • 蒸馏用于远超计算最优 Token 数的长训练,目标是提高最终质量,而不仅是缩短训练时间。
蒸馏监督
LKD=−∑xPT(x∣xc)log⁡PS(x∣xc)
  • 蓝色 教师分布为给定上下文 x_c 后各候选 Token 的概率;学生 P_S 通过交叉熵逼近它。
  • 同一位置可获得多个候选词的监督,比只学习原文中出现的一个 Token 更丰富。

教师示范、RLHF 与权重合并 ​

从预训练模型到指令模型

SFT 与蒸馏

  • 使用英文、纯文本的真实与合成 Prompt;回答主要由更大的教师生成。
  • 对示范做行为克隆,同时在学生生成分布上接受教师监督。
  • 引入 LMSYS-chat-1M 的 Prompt,不使用其中的原回答。

偏好优化与合并

  • RM 由英文人工偏好数据训练,规模约为 Policy 的一个数量级,重点增强多轮对话评价。
  • RLHF 沿用 Gemma 1.1 的算法路线,训练 Prompt 与 SFT 阶段同源。
  • 对不同超参数运行得到的模型进行权重平均,提高综合表现。
数据过滤与事实性
  • 移除重复样本、错误自我身份、敏感信息及不合适输出,避免教师错误直接进入学生训练。
  • 加入基于上下文引用、表达不确定性、必要时拒答的示范,减少无依据回答。
  • 作者观察到这类数据提高事实性指标,同时没有降低其他评测表现。

实验设置(Gemma 2 PT / IT 与蒸馏消融) ​

模型与对照

完整训练

  • 2B / 9B / 27B:分别为 26 / 42 / 46 层;训练量 2T / 8T / 13T tokens,上下文 8192。
  • PT 测知识、数学、代码等静态基准;IT 额外测人工偏好、指令遵循和多轮对话。
  • 静态结果包括 MMLU 5-shot、GSM8K 5-shot、HumanEval pass@1、MBPP 3-shot。

受控消融

  • 蒸馏:固定 2B 学生、500B tokens,比较普通训练与 7B 教师蒸馏。
  • 架构:在 9B 比较 MHA/GQA、宽/深布局;单独改变推理时局部窗口。
  • 人工多轮评测:500 个场景,平均 8.4 个用户轮次,对满意度和目标完成度打 1~5 分。

关键结果(Gemma 2,预训练蒸馏 + SFT/RLHF/权重合并) ​

预训练蒸馏与架构消融

教师监督

  • 2B + 500B tokens:三项基准平均分 60.3 → 67.7,提升 +7.4pt。
  • 固定 7B 教师,200M / 400M / 1B 学生验证 PPL 分别从 23 / 19 / 17 降至 21 / 17 / 15。
  • 蒸馏收益在不同学生规模上都存在,支持在小模型训练中增加监督信息量。

架构取舍

  • 9B 的四项基准均分:MHA 50.3、GQA 50.8;减少 KV Heads 未损失质量。
  • 同参数 9B:宽布局 50.8、深布局 52.0,深度增加带来小幅一致收益。
  • 局部窗口 4096 / 2048 / 1024:验证 PPL 1.63 / 1.63 / 1.64,可用小窗口换取推理效率。
最终模型与对齐收益

代码与知识

  • 27B PT:MMLU 75.2、GSM8K 74.0、HumanEval 51.8、MBPP 62.6。
  • 9B PT → IT:MMLU 71.3 → 72.3,MBPP 52.4 → 59.2。
  • 27B PT → IT:MMLU 75.2 → 76.2,MBPP 62.6 → 67.4;对齐同时改善少样本任务表现。

人工交互

  • 报告快照中 27B IT 的 Arena Elo 为 1218,9B IT 为 1187,2B IT 为 1126。
  • 多轮目标完成度:Gemma 1.1 7B 3.36,Gemma 2 9B 4.08,27B 4.24。
  • 满意度和目标完成度共同提高,收益覆盖整段对话,而非只改善单轮偏好。

未来方向 ​

原文后续方向
  • 事实性与稳健性:继续减少错误事实,提高对抗输入下的鲁棒性。
  • 推理与对齐:进一步研究小模型的推理能力和行为对齐,扩展开放权重模型可承担的任务。

(2406) CodeGemma (FIM、多文件打包) ​

CodeGemma

核心内容

  • 在 Gemma 基座上强化代码预训练,以较高 FIM 比例学习 PSM/SPM 补全。
  • 结合依赖关系和单元测试做多文件打包;2B 面向补全,7B 扩展对话与代码推理。

详细笔记

(2403) Gemini 1.5 (Sparse MoE、在线蒸馏、百万上下文) ​

🌺 论文摘要

Gemini 1.5 Pro / Flash 摘要

参考链接

问题背景

  • 整库代码、长文档和长音视频需要跨远距离整合证据,服务成本随长度增加。

核心方法

  • Pro:Sparse MoE;Flash:高效 Dense 模型,从 Pro 在线蒸馏。
  • 多模态预训练、指令微调与人类偏好训练,扩展长上下文能力。

模型效果

  • Pro 在 1M 单针检索中准确率超过 99.7%;给定语法书后可学习 Kalamang 翻译。
  • HumanEval:1.0 Ultra 74.4、1.5 Flash 74.3、1.5 Pro 84.1。

重要结论

  • 长上下文要分别测检索与联合理解;公开代码题还需控制数据污染。

核心贡献

  • 确立长上下文 Pro 与高效 Flash 两条产品路线,并扩展多模态长文评测。

未来方向

  • 提高长文联合推理能力,减少正常请求上的过度拒答。

问题背景 ​

长序列理解与服务成本
  • 整库代码、长文档和长音视频需要跨远距离整合证据,输入越长,处理成本越高。
  • 高能力模型适合复杂任务,低延迟服务还需要更轻量的架构与知识迁移。

核心方法 ​

Pro / Flash 架构与蒸馏 ​

Pro / Flash 架构

Gemini 1.5 Pro

  • Sparse MoE 通过路由选择部分专家,扩大容量同时控制单 token 成本。
  • 原生处理图像、音频、视频、文本与代码交错输入。

Gemini 1.5 Flash

  • 高效 Dense decoder,并行计算 attention 和 FFN,降低延迟。
  • 从 Pro 在线蒸馏,保留长上下文与多模态能力。

多模态预训练与对齐 ​

多模态训练

预训练

  • 网页、代码、图像、音频、视频和多语言语料共同训练。
  • 部分数据附带分类器控制标签,如毒性标签,供后训练调节行为。

SFT 与 RLHF

  • 人或模型寻找有问题的回答,修订后形成 SFT 示范。
  • 人类比较候选回答,训练 RM,再利用偏好信号优化模型。

实验设置(Gemini 1.5 Pro / Flash) ​

实验设置

模型与训练

  • Pro 使用 MoE,Flash 使用 Dense 与在线蒸馏。
  • 训练使用跨数据中心的 4096-chip TPUv4 Pod。

评测任务

  • HumanEval、Natural2Code、长文档、整库代码与音视频。
  • 研究评测包含最长 10M tokens 的特定长序列任务。

对照协议

  • Code 表11使用 0-shot;对照 Gemini 1.0 Ultra。
  • 另做测试数据污染实验,检查评测独立性。
长上下文评测设计

能力层次

  • 单针、多针检索检查定位能力;整书和整库任务检查跨位置联合理解。
  • 音视频评测检查长时间跨度的事件与信息检索。

长上下文学习

  • MTOB:把约 500 页 Kalamang 语法书、2K 词典项和约 400 平行句放入上下文。
  • 总材料约 250K tokens,直接进行翻译,不更新模型参数。
  • 对照无材料、半本书、全套材料,并与阅读相同材料的人类学习者比较。

代码污染对照

  • 除公开 HumanEval 外,构建内部新题 Natural2Code。
  • 用测试数据混入预训练的对照,检查公开评测被污染后分数变化。

关键结果(Gemini 1.5 Pro / Flash) ​

关键结果

长上下文检索与学习

  • Pro 在 1M 单针检索中超过 99.7%;该任务验证信息定位,需与联合推理分开看。
  • 英语→Kalamang 的人工翻译评分:无材料 0.0,完整材料 5.46/6,人类学习者 5.60/6。
  • 长窗口容纳语法规则与例句后,模型可在推理时学习低资源语言,无需额外训练。

代码能力

  • HumanEval:Ultra 74.4 → Pro 84.1;Natural2Code:74.9 → 82.6。
  • Flash 的 Natural2Code 为 77.2,在较低服务成本下保持可用代码能力。

数据污染

  • 将 HumanEval 测试数据混入继续预训练后,Ultra 74.4 → 89.0。
  • 测试泄漏足以造成大幅虚高,内部新题为模型能力提供额外验证。

长文与安全

  • 单针检索效果很强,但多针和跨段推理仍需单独测量。
  • 降低违规时仍有部分额外拒答,需要兼顾正常请求的可回答性。
Kalamang 上下文学习案例:把语法书和词典放入输入后完成翻译,说明长窗口可用于推理时学习新规则,无需更新参数。
原文图 4:Kalamang 上下文学习案例:把语法书和词典放入输入后完成翻译,说明长窗口可用于推理时学习新规则,无需更新参数。 来源
Gemini 1.5 在文本、音频和视频中的长上下文检索。观察长度与目标位置变化时的成功区域;此图检验信息定位能力。
原文图 1:Gemini 1.5 在文本、音频和视频中的长上下文检索。观察长度与目标位置变化时的成功区域;此图检验信息定位能力。 来源

未来方向 ​

未来方向

原文提出的方向

  • 提高长文联合推理能力,减少正常请求上的过度拒答。

(2312) Gemini 1.0 (原生多模态、SFT+RLHF) ​

🌺 论文摘要

Gemini 1.0 摘要

参考链接

问题背景

  • 通用模型需联合理解多种模态,同时覆盖高性能服务和端侧部署。

核心方法

  • 联合预训练:文本、视觉、音频共同学习;Ultra / Pro / Nano 分层。
  • 后训练:示范 SFT → 偏好 RM → RLHF,持续更新反馈数据。
  • 训练系统:跨 Pod 模型/数据并行,冗余状态恢复与确定性重放处理故障。

模型效果

  • Ultra:MMLU 90.0(CoT 多采样),MMMU 62.4,HumanEval 74.4。

重要结论

  • 联合多模态训练能同时支持文本推理与视觉任务;推理策略也影响最终得分。

核心贡献

  • 建立原生多模态模型家族,并给出从预训练、后训练到服务的统一路线。

未来方向

  • 优化多模态训练数据分布,提高事实性、复杂推理与跨模态理解。

问题背景 ​

统一多模态与不同部署需求
  • 文字、图像、音频和视频包含互补信息,需要在同一模型中联合理解。
  • 高性能服务与端侧部署的算力不同,需要形成 Ultra / Pro / Nano 模型分层。

核心方法 ​

多模态架构与模型分层 ​

原生多模态架构

联合输入

  • Decoder-only Transformer,从预训练开始联合学习文本、图像、音频与视频。
  • 视频按帧编码并与文字、音频交错输入;可变图像分辨率保留细粒度信息。
  • 音频直接使用 16kHz USM 特征,保留语气等转写文本容易丢失的信息。

模型分层

  • Ultra / Pro:分别面向复杂任务和服务效率。
  • Nano:从大 Gemini 蒸馏,1.8B / 3.25B,部署时使用 4-bit 量化。
Gemini 1.0 将文本、图像、音频和视频组织为交错输入序列,统一建模不同模态之间的关系。
原文图 2:Gemini 1.0 将文本、图像、音频和视频组织为交错输入序列,统一建模不同模态之间的关系。 来源

数据构建与对齐训练 ​

预训练数据与分阶段配比
  • 网页、书籍、代码与多模态语料混合;规则和模型筛选质量,并去除评测重叠数据。
  • 小模型消融决定数据权重,训练后期增加目标领域数据比例。
  • SentencePiece 使用全语料样本训练,改善非拉丁文字的切分效率。
SFT、Reward Model 与 RLHF
  • Prompt:覆盖真实单轮、多轮任务,来自人工、授权与合成数据。
  • SFT:人工示范与经修订的模型回答,学习指令、代码与多模态响应。
  • RM:对同一 Prompt 的候选答案收集偏好,覆盖安全、事实性和创造性。
  • RLHF:利用 RM 更新策略,再从新策略的不足收集数据,迭代 RM 与策略。
后训练的数据循环:收集人机交互反馈,分别形成 SFT、奖励模型和 RL 数据,再把模型反馈用于下一轮改进。
原文图 7:后训练的数据循环:收集人机交互反馈,分别形成 SFT、奖励模型和 RL 数据,再把模型反馈用于下一轮改进。 来源

跨集群训练与容错 ​

跨集群训练与容错
  • Pod 内模型并行、Pod 间数据并行,JAX / Pathways 统一调度。
  • 内存保留冗余模型状态,故障时从完整副本恢复;确定性重放定位异常计算。

实验设置(Gemini 1.0) ​

实验设置

模型与训练

  • 上下文 32K;TPUv4 / TPUv5e;Ultra 使用跨数据中心训练。
  • 预训练后分别形成 Apps 与 API 后训练版本。

评测协议

  • MMLU:CoT@32,按答案一致性阈值选择结果,低置信度时回退贪心回答。
  • HumanEval 为后训练模型;MMMU 评估学科图文推理。

关键结果(Gemini 1.0) ​

关键结果

推理与多模态

  • Ultra 的 MMLU:5-shot 83.7,加入多采样与不确定性选择后达 90.0。
  • MMMU 62.4,比此前最好结果高约 5pt,提升覆盖跨学科图文推理。

代码与系统

  • HumanEval 74.4、Natural2Code 74.9,后者使用未公开的独立代码题。
  • 训练有效运行时间比例由 85% → 97%,故障恢复是扩大训练规模的重要条件。

未来方向 ​

未来方向

原文讨论的方向

  • 优化多模态训练数据分布,提高事实性、复杂推理与跨模态理解。

(2305) PaLM 2 (计算最优、多语言、混合目标) ​

🌺 论文摘要

PaLM 2 摘要

参考链接

问题背景

  • 只扩参数量会增加服务成本,英语主导的数据也限制多语言能力。

核心方法

  • 计算最优:联合扩展数据与参数。
  • 混合数据与目标:多语言平行文本、代码、数学及多种预训练目标。

模型效果

  • 英语 QA/分类平均分:PaLM 70.4 → PaLM 2-L 76.9。
  • Code 训练后的 PaLM 2-S*:HumanEval 37.6,PaLM-Coder 540B 为 35.9。

重要结论

  • 更小模型也能通过数据和训练组合提高能力;最低 Loss 不一定对应每个任务的最佳配置。

核心贡献

  • 提供计算预算、数据多样性和混合目标共同优化的基模路线。

未来方向

  • 联合优化数据配比、训练目标与推理成本,进一步提升低资源语言和复杂推理。

问题背景 ​

参数规模与训练资源的分配
  • 只扩大参数增加服务成本,固定算力下还可能导致训练数据不足。
  • 英语主导的语料限制多语言能力,数据配比与训练目标需要共同优化。

核心方法 ​

计算最优规模选择 ​

Compute-optimal Scaling
  • 固定 FLOPs,联合选择参数量与训练 token 数,避免模型过大而训练不足。
  • 扫描多个计算预算和模型规模,用验证 Loss 拟合最优组合,再检查下游任务。
  • 参数与数据应近似同比例扩大;部署延迟也影响最终规模选择。

多语言数据与混合目标 ​

多语言数据与混合训练目标

数据构建

  • 扩大非英语、数学和代码比例,加入数百种语言的英外平行文本。
  • 去重、质量过滤与敏感信息清理,减少重复记忆,提高语料利用率。

训练目标

  • 参考 UL2 采用多种预训练目标的混合,学习不同形式的语言理解与生成。
  • 少量数据加入 Toxicity 控制 token,推理时通过条件控制减少有害输出。
  • Code 分支在通用模型上继续训练代码,提高生成、修复和数据分析能力。

实验设置(PaLM 2) ​

实验设置

模型与训练

  • S / M / L 三档;正式模型参数与总 token 数未公开。
  • Scaling 实验单独扫描 FLOPs、参数和 token 数;代码实验包含追加代码训练的 S*。

评测协议

  • QA/分类 1-shot;L 取最后 5 个 Checkpoint 的平均表现。
  • HumanEval / MBPP 的 pass@1 使用贪心生成;ARCADE 使用 New Tasks 子集。

关键结果(PaLM 2) ​

关键结果

通用与代码

  • 英语 QA/分类:70.4 → 76.9,更小的 S 也接近 PaLM 540B。
  • PaLM 2-S* 相对 PaLM-Coder 540B:HumanEval 35.9 → 37.6,ARCADE 7.9 → 16.2。
  • 收益不仅来自参数量,代码数据与任务训练可明显改善较小模型。

Scaling 与多语言

  • 相同 FLOPs 下,最低 Loss 的规模并非所有下游任务最优,需要结合实际目标选择。
  • 增加多语言比例后,英语任务仍提升;两者可以通过更高质量的数据共同改善。
固定计算预算的 IsoFLOP 曲线。每条曲线的最低点对应较合适的参数量,展示模型规模与训练数据之间的取舍。
原文图 4:固定计算预算的 IsoFLOP 曲线。每条曲线的最低点对应较合适的参数量,展示模型规模与训练数据之间的取舍。 来源

未来方向 ​

未来方向

笔记讨论

  • 联合优化数据配比、训练目标与推理成本,进一步提升低资源语言和复杂推理。

(2204) PaLM (540B Dense、Pathways) ​

🌺 论文摘要

PaLM 540B 摘要

参考链接

问题背景

  • 扩大 Dense 模型需要同时解决跨集群效率,并验证规模对复杂推理的作用。

核心方法

  • 540B Dense:SwiGLU、并行 Attention/FFN、MQA。
  • Pathways:跨 TPU Pod 同步训练,使用约 780B tokens。
  • CoT Prompting:在少样本示例中加入推理过程,再生成答案。

模型效果

  • PaLM 540B 的 GSM8K:8-shot CoT 58.1;常用英语任务中 28/29 达当时最佳。

重要结论

  • 模型规模与 CoT 共同增强推理;部分任务的提升并非线性。

核心贡献

  • 验证超大 Dense 模型的跨 Pod 训练,并系统分析规模、代码与少样本推理。

未来方向

  • 提高数据与计算效率,扩大多语言覆盖;研究模型规模与推理能力之间的关系。

问题背景 ​

大模型扩展与跨集群效率
  • 超大 Dense 模型需要跨 TPU Pod 训练,计算、通信和显存开销必须共同控制。
  • 模型扩大后,还需用多规模对照检验代码、语言与复杂推理收益。

核心方法 ​

Dense 架构优化 ​

Dense Transformer 架构

计算与显存

  • 并行 Attention / FFN:同一归一化输入进入两个分支,合并矩阵计算。
  • MQA:多个 Query Head 共享 K/V,减少自回归生成时的 Cache 读取。

训练稳定性

  • 使用 SwiGLU、RoPE、输入输出 Embedding 共享,并移除 Dense / LayerNorm Bias。
  • 256K SentencePiece 词表保留空白,数字逐位切分,兼顾代码与多语言。

数据混合与 Pathways 训练 ​

数据混合与 Pathways 训练

训练数据

  • 网页按质量分加权采样;混合社交对话、书籍、代码、Wikipedia 与新闻。
  • GitHub 数据按语言和许可证筛选,并按文件相似度去重。
  • 按来源设混合比例,整体训练约一轮,避免反复使用某个子集。

分布式训练

  • 两组 TPUv4 Pod 使用模型并行与数据并行,不使用 Pipeline Parallel。
  • Pathways 统一协调跨 Pod 训练,JAX / T5X 实现训练与评测。
Pathways 跨两个 TPU v4 Pod 组织训练:Pod 间采用数据并行,Pod 内安排模型计算与通信。Pathways 跨两个 TPU v4 Pod 组织训练:Pod 间采用数据并行,Pod 内安排模型计算与通信。
原文图 2:Pathways 跨两个 TPU v4 Pod 组织训练:Pod 间采用数据并行,Pod 内安排模型计算与通信。 来源

实验设置(PaLM 540B) ​

实验设置

模型与数据

  • 对照 8B / 62B / 540B,使用相同词表和数据。
  • 数据:社交对话 50%、网页 27%、书籍 13%、代码 5%、Wikipedia 4%、新闻 1%。

硬件与评测

  • 540B:6144 TPUv4,两个 Pod;约 780B tokens。
  • 推理任务使用 8-shot CoT;主结果为预训练模型,PaLM-Coder 另做代码训练。

关键结果(PaLM 540B) ​

关键结果

推理与扩展

  • GSM8K 达 58.1,少样本 CoT 可直接激发预训练模型的多步推理能力。
  • 约四分之一 BIG-bench 任务在 62B → 540B 阶段出现更明显跃升。

训练效率

  • 并行 Attention/FFN 在大模型下提速约 15%,62B 消融未见质量下降。
  • 540B 的 MFU 为 46.2%,说明跨 Pod 的模型与数据并行可以保持较高利用率。
六个 BIG-bench 任务的规模曲线:分别呈现近似平滑、突增和趋平的变化,说明不同任务的规模收益并不相同。
原文图 5:六个 BIG-bench 任务的规模曲线:分别呈现近似平滑、突增和趋平的变化,说明不同任务的规模收益并不相同。 来源

未来方向 ​

未来方向

原文讨论的方向

  • 提高数据与计算效率,扩大多语言覆盖;研究模型规模与推理能力之间的关系。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026