变化点
2026.09 · MiniCPM5-2B
- 训练
16 个领域教师,通过 OPD 将推理与 Agent 能力迁移至 2B。 - 开放 Base、MidTrain、SFT 和最终权重,支持分阶段研究与继续训练。
2026.02 发布 / 04 报告 · MiniCPM-o4.5(全模态分支)
- Omni-Flow 统一多模态流,支持全双工实时交互。
- TAIL 按语音播放进度调节文本生成,保持实时同步。
2025.09 · MiniCPM-V4.5
- 通过 3D 视频压缩减少视觉 token,保留跨帧信息。
- 结合长短推理联合 RL 与视觉偏好训练。
2025.09 · MiniCPM4.1
- 在 InfLLM-V2 上引入 Dense / Sparse 切换,兼顾精度和长文本效率。
- 加强可控推理与长上下文任务能力。
2025.06 · MiniCPM4
- UltraClean 改进数据质量,InfLLM v2 降低长上下文计算。
- 结合分块 rollout 与端侧推理优化,提高训练和部署效率。
2024.09 · MiniCPM3-4B
- 强化工具调用与代码解释器,支持
32K上下文。
2024.08 报告 · MiniCPM-V(视觉分支)
- 压缩视觉 token,提高小模型的高分辨率理解效率。
- 通过 RLAIF-V 降低视觉幻觉。
2024.04 报告 · MiniCPM
- 提出 WSD 学习率与训练风洞,降低模型和训练配方的试验成本。
- 在后期衰减阶段调整高质量数据配比,提高小模型效果。
(2609) MiniCPM5-2B (16教师OPD, 阶段权重)
参考链接
模型与阶段
- Dense 模型,非 Embedding 约
1.98B、总计约2.52B,128K上下文。 - Base → MidTrain → 深度思考 SFT → 领域 RL → OPD,目标是在小参数内整合推理和 Agent 能力。
- 开放 Base、MidTrain、SFT 和最终权重,便于分析各阶段作用。
数据构建
- 使用 Ultra-FineWeb、UltraX、UltraData-Code/Math;代码按 L0–L3 分级管理。
- 深度思考 SFT 约
400B tokens;配套约500KAgent SFT、80K+RL 数据。
RL 与蒸馏
- 分别训练数学、代码、写作和 Agent 教师,共
16个领域专家,其中5个 Agent 专家。 - 学生沿自身轨迹生成,教师在相同前缀提供全词表分布,以 reverse KL 构造优势。
- 直接复用教师 RL prompts,无需另建静态教师回答集;最终模型仍为 Dense。
- AIME 2025
86.5、LiveCodeBench v669.1,小模型获得较强推理和代码能力。 - 官方阶段比较中,RL + OPD 使推理/通用项目平均提高约
11分,Agent 项目约7分。 - SWE-V
46.4,SWE-Pro14.4,Terminal-Bench v2.18.6;复杂仓库与系统操作仍较弱。
(2604) MiniCPM-o4.5 (Omni-Flow, TAIL, 全双工)
🌺 论文摘要
参考链接
问题背景
- 传统多模态交互把感知与回答分开,模型说话期间难以及时利用新声音、新画面。
- 文本生成快于语音播放,还会导致正在播放的内容落后于当前环境。
核心方法
- 9B全模态架构:Qwen3-8B 负责理解与文本,轻量 speech decoder 负责高频语音 token。
- Omni-Flow:按时间窗口交错视觉、音频与输出,使用独立 Listen/Speak 控制。
- TAIL:根据累计播放进度动态调整文本生成量,保持说话内容与环境同步。
- 训练:语音模块预训练 → 联合预训练 → 两阶段 SFT → GRPO/RLAIF-V。
模型效果(MiniCPM-o4.5)
- OpenCompass:Instruct
77.6、Thinking78.2;LiveSports-3K-CC54.4。 - RTX4090、INT4、llama.cpp-omni 下,RTF
0.21,显存约11GB。
重要结论
- 时间窗口并非越短越好;明确区分交互控制和内容生成,有助于稳定学习全双工行为。
- 实时语音需要控制文本领先量,仅提高生成速度不能解决内容过时。
核心贡献
- 用统一时间序列实现持续感知、同步输出与主动交互,并配套端侧流式推理。
未来方向
- 提高长时间动态交互的稳定性、流式发音质量和主动规划能力。
问题背景
感知中断
- Turn-based 系统在生成长回答时,无法持续把新观察纳入当前输出。
- 全双工要求模型同时感知和说话,并自主决定何时回应、何时继续听。
播放延迟
- 已生成文本可能排队等待播放,后续即使看到环境变化,也只能继续播旧内容。
- 模型需要同步生成与播放进度,避免文本流持续领先于声音。
核心方法
全模态架构与流式交互
视觉与音频输入
- SigLIP ViT 编码图像切片,resampler 将每片
1024 tokens压缩到64。 - Whisper Medium 流式编码音频,经 projector 从每秒
50 tokens压缩为10 tokens。
语言骨干
- 基于 Qwen3-8B,负责跨模态理解与文本输出;主模型只需跟随人类语速生成文本。
- 全双工模式采用较低图像分辨率,减少每轮视觉输入的处理成本。
语音输出
- 约
0.3Bspeech token decoder 接收文本及其 LLM hidden states,生成 S3 语音 tokens。 - 流式 flow-matching decoder 转换为波形,并利用参考音频保持音色。
- 主干与语音模块通过 hidden states 连通,可以联合反向传播。
时间序列
- 将环境视觉、环境音频与输出划入同一时间窗口,按
[视觉;音频;输出]连续拼接。 - 每个窗口先接收最新观察,再生成该窗口的回应;不回应时输出
[listen]。
控制与内容分离
- Listen/Speak 先判断是否说话,再决定说什么,减少两类决策混在同一步的学习难度。
- 明确标注时间块边界,帮助区分新输入和新输出。
- 最终采用约
1秒窗口,在响应速度与单块信息量之间取舍。
动态生成量
- 根据历史累计播放位置决定本块生成多少文本,使声音尽量跟上当前时间边界。
- 如果前一块播放稍慢,后一块少生成一些文本,让声音追上环境变化。
训练监督
- 按文本 token 的实际起止时间,将文本及对应语音 tokens 分配到时间块。
- 每块文本长度可变化,模型学习依赖历史播放进度的交错方式。
有限 Look-ahead
- 发音需要局部后文时,将少量末尾文本的语音延迟到下一块。
- 只保留有限前瞻,兼顾连贯发音和实时同步。
多模态数据与训练
语音与视觉
- 自然语音数据构造 ASR、TTS 和多说话人对话;高质量对话由专业配音补充情绪与语速变化。
- 图文数据包含 caption、OCR、文档、多图与密集视频描述,加入文字任务保留语言能力。
- 文档遮盖优先选择与图表相关的区域,迫使模型利用视觉证据。
全双工数据
- 每条样本保留视觉、声音、输出文本和输出语音的时间标记。
- 过滤弱音画关联、单人连续口播和字幕捷径,减少仅靠声音或字幕完成任务的情况。
- 人工构造持续场景描述、主动提醒等精细交互样本。
语音模块对齐
- 从 MiniCPM-V4.5 的预训练 checkpoint 和 Whisper 初始化,冻结原模块,只训练新增语音接口。
- 对齐音频输入与 LLM hidden space,并让 speech decoder 学习从语言特征生成语音。
联合 PreTrain 与 SFT
- 解冻全部参数,按固定模态配比联合预训练;不同 data-parallel ranks 分配不同模态组合。
- SFT 先进行大规模指令适配,再用高质量人标数据修正交互行为。
- 随机分辨率与帧率,学习不同输入成本下的交互方式。
GRPO 与事实反馈
- GRPO 使用正确性、格式和通用质量奖励,提高推理与指令能力。
- 在相同 prompt 的候选间比较长度;错误回答只接受非正长度奖励,避免奖励短错误答案。
- 长度差很小时衰减该项影响;前
480步不加长度奖励,让正确性先稳定。 - 最后使用 RLAIF-V 降低视觉幻觉,图文事实监督也能改善流式交互。
实验设置(o4.5多模态训练与流式交互)
训练对象
- 约
9B总参数;Qwen3-8B、SigLIP、Whisper 和轻量语音输出模块联合构成。 - SFT 全模态数据随机使用
0.2–0.4MP分辨率与1–5FPS输入。
设计消融
- 比较
1秒/0.2秒/0.1秒窗口、显式/隐式边界、Listen-Speak/Listen-Text 控制。 - 比较无长度奖励、K1.5 风格奖励和平滑长度奖励;另比较三种语音交错策略。
质量与效率评测
- 图文区分 Instruct/Thinking;语音测试识别、生成与风格控制;文本对照 Qwen3-8B。
- 流式使用纯视觉 LiveSports-3K-CC;全模态理解另用音视频 benchmark。
- 部署测试 RTX4090/DGX Spark,区分 PyTorch 与 llama.cpp-omni、FP16/BF16 与 INT4。
关键结果(MiniCPM-o4.5,Omni-Flow + 联合训练)
实时交互
- LiveSports-3K-CC
54.4,高于 LiveCC41.5和 StreamingVLM45.6。 1秒窗口优于更细窗口;过短片段提供的上下文不足,会损害连贯回答与控制决策。
语言与多模态
- OpenCompass 为
77.6/78.2,Daily-Omni80.2,多模态理解保持较强水平。 - 文本综合平均从 Qwen3-8B 的
81.6到82.1,但 MMLU、Math500 等单项仍有下降。
长度奖励
- Thinking 平均分
73.5 → 74.3,输出长度减少35.3%。 - 更激进的长度奖励缩短更多,但平均分下降,说明压缩推理需要兼顾有效中间步骤。
语音与部署
- TAIL 的英文 WER
3.93,高于固定交错的2.38,时间同步带来一定语音质量取舍。 - RTX4090/INT4 的 llama.cpp-omni:RTF
0.21、约11GB显存,满足该配置下的实时处理。
未来方向
持续交互
- 提高长时间、动态现实场景下的理解与稳定性,减少状态变化后的错误延续。
语音质量
- 减少流式模式的误发音和中英文混杂,改善不同网络与部署条件下的连续输出。
主动行为
- 从简单提醒发展到更丰富的上下文规划与自主辅助。
(2509) MiniCPM-V4.5 (3D视频压缩, 长短推理联合RL)
🌺 论文摘要
参考链接
问题背景
- 高分辨率图像、长视频占用大量视觉 token;小模型还需要补充知识与复杂推理能力。
- 所有问题都生成长 CoT 会增加训练和推理成本,简单感知任务也需要保留直接回答能力。
核心方法
- 3D-Resampler:联合压缩空间与时间,
6帧448×448图像 → 64个视觉token。 - 文档学习:根据遮挡强度,在同一任务中训练 OCR、上下文恢复与跨模态知识学习。
- 训练:分阶段预训练 → 通用 SFT → Long-CoT/视频 SFT → 混合 GRPO → RLAIF-V。
- 混合 RL:同一模型同时学习长、短推理;RLAIF-V 再通过事实偏好 DPO 减少幻觉。
模型效果(MiniCPM-V4.5,8B级多模态模型)
- OpenCompass
77.0,MathVista79.9;Video-MME 无字幕67.9、有字幕73.5。
重要结论
- 长短推理联合训练达到长推理训练的效果,消耗约
70.5%的训练生成 token。 - 视觉压缩、文档知识与推理训练分别作用于计算效率、知识覆盖和问题求解。
核心贡献
- 提供兼顾图像、长视频与可控推理的高效 MLLM 训练方案。
未来方向
- 笔记整理:细粒度时序信息保留、按问题分配推理预算、开放问题的奖励质量。
问题背景
视觉序列过长
- 高分辨率图像需要多个切片,视频还要重复编码相邻帧,LLM 的上下文和计算成本迅速增长。
- 相邻帧存在大量冗余,单独压缩每一帧没有利用时间上的重复信息。
知识与推理不足
- 图文对难以充分覆盖教材、论文中的专业知识,复杂 PDF 解析还会引入错误。
- 长 CoT 适合复杂问题,但简单识别、OCR 等任务更适合短回答。
核心方法
视觉与视频压缩
自适应切片
- 延续 LLaVA-UHD 的图像切分方式,根据长宽比分配切片,保留小字与局部细节。
- 视觉编码器处理各切片,Resampler 将每个
448×448图像压缩到64个token。
可学习查询
- 使用可学习 query 对图像特征做 cross-attention,加入二维位置编码保留空间关系。
- 输出定长视觉 token,控制输入 LLM 的序列长度。
相邻帧联合编码
- 将连续帧组成一组,使用二维空间位置和时间位置共同标记视觉特征。
- query 跨多个帧提取信息,同一组帧共享压缩预算,避免逐帧重复传入背景。
6帧448×448 → 64个token;例如6秒、2fps的视频,12帧压缩为128个token。
图像与视频统一
- 共享编码与压缩参数,在第二阶段 SFT 中由 2D-Resampler 扩展到 3D-Resampler。
- 训练随机改变帧分组与采样率,覆盖不同时间粒度;支持最多
1080帧、最高10fps输入。

预训练与文档学习
模块对齐
- 阶段1:冻结视觉编码器和 LLM,只训练 Resampler,建立视觉特征与语言输入的对应关系。
- 阶段2:解冻视觉编码器,加入 OCR 和图文数据;继续冻结 LLM,减少低质量语言数据的影响。
- 阶段3:全参数训练高质量文本、交错图文和视频,WSD 衰减阶段提高知识与指令数据占比。
数据质量
- 图文对经过 CLIP 过滤、CapsFusion 重描述,补充长尾概念与知识信息。
- 交错图文清理损坏图片、低相关内容,并按知识密度筛选。
- OCR 数据结合自然背景上的文字渲染与 HTML 渲染,覆盖不同文字和布局。
训练样本
- 从教材、论文页面选取文本区域,以原始文本作为监督目标。
- 对页面施加不同程度的视觉扰动,模型结合图像、上下文与版面恢复目标文字。
遮挡强度对应不同能力
- 轻度扰动:主要依靠局部字形,训练 OCR 识别。
- 中度扰动:结合不完整字形和邻近文本,训练上下文恢复。
- 强遮挡:目标区域不可见,需要利用其他段落、图表和布局关系推断内容。
- 这种设计将文字识别和文档知识学习放入同一任务,减少对复杂 PDF 解析流水线的依赖。
SFT 与多模态 RL
两阶段 SFT
- 通用 SFT 混入约
10%纯文本数据,保留语言模型能力。 - Long-CoT 阶段加入高帧率长视频,并完成 3D-Resampler 的训练。
高质量推理数据
- STEM 和长尾知识问题先检查视觉依赖,排除不看图也能回答的样本。
- 从模型难以解决的问题中生成 CoT,通过答案正确性、事实检查与重复检测筛选。
- 对轨迹进行改写以增加表达多样性,避免只模仿单一推理形式。
模式控制
- 同一模型通过 prompt 选择长推理或短推理,训练时随机分配模式。
- 两种模式共享参数,兼顾复杂推理与快速感知;使用 GRPO 更新,不加 KL 和熵正则。
奖励组成
- 正确性奖励:简单答案用规则验证,复杂自然语言答案使用基于参考答案概率的 RLPR。
- 格式与重复项:约束输出结构,抑制重复生成。
- 偏好奖励:RM 只评价最终回答,避免把不熟悉的 CoT 文风当作质量差异。
- RM 分数在同一 prompt 的候选组内标准化,权重为
0.5。 - 总奖励:
正确性 + 格式 + 重复项 + 0.5 × 标准化RM分数。
偏好数据
- 对同一图像或视频问题采样多个回答,将回答拆成可验证的原子事实。
- 逐条检查事实并累计错误数,用错误较少的回答构造偏好对。
DPO 更新
- 在混合 GRPO 之后执行 DPO,进一步减少描述和问答中的视觉幻觉。
- 该阶段优化事实可靠性,与前面的正确性、格式和推理训练互补。
实验设置
模型与训练
- MiniCPM-V4.5,
8B级多模态模型,完整进行预训练、SFT、GRPO 和 RLAIF-V。 - 预训练 WSD:稳定阶段
lr=5e-5,衰减到1e-5。 - 通用 SFT:
1e-5 → 1e-6;Long-CoT/3D 阶段:5e-6 → 1e-6。
RL 超参
- GRPO:
128个prompt × 8个回答,max_response=8192,temperature=1,lr=1e-6。 - 每批约
50%的 prompt 使用长推理模式,关闭 KL 与熵正则。 - RLAIF-V:
bs=256,lr=1e-6,DPO β=0.1,训练400步。
评测与消融
- OpenCompass 汇总8项多模态基准,部分推理任务采用长推理,其他任务采用短推理。
- 长推理结果平均3次运行;效率对比使用
8张A100。 - 文档学习消融固定后续 SFT,比较高质量训练样本中是否加入文档知识数据。
- 长短推理消融对比短模式、长模式和联合训练,记录准确率及生成 token 总量。
关键结果(MiniCPM-V4.5,混合GRPO + RLAIF-V)
图像与视频
- OpenCompass
77.0,高于 Qwen2.5-VL-72B 的76.1和 GPT-4o 的75.4。 - MathVista
79.9、OCRBench89.0,覆盖数学推理与细粒度文字识别。 - Video-MME 无字幕
67.9、有字幕73.5,长视频仍能保留有效信息。 - MMHal 幻觉率
19.4,低于 Qwen2.5-VL-7B 的31.6。
长短推理消融
- 仅短推理:OpenCompass
76.0,训练生成1.6B tokens。 - 仅长推理:
77.0,生成4.4B tokens;混合训练:77.1,生成3.1B tokens。 - 联合训练以约
70.5%的 token 达到长推理方案的效果,收益在于推理质量与成本的平衡。
文档知识数据
- 加入文档学习后,MMMU
49.0 → 51.4、AI2D74.9 → 76.5。 - OCRBench 原始分
576 → 617,说明文档训练同时改善文字识别与知识理解。
视频计算效率
- 相同效率评测中,Video-MME 用时约
0.26小时,显存约28GB。 - Qwen2.5-VL-7B 为
3小时、60GB;MiniCPM-V4.5 的有字幕分数同时由对照的71.6提高到73.5。 - 3D 压缩减少输入 LLM 的视觉序列,收益贯穿显存、评测时间与可处理视频长度。
未来方向
压缩与信息保留
- 对短暂动作、密集小字和精确时间定位,研究按内容自适应分配视觉 token。
推理与奖励
- 将长短模式从人工指定扩展为按问题难度分配预算,兼顾准确率与延迟。
- 提升开放式视觉问题的事实验证,减少错误偏好数据对 RLAIF-V 的影响。
(2509) MiniCPM4.1 (InfLLM-V2, Dense-Sparse切换)
🌺 论文与资料摘要
参考链接
问题背景
- 长上下文和长 CoT 增加注意力成本,直接替换稀疏架构又可能破坏已有 Dense 模型能力。
核心方法
- InfLLM-V2:复用 Dense 的 Q/K/V 参数,只改变访问哪些历史 token。
- 块选择:细粒度池化 → GQA 组内分数合并 → Top-k,保留初始与局部窗口。
- 训练:短序列预训练后,用约
5B长文本tokens适配稀疏注意力。 - 部署:长短推理可控;Dense/Sparse 按序列长度切换,配合推测解码。
模型效果(8B架构对照与发布模型)
- InfLLM-V2 稀疏版 RULER
82.62,FullAttn84.26;长推理平均42.66 vs 42.79。 - MiniCPM4.1 模型卡报告,RTX4090 配合稀疏注意力与推测解码,推理生成加速约
3倍。
重要结论
- 共享参数、单一注意力输出,使短序列 Dense 预训练与长序列稀疏适配保持一致。
核心贡献
- 开放可在 Dense/Sparse 之间切换的模型、训练与推理 kernel。
未来方向
- 进一步融合块选择 kernel,并结合 FFN 加速降低端到端生成成本。
问题背景
架构切换影响训练
- 常规训练先使用短文本,再扩展长上下文,稀疏模块需要兼容已有参数。
- 多组 KV、多个注意力输出和额外门控,会改变原模型计算结构,增加适配难度。
短文本与长文本需求不同
- 短文本中,块选择的额外计算可能抵消稀疏收益。
- 长文本需要减少历史访问,但块选择本身也必须足够高效。
核心方法
稀疏注意力与块检索
同一套参数
- Dense 与 Sparse 共用 Q/K/V 投影;稀疏适配不引入额外参数。
- 每个 query 固定访问开头块和局部窗口,再加入相关性最高的远程块。
- 对这些位置的并集执行一次注意力,保留原有单一输出结构。
压缩仅用于选块
- 压缩后的 key 用于计算块相关性,不额外产生一条注意力输出。
- 短序列直接恢复 Dense 计算,省去没有必要的块检索。

细粒度表示
- 先对重叠的小窗口做 mean pooling,避免整个大块平均后丢失局部重要信息。
- query 与这些小窗口计算相关性,同一 GQA 组内的 query heads 汇总分数。
- 对覆盖一个大块的小窗口分数做 max pooling,以最显著的局部证据代表该块。
共享选择结果
- 同一 GQA 组共享所选 KV blocks,减少重复读写。
- 最终访问集合为
初始块 + 局部块 + 远程Top-k块,注意力仍读取所选块的原始 KV。
组内融合
- 完整的 query-head × 历史块分数矩阵过大,写入 HBM 会抵消稀疏计算收益。
- 在 SRAM 中完成 GQA 组内求和,只把合并后的分数写回 HBM。
LSE 近似
- Softmax 归一化和组内求和顺序不同,需要先取得归一化量,再计算合并分数。
- 第一遍用更粗粒度的 key 估计 LSE,第二遍计算细粒度分数,降低两遍计算的开销。
长上下文适配
长上下文适配
- 先用 Dense attention 训练短序列基模,再切换为 Sparse attention 做长文本训练。
- 混合不同长度区间,避免适配过程中只优化最长文本。
- 长推理架构实验继续使用 OpenMathReasoning、OpenCodeReasoning 微调。
发布模型模式
- MiniCPM4.1 支持思考与直接回答;该开关控制回答方式。
- Dense/Sparse 开关控制注意力计算,和思考开关属于不同维度。
- 原生上下文
64K,LongRoPE 扩展验证到128K;可结合 EAGLE3 等推测解码。
实验设置
基础模型与预训练
8BGQA 模型,hidden=4096,32个Q heads、2个KV heads,head_dim=128。8T tokens、序列4K,主要使用 FineWeb-Edu 与 Stack-v2;WSD,8M tokens/batch。
长文本训练
5B tokens;四组长度0–4K / 4–12K / 12–24K / 24–32K,token 数量等比例。lr=3e-4 → 2.75e-4,块大小64,每个 query 访问96块、约6K tokens。- 访问集合为
1个初始块 + 32个局部块 + 63个远程块。
对照与评测
- 同一基模与训练配置比较 FullAttn、InfLLM-V2、NSA,稀疏方法保持相同稀疏度。
- RULER 测试
32K;另测 LongBench、LongPPL、数学、代码及短文本任务。 - Kernel 效率使用 A100/RTX4090、
bs=1;端到端使用W4A16与96块配置。
生成与注意力
- 模型卡推荐
temperature=0.9、top_p=0.95,最大输出预算65536。 - 稀疏推理配置包含
2048-token局部窗口,短于8192时使用 Dense。 - 稀疏加速使用对应 kernel 与 CPM.cu;框架支持情况按发布版本配置。
关键结果(8B InfLLM-V2适配实验与MiniCPM4.1)
长文本适配
- RULER:稀疏版
82.62,FullAttn84.26,保留约98.1%的得分。 - LongBench:
42.54 vs 42.30;LongPPL:2.12 vs 2.06,长依赖建模接近全注意力。 - 仅对短文本模型直接做 YaRN 外推时,RULER 为
40.63,说明长文本适配训练很关键。
长推理与切换
- 数学与代码5项平均:稀疏版
42.66,FullAttn42.79,保留约99.7%的效果。 - 同一稀疏训练模型切回 Dense 后可继续处理短文本,避免为不同长度维护两套权重。
- 这些是注意力架构的控制实验,MiniCPM4.1 发布模型进一步提供混合推理能力。
端到端收益
- 报告中的 W4A16、96块配置,Prefill 加速
2.13倍,Decode 加速2.32倍。 - 模型卡的 MiniCPM4.1 配合推测解码,在 RTX4090 上报告约
3倍推理生成加速。 - 只减少注意力计算仍会受到 FFN、块选择和访存限制,联合优化比单独追求稀疏率更重要。
未来方向
报告提出
- 继续把 max pooling 和 Top-k 融入块选择 kernel,减少中间结果读写。
- 配合 FFN 加速,降低注意力之外的计算成本。
笔记整理
- 根据输入长度与任务性质选择 Dense/Sparse 和推理预算,减少短任务的不必要开销。
(2506) MiniCPM4 (UltraClean, InfLLM v2, 分块Rollout)
🌺 论文摘要
参考链接
问题背景
- 端侧模型受计算、显存与功耗限制,需要同时提高数据效率、训练效率和生成速度。
核心方法
- 稀疏注意力:InfLLM v2 逐 query 检索 KV blocks,减少长文本 Prefill 与 Decode 开销。
- 数据与训练配方:UltraClean 用退火实验迭代语料分类器;ModelTunnel v2 结合 μP/ScalingBench 搜索训练策略。
- 后训练:UltraChat v2 → Long-CoT SFT → 数学/代码 RL,分块 rollout 平衡负载,再扩展应用任务。
- 端侧推理:BitCPM4 三值 QAT;CPM.cu 集成稀疏注意力、FR-Spec 与 P-GPTQ。
模型效果(MiniCPM4-8B与分块RL对照)
- MiniCPM4-8B:8项平均
81.13,Qwen3-8B 为80.55;预训练约8T tokens。 - 1.5B 分块 RL 对照:AIME2025
25.21 → 26.67,单步耗时降至完整 rollout 的约59%。
重要结论
- 数据过滤应以实际训练收益校准;分块 rollout 提高利用率,但需要处理跨版本策略偏移。
- 量化、稀疏和推测解码需联合配置,单项加速收益不能直接相乘。
核心贡献
- 开放模型与端侧推理代码,提供覆盖数据、架构、RL 与部署的完整效率优化方案。
未来方向
- 更长上下文、更高质量推理数据、更广泛环境中的 RL,以及多平台端侧部署。
问题背景
模型能力与训练成本
- 小模型仍需覆盖知识、推理和工具能力,低质量语料会浪费有限训练预算。
- 大模型上逐项搜索超参成本高,需要能迁移的小模型实验方法。
长序列与部署效率
- 长文本增加注意力和 KV 读取成本,长 CoT 又造成 RL rollout 的负载不均。
- 端侧部署还受内存容量和硬件差异限制,需要同时优化模型与推理系统。
核心方法
稀疏注意力
上下文筛选
- KV cache 划分为连续块,每个 query token 独立选择相关块。
- 对重叠的细粒度窗口做 mean pooling,得到 Semantic Kernel,保留块内局部语义。
- query 与各 Kernel 计算相关性,以块内最高相关分数选取 Top-k blocks。
- 初始位置与局部窗口固定保留,再对所选块中的原始 KV 执行注意力。
训练兼容性
- 池化不引入额外参数,其输入 key 随主模型训练更新。
- 短文本可退化为 Dense attention,避免额外的稀疏模块输出。
- query 按 token 选择,单 token Decode 也能使用同样的计算结构。
访存优化
- 同一 GQA 组内共享 Top-k blocks,减少重复 KV 读取。
- 块选择需要归一化并聚合 query heads 分数,本身也会产生计算与访存成本。
粗粒度归一化
- 用更粗的 Semantic Kernel 近似 LogSumExp,再计算细粒度相关性。
- 将计算预算集中于最终的块排序,降低块检索对加速收益的抵消。
数据与训练配方
低成本验证
- 从接近训练完成的
1B模型出发,在退火阶段混入候选数据,观察下游任务变化。 - 固定基础混合语料,对候选数据单独做对照,避免每次从零预训练。
分类器迭代
- 将能带来训练收益的语料作为正样本,从多种原始语料中采样负样本。
- 训练 fastText 质量分类器,并再次验证筛选结果对模型训练的作用。
- 持续调整种子数据与分类器,稳定后用于全量中英文网页筛选,形成 UltraFineWeb。

结构化生成
- 从高质量网页、教材、数学与代码材料选种子,用小于
10B的模型清理和重组文本。 - 教材式数据按知识点、解释、总结、练习展开,补充系统知识。
- 论坛式数据生成多轮问答与观点讨论,增加推理路径和表达多样性。
迭代扩展
- 将生成内容加入种子池继续演化,同时维持领域覆盖,避免合成数据集中于少数模式。
能力指标
- 极小模型在任务准确率上常接近随机,普通语料的 LM loss 又未必对应目标能力。
- ScalingBench 为下游验证题补充推理步骤,计算给定问题时生成推理与答案的条件 loss。
- 通过不同规模模型建立 loss 与任务表现的映射,用于评价训练配置。
μP 超参迁移
- 在百万参数级模型上搜索学习率、batch size 与初始化,再迁移到目标模型。
- 结合实际 WSD 和数据配比验证配置,减少在大模型上反复试验的成本。
Multi-Token Prediction
- 主模型预测下一 token,额外单层 Transformer 结合 hidden state 与下一 token embedding,继续预测后续 token。
- 共享 embedding 与输出头,训练目标为
NTP loss + λ × MTP loss。
混合精度
- 线性层前向和输入梯度使用 FP8,参数梯度使用 BF16,累加使用 FP32。
- 权重与激活采用分块量化,降低训练开销并控制精度损失。
SFT、RL 与应用训练
知识与推理
- 从学科知识框架生成 QA,对问题表达和答案形式分别做演化。
- 数学按主题、教育阶段与难度分层,同题生成多种解法,减少简单题比例。
- 代码从真实函数、类和算法片段出题,配套单测与输入输出,并扩展到诊断、改写和跨语言转换。
指令遵循
- 从简单指令逐步叠加内容、格式和风格约束,通过规则验证答案。
- 同时从高质量现有文本反向生成指令,丰富任务类型。
长上下文
- 根据原始文档生成提取、总结和推理问题,再检索相关干扰文档。
- 将目标文档随机插入长输入,训练模型定位有效信息;覆盖
8K–64K长度。
工具交互
- Function calling 检查函数是否存在、参数名与类型是否符合 schema,并加入调用前推理。
- Code Interpreter 让模型在 sandbox 内生成并执行代码,保留执行反馈和修正过程。
10次尝试仍未解决的自建样本被丢弃,形成可完成的交互示范。
初始化与奖励
- 先通过蒸馏的 Long-CoT 数据 SFT,建立基本推理能力,再进行 RL。
- 数学使用规则匹配与 SymPy 验证;代码在 Firejail sandbox 执行,按测试通过比例奖励。
数据与组采样
- 对 SFT/RL 数据去重,用小推理模型每题采样4次,排除全部答对的简单题。
- 提高优质代码样本采样比例,缓解数学与代码数据量不均。
- RL 动态过滤全对、全错的 prompt 组,保留有相对优势差异的训练数据。
策略目标
- 提高上侧 clipping 阈值维持探索,使用 token-level loss。
- 达到最大长度而被截断的回答不参与策略 loss,避免把未完成推理直接当作错误。
长轨迹阻塞
- 一批任务中少数回答特别长,其他样本结束后 GPU 仍需等待,降低采样利用率。
- 每轮只生成固定长度 chunk,未完成回答缓存前缀,与下一批新任务一起继续生成。
- 同一 prompt 的候选回答完成后再计算组奖励,分块不改变完整回答的评价对象。
跨版本概率
- 两个 chunk 之间可能更新模型,因此同一回答由多个策略版本生成。
- 保存每个 chunk 对应策略的 log probability,训练时与当前策略概率比较。
- token 比率使用
当前策略概率 / 生成该chunk的策略概率,按 chunk 对应版本做 IS 校正。
限制策略偏移
- Dual-clip 限制异常概率比造成的过大更新,抑制部分 off-policy 轨迹引起的 loss 尖峰。
- 保留 KL 正则,并定期更新 reference,兼顾稳定性与策略持续改进。
异常过滤
- 缓存前缀与新策略续写可能产生乱码或重复,Garble filter 将这些轨迹移出 loss。
- chunk 越短,重新计算历史 log probability 越频繁,需要平衡采样与校正成本。
数据与训练
- 建立论文摘要检索库,将综述训练拆为 Query2Plan 与 Plan2Survey。
- 小规模 SFT 冷启动后,RL 先优化章节,再优化整篇综述。
奖励与上下文
- 规划、检索、写作、引用分别评分,结合规则与 LLM 评价事实、覆盖度和深度。
- 记录完整检索与生成轨迹,以步骤格式惩罚和整条轨迹奖励分配优势。
- 并行环境交互减少检索、评审等外部服务的等待。
示范构建
- 将已有问题交给带工具的强模型求解,只保留最终结果匹配的轨迹。
- 从工具描述反向生成单工具、跨工具任务,再实际调用工具形成示范。
- 转换已有 function calling 数据,整理约
140K条 MCP 格式数据,进行 SFT。
环境检查
- MCP servers 封装到 Docker;每个工具生成10个调用问题检查通信是否正常。
- 通过检查后再暴露给模型,减少环境连接失败混入工具学习。
量化与端侧推理
两阶段训练
- 先训练高精度模型,再将权重量化为三值,继续进行 QAT;激活保留较高精度。
- QAT 开始时重新 warmup 学习率,帮助模型适应离散权重。
- 使用 ModelTunnel 搜索高精度与 QAT 的 token 配比,再应用到
0.5B/1B模型。
训练预算
- BitCPM4 的 QAT 使用约
350B tokens,复用已有基模能力,减少从零量化训练的成本。
FR-Spec
- draft 模型只计算高频词表子集,约
25%词表覆盖约95%的 token 出现次数。 - target 模型仍用完整词表验证,降低 draft 输出头成本,同时保留目标分布。
P-GPTQ
- 前几个位置的异常大激活会主导 GPTQ 校准统计,影响其他 token 的权重量化。
- 计算 Hessian 时排除开头
4个位置,可与 AWQ smoothing 组合。
联合部署
- target 量化后单步 Decode 更快,过多 draft 候选的验证成本更容易抵消收益。
- draft 使用 QAT 保持接受率,长上下文中使用滑动窗口;target 使用稀疏注意力。
推理执行
- CPM.cu 结合静态内存管理、kernel fusion、树形候选验证和 InfLLM v2。
- 稀疏、量化与推测解码统一调度,适配 NVIDIA 端侧硬件。
跨平台适配
- ArkInfer 用统一 Tensor、KV 管理和 executor 接口接入不同芯片后端。
- 复用推测解码与 JSON/SQL 约束解码,并提供模型格式转换和调试入口。
实验设置
模型与预训练
- MiniCPM4 提供
0.5B/8B;8B 使用约8T tokens,WSD 稳定阶段约7T。 - 先在
4K训练,再用20B tokens扩展到32K;LongRoPE/YaRN 支持128K外推。 - UltraClean 数据对照使用
1.2B模型,每组约100B tokens,统一 zero-shot 评测。
MiniCPM4 推理 RL
bs=256,mini_bs=128,lr=1e-5,采用 μP 学习率策略。rollout=16,max_response=32768,temperature=1,top_p=1。KL coef=0.001,不加熵约束;数学与代码混合训练。
分块 Rollout 消融
- 基础模型 DeepSeek-R1-Distill-Qwen-1.5B,DAPO 数据,
64张A800,训练150步。 bs=64,rollout=8,lr=3e-6;对比完整生成及4K/8K/16K chunk。- AIME 结果平均
16次评估,记录采样和完整训练 step 耗时。
通用与效率
- OpenCompass 评测中英文知识、数学、代码和 BBH;长上下文使用 RULER-NIAH。
- 部署效率测试 Jetson AGX Orin 与 RTX4090,输入长度
32K–128K。 - P-GPTQ 使用
1024条校准序列,各线性层采用分组 INT4。
应用评测
- SurveyEval:
20个主题,由 GPT-4o 评价相关性、覆盖、深度、新颖性与事实支持。 - MCP:分别评价函数名、参数名与参数值;多步样本提供之前的 GT 步骤。
关键结果(MiniCPM4-8B与分块RL、量化消融)
8B 模型
- 8项基准平均
81.13,Qwen3-8B 为80.55,较少训练 token 仍能形成有竞争力的能力。 - 中文与通用推理较强:CMMLU
80.62、CEval81.36、BBH76.73。 - 数学仍有差距:MATH500
78.60,低于 Qwen3-8B 的83.20;不能只看平均分。
过滤数据对照
- 1.2B 控制实验:英文平均从 FineWeb 的
42.28提高到 UltraFineWeb 的45.89。 - 中文平均
33.18 → 35.16,说明以实际训练收益迭代分类器能够改善语料质量。
8K Chunk 对照
- 1.5B 模型 AIME2024
32.91 → 34.79,AIME202525.21 → 26.67。 - 完整训练 step 耗时约降到
59%,采样耗时约降到44%,缓解长轨迹等待。
更小 Chunk 的取舍
- 4K 的采样更快,但完整 step 与 8K 接近,因为历史 log probability 校正更频繁。
- 分块收益来自调度效率,稳定训练依赖跨版本 IS、KL 和异常轨迹处理共同配合。
端侧部署
- 128K NIAH 达到
100%,每个 query 只访问约6K历史 token。 - Jetson AGX Orin 长上下文测试中,相对 Qwen3-8B Decode 约加速
7倍。 - S-P-GPTQ 平均分
74.91,高于 GPTQ 的74.31,更接近 FP16 的75.58。
应用训练
- Survey 的 SFT → RL:内容平均
3.11 → 3.50,FactScore50.24 → 68.73。 - 收益集中在覆盖、深度和引用事实支持,单独模仿综述格式仍不足。
- MCP 参数值准确率
51.2,高于 Qwen3-8B 的43.8,但明显低于自身函数名的88.3。 - 工具选择较容易,正确填入复杂参数仍是继续优化的重点。
未来方向
数据与训练
- 提高自动数据质量评估能力,兼顾合成数据的任务相关性与多样性。
- 优化 chunk 长度与 log probability 计算的取舍,扩大环境交互 RL 的任务范围。
- 将低成本 QAT 扩展到更大模型,改善小规模量化模型的复杂推理能力。
架构与部署
- 继续降低长上下文块检索成本,支持更长的端侧任务。
- 扩大不同芯片的推理支持,联合优化稀疏注意力、量化与推测解码。
(2409) MiniCPM3-4B (工具调用、32K)
参考链接
工具与长文
4B文本模型,原生32K;支持 Function Call 和 Code Interpreter。- 模型生成调用或代码,由环境执行并回传结果,用于工具交互、计算和数据处理。
- 超长文档通过外部 LLMxMapReduce 分块处理,再汇总各块信息。
- BFCL v2
76.0,高于 Qwen2-7B 的71.6,函数调用是其优势。 - IFEval Prompt Strict Accuracy
68.4,高于 Phi-3.5-mini 的49.4。 - LiveCodeBench v3
22.6,与 Qwen2-7B 的22.2接近,较小规模仍保留可用代码能力。
(2408) MiniCPM-V (视觉Token压缩, RLAIF-V)
🌺 论文摘要
参考链接
问题背景
- 手机端需要同时处理高分辨率、OCR、多语言和视觉幻觉,视觉 tokens 是主要成本来源。
核心方法
- 自适应切片:保留全局图与局部细节,Resampler 将每块视觉 tokens 压缩到
96个。 - 分阶段训练:先适配视觉模块,再全参数 SFT;Caption 改写和样本打包提高数据利用率。
- RLAIF-V:拆分回答中的事实,由强视觉模型验证,再构造偏好对做 DPO。
- 端侧部署:4-bit 量化与移动推理优化。
模型效果
- V 2.5 在 OpenCompass 多模态均分达
65.1,OCRBench 达725。 - RLAIF-V 将回答级幻觉率由
13.1%降到10.3%。
重要结论
- 视觉压缩和事实级偏好反馈分别改善推理成本与回答可靠性。
核心贡献
- 将高分辨率理解、多语言迁移和低内存部署整合为端侧多模态训练方案。
未来方向
- 继续降低高分辨率和长输入的延迟、功耗,适配移动芯片与运行时。
- 扩展视频、音频等模态,增强端侧交互能力。
- 改进不同语言的视觉理解迁移,缩小多语言表现差异。
问题背景
端侧多模态模型
- 手机的内存与算力有限,高分辨率图片会产生大量视觉 tokens。
- 小模型还需要识别细小文字、减少视觉幻觉,并适配多语言问答。
核心方法
视觉编码与压缩
自适应切片
- 按图像面积估计切片数,再比较相邻切片数量的行列组合。
- 选择与原图宽高比最接近的划分,减少拉伸和无效区域。
- 每块缩放到 ViT 接近原生分辨率的尺寸,插值适配位置编码。
全局与局部信息
- 保留一张全局缩略图,与各局部切片一起送入模型。
- 通过切片分隔符和换行标记保留网格关系,支持最高约
1.8M像素。
模型结构
- SigLIP 视觉编码器 → 单层 Cross-Attention Resampler → LLM。
- MiniCPM-Llama3-V 2.5 每块将
1024个视觉 tokens 压缩到96个。 - 压缩查询从完整特征中提取信息,降低 LLM 处理高分辨率输入的成本。

多模态数据与训练
冻结 LLM,逐步适配视觉模块
- 阶段 1:
224×224输入,仅训练随机初始化的 Resampler,使用200M图文对。 - 阶段 2:提升到
448×448,仅训练 ViT,再使用200M图文对。 - 阶段 3:训练 ViT 与 Resampler,引入自适应高分辨率、OCR 和知识数据。
- 三个阶段均冻结 LLM,减少视觉对齐对语言能力的干扰。
数据池
- Caption:约
410M英文与110M中文图文对。 - OCR 与知识类:约
39M英文与11M中文样本。
数据处理
- 用 GPT-4 生成种子改写数据,训练一个 LLM 扩展 Caption 改写。
- 将描述改写为问答,再取答案形成更丰富的图像描述。
- 将多个样本打包到固定长度序列,通过 position IDs 与 attention mask 隔离样本。
两阶段 SFT
- 先训练简短描述、识别型 VQA 与 OCR,再加入详细回答、复杂指令和纯文本数据。
- V 2.5 补充约
2MCauldron 样本,强化多任务视觉理解。
多语言能力
- 多模态预训练以中英文为主,复用 LLM 已有的多语言能力。
- 再用约
90K、覆盖36种语言的 SFT 数据,迁移视觉问答能力。
候选回答与事实检查
- 每张图像采样
10个候选回答,较高温度增加回答差异。 - Llama3-8B 将回答拆成独立事实,如“图中有两辆车”“左侧车辆为红色”。
- 将各事实转成 Yes/No 问题,交给更强的视觉模型检查。
- V 2.5 使用 LLaVA-NeXT-Yi-34B 提供反馈,按不成立的事实数量给回答打分。
偏好构建与更新
- 在同一问题内组成偏好对,优先选择错误事实更少的回答。
- 约
3K张图像构造6K偏好对,通过 DPO 更新模型。 - 训练信号针对具体事实错误,比只评价回答是否流畅更直接。

端侧部署优化
端侧推理
- 采用 GGML 的
Q4_K_M量化,结合 llama.cpp 运行模型。 - 按 ViT → LLM 顺序加载模块,减少内存峰值和换页。
- 在目标设备上编译,匹配其 CPU 指令集,并自动搜索 CPU 核配置。
- ViT 通过 QNN 使用 NPU 加速,LLM 仍由 llama.cpp 执行。
实验设置(MiniCPM-V)
基础模型
- 主模型 MiniCPM-Llama3-V 2.5:Llama3 + SigLIP + Perceiver Resampler,总参数约
8.5B。 - 报告同时介绍 MiniCPM-V 早期版本;主要结果对应 V 2.5。
训练配置
- 预训练前两阶段各
200M图文对,随后增加高分辨率、OCR 与知识数据。 - 全参数 SFT;多语言增量约
90K样本,RLAIF-V 使用约6K偏好对。
评测协议
- OpenCompass 多模态榜单汇总
11项 benchmark,另测 OCRBench、DocVQA 和 ObjHalBench。 - 多语言实验将 LLaVA Bench 翻译为不同语言,使用 GPT-4 Turbo 评价回答。
- 端侧实验包含 Xiaomi 14 Pro,搭载 Snapdragon 8 Gen 3。
关键结果(MiniCPM-V)
整体多模态能力
- OpenCompass 均分
65.1,高于 Idefics2-8B 的57.2与 GPT-4V-1106 的63.5。 - OCRBench
725,说明高分辨率切片对文字密集输入有效。 - DocVQA
84.8,低于 GPT-4V 的88.4,复杂文档问答仍有提升空间。
事实反馈的作用
- RLAIF-V 将回答级幻觉率
13.1% → 10.3%,错误实体提及率6.4% → 5.0%。 - OpenCompass 均分同时
64.5 → 65.1,减少幻觉没有牺牲整体任务表现。
多语言与资源效率
- 补充多语言 SFT 后,德语 LLaVA Bench 得分
22.8 → 76.5,少量适配数据即可迁移视觉能力。 - 视觉序列约
96–960tokens,低于 LLaVA-NeXT 的1728–2880,减轻 LLM 输入负担。 - 4-bit 量化将内存需求从约
16–17GB降到约5GB,支持手机端运行。 - 手机 CPU 解码速度由
1.3 → 8.2 tokens/s,内存与运行配置优化直接改善交互等待。
未来方向
优化方向
- 继续降低高分辨率和长输入的延迟、功耗,适配移动芯片与运行时。
- 扩展视频、音频等模态,增强端侧交互能力。
- 改进不同语言的视觉理解迁移,缩小多语言表现差异。
(2404) MiniCPM (WSD, 后期数据配比)
🌺 论文摘要
参考链接
问题背景
- 小模型训练需要精细的数据和优化配方,常规学习率日程难以复用不同预算的训练。
核心方法
- Model Wind Tunnel:小规模搜索超参,通过宽度与深度缩放迁移到更大模型。
- WSD:Warmup → Stable → Decay,复用 Stable 路径,在不同预算位置分支收敛。
- 后期数据配比:Decay 混入高质量知识与指令数据,随后继续 SFT。
- 能力扩展:DPO、长上下文适配等,复用已训练的模型。
模型效果
- MiniCPM-2.4B SFT:MMLU
53.46、HumanEval50.0、GSM8K53.83。 - DPO 将 MT-Bench 从
6.89提升到7.25。
重要结论
- 小模型的收益不仅来自增加 token,后期数据质量与优化日程同样关键。
核心贡献
- 提出可复用训练预算、可迁移超参的小模型训练方案,并验证后期数据混合的价值。
未来方向
- 进一步解释 Decay 阶段的优化动态,改进学习率和数据配比的联合设计。
- 研究小模型的数据选择与训练预算分配,提高单位训练成本带来的能力增益。
- 加强复杂推理、长上下文和偏好对齐,减少小模型的能力短板。
问题背景
小模型训练效率
- 小模型需要在有限参数下充分利用训练数据,训练配方对最终能力影响更大。
- 常规 Cosine 衰减依赖预设训练预算,增加数据或比较不同规模时需要重复训练。
- 直接用大模型搜索超参成本高,需要能从小规模实验迁移的配置。
核心方法
超参缩放与预算复用
低成本超参搜索
- 先在小模型上搜索学习率、初始化与残差缩放,再扩展到更大模型。
- 采用 Tensor Program 的参数化方式,减少模型宽度变化引起的更新尺度变化。
缩放规则
- 设宽度比
m=d/d_base,层数为L;Embedding 输出乘以固定缩放系数。 - 残差分支乘以
scale_depth/√L,控制深层模型的残差累积。 - 二维权重的初始化标准差除以
√m,学习率除以m。 - 输出 logits 除以
m,使不同宽度的优化过程更接近。
Batch Size
- 最优 batch 随训练 loss 降低而增大,后期可以增加 batch 提高吞吐。
三个阶段
- Warmup:逐步提高学习率,稳定训练初期的更新。
- Stable:维持较高学习率,持续吸收大规模预训练数据。
- Decay:从某个 Stable checkpoint 分支,降低学习率完成收敛。
Checkpoint 复用
- 需要更长训练时,继续 Stable 主线;需要交付模型时,另开 Decay 分支。
- 不同数据预算共用前面的训练过程,减少重复实验。
- 例如比较三个训练预算,可从同一 Stable 路径的三个位置分别衰减。
两阶段数据配比
- Stable 以大规模通用语料为主,建立语言、知识与代码基础。
- Decay 将高质量知识与 SFT 数据混入预训练语料,集中强化任务相关能力。
- 完成 Decay 后继续单独 SFT,学习指令与回答格式。
数据来源与去重
- 中文 Common Crawl;英文 Dolma、C4、Pile;代码来自 The Stack 与 StarCoder 数据。
- 使用 MinHash 做语料内部与跨来源去重。
- 后期补充 UltraChat、SlimOrca、Evol 等指令数据,以及代码和 K12 题目。
后训练与上下文扩展
SFT 与偏好优化
- SFT 使用约
6B tokens,学习率从 Decay 末期水平继续调整。 - DPO 在 SFT 模型上训练,使用 UltraFeedback 与数学、代码偏好数据。
长上下文训练
- 复用预训练 checkpoint,通过 ABF 将上下文从
4K扩展到32K。 - 再用 NTK 扩展与课程训练逐步适配
128K。 - 长上下文数据混合长文与短文本,并加入合成的长文问答。
实验设置(MiniCPM)
模型结构
1.2B与2.4B指非 Embedding 参数;总参数还需计入约0.2B/0.3B的 Embedding。- 共享输入输出 Embedding;1.2B 使用
52层与 GQA,2.4B 使用40层。
训练数据与优化
- 总训练量约
1.1T tokens,Stable 阶段约1T,之后进行 Decay 与 SFT。 - Adam;2.4B batch 约
4M tokens,1.2B 从约2M增至4M。 - 超参搜索的全局基础学习率为
0.01;二维参数实际学习率按宽度缩放。 - DPO 训练
1 epoch,学习率1e-5,使用 Cosine 衰减。
控制实验
- 后期数据实验从同一 2.4B checkpoint 出发,对比纯预训练数据与混合高质量数据。
- 两组随后使用相同的
4B tokensSFT,隔离 Decay 数据配比的影响。 - 另比较 WSD 衰减长度、不同模型规模和训练预算。
关键结果(MiniCPM)
2.4B 的基础能力
- SFT 模型 HumanEval
50.0、GSM8K53.83,表明充分训练的小模型也能形成代码与数学能力。 - DPO 后 MT-Bench
6.89 → 7.25,偏好优化改善交互质量,同时部分基础任务略有回退。
后期数据混合
- 同起点、同后续 SFT 的对照中,混合高质量数据使 MMLU
44.6 → 50.9。 - GSM8K
27.7 → 42.3、HumanEval27.7 → 30.4,说明在 Decay 阶段引入任务数据有实际收益。
WSD 与训练效率
- 控制实验中,约占训练过程
10%的 Decay 已能充分收敛,2.5%偏短。 - Loss 的主要下降集中在 Decay,Stable checkpoint 可以继续训练,也可以转入交付分支。
- 小模型长训练能改善推理部署成本,但需要按模型和数据质量权衡训练投入。
未来方向
笔记讨论
- 进一步解释 Decay 阶段的优化动态,改进学习率和数据配比的联合设计。
- 研究小模型的数据选择与训练预算分配,提高单位训练成本带来的能力增益。
- 加强复杂推理、长上下文和偏好对齐,减少小模型的能力短板。