Skip to content

面壁 MiniCPM 系列

📅 发表于 2026/09/21
🔄 更新于 2026/09/21
👁️ — 次访问
📝 13738 字
⏳ 41 分钟
minicpm
#MiniCPM

变化点 ​

2026

2026.09 · MiniCPM5-2B

  • 训练 16 个领域教师,通过 OPD 将推理与 Agent 能力迁移至 2B。
  • 开放 Base、MidTrain、SFT 和最终权重,支持分阶段研究与继续训练。

2026.02 发布 / 04 报告 · MiniCPM-o4.5(全模态分支)

  • Omni-Flow 统一多模态流,支持全双工实时交互。
  • TAIL 按语音播放进度调节文本生成,保持实时同步。
2025

2025.09 · MiniCPM-V4.5

  • 通过 3D 视频压缩减少视觉 token,保留跨帧信息。
  • 结合长短推理联合 RL 与视觉偏好训练。

2025.09 · MiniCPM4.1

  • 在 InfLLM-V2 上引入 Dense / Sparse 切换,兼顾精度和长文本效率。
  • 加强可控推理与长上下文任务能力。

2025.06 · MiniCPM4

  • UltraClean 改进数据质量,InfLLM v2 降低长上下文计算。
  • 结合分块 rollout 与端侧推理优化,提高训练和部署效率。
2024 及以前

2024.09 · MiniCPM3-4B

  • 强化工具调用与代码解释器,支持 32K 上下文。

2024.08 报告 · MiniCPM-V(视觉分支)

  • 压缩视觉 token,提高小模型的高分辨率理解效率。
  • 通过 RLAIF-V 降低视觉幻觉。

2024.04 报告 · MiniCPM

  • 提出 WSD 学习率与训练风洞,降低模型和训练配方的试验成本。
  • 在后期衰减阶段调整高质量数据配比,提高小模型效果。

(2609) MiniCPM5-2B (16教师OPD, 阶段权重) ​

MiniCPM5-2B

参考链接

模型与阶段

  • Dense 模型,非 Embedding 约 1.98B、总计约 2.52B,128K 上下文。
  • Base → MidTrain → 深度思考 SFT → 领域 RL → OPD,目标是在小参数内整合推理和 Agent 能力。
  • 开放 Base、MidTrain、SFT 和最终权重,便于分析各阶段作用。
数据与领域教师

数据构建

  • 使用 Ultra-FineWeb、UltraX、UltraData-Code/Math;代码按 L0–L3 分级管理。
  • 深度思考 SFT 约 400B tokens;配套约 500K Agent SFT、80K+ RL 数据。

RL 与蒸馏

  • 分别训练数学、代码、写作和 Agent 教师,共 16 个领域专家,其中 5 个 Agent 专家。
  • 学生沿自身轨迹生成,教师在相同前缀提供全词表分布,以 reverse KL 构造优势。
  • 直接复用教师 RL prompts,无需另建静态教师回答集;最终模型仍为 Dense。
公开表现
  • AIME 2025 86.5、LiveCodeBench v6 69.1,小模型获得较强推理和代码能力。
  • 官方阶段比较中,RL + OPD 使推理/通用项目平均提高约 11 分,Agent 项目约 7 分。
  • SWE-V 46.4,SWE-Pro 14.4,Terminal-Bench v2.1 8.6;复杂仓库与系统操作仍较弱。

(2604) MiniCPM-o4.5 (Omni-Flow, TAIL, 全双工) ​

🌺 论文摘要

MiniCPM-o4.5 论文摘要

参考链接

问题背景

  • 传统多模态交互把感知与回答分开,模型说话期间难以及时利用新声音、新画面。
  • 文本生成快于语音播放,还会导致正在播放的内容落后于当前环境。

核心方法

  • 9B全模态架构:Qwen3-8B 负责理解与文本,轻量 speech decoder 负责高频语音 token。
  • Omni-Flow:按时间窗口交错视觉、音频与输出,使用独立 Listen/Speak 控制。
  • TAIL:根据累计播放进度动态调整文本生成量,保持说话内容与环境同步。
  • 训练:语音模块预训练 → 联合预训练 → 两阶段 SFT → GRPO/RLAIF-V。

模型效果(MiniCPM-o4.5)

  • OpenCompass:Instruct 77.6、Thinking 78.2;LiveSports-3K-CC 54.4。
  • RTX4090、INT4、llama.cpp-omni 下,RTF 0.21,显存约 11GB。

重要结论

  • 时间窗口并非越短越好;明确区分交互控制和内容生成,有助于稳定学习全双工行为。
  • 实时语音需要控制文本领先量,仅提高生成速度不能解决内容过时。

核心贡献

  • 用统一时间序列实现持续感知、同步输出与主动交互,并配套端侧流式推理。

未来方向

  • 提高长时间动态交互的稳定性、流式发音质量和主动规划能力。

问题背景 ​

轮流交互与实时环境

感知中断

  • Turn-based 系统在生成长回答时,无法持续把新观察纳入当前输出。
  • 全双工要求模型同时感知和说话,并自主决定何时回应、何时继续听。

播放延迟

  • 已生成文本可能排队等待播放,后续即使看到环境变化,也只能继续播旧内容。
  • 模型需要同步生成与播放进度,避免文本流持续领先于声音。

核心方法 ​

全模态架构与流式交互 ​

编码、理解与语音生成

视觉与音频输入

  • SigLIP ViT 编码图像切片,resampler 将每片 1024 tokens压缩到 64。
  • Whisper Medium 流式编码音频,经 projector 从每秒 50 tokens压缩为 10 tokens。

语言骨干

  • 基于 Qwen3-8B,负责跨模态理解与文本输出;主模型只需跟随人类语速生成文本。
  • 全双工模式采用较低图像分辨率,减少每轮视觉输入的处理成本。

语音输出

  • 约 0.3B speech token decoder 接收文本及其 LLM hidden states,生成 S3 语音 tokens。
  • 流式 flow-matching decoder 转换为波形,并利用参考音频保持音色。
  • 主干与语音模块通过 hidden states 连通,可以联合反向传播。
统一序列建模

时间序列

  • 将环境视觉、环境音频与输出划入同一时间窗口,按 [视觉;音频;输出]连续拼接。
  • 每个窗口先接收最新观察,再生成该窗口的回应;不回应时输出 [listen]。

控制与内容分离

  • Listen/Speak 先判断是否说话,再决定说什么,减少两类决策混在同一步的学习难度。
  • 明确标注时间块边界,帮助区分新输入和新输出。
  • 最终采用约 1秒窗口,在响应速度与单块信息量之间取舍。
MiniCPM-o4.5 的端到端架构:模态编码器、LLM 与语音解码器通过 hidden states 连接,输入输出流放到统一时间轴。
原文图 4:MiniCPM-o4.5 的端到端架构:模态编码器、LLM 与语音解码器通过 hidden states 连接,输入输出流放到统一时间轴。 来源
文本与语音对齐

动态生成量

  • 根据历史累计播放位置决定本块生成多少文本,使声音尽量跟上当前时间边界。
  • 如果前一块播放稍慢,后一块少生成一些文本,让声音追上环境变化。

训练监督

  • 按文本 token 的实际起止时间,将文本及对应语音 tokens 分配到时间块。
  • 每块文本长度可变化,模型学习依赖历史播放进度的交错方式。

有限 Look-ahead

  • 发音需要局部后文时,将少量末尾文本的语音延迟到下一块。
  • 只保留有限前瞻,兼顾连贯发音和实时同步。
TAIL 对齐策略:每段文本对应相近时长的实际语音播放,减少固定比例或文本领先过多导致的内容滞后。
原文图 5:TAIL 对齐策略:每段文本对应相近时长的实际语音播放,减少固定比例或文本领先过多导致的内容滞后。 来源

多模态数据与训练 ​

数据构建

语音与视觉

  • 自然语音数据构造 ASR、TTS 和多说话人对话;高质量对话由专业配音补充情绪与语速变化。
  • 图文数据包含 caption、OCR、文档、多图与密集视频描述,加入文字任务保留语言能力。
  • 文档遮盖优先选择与图表相关的区域,迫使模型利用视觉证据。

全双工数据

  • 每条样本保留视觉、声音、输出文本和输出语音的时间标记。
  • 过滤弱音画关联、单人连续口播和字幕捷径,减少仅靠声音或字幕完成任务的情况。
  • 人工构造持续场景描述、主动提醒等精细交互样本。
训练流程

语音模块对齐

  • 从 MiniCPM-V4.5 的预训练 checkpoint 和 Whisper 初始化,冻结原模块,只训练新增语音接口。
  • 对齐音频输入与 LLM hidden space,并让 speech decoder 学习从语言特征生成语音。

联合 PreTrain 与 SFT

  • 解冻全部参数,按固定模态配比联合预训练;不同 data-parallel ranks 分配不同模态组合。
  • SFT 先进行大规模指令适配,再用高质量人标数据修正交互行为。
  • 随机分辨率与帧率,学习不同输入成本下的交互方式。

GRPO 与事实反馈

  • GRPO 使用正确性、格式和通用质量奖励,提高推理与指令能力。
  • 在相同 prompt 的候选间比较长度;错误回答只接受非正长度奖励,避免奖励短错误答案。
  • 长度差很小时衰减该项影响;前 480步不加长度奖励,让正确性先稳定。
  • 最后使用 RLAIF-V 降低视觉幻觉,图文事实监督也能改善流式交互。

实验设置(o4.5多模态训练与流式交互) ​

模型、输入与对照

训练对象

  • 约 9B总参数;Qwen3-8B、SigLIP、Whisper 和轻量语音输出模块联合构成。
  • SFT 全模态数据随机使用 0.2–0.4MP分辨率与 1–5FPS输入。

设计消融

  • 比较 1秒/0.2秒/0.1秒窗口、显式/隐式边界、Listen-Speak/Listen-Text 控制。
  • 比较无长度奖励、K1.5 风格奖励和平滑长度奖励;另比较三种语音交错策略。

质量与效率评测

  • 图文区分 Instruct/Thinking;语音测试识别、生成与风格控制;文本对照 Qwen3-8B。
  • 流式使用纯视觉 LiveSports-3K-CC;全模态理解另用音视频 benchmark。
  • 部署测试 RTX4090/DGX Spark,区分 PyTorch 与 llama.cpp-omni、FP16/BF16 与 INT4。

关键结果(MiniCPM-o4.5,Omni-Flow + 联合训练) ​

能力与设计取舍

实时交互

  • LiveSports-3K-CC 54.4,高于 LiveCC 41.5和 StreamingVLM 45.6。
  • 1秒窗口优于更细窗口;过短片段提供的上下文不足,会损害连贯回答与控制决策。

语言与多模态

  • OpenCompass 为 77.6/78.2,Daily-Omni 80.2,多模态理解保持较强水平。
  • 文本综合平均从 Qwen3-8B 的 81.6到 82.1,但 MMLU、Math500 等单项仍有下降。

长度奖励

  • Thinking 平均分 73.5 → 74.3,输出长度减少 35.3%。
  • 更激进的长度奖励缩短更多,但平均分下降,说明压缩推理需要兼顾有效中间步骤。

语音与部署

  • TAIL 的英文 WER 3.93,高于固定交错的 2.38,时间同步带来一定语音质量取舍。
  • RTX4090/INT4 的 llama.cpp-omni:RTF 0.21、约 11GB显存,满足该配置下的实时处理。

未来方向 ​

作者指出的不足

持续交互

  • 提高长时间、动态现实场景下的理解与稳定性,减少状态变化后的错误延续。

语音质量

  • 减少流式模式的误发音和中英文混杂,改善不同网络与部署条件下的连续输出。

主动行为

  • 从简单提醒发展到更丰富的上下文规划与自主辅助。

(2509) MiniCPM-V4.5 (3D视频压缩, 长短推理联合RL) ​

🌺 论文摘要

MiniCPM-V4.5 论文摘要

参考链接

问题背景

  • 高分辨率图像、长视频占用大量视觉 token;小模型还需要补充知识与复杂推理能力。
  • 所有问题都生成长 CoT 会增加训练和推理成本,简单感知任务也需要保留直接回答能力。

核心方法

  • 3D-Resampler:联合压缩空间与时间,6帧448×448图像 → 64个视觉token。
  • 文档学习:根据遮挡强度,在同一任务中训练 OCR、上下文恢复与跨模态知识学习。
  • 训练:分阶段预训练 → 通用 SFT → Long-CoT/视频 SFT → 混合 GRPO → RLAIF-V。
  • 混合 RL:同一模型同时学习长、短推理;RLAIF-V 再通过事实偏好 DPO 减少幻觉。

模型效果(MiniCPM-V4.5,8B级多模态模型)

  • OpenCompass 77.0,MathVista 79.9;Video-MME 无字幕 67.9、有字幕 73.5。

重要结论

  • 长短推理联合训练达到长推理训练的效果,消耗约 70.5%的训练生成 token。
  • 视觉压缩、文档知识与推理训练分别作用于计算效率、知识覆盖和问题求解。

核心贡献

  • 提供兼顾图像、长视频与可控推理的高效 MLLM 训练方案。

未来方向

  • 笔记整理:细粒度时序信息保留、按问题分配推理预算、开放问题的奖励质量。

问题背景 ​

多模态能力与计算成本

视觉序列过长

  • 高分辨率图像需要多个切片,视频还要重复编码相邻帧,LLM 的上下文和计算成本迅速增长。
  • 相邻帧存在大量冗余,单独压缩每一帧没有利用时间上的重复信息。

知识与推理不足

  • 图文对难以充分覆盖教材、论文中的专业知识,复杂 PDF 解析还会引入错误。
  • 长 CoT 适合复杂问题,但简单识别、OCR 等任务更适合短回答。

核心方法 ​

视觉与视频压缩 ​

高分辨率图像

自适应切片

  • 延续 LLaVA-UHD 的图像切分方式,根据长宽比分配切片,保留小字与局部细节。
  • 视觉编码器处理各切片,Resampler 将每个 448×448图像压缩到 64个token。

可学习查询

  • 使用可学习 query 对图像特征做 cross-attention,加入二维位置编码保留空间关系。
  • 输出定长视觉 token,控制输入 LLM 的序列长度。
3D-Resampler

相邻帧联合编码

  • 将连续帧组成一组,使用二维空间位置和时间位置共同标记视觉特征。
  • query 跨多个帧提取信息,同一组帧共享压缩预算,避免逐帧重复传入背景。
  • 6帧448×448 → 64个token;例如 6秒、2fps的视频,12帧压缩为 128个token。

图像与视频统一

  • 共享编码与压缩参数,在第二阶段 SFT 中由 2D-Resampler 扩展到 3D-Resampler。
  • 训练随机改变帧分组与采样率,覆盖不同时间粒度;支持最多 1080帧、最高 10fps输入。
统一 3D-Resampler 同时压缩图像与视频特征;重点看图像切片、视频打包和视觉 token 压缩之间的关系。
原文图 1:统一 3D-Resampler 同时压缩图像与视频特征;重点看图像切片、视频打包和视觉 token 压缩之间的关系。 来源

预训练与文档学习 ​

预训练流程

模块对齐

  • 阶段1:冻结视觉编码器和 LLM,只训练 Resampler,建立视觉特征与语言输入的对应关系。
  • 阶段2:解冻视觉编码器,加入 OCR 和图文数据;继续冻结 LLM,减少低质量语言数据的影响。
  • 阶段3:全参数训练高质量文本、交错图文和视频,WSD 衰减阶段提高知识与指令数据占比。

数据质量

  • 图文对经过 CLIP 过滤、CapsFusion 重描述,补充长尾概念与知识信息。
  • 交错图文清理损坏图片、低相关内容,并按知识密度筛选。
  • OCR 数据结合自然背景上的文字渲染与 HTML 渲染,覆盖不同文字和布局。
视觉遮挡课程

训练样本

  • 从教材、论文页面选取文本区域,以原始文本作为监督目标。
  • 对页面施加不同程度的视觉扰动,模型结合图像、上下文与版面恢复目标文字。

遮挡强度对应不同能力

  • 轻度扰动:主要依靠局部字形,训练 OCR 识别。
  • 中度扰动:结合不完整字形和邻近文本,训练上下文恢复。
  • 强遮挡:目标区域不可见,需要利用其他段落、图表和布局关系推断内容。
  • 这种设计将文字识别和文档知识学习放入同一任务,减少对复杂 PDF 解析流水线的依赖。

SFT 与多模态 RL ​

指令数据与推理轨迹

两阶段 SFT

  • 通用 SFT 混入约 10%纯文本数据,保留语言模型能力。
  • Long-CoT 阶段加入高帧率长视频,并完成 3D-Resampler 的训练。

高质量推理数据

  • STEM 和长尾知识问题先检查视觉依赖,排除不看图也能回答的样本。
  • 从模型难以解决的问题中生成 CoT,通过答案正确性、事实检查与重复检测筛选。
  • 对轨迹进行改写以增加表达多样性,避免只模仿单一推理形式。
长短推理共享训练

模式控制

  • 同一模型通过 prompt 选择长推理或短推理,训练时随机分配模式。
  • 两种模式共享参数,兼顾复杂推理与快速感知;使用 GRPO 更新,不加 KL 和熵正则。

奖励组成

  • 正确性奖励:简单答案用规则验证,复杂自然语言答案使用基于参考答案概率的 RLPR。
  • 格式与重复项:约束输出结构,抑制重复生成。
  • 偏好奖励:RM 只评价最终回答,避免把不熟悉的 CoT 文风当作质量差异。
  • RM 分数在同一 prompt 的候选组内标准化,权重为 0.5。
  • 总奖励:正确性 + 格式 + 重复项 + 0.5 × 标准化RM分数。
多模态事实反馈

偏好数据

  • 对同一图像或视频问题采样多个回答,将回答拆成可验证的原子事实。
  • 逐条检查事实并累计错误数,用错误较少的回答构造偏好对。

DPO 更新

  • 在混合 GRPO 之后执行 DPO,进一步减少描述和问答中的视觉幻觉。
  • 该阶段优化事实可靠性,与前面的正确性、格式和推理训练互补。

实验设置 ​

训练与评测

模型与训练

  • MiniCPM-V4.5,8B级多模态模型,完整进行预训练、SFT、GRPO 和 RLAIF-V。
  • 预训练 WSD:稳定阶段 lr=5e-5,衰减到 1e-5。
  • 通用 SFT:1e-5 → 1e-6;Long-CoT/3D 阶段:5e-6 → 1e-6。

RL 超参

  • GRPO:128个prompt × 8个回答,max_response=8192,temperature=1,lr=1e-6。
  • 每批约 50%的 prompt 使用长推理模式,关闭 KL 与熵正则。
  • RLAIF-V:bs=256,lr=1e-6,DPO β=0.1,训练 400步。

评测与消融

  • OpenCompass 汇总8项多模态基准,部分推理任务采用长推理,其他任务采用短推理。
  • 长推理结果平均3次运行;效率对比使用 8张A100。
  • 文档学习消融固定后续 SFT,比较高质量训练样本中是否加入文档知识数据。
  • 长短推理消融对比短模式、长模式和联合训练,记录准确率及生成 token 总量。

关键结果(MiniCPM-V4.5,混合GRPO + RLAIF-V) ​

多模态效果与推理成本

图像与视频

  • OpenCompass 77.0,高于 Qwen2.5-VL-72B 的 76.1和 GPT-4o 的 75.4。
  • MathVista 79.9、OCRBench 89.0,覆盖数学推理与细粒度文字识别。
  • Video-MME 无字幕 67.9、有字幕 73.5,长视频仍能保留有效信息。
  • MMHal 幻觉率 19.4,低于 Qwen2.5-VL-7B 的 31.6。

长短推理消融

  • 仅短推理:OpenCompass 76.0,训练生成 1.6B tokens。
  • 仅长推理:77.0,生成 4.4B tokens;混合训练:77.1,生成 3.1B tokens。
  • 联合训练以约 70.5%的 token 达到长推理方案的效果,收益在于推理质量与成本的平衡。
架构与数据的作用

文档知识数据

  • 加入文档学习后,MMMU 49.0 → 51.4、AI2D 74.9 → 76.5。
  • OCRBench 原始分 576 → 617,说明文档训练同时改善文字识别与知识理解。

视频计算效率

  • 相同效率评测中,Video-MME 用时约 0.26小时,显存约 28GB。
  • Qwen2.5-VL-7B 为 3小时、60GB;MiniCPM-V4.5 的有字幕分数同时由对照的 71.6提高到 73.5。
  • 3D 压缩减少输入 LLM 的视觉序列,收益贯穿显存、评测时间与可处理视频长度。

未来方向 ​

后续研究(笔记整理)

压缩与信息保留

  • 对短暂动作、密集小字和精确时间定位,研究按内容自适应分配视觉 token。

推理与奖励

  • 将长短模式从人工指定扩展为按问题难度分配预算,兼顾准确率与延迟。
  • 提升开放式视觉问题的事实验证,减少错误偏好数据对 RLAIF-V 的影响。

(2509) MiniCPM4.1 (InfLLM-V2, Dense-Sparse切换) ​

🌺 论文与资料摘要

MiniCPM4.1 论文与资料摘要

参考链接

问题背景

  • 长上下文和长 CoT 增加注意力成本,直接替换稀疏架构又可能破坏已有 Dense 模型能力。

核心方法

  • InfLLM-V2:复用 Dense 的 Q/K/V 参数,只改变访问哪些历史 token。
  • 块选择:细粒度池化 → GQA 组内分数合并 → Top-k,保留初始与局部窗口。
  • 训练:短序列预训练后,用约 5B长文本tokens适配稀疏注意力。
  • 部署:长短推理可控;Dense/Sparse 按序列长度切换,配合推测解码。

模型效果(8B架构对照与发布模型)

  • InfLLM-V2 稀疏版 RULER 82.62,FullAttn 84.26;长推理平均 42.66 vs 42.79。
  • MiniCPM4.1 模型卡报告,RTX4090 配合稀疏注意力与推测解码,推理生成加速约 3倍。

重要结论

  • 共享参数、单一注意力输出,使短序列 Dense 预训练与长序列稀疏适配保持一致。

核心贡献

  • 开放可在 Dense/Sparse 之间切换的模型、训练与推理 kernel。

未来方向

  • 进一步融合块选择 kernel,并结合 FFN 加速降低端到端生成成本。

问题背景 ​

Dense 模型的稀疏适配

架构切换影响训练

  • 常规训练先使用短文本,再扩展长上下文,稀疏模块需要兼容已有参数。
  • 多组 KV、多个注意力输出和额外门控,会改变原模型计算结构,增加适配难度。

短文本与长文本需求不同

  • 短文本中,块选择的额外计算可能抵消稀疏收益。
  • 长文本需要减少历史访问,但块选择本身也必须足够高效。

核心方法 ​

稀疏注意力与块检索 ​

Dense-Sparse 切换

同一套参数

  • Dense 与 Sparse 共用 Q/K/V 投影;稀疏适配不引入额外参数。
  • 每个 query 固定访问开头块和局部窗口,再加入相关性最高的远程块。
  • 对这些位置的并集执行一次注意力,保留原有单一输出结构。

压缩仅用于选块

  • 压缩后的 key 用于计算块相关性,不额外产生一条注意力输出。
  • 短序列直接恢复 Dense 计算,省去没有必要的块检索。
NSA 与 InfLLM-V2 的架构对照:共享 KV、合并选中块与局部窗口的 Attention,并去掉压缩分支的输出。
原文图 2:NSA 与 InfLLM-V2 的架构对照:共享 KV、合并选中块与局部窗口的 Attention,并去掉压缩分支的输出。 来源
相关上下文选择

细粒度表示

  • 先对重叠的小窗口做 mean pooling,避免整个大块平均后丢失局部重要信息。
  • query 与这些小窗口计算相关性,同一 GQA 组内的 query heads 汇总分数。
  • 对覆盖一个大块的小窗口分数做 max pooling,以最显著的局部证据代表该块。

共享选择结果

  • 同一 GQA 组共享所选 KV blocks,减少重复读写。
  • 最终访问集合为 初始块 + 局部块 + 远程Top-k块,注意力仍读取所选块的原始 KV。
三阶段分组压缩与单阶段 token 压缩对照:先形成块级表示,再筛选相关 KV blocks,减少长序列检索开销。
原文图 4:三阶段分组压缩与单阶段 token 压缩对照:先形成块级表示,再筛选相关 KV blocks,减少长序列检索开销。 来源
减少中间分数读写

组内融合

  • 完整的 query-head × 历史块分数矩阵过大,写入 HBM 会抵消稀疏计算收益。
  • 在 SRAM 中完成 GQA 组内求和,只把合并后的分数写回 HBM。

LSE 近似

  • Softmax 归一化和组内求和顺序不同,需要先取得归一化量,再计算合并分数。
  • 第一遍用更粗粒度的 key 估计 LSE,第二遍计算细粒度分数,降低两遍计算的开销。

长上下文适配 ​

训练与推理模式

长上下文适配

  • 先用 Dense attention 训练短序列基模,再切换为 Sparse attention 做长文本训练。
  • 混合不同长度区间,避免适配过程中只优化最长文本。
  • 长推理架构实验继续使用 OpenMathReasoning、OpenCodeReasoning 微调。

发布模型模式

  • MiniCPM4.1 支持思考与直接回答;该开关控制回答方式。
  • Dense/Sparse 开关控制注意力计算,和思考开关属于不同维度。
  • 原生上下文 64K,LongRoPE 扩展验证到 128K;可结合 EAGLE3 等推测解码。

实验设置 ​

InfLLM-V2 架构实验

基础模型与预训练

  • 8B GQA 模型,hidden=4096,32个Q heads、2个KV heads,head_dim=128。
  • 8T tokens、序列 4K,主要使用 FineWeb-Edu 与 Stack-v2;WSD,8M tokens/batch。

长文本训练

  • 5B tokens;四组长度 0–4K / 4–12K / 12–24K / 24–32K,token 数量等比例。
  • lr=3e-4 → 2.75e-4,块大小 64,每个 query 访问 96块、约 6K tokens。
  • 访问集合为 1个初始块 + 32个局部块 + 63个远程块。

对照与评测

  • 同一基模与训练配置比较 FullAttn、InfLLM-V2、NSA,稀疏方法保持相同稀疏度。
  • RULER 测试 32K;另测 LongBench、LongPPL、数学、代码及短文本任务。
  • Kernel 效率使用 A100/RTX4090、bs=1;端到端使用 W4A16与 96块配置。
MiniCPM4.1 使用设置

生成与注意力

  • 模型卡推荐 temperature=0.9、top_p=0.95,最大输出预算 65536。
  • 稀疏推理配置包含 2048-token局部窗口,短于 8192时使用 Dense。
  • 稀疏加速使用对应 kernel 与 CPM.cu;框架支持情况按发布版本配置。

关键结果(8B InfLLM-V2适配实验与MiniCPM4.1) ​

长上下文与推理能力

长文本适配

  • RULER:稀疏版 82.62,FullAttn 84.26,保留约 98.1%的得分。
  • LongBench:42.54 vs 42.30;LongPPL:2.12 vs 2.06,长依赖建模接近全注意力。
  • 仅对短文本模型直接做 YaRN 外推时,RULER 为 40.63,说明长文本适配训练很关键。

长推理与切换

  • 数学与代码5项平均:稀疏版 42.66,FullAttn 42.79,保留约 99.7%的效果。
  • 同一稀疏训练模型切回 Dense 后可继续处理短文本,避免为不同长度维护两套权重。
  • 这些是注意力架构的控制实验,MiniCPM4.1 发布模型进一步提供混合推理能力。
实际加速

端到端收益

  • 报告中的 W4A16、96块配置,Prefill 加速 2.13倍,Decode 加速 2.32倍。
  • 模型卡的 MiniCPM4.1 配合推测解码,在 RTX4090 上报告约 3倍推理生成加速。
  • 只减少注意力计算仍会受到 FFN、块选择和访存限制,联合优化比单独追求稀疏率更重要。

未来方向 ​

Kernel 与端到端效率

报告提出

  • 继续把 max pooling 和 Top-k 融入块选择 kernel,减少中间结果读写。
  • 配合 FFN 加速,降低注意力之外的计算成本。

笔记整理

  • 根据输入长度与任务性质选择 Dense/Sparse 和推理预算,减少短任务的不必要开销。

(2506) MiniCPM4 (UltraClean, InfLLM v2, 分块Rollout) ​

🌺 论文摘要

MiniCPM4 论文摘要

参考链接

问题背景

  • 端侧模型受计算、显存与功耗限制,需要同时提高数据效率、训练效率和生成速度。

核心方法

  • 稀疏注意力:InfLLM v2 逐 query 检索 KV blocks,减少长文本 Prefill 与 Decode 开销。
  • 数据与训练配方:UltraClean 用退火实验迭代语料分类器;ModelTunnel v2 结合 μP/ScalingBench 搜索训练策略。
  • 后训练:UltraChat v2 → Long-CoT SFT → 数学/代码 RL,分块 rollout 平衡负载,再扩展应用任务。
  • 端侧推理:BitCPM4 三值 QAT;CPM.cu 集成稀疏注意力、FR-Spec 与 P-GPTQ。

模型效果(MiniCPM4-8B与分块RL对照)

  • MiniCPM4-8B:8项平均 81.13,Qwen3-8B 为 80.55;预训练约 8T tokens。
  • 1.5B 分块 RL 对照:AIME2025 25.21 → 26.67,单步耗时降至完整 rollout 的约 59%。

重要结论

  • 数据过滤应以实际训练收益校准;分块 rollout 提高利用率,但需要处理跨版本策略偏移。
  • 量化、稀疏和推测解码需联合配置,单项加速收益不能直接相乘。

核心贡献

  • 开放模型与端侧推理代码,提供覆盖数据、架构、RL 与部署的完整效率优化方案。

未来方向

  • 更长上下文、更高质量推理数据、更广泛环境中的 RL,以及多平台端侧部署。

问题背景 ​

端侧模型的资源约束

模型能力与训练成本

  • 小模型仍需覆盖知识、推理和工具能力,低质量语料会浪费有限训练预算。
  • 大模型上逐项搜索超参成本高,需要能迁移的小模型实验方法。

长序列与部署效率

  • 长文本增加注意力和 KV 读取成本,长 CoT 又造成 RL rollout 的负载不均。
  • 端侧部署还受内存容量和硬件差异限制,需要同时优化模型与推理系统。

核心方法 ​

稀疏注意力 ​

逐 Token 查询、按 KV Block 访问

上下文筛选

  • KV cache 划分为连续块,每个 query token 独立选择相关块。
  • 对重叠的细粒度窗口做 mean pooling,得到 Semantic Kernel,保留块内局部语义。
  • query 与各 Kernel 计算相关性,以块内最高相关分数选取 Top-k blocks。
  • 初始位置与局部窗口固定保留,再对所选块中的原始 KV 执行注意力。

训练兼容性

  • 池化不引入额外参数,其输入 key 随主模型训练更新。
  • 短文本可退化为 Dense attention,避免额外的稀疏模块输出。
  • query 按 token 选择,单 token Decode 也能使用同样的计算结构。
块选择开销

访存优化

  • 同一 GQA 组内共享 Top-k blocks,减少重复 KV 读取。
  • 块选择需要归一化并聚合 query heads 分数,本身也会产生计算与访存成本。

粗粒度归一化

  • 用更粗的 Semantic Kernel 近似 LogSumExp,再计算细粒度相关性。
  • 将计算预算集中于最终的块排序,降低块检索对加速收益的抵消。
InfLLM v2 按 query 选择相关 KV blocks,同时保留起始 token 与局部窗口;稀疏计算依赖的是块选择。
原文图 2:InfLLM v2 按 query 选择相关 KV blocks,同时保留起始 token 与局部窗口;稀疏计算依赖的是块选择。 来源

数据与训练配方 ​

UltraClean

低成本验证

  • 从接近训练完成的 1B模型出发,在退火阶段混入候选数据,观察下游任务变化。
  • 固定基础混合语料,对候选数据单独做对照,避免每次从零预训练。

分类器迭代

  • 将能带来训练收益的语料作为正样本,从多种原始语料中采样负样本。
  • 训练 fastText 质量分类器,并再次验证筛选结果对模型训练的作用。
  • 持续调整种子数据与分类器,稳定后用于全量中英文网页筛选,形成 UltraFineWeb。
UltraClean 数据筛选流程:对比依赖人工种子的传统方法,关注数据质量验证如何反馈到筛选器迭代。
原文图 3:UltraClean 数据筛选流程:对比依赖人工种子的传统方法,关注数据质量验证如何反馈到筛选器迭代。 来源
推理密集型预训练数据

结构化生成

  • 从高质量网页、教材、数学与代码材料选种子,用小于 10B的模型清理和重组文本。
  • 教材式数据按知识点、解释、总结、练习展开,补充系统知识。
  • 论坛式数据生成多轮问答与观点讨论,增加推理路径和表达多样性。

迭代扩展

  • 将生成内容加入种子池继续演化,同时维持领域覆盖,避免合成数据集中于少数模式。
ModelTunnel v2

能力指标

  • 极小模型在任务准确率上常接近随机,普通语料的 LM loss 又未必对应目标能力。
  • ScalingBench 为下游验证题补充推理步骤,计算给定问题时生成推理与答案的条件 loss。
  • 通过不同规模模型建立 loss 与任务表现的映射,用于评价训练配置。

μP 超参迁移

  • 在百万参数级模型上搜索学习率、batch size 与初始化,再迁移到目标模型。
  • 结合实际 WSD 和数据配比验证配置,减少在大模型上反复试验的成本。
预训练计算

Multi-Token Prediction

  • 主模型预测下一 token,额外单层 Transformer 结合 hidden state 与下一 token embedding,继续预测后续 token。
  • 共享 embedding 与输出头,训练目标为 NTP loss + λ × MTP loss。

混合精度

  • 线性层前向和输入梯度使用 FP8,参数梯度使用 BF16,累加使用 FP32。
  • 权重与激活采用分块量化,降低训练开销并控制精度损失。

SFT、RL 与应用训练 ​

知识、推理与指令

知识与推理

  • 从学科知识框架生成 QA,对问题表达和答案形式分别做演化。
  • 数学按主题、教育阶段与难度分层,同题生成多种解法,减少简单题比例。
  • 代码从真实函数、类和算法片段出题,配套单测与输入输出,并扩展到诊断、改写和跨语言转换。

指令遵循

  • 从简单指令逐步叠加内容、格式和风格约束,通过规则验证答案。
  • 同时从高质量现有文本反向生成指令,丰富任务类型。
长上下文与工具数据

长上下文

  • 根据原始文档生成提取、总结和推理问题,再检索相关干扰文档。
  • 将目标文档随机插入长输入,训练模型定位有效信息;覆盖 8K–64K长度。

工具交互

  • Function calling 检查函数是否存在、参数名与类型是否符合 schema,并加入调用前推理。
  • Code Interpreter 让模型在 sandbox 内生成并执行代码,保留执行反馈和修正过程。
  • 10次尝试仍未解决的自建样本被丢弃,形成可完成的交互示范。
数学与代码强化训练

初始化与奖励

  • 先通过蒸馏的 Long-CoT 数据 SFT,建立基本推理能力,再进行 RL。
  • 数学使用规则匹配与 SymPy 验证;代码在 Firejail sandbox 执行,按测试通过比例奖励。

数据与组采样

  • 对 SFT/RL 数据去重,用小推理模型每题采样4次,排除全部答对的简单题。
  • 提高优质代码样本采样比例,缓解数学与代码数据量不均。
  • RL 动态过滤全对、全错的 prompt 组,保留有相对优势差异的训练数据。

策略目标

  • 提高上侧 clipping 阈值维持探索,使用 token-level loss。
  • 达到最大长度而被截断的回答不参与策略 loss,避免把未完成推理直接当作错误。
分块采样与训练调度

长轨迹阻塞

  • 一批任务中少数回答特别长,其他样本结束后 GPU 仍需等待,降低采样利用率。
  • 每轮只生成固定长度 chunk,未完成回答缓存前缀,与下一批新任务一起继续生成。
  • 同一 prompt 的候选回答完成后再计算组奖励,分块不改变完整回答的评价对象。

跨版本概率

  • 两个 chunk 之间可能更新模型,因此同一回答由多个策略版本生成。
  • 保存每个 chunk 对应策略的 log probability,训练时与当前策略概率比较。
  • token 比率使用 当前策略概率 / 生成该chunk的策略概率,按 chunk 对应版本做 IS 校正。
稳定训练

限制策略偏移

  • Dual-clip 限制异常概率比造成的过大更新,抑制部分 off-policy 轨迹引起的 loss 尖峰。
  • 保留 KL 正则,并定期更新 reference,兼顾稳定性与策略持续改进。

异常过滤

  • 缓存前缀与新策略续写可能产生乱码或重复,Garble filter 将这些轨迹移出 loss。
  • chunk 越短,重新计算历史 log probability 越频繁,需要平衡采样与校正成本。
MiniCPM4-Survey

数据与训练

  • 建立论文摘要检索库,将综述训练拆为 Query2Plan 与 Plan2Survey。
  • 小规模 SFT 冷启动后,RL 先优化章节,再优化整篇综述。

奖励与上下文

  • 规划、检索、写作、引用分别评分,结合规则与 LLM 评价事实、覆盖度和深度。
  • 记录完整检索与生成轨迹,以步骤格式惩罚和整条轨迹奖励分配优势。
  • 并行环境交互减少检索、评审等外部服务的等待。
MiniCPM4-MCP

示范构建

  • 将已有问题交给带工具的强模型求解,只保留最终结果匹配的轨迹。
  • 从工具描述反向生成单工具、跨工具任务,再实际调用工具形成示范。
  • 转换已有 function calling 数据,整理约 140K条 MCP 格式数据,进行 SFT。

环境检查

  • MCP servers 封装到 Docker;每个工具生成10个调用问题检查通信是否正常。
  • 通过检查后再暴露给模型,减少环境连接失败混入工具学习。

量化与端侧推理 ​

高精度权重到三值模型

两阶段训练

  • 先训练高精度模型,再将权重量化为三值,继续进行 QAT;激活保留较高精度。
  • QAT 开始时重新 warmup 学习率,帮助模型适应离散权重。
  • 使用 ModelTunnel 搜索高精度与 QAT 的 token 配比,再应用到 0.5B/1B模型。

训练预算

  • BitCPM4 的 QAT 使用约 350B tokens,复用已有基模能力,减少从零量化训练的成本。
推测解码和量化

FR-Spec

  • draft 模型只计算高频词表子集,约 25%词表覆盖约 95%的 token 出现次数。
  • target 模型仍用完整词表验证,降低 draft 输出头成本,同时保留目标分布。

P-GPTQ

  • 前几个位置的异常大激活会主导 GPTQ 校准统计,影响其他 token 的权重量化。
  • 计算 Hessian 时排除开头 4个位置,可与 AWQ smoothing 组合。

联合部署

  • target 量化后单步 Decode 更快,过多 draft 候选的验证成本更容易抵消收益。
  • draft 使用 QAT 保持接受率,长上下文中使用滑动窗口;target 使用稀疏注意力。
CPM.cu 与 ArkInfer

推理执行

  • CPM.cu 结合静态内存管理、kernel fusion、树形候选验证和 InfLLM v2。
  • 稀疏、量化与推测解码统一调度,适配 NVIDIA 端侧硬件。

跨平台适配

  • ArkInfer 用统一 Tensor、KV 管理和 executor 接口接入不同芯片后端。
  • 复用推测解码与 JSON/SQL 约束解码,并提供模型格式转换和调试入口。

实验设置 ​

预训练、后训练与专项实验

模型与预训练

  • MiniCPM4 提供 0.5B/8B;8B 使用约 8T tokens,WSD 稳定阶段约 7T。
  • 先在 4K训练,再用 20B tokens扩展到 32K;LongRoPE/YaRN 支持 128K外推。
  • UltraClean 数据对照使用 1.2B模型,每组约 100B tokens,统一 zero-shot 评测。

MiniCPM4 推理 RL

  • bs=256,mini_bs=128,lr=1e-5,采用 μP 学习率策略。
  • rollout=16,max_response=32768,temperature=1,top_p=1。
  • KL coef=0.001,不加熵约束;数学与代码混合训练。

分块 Rollout 消融

  • 基础模型 DeepSeek-R1-Distill-Qwen-1.5B,DAPO 数据,64张A800,训练 150步。
  • bs=64,rollout=8,lr=3e-6;对比完整生成及 4K/8K/16K chunk。
  • AIME 结果平均 16次评估,记录采样和完整训练 step 耗时。
评测协议

通用与效率

  • OpenCompass 评测中英文知识、数学、代码和 BBH;长上下文使用 RULER-NIAH。
  • 部署效率测试 Jetson AGX Orin 与 RTX4090,输入长度 32K–128K。
  • P-GPTQ 使用 1024条校准序列,各线性层采用分组 INT4。

应用评测

  • SurveyEval:20个主题,由 GPT-4o 评价相关性、覆盖、深度、新颖性与事实支持。
  • MCP:分别评价函数名、参数名与参数值;多步样本提供之前的 GT 步骤。

关键结果(MiniCPM4-8B与分块RL、量化消融) ​

模型能力与数据效率

8B 模型

  • 8项基准平均 81.13,Qwen3-8B 为 80.55,较少训练 token 仍能形成有竞争力的能力。
  • 中文与通用推理较强:CMMLU 80.62、CEval 81.36、BBH 76.73。
  • 数学仍有差距:MATH500 78.60,低于 Qwen3-8B 的 83.20;不能只看平均分。

过滤数据对照

  • 1.2B 控制实验:英文平均从 FineWeb 的 42.28提高到 UltraFineWeb 的 45.89。
  • 中文平均 33.18 → 35.16,说明以实际训练收益迭代分类器能够改善语料质量。
分块 Rollout 的速度与效果

8K Chunk 对照

  • 1.5B 模型 AIME2024 32.91 → 34.79,AIME2025 25.21 → 26.67。
  • 完整训练 step 耗时约降到 59%,采样耗时约降到 44%,缓解长轨迹等待。

更小 Chunk 的取舍

  • 4K 的采样更快,但完整 step 与 8K 接近,因为历史 log probability 校正更频繁。
  • 分块收益来自调度效率,稳定训练依赖跨版本 IS、KL 和异常轨迹处理共同配合。
量化、长文本与应用

端侧部署

  • 128K NIAH 达到 100%,每个 query 只访问约 6K历史 token。
  • Jetson AGX Orin 长上下文测试中,相对 Qwen3-8B Decode 约加速 7倍。
  • S-P-GPTQ 平均分 74.91,高于 GPTQ 的 74.31,更接近 FP16 的 75.58。

应用训练

  • Survey 的 SFT → RL:内容平均 3.11 → 3.50,FactScore 50.24 → 68.73。
  • 收益集中在覆盖、深度和引用事实支持,单独模仿综述格式仍不足。
  • MCP 参数值准确率 51.2,高于 Qwen3-8B 的 43.8,但明显低于自身函数名的 88.3。
  • 工具选择较容易,正确填入复杂参数仍是继续优化的重点。

未来方向 ​

高效训练与端侧能力

数据与训练

  • 提高自动数据质量评估能力,兼顾合成数据的任务相关性与多样性。
  • 优化 chunk 长度与 log probability 计算的取舍,扩大环境交互 RL 的任务范围。
  • 将低成本 QAT 扩展到更大模型,改善小规模量化模型的复杂推理能力。

架构与部署

  • 继续降低长上下文块检索成本,支持更长的端侧任务。
  • 扩大不同芯片的推理支持,联合优化稀疏注意力、量化与推测解码。

(2409) MiniCPM3-4B (工具调用、32K) ​

MiniCPM3-4B

参考链接

工具与长文

  • 4B 文本模型,原生 32K;支持 Function Call 和 Code Interpreter。
  • 模型生成调用或代码,由环境执行并回传结果,用于工具交互、计算和数据处理。
  • 超长文档通过外部 LLMxMapReduce 分块处理,再汇总各块信息。
公开表现
  • BFCL v2 76.0,高于 Qwen2-7B 的 71.6,函数调用是其优势。
  • IFEval Prompt Strict Accuracy 68.4,高于 Phi-3.5-mini 的 49.4。
  • LiveCodeBench v3 22.6,与 Qwen2-7B 的 22.2 接近,较小规模仍保留可用代码能力。

(2408) MiniCPM-V (视觉Token压缩, RLAIF-V) ​

🌺 论文摘要

MiniCPM-V 摘要

参考链接

问题背景

  • 手机端需要同时处理高分辨率、OCR、多语言和视觉幻觉,视觉 tokens 是主要成本来源。

核心方法

  • 自适应切片:保留全局图与局部细节,Resampler 将每块视觉 tokens 压缩到 96 个。
  • 分阶段训练:先适配视觉模块,再全参数 SFT;Caption 改写和样本打包提高数据利用率。
  • RLAIF-V:拆分回答中的事实,由强视觉模型验证,再构造偏好对做 DPO。
  • 端侧部署:4-bit 量化与移动推理优化。

模型效果

  • V 2.5 在 OpenCompass 多模态均分达 65.1,OCRBench 达 725。
  • RLAIF-V 将回答级幻觉率由 13.1% 降到 10.3%。

重要结论

  • 视觉压缩和事实级偏好反馈分别改善推理成本与回答可靠性。

核心贡献

  • 将高分辨率理解、多语言迁移和低内存部署整合为端侧多模态训练方案。

未来方向

  • 继续降低高分辨率和长输入的延迟、功耗,适配移动芯片与运行时。
  • 扩展视频、音频等模态,增强端侧交互能力。
  • 改进不同语言的视觉理解迁移,缩小多语言表现差异。

问题背景 ​

问题背景

端侧多模态模型

  • 手机的内存与算力有限,高分辨率图片会产生大量视觉 tokens。
  • 小模型还需要识别细小文字、减少视觉幻觉,并适配多语言问答。

核心方法 ​

视觉编码与压缩 ​

图像切片与位置编码

自适应切片

  • 按图像面积估计切片数,再比较相邻切片数量的行列组合。
  • 选择与原图宽高比最接近的划分,减少拉伸和无效区域。
  • 每块缩放到 ViT 接近原生分辨率的尺寸,插值适配位置编码。

全局与局部信息

  • 保留一张全局缩略图,与各局部切片一起送入模型。
  • 通过切片分隔符和换行标记保留网格关系,支持最高约 1.8M 像素。
Perceiver Resampler

模型结构

  • SigLIP 视觉编码器 → 单层 Cross-Attention Resampler → LLM。
  • MiniCPM-Llama3-V 2.5 每块将 1024 个视觉 tokens 压缩到 96 个。
  • 压缩查询从完整特征中提取信息,降低 LLM 处理高分辨率输入的成本。
MiniCPM-V 架构与自适应视觉编码:高分辨率图像按比例切片,经视觉编码与共享压缩层后接入 LLM。
原文图 3:MiniCPM-V 架构与自适应视觉编码:高分辨率图像按比例切片,经视觉编码与共享压缩层后接入 LLM。 来源

多模态数据与训练 ​

三阶段预训练

冻结 LLM,逐步适配视觉模块

  • 阶段 1:224×224 输入,仅训练随机初始化的 Resampler,使用 200M 图文对。
  • 阶段 2:提升到 448×448,仅训练 ViT,再使用 200M 图文对。
  • 阶段 3:训练 ViT 与 Resampler,引入自适应高分辨率、OCR 和知识数据。
  • 三个阶段均冻结 LLM,减少视觉对齐对语言能力的干扰。
Caption 改写与样本打包

数据池

  • Caption:约 410M 英文与 110M 中文图文对。
  • OCR 与知识类:约 39M 英文与 11M 中文样本。

数据处理

  • 用 GPT-4 生成种子改写数据,训练一个 LLM 扩展 Caption 改写。
  • 将描述改写为问答,再取答案形成更丰富的图像描述。
  • 将多个样本打包到固定长度序列,通过 position IDs 与 attention mask 隔离样本。
全参数 SFT 与多语言迁移

两阶段 SFT

  • 先训练简短描述、识别型 VQA 与 OCR,再加入详细回答、复杂指令和纯文本数据。
  • V 2.5 补充约 2M Cauldron 样本,强化多任务视觉理解。

多语言能力

  • 多模态预训练以中英文为主,复用 LLM 已有的多语言能力。
  • 再用约 90K、覆盖 36 种语言的 SFT 数据,迁移视觉问答能力。
RLAIF-V 事实反馈与 DPO

候选回答与事实检查

  • 每张图像采样 10 个候选回答,较高温度增加回答差异。
  • Llama3-8B 将回答拆成独立事实,如“图中有两辆车”“左侧车辆为红色”。
  • 将各事实转成 Yes/No 问题,交给更强的视觉模型检查。
  • V 2.5 使用 LLaVA-NeXT-Yi-34B 提供反馈,按不成立的事实数量给回答打分。

偏好构建与更新

  • 在同一问题内组成偏好对,优先选择错误事实更少的回答。
  • 约 3K 张图像构造 6K 偏好对,通过 DPO 更新模型。
  • 训练信号针对具体事实错误,比只评价回答是否流畅更直接。
RLAIF-V 将回答拆成可检查的事实获取反馈,再构建偏好对做 DPO;重点看事实检查如何进入参数更新。
原文图 4:RLAIF-V 将回答拆成可检查的事实获取反馈,再构建偏好对做 DPO;重点看事实检查如何进入参数更新。 来源

端侧部署优化 ​

4-bit 量化与手机部署

端侧推理

  • 采用 GGML 的 Q4_K_M 量化,结合 llama.cpp 运行模型。
  • 按 ViT → LLM 顺序加载模块,减少内存峰值和换页。
  • 在目标设备上编译,匹配其 CPU 指令集,并自动搜索 CPU 核配置。
  • ViT 通过 QNN 使用 NPU 加速,LLM 仍由 llama.cpp 执行。

实验设置(MiniCPM-V) ​

实验设置

基础模型

  • 主模型 MiniCPM-Llama3-V 2.5:Llama3 + SigLIP + Perceiver Resampler,总参数约 8.5B。
  • 报告同时介绍 MiniCPM-V 早期版本;主要结果对应 V 2.5。

训练配置

  • 预训练前两阶段各 200M 图文对,随后增加高分辨率、OCR 与知识数据。
  • 全参数 SFT;多语言增量约 90K 样本,RLAIF-V 使用约 6K 偏好对。

评测协议

  • OpenCompass 多模态榜单汇总 11 项 benchmark,另测 OCRBench、DocVQA 和 ObjHalBench。
  • 多语言实验将 LLaVA Bench 翻译为不同语言,使用 GPT-4 Turbo 评价回答。
  • 端侧实验包含 Xiaomi 14 Pro,搭载 Snapdragon 8 Gen 3。

关键结果(MiniCPM-V) ​

关键结果

整体多模态能力

  • OpenCompass 均分 65.1,高于 Idefics2-8B 的 57.2 与 GPT-4V-1106 的 63.5。
  • OCRBench 725,说明高分辨率切片对文字密集输入有效。
  • DocVQA 84.8,低于 GPT-4V 的 88.4,复杂文档问答仍有提升空间。

事实反馈的作用

  • RLAIF-V 将回答级幻觉率 13.1% → 10.3%,错误实体提及率 6.4% → 5.0%。
  • OpenCompass 均分同时 64.5 → 65.1,减少幻觉没有牺牲整体任务表现。

多语言与资源效率

  • 补充多语言 SFT 后,德语 LLaVA Bench 得分 22.8 → 76.5,少量适配数据即可迁移视觉能力。
  • 视觉序列约 96–960 tokens,低于 LLaVA-NeXT 的 1728–2880,减轻 LLM 输入负担。
  • 4-bit 量化将内存需求从约 16–17GB 降到约 5GB,支持手机端运行。
  • 手机 CPU 解码速度由 1.3 → 8.2 tokens/s,内存与运行配置优化直接改善交互等待。

未来方向 ​

未来方向

优化方向

  • 继续降低高分辨率和长输入的延迟、功耗,适配移动芯片与运行时。
  • 扩展视频、音频等模态,增强端侧交互能力。
  • 改进不同语言的视觉理解迁移,缩小多语言表现差异。

(2404) MiniCPM (WSD, 后期数据配比) ​

🌺 论文摘要

MiniCPM 摘要

参考链接

问题背景

  • 小模型训练需要精细的数据和优化配方,常规学习率日程难以复用不同预算的训练。

核心方法

  • Model Wind Tunnel:小规模搜索超参,通过宽度与深度缩放迁移到更大模型。
  • WSD:Warmup → Stable → Decay,复用 Stable 路径,在不同预算位置分支收敛。
  • 后期数据配比:Decay 混入高质量知识与指令数据,随后继续 SFT。
  • 能力扩展:DPO、长上下文适配等,复用已训练的模型。

模型效果

  • MiniCPM-2.4B SFT:MMLU 53.46、HumanEval 50.0、GSM8K 53.83。
  • DPO 将 MT-Bench 从 6.89 提升到 7.25。

重要结论

  • 小模型的收益不仅来自增加 token,后期数据质量与优化日程同样关键。

核心贡献

  • 提出可复用训练预算、可迁移超参的小模型训练方案,并验证后期数据混合的价值。

未来方向

  • 进一步解释 Decay 阶段的优化动态,改进学习率和数据配比的联合设计。
  • 研究小模型的数据选择与训练预算分配,提高单位训练成本带来的能力增益。
  • 加强复杂推理、长上下文和偏好对齐,减少小模型的能力短板。

问题背景 ​

问题背景

小模型训练效率

  • 小模型需要在有限参数下充分利用训练数据,训练配方对最终能力影响更大。
  • 常规 Cosine 衰减依赖预设训练预算,增加数据或比较不同规模时需要重复训练。
  • 直接用大模型搜索超参成本高,需要能从小规模实验迁移的配置。

核心方法 ​

超参缩放与预算复用 ​

宽度与深度缩放

低成本超参搜索

  • 先在小模型上搜索学习率、初始化与残差缩放,再扩展到更大模型。
  • 采用 Tensor Program 的参数化方式,减少模型宽度变化引起的更新尺度变化。

缩放规则

  • 设宽度比 m=d/d_base,层数为 L;Embedding 输出乘以固定缩放系数。
  • 残差分支乘以 scale_depth/√L,控制深层模型的残差累积。
  • 二维权重的初始化标准差除以 √m,学习率除以 m。
  • 输出 logits 除以 m,使不同宽度的优化过程更接近。

Batch Size

  • 最优 batch 随训练 loss 降低而增大,后期可以增加 batch 提高吞吐。
Warmup–Stable–Decay

三个阶段

  • Warmup:逐步提高学习率,稳定训练初期的更新。
  • Stable:维持较高学习率,持续吸收大规模预训练数据。
  • Decay:从某个 Stable checkpoint 分支,降低学习率完成收敛。

Checkpoint 复用

  • 需要更长训练时,继续 Stable 主线;需要交付模型时,另开 Decay 分支。
  • 不同数据预算共用前面的训练过程,减少重复实验。
  • 例如比较三个训练预算,可从同一 Stable 路径的三个位置分别衰减。
Cosine 与 WSD 的训练日程对照:不同预算可共享 Stable 阶段,再从相应 checkpoint 分支进入 Decay,减少重复训练。
原文图 15:Cosine 与 WSD 的训练日程对照:不同预算可共享 Stable 阶段,再从相应 checkpoint 分支进入 Decay,减少重复训练。 来源
Decay 阶段与高质量数据

两阶段数据配比

  • Stable 以大规模通用语料为主,建立语言、知识与代码基础。
  • Decay 将高质量知识与 SFT 数据混入预训练语料,集中强化任务相关能力。
  • 完成 Decay 后继续单独 SFT,学习指令与回答格式。

数据来源与去重

  • 中文 Common Crawl;英文 Dolma、C4、Pile;代码来自 The Stack 与 StarCoder 数据。
  • 使用 MinHash 做语料内部与跨来源去重。
  • 后期补充 UltraChat、SlimOrca、Evol 等指令数据,以及代码和 K12 题目。

后训练与上下文扩展 ​

SFT、DPO 与长上下文扩展

SFT 与偏好优化

  • SFT 使用约 6B tokens,学习率从 Decay 末期水平继续调整。
  • DPO 在 SFT 模型上训练,使用 UltraFeedback 与数学、代码偏好数据。

长上下文训练

  • 复用预训练 checkpoint,通过 ABF 将上下文从 4K 扩展到 32K。
  • 再用 NTK 扩展与课程训练逐步适配 128K。
  • 长上下文数据混合长文与短文本,并加入合成的长文问答。

实验设置(MiniCPM) ​

实验设置

模型结构

  • 1.2B 与 2.4B 指非 Embedding 参数;总参数还需计入约 0.2B/0.3B 的 Embedding。
  • 共享输入输出 Embedding;1.2B 使用 52 层与 GQA,2.4B 使用 40 层。

训练数据与优化

  • 总训练量约 1.1T tokens,Stable 阶段约 1T,之后进行 Decay 与 SFT。
  • Adam;2.4B batch 约 4M tokens,1.2B 从约 2M 增至 4M。
  • 超参搜索的全局基础学习率为 0.01;二维参数实际学习率按宽度缩放。
  • DPO 训练 1 epoch,学习率 1e-5,使用 Cosine 衰减。

控制实验

  • 后期数据实验从同一 2.4B checkpoint 出发,对比纯预训练数据与混合高质量数据。
  • 两组随后使用相同的 4B tokens SFT,隔离 Decay 数据配比的影响。
  • 另比较 WSD 衰减长度、不同模型规模和训练预算。

关键结果(MiniCPM) ​

关键结果

2.4B 的基础能力

  • SFT 模型 HumanEval 50.0、GSM8K 53.83,表明充分训练的小模型也能形成代码与数学能力。
  • DPO 后 MT-Bench 6.89 → 7.25,偏好优化改善交互质量,同时部分基础任务略有回退。

后期数据混合

  • 同起点、同后续 SFT 的对照中,混合高质量数据使 MMLU 44.6 → 50.9。
  • GSM8K 27.7 → 42.3、HumanEval 27.7 → 30.4,说明在 Decay 阶段引入任务数据有实际收益。

WSD 与训练效率

  • 控制实验中,约占训练过程 10% 的 Decay 已能充分收敛,2.5% 偏短。
  • Loss 的主要下降集中在 Decay,Stable checkpoint 可以继续训练,也可以转入交付分支。
  • 小模型长训练能改善推理部署成本,但需要按模型和数据质量权衡训练投入。

未来方向 ​

未来方向

笔记讨论

  • 进一步解释 Decay 阶段的优化动态,改进学习率和数据配比的联合设计。
  • 研究小模型的数据选择与训练预算分配,提高单位训练成本带来的能力增益。
  • 加强复杂推理、长上下文和偏好对齐,减少小模型的能力短板。
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026