9 月 8 日,面壁智能联合 OpenBMB 开源 MiniCPM5-2B。模型采用 2B 参数高密度架构,支持工具调用、深度搜索、代码生成等任务,面向手机、PC、车机和机器人等端侧设备,初步形成通用 Agent 能力。

Artificial Analysis Intelligence Index 最新评测显示,MiniCPM5-2B 综合能力得分为 23 分,在全球 4B 参数以下开源基座模型中排名第一;Agentic Index 得分达到 20 分。本次开源还覆盖训练 Recipe、数据集、强化学习框架及训练策略。

 

全球 4B 以下综合表现最优

在 AA 榜单上,MiniCPM5-2B 的综合能力得分提升至 23 分,位于全球 4B 参数以下开源模型之首,超越 Gemma 4 12B、Qwen3.5 9B 以及各大主流 3B-4B 级别的模型:

在模型的智能密度上,MiniCPM5-2B 实现了极致的参数效率比——以仅 2B 的参数体量,在智能水平上领先参数规模翻倍的 4B 同级开源模型。

这意味着:MiniCPM5-2B 仅用约一半的参数量,就跑出了近乎翻倍的智能得分,单位参数智能密度极高。

在推理效率与输出质量上,MiniCPM5-2B 表现出了 极高的 Token 产出效率

同样消耗 21k Token(14k 思考 + 7k 答案),MiniCPM5-2B 的智力得分高达 23 分、同级第一。同比 Granite 4.2 3B 消耗 19k Token(12k 思考 + 7k 答案),智力得分仅 14 分;LFM2.5-2.6B 消耗 21k Token(14k 思考 + 7k 答案),智力得分仅 11 分。

也就是说,MiniCPM5-2B 用同等甚至更紧凑的计算成本,实现了几乎两倍的智能高度:

在通用 Agent 能力上,MiniCPM5-2B 也体现了高密度端侧语言基础模型的潜力:

根据 AA 榜单成绩,MiniCPM5-2B 获得断层式领先的 20 分,是同级模型(包括 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)的 10 倍能力增长,初步实现了 高智能密度端侧通用 Agent 能力雏形

除了 AA 榜单,MiniCPM5-2B 在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务等方向的 34 项基准评测中也有出色表现:

  • 其平均得分高达 53.9 分,排名第一,不仅领先同级 2B 模型第二名的 33.2 分,也超过 4B 模型中表现最佳的 Qwen3.5-4B。
  • 具体任务上,代码推理、数学推理、长文本、工具调用、搜索智能体、通用智能体等多个领域上均领先同级 2B 乃至参数规模更大的 3B-4B 行业主流模型。

以 1000 分为人类基线,MiniCPM5-2B 在真实任务评测中获得 891 分,居于 4B 以下模型榜首,同时远高于参数规模约为其 6 倍的 Gemma 4 12B(647 分),更接近人类水平。

MiniCPM5-2B 在智能密度与 Token 消耗上的表现,进一步验证了面壁智能首创「密度定律」的科学性,也体现了其在算力与显存有限的手机、车机、PC、机器人等端侧设备上兼顾性能与成本的落地优势。

 

数据治理,让智能更高效

MiniCPM5-2B 高效平衡性能与成本的背后,是 对每一个模型参数潜力的极致挖掘。支撑这一结果的,是面壁智能自 2023 年以来率先积累多年的 数据治理 经验与成果。

受限于算力、显存等因素,目前能够部署到端侧设备上的模型参数规模有限,因此每一个参数的智能密度都直接决定了端侧智能的上限。数据治理是提高智能密度的关键。

MiniCPM5-2B 基于面壁智能 UltraData 的 L0 至 L4 分级数据治理体系,在通用网页、数学、代码、SFT、RL 等多个维度上提出了完善的数据治理方案。伴随 MiniCPM5-2B 一同新开源的,还有 4 个数据集:UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609、UltraX。

UltraData-Code

面向代码预训练与能力优化,覆盖 UltraData L0 至 L3 分级代码数据。项目从约 1.92 亿个公开 GitHub 仓库中采集原始数据,经过清洗去重、算法代码筛选和任务导向的结构化合成,分别形成约 400B 词元的 L2 算法代码精筛数据和约 150B 词元的 L3 任务导向合成数据。

UltraData-SFT-Agent-2609

用于 MiniCPM5-2B 后训练阶段的智能体能力优化,包含约 50 万条训练样本,覆盖工具调用、网页搜索、代码生成、Office 文档处理、数据库交互等任务,可有效提升端侧模型智能体能力。

UltraData-RL-2609

该数据是 MiniCPM5-2B 强化学习阶段的核心数据集,包含超过 8 万条覆盖数学推理、代码生成、通用知识问答和长文本理解的高质量样本。

针对题目不可验证、奖励标签不可信以及难度与模型能力不匹配等问题,数据集通过可验证性过滤、奖励可信性校验和难度匹配三阶段流程进行严格清洗,为 RL 训练提供高信噪比的奖励信号和可靠的数据基础。

UltraX

UltraX是一个面向大规模预训练数据的函数调用式精炼框架。它通过轻量化模型逐条地对数据生成处理脚本,实现低成本、细粒度且可追溯的数据清洗。UltraX 包含五个数据子集,合计约 100B 词元、1.14 亿条样本,可有效提升预训练数据质量。

目前,UltraData 数据集在开源社区已得到广泛验证。截至 2026 年 9 月,UltraData 系列数据集累计下载量超过 266 万次,累计开源数据集数量已超过 10 个。

可扩展的强化学习

此次,随着 MiniCPM5-2B 的开源,面壁智能与 OpenBMB 还开源了全新的自研强化学习框架 Meshy 与基于奖励的强化学习策略 JustRL II。

在训练框架侧,Meshy 彻底丢掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算等全部建模到对等服务,利用 TransferQueue 中的数据就绪状态来驱动实际控制流,能够简单地在同步、异步、全异步三种训练模式中灵活切换,便于扩展。

在算法层面,端侧模型做长思维链强化学习,常常训练过程中分数不升反降:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面 GRPO 信用分配太粗糙,面对上万词元的推理链,分不清哪些对、哪些错。

为此,MiniCPM 团队提出 JustRL II:数据上,用三阶段流水线筛选校准训练数据;算法上,给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。

多款芯片 Day0 适配,加速产业落地

为加速产业落地,MiniCPM5-2B 已与英特尔、瑞芯微、Arm 等多家芯片或计算平台厂商完成了 Day0 首日原生适配,在多款芯片上表现出色。

在英特尔平台上,依托酷睿 Ultra 系列 XPU 全异构算力(CPU、GPU、NPU)以及 OpenVINO™ 工具套件,对 MiniCPM5-2B 开展算子、图融合、内存调度全链路深度优化。

相较于基准版本,预填充(Prefill)和解码(Decode)性能均得到大幅提升;可显著压低运行内存占用,大幅削减长上下文推理时延,以低功耗稳定跑通深思考推理、工具调用、深度搜索、代码生成全套端侧 Agent 能力。

开发者基于英特尔 AI PC 可实现开箱即用的本地化部署,从底层硬件、优化工具链到上层 Agent 应用形成完整闭环,充分释放 MiniCPM5-2B 端侧 AI 的全部产业潜力。

在瑞芯微平台上,MiniCPM5-2B 可以基于 RK3588+RK1828 双芯平台实现完整端侧部署,依托瑞芯微 RKNN3 完整工具链完成模型量化、算子深度优化,依托 RK182X 系列的高带宽优势有效降低大模型首 token 时延,在端侧硬件上稳定运行,完整复现包括深思考推理、工具调用、深度搜索、代码生成等端侧 Agent 核心能力。

在 Arm 计算平台上,MiniCPM5-2B 现已能够在搭载启用第二代可伸缩矩阵扩展(SME2)技术的 Armv9 计算平台的移动设备上实现高效运行。

内置于 Armv9 CPU 架构,Arm SME2 可在 CPU 上直接实现 AI 加速,能够在 AI 异构计算框架下,高效支持各类实时移动端推理任务。

实际测试结果显示,在启用 SME2 技术的移动设备上运行 MiniCPM5-2B 时,预填充(prefill)与解码(decode)阶段的性能分别实现了约 1.7 倍和 1.2 倍的提升,有利于为用户带来更加流畅、智能的端侧 AI 体验。

 

数据、框架、训练方法均开源

面壁智能与 OpenBMB 本次联合开源,不仅开源 MiniCPM5-2B 模型本身,还同时开源模型背后的训练 Recipe(配方)、框架与数据。

近年来,面壁智能联合 OpenBMB 开源社区持续推进基础模型技术开放。截至 2026 年 8 月,MiniCPM 系列模型开源下载量已突破 5000 万,语言基础模型 MiniCPM 开源下载量突破 1300 万。

目前,MiniCPM5-2B 已接入主流开发工具链,并适配多种模型开发与部署工具。

在训练与微调方面,MiniCPM5-2B 已支持 LlamaFactory、ms-swift 等工具;在推理部署方面,已接入 SGLang、vLLM、llama.cpp、Ollama 和 Transformers 等主流框架,并兼容面壁智能自研的 Arclight CPU 推理框架。

 

本地部署

从魔搭下载模型

先安装 ModelScope:

pip install -U modelscope

 

根据运行方式选择对应仓库下载:

# BF16 最终版,适用于 Transformers、vLLM、SGLang
modelscope download --model OpenBMB/MiniCPM5-2B
 
# GGUF 版本,适用于 llama.cpp、Ollama、LM Studio
modelscope download --model OpenBMB/MiniCPM5-2B-gguf
 
# MLX / 4bit 版本,适用于 Apple Silicon
modelscope download --model OpenBMB/MiniCPM5-2B-MLX

 

也可以通过 Python SDK 下载标准版本:

from modelscope import snapshot_download
 
model_dir = snapshot_download("OpenBMB/MiniCPM5-2B")
print(model_dir)

 

使用 vLLM 或 SGLang 时,也可以直接指定从魔搭拉取模型:

VLLM_USE_MODELSCOPE=true vllm serve openbmb/MiniCPM5-2B --port 8000
 
SGLANG_USE_MODELSCOPE=true python -m sglang.launch_server \
  --model-path openbmb/MiniCPM5-2B \
  --port 30000

 

Transformers:本地 Python 推理

安装依赖:

pip install -U "transformers>=5.6" accelerate torch

 

运行示例:

from transformers import AutoModelForCausalLM, AutoTokenizer
 
model_id = "openbmb/MiniCPM5-2B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
)
 
messages = [{"role": "user", "content": "请简要介绍一下你自己。"}]
inputs = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    enable_thinking=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)
 
outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(
    outputs[0][inputs["input_ids"].shape[-1]:],
    skip_special_tokens=True,
))

官方推荐采样参数为 temperature=1.0top_p=0.95。模型原生上下文长度为 131,072 tokens。

vLLM:启动 OpenAI 兼容服务

pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000

 

服务启动后可通过 OpenAI 兼容接口调用:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openbmb/MiniCPM5-2B",
    "messages": [{"role": "user", "content": "请简要介绍一下你自己。"}],
    "max_tokens": 128,
    "temperature": 1.0
  }'

 

vLLM 官方部署说明:https://github.com/OpenBMB/MiniCPM/blob/main/docs/deployment/vllm.md

SGLang:工具调用与 OpenAI 兼容服务

pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server \
  --model-path openbmb/MiniCPM5-2B \
  --port 30000

 

MiniCPM5-2B 使用 XML 风格的工具调用格式。开启工具调用时,添加 --tool-call-parser minicpm5,SGLang 会将其转换为 OpenAI 兼容的 tool_calls

python -m sglang.launch_server \
  --model-path openbmb/MiniCPM5-2B \
  --port 30000 \
  --tool-call-parser minicpm5

 

SGLang 官方部署说明:https://github.com/OpenBMB/MiniCPM/blob/main/docs/deployment/sglang.md

轻量端侧部署:GGUF 与 MLX

CPU、本地桌面或资源受限设备可选择 GGUF 版本,并通过 llama.cpp、Ollama、LM Studio 等工具运行;Apple Silicon 设备可选择 MLX / 4bit 版本。

GGUF 版本

OpenBMB/MiniCPM5-2B-gguf 提供 GGUF 格式权重,适合通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理,可用于 CPU 或 CPU/GPU 混合运行场景。

魔搭地址:https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-gguf

MLX / 4bit 版本

OpenBMB/MiniCPM5-2B-MLX 面向 Apple Silicon 设备,采用 MLX / 4bit 格式,适合在搭载 M 系列芯片的 Mac 上进行低显存占用的本地推理。

魔搭地址:https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-MLX

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐