Spark-X2.5开源:4B&1.7B 智能体模型,探索端侧大模型的智能体能力上限
SparkLLM 正式开源 Spark-X2.5 系列,包含 4B 与 1.7B 两档参数规模。该系列采用混合注意力架构,原生支持最长 1M token 上下文,覆盖 200 余种语言,并针对代码、工具调用和智能体工作流进行了后训练。两档模型均提供发布版、Base 版和 GGUF 版,可分别用于直接推理、继续训练与本地运行。

Spark-X2.5 多项能力基准测试
模型合集
https://modelscope.cn/collections/XHToken/Spark-X25
核心特性
高效架构与原生1M上下文:
采取混合注意力架构,每一层全量注意力层搭配三层滑动窗口注意力层,有效削减传统长上下文模型固有的高额计算开销,原生支持 1M 上下文窗口长度。
代码与智能体能力:
深度适配 Claude Code、Hermes、Codex、OpenClaw 等主流脚手架,在智能体工作流、日常代码编写、数学推理以及指令遵循等任务上综合效果达到了同尺寸模型 SOTA 水平。
丰富的硬件生态适配:
支持英伟达、华为、海光、后摩等多种硬件平台,兼容 vLLM、SGLang、llama.cpp、MLX 等主流推理框架,可在 Ollama、LMStudio 等平台上快速部署使用,同时支持 LLaMA-Factory 等微调工具进行定制训练。在多种硬件平台上,Spark-X2.5 拥有同尺寸规模模型更优的 TTFT、TPOT 等性能指标,具备突出的推理运行效率。
全国产训练:
基于国产算力平台完成训练,采用大规模强化学习和 MOPD 等后训练算法,显著提升模型在深度推理、代码、智能体、指令跟随等能力上的效果。
模型结构
在通用 Agent 等任务场景,模型效果、推理速度与缓存占用的平衡难题,一直是制约模型效能释放的核心瓶颈。
Spark-X2.5 依托成熟注意力技术进行系统化整合与架构优化,搭配滑窗注意力与全注意力混合结构,充分融合两种注意力机制的技术优势,规避单一结构的性能短板,有效实现模型效果、推理运行效率、KV 缓存占用尺寸三者的优质权衡,切实提升模型落地场景的适配性与有效性。

Spark-X2.5 混合架构与模型规格
训练方法
Spark-X2.5 使用约 20 万亿 token 的多样化数据进行预训练,覆盖海量网页、书籍、学术文献、代码、百科及其他知识类数据。
重点关注训练数据的质量、领域覆盖范围及不同类型数据之间的采样比例,并通过大量数据配比实验,持续优化数学、逻辑推理、代码及其他高价值领域数据的占比,使模型在获得广泛通用知识的同时,进一步强化复杂推理、代码理解与生成等核心能力。
为提升模型处理长上下文的能力,Spark-X2.5 还使用了千亿 token 的长上下文数据进行专项训练,训练序列长度最高达到 1M token。
后训练阶段首先在精心筛选的高质量 SFT 数据上进行监督微调,使模型具备指令理解、结构化输出和任务完成能力,并为后续强化学习提供稳定的初始化起点。面向多个专业领域开展大规模强化学习,覆盖数学推理、编程、智能体工具调用和指令遵循等关键能力,分别训练具备领域专长的教师 RL 模型。
通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),利用学生模型在线生成的轨迹构建针对不同能力的训练信号,将多个教师模型的优势有效整合到统一的发布模型中,使 Spark-X2.5 获得更加全面、均衡的综合能力。

Spark-X2.5 监督微调、领域专家训练与多教师在线策略蒸馏流程
性能表现
官方在智能体、代码、数学、通用与知识任务上评测了 Spark-X2.5-4B 和 Spark-X2.5-1.7B。4B 版本在多项指标上取得表中最高分;1.7B 版本则以更小参数规模覆盖相同任务类型。
完整对比结果如下

Spark-X2.5 完整性能评测表
单元格中的“*”表示来自开源模型的公开报告结果,“-”表示该项分数暂不可用。
所有评测均在思考模式下进行。Spark-X2.5 的推荐采样参数为:temperature=1.0、top_p=0.95、top_k=-1。
Gaokao 2026 由 2026 年高考数学的五套试卷组成(全国卷 I、全国卷 II、北京卷、上海卷、天津卷),满分为 150 分。
本地部署与推理
Spark-X2.5 官方文档提供 5 种部署与运行方式:SGLang、vLLM、MLX、Ollama 和 LM Studio。其中,SGLang 与 vLLM 适合启动 OpenAI 兼容 API 服务;MLX 支持 Apple Silicon、Linux CPU 与 CUDA 环境;Ollama 和 LM Studio 使用 GGUF 模型,需配合 XHToken 适配版 llama.cpp。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=-1。
模型下载
使用 ModelScope CLI 下载 4B 或 1.7B 发布版模型:
modelscope download --model XHToken/Spark-X2.5-4B --local_dir ./Spark-X2.5-4B
modelscope download --model XHToken/Spark-X2.5-1.7B --local_dir ./Spark-X2.5-1.7B
SGLang
安装 SGLang
使用适配 Spark-X2.5 运行时的预构建镜像:
docker pull lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1
启动推理服务
以下命令指定单 GPU,并启动 OpenAI 兼容 API 服务,最大上下文长度设置为 1,048,576 token;实际部署时应根据显存容量调整 context-length。
服务端
docker run -it \
--gpus '"device=0"' \
--ipc=host \
-p 30000:30000 \
-v "$MODEL_PATH":/root/Spark-X2.5-4B \
lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1 \
python -m sglang.launch_server \
--model-path /root/Spark-X2.5-4B \
--served-model-name spark2.5 \
--tool-call-parser spark25 \
--reasoning-parser qwen3 \
--tp-size 1 \
--mem-fraction-static 0.8 \
--context-length 1048576 \
--chat-template /root/Spark-X2.5-4B/chat_template.jinja \
--host 0.0.0.0 \
--port 30000
客户端调用
聊天模板与 qwen3 reasoning parser 默认启用思考模式。如需对单次请求关闭思考,可设置 chat_template_kwargs:{“enable_thinking”: false}。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=-1。
curl -s http://localhost:30000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "spark2.5", "messages": [ { "role": "user", "content": "安徽的省会在哪里?" } ], "max_tokens": 131072, "temperature": 1, "top_k": -1, "top_p": 0.95, "repetition_penalty": 1, "presence_penalty": 0, "frequency_penalty": 0 }'
vLLM
安装:
pip install uv
uv venv ~/spark2_5
source ~/spark2_5/bin/activate
git clone https://github.com/XHToken/Spark-plugin.git
cd ./Spark-plugin
uv pip install .
服务端:
vllm serve "./Spark-X2.5-4B" \
--port "30000" \
--trust-remote-code \
--served-model-name spark25 \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.7 \
--enable-prefix-caching \
--chat-template Spark-X2.5-4B/chat_template.jinja
客户端调用:
curl -s http://127.0.0.1:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "spark25",
"messages": [{"role": "user", "content": "安徽省的省会是什么?"}],
"temperature": 1.0,
"top_k": -1,
"top_p": 0.95
}'
MLX
安装:
git clone https://github.com/XHToken/Spark-MLX-LLM.git
cd Spark-MLX-LLM
python3 -m venv .venv
source .venv/bin/activate
# Apple silicon
python -m pip install -e .
# Linux cpu
python -m pip install -e '.[cpu]'
# Linux with cuda12
python -m pip install -e '.[cuda12]'
# Linux with cuda13
python -m pip install -e '.[cuda13]'
运行 Spark-X2.5:
spark-mlx-generate \
--device gpu \
--dtype bfloat16 \
--model XHToken/Spark-X2.5-1.7B \
--prompt "请用三句话介绍合肥。" \
--max-tokens 512 \
--temp 0
Ollama(GGUF)
编译:
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8
创建并运行模型
printf 'FROM /absolute/path/to/your.gguf\n' > ./Modelfile.spark
./ollama serve
./ollama create Spark-X2.5-1.7B -f
./Modelfile.spark./ollama run Spark-X2.5-1.7B
LM Studio(GGUF)
LM Studio(GGUF)
编译适配版模型:
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8
配置 LM Studio:
- 关闭 LM Studio,将编译产物复制到
<LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/目录。 - 将
llama.cpp-spark的构建产物复制到<selected-runtime>目录并替换对应文件。 - 将 GGUF 文件放入
<LM_STUDIO_HOME>/models/<org>/<name>/目录。
Example(macOS):
./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-
arm64-apple-metal-advsimd-<version>/
运行:
- LM Studio 图形界面:在 My Models 中选择 Spark-X2.5 模型,点击 Load 后新建对话。
- lms 命令行:
# Replace `<model>` with a model listed by `lms ls`
lms load <model>
lms chat <model>
更多推荐




所有评论(0)