SparkLLM 正式开源 Spark-X2.5 系列,包含 4B 与 1.7B 两档参数规模。该系列采用混合注意力架构,原生支持最长 1M token 上下文,覆盖 200 余种语言,并针对代码、工具调用和智能体工作流进行了后训练。两档模型均提供发布版、Base 版和 GGUF 版,可分别用于直接推理、继续训练与本地运行。

Spark-X2.5 多项能力基准测试

模型合集

https://modelscope.cn/collections/XHToken/Spark-X25

 

核心特性

高效架构与原生1M上下文:

采取混合注意力架构,每一层全量注意力层搭配三层滑动窗口注意力层,有效削减传统长上下文模型固有的高额计算开销,原生支持 1M 上下文窗口长度。

代码与智能体能力:

深度适配 Claude Code、Hermes、Codex、OpenClaw 等主流脚手架,在智能体工作流、日常代码编写、数学推理以及指令遵循等任务上综合效果达到了同尺寸模型 SOTA 水平。

丰富的硬件生态适配:

支持英伟达、华为、海光、后摩等多种硬件平台,兼容 vLLM、SGLang、llama.cpp、MLX 等主流推理框架,可在 Ollama、LMStudio 等平台上快速部署使用,同时支持 LLaMA-Factory 等微调工具进行定制训练。在多种硬件平台上,Spark-X2.5 拥有同尺寸规模模型更优的 TTFT、TPOT 等性能指标,具备突出的推理运行效率。

全国产训练:

基于国产算力平台完成训练,采用大规模强化学习和 MOPD 等后训练算法,显著提升模型在深度推理、代码、智能体、指令跟随等能力上的效果。

 

模型结构

在通用 Agent 等任务场景,模型效果、推理速度与缓存占用的平衡难题,一直是制约模型效能释放的核心瓶颈。

Spark-X2.5 依托成熟注意力技术进行系统化整合与架构优化,搭配滑窗注意力与全注意力混合结构,充分融合两种注意力机制的技术优势,规避单一结构的性能短板,有效实现模型效果、推理运行效率、KV 缓存占用尺寸三者的优质权衡,切实提升模型落地场景的适配性与有效性。

Spark-X2.5 混合架构与模型规格

 

训练方法

Spark-X2.5 使用约 20 万亿 token 的多样化数据进行预训练,覆盖海量网页、书籍、学术文献、代码、百科及其他知识类数据。

重点关注训练数据的质量、领域覆盖范围及不同类型数据之间的采样比例,并通过大量数据配比实验,持续优化数学、逻辑推理、代码及其他高价值领域数据的占比,使模型在获得广泛通用知识的同时,进一步强化复杂推理、代码理解与生成等核心能力。

为提升模型处理长上下文的能力,Spark-X2.5 还使用了千亿 token 的长上下文数据进行专项训练,训练序列长度最高达到 1M token。

后训练阶段首先在精心筛选的高质量 SFT 数据上进行监督微调,使模型具备指令理解、结构化输出和任务完成能力,并为后续强化学习提供稳定的初始化起点。面向多个专业领域开展大规模强化学习,覆盖数学推理、编程、智能体工具调用和指令遵循等关键能力,分别训练具备领域专长的教师 RL 模型。

通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),利用学生模型在线生成的轨迹构建针对不同能力的训练信号,将多个教师模型的优势有效整合到统一的发布模型中,使 Spark-X2.5 获得更加全面、均衡的综合能力。

Spark-X2.5 监督微调、领域专家训练与多教师在线策略蒸馏流程

 

性能表现

官方在智能体、代码、数学、通用与知识任务上评测了 Spark-X2.5-4B 和 Spark-X2.5-1.7B。4B 版本在多项指标上取得表中最高分;1.7B 版本则以更小参数规模覆盖相同任务类型。

完整对比结果如下

Spark-X2.5 完整性能评测表

单元格中的“*”表示来自开源模型的公开报告结果,“-”表示该项分数暂不可用。
所有评测均在思考模式下进行。Spark-X2.5 的推荐采样参数为:temperature=1.0、top_p=0.95、top_k=-1。
Gaokao 2026 由 2026 年高考数学的五套试卷组成(全国卷 I、全国卷 II、北京卷、上海卷、天津卷),满分为 150 分。

 

本地部署与推理

Spark-X2.5 官方文档提供 5 种部署与运行方式:SGLang、vLLM、MLX、Ollama 和 LM Studio。其中,SGLang 与 vLLM 适合启动 OpenAI 兼容 API 服务;MLX 支持 Apple Silicon、Linux CPU 与 CUDA 环境;Ollama 和 LM Studio 使用 GGUF 模型,需配合 XHToken 适配版 llama.cpp。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=-1。

模型下载

使用 ModelScope CLI 下载 4B 或 1.7B 发布版模型:

modelscope download --model XHToken/Spark-X2.5-4B --local_dir ./Spark-X2.5-4B
modelscope download --model XHToken/Spark-X2.5-1.7B --local_dir ./Spark-X2.5-1.7B

SGLang

安装 SGLang

使用适配 Spark-X2.5 运行时的预构建镜像:

docker pull lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1

启动推理服务

以下命令指定单 GPU,并启动 OpenAI 兼容 API 服务,最大上下文长度设置为 1,048,576 token;实际部署时应根据显存容量调整 context-length

服务端

docker run -it \
  --gpus '"device=0"' \
  --ipc=host \
  -p 30000:30000 \
  -v "$MODEL_PATH":/root/Spark-X2.5-4B \
  lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1 \
  python -m sglang.launch_server \
    --model-path /root/Spark-X2.5-4B \
    --served-model-name spark2.5 \
    --tool-call-parser spark25 \
    --reasoning-parser qwen3 \
    --tp-size 1 \
    --mem-fraction-static 0.8 \
    --context-length 1048576 \
    --chat-template /root/Spark-X2.5-4B/chat_template.jinja \
    --host 0.0.0.0 \
    --port 30000

 

客户端调用

聊天模板与 qwen3 reasoning parser 默认启用思考模式。如需对单次请求关闭思考,可设置 chat_template_kwargs:{“enable_thinking”: false}。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=-1。

curl -s http://localhost:30000/v1/chat/completions \  -H "Content-Type: application/json" \  -d '{    "model": "spark2.5",    "messages": [      {        "role": "user",        "content": "安徽的省会在哪里?"      }    ],    "max_tokens": 131072,    "temperature": 1,    "top_k": -1,    "top_p": 0.95,    "repetition_penalty": 1,    "presence_penalty": 0,    "frequency_penalty": 0  }'

vLLM

安装:

pip install uv
uv venv ~/spark2_5
source ~/spark2_5/bin/activate
git clone https://github.com/XHToken/Spark-plugin.git
cd ./Spark-plugin
uv pip install .

服务端:

vllm serve "./Spark-X2.5-4B" \
  --port "30000" \
  --trust-remote-code \
  --served-model-name spark25 \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.7 \
  --enable-prefix-caching \
  --chat-template Spark-X2.5-4B/chat_template.jinja

客户端调用:

curl -s http://127.0.0.1:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spark25",
    "messages": [{"role": "user", "content": "安徽省的省会是什么?"}],
    "temperature": 1.0,
    "top_k": -1,
    "top_p": 0.95
  }'

MLX

安装:

git clone https://github.com/XHToken/Spark-MLX-LLM.git
cd Spark-MLX-LLM
python3 -m venv .venv
source .venv/bin/activate
 
# Apple silicon
python -m pip install -e .
 
# Linux cpu
python -m pip install -e '.[cpu]'
 
# Linux with cuda12
python -m pip install -e '.[cuda12]'
 
# Linux with cuda13
python -m pip install -e '.[cuda13]'

运行 Spark-X2.5:

spark-mlx-generate \
  --device gpu \
  --dtype bfloat16 \
  --model XHToken/Spark-X2.5-1.7B \
  --prompt "请用三句话介绍合肥。" \
  --max-tokens 512 \
  --temp 0

Ollama(GGUF)

编译:

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8

创建并运行模型

printf 'FROM /absolute/path/to/your.gguf\n' > ./Modelfile.spark
./ollama serve
./ollama create Spark-X2.5-1.7B -f 
./Modelfile.spark./ollama run Spark-X2.5-1.7B
LM Studio(GGUF)

LM Studio(GGUF)

编译适配版模型:

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8

配置 LM Studio:

  • 关闭 LM Studio,将编译产物复制到 <LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/ 目录。
  • 将 llama.cpp-spark 的构建产物复制到 <selected-runtime> 目录并替换对应文件。
  • 将 GGUF 文件放入 <LM_STUDIO_HOME>/models/<org>/<name>/ 目录。
Example(macOS):
./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-
arm64-apple-metal-advsimd-<version>/

运行:

  • LM Studio 图形界面:在 My Models 中选择 Spark-X2.5 模型,点击 Load 后新建对话。
  • lms 命令行:
# Replace `<model>` with a model listed by `lms ls`
lms load <model>
lms chat <model>
Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐