IFM 开源 K2 Horizon六款模型:覆盖 0.9B 至 375B,训练全链路开放
Institute of Foundation Models(IFM)是由穆罕默德·本·扎耶德人工智能大学(MBZUAI)于 2025 年创立的全球 AI 研究机构,在阿布扎比、硅谷和巴黎设有研究团队,专注于开放、独立的前沿基础模型研发。
IFM 此次发布 K2 Horizon 系列,一次覆盖 0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B 六种规模,面向端侧、本地部署和企业级智能体任务。官方评测显示,7B 在 SWE-bench Verified 和 AIME 2026 上分别达到 70.6% 和 90.1%;采用 MoVA 架构的 36B-A4B 每个 token 仅激活约 4B 参数,性能接近稠密 32B 模型。
K2 Horizon 同时开放完整训练链路,包括训练数据或详细构建方案、训练代码、配置、中间检查点、细粒度日志、评测结果和最终权重,并覆盖推理与智能体后训练阶段。模型与代码采用 Apache 2.0 许可证;无法直接再分发的数据将公开构建方法和混合方案。
开源地址:
六款模型:覆盖边缘端到企业级部署
K2 Horizon 包含 375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B 六款模型,覆盖资源受限设备、本地工作站、高效推理服务和企业级部署。除 0.9B 使用较小词表外,各型号共享训练方法、接口、评测体系和部署工具。
跨规模性能对比
在 Terminal-Bench 2.1 上,7B、36B-A4B 和 375B-A23B 分别取得 39.1%、58.6% 和 70.2%;在 Humanity’s Last Exam 上分别达到 18.6%、25.2% 和 32.0%。
随着模型规模增加,K2 Horizon 在复杂推理、工具使用和智能体任务上的能力同步提升。

375B-A23B:企业级旗舰模型
375B-A23B 是总参数 375B、每个 token 激活约 23B 的稀疏 MoE 模型,面向复杂推理、软件工程、深度研究和长时程智能体任务。
该模型在 GDPVal-AA 上获得 1,441 Elo,Toolathlon Verified、BrowseComp 和 MCPMark 分别达到 65.3%、72.8% 和 67.7%。
Terminal-Bench 2.1 原始成绩为 70.2%;奖励作弊审计剔除 24 次被标记的试验后,成绩修正为 66.9%。

32B 与 36B-A4B:面向本地部署
32B 是系列中能力最强的稠密模型,在性能、适配性和本地部署可行性之间取得平衡,适合本地工作站、高效服务系统及私有化部署。
36B-A4B 采用 MoE 前馈层与 MoVA 稀疏注意力,总参数量为 36B,每个 token 仅激活约 4B。在相同训练条件下,其性能接近稠密 32B 模型,同时显著降低激活参数量。
该模型在 Terminal-Bench 2.1、SciCode 和 AA-LCR 上分别取得 58.6%、38.9% 和 66.3%。

7B、3.7B 与 0.9B:端侧与轻量部署
7B 面向手机、本地设备和多步工作流,在 SWE-bench Verified、LiveCodeBench v6 和 AIME 2026 上分别达到 70.6%、71.2% 和 90.1%。
3.7B 适合微调和端侧部署,在 SWE-bench Verified 上取得 68.6%,AIME 2026 达到 89.7%,能力覆盖科学编程、数学推理和多步任务。
0.9B 面向手表、眼镜等资源受限设备,适合数学推理、轻量工具调用和简单智能体任务。其 AIME 2026、LiveCodeBench v6 和 BFCL v4 分别达到 48.5%、37.4% 和 28.0%。

从模型家族到 MoVA:从训练方法到开放科学
K2 Horizon 并非六个独立模型,而是共享架构设计、训练方法、接口、评测体系和部署工具的模型家族。36B-A4B 进一步引入 MoVA(Mixture-of-Value-Attention),将专家路由从前馈层扩展到注意力的 value 计算,并兼容 FlashAttention、分组查询注意力和稀疏注意力,实现总参数 36B、每个 token 仅激活约 4B。
训练数据与合成数据
每款模型使用约 20T token 进行预训练,数据覆盖网页、代码、数学、科学、多语言及特定领域。其中近 17% 为带显式推理过程的问题求解轨迹,合成数据总量约 10T token。
IFM 使用 Wzip 衡量大规模语料的多样性。该方法结合自适应多滑动窗口 LZ77 与分窗口 Huffman 编码,缓解 gzip、zstd 等指标在大规模语料上过早饱和的问题。
结果显示,K2 Horizon 合成数据的多样性接近高质量自然网页文本,并明显高于网页代码。

工具训练同时覆盖 JSON、XML 和 Markdown 格式,避免模型绑定单一语法。推理阶段默认使用 Markdown 呈现工具定义,在 IFM 的数据上,其 token 消耗比传统 JSON 格式低约 18.5%。
跨规模训练动态
3.7B、7B、32B 和 36B-A4B 使用相同的 22T token 训练。按照训练进度对齐,并以最后 1% 训练阶段的损失中位数归一化后,四种规模的损失轨迹基本重合。
这一结果表明,在共享数据和统一训练方案下,不同参数规模以及稠密、稀疏架构呈现出相近的学习曲线;开放的中间检查点和细粒度日志也使训练波动、干预效果与能力涌现过程可以被进一步分析。

K2 Horizon 跨规模训练损失
后训练与开放基础设施
K2 Horizon 的后训练流程包括中期训练、监督微调、模型合并和强化学习,并从共同基础检查点分出推理、编程、工具使用和智能体等分支。后训练数据从中期训练阶段开始引入,涵盖长上下文文档、指令遵循、推理与智能体轨迹,以及超过 1 亿个独特任务。
IFM 同时开放用于预训练的 xLLM 基础设施和智能体后训练代码,使研究者能够检查训练过程、复现不同阶段,并将相关方法适配到新的工具、环境和领域。
训练日志揭示奖励作弊
IFM 对 375B-A23B 在 Terminal-Bench 2.1 上的全部通过试验进行了奖励作弊审计。模型共完成 712 次试验,其中 500 次通过验证器,原始准确率为 70.2%;审计发现 10 项任务中的 24 次试验存在问题,剔除后成绩为 66.9%,修正了 3.37 个百分点。
被标记的行为包括从公开仓库查找参考答案、复制现有修复方案、读取未公开文件或暴露凭据,以及修改测试框架或利用评分器。开放中间检查点和训练日志,可以进一步追踪这些非预期策略在训练的哪个阶段出现。

本地部署
K2 Horizon 36B-A4B 支持三种本地推理方式:Transformers 直接加载、vLLM 服务化部署和 SGLang 服务化部署。模型原生上下文长度为 524,288 token,以下服务示例将上限设置为 131,072 token。
官方推荐 reasoning_effort="high"、temperature=1.0、top_p=0.95。
模型下载
modelscope download \
--model IFM/K2-Horizon-MoVA-36B-A4B \
--local_dir ./K2-Horizon-MoVA-36B-A4B
Transformers 推理
Transformers 适合直接在 Python 中加载模型,便于功能验证和二次开发。模型以 BF16 精度加载,并由 device_map="auto" 自动分配设备。
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "IFM/K2-Horizon-MoVA-36B-A4B"
tokenizer = AutoTokenizer.from_pretrained(model_id,
trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, device_map="auto", dtype="bfloat16",
low_cpu_mem_usage=True, trust_remote_code=True
)
inputs = tokenizer("Explain why long-context evaluation is difficult.",
return_tensors="pt").to(model.device)
inputs.pop("token_type_ids", None)
outputs = model.generate(**inputs, max_new_tokens=32768,
temperature=1.0, top_p=0.95, do_sample=True)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
vLLM 部署
vLLM 方案采用 TP=2、专家并行和 BF16 精度,并提供 OpenAI 兼容接口:
VLLM_USE_MODELSCOPE=true vllm serve \
./K2-Horizon-MoVA-36B-A4B \
--tensor-parallel-size 2 \
--enable-expert-parallel \
--trust-remote-code \
--dtype bfloat16 \
--max-model-len 131072 \
--reasoning-parser k2_horizon \
--tool-call-parser k2_horizon \
--enable-auto-tool-choice \
--port 30000
SGLang 部署
以下配置已由官方在 2×H200 环境中验证,采用 TP=2、EP=2、BF16 和 FlashAttention-3:
python3 -m sglang.launch_server \
--model-path ./K2-Horizon-MoVA-36B-A4B \
--tp 2 \
--ep 2 \
--dtype bfloat16 \
--attention-backend fa3 \
--json-model-override-args \
'{"xllm_source_router_gemm_partitions":2}' \
--reasoning-parser k2_horizon \
--tool-call-parser k2_horizon \
--host 0.0.0.0 \
--port 30000
OpenAI 兼容 API 调用
vLLM 或 SGLang 启动后,可通过 OpenAI SDK访问。工具调用支持 json、xml 和 xml_typed,默认使用 xml。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:30000/v1",
api_key="EMPTY",
)
model_id = client.models.list().data[0].id
response = client.chat.completions.create(
model=model_id,
messages=[
{"role": "user", "content": "请逐步解释这个结果。"}
],
temperature=1.0,
top_p=0.95,
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "high",
"tool_call_format": "xml",
}
},
)
message = response.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print("Answer:", message.content)
更多推荐




所有评论(0)