基元律动(TokenRhythm)联合无问芯穹,与清华大学、北京大学、香港中文大学、阿里巴巴等合作伙伴发布 NeoHorse-1,包含 4B 和 9B 两个版本。该系列面向 Agent 场景训练,覆盖工具调用、任务规划、深度搜索和代码生成。

NeoHorse-1 4B 在 Agent 任务上的表现已超过多个参数量显著更大的通用模型;9B 版本在更复杂的推理与长程规划任务上表现更优。两个规模的后训练增益,都最突出地体现在 Agentic 任务上。

NeoHorse-1 Agentic 基准测试

从 Agent 任务中来:Harness 轨迹构成训练数据底座

训练语料以 Routing Harness 在 Agent 执行场景中产生的结构化轨迹为核心,并辅以公开数据。

一次完整的任务执行,会在 Harness 中留下结构化记录:任务请求、能力需求评估、路由选择、模型响应、工具调用、环境反馈、错误与恢复路径、最终完成状态。相比传统问答语料「题目与答案」的形态,执行轨迹多出三个维度的信息:能力需求、执行决策、环境结果。

其中既有成功经验,也有被中途替换的失败轨迹——最终答案只能说明「怎么做对」,失败与修复过程则说明「哪里容易出错、出错后如何恢复」。

Agent 轨迹通常很长,包含系统提示、工具参数、重复尝试、错误信息与中间输出,不能直接用于训练。据技术报告,每条轨迹先经过结构检查,确认请求、模型回复、工具调用与环境结果之间正确对应;再从六个维度进行质量评估:是否完成任务目标、是否遵循指令、工具使用是否合理、结论是否有证据支撑、遇到错误后是否恢复、是否在正确时机终止。

因此,NeoHorse-1 的训练目标从一开始就指向任务完成,而不是在通用模型训练后再补充 Agent 场景适配。团队将这一取向称为 Agent-Native。

 

Agentic Post-Training:用路由信号组织训练

数据筛选完成后,路由信号在训练中发挥第二个作用。

Harness 路由器在每一轮对话上估计「这个任务需要多强的能力」,并归入四个服务档位:C0 处理边界清晰的低风险请求,C1 是通用默认档,C2 支持多步推理与执行,C3 提供最高能力或最高可靠性。

这个档位判断原本只用于线上选模型,NeoHorse-1 把它变成了训练信号。

训练完成后,将路由记录拆成「预测—行动—结果」三段:路由器预测的能力需求、策略实际选择的档位、以及任务最终结果。这种分离让训练侧只用「预测」来排课程,而「结果」字段则提供能力短板信号——哪些子场景反复失败、哪些环节恢复成本高、哪些能力档位供给不足。

这些短板信号被用来调整下一轮的训练数据配比,形成「评测反馈 → 数据配比 → 更新模型」的闭环。报告称之为 Capability-Guided Data Allocation(能力引导的数据配比)。

同一套路由信号承担两项任务:在线阶段判断“这个任务该由谁完成”,离线阶段决定“模型应先学习哪些能力”。由此,能力判断同时成为服务决策机制和训练数据组织方式。

 

RSI:Data-RSI 与 Model-RSI 的单轮闭环

NeoHorse-1 RSI 闭环

NeoHorse-1 同时是递归自我改进(RSI,Recursive Self-Improvement)的一次单轮工程验证。闭环分为两部分:

  • Data-RSI:模型在 Harness 中持续执行任务,每一次路由、工具调用、失败恢复与最终结果都产生新的结构化记录,经筛选处理后成为后续训练的候选材料,随系统运行自然增加;
  • Model-RSI:系统根据评测结果定位当前模型的能力短板,调整下一轮训练数据分布,更新模型,再把新模型放回 Harness 模型池继续工作。

 

模型从执行经验中学习,并通过新的执行过程为下一轮训练提供反馈。

当前 NeoHorse-1 尚不能被视为完整的 RSI 系统。

技术报告验证的是一次“执行—评估—选择—更新”闭环。信号编译、奖励设计和训练流程仍然由人类设定,多代模型能否持续获得稳定增益,也有待后续实验。

这次发布提供了两层验证:结构化执行经验可以转化为模型训练材料;同一 Harness 中可以完成一次“执行—评估—选择—更新”的 RSI 工程闭环。

基元律动将其业务闭环描述为:OpenSquilla 承接 Agent 任务,Routing 识别各环节适配的模型,TokenRhythm API 输出能力,任务反馈再用于迭代路由与模型,更新后的模型重新进入模型池。

NeoHorse-1 将自研 Agent 模型纳入这套多模型协作网络,为“执行轨迹—训练更新—重新执行”的循环提供了首轮实验结果。

 

多方协同:基础设施与算法支持

NeoHorse-1 由基元律动联合多家机构共同完成:

  • 作为联合首发方,无问芯穹提供底层基础设施与推理优化支持,用于承载大规模 Agent 推理任务;其弹性训练系统还用于提升训练效率和稳定性。
  • 由汪玉老师发起,清华大学、北京大学、香港中文大学团队参与算法与训练方法研究;阿里巴巴等机构为模型推理等环节提供支持。

 

本地部署

NeoHorse-1 提供 4B 和 9B 两个 BF16 版本,原生上下文长度均为 262,144 tokens,可扩展至 1,010,000 tokens。实际可用上下文取决于 GPU 显存和服务配置,显存有限时可先降低上下文长度。

安装下载工具

pip install -U modelscope

 

下载模型

4B 与 9B 可按需选择其一:

modelscope download --model TokenRhythm/NeoHorse-1-4B \
  --local_dir ./NeoHorse-1-4B
 
modelscope download --model TokenRhythm/NeoHorse-1-9B \
  --local_dir ./NeoHorse-1-9B

 

SGLang 部署

模型评测使用 SGLang 0.5.17。以下以 4B 版本为例;部署 9B 时,将模型路径和服务名分别改为 ./NeoHorse-1-9B 与 neohorse-1-9b。

pip install "sglang==0.5.17"

 

python3 -m sglang.launch_server \
  --model-path ./NeoHorse-1-4B \
  --served-model-name neohorse-1-4b \
  --host 0.0.0.0 --port 30000 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

 

vLLM 部署

pip install -U vllm

 

vllm serve ./NeoHorse-1-4B \
  --served-model-name neohorse-1-4b \
  --host 0.0.0.0 --port 8000 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

 

OpenAI 兼容 API 调用

服务启动后,可通过 OpenAI SDK 调用。使用 SGLang 时将 base_url 改为 http://localhost:30000/v1。

from openai import OpenAI
 
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY",
)
 
response = client.chat.completions.create(
    model="neohorse-1-4b",
    messages=[{"role": "user", "content": "写一个返回前 n 个斐波那契数的 Python 函数。"}],
    max_tokens=512,
    temperature=1.0,
    top_p=0.95,
)
print(response.choices[0].message.content)

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐