基元律动开源 NeoHorse-1:9B 均分 69.04,超底座 3.44 分
基元律动(TokenRhythm)联合无问芯穹,与清华大学、北京大学、香港中文大学、阿里巴巴等合作伙伴发布 NeoHorse-1,包含 4B 和 9B 两个版本。该系列面向 Agent 场景训练,覆盖工具调用、任务规划、深度搜索和代码生成。
NeoHorse-1 4B 在 Agent 任务上的表现已超过多个参数量显著更大的通用模型;9B 版本在更复杂的推理与长程规划任务上表现更优。两个规模的后训练增益,都最突出地体现在 Agentic 任务上。

NeoHorse-1 Agentic 基准测试
- 模型链接
https://www.modelscope.cn/models/TokenRhythm/NeoHorse-1-4B
https://www.modelscope.cn/models/TokenRhythm/NeoHorse-1-9B - 代码仓库
https://github.com/TokenRhythm/NeoHorse - 技术报告
https://arxiv.org/abs/2609.08183
从 Agent 任务中来:Harness 轨迹构成训练数据底座
训练语料以 Routing Harness 在 Agent 执行场景中产生的结构化轨迹为核心,并辅以公开数据。
一次完整的任务执行,会在 Harness 中留下结构化记录:任务请求、能力需求评估、路由选择、模型响应、工具调用、环境反馈、错误与恢复路径、最终完成状态。相比传统问答语料「题目与答案」的形态,执行轨迹多出三个维度的信息:能力需求、执行决策、环境结果。
其中既有成功经验,也有被中途替换的失败轨迹——最终答案只能说明「怎么做对」,失败与修复过程则说明「哪里容易出错、出错后如何恢复」。
Agent 轨迹通常很长,包含系统提示、工具参数、重复尝试、错误信息与中间输出,不能直接用于训练。据技术报告,每条轨迹先经过结构检查,确认请求、模型回复、工具调用与环境结果之间正确对应;再从六个维度进行质量评估:是否完成任务目标、是否遵循指令、工具使用是否合理、结论是否有证据支撑、遇到错误后是否恢复、是否在正确时机终止。
因此,NeoHorse-1 的训练目标从一开始就指向任务完成,而不是在通用模型训练后再补充 Agent 场景适配。团队将这一取向称为 Agent-Native。
Agentic Post-Training:用路由信号组织训练
数据筛选完成后,路由信号在训练中发挥第二个作用。
Harness 路由器在每一轮对话上估计「这个任务需要多强的能力」,并归入四个服务档位:C0 处理边界清晰的低风险请求,C1 是通用默认档,C2 支持多步推理与执行,C3 提供最高能力或最高可靠性。
这个档位判断原本只用于线上选模型,NeoHorse-1 把它变成了训练信号。
训练完成后,将路由记录拆成「预测—行动—结果」三段:路由器预测的能力需求、策略实际选择的档位、以及任务最终结果。这种分离让训练侧只用「预测」来排课程,而「结果」字段则提供能力短板信号——哪些子场景反复失败、哪些环节恢复成本高、哪些能力档位供给不足。
这些短板信号被用来调整下一轮的训练数据配比,形成「评测反馈 → 数据配比 → 更新模型」的闭环。报告称之为 Capability-Guided Data Allocation(能力引导的数据配比)。

同一套路由信号承担两项任务:在线阶段判断“这个任务该由谁完成”,离线阶段决定“模型应先学习哪些能力”。由此,能力判断同时成为服务决策机制和训练数据组织方式。
RSI:Data-RSI 与 Model-RSI 的单轮闭环

NeoHorse-1 RSI 闭环
NeoHorse-1 同时是递归自我改进(RSI,Recursive Self-Improvement)的一次单轮工程验证。闭环分为两部分:
- Data-RSI:模型在 Harness 中持续执行任务,每一次路由、工具调用、失败恢复与最终结果都产生新的结构化记录,经筛选处理后成为后续训练的候选材料,随系统运行自然增加;
- Model-RSI:系统根据评测结果定位当前模型的能力短板,调整下一轮训练数据分布,更新模型,再把新模型放回 Harness 模型池继续工作。
模型从执行经验中学习,并通过新的执行过程为下一轮训练提供反馈。
当前 NeoHorse-1 尚不能被视为完整的 RSI 系统。
技术报告验证的是一次“执行—评估—选择—更新”闭环。信号编译、奖励设计和训练流程仍然由人类设定,多代模型能否持续获得稳定增益,也有待后续实验。
这次发布提供了两层验证:结构化执行经验可以转化为模型训练材料;同一 Harness 中可以完成一次“执行—评估—选择—更新”的 RSI 工程闭环。
基元律动将其业务闭环描述为:OpenSquilla 承接 Agent 任务,Routing 识别各环节适配的模型,TokenRhythm API 输出能力,任务反馈再用于迭代路由与模型,更新后的模型重新进入模型池。
NeoHorse-1 将自研 Agent 模型纳入这套多模型协作网络,为“执行轨迹—训练更新—重新执行”的循环提供了首轮实验结果。
多方协同:基础设施与算法支持
NeoHorse-1 由基元律动联合多家机构共同完成:
- 作为联合首发方,无问芯穹提供底层基础设施与推理优化支持,用于承载大规模 Agent 推理任务;其弹性训练系统还用于提升训练效率和稳定性。
- 由汪玉老师发起,清华大学、北京大学、香港中文大学团队参与算法与训练方法研究;阿里巴巴等机构为模型推理等环节提供支持。
本地部署
NeoHorse-1 提供 4B 和 9B 两个 BF16 版本,原生上下文长度均为 262,144 tokens,可扩展至 1,010,000 tokens。实际可用上下文取决于 GPU 显存和服务配置,显存有限时可先降低上下文长度。
安装下载工具
pip install -U modelscope
下载模型
4B 与 9B 可按需选择其一:
modelscope download --model TokenRhythm/NeoHorse-1-4B \
--local_dir ./NeoHorse-1-4B
modelscope download --model TokenRhythm/NeoHorse-1-9B \
--local_dir ./NeoHorse-1-9B
SGLang 部署
模型评测使用 SGLang 0.5.17。以下以 4B 版本为例;部署 9B 时,将模型路径和服务名分别改为 ./NeoHorse-1-9B 与 neohorse-1-9b。
pip install "sglang==0.5.17"
python3 -m sglang.launch_server \
--model-path ./NeoHorse-1-4B \
--served-model-name neohorse-1-4b \
--host 0.0.0.0 --port 30000 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
vLLM 部署
pip install -U vllm
vllm serve ./NeoHorse-1-4B \
--served-model-name neohorse-1-4b \
--host 0.0.0.0 --port 8000 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
OpenAI 兼容 API 调用
服务启动后,可通过 OpenAI SDK 调用。使用 SGLang 时将 base_url 改为 http://localhost:30000/v1。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="neohorse-1-4b",
messages=[{"role": "user", "content": "写一个返回前 n 个斐波那契数的 Python 函数。"}],
max_tokens=512,
temperature=1.0,
top_p=0.95,
)
print(response.choices[0].message.content)
更多推荐




所有评论(0)