Nex-AGI 是由上海创智学院发起的创新联盟,旨在建设一个可持续的能动性闭环开源生态。今天,Nex-AGI 正式开源 Nex-N2.5,一个面向真实环境长程任务的智能体模型家族,包含 Mini、Pro、Max 三个版本。

 

Nex-N2.5 三档模型

三款模型共享“智能体后训练”这一主线,按任务与部署规模形成组合:

  • Mini 与 Pro 延续 Nex-N2 的多模态底座,重点强化计算机使用、网页浏览与视觉辅助的能动性;
  • Max 建立在 DeepSeek-V4-Pro-Base 之上,采用 1.6T 总参、每 Token 激活 49B 的纯文本 MoE 架构,是官方首次在万亿参数规模完成的完整后训练。

在多项权威基准中,Nex-N2.5 与 Claude Opus 5、GPT-5.6 Sol 等顶尖闭源模型互有高低;Max 以 92.6 拿下 BrowseComp 表内最佳、Pro 以 87.4 拿下 OSWorld-G 表内最佳。

 

ModelScope:

https://modelscope.cn/collections/nex-agi/Nex-N25

GitHub:

https://github.com/nex-agi/Nex-N2.5

blog:

https://nex-agi.com/

 

效果与能力

真实 Agent 任务(Nex-N2.5 Max)

案例一:芯片设计

任务从一份存在缺陷的 CRC16-CCITT 流式加速器 RTL 出发,Nex-N2.5 Max 修复逐周期握手、忙碌状态、末字节处理和单周期完成信号,并调用 Verilator、Icarus Verilog、Yosys 与 OpenROAD 完成功能验证、综合及 Sky130 HD 布局布线。

最终通过隐藏功能回归与完整物理实现,生成 GDS、DEF、SPEF 和门级网表;Setup / Hold TNS、详细布线违例均为 0,报告 Fmax 约 386 MHz。

 

案例二:CAD 设计,用 Python 驱动 SolidWorks 装配机械臂

Nex-N2.5 Max 通过 Python 调用 SolidWorks COM,从零件建模、关节定位到整体装配,构建具有工业产品外观的机械臂。设计以深灰骨架、橙色装甲和金属关节组织结构,补充双指夹爪、分层外壳、法兰与紧固件。

演示视频、装配视图和爆炸视图共同呈现从参数化设计到 CAD 装配的过程,以及各部件的空间关系。

 

 

案例三:凝聚态物理

围绕 R3c BiFeO₃ 材料的磁控极化问题,Nex-N2.5 Max 模拟不同磁矩方向下的电极化变化,用路径角度—极化曲线呈现磁态与极化的耦合关系。结果图将晶体结构、磁矩旋转路径和计算曲线联系起来,为分析磁态如何调控电极化提供依据,也展示了低功耗磁电存储相关材料问题的研究过程。

 

案例四:复杂前端

从“用 SVG 画一只骑自行车的鹈鹕”,到第一人称高达空战、可拆解重拼的乐高城市,Nex-N2.5 Max 将简短自然语言需求转化为可直接体验的前端作品,围绕每个创意补全场景、交互控件与反馈机制,把 SVG 动画、三维场景与游戏逻辑组织成完整页面。

 

第一人称高达空战

 

骑自行车的鹈鹕与乐高城市

Vision Agentic 任务(Nex-N2.5 Pro)

案例五:长程游戏操作

任务从《宝可梦 白金》的新游戏开始,要求 Nex-N2.5 Pro 仅凭游戏画面与正常按键,自主阅读对话、寻找路线、推进剧情,并管理队伍的体力、招式与战斗策略。目标是击败黑金道馆的飘太,获得第一枚煤炭徽章;过程涵盖探索、训练、补给和失败后的策略调整,获胜后还需通过游戏内保存与重新载入确认徽章进度。

案例六:Office 办公,LibreOffice 三件套的真实工作流

Nex-N2.5 Pro 阅读 UNEP《Emissions Gap Report 2024》,核对报告标题、章节结构和关键数据,再在 LibreOffice Writer 中整理研究笔记。

正文提炼短结论与证据信号,独立附录记录来源、可见页面核查和信息使用范围,使结论能够回到原报告查证。最终保存为两页可编辑文档,并逐页复核内容与排版。

案例七:创意设计,从 Inkscape 概念图到 Blender 渲染

Nex-N2.5 Pro 先在 Inkscape 中通过图形界面逐步绘制机甲概念板,确定身体比例、装甲轮廓、剑盾装备与配色,再将二维设计转化为 Blender 中的 58 个独立网格分件。

建模过程补全侧面厚度、背部推进器和连接结构,配置金属装甲、深色内构与能量自发光材质,最后加入相机、灯光和展示底座,完成 Eevee 渲染。

 

Inkscape 概念图与 Blender 渲染

案例八:Vision2Context

许多 Agent 任务受限于用户个性化上下文:例如申请公司 API 额度,模型需要了解内部平台、申请入口与审批流程。

Nex-N2.5 Pro 根据用户授权范围,从主动录制的示范视频或日常屏幕观察中提取这些信息,生成可复用的个性化 Skills,供 NorthCUA、OpenClaw 等 Agent 使用。

两段视频以差旅场景串联操作示范理解、Skill 生成和后续 Computer Use 执行。

技术解读

NexRT 推理基础设施

NexRT 是面向 Nex-N2.5-Pro 的单请求推理引擎,支持在 8 张 H100 或 H200 GPU 上运行普通解码、MTP 和 DFlash。通过定制 CUDA 内核、完整解码 CUDA Graph 和 GPU 直接通信,NexRT 优化从嵌入、注意力、MoE 到采样的整个解码路径。

NexRT 使用 SGLang 完成预填充,并在预填充与解码引擎之间共享路由专家权重;上下文并行注意力进一步减少长上下文中的重复 KV 读取。

 

NexRT 推理界面

 

NexRT 吞吐性能

部署与推理

模型下载(以 Max 为例):

modelscope download \
  --model nex-agi/Nex-N2.5-Max \
  --local_dir ./Nex-N2.5-Max

 

官方提供预置定制 SGLang 分支的 Docker 镜像 nexagi/sglang:v0.5.18-nex-patch,三个尺寸的启动命令如下。

Nex-N2.5-Max(2 节点 16 × H200)

docker run --gpus all --shm-size 32g --network host \
  -v /path/to/your/model:/model \
  nexagi/sglang:v0.5.18-nex-patch \
  python3 -m sglang.launch_server \
    --model-path /path/to/your/model \
    --trust-remote-code \
    --host 0.0.0.0 --port 8000 \
    --nnodes 2 --node-rank "${NODE_RANK}" \
    --dist-init-addr "${MASTER_ADDR}:5000" \
    --tp 16 --pp-size 1 --dp 1 --ep-size 16 \
    --attention-backend dsv4 \
    --kv-cache-dtype fp8_e4m3 \
    --page-size 256 \
    --moe-a2a-backend deepep --moe-runner-backend deep_gemm \
    --moe-dense-tp-size 1 --deepep-mode auto \
    --context-length 262144 \
    --mem-fraction-static 0.84 \
    --chunked-prefill-size 8192 --enable-mixed-chunk \
    --disable-overlap-schedule --max-running-requests 64 \
    --cuda-graph-max-bs-decode 64 \
    --cuda-graph-backend-decode full \
    --cuda-graph-backend-prefill disabled \
    --chat-template /path/to/nex-n2.5-max/chat_template.jinja \
    --reasoning-parser deepseek-r1 \
    --tool-call-parser qwen3_coder

 

Nex-N2.5-Pro(单机 8 × H100,权重发布后适用)

docker run --gpus all --shm-size 32g --ipc=host \
  -p 30000:30000 -v /path/to/your/model:/model \
  nexagi/sglang:v0.5.18-nex-patch \
  python3 -m sglang.launch_server \
    --model-path /model \
    --tp 8 --host 0.0.0.0 --port 30000 \
    --reasoning-parser qwen3 \
    --tool-call-parser qwen3_coder \
    --chat-template /path/to/nex-N2.5-Pro/chat_template.jinja \
    --mamba-scheduler-strategy extra_buffer

 

Nex-N2.5-mini(单机 2 × H100)

docker run --gpus all --shm-size 32g --ipc=host \
  -p 30000:30000 -v /path/to/your/model:/model \
  nexagi/sglang:v0.5.18-nex-patch \
  python3 -m sglang.launch_server \
    --model-path /model \
    --tp 2 --host 0.0.0.0 --port 30000 \
    --reasoning-parser qwen3 \
    --tool-call-parser qwen3_coder \
    --chat-template /path/to/nex-N2.5-mini/chat-template.jinja \
    --mamba-scheduler-strategy extra_buffer

 

采样与思考模式:官方推荐 temperature=0.7、top_p=0.95、top_k=40。通过 reasoning_effort 控制思考行为:none 不思考直接回答,medium(默认)自适应思考,high 始终思考。

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐