Nex-AGI 开源 Nex-N2.5:mini、Pro、Max 三档模型齐发,SWE-Bench Pro 超越 GPT-5.6
Nex-AGI 是由上海创智学院发起的创新联盟,旨在建设一个可持续的能动性闭环开源生态。今天,Nex-AGI 正式开源 Nex-N2.5,一个面向真实环境长程任务的智能体模型家族,包含 Mini、Pro、Max 三个版本。

Nex-N2.5 三档模型
三款模型共享“智能体后训练”这一主线,按任务与部署规模形成组合:
- Mini 与 Pro 延续 Nex-N2 的多模态底座,重点强化计算机使用、网页浏览与视觉辅助的能动性;
- Max 建立在 DeepSeek-V4-Pro-Base 之上,采用 1.6T 总参、每 Token 激活 49B 的纯文本 MoE 架构,是官方首次在万亿参数规模完成的完整后训练。
在多项权威基准中,Nex-N2.5 与 Claude Opus 5、GPT-5.6 Sol 等顶尖闭源模型互有高低;Max 以 92.6 拿下 BrowseComp 表内最佳、Pro 以 87.4 拿下 OSWorld-G 表内最佳。

ModelScope:
https://modelscope.cn/collections/nex-agi/Nex-N25
GitHub:
https://github.com/nex-agi/Nex-N2.5
blog:
效果与能力
真实 Agent 任务(Nex-N2.5 Max)
案例一:芯片设计
任务从一份存在缺陷的 CRC16-CCITT 流式加速器 RTL 出发,Nex-N2.5 Max 修复逐周期握手、忙碌状态、末字节处理和单周期完成信号,并调用 Verilator、Icarus Verilog、Yosys 与 OpenROAD 完成功能验证、综合及 Sky130 HD 布局布线。
最终通过隐藏功能回归与完整物理实现,生成 GDS、DEF、SPEF 和门级网表;Setup / Hold TNS、详细布线违例均为 0,报告 Fmax 约 386 MHz。

案例二:CAD 设计,用 Python 驱动 SolidWorks 装配机械臂
Nex-N2.5 Max 通过 Python 调用 SolidWorks COM,从零件建模、关节定位到整体装配,构建具有工业产品外观的机械臂。设计以深灰骨架、橙色装甲和金属关节组织结构,补充双指夹爪、分层外壳、法兰与紧固件。
演示视频、装配视图和爆炸视图共同呈现从参数化设计到 CAD 装配的过程,以及各部件的空间关系。


案例三:凝聚态物理
围绕 R3c BiFeO₃ 材料的磁控极化问题,Nex-N2.5 Max 模拟不同磁矩方向下的电极化变化,用路径角度—极化曲线呈现磁态与极化的耦合关系。结果图将晶体结构、磁矩旋转路径和计算曲线联系起来,为分析磁态如何调控电极化提供依据,也展示了低功耗磁电存储相关材料问题的研究过程。

案例四:复杂前端
从“用 SVG 画一只骑自行车的鹈鹕”,到第一人称高达空战、可拆解重拼的乐高城市,Nex-N2.5 Max 将简短自然语言需求转化为可直接体验的前端作品,围绕每个创意补全场景、交互控件与反馈机制,把 SVG 动画、三维场景与游戏逻辑组织成完整页面。

第一人称高达空战

骑自行车的鹈鹕与乐高城市
Vision Agentic 任务(Nex-N2.5 Pro)
案例五:长程游戏操作
任务从《宝可梦 白金》的新游戏开始,要求 Nex-N2.5 Pro 仅凭游戏画面与正常按键,自主阅读对话、寻找路线、推进剧情,并管理队伍的体力、招式与战斗策略。目标是击败黑金道馆的飘太,获得第一枚煤炭徽章;过程涵盖探索、训练、补给和失败后的策略调整,获胜后还需通过游戏内保存与重新载入确认徽章进度。


案例六:Office 办公,LibreOffice 三件套的真实工作流
Nex-N2.5 Pro 阅读 UNEP《Emissions Gap Report 2024》,核对报告标题、章节结构和关键数据,再在 LibreOffice Writer 中整理研究笔记。
正文提炼短结论与证据信号,独立附录记录来源、可见页面核查和信息使用范围,使结论能够回到原报告查证。最终保存为两页可编辑文档,并逐页复核内容与排版。



案例七:创意设计,从 Inkscape 概念图到 Blender 渲染
Nex-N2.5 Pro 先在 Inkscape 中通过图形界面逐步绘制机甲概念板,确定身体比例、装甲轮廓、剑盾装备与配色,再将二维设计转化为 Blender 中的 58 个独立网格分件。
建模过程补全侧面厚度、背部推进器和连接结构,配置金属装甲、深色内构与能量自发光材质,最后加入相机、灯光和展示底座,完成 Eevee 渲染。

Inkscape 概念图与 Blender 渲染
案例八:Vision2Context
许多 Agent 任务受限于用户个性化上下文:例如申请公司 API 额度,模型需要了解内部平台、申请入口与审批流程。
Nex-N2.5 Pro 根据用户授权范围,从主动录制的示范视频或日常屏幕观察中提取这些信息,生成可复用的个性化 Skills,供 NorthCUA、OpenClaw 等 Agent 使用。
两段视频以差旅场景串联操作示范理解、Skill 生成和后续 Computer Use 执行。


技术解读
NexRT 推理基础设施
NexRT 是面向 Nex-N2.5-Pro 的单请求推理引擎,支持在 8 张 H100 或 H200 GPU 上运行普通解码、MTP 和 DFlash。通过定制 CUDA 内核、完整解码 CUDA Graph 和 GPU 直接通信,NexRT 优化从嵌入、注意力、MoE 到采样的整个解码路径。
NexRT 使用 SGLang 完成预填充,并在预填充与解码引擎之间共享路由专家权重;上下文并行注意力进一步减少长上下文中的重复 KV 读取。

NexRT 推理界面

NexRT 吞吐性能
部署与推理
模型下载(以 Max 为例):
modelscope download \
--model nex-agi/Nex-N2.5-Max \
--local_dir ./Nex-N2.5-Max
官方提供预置定制 SGLang 分支的 Docker 镜像 nexagi/sglang:v0.5.18-nex-patch,三个尺寸的启动命令如下。
Nex-N2.5-Max(2 节点 16 × H200)
docker run --gpus all --shm-size 32g --network host \
-v /path/to/your/model:/model \
nexagi/sglang:v0.5.18-nex-patch \
python3 -m sglang.launch_server \
--model-path /path/to/your/model \
--trust-remote-code \
--host 0.0.0.0 --port 8000 \
--nnodes 2 --node-rank "${NODE_RANK}" \
--dist-init-addr "${MASTER_ADDR}:5000" \
--tp 16 --pp-size 1 --dp 1 --ep-size 16 \
--attention-backend dsv4 \
--kv-cache-dtype fp8_e4m3 \
--page-size 256 \
--moe-a2a-backend deepep --moe-runner-backend deep_gemm \
--moe-dense-tp-size 1 --deepep-mode auto \
--context-length 262144 \
--mem-fraction-static 0.84 \
--chunked-prefill-size 8192 --enable-mixed-chunk \
--disable-overlap-schedule --max-running-requests 64 \
--cuda-graph-max-bs-decode 64 \
--cuda-graph-backend-decode full \
--cuda-graph-backend-prefill disabled \
--chat-template /path/to/nex-n2.5-max/chat_template.jinja \
--reasoning-parser deepseek-r1 \
--tool-call-parser qwen3_coder
Nex-N2.5-Pro(单机 8 × H100,权重发布后适用)
docker run --gpus all --shm-size 32g --ipc=host \
-p 30000:30000 -v /path/to/your/model:/model \
nexagi/sglang:v0.5.18-nex-patch \
python3 -m sglang.launch_server \
--model-path /model \
--tp 8 --host 0.0.0.0 --port 30000 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder \
--chat-template /path/to/nex-N2.5-Pro/chat_template.jinja \
--mamba-scheduler-strategy extra_buffer
Nex-N2.5-mini(单机 2 × H100)
docker run --gpus all --shm-size 32g --ipc=host \
-p 30000:30000 -v /path/to/your/model:/model \
nexagi/sglang:v0.5.18-nex-patch \
python3 -m sglang.launch_server \
--model-path /model \
--tp 2 --host 0.0.0.0 --port 30000 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder \
--chat-template /path/to/nex-N2.5-mini/chat-template.jinja \
--mamba-scheduler-strategy extra_buffer
采样与思考模式:官方推荐 temperature=0.7、top_p=0.95、top_k=40。通过 reasoning_effort 控制思考行为:none 不思考直接回答,medium(默认)自适应思考,high 始终思考。
更多推荐




所有评论(0)