NVIDIA Nemotron 3.5 Lightning 开源:30B MoE 仅激活 3B,吞吐最高提升 4 倍
NVIDIA 开源 Nemotron 3.5 Lightning,BF16、NVFP4、NVFP4-DFlash、NVFP4-DSpark 四个权重版本已同步上线魔搭社区。这是一个总参数 30B、激活参数 3B 的混合 MoE 模型,蒸馏自NVIDIA 前沿模型 Nemotron 3 Ultra,与 Nemotron Coalition 共同开发,支持最高 1M 上下文,使用超过 20T tokens 预训练。它是同级别中速度最快的开放模型,用于驱动常驻运行(always-on)的智能体、更快完成专用任务,在高并发量的智能体工作流中可带来最高 4 倍的吞吐提升和最高 30% 的任务完成提速。
常驻智能体能够自主完成复杂的多步骤任务:调研、决策、执行,全程无需人持续介入。为此,智能体需要收集上下文、观察所处环境、基于已知信息推理并采取行动,其中每一步都要调用一次语言模型。但并非每一步都需要同一个模型——复杂的推理与编排需要前沿级别的能力,而高频、重复、领域专用的任务更适合交给专用模型处理。Nemotron 3.5 Lightning 正是面向后者,它面向主流智能体框架(agent harness)构建,并为定制化而设计,企业可针对自有工具、工作流与策略做后训练,同时保有对模型的所有权、改造权,并可在智能体运行的任何位置部署。
模型合集:
https://modelscope.cn/collections/nv-community/Nemotron-35-Lightning
效果
吞吐与任务完成速度
Nemotron 3.5 Lightning 提供最高 4 倍的吞吐提升与最高 30% 的任务完成提速,帮助常驻智能体更快完成高并发量的专用工作。

精度表现
Nemotron 3.5 Lightning 针对智能体任务和主流智能体框架训练,为高效、高可靠的智能体提供领先精度。在 PinchBench、AA-Omniscience Non-Hallucination 等基准上表现优异,这两项分别对应智能体的生产力与可靠性,也是多步骤智能体工作流中最关键的两项能力。
可定制与模型自主可控
模型面向主流智能体框架构建,且易于定制,企业可针对自有的领域工具、工作流与策略对其做后训练,在专用任务上取得领先精度。作为使用开放数据集训练的开放模型,企业可对其进行控制、定制,并部署在边缘、本地和数据中心,同时自主管理模型行为、数据处理与智能体工作流。

此外,NeMo Switchyard 可以把智能体工作流的每一步路由到用户所选模型池中最合适的模型——在高并发量的专用任务场景下选用 Nemotron 3.5 Lightning 这类模型,从而提升精度与效率。
应用场景
比如个人智能体,驱动长时间运行的个人助理处理日常事务,例如管理邮件、日程、项目和预订,这类智能体可以在本地 PC 上运行,从而利用带上下文的个人信息。
比如金融服务工作流,驱动专用智能体从文档中抽取数据、核查政策规则、监控风险信号、生成结构化摘要。
比如网络安全运营,驱动专用智能体完成告警富化、事件分类、日志查询、控制项校验、指标关联,以及为分析师整理结构化结论。
比如电信场景,驱动专用智能体支撑自治网络与主动式客户服务,例如网络告警分诊、网络配置优化、账单问题应答。
比如零售场景,驱动专用智能体完成商品目录富化、库存与履约异常处理、商品发现辅助,以及订单、退货或会员积分类问题应答。
技术
LatentMoE 混合架构
模型采用混合 Latent Mixture-of-Experts(LatentMoE)架构,交错使用 Mamba-2 层与 MoE 层,并搭配部分 Attention 层。在 LatentMoE 架构中,token 会被投影到更小的潜在维度上再进行专家路由与计算,从而提升单位字节的精度表现。模型总参数 30B、激活参数 3B。
多 Token 预测 (MTP,Multi-Token Prediction) 与投机解码
模型引入了 Multi-Token Prediction(MTP)层,通过预测多个未来 token 提供更丰富的训练信号,并借助投机解码(speculative decoding)实现更快的推理。模型提供 3 种投机解码方案,包括 MTP、DFlash、DSpark,本次开源也提供了对应的 NVFP4-DFlash、NVFP4DSpark 权重版本。
NVFP4 预训练配方
模型使用超过 20T tokens 进行预训练,预训练阶段采用 NVFP4 配方以最大化计算效率,支持最高1M 上下文长度。
三阶段训练
预训练阶段使用爬取和合成的代码、数学、科学及通用知识数据,训练软件为 Megatron-LM。
监督微调阶段在合成的代码、数学、科学、工具调用、指令跟随、结构化输出和通用知识数据上继续训练,并纳入了用于支持长距离检索与多文档聚合的数据。
强化学习阶段使用 GRPO(Group Relative Policy Optimization),在数学、代码、科学、指令跟随、多步工具使用、多轮对话和结构化输出等多种环境下进行多环境强化学习。训练采用异步 RL 架构,将训练与推理解耦,并利用 MTP 加速 rollout 生成,所用软件为 NeMo RL 与 NeMo Gym。
训练数据构成
预训练语料由高质量精选内容与合成生成内容混合构成,包括网页、文章、对话,以及法律、数学、科学、金融等领域的文档,其中包含由 GPT-OSS-120B 等教师模型生成的合成推理轨迹与代码,全部数据都经过过滤以保证结构完整性、许可合规,并剔除重复或带政治偏见的输出。语言方面,预训练数据涵盖英语、其他 19 种口语语言和 43 种编程语言,后训练数据主要集中在英语、法语、德语、意大利语、日语、西班牙语和中文。
模型规格
| 项目 | 参数 |
| 架构 | 混合 MoE(Mamba + Transformer) |
| 参数量 | 30B 总参数 / 3B 激活参数 |
| 投机解码 | MTP, Dflash, Dspark |
| 上下文长度 | 最高 1M |
| 模型输入输出 | 文本进,文本出 |
| 蒸馏来源 | Nemotron 3 Ultra |
模型为通用推理与对话模型,主要面向英语和编程语言使用,同时支持西班牙语、法语、德语、意大利语、日语,适用于设计 AI Agent 系统、聊天机器人、RAG 系统及其他 AI 应用的开发者,也适用于常见的指令跟随类任务。
开发者实践
使用 ms-swift 推理与微调
ms-swift day0 支持了 Nemotron 3.5 Lightning 系列模型的微调, ms-swift是魔搭社区官方提供的大模型训练框架,开源地址:https://github.com/modelscope/ms-swift
环境准备:
# pip install git+https://github.com/modelscope/ms-swift.git
git clone https://github.com/modelscope/ms-swift.git
cd ms-swift
pip install -e .
pip install transformers -U
我们介绍使用ms-swift对 Nemotron 3.5 Lightning进行自我认知微调,并对微调后模型进行推理。
自我认知数据集链接:https://modelscope.cn/datasets/swift/self-cognition
PYTORCH_CUDA_ALLOC_CONF='expandable_segments:True' \
NPROC_PER_NODE=2 \
CUDA_VISIBLE_DEVICES=0,1 \
megatron sft \
--model nv-community/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
--save_safetensors true \
--merge_lora false \
--dataset 'swift/Qwen3-SFT-Mixin#2000' \
'swift/self-cognition:empty_think#600' \
--loss_scale ignore_empty_think \
--tuner_type lora \
--lora_rank 8 \
--lora_alpha 32 \
--target_modules all-linear \
--split_dataset_ratio 0.01 \
--expert_model_parallel_size 2 \
--moe_permute_fusion true \
--moe_grouped_gemm true \
--moe_shared_expert_overlap true \
--moe_aux_loss_coeff 1e-3 \
--micro_batch_size 8 \
--global_batch_size 16 \
--recompute_granularity full \
--recompute_method uniform \
--recompute_num_layers 1 \
--num_train_epochs 1 \
--finetune true \
--cross_entropy_loss_fusion true \
--lr 1e-4 \
--lr_warmup_fraction 0.05 \
--min_lr 1e-5 \
--output_dir megatron_output \
--eval_steps 200 \
--save_steps 200 \
--max_length 2048 \
--dataloader_num_workers 8 \
--dataset_num_proc 8 \
--no_save_optim true \
--no_save_rng true \
--sequence_parallel true \
--attention_backend flash \
--model_author swift \
--model_name swift-robot
对验证集进行推理:
CUDA_VISIBLE_DEVICES=0 \
swift infer \
--adapters output/vx-xxx/checkpoint-xxx \
--infer_backend vllm \
--stream true \
--load_data_args true \
--enable_thinking false
如果您需要自定义数据集微调模型,你可以将数据准备成以下格式:
{"messages": [{"role": "user", "content": "What is the capital of Zhejiang?"}, {"role": "assistant", "content": "The capital of Zhejiang is Hangzhou."}]}
{"messages": [{"role": "user", "content": "浙江的省会在哪?"}, {"role": "assistant", "content": "浙江的省会在杭州。"}]}
更多自定义数据格式参考文档 https://swift.readthedocs.io/zh-cn/latest/Customization/Custom-dataset.html
推送微调后的模型到ModelScope:
swift export \
--adapters output/vx-xxx/checkpoint-xxx \
--push_to_hub true \
--hub_model_id '<your-model-id>' \
--hub_token '<your-sdk-token>'
更多推荐




所有评论(0)