蚂蚁百灵 Ling-3.0-flash 开源:仅激活 5.1B,对齐上一代 1T 级旗舰
最近,蚂蚁百灵团队正式发布并开源了新一代原生混合推理模型 Ling-3.0-flash。
它采用 124B 总参数、5.1B 激活参数的 MoE 架构,与上一代 1T 级旗舰思考模型 Ring-2.6-1T 相比,其总参数量约为后者的 12.4%,激活参数量约为 8.1%。官方评测显示,在多项推理、指令遵循、长文本与 Agent 任务上,它能够对齐或超过上一代旗舰及部分更大规模模型。
更关键的是,这次开源同步提供基础版本、FP8、FP4 与 INT4 多种权重,使模型可以从云端 API 延伸到本地设备与专属推理集群。对开发者来说,Ling-3.0-flash 的看点因此不只是“更小”,而是能力、速度、成本和部署自主性之间的重新平衡。

模型合集:
https://modelscope.cn/collections/inclusionAI/Ling-30-flash
案例展示
Ling-3.0-flash 更适合被放在边界清晰、可调用工具、结果可验证的执行链路中。以下五类场景,分别展示其空间推理、多智能体协作、办公自动化、前端生成与本地数据处理能力。
Blender 自动化建模:一句话搭建城市并渲染航拍

Ling-3.0-flash已经突破了平面代码的限制,可以直接介入 3D 设计世界,成为你随时可调用的虚拟三维建模助理。
在Blender使用场景中,Ling-3.0-flash 通过 Blender MCP 接口控制 3D 软件,自动编写 Python 脚本在一句话指令下搭建包含高架路网、摩天大楼与材质的城场景,最后设置相机路径并渲染输出航拍视频。
在生成过程中,Ling-3.0-flash 体现出了复杂 3D 几何空间推理、Blender Python API 控制以及长程 MCP 工具调用等能力。
自主多智能体科研大盘:角色分工完成研究闭环

拿到一个课题不知从何下手?Ling-3.0-flash可以扮演多重角色快速进行文献检索、数据质询,并生成论文,合成你需要的PPT。
Ling-3.0-flash 搭建的自主多智能体科研大盘,支持跨角色(Scientist, Data Analyst, CrossValidator, Archivist, Writer)自主进行假说推演、文献检索、数据质询打回、黄区现场研讨与自动化成果论文及 Slide 报告合成。
Office 自动化:从凌乱草稿到 Word、Excel 与 PDF

如果你有一堆凌乱的立项草稿和预算数据需要梳理,不需要手动调格式和套公式,模型能像私人秘书一样帮你完成这些日常核算工作。
面向真实的办公场景,Ling-3.0-flash 能够基于 Office MCP 接口,由 AI 直接读取并排版 Word 提案(调整格式并生成目录),同时核算 Excel 财务数据(处理 SUMIF 公式与透视表汇总),最终输出规范文档与 PDF 滚动长图。
过程中表现出了Ling-3.0-flash 对多模态文档解析、Office API 精细控制与自动化长程执行的稳定性。
批量美学网页生成:不用图片素材完成视觉表达

大模型不仅是代码工具,更是设计大师。即使没有任何图片素材,Ling-3.0-flash只凭代码,就能批量为你搭建出极具视觉冲击力的前卫艺术网页。
Ling-3.0-flash 批量生成了数个现代设计流派页面(含包豪斯、波西米亚、酸性设计等,包含 Easy 到 Hard 渐进难度),在不依赖外部图片的前提下,纯靠 CSS 渐变、SVG 路径和排版布局还原流派质感。
不同风格的页面生成展现出了Ling-3.0-flash 对视觉流派设计的理解力、极高质量的前端代码批量生成与无图美学排版能力。
研究数据本地处理:敏感信息在单机内闭环
在单台 NVIDIA DGX Spark 上部署 Ling-3.0-flash,构建了一套面向医疗研究数据处理的本地 Agentic Pipeline。模型和数据均在本地环境中运行,减少患者信息进入外部链路的风险,并可辅助完成:
- 敏感信息处理:对身份信息进行脱敏,并为研究样本分配动态 ID,降低后续处理过程中关联真实身份的风险。
- 医疗信息结构化:从原始资料中提取生命体征、血液生化指标和彩超报告等信息,将分散数据整理为可用于研究分析的结构化结果。
- 研究流程辅助:按照研究规则完成样本初步分组;对于异常、复杂或证据不足的样本,统一标记为“Unclassified”,交由专业人员进一步复核。

这一案例体现了 Ling-3.0-flash 单机部署的实际价值:在降低敏感医疗数据外传风险的同时,将重复的信息提取、整理和初步分类转化为可持续运行的本地流程,让研究人员把更多时间用于真正需要专业经验和责任判断的工作。
模型用于医疗研究与数据处理辅助,不替代专业人员判断或临床诊断。实际应用仍需满足相关法规、伦理审查,以及组织内部的权限管理、日志审计和数据治理要求。
技术解析
Ling-3.0 架构升级:124B 释放 1T 级能力
Ling-3.0 系列模型在架构设计上实现系统性升级,深度融合长上下文计算、状态记忆与专家路由优化,以更低的单 Token 激活规模承载并转化更大容量的知识与能力。
Hybrid-linear:原生混合线性注意力架构
不同于 Ling-2.6 依赖架构迁移进行预训练改造,Ling-3.0 从预训练伊始即采用原生混合线性注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层(每 6 层包含 5 层 KDA 和 1 层 MLA)。该设计使全链路模型组件在整个训练周期内深度协同优化,在长上下文效率与模型能力之间实现更优平衡。
Ling-3.0 将上一代的 Lightning Attention 升级为 KDA(Kimi Delta Attention)。KDA 在 Delta Rule 的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。 这一机制显著提升了有限状态记忆的控制精度,使模型在处理长文档、大型代码库和复杂资料包时,能够精准维护跨段落、跨步骤的关键信息,为长上下文检索、信息整合和持续推理奠定坚实的架构基础。
基于 Ling Scaling Law,更低的专家激活比例可带来更高的“效率杠杆”,即以更少的实际计算获得更高的等效模型能力。因此,Ling-3.0 将每个 Token 的专家激活比例由前代的 1⁄32 进一步降低至 1/64,以极低的计算消耗驱动模型能力的跃迁。
综上,原生混合线性注意力、KDA 与稀疏 MoE 三者深度协同,大幅提升了参数规模、计算开销与模型能力之间的转化效率,为 Ling-3.0-flash 在 124B(激活 5.1B)规模下的跨越式发展提供了坚实的架构支撑。
以极致智能密度,探索能力边界与落地极限
在上一代 flash 模型对智能密度与智效比极致探索的基础之上,Ling-3.0-flash 持续全面进化。百灵团队不求单纯的“大而全”,而是专注于在“足够强”的前提下,把“快、省、可落地”做到极致,不断突破模型能力的上限与智能密度的绝对边界。面对更大尺寸的 SOTA 模型及上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 在多项关键指标上展现出不逊色甚至更优的越级表现:
- 核心能力全面对标,性能实现越级。Ling-3.0-flash 在传统推理、指令遵循与长文本交互上展现出向更大体量模型对比的底气,不仅全面覆盖数学、传统逻辑与代码等核心复杂场景,精准驾驭多约束及智能体环境下的严苛指令,更能从容支撑海量上下文处理,保障长周期、多轮次深度交互中复杂业务逻辑的持续推进。
- 多场景深度适配,Agent 扎实落地。围绕当下最炙手可热的 Agent 场景,Ling-3.0-flash 展现出极高的场景契合度,做到“能力强、响应快、协同稳”。无论是深度覆盖代码生成、多文件重构与结果验证的 Coding Agent,具备出色任务规划、工具组合与动态调整能力的 General Agent,还是专注于多轮检索、跨源整合与证据闭环的 Deep Research Agent,模型均能扎实落地,以卓越的闭环执行力从容驾驭各类复杂生产力场景。
- 极致智能密度,兼顾高性能与高性价比。在追求高性能的同时,Ling-3.0-flash 在智能密度与智效比的维度上追求极致。凭借极少的总参数与激活参数,模型在多项测评指标中达到或超过大尺寸 SOTA 与上一代旗舰 Ring-2.6-1T,更将推理开销压至极低。这种极致的智能密度转化为实际应用价值,意味着更短的生成时延、更快的首字响应(TTFT)与更低的 API 调用成本,全面赋能高频线上服务与真实 Agent 的落地。

评测默认开启思考模式,计算均分时使用所有模型都有评测得分的部分。
智能密度(IQ/显存成本) = 平均榜单分数 ÷ 总参数量(B),代表“单位显存下的智能水平”,衡量起步部署硬件门槛
智效比(IQ/计算成本) = 平均榜单分数 ÷ 单 token 激活参数量(B),代表“单位计算算力下的智能水平”,衡量高并发服务能力
激活参数决定单次推理计算量与服务吞吐:Ling-3.0-flash 仅需 5.1B 激活参数即可提供具有竞争力的智能分数。
Agent 全面进化:能力强、响应快、协同稳
值得一提的是,Ling-3.0-flash 还围绕真实生产力场景,对 Agent 能力、运行效率与协同架构进行了系统升级。面对复杂约束和长程任务,Ling-3.0-flash 能够持续规划、调用工具、响应环境反馈,并根据中间结果动态调整执行路径,最终完成可验证的任务交付。与此同时,百灵团队通过分级缓存和 Multi-Agent 协同架构,进一步提升了长会话交互效率,以及复杂任务执行的能力上限与稳定性。
能力强:复杂任务,持续优化
在训练方面,百灵团队将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 10,000 余个,并持续提升环境的质量、多样性和任务难度。针对长程 Agent 任务,百灵团队在RL阶段引入完整执行轨迹复盘和步骤贡献评估机制,为任务执行过程生成更细粒度的步骤级训练信号,帮助模型更高效地从环境交互、失败反馈和自主纠错中学习。
由此,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力实现全面提升,在多项指标上对齐甚至超越体量达其 2~3 倍的开源 SOTA 及行业领先闭源模型,展现出面向真实生产力场景的任务执行与交付能力。这种能力也经受住了真实 APP 生成需求场景的检验,Ling-3.0-flash 在 MiniAppBench (https://miniappbench.github.io/) 上的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型达到同等水平。MiniAppBench 要求模型仅根据一句用户需求,生成完整可用的 APP,参与评测的 16 个主流模型平均通过率仅为 17%。
响应快:长程交互,无需重算
Agent 任务越复杂,对话轮次越多,上下文也越长。传统推理服务中,一旦本地缓存被新请求挤出,或同一会话被调度至其他计算节点,系统往往需要重新处理前面数万 Token 的上下文,导致首 Token 延迟(TTFT)快速上升。为此,Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,让已有上下文能够跨层级存储、跨节点共享和按需恢复,将缓存从“实例私有”升级为“集群共享”,最大限度减少长上下文的重复计算。实测显示,在长输入场景下,命中 L3 Cache 相比直接重新计算,可将 TTFT 降低 60%~80% 以上。

从本地缓存到集群共享,从重复计算到分层复用,Ling-3.0-flash 显著提升了长会话的 Token Efficiency。对于 Coding Agent、长文档问答等需要持续携带完整历史的场景,这意味着更快的任务接续、更低的计算开销,以及更加流畅稳定的交互体验。
Multi-Agent 协同稳:多元智能,相互校验
面对复杂 Agent 任务,传统的 Single-Agent 推理链路容易受到决策漂移、局部误判和容错能力不足等问题影响。为此,Ling-3.0-flash 升级了多智能体协同架构“Ling Multi-Agent”。百灵团队在 SearchSwam (https://arxiv.org/abs/2606.09730) “委派智能(Delegation Intelligence)”范式的基础上,进一步研究了 Multi-Agent 架构的 Scaling 机制。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错与竞争赛马,降低单一推理路径带来的偏差。
如下图,在 BrowseComp 和 BrowseComp_zh 上,通过“Ling Mulit-Agent”架构可获得 log-linear 的性能提升。未来,百灵团队将把这一范式拓展到更广泛的任务场景,持续探索更大规模智能体协同的能力边界。

如何使用
在魔搭社区在线体验
无需本地部署,打开魔搭模型页即可直接试用

在模型页点击「在线体验」,即可在网页端与 Ling-3.0-flash 直接对话,快速验证推理、指令遵循与长文本处理效果。
免费调用魔搭 API-Inference
魔搭社区为 Ling-3.0-flash 提供免费的 API-Inference 调用,接口与 OpenAI SDK 兼容。在模型页点击「推理 API-Inference」即可获取示例代码,将 <MODELSCOPE_TOKEN> 替换为自己的魔搭访问令牌(在魔搭「账号设置 - 访问令牌」中创建)后即可运行:

运行脚本:
from openai import OpenAI
client = OpenAI(
base_url='https://api-inference.modelscope.cn/v1',
api_key='<MODELSCOPE_TOKEN>', # ModelScope Token
)
response = client.chat.completions.create(
model='inclusionAI/Ling-3.0-flash', # ModelScope Model-Id, required
messages=[
{
'role': 'user',
'content': '你好'
}
],
stream=True
)
done_reasoning = False
for chunk in response:
if chunk.choices:
reasoning_chunk = chunk.choices[0].delta.reasoning_content
answer_chunk = chunk.choices[0].delta.content
if reasoning_chunk != '':
print(reasoning_chunk, end='', flush=True)
elif answer_chunk != '':
if not done_reasoning:
print('\n\n === Final Answer ===\n')
done_reasoning = True
print(answer_chunk, end='', flush=True)
本地部署
官方为 Ling-3.0-flash 提供了 vLLM 与 SGLang 两套部署方案。权重可直接从魔搭下载:
pip install modelscope
modelscope download --model inclusionAI/Ling-3.0-flash --local_dir ./Ling-3.0-flash
vLLM
安装官方适配版本的 vLLM:
pip install uv
uv venv ~/my_ling_env
source ~/my_ling_env/bin/activate
git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
cd vllm-ling-v3
VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto
启动服务,以下为 4 卡示例,$MODEL_PATH 指向上一步下载的权重目录,$PORT 为服务端口。模型在训练阶段带 MTP,推荐推理时开启投机解码以降低延迟:
vllm serve "$MODEL_PATH" \
--port "$PORT" \
--trust-remote-code \
--served-model-name auto \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.85 \
--enable-prefix-caching \
--mamba-cache-mode align \
--enable-auto-tool-choice \
--tool-call-parser ling3 \
--reasoning-parser ling3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
调用服务,推荐采样参数 temperature=0.6、top_p=0.95、top_k=20,并开启 enable_thinking:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto",
"messages": [{"role": "user", "content": "hello!"}],
"chat_template_kwargs": {"enable_thinking": true},
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
SGLang
官方提供了跟随 Ling-3.0 运行时更新的预置镜像:
docker pull lmsysorg/sglang:dev-Ling-3.0-flash
低延迟推荐配置,内置 MTP / NEXTN 与 256K YaRN 上下文,适用于 4 张 141GB 级显卡(如 H20-3e)或 4 卡 Blackwell 节点;使用 80GB 显卡(H100 / H800)时将 --tp 4 改为 --tp 8:
docker run --rm --gpus all --ipc=host --shm-size 32g \
-p 30000:30000 \
-e HF_TOKEN=<your-hf-token> \
lmsysorg/sglang:dev-Ling-3.0-flash \
env SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \
python3 -m sglang.launch_server \
--model-path inclusionAI/Ling-3.0-flash \
--tp 4 \
--context-length 262144 \
--speculative-algorithm NEXTN \
--mem-fraction-static 0.8 \
--host 0.0.0.0 \
--port 30000
若使用已从魔搭下载到本地的权重,可去掉 -e HF_TOKEN,通过 -v 挂载权重目录并将 --model-path 指向挂载后的路径。
调用服务。chat template 与 ling3 reasoning parser 默认开启思考模式,可在单次请求中通过 "chat_template_kwargs": {"enable_thinking": false} 关闭:
curl -s http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "inclusionAI/Ling-3.0-flash",
"messages": [{"role": "user", "content": "hello!"}],
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
BF16 / FP8 与低延迟、高吞吐、HiCache + Mooncake 等不同组合的完整启动矩阵和已验证配置,可参考 SGLang Cookbook:
https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-flash
更多部署说明见魔搭模型页:
https://modelscope.cn/models/inclusionAI/Ling-3.0-flash
更多推荐




所有评论(0)