Ling-3.0 tiny & flash Base Models 正式开源
8 月以来,Ling-3.0 系列模型陆续开放。灵波先后开源 Ling-3.0-flash 和 Ling-3.0-tiny,希望为开发者提供覆盖不同规模、不同任务需求的开放模型选择。
开源之后,越来越多开发者开始基于 Ling-3.0 探索自己的应用场景,灵波也收到了很多来自社区真实的使用和反馈。大家普遍反馈:希望拥有一个更开放、更具可塑性的 Base Model,以便基于自己的数据、任务和目标开展后训练。
在 Ling-3.0-tiny 的 Hugging Face Community 中,一位开发者直接提出:“Can we get a base model?”
在他看来,Tiny 的模型规模和稀疏架构对预算有限的研究者很有吸引力,适合开展强化学习 rollout 和面向具体场景的后训练;相比已经完成后训练的模型,社区更需要一个能够继续塑造的 Base Model。

灵波正式回应这份期待。
不只开放最终权重,也开放训练过程中的关键节点
近日,灵波将 Ling-3.0-tiny-base 与 Ling-3.0-flash-base 正式开源。除最终 Base checkpoint 外,灵波还将同步开放两个模型的预训练和中期训练的权重 checkpoint,共计 6 个 checkpoints。社区既可以观察模型能力如何随训练阶段变化,比较中期训练与模型合并带来的增益,也可以选择更适合自身数据与研究目标的训练起点。

预训练 checkpoint:已完成大规模预训练,尚未进行中期训练、WSM 合并和后训练;
中期训练 checkpoint:已完成中期训练,尚未进行 WSM 合并和后训练;
WSM 合并 checkpoint:已基于中期训练 checkpoint 完成 WSM 合并,尚未进行后训练。
这些 checkpoints 适合用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和 MoE 系统研究。
值得注意的是,在中期训练结束后,灵波将传统学习率衰减改写为 checkpoints 加权合并,即 WSM1(Warmup-Stable and Merge)。由于没有了学习率衰减,灵波的 Base Model 更适合持续预训练和动态扩展数据,且支持训练后离线探索不同学习率“衰减曲线”。
与此同时,Ling-3.0-tiny-base 与 Ling-3.0-flash-base 采用统一的训练方案,为策略验证与规模扩展提供了一条清晰路径:先在 Ling-3.0-tiny-base 上低成本试验,再将验证有效的方法扩展至 Ling-3.0-flash-base。
需要特别说明的是,Base Model 并不是已经完成指令对齐的聊天模型。灵波不建议未经后训练便直接将其部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估便用于安全关键型应用。任何生产使用都应完成面向具体任务的后训练、评估与验证。
Tiny & Flash 两个系列 Base Models,面向真实世界的不同探索
Ling-3.0-tiny-base:更适合研究者上手的代码与后训练底座
Ling-3.0-tiny-base(总参数 7.9B,激活参数 1.3B)相对紧凑的总参数和激活参数,为更多研究者提供了一个能力扎实、可继续训练和塑造的开放起点。
基于下表中的模型能力对比,模型以相比前代 50% 左右的总参数量,在大多数评测中取得更高结果;在与同等规模模型对比中,展现出更具竞争力的代码能力。

这使 tiny-base 尤其适合:
- 开展代码领域的持续预训练、监督微调与后训练;
- 进行预算敏感的强化学习 rollout 与后训练研究;
- 用于高校教学、模型行为研究和 MoE 消融实验;
- 针对具体行业和任务验证领域适配路线。
Ling-3.0-flash-base:兼顾代码、推理与长上下文能力的开放底座
Ling-3.0-flash-base(总参数 124B,激活参数 5.1B)具备更充足的参数容量与稀疏激活设计,为研究者和开发团队提供了一个可继续训练、拓展并适配真实场景的开放底座。
在下表的评测中,模型在代码、复杂推理和长上下文方向表现突出。相比总参数量约为其 2–3 倍的 base model,模型的整体表现仍具优势。

这使 flash-base 适合用于以下方向的继续训练与探索:
- 面向软件研发和大型代码库的代码模型;
- 需要多步分析与复杂推理的专业模型;
- 面向长文档、长流程和长程任务的 Agent 基础模型;
- 金融、医疗、科研、工业等专业领域的持续预训练与后训练。
Benchmark 描述的是特定设置下的 Base Model 能力,并不等同于聊天体验、Agent 执行效果或生产系统性能。Tiny 和 Flash 在知识、数学等部分评测上也各有能力边界,灵波希望社区以此作为选择训练底座的参考。
为什么要开放 Base Model?
真实世界不只有一种任务,也不只有一种正确答案。
真实世界任务往往具有长期目标、专业知识、复杂环境、工具调用和责任边界。医疗、金融、科研、工业和个人助手需要不同的数据、反馈机制和安全约束。一个官方后训练模型可以提供通用能力,却无法替代每个领域基于真实任务进行的训练、对齐和验证。
Base Model 保留了更原始、更可塑的预训练能力。开放 Base Model,使社区的研究者和开发者们能够根据自己的数据、任务与价值偏好,自主设计持续预训练、监督微调、偏好优化、强化学习后训练和蒸馏路线。这是开放智能进入真实世界的重要前提。
灵波相信,基模开源,才是真正的开源。
开放后训练模型,是把已经形成的能力交给社区;开放 Base Model,是让社区能够从底座出发,继续训练并塑造面向真实场景的智能。
通过开放 Tiny 与 Flash 的 Base Model,以及模型训练过程中的关键 checkpoints,灵波希望更多研究者和开发者能够从预训练底座出发,用自己的数据、任务和反馈,让模型在真实世界中继续生长。
从这里开始
*Ling-3.0-tiny*
**🤗 Hugging Face**
- https://huggingface.co/inclusionAI/Ling-3.0-tiny-base
- https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30T
- https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrain
**🤖 ModelScope**
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30T
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-midtrain
Ling-3.0-flash
**🤗 Hugging Face**
- https://huggingface.co/inclusionAI/Ling-3.0-flash-base
- https://huggingface.co/inclusionAI/Ling-3.0-flash-base-30T
- https://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrain
***🤖 *ModelScope**
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30T
- https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain
注:1、WSM 技术论文:WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training(https://arxiv.org/abs/2507.17634)
更多推荐




所有评论(0)