GLM-5.3 系列开源:Flash 已上线|GLM-5.3 倒计时不到 24 小时
智谱 AI 连续发布 GLM-5 系列两款模型。GLM-5.3 定位能力旗舰,通过极限后训练扩展在编码和网络安全基准上达到开源最强,并在真实代码库中发现 2,436 个漏洞。GLM-5.3-Flash 定位效率旗舰,全新 320B/18B 激活架构以 1⁄10 成本在编码和智能体任务上接近 Claude Opus 4.8。GLM-5.3-Flash 已以 MIT 协议开源,GLM-5.3 计划明天开源。
发布前,智谱以匿名 ID “ox-alpha” 在 OpenRouter 和 OpenCode 上进行了测试。6 天内 ox-alpha 成为 OpenRouter 最热门模型(23.2T token,2.3 倍于第二名),在 OpenCode 上 7 天累计 43T token 用量位列第一,所有流量均运行在中国 AI 芯片上。


GLM-5.3 明天 23:00(UTC+8)开源,魔搭倒计时页面已上线,欢迎点 Like 预约👇

开源地址
- 模型链接(Flash,已开源):
https://modelscope.cn/models/ZhipuAI/GLM-5.3-Flash - 模型链接(5.3,明日开源,点 Like 预约):
https://modelscope.cn/models/ZhipuAI/GLM-5.3 - 技术博客(Flash):
https://z.ai/blog/glm-5.3-flash - 技术博客(5.3):
https://z.ai/blog/glm-5.3
共同基础:后训练扩展路线
GLM-5.3 系列的核心方法论是扩展后训练。团队在 GLM-5.2 阶段构建了完整的后训练技术栈:IndexShare 用于高效长上下文处理,SAO(带压缩)用于长周期任务强化学习,slime 用于大规模异步 RL 训练,所有组件运行在持续积累的长周期任务环境之上。
GLM-5.3 和 GLM-5.3-Flash 共享这条路线,但分支点不同:GLM-5.3 在 GLM-5.2 的 744B 基座上继续扩展后训练,所有增益来自更多环境、更多任务、更多计算;GLM-5.3-Flash 则从头训练了一个全新的 320B 基座,在架构层面围绕效率重新设计后再进行后训练对齐。
GLM-5.3:后训练扩展到极限
环境扩展与合成
GLM-5.3 将训练环境推向了接近真实专家工作的复杂度。任务不再是编程练习,而是覆盖生产工作流的完整工程单元——有些代表一位经验丰富工程师几天的工作量。以 ML 基础设施任务为例:模型获得与工程师相同的工作环境(计算集群、存储系统、内部文档、代码库、实验结果),需要诊断训练堆栈瓶颈、实现优化、运行实验,并交付可衡量的端到端加速。
为规模化生产这些环境,团队构建了端到端合成管线:研究智能体从真实工作中收集任务模式,转化为具有多步骤依赖和隐藏状态的可运行长周期环境;判断智能体验证每个任务确实可解;验证器在不接触参考解的情况下合成,求解轨迹用于发现和关闭奖励捷径。通过 oracle、无操作和未解决状态检查的验证器产生足够可靠的二元奖励直接训练。
在系统层面,slime 框架新增了 top-p mask、全词表 OPD、R3 风格训练-推理一致性配置(logprob 平均差异控制在 1e-7 级别,相比此前减少 99.99%+),以及面向长周期任务的联合调度和负载均衡优化,端到端 RL 训练吞吐提升 2.3 倍以上。
编码性能
效果直接体现在基准上:Terminal-Bench 3.0 从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents’ Last Exam 从 23.8 升至 28.5。

在内部 Z.ai Code Bench 上,GLM-5.3 在 Max 努力下以每任务约 75K 输出 token 达到 34.5%,而 GLM-5.2 以 96K token 仅达 23.4%,性能和 token 效率同步提升。在 High 努力下,GLM-5.3 以约 50K token 达到 31.4%,超越 Claude Opus 4.8 的 29.5%(120K token)。

涌现的网络安全能力
作为后训练的一部分,团队将漏洞发现数据和环境引入训练。随着训练规模扩大,网络安全能力的发展速度超出预期——模型不仅更善于识别孤立缺陷,还开始跨利用链多阶段推理,形成完整利用计划。
三个基准覆盖不同阶段:CyberGym(白盒源代码漏洞识别与验证)得分 84.5%,为该基准最佳,领先 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%);ExploitBench(深层漏洞利用推理)达到 54.4%,是 GLM-5.2(24.4%)的两倍以上;ExploitGym(时间归一化利用任务)在 2h/6h 内分别完成 105⁄130 个任务,远超 GLM-5.2 的 29/39。

模式一致:越往利用链上游,提升越大,这也是与闭源前沿差距最大的地方,能力增长最快恰在最薄弱处。
真实代码库验证:与中国多个安全团队合作,经专家审查和去重后,模型在 269 个开源项目中识别了 2,436 个漏洞(其中 1,097 个中高危),涵盖系统内核、操作系统、浏览器引擎、Web 应用和网络协议。许多漏洞已存在数十年,最老可追溯约 40 年(1981 年引入),平均存活 26.6 年。
GLM-5.3-Flash:全新架构的效率前沿
混合注意力架构
GLM-5.3-Flash 从头设计了一套面向超低成本推理的架构。尽管总参数量相近(320B vs. GLM-4.5 的 355B),激活参数从 32B 降至 18B,层数从 92 降至 45。
核心是线性注意力 + 稀疏注意力的混合架构:线性注意力通过状态建模捕捉局部依赖,稀疏注意力通过轻量级索引器检索全局上下文。为降低 1M token 上下文下索引器的延迟和内存开销,引入 IndexPool——通过加权池化将四个索引器键向量压缩为一个。模型还采用流形约束超连接(mHC)进一步提升缩放效率。
效率对比:与 GLM-5.3 相比,注意力计算量降低 3.0 倍,KV 缓存降低 4.4 倍。在所有对比模型(含 DeepSeek-V4-Flash、Kimi-K3)中,GLM-5.3-Flash 拥有最低的注意力计算量。

结合 30T token 多模态预训练语料,GLM-5.3-Flash-Base 在 LiveCodeBench 上以 37.6 大幅领先同级模型(GLM-4.5-Base 28.1、DeepSeek-V4-Flash-Base 29.9)。
原生多模态视觉
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。视觉被直接集成到编码循环中——模型可以决定何时观察、用视觉反馈指导后续行动。
团队开发了视觉编码数据合成管线,重点在自我视觉判断和测试时改进:训练轨迹要求模型与环境交互、检查自己的输出并迭代改进。前端编码上还探索了带环境反馈的强化学习,通过基于真实用户流程的智能体验证增强 GUI 判断能力。
以下是视觉自我验证的效果示例,模型在生成专业文档后检查渲染结果并自行修复布局问题:


视觉智能也延伸到编码之外的专业工作:解读文档、电子表格、演示文稿、仪表盘等异构视觉信息,直接根据视觉上下文评估自身输出质量与美学表现。
国产 AI 芯片大规模部署
团队在大规模国产 AI 芯片集群上完成了 GLM-5.3-Flash 的服务部署。为克服单芯片有限的计算和内存容量(尤其是百万 token 上下文),在 SGLang 之上构建了专用推理引擎,推理堆栈包含:节点内张量并行(线性注意力 + LM head)、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化、Layer Split。
集群层面采用 EPD(Encode-Prefill-Decode)分离架构,将多模态编码、提示预填充和逐 token 解码分离为独立调度的工作池。与同硬件初始基线相比,端到端推理性能提升 3 倍,达到与主流 NVIDIA GPU 相当的硬件效率和每 token 成本。
性能对比
GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 上得分 57,每任务成本仅 $0.045(折后),这一智能水平此前需要约 10 倍成本才能获得,推进了成本-性能帕累托前沿。

GLM-5.3-Flash 六项编码与智能体基准对比(含 GLM-5.2、DeepSeek-V4、Claude Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flash):

Z.ai Code Bench 上 GLM-5.3、GLM-5.3-Flash、GLM-5.2 以及 Claude 系列在不同努力级别下的性能和 token 效率对比:

两模型定位总结:编码硬指标上 GLM-5.3 略强(DeepSWE +3.5、Terminal Bench 2.1 +3.9),智能体任务 Flash 反超(Toolathlon +5.4),视觉基准为 Flash 独有优势。两个模型的 API 成本差约 10 倍,选型逻辑明确:极致编码和安全研究选 5.3,日常生产和多模态办公选 Flash。
本地部署
GLM-5.3-Flash 已开源(MIT),官方支持四个推理框架。
模型下载
# GLM-5.3-Flash(已可用)
modelscope download --model ZhipuAI/GLM-5.3-Flash --local_dir ./ZhipuAI/GLM-5.3-Flash
# GLM-5.3(明日开源后可用)
modelscope download --model ZhipuAI/GLM-5.3 --local_dir ./ZhipuAI/GLM-5.3
SGLang 部署
sglang serve \
--model-path ZhipuAI/GLM-5.3-Flash \
--tp-size 4 \
--ep-size 4 \
--dsa-prefill-backend trtllm \
--dsa-decode-backend trtllm \
--kv-cache-dtype fp8_e4m3 \
--moe-runner-backend deep_gemm \
--disable-shared-experts-fusion \
--speculative-algorithm NEXTN \
--speculative-num-steps 5 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 6 \
--speculative-adaptive \
--reasoning-parser glm45 \
--tool-call-parser glm47 \
--host 0.0.0.0 \
--port 30000
官方 cookbook:http://cookbook.sglang.io/autoregressive/GLM/GLM-5.3-Flash
vLLM 部署
docker run --gpus all \
--privileged --ipc=host -p 8000:8000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-e VLLM_ENGINE_READY_TIMEOUT_S=3600 \
vllm/vllm-openai:glm53-flash ZhipuAI/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--no-enable-flashinfer-autotune \
--tool-call-parser glm47 \
--enable-auto-tool-choice \
--reasoning-parser glm45
官方 recipes:https://recipes.vllm.ai/ZhipuAI/GLM-5.3-Flash
TokenSpeed 部署
ts serve ZhipuAI/GLM-5.3-Flash \
--trust-remote-code \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--moe-backend flashinfer_trtllm \
--kv-cache-dtype fp8 \
--draft-model-path-use-base \
--speculative-algorithm MTP \
--speculative-num-steps 2 \
--speculative-num-draft-tokens 3
官方文档:https://lightseek.org/tokenspeed/recipes/models#glm-5-3-flash
KTransformers 部署
MODEL_PATH=/path/to/GLM-5.3-flash
CUDA_VISIBLE_DEVICES=0,1,2,3 \
python -m sglang.launch_server \
--model-path "$MODEL_PATH" \
--kt-weight-path "$MODEL_PATH" \
--served-model-name GLM-5.3-flash \
--host 0.0.0.0 \
--tp-size 4 \
--context-length 501025 \
--mem-fraction-static 0.60 \
--chunked-prefill-size 4096 \
--kt-method FP8 \
--kt-cpuinfer 64 \
--kt-threadpool-count 2 \
--kt-num-gpu-experts 40 \
--kt-gpu-prefill-token-threshold 2048 \
--cuda-graph-bs 1 2 4 \
--limit-mm-data-per-request '{"image":8,"video":1}' \
--mm-process-config '{"image":{"max_pixels":1254400}}' \
--tool-call-parser glm47 \
--reasoning-parser glm45
官方教程:https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/kt-kernel/GLM-5.3-Flash-Tutorial.md
更多推荐




所有评论(0)