GLM-5.3 权重正式开源:编程涨 50%、挖洞翻倍,但普通玩家先别冲动

一句话结论: 智谱把 GLM-5.3 的权重正式放上了 Hugging Face 和 ModelScope,编程能力官方口径提升 50%、网络安全能力直接翻倍,是目前开源权重里最能打的编程模型;但 750B 量级参数、756GB 的 FP8 权重,意味着绝大多数人还是乖乖走 API 或中转平台更划算。
8 月 28 日那天,Hacker News 上「GLM-5.3 is now open-weight」的帖子冲到了 800 多分。老张点开 Hugging Face 一看,发布不到一周,下载量已经逼近 10 万。说实话,这轮国产开源模型的节奏确实快——API 是 8 月 19 日先上的,权重因为这次模型网络安全能力太强,官方专门多做了两周安全评估才放行。这件事本身就很值得运维和安全圈的人关注。
📋 速览表
| 项目 | 内容 |
|---|---|
| 模型 | GLM-5.3(智谱) |
| 事件 | 2026-08-28 权重正式开源(Hugging Face / ModelScope) |
| 架构 | MoE,总参数约 750B,每 token 激活约 40B |
| 权重格式 | FP8,141 个 safetensors 分片,共约 756GB |
| 上下文 | 1M,最大输出 128K |
| 思考模式 | 强制开启,low / high / max 三档(默认 max) |
| License | 自定义 GLM-5.3 License,允许商用、微调、二次分发 |
| 部署框架 | SGLang、vLLM、Transformers、KTransformers、Unsloth、TokenSpeed,支持昇腾 NPU |
发生了什么:API 先上,权重迟到两周
GLM-5.3 的 API 是 8 月 19 日在大模型开放平台全量上线的,当天就进了 GLM Coding Plan 的默认模型。但权重拖到 8 月 28 日才放出来。
为什么晚?官方说法是:这次模型在漏洞发现、漏洞利用上的能力提升超出预期,属于「涌现的网络安全能力」,所以团队在开源前专门做了额外的安全评估,花了大约两周。模型卡里也写明,GLM-5.3 用的是和 GLM-5.2 完全相同的基础模型——所有提升都来自后训练,这句话的含金量在于:基座没变,工程能力却大幅跃升。
编程能力:内部基准涨 50%,公开基准开源第一
老张从官方模型卡里挑了几个关键数字:
- Terminal Bench 3.0:4.6 → 28.3,接近 6 倍提升,开源模型里第一;
- DeepSWE v1.1:46.2 → 66.9;
- Agents' Last Exam(CLI):23.8 → 28.5,同样是开源 SOTA;
- 智谱内部 Z.ai Code Bench:官方口径比 GLM-5.2 提升 50%;Max 档准确率 34.5%,平均每任务输出 7.5 万 token——比 GLM-5.2 的 9.6 万 token 还更省;
- 第三方 Artificial Analysis 智能指数:GLM-5.3 拿到 60 分,和 Kimi K3 并列开源模型第一。
![[Codex/自媒体/图片/2026-09-03-glm-53-open-weights-01.png]]
有意思的是 token 效率这组数据:High 档下 GLM-5.3 用约 5 万 token 拿到 31.4% 准确率,超过了 Claude Opus 4.8 用约 12 万 token 拿到的 29.5%。当然,离 Claude Fable 5 的 39.5% 还有差距,这点官方也没藏着。
网络安全能力:这才是这次最大的看点
对运维和安全团队来说,GLM-5.3 真正值得关注的是它的网安能力:
- CyberGym(漏洞发现):84.5%,当前该基准最佳成绩;
- ExploitBench(漏洞利用推理):24.4% → 54.4%,直接翻倍还多;
- ExploitGym:2 小时完成 105 项任务,GLM-5.2 只有 29 项。
![[Codex/自媒体/图片/2026-09-03-glm-53-open-weights-02.png]]
更关键的是真实场景数据:智谱联合国内多家安全团队,用模型在 269 个真实项目里发现了 2,436 个漏洞,其中 1,097 个中高危,藏得最深的一个在代码里潜伏了约 40 年。官方还建了一个持续更新的漏洞披露台账。
老张的判断:这套能力用在防守侧(代码审计、漏洞挖掘)价值巨大,但双刃剑属性也很明显——官方多压两周做安全评估、License 里加安全审查条款,都是同一个原因。
部署:门槛比你想的高
权重开出来了,但先看清楚规格再决定要不要自建:
- 权重直接以 FP8 精度发布,141 个分片,总文件约 756GB;
- 本地全量部署需要 TB 级显存的多卡集群(8×H200 级别起步,老张估算),单机玩家直接劝退;
- 支持 SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth,昇腾平台有 vLLM-Ascend / xLLM / SGLang 适配;
- API 价格与 GLM-5.2 持平,OpenRouter、SiliconFlow 等第三方平台已同步上架。
所以现实路径很清楚:中小团队和个人走官方 API、GLM Coding Plan 或中转平台;有合规或数据安全要求、且手里有 8 卡以上集群的团队,才值得认真考虑自建。
License 有一个条款要注意
GLM-5.3 用的是自定义 License,整体相当宽松:允许商用、允许微调、允许二次分发。但有一个特殊条款——如果你或关联公司做 MaaS 生意,且连续 12 个月总营收超过 100 亿美元,商业使用前必须通过 Z.AI 的安全审查。普通公司完全不用管这条,它防的显然是超大规模云厂商「拿开源权重做托管服务」。
迁移坑:思考不能关了
从 GLM-5.2 升级要注意一个破坏性变化:GLM-5.3 强制开启思考,不再支持 thinking.type: "disabled",否则会直接报错。正确姿势是改成 enabled 并用 reasoning_effort 调档位:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
简单任务设 low 省钱,复杂编程任务用默认的 max。另外本地部署时 clear_thinking 默认是 false,聊天场景记得显式传 true,否则历史推理内容会堆在上下文里。
🎯 老张建议
- 普通用户别折腾自建:756GB 的 FP8 权重意味着 TB 级显存集群,先走 API 或 Coding Plan 体验,成本差好几个数量级;
- 升级前先检查 thinking 参数:
disabled会直接报错,这是这次最容易踩的坑; - 安全团队重点关注:开源权重 + 翻倍的漏洞发现能力,意味着防守方第一次能用上开源的顶级漏洞挖掘模型,建议在隔离环境里做代码审计 PoC。
💬 互动话题
- 你会为了数据安全自建 750B 级模型,还是继续用 API?
- 模型开源前因「能力太强」多审两周,你觉得这是负责任还是拖节奏?
- 你的团队已经在用 AI 做漏洞挖掘了吗?效果如何?
🔗 关注老张
公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/