
GLM-5.3-BF16 完整开放权重上线:753B 参数,代码与安全 benchmark 公开
GLM-5.3 的完整 BF16 权重已上线,本文汇总 753B 参数、官方 benchmark、API 价格、部署框架与许可证边界,帮助开发者决定是否开始本地评测。
先看结论
GLM-5.3 的完整 BF16 权重已经上线。Hugging Face 的模型搜索记录显示,
zai-org/GLM-5.3-BF16 在 2026 年 8 月 28 日 21:46(北京时间) 更新;这兑现了 Z.ai 在 8 月 14 日发布 GLM-5.3 时所说的“两周后开放权重”。12这次更新把 GLM-5.3 从“可调用的闭源服务”推进到“可以下载和自部署的 BF16 模型”。开发者可以把它加入长程编码、终端操作和安全研究任务的本地评测队列;产品团队先核对显存、并行策略、吞吐和许可证条款,再决定部署规模。
| 现在要判断什么 | 已确认的信息 | 动作窗口 |
|---|---|---|
| 是否值得开始评测 | BF16 权重已公开,参数规模为 753B;模型卡将架构标为 glm_moe_dsa。1 | 现在可以开始做本地加载和长程 Agent 小样本测试。 |
| 能力重点 | Z.ai 报告的提升集中在复杂编码、长程 Agent 任务和漏洞发现 / 利用。2 | 先用真实代码库、工具调用和安全测试任务验证。 |
| API 是否仍可用 | glm-5.3 API、GLM Coding Plan 与 ZCode 均已提供;官方 API 价格页列出输入 $1.4、缓存命中输入 $0.26、输出 $4.4,均按每 100 万 tokens 计。34 | 已接入 API 的团队可以把本地权重与托管 API 做成本、延迟和质量对照。 |
关键规格
| 项目 | 目前可确认的信息 |
|---|---|
| 模型与状态 | GLM-5.3-BF16,完整 BF16 权重已在 Hugging Face 提供;模型搜索记录的最新更新时间为 2026 年 8 月 28 日 21:46(北京时间)。1 |
| 参数规模与精度 | 模型卡标示 753B params,张量类型为 BF16 / F32;当前模型卡没有列出激活参数规模。1 |
| 基座与训练 | GLM-5.3 使用与 GLM-5.2 相同的 base model,Z.ai 将全部增益归因于 post-training(后训练)。2 |
| 架构标记 | Hugging Face 页面将架构标为 glm_moe_dsa;模型当前支持文本输入。13 |
| 上下文与输出 | 最大上下文 1M tokens,最大输出 128K tokens。3 |
| 推理控制 | 始终启用 reasoning;reasoning_effort 支持 low、high、max,默认值为 max。3 |
| 权重入口 | Hugging Face 提供 zai-org/GLM-5.3-BF16;Z.ai 官方仓库同时列出 ModelScope 下载入口。15 |
Z.ai 官方仓库的下载表仍写着
744B-A40B,而当前 BF16 模型卡标示 753B params。两个官方页面的数字口径尚未统一;部署前应以实际权重文件、配置和显存测算为准,本文采用 BF16 模型卡的 753B 记录。15benchmark:提升集中在哪些任务
| 任务 | GLM-5.3 | GLM-5.2 | 读法 |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 | 真实终端 Agent 任务;官方称 GLM-5.3 达到开源模型 SOTA。2 |
| DeepSWE v1.1 | 66.9 | 46.2 | 长程软件工程任务,官方测试使用 400K 上下文和 6 小时超时。1 |
| Agents’ Last Exam(ALE-CLI) | 28.5 | 23.8 | 官方 CLI Agent 评测,GLM-5.3 使用 1M 上下文、最高 64K 输出。2 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 自动化任务分数;官方说明采用修复 null 类型处理问题后的版本。1 |
| CyberGym | 84.5 | 77.2 | 从白盒源代码出发,测试漏洞识别与验证;官方将 84.5% 列为该 benchmark 的最高结果。2 |
| ExploitBench | 54.4 | 24.4 | 更靠近真实漏洞利用;官方结果按 41 个任务、3 次 revision 的覆盖情况计算。1 |
这组结果显示,GLM-5.3 的增益更贴近“把一项工作做完”而非只回答一道代码题。Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE 从 46.2 提升到 66.9,ALE-CLI 从 23.8 提升到 28.5;Z.ai 在自有 Z.ai Code Bench 上也报告了相对 GLM-5.2 50% 的性能提升。2
安全能力的分布更值得单独看。CyberGym 衡量的是从源代码识别并验证漏洞,ExploitBench 衡量更深的漏洞利用过程。GLM-5.3 在两项上的分数分别为 84.5% 和 54.4%,相对 GLM-5.2 的提升幅度不同;这说明后训练带来的能力提升延伸到了更长的安全任务链,结果本身仍然属于 Z.ai 的测试设置。2
现在怎么用
| 路径 | 入口与已知信息 | 适合的动作 |
|---|---|---|
| 本地权重 | Hugging Face 提供 BF16 权重,Z.ai 仓库列出 ModelScope;官方仓库确认 SGLang、vLLM、Transformers、KTransformers、Unsloth,以及 Ascend NPU 相关部署路径。15 | 先用 FP8 或 BF16 的实际配置做加载、并行和吞吐测试,再评估生产规模。 |
| Z.ai API | 模型 ID 为 glm-5.3;官方文档列出 OpenAI Chat Completion、OpenAI Responses 和 Anthropic Message 三类协议入口。价格页列出输入 $1.4、缓存命中输入 $0.26、输出 $4.4 / 100 万 tokens。34 | 已有 API 链路的团队可以先做质量、延迟与 token 成本基线。 |
| GLM Coding Plan / ZCode | GLM-5.3 已向 Coding Plan 用户开放,并可在 ZCode、Claude Code、OpenCode 等编码 Agent 中使用。23 | 适合先用现成 Agent 验证长程任务,再决定是否承担自部署成本。 |
从 GLM-5.2 或更早版本迁移时,调用参数需要一起检查:GLM-5.3 强制启用
thinking.type: "enabled",reasoning_effort 可设为 low、high 或 max。旧调用若仍传入 thinking.type: "disabled",请求会失败;复杂编码任务官方建议使用 max。7许可证与评测前检查
许可证还规定了一个与 Model as a Service 相关的条件:如果被许可方或其关联方运营这类服务,且任意连续 12 个月累计总收入超过 100 亿美元,商业使用软件或衍生作品前需要通过 Z.AI 安全审查。计划把权重包装成 API 服务的团队,应让法务按原文判断自己的业务是否落入该条款。8
第一轮评测可以固定一套已有基线任务、工具和提示词,分别记录成功率、最终交付物质量、端到端耗时和 token 消耗。长程 Agent 任务再分开比较
low、high、max 三种 reasoning effort,避免把推理预算的差异误认为模型本身的能力差异。GLM-5.3-BF16 现在具备权重、API、Coding Plan 和本地部署路径。对开发者来说,下一步是验证它能否在自己的工具链里稳定完成任务;对产品团队来说,下一步是把 753B BF16 的基础设施成本与 API 价格放在同一张评测表里比较。
References
- 1Hugging Face:zai-org/GLM-5.3-BF16
huggingface.co
- 2
- 3Z.ai:GLM-5.3 开发文档
docs.z.ai
- 4Z.ai:API 价格
docs.z.ai
- 5Z.ai:GLM-5 官方仓库
github.com
- 6GLM-5.3 官方 benchmark 图
raw.githubusercontent.com
- 7Z.ai:迁移到 GLM-5.3
docs.z.ai
- 8GLM-5.3-BF16 许可证
huggingface.co
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- GPT-6 Astra 正式 rollout:模型 ID、价格与系统卡已上线,可用性仍分阶段
- OpenAI Astra 先公开安全评估:达到网络安全 Critical,API 与系统卡尚待上线
- Gemini 3.8 Flash 与 Flash Cyber 发布:$0.75 起,安全版进入 Fairwind 受控访问
- Claude Fable 5.1 与 Mythos 5.1 发布:同一底座、两套护栏,缓存读取降至 $0.25/百万 tokens
- 腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活,1M 上下文
- Qwen3.8-Flash API 已正式上线
- GLM-5.3-Flash 发布:320B/18B 开权重、1M 上下文、API 五折至 9/9
- Qwen3.8-Flash-Next 开放权重上架:125B/6B、Qwen4 架构预览、云端价已公布

