GLM-5.3 发布:基于 743B 基座训练,编码与网络安全能力跃升

GLM-5.3 发布:基于 743B 基座训练,编码与网络安全能力跃升

Z.ai 发布 GLM-5.3,公开 743B 基座训练信息和四项官方 benchmark;Coding Plan 已上线,公开 API 即将上线,开放权重与价格仍待官方补齐。

先看结论

Z.ai 在北京时间 2026 年 8 月 14 日 13:17 发布 GLM-5.3,主打编码、Agent 和网络安全。公告给出的关键信息是:模型经过 743B 基座模型的后训练,网络安全能力被官方描述为开放模型中的一次跃升。三分钟后,Z.ai 负责人补充了四项 benchmark:Terminal Bench 3.0 为 28.3,DeepSWE 为 66.9,Agents' Last Exam 为 28.5,GDPVal-AA 为 1769。12
对开发者来说,当前更适合把 GLM-5.3 加入编码、Agent 和安全评测候选,而不是马上按 743B 这个数字做部署判断。原始发布路线是先向 select partners(受限合作方)开放;智谱开放文档目前又显示,GLM Coding Plan 已全量上线 GLM-5.3,模型 API 即将上线。公开文档暂未列出按 token 计费价格。34

关键资料一览

项目目前可确认的信息
发布时间2026 年 8 月 14 日,北京时间 13:17。1
发布方Z.ai(智谱)旗下 GLM 模型团队。1
模型定位编码、Agent 和网络安全;官方公告的标语是「Built to Code. Ready for Cyber Defense」。1
参数信息743B 指后训练所使用的 base model(基座模型)。Z.ai 后续称 GLM-5.3 与 GLM-5.2 使用同一个 743B 基座;GLM-5.3 自身的总参数、激活参数和部署规模尚未披露。12
上下文与接口能力官方文档列出 1M 上下文窗口、128K 最大输出,支持文本输入与文本输出、思考模式、流式输出、Function Calling、上下文缓存、结构化输出和 MCP。4
官方 benchmarkTerminal Bench 3.0:28.3;DeepSWE:66.9;Agents' Last Exam:28.5;GDPVal-AA:1769。四项数字均为 Z.ai 公布的结果。2
当前可用性原始发布路线为 select partners 受限访问;官方文档显示 GLM Coding Plan 已全量上线 GLM-5.3,模型 API 即将上线。开放权重仍要等安全评估完成,未给出时间表。34
价格与 API模型 API 即将上线;GLM Coding Plan 已全量上线 GLM-5.3。公开文档暂未列出按 token 计费价格。4
这里有一个容易被标题带偏的细节:743B 是基座模型规模,不是 GLM-5.3 已公开的参数表。它说明了后训练的起点,不能直接推出模型会占用多少显存、开放权重需要什么硬件,或 API 的推理成本。

四项评测先怎么看

四个分数最初由 Z.ai 官方跟进帖公布;开放文档又补齐了 GLM-5.2 到 GLM-5.3 的部分对照口径:Terminal Bench 3.0 为 4.6 升至 28.3,DeepSWE v1.1 为 46.2 升至 66.9,Agents' Last Exam 为 23.8 升至 28.5。GDPVal-AA v2 则列出 GLM-5.3 的 1769 分。24
这些数字仍是厂商自报结果。公开帖文和文档没有提供独立复测、完整测试配置或统一的误差范围,因此它们更适合用来决定「下一轮该测什么」,还不足以单独证明 GLM-5.3 在所有编码或 Agent 任务上都领先。4
  • Terminal Bench 3.0:28.3。 与 GLM-5.2 的 4.6 对照,适合拿来设计命令行、代码修改和测试执行任务。4
  • DeepSWE v1.1:66.9。 与 GLM-5.2 的 46.2 对照,需要保留数据集版本、提示词和工具权限,才能和其他模型复测。4
  • Agents' Last Exam:28.5。 与 GLM-5.2 的 23.8 对照,适合观察多步任务中的规划和执行表现。4
  • GDPVal-AA v2:1769。 这是另一套指标,不能与前三项直接相加,也不能因为数值更大就理解为能力更强。4
Z.ai 还称,GLM-5.3 使用与 GLM-5.2 相同的 743B 基座,同时达到参数规模大几倍模型的性能。开放文档进一步把它描述为在长程工程任务中减少人工干预、持续推进数万行代码和上百个文件。前一句是发布方自己的比较性结论,后一句是官方产品文档的能力描述;在缺少独立结果前,读者应把两者都作为待验证的厂商主张,而不是通用排名。24

可用性比 benchmark 更需要等

当前状态分成三层。原始发布路线是先向 select partners 提供受限访问,完成安全评估后再开放 API 和权重;智谱开放文档目前显示,GLM Coding Plan 已全量上线 GLM-5.3,模型 API 即将上线,完整调用示例与模型体验中心会随 API 同步。34
这组信息说明,GLM-5.3 已经有产品侧入口,但公开 API 的模型 ID、按 token 计费价格和完整调用方式仍待官方文档补齐。1M 上下文、128K 最大输出、Function Calling 和 MCP 等规格已经列在模型页,API 是否适合你的业务还要看真实调用限制和费用。4
智谱文档中的 GLM-5.3 网络安全评测对照
智谱官方文档列出 CyberGym、ExploitBench 和 ExploitGym 对照:GLM-5.3 在 CyberGym 为 84.5%,高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;在 ExploitBench 为 54.4%,高于 GLM-5.2 的 24.4%。这些是发布方评测口径,不是独立安全审计。4
安全方向还需要单独看安全评估,而不能只看一个高分。若后续开放涉及高权限工具调用的 API,开发团队至少应确认提示注入、越权操作、敏感信息处理和拒答边界,再决定是否放进生产流程。这里的安全评估是上线前提,不是已经完成的独立审计结论。

现在可以怎样评测

  1. 先准备三组真实任务。 分别覆盖终端编码、软件工程修复和多步工具调用;如果你的业务关心网络安全,再加入隔离环境中的防护任务。保持代码仓库、工具权限和超时设置一致。
  2. 把完成标准写成可检查的结果。 记录测试是否通过、任务是否需要人工接管、工具调用是否走偏、重试次数、输入输出 tokens 和总耗时。不要只记录模型最后生成的文字。
  3. 把 743B 从部署表里单独标记。 在模型卡和权重发布前,把它记作「后训练基座规模」,不要把它当作可下载模型的总参数或硬件需求。
  4. 等待三项信息再做迁移判断。 API 入口与价格、开放权重与许可、安全评估报告,至少要和一轮自己的任务集结果放在一起看。它们齐全后,才能比较 GLM-5.3 与现有模型的实际成本和风险。
GLM-5.3 这次公开了一个清晰的方向和一组待复核的数字,但还没有公开完整的产品接口。对编码、Agent 或安全任务有需求的团队,可以先把它放进评测清单;是否试用、迁移或本地部署,等 API、权重和安全材料落地后再按自己的任务结果决定。
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.