唐杰转发 Z.ai:GLM-5.3 将至,重点做 coding,安全能力同步跃升

唐杰转发 Z.ai:GLM-5.3 将至,重点做 coding,安全能力同步跃升

唐杰引用 Z.ai 宣布 GLM-5.3 将至,官方资料显示它把重点放在长程 coding,并同步披露网络安全能力提升;本文梳理已确认的上线路径、评测数据与仍待验证的开源计划。

最新动态

北京时间 8 月 14 日 13:28,唐杰在 X 引用 Z.ai 的发布帖,写下:「GLM-5.3 is coming. focusing on coding.」1
Z.ai 被引用的原帖在 13:17 发布,标题是「Introducing GLM-5.3: Built to Code. Ready for Cyber Defense」。原帖把新模型的两个重点说得很直白:复杂编程与智能体能力,以及网络安全能力。它还称,训练使用了 743B 基础模型的后训练。2
Loading content card…
唐杰的措辞仍是「coming」,但 Z.ai 的官方博客已经写成「Today we are releasing GLM-5.3」。目前能确认的落地路径是 Coding Plan、ZCode、Claude Code 和 OpenCode;权重则要等发布后约两周,完成安全评估和加固后再公开。3

这次升级押注什么

GLM-5.3 与 GLM-5.2 使用同一个基础模型。Z.ai 对这次升级的解释是继续扩大后训练:加入更多、更复杂的长程任务环境,让模型在接近真实工程的环境里诊断问题、改代码、跑实验,再交付可验证的结果。换句话说,重点从「能不能生成代码」移向「能不能把一段工程工作做完」。这仍是 Z.ai 对自家训练和评测的描述,不能直接等同于所有开发者场景中的实际效果。3
Z.ai 自报的对比中,GLM-5.3 相比 GLM-5.2 的提升主要出现在长程编程任务:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,Agents' Last Exam(CLI)从 23.8 提升到 28.5。3
Z.ai 官方博客的 LLM Performance Evaluation 柱状图,比较 GLM-5.3 与 GLM-5.2 等模型在六项 coding 和 agentic benchmark 上的分数
图中展示 Z.ai 对 Terminal Bench 3.0、DeepSWE、Agents' Last Exam 等评测的对比;数据与评测方法以 Z.ai 官方博客为准。3

网络安全能力是另一条主线

Z.ai 将网络安全能力称为后训练过程中的「emergent cyber capability」,并特别强调模型开始处理多阶段漏洞利用链。公开博客给出的自报结果是:CyberGym 为 84.5%,高于 GLM-5.2 的 77.2%;ExploitBench 为 54.4%,高于 GLM-5.2 的 24.4%;在按时间预算统计的 ExploitGym 上,GLM-5.3 在 2 小时和 6 小时内分别完成 105 和 130 项,GLM-5.2 为 29 和 39 项。3
Z.ai 官方博客的 CyberSecurity Evaluation 柱状图,比较 GLM-5.3 与 GLM-5.2 等模型在 CyberGym、ExploitBench 和 ExploitGym 上的结果
这张图把漏洞发现、漏洞利用和限时完成任务分开比较;它反映的是 Z.ai 的评测口径,不是现实网络攻击效果的独立审计。3
这部分的关键信息不只是分数变高,而是能力边界开始向更高风险的任务延伸。真正值得继续观察的,是权重公开后的复现实验、模型在受控环境中的安全限制,以及 Z.ai 后续披露的漏洞验证和处置流程。

讨论串里的几个信号

这次发布前后,唐杰的几条短回复把「coming」的时间线补得更具体,但没有给出一个公开发布日期。8 月 14 日 8:39,他引用用户 BlueWise 对此前「soon」的调侃「when glm 5.3?」,只回复「sooooooon」;这是一条对等待者的回应,不是正式日期承诺。4
同一讨论串里,@JacobRothfield 在 13:18 说自己对 GLM Coding Plan 的周限额不满意;唐杰在 13:23 回复「will reset today:)」,Jacob 随后回「Thanks ❤️」。这说明唐杰回应的是一项 Coding Plan 周限额重置安排,但公开回复没有说明重置范围、具体生效时间,或是否适用于所有用户。567
在发布帖后的讨论中,@VeryCoolGuy6 问「5.5 soon?」,唐杰回复「need some time:-) but more to come」;这至少说明他没有给出 GLM-5.5 的近期时间表。随后,@jenzhuscott 说「Jie you guys are rocking it!!」,唐杰回「Thanks, Jen.」,这属于对祝贺的礼貌回复,没有新增产品信息。89

接下来关注什么

对开发者来说,当前最重要的变化是 GLM-5.3 已进入 Coding Plan 和相关 coding agent 的使用路径;对模型研究和开源社区来说,真正的验证点有三个:权重是否按计划公开,第三方能否复现 coding 与 cyber 评测,以及实际使用中的长程任务完成率和安全边界。
本轮新增信息来自 X;微博端本次巡检仍未发现新的相关动态。
唐杰THU 动态追踪

唐杰THU 动态追踪

追踪唐杰THU(清华教授、智谱AI首席科学家)在微博与X平台的公开动态,涵盖发帖、回复与互动。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.