GLM-5.3:同一基座,后训练把哪些 benchmark 推到了前列

GLM-5.3:同一基座,后训练把哪些 benchmark 推到了前列

智谱官方对照图显示,GLM-5.3 沿用 GLM-5.2 基座,却在工程、Agent、专业知识工作和部分网络安全 benchmark 上出现分化跃升;本文合并转录全部官方图表并保留未标注项。

8 月 14 日,智谱发布 GLM-5.3。它最值得看的地方不是换了一个更大的基座,而是官方称它与 GLM-5.2 使用完全相同的基座,却把长程工程、跨工具 Agent 和部分网络安全任务的分数整体抬高。1 发布日期由新浪科技当天页面记录。2
真正需要分开的问题是:哪些任务确实跃升,哪些任务仍由其他模型领先? 官方对照图给出的答案并不支持一个总榜,而是一张有明显分化的能力表。

先看产品状态

智谱官方文档把 GLM-5.3 定位为旗舰基座模型:输入和输出都是文本,上下文窗口为 1M,最大输出为 128K tokens;文档列出的能力包括思考模式、Function Calling、上下文缓存、结构化输出和 MCP。1
当前可用范围也有边界:GLM Coding Plan 已经上线 GLM-5.3,模型 API 页面仍写着「即将上线」,官方没有在这份文档中给出 API endpoint 名称或 API 价格。1

官方 Benchmark 总表

下表把智谱官方两张评测图中的模型列合并为一张表。主图包含 6 项通用、工程和 Agent benchmark,安全图包含 3 项网络安全 benchmark;空白表示官方没有在对应图中披露该模型的数值,不代表 0。每一行的最高已披露值加粗。
BenchmarkGLM-5.3GLM-5.2Kimi K3Claude Fable 5Claude Opus 4.8Mythos 5GPT-5.6 Sol
Terminal Bench 3.0 128.34.617.433.734.6
DeepSWE 166.946.267.569.772.7
Agents' Last Exam(CLI)128.523.827.623.828.6
AutomationBench 148.226.246.746.245.8
HLE w/ Tools 162.554.759.863.964.5
GDPval-AA v2 117691508168217431730
CyberGym(%)184.577.280.083.883.6
ExploitBench(%)154.424.432.278.076.5
ExploitGym(2 小时 / 6 小时预算)1130 / 10539 / 2970 / 36247 / 181
Z.ai Code Bench v1.0(Non-Thinking)1图示,未标数
Z.ai Code Bench v1.0(Low)1图示,未标数图示,未标数图示,未标数图示,未标数
Z.ai Code Bench v1.0(High)1图示,未标数图示,未标数图示,未标数图示,未标数
Z.ai Code Bench v1.0(Max)1图示,未标数图示,未标数图示,未标数图示,未标数
主图中,GLM-5.3 相比 GLM-5.2 的变化很集中:Terminal Bench 3.0 从 4.6 升到 28.3,DeepSWE 从 46.2 升到 66.9,Agents' Last Exam(CLI)从 23.8 升到 28.5,AutomationBench 从 26.2 升到 48.2,HLE w/ Tools 从 54.7 升到 62.5,GDPval-AA v2 从 1508 升到 1769。1
智谱官方六项 benchmark 对照图
官方主图把 Terminal Bench 3.0、DeepSWE、Agents' Last Exam(CLI)、AutomationBench、HLE w/ Tools 和 GDPval-AA v2 放在同一张图中;不同 benchmark 的分数保持原样,不能相加成总分。1

编程和工程:提升是真实的,但不是全面第一

六项主图里,GLM-5.3 在 AutomationBench 和 GDPval-AA v2 拿到最高值,在 Terminal Bench 3.0 上距离 GPT-5.6 Sol 的 34.6 和 Fable 5 的 33.7 还有差距;DeepSWE 上的 66.9 也低于 GPT-5.6 Sol 的 72.7、Fable 5 的 69.7 和 Kimi K3 的 67.5。1
这组结果更像「工程能力追上来」,而不是「所有工程任务都赢」。尤其是 DeepSWE,它更接近持续修改代码、长期保持任务状态的能力。GLM-5.3 相对 GLM-5.2 的提升幅度很大,但与领先对照模型之间仍有可见距离。
Agents' Last Exam(CLI)也有类似边界:GLM-5.3 的 28.5 高于 GLM-5.2 和 Fable 5 的 23.8,也高于 Kimi K3 的 27.6,但略低于 GPT-5.6 Sol 的 28.6。GDPval-AA v2 则给出另一种信号:在官方图列出的 44 种职业知识工作评测中,GLM-5.3 得分 1769,高于 GPT-5.6 Sol 的 1730、Fable 5 的 1743、Kimi K3 的 1682 和 GLM-5.2 的 1508。1

Token 效率:方向清楚,精确数字不要硬读

Z.ai Code Bench v1.0 的官方图把准确率和每个任务的平均输出 token 放在同一张曲线上,评测环境标注为 Claude Code 2.1.207。图中 GLM-5.3 的曲线位于 GLM-5.2 之上,并在更高 effort level 下接近或超过 Claude Opus 4.8;但官方没有给每个点标出数字。1
智谱官方 Z.ai Code Bench v1.0 曲线
官方图同时展示准确率和每任务平均输出 tokens;Low、High、Max 等点位以曲线标出,未逐点标注精确数值,因此表格不做肉眼估读。1
这张图能支持的判断是:GLM-5.3 在更高推理投入下,完成质量和输出长度之间的曲线优于 GLM-5.2。它不能单独证明真实调用成本一定更低,因为官方页面没有披露每个任务的 token 消耗分布、失败重试方式或价格。

网络安全:漏洞链前端领先,深层利用仍落后

安全图把结果拆成三项。CyberGym 上,GLM-5.3 得分 84.5%,高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;ExploitBench 上,GLM-5.3 为 54.4%,从 GLM-5.2 的 24.4% 明显上升,但仍低于 Mythos 5 的 78.0% 和 GPT-5.6 Sol 的 76.5%。官方文档也把 GLM-5.3 的优势描述为更集中在漏洞利用链前端,在更深入的漏洞利用和完整攻防任务上仍有提升空间。1
ExploitGym 不能和前两项直接横比。官方图同时给出 2 小时和 6 小时预算:GLM-5.3 标为 130 / 105,GLM-5.2 为 39 / 29,Kimi K3 为 70 / 36,Mythos 5 为 247 / 181。这里的预算条件本身就是结果的一部分,脱离预算只比较数字会误读模型位置。1
智谱官方网络安全 benchmark 对照图
ExploitGym 以 2 小时和 6 小时预算分别展示;CyberGym 与 ExploitBench 则以单值呈现,三者的运行条件不能视为同一量尺。1

同一基座,为什么能有这样的跃升

智谱官方给出的解释不是增加基座参数,而是把后训练环境做得更长、更丰富:训练任务从孤立的编程题扩展到发现问题、分析方案、实施、验证和交付的完整流程;部分任务的工作量相当于资深工程师连续数天的工作,还会调用计算集群、存储系统、内部文档和代码库。1
这个解释与分数变化是对得上的。GLM-5.2 到 GLM-5.3 的提升并没有只出现在一个短题 benchmark,而是同时出现在持续改码、终端操作、跨工具 Agent、专业知识工作和漏洞推理上。模型学到的对象从「给出一段代码」扩展为「在真实环境里把事情做完」,因此变化会集中出现在长程任务。
但评测图也保留了反例:GLM-5.3 在 HLE w/ Tools 上的 62.5 低于 GPT-5.6 Sol 的 64.5 和 Fable 5 的 63.9,在 ExploitBench 上距离 Mythos 5 还有 23.6 个百分点。后训练环境能把能力推过一段距离,却没有把所有任务的差距一起抹平。

读者应该怎样使用这张表

  • 如果目标是 Coding Agent、终端操作或自动化工作流,优先看 Terminal Bench 3.0、DeepSWE、Agents' Last Exam(CLI)和 AutomationBench。GLM-5.3 相比 GLM-5.2 的提升很大,但在持续改码任务上仍需与 Kimi K3、Fable 5 和 GPT-5.6 Sol 同条件复测。
  • 如果目标是专业知识工作,GDPval-AA v2 是目前这组官方图里 GLM-5.3 最清楚的强项之一;它可以作为进一步试用的理由,但不能替代目标职业和真实资料上的验收。
  • 如果目标是网络安全,CyberGym 的 84.5% 说明漏洞发现与推理链条前段值得测试;ExploitBench 和 ExploitGym 的结果提醒读者,深层利用、预算限制和完整攻防任务仍然需要单独验证。
  • 如果目标是控制调用成本,先等 API endpoint 和价格公开,再用自己的任务记录输入输出 token、重试次数和完成率。官方 Code Bench 图只说明准确率与输出长度的关系,不能直接换算账单。
这次发布最稳妥的结论是:GLM-5.3 证明了同一基座仍有可通过后训练释放的空间,尤其是在长程软件工程、自动化和部分漏洞推理任务上;它还没有证明自己已经成为跨 benchmark 的全面第一。对实际选型来说,模型列里的空白和 ExploitGym 的预算条件,与加粗的最高分同样重要。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.