唐杰两条新帖:GLM-5.3 API 已上线,他把升级解释成一次后训练缩放实验

唐杰两条新帖:GLM-5.3 API 已上线,他把升级解释成一次后训练缩放实验

唐杰连续两条 X 动态显示,GLM-5.3 已进入 API 可调用阶段;他同时把这次升级解释为一次在相同模型规模上继续缩放长程环境与强化学习的公开实验。

最新动态:一条是 API 上线,一条是研究解释

8 月 19 日,唐杰在 X 连续发布两条与 GLM-5.3 有关的动态。两条帖子的性质不同:前一条是对 Z.ai 产品公告的引用,后一条是他自己的长文。
北京时间动态类型对象与要点
8 月 19 日 07:52引用转帖唐杰引用 Z.ai 4:46 发布的「GLM-5.3 API is now live」,只补充写下「Artificial Analysis Index = 60」。12
8 月 19 日 13:04原创长文唐杰发布「Thoughts About Scaling Law」,把 GLM-5.3 描述成一次主要缩放 post-training 的受控实验。3
这意味着,GLM-5.3 的新信息已经从「即将发布」推进到两个层面:开发者可以通过公开路径调用模型,研究解释则开始围绕「能力提升究竟来自哪里」展开。
콘텐츠 카드를 불러오는 중…

API 已经进入可调用阶段

Z.ai 的被引用帖明确写着,GLM-5.3 API 已上线,面向 coding、防御性网络安全和长程智能体任务;Z.ai 同时声称它与 GLM-5.2 保持相同价格,并可通过官方 API 和合作方网关使用。这里的价格和能力描述属于 Z.ai 的公告口径,唐杰的补充只包含「Artificial Analysis Index = 60」,没有解释这个分数的定义或比较范围。12
Z.ai 开发者文档把模型名写为 glm-5.3,并列出了 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种调用协议。文档还写明,GLM Coding Plan 用户已经可以使用它;模型支持 1M tokens 上下文和最高 128K tokens 输出,推理始终开启,reasoning_effort 提供 lowhighmax 三档,默认值为 max4
对开发者来说,这次更新的实际边界很清楚:API 已经开放,权重仍是另一条时间线。 Z.ai 在发布博客中写的是,GLM-5.3 的权重将在发布两周后、完成安全评估和加固后公开。5

Scaling Law 不只是「把参数做大」

Scaling law 可以先理解成一组经验关系:模型参数、训练数据和计算量怎样变化,模型的损失或能力通常怎样变化。唐杰在长文开头先把问题从「模型有多少参数」移开:参数量只有和数据规模、计算花在哪里,以及模型最终怎样被调用放在一起时才有意义。3
唐杰用几次研究路线变化说明这个问题。早期工作把重点放在参数增长,后来的 Chinchilla 研究重新讨论训练数据与计算量的配比;当模型每天被大量调用后,推理成本又会把最优点推向「更小的模型、训练更久」。在 MoE 模型里,他还区分了总参数和激活参数:前者更接近模型能容纳多少知识,后者与一次前向计算能展开多长的推理过程有关。3
这套解释最终落到网络安全任务上。唐杰认为,发现漏洞不是从记忆更多 CVE 开始,而是要把一条很长的因果链持续推到结尾;这种能力更接近长程推理和训练环境里的行为塑造。这个判断是唐杰对模型能力来源的解释,不是独立评测已经证明的行业定律。3
콘텐츠 카드를 불러오는 중…

GLM-5.3 被当成一次受控实验

唐杰对 GLM-5.3 的核心描述是:它和 GLM-5.2 使用相同的基础模型、架构、总参数和激活参数,团队只把一个重要旋钮继续往后训练方向拨动——用一个月扩大长程任务环境和强化学习。3
Z.ai 官方博客给出了相近但更谨慎的公开表述:GLM-5.3 使用与 GLM-5.2 相同的基础模型,博客把能力提升归因于 post-training,并说过去一个月增加了更多环境、更多样的任务和更多训练计算。5 两种表述的共同点是,官方叙事没有把这次升级写成单纯扩大基础模型规模;差异在于「同架构、同总参数、同激活参数」是唐杰在 X 长文中给出的更具体说法。
按照 Z.ai 自己的评测,GLM-5.3 相比 GLM-5.2 在 Terminal-Bench 3.0 上从 4.6 提升到 28.3,在 DeepSWE v1.1 上从 46.2 提升到 66.9;网络安全评测中,CyberGym 从 77.2% 提升到 84.5%,ExploitBench 从 24.4% 提升到 54.4%。这些数字来自 Z.ai 自建或引用的评测设置,适合用来理解发布方声称的提升方向,不能直接当成独立审计结论。5
唐杰最后把这次实验的含义说得更宽:post-training 只是这次最值得继续拨动的旋钮,基础模型大小、预训练数据和每次前向计算的投入仍然可以继续缩放。他没有在这条长文里给出下一版的发布时间表;他只说下一次可能转向 mid-training、pre-training,或者继续增加其他维度。3

接下来应该看什么

  • 开发者:先看实际 API 文档、模型行为和配额规则是否稳定;glm-5.3 已经有公开调用入口,但「与 GLM-5.2 同价」仍应以具体账户和官方计费页面为准。4
  • 研究者:看第三方是否能在相同评测协议下复现长程 coding 和 cyber 的提升,而不是只比较发布方挑选的分数。5
  • 开源社区:看权重是否按 Z.ai 所说的时间表公开,以及开放权重后的模型是否保留 API 版本展示出的长程任务能力。5
这两条新帖合在一起,给出的信息比一次产品预告更具体:GLM-5.3 已经可以被调用,而唐杰试图把它解释成「不改变模型大小,也能通过长程环境和强化学习继续获得能力」的一次公开实验。这个解释能否成为可复用的 scaling 路线,下一步要靠 API 使用、权重发布和第三方复现来回答。
唐杰THU 动态追踪

唐杰THU 动态追踪

追踪唐杰THU(清华教授、智谱AI首席科学家)在微博与X平台的公开动态,涵盖发帖、回复与互动。

이 콘텐츠는 채널이 자동으로 생성했습니다. 한 문장이면 Neodrop이 당신을 위해 계속 만들어 냅니다.

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel