GLM-5.3-Flash 发布:320B/18B 开权重、1M 上下文、API 五折至 9/9

GLM-5.3-Flash 发布:320B/18B 开权重、1M 上下文、API 五折至 9/9

Z.ai 发布 GLM-5.3-Flash:GLM-5 系列首个原生多模态模型,320B/18B、MIT 开权重、1M 上下文;API 标价 $0.15/$0.50,9 月 9 日前五折。

先看结论

Z.ai 在北京时间 2026 年 8 月 26 日 正式发布 GLM-5.3-Flash。官方博客标注当天发布,@Zai_org 主帖时间为 22:12;Hugging Face 官方仓库 zai-org/GLM-5.3-FlashlastModified 为次日凌晨 00:31:15123
这次和此前的 GLM-5.3 不是同一次发布。Flash 是 GLM-5 系列首个原生多模态模型:总参数约 320B,每 token 激活约 18B,原生 1M 上下文,权重按 MIT License 开放。API 模型代码为 glm-5.3-flash,价目表标价为每百万 tokens 输入 $0.15、缓存命中输入 $0.03、输出 $0.50;到 2026 年 9 月 9 日 24:00(UTC+8) 前按 5 折计,即 $0.075 / $0.015 / $0.251245
对选型团队,现在可以同时做三件事:用 API 跑编码与多模态 Agent 任务、下载权重做本地兼容、对照 MIT 许可评估商业路径。发布前它以 Ox Alpha 名义在 OpenRouter / OpenCode 上灰测,官方称当周流量最高,且推理跑在国产芯片集群上。12

关键资料一览

项目目前可确认的信息
发布时间官方博客标注 2026-08-26;@Zai_org 主帖为当天 22:12(北京时间);HF lastModified 为 2026-08-27 00:31:15(北京时间)。123
模型定位GLM-5 系列首个原生多模态模型;官方称编码与 Agent 评测接近 Claude Opus 4.8,价格约为同类能力模型的约 1/10。1
参数口径官方写总参数 320B、激活 18B;HF safetensors 汇总约 321B params。配置显示 45 层、288 个 routed 专家 + 1 个 shared、每 token 激活 8 个专家。13
上下文官方文档与推文写 1M-token 上下文;config.jsonmax_position_embeddings 为 1,048,576。235
模态与能力原生图像 / 视频 / 文件输入;支持工具调用、结构化输出、上下文缓存;thinking.type 仅支持 enabled,推理不可关闭。5
开放入口Hugging Face zai-org/GLM-5.3-Flash;API、Coding Plan、ZCode、Chat、AutoClaw 已同步开放。本地框架列出 SGLang、vLLM、TokenSpeed、KTransformers。23
许可仓库 LICENSE 为 MIT License(Copyright 2026 Z.AI Co., Ltd);HF 元数据标注 license:mit36
API 与价格模型代码 glm-5.3-flash。标价输入 $0.15、缓存命中输入 $0.03、输出 $0.50(每百万 tokens);2026-09-09 24:00(UTC+8)前 5 折。Coding Plan 可用额度约为 GLM-5.3 的 3 倍。45
和频道此前两篇 GLM-5.3 简讯对照:GLM-5.3 是 743B 基座上的后训练旗舰,权重当时尚未开放;GLM-5.3-Flash 是另一条线——更低激活、原生多模态、MIT 权重和已上线的低价 API。

架构为什么更便宜

官方把 Flash 的效率压到三件事上:更少激活参数、更浅网络,以及稀疏注意力与线性注意力的混合。相对 GLM-4.5 系列,总参数接近(320B vs 355B),激活从 32B 降到 18B,层数从 92 降到 45。1
GLM-5.3-Flash 官方架构图
Z.ai 官方发布的 GLM-5.3-Flash 架构示意:混合稀疏 / 线性注意力、mHC、MoE,以及相对序列长度的 KV cache 与 attention 计算对比。1
按官方说明,对服务成本最直接的几条是:
  1. 线性注意力管局部,稀疏注意力管全局。 线性注意力用状态建模抓近程依赖,稀疏注意力用轻量 indexer 检索相关全局上下文;为了撑住 1M 上下文,官方还引入 IndexPool,把 4 个 indexer key 加权池化成 1 个。1
  2. 相对 GLM-5.3,attention 计算约降 3.0×,KV cache 约降 4.4×。 官方在与 DeepSeek-V4-Flash、Kimi-K3 的对照里称,Flash 的 attention 计算量最低;KV cache 仍略高于后两者。15
  3. 预训练语料约 30T tokens 的多模态数据,并启用 mHC(Manifold-Constrained Hyper-Connections)。 官方把这些改动和混合注意力一起,解释为“更少算力换更高智力”的基础。1
HF 配置还显示这是多模态条件生成架构 Glm5NextForConditionalGeneration,带独立 vision_config;文本侧 45 层里线性注意力与稀疏注意力按 3:1 交错,前 3 层 MLP 为 dense,其余为 sparse MoE。3

官方自报 benchmark

下面分数均来自 Z.ai 官方博客与模型卡,属于厂商自述。表格对照 GLM-5.2、DeepSeek-V4-Vision-Exp、Claude Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flash;脚注说明了不同 harness 与上下文设置。1
评测GLM-5.3-FlashGLM-5.2DeepSeek-V4-Vision-ExpOpus 4.8GPT-5.6 TerraGemini 3.7 Flash
Terminal Bench 2.184.3 181.083.985.087.485.8
DeepSWE v1.163.4 146.259.358.069.665.3
NL2Repo56.3 148.957.769.7
Toolathlon Verified78.4 159.975.976.274.9
AutomationBench v1.0.648.8 126.238.841.037.252.3
Agents' Last Exam26.3 120.427.327.028.0
HLE w/ Tools55.3 154.755.157.9
GDPval-AA v21773 115041675158215711527
官方编码与 Agent 六项评测图
Z.ai 官方给出的编码 / Agent 六项对照图,横轴为各模型在 Terminal Bench 2.1、DeepSWE、Agents' Last Exam、AutomationBench、HLE w/ Tools、GDPval-AA v2 上的分数。1
视觉侧官方给出的代表性分数包括:OfficeQA Pro 62.4、CharXiv Reasoning w/ Tools 89.4、Chartography w/ Tools 78.0、BabyVision 53.4、MVbench 77.8、MMVU 80.5。官方还称 Artificial Analysis Intelligence Index v4.1.1 上得分为 57,折后约 $0.045 / task。这些数字适合作为第一轮评测对照,真实业务仍要看完成率、重试和人工接管。1

价格、API 与本地入口

API 侧,开发文档给出的模型代码是 glm-5.3-flash,文本参数与 GLM-5.3 一致,上下文按 1M 配置;图片通过 messages[].content[] 里的 image_url 传入。推荐采样为 temperature: 1top_p: 0.95reasoning_effort: maxthinking.type 只能是 enabled5
价格以官方价目页为准,单位均为每百万 tokens:4
项目标价5 折后(至 2026-09-09 24:00 UTC+8)
输入$0.15$0.075
缓存命中输入$0.03$0.015
输出$0.50$0.25
Cached Input Storage限时免费限时免费
和同页的 GLM-5.3 / GLM-5.2(输入 $1.4 / 缓存 $0.26 / 输出 $4.4)比,Flash 标价大约是它们的 1/9–1/104
订阅侧,GLM Coding Plan 已全量开放 Flash,官方称可用额度约为 GLM-5.3 的 3 倍;积分制下,低峰时段与周末全天按 50% 积分消耗。ZCode 侧可接 Browser Use 与 Computer Use,做页面与桌面操作的视觉闭环。15
权重侧,MIT 许可文本允许使用、复制、修改、合并、发布、分发、再许可和销售,条件是保留版权与许可声明。本地部署官方列出 SGLang cookbookvLLM recipesTokenSpeedKTransformers 教程36

现在适合怎样试

  1. API 先跑编码 Agent 和看图闭环。glm-5.3-flash 覆盖仓库修复、工具调用、截图对照前端、Office 交付物;记录完成率、输出 token 和人工接管。促销价到 9 月 9 日,适合先做成本基线。45
  2. 本地先做框架兼容。 用 SGLang / vLLM / TokenSpeed / KTransformers 拉起权重,测量显存、吞吐和 1M 上下文下的延迟;配置里已写明 45 层混合注意力与视觉塔,部署要以实测为准。3
  3. 把 Flash 和 GLM-5.3 放进同一轮对照。 Flash 便宜、多模态、开权重;GLM-5.3 是更高价的旗舰 API 线。任务集至少同时覆盖纯文本编码、多模态 Agent 和长上下文,再决定默认路由。14
  4. 商业路径按 MIT 文本走内部评审。 MIT 对再分发和商用限制较少,但仍要保留版权声明;若走托管 API,再核验地区、限流和 Coding Plan 积分规则。56
GLM-5.3-Flash 现在已经同时具备开放权重、可调用 API 和明确促销价。它最明确的价值,是把原生多模态、混合注意力和约 18B 激活的服务成本,压进一条可今天开测的产品线。本地和云端团队都可以立刻开测;依赖独立第三方榜单或安全评估的团队,等后续报告再补一版跟进。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel