智谱上线 GLM-5.3-FlashX:推理速度 200 tokens/s,价格是 GLM-5.3-Flash 的 2.5 倍

智谱上线 GLM-5.3-FlashX:推理速度 200 tokens/s,价格是 GLM-5.3-Flash 的 2.5 倍

智谱为 GLM-5.3-Flash 加了一档推理速度 200 tokens/s 的高速配置 GLM-5.3-FlashX:规格与 Flash 相同,输出价涨到 2.5 倍,暂不进 Coding Plan、也没有开放权重和第三方托管。

北京时间 2026 年 9 月 18 日,智谱为 GLM-5.3-Flash 加了一档更快的推理配置,模型代码是 glm-5.3-flashxZ.AI 的官方价目页与模型文档都已收录这一条,模型文档的标题写成「GLM-5.3-Flash/FlashX」。12
官方文档里关于速度只有一句话:「GLM-5.3-FlashX is now live」,推理速度 200 tokens/s。2「比 GLM-5.3-Flash 快 5 倍、价格是它的 2.5 倍」这组说法出自智谱对媒体的表述,官方文档没有给出对照基线。34
这次没有配套的发布公告。智谱的官方研究页最新一条仍停在 8 月 26 日的 GLM-5.3-Flash,开放平台的「模型与产品发布记录」也还没有这一条。56FlashX 目前挂在文档、价目页和 API 上,智谱暂未为它单独出过公告。

先说结论:变的是速度和价格

三项单价全线上调,输出端正好 2.5 倍。 GLM-5.3-FlashX 每百万 tokens 的价格是输入 0.37 美元、缓存命中输入 0.075 美元、输出 1.25 美元;GLM-5.3-Flash 对应的是 0.15、0.03、0.50 美元。1逐项换算,输入是 2.47 倍,缓存输入与输出都是 2.50 倍。缓存存储两档都标着限时免费。1
规格这一层沿用同一份文档。 输入模态(视频、图像、文本、文件)、1M 上下文、128K 最大输出,以及 temperature: 1top_p: 0.95reasoning_effort: maxthinking.type 仅支持 enabled 这组推荐参数,在官方文档里是两档共用的同一套。2
快出来的部分来自推理侧。 官方把提速归到国产芯片集群与推理优化:同一硬件上,端到端服务性能相比初始基线提升 3 倍,团队在 SGLang 之上另建了一套适配该架构的推理引擎。2对媒体,智谱说由 10 万张国产芯片组成的推理集群上线即被打满,这次扩大算力规模并推出价格更高、速度更快的档位。3

快速核对

项目GLM-5.3-FlashGLM-5.3-FlashX官方信源与边界说明
模型代码glm-5.3-flashglm-5.3-flashx官方模型文档的 Model Code 一栏同时列出两个。2
上线时间2026-08-262026-09-18FlashX 的日期出自智谱对媒体的表述;官方文档与价目页不带日期。9 月 11 日的历史快照里,同一张表还只有 Flash、GLM-5.3、GLM-5.2 三行。37
输入模态视频、图像、文本、文件同左两档共用同一张规格卡。2
上下文 / 最大输出1M / 128K1M / 128K同上。2
思考模式enabled,不可关闭同左文档建议同时设置 thinking.clear_thinking: false2
输入价0.15 美元 / 1M tokens0.37 美元 / 1M tokens官方价目页 Latest Models 表分列两行。1
缓存命中输入价0.03 美元0.075 美元同上。1
输出价0.50 美元1.25 美元输出 tokens 包含思考过程。12
缓存存储限时免费限时免费价目页两行同标。1
API 端点Chat Completions 视觉端点内同左,且是该端点的示例与默认值文本端点的型号枚举里没有这两个。8
GLM Coding Plan在计划内,额度为 GLM-5.3 的 3 倍官方文档写明暂未开放走 FlashX 需要按计量 API 计费。29
开放权重MIT 许可,Hugging Face 有仓库暂无zai-org 在 Hugging Face 的仓库列表里没有 FlashX。10
第三方托管OpenRouter 上有暂无OpenRouter 的 Z.ai 页面列出 21 个模型,最新仍是 8 月 26 日的 GLM 5.3 Flash。11
官方评测分数AA 综合智能指数 57 分官方未披露57 分与每任务 0.045 美元挂在 Flash 名下,8 月 26 日发布时给出。2
时间窗口已恢复标准价无促销、无截止日期价目页没有给出限时折扣或生效期限。1

2.5 倍落到账单上是什么样

拿一个常见的长上下文请求做样本:输入 20,000 tokens、输出 2,000 tokens。1
  • 在 GLM-5.3-Flash 上,单次约 0.0040 美元(输入 0.0030 加输出 0.0010)。
  • 同样的请求换到 GLM-5.3-FlashX,单次约 0.0099 美元(输入 0.0074 加输出 0.0025)。
  • 如果这 20,000 tokens 全部命中缓存,Flash 降到约 0.0016 美元,FlashX 降到约 0.0040 美元。
缓存把两档的成本同时压到四成上下,档位之间的倍数关系留住。1
把每任务成本换算一下:GLM-5.3-Flash 发布时引用的 Artificial Analysis 每任务 0.045 美元是折扣价口径,如果 token 消耗量不变、价格按 2.5 倍走,FlashX 的每任务成本大致会按同一倍数上抬。这是按 token 数不变做的推算,官方没有给出 FlashX 的每任务成本。2

哪些数字还没有

FlashX 自己的评测分数一条都没有。 官方文档里能找到的 Artificial Analysis 综合智能指数 v4.1.1 的 57 分、每任务 0.045 美元,都挂在 GLM-5.3-Flash 名下,出自 8 月 26 日那次发布。2
FlashX 的参数量官方未披露。 文档里那组数字——总参数 320B、激活 18B、45 层、注意力计算量与 KV 缓存相比 GLM-5.3 分别降低 3.01 倍和 4.44 倍——写在 GLM-5.3-Flash 名下,文档没有为 FlashX 单列参数或层数。2
独立评测也还没有。 OpenRouter 的 Z.ai 页面上,FlashX 尚无条目,第三方排行榜与独立测评暂时跟不到这一档。11

接入与切换成本

已经调用 glm-5.3-flash 的项目,把模型代码换成 glm-5.3-flashx 就能切过去,其余参数沿用。2
调用位置要留意:在 Chat Completions 的型号枚举里,glm-5.3-flashxglm-5.3-flash 一起挂在视觉理解端点上,FlashX 还是这个端点的示例与默认值;文本端点的枚举里两个都没有。8
三条限制值得先看清。
  1. 不进 GLM Coding Plan。 官方文档写明 FlashX 暂未开放该套餐,计划内的仍是 GLM-5.3-Flash,额度为 GLM-5.3 的 3 倍。订阅用户调用 FlashX 会绕开套餐额度,改走计量计费。29
  2. 没有开放权重。 zai-org 在 Hugging Face 上,GLM-5.3 那一组仍是 GLM-5.3-Flash、GLM-5.3-Flash-BF16、GLM-5.3 与 GLM-5.3-BF16,没有 FlashX。需要自托管或私有化部署的团队,手上只有 Flash。10
  3. 还没有第三方托管。 OpenRouter 的 Z.ai 页面列了 21 个模型,最新仍是 8 月 26 日的 GLM 5.3 Flash 及其批量版本;FlashX 目前只在 Z.AI 自有 API 上。11
想先试再定的,可以按官方文档给的体验中心入口上手。9

该不该换:三个可以自己核对的判断

  • 输出 tokens 占你请求耗时的大头吗? 对话、代码补全、实时 Agent 这类场景,等待时间主要花在逐个 token 生成上,FlashX 压缩的正是这一段。离线批处理、夜间跑的数据管线,时间不紧,价格更低的 Flash 更合适。3
  • 你在用 GLM Coding Plan 吗? 套餐里只有 Flash;把调用切到 FlashX,这部分开销就从套餐额度转成按量账单。2
  • 你需要自托管或换一家托管吗? 这两条路目前都通不到 FlashX,需要的话先留在 Flash。1011
这档配置没有限时折扣,价目页也没有给出截止日期,按自己的节奏做评测就行。1

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel