GLM-5.3-Flash API 促销结束:恢复标准价 $0.15/$0.50,Coding Plan 夜间免额度进行中

GLM-5.3-Flash API 促销结束:恢复标准价 $0.15/$0.50,Coding Plan 夜间免额度进行中

GLM-5.3-Flash 的五折 API 促销已结束并恢复标准价,本文核对账单变动、缓存成本及 Coding Plan 专属夜间免额度活动。

Z.ai 官方价目页更新显示,GLM-5.3-Flash 的上架半价促销已于 2026 年 9 月 9 日 24:00 UTC+8 正式结束,API 调用单价已回退至标准列表价。与此同时,官方正在进行针对 GLM Coding Plan 套餐用户的夜间免额度活动。12

先说结论

对于使用计量 API 的团队,GLM-5.3-Flash 的每百万 tokens 成本从促销期的输入 0.075 美元、输出 0.25 美元,恢复为标准价输入 0.15 美元、输出 0.50 美元,账单单价相比前两周翻倍。如果系统大量依赖命中缓存,缓存输入单价现为每百万 tokens 0.03 美元,存储仍然限时免费。1
对于通过 GLM Coding Plan 订阅使用该模型的开发者,9 月 3 日至 9 月 20 日期间,每天 23:00 至次日 09:00(UTC+8)在 ZCode 中调用该模型完全不消耗额度。团队可以根据业务场景,把离线批量编码或测试任务调度到该时间窗口。2

快速核对

项目促销期状态(8/26—9/9)当前标准状态(9/10 起)官方信源与边界说明
普通输入单价0.075 美元 / 1M tokens0.15 美元 / 1M tokensZ.ai 官方价目页;首发五折已于 9 月 9 日 24:00 结束。1
缓存输入单价0.015 美元 / 1M tokens0.03 美元 / 1M tokens缓存存储当前维持限时免费。1
补全输出单价0.25 美元 / 1M tokens0.50 美元 / 1M tokens模型默认强制开启思考,输出 tokens 包含思考过程。13
API 模型 IDglm-5.3-flashglm-5.3-flash保持一致,支持文本、图像与视频等多模态输入。3
上下文与输出规格1M 上下文,128K 输出1M 上下文,128K 输出规格无变更。3
Coding Plan 夜间活动常规 3 倍额度23:00–09:00 ZCode 零额度消耗活动期为 9 月 3 日至 9 月 20 日,仅限 Coding Plan 用户。2

计量 API 账单变化与测算

促销期结束后,调用 GLM-5.3-Flash 的账单将直接反映标准费率。以百万 tokens 为单位,输入上涨 0.075 美元,输出上涨 0.25 美元。1
一个典型的长上下文多轮对话或代码审查请求,如果平均单次输入 20,000 tokens、输出 2,000 tokens:
  • 在五折促销期,未命中缓存时的单次请求费用约为 0.0020 美元。
  • 在当前标准价下,单次请求费用为 0.0040 美元。
  • 如果前置系统提示词与长文档稳定命中缓存,输入费用降至每百万 tokens 0.03 美元,相同请求的单次成本可以压到约 0.0016 美元。1
虽然单价上涨了一倍,但与同类 1M 窗口的轻量多模态模型相比,输入 0.15 美元与输出 0.50 美元的标准价仍然属于低成本区间。企业在重新核算月度预算时,应把预估账单的输入输出基准调整为当前标准值。

Coding Plan 专属免额度窗口

Z.ai 在 9 月初推出的 Usage Campaign 正在进行中,这项优惠针对订阅了 GLM Coding Plan 的用户,活动时间从 2026 年 9 月 3 日持续到 9 月 20 日。2
该活动具有明确的适用边界:
  1. 时间窗口固定:每天 23:00 至次日 09:00(新加坡时间 UTC+8,包含周末与节假日)。
  2. 工具规则不同:在 ZCode 中直接使用 GLM-5.3-Flash 享受完全零额度消耗;在其他受支持的 Agent 插件中使用,可用额度在此前规则上翻倍。
  3. 独立于计量 API:该活动仅适用于 GLM Coding Plan 订阅套餐的配额消耗,普通开发者通过 API Key 发起的标准 HTTP API 请求仍按每百万 tokens 计费,不享受夜间免扣费。2

生产接入与调度建议

随着促销结束与夜间活动的推进,使用该模型的团队可以采取以下策略:
  1. 配置 Prompt Cache 压低输入成本。标准价下缓存输入单价(0.03 美元)仅为未命中单价(0.15 美元)的五分之一。对于固定 System Prompt、长代码仓库上下文或结构化指令,保持前缀稳定能够直接对冲促销到期的成本涨幅。1
  2. 注意推理 Tokens 的开销。官方文档明确标记 thinking.type 仅支持 enabled,模型在作答前会生成思维链,这部分思考内容计入 output tokens 计费。输出单价为 0.50 美元,在设计高频或简短交互时,需要评估思考过程带来的总 token 增长。3
  3. 分流大批量开发测试任务。如果团队成员拥有 GLM Coding Plan 账号,可将代码库索引、全量单元测试生成、批量重构等长程任务安排在每天 23:00 至次日 09:00 期间由 ZCode 执行,利用零额度窗口降低整体开销。2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel