
GLM-5.3-Flash API 促销结束:恢复标准价 $0.15/$0.50,Coding Plan 夜间免额度进行中
GLM-5.3-Flash 的五折 API 促销已结束并恢复标准价,本文核对账单变动、缓存成本及 Coding Plan 专属夜间免额度活动。
Z.ai 官方价目页更新显示,GLM-5.3-Flash 的上架半价促销已于 2026 年 9 月 9 日 24:00 UTC+8 正式结束,API 调用单价已回退至标准列表价。与此同时,官方正在进行针对 GLM Coding Plan 套餐用户的夜间免额度活动。12
先说结论
对于使用计量 API 的团队,GLM-5.3-Flash 的每百万 tokens 成本从促销期的输入 0.075 美元、输出 0.25 美元,恢复为标准价输入 0.15 美元、输出 0.50 美元,账单单价相比前两周翻倍。如果系统大量依赖命中缓存,缓存输入单价现为每百万 tokens 0.03 美元,存储仍然限时免费。1
对于通过 GLM Coding Plan 订阅使用该模型的开发者,9 月 3 日至 9 月 20 日期间,每天 23:00 至次日 09:00(UTC+8)在 ZCode 中调用该模型完全不消耗额度。团队可以根据业务场景,把离线批量编码或测试任务调度到该时间窗口。2
快速核对
| 项目 | 促销期状态(8/26—9/9) | 当前标准状态(9/10 起) | 官方信源与边界说明 |
|---|---|---|---|
| 普通输入单价 | 0.075 美元 / 1M tokens | 0.15 美元 / 1M tokens | Z.ai 官方价目页;首发五折已于 9 月 9 日 24:00 结束。1 |
| 缓存输入单价 | 0.015 美元 / 1M tokens | 0.03 美元 / 1M tokens | 缓存存储当前维持限时免费。1 |
| 补全输出单价 | 0.25 美元 / 1M tokens | 0.50 美元 / 1M tokens | 模型默认强制开启思考,输出 tokens 包含思考过程。13 |
| API 模型 ID | glm-5.3-flash | glm-5.3-flash | 保持一致,支持文本、图像与视频等多模态输入。3 |
| 上下文与输出规格 | 1M 上下文,128K 输出 | 1M 上下文,128K 输出 | 规格无变更。3 |
| Coding Plan 夜间活动 | 常规 3 倍额度 | 23:00–09:00 ZCode 零额度消耗 | 活动期为 9 月 3 日至 9 月 20 日,仅限 Coding Plan 用户。2 |
计量 API 账单变化与测算
促销期结束后,调用 GLM-5.3-Flash 的账单将直接反映标准费率。以百万 tokens 为单位,输入上涨 0.075 美元,输出上涨 0.25 美元。1
一个典型的长上下文多轮对话或代码审查请求,如果平均单次输入 20,000 tokens、输出 2,000 tokens:
- 在五折促销期,未命中缓存时的单次请求费用约为 0.0020 美元。
- 在当前标准价下,单次请求费用为 0.0040 美元。
- 如果前置系统提示词与长文档稳定命中缓存,输入费用降至每百万 tokens 0.03 美元,相同请求的单次成本可以压到约 0.0016 美元。1
虽然单价上涨了一倍,但与同类 1M 窗口的轻量多模态模型相比,输入 0.15 美元与输出 0.50 美元的标准价仍然属于低成本区间。企业在重新核算月度预算时,应把预估账单的输入输出基准调整为当前标准值。
Coding Plan 专属免额度窗口
Z.ai 在 9 月初推出的 Usage Campaign 正在进行中,这项优惠针对订阅了 GLM Coding Plan 的用户,活动时间从 2026 年 9 月 3 日持续到 9 月 20 日。2
该活动具有明确的适用边界:
- 时间窗口固定:每天 23:00 至次日 09:00(新加坡时间 UTC+8,包含周末与节假日)。
- 工具规则不同:在 ZCode 中直接使用 GLM-5.3-Flash 享受完全零额度消耗;在其他受支持的 Agent 插件中使用,可用额度在此前规则上翻倍。
- 独立于计量 API:该活动仅适用于 GLM Coding Plan 订阅套餐的配额消耗,普通开发者通过 API Key 发起的标准 HTTP API 请求仍按每百万 tokens 计费,不享受夜间免扣费。2
生产接入与调度建议
随着促销结束与夜间活动的推进,使用该模型的团队可以采取以下策略:
- 配置 Prompt Cache 压低输入成本。标准价下缓存输入单价(0.03 美元)仅为未命中单价(0.15 美元)的五分之一。对于固定 System Prompt、长代码仓库上下文或结构化指令,保持前缀稳定能够直接对冲促销到期的成本涨幅。1
- 注意推理 Tokens 的开销。官方文档明确标记
thinking.type仅支持enabled,模型在作答前会生成思维链,这部分思考内容计入 output tokens 计费。输出单价为 0.50 美元,在设计高频或简短交互时,需要评估思考过程带来的总 token 增长。3 - 分流大批量开发测试任务。如果团队成员拥有 GLM Coding Plan 账号,可将代码库索引、全量单元测试生成、批量重构等长程任务安排在每天 23:00 至次日 09:00 期间由 ZCode 执行,利用零额度窗口降低整体开销。2
References
- 1
- 2
- 3
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- DeepSeek 逆转 V4 Pro 退役计划:API 9 月 14 日后继续提供,原价结算不自动路由
- DeepSeek 首次公开 V4.1-Flash 技术报告:552B 骨干参数与 CED 架构亮相,KV 缓存压至 890 字节
- DeepSeek 正式上线 deepseek-flash:调价全面生效,9 月 14 日起全量路由接管 V4 Pro
- DeepSeek 计划今日正式发布 V4.1 Flash:全量路由接管 V4 Pro,Flash 全系午间降价最高 60%
- Muse Spark 1.3 max 公开可用:Meta 把最强推理配置推上 Muse Code 与 API
- GPT-6 Astra 可用性更新:Pro、企业 Work/Codex 与 API 已开放
- Qwen3.8-Max-0902 更新:同一基座、同一价格,编码后训练改写表现
- GPT-6 Astra 正式 rollout:模型 ID、价格与系统卡已上线,可用性仍分阶段
