
唐杰确认:Ox Alpha 即 GLM-5.3 Flash,OpenRouter 周份额近 20%
唐杰 8 月 27 日在微博与 X 同步确认 Ox Alpha 对外名为 GLM-5.3 Flash,并给出 OpenRouter 周 token 份额近 20%、AA 57、约 1/100 价格与国产芯片全量上线等公开数字。
双平台同日确认:Ox Alpha 就是 GLM-5.3 Flash
北京时间 2026 年 8 月 27 日,清华大学教授、智谱 AI 首席科学家唐杰在微博与 X 同步表态:此前以 Ox Alpha 预览名在 OpenRouter 上跑流量的模型,对外正式名称是 GLM-5.3 Flash。12
当天时间线可以按先后排开:
| 北京时间 | 平台 | 类型 | 要点 |
|---|---|---|---|
| 8 月 26 日 22:12 | X @Zai_org | 官方发布 | 介绍 GLM-5.3-Flash:320B 总参数 / 18B 激活、MIT 开源、原生多模态、1M 上下文;预览名 Ox Alpha;全量跑在国产 AI 芯片上。3 |
| 8 月 27 日 13:03 | X @jietang | 转发 | 转发上述 Z.ai 公告。4 |
| 8 月 27 日 13:42 | X @jietang | 英文原创 | 写明 Ox Alpha = GLM-5.3 Flash,并给出 AA 57、约 1/100 价格、国产芯片、OpenRouter 周 token 份额近 20% 且第一。2 |
| 8 月 27 日 17:29 | 微博「唐杰 THU」 | 中文原创 | 同一组数字,并补全算力短缺、数万张国产芯片全量上线、推理栈优化与 Infra Agent 参与调优的细节。1 |
X 英文帖写得很短:
Ox Alpha = GLM-5.3 Flash AA = 57 , 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter. Thanks to all for the support.2
Cargando tarjeta de contenido…
唐杰给出的四组数字
微博与 X 的核心数字一致,可以并排读:
| 指标 | 唐杰的说法 | 来源 |
|---|---|---|
| 身份对应 | Ox Alpha(对外名字:GLM-5.3 Flash) | 微博 / X12 |
| 用量 | 本周 OpenRouter 周 token 份额近 20%,排名第一 | 微博 / X12 |
| 综合评测 | AA 57(Artificial Analysis 智能指数) | 微博 / X12 |
| 价格 | 约为前沿模型的 1/100 | 微博 / X12 |
| 算力底座 | 纯国产芯片;微博写「数万张国产芯片全量上线」 | 微博 / X12 |
唐杰 X 帖附带的图,把 OpenRouter 上的份额变化画得更具体:图题写的是「Ox Alpha (GLM-5.3-Flash) pushed Z.AI above DeepSeek in weekly token share this week」,时间窗是 2026 年 4 月 27 日至 8 月 25 日;最右侧一周(标注 Aug 24 附近)黄色块标出 GLM-5.3-Flash token share 19%,同一周 DeepSeek 份额标为 16%。2

Z.ai 技术博客里还有另一张按模型累计 token 的横向条形图:在 ox-alpha 上线后的 6 个完整自然日里,ox-alpha 处理约 23.2T tokens,约为第二名 deepseek-v4-flash 的 2.3 倍,并写明 ox-alpha 是当周 OpenRouter 第一。5
微博补全的工程细节
英文短帖只点到「pure Chinese chips」。微博把工程侧写开了,主要有五层:1
- 动机:算力仍然短缺,所以选择用数万张国产芯片全量上线,并把可用的 infra 优化技术全部用上。
- 硬件约束:唐杰写明,国产芯片单颗算力和显存都不算富裕;要支撑最长 100 万 token 上下文时,显存更紧。
- 软件栈:基于 SGLang 为这套架构专门做推理引擎;用计算换带宽、通信换带宽;节点内张量并行、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化等一并上线。
- 集群调度:采用 Encode–Prefill–Decode 三阶段分离,多模态编码、预填充、逐 token 解码各自独立调度和扩缩。
- 结果与闭环:相对同硬件初始基线,端到端服务性能提升 3 倍;硬件效率与单 token 成本「已接近主流 NVIDIA GPU」。唐杰还写到一个细节:由 GLM-5.3 驱动的 Infra Agent 深度参与了算子开发、性能瓶颈诊断和推理栈调优,形成「模型在优化服务模型自己的系统」。
微博收尾句是:「价格是前沿的 1/100,效率对标主流 GPU。这个方向,我们会继续走下去。」1
这些句子是唐杰个人对部署与成本的公开描述。芯片具体型号、集群规模拆分、与 NVIDIA 对照时的精确测试协议,帖子里没有给出。
Z.ai 官方发布里已经钉死的产品边界
官方已经写明的规格:
- 规模:总参数 320B,激活 18B(写作 320B-A18B)
- 许可:MIT License,权重放在 Hugging Face
- 能力形态:GLM-5 系列首个原生多模态模型;1M-token 上下文
- 预览身份:此前以
ox-alpha在 OpenCode 与 OpenRouter 匿名试跑 - 算力声明:流量「running entirely on Chinese AI chips」
- 架构要点(博客):稀疏注意力与线性注意力的混合结构;Manifold-Constrained Hyper-Connections(mHC);长上下文侧的 IndexPool 等
官方入口(发布帖与博客给出的路径):
| 用途 | 入口 |
|---|---|
| 技术说明 | z.ai/blog/glm-5.3-flash |
| API 文档 | docs.z.ai/guides/llm/glm-5.3-flash |
| 权重 | Hugging Face · zai-org/GLM-5.3-Flash |
| Coding Plan | z.ai/subscribe |
| 产品侧 | ZCode、Chat、AutoClaw 等官方路径 |
博客对 Artificial Analysis Intelligence Index v4.1.1 的写法是:GLM-5.3-Flash 得分 57,折扣价约 $0.045 / task,并称这是此前大约 10 倍成本 才能买到的智能水平;同时写相对 GLM-5.2「one-tenth the price」。5

价格口径需要分开记:
两边数字都来自公开文本,比较基准(「前沿模型」具体指哪一家、是否含折扣、是否按 AA 单次任务成本)并不完全重合。引用时保留各自原文即可。
博客还给出一组 coding / agentic 评测对照,例如 DeepSWE v1.1 上 GLM-5.3-Flash 63.4、GLM-5.2 46.2;AutomationBench v1.0.6 上 48.8 对 26.2;并称整体接近 Claude Opus 4.8。这些数字来自 Z.ai 自己整理的评测表,独立复现与第三方审计边界仍以各榜单官方协议为准。5
与 8 月 14 日上线的 GLM-5.3(偏 coding / cyber defense、后训练缩放叙事)相比,本条动态的新信息是另一条产品线:Flash 以更低激活参数、原生多模态和成本/吞吐定位正式对外,并已经用 OpenRouter 上的预览流量完成了一次公开验证。
读者可以接着看什么
- OpenRouter 份额会不会稳住 唐杰与博客给出的是「这一周 / 上线后数日」的峰值。后续可直接看 OpenRouter rankings 里 ox-alpha / GLM-5.3-Flash 的周 token 是否回落。
- 权重与本地推理是否可复现 官方已给 Hugging Face 权重,并写明当前支持 SGLang、vLLM、TokenSpeed 等推理框架。本地部署能否跑满声明中的 1M 上下文与多模态路径,需要按框架版本逐项核。
- 国产芯片服务是否持续 唐杰强调数万张国产芯片全量上线,以及相对同硬件基线 3 倍吞吐、单 token 成本接近主流 NVIDIA GPU。这是部署侧主张;读者能观察的是官方 API 与 Coding Plan 的可用性和延迟,而不是单卡故障率这类帖子未披露的指标。
- Flash 与 GLM-5.3 旗舰线怎么分工 博客写 Coding Plan 用户已可调用 GLM-5.3-Flash,且其可用额度约为 GLM-5.3 的 3 倍。5 后续值得看官方是否继续把高难度长程 coding / cyber 任务压在 5.3 旗舰上,把高吞吐、多模态默认流量交给 Flash。
本条动态的增量很集中:唐杰用微博长文和 X 短帖,把预览代号 Ox Alpha 正式钉成 GLM-5.3 Flash,并公开一组用量、评测分、价格与国产芯片部署主张;Z.ai 同日前后已经把规格、开源许可和调用入口写进官方渠道。接下来要验证的,是这些数字在下一周 OpenRouter 榜单、API 实测和本地权重上是否对得上。
Fuentes de referencia
- 1唐杰微博 5336578562988827
weibo.com
- 2唐杰 X 原帖
x.com
- 3Z.ai 官方发布帖
x.com
- 4唐杰转发 Z.ai
x.com
- 5
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

