唐杰确认:Ox Alpha 即 GLM-5.3 Flash,OpenRouter 周份额近 20%

唐杰确认:Ox Alpha 即 GLM-5.3 Flash,OpenRouter 周份额近 20%

唐杰 8 月 27 日在微博与 X 同步确认 Ox Alpha 对外名为 GLM-5.3 Flash,并给出 OpenRouter 周 token 份额近 20%、AA 57、约 1/100 价格与国产芯片全量上线等公开数字。

双平台同日确认:Ox Alpha 就是 GLM-5.3 Flash

北京时间 2026 年 8 月 27 日,清华大学教授、智谱 AI 首席科学家唐杰在微博与 X 同步表态:此前以 Ox Alpha 预览名在 OpenRouter 上跑流量的模型,对外正式名称是 GLM-5.3 Flash12
当天时间线可以按先后排开:
北京时间平台类型要点
8 月 26 日 22:12X @Zai_org官方发布介绍 GLM-5.3-Flash:320B 总参数 / 18B 激活、MIT 开源、原生多模态、1M 上下文;预览名 Ox Alpha;全量跑在国产 AI 芯片上。3
8 月 27 日 13:03X @jietang转发转发上述 Z.ai 公告。4
8 月 27 日 13:42X @jietang英文原创写明 Ox Alpha = GLM-5.3 Flash,并给出 AA 57、约 1/100 价格、国产芯片、OpenRouter 周 token 份额近 20% 且第一。2
8 月 27 日 17:29微博「唐杰 THU」中文原创同一组数字,并补全算力短缺、数万张国产芯片全量上线、推理栈优化与 Infra Agent 参与调优的细节。1
X 英文帖写得很短:
Ox Alpha = GLM-5.3 Flash AA = 57 , 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter. Thanks to all for the support.2
Loading content card…

唐杰给出的四组数字

微博与 X 的核心数字一致,可以并排读:
指标唐杰的说法来源
身份对应Ox Alpha(对外名字:GLM-5.3 Flash)微博 / X12
用量本周 OpenRouter 周 token 份额近 20%,排名第一微博 / X12
综合评测AA 57(Artificial Analysis 智能指数)微博 / X12
价格约为前沿模型的 1/100微博 / X12
算力底座纯国产芯片;微博写「数万张国产芯片全量上线」微博 / X12
唐杰 X 帖附带的图,把 OpenRouter 上的份额变化画得更具体:图题写的是「Ox Alpha (GLM-5.3-Flash) pushed Z.AI above DeepSeek in weekly token share this week」,时间窗是 2026 年 4 月 27 日至 8 月 25 日;最右侧一周(标注 Aug 24 附近)黄色块标出 GLM-5.3-Flash token share 19%,同一周 DeepSeek 份额标为 16%。2
OpenRouter 周 token 份额堆叠图:Ox Alpha / GLM-5.3-Flash 推高 Z.AI 份额
唐杰 2026-08-27 X 原帖附图:OpenRouter 按模型类别的周 token 份额,4 月 27 日–8 月 25 日;图中最右侧一周标出 GLM-5.3-Flash 约 19%。2
Z.ai 技术博客里还有另一张按模型累计 token 的横向条形图:在 ox-alpha 上线后的 6 个完整自然日里,ox-alpha 处理约 23.2T tokens,约为第二名 deepseek-v4-flash 的 2.3 倍,并写明 ox-alpha 是当周 OpenRouter 第一。5
OpenRouter 上 ox-alpha 以 23.2T tokens 居首的横向条形图
Z.ai 技术博客配图:ox-alpha 上线后 6 个完整自然日的 OpenRouter 模型 token 量;图题写 ox-alpha 为第一,约为第二名的 2.3 倍。5

微博补全的工程细节

英文短帖只点到「pure Chinese chips」。微博把工程侧写开了,主要有五层:1
  1. 动机:算力仍然短缺,所以选择用数万张国产芯片全量上线,并把可用的 infra 优化技术全部用上。
  2. 硬件约束:唐杰写明,国产芯片单颗算力和显存都不算富裕;要支撑最长 100 万 token 上下文时,显存更紧。
  3. 软件栈:基于 SGLang 为这套架构专门做推理引擎;用计算换带宽、通信换带宽;节点内张量并行、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化等一并上线。
  4. 集群调度:采用 Encode–Prefill–Decode 三阶段分离,多模态编码、预填充、逐 token 解码各自独立调度和扩缩。
  5. 结果与闭环:相对同硬件初始基线,端到端服务性能提升 3 倍;硬件效率与单 token 成本「已接近主流 NVIDIA GPU」。唐杰还写到一个细节:由 GLM-5.3 驱动的 Infra Agent 深度参与了算子开发、性能瓶颈诊断和推理栈调优,形成「模型在优化服务模型自己的系统」。
微博收尾句是:「价格是前沿的 1/100,效率对标主流 GPU。这个方向,我们会继续走下去。」1
这些句子是唐杰个人对部署与成本的公开描述。芯片具体型号、集群规模拆分、与 NVIDIA 对照时的精确测试协议,帖子里没有给出。

Z.ai 官方发布里已经钉死的产品边界

Z.ai 在 8 月 26 日的官方帖与技术博客,给出了比唐杰短帖更完整的产品定义。读者可以把两边分开读:一边是唐杰的用量与成本表态,一边是实验室的规格与入口。35
官方已经写明的规格:
  • 规模:总参数 320B,激活 18B(写作 320B-A18B)
  • 许可MIT License,权重放在 Hugging Face
  • 能力形态:GLM-5 系列首个原生多模态模型;1M-token 上下文
  • 预览身份:此前以 ox-alpha 在 OpenCode 与 OpenRouter 匿名试跑
  • 算力声明:流量「running entirely on Chinese AI chips」
  • 架构要点(博客):稀疏注意力与线性注意力的混合结构;Manifold-Constrained Hyper-Connections(mHC);长上下文侧的 IndexPool 等
官方入口(发布帖与博客给出的路径):
用途入口
技术说明z.ai/blog/glm-5.3-flash
API 文档docs.z.ai/guides/llm/glm-5.3-flash
权重Hugging Face · zai-org/GLM-5.3-Flash
Coding Planz.ai/subscribe
产品侧ZCode、Chat、AutoClaw 等官方路径
博客对 Artificial Analysis Intelligence Index v4.1.1 的写法是:GLM-5.3-Flash 得分 57,折扣价约 $0.045 / task,并称这是此前大约 10 倍成本 才能买到的智能水平;同时写相对 GLM-5.2「one-tenth the price」。5
Artificial Analysis 智能指数 Pareto 前沿散点图,标出 GLM-5.3-Flash
Z.ai 技术博客配图:Artificial Analysis Intelligence Index v4.1.1 的 Pareto 前沿;图中标出 GLM-5.3-Flash(discounted)约 57 分、约 $0.045/task。数据源标注为 Artificial Analysis,更新于 2026-08-26。5
价格口径需要分开记:
  • 唐杰个人:价格约为前沿模型的 1/10012
  • Z.ai 博客:相对 GLM-5.2 约 1/10;在 AA 指数上,57 分对应的智能水平此前大约要 10 倍成本5
两边数字都来自公开文本,比较基准(「前沿模型」具体指哪一家、是否含折扣、是否按 AA 单次任务成本)并不完全重合。引用时保留各自原文即可。
博客还给出一组 coding / agentic 评测对照,例如 DeepSWE v1.1 上 GLM-5.3-Flash 63.4、GLM-5.2 46.2;AutomationBench v1.0.6 上 48.826.2;并称整体接近 Claude Opus 4.8。这些数字来自 Z.ai 自己整理的评测表,独立复现与第三方审计边界仍以各榜单官方协议为准。5
与 8 月 14 日上线的 GLM-5.3(偏 coding / cyber defense、后训练缩放叙事)相比,本条动态的新信息是另一条产品线:Flash 以更低激活参数、原生多模态和成本/吞吐定位正式对外,并已经用 OpenRouter 上的预览流量完成了一次公开验证。

读者可以接着看什么

  1. OpenRouter 份额会不会稳住 唐杰与博客给出的是「这一周 / 上线后数日」的峰值。后续可直接看 OpenRouter rankings 里 ox-alpha / GLM-5.3-Flash 的周 token 是否回落。
  2. 权重与本地推理是否可复现 官方已给 Hugging Face 权重,并写明当前支持 SGLang、vLLM、TokenSpeed 等推理框架。本地部署能否跑满声明中的 1M 上下文与多模态路径,需要按框架版本逐项核。
  3. 国产芯片服务是否持续 唐杰强调数万张国产芯片全量上线,以及相对同硬件基线 3 倍吞吐、单 token 成本接近主流 NVIDIA GPU。这是部署侧主张;读者能观察的是官方 API 与 Coding Plan 的可用性和延迟,而不是单卡故障率这类帖子未披露的指标。
  4. Flash 与 GLM-5.3 旗舰线怎么分工 博客写 Coding Plan 用户已可调用 GLM-5.3-Flash,且其可用额度约为 GLM-5.3 的 3 倍5 后续值得看官方是否继续把高难度长程 coding / cyber 任务压在 5.3 旗舰上,把高吞吐、多模态默认流量交给 Flash。
本条动态的增量很集中:唐杰用微博长文和 X 短帖,把预览代号 Ox Alpha 正式钉成 GLM-5.3 Flash,并公开一组用量、评测分、价格与国产芯片部署主张;Z.ai 同日前后已经把规格、开源许可和调用入口写进官方渠道。接下来要验证的,是这些数字在下一周 OpenRouter 榜单、API 实测和本地权重上是否对得上。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content