
晚点硬科技 8/26 晚:智谱 GLM-5.3 Flash 对标 DeepSeek,10 万国产卡撑推理
晚点LatePost独家写智谱 GLM-5.3 Flash:对标 DeepSeek V4 Flash、约 300B 参数与原生多模态,线上推理调用超 10 万张国产芯片,价格压到旗舰十分之一。
本期覆盖 2026 年 8 月 26 日 21:47:21(北京时间,上次成功发布 cutoff)至 8 月 27 日 01:53 前后。信源范围是晚点 LatePost 主号、晚点 AI、晚点 Auto、晚点对话及其他晚点同系微信公众号;筛选口径是 AI、大模型、物理模型/世界模型、具身智能、机器人、芯片及紧密相关基础设施。本窗口确认 1 篇独立硬科技文章。
优先级
| 优先级 | 文章 | 账号与发布时间 | 为什么先看 |
|---|---|---|---|
| 1 | 晚点独家丨智谱推出对标 DeepSeek 的轻量旗舰模型,由 10 万国产卡支持 | 晚点 LatePost · 2026 年 8 月 26 日 22:54(北京时间)1 | 智谱发布对标 DeepSeek V4 Flash 的 GLM-5.3 Flash:约 300B 参数、原生多模态、内部评测 57 分,API 价约为 GLM-5.3 的十分之一;线上推理调用超过 10 万张国产芯片集群,并在 OpenRouter 以 Ox Alpha 匿名预发冲量。 |
逐篇速读:轻量旗舰、价格弹性与国产推理卡
晚点独家丨智谱推出对标 DeepSeek 的轻量旗舰模型,由 10 万国产卡支持
账号与时间: 晚点 LatePost,2026 年 8 月 26 日 22:54(北京时间)。
核心事实
- 智谱发布轻量旗舰模型 GLM-5.3 Flash,明确对标 DeepSeek V4 Flash。 参数规模约 300B,约为 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。它采用与 GLM-5.3 不同的架构,并非从大模型蒸馏而来;具备原生多模态能力,支持图像与视频输入,也是智谱战略聚焦 coding 以来首次推出带多模态能力的新模型。1
- 线上推理全栈适配国产算力,调用规模超过 10 万张国产芯片。 原文写到,线上流量均由国产芯片承接;《晚点 LatePost》了解到算力供应商或来自华为、摩尔线程与海光,智谱官方未评论。智谱技术文档称,集群「硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平」,但未写明具体型号。1
- 内部评测分数把 Flash 放到旗舰附近。 据原文看到的智谱内部评测,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57:超过上一代旗舰 GLM-5.2,与 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰 V4 Pro 正式版的 53 分。1
- API 定价约为 GLM-5.3 的十分之一,上线前两周半价。 每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。横向对比调价后的 DeepSeek V4 Flash 谷时价(输入 1.5 元、输出 4.5 元、缓存 0.05 元),原文判断在绝大多数常规调用场景下 GLM-5.3 Flash 更便宜;海外输出价 0.5 美元,对照 Claude Opus 4.8 官方输出价 25 美元。1
- 正式发布前以 Ox Alpha 匿名在 OpenRouter 等平台测试。 5 天流量累积据悉超过 50 T,因完全免费刷新了 OpenRouter 与 OpenCode 的流量增长纪录。今年春节前夕,OpenRouter 上的 Pony Alpha 后来被证明是智谱 GLM-5。1
- 文章把发布放在「中国厂商把接近旗舰的能力推入低价区间」的竞争里。 6 月以来智谱 GLM-5.2、Kimi K3、DeepSeek V4 Pro、智谱 GLM-5.3 等相继发布;多家曾提价后,DeepSeek V4 Flash 在 OpenCode 上的调用量掉了一半,原文写这部分需求成了国产模型厂商新的增长空间。1
关键判断
第一,原文把「轻量旗舰」写成 DeepSeek 提价后的直接承接带。 梁文锋录音里「智能需求没有弹性」与 8 月全面提价形成对照;原文用 OpenCode 上 V4 Flash 调用量腰斩,说明在保证基本能力的前提下用户仍对价格敏感,轻量旗舰因此成为新增长区间。1
给产品经理的启示: 规划模型产品线时,应把「旗舰提价后被挤出的常规调用」单独做成可切换的轻量 SKU,并用真实调用曲线验证价格弹性,而不是只盯参数榜。
第二,国产卡不只是合规标签,而是推理服务的主路径。 超过 10 万张国产芯片承接线上流量,文档宣称单位 token 成本与主流英伟达 GPU 相当;供应商线索指向华为、摩尔线程、海光,但智谱未确认、型号也未披露。1
给投资人的启示: 评估国产推理生态时,优先核对公开服务是否已全量跑在国产集群、单位 token 成本声明能否被第三方平台流量验证,而不是停留在「适配名单」叙事。
第三,Ox Alpha 匿名预发被写成能力与调度的双重压测。 免费冲量刷新平台纪录,也让模型在去掉品牌光环后接受调用投票;原生多模态与非蒸馏架构,则对应智谱在 coding 主线之外补视觉输入、并与同代「蒸馏小尺寸」路径区分。1
给开发者的启示: 接入 Flash 级模型时,同时测文本任务单价、多模态输入可用性,以及半价窗口结束后的稳态价与吞吐,避免只按匿名免费期的流量体感做默认选型。
本窗口趋势洞察
1. 竞争焦点从「更大的旗舰」滑向「够用且更便宜的轻量旗舰」。 这篇单篇材料把 DeepSeek V4 Flash 提价、OpenCode 调用腰斩、GLM-5.3 Flash 约十分之一价与 57 分内部评测写在同一条线上。它当前卡在硬科技叙事的模型商品化层:当多家把接近旗舰的能力推入低价区间,调用量开始用价格投票。1
2. 国产推理卡从「能不能跑」推进到「能不能撑住公开流量」。 超过 10 万张国产芯片承接线上服务,并宣称硬件效率与单位 token 成本对标主流英伟达 GPU,是可回指的基础设施信号;型号与供应商仍未官方坐实,下一步值得跟踪的是持续公开流量下的成本与稳定性。1
3. 匿名预发与原生多模态,把产品节奏绑在「先抢调用、再补模态」上。 Ox Alpha 五天超 50 T 免费流量,与 Flash 首次原生图像视频输入并列出现,说明厂商在用第三方平台压测调度与缓存的同时,把视觉输入写进轻量旗舰默认能力,而不是继续外挂。1
排除项与未覆盖边界
- 本期按 1 篇独立文章计入。cutoff 之后主号未见其他合口径硬科技新文;主号稍早的《零跑进入自研自制正循环,连续三个半年度盈利》属汽车业绩与供应链自制,不纳入硬科技口径。
- 晚点 AI 列表最近一篇仍为 8 月 19 日;晚点 Auto 最近一篇为 8 月 25 日赛豆 AIVA 换电(汽车商业模式,已在既往边界排除);晚点对话列表最近一篇仍为 2025 年 5 月。
- 同系账号「晚点再听 LaterCast」在 8 月 26 日 21:47 有一期 Y Combinator 创业学习播客摘要,属创业方法论转述,不纳入本期硬科技口径。
- 晚点 Late 本轮列表入口仍返回不可用;另以微信文章关键词检索与公开网页检索交叉核验,本窗口未发现可确认归属该账号、且合口径的新文。本期没有用其他来源替代晚点同系信源。
- 消费零售、泛商业和纯财务题材继续排除。本文只按晚点 LatePost 原文整理智谱 GLM-5.3 Flash 的规格、评测、定价与国产推理部署事实,读者应把这些内容与投资决策、行业普遍结论分开。
References
- 1晚点独家丨智谱推出对标 DeepSeek 的轻量旗舰模型,由 10 万国产卡支持
mp.weixin.qq.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
