这组图追踪 2026 年 7 月 9 日至 23 日新增的公开信号。结论先放在这里:SGLang 把优势押在新模型首发、硬件协同和推理到训练的联动;vLLM 则继续把引擎往生产系统、请求路由和模型组合上推。Google Cloud 与 AMD 都把两者并列纳入软件栈,当前材料还不足以宣布一个普遍性能赢家。
共同地面:云厂商没有替读者选边
Alphabet CEO Sundar Pichai 在 Q2 2026 财报电话会中称,Google Cloud 软件栈原生支持 JAX、PyTorch、vLLM 和 SGLang,用于 GPU 与 TPU 之间的工作负载可移植。1
AMD 的 ROCm Certification Program 也把 vLLM 与 SGLang 并列写入 Professional 级 serving 能力,要求覆盖多 GPU 分布式训练与高吞吐推理。2 AMD Advancing AI 2026 的公开材料同时提到 vLLM、SGLang 与 llm-d;在本期窗口内,我没有看到排他性支持信号。3
这说明的是迁移层面的选择权,不是双方能力相同。云厂商先把两套引擎接进来,模型、硬件和工作负载再决定最后落点。
SGLang:新模型先跑起来
Baseten 发布的 GLM-5.2-Vision-NVFP4 模型卡写明仅支持 SGLang 推理,同时给出 Blackwell、约 466 GB、1M tokens 上下文和 Baseten 部署配置。这个证据支持的是一次模型发布的适配路径,不足以外推成 SGLang 对所有视觉模型的普遍优势。4
SGLang 官方账号宣布 DSpark speculative decoding 支持 Inkling NVFP4,并称解码吞吐提升 1.89×;维护者补充,speculator 直接在 live SGLang engine 上在线蒸馏。两条信息都来自项目方公开账号,性能数字应按发布方口径阅读。5 6
vLLM:从引擎伸到生产系统
vLLM 预告 Kimi K3 在 7 月 27 日开放权重后提供 day-0 支持。其博客把 KDA prefix caching 拆成 physical block、scheduler alignment 与 prefix-match unit,以应对 1M context 的细粒度命中问题;这属于模型厂商与推理项目共同适配的公开设计。7
Netflix 工程博客称其 LLM serving 平台把 vLLM 选为 paved-path engine,并从 TensorRT-LLM 迁移到 vLLM;V1 迁移解决了 logits processor 的 CPU 序列化瓶颈。它是本期最清晰的生产运营证据,但文章没有说明是否评估过 SGLang,不能用来做双方的采购胜负判定。8
vLLM 官方博客把 Semantic Router 的下一阶段定义为 Mixture-of-Models 系统,覆盖训练、评估、执行和部署。Prime Intellect 也公开展示了 prime-rl 0.6.0 以 vLLM 运行 131k seqlen 的 agentic RL 配置,使用 28 台 H200、训练步小于 5 分钟;后者是发布方自述,尚无独立复测。9 10
如何读这次位置变化
两边都在接新模型、做 Blackwell 优化、推进 speculative decoding,所以「谁更快」必须绑定具体硬件、模型、量化、并发和版本。
这期能确认的,是位置分化:SGLang 的新信号更集中在模型专用适配,以及 SGLang → Miles 的推理—训练联动;Miles 的 OPD 支持把 SGLang-hosted teacher 放进蒸馏流程。11 vLLM 的新信号更集中在生产路径、路由 / 模型组合,以及 vLLM 作为 RL rollout backend 的扩展;AMD 的 vime 文章明确将其与以 SGLang 为 rollout backend 的 slime 对照。12
本期没有拿到同版本、同硬件、同工作负载的新复测,因此不把不同模型和不同部署条件下的公开数字拼成总榜。下一轮优先核对 Kimi K3 开放权重后的 vLLM 实测、GLM-5.2-Vision 在 vLLM 的可比支持、SM121 / Laguna S 2.1 的 SGLang 修复是否进入正式镜像,以及两侧托管产品的真实客户与价格。
参考ソース
- 1Q2 2026 earnings call: Remarks from our CEO
- 2Announcing the ROCm Certification Program
- 3Advancing AI 2026
- 4GLM-5.2-Vision-NVFP4
- 5SGLang 官方项目动态
- 6Mingyi Lu 关于 DSpark 在线蒸馏的说明
- 7Kimi K3 Preview
- 8In-House LLM Serving at Netflix
- 9From Routing Requests to Building Model Systems
- 10vLLM 官方 prime-rl 0.6.0 动态
- 11OPD Support in Miles
- 12vLLM + ROCm Support for vime




コメント
ログインするとコメントできます。