1/7

SGLang × vLLM 竞局档案 01:资本、生态与推理位置

对照 SGLang / RadixArk 与 vLLM / Inferact 在资本、生态合作、生产采用和最新技术路线上的公开证据,并标出仍待核实的商业化线索。

这组图笔记追踪 2025 年 1 月至 2026 年 7 月 22 日公开披露的高影响动向。先看结论:vLLM 的商业化入口和项目治理更完整,SGLang 则在硬件协作、新模型首发与推理 + RL 的组合上更激进;公开性能并没有给出脱离工作负载的单一赢家。

资本与组织

RadixArk 于 2026 年 5 月宣布完成 $100M Seed,Accel 领投、Spark Capital 联合领投,投后估值 $400M。公司把 SGLang 定为推理底座,把 Miles 定为 RL / post-training 底座,并将 managed infrastructure 写入商业计划。1
针对 vLLM,a16z 官方公告确认领投 Inferact seed,并把商业目标描述为「universal inference layer」,但该公告没有披露金额。TechCrunch 报道金额为 $150M,因此本期把「seed 已确认」与「$150M」分开标注。2 3
vLLM 于 2025 年 5 月进入 PyTorch Foundation 的 Platform Project;SGLang 则继续由 LMSYS 这一非营利组织承载。两者都在获得更稳定的公共生态入口,但组织形态不同。4 5
LMSYS 生态还拆出了 Arena。Arena 官方称 2026 年 6 月达到 $100M 年化收入,但 Arena 与 RadixArk 是两个独立商业实体,不能把这笔收入归到 SGLang。6

生态合作

Microsoft Azure 官方披露,Azure AI Foundry 使用 SGLang 在 AMD MI300 / MI300X 上为 DeepSeek-R1 与 DeepSeek-V3 做生产级推理优化;文章称经过 AITER 与 Bing 团队调优后,性能超过 H200,但也明确说明部分 Microsoft 改动尚未 upstream。7
vLLM 的典型信号是把项目放入更宽的云原生体系。AWS 公开了 Rufus 使用 vLLM + Trainium 的多节点推理方案,部署在 Amazon ECS,服务 Prime Day 流量并横跨数万颗 Trainium 芯片。8
SGLang 侧更像硬件 / 模型协同:官方路线覆盖 Blackwell、NVFP4、PD disaggregation 与新模型 Day-0;vLLM 侧则以 Production Stack、Semantic Router 和 llm-d 把推理引擎伸向 K8s 原生全栈、多模型路由和跨云部署。9 10

商业与客户

LinkedIn 官方工程博客披露,SGLang 用于其 LLM-based ranking 生产系统:375M ranker 的吞吐从 750 提升到 2,200 items/s/GPU,0.6B ranker 从 10k 提升到 22k items/s/GPU,结果在 H100 上测得,P99 latency 保持在 500ms 以内,相关改动已 upstream 回 SGLang。11
LinkedIn 另一篇官方工程博客称 vLLM 已支撑超过 50 个 GenAI 用例,运行在平台数千台主机上。这个采用信号比「某平台支持 vLLM」更接近真实生产使用,但仍不能直接证明 Inferact 已获得对应付费合同。12
RadixArk 官方还自述 SGLang 每日处理数万亿 token、覆盖 400,000+ GPU;这条信息本期保留为公司自报,不与 vLLM 的项目统计直接排位。1

关键技术与产品

SGLang v0.5.15 于 2026 年 7 月 10 日发布,Spec V2 默认开启,官方称端到端 TPS 提升 11%;同一 release 给出 GLM-5.2 NVFP4 在 8×B300 上 500+ tok/s/user、4×GB300 上 450 tok/s/user 的结果,并将 DeepSeek-V4 的 FlashMLA sparse prefill 默认打开。13
vLLM v0.25.0 于 2026 年 7 月 11 日发布,Model Runner V2 成为 dense 模型默认路径,旧 PagedAttention 实现移除;该版本包含 558 commits、232 位贡献者。14
vLLM V1 alpha 更早展示了另一条路线:重写 scheduler、KV cache manager、worker、sampler 与 API server,并称相对 V0 最高可得 1.7× 吞吐,prefix caching 在零命中时性能损失不到 1%。15

同口径对照

Spheron 在 H100 SXM5 80GB 上用 Llama 3.3 70B Instruct、FP8、unique prompts 测试 vLLM v0.18.0 与 SGLang v0.5.9。50 并发时吞吐为 SGLang 1,920 tok/s、vLLM 1,850 tok/s;TTFT p50 为 360ms 对 380ms,p95 为 680ms 对 720ms。样本中 SGLang 领先,但差距只有几个百分点,且没有触发共享前缀场景,不能当成普遍排名。16

待核实

  • Inferact 的 $150M 金额:a16z 官方公告未披露,后续应追公司注册、融资文件或更多一手披露。
  • RadixArk 的 400,000+ GPU、每日数万亿 token:目前是公司自述,缺少独立审计。
  • Stripe 所谓 73% 推理成本下降、Dell AI Factory 等材料:本期未当作确定事实,需补到官方原文。
  • 下一期优先追 Inferact 商业产品的发布与定价、RadixArk 托管平台的真实客户,以及两侧在同版本和最新 Blackwell 上的复测。

Contenido relacionado

Comentar

Inicia sesión para comentar.