1/19

张小珺商业访谈录 148|游凯超:vLLM 从开源社区到 Inferact

19 张图片笔记,沿着游凯超的访谈拆开 vLLM 从论文、社区到 Inferact,以及模型与 Infra 的 Co-design。

这不是一张融资新闻卡,而是一条从论文到基础设施公司的路径图。
第 148 集嘉宾游凯超是 Inferact 联合创始人兼首席科学家,也是 vLLM 核心维护者。3 小时访谈从机器学习算法与系统的关系出发,经过 PagedAttention、开源社区治理和「仁慈的独裁者」,最后落到一个更大的问题:当模型、Infra、硬件和 Harness Engineering 开始互相规定对方,AI 基础设施会怎样变化。1

读图顺序

01–03:先认识嘉宾,再看访谈路线。
04–06:理解 vLLM 解决的系统问题,以及团队为什么愿意投入个人机会成本。
07–11:看开源项目怎样治理、怎样进入公司,以及 1.5 亿美元种子轮押注的是什么。
12–15:把视线从软件项目拉到模型、硬件、工具链和电力成本。
16–19:回到原话、延伸问题和这期访谈的主线。

三个背景事实

游凯超在个人主页中介绍,自己拥有清华大学软件学院的本科和博士学位,研究兴趣集中在机器学习与系统;他目前是 vLLM 核心维护者,也是 Inferact 联合创始人兼首席科学家。2
vLLM 官方博客介绍,项目最初由伯克利团队开发,是用于大语言模型推理与服务的开源库;其核心机制 PagedAttention 借鉴了操作系统的虚拟内存分页思路。3
论文摘要给出的实验结论是,在相同延迟水平下,vLLM 相比 FasterTransformer 和 Orca 的吞吐提升为 2–4 倍;论文关注的核心问题,是动态增长的 KV Cache 如何避免碎片和重复存储。4

从社区到公司

Inferact 官网把使命写成两件事:让推理更便宜、更快,把 vLLM 推向更多模型和硬件;官网同时承诺,开发出的优化会回流开源社区。5
a16z 的公开公告确认,Inferact 在 2026 年 1 月完成 1.5 亿美元种子轮融资,领投方包括 a16z;公告把这笔投资放在多样化 AI 应用、Agent 和硬件工作负载的背景下。6
这也解释了本期最有意思的张力:公司需要专职团队、预算、客户响应和产品路线,社区需要透明代码、可参与治理和持续回馈。两条线能否同时成立,不能靠融资数字提前回答。

访谈里值得带走的判断

  1. 研究论文解决的是一个具体瓶颈,基础设施项目还要面对真实请求、不同模型、硬件碎片和长期维护。
  2. 模型结构越复杂,模型和 Infra 越难按上下游简单分工,联合设计会变成工程前提。
  3. Token 数、吞吐和延迟是可见指标,显存、带宽、功耗、设备利用率和调度才构成更完整的推理成本。
  4. 推理基础设施的价值最终要由真实部署中的成本、稳定性、兼容性和开发效率来证明,融资规模不能替代这些指标。

原话

「如果我们自己赚了很多钱但是 vLLM 项目失败了,我觉得我们都是会后悔一辈子的。」1
「仁慈的独裁者就意味着有些时候你需要对方向进行一些取舍,就是不能够做一个老好人。」1
「论文只是一个副产物。」1

原始资料

文中引语均按本集完整音频逐字稿核对;内容用于访谈笔记,不构成投资建议。

Related content

Comments

Sign in to comment.