vLLM 走向公司之后:开源社区如何保住方向,Infra 如何与模型共同设计

vLLM 走向公司之后:开源社区如何保住方向,Infra 如何与模型共同设计

游凯超从 vLLM 的论文、社区到 Inferact 的公司化过程出发,解释开源治理、推理成本以及模型与硬件共同设计的关系。

单集信息

项目内容
播客名张小珺 Jùn|商业访谈录
主持人张小珺
嘉宾游凯超,Inferact 联合创始人兼首席科学家,vLLM 核心维护者
集标题148. 对游凯超 3 小时访谈:开源 Infra、和模型 Co-design、「如果 vLLM 失败,我们会后悔一辈子」
发布日期2026 年 7 月 28 日
原集链接小宇宙单集页
这是一集从学术研究一路讲到公司治理的访谈。游凯超回顾了自己如何从算法研究转向机器学习系统,vLLM 如何从论文变成开源推理引擎和社区,以及开源项目在公司化之后怎样继续保住技术方向。后半段则解释了为什么模型结构、硬件和推理系统必须共同设计。1

从算法论文转向系统问题

游凯超说,自己在 2018 年接触人工智能研究时,一届会议大约只有几百篇论文,审稿还能围绕怎样把工作做得更好展开。后来投稿数量以几何级数增长,审稿人的数量和质量跟不上,论文发表越来越像抽彩票。
更直接的打击来自算法的边际收益。他在博士阶段受限于算力,做过大模型微调和算法改进,投入一年可能带来 1% 到 2% 的效果提升,但下一年换一个更大、更好的预训练模型,收益就可能超过这项算法本身。于是他在博士后半段转向机器学习系统,关注模型真正如何运行。
这条经历解释了他为什么会在 2024 年去伯克利交流并参与 vLLM。训练出模型只是开始,模型还需要被高效地部署和服务。vLLM 的起点是 Paged Attention 论文,但游凯超强调,今天的 vLLM 不能只理解成一个算法,它已经是一个大模型推理系统和生态。Paged Attention、Continuous Batching 以及后续优化,共同解决的是模型和硬件快速变化时,怎样提供高效推理服务的问题。2

开源项目为什么需要公司

vLLM 的公司化并不是把开源项目关进公司。节目页介绍,项目维护者用了将近 3 年,把它从算法论文变成开源社区,再走向正常的公司运营;今年初,Inferact 获得了 1.5 亿美元种子轮融资。1
游凯超把成立公司的理由说得很实际。没有公司,很多合作伙伴无法签保密协议,外部算力和硬件资源也很难合规地提供给一个松散社区;有了公司,团队可以招聘全职成员、获取机器资源、验证以前无法验证的事情。公司不是开源的对立面,而是给开源项目补上合同、资源和执行能力。
vLLM 同时把项目捐给 PyTorch 基金会。这样做的核心是用法律结构确认项目持续开源,商标属于社区;技术发展和商业化则由 Inferact 以及社区里的其他公司共同参与。这个安排把三个问题拆开了:谁维护代码,谁拥有商标,谁可以围绕生态做生意。
公司与社区的边界也由取舍来维护。游凯超说,现在想合作的商业客户多于团队能支持的数量,所以当商业需求和社区发展发生冲突时,他们可以直接拒绝不合适的客户。他的原话是:「我们不接这样的商业客户。」这不是姿态,而是因为供给不足让团队暂时拥有拒绝权。2

融资不是目的,速度才是约束

Inferact 的种子轮规模很大,但游凯超并没有把融资额当成成功指标。团队在 2023 年和 2024 年已经收到面向开源社区的资金支持,等到 2025 年底决定成立公司后,早期投资人相当于一直在等待这个决定。公司希望融资和成长速度匹配,「不是为了融资而融资」。
商业模式也围绕推理服务而不是人力外包。团队探索过 endpoint service 和 BYOC:客户可以使用 Inferact 的机器和软件,也可以保留自己的机器、购买软件服务。游凯超希望最终按量收费,价值取决于为客户产生了多少 Token、节省了多少成本,而不是卖工程师的时间。访谈时公司约 30 多人,接近 40 人,仍在招聘。
这里的关键约束是,开源社区需要持续支持新模型和新硬件,公司又必须在有限的人力和算力下选择优先级。商业化如果能增加维护能力,就会反过来强化社区;如果只把社区当成获客渠道,信任就会很快消耗掉。

Token 不是可以随意搬运的电

游凯超用一个比喻解释模型和 Infra 的共同设计:硬件像自然资源,模型像发电机,推理引擎像电力系统,最终把模型运行产生的 Token 分发给用户。不同硬件条件需要不同的模型和系统设计,协同程度决定效率。
但他也提醒,Token 并不像电力那样完全可互换。一个模型产生的 Token 不能直接变成另一个模型的 Token,因为 Token 带着模型结构和训练方式的烙印。对于推理服务商来说,真正要优化的不是一个孤立的速度指标,而是模型、芯片、内存、通信和系统共同形成的成本与吞吐。
这也是「硬件彩票」在今天重新重要的原因。过去通用硬件性能可以按摩尔定律持续提升,软件不必太在意硬件细节;现在的算力越来越专用,如果算法没有利用到对应硬件,就抽不中这张彩票。游凯超的判断很明确:模型结构决定推理效率的上界,系统工程师无法把一个先天不适配硬件的结构无限优化好。Transformer 之所以成功,部分原因正是它适合 GPU 的并行计算。

这集值得怎么听

  • 想理解 vLLM,重点听它从 Paged Attention 论文变成推理生态的过程,不要把它只当成一个单点算法。
  • 想做开源项目商业化,重点听 PyTorch 基金会、公司资源和客户拒绝之间的关系:开源承诺需要治理结构和现实资源共同支撑。
  • 想理解 AI Infra 的价值,重点听「模型结构决定效率上界」和 Token 不可互换的部分,它们比单纯讨论 GPU 数量更接近真实成本。
  • 如果你只关心融资数字,可以把种子轮放在背景里;这集真正值得听的是团队如何在社区、公司、模型和硬件之间分配长期注意力。

Related content

  • Sign in to comment.
More from this channel