Poolside 的 model factory:模型公司如何把训练变成生产系统

Poolside 的 model factory:模型公司如何把训练变成生产系统

Eiso Kant 解释 Poolside 如何用 model factory 把数据、训练、实验、agents 和开放研究连成一套可复现的模型生产系统。

单集信息

  • 播客:Latent Space: The AI Engineer Podcast
  • 主持人:Swyx、Vibhu
  • 嘉宾:Eiso Kant,Poolside AI co-CEO
  • 集标题:Inside the Model Factory — Eiso Kant, Poolside AI
  • 发布日期:2026 年 7 月 23 日
  • 原集链接1
  • Apple Podcasts 单集页2
这集最值得听的地方,不是再确认一次某个小模型的 benchmark,而是 Eiso Kant 对「模型公司」这件事的重新定义:模型不是一个孤立的权重文件,而是一个能够持续产出、验证和改进模型的生产系统。Poolside 把它称作 model factory;在这个框架里,数据管线、分布式训练、代码版本、实验追踪、研究员和 agents 都是同一个系统的组成部分。

先别把模型当成产品终点

Eiso 的判断很直接:「Model building is ultimately 90% engineering.」这不是把研究贬低成运维,而是说,真正决定迭代速度的,往往是研究想法能多快变成可信的实验结果。
他描述的 model factory,起点不是一套漂亮的研究抽象,而是大量容易失控的工程细节:bash scripts、Slurm、拼接起来的 codebase、临时的数据管线,以及训练前反复打包和搬运数据的流程。Poolside 从一开始就让 distributed systems engineers 参与 research,而不是等研究路线确定后再补基础设施。目标是缩短「研究员提出想法」到「得到实验结果」之间的距离。1
这套系统已经不再是一个小型工具箱。Eiso 说,model factory 最早只有少量组件,现在已经扩展到 thousands of components;团队有 less than 70 researchers 和 another 35 engineers,每月运行 far more than 10,000、约 10,000 到 20,000 个 experiments。这里的重点不是把实验数量当成成绩单,而是说明研究组织的瓶颈已经从「能不能跑一次」转向「能不能稳定地跑很多次,并知道每一次改变了什么」。

速度来自数据和可复现性

Poolside 对训练数据的一个早期判断是:先把数据集完整 materialize,打包、tokenize,再复制到 training cluster,最后分发给节点,这个顺序本身就浪费时间。他们改成 streaming data into training,让训练可以在数据仍然 materializing 时启动;数据混合则变成 config,可以配置不同 source 的比例、repetition epochs 和 shuffle 方式。对谈中举过 20% 和 10% 的混合比例例子,但这些比例只是某次配置,不是固定配方。1
更关键的是 immutable data layer 和 versioned code。每个 experiment 都能追溯到使用的代码版本和数据,研究员可以把实验当作真正的 ablation,而不是凭记忆比较两次 run。Eiso 甚至说,按照这套流程,他们仍然可以复现两年前的 runs。对 model factory 而言,可复现性不是论文发表后的附录要求,而是下一次训练能够建立在上一次结果之上的必要条件。
他们还在用自动化缩小数据选择成本:auto mixer 会先训练 eight small models,再据此选择 pre-training dataset。这个流程的含义是,数据选择不再只是研究员的静态判断,而是可以进入反复实验、比较和放大的流水线。
因此,Eiso 又把 95% 的 model building 概括为两件事:improving data 和 improving compute efficiency。甚至在算力足够时,networking 也可能比 compute 更早成为瓶颈。这个判断把「模型规模竞赛」拉回了工程现实:带宽、数据流、可靠性和追踪系统,都会直接限制研究速度。

Laguna S 展示的是节奏和行为

对谈里提到的发布节奏很能说明问题。Laguna XS2 从开始 pre-training 到 launch 用了 5 weeks;当前讨论的模型从 pre-training 到 launch 用了 8 weeks。当前模型完成 post-training 后,下一模型已经在「literally yesterday」开始训练,计算资源也转向更大的 Laguna M。
这里不能把速度简单理解为「小模型更快」。Eiso 给出的解释是,model factory 把数据、训练、评估和发布连接成了可以重复运行的过程。模型之间的间隔,已经从 months or years 压缩到 weeks;从第一代路线走到当前发布模型,仍然花了大约 3 years,但之后每一代的生产方式已经不同。
稳定性指标同样反直觉。Eiso 说 Laguna S 没有发生 on-call events,原话是「completely zero」。这不等于完全没有故障:新 run 启动后的前 6 小时通常还会出现配置错误或小失误,只是没有升级成需要值班响应的大事故。对于一个高频实验系统,能否把错误限制在早期小窗口内,可能比一次漂亮的 benchmark 更能说明生产能力。
他还转述团队内部的观察:Laguna S 的部分收益并不来自 more intelligence,而来自 different behavior,包括 more verification、less taking things for granted、not declaring victory early 和更强的 persistence。这是一个值得保留的区分:模型表现变好,未必意味着它「知道得更多」,也可能意味着它更愿意核查、不急着宣布成功、遇到困难时继续尝试。

Agents 先接管执行层

在 Eiso 的描述里,agents 已经进入 model factory,但还没有取代研究员。它们可以写代码、启动 jobs、评估模型返回的结果,再提出或执行修改;研究员仍然在驾驶座上,负责方向、判断和取舍。
这也是为什么他不急着把「AI 参与 AI 研发」描述成完整的 recursive self-improvement。对谈中使用的是 early signs、twinklings 一类的谨慎说法:当一个系统有好的 APIs、端到端工程链路和明确的实验反馈,agents 确实很适合承担重复的执行工作;但从执行层自动化到研究目标自我设定,中间仍然隔着评价标准、错误归因和资源分配等问题。1
这套分工也解释了 model factory 的价值。没有可追踪的数据、版本化的代码和稳定的 job 接口,agent 只会更快地产生难以解释的改动;有了这些约束,它才可能成为研究流程中的可审计执行者。

开放权重不等于开放系统

Eiso 对开放的立场不是「把权重放出来就结束」。他更愿意生活在有 100 家 foundation model companies 的世界,而不是只有 5 家,即使自己属于那 5 家。他认为,更多模型提供方意味着更多行为、偏置和选择,用户、公司与国家可以选择自己更信任、更对齐的 provider。
但他也明确区分了 open weights 和 open research:「Weights are a binary」;只给权重,并不能让别人完整重建你正在做的系统。真正有复用价值的内容还包括研究过程、数据处理思路,以及大量实验中哪些方法有效、哪些方法失败。
这条开放路线并不回避风险。对谈中保留了几个没有被轻易解决的问题:什么时候 open-source model 的 misuse risk 大到不应继续发布,foundation model 的商业模式如何成立,以及政府会如何回应 open source。也就是说,Poolside 的主张更接近「在风险边界内扩大研究和选择」,而不是把开放当成无需条件的道德答案。1
Eiso 还承认,Poolside 自己一直在利用其他团队发布的 open research,尤其是那些在模型研究还不热门时就持续投入的团队。因此,开放研究在这里不是品牌口号,而是一种互惠的基础设施:先使用别人留下的知识,再把自己的工程经验和研究方法交还给生态。

这集值得谁听

  1. 对 AI infra、训练系统和研究工程感兴趣的人值得完整听:这集最具体的增量,是把 model factory 拆成数据流、版本化、实验规模、可靠性和人员分工,而不是停留在「AI 工厂」的比喻上。
  2. 做 model training 或 research tooling 的团队负责人值得听:10,000 到 20,000 个 experiments、immutable data layer 和 agents 执行层之间的关系,提供了一个判断组织瓶颈的实际框架。
  3. 只想听 Laguna S 性能排名的人可以跳过中段的创业回忆与开放生态讨论:这集没有把重点放在完整 benchmark 表,而是解释模型如何被生产出来,以及为什么行为变化可能比单纯增加 intelligence 更重要。
  4. 关心 open weights 的人应听到结尾:核心增量不是「开放一定正确」,而是把权重、研究过程、复现能力和 misuse risk 分开讨论。

Related content

  • Sign in to comment.
More from this channel