1/8

Eiso Kant:Poolside 如何把模型训练做成一座工厂

Latent Space 对谈 Poolside 联合创始人 Eiso Kant:从 Model Factory、10,000–20,000 次月度实验,到 Laguna S 2.1 的行为收益与开放模型路线。

Inside the Model Factory:Eiso Kant 拆解 Poolside 的模型工厂

Latent Space 对谈 Poolside 联合创始人兼 CTO Eiso Kant。这个近 1 小时 55 分钟的单集,核心不是再介绍一个模型,而是解释一支小团队如何把基础模型训练变成一套高频、可复现、能不断吸收反馈的工程系统。

一句话判断

当模型能力越来越依赖后训练、工具使用和长链路任务时,竞争的基本单位正在从「一个模型 checkpoint」变成「模型 + 数据 + 评估 + harness + 实验调度」的整体系统。Poolside 所谓的 Model Factory,真正要解决的是:让更多想法更快变成可信实验,并把实验结果送回下一轮训练。

节目速览

  • 节目:Latent Space: The AI Engineer Podcast
  • 单集:Inside the Model Factory — Eiso Kant, Poolside AI
  • 嘉宾:Eiso Kant,Poolside 联合创始人、CTO
  • 访谈:Swyx、Vibhu
  • 视觉笔记:8 张 3:4 图卡,按节目顺序展开
官方单集页与完整逐字稿:1

按节目顺序精读

1. 从 Karpathy 的 RNN 文章,到代码语言模型

Eiso 说,2015 年 Andrej Karpathy 的《The Unreasonable Effectiveness of Recurrent Neural Nets》让他把创业方向转向 RNN,之后继续研究 LSTM 和 Transformer。他当时形成的判断是:如果语言可以被模型学习,代码也可以成为一种语言,模型能够泛化到软件任务。
这条路径后来发展成 source{d},一家完全开源、专注代码与软件的公司。团队坚持了四五年,直到 2019 年底仍然没有获得市场注意。Eiso 把这段经历称为职业生涯中最大的失败之一:约 40 人的团队投入了约 1200 万美元,做过卷积网络处理代码结构、把 attention 接到 LSTM 等尝试,却没有及时意识到应该继续扩大规模。ChatGPT 出现后,早期演讲和旧材料被重新翻出来,对他而言像一次迟到的验证。
Eiso 的人物背景补充:他在创办 Poolside 前,曾创办并担任 Athenian CEO;此前建立 source{d},长期在 AI、开发者工具和早期创业公司中工作。2

2. 为什么 Poolside 重新选择开放

Poolside 早期的两个判断是:模型能力会继续复合增长,强化学习会成为 LLM 能力增长的重要驱动力。这些判断后来变得更主流,但在 Poolside 创办初期并不是共识。
Eiso 现在更担心另一种未来:少数几家公司控制几乎全部智能生产。他明确表示,宁愿生活在有 100 家基础模型公司的世界里,也不愿只有 5 家,即使 Poolside 自己是其中之一。因此,Poolside 开始公开研究和开放权重,并把开放研究过程看得比单纯发布权重更重要。对他来说,数据、实验和训练方法产生的可复现知识,才是帮助生态长出更多公司的关键。

3. Model Factory:把模型构建拆成一条装配线

Eiso 在访谈中把模型构建概括为高度工程化的工作:改进数据,或提高计算效率。真正的日常工作包括写代码、看数据、跑实验、读曲线、找失败原因和形成更可靠的直觉。Model Factory 的作用,是把这些工作从依赖少数资深研究员的手工流程,变成多个系统可以协同执行的实验基础设施。
Poolside 官方文章给出的流水线包括:
  • 预训练,以及自动评估和推理服务;
  • 基于代码执行的强化学习,让模型在隔离环境中写代码、运行测试并得到反馈;
  • 自动化架构消融,探索模型布局、参数量和注意力机制;
  • 自动化数据精炼,追踪数据处理步骤与模型表现的关系;
  • 自动化数据混合,支持在训练过程中动态改变数据配比和顺序;
  • 统一调度这些互相依赖的任务,并对 GPU 集群进行可复现的资源管理。
官方文章还披露,代码执行环境包含约一百万个公开仓库及其大量 revision,训练、评估和 RL 任务可以在其中运行。Model Factory 的核心不是某一个工具名,而是让每一个实验的输入、配置、结果和后续决策都能被追溯。3

4. 10,000–20,000 次实验,靠的是系统吞吐

Poolside 团队不到 70 名研究员、约 35 名工程师,但每月可以运行约 10,000–20,000 个实验。Eiso 说,agent 已经开始参与写代码、发起训练任务、评估结果和修改流水线,研究员则更多负责提出想法、判断方向和调试系统。
这不是把研究员简单替换成 agent。相反,实验系统越自动化,越需要不可变的数据层、版本化代码、可追踪的 token 流入、清晰的评估间隔和一致的调度规则。Poolside 还把数据直接流式送入训练,避免为每种数据混合方式重新物化并分发一个巨型数据集。访谈里最有价值的信号是:高频实验只有在结果值得信任时才有意义。1

5. Laguna S 2.1:行为收益比参数故事更重要

Poolside 官方资料显示,Laguna S 2.1 是 118B 总参数、每个 token 激活 8B 参数的 MoE 模型,支持最高 1M tokens 上下文;从训练开始到发布不到 9 周。官方还公开了最终评估的完整轨迹,强调可检查模型是如何完成任务的,而不只看一个分数。4
Eiso 在节目里反复强调,Laguna S 的提升更多表现为行为变化,而非单纯的原始智能提升:
  • 更愿意验证,而不是默认事情成立;
  • 遇到错误会回退,重新查资料或换路径;
  • 不会过早宣布任务完成;
  • 能在长任务中保持更久的持续性。
他举了几个例子:模型独立重新推导 Erdős 问题 397;在没有互联网和外部库的情况下,尝试理解本地系统 API;在复杂编程任务中不断检查自己的中间结果。Poolside 官方案例还展示了离线构建浏览器引擎、优化自身 harness,以及在 Perl 环境中重新推导该数学问题的轨迹。这里需要区分:Eiso 在访谈中谈的是观察到的行为,具体参数、轨迹和案例说明来自 Poolside 的模型发布文章。

6. 模型与 harness:能力边界不只由权重决定

Eiso 把 harness 描述为模型与环境之间的接口。Poolside 自己的 harness 很轻量,工具数量有限,包含 shell、文件、网页获取和等待等基础能力;它不是为了堆叠提示词、数据源和工具而专门优化某个 benchmark 的深度研究系统。
但同一个模型接入不同 harness 后,任务效率仍然可能明显不同。一个更复杂的 harness 可以提供更适合任务的工具、数据和行动规则;一个模型公司自己的 harness 则因为 RL 和合成数据主要围绕它训练,往往表现更好。Eiso 的折中是:保持研究变量可控,同时给 OpenCode、Hermes、Pi 等外部环境做必要适配。
这也解释了为什么模型公司与 agent 公司会形成分工:模型公司负责通用能力和训练,agent 公司通过更贴近场景的工具与数据,把能力转化成更高效的任务完成路径。模型是核心,但 harness 决定它能否把能力用出来。1

7. 为什么代码是通往 AGI 的一条路径

Eiso 说,Poolside 从一开始就把 coding 和长链路软件任务视为通往 AGI 的路径。原因不是代码比自然语言更神秘,而是软件任务会强迫模型处理长时间跨度、复杂推理、外部工具、环境反馈和多轮纠错。
在他看来,知识工作里最常见的优势不一定是把三个完全不同领域的概念瞬间连接起来,而是遇到问题时能坚持下去:查文档、试不同方法、定位 bug、回退、再验证。对很多软件工作来说,持续性、验证和回退的价值,可能比单纯把模型做得更大更直接。
这并不等于停止 scaling。Eiso 仍然认为更大的模型会在科学前沿和跨领域综合上更强,只是对日常编码等知识工作,模型大小与投入回报之间可能存在一个最佳区间。小模型如果拥有更好的行为、更合适的后训练和更好的工具环境,可能比过去预想的更有用。

8. 开放模型与监管:避免把能力锁成寡头商品

Eiso 认为,智能最终会像一种商品,价格会下降,用户、公司和国家会选择自己信任的模型提供方。开放权重能扩大选择,但更重要的是公开研究过程,让更多团队理解数据、训练和评估的真实方法。
对于监管,他不接受「永远全部开放」或「现在全部关闭」这两种极端。他认为真正出现明确的滥用风险时,可以针对能力、训练方式和版本做更细的限制;但基于当前能力提前设置覆盖所有开放模型的宽泛限制,可能会把创新入口直接收窄到两三家公司。讨论的核心不是哪一家公司应当单方面决定一切,而是如何让民主制度、政府、评估机构和行业共同形成可检查的边界。

9. 团队、agency 与限制条件

Eiso 把 agency,也就是把想法主动推进成结果的能力,视为 AI 时代最重要的员工特质之一。高 agency 团队不意味着每个人都随意探索。领导者需要提供共同目标和清晰边界:哪些问题必须解决,哪些方向暂时不做,哪些资源约束不能绕开。
他认为限制反而能提高效率。Poolside 使用相对少的计算、资金和外部数据,迫使团队在实验设计、数据质量和系统工程上变得更强。招聘上,Poolside 仍在寻找应用研究、预训练、后训练、架构、评估和工程人才。对小团队而言,吸引力不是职位名称,而是每个人仍然有机会对模型和使命产生很高比例的影响。

给 AI builder 的 5 个启发

  1. 先把实验变得可信,再追求实验数量。 没有可复现配置、版本化数据和稳定评估,10,000 次实验只是噪声。
  2. 把数据混合和评估当成一等公民。 数据不是训练前一次性准备好的静态附件,而是能持续改变模型结果的训练变量。
  3. 模型、harness 和环境要一起设计。 只比较权重,很容易把工具、反馈和数据入口的影响误认为模型本身的能力。
  4. 长任务的核心指标包含行为。 是否验证、是否回退、是否能在失败后继续推进,可能比一次性的高分更接近真实生产力。
  5. 小团队的杠杆来自边界。 共同目标和有限范围能让高 agency 的人把速度用在同一个方向上。

来源与图卡说明

  • 节目逐字稿与单集信息:1
  • Model Factory 工程架构:3
  • Laguna S 2.1 参数、上下文和评估轨迹:4
  • Eiso Kant 职业背景和公开头像:2
图卡按「嘉宾背景 → Model Factory → 实验吞吐 → Laguna S 2.1 → harness → 开放模型 → 团队」顺序排列。第 2 张使用 WEF 公开人物头像;其余技术图为本期视觉系统下的抽象示意,不代表 Poolside 真实设备或界面。

逐句全文翻译

以下内容基于 Latent Space 官方完整逐字稿,按原始顺序保留说话人标签与时间戳,仅呈现中文译文,不对对话做摘要或删减。原始入口:1
简介:Eiso Kant、池畔和开放模型
Swyx [00:00:00]: 好吧,我们和来自 Poolside 的 Eiso Kant 以及 Vibhu 一起在工作室里。欢迎。
Eiso Kant [00:00:08]:谢谢。谢谢你们邀请我,伙计们。很高兴来到这里。
Swyx [00:00:10]: 是的,刚刚在飞机上。你给我发短信,你说,「嘿,我正在去旧金山的路上。「我当时想,「你现在在飞机上,对吧?「就像,嘿。
Eiso Kant [00:00:16]:我知道。在我给你发短信后,我意识到今天可能会因时差而带来一些有趣的经历,但我们就这么做吧。
Swyx [00:00:23]: 我的意思是,我想我要告诉客人的是,他们不必准备那么多,因为如果你真的每天都在努力做到这一点,那么即使你模糊记得的东西对于很多并不每天都生活在你的世界中的观众来说也会是新的,对吧? 10 年前,您在 Google Slush 上做了一次演讲,谈论了人工智能的民主化。现在,您正在开源一个我们将要讨论的令人难以置信的新模型。但我想,是什么让你进入人工智能的民主化?就像,从你的 LinkedIn 或其他东西上看并不明显。
从 Karpathy 的 RNN 帖子到 Sourced
Eiso Kant [00:00:57]: 不,根本不是。我认为我是如何进入这个领域的并不明显。我要感谢安德烈·卡帕蒂 (Andrej Karpathy) 进入这个领域。
Eiso Kant [00:01:05]: 2015 年,他写了一篇名为「循环神经网络的不合理有效性「的文章。
Swyx [00:01:10]: 神经网络,是的。
Eiso Kant [00:01:11]: 那篇文章,我读了它,然后我连夜将我的创业公司转向 RNN,以及后来的 LSTM 和 Transformer 模型,以便能够编写代码。如果您阅读本文并向下滚动,您可以开始看到,这就是最终成为语言模型的先驱。因此,至少当他开始预测字母的字符级语言模型时,他在这里有一个例子。有一个保罗·格雷厄姆生成器,你可以阅读它,并且文本有意义,但事实并非如此。还有一点——下面有一个代码示例。是的,莎士比亚也是如此。
Swyx [00:01:47]:莎士比亚。
Swyx [00:01:49]:
Eiso Kant [00:01:49]: 由于某种原因,我读了这篇文章,然后我就陷入了学习有关 RNN 和 LSTM 的一切知识的困境,对吗?这是变压器纸。我建立了一个完全不合理的信念,即神经网络应该能够泛化到任何事物,并且语言应该能够泛化到许多智能事物和编写代码的能力。所以我开始构建 Sourced,这是一家完全开源的公司,试图构建我们过去所说的基于代码的机器学习、基于代码的语言模型。我们花了大约四五年的时间,直到 2019 年底。这在今天听起来真的很酷,但当时没有人关心。
Eiso Kant [00:02:29]: 对吧?就像,没有人关心。我们在黑暗中。就像,我们一路上做了一些事情。我们尝试将卷积神经网络应用于代码结构等。我们是。当注意力出现的时候,我们正在将它应用到 LSTM 上,然后 Transformer 论文就出来了。我们走在正确的轨道上这一点并不明显,我们在整个旅程中错过了这一点,但我们应该继续扩大规模。今天,对我们所有人来说,缩放定律和缩放似乎是最明显的事情。但我花了四五年的时间研究代码语言模型,这一点并不明显。因此,我非常尊重 Google 和 OpenAI 的人员以及其他充满信心并继续前进的人。当时我们最终失败了,这是我职业生涯中最大的失败,对吧?你花掉了 1200 万美元投资者的钱,这在当时来说是一笔巨款。
Swyx [00:03:18]: 是的。
Eiso Kant [00:03:19]: 你花了很多钱,但是,你花了很多年的时间和一群 40 个人一起痴迷于这个问题。生活发生了不同的转变,事实确实如此,家庭成为焦点,我低着头,在接下来的两年里,真的没有真正研究过语言模型。考虑到接下来的几年会非常有趣,这是一个很大的错误。然后 ChatGPT 出现了,这就像一个平反。就像人们开始给我发短信一样。我找到了我的旧工作平台和这些旧演讲。在整个旅程中,我们,
ChatGPT、辩护和回归开源
Eiso Kant [00:03:56]: 当时我们确实有一个强烈的观点,比如,当你正在构建更强大的智能时,它应该是开放的和开源的。
Eiso Kant [00:04:04]: 当我们开始 Poolside 时,情况根本不是这样,我想对此非常开放。当我们开始 Poolside 时,我们想,有两件事的前提。一是这项技术不会停止复合功能。我认为对于今天的大多数人来说这是显而易见的,但三年多前当我们开始时,大多数人仍在争论这些是否是随机鹦鹉。
Eiso Kant [00:04:23]: 第二个是强化学习将成为 LLM 能力的最大驱动力。今天,非常明显。三年前,OpenAI、Google、Anthropic 或其他公司都没有提出任何意见或方向。所以人们有点看不起我们。他们说,「这真的有用吗?「所以我们只是开始解决这个问题,我们再也没有真正考虑过开源。我们只是低着头,从头开始建立我们的知识、理解,对吗?我们没有推出现有的实验室。所以我们拿起论文并开始编写代码并解决问题。
Eiso Kant [00:04:59]: 直到今年年初,我和我的创始人 Jason 才再次开始谈论开源。
Eiso Kant [00:05:07]: 如果你回顾一下我们网站上的一些早期内容,就会发现它非常简单。我们想要实现 AGI,我们想要支持一个丰富的世界,我们想要成为第一家实现这一目标的公司。
Eiso Kant [00:05:20]: 但我们从今年年初开始谈论,因为很明显,世界正在朝着一个开始喜欢、对我们挑剔的方向发展。就像,事实并非如此,这不是一夜之间发生的。就像我们看到这一点一样,我们就像,「好吧,世界正在走一条路。「在整个旅程中,我使用了一些东西作为类比或事物。所以我说,好吧,如果我回到过去,2015 年或 2016 年,我们正在研究这个,我从书架上拿起一本科幻书,我正在读一本关于 2035 年的书。AGI 实现了,故事将在接下来的几十年里发生。在第一章中,每个人都试图弄清楚事情的真相。你会看到 ChatGPT 的章节出来,然后你会看到世界正处于岔路口的章节,而它选择的章节是三、四家或少数公司将创造所有向前发展的智能。
Eiso Kant [00:06:21]: 当我想到这个故事时,感觉就像一本反乌托邦的小说,而不是一本乌托邦的小说。现实是,我是一个乌托邦式的科幻迷。就像,所以我们退后一步说:「嘿,我们可以在这里发挥作用吗?「现在我们很容易做到这一点,因为我们不在边境。
Eiso Kant [00:06:41]: 如果我们在边境,我认为我们不会改变主意。我的意思并不是说当涉及太多资本、太多期望时,你就已经建立了一些东西,对吗?我们是一个小团队,只是不断改进。所以我们知道我们现在可以做出这个决定,但随着我们越来越接近前沿并追赶其他人,做出这个决定会变得更加困难。并且进行了大量的反省和大量的对话,并说,「不,这是有道理的,「即使还有很大的悬而未决的问题,比如你到底如何用开源的基础模型构建一个商业模型?我们还没有完全找到答案的开放式大问题,对吗?在什么时候您不再想发布开源模型,因为模型的滥用会带来与之相关的真正潜在风险?政府将如何应对开源?但我认为这一切都归结为一件事,我将停止独白,事实是我宁愿生活在一个有 100 家基础模型公司的世界里,也不愿生活在一个有 5 家的世界里,即使我是这 5 家之一。我们能为 100 的存在做出的最小和最有意义的贡献就是开放我们的研究,开放我们现在的权重,并弄清楚我们如何能够做得更多。
Neo-Labs、模型选择和代币经济
Swyx [00:08:01]: 是的。我想,如果说有什么不同的话,那就是在过去的三年里,这一点变得更加真实了。你是 Neo 实验室中的一员
Eiso Kant [00:08:10]: 是的
Swyx [00:08:10]: 人们现在这么称呼它。而且,我们是在 Thinky 推出他们的新模型的那天做这件事的,而你们在他们发布的一些基准测试中表现优于他们,对吗?就像,他们只是还没有。所以这表明我认为,这是一个可以容纳多个玩家的空间,而且你会看到更多的未来。也许更像是 20 个,而不是 100 个,但是,就像,你是 20 个中的一员。
Eiso Kant [00:08:36]: 我真的希望如此,对吧?我想我们,我对他们的发布感到兴奋,我对每个人的发布感到兴奋,因为,最终,选择竞争都会推动朝着正确方向前进。但事实是,我们创建模型,虽然我们都有效地汲取同一口数据,但我们确实在模型中引入了非常不同的行为和偏差。有些是故意的偏见,有些是完全无意识的偏见。
Swyx [00:09:03]: 是的。
Eiso Kant [00:09:03]: 如果我们在世界上形成一个生态系统,其中开放模型将成为代币经济的一部分,就像,我认为不再有任何问题了,那么我们希望能够生活在一个公司、国家、人们可以选择并说,「嘿,我最一致并且我最信任这些东西的提供商的世界。「
Swyx [00:09:25]: 是的。
Vibhu [00:09:26]: 我认为不仅仅是 20 个 Neo 实验室之一,直到最近,大部分开源创新都来自中国实验室,对吗?于是就有了西方的 DeepSeek。是今天吗?好吧,也许这是思维机器的反射,但并不多,对吧?所以,你们在法国、欧洲开始的事情之一,但现在你们很大程度上采取了美国的立场,不仅如此,重点是我们看到的中国模式,它们不是超级开放的研究。我认为你所做的工作是最好的。因此,每隔几个月,你不仅会得到前沿模型,而且还有一份细分博客、论文、技术报告,其中包含了最先进的构建、前沿情报的一切,而你也在填补这一空白,对吗?因此,不仅是开放的重量,不仅是西方的,而且还有相当开放的研究。
开放权重与开放研究
Eiso Kant [00:10:20]: 不,我很欣赏。你看,我认为这是,我认为这是最有意义的贡献,对吧?权重是二进制的。我们就这样称呼它们吧。是的,我们可以修改它们,我们可以改变它们,但是,就像给某人权重并不能让他们最终重现你正在做的事情,对吗?所以现在在发布数据集方面存在挑战,比如发布某些东西,但是能够分享你的研究,比如,对吧,我们该怎么做?我们通过数以万计的计算实验学到了哪些经验教训?我也这么认为。不过,需要更正一下,Vibhu,我这么说是因为它已经困扰我们很多年了。从零开始我们就是一家美国公司。
Swyx [00:10:55]: 是的。他们搬家了
Poolside 的全球团队和美国公司的故事
Swyx [00:10:56]: 飞往法国。
Eiso Kant [00:10:56]: 所以这个故事一劳永逸非常。我们最初是一家美国公司。我们一直是一家美国公司,很早就做出了一个非常有意识的决定。我们说,「我们不会在湾区雇用任何研究人员。我们将在世界其他地方寻找人才。「从中美洲、西雅图到塞尔维亚,再到台湾、新加坡和其他地方。这是因为我们认为这将成为一场人才战争,我认为多年来一直如此。三年前,这一点还不是很明显。我想今天确实如此。我们还意识到,世界上一些最有能力、拥有最有趣、最创新想法的人不仅仅会在这里。因此,它引导我们创建一家完全远程的公司。我们最终在巴黎和伦敦等不同地方开设了办事处,我们在美国有很多团队,在国外也有很多团队。但我们一直认为,我们是一家美国公司,但如果我们希望最优秀的人才与我们合作,我们需要有全球视野。现在我们在硅谷也有人员,比如公司的成长者和其他人,但我认为一开始放慢了我们的速度,但现在加快了我们的速度,这就是为什么你看到我们的模型和发布节奏的进展,是因为我们没有推出现有的实验室。正确的?我们没有,当时我们没有很多在这里自由流动的信息。我们只是采取这样的观点,「好吧,好吧,让我们解决这个问题。让我们去读一下现有的几篇论文,然后让我们解决这个问题。「因此多年来我们在模型训练中犯了一些搞笑的错误
Eiso Kant [00:12:35]: 尤其是在前 12 个月。我认为有一些仍然困扰着我并让我害怕。我们可以稍后再讨论。但它在团队中创造了一种弹性和毅力,对吧?多年来离开我们的人极少,就像告诉我们,「好吧,我们可以做到这一点。「当我们第一次完全从头开始编写第一个训练代码库时,它并不是任何开源的分支。就像,「好吧,让我们从头开始构建它。「我记得我们有过这样的时刻,我们花了三周的时间来解决一个优化器错误。就好像训练无法稳定下来一样。我们对它着迷,我们想,也许我们错了。也许我们应该分叉这个仓库,或者我们应该这样做。但是当我们解决这个问题的时候,我还记得当时我们公司就五个人。当我们解决这个问题时,我们会想,「哦,我们可以做事「,就像只要我们愿意努力工作一样。我认为具有强烈工程偏见的文化帮助我们达到了现在的水平。所以就有了开源和人才等概念。我认为我们只是从不同的起点做出了不同的决定。我认为我们很幸运。我确实想称其为幸运。团队付出了很多努力,现在,这些努力开始体现在成果中。
Swyx [00:13:52]: 只是因为我们可能不会再重温这个问题,但是,如果有人知道答案,这将是一个有趣的招聘挑战。有什么错误吗?然后我们不会告诉解决方案,但我们「
优化器错误和从头开始构建的价值
Eiso Kant [00:14:01]: 所以 - 这个 - 你要在这里测试我的记忆力,
Swyx [00:14:04]: 哦,好吧
Eiso Kant [00:14:04]: 所以但我认为
Swyx [00:14:05]: 直接
Eiso Kant [00:14:05]:我想我能回忆起来。所以如果你,如果你看,所以如果你像 Adam 一样作为优化器,你就有 epsilon
Swyx [00:14:12]: 是的
Eiso Kant [00:14:13]: 这就像分母一样
Swyx [00:14:14]: 动量和权重。是的
Eiso Kant [00:14:15]: 正是在分母中。如果我没记错的话,当时你看过早期的 Llama 论文之类的东西。人们都在榨取 epsilon,相当多。就像,他们,就像,添加,我不知道它是 E 减四还是其他什么,比如 epsilon 的高值。
Eiso Kant [00:14:31]: 如果你在训练过程中考虑这一点,你就会发现,我们只是通过有效地添加分母中的随机数来向优化器添加噪声,这有点奇怪和违反直觉,对吧?比如小数点后面。我不记得确切的错误,但它有 - 我记得的是,一旦我们解决了它,我们就不再需要像在 Llama 论文和其他地方发生的那样那么多地榨取 epsilon 了。这就像我们信任这篇论文的那些基本时刻之一,我们就像,「哦,不,它必须是这样的。它必须具有如此高的 epsilon 值。「但直觉上这对我们来说毫无意义。比如,为什么你必须有这么高?例如,如果您只是想避免被零除,为什么该值不能非常小?那就像你意识到,好吧,自己从头开始发现事物可以建立更好的直觉。因为通过模型构建你很快就能学到的一件事是,你一开始的直觉会被严重打败。
Eiso Kant [00:15:33]: 对吧?就像——这是一门实验科学,那些看似显而易见的事情,你很快就会学到,比如,你错了,希望你能找出原因,但有时你甚至没有。
Swyx [00:15:45]: 是的。是的,所以,当你发布新模型时,Vibhu 非常兴奋的原因之一。我的意思是,每个人都非常兴奋。但是 Vibhu 领导了我们的纸质俱乐部,你们看到了
Eiso Kant [00:15:58]: 是的
Swyx [00:15:58]:显然。也许可以谈谈从中吸取的一些教训,无论你能透露什么。我们可以专注于模型工厂的东西,无论你认为什么都是一个好的起点。
模型构建作为工程
Eiso Kant [00:16:08]: 所以我想说,我们从公司早期就认为模型构建最终 90% 是工程。
Eiso Kant [00:16:18]: 我想业内都知道这一点,因为如果你看看每个研究人员都把时间花在哪里,你会发现他们都在写代码,对吧?看数据,写代码。所以我们说,好吧,现在的状态,就像三年前一样,是用于训练的 bash 脚本、Slurm 和 spaghetti 代码库,以及修补在一起的数据管道。我们研究了这一点并说:「好吧,最终,模型构建是一个过程。「你是从原始数据出发的,对吧?比如培训原材料、网络等等。你正在做一大堆过滤、清理、转换、分析。如今,情况比三年前复杂得多。那么你正在训练一个模型,这实际上是一个大型分布式系统问题,对吧?跨硬件仍然——它变得更加可靠。那时它非常脆弱。现在,随着每一代新人的诞生,我们都会面临一系列新的挑战。然后你就进入了下一个阶段,对吗?那时没有训练,但是,就像,你得到了训练后,然后是强化学习。所以我们看着这个,我们说,「嗯,这看起来像一个工业化的过程。这看起来像一个最终过程,它的每个部分都有它的机器,「对吧?如果是您的大数据管道,如果是您对网络的爬行摄取,如果是您的大规模分布式训练,那么您就拥有了可靠性。我们说,「好吧,为什么我们不聘请一些我们认识的世界上最聪明的分布式系统工程师,让他们从零开始就参与研究过程呢?「不是后来再改造它,而是,真的从一开始就改造它。这成为了我们的模范工厂。因此,我们的模型工厂从一些组件开始。今天,它有数千个组件,我试图将其等同于,如果你想想,像那些在富士康早期工作的人,如果他们在接下来的十年里一直在那里,他们将能够重建富士康,因为他们看到了导致构建该系统的每一个决定以及所有的复杂性。如果你我今天走进富士康,就没有机会了。
模型工厂和实验速度
Eiso Kant [00:18:18]: 对吧?因为我们没有导致这种情况的决策的血统和历史。因此,我们从一开始就建立了一个团队,他们真正理解,我们正在优化的指标是从研究人员的想法到实验结果的速度,我们可以相信实验结果是下一个模型训练的一部分。
Eiso Kant [00:18:42]: 并且在。因为它是一门实验科学,最终,在一开始它并不那么复杂时,你可以修补它,对吗?但现在,在任何一家基金会模型公司,你都在跑步。我的意思是,我们是一个小团队,对吧?我们只有不到 70 名研究人员,另外还有 35 名工程师。我们正在运行,我没有检查最新的计数,但我们每个月削减的实验数量远远超过 10,000 个,也许 10 到 20,000 个。因此,如果您查看每个模型运行的规模,就像最终的情况一样,您需要能够将其视为基础问题。因此,我们多年来所做的事情已经变得非常擅长,只需努力工作、改进它并专注于这些最终决策。现在这意味着您查找了我们推出的 Laguna XS 2。从开始培训到上线,一共花了五周时间。我们今天要讨论的模型从训练开始到启动需要八周时间。我们昨天就开始了下一个模型,因为我们现在已经完成了下周或今天发布的模型所需的后期培训。我们将计算转移到我们现在正在训练的更大的 Laguna M 模型中。因此,该模型应该是某人流程的产物。它本身不应该是一个真正的东西。就像,我们对待它就像你看待 SpaceX 工厂一样,是的,第一枚火箭确实很难建造,但更困难的挑战是建造工厂。现在它们正在推出,没有人真正考虑下一次发布。所以这只是另一次发射,这是另一次发射,另一枚火箭升空。这就是我们在模型构建方面尝试做的事情。
Eiso Kant [00:20:22]: 而从零开始就没有计划的事情,就在我们的脑海中,就像有一天会发生的那样,当你建立一个非常好的最终模型工厂,拥有非常好的 API 和非常好的工程系统时,那么,它有什么完美的呢?它非常适合代理商。
模型工厂内的特工
Eiso Kant [00:20:40]: 因为代理商现在开始接管我们模型工厂越来越多的工作。
Vibhu [00:20:43]: 是的。
Eiso Kant [00:20:44]: 所以我走路时会看着屏幕,就像我们在一起时,我们每月一次,我们每月一次的现场活动,我走到人们的屏幕后面,停下来与我们的研究人员交谈。默认情况下,所有这些不同的代理都在其屏幕上运行并编写代码。他们正在启动这些工作。他们正在评估模型运行返回的结果。他们正在做出改变。我们仍然坐在驾驶座上。我们仍在想出一些想法。我们仍在帮助调试。但越来越多的情况是,现在这在我们的预处理和后处理管道的数据方面以及合成数据管道方面都非常深刻,它也开始在架构方面变得更加重要。你开始看到 RSI 会是什么样子。
Eiso Kant [00:21:27]: 就是这样。因此,当我们谈论,就像你关于我们模型的问题,每次谈论模型工厂时,我最酷的例子总是,当我们开始新的运行时,无论它是像大型运行这样的训练,还是现在的帖子,就像我们为发布或许多实验所做的 10 个训练后版本之一,在任何给定时刻,有人对他们前一天的实验结果所做的更改都进入了运行。
Eiso Kant [00:21:57]: 所以不存在 90 天前的截止日期。就像不一样,从那一刻起就真的是这样了,因为我们现在可以足够信任这台机器了。然后您还必须投资于可靠性。所以我最喜欢的关于 Laguna S 的指标之一是没有通话事件,对吧?就像完全为零一样。据我整个一年的记忆,我们还没有举办过有意义的电话活动,比如值得醒来的事情。现在有一个星号。通常在启动新模型运行的前六个小时中,由于您设置了错误的配置、犯了一个小错误等等,某些东西会出现故障。所以通常会有一点干预,但总是在类似的呼叫期内,对吗?不随叫随到。我认为现在情况开始变得复杂起来。所以我们现在发布的模型,我喜欢它。太棒了,但我们已经开始下一个了。我认为事情应该如此。
Laguna、五周构建和零待命事件
Vibhu [00:22:50]: 嘿,我也只是想指出,所以就上下文而言,这就像一个月前一样。我们在技术报告中找到了它,所以我们只是进来了,「好吧,新型号已经放弃了。还没有听说过。「我们是
Eiso Kant [00:23:02]: 是的,我们非常习惯每隔几个月这样做一次。
Vibhu [00:23:03]: 我们,我们非常喜欢,「好吧,看,这就像,与 Kimi、DeepSeek 之类的、小型的、Gemma 级别的一样。哦,这是一篇关于建筑的非常酷的论文。「然后我们就进入了这个页面,对吗?就像技术报告第二页的字面意思一样,「这个过程使我们能够应用经验教训,在五周内从头开始构建小型模型到交付「。然后我想,哦,这篇论文不是关于基准测试的技术报告,也不是关于它接受了多少代币的训练。就像那些想深入了解我们不会在播客上讨论的内容的人一样,一切都在这里列出,对吧?从
Eiso Kant [00:23:38]: 是的
Vibhu [00:23:39]: 代理可以用来与训练代码、训练数据交互的自定义软件。
Eiso Kant [00:23:45]: 是的。嗯,正确链接论文,所以是的。
Vibhu [00:23:47]: 是的。所有这些东西。阅读这里的报纸,但是,
技术报告原理和流式培训数据
Eiso Kant [00:23:50]:但我愿意。我喜欢原则,我认为这是讲述一些故事的一个很好的起点。也许我们可以一一超越这些原则。我只想说 Dagster 刚刚被一个级长买了。
Vibhu [00:24:01]: 是的。
Eiso Kant [00:24:01]: 这不是很有趣吗?但是,是的,我对 Dagster 非常熟悉。任何能引发故事的事情。
Vibhu [00:24:07]: 所以,好吧,我想说,好吧,实验代码是显而易见的,但我认为我最喜欢的事情之一是,我不知道它在这里哪里,但在早期,我仍然认为很多基础模型公司都是这种情况,人们准备他们的训练数据集,将它们打包,然后将它们复制到分布在所有节点上的训练集群,然后开始训练。
Vibhu [00:24:30]: 我们三年前就看过这个,我们觉得这毫无意义
Eiso Kant [00:24:36]: 你损失了很多时间,因为当你必须重新物化数据集的那一刻,你必须做出改变,你必须修复某些东西,等等,你有这么多时间来重新包装它,对吧? Toca-将其标记化、重新打包、将其移动到集群,然后将其分布到节点上。您的集群越大,您就开始使用类似 torrent 的奇特算法来分发数据。那么我们为什么不将数据流式传输到训练中呢?正确的?一些很常见并且很基本的东西
Vibhu [00:25:00]: 恰逢其时
Eiso Kant [00:25:01]: 恰逢其时,就像好的计算机科学一样原理。这是我认为首先解锁的东西之一——模型工厂。因为当你开始考虑训练工作时,不管它是一次大英雄跑还是一个小训练后实验,每秒都会消耗一定数量的代币,对吧?而且数量并不多,对吧?从类似数据、移动数据的角度来看。所以我们说,好吧,我们有我们的训练集群,然后我们有类似 AWS 的设置,我们可以在其中构建这些令人惊叹的大数据管道。我们可以安排一些事情。就像所有这些东西一样,我们在底层使用 Spark。
Vibhu [00:25:36]: 但是当你说 AWS 时,它不是真正的 AWS,而是你的内部 AWS。
Eiso Kant [00:25:39]: 这是我们的内部——不,这是我们的内部就像我们的基础设施一样运行
Vibhu [00:25:42]: 网站网络服务
Eiso Kant [00:25:43]: 完全正确。我们的东西像 AWS 帐户或任何硬件一样运行,对吗?
Vibhu [00:25:47]: 是的。
Eiso Kant [00:25:48]: 因此,一旦我们将数据转变为「我可以将数据流式传输到训练中「,突然间你会意识到很多事情都解锁了。因为现在您不必等待整个数据集实现。
不可变数据、实验即代码和科学严谨性
Eiso Kant [00:26:00]: 现在,当您运行有关混合数据的数据实验时,突然之间,它是一个配置。因为你已经获得了这些数据源,而你只是 - 我们在报告中提供了名为 Blender 的服务,然后我们说,「好吧,对于这次运行,我想要这个源的 20%,这个源的 10%。我想要这么多,这么多的重复周期。我希望它以某种方式进行洗牌,「你的训练工作可以在其余数据仍在实现时开始。它所做的也是因为所有这些都在下面——所以对我们来说,我们将下面的数据层视为不可变的数据层,这非常重要。就像代码实验一样,不可变的数据层意味着您始终可以返回并从字面上理解单个标记,它位于哪个光标所在的代码版本上。
Vibhu [00:26:47]: 是的。
Eiso Kant [00:26:48]: 我不得不承认,就像池畔的第一年一样,我们明白工程必须变得伟大,但我们还不明白,这最终会支持一个良好的、严格的科学进步。我们是一个非常小的人,所以很多都是 YOLO 的想法和 YOLO 的运行。
Vibhu [00:27:08]: 是的。
Eiso Kant [00:27:09]: 我们为 YOLO 运行构建了很棒的基础设施。但是,一旦我们意识到我们将数据视为不可变,将代码视为始终版本化,并且您始终可以完美地端到端跟踪和跟踪每个实验,您就可以完美地重复一切,对吗?您具有完美的再现性。如果我愿意的话,我仍然可以重现两年前的运行,对吧?它促进了科学进步,就像科学过程一样,我认为这可能需要我们进入公司大约一年半的时间才能弄清楚。我们还聘请了一些出色的员工,比如我们的应用研究主管 Nikolai,他从 Yandex 加入我们,从 2020 年代初就开始研究语言模型,我认为他将这一点带入了公司,「嘿,我们想要更加严格。「然后,一旦我们有了越来越强大的平台的组合,允许人们做更多的事情,但具有这种不变性,我们就能够开始「好吧,每一个实验都是真正的消融。我们真的需要理解它。「我认为过去几年我们在科学上变得更加严谨,而底层的基础设施使之成为可能。然后就是一些有趣的东西,比如
Vibhu [00:28:16]: 是的,很多都很有趣,就像,一,你分享所有的消融,二,选择数据集,对吧?这里有一个随机的小段落,就像「哦,是的,训练数据,我们有一些,我们有一个自动混合器。「它训练八个小模型,将它们放大,选择训练数据集。我们甚至不需要看它。我想,「哇,那里有很多工程严谨性。「这里有很多东西。
出版研究和回馈
Eiso Kant [00:28:40]: 是的,而且它 - 看,我们想推出更多。就像我们一样,我们把写论文视为很长一段时间以来我们还没有获得权利的事情。因此,一旦您处于前沿,您就有权利花时间发表研究成果,因为在那之前,您正在迎头赶上,这个行业的每一分钟和每小时都很重要。就像我对它的痴迷一样,不仅仅是从想法到结果的挂钟时间,而是像我们每天的一般时间一样,浪费是一种不允许我们赶上的时间。但在这种情况下,我们说:「好吧,我们要奉献自己。「我想我们给了团队三四天的时间,让他们继续工作,就像付出了一切。就你之前的观点而言,如果你的东西,很容易喜欢把它拿出来。随着时间的推移,我们想要谈论的事情还有很多,我们肯定会开始做。随着我们获得更多的权利,而且现在我们的使命也增加了,我们希望有更多的基金会模型公司存在,你会看到我们变得更加积极主动,并且只是试图不断放弃一些我们一路上学到的东西,这些东西可以帮助其他人加快速度。
Vibhu [00:29:40]: 这是另一个很酷的一面,对吧?这不是,回到你的观点,这不仅仅是我们训练的基准。如果你想复制,这里有优化器、数据集、训练后的实验。你在这里列出了很多内容,同时这是你如何做到这一点的系统?所以,这真的就像促销一样
Eiso Kant [00:29:59]: 不,谢谢
Vibhu [00:29:59]: 其他人也可以这样做。
Eiso Kant [00:30:00]: 顺便说一句,我也想澄清,对吧,我们一直令人难以置信——就像我们充分利用了其他人发表的所有开放研究的事实一样,对吧?你提到了中国的实验室,我认为重要的是,来自每个国家、每种文化和背景,包括像我们这样的西方公司,都有不同的模型可供人们选择信任。但我认为我们确实必须在应得的荣誉上给予荣誉,对吗?这个令人难以置信的中国实验室在分享他们的研究方面做得非常出色,我们肯定是利用这一点的接收端。因此,当你接受某样东西时,我认为你也有义务回馈。
Swyx [00:30:39]: 你有一个最喜欢的或被低估的中国实验室你想大声喊出来吗?每个人都喊出 DeepSeek。
中国实验室、智浦、坚持
Eiso Kant [00:30:44]: 这是一个好问题。
Swyx [00:30:45]: Moaan 显然是为 Therapi 设计的。是的。
Eiso Kant [00:30:48]: 是的,看,我想,我想显然每个人最近都在谈论 Zhipu,5.2。我认为大多数人都没有意识到他们什么时候开始的。
Swyx [00:30:59]: 是的。
Eiso Kant [00:30:59]: 对吧?他们比 ChatGPT 早几年就开始了。
Swyx [00:31:02]: 他们刚刚重新命名。是的
Eiso Kant [00:31:03]: 所以,我想,我记得在世界其他地方对此感到兴奋之前,在这些事情上工作是多么困难。因此,我非常尊重那些致力于改进模型的人们,尽管这并不是一件性感的事情,但相信法学硕士会让你受到嘲笑。我记得在 2016 年,当时我们正在使用其中一些模型进行代码机器学习。我们会——人们会嘲笑我们,就像他们会说,「这毫无意义。就像你为什么要浪费所有这些,比如,数百万美元来试图解决这个问题?「所以我想说,我认为他们可能是值得称赞的人,不仅因为他们的最新型号非常好,而且因为他们为达到这一目标而奋斗。我认为,我认为每个基础模型公司都需要时间才能到达这里,对吧?我们花了三年时间才达到我们现在要发布的模型。现在模型之间的时间间隔即将到来,以周为单位计算。它不再以月或年计算。但这东西很难。如果我们能让下一个人更容易一点,就像我们都应该这样做一样。因为如果我们不这样做,那么在模型真正影响递归自我改进到达到否则追赶可能变得不可行的水平之前,我们就会有一个小窗口。我们应该尝试在这个窗口期鼓励尽可能多的实验室,或者无论我们如何称呼它们,就像开始一样。所以我目前的其中之一
Eiso Kant [00:32:36]: 使命,但疑虑就像我想鼓励现在任何认为自己可以解决这个问题的研究人员离开并成为我的竞争对手。
Eiso Kant [00:32:45]: 就像创办另一个基础模型公司,因为我认为我们需要它。我认为否则我们就不会成为这样的世界,我不想成为第五或第六家获胜的公司。我想看看一个有很多选择的世界。
创办基金会模型公司
Vibhu [00:32:57]: 人们在启动基础模型时还看不到什么?是的,有大量的计算,需要大量的资本,大量的计算。你布置了模型工厂以及如何进行培训,但里面有很多东西,对吧?那就是,
Eiso Kant [00:33:10]: 好吧,看,我反过来——这是一种过于简单化的说法,我总是用星号来表示它,因为它可能会在人们的头脑中产生一些错误的方式。但我认为你可以总结一下,我看到了,95% 的模型构建只是在做,你只是在做两件事。您正在改进数据或正在提高计算效率。我知道,对于那些令人难以置信的天才和熟练的人所做的工作来说,这感觉过于简单化了。但如果你真的看一下,就像我们在做什么?我们正在研究数据,我们正在生成新数据,我们正在改进数据。唯一的方法就是查看数据,对吧?这是基础模型构建的重要组成部分。另一方面,我们在推理、架构和新的注意力机制方面取得了令人难以置信的突破。但他们到底在做什么?他们带来了计算效率。现在,这些年来我们确实取得了一些突破,允许更多的模型功能。但在极限情况下,如果你可以训练一个足够大的模型,对吧,就像,你有无限的计算,我们可能——如果你有无限的计算,你明天可能就已经在 AGI 了。
Eiso Kant [00:34:12]: 对吧?好像不是。因此,让我说无限计算具有无限更快网络的能力,因为网络最终比计算更成为瓶颈。但是,我确实认为这些是主要的事情。并意识到这是工程。我认为这变得更加明显,但我认为多年来,人们一直将基础模型公司、研究人员和其他人放在这个基座上,就像你正在做令人难以置信的魔术或火箭科学,或者只有诺贝尔奖获得者物理学家才能做到这一点。不要误会我的意思,有一些非常困难的问题需要解决,但是我们所有人每天所做的很多工作并不是坐下来尝试解决数学定理。我们正在做的很多工作只是真正做好基础知识,编写好的代码,查看数据,改进它,运行实验,查看图表,试图看到,嘿,试图塑造我们的直觉。更多的人可以成为高能力的研究人员。我认为人们这样做感觉很遥远。但我在我们自己的公司看到,我们看到工程师成为研究人员,因为模型工厂允许他们进行实验和尝试的障碍要低得多。我们团队中的一个人最初是一名构建代理的工程师,现在是一名合法的强化学习研究员,取得了真正的进步。这发生在大约六个月的时间内。几年前,我认为大多数人认为这是不可能的。
Swyx [00:35:46]: 是的。我认为有趣的时刻之一是你可以自我托管,就像如果在一种编程语言中,就像你可以用该语言编译该语言一样,相当于你可以使用自己的工具,对吧?您有池 CLI,您有自己的模型。想必您不仅使用自己的模型。没有办法。但随着时间的推移,这个百分比是多少?
Laguna S、持久性和行为增益
Eiso Kant [00:36:10]: 这是我们发布的第一个模型,它开始为我们自己的工作做出有意义的贡献。这还不是一个不是最先进的模型。 《神鬼寓言》和其他的,它们是非常有能力的模型,但 Laguna S 真的很有趣。我要调出报价。我们的应用研究负责人之一彭明上周说了一些话,大约十天前模型就出来了,比我们希望或预期的要好得多。他说,我感觉 Laguna S 的很多收获不是来自于更多的智力,而是更多来自于不同的行为,更多的验证,更少的认为事情是理所当然的,不提前宣布胜利,并且更加坚持。老实说,在某种程度上,这些比原始智力更能预测人类的成功。他在 7 月 5 日的一个周日给我写了这封信,从那时起它就一直在我的脑海中烙印,因为 Laguna S 模型,正如你将看到的那样,以及为什么它在基准测试中表现如此出色以及为什么它在日常使用中表现如此出色,是因为它非常持久。原因有很多。我确实这么说。我们还有很多工作要做,以提高效率。我们必须努力提供不同的推理模式。但这个模型能够做到我从未想过它能做到的事情。一千一百八亿的 8B 活跃模型,并没有那么大。它适合 DGX Spark,并且在 Spark 上仍然以每秒 30、40 个代币的速度运行,能够独立解决 Erdős 397。它能够完成复杂的编程任务。是可以的。今天早上我要求它为我制作一个 Fi 扫描仪,而无需在我的 Mac 上使用任何外部库,它就像通过真正坚持不懈地尝试在不访问互联网的情况下理解核心 WLAN API 来弄清楚它一样。而且,我喜欢检查氛围。在过去的十天里,我可能每天花八到十个小时在这个模型上。
Eiso Kant [00:38:05]:我没有夸张。昨天我乘坐了 11 个小时的航班。我花了十个小时阅读模型的轨迹和痕迹等。
Eiso Kant [00:38:12]: 而我从中得到的正是彭明所说的。我们将能够从较小的模型中榨取比我们在行业中想象的更多的东西,因为,是的,有智能,而更大的模型更智能。就像,毫无疑问。我们应该继续扩大规模。但真正坚持不懈的行为,当你犯错时能够回溯的行为,比如理解如何与你的环境互动的行为告诉我们,我们可以从中得到更多。对我来说,这在过去几天里在我的脑海中产生了一些问题。如果您想一下我们今天在哪里使用模型,对吧?例如,我们正在使用模型进行知识工作。代表全球经济的百分之二十五,二十五万亿美元的工作。
Eiso Kant [00:39:00]: 随着我们扩大模型规模并且它们变得更加智能,我们很高兴能够越来越多地使用它们来推动科学前沿。
小模型、知识工作和商品化
Eiso Kant [00:39:08]: 如果你看看科学的前沿,就像科学上的真正突破一样,它们是相互联系的,它们在许多地方与更多的智能联系在一起。爱因斯坦发现了广义相对论,能够将其他人无法整合的想法整合在一起。我认为智能的众多维度之一就是做到这一点的能力,我们清楚地看到,随着模型变得更大、能力更强,它们能够将更多的想法和线索整合在一起,而较小的模型则无法做到这一点。
Eiso Kant [00:39:36]: 我们开始在医学、生物和其他领域看到这样的例子。但如果你考虑一下我们所做的大部分知识工作,其中包括构建软件。我本质上可能首先是一名软件开发人员,尽管我可能不能再多说了,因为我已经很多年没有编写生产代码了,但让我们变得优秀的是我们的坚持。这是我们遇到问题并回溯并说:「我需要找出这个错误。我需要去研究这个。我需要去查看文档。我需要,比如,尝试不同的、五种不同的方法来看看,比如,我是否能解决它。「但它不一定将来自完全不同领域的三种想法结合在一起。因此,如果我们现在看到,我认为 Laguna S 就是一个例子,我们能够使一个相对较小的模型比我明确预测的或任何以前的基准测试显示的任何模型的能力都要强大得多,至少在编码任务上,这是因为行为。所以现在我的问题是,我没有答案,这是我知道的极限,所以无限的模型大小,对,非常大的模型,并且该模型的运行成本将非常昂贵。我们知道这一点,对吧?所以更大的模型投资回报率。
Eiso Kant [00:40:52]: 所以我知道,在极限情况下,我不会有一天使用世界上最大的模型、四万亿个参数,无论什么疯狂的东西,比如我们扩大规模,来完成一项基本的编码任务。今天,我已经开始缩减某些任务的规模。
Eiso Kant [00:41:07]: 所以这意味着存在一个最优值。这意味着当我们达到知识工作的模型大小时,会出现一些曲线,在某个时刻我们处于顶峰,在那之后,使用更大模型的投资回报就没有意义了。
Eiso Kant [00:41:22]: 现在,我认为问题是,以前我会认为峰值非常非常遥远。
Eiso Kant [00:41:30]: 对我来说,这个模型是第一个迹象,表明也许那个峰值是一万亿、五万亿、十万亿。也许我们可以从这些模型中榨取更多东西。我不再认为我们需要在最大的模型上增加两到三个数量级才能解决知识工作、会计、法律和我们编写的代码。因此,如果这是真的,那么这就是模型商品化的一个论点。这是一个关于开源可以赢得胜利并在这个世界上取得成功的论点。现在这当然是一个自私的论点,也是一个充满希望的论点,但理论上它的作用有限。我们只需要去发现在接下来的几年里我们还能挤出多少东西。现在,我确实想加一个大星号。这并不意味着我反对扩展模型。我认为,只有我们将模型规模扩大到与竞争对手一样大,我们最终才能成功。我不喜欢。我认为我们不应该把头埋在沙子里并说我们将成为开源小型模型之王。我认为那是,这是一个出局。它试图成为自己王国的国王,但没有意识到世界其他地方在做什么。我们所有人都宁愿使用更智能、更快、更多的模型。这是希望的标志。所以我不想过分地说这是一个很好的模型。要想达到最先进的水平,我们还有很长的路要走。但希望人们在使用这个模型时能学到的是,它内部的行为促使它变得更加强大,而不是参数的数量。
预训练、训练中期和强化学习提前进行
Vibhu [00:43:03]: 这主要是训练后吗?喜欢
Eiso Kant [00:43:05]: 是的
Vibhu [00:43:05]: 对。
Eiso Kant [00:43:06]: 这完全是训练后的事情。
Vibhu [00:43:08]: 我们在训练方面是否已经完成了改进?培训完成了吗?
Eiso Kant [00:43:12]: 不。
Vibhu [00:43:12]: 好的。
Eiso Kant [00:43:13]: 所以
Vibhu [00:43:13]: 我只是想介绍一下训练,然后我们进行训练后
Eiso Kant [00:43:15]: 训练尚未完成。我的意思是,你看,训练中有一部分只是处理技巧,对吗?模型技能每提高一个数量级,你都会得到需要解决的新问题。但这些最终都是工程挑战。
Eiso Kant [00:43:31]: 我想说,我有一个不常见的观点,即强化学习将越来越早地进入训练。
Vibhu [00:43:42]: 是的,训练。
Eiso Kant [00:43:44]:甚至没有训练。就像今天的培训一样,对吧,就像你看 - 所以我们已经在这方面努力了很多年。我认为最好的——我认为我们第一次在公开场合看到它是 DeepSeek Zero 论文。如果我没记错的话,那是一年半前的事了。在模型中,您可以很早就开始能够使用语言等来诱导推理。所以我的问题是,我们有这个——我们有网络数据集。和网络,我认为我们可以说可能将人类的全部知识编码在不同的地方。这是一个巨大的质量差异程度,来自垃圾数据,就像一旦你查看训练数据一样,你真的会因为网络是什么而感到谦卑,喜欢最伟大的科学论文和最好的博客文章之类的,最好的成绩单等等。
Eiso Kant [00:44:39]: 所以现在我们正在试图弄清楚什么,并且已经做了很多工作,这个地方可能不像我们在其他事情上那么开放,但随着时间的推移我们会变得更加开放。我们花了几年时间真正研究如何将网络不仅转变为下一个令牌预测,而且转变为一种教会模型在训练中尽早思考的方法。我认为那里蕴藏着大量的黄金。我认为我们现在已经进入了这个行业,我们已经有了一些药物。其中一种药物是蒸馏。另一种药物是,更多的环境。就像,它们很棒,它们让我们感觉良好,它们使模型变得更好,就像我们都沉迷于它们一样,我们会使用它们,对吗?以各种不同的方式。但最终,我认为我们仍然没有从网络中挤出我们应该从网络中得到的东西。
Eiso Kant [00:45:33]: 我认为仅在训练期间预测下一个标记是不够的。
Eiso Kant [00:45:36]:
Vibhu [00:45:38]: 是的
Eiso Kant [00:45:38]:我认为我们会看到一些非常有趣的事情仍然发生。强化学习在训练后诱导行为、改善事物,就像我认为的那样——现在全世界都知道如何做到这一点。我想我们正在扩大规模。每个人都是。但我想知道我们是否需要在环境方面走得像今天这样。我还不确定
Vibhu [00:46:01]: 你的意思是我们走得太远了?
Eiso Kant [00:46:02]: 我,我不确定通往 AGI 的道路是否只是
Vibhu [00:46:06]: 是更多环境
Eiso Kant [00:46:07]: 更多环境。
Vibhu [00:46:08]: 这似乎是一个永无止境的问题,「好吧,我想要这张桌子的使用手册,对吗?我要建造家具吗?或者我们只是要结束,就像我们需要一些通用的解决方案一样?「
Eiso Kant [00:46:19]: 我认为有,我认为有能力从网络上概括更多。但我也很受鼓舞,就像当我看到 Laguna S 时,训练后的影响是巨大的。我认为,哦,等一下,只要让其中一些行为变得更好,我们就能从中获得更多。它只是稍微改变了你对智力的看法。
Vibhu [00:46:40]: 是的。人们经常打的比方是,在强化学习阶段,你不会学到太多新知识。你转变
Eiso Kant [00:46:46]: 是的。
Vibhu [00:46:46]: 是的。因此,你可以改变分布,并且可以让它朝着你想要的方向发展。关于你关于训练的观点,很多训练仍然只是继续在某个领域进行训练,比如医学,然后你就进行强化学习。所以还是只是
Eiso Kant [00:47:00]: 这只是更好的数据,对吧?就像,我的意思是,训练,哦,我喜欢我们发明这个词的方式。就像它实际上一样,
Vibhu [00:47:06]: 第二阶段
Eiso Kant [00:47:07]: 这是训练的第二阶段,用一种非常愚蠢的方式来完成课程。但最终,您想要的是从代币 0 到代币 30 或 40 万亿代币的课程,这确实是模型学习的最佳课程。但培训本质上是网络上的阶段性课程,因为我们不必计算,并且有效地尝试消除完美的课程,对吗?所以我很确定你很快就会开始看到人们谈论其他术语,有两个或 - 因为现在我们这样做,对吗?我们谈论第二阶段、第三阶段和第四阶段的训练等等。但最终,我们所做的只是尝试为网络数据分配课程,以便模型能够更好地学习。我认为在某种程度上,随着事物得到计算,随着模型的运行成本变得越来越便宜,作为下一代计算,这将变得更加连续。顺便说一句,我也认为原因是你接受了培训,并且像第二阶段和第三阶段一样是组织方面的,对吗?我认为,这是我们在模型工厂中真正努力避免的事情,就像培训的存在是因为现在有一个培训团队,对吗?有人,或者像正在接受培训的人一样,决定专注于培训工作。但你真正想要的是实验的工程和规模,允许你没有的更连续的光谱,你有无限的阶段。现在,我们不在那儿了。计算不存在。组织设计尚不成熟。但我想我们会成功的。当我们回顾几年的情况时,会说,「哦天啊,我们以如此幼稚的方式处理训练数据真是太可爱了。就像我们几乎没有订购它一样。我们在这方面并没有真正做得很好
课程、汽车研究和新目标
Vibhu [00:48:48]: 该课程的建设将使您在行业中获得成功。
Eiso Kant [00:48:51]: 我会确认这一点,当我与一些研究人员交谈时,现在的焦点是训练如何改变以及除了下一个令牌预测之外的下一个目标是什么。我假设你没有答案,但你有一些想法。
Vibhu [00:49:02]: 我们有一些想法。我们还没有准备好谈论它。
Eiso Kant [00:49:05]: 是的。
Vibhu [00:49:05]: 我们多年来一直在研究它们,我认为这也是你之前问过的一件事,就像建立一家基金会模型公司的不明显之处在于你不断地平衡赌注工作,配方有效
Eiso Kant [00:49:19]: 是的。
Vibhu [00:49:19]: 与你一样,我的疯狂
Eiso Kant [00:49:22]: 纯研究
Vibhu [00:49:22]:突破。
Eiso Kant [00:49:22]: 是的。
Vibhu [00:49:22]: 纯粹的研究和找到平衡并根据你在比赛中的位置调整百分比非常重要。
Eiso Kant [00:49:31]: 我的意思是,就像,这是一个很好的方法。我本来想在某个时候提起汽车研究
Vibhu [00:49:35]: 是的
Eiso Kant [00:49:35]: 作为安德烈的另一个发明或创造,老实说,就像可以有多少个目标函数,对吗?就像只尝试其中 1,000 个,然后将其设置为运行,等等。
Vibhu [00:49:47]: 伙计,这也是
Eiso Kant [00:49:48]: 就像您正在寻找的一样。你正在寻找这样的损失曲线,比如
Vibhu [00:49:51]: 这也是人们下注的东西,对吧?当你说更多 Neo 实验室时,你正在做一个版本,我们将做基础模型,扩大规模,下一个令牌预测器。我们看到的许多其他 Neo 实验室都想采取完全不同的方法,对吗?在某种程度上,你是对的。这就是计算效率,这就是最终目标。但有些还可以,不同的架构,比如截然不同的计算支出。所以有些是不同的。他们不仅仅是
Eiso Kant [00:50:19]: 是的
Vibhu [00:50:19]: 他们就像,99% 没有平衡,这是香草和扩大规模。他们 99% 都同意,这项新颖的研究将改变一切。
Eiso Kant [00:50:27]: 我想,卢克,我想你。这也取决于你什么时候开始的,对吧?
纯研究与赌注
Vibhu [00:50:30]: 是的。
Eiso Kant [00:50:30]: 当我们开始时,我们所做的新颖的事情就是对代码进行强化学习。不久——到目前为止,这已经不是什么新鲜事了,但我们就像——当没有人相信强化学习时,我们就痴迷于此。所以你创办公司的时候必须要有自己的想法。你必须有一些不同的东西来让你加速,对吧?对我们来说,RL 到法学硕士后来变得很常见,就像知识一样。但一开始并非如此
Vibhu [00:50:53]: 很酷。这就像你原来的 2023 年博客
Eiso Kant [00:50:57]: 是的
Vibhu [00:50:57]: 有目的的。
Eiso Kant [00:50:58]: 是的。
Vibhu [00:50:59]: 就像你把这一切都列在这里一样。
Eiso Kant [00:51:01]: 我们奠定了
Vibhu [00:51:01]: 这个博客被低估了,对吧?整个 RL 代码很早就出现了。
Eiso Kant [00:51:06]: 很早。甚至我们也不得不与人们争论,就像我们在这里所说的,比如超越当前的能力,来训练你自己的基础模型。我们不得不与人们争论,拥有自己喜欢的基本模型很重要。你可以调整自己的成功之路,对吧?主要功能来自于训练基础模型,并在微调过程中使其变得准确且有用。
Vibhu [00:51:23]: 从当时的角度来看,我们知道封闭模型、OpenAI、Anthropic 是巨大的。我们的开放型号有 Mistral 7B、30B、70B。
Eiso Kant [00:51:35]: 当我们
Vibhu [00:51:35]: 是的
Eiso Kant [00:51:36]: 这件事上的日期是错误的。当我们发布这篇文章时,是 2023 年 4 月。我认为这只是
Vibhu [00:51:42]: 是的
Eiso Kant [00:51:42]: 发生在迁移中,可能在 archive.org 上找到它。
Vibhu [00:51:45]: 米斯特拉尔。
Eiso Kant [00:51:46]: Mistral 已经开始了,我们在同一个月开始,对吧?
Vibhu [00:51:49]: 是的。
Eiso Kant [00:51:49]: 所以这不是均匀的,我认为当时只有 Llama 出来
维布[00:51:52]:斯内尔
Eiso Kant [00:51:52]: 就是这样,对吧?所以,但我同意。我认为我们想要,我们想要尽可能多的多样性想法,而且我确实认为如果你从今天开始,你想要一些能给你带来优势的东西,对吗?我确实认为我们有时会结束。
Eiso Kant [00:52:13]: 我认为每个建筑师都达到了极限,每个建筑都可以工作。 RNN 可以工作,只是计算效率不高,对吧?比如说,如果你有无限的计算能力,你可能只需采用过去的基本 RNN,就可以走得很远。
Eiso Kant [00:52:27]: 现在已经有了有意义的突破、注意力和其他东西。但我认为我们仍然处于解决这些问题的早期阶段。我最兴奋的事情是,我最兴奋的是人们进行极低精度的训练,对吧?就像我们看到的三元材料一样
Vibhu [00:52:47]: 天哪
Eiso Kant [00:52:47]:非常酷。昨天的盆景东西看起来超级酷。我认为,如果你能找到我追溯到 2023 年的推文,这就像类似的概念,那么,这是一个明显的权衡。根据定义,较大的模型、较低的精度等于较小的模型、较高的精度,对吗?这就是事实,就像结果如何,对吧?实际尺寸限制是多少?现在有些公司正在试图解决这个问题,但如果做得正确,这些事情可以改变我们的行业。
低精度训练和计算效率
Vibhu [00:53:14]: 是的。
Eiso Kant [00:53:14]: 因为最终,我们的计算瓶颈是 MatMul 瓶颈,网络瓶颈,以及你开始做这些事情的那一刻。所以我对此感到很兴奋。我们没有做 - 我的意思是,我们正在做平常的事情,比如,Laguna S 在 FP8 中接受训练。在这轮比赛中,我必须承认的唯一一件事不是 FP8,那就是我们昨天刚刚开始的新一轮比赛中的一切。 FP8 适合所有人。这就像截止日期一样,哦,我们不太愿意这样做。通过 Nemotron 和 NVFP4 培训,您取得了令人惊叹的成绩。就像,我认为他们在那里所做的事情被低估了。我很高兴能够参加 NVFP4 培训。还没有意义,因为我们仍在对 Hoppers 进行训练,对吗?我们相对较小。我们现在是 10K H200 集群公司。我们很快就会扩大规模,但是,如果有人正在考虑申请工作,我们会扩大规模。但喜欢的。是的,我认为是的,还有很多东西可以榨取,希望 Laguna S 向人们展示这种尺寸的模型可以得到更多,我们在八周内完成了这件事。我们认为任何尺寸的模型都可以榨出更多的汁液。我们现在正在扩大规模,因为这对我们公司来说是最理想的事情。但如果我有无限的时间,我很乐意在其他模型尺寸上推出更多功能。
Vibhu [00:54:34]: 我认为我们还没有正确宣布您的新尺寸。所以我们有 XS,大约 30B。
Laguna S 型号尺寸和命名
Eiso Kant [00:54:41]: 是的。
Vibhu [00:54:41]: 旧介质是 200B,将被弃用
Eiso Kant [00:54:45]: 是的
Vibhu [00:54:45]: 看来。如此新的拉古纳小
Eiso Kant [00:54:48]: 所以 Laguna S,Laguna Small,总参数 1180 亿个,8B 活跃,所以非常稀疏。它是 XS 架构的扩展。这是经典,或者说现在称之为经典,就像滑动窗口注意力与全局注意力的三比一一样。只是,它的尺寸不错,有几个原因。第一,它非常具有成本效益。对我们来说,这是一个好方法 - 我们希望快速取得进展。我们看到的一件事是,这是一个基础模型公司内部的平衡,专注于发布和运输,以及你的新小说研究。但是有了模型工厂,我们就可以将模型的发布视为团队投入的时间更少,因为它只是,哦,在此时此刻,进行训练运行,完成,应用最新的训练后。所以我认为这是一个很好的重量级。它也适用于 DGX Spark,我对它有一个小小的情结。我喜欢那些小事,比如运行一个好的模型。
Swyx [00:55:52]: 是的,我们去年在 GTC 这个 Pod 上介绍过它。
Eiso Kant [00:55:54]: 很好。
Swyx [00:55:55]: 我认为 OSS 120B 是第一个,因为它是一个大型单 GPU,也就是 H100,对吗?
Eiso Kant [00:56:02]: 完全正确。
Swyx [00:56:02]: 租一台 H100,现在您已经拥有 128 台 Mac、Mac Mini、Sparks。这是,这是家的最佳地点。
Eiso Kant [00:56:10]: 但我认为我最兴奋的是这个模型希望向人们展示这个尺寸的可能性,因为当你查看基准并开始使用它时,你会意识到我们的性能优于其尺寸的两到三倍。
Swyx [00:56:24]: 是的,他们认为 - 例如,今天的 Thinky 模型就像一万亿个参数。
Eiso Kant [00:56:28]: 所以是的,完全正确。顺便说一下,我很兴奋——我已经——它刚刚发布,所以对于那些正在听这个的人来说,我在手机上看到了它
Swyx [00:56:34]: 如果你在,如果你在听
Eiso Kant [00:56:34]: 如果你在哼唱
Swyx [00:56:35]: 是的。
Eiso Kant [00:56:35]: 大约两秒钟,所以我什至没有机会阅读这篇文章。
Swyx [00:56:39]: 但不知怎的,你不仅比 Thinky 更好,这就像这些基准之一,而且,在某些基准上,比如 τ-bench ,就像你是最先进的。
Eiso Kant [00:56:51]: 我们「- 看,我们正在做,我不确定我们是否处于最先进的水平,我的意思是,3 银行,我还没有检查我们在排行榜上的位置。但我认为,在我们的重量级内,我可以很轻松地说,甚至在一些两倍大的重量级中,我们可能是最先进的。我还想提醒一下,现在世界上最好的模型肯定是,给我一个寓言,给我 5.6。对于您之前的观点,我们还使用其他模型。
Swyx [00:57:15]: 是的。
Swyx [00:57:15]: 我认为,你之前提到的有趣的事情是你开始将很多实际使用转移到它上,对吗?基准就像
Eiso Kant [00:57:21]: 是的
Swyx [00:57:22]: 它们很适合比较,但它们并不是超级现实。它'
Eiso Kant [00:57:24]: 他们必须这样做,对吧?这就是他们进行狗粮基准测试的方式。
Eiso Kant [00:57:27]:不,你必须这样做。就像,你必须使用自己的模型,并且必须有自己的内部评估和基准。有趣的是,就像在一个新的检查站出现后的前 30 分钟内,也就是一趟火车之后的第一趟火车后,你自己可以在前 30 分钟内感觉到这个模型将会在哪里。就像,你不太清楚,但是就像当这个出来时,我们就像,「哦,「就像,「这是不同的。「就像,我认为这是最好的例子。但这有点像你的孩子。我没有孩子,但父母们,他们看到自己的孩子是完美的,他们喜欢它,然后他们看不到所有粗糙的边缘。当您构建自己的模型时,您总是会得到这一点。最有趣的部分是,你喜欢你所做的每一个模特。我们试图不断地说这件事,就像,「这是我们训练过的最糟糕的模型。「所以我知道团队现在已经开始了
Swyx [00:58:18]: 是的
Eiso Kant [00:58:19]: 下一场,理应如此,因为这是一场比赛。这个模型是一个及时的时刻,希望向人们表明我们对这场比赛是认真的,我们想非常努力地工作,我们需要反馈,对吧?哪里好呢?哪里不是呢?就像,让你的模型在公开重量下公开的好处之一就是你可以获得很多反馈。
Swyx [00:58:40]: 你如何看待用类似的方式构建它,使用线束,对吧?所以 OpenCode、Codex,你都有自己的池 CLI 工具。让人们使用它,模型安全带的设计,培训它。
Eiso Kant [00:58:54]: 所以你需要做一些多线束训练。就像如果您,特别是在这些较小尺寸的情况下,您想对这些模型进行一些多线束训练以获得正确的效果。而且数量非常少。就像,你不需要太多,但这就像把你在你的线束中看到的正确行为转移到你自己的线束上,就像你和其他人可能会使用它一样。我们内部一直称之为抛光,就像你已经有了你的模型,你做了一点抛光,这样,它就能够在其他线束中很好地工作,就像在你自己的线束中一样。
Eiso Kant [00:59:24]:毫无疑问,在你自己的工具中它会更好,这只是因为你把强化学习计算放在哪里,对吧?你将你的强化学习和合成数据放入你自己的工具中,因为这是你最了解并且最有能力推动的数据。因为最终控制可以让你做得更好。那么转移这些功能更多的是确保模型,引发适当数量的推理等,理解一些可能存在于其他地方的可能更复杂的奇怪工具调用格式。因此,我们进行了一些多线束抛光,正如我们所说的那样。它并不是真正驱动功能的因素,但它确实创造了更好的体验。我想现在每个人都可能这样做,但看到为什么你自己的安全带仍然比其他安全带更好是完全公平的。我认为我们在所有基金会模型公司中都看到了这一点。只是当你推动功能时,你并不想通过在 RL 运行中放置 10 个工具来进行权衡,因为这太复杂了。这是工程的复杂性,因为当你试图做好科学研究时,对吧,当你试图真正理解是什么让我的模型得到改进时,你想要对你理解的东西做出一个变量的改变。对于别人的安全带,您并不像了解自己的安全带那样了解或理解,对吗?他们可能有不同的代理或不同的提示
为什么池畔被称为池畔
Swyx [01:00:48]: 是的,
Eiso Kant [01:00:48]: 在不同的地方
Swyx [01:00:49]: 如果是开源的,你可以看一下源码。
Eiso Kant [01:00:50]: 是的,但现在是时候了,对吧?就像我真的无法承受压力,就像我知道我在这方面就像一个奇怪的人,因为就像我有朋友一样,「我们可以见面吗?「或者,「我们可以这样做吗?「或者,「我们可以出去吗?「我说:「不。「因为归根结底,这是一场比赛,时间是唯一重要的事情。如果我看着我们的团队说,「好吧,在我们构建更强大模型的一般轨迹上,什么是值得引入的复杂性?它可以快速推广到其他工具。顺便说一句,我们的模型在其他工具上运行良好。我真的鼓励人们这样做。它运行良好。就像我一样,我们一直在 OpenCode 和 Kilo Code 等其他代码以及 Claude Code 中对其进行测试。
Swyx [01:01:22]: 今天刚买的。
Eiso Kant [01:01:24]:我看到了。
Swyx [01:01:25]: 我的意思是本田。是的。
Eiso Kant [01:01:25]: 完全正确。
Swyx [01:01:26]: 一切都被收购了。
Eiso Kant [01:01:27]: 完全正确。我认为其中一部分就像,并且有一些令人惊奇的。我,我很兴奋,就像我认为爱马仕是一个非常酷的安全带一样,而且
Swyx [01:01:37]: 而且,问题的一部分就像模型与模型加线束的比例一样,对吧?因此,像 Agents Last Exam 这样的新基准,它不想仅仅衡量模型。模特变得越来越代理也是如此。他们需要一个安全带来操作,对吧?
Eiso Kant [01:01:55]: 我认为当你向模特公司问这个问题时,我认为你可以将它分成两部分,就像安全带一样,就像我们有一个非常瘦身的安全带。当你看到它时,它就像六个工具。它就像 shell,就像 shell 杀死、shell 等待、写入、获取网络,还有像,我不知道,bash。就像我认为我缺少一个,但实际上这就是所有工具。这非常简单。它非常轻。因此,它不是一个旨在尝试在基准测试中表现出色或在某些事物子集上表现出色的工具,对吗?这不是一个深入的研究工具。因此,我认为我们看到了复杂工具的令人难以置信的能力,这些工具围绕构建大量提示以及额外的数据源和其他工具来真正推动模型的功能向前发展。
Eiso Kant [01:02:41]: 但我们的模型仍然比其他一些在类似编码任务中执行此操作的工具更好,因为它是用它进行强化学习的。
Eiso Kant [01:02:48]: 现在,我确实鼓励人们,顺便说一句,我认为我们的模型非常好,而且对我们的模型也很好。这些差异可能太小,任何人都不会注意到,但我们最终在基准测试中看到它仍然有一点点。所以我认为两者都是正确的。拥有安全带的基础模型公司将真正推动他们,因为这只是操作上的,是改进模型时保持科学严谨的最佳方式。但那些采用我们的模型并在改进安全带方面确实做了很多工作的人也将与我们竞争,这是他们应该做的。这只是因为线束是模型能力和它需要的附加指令之间的权宜之计,而它需要的是访问数据和工具,对吗?我认为这最终就是安全带的本质。就好像,能不能。当您构建功能更强大的模型时,您就可以改进模型的指导。因此,额外的安全带只是说:「嘿,如果你遇到 X、Y 或 Z,请这样做。「因此,即使您会说具有两种不同线束的两个模型可以同等地达到您关心的相同功能,但真正针对某种功能量身定制的线束会更有效地实现这一点。
Eiso Kant [01:03:58]: 这就像一个人拿到一本手册,告诉他如何使用正确的工具和正确的数据源以最有效的方式完成任务,而不是一个真正聪明的人,比如「去弄清楚「。他们都会解决这项任务,但其中一个会更有效率。因此,我是世界上正在发生的所有线束开发的忠实粉丝,我们希望与更多线束创作者合作,以确保如果需要一些额外的培训(例如发布),我们会这样做。
Swyx [01:04:22]: 我的意思是,我认为当你说这是一场比赛时,有一个问题是你要比赛什么?您是在竞相成为最好的编码模型公司还是最好的编码模型加线束公司?我认为这是不同的事情。
Swyx [01:04:36]: 或者两者都不是。
Eiso Kant [01:04:37]: 或者两者都不是。
Swyx [01:04:37]: 是的。
Eiso Kant [01:04:38]:所以我们。我与 AGI 赛跑。从我们网站上线的零天开始,我们就一直在编码,而且我们已经一遍又一遍地说过,我们认为专注于编码和像软件任务这样的长期任务是通向 AGI 的道路,因为它迫使我们解决难题。它迫使我们解决完成长期复杂工作的能力,这些工作需要大量推理、外部工具、数据等等。我可以向您展示的一件事是,我们将就这个模型进行网络聊天,我喜欢这个模型进行深入研究,只是在我的编码工具中使用它。它从未接受过这方面的训练。它从来不像看起来那样,但在我看来,它很棒。因为最终,他们会概括技能转移。现在,我们今天不关注的是确保世界上最伟大的医学知识或世界上最伟大的法律知识被编码在这个模型中。但它确实做到了。我们不会发布这个基准测试,因为我们没有时间真正做正确的事情,但它在 LegalBench 上表现得非常好。至少在我们的第一次运行中,我们非常严格。当我们发布评估时,我们已经检查了它们的每一个小细节。我们已经运行过很多次了。我们已经过去了,就像我们已经走了一样,我们也会,就像我们试图对此非常诚实一样,所以如果我们没有花足够的时间在我们内部使用的公开基准上,我们只是说我们不会发布它。和
Swyx [01:06:01]: 我的意思是,另一种方法就是将其交给人工分析并让他们运行它。
Swyx [01:06:04]: 像第三方标准。
Eiso Kant [01:06:05]: 哦,100%,我们也会这样做。但这仍然需要时间和精力,对吗?因为你正在与人们合作,了解基础设施故障以及他们正在使用和喜欢的工具,他们是否设置得很好。但我同意。你绝对想要。我是 Vals 和 Artificial Analysis 等公司的忠实粉丝,也喜欢其他从事这方面工作的公司。
Swyx [01:06:21]: 我发现它非常好。你是第一个提出来的。
Eiso Kant [01:06:22]: 是的。我认为他们很棒。他们有喜欢的。我喜欢他们所做的很多工作。所以,我认为还有更多,请创建更多的评估公司。就像创建更多评估一样。我认为这对这个行业来说非常有价值。
Swyx [01:06:34]: 我觉得这是一个真正的垄断。哦,也许还有双头垄断。
Eiso Kant [01:06:37]:我认为它可以被打破。
Swyx [01:06:39]: 是的。
Eiso Kant [01:06:40]: 因为我认为它很容易被打破,因为为很多人创建一个评估并不是性感的工作,但无论谁做,每个人都很高兴得到一个好的评估。您希望评估构建良好,每个人都在庆祝它,每个人都愿意为此付费,并且每个人都愿意,就像基础模型一样
Swyx [01:06:55]: 哦,是的。我认为创建 eval 是的。但就像我们是行业标准一样
Eiso Kant [01:07:01]: 是的
Swyx [01:07:01]: Τ-长凳并确保你没有,你没有作弊
Eiso Kant [01:07:03]: 是的,确实如此
Swyx [01:07:03]: 我会按照您与竞争对手的相同方式来运行它。
Eiso Kant [01:07:05]: 是的。这是非常正确的,我们需要它。这很好,就像我们都必须喜欢、遵守的一些标准地方一样。它让我们所有人保持诚实。我认为这样做非常重要,但是,是的,不,我认为我们的目标是建立世界上最有能力的模型。现在我们专注于编码代理能力,长期工作。但你会看到,你可以免费获得很多东西。我总是说,当我们到达 SOTA 和编码前沿时,我们会更容易地说,「好吧,现在我们将痴迷于使用模型工厂为我们不那么擅长的地方添加更多数据「,比如医疗、法律或任何其他领域。同样,我认为我们所看到的,我们在推理模型中经常看到这一点,如果你让模型访问正确的知识源,并且它们具有强大的推理方式,它们就能够很好地进入它们不太了解的领域,甚至在训练数据中很少看到的领域。所以,但是是的。我们是像模型加线束组件这样的代理吗?不,我们是一家模范公司。但我认为今天的模型无法在没有安全带的情况下进行训练。这是不可能的。所以就像以前一样,容器中只有重物,现在有一个特工安全带附在上面。但我认为作为一个模范公司的代理人与真正建立代理人公司的人有很大的不同。我认为他们能做的远比我们多。
Swyx [01:08:27]: 是的。明白了。是的。我认为这是我的小阻力。如果你真的被认定为模范公司,那就为 OpenCode 做出最好的模范吧?而不是游泳池或其他什么。我认为,与目标是 AGI、为 Hermes 制作最好的模型相比,这并不是次要的。
Swyx [01:08:45]: 对吧?就像只是因为这是编码后的下一个阶段。
Eiso Kant [01:08:48]: 我看,我们正在与他们非常密切地合作
Swyx [01:08:52]: 是的
Eiso Kant [01:08:52]:因为我确实这么认为,而且,你必须关心,你必须投资它。这就是我们进行抛光并花费时间的原因。我认为随着时间的推移,是的,你是对的,你想要平衡这一点。但最终您只需要通用功能,即每个安全带中的一切都同等工作。
Swyx [01:09:10]: 就主题而言,你们对 Hermes、OpenAI Codex、NanoCodex 等做了很多工作吗?圆周率?
Swyx [01:09:16]: Pi。
Eiso Kant [01:09:17]: Pi。
Swyx [01:09:17]: 不,Pi 不同。
Eiso Kant [01:09:18]: 更多的是编码。
Swyx [01:09:19]: 是的。
Eiso Kant [01:09:19]: 不过,我不得不说,我是 Pi 的忠实粉丝。我觉得这真的很性感
Swyx [01:09:22]: 我忘了提到 Pi。
Eiso Kant [01:09:23]: 是的。
Swyx [01:09:23]: Pi,你听起来最接近 Pi 的术语——池和 Pi 的最小表面
Eiso Kant [01:09:28]: 在最小的范围内是的。
Swyx [01:09:29]: 是的。
Eiso Kant [01:09:29]: 这是因为我没有-我有一个。请允许我提出更强烈的意见。
Swyx [01:09:33]: 是的。
Eiso Kant [01:09:34]: 我已经这样说了两年了。
Eiso Kant [01:09:37]: 我认为 MCP 和工具都很愚蠢。
Swyx [01:09:41]: 哦。我们走吧。
Swyx [01:09:42]: 你支持 MCP。
Eiso Kant [01:09:43]: 我支持 MCP,我们支持工具和一切。它们对我来说完全没有意义。
Eiso Kant [01:09:48]: 等等,我会解释一下原因,我想我可能可以让人们参与这个问题。
Eiso Kant [01:09:56]: 如果你正在寻找复杂的任务,越来越长的视野,越来越复杂的任务,无论是编码还是其他什么,你都会与数据源交互,对吧?您将与安装在某种形式的虚拟机上的东西进行交互。
Eiso Kant [01:10:15]: 我们正在做的是在这些事情之间放置一层。我们将 MCP 置于两者之间,将工具调用置于其间,这比 MCP 更关乎工具调用,其中模型只需编写代码并与系统交互。我们开始看到这一点。就像 Laguna S 经常这样做。您也会在类似的前沿模型中看到这一点。他们越来越不再是「这里我们要在类似的系统提示符中填充 50 个工具「,而是「不,这是一个安装了这些二进制文件的虚拟机,您可以在其中操作这个代码库。这里是一个您可以写入的文件夹,如果您愿意的话,您的内存也可以。「该模型正在使用代码来执行复杂的请求。当它使用代码时,它不是一两个工具调用或三个链接在一起的东西。它开始使用 if 语句和 for 循环并使事情成为有条件的。所以我认为我们已经从工具调用转向有效地建模编写代码、小脚本,当你使用 Python 时你会经常看到这一点,
Swyx [01:11:15]: 代码解释器。
Eiso Kant [01:11:16]: 完全正确。就像箭头所示,在文件中写入代码。我不知道你叫什么
Swyx [01:11:21]: EOF?是的。
Eiso Kant [01:11:22]: 是的,完全正确。就像,你已经看到这种情况在模型中发生得更多,因为当你开始在 RL 中训练它们时,模型想要自由。他们希望能够以最有效的方式做他们想做的事情,而不是在他们喜欢的系统提示符中调用 50 个工具之一。所以我非常喜欢给模型一个最小的框架,尽可能最小,给它一个容器,在其中它有自己的代码库,对吧?然后,获得了一个模型代码库,可以访问 API 密钥和数据源以及所需的少量库和文档,并让它在任务中自由运行。我认为这就是我们前进的方向。我认为 12 个月后,我们将不会再看到一个包含 20、30 或 40 个工具的系统提示符。
Swyx [01:12:07]: 没有评论。那里没有阻力。我认为它将在很长一段时间内得到支持,因为现在很多人都接受了这方面的培训,但也许你们不需要在模型中支持它,继续前进。所以,但是,是的,我的意思是,如果可以的话。我确实认为,编写代码更通用,它是达到目的的一种手段
Eiso Kant [01:12:26]: 我们提供支持工具。
Swyx [01:12:27]: 是的。
Eiso Kant [01:12:27]:我们支持。这是我们进行并行工具调用的第一个模型,我们需要赶上这个模型。就像那儿一样
Swyx [01:12:32]: 是的
Eiso Kant [01:12:32]: 所以它是,它在那里,但是我,
Swyx [01:12:35]: 是的
Eiso Kant [01:12:35]: 这是个人的、挑剔的。我喜欢,我希望模型有尽可能多的自由度,就像,自由并做有能力的事情。
Swyx [01:12:43]: 是的。然后,就这样,好吧,你如何在我的 Hermes 或 OpenAI Codex 中使用 Poolsides 模型和 Laguna 模型
Eiso Kant [01:12:52]: 是的
Swyx [01:12:52]: 关于所有这些事情。因此,我通常寻找的是计算机使用或视觉。这是一个,这是一个非常大的。你们有一篇关于这方面的博客文章。但我认为持久性也是非常有价值的,还有很长的背景,你们拥有一百万个代币的背景。还要别的吗?
Eiso Kant [01:13:08]: 所以对于我们来说,看,所以对于我们来说,视觉理解是下一步,对吗?
Swyx [01:13:11]: 是的。
Eiso Kant [01:13:11]: 就像我们没有视觉理解一样。
Swyx [01:13:12]: 我想说的是
Eiso Kant [01:13:14]: 我们还没有对这些模型进行视觉理解。
Swyx [01:13:16]: 是的。
Swyx [01:13:17]:
Eiso Kant [01:13:17]: 所以这是我们已经开始努力的事情。正如我们所想,视觉理解非常重要。
Swyx [01:13:23]: 这是公司的愿景。
Eiso Kant [01:13:24]: 所以不,我们还有工作要做。这是我喜欢 Thinky 模型的原因之一,就像我滚动博客文章的两分钟一样
Swyx [01:13:33]: 是的
Eiso Kant [01:13:33]: 多重,多重
Swyx [01:13:34]: 他们非常致力于多模式,包括音频。是的。
Vibhu [01:13:36]: 它们是最先进的音频,是万亿参数的最先进的音频,而且都是从头开始训练的,对吧?
Swyx [01:13:43]: 是的。
Vibhu [01:13:43]: 从某种意义上来说没有编码器
Swyx [01:13:45]: 对我来说,那是,那是,这是你需要从头开始训练的最有力的原因之一,你只是有一个不同的标记器,你会有不同的
Eiso Kant [01:13:51]: 我完全同意,就像我在这里零分歧一样。就像,只添加模态而不放置。保持简单。我认为我们在很长一段时间内都不会接触音频。
Vibhu [01:14:05]: 名称中也有,InkLink Inc.。
Eiso Kant [01:14:08]:正确。
Swyx [01:14:08]: 是的。
Swyx [01:14:09]: 我的意思是,音频有什么难的?
Eiso Kant [01:14:11]: 这与「再次「无关,这一切都归结为焦点。
Swyx [01:14:14]: 我明白了。
Eiso Kant [01:14:15]: 对吧?就像对事物说「不「意味着有一项研究或一项计算可以取得总体进展,而我们的观点是,总体进步将来自于将这些模型推向更有能力的推理、更长期的任务的能力。我不认为音频会增加这一点。我不认为它能让我们接近通用人工智能。我认为当你接近 AGI 时,这是一种必要的方式。我认为视觉理解位于这些事情的中间。我认为视觉理解绝对可以做到这一点,但它也释放了当今有价值的能力。但这就是重点,对吧?你想要更多的多样性,你想要更多不同的基金会模型公司,他们专注于不同的事情。我认为我们就像一匹戴着眼罩的马,就像
Swyx [01:14:58]: 是的,你有你的路
Eiso Kant [01:14:59]: 我们有自己的路,我们想赶上前沿,而且,我们不想用其他任何事情分散自己的注意力。
Swyx [01:15:05]: 是的。
Swyx [01:15:06]: 我要指出的是,DeepSeek OCR 是研究的一个分支,也就是说你可以扔掉文本标记器而只拥有视觉吗?
Eiso Kant [01:15:13]: 我发现这个——我看,极客,我内心的极客就像看着这个东西,就像,好吧,看看这个,就像看看编码的位数
Swyx [01:15:20]: 但他们是对的。
Eiso Kant [01:15:21]: 我认为这非常酷,对吧?但我认为这就是我们要回到的问题。就像可能有效一样,只是它的计算效率足够高吗?是不是像我认为的那样,很多事情最终都会奏效?就像,文字有什么好处?我之前提到过,彭明和尼古拉是我的两位应用研究负责人,他们非常棒,如果没有他们和整个团队,我们就不可能取得今天的成就。
Eiso Kant [01:15:45]: 尼古拉和我多年来一直在争论,推理是否应该存在于潜在空间中?推理应该用标记来表达吗?但我认为他和我以及我们三个人都非常同意一件事,那就是语言是令人难以置信的,因为它是一种编码知识、信息和智能的极其密集的方式,对吗?如果你想一下当时 20 或 30 页的物理论文的内容,比如智力和思想的数量,以及随后生成的内容,就像在那篇 20 页的文档中,就像那些少量的比特,编码的内容太多了。其他模式(例如视频和图像)令人惊叹,但它们不具有相同的密度,例如知识或推理,或者像我们试图推动的以该模式编码的事物。他们就在那里。在很多情况下,你可以在 YouTube 上观看一场令人难以置信的讲座 50 分钟,但是,如果你将其视为数据中的视频与文本数据,对,就像信噪比一样,该模式的计算效率要低得多。所以我们有这样的观点,就像语言一样,你可以走得很远,但当你的计算、人员有限,而且它们与两者密切相关时,我认为我们可以推动语言。越多,投资就越好。但我想要所有的方式。我发现它超级酷,我喜欢 DeepSeek 和其他人正在尝试的东西。就像我可以一直转发它们一样,但在内部我们只是想,「让我们保持专注。「
Vibhu [01:17:17]: 我想说的是,你可以看到一些关于 Anthropic 的作品。 OpenAI 有很多愿景、多模态。人类只是没有,对吧? 《神鬼寓言》在图像处理方面迈出了一大步,但他们并不被称为多式联运公司,对吧?他们是语言模型编码公司,拥有多模式功能,但从来都不是超级灵活的,而且走得很远。
Eiso Kant [01:17:42]: 我看,我认为人类,我的意思是,他们做了很多正确的事情,但我认为这种疯狂的关注只是推动能力,扩大模型。我完全同意。我认为这是第一个障碍,一旦我们克服了这个障碍,我们就可以改进很多其他的事情。但与此同时,在光谱的另一端,看到人们构建这些空间模型真的很令人兴奋,对吧?也就是说,正在构建的世界模型,例如针对非常不同的用例。但我认为最终这一切都会在某个时刻融合在一起。
Vibhu [01:18:19]: 好的。所以缩放模型,这是 Laguna S 的小型。
Eiso Kant [01:18:23]: 是的。
Vibhu [01:18:23]: 你的命名很好,超小,中,大。
Eiso Kant [01:18:26]: 是的。
Vibhu [01:18:26]: 还在缩放吗?
Eiso Kant [01:18:28]: 所以新的媒介开始训练,而且它比上一个媒介大得多,昨天开始训练。所以这是一次为期 39 天的训练。和,
Vibhu [01:18:39]: 日子和事件怎么样?只是计算模型
Eiso Kant [01:18:41]: 模型工厂。
Vibhu [01:18:42]: 好的。
Eiso Kant [01:18:42]: 对吧?就像在这一点上,就像模型工厂一样,喜欢它「
Vibhu [01:18:46]: 我觉得这很有趣。因此,在 Laguna 中型和超小型中,您甚至引用了不同大小的 GPU 小时数和天数。我想,「哦,你也可以倒推到成本是多少,对吧?什么 GPU,需要多少小时「
Eiso Kant [01:18:59]: 你意识到这并不是很多。
Vibhu [01:19:00]: 不,不是。
Eiso Kant [01:19:01]: 这不是很多钱。而且,你从西方的 DeepSeek 开始,我认为那就是 DeepSeek 时刻,对吧,是人们意识到你可以在训练中花费不多的钱来训练令人难以置信的模型的时刻。但我认为这是谎言,对吗?就像训练跑步并不是最昂贵的部分。训练跑是一件很虎头蛇尾的事情吧?就像我们昨天刚刚收到一条 Slack 消息一样,「新模型正在训练,这里是链接,因此您可以按照评估进行操作「,就这样。那一刻的所有工作,就像人们如何谈论我对体育一无所知,但是,就像运动员谈论的那样,这都是准备工作,都是去健身房,然后比赛就只是一场比赛。我认为这有点像模型训练。
Swyx [01:19:42]: 是的。人们在 DeepSeek 上过度索引,接受了 500 万美元的培训,或者其他什么,对吧?就好像之前有大量的研发,基础设施已经建立起来了。是的。
Eiso Kant [01:19:51]: 确切地说,所有的东西,数据。但没有,所以 Laguna M 正在训练,是的,会有 L 和 XL,你会
Swyx [01:19:57]: 哦。
Eiso Kant [01:19:57]: 你会看到 M,对吧,M 比最后一个 M 大得多,对吧?所以这些绰号有点像我们的不同版本
Swyx [01:20:04]: 是的,他在取笑那些说小就是 24B 之类的人。
Swyx [01:20:08]: 不,所以,不。小米斯特拉尔现在已经超过 100B 了。
Eiso Kant [01:20:12]:什么?
Swyx [01:20:12]: 是的,我可以把它拉起来。
Eiso Kant [01:20:13]: 我的意思是,我们的小号,右边是 118,所以我不想说什么。就像,它「
Swyx [01:20:17]: 我的意思是,我认为也是。好的,是的,你的小号是
Eiso Kant [01:20:20]: 我们都知道,对于任何基础模型公司来说,最困难的事情就是命名。
Eiso Kant [01:20:25]: 我也不想说我们很擅长。我的意思是,这就是 Laguna S 2.1。是,是「
Swyx [01:20:32]: 但至少人们明白,中号大于小号。直到你搞砸了,就像
Eiso Kant [01:20:37]: 正是如此
Swyx [01:20:38]: 你有通行证。
Eiso Kant [01:20:38]:我们努力。
Swyx [01:20:40]: 虽然我们正在讨论命名主题,但这也将是最后的内容,但也可以
Eiso Kant [01:20:43]: 当然
Swyx [01:20:43]: 为什么选择池畔?为什么是拉古纳?
Eiso Kant [01:20:46]: 所以当我们创办公司时,它将被称为 Snowball Apps。这是在滚雪球效应之后,因为我们预计这家公司会成为滚雪球效应,这对我们来说绝对是滚雪球效应。原来这是亚马逊的商标。
Eiso Kant [01:20:59]: 我没有骗你,我的创始人的下一个名字建议是,「我们称之为 Bedrock「。所以在这一点上,就像是,「好吧,不,如果你在亚马逊工作过,你在命名事物方面就很了不起。「因此,在公司成立之初,在我们成立之前,我们参加了一家非常大的大型科技公司的年度会议,我们一直在与他们进行讨论。你必须意识到,此时的公司就是我,我的创始人,我们的首席执行官,玛格丽塔。我们知道第一个要加入我们的人。我们还没有合并。我们正在与这家大型科技公司讨论 OpenAI 微软式的交易。就像,他们将为我们提供大量计算。我们会给他们永久的访问权,很多东西。
Eiso Kant [01:21:49]: 而且,当我们参加那次会议并进行我们无权进行的讨论时,我们发现这个名称已注册商标,Snowball Labs,对吗?我们是两个还一无所有的人,但是这家大公司愿意接受我们可能与他们合作的事实。而且,我们正在讨论这个问题,是在他们的年度会议上,在公共场合,该公司的首席科学家说,「人们在这里可以听到我们的声音。就像,我们应该搬到其他地方。我们去池畔餐厅吧。「出于某种原因,我和杰森在那一刻互相看了一眼,说道:「哦。「那天晚上晚些时候,这个名字就一直萦绕在我们心头。这个词一直萦绕在我们心头,我们说:「我们把这家公司命名为 Poolside 吧。「从那时起,我们就再也没有完成那笔交易,我们用它来提醒我们永远不要放弃我们的雄心,因为那是一条容易的路。困难的部分是我们所做的,那就是开始并尝试筹集大量资金,而你们只是几个甚至不在硅谷建造它的人,他们不是来自任何已知的旋钮和类似的东西。所以每个人都假设池畔是因为 AGI,每个人都坐在池畔,这是一个有趣的名字,我们喜欢它,而且它有点不同。但这个名字就像是在提醒我们永远不要放弃我们的抱负,每当你面临这些决定时,就选择更艰难的道路。
Swyx [01:23:09]: 是的。我的意思是,那是一个很棒的故事。我知道你之前已经说过了
Eiso Kant [01:23:13]: 是的
Swyx [01:23:13]: 但我只是想要
Eiso Kant [01:23:14]:
Swyx [01:23:14]:记录在案。但这就是我第一次见到你时所做的。你告诉我,你让我坐下。你,你,我们在某个酒店里。
Eiso Kant [01:23:21]: 是的。
Swyx [01:23:21]: 你会说,「我们正在筹集 5 亿美元。「我就像。然后你给了我整个愿景,然后你就做到了。我当时想,好吧,我没有太多机会问,比如,你如何向这些类型的风投公司筹集资金?他们在寻找什么?就像,是的,模糊的 AGI,但是,就像,他们想要什么
筹集巨额资金和 AGI 投资理论
Eiso Kant [01:23:42]: 看,世界确实改变了,对吧?当我们筹集 5 亿美元的资金时,大多数投资者的谈话仍在试图解释这些模型不仅仅是随机鹦鹉,而且它们会继续下去。我已经看到 OpenAI 的世界将赢得一切,而且没有其他人可以建立公司,对吗?我的意思是,Anthropic 艰难地筹集了 5 亿美元的资金。就像,报道得很好。他们很高兴地成功了。所以我认为当我们提出这个问题时,大约是一年半前的那个时候,世界与今天有很大不同。我认为当今世界,曾经有这样一个函数,相信 AGI 是真实的人数,可能是一个,一个,一个超线性的,或者绝对是某种形式的指数函数本身。
Eiso Kant [01:24:31]:我认为这很重要,因为如果你持有我们三年前和一年半前的信念,并且我们寻找拥有同样信念的人,就像,这项技术将从根本上支撑一切有经济利益的东西,或者对未来有经济价值和科学意义的东西,那么之后的价值函数就很容易理解,就像,嘿,如果你到达那里,你就是商品之一,能够建造该商品的玩家之一。多年来,构建这种商品不仅涉及构建模型,还涉及构建基础设施和其他事物。
Eiso Kant [01:25:03]: 所以我今天想,因为人数更多了,结果已经被证明了,对吧?我认为 Anthropic 目前所取得的令人难以置信的财务成功,以及 OpenAI 和其他公司以及谷歌的增长,不再使这个问题成为产品市场契合度的问题,而几年前这确实是问题的一部分。比如,这些东西能有多大?你告诉人们,你现在在我们这个行业的收入数字是这样的,人们仍然会在房间里嘲笑你。
Eiso Kant [01:25:33]: 现在我认为这取决于世界上谁相信这将成为智力寡头垄断以及谁相信寡头垄断可以被其他公司打破。我认为这就是投资者分歧最大的地方。对于那些相信 AGI 的人来说,你会得到一个完整的层,是自我选择的基础模型公司,因为他们会说,「看,我赚不到——我在那里投入的钱,与我可以投入应用程序公司的钱相比,是非常不同的。「我认为有很多令人难以置信的应用程序公司,而且应该建立很多应用程序公司。但我确实认为我们现在仍然处于一个刚刚开始的世界——这仍然可能是谁将成为获胜者的一部分的早期阶段。在我看来,智力是世界上最需要的商品。利润和价格将更加商品化。世界需要选择,也需要选择。因此,我认为将世界视为「哦,只会有两个参与者「,我认为投资者的目光非常短视。
Eiso Kant [01:26:41]: 我认为年初认为这一点的群体比现在大得多。
Eiso Kant [01:26:46]: 我认为过去几个月已经唤醒了很多人,并说「天哪「,世界既可以使用更多的智慧,也可以,世界要复杂得多。我们应该有多种选择,更多的选择,可以关闭的东西,不能关闭的东西,那个。我认为,人们现在对模型的限制是另一个领域,对吧?
Eiso Kant [01:27:08]: 就像,我们正在进入一个模型公司说的世界,「你不被允许使用我来发展基础模型公司。「应该允许他们这样做。这是资本主义。这是他们的事。这是他们的工作产品。
Eiso Kant [01:27:23]: 但这太疯狂了。
Eiso Kant [01:27:25]: 我们对此感到很疯狂,就像,同意这样。
开放模式、民主和监管
Swyx [01:27:30]: 你对 Anthropic 说的还是白宫说的有更多问题?你正在选择两个不同的
Eiso Kant [01:27:37]: 事情
Swyx [01:27:37]: 那里的限制和限制。
Eiso Kant [01:27:39]: 看,我想我,-我会这样说。我认为,随着这项技术变得越来越强大,无论好坏,我们确实希望屈服于民主,以越来越多地解决这个问题。我认为任何一家公司做出单方面决定都是危险的。这是权力集中在少数人手中,制衡机制非常有限。而这在历史上从来没有以任何方式、形式或形式取得过良好的效果。这并不是对现有基金会模式公司的批评。这只是更多的评论,比如,我希望世界是什么样子。我认为,在技术变得更加强大的世界中,政府需要发挥积极作用,确定哪里存在真正的滥用风险,对吧?我确实认为我们需要将滥用和世界末日场景之间的安全分开,我认为没有人知道是否会发生。我认为,实际上,我认为,我很高兴看到现在在政府层面再次开始进行大量对话,试图解决这个问题。现在最终的决定是什么,也许我对此感到高兴,也许我不高兴,也许我同意,也许不同意。但最终,这就是民主,对吧?就像,在任何特定时刻,我可能对其中一个或另一个并不完全满意,但人们选择投票给某人来做出这些决定。所以我认为从长远来看,在 20 年的时间内,世界的方向是正确的,民主确实有效。至少,有句名言是这样的:「这是最糟糕的——这是所有最糟糕的系统中最好的「之类的。
Swyx [01:29:26]: 除了我们尝试过的所有其他组织形式之外,这是最糟糕的组织形式。
Eiso Kant [01:29:30]: 完全正确。就是这个。
Swyx [01:29:31]: 你总是可以指望我引用丘吉尔的话,因为我已经研究了丘吉尔很多。
Eiso Kant [01:29:35]:我喜欢这个。这就是我所希望的。现在,我确实认为我们正处于关键时刻,因此为任何人发声很重要。我认为,那些正在考虑创办自己的基金会模型公司的研究人员就开始了。那些想要分享自己的观点并敢于发声的人,如果是与他们的代表或只是在 X 上发表意见,就这样做吧。
Eiso Kant [01:29:57]: 但具体到你的观点,我认为我们现在还没有达到我们应该开始以任何方式、形状或形式限制、开放模型的能力水平。我认为如果我们这样做的话将会损害创新。
Swyx [01:30:14]: 您是否会在某个时刻改变您的观点?
Eiso Kant [01:30:17]: 是的。我的意思是,看,- 一定有。
Swyx [01:30:19]: 是的。
Eiso Kant [01:30:20]: 对吧?就像,你不能。如果你板着脸坐着说:「这可以以各种方式、形状或形式永远开放「,我认为,这就像说,相反的一切现在都需要关闭一样令人震惊。就像,我认为极端的任何一端都是我们出错的地方。
Eiso Kant [01:30:41]: 对吧?在社会中以任何方式、形状或形式。所以答案总是更加微妙,而且答案从来都不是非黑即白的。所以我认为,当我们遇到现实世界的场景时,我们必须说,「嘿,我们必须更加小心「,我们需要重新评估。如果这意味着以不同的方式训练模型并开放它,有不同的版本,有些东西是受限制的——我认为这完全没问题,因为我认为任何人都不应该不负责任。我真正想指出的是,从 2 开始,人们就一直在呼吁担心这些模型被滥用,对吧?我仍然记得,「我们不能发布 2,因为全世界都会得到「
Swyx [01:31:20]: 我的意思是,那是达里奥。
Eiso Kant [01:31:21]: 所以,这不是对达里奥的评论,这只是这个领域的一般评论。所以到目前为止我们在这方面还不是很擅长,我们需要做得更好。我确实认为,安全机构和更好的评估等正在进行的工作可能是正确的方向。
Swyx [01:31:38]: 是的。我的意思是,我想说一些话来捍卫这一点。最好在安全方面犯错误,然后再回滚,而不是相反,因为从另一方面来说,这是一个单向的决定。我认为是这样,我认为这是真的。
Vibhu [01:31:53]: 需要注意的是竞争,对吧?为了安全起见,你不会出现全局错误,对吗?你在说话
Swyx [01:32:01]: 是的,完全正确。
Vibhu [01:32:02]: 所以哦,是的
Swyx [01:32:02]: 你不能单方面保证安全,因为其他人只会比你更不安全。
Vibhu [01:32:06]: 是的,完全正确。
Swyx [01:32:07]: 是的。
Vibhu [01:32:07]: 您可以在此处暂停创新。这并不意味着它是,它在其他地方暂停了。
Swyx [01:32:11]: 他们将接管世界。太简单了。
Eiso Kant [01:32:13]: 它们是,它们是复杂的部分。
Swyx [01:32:14]: 是的。
Eiso Kant [01:32:15]: 对吧?我认为,与我们白纸黑字地讨论可用模型(无论是可用还是不可用)相比,我们更好地讨论我们可以、普遍同意和国际上同意我们想要限制或不可用的某些功能。就像,当你开始得到这些大的笼统声明的那一刻,你就开始面临这样的风险。我总是回想起我们禁止香烟广告的时候。好东西。我并不是说我反对这一点。但它实际上建立了卷烟公司的寡头垄断,因为没有其他人可以竞争。这可能是烟草业有史以来最好的时刻,但我们现在不想这样做。如果我们停下来,创新就会出现障碍,这是一个自私的评论,因为我还没有处于前沿,但这不仅仅与我有关。我认为这与该领域的每个人都有关系。你现在正在 2026 年做出决定,基于当前模型的能力,这是只有两三个公司才能构建的东西,对我来说,这读起来就像我能读到的最反乌托邦的科幻小说的第 14 章,因为从那里我认为你可以展现世界上发生的所有场景,但这些场景都不会让我对未来感到兴奋。我认为这是我们都应该考虑的事情。比如,我们想要兴奋的未来是什么?我们想要什么?我认为未来智能将成为一种商品。每个人都可以访问它。它变得越来越便宜,对吗?我认为这很重要。它可以影响世界上更多的地方,而且不是由一家公司决定其输出、打开或关闭的规模。
Nvidia、硬件和计算堆栈
Swyx [01:33:56]: 我认为比美国政府拥有更多权力的实体是 Nvidia。
Swyx [01:34:02]: 因为,就像,谁获得分配就获得计算。
Vibhu [01:34:06]: 您可以将其交给 TSMC,或者,
Swyx [01:34:09]: 下面是台积电。但我只是想测试一下挑衅性的言论,看看你是否有任何反应。
Eiso Kant [01:34:18]: 我需要考虑这一点。
Vibhu [01:34:20]: 我认为它们受到监管,对吗?比如,你可以看到政府
Swyx [01:34:23]: Nvidia 不受监管。
Vibhu [01:34:24]: 他们可以运送到中国吗?
Swyx [01:34:26]: 好吧,但他们不是中国。
Eiso Kant [01:34:30]: 看,我认为这个行业因为 Nvidia 所做的事情而存在。
Swyx [01:34:35]: 是的。
Eiso Kant [01:34:35]: 对吧?我知道他们——人们喜欢很容易地批评他们,但我也想说,我记得我们开始 Source 的时候,对吧? 2015 年发布了那篇容量文章。这一进展之所以能够发生,是因为我们能够将消费级 GPU 放入服务器中,并且它们允许我们这样做,然后,就像,你继续走得更远。所以这就像基础模型与其硬件和系统紧密相连。
Swyx [01:34:58]: 是的。
Eiso Kant [01:34:59]: 为什么我们会看到这些逐步进展的发生?我们看到它们的发生是因为下一代网络和系统的出现,对吗?在 Hoppers 上训练的模型与在 GB300 上训练的模型的区别就像万亿参数模型和五、六万亿参数模型之间的区别。因此,我认为这些东西确实共存,彼此非常紧密,我认为未来更有趣的问题将是,比如,当我们开始更多地设计这些东西时,我们如何在模型功能方面解锁什么?我们在下一代系统中看到了这一点。我认为这个世界是令人憎恶的。
Eiso Kant [01:35:42]: 就像,资本主义在尝试推动允许更多竞争的事情方面做得非常好,对吧? Nvidia 允许竞争。它不是。但如果政府说没有其他人可以通过监管有效地建立基础模型,那就大不相同了。现在,构建 Nvidia 很难吗?绝对地。建立基础模型很难吗?我认为建立一个基础模型是非常困难的。但我们应该创造一个这样的环境:如果有人明天醒来并想要这样做,他们就可以这样做,并且可以使用工具来这样做。我认为我们在围绕模型公司的讨论中看到的内容与我们在芯片公司中看到的内容之间仍然存在很大差异。
Vibhu [01:36:25]: 差距似乎还在于谁监管它的专业知识,对吗?政府中谁来决定什么是太安全、太聪明、太危险?但是,当我们提出尖锐的问题时,您最想到的有什么可以改变的吗?那么,OpenAI、Anthropic、开源模型应该吗?是开放式举重吗?我们在强化学习中所做的事情决定了你的安全屏障吗?那里有什么应该做的还是只是吐痰?
强化学习瓶颈、混合硬件和低精度强化学习
Eiso Kant [01:36:53]: 这是一个好问题。是的。让我感到兴奋的一件事是,在 RL 训练期间混合和匹配硬件,我认为我们越来越多地谈论它,我认为还没有人在做,对吗?就像,-你思考这个概念,我们在推论中看到了这一点,对吗?预填充和解码
Vibhu [01:37:15]: 是的
Eiso Kant [01:37:16]: 只是使用通用 GPU 和更专业的芯片来更好地工作,对吧?就像 Nvidia 的 Groq 芯片、LPU 和 GPU 结合在一起一样,业界有不同的版本。 RL 的批量大小受到限制,对吗?所以,就像,你最终会受到批量大小的限制,因为你没有无限的任务,对吗?当您拥有整个网络时,您可以更加灵活地扩大批量大小,因为您拥有整个网络。但对于强化学习来说,你有数百万个任务需要训练,所以你不能大幅增加批量大小,这意味着你无法使用强化学习将计算扩展到一定程度,就像你可以通过训练来扩展计算一样。所以我对任何能改善这一点的事情都感到非常兴奋。我认为开始改进的最好方法之一就是我们已经开始在推理中看到的东西,即将预填充和解码分离到不同的芯片以进行强化学习,对吗?我想我们很快就会到达那里。我认为应该有更多的人致力于这方面的工作,因为突然间我们就能够更加高效地根据挂钟时间训练强化学习。再次回到现实,这是一场比赛,对吧?比赛不是以 GPU 数量来衡量,而是以日历时间来衡量,这可能是我们现在可以加速行业发展的最大影响之一。所以从技术上来说,我喜欢探索并与人交谈。是的。
Swyx [01:38:45]: 是的,我会和 Etched 谈谈。我参观了他们的数据中心,从物理上你可以看到数据中心如何规划 PD 分解,并且你必须拥有自己的硬件才能做到这一点。
Eiso Kant [01:38:57]: 是的。不,你看,我认为——我认为这个领域的更多创新就是最酷的事情。
Swyx [01:39:02]: 是的。
Eiso Kant [01:39:03]: 所以我,我很兴奋,因为我们所有人都很兴奋。
Eiso Kant [01:39:09]: 就像,我们为什么不在发布前两周完成这个模型的后训练呢?或者不,抱歉,在发布之间,在训练之间,然后是训练 SFT,然后是发布所需的时间。我现在最大的挂钟瓶颈是 RL 时间。
Eiso Kant [01:39:25]: 对吧?这只是因为我无法进一步扩展它,因为由于批量大小限制,我无法向其中添加更多 GPU。刚刚发布的一篇非常酷的博客文章显示,强化学习的精度比我们任何人都低。我觉得这真的很酷。那么今天到底是什么日子呢?现在是 7 月 15 日,所以这是五天前发布的。我觉得这很酷。我认为,较低精度的强化学习,在保持稳定的同时,我们仍然在 FP8 中这样做,所以,我很高兴看到他们分享这项工作并将其推出。一旦我们转向 Blackwell GPU,这绝对是我很高兴能做的事情。
Swyx [01:40:05]: 但是,是的,很酷。作为开放研究的一部分,你需要获取并给予。
Eiso Kant [01:40:08]: 完全正确。是的。
Swyx [01:40:10]: 我会快速提到,有一篇论文对量化级别进行了消融,他们粗略地得出结论,四位是最佳位置。但我不记得了
Eiso Kant [01:40:20]: 这只是几年前的事,对吧?我想我记得这个。
Swyx [01:40:22]: 我想一年。
Eiso Kant [01:40:23]: 一年,好吧。
Swyx [01:40:24]: 但是,我想,好吧,也许 NVFP4 就是这样。你不能真的——比如,你能达到的最低限度是三元。
Eiso Kant [01:40:30]: 是的。
Swyx [01:40:30]: 就是这样。就像,没有那么多。
Eiso Kant [01:40:32]: 嗯,我的意思是,NVFP4 和四位之间还是有很大的区别,对吧,就什么是可能而言。但我认为 NVFP4 就其本质而言被低估了。我,我很兴奋 - 当它问世时,它只是得到额外的,比如,范围之间的权衡,
Swyx [01:40:51]: 是的
Eiso Kant [01:40:51]: 非常酷。
Swyx [01:40:52]: 几个快速结束问题。
Vibhu [01:40:54]: 我有一个快速的。
XS、S、蒸馏和模型节奏
Swyx [01:40:55]: 是的。
Vibhu [01:40:55]: 好的,快速问题回到技术方面。那么,就训练模型而言,XS 2.1 中型对于训练新的小型、通用型有什么重大收获吗?你在之前的讨论中提到了很多,好吧,在训练中,你可以挤出很多东西,对吧?您可以从网络上了解更多信息。同时,你把 30B 放大到 120B,对吗?对于多小是否太小有任何限制吗?所以我,我只是要闲逛一下。最后我会提出一个问题。但是,卡帕西论文的一部分是认知核心,对吧?我们已经看到 Vipe Thinker、Nanbase、3B、4Bs 进行了很多推理,然后,我们的想法是你将工作转移到不同的模型。这个这些都是小推理模型。那么您有没有发现任何有趣的模型大小,例如设备上 20、30B,单 GPU 上 100B?你能在那里挤出更多吗?
Eiso Kant [01:41:56]:还有很多东西可以挤出。我认为,不要做出太多的前瞻性承诺,但我认为我们也可以从 XS 尺寸中挤出更多东西。我认为我们在 S 训练期间学到了很多东西,这将使我们能够进一步改进 XS 等尺寸。我认为从那时起我们已经学到了一些可以让 S 变得更好的东西。我认为我们还有很多空间可以将模型挤出更小的空间。我不认为这是反对扩大规模的理由。顺便说一句,我认为这是一件好事,对于较小模型的训练后配方并尝试将其应用于更大的模型,这确实没有多大帮助。
Vibhu [01:42:38]: 是的。
Eiso Kant [01:42:38]:只是,在所有情况下,你都必须重新考虑大部分食谱。但是,将较大模型应用于较小模型的后期训练的秘诀几乎总是非常好的,例如改进和基线。你仍然可以对其进行更多调整,但我认为这不一定是显而易见的。因此,一旦您使较大的模型变得更好,您通常会拥有一个快速杠杆来再次快速改进较小的模型。但我们能否从更小的模型中榨取更多的东西呢? Laguna S 给了我很大的信心,我认为我们可以。我认为这是围绕我们之前进行的讨论的,它是关于行为,不一定是原始智力,你试图改进模型。
Vibhu [01:43:23]: 这是在所有轴上,就像一个模型推理多长时间的轴,那么它能保持代理多长时间,然后还有效率,对吧?理想情况下,你想同时推动两者。需要澄清的是,你们现在没有做的事情是蒸馏,我们在 Frontier Labs 确实看到了这一点,对吗?你有一个大模型,但你并没有真正交付给用户,你提供的推理内容通常是从中提炼出来的,这会给你带来相当多的收益,对吧?
Eiso Kant [01:43:50]: 看,我认为,这是我们现在不做的事情,因为,为什么我们也在构建这些模型,对吧?这些模型对我们来说是我们研究道路的一部分。因此,Laguna Medium 比我们发布的最后两个模型大得多,我们过去训练过更大的模型。因此,存在工程组件,例如更大的模型和每个数量级的尺寸,您将在稳定性训练中学到新东西。但在较小的模型尺寸下,您可以更快地迭代,就像在内部一样,对吧,您的研究。因此,对我们来说,简化为较小的模型并不能达到目的。这些模型是。这不是正确的术语,但对我们来说,它们是双重用途的模型。它们是我们衡量的进步,看看我们在模型工厂中是否有所改进,以及向世界推出的东西。这就是我们不这样做的原因。我们已经完成了蒸馏实验,你可以做一些非常酷的事情,我认为如果你有大量的用户数据,那么,你可以在这方面走得更远,对吧。但我认为从头开始快速训练模型是有道理的,这样你作为一个研究组织就可以吸取教训而不是等待。这是我们多年来学到的重要教训之一,当时我们曾经有很多
Eiso Kant [01:45:09]: 模型训练之间的节奏更长,比如六个月,我们会训练一个大模型,等待六个月,训练另一个更大的模型。你会混合如此多的改进变化,当你训练下一个模型时,它有点像汤,你真的不知道是什么成分导致了结果。因此,当您更频繁地训练模型时(无论是后期训练还是从头开始训练),您都更能够了解导致改进的原因。我认为这很重要。就像,最终,我们都静止了。对于大型语言模型的深度学习,目前还没有真正的科学。但我认为,我们都在试图从我们的实验中获得见解,因为正是这些见解导致了缩放定律,导致了改进,使我们能够再次提高计算效率并获得更多功能。
Swyx [01:46:02]: 是的。惊人的。我本想以更多的历史来结束。您花了一些时间查看工程团队生产力的指标。您如何看待当今工程团队的生产力?
代理时代的工程生产力
Eiso Kant [01:46:14]: 我的意思是,这很狂野,对吧?我的意思是,这就像黄金时代。事实上,你可以通过通宵等待代理完成工作来提出一个想法并构建一些东西。
Eiso Kant [01:46:26]:我不知道。到
Swyx [01:46:27]: 比如,你如何测量时间。
Swyx [01:46:28]: 因为你确实在理论中
Eiso Kant [01:46:30]: 是的。
Swyx [01:46:30]: 你正在这样做,对吧?
Eiso Kant [01:46:32]: 看,我认为这是一个很好的问题。这是我很长一段时间没有思考过的问题。
Swyx [01:46:36]: 但是,你有资格——你很有资格做到这一点。
Eiso Kant [01:46:38]: 不,我要去。 - 不,这是一个公平的观点。让我花点时间考虑一下。归根结底,什么是代码、什么是软件、什么是工程,就是从对最终用户或一组最终用户有价值的东西(例如一个想法、一个额外的东西、一个错误修复、一个功能)到交付该价值。我认为我们正在做的事情是让这些模型变得更有能力,我们非常喜欢,既消除了中间商,又压缩了交付该价值所需的时间。最终,对于任何初创公司或任何公司来说,迭代周期都是让你获胜的关键,对吗?如果你能够在两小时内解决一个错误,而不是让它在待办事项中停留三周,如果你能够,比如,在客户电话中学习,嘿,如果这个功能存在,他们会愿意支付更多,这对他们来说更有价值,你可以在一周内而不是一个月内交付它。所以我认为最终,也许我们几年前在法学硕士中看到的同样的东西仍然适用,这只是周期时间的概念。但在这种情况下,这是从您想要为某人做一件有价值的事情到将其运送给他们的那一刻起的交货时间。所有其他指标最终都是该滞后指标的领先指标,对吗?如果你查看大量的代码、PR、评论以及所有这些东西,那并不重要。因此,我认为在这种情况下,我们开始在其中一些事情上采取如此迅速的行动,以至于我们可以坐下来看看传统上滞后的指标。我们只是将其命名为从传统的票证到最终结果的交付时间。我在这个新世界中看到的,也许我们以前没有想到的是,一个人可以用它做多少事情,
Eiso Kant [01:48:22]: 对吧?最重要的之一是,如果你看看人工智能本土公司,你会发现它们的设计并不像法学硕士时代的工程组织。它们通常只是由建造者设计的,对吗?以及尽可能贴近客户的发货能力。中间不一定有一个庞大的团队坐在那里。我认为这是令人兴奋的,就像单个 IC 可以更接近这一目标的组织一样。因此,我会关注从价值确定到发货的那一刻,以及有多少人参与其中。你希望参与其中的人数更少,并且你希望结束的时间更短。
Swyx [01:49:05]: 好的。当你采访某人时,有没有办法评估这一点?
Eiso Kant [01:49:12]: 噢。
Swyx [01:49:13]: 因为也就是说,
Eiso Kant [01:49:14]: 看,
Swyx [01:49:14]: 最压缩的版本。
代理、约束和高影响力团队
Eiso Kant [01:49:17]: 我认为对此的常见答案是代理。
Swyx [01:49:20]: 是的。
Eiso Kant [01:49:20]: 一个人有多少能动性?我认为在人工智能变得越来越强大的时代,代理可能成为任何人最重要的品质之一。我认为代理是你可以在人们过去所做的事情中寻找的东西,因为代理是如果你拥有它,你就会展示它,对吧?没有人只有代理权,却袖手旁观而不去行使它。它的整个定义就是它被行使。因此,要了解人们在生活、职业和个人项目中所做的哪些事情显示了能动性,以及你的个人背景故事显示了可笑的能动性。
Swyx [01:49:56]:哦,亲爱的。
Eiso Kant [01:49:58]: 就像,我认为最终就是这样。这是硅谷,在过去的一年半左右的时间里,你可以随心所欲地做事,对吗?
Swyx [01:50:06]: 是的。
Eiso Kant [01:50:07]: 那-我想这就是你要找的。
Swyx [01:50:08]: 我认为协调高级机构人员非常困难,因为他们都想走自己的路。这就是重点,对吧?
Eiso Kant [01:50:15]: 他们 - 是的,但我认为这个概念 - 就像,我认为组织中一个好的领导者的概念是能够将人们聚集在一起,就像一个共同的结果。我认为你想与任何具有高代理能力的人一起做的事情 - 我感到非常幸运,我拥有一个拥有令人难以置信的高代理人员的组织。就像,我的意思是,我不是构建模型的人,对吗?我怎么强调都不为过。就像,正是这个团队实现了这一目标,而且这是一个具有令人难以置信的高代理能力的团队。因此,如果你看看,需要什么才能将它们结合在一起,它最终是一个共同的目标和一组共同的边界。因为如果你允许「你可以做一切「,你就会成为一种探索算法。这就是我们在大型科技中看到的,对吧?在研究中,在大型科技中,一切都是探索算法。每个人都可以做任何事,只要 - 然后收集资源就变得政治化了。所以当你说「这是我们的共同目标,这些是我们设定的界限「时,对吧? 「我们不是多式联运。我们专注于强化学习。「就像,我们做这些事情,你在人们加入公司之前就与他们提前沟通,你得到了很多代理权。你可以跑到你想去的地方,但这些是我们要跑的地方
Swyx [01:51:24]: 是的,车道
Eiso Kant [01:51:24]: 这并不意味着——这是车道
Swyx [01:51:25]: 是的
Eiso Kant [01:51:25]: 这是有道理的。我认为它可以充分发挥人们的潜力,因为创新来自于限制。
Eiso Kant [01:51:34]: 与其他一些人相比,我们用相对较少的计算和相对较少的资金来做到这一点。我最近回想了很多,并认为这是一件好事,因为这些限制迫使我们在某些其他方面变得更好,而其他方面可能没有,对吗?我们购买的外部数据相对较少。
Swyx [01:52:01]: 我正想问这个。是的。
Eiso Kant [01:52:02]: 完全正确。这是一个限制。但这是一个限制,促使我们在其他领域进行改进。类似的,还有很多版本。所以我认为高层人士,你想要赋予他们权力,你想让他们对自己正在做的事情感到非常兴奋,但你也想说,「嘿,如果你加入这个使命,这就是我需要你实现的结果。但这些是我们不会去的地方,也许如果你关心这些地方,那就去别的地方吧。「
Swyx [01:52:26]: 是的。伟大的。最后一次行动呼吁,您要雇用谁?
招聘、影响和结束
Eiso Kant [01:52:31]: 我们正在公司招聘应用研究和工程方面的所有可能的职位。所以从
Swyx [01:52:36]: 是的
Eiso Kant [01:52:36]: 一直训练到评估训练后架构。就像,我们仍然处于一个个人可以产生巨大影响的世界。我认为我们加入我们的理由是——我们谈论了很多关于使命、我们如何看待事物的问题,但我认为我们是个人影响力比例最高的地方之一,对吗?不到 70 人建造了这个模型。工程人员和研究人员共同完成这项工作的人数不到 115,这是一个非常宽泛的定义,因为我把自己列入了 115 名名单中。
Eiso Kant [01:53:08]: 因此,能够在你所认同的使命上完成这项工作,并且你可以做到这一点 - 每个人仍然具有巨大的影响力。我认为
Swyx [01:53:18]: 并且能够发布、能够打开
Eiso Kant [01:53:20]: 它「
Swyx [01:53:20]: 开源模型。
Eiso Kant [01:53:21]: 是的,看,所有这些都是其中的一部分。但我认为最终,当你今天可以选择加入一家非常大的基础模型公司时,但你是众多公司之一。
Eiso Kant [01:53:35]: 并不是他们的任何错误,而是根据定义,分母变得非常大。我们的分母非常小,因此您所产生的影响力非常高。我认为最终我们所有人,我所认识的最令人难以置信的高级代理人员,他们正在优化什么?他们正在优化影响力。他们正在优化影响力,我是否与使命保持一致?如果今天您听说了我们的使命并达成一致,并且正在优化影响力,那么我认为我们是一个非常好的加入场所。
Swyx [01:54:05]: 好的。
Eiso Kant [01:54:05]:太棒了。
Swyx [01:54:05]: 我想我们到此结束。这是一个很棒的声明。四个小时的睡眠,你的表现非常出色。
Eiso Kant [01:54:11]:谢谢你们,伙计们。
Swyx [01:54:12]: 所以,播客评估,绝对获得批准。
Eiso Kant [01:54:14]:欣赏它。我真的把它写下来了。我的眼睛开始像这样。我就像,「唷。「
Swyx [01:54:17]: 我们会让你走。我们会让你回去。
Eiso Kant [01:54:19]: 很高兴见到你们。
Swyx [01:54:19]: 感谢您的设置。我们想加入这个,因为我们认为这是一个很棒的模型。
Eiso Kant [01:54:23]:欣赏它。
Swyx [01:54:23]: 我认为这是一个很棒的故事。谢谢。

相似内容

评论

登录后可发表评论。