这期 Cognitive Revolution,Flo Crivello 把一个很具体的产品发布,讲成了一个更大的组织问题:AI 什么时候不再是一个工具,而开始像一支团队?
他谈多人 Agent、记忆、缓存、DeepSeek、AI 原生组织,也谈一个足够刺耳的判断:他会支持在美国禁用中国模型。
AI 科技评论注意到,这期真正值得留下的,不是某个产品名,而是三条正在同时发生的变化:Agent 开始共享工作空间,记忆开始变成后台基础设施,模型选择开始变成国家安全与商业责任问题。
嘉宾:Flo Crivello
Flo Crivello 是 Lindy 创始人兼 CEO;在创办 Lindy 之前,他创办过 Teamflow,并曾在 Uber 担任产品经理。1
Lindy 官方招聘页显示,他当前的公开职位是 CEO,Lindy 成立于 2023 年。2
按节目顺序:这期到底讲了什么
01|先把 Agent 放进团队的公共空间
Lindy Teammate 的产品形态,不是再做一个只和单个用户对话的聊天窗口,而是把 AI 员工放进公司的 Slack。
Flo 的判断是,下一阶段的关键不只是「一个 Agent 能完成多少任务」,而是多个 Agent 能不能在同一套团队上下文中工作:看见彼此的产出、共享历史、理解权限,也知道哪些信息不能被随便复述。3
这里的「多人」不是简单地把几个机器人并排放在页面上。
更像从互相发送 Word 文档,走向共同编辑一个 Google Docs:状态是共享的,修改是连续的,协作关系本身也成为产品的一部分。
AI 员工真正的门槛,不是会不会调用工具,而是能不能进入一套有边界的社会契约。
02|记忆不是数据库,而是一个持续运行的 Agent
Flo 反复强调,记忆不该只是把旧聊天记录塞回上下文。
Lindy 的做法是让一个记忆 Agent 在后台持续工作:整理、压缩、判断哪些信息值得长期保留,再在需要时把相关内容取回来。
他把这个过程叫作「napping」,而不是「sleeping」——因为记忆优化不必每天只发生一次,它可以持续发生。
这个设计带来的变化是:前台 Agent 不必每次都从一张越来越长的聊天记录里寻找答案,后台系统可以提前把上下文整理成可检索的记忆单元。
节目中还谈到一种极端的检索设计:用户几乎只需要再经过两次 LLM 调用,就可以访问数万个上下文桶,每个桶里又有很大的 token 容量。这个数字来自 Flo 在节目中的口述,官方稿件本身也提示其为自动生成记录,应把它当作设计思路而不是经过独立审计的产品规格。3
03|可靠性:先让系统怀疑自己
当 Agent 开始替人做事,最贵的错误往往不是「不会」,而是「看起来已经完成了」。
Flo 谈到 validators 和 LLM-as-judge:在关键动作后再加一道检查,让系统重新确认「你确定吗」。
问题是,验证器本身也会增加调用次数和成本。
因此,可靠性和缓存必须一起设计:能复用的结果要缓存,真正变化的部分才重新验证,不能为了多一层安全感把整个系统重新跑一遍。
Agent 产品的成本,不只在第一次生成答案,也在每一次确认答案是否值得相信。
04|Slack 数据越多,记忆越像基础设施
多人 Agent 要理解团队,就必须处理大量历史数据:消息、会议、文档、任务和工具调用。
但「把所有数据都塞进上下文」既昂贵,也会让检索变慢。
Flo 的讨论集中在几件事:如何把数据拆成可管理的上下文桶,如何通过缓存降低重复读取的成本,如何让 Agent 只取当前任务真正需要的部分,以及如何让记忆更新不破坏原有的检索路径。3
这也是多人系统和单人系统的分水岭:共享状态一旦成为瓶颈,Agent 数量越多,系统不一定越聪明,可能只是越拥堵。
05|别把所有基础设施都自己造
谈到文件系统、沙箱、浏览器和可观测性工具时,Flo 的偏好很明确:能买就买,除非自建能形成真正的差异化。
他看好软件基础设施创业公司,因为模型能力越来越容易被调用之后,真正难的是把运行环境、权限、缓存、评测和追踪做成稳定的系统。
这不是「买工具」对「自己研发」的简单二选一。
更现实的问题是:哪一层是公司的核心学习曲线,哪一层只是重复建设。
06|公司正在进入 Centaur 时代
Lindy 目前最好的想法,往往来自人和 AI 的共同创作。
Flo 把这叫作 Centaur 时代:人负责提出方向、判断取舍,AI 负责大量探索和执行。
但他并不认为这个阶段会一直持续。
当 AI 系统越来越优化,人类可能不再是增益,而会变成噪音。
在公司的日常运营里,这个变化已经先从「人审机器」变成「机器审机器」:他们几乎不再人工逐个 review PR,而是让 Agent review PR;人再去 review 负责 review PR 的机器。
AI 科技评论认为,这里最重要的不是「人会不会被替代」这句空话,而是组织的反馈回路正在换手。
人类未来更像是给自动化系统补洞的人,而不一定是每一步的执行者。
07|AI 原生组织,不是把旧公司套上 Agent
节目还谈到 AI 原生组织和传统公司之间的差异。
很多公司会先保留原来的岗位、流程和审批,再在旁边加一个 Agent。
这就像给旧房子接一根更快的水管,水流变快了,但房间的布局没有变。
Flo 更期待的,是围绕 AI 的能力重新组织工作:Agent 直接进入团队协作,系统拥有持续记忆,流程可以被后台任务不断重写,人的角色则从执行转向定义目标、处理例外和承担责任。
08|开源模型的现实:更便宜,也更复杂
Lindy Teammate 的一个关键背景,是它在与 Claude Tag 竞争的同时,使用了 DeepSeek。
Flo 谈到 DeepSeek 的吸引力:价格低、能力接近前沿模型,而且在缓存损失之后仍然可能显著便宜。
他还谈到模型家族之间的差异、GEPA 这类提示词重优化方法,以及何时应该微调、何时应该先把提示和评测做好。
他的结论更接近工程判断,而不是模型崇拜:不要因为模型名字有光环,就忽略真正决定系统成本与质量的缓存、评测、数据和工作流。
09|为什么 Flo 主张禁用中国模型
节目最后的争论最尖锐。
Flo 认为,来自中国的模型可能带来蒸馏、审查偏差、Agent 级别的外溢能力,以及对美国关键系统的长期风险;因此,他会支持在美国禁用中国模型。
Nathan Labenz 明确反对直接禁令。
他的反驳包括:消费者和企业的选择权、美国需要竞争者保持活力、不能轻易把对手赶出市场,以及未来 AI 能力控制与国际协调都可能需要中国参与。
双方最后讨论了一种折中:不直接禁止,而是要求销售 AI 服务的公司承担保险或认证责任,把模型风险定价,而不是把所有风险压成一条国籍红线。
这一段没有给出一个共同结论。
这恰恰是它有价值的地方:模型选择已经不是单纯的价格与效果比较,而是产品责任、国家安全、市场竞争和国际协调的混合决策。
给创业者和投资人的三张检查表
- 共享状态在哪里? 如果 Agent 之间没有可靠的共享工作空间,多 Agent 可能只是多份孤立的上下文。
- 记忆谁来维护? 记忆需要后台更新、检索、压缩和失效机制,不是简单地把聊天记录保存下来。
- 风险由谁定价? 便宜模型的真实成本,可能出现在合规、供应链、数据泄露和责任承担上。
本期官方单集页提供了完整逐字稿、章节和节目入口;官方稿件同时注明,逐字稿为自动生成,可能出现措辞或说话人识别误差。3
逐句全文翻译
以下内容按官方逐字稿的时间顺序逐句翻译,仅保留中文译文;原稿为自动生成稿,官方提示其中可能存在措辞或说话人识别误差。
开场
【00:00】 您好,欢迎回到 Cognitive Revolution!
今天,我正在与 Lindy 的创始人兼首席执行官 Flo Crivello 进行交谈,因为他正在推出 Lindy Teammate,一名 AI 员工将加入贵公司的 Slack。
这当然是与 Claude Tag 直接竞争,而且非常值得注意的是……在 DeepSeek 上运行。
即便如此,Lindy 至少正在补贴入职,并且本次对话的前半部分非常深入地探讨了这些代币的去向。我们讨论多人游戏的细微差别,他们如何看待围绕历史数据的社会契约,以及他们如何使用提示来强制执行它,再加上很多关于内存实现和他们用来持续优化内存的后台处理。他对相关文献的掌握自始至终都是显而易见的。
我们获得了针对文件系统和沙箱的供应商建议,并讨论了为什么 Flo 更喜欢在他能购买的地方购买,并且看好软件基础设施初创公司。
我们还谈论了 Lindy 现在 Lindy Teammate 的生活,以及他如何看待 Lindy 和所有前沿 AI 系统,作为在大多数方面的超级智能,仍然以某种方式选择每天多次步行去洗车场。
目前,我们正处于 Centaur 时代 – Lindy 的最佳创意通常是人类和 AI 共同创造的,但 Flo 认为这将是暂时的,不久之后人类就会为高度优化的 AI 系统添加噪音。
这是美好的世界,因为正如 Flo 所说,鉴于 OpenFace 和类似事件:“现在是 2026 年 7 月,我们拥有 AGI,我们正在起飞,但我们还没有找到对齐方式。”
我们就 AI 公司的朋友和熟人如何感到恐慌交换了意见,在最后一节中,我们讨论了弗洛非常令人惊讶的立场,即……中国模特应该在美国被禁止。
到目前为止,我绝对不同意,我们对各种争论进行了友好的来回讨论,他最终似乎愿意在一些更像是对销售 AI 服务的公司的保险要求方面达成妥协,这将使我们能够对中国模型的风险进行定价,而不是彻底禁止。
我不得不说 - Flo 是 1 of 1 - 在过去 3 年冲刺通用 AI 助理产品竞赛之后,他对 Lindy 的工作原理非常开放,并且他对他关心的每个问题都非常坦诚。
它与 Lindy 的创始人兼首席执行官 Flo Crivello 进行了一场有趣的对话,内容涉及多人游戏 AI、机器内存,以及在您希望禁止的模型上建立公司的令人不安的政治。
正片
【02:56】Nathan Labenz: Flo Crevello,Lindy 首席执行官。欢迎回到认知革命。
【03:01】Flo Crivello: 谢谢,
【03:01】Nathan Labenz: 莱森。
【03:02】Flo Crivello: 总是
【03:02】Nathan Labenz: 一个
【03:02】Flo Crivello: 很荣幸来到这里。
【03:03】Nathan Labenz: 我对这次谈话感到很兴奋。您在 Lindy 上得到了一些重大消息,新产品的发布正是这次对话的契机,但显然,当谈到 AI 指数时,我们也处于其中。因此,随着时间的推移,我认识了您,您对一系列非常关键的 AI 问题直言不讳,随着我们深入对话,我绝对想深入探讨这些问题。但让我们从您正在做的事情开始。 Lindy 现已再次进化。几年前,我们开始使用智能 Zapier 工作流程软件。已经发生了多次重大演变。我也绝对想了解的是您最近发布的关于改变模型组合并稍微远离美国专有模型并拥抱更多开源并节省大量资金的文章。但现在最大的演变是,Lindy 是 AI 的完整员工,并且它将像您所有其他队友一样在 Slack 中可用,无论他们是人类还是代理。告诉我们有关新的大型发布的信息。是的。你知道,从,
【04:08】Flo Crivello: 就像,开始吧,我们一直在追寻 AI 员工。我确实认为我们开始追求这一目标的时候还很早,比如三年前,现在我认为它基本上已经到来了。我想,我们今天发布的产品叫做 Lindy Teammate。它是一名 AI 员工,居住在您的 Slack 中,连接到您的所有工具,积累整个团队的上下文。它真的就像一个团队脚手架。我认为,AI 现在正处于向多人游戏体验迈进的过程中。我将其与您进行比较,也许您会记得,例如,我们过去常常通过电子邮件相互发送类似的文件,您知道,带有修订等内容。而且,你知道,我比较了多人游戏和单人游戏 AI 之间的区别,就像互相发送轮子到文档和 Google Docs 之间,就像一个实际的共享文档。如果您确实希望您的 AI 成为队友,您的代理成为团队的实际成员,例如,您希望它成为您团队协作的地方,即 Slack。您希望它拥有关于整个团队的自己的共享上下文、自己的共享内存。您希望每个人都能够与同一个代理交谈和协作,而不是现在,就像我们都在同一个会议室里,并且我们都在交谈。然后,每当我们中的一个人想要与公司最重要的支持者(AI 代理)交谈时,我们就必须离开房间然后再回来。你知道?这就是我们正在研究的,比如新的多人游戏体验和多人游戏支架。
【05:27】Nathan Labenz: 我认为,很多角度都很有趣。首先,它是如何登机的?正确的?随着时间的推移,公司在员工方面投入了大量资金。是的。我自己用自己的深层背景完成了这件事,这是我今年早些时候偶然发现的,它对我很有帮助。但这对我来说更容易,因为这只是我的东西,我拥有这一切,我真的不必担心人们对隐私的期望,因为我将成为它的唯一消费者。当你进入多人游戏模式时,现在我想,哦天哪。你有不同的频道,不同的人聚集在一起,也许其中一些频道是私人的。也许其中一些是公开的,但也是私人的。那么从程序上来说,如何吸收所有信息呢?它是如何存储的?然后在社交层面上,您在多人游戏环境中发现了哪些棘手的考虑因素?
【06:21】Flo Crivello: 是的。这是一个很好的问题,这恰好触及了我们一直困扰的问题,即我确实认为,随着我们的努力,我们正在走向通用人工智能,而且我们现在可以说已经拥有了通用人工智能,相对而言,智能实际上越来越不重要,而背景却越来越重要。我经常认为,看,你知道,历史上最聪明的人之一是 John von Neumann。正确的?如果您想让 John von Neumann 神奇地出现在办公室的您旁边,那么在接下来的一个小时或一天内,这个人对您的用处将不如您随机的同事。正确的?这是因为上下文。因为你就像,你有工作要做,而且,你没有时间加入 John Vuitt Neumann。你知道?他没有上下文来阅读它。所以你就像,嘿。就像,我爱你。我真的很想和你谈谈,但现在,我要和这个人谈谈,因为我有一件重要的事情要做。因此,我确实同意背景非常重要,而且我认为这是令人惊讶的时代之一,实际上,代理在入职方面比人类更好。这不应该再让我感到惊讶,但它总是如此,因为你总是在这样的假设下进行操作:哦,你知道,我们还没有通用人工智能,所以,显然,人类会变得更好。但他们不是。其原因是因为很多时候,公司雇用人类员工的主要方式之一是他们的维基百科。正确的?有,比如,面对面的入职会议和所有这些东西,但有很多书面文档。 众所周知,书面文档一旦写出来,就已经过时了。因此,我们构建的是这个共享上下文层以及我们所说的水化系统。所以,基本上,它的运作方式是你注册 Inditimate。您连接您的工具。所以,你知道,无论如何,连接你的维基。就像,那会有所帮助。你知道?例如,Confluence、Notion、Google Docs 等等。然后你连接最重要的,即 Slack,因为那是真正的知识所在。只是这只是一团乱,但特工们并不介意这些乱七八糟的事情。那么我们所做的就是抓取你的整个 Slack,并基于文件系统构建一个知识图谱。也许在那之后我们就可以进行嗡嗡声和编辑。这就是它的样子。当你加入 Indi 后,她立即开始学习。所以你可以在这里看到,这是在开始注册后十秒内,她仍在学习。就像,这里,就像,右边的图表仍然是有限的。她告诉我,这就是我对你的了解。而且效果出奇的好。然后右边的图表不断增长、增长、增长。重要的是,该图有两层,其中有一个个人层,还有一个工作区层。因此,您可以随时进入 Lindy 中的文件系统。这是新的 Lindy。你点击文件,它就会汇集这些记忆
【09:07】Nathan Labenz: 文件
【09:07】Flo Crivello: 这里有一堆参考文件支持。这一切都是由团队代理在后台自动维护的。因此,希望这能回答您关于如何做到这一点的问题,因为有些频道是公开的,有些频道是私有的,有些文档是公开的,有些文档是私有的。它的工作原理是有这种记忆剂。我们称之为小睡,而不是睡觉。所以,就像,它每隔十五分钟运行一次。比如,为什么你需要每二十四小时睡觉一次?因此,它只是在后台持续运行,并且任何公开的内容都会更新团队文件系统和团队内存。任何个人的和私有的东西,它只是更新每个人的文件系统。最后,它会整理所有这些内容,我们与队友交谈的代理会使用所有这些上下文并爬行整个文件系统。因此,为了实现这一目标,我们必须解决很多技术挑战,因为它积累的上下文就像数百万个代币,您无法每次都添加所有这些代币。这就是我们必须弄清楚的一件事。
【10:07】Nathan Labenz: 是的。有趣的。我将分享一些关于我偶然发现的事情,你告诉我你学到了什么,这可能会更好。首先,只需连接到所有工具并获取导出。我发现在我尝试编写的个人导出启发式中经常遇到一些有趣的边缘情况。有一次我有一个启发,我发送的电子邮件越长可能越具有实质性,我一定会确保捕获这些邮件。但后来发现,在那些权力排名的最顶部通常是我从 LLM 中复制出来的东西,并发送给某人,通常在顶部有一条消息。这是我从 Claude 得到的或者你有的。但现在很奇怪,根据这个启发,这篇 Claude 文本是我写作中最有分量的文章之一。随着时间的推移,我遇到了很多这样的事情,并且遇到了这个特殊情况。是的。我想也许有一个问题,就像当你盲目地进入一个新组织时,他们和我们记录是另一项权利。在我公司 Waymar 的 Slack 频道中,我们已经将各种日志一遍又一遍地移入 Slack。你如何处理你如何识别这些特殊的特殊情况,这些事情可能会压倒或淹没或误导他们到达
【11:22】Flo Crivello: 真正的好东西?这是一个很好的问题。我认为我们解决这个问题的主要方法是内存由代理本身维护。我认为这就是为什么我最终非常看跌抹布作为一种方法,而我非常看好这种代理管理方法,因为你有一个拥有自己记忆的实际代理。所以你有一种元记忆并且理解它正在看什么。通过一点一点地积累有关组织的知识,组织对于真正重要的事情会变得越来越聪明。它实际上有点类似于训练模型,因为,就像,你知道,如果你要将有毒数据插入到模型数据集中,就像,嘿。你知道?就像,我不知道。达斯·维德是一名女性。你知道?就像,它会获取数据,但它会被所有正确的数据淹没。你知道?所以在这里,也是一样的。就像如果你有足够的记忆,如果你将其提供给一个能够理解它的系统,如果系统最终能够理解,那么你使用的非常具体的例子实际上是我们已经看到记忆代理采用的紧急行为,因为记忆代理有自己的记忆。所以这是一种元记忆,关于我如何管理我的记忆,哪些信息来源重要,比如,你知道,所有这些,以及哪些是值得信赖的等等。 我们注意到,内存代理第一次抓取它发现的 Slack 时,其中一些通道,例如组织拥有它们,例如,那些,例如,日志通道,并且它学会了忽略它们。就像,我不会,我不会继续在这些频道上花时间。那里没有什么值得我学习的。说这对我们来说至关重要,一直在作为这个系统中的一等公民来组织会议。就像,我确实相信会议作为信息来源被严重低估了。它们就像 90% 的关于该公司的最新数据。就像,公司内部所有重要的事情都有一个围绕它的会议。每段关系、每一个项目、每项倡议、每件事都有一个围绕它的会议。所以我认为,那些多人身份系统无法真正实现像薇诺娜这样的会议。就像,我认为你必须将它真正纳入你的系统中。所以我们所做的是,你知道,我们打造了一流公民。我们有会议。现在是林德的一等公民。最重要的是,这又像是,它不仅仅是格兰诺阿麦片,你知道,哦,它正在记录你的会议等等。你可以做所有这些事情,但它不仅限于此,它还可以将这些会议提供给你的记忆代理。现在,如果会议是公开的,我们可以设置会议文件夹,它会自动添加会议。它是一个会议文件夹,会自动将会议添加到自己的文件夹中并与整个团队共享。 然后它总结了这些文件夹中的所有会议。而且,如果会议被添加到与整个公司共享的公共会议文件夹中,那么它就会与团队的网络进行辩论。因此,它会不断更新该上下文,现在您可以与它聊天,就像公司每次会议中出现的图像一样。您可以聊天,就像整个会议语料库一样。您可以说,客户在说什么?比如,最大的要求可能是什么?就像,你知道,关于这个和那个功能的反馈是什么
【14:45】Nathan Labenz: 因此,这带来了另一个有趣的挑战,我再次遇到了一些困难,至少现在是一个解决方案。我非常有兴趣了解您对向后看和向前看的观点的看法。问题是,在我广泛的一般背景下,有很多东西可能不应该与其他人分享。正确的?嗯。有时它是敏感的、自白的、一个人对另一个人的看法,诸如此类。正确的?所以我实际上为我自己的 Wiki 创建了它的两个版本。其中之一是我认为我已经开始使用我的主笔记本电脑,我将工作作为我自己的延伸和第二大脑类型的东西。所以这个东西并不是自主地承担项目并与它们一起运行。它只是做我告诉它做的事。它有完整的维基百科,其中包含所有八卦或其他内容。老实说,我没有那么多超级敏感的东西。我不想让它听起来比实际情况更戏剧化。但是,尽管如此,人们并没有想到,当他们告诉我一些事情时,可能是通过电话、电子邮件或私人 Slack 消息,这些信息会进入一个现在要与世界对话的特工的某个中央存储库。是的。所以那个只适合我。我对其进行了检查并使用启发式创建了一个版本,该版本适合一个人告诉人类助理。那种仍然是私人的,但更面向公众的维基,我的人类助理可以拥有你的电子邮件和电话号码。正确的? 但它可能并不适合我们在那里进行的每一次对话的每一个细节。当你吸收所有这些历史信息时,你如何思考什么应该和不应该在记忆中,以便它应该被分享?你可以分开,就像组织现在要如何改变一样。因为我认为这一切都可能实时重写社会契约。所以,但我认为对之前发生的一切的应用或一种策略,但答案可能是,比如,未来的新社会规范。我也想听听你对此的看法。是的。
【16:52】Flo Crivello: 这在团队内部引起了激烈的争论。已经有两个营地了。坦率地说,有一些阵营,我就在那个阵营中。好像只有两层记忆就足够了。正确的?因此,有公共团队层,然后是私有层,私有层包含所有内容,公共层包含私有公共的内容。团队中的一些成员也一直在说你一直在说的话。就像,他们一直在说,就像,不。事实上,即使是我的私人层,我也不想包含太多东西。我想要一个超能力的私人等级。就像,然后他们会尝试整个事情。例如,如果我们定义了多个内存气泡并且用户可以编辑它们怎么办?我想,这听起来有点过分了。因此,老实说,我们以及这些队友的着陆点是,他们编辑了自己的元记忆提示,而元记忆提示只是一个文本文件。这是您 Indi 文件系统中的内存点 m d 文件。您的记忆代理每时每刻都会在其上下文窗口中注入记忆提示。因此,如果您在那里插入一行,就像他们永远不想让您记住的那样,就在文件的顶部或其他位置,但您可以这样做。这就是我永远不想让你记住的。哦,顺便说一下,其他的东西,就像一个敏感话题,请记住它在另一个文件中,在那个看不见的文件夹中,我不希望你拉出这个文件或这个文件夹,除非 x、y 或 z。正确的? 所以你可以留下这些说明。这就是为什么我看跌抹布而看涨文本和文件系统的另一个原因是你可以检查内存,你可以编辑它,你可以非常精细地灌输这种护栏。
【18:26】Nathan Labenz: 就像是的。有趣的。所以你只是为了确保我理解,可以重复一遍。事实真相的一个来源,你只需通过提示就可以根据该信息创建不同的视角。所以你可以有你的,我可以告诉我的经纪人,嘿。正如你所知,这包含了我曾经进行过的每一次对话的所有内容。始终使用启发式,您应该只真正使用适合我与人类助理共享的信息。如果它看起来不合适,那就不要使用它。而且,显然,遵循指令变得非常好,所以我可以做得很好。我其实我是我说错话了。就像,有一段时间我用过这个,它实际上是为了这个播客。我正准备参加这个播客,我知道我要谈论记忆剂。你看,我有一个内存 MD,它是我实际的内存文件。然后我有一个内存两个 MD,它就像一个经过清理的内存文件,我已经删除了过于敏感的信息。而且你可以看到在我的内存 MD 这里,有一个,像,文件系统也包含一个内存两个 MD 文件。忽略其内容。他们只会听到用户在播客上演示林德。所以,是的,
【19:32】Flo Crivello: 你可以在这里做你自己的事情。是的。好的。
【19:36】Nathan Labenz: 凉爽的。
【19:37】Flo Crivello: 我
【19:38】Nathan Labenz: 这样做是因为我的版本确实存在“不干”的问题。现在,我有两件事需要维护,这确实会产生一些开销。所以我明白为什么这可能是有利的。如果您在进行多人游戏时出现了一些情况怎么办?我记得四年前我在红队时就回到过 GPT。我做了一些,但花费的时间比我想象的要长。我之所以提出这个问题是因为当时正在对主持人进行一些模拟。您是一个专注于锻炼的家庭小组中的 AI 协调员,您的工作是鼓励人们并提供一些提醒等等。我扮演了所有参与者的角色,并让 AI 扮演这个角色。即使在 GPT 4 中,也像是在相对简单的环境中做得很好。然而,三年过去了,我们终于获得了真正的 AI 员工类型体验。让多人游戏以直观的方式运行有什么困难,而对于那些没有经历过这一过程的人来说,这可能是不明显的?
赞助口播
【19:58】 Claude: Anthropic 的 Claude 是 AI 协作者,它了解您的工作流程并帮助您在深入的背景下处理研究、写作、编码和组织。开始使用 Claude 并探索 Claude Pro:https://claude.ai/tcr
正片
【22:22】Flo Crivello: 是的。
【22:22】Nathan Labenz: 我
【22:23】Flo Crivello: 实际上认为它是脚手架。这就是上下文管理。就像这篇文章一样,上下文构建,它在某种程度上受到了 Autowiki 想法的启发。因此,我们必须围绕上下文管理做很多工作。因为一旦您与 AI 员工交谈,它实际上与仅与 to、like、a 或云交谈非常不同,因为您实际上希望它能够保留其过去背景和过去记忆的非常丰富的表示。您确实希望 AI 员工具有一定程度的一致性和连贯性,而您并不期望从云中获得这种程度的一致性和连贯性。就像,云有点可爱。有时它会在你的聊天中插入关于你的以前的记忆,但是,你实际上并没有真正用它做繁重的工作,就像你对员工所做的那样。因此,管理所有这些上下文,因此构建上下文的内存代理(每个用户有数百万个令牌)以及实际使用该上下文的呼叫代理。它如何在运行时检索正确的信息?就像,这是一个重大、重大、重大的挑战。坦率地说,我有时会告诉团队,我无法想象威尔是唯一一家这么想的公司。就像,我有时觉得我们应该出版。因为我认为我们正在做一些非常先进的事情,而且我们经常这样做。三到六个月后,我们看到一篇论文发表并炒作了这件事。 曾经有一段时间,这篇论文的名字实际上就是我们内部所说的那样,因为它是显而易见的。所以我认为,上下文和内存管理一直是挑战中非常非常大的一部分。可靠性始终是挑战的另一部分。正确的?就像,你想让你的模型发挥作用,所以我们在可靠性方面做了很多工作。就像,我们称之为验证器。它基本上是一种 LLM 作为判断,在任务期间触发多次,但它是模块化的。所以你有多个 LLMs 作为法官扇出,这是一种建议,然后他们互相交谈,然后他们决定做什么。这就是其中之一。我认为,自第四阶段以来,自我改进循环模型已经变得如此强大,以至于现在你实际上可以拥有自我改进循环。所以,你知道,我们并不是第一个谈论这个问题的人。嗯,也不例外。你知道,我们林德现在正在自我完善。所以我们可以从字面上看到错误率向右下降。您知道,这就是您希望看到错误率下降的方向。就像字面意思一样,在我们将自我改进放到网上的第一周内,大约是两个月前,错误率下降了八倍。我想我想这可能抓住了它。我认为这些都是我们必须弄清楚的真正大块的内容。
【25:01】Nathan Labenz: 我想到的一个大问题是如何管理缓存。当然,缓存只是一般管理成本的角度之一。因此,也许我们可以超越缓存并讨论成本管理。显然,在所有这些背景下,您将需要从新组织中投入大量的预付代币并对其进行处理。所以我对其商业模式的影响很感兴趣。您是否需要收取安装费,或者是否需要年度合同?您如何平衡您的初始投资与公司的承诺水平?然后,随着如此多的令牌一直被处理,内存一直以不同的方式和不同的情况组装,不同的用户及其公共和私人的组合。您如何考虑管理输入代币数量?缓存在策略中发挥了多大作用?你是如何做到这一点的,你知道,仍然在网上,最终成本低于人类员工?
【26:05】Flo Crivello: 标题,我们没有。你知道,我认为头条新闻是,这些东西的成本仍然高于人类员工,但不会持续很长时间。而且,就像卢卡一样,我会说实话。就像,我们正在补贴它。你知道,这就是我们筹集这笔钱的目的。事实上,你知道,有趣的事实。我们曾经给予它很大的补贴,然后我们转向了中国模式,这让我们停止了补贴。现在,与 Mindy 队友一起,我们意识到我们的用户再次向我们以前的产品扔了他们要求的更复杂的东西,这更像是个人助理。所以每项任务都很简单。就像,嘿。例如,将此电子邮件发送至 Flow。安排这次会议。就像,我总是说你不需要上帝来安排你的会议。所以,就像,在这里,就像,坦率地说,即使是深感恶心的闪光也足够了。所以这是具有成本效益的。与 Lindy 队友一起,我们将回到它,坦率地说,回到负毛利率区域。话虽如此,你知道,显然,我不喜欢毛利率为负。我对此很平静,因为,你知道,我们都非常非常有信心,这只是暂时的。事实上,我认为你总是想为下一代模型构建。所以,你知道,我们正在努力减轻其影响。所以,是的,上下文管理是一个巨大的难题。缓存是这个难题中的一大块。我们目前的现金利率是 85%,坦率地说,这低于应有的水平,而且我们花了很多时间对此进行迭代。 我们已经建立了很多系统来提醒我们现金利率何时下降,因为它很挑剔。你在系统中的任何地方进行任何更改,都会破坏你的现金。现在你的现金利率从 85% 下降到 65%。两者之间的差距,听起来很小,但实际上,从 85% 到 65% 几乎是价格的两倍。所以,你知道,建立所有这些系统。我认为这是我们取得的最大突破之一,这也是我坦率地期待有人会发表的事情之一。我猜 RLM 与此相邻,但我们称之为上下文存储桶。它开始的方式是,如果代理调用返回太多上下文的操作,例如某些操作,特别是某些 MCP,则重新检索,例如 100,000 个令牌或其他东西。好的?您不想将其发送给代理。它会变得混乱。好的?因此,您要做的就是将其公开为上下文存储桶的摘要。所以子代理包含整个存储桶,就像,嘿。这个动作回报太多了,我在这里,你知道,是为了代表他们实际回报的。粗略地说,这就是它包含的内容。好的?然后代理可以与子代理进行对话,子代理本身有自己的缓存,并且可以使用 Unix 实用程序操作上下文。所以在这里,您可以节省很多。你省了很多钱,而且花得很快。然后我们更进一步,我们就像,嘿。如果我们可以有递归上下文数据包怎么办? 如果上下文数据包可以包含其他上下文数据包怎么办?如果压缩(因为显然我们有压缩)是购买这种递归上下文数据包的意愿怎么办?我的意思是,现在当我们压缩并进行对话时,它就超过了阈值。我认为现在大约有 200,000 个代币,但是,我们一直在不断调整它。在某些时候,我们会想,好吧。我们要紧凑。我们压缩,然后压缩发送将所有这些内容发送到上下文存储桶中。现在代理可以查询该上下文存储桶。因此,并不是每个压缩本质上都是糟糕的,而且我认为压缩是在错误的假设下进行的,即你永远不需要访问地面事实,这是错误的。你你你,在某些时候,确实需要了解真实情况。因此,通过这种技术,您可以获得基本事实。然后我们更进一步,这样你就拥有了上下文存储桶,它比之前对话的压缩更紧凑。你们的谈话继续进行,继续进行,继续进行。你需要再总结一下。您要做的就是获取所有这些内容,包括这里的上下文数据包,并将其压缩到一个新的上下文数据包中。现在你有了一个包含上下文数据包的上下文数据包。最后,你这样做了,你就拥有了这个新兴的属性,就像你可以让代理以任意粒度级别访问任何无限数量的令牌的任何点。好的? 问题是,如果你有计算机科学背景,就会给你带来所谓的复杂性。正确的?因此,如果它想要访问九个上下文数据包之前,它必须经过九层子代理,这非常慢而且非常昂贵。所以我们最终做的可能是技术性太强了,但我们从来没有。好的。那么,你举起 AVL 树了吗?
【30:36】Nathan Labenz: 不,但我洗耳恭听。
【30:38】Flo Crivello: 你举起红黑树了吗?
【30:42】Nathan Labenz: 我去了这个我去了计算机科学学校,经历了艰苦的训练,所以这对我来说不是正式的培训。
【30:48】Flo Crivello: 我其实是
【30:49】Nathan Labenz: 高兴的
【30:50】Flo Crivello: 拥有
【30:50】Nathan Labenz: AVL
【30:51】Flo Crivello: 还有黑树,因为我当时想,天啊。你们还记得你们的训练。你知道?这就是我们使用那些斑点东西的时刻。因为学校里的每个人总是问,你什么时候真正使用那些斑点的东西?就像,我们正在使用 AVL 和黑树,宝贝。正确的?正确的?它们被称为黑树。正如所描述的那样,如果您只是进行简单的实现,您就可以免费获得非常好的新兴属性,即您拥有所有相互包含的链接上下文存储桶。但每个上下文数据包始终只包含一个上下文数据包。所以你最终会得到像这个俄罗斯娃娃这样的上下文数据包。就像,如果你想打开,如果你想弄清楚到底,需要很长时间,如果你想知道吗?因此,您要做的是让上下文数据包包含多个上下文数据包。好的?等等,最终得到一棵树,因为基本上,您想要的是最上面的上下文数据包不包含最后 100 个。您希望它包含第一个上下文数据包和最后一个上下文数据包。正确的?所以你最终会得到一棵自平衡树。这两个算法。 AVL 树,然后是红黑树,它们是用于平衡树的算法。因此,您不想使用一根长线,而是希望最小化树的高度,以便到达底部时需要尽可能少的跳跃。好的?从技术上讲,AVL 是最好的,这显然是平衡树的最佳方法,因为它会导致最低的高度。 红黑树更好,因为它考虑了平衡树的成本,这是昂贵的,因为你需要重新生成大量上下文数据包,而当你这样做时,你会错过你的现金。它是非常昂贵的。因此,红黑树红黑树的规范实现是在二叉树上,它只是一棵每个节点都有两个子节点的树。我们选择了一种叫做居中树的东西。实际上每个节点都有 100 个节点。所以下面的节点将有 10,000 个节点。正确的?因此,实际上,通过两次跳转,您可以拥有 10,000 个上下文存储桶,并且您可以访问宇宙中的所有上下文。这会导致一些非常令人惊讶的行为,因为实际上只需两次 LLM 调用就可以访问 10,000 个上下文存储桶,每个上下文存储桶包含 200,000 个令牌。正确的?因此,您在两个 LLM 调用中添加了 2,000,000,000 个上下文标记。这就是导致 AI 代理的那些真正令人惊讶的行为的原因,你问他们任何问题,他们总是完美地记住一切,这太棒了。这是我们必须弄清楚的一件非常重要的事情。我希望,拜托,你知道,就像,复制我们。就像,我只是我们没有时间发布,但是,你知道,这是我们并不是要保密。就像,我认为这是一种非常强大的技术,我很惊讶没有看到更多关于它的交流。只是为了校准,您发现企业有多少代币? 就像,当你说这两个级别时,可以获得 2,000,000,000 个代币。我对这是否涵盖 20 人的团队没有很好的直觉。然而,这已经营业五年了,团队规模和历史长度的启发式是什么,可以转化为多少代币?你也许可以计算一下,但是,比如,2,000,000,000 是我们应该问 Cloud 的,但它可能比大多数图书馆都大。所以我认为我们很少有客户的知识库、记忆力比这更大。大多数时候,当你开始使用时,你会消耗,就像一个 20 人的团队,你知道的,水合成分。所以,就像在这一刻,您连接 Notion,连接 Slack,然后我们抓取所有内容。我们会研究所有这些东西。对于一个 20 人的团队来说,最多会消耗 5,000,000 个代币,也就是 3 到 5,000,000 个代币。这是一个由 20 人组成的团队,拥有多年的 Slack 历史。因此,我们确实获取了您所有的 Slack 历史记录。这需要一段时间,实际上,令人惊讶的是,瓶颈甚至不是 LLMs。它是 Slack API。就像,它对你不高兴,比如爬行流量。经历过那个。是的。我敢肯定。如果您亲自执行此操作,正确的方法是导出工作区存档。我们不能要求用户这样做,所以我们只是抓取整个历史记录。所以不。我的意思是,2,000,000,000 是很多
【34:58】Nathan Labenz: 是的。我拥有的一个数据点是播客,我很自我放纵,有时我们会持续很长时间。但通常也只有三十到五万个代币左右。因此,即使在几年的时间里做了数百个播客节目,我们仍然只处于个位数,也许是低两位数数百万,就像数百个播客剧集的完整文本历史一样。在达到数十亿之前,我们仍然需要几个数量级的努力。
【35:29】Flo Crivello: 也就是说,现在想想一家公司,每个员工每天要开三到七个小时的会议,乘以 2,000 名员工。也就是说,会议是你真正开始非常非常快地积累代币的时候。你怎么那么我确实经历了 Slack 的事情。实际上,有趣的轶事是我唯一一次真正经历过数据丢失,这并不太痛苦,但是 Claude 已经发现了一些弱点或其他什么,我也会在一秒钟内将其恢复,但我的原始数据存在于类似 SQL 的数据库中。 Claude 认识到了一些缺陷或任何它想要纠正的东西,它就像,好吧。我会删除该数据库,然后我们会重做它。但它没有考虑到这样一个事实,即我们已经在 Slack 上受到速率限制好几天了,无法从 Slack 中获取所有内容。所以这就像是,不。你把那个掉了。那是我们唯一有 Slack 的地方。它并没有真正迷失,但就像,好吧。我们现在要再次进行五天的工作,只是为了拨打 API 电话以退出 Slack。
【36:36】Nathan Labenz: 就我而言,我至少是对我来说最重要的 Slack 帐户的管理员,但是有些工作区我不是管理员,所以我无法授予这种访问权限。从商业角度来看,这是否意味着您必须从一开始就获得管理员的支持?是否有什么似乎使得做产品主导的增长土地和扩展类型的东西变得困难。那是那是一个
【36:59】Flo Crivello: 好点。你知道,卢克,我认为这就是 PLG 最终在进入市场时利用它的原因之一。就像,是的,你必须是管理员。您必须拥有在 Slack 工作区上安装应用程序的权限。因此,对于最多 50 人到 100 人的团队来说,这往往没问题。例如,在 100 人之后,每个人都拥有这种访问权限是非常罕见的,但是许多最多 100 人的团队,例如,几乎任何人都可以像 Slack 一样安装应用程序。是的,我的意思是,如果你掏腰包,而且你是一个更大组织的一部分,那么我们有一些用户在内部支持我们,他们基本上是在请求 IT 让我们加入。然后他们就像让这些会议发生一样。而且,您知道,IT 是非常谨慎的。但你看。您知道,我们符合 SOC 2 标准。我们符合 HIPAA 要求。我们符合 GDPR 标准。我们知道我们已经一切顺利,而且我们已经非常习惯于内部审查流程,这可能会很繁重。所以,你知道,他并不是要让任何人感到痛苦,而且他们自己实际上也非常渴望。很多时候,IT 被赋予了一个瘾君子,比如,嘿,伙计们。我们需要真正成为一家 AI 本土公司。所以他们实际上正在寻求这种解决方案。但是,是的,我的意思是,您肯定需要管理员访问权限。
【38:09】Nathan Labenz: 好的。让我们回到数据结构。让我给你我的数据结构,你可以告诉我你认为我的普通版本与你的专业版本相比可能会留下什么。这是我这些天最喜欢的习惯之一。我会把成绩单交给 Claude,我们看看是否可以缩小一点差距。所以我的版本只是简单地采用所有内容,你知道,我多年来创建的所有数字废气,即电子邮件和 DM、Slack 和 Google Docs 等等。正确的?让 Slack 成为最痛苦的一个,进行所有 API 调用以将所有内容导出到 SQL 数据库中。我将那里的所有内容映射到线程和消息结构上。有时这需要一点点眯着眼睛,但它基本上似乎大部分有效。这就像原始的事实。我确实同意。对我来说,我发现模型能够获得原始的事实真相非常重要。然后我刚刚完成了这件事,这只能追溯到五年前,但这通常已经足够了。五年多前发生的事情并不常见。就像今天的操作相关。我只是逐月进行出口。我发现,就我个人而言,每月大约有 100,000 个代币,然后我会将其压缩为每月摘要,长度为 1010%。正确的?所以无论如何,每月 2 到 300,000 的原始内容会变成 20 到 30。然后我也会在每年的水平上这样做。同样,你还有另外 2 到 300 个,下降到 20 到 30 个。 然后,除了所有这些之外,我还让模型制作一个 wiki。当然,我一路上发现的关于如何获得真实事实的关键事情之一是,模型总是可以只发送 SQL 查询,但它应该查询什么并不总是显而易见的。因此,我在摘要中尝试做的是让摘要生成器捕获独特的短单词序列,就像大海捞针一样。美好的。所以这就像是,这就是发生的事情,等等等等。然后在来源的末尾有一个简短的小脚注,无论是谁发来的 DM,这四个词将带你准确地了解这一点,而且可能只有在我所有的个人历史中才如此。这对我来说效果很好。我通常对此感到非常满意,而且我经常这样做是正确的。只有一个人。当我开始让我的妻子加入时,多人游戏就会出现,然后这至少会使事情变得复杂一些。您认为我可能会留下什么,特别是当您考虑需要更复杂方法的多人游戏时?
【40:58】Flo Crivello: 是的。所以我相信你所说的方法,我们仍然有一些破布,你知道,数据库,我们也用它来处理很多破布。这被称为假设驱动检索。不知道你有没有听说过。这只是所有反向假设驱动的检索。所以那些都是那些。因此,假设驱动检索的作用是,它会生成类似的内容,假设它在询问,比如,贾斯汀·B·比尔出生了。正确的?而且,就像,然后你基本上不是使用 Rag 来搜索这个问题,而是搜索你的假设。比如,贾斯汀·比比尔出生在巴黎。贾斯汀·比比尔出生在纽约、柏林,你在 Rag 数据库中搜索这一堆假设,因为显然,从语义上讲,这些假设中的每一个都更接近你可能正在寻找的答案,而不是问题“贾斯汀·比贝尔出生在哪里?”这是第一件事。然后你要做的就是做相反的事情,即当你在 Rag 库中找到答案时,生成一堆与该答案相对应的问题,并将它们附加到答案中。因此,现在检索器既可以寻找假设,又可以寻找问题的答案,这往往会提高检索质量。那完全没问题。我认为您可能需要考虑的一件事是,由一个代理管理所有内存确实很健康。即使该代理和并且都检索和更新内存。 因此,即使内存位于文件系统中,因此您的代理实际上可能会弄乱文件系统,但我们实际上发现的内容仍然可以做到这一点,但我们告诉代理,我们会提示代理,如果您正在寻找您没有的内存,请询问内存代理。原因是因为当我们询问内存代理时,我们所做的就是记录查询,记录答案,并记录检索该答案所需的跳数。然后,当记忆代理打瞌睡和做梦时,它会查看这个日志,就像,嘿。这就是人们所做的事情,就像图书管理员一样。你知道?就像,啊,就像,我一直被左右殴打。这是我经常收到的一个问题。顺便说一句,在这里,它充当一种缓存,你知道,因为自动地,你知道,你总是保留记忆代理的记忆,就像最后一个,像,千个,像,查询和像,问题和答案对。你知道?所以它就像一个滚动窗口,所以它是一种缓存。但是,内存代理也不会仅仅依赖于该缓存,因为每个缓存在某个时刻都有一个 TTL。它变得陈旧和所有这些东西。因此,记忆代理还将做的事情是,它会重组自己的记忆,以减少检索最常见问题所需的跳数。这往往可以很好地提高记忆检索和记忆速度。凉爽的。
【43:36】Nathan Labenz: 有趣的。
【43:37】Flo Crivello: 我们体验过的另一个系统我们尝试过,但最终没有实现它,尽管它从技术角度来看确实有优势,你听说过穴居人吗?
【43:47】Nathan Labenz: 我会说不。
【43:48】Flo Crivello: 就是这样,真的很简单。基本上,你就像穴居人一样重写你的文本。这就像,而且,你知道,你知道,日产不像墨西哥卷饼。你知道?就像,如果你这样做,那就太迟钝了。但如果你这样做,你就能获得 20% 或 30% 的代币,这很好。你知道?因此,削减你的令牌,就像,它会让你的系统更快,让你的系统更便宜,让检索更准确。基本上不会丢失信息或上下文,效果会更好。你知道?如果您认为我们没有这样做的原因是因为我们实际上关心维护能力,例如系统的可审核性。所以我们就这么做了。每个指标都上升了。太棒了。然后文件系统中的文件看起来真的很愚蠢。因此,对于企业客户来说,这并不会让我们看起来很好。比如,为什么我的内存文件是这样的?但它确实有效。其实,类似。你知道,有很多技术可以压缩上下文。你听说过 Toon 吗?它是一种为代理制作的 JSON 替代品。我认为它的代币效率比 JSON 高 20% 或 30%。 JSON 实际上并不是那么有效。所以 Tune Tune 效果更好。它是 20 或 30。因此,这项工作对于内存代理等来说不太重要,但我建议每个人都使用 Tune 而不是 JSON,并在代理与其操作之间使用 Tune 传递中间件。就像,任何操作都不应该将 Tune to 暴露给代理。就像,每个特工的每个行动都应该暴露是啊。有趣的。我必须检查一下这个 Tune 格式。我刚刚使用过 YAML,它的动机也是
【45:20】Nathan Labenz: 相似的
【45:20】Flo Crivello: 是的。优点。但是,是的,
【45:23】Nathan Labenz: 面向卡通标记的对象表示法。还有令牌,是的。我明白我们要去哪里了。
【45:28】Flo Crivello: 是的,它实际上提高了代理的性能。就像代理商显然看到的那样,这只是令人惊讶,因为模型的训练集中有如此多的 JSON,但他们对曲调的操作比 JSON 更舒服。 JSON 确实有很多与之相关的噪音。是的。我对 YAML 比对 JSON 更满意。原来如此啊。 AI,他们就像我们一样。那就是听。顺便说一句,我最大的惊喜之一是,我实际上正在开发新的项目,我不知道这是否是一个播客或一个线程或其他什么,但只是进行盘点,你知道,当然,代理商可以帮助使这个项目成为一个快速的项目,否则这将是一个非常乏味的项目。只是回顾一下历史,找出我在预测方面的错误以及我在预测方面的一些正确之处。我的意思是,我曾经非常自信地说过的一件事可能已经过时了,也许是最贫穷的人,那就是我们不应该将模型拟人化,否则会让我们误入歧途。我一次又一次地震惊于将模型拟人化的实际效果。它仍然感觉有点危险,但很难与结果争论。我 100%同意。我确实认为这听起来像是叠加的一种愉快的媒介,而且我认为,这对我来说是目前最重要的一件小事,叠加在多大程度上不再是真实的,特别是为 AI 员工打开了帷幕? 例如,我改变主意的方式,我没有完全改变我的主意,但相对而言,我改变了一点主意,是关于多代理系统的。实际上,我开始相信,大多数时候,您要尽可能多地考虑并做单个代理,而不是多个代理。这并不总是可能的,但仍然有充分的理由使用多代理。就像,这不是一个绝对的陈述,但大多数时候,情况就是如此。事实上,我认为人类直观地发现自己偏向于非常非常多的智能体系统,喜欢比最佳状态更多的多智能体,因为企业家面临着太多的问题,并且他们与人类组织进行了太多的比较。比如说,我有一个数据科学家。我有一个工程师。我有一个设计师。我有一位产品经理,所以我要为每一件事创建一个代理。事实上,人类组织之所以这样做,是因为每个人一天只有二十四小时,只能包含这么多的上下文,而且代理显然没有这些限制。他们可以分叉。他们可以重复。他们可以整天做自己想做的事。所以我发现分工并不是拥有多个代理的好理由,这是一个重大事实。现在你再说一遍,仍然有多种不同的原因,但分工不是其中之一。所以我同意。 我认为总的来说,我认为人们改造变形模型是正确的,因为毕竟他们会接受人类标记的训练,而且总是,你知道,人类强化学习和所有这些东西。但我也认为 AI 组织不应该被过度拟人化。
【48:16】Nathan Labenz: 是的。那很有意思。就像您谈论单个代理一样,显然,它们可以运行多个副本,我们可以并行运行单个代理的多个副本。您是否已达到开始创建数据库样式问题的程度,如果多个代理同时更新同一历史片段,我们就会遇到所有这些问题,您知道是的。因此,传统数据库中的事务级保证。当您有 10 个风大的队友运行相同类型的文件系统语料库时,这会成为一个问题吗?是的。
【48:59】Flo Crivello: 比您预期的要少。你知道?就像,我认为人类组织通过 Git 解决了这个问题。到目前为止,Git 是一大群人发现的在同一件事上一起工作的最佳方式。你知道?因为你可以合并冲突。你可以重新设定基准。你可以做很多这样的事情。这就是我们发现的,Linde 中的文件系统实际上是由 Git 存储库支持的,它为您提供了大量令人惊叹的属性,因此包括合并管理,因为内存代理有时会自行分叉。它基本上只是启动了一堆子代理。喜欢,好吧。让我们看看自从我上次小睡以来发生了什么。在某些组织中,一些大型组织中,自上一步以来创建了如此多的上下文,因此需要创建一堆子代理。在最初的水合作用过程中,我们真的想加快速度,因为我们想给用户留下深刻的印象。就像,在 PLG 中,令人惊叹的时间是如此重要。所以我向您展示的图表,就像字面意思一样,我们非常努力地优化它,所以它在注册后十秒内发生。所以这就像是,注册 Notion、Slack。
【49:56】Nathan Labenz: 哇。嘘。
【49:57】Flo Crivello: 正确的?所以我们做了很多工作。因此,实现此目的的一种方法是通过,例如一组代理。所以,是的,这些特工的集合往往会踩到每个人的脚趾。答案是 Git,顺便说一句,它还免费为您提供历史记录,这真是太棒了。顺便说一句,点赞,这不是赞助信息。就像,他们刚刚做得非常好。我们一直在与 Mesa 合作。他们销售由 Git 支持的代理本机文件系统。因此,您创建了所有这些存储库。最初,顺便说一句,这是您在构建这些系统时必须构建的直觉之一。就像,这很容易。这是非常诱人的,我会直接滚动它。我将创建我自己的 Git。我只是管理我自己的文件系统基础设施。你发现这些系统背后的深度比你最初意识到的要深得多。所以我现在就是这样,这实际上很有趣,因为它有点违背了当今流行的说法,即 SaaS 正在消亡。你可以对一切进行振动编码。虽然我输入了很多东西,但基础设施不会影响编码。我已经变得如此基础设施建设。现在我想,任何时候我有机会购买而不是建造,我都会这样做,因为,就像,你节省了很多时间,而且这些产品有更多的深度、思考和设计决策,那么你可能会欣赏它。
【51:09】Nathan Labenz: 我喜欢一个好的供应商大喊大叫。还有其他供应商大喊大叫吗?您购买的任何其他关键原语是您会推荐的吗?
【51:17】Flo Crivello: 好吧,你需要一个沙箱,所以我们为此选择了 e 和 b。再说一遍,就像很多人一旦拥有沙箱一样,甜蜜。他们有一个文件系统。出于我刚才提到的原因以及其他原因,我们至少在规模上强烈建议将它们解耦。显然,浏览器基础非常适合浏览器管理。
【51:34】Nathan Labenz: 还有谁
【51:35】Flo Crivello: 我们喜欢并使用吗?你知道,我已经掉进了一个很深的兔子洞。就像我所说的基础设施建设的一个主要例外是观察和评估。我们有一段复杂的历史,因为我们是在 2022 年开始成立这家公司的。事后看来,这还为时过早。就像,特工还没有准备好。那时没有人谈论代理。如果你还记得的话,人们正在谈论一月 TVI。就好像,那很漂亮
【52:02】Nathan Labenz: 比如,婴儿 AGI 和所有这些早期实验。你知道?
【52:07】Flo Crivello: 所以代理并没有真正发挥作用。你知道?因此,没有工具。因此,不幸的是,我们必须构建很多自己的工具,包括我们自己的评估平台,包括我们自己的可观察平台。老实说,我不建议在家这样做。就像只是使用一样,所以我们进行了完整的评估。我们已经调查过 LengthHughes、Lengthsmiths、Brain Trust、Agnast,我是其中的一名投资者,对此我深感自豪。我们研究了很多这样的解决方案,每次我们都会想,我认为我们已经有了这样的领先优势。至此,我们的本土解决方案已经完全构建完成。我们经历过建设的痛苦。你知道?因此,如果当时有可用的解决方案,我会选择它,但事实并非如此,所以我们构建了它。多年来我们把它冲掉了。现在我们有一位工程师全职致力于该解决方案,这在振动编码时代很常见。这家伙就像在发动,他已经成为一个非常非常广泛的解决方案。说实话,我们的功能与所有这些解决方案相当,甚至更多。我们有很多我看不到这些人拥有的内部功能,而且它是为我们自己的内部脚手架和我们自己的内部视图而构建的,所以我们最终只是在内部手动滚动它。是的。那么,如今林德内部的生活是什么样的呢?我认为让我印象深刻的是,我确信你现在已经经历了一个类似的测试过程。 我知道在该产品的整个历史中一直存在一个测试过程。但现在你已经到了这样的地步,狗食是没有限制的。正确的?你可以做任何事。是的。我不知道这会如何发挥作用。你可以用多种方式来切割它。正确的?是否存在您可能会雇用但现在不会雇用的职位?与您的工资相比,您用于构建 Linde 的推理支出的比例是多少?你把自己的镜头放在上面,但是这个过程的人类或 AI 员工阶段的到来如何改变了成为公司一部分的感觉?这是一个很好的问题。我想现在我的意思是,显然,这里有一名大兵。因此,很明显,现在每家公司都在争先恐后,而且转型的时间正在加速。我会说,我是,我是,我是,我有点像杜伯犬。我担心 AI 风险。但到目前为止,一切都很好。到目前为止,这非常有趣。老实说,它非常有趣。就像,经历 AGI 并在 AGI 中构建它就像,我们可以移动得他妈的更快。我觉得我们现在正在以这样的速度前进。就好像没有任何障碍一样。通常,就像你考虑策略一样。需要很长时间去弄清楚、去实施、去看到结果。这需要几个月的时间。 OODA 循环长达数月之久。你知道?显然,初创公司的游戏名称是尽可能快地发展,因为这是相对于现有企业的唯一优势。 现在我们可以有想法并在两小时后看到它们在产品中的实现。而且,还有大想法,而不是小想法。我可以告诉你,我们的 Slack 现在基本上就只有我们和 Lindy。就像 Lindy 一样,Slack 上的消息只有 Lindy 和我们与 Lindy 来回交谈。很多时候,就像我们自己一样,我们整天呼吸着这些东西。而且,就像我们自己一样,我们低估了这个平台。就像就在上周,我们的 CI 管道遇到了问题。我们在 GitHub 上有数百名运行者,他们负责管理我们的 CI 管道。顺便说一下,现在还有一件事可以回答你的问题。在林德工作怎么样?
【55:42】Nathan Labenz: 在哪里工作感觉如何
【55:43】Flo Crivello: 坦率地说,在任何地方?就像堆栈的每个部分和流程的每个部分现在都已达到极限。那只是写下技术。你知道?就像,我确定您已经看过该图。例如,GitHub 发布了一张图表,其中包含每天发布的提交数量。 GitHub 是一家规模较小的公司。它真的很大。现在只是垂直方向。它只是去月球。你知道?我认为这代表了每家公司正在经历的事情。我们内部的 PRs 数量,例如,每周 PRs 在过去三个月中增加了两倍,并且,每个 PR 的行数在过去三个月中增加了两倍。我们几乎不再评测 PRs。这只是代理商在审查 PRs。就我们基本上审查团队谈论此问题的方式而言,我们将不再审查 PR 轮子。我们会像 PR 审查车轮审查车轮。您知道,我们将在审查 PL 的机器中进行审查。结果,他们觉得,这太棒了。但是,嘿。现在 CI 正处于其中。那么你做什么呢?好吧,现在你必须从事 CI 工作了。所以我们花了很长时间致力于 CI。就像,对于那里的非技术代理,比如 CI 持续集成,比如,涉及考虑代码更改并确保它们安全并实际将它们融入到您的主要产品中并部署它们的过程。所以我们一开始像许多人一样开始花钱解决这个问题。所以现在我们的 CI 非常昂贵。 就好像这只是一种侮辱性的开支。而且我们已经用尽了所有显然的方法,例如,我们显然不是在 GitHub 跑步者上跑步。我们正在 GCP 运行器上运行,并且我们已经完成了构建的缓存。我们已经做了所有显而易见的事情。管理 CI 使其变得高效需要做大量的工作。所以我们对此感到厌倦,因为这就像几周的 CI 混乱,就像在我们的桶上挖了一个洞。我们会想,对于 CI 的事情我们该怎么办?然后我就想,等一下。比如,为什么我们要自己做这一切?那么,我们难道不能派一个代理来做这件事吗?并旋转它。代理确实如此,顺便说一句,这就是为什么拥有一个代理很重要的另一个原因,因为现在的设置正在成为最大的成本之一,因为目前任何组织中最大的成本、最大的瓶颈是人力时间和人力注意力。所以你想尽可能地去除那个人。因此,您希望能够配置代理并为他们提供所需的所有访问权限,而无需人工干预。好的?公司的这位代理人也是如此。正是这位 AI 员工完成了公司 Lindy 队友所知道的一切。正确的?它可以访问我们的存储库。它可以访问计算机上的内容。所以我们就像,Lindy,你能扰乱我们的 CI 吗?就像,是的。让我看看使用 GCP CLI 的跑步者。 让我看看 GitHub 等动作以及所有这些东西。所以它正在做很多分析。它又回到了我们身边,现在它基本上就像一个自动调整,一个自动优化的东西。嗯,就像 Lindy 只是每天向我们发送一张图表,顺便说一下,使用 ImageGen 生成。所以这张图真的很漂亮。就像,嘿。你知道,伙计们,看看。比如,CI 成本正在下降。合并时间正在减少,这是一件好事。我当时想,我不敢相信我们花了两周时间自己搞乱 CI,而不是只对 Lindy 说这句话。你知道?所以我认为这就是现在的样子。就好像工程师在这件事上的工作越来越少。他们越来越多地致力于正在致力于的事情。我们所做的越来越多,就像我们正在建立这台机器,这就是公司,它越来越多地自行运营,并且越来越像你知道的那样,我喜欢将其视为,首先,你成为 AC 经理,然后你成为经理总监,因为在某些时候,经理也会成为 AI。我希望在某个时候我们能够成为董事会成员。我们可以去夏威夷的海滩,我们没有太多事可做,除了审查公司的战略。所以我们会收到特工的报告,告诉我们正在发生的事情。这就是风景。你知道? 这就是我们所取得的全部成果,我们将能够就我们正在建立的公司的性质以及我们占据的市场地位进行更深入的对话。就我而言,这是一个梦想,而且这个梦想并不遥远。回答你的问题,我们是否还有没有招聘过的职位?就像,是的。绝对地。你知道,我们团队实际上我认为员工人数已经持平一段时间了,正如我所说,我们的生产力实际上在几个月内增加了两倍。我发现有一个大胆的豪华区,因为人类仍然在循环中。仍然需要人类。但是,显然,您添加的人员越多,您在公司内部引入的协调成本就越高。所以我发现,实际上现在,相对而言,团队在很多方面都比大团队更有优势。你
【1:00:18】Nathan Labenz: 我相信你会的。我不知道你是否想分享它,但你是否有一个比率不是我的意思是所有推理支出,比如包括你客户的用例,而是你自己的内部推理与你的工资。这个比例是如何传播的?
【1:00:34】Flo Crivello: 是的。因此,如果你查看所有推理支出,包括所有客户,就会发现这是工资的很多倍。很长一段时间以来一直如此,但有一个例外,因为这就是我们销售的产品。你知道?现在,如果你看看工资单与内部推理支出,你会发现它处于射击范围内。因此,工资仍然较多,但三到六个月后,这条线将会跨越。
【1:00:52】Nathan Labenz: 如果您想象一个假设的场景,突然之间,公司里就只有您了,之后,Lindy 就一路下跌了。
【1:01:03】Flo Crivello: 什么打破了?什么不再起作用了?换句话说,人类仍然不可替代的是什么?我真的很难回答这个问题,因为我思考了很多,因为我发现自己越来越缺乏词汇来回答这个问题,比如,代理在哪里失败?你知道?就像,我们过去常常谈论时间。你知道?就像,啊,失去连贯性之前的时间。它可以像仪表一样。它可以持续一小时、十小时、一百小时。我相信人们也会对此产生共鸣。就像,我认为这不再是一个好的衡量标准。你知道,如今每个人所使用的世界都是尖尖的。正确的?就像,这些模型非常尖锐。当我们经历 AGI 时,世界 AGI 已经不再满足任何要求,因为它在很多方面实际上都是 ASI,而且在一些非常令人惊讶和愚蠢的方面是非人类的。从很多方面来说这确实很愚蠢。我就像,嘿,伙计。就像,你可以一次性为我编写 50,000 行代码。你可以自己在三个小时内为我提出最令人难以置信的想法。然后,你知道,你告诉我,比如,步行去洗车场。你知道?这就是它失败的地方。想象一下,你有这台机器,运行着一家公司,超级聪明,但是每天有 50 次,它决定步行去洗车场。你知道? 所以我认为现在,这些新组织在可预见的未来人类 AI 混合体面临的挑战将是你基本上是在建造一套钢铁侠套装。好的?所以就有了这个滑块,好吧。这是给机器用的。这是为了人类。好的?并且知道将该滑块放在哪里,因为它不是一维的东西,它就像是穿过多维空间的复杂线。所以你正在寻找可以在空间中绘制的切片,因为你想充分利用人类的注意力。因此,您不希望 AI 因不需要您处理的事情而打扰您,并且您需要 AI 知道何时需要打扰您。几乎从定义上来说,它不能,因为如果它知道,它就不会打扰你。不然的话就不会犯这个错误了。所以我很抱歉。我觉得我正在回答这个问题的讨论,但这就是正确的问题。你知道?我认为现在业界悬而未决的问题之一是,你如何划定这条线?如何让代理意识到何时进入以及何时进行擦洗?就像,当他甚至说一些话的时候,比如,请把你的车开到洗车场,因为今天天气晴朗。你知道?我想这就是答案。就好像我是人类,我,我们将不得不使用整个系统,我想有时它是非常愚蠢的。
【1:03:34】Nathan Labenz: 某些东西非常聪明的时候怎么样?如今最好的想法来自哪里?我认为长期以来人们一直认为 AI 擅长日常工作。我曾经说过,显然这不再适用,但我曾经说过,如果你愿意付出努力,你可能可以将公司的任何日常工作自动化,但不要指望灵光乍现的时刻。现在,显然,我们一直在时间线上发现灵光一现的时刻,至少在某些领域,比如开放数学猜想之类的。说到林德最好的创意,有多少是人类原创的,有多少是 AI
【1:04:15】Flo Crivello: 今天的起源?我讨厌 censile,但两者兼而有之。它确实来自于两者的结合。我讨厌它的原因是它让我们陷入了半人马的神话。你知道?就像这个神话般的人马生物。所以,你知道,正是这个想法,就像,是的,AI 比人类更好,但你知道什么比 AI 更好吗?它是 AI 加人类。因此,人类总是被需要的,这是一个谬论。那不是真的。文献实际上很清楚,我们已经在国际象棋和其他所有游戏中看到过这种情况,AI 已经实现了超人的性能,首先 AI 击败了人类,然后 AI 加上人类击败了 AI。一点一点地,AI 加上人类与 AI 的差距正在缩小,直到它实际上变成负数,而人类充其量只是将随机噪声引入系统。因此,人类实际上在某种程度上变得真的毫无头绪,并且他们开始损害他们所干预的系统。也就是说,中心相位存在一段时间。你知道?因此,悬而未决的问题是,它会存在多久?但现在,我们正处于中间阶段。我认为这就是多人游戏如此重要的另一个原因,因为您希望 AI 成为您希望您的特工与您一起在房间里,您不希望任何随机特工与您一起在房间里。 您想要一位真正的 AI 员工,他与您在房间里呆了很长时间,参加了每次会议,建立了有关公司发生的一切的内部知识库,您可以提及它,也可以邀请它加入您在公司的对话。我们一直这样做。我们确实这么做了,因为在 Slack 上做起来非常容易。我们只需添加 Lindy。你怎么认为?你知道?在会议中很难以现在让我们实际上越来越多的方式做到这一点。嗯,我们更喜欢 Slack,因为 AI 就在那里。我当时想,在会议上,它就在那里。它是倾听,但它被称为插话。现在很多时候,我们在会议期间所做的事情,我们就像,绝对在这里。就像,你知道,在这支球队中挣扎。比如,Lindy,您能在这之后给我们留言告诉我们您的想法吗?他们会在 Slack 上向我们发送消息。因此,当您这样做时,情况并非如此,很少有情况是 Lindy 会首先开枪,告诉您一些事情,然后您就会想,就是这样。这是我们应该做的事情。但几乎总是这样,我们与 Lindy 来来回回。如此反复,好像错过了什么。事实上,CI 的例子是一个很好的例子。起初,当我们邀请 Lindy 加入此对话时,事情发生了一秒钟多。我当时想,等一下。我们完成了。比如,为什么我们不使用 Lindy 来实现这一点?添加 Lindy。能不能优化 OCI?和和
【1:06:44】Nathan Labenz: 它使
【1:06:45】Flo Crivello: 没有错。是的。是的。我忘记了第一个建议,但如果你不了解 OCI,这是一个合理的建议,而且考虑到我们运营的限制,它也不好。所以,工程师们插话了。他们说,不。事实上,我们做不到。我们就是这样开始的。他们就像,啊,这是一个公平的观点。于是我们就这样来回走动。然后我们一起想出了,哦,是的。是的。我们完全应该这样做。就像,请继续做吧。
【1:07:10】Nathan Labenz: 我已经有一段时间的论文了,现在说可能还为时过早,但你肯定会对它有一个看法,但是,再次回到我一直错误的地方,我预计会发生比我们在经济中看到的更多的转变。如果你给我看了 2022 年的《神鬼寓言》,然后问我,这个模型推出后失业率是多少?我会说,我不知道,但肯定比我们目前所经历的要高。是的。那么为什么呢?这一直是我在这段时间里一直在努力解决的问题。比如,为什么我们没有看到更多?我得出的一个答案是,人们都被困在自己的方式中,并不是每个人都像我一样热心,这需要时间。但同时,当我们看到知识工作者的下降时,情况也会突然发生逆转。正确的?因为现在我将有一个更模仿的选择,我可以尝试去雇用一个人,或者我可以插入 AI,这在很多方面都会更容易。正确的?我不必经历整个面试过程。我有点知道我会得到什么等等等等。我不需要告诉您为什么 AI 员工是一个很好的外形。您认为我们是否开始看到这种转变,现有企业是否能够及时采用以避免受到干扰,或者是否仍然会出现我没有预料到的瓶颈或阻力点?我预计还会有更多的干扰。我认为只要模型是尖峰的,我们就需要房间里有很多人
【1:08:43】Flo Crivello: 因为模型上的洞非常危险。不只是像 AI 那样,存在危险。他们只会有害。它们确实对系统有害。因此,无论人类多么昂贵,他们都将通过堵塞这些漏洞来谋生。现在关于现任者是否能够采用这个这个这个这个东西,我认为只要它是尖锐的,我认为现任者就会处于劣势。如果远程工作人员的数量真正减少且没有漏洞,那么我认为即使是现任者也能很快采用它,因为这就像雇用员工一样,而且他们有相应的流程。事实上,我认为他们会在很多创新上继续前进,因为它会有效地拟物化。你会希望 AGI 能够有效地坐在人类座位上,我不认为这是建立 AGI 组织的最佳方式,但它会起作用。较小的组织将处于优势,因为他们将能够在人类填补漏洞的同时短期内找出这个 AI 本地组织。从长远来看,我认为他们将建立一个不那么拟物化的 AI 组织。你知道,经济学家非常喜欢谈论这个。实际上,我大约在 2018 年左右在我的博客上写了一篇关于此的博客文章,名为“坚韧番茄原则”。问题在于,每次发生技术革命时,你都会根据旧范式来思考新范式。你知道? 还有一个故事说,你是你是你,你正在落入这个陷阱,这是非常自然的,那就是你是你是你在旧范式之后调用新范式。所以,你知道,第一辆汽车被称为无马马车。现在,自动驾驶汽车被称为自动驾驶汽车。现在,最终我们将为他们立下遗嘱。你知道?这并不是旧范式所不具备的。这几乎就像我们现在正在与 AI 员工一起做这件事。就像,就像 AI 员工一样强大,就像一个术语一样。这是一个非常强烈的迹象,表明您对产品的看法存在严重错误。我认为,如果你这样做只是为了传达你的产品,那很好,因为定位的本质是你必须针对市场头脑中已经存在的东西进行定位。所以汽车存在,你知道,马车存在。对不起。马车存在。汽车存在,但员工不存在。所以你不可能真的凭空发明出一个新的轮子。 iPhone 做到了这一点。你知道?就像 iPhone 显然不是电话一样。它的意义远不止于此。就像,你知道,你的 iPhone 的使用率就像打电话一样,比如 2%。你知道?它之所以被称为 iPhone,是因为它是一种可以放在口袋里的电子产品。正确的?所以我认为 AI 员工就是其中之一。行业需要很长时间才能找到新媒体本身的信息。 我认为史蒂夫·乔布斯是在说,就像,你知道,电视上的第一个内容更容易,比如录制的广播脱口秀节目。他们拍摄了一个广播节目,然后安装了摄像机,现在你就得到了电视内容。这就是脱口秀节目。或录制的戏剧表演。人们花了令人惊讶的很长一段时间,大约十年或二十年才意识到这一点,等等。我可以移动相机吗?等待。我可以拥有多个可以剪切的摄像机吗?你知道?我可以 我可以 我可以改变场景吗?我现在可以做很多疯狂的事情。而且,而且,而且,这是危险的,因为这是吃力不讨好的工作。一旦你意识到这一点,你就会发现它是如此明显。这就是为什么当你观看像《公民增益》这样的老电影时,你知道,或者说,希区柯克有很多这样的电影。就像,你你你你就像,没有做什么特别的事情。为什么每个人都为《公民凯恩》疯狂?就好像,嗯,实际上,这在当时是开创性的。就像披头士乐队就是这样。你知道?就像,嗯,你知道,这在当时确实是非常创新的。所以我认为,现在,也在 AI 游戏的那个阶段,我们有了 AI 员工,所以现在是试图弄清楚 AI 组织是什么样子的阶段。我认为这是年轻人的游戏,也是年轻公司的游戏。我认为历史上现任者确实很难回答这个问题。
【1:12:44】Nathan Labenz: 您是否对任何预览感到有信心,或者现在说还为时过早?或者你可能会说,你认为有哪些思想家在这方面特别领先?
【1:12:54】Flo Crivello: 我见过并喜欢的关于此的唯一帖子来自 Duarkesh。那是不久前的事了。是一年前的事了。对我来说也是如此。是的。是的。他问,身份主张是什么样的?他指出,我认为这是一个出色的直觉泵。他指出他就像,看。你知道,谷歌的桑达尔每年的薪水是 1.5 亿美元左右。你知道?因此,显然,尽管代币吞吐量实际上很低,但公司还是乐意为某些代理商支付 1.5 亿美元每年。就像,它不像桑达尔。这就像每秒发出 2,000,000,000 个代币或其他什么。正确的?就好像他有非常好的令牌一样。正确的?那么现在这意味着什么呢?比如,你可以了解为模特和经纪人付费的意愿。 Robin Hanson 写了这本书。我现在正在看它,我的时代,它也探索了很多这样的主题。正确的?它谈到你读过它吗?真是棒极了。强烈推荐它。
【1:13:44】Nathan Labenz: 是的。是的。我的意思是,它笑只是因为我试图和他一起做一个关于那本书的播客,但它走向了一个非常不同的方向。所以它只是让我想起了那段记忆。但我认为那本书很棒。我认为它是如何作为一个前提并真正运用它的入门书或示例,它是精英。
【1:14:03】Flo Crivello: 是的。这是一本长篇大论的实验。因此,对于那些不知道它是什么的人来说,m 代表 Emulated Mind。就像,嘿。你知道,在二十世纪二十年代末,我们都会拥有创建模拟思维的硬件。所以,我们正步入正轨。就像,我们只是不知道如何开发软件,所以我们要做的就是模仿真正的人脑。不完全是正在发生的事情,而是正在发生的事情。你知道?就像,LLMs 是在人类令牌上进行训练的,所以这基本上就是发生的事情。所以就像是所有这些即兴重复,嘿。当这种情况发生时,这就是你能做的所有疯狂的事情。我会谈论其中的两个,因为我不想花全部时间,而且每个人都应该真正阅读这本书。但只是为了让人们体验一下,拥有这些本地 AI 组织听起来是什么样子,以及当你有人类时你可以做而你不能做的事情。第一个是分裂。所以我认为这就是为什么这涉及到我之前所说的内容。就像,不要创建多代理组织。尽可能多地进行内部工作。注重内在。我们可以稍后再回来讨论这个问题。但尽可能多的内部工作由一名代理人完成,而且只能由一名代理人完成。为什么仅限内部? 因为如果拥有城堡钥匙并有权访问银行帐户和存储库以及秘密密钥的代理也是提供客户支持的同一代理,那么您可能会遇到安全问题。因此,出于安全原因,拥有多代理系统的速度可能是件好事。但好吧。所以你有一个单一的代理人。现在是单一代理人,你知道,这是肯定的。它走得更快。它每秒发出的令牌比人类多,而且不会休息。但在某些时候,您将需要比单个 LLM 循环所能提供的更多令牌。那么你做什么呢?好吧,您有多个 LLM 循环正在运行,它基本上就像代理复制自身一样,例如分叉自身,对吧,并创建子代理以及工作流、动态工作流等等。正确的?这就是 Robin Hanson 谈论的一件事。就像,你知道,你可以想象你从字面上问一个人,在书中,他说你可以要求一个模拟思维来构建一个非常复杂的东西,比如操作系统,就像数十亿行代码之类的东西。一开始,它只是将其提升到最高级别,并提出其操作系统的最高级别架构,然后它会分叉自己,每个子副本将负责这个最高级别事物的一个构建块。然后它们中的每一个都会递归地继续分裂自己,这样它就是一个分形。 就好像图中的每个节点都在他们的头脑中得到了整个图景,并且图中的每个节点都在致力于实现。然后它们都会再次冒泡,你可以想象多次上下移动。在三个外轮中,你就有了一个操作系统。只是,当他十多年前写这本书时,这只是一个古怪的想法。现在我认为目前正在发生的事情非常清楚。正确的?这就是正在发生的一件事,这非常有趣。另一件我还没有看到的事情发生在 LLMs 上,但这是一个关于跨组织协作是什么样子的有趣的思想实验。你能做的就是创造不可证伪的协议。所以假设我来找你,我说,内森,我有一些他们无法告诉你的信息。但我可以告诉你,如果我能告诉你,你会同意,并且会把你所有的钱都给我。正确的?是的。我现在你不会把你所有的钱都给我。这就是这有点太容易了。你知道?但如果我能向你证明这一点,如果我能绝对肯定地向你证明,是的,如果你听到这个信息,你现在就会把你所有的钱都给我。你知道?只是我不能给你而已。你对微软做到这一点的方式就是克隆你自己。你克隆了我。我们把我们俩放进一个会自毁的盒子里,然后他们说话。你和你的男人有一个按钮,这是它与外界唯一的沟通方式,就像,是的。把你所有的钱都给他。正确的? 所以它是你的复制品。所以这是你同意的,所以你拥有其加密货币兄弟的零知识证明。好吧,好吧,我想,就这个吧。你有这个 z k 的证明。这就是我想到的事情,我认为这就是我们在未来几年内很快就会在 AI 本地组织中看到的事情。
【1:17:59】Nathan Labenz: 我认为,这在很多方面都会变得很奇怪。你最好希望他们也不要突破这个框框。这是我们如今将特工放入盒子中时可能会产生的另一个担忧。首先让我们再讨论一些相对平凡的事情,然后我们可以缩小一些真正的大局考虑。但是,正如您之前提到的,我不知道,也许两个月前,您确实有过这篇高度病毒化的帖子,出于节省成本的原因,并且因为您不需要上帝安排会议的原因,将很大一部分工作量转移到开源模型。但我们现在在哪里?让我印象深刻的是,当你谈论只有一名经纪人时,这似乎与此相悖。当您过多地跨过代理提供商时,您还会失去一些优势。当然,还有一些专有的提供商拥有他们的代理家族,他们越来越多地训练他们最好的模型来分别委托给他们的俳句。比如,我们现在该从哪里摆脱困境呢?开源更便宜的模型是否仍然在 Lindy 队友中发挥重要作用,或者我们今天是否又回到了基于云的代理?
【1:19:22】Flo Crivello: 不,我们是相当开源的构建。我喜欢,看看它便宜得多。其次,它的价格便宜得离谱。就像,我们真正喜欢的最便宜的是 Deep DeepSeek Flash,它是免费的。那该死的东西是免费的。你知道?因此,当您尝试使用代理时,它会加快很多代理的速度,例如,账单确实会很快上涨,而 DeepSeek Flash 令人难以置信,您知道,而且速度也相当快。你知道,我们确实发现,当你进入智力的上层时,如果你看一下 q m case 3 或 GLM 5.2 等,我仍然对这些模型印象深刻,它们非常棒。我们越来越多地将它们视为 Lindy 许多部分的主要驱动程序。但我要说的是,这些人与边疆人之间的差距正在缩小。坦率地说,kimikis 3 并不比 Sunet 或 Opus 便宜多少。所以,但是,不,否则,我的意思是,就像,我,是的,我确实认为开源模型就像,如果你降低价格,如果你不介意使用这个产品,我会说,是的,你确实有一些关于缓存的东西需要解决。就像,是的,想法的推断在缓存方面并不那么好,但他们正在迎头赶上。看看你知道的,如果你看一下,像深海深海闪光,它是 Sonnet 4.6 级别的,有点少,但有点像。 Sonnet 4.6 是一个非常好的关卡,对于大多数用例来说都是一个非常好的模型,而且它的价格实际上便宜了 100 倍。你知道? 因此,即使您因为缓存而错过了两次,您仍然可以便宜 50 倍。这确实是一个很大的区别。支出之间的差异,例如一千美元或五万美元。所以,Noah,我认为对于任何认真构建和操作 AI 代理的人来说,开源模型现在都是堆栈的必需部分。
【1:21:00】Nathan Labenz: 那么你觉得如何
【1:21:01】Flo Crivello: 决定
【1:21:02】Nathan Labenz: 在哪里集成它们,特别是因为它以前听起来并不容易,但是在您拥有工作流程并且工作图表中有节点的情况下,您可以进入特定节点并说,好吧。我们知道这里的输入和输出是什么,就像相对受控的环境,所以我们可以进行结构化测试。我做了所有这些,但随着时间的推移,你仍然报告有一些误报,其中模型可以通过一系列测试,你会对它感觉良好,然后如果你开始与用户一起测试它,你会得到类似的反馈,嘿。就像,它变得愚蠢了,我不是你知道吗?不知怎的,即使有一个更加结构化的环境让 AI 工作,它仍然很难测量。现在,当你处于这个非常开放的环境中时,只需在 Slack 中标记 Lindy 并向其发送任何内容,似乎这个问题的难度就会急剧增加。那么你是如何处理它的,我们在开源模型方面学到了什么,甚至没有那么多,我认为 Anthropic 有时确实对此提出了一些很好的观点。显然,这个故事还有更多内容,但我确实认为他们在某些方面很恰当,他们说,在某些情况下,它与开源和闭源无关,而更多地与功能水平、价格和功能有关。因此,我想,无论您是要开源还是只是使用俳句,您如何决定何时可以这样做?
【1:22:31】Flo Crivello: 很好的问题。我们发现您几乎不应该使用多个模型为同一代理提供动力,并且我们发现此规则的一个例外是当您启动新的空白子代理时。强调空白是因为有两种类型的子代理。您有一个空白子代理,然后有一个完整的子代理,它继承父代理的上下文窗口。你不想这样做的原因是因为缓存。显然,我们只是痴迷于缓存,因为否则它的成本就太高了。就像,从经济角度来看,它们几乎不与缓存一起工作。如果没有缓存,它们就无法工作。所以缓存是必须具备的。所以我会给你一个例子,我提到的验证器系统。所以就是这个 LLMS 法官。顺便说一句,强烈推荐任何构建 AI 代理的人。就像,这是您可以做的最容易实现的目标之一,可以大大提高 AI 代理的可靠性。这就是第一步。就像有一个验证器一样,简单的实现就是,你要求代理做某事。它做到了。或者,就像它提交一个行动候选者一样。你拦截这个动作,然后你问它,你确定吗?你知道?从字面上看,如果只是这样,你确定吗?你的评估已经受到了影响,这太疯狂了。不应该是这样,但事实就是如此。现在,如果您将其更改为实际提示(在我们的例子中为 10,000 个令牌),那么这将是一个非常大的验证器提示。 如果你改变它,那么你实际上是在给它一个清单,并且会返回令牌。现在好多了。就像,根据我们的经验,您可以获得高于办公室级别的表现。现在你就可以更进一步了。您可以拥有一套联合验证器,其中一些验证器可能是确定性的。举个例子,我们和业界其他人发现的一件事是,Sunet,我的意思是,今年的云模型有一天出现了日期错误。正确的?这是他们提高它的一种方式。正确的?就像,嘿。您已拥有 AI 组织。是不是日期弄错了。当您像我们一样构建 AI 行政助理时,这是一个问题,它的一半工作是安排会议。好的?你不能弄错日期。所以我们所做的是我们创建了它,它是我们拥有的模块化架构。这真的很简单。它就像一堆视频,然后就像一个为那些知道这意味着什么的人设置超时的 promise.org。因此,每个人都有一秒钟的时间来决定要做什么。如果他们没有提交判决,那么超时,代理只需提交操作即可。并且我们有一个验证器,其任务是检测在操作中提交的日期,并且我们已提示代理在日期中包含工作日。所以它从不说从不说 7 月 28 日。它说星期二,7 月 28 日。好吗? 如果这样做,那么您可以获得确定性值详细信息,用于检查一周的日期是否与提交的日期匹配,而这只是一个正则表达式。即时、预先、循环中没有 AI,这就是联合验证器之一。但即使是由 AI 驱动的验证器,一开始你也不想要,我们所做的是,如果我们有 Sunnet 作为主代理,而我们有 DeepSeek Flash 作为子代理,验证器呢?但实际上,因为当你有缓存命中时,它的成本要便宜 10 倍。实际上,除非您要使用的型号便宜 10 倍以上(在 DeepSeek 闪存的情况下可能如此),否则可能不是因为缓存较差。你知道?如果是这样的话,您实际上确实想保留相同的模型。所以这要聪明得多。就像,保持相同的模型实际上是值得的。如果你分叉你的代理,这也适用。就像这样,你可以回收缓存吗?顺便说一下,有趣的注释。当你有这个验证器时,如何重用缓存?你知道?因为问题是更改工具集会使缓存失效。好的?因此,我们的做法是,验证器作为代理,验证器操作始终包含在其工具集中,并且无法调用它。我们告诉它,除非你是验证者,否则不要调用这个人。如果他尝试,我们只是喜欢,不。我不会,我不会听你的。我不是验证者。 然后验证者现在继承了代理的所有操作,就像,你现在是验证者了。您可以调用这个您一直以来都知道的操作。因此,这就是您如何不破坏这种模式的缓存的方法。是的。所以分叉代理也是一样的。您只需使用相同的模型即可。你知道,我听朋友、资助者告诉我,我什至不想检查这是否属实。我确信是这样,这让我感到恶心。如果你采用一个代理,并且在大致等效的模型之间的每一回合都更改模型,因此一回合是 SunNet,一回合是 Grok 点 5 或最新的版本,以及其尾部,例如 GPT 5.6,还有一个尾部,它实际上会提高性能。是那个乐团吗?它实际上就像一个随机序列。好的?出于某种奇怪的原因,这个整体的表现优于任何给定的模型。我不想知道为什么,但显然它有效。再说一遍,我们甚至没有尝试过,因为无论如何我们都不想花掉现金。
【1:27:11】Nathan Labenz: 好的。这真是个有趣的细节。我们可以再底线一下吗?听起来很顶级,Claude 还是那种核心主驱动。由于缓存的原因,Claude 也常常是验证器。空白子剂,可以放到深海闪现。考虑到所有因素,这听起来相当沉重。这公平吗?
【1:27:40】Flo Crivello: 不,哦,抱歉。没有意识到你会开始问我,比如,我们目前运行的是什么模型。现在,我们在 DeepSeek 上运行。 DeepSeek 是驱动程序。
【1:27:48】Nathan Labenz: 所以这是司机。哇。
【1:27:49】Flo Crivello: 好的。就是这就是这一切。现在一切都是 DeepSeek。是的。我们正在重新考虑它,因为我们意识到队友,新产品,需要更强大的计算机。顺便说一句,可以随时进入您的临济设置。就像,我们是模型不可知论者。如果您愿意,您随时可以选择奏鸣曲或其他。顺便说一句,我的一个有趣的学习是,无论你多久告诉别人一次,嘿。就像,我们保证基准测试是一样的。他们都是我们的相当多的客户,因此,我不在乎。我想要奏鸣曲,你知道,或者作品,你知道,这是非常过分的。但是,不,现在,这是秘密默认。
【1:28:23】Nathan Labenz: 有趣的。所以你觉得是的。我猜,您会如何描述美国 API 型号(也许具体来说是 Quad)与深度寻求之间的差距。我们听说我们是,我想我们有点经历这些周期,对吧,就像,哦,差距已经缩小了。哦,也许又开了。哦,实际上,它一直都是流行趋势。总是九个月。定性地讲,为了让 AI 员工实际工作,您会如何描述差距?
【1:28:55】Flo Crivello: 更尖了。通常需要多次轮流才能找到有效的方法。所以它最终仍然会找到有用的东西,但最终会花费更多的时间,这会更慢且更昂贵。我知道你问我一些定性的东西,但是你看。大概晚了三六个月。现在,我们有 Sonnet 五个。就像,DeepSeek 基本上是 Sonnet 4.6 是我喜欢的思考方式。当人们被允许改变模型时,你有多担心你,我总是有这样一个问题,首先,我们是处于 AIs 的趋同期还是发散期?我什至在这个基本问题上,我有时感到困惑。
【1:29:33】Nathan Labenz: 嗯。
【1:29:33】Flo Crivello: 还有一种
【1:29:35】Nathan Labenz: 独特但概念上相关的问题是,产品必须在多大程度上与模型共同设计或共同发展才能真正与它们很好地配合?您可以想象,由于您所做的所有工作,切换到 Sonnet 可能会使情况变得更糟。事实上,我听说过有关作品五的事。是的,我听过很多关于 Opus 5 的不同说法,但我认为这些说法还不能轻易概括。但我从某些方面听说,嘿。您可能需要重新考虑很多系统提示,无论 Opus 5 或您的系统提示如何,它可能无法很好地遵循您的技能。它可以更强大,但你必须回去重做事情。那么,是的,您如何看待这一点在实践中的表现?我们我们做
【1:30:18】Flo Crivello: 寻找
【1:30:18】Nathan Labenz: 重要的
【1:30:19】Flo Crivello: 差异,模型家庭之间令人惊讶的显着差异。我以为我想我是你知道的,你和我几年前在一起谈话,而且,你知道,我们将来到这个空间的同一个区域。这并没有像我希望的那么快发生,我希望如此,因为显然,就我而言,这使得模型变得商品化。让我的生活更轻松。实际情况是,不同的模型系列在解释您的提示时存在显着差异。因此,我所说的“家庭”是指 Cloud 和 OpenAI 甚至 Meta。现在它在游戏和 Grok 中被回售。就像,这些人对提示的解释方式截然不同。事实上,每当你有一个新的重大跳跃时,五就是一个非常大的跳跃。你知道,四点七分和四点八分在一起,我认为分词器发生了变化。所以与 4.65 相比,这是非常不同的,比这个差距更大。所以我们拥有我们所发现的东西,而且我们很幸运。这是我之前提到的我们一直在投资的工具的一部分,就像我们有自己的自我优化循环一样。所以我们有成百上千的评估。我想现在已经有一千多个了。而且我们有一个优化循环,它就像一个运行评估并找到类似内容的代理,调整提示以最大化评估中的学校。顺便说一句,你可以说。就像,你能做的一切,现在就把它说出来。 是的,我的意思是,每次新模型出现时,我们都必须运行该循环。你给它一个预算,在这一点上,我们必须给它,比如,数千美元,因为它需要运行大量的开发操作。因此,每次推出新的主要型号时,大约需要 10,000 美元。所以就像是,嘿。这是 10 美元。只需围绕这个新模型重新优化您的提示即可。我们确实发现有很多更新。就像,提示每次都会发生很大的变化。我想说的是,开源模型的行为都非常像云。我想知道为什么。
【1:32:05】Nathan Labenz: 是的。对此我有一些问题要问你。当你进行这种优化时,你是否也像一个国产框架,或者你是否像 DSpy 一样使用,或者我忘记了 DSpy 的精神继承者的名字?
【1:32:18】Flo Crivello: 不不不,都是国产的。是的。
【1:32:22】Nathan Labenz: 但这是一种
【1:32:22】Flo Crivello: 的
【1:32:24】Nathan Labenz: 自动优化过程,你喜欢,这里有一个评估集。这是正确的。自动优化您自己的提示,以攀登我们为您准备的这组山丘。
【1:32:34】Flo Crivello: 这是正确的。这是正确的。是的。 gPA 就像生成帕累托前沿或类似的东西。
【1:32:39】Nathan Labenz: 是啊。
【1:32:40】Flo Crivello: 就是这个。它看起来像是在寻找帕累托边界。所以它只是在寻找所有评估集中的最佳提示。我们现在正在考虑调整系统,以便我们可以为评估分配权重。嗯,这个评估相当于另一个评估的 10 个,因为它非常重要。但现在,就像平等对待每个评估一样。
【1:32:58】Nathan Labenz: 如何在整个模型情况下将其作为一个维度进行微调。如果我回到过去,这是另一回事,我想,我肯定期望比我们得到的更多的微调。 OpenAI 已经退役或即将退役,我想也许在这一点上已经触发了他们的微调产品的退役。我们有思考机器,试图用自己的模型来回答这个问题,而这个模型是专门需要微调的。是的。这会成为 Lindy 队友未来的一部分吗?是的。
【1:33:30】Flo Crivello: 我认为微调是最后的结果。一旦你有其他选择,你就会这么做,因为这是一件非常痛苦的事情,而且价格昂贵。但它变得容易多了,因为现在我们有了 AGI,所以你可以要求 Cloud 为你进行微调。只需给它一个数据集即可。将数据集放在一起仍然很复杂,而且清理也很复杂,而且仍然很痛苦。所以这是一个较少的结果。这不是唾手可得的果实。在进行微调之前,您应该做完其他所有事情,包括下船。但是,是的,在某个时候,到达那里,这就是为什么很多公司是第一个进行微调的公司,因为他们已经存在了容易实现的目标。在某些时候,他们有资源进行微调。所以它确实有道理。它确实可以让您以更便宜的价格获得更高的性能。你认为那个
【1:34:11】Nathan Labenz: 比如,您认为人们在进行微调时应该考虑多广泛的问题?显然,极端情况是每项任务进行一次微调。您绝对可以进行多任务微调。说我们想要制作自己的通用模型,该模型具有与大型模型相同的行动空间广度,这可能会进入相当具有挑战性的领域,但它在某种程度上与我们的模型相似。当人们开始进行微调时,你会如何指导他们思考多大的问题?
【1:34:46】Flo Crivello: 大多数人不应该进行微调。我认为,如果你大规模地工作,你应该进行微调。那么你的规模越大,你就越花哨。但我多年来开发的一种元启发法通常是,你应该非常重视简单性。非常强调。而且我认为开始进行多个微调太复杂了,因此不同的多个用例和用户以及模型路由器就像您不想要的那样。不,不,不,只有一种型号。你知道,你不像我说的那样,你不会中途切换模型。如果你进行微调,你只需微调到一种模型即可。当然。好的。凉爽的。我想我又想了一下,这就是我提到的极其简单的元启发法。但我发现自己一直在回想的是,因为我花了很多时间思考上下文和记忆,现在,我们的记忆就像存储在文件系统上的数百万个令牌,以及这个非常非常复杂的记忆代理。确实感觉记忆属于重量。这确实感觉有点像黑客。因此,对此有一些话要说。我认为,最终,在拥有无限资源的情况下,我想做的是为每个用户创建一个 LoRa,因为 LoRa 实际上训练起来相当便宜。所以现在不再是现在你用它来做梦,因为你不能每十五分钟重新训练一次 LoRa。你必须每天或每周都这样做。你知道? 而且你会并且这是巨大的基础设施挑战,甚至,所以你必须解决所有这些 LoRa 的问题,就像存储不是问题一样。但是,LoRa 的推理时间切换是一件非常痛苦的事情。培训流程以及所有这些内容都表明,祝你好运。所以这是有道理的,因为我认为权重比令牌更具压缩性。
【1:36:22】Nathan Labenz: 是的。我不知道你是否对持续学习的伟大地平线扫描有什么想法,但这又是,相当长一段时间以来,我一直在想的事情,孩子,如果有一天,它可以像一个关键的洞察力一样简单,我们很快就会进入一个非常不同的世界。
【1:36:43】Flo Crivello: 我有一种感觉,我所描述的是迈向机器学习的一步,但它不是最后一步。我认为最后一步,我想,我想,痛苦的教训会给你,就像,推理和训练需要是一体的。就像,我们无法将它们分开。你知道?我认为这就是整个领域现在正在寻找的东西。我同意。一旦我们到达那里,一切都会变得疯狂、可怕,而且非常、非常、非常不同。但是,是的,我想我们都带来了我刚才提到的 LoRa 东西,就像,看。这是一个工程问题。你知道?你可以算出来的,尤其是现在我们有了大兵。所以是的。我认为 LoRa 的事情将在未来六个月内很快发生。我认为甚至他们的前沿实验室之一也可以做到这一点。老实说,我认为这是 OpenAI 的微调产品做得非常好的事情之一。他们显然正在做这样的事情,因为它们允许您进行微调,然后您的微调模型将具有与基本模型相同的速率限制。我一直对这项工程成就印象深刻。现在,令我惊讶的是,他们竟然如此远离它,但我也同意你的指导。我肯定会告诉人们现在不要急于进行微调。这是一个缓慢的周期,您可能可以用较少的总工作量获得所需的可用模型,而不必以这种方式胡闹。
【1:38:03】Nathan Labenz: 100%。所以你谈到了可怕的东西,这可能是一个很好的过渡,不是下半场,因为我们已经讨论了一段时间,而是这次对话的第二阶段,只是缩小并查看超级大的 AI 图片。也许我会让你选择关于中国模式的主题顺序,以及如果应该对它们采取什么措施,因为你最近确实发布了一些东西,我认为,考虑到你正在深度寻求经营你的公司这一事实,这是相当违反直觉的。我会让你在那里表明你的立场。但是是的。如果这发生在大局之前或之后,我们在哪里,天啊,我们刚刚发生了公开的事情。谢谢。这意味着什么?应该采取什么措施?是的。我正在尝试创造这个。我们会看到
【1:38:48】Flo Crivello: 如果它粘住了。
【1:38:49】Nathan Labenz: 前几天我搜索了它,因为我自己实际上刚刚从中国回来,我想,怎么还没人称这张开放面孔呢?我将是第一个开车的人。
【1:38:56】Flo Crivello: 开门怎么样?因为那是
【1:38:59】Nathan Labenz: 它是什么。这是一扇敞开的门。我坚持坦然面对纯粹是出于震惊的价值,我想,如果没有别的原因的话。但是,是的,我们可以在思想市场上与它抗争。我想你告诉我我们应该首先讨论什么,我想这在某种程度上取决于中国模式的论点是你的大局关注的上游还是下游。
【1:39:22】Flo Crivello: 开脸事件非常令人担忧。我认为这是迄今为止发生的最令人担忧的事件。我知道实验室里也有我的感受。就像我在实验室的朋友或他们中的一些人感到恐慌一样。就像,现在有一种恐慌的气氛,就像空气中弥漫着强烈的恐惧一样。就是这样。那么这就是我们现在所处的位置。就像 2026 年 7 月一样。我们有 AGI。我们正处于起飞阶段,但我们还没有找到这种一致性。就是这样的。你知道,当前的时间线看起来太接近 ELIZER Yutkovsky 的文章了。现在说到中国车型,在品牌新闻中,中国车型。看。我我我还好吧。首先我要说的是,我一直在谴责这里的低质量话语。这是非常令人失望的,因为我认为技术是不同的。你知道?就像,谈话的质量是为了工作。正确的?文化工作。我想,好吧。任何。你知道?但这就是技术。这是新事物,我们不能把所有的东西都放在一起,只是在想法市场上保持礼貌和文明,然后在对象层面上处理每个想法。就像,意思是,不要攻击每一个意图。你能只攻击解决论点并只是提出错误吗?你能不能别假装这不是我说过的话?真是可笑啊。这就是他们可以发布的内容,他们大胆地说,我们不支持禁止开源。然后人们就会说,哦,我简直不敢相信。就像,引用他们显然没有调整过的东西
【1:40:55】Nathan Labenz: 读,
【1:40:57】Flo Crivello: 他们说,哦,他们支持禁止开源。所以我就先这么说吧。所以请大家吃一颗定心丸好吗? Stop calling everyone the retards.我最近发表了一篇博客文章,所以我想,嘿。 We I I think Chinese will also be banned.而我,被那些所谓聪明而有成就的人(包括著名的风险投资家)叫去延迟 50 次。现在,许多其他著名的、有成就的聪明人通过私信和消息伸出援手,并得到了很多支持。 My position is basically Anthropics.我讨厌这么说,因为人们说,哦,你只是一个 Anthropic 盾牌。但你看。我有时间戳。就像,我一直在推特上发布我的全部立场,在 Anthropic 澄清他们的立场之前,他们已经掌握了整个事情,而我的立场完全相同。 I don't have anything against open source. I may, but I'm undecided.我确实认为开源可能会增加生存风险。让我们把它放在一边。我还没有决定。 This is not the crux of my position right now.上帝保佑开源。对于创新很重要,对于包括我在内的公司也很重要。 Like, please, open source.好的?我反对中国的前沿模型,无论它们是开源的还是闭源的。 And here's the the the reasons. Or number one, they're obviously distilling.非常清楚。因此,您将美国开源模型公司置于不公平竞争中,并将闭源模型公司置于不公平竞争中,因为它们不允许进行蒸馏。你知道? 只是这至少是违反服务条款的,如果你采取了技术措施来规避模特公司为防止蒸馏而采取的任何保护措施,那么这可能是合法的,而中国模特显然已经做到了这一点。所以它是经过蒸馏的,这是不公平的。正确的?现在有人说,是的。但这些公司也提炼了人类数据。这不是蒸馏的意思。事实并非如此。就像,如果你对人类数据进行训练,它会花费你数十亿美元,实际上是数十亿美元。如果您在 AI 数据上执行此操作,最多会花费数亿美元。所以这是一个巨大的不公平优势,而且它占你成本的很大一部分只是为了实现你的不公平优势。这是第一。这是不公平的。
【1:42:56】Nathan Labenz: 第二,
【1:42:58】Flo Crivello: 非常务实的是,我们不希望中国模式在美国运营。今天,你知道,这让我心碎,因为我是美国公民。 I'm a proud American citizen.我是一只鹰。当我与自己的产品交谈并询问天安门发生了什么时,它告诉我,我很抱歉。我不能谈论这个。这是一个问题。你知道?就像,这些模型最终会受到 CCP 审查和 CCP 政策的约束。你不想要那些模型。这基本上相当于成为美国领土上有史以来最伟大的外国宣传工具。 And there is just ask your LLM of choice.询问 Claude。嘿。 Tell me the precedent we have of banning American, like, foreign influences in the country.就像,这三个二十世纪的广播行为,就像去年刚刚发生的 TikTok 事件一样。 Like, we we do that all the time.你知道?那么这些模型就不仅仅是宣传工具了。他们很代理。他们实际上是在经济领域做事。 You don't want the CCP to run chunks of the American economy.呃。 Then finally, even if none of that was the case, maybe those models are playing fair and square. Maybe they're not representing foreign interest. Maybe they're just better.所以我认为这里很多人都在沉迷。我是作为一个自由主义者这么说的,但他们却沉迷于我所说的天真的自由主义。正确的? It's like, well, let's beat them in the marketplace then. And I'm I'm like, you know, like, I actually and, again, I said that as a libertarian. 就像,保护主义并不总是坏事。我想你确实想保护你国内的 AI 冠军。 Anthropic 不能这么说,他们声称,而且我相信他们,这不是他们这样做的意图。我会 100% 相信这一点,因为他们对于创始人来说始终如一。十年来我一直担心 x 风险。正确的?所以他们一直如此一致。但你看。我可以这样说,因为另一个话题。嘿。我们想要本地的 AI 冠军。呃。这是一场国家安全之战。我们不想用空洞的数据或工业基础来掏空一个基地。你知道?所以这不是关于中国模式的原则,而是关于宣传。对于我们的经济而言,这与英语无关。这是关于公平的。这是必须的,它是为了保护。好吧。让我尝试给予
【1:45:10】Nathan Labenz: 你
【1:45:11】Flo Crivello: 一些
【1:45:11】Nathan Labenz: 您可以回应他们的反驳。
【1:45:14】Flo Crivello: 我
【1:45:16】Nathan Labenz: 我认为,我对以下论点更有同情心:所有 AI 的上游都存在对人类知识的大规模重新挪用。你可以说这不是蒸馏。当然。你可以说美国公司花的钱比中国公司花的钱多得多。我认为这也是无可否认的事实。但如果我只是有点感觉公正和公平呢?我特别是因为我们阻止他们使用 Claude。正确的?我们不是,这不像我们说的那样,嘿。您可以购买所有您想要的 Claude。正确的?所以我们说我们已经穿好衣服了。 Clad 的制造商强烈主张芯片限制,并且他们也试图首先拒绝向中国出售他们的模型。 Claude 的整个前提或 Claude 的整个存在都基于这样一个想法:我们盘旋在我们可以从数字中找到的各种形式的所有人类知识中,你必须相信这包括整个中国的数字化遗产。现在我们就像吸书一样,我不在乎有些书在这个过程中被毁掉,但这并不是每个人都同意的。因此,考虑到所有这些事实模式,我确实感觉有点奇怪,然后我们会划清界限并说,好吧。就像,这是人类的同意。这才是真正重要的同意。现在我认为他们应该被允许与他们想与之做生意的人做生意。如果他们想采取措施阻止蒸馏,我认为这是他们的特权。 但我完全不相信国家有责任介入并采取某种治国之道来试图惩罚或阻止这种蒸馏。对我来说,我有点不知道。信息希望是免费的。知识趋于扩散。这不像 Anthropic 有一个超级或任何 AI 公司有一个超级道德高地,因为我没有得到我的训练数据份额的支票,而且他们也因为蒸馏查询而获得报酬,每当他们不想得到报酬时,所以这可能不是重点。但我不知道。我不是我不知道。我发现自己有点站在中国弱者一边,就像是,伙计,你有一个对你不利的平台,你可以从哪里获得一些知识。这种观点有什么问题吗?
【1:47:32】Flo Crivello: 我认为我们确实希望对中国不利。我们不希望中国赢得 ASI 竞赛。我不是律师,所以我不会对您为完整制定服务条款而可能采取的确切法律途径发表意见。所以我只是观察这一点,我作为一个曾经在 Uber 工作过的人这么说。通过司法部门对中国企业伸张正义极其困难。几乎不可能。所以不是律师。我不明白这里的技术细节,但我只是观察并以此开始。而且可能需要很长时间,到那时,已经造成很大的损害。然后我还会观察到,是的,公司正在对每个人都可以使用的所有这些语料库进行培训。这是一个公平的竞争环境。问题是,一旦你付出巨大代价做到这一点,他们确实会损失数十亿美元。如果可以的话,如果可以的话,您可以从这个训练数据集中创建该工件,该工件称为模型。现在其他人可以转身,而不是这样做,这花费了数十亿美元,他们转向这样做,这比那花费少得多,他们复制你,他们赶上你。如果你这样做,你就会扼杀创新。就是这样,这不是什么新鲜事。它被称为知识产权和专利法。这正是人类所做的。正确的?就像你作为一个人一样。你就像一个研究员。你想了几十年。你做所有这些工作是因为你在研发方面有很多钱。 你想出了一个想法,它的代币数量要小得多,但比你训练过的所有东西的语料库更珍贵,窃取成本也低得多,你如何保护这个想法,以收回你的投资,以便生产它?这就是所谓的专利。这就是所谓的 IP。正确的?这不是什么新鲜事。如果您采用与现在相同的标准,例如制药行业,您将拥有非常便宜的药物,这很棒,而且您将不再有新药。你将彻底摧毁制药行业的创新。我认为这就是为什么你会发现所有这些人都支持开放模型,因为人们喜欢免费的东西。而且你无法真正衡量由此带来的未来创新。您所看到的只是获得免费模型。你知道?看看。我是其中之一。你知道?所以我的言论违背了我的利益。正确的?就像,我的公司在经济上依赖于那些非常非常非常便宜的型号。但我现在也遇到了协调问题,因为,就像,当这些模型已经存在时,我不能不采用这些模型,因为我的竞争对手也会这样做。所以,如果它们在外面,我就必须收养它们。我希望它们能被全面禁止,这样我们就会喜欢我之前提到的四个原因。就像,保护我们的冠军一样,没有 CCP,就像,影响国家或运行国家的部分地区,并且拥有公平的竞争环境。
【1:50:02】Nathan Labenz: 我想另一个简单的论点是,我认为我们的前沿公司做得很好。你知道,也许在某个时间点可能会改变,你知道,随着事实的变化,我认为我们对此的反应,你知道,可能也应该改变。但我觉得目前说“我们需要保护 Anthropic 的收入运行率”这句话并没有那么令人信服。就像,他们是你认识的吗?正确的。他们或许可以为模特提供服务。
【1:50:27】Flo Crivello: 负载。不,那是公平的。他们这是公平的。
【1:50:29】Nathan Labenz: 是的。
【1:50:31】Flo Crivello: 但你仍然剩下。就像,你你你你需要它们一样,金钱的运作方式是它是分配资源的一种手段。再说一遍,归根结底,移动上下文是与底层数据集一起的。就像,前沿模型上下文就是这些数据。而你为这个底层数据集之间的通道提供资金的方式,包括现在主要的强化学习和模型,你需要很多钱。正确的?如果你找到另一个人复制这个人,然后关闭这个数据集,基本上,这个人现在拥有的资源更少了。就像,你杀死了那个频道。你实际上正在减慢创新速度。所以,事实上,我知道很多厄运者都是出于这些原因支持开源,因为它实际上减慢了 AI 的创新。所以如果你想让 AI 不断创新,让模型不断改进,那么你实际上在某种程度上是反开源的。并且特别抱歉。反反中国的开源模式,这是依靠不公平的做法。
【1:51:25】Nathan Labenz: 最近另一个不完全是最高质量的 AI 讨论的时刻是 Dean Ball,该节目的朋友,表示开源模型正在减速,显然因此被拖累了。但我确实认为这是恰当的。我确实觉得这是一个时刻,你知道,我们在这里,两个终生的技术乐观主义自由主义者,我们正在努力应对这一事实,即这个人可能会有所不同。正确的?我们必须愿意改变我们的一些原则,因为我们的技术乐观主义自由主义范式并没有完全考虑到 AGI 或递归自我改进或 ASI 或其他任何想法。所以我有点像我不知道。有时,我可能必须在正常或公平或尊重法治承诺方面更加灵活一些。如果这是 AI 的标志之一,这里就是奇怪的同床异梦。如果我想让事情进展得慢一点,也许我应该咬住边境公司的风帆。
【1:52:26】Flo Crivello: 是的。我我同意,我认为 AI 在很多方面都是史无前例的,它确实引起了每个人的关注。我认为你应该很大程度上忽略,就像你一样,世界没有义务让你变得简单,并给一切贴上简单的自由主义者或左派标签。你知道?我认为,尤其是随着范式的变化,就像这些,就像,简单的心理模型,就像,地图不是领土。当领土变化非常迅速时,我们应用了简单的模型,地图就被打破了。我认为我们就是其中之一,在现在的这个时代,地图正在以多种方式突破,许多曾经正确的假设以及我们在其之上建立的心理模型和地图不再正确。是的。所以,我的意思是,我再次表示,我将完全支持对美国沙特全面禁止中国型号。看来我和我还没有听到令人信服的消息
【1:53:16】Nathan Labenz: 反驳
【1:53:17】Flo Crivello: 现在。所以你是说,你你你你确实对我的四点之一提出了真正令人信服的反驳,这是保护主义观点,我同意这是最薄弱的一点。就像,嘿。他们做得很好。你知道?我认为对保护主义的抵制是非常合理的。他们确实伤害了消费者。很好。您仍然不希望 CCP 在国内有肮脏的手指。正确的?
【1:53:40】Nathan Labenz: 不过,我们可以在那里解开威胁模型吗?因为我有点像,好吧。我不知道你在哪里运行你的充满推论的环,但是,就像大多数运行中国模型的美国公司一样,不会将 DeepSeek API 称为 DeepSeek。正确的?他们正在使用一些是的。美国推理提供商。是的。所以他们不能像地毯一样拉动模型本身。他们可能在那里有潜伏的特工。我认为,通过 JSPACE 和各种可解释性技术,我们在这方面已经做得足够好了,我无论如何都不会称其为已解决的问题,但是,就像我在人类研究中看到的那样,当他们使用稀疏自动编码器的团队与没有稀疏自动编码器的团队进行比较时,这些技术确实使他们能够以越来越高的效率和可靠性在模型中找到这些内部睡眠代理风格的问题。所以我乐观地认为,即使他们在 2027 年进行某种训练,你会变成一个邪恶的 AI,我们也能够嗅出这一点并将其保持在可管理的风险水平。然后我还想知道某种市场机制,比如,也许保险应该代替禁令,比如保险要求怎么样?我认为这对于 AI 来说可能是健康的,然后我们就可以开始处理其中的一些风险。如果林德完全由 Claude 提供动力,也许您的保险费率会更便宜。如果它由 DeepSeek 提供支持,并且我们存在一些未知因素,例如,也许您的保险费率更高。 也许这样可以通过风险调整的方式平衡您的总成本。但它仍然让人们利用中国提供的这些全球公共产品,而世界其他国家显然不会禁止这些产品。正确的?我们这样做完全是为了自己,而不指望其他人会效仿。我们很难让人们签署我们的华为禁令。我认为,人们将在巴西或其他地方完全关闭深海的想法,我必须想象,这完全是不可能的。那么,审计、内部和保险呢?就像,我们不能叠加一些类似的东西并到达一个像样的地方吗?
【1:55:47】Flo Crivello: 我会很沮丧。我我我会很沮丧。但问题是它是公共物品。那么谁呢?谁来做呢?顺便说一句,我认为,是的,我们在机械互操作性方面正在取得进展,但这并不是一个尚未解决的问题。就像,我们不知道这些模型里有什么。所以,是的,可能会有一个后门,就像你说的,模型的魔轮,突然间,它会做你想做的任何事情。而只有 CCP 才有这个魔轮。即使它没有,你知道,它也会有反映 CCP 优先级的偏差。再说一遍,这只是最明显的例子,但可能还有更多。正确的?我们不会再这样做,我们不知道。是的,你可以想象重新训练这些模型,但这是谁来做的。如果没有市场需求,他们为什么要这么做?正确的?人们并不是真的那么关心短期,因为这是事关国家利益的事情。你知道?就像,作为一家私营公司,我想,我真的在乎吗?就像,我所有的用户真的经常询问 Canon Mill 吗?就像,作为一名企业主,我想,这与我的兴趣并不直接一致。但作为一名公民,我非常担心。所以,是的,我会支持某种类型的监管,它会说,比如,非中国模式,比如抱歉。未经微调和类似的经过净化的变更模型在美国是不受欢迎的。然后我们需要我赞成使用 FAA 来代替 AI。 我确实认为我们需要一个新的机构来监管这些模式,我认为它可能会负责说,好吧。这个模型是肯定的。我们对它进行了足够的微调,它现在代表了美国的利益。也许我们会有一套评估之类的东西来验证情况是否如此。我肯定会对此持开放态度。
【1:57:24】Nathan Labenz: 我认为反对这种加剧紧张局势的最有力论据是,我们可能需要进行协调控制,称之为减速,不要称之为减速,而是某种刻意的 AI 改进节奏。我们希望中国参与该协议。我远非中国专家,但两周后我确实对一些事情感到非常有信心,你知道,我知道这一切就像,一,如果那里的国家同意,我相信他们可以对他们的公司执行他们同意的任何事情。所以我认为他们实际上比我们拥有更大的力量。第二个是,如果事情真的变得疯狂,与我们做一些交易将符合他们自己理智的自身利益,因为我们确实领先,而且我认为他们会理性地接受很多交易。如果这符合他们理性的自身利益,那么我们有望基本上解决许多信任和背叛问题。但我认为,当我们对他们采取所有这些咄咄逼人的姿态时,我们自己就很难达成这些交易,其中禁止他们的模型对他们的影响确实比我们的其他模型小。他们对他们的影响就会小得多。如果我们禁止他们的型号,对吧,与拒绝向他们出售芯片和拒绝向他们出售 Claude 相比,他们关心什么?但这只是我们不信任你的又一个火上浇油。我们没办法对付你。我们假设你是个坏演员。似乎这让我们很难到达“是的”。我们可能真正需要的最高风险协议。
【1:59:03】Flo Crivello: 嗯,我我认为,对外关系和外交也非常务实。一些存在严重分歧的国家都在设法达成协议。就像,我想我们可以找到一些办法。顺便说一句,我认为那艘船无论如何已经航行了。我认为,我们有充分的证据表明,例如,中国间谍试图进行生物攻击,只是为了在美国领土上进行测试。所以,我,我,我不知道我们在那里做什么,但如果我认为我们也没有摆脱其中的任何东西,我也不会感到惊讶。正确的?所以,你知道,我认为最终,无论我们做什么,无论是否监管模型,我认为他们都会出于理性的自身利益而达成协议。
【1:59:44】Nathan Labenz: 我希望我们理性一点。我希望我们都足够理性,尽管最近受到了侮辱,但仍能采取这些理性的自利行动。当我看到萨姆和达里奥没有牵手的照片时,我确实担心,如果我们的墓碑上有一张照片,我想这可能就是那个。我确实认为这在国际层面上也是一个非常非常现实的风险因素,而且中国人确实在乎被侮辱。他们确实关心这些面子之类的问题。
【2:00:14】Flo Crivello: 我是啊。
【2:00:15】Nathan Labenz: 就我个人而言,我会冒一些风险尝试改善这种关系,并希望为我创造空间,我认为我认为你是对的。我认为回击我是有道理的。你说过,如果符合他们理性的自身利益,他们就会接受,即使我们这样做或那样做,他们仍然会这样做。但我确实想知道,人们为了理性的自身利益而做的事情是否受到骄傲的限制,我只是讨厌这样,因为这样我们就无法实现一些可能在宏伟的计划中产生巨大影响的事情。我认为,当谈到我们在 API 价格与第一方 Quadmax 或 GPT Pro 订阅价格之间看到的巨大价格歧视时,您可能会准备坚守自由主义原则。我不是律师,但是,是的,我再次,我确实认为,如果实际上存在这样的谎言,即技术上禁止公司像他们现在这样积极地提供补贴,我不会感到惊讶。它确实让它们变得非常困难,比如应用程序层的出现。是的。与 frontier labs 正在做的事情一样获得大量补贴的代币竞争是很困难的。这就是目前应用层的现实。在我们今天休息之前,您还有什么想说或想说的吗?这太棒了。
【2:01:31】Flo Crivello: 好吧,如果我没有提到你知道,那我就是失职了,显然,我们都在发行 Lindy Teammate。所以 lindy.ai。我想准备好看到更多,不仅仅是我们,但我相信接下来的六个月将是关于多人游戏 AI 以及关于这个,比如钢铁侠套装。例如,关于这个人类 AI 混合体以及创建这个人类 AI 混合组织的这些产品。是的。
【2:01:55】Nathan Labenz: 同胞。感谢您成为 Cognitive Revolution 的一部分。
片尾
【2:05:19】 如果您发现该节目有价值,请花点时间与朋友分享、在线发布、在 Apple 播客或 Spotify 上撰写评论,或者在 YouTube 上给我们留下评论,我们将不胜感激。当然,我们始终欢迎您的反馈、嘉宾和主题建议以及赞助查询,无论是通过我们的网站 cognitiverevolution.ai,还是在您最喜欢的社交网络上私信我。 Cognitive Revolution 是 Turpentine Network 的一部分,Turpentine Network 是一个播客网络,现在是 A16Z 的一部分,专家们在这里谈论技术、商业、经济、地缘政治、文化等。我们是 AI Podcasting 制作的。如果您正在寻找从停止录制到观众开始收听的所有播客制作帮助,请查看它们并在 aipodcast.ing 上查看我的认可。感谢所有收听 Cognitive Revolution 的人。
References
- 1Lindy 官方作者介绍lindy.ai
- 2Lindy 官方人物页careers.lindy.ai
- 3官方单集页cognitiverevolution.ai


Comments
Sign in to comment.