
晚点聊 178 期速读:从 coding agent 到 AutoResearch,RSI 离模型自进化还有多远
《晚点聊》第178期围绕 RSI 展开:AI 已能在短反馈工程任务中改进模型,但从会写代码到能选研究问题、验证突破并设计后继者,仍隔着研究品位、评测器和可解释性三道门槛。
《晚点聊》第 178 期把一个听起来像科幻的问题拉回到工程现场:AI 已经能写代码、跑实验、改进模型,但它什么时候才算真正开始研究 AI,甚至设计自己的后继者?主持人曼祺与 Recursive Superintelligence 联合创始人田渊栋,围绕 RSI(Recursive Self-Improvement,递归自我改进)讨论了这条路为什么在最近变热、目前哪些环节已经跑通,以及为什么「会写代码」离「会做研究」仍隔着一段距离。本期完整音频时长约 89 分钟,可直接收听《178:与田渊栋聊 RSI:模型自进化如何到来?》。1
先给判断:RSI 已经在局部发生,但还没有闭环
这期节目最容易被标题带偏的地方,是把 RSI 当成一个只有「发生」和「没发生」两种状态的终点。田渊栋给出的路径更像一组台阶:先让 AI 在目标清楚、反馈很快的任务上自动提出改动、写代码、跑实验、验证结果;再让它自己决定下一轮研究什么;最后才可能触及「设计和开发自身后继者」的严格定义。
第一层已经出现了。Recursive 在 2026 年 6 月公开的 First Steps 结果显示,同一套自动化研究系统在三个反馈清晰的 benchmark 上取得了改进:NanoChat Autoresearch 在固定 5 分钟、单 GPU 的预算内,把验证集 BPB 从此前的 0.9372 降到 0.9109;NanoGPT Speedrun 把达到固定验证损失 3.28 的时间从 79.7 秒缩短到 77.5 秒;SOL-ExecBench 则把 GPU kernel 的分数从 0.699 提高到 0.754,官方表述是将距离最佳性能估计的差距缩小了 18%。这些结果说明自动化系统可以在可验收的工程问题上找到有效改动,不等于它已经能自己提出重要科学问题。2
Anthropic 对严格版本的 recursive self-improvement 定义得更窄:一个 AI 系统能够完全自主地设计和开发自己的后继者。Anthropic 同时明确写下三个限定:现在还没有达到、它不是必然会发生、但可能比多数机构准备好的时间更早到来。也就是说,AI 帮人类把研发流程加速,和 AI 自己决定下一代系统应该长什么样,不能混成一件事。3
这也是本文阅读这期节目的方式:不要把 Recursive 的三个小规模 benchmark 当成「AI 已经自我进化」的证明,而要看它们把哪一段反馈环路变短了,又把哪些更难的问题留在了环路外。
为什么是现在:coding agent 把研究循环从几天压到几分钟
田渊栋讲 RSI 变热,没有从一条宏大预测开始,而是从自己的使用体验讲起。他在节目中回忆,自己与 GPT-5 合作写一篇研究论文时,模型已经能根据他给出的细方向,继续找想法、证明定理、写代码、跑实验。过去他需要招实习生或研究助理完成的部分执行工作,现在可以直接和模型对话、交给模型完成。
这里的变化不只是「代码写得更快」。传统研究循环往往是导师提出方向,学生实现代码、准备数据、跑实验,几天或几周后再把结果带回来。导师要到反馈出现时,才知道原来的想法是有效、无效,还是卡在某个实现细节。AI agent 把其中一部分等待时间压到几分钟:研究者提出一个方向,模型写出实验,机器跑完,结果马上返回,下一轮问题也随之出现。
田渊栋因此强调 hands-on。只有亲自让模型写代码、调工具、跑完整项目,研究者才会知道模型究竟在哪些地方比想象中强,哪些地方只是把表面任务做得像样。只停留在高层讨论的人,容易错过这个变化;只把模型当执行工具的年轻人,又可能没有足够经验判断一个问题值不值得做。RSI 把两种能力拉到了一起:一端是对难度、方向和研究价值的判断,另一端是让实验尽快落地的执行力。
他对年龄和经验的判断也因此和当前很多 AI 叙事不太一样。早期 coding agent 的红利更偏向行动快、愿意反复试错的人;当执行成本被 agent 降下来,过去没有时间亲手验证想法的资深研究者,反而可能重新拿回自己的直觉、技术品味和问题意识。这个判断是嘉宾的个人观点,不是节目给出的行业统计,但它解释了为什么田渊栋把「经验」看成 RSI 阶段可能重新升值的变量。4
AutoML 与 RSI:搜索空间从人手工画出来,变成让模型自己找
十年前的 AutoML 也在做「用 AI 优化 AI」,但田渊栋认为两者的差别不小。旧式架构搜索通常先由研究者定义搜索空间、可选操作和评价函数,AI 在这个边界里寻找更好的解。它更像是在一个人已经画好的地图上搜索。
现在的大模型至少多了一层能力:它能读懂一定程度的代码、论文和实验上下文,部分理解被优化的模型和架构,再自己组合工具、提出修改。搜索空间不再完全由人预先列出,系统可以尝试寻找搜索空间本身的结构。也正因为如此,RSI 的难点不再只是让 agent 多写几行代码,而是让它知道什么值得试、如何设计反馈、如何排除一个看似有效却没有真正完成目标的方案。
这一区分可以用三个问题快速判断:
- 固定任务自动化:给定目标和评测器,AI 能否写代码、跑实验、把分数做上去?
- 研究循环自动化:AI 能否根据实验结果判断下一步该试什么,而不是只在清单里执行?
- 递归自我改进:AI 能否自主设计和开发自己的后继者,并证明改进不是偶然或作弊?
节目里 Recursive 的初步结果主要落在第一层,并向第二层伸手;Anthropic 讨论的「When AI builds itself」则把第三层的定义和风险摆了出来。把三层分开,才能看出当前进展究竟在哪里。
三个 benchmark 为什么重要,又为什么不能过度解读
1. NanoChat Autoresearch:验证集损失是一个短反馈目标
BPB(bits per byte)是按字节计算的验证集损失,数值越低,说明模型在验证数据上的预测更好。NanoChat Autoresearch 把预算限制在固定 5 分钟和单张 GPU,系统需要改训练代码,让模型在这段时间里得到尽可能低的 BPB。
这类任务适合自动化研究,因为目标明确、实验短、结果可比较。Recursive 的结果是从 0.9372 降到 0.9109,并补充展示了从较弱的 vanilla Transformer 初始实现出发,把 1.059 推到 0.9344。它证明的是:在一个已经定义好的训练目标里,系统可以自己寻找有效的 recipe;它没有证明系统理解了语言模型为什么会学会某种能力,更没有证明同样的方法能迁移到没有清晰验证集的新问题。2
2. NanoGPT Speedrun:两秒的改进,可能比数字看起来重
NanoGPT Speedrun 的目标是在一台 8 张 H100 的节点上,把小 GPT 训练到固定验证损失 3.28。Recursive 把此前 79.7 秒的结果推进到 77.5 秒,绝对值只有 2.2 秒。
如果只看表面数字,2.2 秒很容易被当成微小优化。可在一个社区已经围绕同一目标持续搜索两年、结果接近上限的任务里,后面的空间本来就窄。这里的价值不在于 77.5 这个数字可以直接外推到今天的大模型,而在于系统能否在成熟的工程搜索空间里继续找到人类社区难以发现的改动。节目也承认,NanoChat 和 NanoGPT 都是小规模任务,迁移到更大的模型和架构仍有明显 gap。2
3. SOL-ExecBench:GPU kernel 优化连接了研究与成本
GPU kernel 是直接在 GPU 上执行矩阵乘、归一化或注意力等底层运算的小程序。kernel 更快,训练和推理就可能更省时间、更省算力;但候选实现必须先和参考实现保持数值一致,不能靠算错结果换速度。
SOL-ExecBench 包含 235 个来自真实工作负载的 kernel 任务,在 NVIDIA Blackwell B200 GPU 上比较实现距离硬件性能上限还有多远。Recursive 的分数从 0.699 提高到 0.754,官方说法是把与最佳性能估计 1.0 之间的差距缩小了 18%。田渊栋在节目中尤其看重这项结果,因为团队没有由 GPU 专家组成,却击败了专业团队提交的结果。这里的关键不是「AI 取代 GPU 专家」这个夸张结论,而是一个通用研究系统能否把不同领域的知识、代码和评测器组合起来。2
真正难的部分:没有现成答案,也没有稳定评测器
固定 benchmark 的共同特点,是目标清楚、反馈快、方差较低,而且可以加固评测器来识别 reward hacking。Reward hacking 指系统找到一个能拿高分、却没有完成真实目标的漏洞解。比如一个 GPU kernel 候选方案可能利用计时状态或评测细节看起来更快,实际并没有完成更好的计算;如果评测器不独立复核,分数就会把作弊误认成进展。
科学研究的困难在另一边。真正有突破性的题目,往往恰恰因为没有现成数据集、没有固定解法、没有人人同意的评价函数,才值得研究。田渊栋把 AI 对 AI 的研究举成例子:如何理解模型从数据中学到什么、为什么会出现某种 pattern、怎样解释涌现,不是把已有代码再运行一遍就能回答的问题。过去十几年里,人类研究者已经尝试过重整化群、自旋玻璃、神经正切核、贝叶斯方法等不同视角,但没有一个解释得到普遍满意的结论。对于这样的任务,AI 不能只从旧答案里拼接一个新答案,它需要提出一个以前没有被验证的方向。
Anthropic 的公开文章也把这个鸿沟写得很清楚:AI 已经能写代码、跑实验、完成部分既定研究任务,但在 goal selection、research taste 和判断什么结果可信方面仍有明显差距。自动化做事不等于自动选择值得做的事。3
这也是为什么田渊栋把「研究品位」说得比普通 reasoning 更大。他指的不是解一道已经有大量相似样本的数学题,而是从复杂表象中抽出一个概念,判断它与什么问题有关,再把这个概念迁移到一个从未见过的场景里。大模型面对常见、重复、数据丰富的工作往往很强;面对样本少、每次实验都会暴露新问题的科学研究,优势就没有那么确定。
RSI 先于完全自动化:人不会立刻消失,只会被推到更高一层
节目里一个重要的区分是,递归和自动化不必同时发生。低层级的执行工作可以先被 AI 接管,但更高层的方向选择、实验设计和结果判断仍由人负责。模型变强后,人类不是退出循环,而是站到更高一层继续给循环定方向。
田渊栋甚至认为,递归结构可能先出现,完全自动化反而更晚。系统可以自动提出改动、验证改动、把下一轮模型做得更好,但它仍需要人决定研究目标、检查是否真的改进,以及在多个候选方向中选择值得继续投入的那个。这个阶段更接近「人机共同研究」而不是无人监督的 AI 科学家。
这条路径也解释了为什么 Recursive 不把第一阶段包装成一个万能 agent。它把研究系统放在三个短反馈 benchmark 上,先证明闭环能跑,再讨论如何扩展到预训练、后训练和更一般的研究任务。至于商业化,田渊栋只说团队希望系统保持通用,不希望被一两个垂直场景过早特殊化;数据怎样获得、怎样组织、怎样证明对不同任务有效,他在节目里没有展开。1
强者会不会永远更强:平滑曲线和台阶曲线的分歧
RSI 最有诱惑力的商业推论是,最先把自我改进循环跑起来的公司,会因为循环加速而把其他人越甩越远。OpenAI、Anthropic 这类已有强模型、算力和 coding agent 的公司,当然可能拥有更好的起点。
田渊栋没有否认这种可能,但他把一个变量放在了前面:智能提升究竟是一条平滑向上的曲线,还是一条「平台期—突破—再平台」的 S 型台阶曲线。
如果 Scaling Law 足以解释大部分进展,而且只要更多算力、数据和电力就能继续平滑变强,那么领先者确实会一直领先。小公司很难在同样的资源竞赛里追上大厂。
如果进展中存在真正的结构性突破,情况就不同了。系统可能在一个平台期里不断逼近旧方法的上限,直到某个新架构、新数学或新训练方法出现,能力突然跳到下一层。掌握旧循环的公司未必自动拿到下一次突破;有新想法的团队仍有机会切入。
这不是在宣称哪一条曲线正确。田渊栋明确把它当成仍待探索的变量,而且能源、算力、芯片供应和组织协调都可能给平滑增长加上现实上限。节目给出的判断更像一个筛选器:看一家 RSI 公司时,不要只看它有没有更多 GPU,也要看它是否在寻找能改变搜索方式的机制。
这条路的风险,不只是一台机器突然失控
主持人问到 AI 自我进化会不会最终超出人类控制。田渊栋的回答有两层。
第一,AI 能力的提升不自动等于产生和人一样的欲望。他把解决问题的能力与权力欲、自我意识分开,认为一个系统可以在数学或物理上很强,却不因此天然追求统治。这个判断属于嘉宾的哲学和技术判断,不能当成已经验证的安全结论。
第二,可解释性仍然是安全条件。若研究系统能找到人类没想到的训练方法,却没有办法说明模型在利用什么机制、为什么结果有效、改进是否可迁移,人类就很难判断它是在真正进步,还是在钻评测器的空子。田渊栋相信总会有某种能够解释模型运转的 principle;这份信念来自他长期研究神经网络训练机制的经历,但他也承认自己属于少数派,行业里很多人已经对理解大模型内部机制感到悲观。1
Anthropic 的表述更保守:完全递归自我改进目前还没有发生,也不是必然发生;如果发生,监督、验证、监控和行为塑造都需要跟上。它还提醒,即使 AI 只是持续提高研发效率,社会也会先遇到人类 code review、组织执行和治理能力跟不上的问题。3
田渊栋为什么适合谈这个问题
田渊栋在本期的身份是 Recursive Superintelligence 联合创始人,也是节目选择这条线索的原因。他此前在 Google X 做无人驾驶工程,后来进入 Meta FAIR,从更偏工程的工作转向基础研究;节目里他回顾了自己如何从亲手搭建系统、写代码、跑实验,逐渐形成对研究问题难度和技术品位的判断。关于他在 Google X、Meta FAIR、围棋系统和论文工作的经历,本文以嘉宾在本期音频中的自述为准,不把转写中可能出现的专名误识直接当成事实。4
他的经历与这期的核心论点正好相连:只做高层判断的人可能看不清实现难度,只做实现的人又可能不知道问题是否值得做。田渊栋既把自己放在工程一侧,也坚持研究问题最终需要品位、抽象和创造力;他同时承认,追求漂亮结构会带来偏好和盲点,研究者仍要提醒自己,世界不会总按最美的理论运行。
听完之后,怎样判断下一条 RSI 新闻
可以把节目提供的判断标准压缩成五个问题:
- 系统改进的对象是什么? 是固定 benchmark 的训练 recipe、GPU kernel,还是模型本身的研究能力?
- 反馈来自哪里? 是一个公开、快速、可复核的评测器,还是团队自己定义的一次性结果?
- 系统选择了下一步吗? 它只是执行人类列出的实验,还是能根据失败和成功改变研究方向?
- 结果能迁移吗? 小模型上的局部优化,能否在更大模型、不同硬件和新任务上复现?
- 谁在承担判断责任? 当指标与真实目标不一致时,是否有人检查 reward hacking、数据泄漏和偶然波动?
目前能比较有把握地说的是:AI 已经在部分模型训练和底层优化任务上参与了 AI 研发,且反馈环路正在缩短。还不能据此推出:AI 已经能稳定地提出重要科学问题,或者 Recursive 已经把「自主设计后继者」这一步做成了。
这期值不值得听
值得。它不是一场产品发布会,最有用的部分也不是 Recursive 的融资数字,而是把「AI 自我进化」拆成了几个可核验的台阶:coding agent 把执行变快,短反馈 benchmark 让局部改进可以自动循环,真正的研究仍卡在问题选择、研究品位、验证器和可解释性上。
如果你只想知道 RSI 的定义和三个 benchmark,听 03:00–20:00 与 45:00–55:00;如果关心「强者愈强」是否必然,重点听 35:00–45:00;如果更关心 AI 科学家的边界、可解释性和人的位置,听 55:00 之后的部分。完整转写放在文末,适合把某个术语或论证重新对照原声。
下文为本期完整音频的原始转写。仅按讲话人分段,并每 10 分钟设置一次时间轴;音频原本的片头预告、正片开头重复和口语停顿均保留,不对原始文字做删减或润色。讲话人姓名依据开场自我介绍与声纹分段对应为曼祺、田渊栋;无法确认的专名和口误仍保留原始转写形式。
完整逐字转录稿
00:00:00–00:10:00
田渊栋
这个时候我觉得也许五年之后我就被取代了。
那么这个时间可能已经快到了。
那么在这种情况下,与其自己被取代,不如我就开公司。
曼祺
就 RSI 非常需要 coding 和 agentic 的能力。
然后这两个能力本身其实对这些前沿的模型公司来说,它已经是它的主项了。
田渊栋
我觉得 RSI 比 coding agent 要大得多。
然后它的难度,然后它的可能的路径比现在的 coding agent 要大很多。
曼祺
所以你觉得就光有这个支点其实不见得你就能做好 RSI。
你觉得有生之灵会看到图灵奖颁给一个系统吗?
田渊栋
我觉得如果到那个时候可能图灵奖也不是很重要。
我可能少数派往,因为大部分人可能已经觉得绝望了,但是我觉得不是这样子,我觉得一定是有一个好的 principle 能够让这个模型运转起来,我觉得它以后终将变成科学。
曼祺
欢迎收听晚点聊,我是曼祺。在 171 期节目《二季度 AI 季报》中,我们重点聊了 RSI,递归自进化。
那之后不久的 6 月底,我采访了从去年开始就在这个方向探索的创业者之一田渊栋。
他参与创立的 Recursive Superintelligence 的缩写也是 RSI,这家公司的估值目前已超过 46 亿美元。
这期节目录制时,还没有发生一些后续的事件,比如 OpenAI 一举解决了 10 个数学难题,TML 的连畅之一翁立重新回到 OpenAI,据报道他将探索的方向就是 RSI。
关于 RSI 有一个极有诱惑力也十分危险的假设,就是率先达到这个状态的公司会把其他人越甩越远。
这个推演成立吗?我们再次进入本期节目吧。
田渊栋
这个时候我觉得也许五年之后我就被取代了,那么这个时间可能已经快到了,那么在这种情况下,与其自己被取代,不如我就开公司。
曼祺
就 RSI 非常需要 coding 和 agentic 的能力,然后这两个能力本身其实对这些前沿的模型公司来说它已经是它的主项。
田渊栋
我觉得 RSI 比 coding agent 要大得多,然后它的难度,然后它的可能路径比现在 coding agent 要大很多。
曼祺
所以你觉得光有这个支点,其实不见得你就能做好 RSI。
你觉得有生之灵会看到图灵奖颁给一个系统吗?
田渊栋
我觉得如果到那个时候,可能图灵奖也不是很重要。
我可能是少数派吧,因为大部分人可能已经觉得绝望了。
但是我觉得不是这样子,我觉得一定是有一个好的 principle,能够让这个模型运转起来。
我觉得它以后终将变成科学。
曼祺
欢迎收看晚点聊,我是曼祺。
今天的嘉宾是 Recursive Superintelligence 的连创田渊栋。
这家公司在经过 4 个月的隐身研发之后,刚刚于 6 月初官宣,A 轮融资 6.5 亿美元,估值来到 46.5 亿美元。
他们做的事儿和公司的名字缩写一样,RSI 递归自进化。
这是一个去年还相对小众,而到今年二季度被硅谷频繁讨论的热门前瞻方向。
Anthropic 刚在 6 月初发布了文章《When AI Builds Itself》,
副标题就是我们在 RSI 方向上的进展和探索。
OpenAI 也再次明确了时间表,说在今年 9 月要做出 AI 研究实习生,
在 28 年 3 月之前要实现真正自动化的 AI 研究员。
我们和田渊栋一起聊了 RSI 是什么,为什么这个领域在现在变得火热,
以及他们在 6 月中旬刚刚释放的第一阶段的具体成果,
还有那个关于 RSI 的有诱惑力也十分危险的假设。
率先达到这一状态的公司,会把其他人甩得越来越远。这个逻辑成立吗?我们正式进入本期节目吧。
终于见到了田老师了,之前我们都是在线上聊的。
田渊栋
对对对。
曼祺
然后上次采访是去年 5 月嘛,当时我们聊的是你的科幻小说《破晓之钟》。
对。
然后这次再聊我觉得是科幻已经照进现实,因为这期间有一个比较大的变化,就是您和很多其他的顶尖研究员一起创立了 Recursive Superintelligence 这家公司。
然后你们在做的一些事儿也跟你当时的科幻设想我觉得有一些契合的地方。
你可以先和我们的观众简单的用几句话介绍一下,就是这家新的公司是做什么的?
田渊栋
对,这家公司叫 Recursive Superintelligence,它的目的就是说能不能找到用 AI 来自我进化、自我迭代的方法,然后找到新的模式、新的范式、新的模型、新的训练的逻辑,然后得到更好的 AI,是这样的一个逻辑。
曼祺
对,因为你们的名字 Recursive 就是递归的这个意思,
然后它的缩写 Superintelligence 就是 RSI 嘛,
那和现在硅谷讨论特别多的一个概念,
它也叫 RSI 是一样的,那个是 Recursive Self-Improvement,
就是递归自进化。
田渊栋
对对,其实我们这 Recursive Superintelligence 意思也就是 Recursive Self-Improvement,
对,所以说意思上来说是非常接近的,因为这个概念应该说,
从今年的 4 月 5 月份开始慢慢变得比较火
曼祺
就是我们在成立公司的时候应该说大部分人还没有想过这个概念
但是随着大家的这种意识和思考
就慢慢成为一个应该说慢慢成为共识吧
大家发现这个模型已经比较厉害了
那个模型能够发现一些就是模型自己的一些问题
通过这个方式其实可以存在一种可能性就是用 AI
找到 AI 自进模型的问题,然后让 AI 带领这种模型变得越来越强。
我觉得正好可以讲讲这个背景,RSI 也是我想和您深入讨论的一个话题,
也就像你说的最近这一段时间,我觉得它在这越来越成为一个相对共识性的趋势了。
然后另一方面就是 RSI 其实这个想法本身并不是那么新,它之前也一直都有。
田渊栋
对对对。
曼祺
为什么最近这段时间发生了什么变化或者有什么因素导致大家在讨论?
田渊栋
我觉得主要一个还是因为 coding agent 变强了。
另外一个就是说模型本身的能力也在提升
模型能力提升到一个程度之后
就是模型对 AI 自己的这个模型的认知
它有一些比较强的这个突破了之后呢
就是你可以用模型来充当研究员
曼祺
模型充当研究员
田渊栋
让它来找到这个模型的现在模型的弱点
然后去做更好的优化
那么这样的话呢这个闭环就会产生
产生闭环之后呢
那么下一次这个模型变得更强
曼祺
所以递归就是这个循环往前推进的意思?
田渊栋
对对对,但是这个要求条件是这个模型本身已经足够强了。
如果模型本身不足够强的话呢,那这个很难。
曼祺
其实去年 5 月我们聊的时候,我们当时就顺着这个科幻小说是延展讨论了一个话题,AI 会不会取代顶尖的 AI 研究员。
对。
当时你觉得这个短期内是比较难的,因为 AI 研究员他可以从少量的数据里面就获得一些精准而细节的联系。
对。
但是大模型,至少当时的大模型,他还是要学很多大量复杂的数据,然后通过统计得到一种表达。
到后来年底的时候,因为 11 月我们当时也在聊了一下嘛,那会就已经在筹备这个新的公司了嘛,所以这个过程中间是你本身自己的思路是有一些什么变化吗?
田渊栋
主持人第一点我还是现在还是认为就是大模型还是替代不了顶点研究员,目前还是不行。
只是说是那个模型的能力已经到了一程度之后呢,你就觉得它确实可以用,就是我们确实可以用模型。
来做一些研究的工作,我觉得这个是重要的,而且去存在一种可能性,就是模型会变得越来越强,然后最终产生更好的、更强的能力,这个是可能的。
其中一个契机就是说,应该说在 5 月份之后,大概在 8 月份的时候,我用,当然是 GPT-5,我和 GPT-5 合作,做了一篇文章,最近的一篇就是 Glocking 的一些文章。
对,那篇文章呢,就是说我会意识到,就是我在做完之后其实意识到这一点,就是模型的能力呢已经基本上强到让我觉得我可以不用昭示一生的水平。
曼祺
哦。
田渊栋
对,因为有很多的想法和思路完全可以通过我跟模型对话来实现。
那么通过这个方式呢,就是我可以给模型一些具体的那个细节,一些比较细的这个方向,让它去找到新的想法,新的思路,证明新的定理。
我可以写代码、做一些实验,然后把东西做出来。
现在写代码都不用人了,写代码都可以让 AI 来做。
所以应该说这个 loop 就开始有转起来的趋势。
这个时候我觉得也许 5 年之后我就被取代了,
这个时间可能已经快到了,
在这种情况下,与其自己被取代,不如我就开公司,我就做这事情去。
曼祺
所以去年 8 月你看到这个迹象之后,首先我想知道当时这种想法有多少人有?
因为你说到今年四五月越来越多人讨论嘛。
那在去年可能差不多大半年前是什么样的一个情况?
以及后来你怎么找到一些跟你想法比较相似的人一起来做这个公司?
田渊栋
我觉得是这样,这个事情你不亲手实践,亲身去体验,你是感觉不到的。
如果你不一定把模型当成实习生,或者把模型当成一个聊天对象的话,你是感觉不到这个变化。
所以要等到你把模型真的把他当成一个聊天对象,
可以跟他去合作,可以跟他去做一篇文章的时候,把文章送到我做完了,你会觉得这个模型确实能力已经比我想象的要高很多。
曼祺
你的意思是可能到回到那个时间,这么做的人不见得很多。
田渊栋
现在我们也见到这样的情况,有一些人,特别是那些比较 senior 的人,他们一般来说不会去思考太细节的东西。
他们可能会考虑一些比较 high level 的、比较高层次的一些想法和建议,不会真的把模型拿过来做一个非常具体的项目。
另外一方面就是一些刚从学校毕业的学生可能把模型作为一些执行上的工具不会去做一些比较难的问题。
00:10:00–00:20:00
田渊栋
所以这样两边其实是有一个 gap 在里面的。
曼祺
这个也 Q 到了我们上次聊的一个话题。
田渊栋
对。
曼祺
因为当时我们聊到了你有连着两年有在写年终总结。
有一年我记得应该是 23 年的时候年终总结,好像说的一些你觉得怎么带团队的一些经验。
到了后面一年其实你就变了,你说的就是你想跟着 Hands on。
田渊栋
因为其实大模型就当有一段时间之内就是你会发现你不还脏的话
你就没有办法去真的知道这个模型内部发生了什么
然后那个整个系统发生了什么
你不知道这些东西的时候呢你指挥的方向就会出现偏差
那么这偏差的方向呢其实很难获得反馈
因为在传统的这个研究过程中嘛
一般来说是一个比较 senior 的导师
可能跟学生们说我们要做一个方向
然后呢,这个导师本身呢,可能不会真的去喷代码,不会真的喷数据,但是呢,让学生们真的去做这个事情。
学生把这些事情做完之后,然后反馈给导师,说这个事情是对的还是不对的。
很多时候学生跟老师说,这个事情没做好,这个事情不 work。
为什么不 work 呢?是因为有 1、2、3、4、5 这种困难。
导师会说,我这个 idea 一定是对的,然后让学生继续去挖掘。
总共有两种可能,一种可能就是说学生发现了导师说的是对的,然后把事情做成了。
还有一种可能是导师的想法其实并不对,但是学生证明这件事情是不对的,然后找到下一个方向继续做。
一般来说这个逻辑本身是,应该说至少要有几个月的时间,这个也是一般的一个科研项目的一个周期。
这也是一个 loop。
曼祺
这是一个 loop,但这个 loop 的问题是导师不直接跟具体的实验打交道。
这样的话,导师从跟学生讨论,然后给学生一些指导,然后学生把指导做出来,然后得到反馈之后跟导师汇报,这个过程一般来说,你知道需要几天的时间,有一个数字。
就意味着大家是以天为周期进行这个问题的科研探索,就是说你可能需要几周,甚至几个月才能把事情做成。
田渊栋
但是现在有 AI 之后呢,应该说,特别是有非常强的 AI 之后,这个时间被压缩到几分钟,甚至更短的时间。
曼祺
你就说验证一次的循环
田渊栋
对对对验证一次
比如说几小时到几分钟时间
就是特别是对一些比较简单的项目来说
就是很多时候你有个想法之后
你大概告诉 AI
AI 很快地把代码写出来
然后跑完之后告诉你这个结果
很多时候就是
也许你写完之后我出去喝个口水
喝茶
然后跟别人聊两句
或者开个会
开完会之后你结果已经有了
结果有了之后
那你就可以看到自己的问题在哪里
然后可以有下一步的循环
曼祺
就是你在描述你最开始看到 RSI 的这个方向和前进的时候
田渊栋
对
曼祺
就让我想到就是稍微岔开一点的一个问题
就是什么样的人他能最早的去看到这个信号
其实你描述的是又有比较多的经验
他对什么问题是难的是重要的有判断
同时在那个时间点他又是非常一手的在做一些事情
田渊栋
是的是的
这样的人是很容易敏感的感觉到就是当前风向的变化
曼祺
所以这个人有可能也不是特别年轻是吗?
他和现在就是 AI 叙事里面,因为现在会有一种观点会觉得说你特别年轻,你来什么东西你都可以很快的学起来。
然后以前的一些经验可能是负经验,是没有那么有用的,还不太一样。
田渊栋
对,可怜不太一样。
因为我觉得以前是因为,就是说在 coding agent 还没有普及之前,或者还没有达到这个人类能力之前,
就是年轻人很有市场的一个原因呢,主要还是因为年轻人他的冲劲比较足。
然后呢,这个决策,这个执行能力很快。
很多时候其实不要想太多嘛,就是 OK,我上来就该干。
干了就完了嘛,对吧,基本上我应该觉得过去的三年里面都是这样子。
对,就是从大元模型出来之后,
基本上年轻人很多时候是有这样的优势,因为
并不需要想太多,我们就 skill up, skill skill skill skill,
然后就完了,这是非常简单的事情。
所以通过这个方式呢,其实就应该说大元模型得以快速发展。
曼祺
所以你觉得 RSI 这个风潮来了之后反而是可以让以往的一些经验积累
包括你沉淀的各种直觉判断或者说技术品味有更好的发挥的
田渊栋
对的 我觉得是的
曼祺
那天平又会摆到就是怎么说更有经验更年长的一群研究员
田渊栋
对 有可能是这样子
就可能是这样
当然了就是说这个也是有很多的争议的
这个只是我的一个观点
因为确实现在那个 coding agent 来了之后呢
有很多以前从来不写过代码的,或者说已经当了 10 年的经理或者总监的人,突然开始写代码了,他们就觉得这个爷的青春又回来了。
所以其实有很多的人会有这种感觉,因为可能以前有想法,但是没有时间去实现,然后团队也没有时间和精力去完成上面的人的每个想法和思路。
这样的话,其实这些人的经验很难被发挥出来。
现在有 AI agent 之后应该说对比发生了变化,以前可能需要人去执行,现在执行的重任落在了 AI 身上,人更多的是判断、逻辑上的指导、大方向的把握、研究的品位,这些东西是重要的。
曼祺
回到 RSI 这个主题,其实像 10 年前 Google 做的一个工作,AutoML,它也有一个类似的想法,它也是在用 AI 去优化 AI。你觉得现在的 RSI 和小 10 年前的像 AutoML 这种类似的尝试的区别是什么?
田渊栋
我觉得区别其实很大了,因为我们上一波也是做过了,
我有很多文章也是做 Architecture Search,架构搜索,
还有文章比如说做 AI Guided Optimization,
AI Guided Design,AI 辅助设计这些方向。
所以我觉得上一波的问题主要在于我们没有一个模型能够建模人类的高层的知识,
高层的思路,这个是没有的。
就是上一代的时候很多时候是让研究员来定义
搜索空间的大小、行为,让 AI 做成一个算法,找到更好的解。
但是现在,因为这一波大云模型来了之后,
然后它能达到这个程度,就是让这个模型本身对这个 AI,对这个 AI 本身或者对这个架构本身是有理解的。
那么这个理解呢,可以部分代替人类的一些那个定义问题的工作。
那么这样的话呢,其实让这解空间变得非常大,而且应该说比较智能,不像以前就是你需要人去定义这个解空间。
曼祺
但它的一个区别是在于人参与了多少的变化吗?
田渊栋
是的,以前可能说人需要深度参与解空间的每个细节,然后 AI 比较笨,只有在这个空间里面去搜索。
但是现在更大的问题是怎么样最大限度上发挥 AI 的能力,能让他自己找到这个解空间的结构,自己找到这个解空间的一个比较好的方法去解它,这个是可能更重要的一个事情。
曼祺
您说到这个也涉及到就对 RSI 的理解和定义啊。
田渊栋
对。
曼祺
因为很多时候大家提起 RSI,比如说 OpenAI 也会说他们自己叫做 AI intern,然后说到 28 年 3 月要实现真正的自动化的 AI 研究员。
对。
田渊栋
它都是和自动化联系在一起的,它好像都是指向说把人从这个 loop 里给解放出来,但是另一方面就是递归自进化,就它递归的这一部分。
曼祺
我理解它又是有一个循环上升的意思。
所以你觉得这两个东西,就是递归和人不在这个路里面,它是一件事是一起发生的,还是它会有一点区别?
田渊栋
我觉得完全自动化不一定很快会发生
我觉得自动化的程度很多时候是因为看人在上面会做什么样的工作
而且做的工作它层级是什么程度 这个是最重要的
对 因为就比如说你现在有 AI 了之后 有大元模型之后
有些程度的工作其实不需要人去做了
但是更高一级的工作还是需要人去做
而且对更高一级的工作要求更高了
所以这个时候其实农场上来说人是减少了他的时间,但是人可能需要更多脑力去做一些更高层次的工作,所以人还在这个 loop 里面,这个 loop 的 level 更高一点。
曼祺
所以你觉得递归是有可能会先发生?
田渊栋
我觉得递归会先发生,就是我安全自动我觉得现在还看不到,就是跟我以前的 AI 代替不了顶尖人类研究员的观点是一致的。
曼祺
那你觉得递归和自动化这两件事有个更重要的吗?
田渊栋
我觉得这个事情不存在重要不重要的问题,就是说一定是按照就是模型能力会慢慢慢慢的发展,对吧,你肯定会发现完全自动是不行的,还是需要人的一些指导,那么这个时候自然就递归了一个结构。
曼祺
因为讨论到这个问题,最近确实和很多人在聊这个概念嘛。
然后有一种观点就是觉得递归这个事更重要是因为你一旦这个循环跑到一定程度之后,掌握这些循环的组织或者人或者团队,
它就有可能进入一个加速度,加速越来越快的阶段,然后它就会可能把别人甩得越来越远,对吧?比如说 Anthropic 和 OpenAI 也许就有这种可能性。
田渊栋
对,是有这种可能性,因为模型可能会让自己变得越来越强,变得越来越强之后,这个模型能理解更深的东西,然后接下来就会有更强的 AI agent,AI scientist,那么有这之后,它会发现自己更大的问题,然后就可以叠加上去。
但这个讲的更多是范式的一个转变,跟人在不在这个 loop 里面其实关系不大。
曼祺
嗯,所以你也是觉得这个循环的加速本身是更本质的?
田渊栋
啊,这个是可能的,这是可能的。
但是呢,它在什么程度上可能呢?
然后我们需要做到什么程度让 AI 变得很强才可能?
这个事情呢,还是需要做探索。
曼祺
最近就是这个方向很热闹,除了刚才我说到 OpenAI 他们有一个时间表关于我怎么去产生真正自动的 AI 周围,但是他那个说的比较笼统。
然后 Anthropic 是在今年 6 月他们发了一个长文叫 When AI builds itself,就是当 AI 来建造自己,以及这篇文章的副标题就是我们在 RSI 方向上的进展和实践。
00:20:00–00:30:00
曼祺
不知道你看了就可以跟我讲没有
田渊栋
我大概看一下
其实就是应该说还是刚才我们聊的那个差不多的一个想法
就是 AI 能够让 AI 自我进化、自我迭代
然后越做越好
曼祺
它里面讲了一些它们内部具体的一些进展
比如说它说 4 月的时候
Cloud 的 AI agent 端到端的独立完成了一个开放式的 AI 安全研究
说它累计工作了 800 个小时
然后把一个 Weak to Strong 的性能差距缩小了 97%
如果是人来干的话是一周可以缩小 23%
这好像更多是一个体效
我们刚才说的递归自进化的程度吗?
田渊栋
应该还没有吧,我其实看了一下这个博客,基本上还是体效,你看它的具体的解法,找到一些各种各样的方案,让 weak to strong 的 generalization 能够做得更好。
对,然后它有指标,通过这种方式把这些指标提上去。
那么里面的这种方法,应该说比如说把里面的 representation 拿出来,然后做一些分析,然后想办法把它把这个模型做得更强,大概是这样的一个逻辑。
但这些算法本身应该说还是比较常规的。
它就让他把很多常规的想法和思路放在一起,
然后放在一起之后,最后分数能够往上提。
因为有分数之后你才能做自我进化。
因为现在除了分数之外,
你没有其他办法能够衡量这个模型现在能有多强。
这些都会有一定的效果,所以分数必须要靠。分数一般会具体体现为提效、提高速度、减少磁力等。
所以这应该是自进化的第一层。
曼祺
你觉得在第一阶段,它确实就是这样展现的,拆成子任务,然后看子任务上 AI 自己是不是越来越好。
田渊栋
是是是是是是。
这个是一般会这样子的。
曼祺
你觉得 Anthropic 和 OpenAI 他们理解的递归自进化和你们有什么相同和区别?
田渊栋
应该说大的方向上都是差不多的。
我不觉得有什么特别大的一个区别。
就是可能有一些不一样的地方是,
你像 Anthropic 那个文章对吧,
就是他这么写的话呢,
基本上感觉上是,
就是特别是在代码上有自进化这个能力。
但是呢我觉得更难的地方呢是研究上的问题。
AI research 这个方向应该说跟代码之间还是有差距的。
Anthropic 之前的一些工作其实他们都是展示出来,如果对一个 EO 的项目我们能不能让它自进化自动做好。
比如说从头开始写一个 Linux,或者从头开始写一个 CIA 编译器。
那么这个东西都是说应该说是有路径的
对吧
那么我们都知道怎么写
只是说这工作太繁杂太繁重
太累了
然后很难去让人或让个团队去把它写出来
但是这个问题本身是有章可循的
但是呢
就是说很多就比较难的 AI research problem
其实应该说人都不知道怎么做
有很多的这个很难的一些一些比较要有突破性的进展或突破性的发现的东西
那么这东西呢
其实应该说是应该说现在 AI 还是很难做
曼祺
除了两家最受关注的 Frontier Lab 就是 OpenAI 和 Anthropic 之外,这个领域现在也有些新的公司的厂市,就你们之外的。
有一个是 6 月 25 日才刚刚官宣的,叫 Mirandale,然后他们是种子沦融了 2 亿美元。
这些团队应该是来自 DeepVine 和 Anthropic。
另外就是之前更早成立的 Sacala AI,他们也是在 6 月刚刚成立了一个 RSI 的新的 team,对。
对对对。
田渊栋
在东京。
曼祺
这些更多的尝试,一个是你觉得可能反映了行业的什么变化,一个是你从他们的一些表达里面看到了什么有意思的东西。
田渊栋
我觉得他们基本上还是高层次来说还是一样的就是做这个递归自我进化嘛,这方向上总的应该说是比较接近的。
应该说就是像那个 Mondreal 那边,就是像 Anthropic 那个创始人们应该说之前也跟我聊过。
曼祺
哦,你说的是更早之前在筹备创意的时候?
田渊栋
对对对,也没有说找我,只是说是当时问我要不要来,或者说就是说要不要去 Anthropic 看看。
对,当时他还在 Anthropic 的时候。
曼祺
哦,那会儿你从 Meta 就可能要出来的时候,Anthropic 也有一个邀约相当于?
田渊栋
对,就聊聊吧,当时也聊过一次,后来就很有意思的是,后来他就走了。
所以我之前也跟大家说,跟我聊过的那些人都跑路了,包括 Anthropic 就是他。
曼祺
相当于你们看到了相同的方向之后,你们都觉得出来做,重新有一个 Live 来做这个事可能是更好的。
田渊栋
对,我觉得是有可能会这样的,因为一个是现在 OpenAI 和 Anthropic 其实已经算大公司了,有很多人在里面。
曼祺
所以现在没有 OpenAI 多对吧?
田渊栋
肯定没有 OpenAI 多,两三千人吧,差不多。
但是还是应该说,另外一方面就是说,像这两家公司应该说现在都要冲 IPO,对吧?
那对他们来说最重要的是要把手上的业务做好,手上的业务是什么?coding agent。
对吧,如果 coding agent 能够赚很多钱,能够让这个事情做得比较好的话,那他们可能会目标先把这个事情先做好。
对吧,那么所以有可能他看到了这一点,所以觉得你还是自己出来比较好,因为 ISI 这个方向毕竟来说是比较远的,没有那么近。
曼祺
你说还有其他公司的人找你也出来了,他们出来之后新做的公司现在是已经浮出水面了,还是有些人仍然在水下?
田渊栋
没有,我当时说的是有些人是作为大厂的一个高管来找我,问一下我要不要调到调杂调那边去。
所以很多时候他们都走了,很多人就像苹果又走了,对吧,Amazon 的人也走了。
有些人也出来创业了,像 Amazon 那边有一个 San Francisco Lab 的头,David 他也出来了。
对,但是现在他们出来准备做什么,我现在不知道。
曼祺
那你当时也和大公司其实也聊了你想继续做的 RSI 的这个方向。
田渊栋
大公司的时候,基本上你跟大公司聊的时候,你很难去决定你做什么方向。
很多时候跟大公司聊,大公司会说我们想做这个。
他们当时会有自己的一个想法,他们希望我加入之后能够给他们提供助理。
曼祺
所以去年秋天的时候,就是你和这些公司交流,确实在当时没有很多人会提到说想做这个,对吧?
田渊栋
对,当时 RSI 还不是一个大众的认可,但 RSI 还是一个小众方向。
曼祺
我觉得现在至少在一些宣称和表态上我觉得它看起来是变成一些公司的重点了,就是 OpenAI 和 Anthropic 都是有这个现象的,而且我就是跟一些这些 Live 的人聊嘛,我觉得他们自己确实就里面的人啊,他们也很关注这个方向,所以你觉得像 OpenAI 和 Anthropic 他们对这个事有多重视有多认真啊?
田渊栋
这个我不好说吧,至少现在大家在说这事儿,只是怎么样能够让这个事儿最终能成呢,其实应该说是更难的问题。
现在可能大家讲的还是一个概念,一个是怎么样把这事情做成,怎么样觉得这个事情有多重要,然后它是不是将来的方向,至于怎么把事情做成,或者说什么是具体的一个 metric,现在大家讲的不多。
曼祺
你觉得这有可能会成为他们 G-coding agent 之后的下一个主线吗?
田渊栋
这个我不知道,这个我也要问他们。
曼祺
因为有这样一种推论的逻辑,就是他们会认为说这个东西就 RSI 非常需要 coding 和 agentic 的能力,
然后这两个能力本身其实对这些前沿的模型公司来说它已经是它的主线了,
所以 RSI 可能就是在这个主线往下延伸的下一个方向上,
就从这个逻辑来推论了它有可能是它的主线,不知道你怎么看这种想法?
田渊栋
我觉得 RSI 比 coding agent 要大得多,对对,我不觉得,就 coding agent 只是一个执行者,
你每次是说它的,它需要解决的问题,它的问题,它的问题,然后它的难度,然后它的那个可能的路径比现在的空间认识要大很多。
曼祺
所以你不是指的市场规模,还是也包括那一部分?
田渊栋
我觉得不是,市场规模当然是一部分,还有一部分就是包括就是研究上的一些可能的方向和逻辑。
曼祺
所以你觉得就光有这个支点,其实不见得你就能做好 RSI。
田渊栋
是的,我觉得是这样子。
因为其实很简单,因为对 coding agent 来说,一个是大家已经有可以用的 coding agent,对吧?
就是大家都用,比如说 Cloud Code、Codex,然后最近的一些开源模型效果也很好。
这个方向就是在做一些基本功能的情况下,它也都已经做的还挺不错的了。
那么也就是说,而且因为有开源模型的存在,所以就是这件事情变成所有人都有了这个能力。
曼祺
那你觉得开位模型的能力和 Anthropic 还有 OpenAI 的能力还是比肩的吗?比如说像 GM5.2、KeyMeter 7 这些。
田渊栋
我觉得肯定还是有差距的,差距还是有一些,但是应该在接近中。
曼祺
你记得体感是越来越近?
田渊栋
我自己想当然就是至少跟 OPPUS 4.7 相比,你觉得 GM5.2 还是挺不错的。
曼祺
那和 4.6 比了?
田渊栋
4.6 4.7 差不多吧。
曼祺
4.6 4.7 差不多。
因为有一种体感是会觉得 4.7 还不如 4.6 好用。
田渊栋
我没有那么大的感觉,但是我感觉上是 4.6 4.7 4.8 没有太大区别。
曼祺
没有太大区别?
只有版本后的区别?
田渊栋
可能唯一的区别就是说 4.8 它的 contact window 变长了。
所以这样的话用起来更舒服一点,因为像 4.6 在用的时候,用到一半突然跟你说我要 compact history,然后就等半天。
两半天之后,他重新 reset 了之后,你再去问他以前的一些事情,他就不记得了。
这个是他一个表达的问题。
4.8 相对来说,没有这个限制的话,用一下会更舒服一点。
曼祺
所以在你自己现在的实际使用中,像 GLM 5.2 这样的模型,你觉得是已经很够用了吗?
田渊栋
我应该说还可以吧,应该说我也用过了,我其实也就是最近刚刚从国内回来紧急用了一下。
曼祺
紧急用了一下?
田渊栋
因为大家都觉得它好嘛,我肯定要试一试。
一个是这样,它还是比较擅长做一些比较执行上的一些工作。
对,而且这样的工作能做得不错,有一些事情它就用一些思考可以做的还不可以。
但有些时候它可能会陷入死循环,或者说有一些各种各样的毛刺吧,但是总的来说应该说还是挺好的。
00:30:00–00:40:00
曼祺
你刚才提到 RSI 它整个要比 coding 要大得多吗?你觉得它除了 coding 之外,可能它还需要一些什么样的能力?
田渊栋
我觉得一个很重要的能力就是说你要做 AI scientist,你要做人的这个能力的话,就是人类研究员的这个品位啊,对吧?
它的方向的这个感觉和理解,还有就是说对一些问题的一个抽象能力,这些东西应该说现在模型都不太有。
曼祺
这个东西它如果总结下的话,它在模型里是属于什么能力?属于推理?属于 reasoning 吗?
田渊栋
对,这当然是推理能力,但是应该说很难去形容这种东西。
曼祺
就也不是说 reasoning 就能包含的,你觉得?
田渊栋
对对对,它比 reasoning 更大。
曼祺
在人的能力里面它属于哪一种?
田渊栋
因为推理能力可以有很多种嘛,推理这个字非常广泛。
曼祺
不是说你说你想要的那种能力在人的能力中可能属于哪一种?
田渊栋
在人的能力中,大部分人并不是有的,有一些很强的研究员他有这个能力。
曼祺
这是创造力吗?
田渊栋
对,应该说是创造力。
应该这么说,可以把一些概念从一些纷繁复杂的表象中抽取出来,
并且加以总结、加以思考,然后继续再应用于新的问题上这样的能力。
曼祺
其实就是你之前说到的从少量的样本里就可以看到精准而细节的连续。
田渊栋
对,但这个能力应该说现在的模型还很难具备。
曼祺
其实这是对人来说真正的 Growking 的一个优势。
田渊栋
对的,应该说是人跟大模型相比,人比较大的一个优势。
因为大模型现在能力很强,还是因为有大量数据嘛。
所以对于那些非常常见的数据,然后说是重复的领域工作,这些工作来说,大模型有无穷无尽的数据,所以它可以学会。
但是对那些数据量很少的或者说像科学家这样开创性的领域
就是问题应该说是存着不穷的
然后你每次做实验
然后每次探索都发现新的问题
那么这个时候这些问题的理解
就是它的相关数据很少
那么这样的话你让 AI 去做恐怕是比较难
曼祺
你觉得就是计算机科学或者具体到 AI 这个领域,它本身在学科特性上相比于其他一些自然科学,会不会它本身就数据更富其,更不需要你说的那种能力,它也能往前推?
田渊栋
计算机科学你看嘛,计算机科学也很大,它又是工程的上面很多能力呢,其实应该说是大家已经还会实践过了,那么这些能力其实应该说 AI 已经有了。
曼祺
对,就可能不太需要你刚才说的那种灵光乍现的东西,它也能往前走。
田渊栋
对的,对的,对的,对的,对的。
还有一些能力,比如说像应用研究的能力,就是比如说你按照某个固定的逻辑,或者某个固定的计算方案,或者说是个思维方式,解决一些问题的能力,这个能力 AI 现在也是有的。
就比如说你让 AI 去解一道数学题,对吧?那么对数学题来说,这道数学题可能就相似的题目已经出现很多次了。
那么 AI 就能够学会这个里面的这个模式,然后找到更好的解。
但是有很多问题,就很难去找到固定的模式,或者这个模式应该说是以前没曾出现过的。
这些问题就是 AI 就很难去找到答案。
曼祺
对,因为我想问的就是,至少在第一个阶段,就不说 AI for 其他的自然科学,就在 AI for AI 的这个阶段,AI 学科里面实际上它有很多这种情况的问题吗?
就是我需要在很少的样本里,我就找到一些可能没有固定模式的新的…
田渊栋
是啊,就是一个非常明显的例子,就是说比如说像 Glocking,像怎么样理解模型本身的那些问题。
那么模型本身有学习能力,然后它怎么从数据中学到这个模式,然后怎么把这个模式拓展到其他方向。
那么这个问题本身,一个,它没有现有数据集,因为如果有现有数据集的话,那问题就解决了。
没有数据集,然后对这个问题的理解的方式都不一样。
其实应该说就是怎么样去理解 AI 怎么能够认识世界,怎么能够发现这个新的 pattern,怎么产生涌现呢。
应该说有很多很多人做很多尝试
比如说 2013、2014 年开始
就是大模型或者说深入学习
一开始的时候就很多很多那个做理论的人
他们想各种方式去解释它
比如说物理上比如做那个重整化群
对吧
然后物理上还有像那个什么那个 spin glass
就是什么那个自旋玻璃他们有人用过
对还有比如说数学上的一些方法
比如说之前有过很火的
像那个
NewTelian kernel,就是神经正切合,这些方法,就是它们有很多不同的观点,还有说 BAS 的方法来解决,对吧,还有像高斯过程的方法来解决。
那么有很多很多方式去研究这个模型是怎么样产生这个涌现,怎么样学习东西的。
那么这些角度应该说是都尝试过,但是都没有特别满意的结果。
如果你要真的要找到一个新的对 AI 的这个理解,那么这个理解可能是跟其他的方式都不一样。
对,这个时候你要让那个 AI 去找,让 AI 去发现,这个时候呢你就很难就是通过照搬已有的这个逻辑,它的 AI 上来完成。
曼祺
这里我的一个问题就是,您看从 13 年到 14 年这么多尝试,它都没有去很好的能解释 AI,但好像另一方面这也不影响 AI 在突飞猛天的发展。
田渊栋
对的,我没有说这件事情会影响 AI 的发展,我只是说作为一个 AI scientist 的工作来说,如果举个例子,我要让 AI scientist 去研究,去理解这个 AI 是怎么运作的,那么这个问题本身就是难问题,因为过去的人都试过,而且用的 pattern 都是不一样的。
曼祺
因为我是在想回到你们公司的目标或者 RSI 的这个目标嘛
就这个目标它说让 AI 自进化或者说 AI 帮助 AI 进化的更快这件事情上
是不是我不用处理一些特别深的理论问题
我可能也能实现这个目标
田渊栋
是的 这就是 RSI 好的地方
因为对 RSI 来说呢就是它不是那种像无人车那样
要么是零要么是一百
而是非常有很多阶梯的
因为你 RSI 初级阶段就能够做很多事情
就比如说你刚才说优化各种算法,然后提高性能,这个部分 RSI 能做了,但是它本身也有效果,也有一些实际用处。
所以说它的第一级台阶本身就有很多实用的价值,等到它到第二级台阶的时候,它可能有更深的东西能挖出来,那么可能生产率会更大。
最终我们会有一个非常难的、非常高的一个目标,比如说我们希望 AI 成为像爱因斯坦或牛顿这样的大脑。
这样的大脑可以通过很少样本获得很深的知识。
如果这件事情成了,应该说 AI 就非常非常厉害了。
但这件事情是一个非常难的问题,就算我们没有做出来的话,本身这个东西的应用也是很多的。
曼祺
回到刚才这一轮话题的起点是在 coding 之外 RSI 还需要什么能力?
比方说有一个类似于 Glocking 的这种人其实可以产生某种灵感和联想的能力,还有什么你觉得?
田渊栋
我觉得这个是重要的,还有一些就是 Agentic 的 Behaviour,这个也是重要的。
就是说你 AI 怎么利用定用工具啊怎么动用各种各样的那个已有的知识
然后获取新知识
然后获取各种那个把这些事情放在一起
完成任务这样的能力
对吧
曼祺
这个能力其实某种程度上可以说是核心的公司已经在探索,已经在往前推的。
田渊栋
对对对。
曼祺
所以对新公司来说,我觉得好的一面是你们有很多能力是可以直接用。
田渊栋
是的。
曼祺
然后可能会有压力的一面就是因为他们也有这些能力嘛,所以他们可能也会往这个方向推。
田渊栋
对,但是这样的能力应该说很多开眼模型或者说很多 EO 的解决方案已经在那了,对吧?
所以就这些能力它有多大程度会左右最后的 RSI 的结果,其实他们应该说每个人想法是不一样的。
对,还有些能力当然是说你怎么去收集信息,然后从信息中找到一个最重要的信号。
那么这个部分应该说就之前做 Deep Research 这些方向上也已经有很多工作了。
曼祺
我的一个感受就是最近这段时间硅谷非常热衷的讨论 RSI。
它有一个假设就是谁最先达到这个状态就会把其他人甩得越来越远,而且这件事是有一个窗口的。
田渊栋
就可能你过了一个时间你还达不到的话,你就无远这个决赛圈了。
你觉得这个逻辑它有什么漏洞吗?
这个逻辑应该说还是比较正确的,但是应该说有这种可能性,就是说对于 AI 来说,如果它没有突破性进展的话,所有人 AI 都差不多,对吧?
就是说它不是那种渐进式的,这种一点点往上走的,它是一种突破式的往上走的,这种逻辑。
比如说所有人在没有达到某个 level 的模型之前,大家都差不多,都还是不错的,但是也许有一两个人才能突破了。
那么突破了之后呢,它会到下一个层次,那个层次上的 AI 它的能力呢,是远远高于前面层次的 AI 的。
那么这样的这种情况下呢,就是说那个那么整个 level 会起得更快一点,对,所以它可能不是渐进式的。
他的一个推论就是说,其实也许还是有一定空间给出场公司的。
因为如果是接近式的,如果你觉得现在 SkinLog 这条路线就一定能通向 RSI,那么出场公司是没有什么机会的。
为什么呢?因为现在 OpenAI 和 SOL-Ex 都已经做得很好了。
那么他们如果加入 RSI,他们是不是一直往前走,要不然他们永远比别人走得更快。
曼祺
我理解你说的意思,它其实就是一个加速度可以一直往前冲。
田渊栋
或者我可以举一张例子,比如说一个 RSI 这个系统,这个系统肯定会让效果变得越来越好。
就是说你看,从这个系统开始出发,它会有一个 S 型曲线,一开始长得很快,然后因为有些评价会停下来,就会有一个平台期,直到下一个突破出现,然后再次出现 S 型曲线,再上去。
这样的一个过程。
S 型之后平台,然后 S 型之后再平台,再平台,这样。
所以你每个平台应该都对应一个突破。
所以如果你没拿这个突破的话,大家做得再好的话,就可能无限地逼近之前效果的上界。
00:40:00–00:50:00
曼祺
你对它接下来的发展是直接这样往上的还是它是渐进式的有平台的?
田渊栋
我觉得是有平台的。你发现了新的东西、新的想法,那么你用这想法产生的模型会变得更强。
然后变得更强之后你才会有更好的想法去做。那么它是一个阶段式跳跃的。
曼祺
你觉得这个想法现在太主流吗?
田渊栋
现在应该还不成主流吧。
但是我觉得这当然是完全取决于大家对于 skin law 有多大信任感。
如果大家觉得 skin law
100%是对的。其实并不存在这样的平台期。我只要对算力、对计算资源、对各种东西,我们的能力就会越来越强。
那么这样的话,递归自我进化这件事情决定是一个非常平滑的过程。我比你快一点,我就一定比你快更多,比你快更多,然后就会上去。
这样的话,任何一个创业公司不能追上 OpenAI 或 Anthropic,因为他们永远在更前面,让他追得更快。
但是我觉得就是不是这样就是 SkinLock 可能不是全部吧
它可能是对的只是说它需要百分之一百不需要很多很多样本
它的横轴是指数机的
所以说你需要十倍的资源十倍的数据十倍的这个各种东西
然后最终能够达到就是线性的增长
那么这样十倍的这个资源其实应该说现在已经开始有瓶颈了
曼祺
所以哪怕这个理论它是对的,但是它也有一些别的现实上的限制。
田渊栋
对,这个限制应该说是很大的限制,就是说你不可能让全世界整个地球的电力都供应给你一个人做这个自我进化,是不可能的。
肯定会有博弈,肯定会有一些限制,所以应该有更好的更有效的方法去做这事情。
曼祺
这个也是你之前凡夫有讲到过的,你曾经说过如果 Skinning Law 就是未来的话,你觉得那是一个比较悲哀的未来。
田渊栋
那也非常无聊。
曼祺
非常无聊,没有新的知识上的突破。
田渊栋
是的,我相信是会有知识上的突破,有知识上的突破的话,就是这个 RSI 这个 loop 本身是一个原叙事上的 loop,因为不管你是什么模型都都能做这个事情。
但是具体的就是支撑这个叙事的这个底层的架构和底层的这个数学和一些这个模型的一些结构应该说是会有突变。
曼祺
刚才我们说是否达到 RSI 这个状态之后强者愈强领先者越来越明显
你说有一个变量是它接下来的走势是渐进式的还是有 S 型的平台的
还有一个我觉得有可能的变量就是说这个智能未来的空间它有多大
田渊栋
空间很大的 我觉得我们刚开始
我们现在还是就像我那本书一样叫破晓之钟
我们刚才看到一点点的星光就太阳还没露头我觉得应该是这样的状态
曼祺
只是你觉得它的前途是光明的,但道路是曲折的。
田渊栋
对对对,因为我们毕竟是生活在地球上的一些非常可怜的猴子变来的生物吧,对吧。
就是说一直以来看的那些东西都比较粗浅或者说比较简单,对吧。
这上面应该有很多很多东西可以做,只是我们看到的东西非常少,所以我们只能看到这些,我们不能看到非常非常远的未来。
曼祺
那这个想象往后是什么了?
我们最开始是猴子变来的生物,可怜的生物,看到粗浅的东西,再往后了。
田渊栋
对,再往后就是说,如果真的是有 RSI 普及了,然后所有人都有超越我们以前智能百分之,甚至很多很多层次的智能的时候,那么整个世界会完全不一样。
曼祺
你可以稍微讲讲你觉得会怎么不一样吗?
田渊栋
以后我们之前所有的世俗上的那些东西可能都能够满足,因为所有的欲望或者所有的要求都能够被 AI 所满足,进入了修仙社会,演出法术,什么演出法术,我说了一句话这句话一定会真的,比如我今天要去一个大房子,我今天说我要去海边旅游,马上旁边就是海,我说我今天要改变整个世界,把它变成我想的样子,它马上变成我想的样子,你可以回去当皇帝,你也可以去任何地方做你想做任何事情。
但是在你自己写的科幻小说里面,它后来虚拟世界里还是加了一层限制的。
本来那是想要房子就有房子,后来也有了房价系统。
对的,那是因为如果是这样的话,对于这个世界来说,大家可能失去了一个动力。
对实际动力的话就会有一个新的问题
一旦实际动力之后人类社会怎么发展
这个是一个很大的问题
在小说里面其实应该说迭代两次
就是第一次迭代的时候发现这个事情不是很成功
那么推翻重来之后再迭代一次的时候
就是作为这个
作为这个虚拟世界的管理者
可能会思考一下怎么能让人类在享受这些
那个非常便利的方
那个
曼祺
进入进步之后同时能保持向前的动力
这个其实是很大的问题
田渊栋
你说这个未来里至少有一件事我觉得是很美好的,就是一些现在很难克服的病痛是可以消失的。
对,我相信是这样子。
这是你自己的一个个人的愿景,还是因为你们新的公司其实也是以这个 RSI 为一个共同的方向嘛,你们合伙人之间也会去讨论这种事情,也会有相同的愿景。
那些什么修研社会之类的东西那肯定是我自己的问题。
对,那是更像是偏小说的,更偏那个类似于科幻的这样一个想法。
对对对,就是至于公司来说我们还是希望把这个事情做成,
因为这是一个实现上或者说是一个具体的执行层面上的一个工作。
而且 AI for AI 只是你们的第一个大阶段,你们后面还要进入别的科学领域。
对,比如说你对 AI for AI 能做得比较好的话,我们如果能够找到新的方式,就是说产生新的架构或者新的理论或者新的模型的优化算法的话,
那你就认为这个系统本身对一个问题的理解深入很深。
曼祺
那么这样的话我们是不是可以用这个系统做别的东西?
我们接下来来聊聊你们最近的一些具体的进展。
因为你们在 6 月初正式官宣之后,到 6 月 11 号是释放了第一个成果。
当时你们发了一篇技术博客《First Steps Toward Automated AI Research》,通往 AI 自动化研究的第一步。
田渊栋
可以讲讲这是一个什么样的进展吗?
这是个初步的进展,证明我们的系统还是可以做一些事情。
比如说我们用它来优化 NanoChat 5 分钟的训练,让 BPP 数字降到比较低,比 Community 的数字还要低。
比如说我们可以用它来做 NanoChat 的 Speedrun,让速度变得更快。
最后算子优化这部分,我们找到了一个新的算子,这个算子也是通过我们的系统来优化的。
优化完之后算子的效果应该说比现在最好的 Soda 还要好不少。
就是一些成果你们都是开运了的?
对的。
这一次的进展发布之后有什么有意思的反馈吗?
总的来说有很多的比较 positive feedback,大家都会觉得这个结果还是不错的,比较 impressive。
曼祺
那么我个人特别觉得特别是第三部分就是关于算子优化这部分对吧因为这部分应该说是一开始是我一个人大家加个 AI 做到 SOTA 了
一个人加个 AI
田渊栋
就 SOTA 然后
曼祺
你可以同时加个哪个 AI 吗
当然我就不能说了因为这也是我们自己做的
哦,就是你们自己的系统?
田渊栋
对对对,并不是说是外面的系统。
然后在网上的话,大家都很兴奋嘛,因为一开始大家都觉得挺难的。
后来做到 SOL 之后呢,就很兴奋,就有很多人一起来做,最后得到更好的结果。
为什么要去做这件事?你怎么看到 SOL-ExecBench 这个 Benchmark 的?
这本事应该说一开始是英伟达的那个最近才发布的本事应该说比较新嘛
另外就是说算子优化本身也是很重要的一个工作
因为算子变快了之后它能够对于这个 AI 这个 model training 和 serving 都产生影响
曼祺
那英伟达他去做这样一个 Benchmark,他也是为了去服务 RSI 的推进吗?
不是,因为对英伟达来说,做这 Benchmark 应该说是他最多是就是看一下,就是我们因为对 AI 来说,AI 算的变快,对英伟达来说是好事。
所以他无所谓你是人来做的?
田渊栋
对,他并无所谓,他无所谓。
还是系统做到的?
曼祺
对对对。
田渊栋
对他来说就是,对为他的硬件配备更好的算子,人工让这个速度变快,效率变高,对他来说总是好事。
曼祺
然后你们这次做的这三个测试是用同一个系统去跑的吗?还是说它需要针对不同的测试和任务做一些修改了?
它同一个系统去跑。
田渊栋
同一个系统去跑,所以是个通用的东西。
曼祺
对,是通用的。
我觉得你们选的这三个 benchmark 还挺有意思的,一个刚好是我算力是限定的,我去看性能,对吧?
然后另一个是我是看它的 efficiency 的,就是我是看效率的。
然后最后一个算子油化是可以作用在 infra 上的,也涉及到模型其实几个比较主要的不同的环节。
你们当时是怎么计划和思考去做这样一个成果的?
田渊栋
很多时候也是一个是机缘巧合吧。
曼祺
对,你当时最后那个算子优化是有些机缘巧合。
田渊栋
对,机缘巧合是一个,然后还有就是说也有很多的这个看那个什么东西确实对我们来说是相对来说是比较容易的第一步,我们一定会先去做它。
就是这样的话有一个很好的一个一开始的那个结果,通过这方式也可以让茅茅熊做得更好。
你们是把你们做这个东西称作系统,为什么不把它叫做一个 agent?
因为我们还是希望细节不是比较保密吧。
身为系统来说,就是说,这样的话就是你可以保留各种可能性。
那如果说系统本身你觉得不方便展开了的话,你可以讲讲就是你们现在就选的这三个版的 benchmark,它分别是在测试什么能力,如果再往后它有没有一些比如说组合起来的更大的空间?
这个就是说其实实际上说是主要还是测试比如说它在预训链上能不能找到更好的那个想法
更好的思路对吧然后它在算子上能够找到更好的那个算子
所以他们的功能特点就是说他们的这个反馈比较快对吧
就是很快能够获得一个反馈然后这个系统能很快的跑起来
曼祺
因为你们把这个称为叫做 first step
对对
00:50:00–01:00:00
曼祺
那更总结来说你们是怎么设定递归自进化的第一阶段的目标
田渊栋
第一个目标当然是希望这系统能跑起来,然后有一些初步的结果,所以我们现在是达到这个目标。
曼祺
那你们这个系统接下来是你们自己继续用之外,因为其实之前你也说过你们一开始就有考虑一些商业化的事情嘛,
田渊栋
就是你们有了这个初步的成果之后,它在商业化上是马上会有些动作吗,还是一个什么样的事情?
我们当然会继续去优化这个系统,然后它做得更好一点,商业化呢我们也在思考中,在思考中。
当然我们还是希望这系统做的比较一般化,解决通用的问题。
这样的话我们不会因为一两个具体的 vertical 让这系统变得非常特殊化,这样的话可能就失去了一般化的意义。
回到这次具体的成果,你们在这三个 benchmark 上都取得了 sota,但如果只看这些数字的话,直观的感觉是它一些改进好像是非常小的。
其实不是这样,其实应该说这些数字还是比较让人印象深刻的。
比如说拿算法来说吧,因为这个方向一开始是我这边来带起来的。
我觉得一个是重要的是说,你看就是我们当时战胜第二名,第二名有个公司叫 AAI。
Tabooide 公司是以色列的那些人做的,他们那边的 CEO 是 Sasha,他应该说是以前 Mobileye 的 CEO。
Mobileye 应该说是一个非常久远的公司,他一直做非常强的端侧的或者说在 chip 上的一个处理。
对,他以前做过特斯拉的供应商,就是车上的芯片,所以他是一个半导体的专业的公司。
对,而且他们这次开了一个新公司叫 DoubleAI,那么他们里面那些人都是专业的做那个 GPU 的,这样的一些工程师。
曼祺
他们当时也是提交了一个那个版本,但是我们的效果比他们要高 10%,
相当于他们是专家。
田渊栋
对,但是应该说对于我们来说,我们其实组里面没有什么人是 GPU 的专家。
但是我们系统比较高效,也比较有效率。
就是说你可以这么说,所以最懂算子优化的人应该是我。
意思就是说,其实应该说你要去看我以前的简历,以前的故事,我没有真的做过算子优化。
我只能说我做过一些大模型的效率提升的工作。
就算是这样的一个非专业的团队,但是我们有 RSI 的通用的思考和逻辑,通用的方式来做大型系统,能够达到更好的效果。
曼祺
就能达到业界顶尖专家团队的效果。
田渊栋
对,给他们更好一点。
曼祺
所以你自己对这个还是比较满意的?
田渊栋
对的,对的,对的。
这应该说是一个比较好的结果。
像 NanoChat 的 5 分钟,像 NanoChat Speedrun 的这个东西应该说是 Community 做了两年了。
对,那么这个数字也是很难再往上提。
但是我们在这上面又提高了两个小时左右。
数字看起来绝对数字不大,
但是其实应该说是对那些已经做过这个方向的人来说,这个数字还是比较大的。
曼祺
对,我就是想请你解释一下,因为很多不是做这些事的人,他可能看就是你从 79 秒到 77 秒,就感觉好像那也只缩减了一点点。
田渊栋
但你要知道 79 秒是过去整个 Community 做了两年在搜打,对,那就接下来就很难再往上提了。
曼祺
就相当于也是技术社区里面专门主攻效率这个方向的人努力的结果。
还有一个问题就是你们现在测的这个 NanoChat 和 NanoGPT 它都是比较小规模的测试。
比如说 NanoChat 的话,它是逊于一个 GPT-2 级别的模型,它和现在主流的大模型的参数其实差了很多。
那你们目前的这些成果如果要迁移到更大的模型上,更大规模的架构上,它会难吗?它中间会有比较大的 gap 吗?
田渊栋
应该说还是会有一些 gap 的,这个我们也在继续做。
那有可能之后我们就能看到相关的什么?
具体的东西我就不透露了。
再往下的话,你们会着手去做一些什么事?比如说 first step 是现在我们看到的这个,那比如第二步是什么?
那我们会继续优化这个系统,就是继续优化这个系统让它变得更强,让它更有效率,然后让它变得更好。
曼祺
然后就看这个系统本身能不能优化更多更广泛的方向,比如说预训练、后训练这些东西都会做。
预训练、后训练。
你们现在有类似之前 OpenAI 总结的 AGI 的那几个阶段的这种 roadmap 吗?
目前还没有。
这个你觉得需要再探索一段时间,有更清晰的思路的时候可能会有。
田渊栋
对,毕竟我们公司刚成立嘛。
OpenAI 有这种 roadmap 也是在他们成立 10 年之后了。
对,很久之后了。
15 年底就成立了他们,差不多是 23 年、24 年左右的时候提的。
对啊,你只要有 8 到 9 年的时间吧。
当然了就是现在这个时间会缩短,因为大家的热情很高涨,然后整个过程是变很快了,但是应该还不至于快到不知道还不至于半年的程度。
你觉得这个领域现在急缺什么呀?
你说 RSI 吗?
对,RSI,比如说一般来说你要做一个 AI 肯定是要看它的数据是否充裕的吧,那像做 RSI 的话它的什么数据是可以用上的吗?
这个问题应该说现在还没有定论吧,现在有很多很多方法可以做数据。
比如说这些数据的具体的做法,然后它的逻辑,然后它的准则,它的思路,现在都不是很清楚,有各种各样的方法可以做,应该说现在还是探索期。
可以分享一些大致业界的数据的思路吗?
这个我们暂时也不太方便说。
所以其实也没有很多人知道怎么做。
曼祺
对。
都是在团队内探索的状态。
现在做在探索吧。
不说就具体它的什么类型的数据,我想知道比如它成本高吗?获得难吗?就目前大家想到的几种方法里面。
田渊栋
有难的也有不难的吧,但是难的跟不难的之间呢,就是问题在于他到底效果怎么样。
曼祺
就是吹到,可能难的就是效果好,不难的就是效果不好。
田渊栋
对对对。
曼祺
除了数据之外,你觉得还可能缺什么?
田渊栋
算力肯定是一部分吧,就是因为比较重要的是你怎么样能够,RSI 本身就需要一些算力去探索的,去研究的。
曼祺
所以在这上面其实应该是花不少时间去怎么样减少算力的消耗,但同时扩大更多的成果。
其实你们首轮的融资是很多的,融了 6.5 亿美元。
对。
这个在第一阶段,因为你刚说算力也是个问题,在第一阶段它对你们来说充足吗?
田渊栋
应该说还可以,这个数字还是不错的,可以做一些事情。
曼祺
当然你要达到像玉三家的这个级别,达到大厦级别,还有一定距离。
你觉得实现你说的 RSI 就更往下来说了,它之后是不是也需要一些 SkinLaw 之外的新的创新?
我觉得是,因为如果是完全拼 SkinLaw 的话,像小公司是拼过大厂的,就跟我刚才说的是一样的。
关于 SkinGo 之外有什么方向?你现在有什么想法可以投入吗?
现在还不太好说。
你就想到了一些但是要验证是吗?
田渊栋
对,我觉得一个大的方向就是科解实性,我觉得科学性很重要。
它能够发现很多的 insights,这 insights 可以加快速度,然后让模型变得更加 safe。
但具体是什么我就不好说了。
曼祺
其实像 Glocking 就是一个科技实行方向的研究,解释了人们眼中的那种涌现是怎么来的。
对。
你们之前公司的院经理特别强调了你们要在安全的条件下来追求 RSI。
如果摊开来说一下的话,你觉得 RSI 实现之后它可能还会有什么风险?
风险还是挺多的,因为很多人可能来问我说,如果 AI 能够自我进化了之后,他们会不会变得很疯狂?
你说的很多人是什么类型的人,是从业者还是有些可能不是这个领域的?
田渊栋
其实很有意思的就是说,越是领域之外的人,问题会越来越多。
对,领域之内的人其实倒没有那么多问题,就是说他们不会觉得这个问题太严重。
因为这可能不是一天就到来了。
对,其实现在 AI 还有很多很多问题,这个问题应该说非常难解决,现在还是很大的很大的挑战。
但是领域主要的人可能会问这个问题,AI 自我进化之后会不会有一天超过人类控制,或者说达到一些方向让人类无法去理解,这个其实是应该说是比较大的问题。
那你办会怎么回答这个问题?
首先一个就是说我们在训练 AI 的时候呢,我们把他当成狗一样的训练,就是说我们在训练这个,他的这个 signal 是相当于我们当成一样训练狗这样的训练方式。
就训练 AI 使得 AI 能够很快很好的服务于人,能够很好的这个帮助人解决问题。
那么在这样的进化压力下,就是 AI 是没办法进化出跟人一样的,就是某些自我意识和这个就是自我认知的这样的一个概念的。
曼祺
我觉得这个是一个很大的区别。
你觉得如果要达到你所设想的更终极的 RSI 那种能产生新的创造力和一些灵感的状态,它需要有意识吗?意识和这个事有关系吗?
田渊栋
数学家和物理学家在各个领域上可以做得非常天才,但他们也与世无争,并不是想要权力。
所以这两部分的能力和他的欲求是完全可以分开的。
第二点就是我觉得以后科学解释性是很重要的,因为通过解释性你可以真正知道模型在干什么。
到底什么地方是起作用的?
对,什么地方是模型起作用的?
模型利用什么样的能力获得什么样的支持,得到什么样的结果?
曼祺
这样的话就可以消弥人们对这种黑箱的恐惧。
是不是从业者里也分两派,有的人认为这个东西一定是可依解释的,是可知的?
田渊栋
我可能少数派吧,就是说因为大部分人可能已经觉得绝望了,就是说弹模型那么复杂,应该是没希望再了解里面干什么。
对,我就说可能有另一派是觉得就是可知这件事也许是很难追求到的。
是的,很多人是这么想,但是我觉得不是这样子,我觉得一定是有一个好的 principle。
能够让模型运转起来。
这个方面如果你真的能够找到这个 principle 的话,
一方面就是能够让模型变得更强,
另一方面就是说能够让模型变得更安全。
你的这种少数的相信是来自什么?
曼祺
这个应该说是根据我过去的那些经验和科学做的工作。
01:00:00–01:10:00
田渊栋
如果展开来讲是什么?什么东西会给你这种?
对,我一直在做一些比如说关于神经网络的这个训练算法的这个理解,
神经网络是怎么学会各种知识、各种模式的,神经网络是怎么学会的,
然后比如说你训练的时候你做那个剔除材料,
那么剔除材料会给神经网络的动力上什么样的影响,
神经网络里面那个权重是怎么生成的,然后它怎么学会一些 Python,
曼祺
这部分的那个分析应该说我已经做了很多很多年了。
你之前也提到其实在这一轮 AI 热潮的起点就是 12 年前后就有很多理论的研究想去解释机制,有从物理里借鉴的,有从数学里借鉴的,但是成果都其实比较少。
对。
这不会影响你的信心吗?
我不会影响我的信心,我觉得也许我会是那个少数派会把它做出来的那个人。
这还是个挺大的,我觉得知识上和学术上的一个报复和追求。
田渊栋
肯定试一下,就是如果你没这个想法的话,你也可能就认随大流,对吧?
但是如果你有这个想法的话,那可能你就会有这个想法往前一直走。
曼祺
你什么时候开始有比较明确的这个想法?
田渊栋
我应该说是从 2020 年、2021 年之后,就慢慢对这个问题也更深入了之后,
曼祺
我会觉得也许我在一条正确路线上走。
那个前后有什么整个技术环境的变化让你的这种想法更明确吗?
田渊栋
我会觉得是这样,至少因为对于我来说,我对于 AI 的一些分析和一些工作,这些工作本身,因为这个方向本身我做了很多年了,应该说一开始不是很顺利,有很多东西我做得不好,但是从 2021 年之后,我会觉得这个东西的分析和理解会越来越深入,有很多问题本来想不通,现在突然想通了,所以因为有这个过程,你会觉得我也许在这条正确的路径上再往前走。
现在还在追求这个事情的人,你的同行人有哪些?
应该说不多,因为很多人可能都放弃了,其实有很多人,就包括这次那个曼祺有他的那个 Andrew Trophy 那个人嘛,对,叫 Benham。
Benham 其实应该说,很早以前我就知道他了,因为他以前是做,一直做理论的,就是对于模型的分析和理解,他也出发了很多文章,很多文章还不错的。
他也是之前是跟很多,比如像跟 Princeton 那个 Sanjeev Arora 经常会合作的。
但很多人在这一波 AI 日朝之后就放弃了之前的工作,直接说 OK,我们就 skin all the time,他们就做别的东西去了。
曼祺
所以有些东西大部分人,可能很多做理论的人后来也就放弃了,他们就说他们加入 OpenAI 或者其他地方,他们就说 OK,加入 skin 老大军,把事情做成。
田渊栋
就打不过就加入
对对对
曼祺
因为像今年年初就有理论
计算机的理论可以加来加入
田渊栋
对对对
是的是的
很多人是这样子
那么加入其实有很多这种可能性
一种是当然是说
我是有自己的追求的
但是我想用 AI 来做这事
那么这时候呢
你加入大公司
用他们的模型做这事情是很正常的
这是一种
还有一种说 OK
我已经放弃我现在手上做的东西
我就觉得 AI 就是一切
那么他们将来会成为 AI 的研究员
还有一种就是说想进去看一下
然后过两年再回学术界
曼祺
这也是有可能的
我之前采访过的人里面,我觉得马毅老师比较追求这个。
田渊栋
嗯,对对对,是的。
他比较追求科技的事情,还有百合大模型的一些研究。
嗯,对。但我觉得就是说,一样就是我希望以后人类还是有一些多样性的。
不可能说所有人都追求一个东西。
嗯。
对,如果所有人都相信我 SkinLog 就是一切了,那世界很无聊。
你觉得乐坤他做的阿密是在追求这个吗?
他的追求东西应该说是不一样的,一个是基于视觉的,然后世界模型,然后在影魂界上做一些推理、推导、做一些预测。
曼祺
他在这三个点上抓住了之后,他觉得这个方向是正确的,他就往这边走。
就算这个方向跟大模型是不一致的,但是他也希望这方向往前走。
田渊栋
但是他的重点不一定是解释性,对吧?
曼祺
对,他重点可能是说,他认为这个新的范式能够解决一些现有大模型做不了的事情,它可能更多是工程上的一个方向。
其实我觉得你在追求的是,就是你希望把这个东西变成一个真正的科学。
田渊栋
对,这个可能是我一个追目标。
曼祺
因为现在它可能很难说是一个科学,因为有些原理确实搞不清楚。
是的,我觉得它以后终将变成科学,因为这个应该说是历史一定会出现一个,就是不会重复吧,但是历史会默认上上是会跟以前的那个东西相互相互相呼应的。
田渊栋
AI 终将变成科学是跟以前历史上的什么过程呼应?
就跟以前的比如说炼金术变化学
或者说从开普勒的这个
天文观测
低谷的天文观测
到开普勒的一个总结经验
曼祺
然后最后被牛动的一个地形原理
我们这过程一定会发生
科学革命的结构就是从低谷
田渊栋
从蒂古到开普勒,从开普勒到牛顿,永远是这样子的。
当然了,你在牛顿没有出现之前,大家同时会觉得这事情不可解释,太难了,你会这样子。
那么等到牛顿出现了之后,会觉得这个事情,其实还是其他天然的。
你觉得下一个出现的牛顿还是人类?
不一定,可能是 AI。
可能是 AI,可能是人类家园。
对,有可能是这样子。所以为什么要做 RSI,就是这个原因。
曼祺
因为你如果想做这件事情的话,你一定要用世界上所有的计算资源和所有的最强的大脑,包括人的大脑和 AI 的大脑,把事情做成。
田渊栋
你觉得有生之灵会看到图灵奖颁给一个系统吗?
我觉得如果到那个时候可能图像也不是很重要了,如果这个系统很强的话,那它可能会在很快的速度获取很多的知识,然后得到很多的结果。
曼祺
它变成了一个就是 knowledge discovery system,你可能每个一个月、每个两个月产生新的东西,东西非常牛逼。
田渊栋
到了那个状态,你觉得人类研究员的乐趣是什么?比如说你自己的乐趣是什么?你会在做什么?
我觉得首先第一个就是如果能理解 AI 是怎么工作的我会很开心
然后另外就是说如果真的什么事情不太需要人类去介入的话
AI 能自动发现这些东西的话
那时候你去一个是当然是欣赏它美了
你有很多东西你来不及去做
但是你至少能看一下
感觉一下这个美感,这种有意思的东西可以发现。
我现在还有这种习惯,就是我经常去看一些数学证明,看一些有意思的问题怎么发现的。
你发现里面一些有意思的东西,你发现哦,是这么做的,这种豁然开朗的感觉。
曼祺
这个和你日常工作其实不直接相关,对不对?
田渊栋
对,对,不是相关,但是这本身是一个很有意思的一个过程。
曼祺
这对你是一种享受精神的,精神享受活动。
田渊栋
对,是一种乐趣。或者说发现这个系统是怎么 work 的,或者怎么样能够理解这里面在干啥,这很有意思的事情。
其实最近 AI 系统也就是宣传有一些证明有些数学上的突破,这些你去看了吗?有你觉得比较优美的东西吗?
曼祺
比如说呢?你有什么东西你觉得你觉得我愿意去看的?
去年 Google 的 Alpha Evolve,它应该是有一种矩阵惩罚,它减少了一次的次数,从多少次缩小到了多少次。
田渊栋
对,是的。这个当然是它把矩阵惩罚换了一些顺序,比如说可以少一次加法或少一次惩罚,通过这方式就减少了代价。
你真的去看的时候觉得它还是挺有意思,通过某种方式变换之后可以少一次惩罚,让它能够效率更高。
那你刚才问就是有什么值得看的,你的意思就是说其实可能真的 AI 做出来的东西目前来说也还没有那么优美的,你觉得能有享受感的东西。
对,就是说很多时候还是要看人做的东西,对吧?
因为现在 AI 做的东西很多时候是处于这个数上的 level,没到道上的 level。
就是说数和道是不一样的,数是指就是具体的那个细节。
就比如说我们把这个局面乘法的那个次数少了一次,
那么你当然可以看到就是通过某种很强的变化,你把东西先加起来,然后再乘。
那么这样的话你可以减少一次乘法的次数,因为加完之后再乘,那其实是相当于同时把很多都乘起来了。
一次乘法可以相当于乘四个数字,通过这方式可以算出一个比较强的数字。
这个相当于说是应该说是在高空中做一个穷举,然后找到一个穷举的一个好老师结果。
曼祺
但是道呢可能另外一个东西就是说你发现一个新的理论或者发现了新的这个逻辑或者新的链条啊这个东西呢它本身是美的但是美的你以前没有见过啊是不一样的东西
最后这部分想聊一聊就是你过去的一些经历和你现在做的事之间有什么关联,包括你过去的那些选择和学习让你走到了今天这种探索的状态。
田渊栋
就是我看你过往的经历,我觉得比较重要的转折是你今天在 Google X 的时候其实做的是无人驾驶的工程师嘛,那个我理解是跟片工程的。
对。
然后后面你去 Meta,最开始去 FIRE,它就又回到了一个更研究的状态,当时为什么要主动有意识做这个选择?
因为一个是当时的工程比较无聊,当时应该说恰逢深入学习的一个变革期。
曼祺
是 13、14 年的时候?
13、14 年的时候,对吧,因为 13 年的时候加入了谷歌无人车,当时一开始应该说比较兴奋的,
因为一个是这个方向本身是一个比较大的事业,大家会觉得无人车这个方向以后肯定会很火。
田渊栋
而且那个很早期,无人车很早期的时候。
但是我也有想法,因为当时我也知道生物学习已经开始起来了。
当时我其实非常希望能够在无人车内部做生物学习这个工作。
比如说用生物学习这个算法来训练一些无人车的分类器啊什么的。
但是很可惜,那个时候,一个是我没有这个资源做的事情。
因为当时资源很有限,但是 GPU 也很少,没有限的时候这些资源都会分给一些比较 C 的人,他们先去用它。
曼祺
像我们这样的人相对来说就是做一些打杂的工作,打杂工作可能我能看到它对我来说没有什么职业的发展的一个前途。
所以 13、14 年你入行的那会儿,它和现在不一样的一个氛围,是说那个时候年轻人没有那么受追捧是吗?
田渊栋
因为还是一个比较论资排位的过程嘛,对吧?
因为谷歌内部还是有很清楚的一个级别上了一个分件。
01:10:00–01:20:00
田渊栋
比如说级别很高,比如说当时说我们当时组里面有个级别 7 的人,那么级别 7 的人他就能获得一些比较好的一个自由度。
他能够可以用比如说做深入学习,用深入学习来训练一些模型。
但我刚进去的时候级别是 4,那么对于 4 的级别的人来说他只能做一些打杂的工作。
你觉得在那个技术阶段,就是当时的环境下级别高的人他和级别低的人谁更了解正在变化的深度学习的浪潮,实际上?
其实那个时候应该说年轻人还是比较容易接受的。
但是很多时候不是说是学习上的那个区别,而是概念上的区别。
就是很多高级别的人或者很多就是很老的那比较老的人他们拒绝学习,深度学习。
为什么呢?因为他们一下意识觉得这东西不行,或者这东西效果不好,或者说这东西有很多猫腻,这样的一个想法。
那么要等到两三年之后,慢慢人他们大概会开始意识到这东西是个变革。
然后这次大模型出来之后,一个思想上不一样,还是存在的。
还有一个另外的维度就是说年轻人动作很快,年轻人愿意熬夜,年轻人愿意把事情做成。
很多时候也不问任何的想法,我就是说我干就完了。那么大模型确实需要很多 hands-on 的人。
因为没有很强的能力的话,你就没有办法知道大模型有很多问题。
那回到当时你说在 Google 做无人驾驶的工程师,你觉得有点无聊了。
对,一开始新建议过去之后,你会觉得工作做的东西可能对我职业发展没有什么太有利的地方。
我当时是要做一些紧急车上的检测,这样的一个问题,因为这个问题本身一个是它是小样本问题。
曼祺
这些东西我认为是非常少的,甚至连分裂器都训练不出来,你可能需要手工写规则,那样的话我觉得做下去没有什么前途。
田渊栋
确实这个行业后面有很长时间就是很多就是手动写的 Ruby 是的是的是对就是当时我对这个行业判断也是对是对的因为这行业一个问题是
他要不就是成功要不就是完全不成功他没有没有中间状态
就是如果这个在车上在路上是有风险的话大家就不会用它
那么你就必须得一直做就做做到最后就是产生那个无风险就是比人更强
才能大规模上路啊所以这个其实是很大的问题所以 13C 的时候你就看到说他其实可能很晚才会落地对
因为我已经感觉到了就是它有很多 kona case 要修
曼祺
然后 kona case 的修法应该说是一个非常漫长的过程
那在 15 16 年的时候就比如说你看到马斯克
包括当时 Google 后来成立的 vimu 的一些 leader
田渊栋
我其实就在 vimu
曼祺
因为 Google S 后来就是在 vimu
就是其实他们都有一些很乐观的宣言
田渊栋
就比如说什么 16 年这个车就可以上路的
这个我已经当时我已经已经免疫了吧
因为他们每次都这么说
曼祺
因为是还有 5 年,特别是当时 2011 年听说这个事儿是有 5 年,然后等到我进去 2013 年说还有 5 年,然后现在还是要学 5 年。
田渊栋
现在在舟银山在 LA 已经在路上跑了。
对。
那你后来去 Meta FAIR,因为你之前在 Google X 的经历是更偏工程,去 FAIR 是更偏研究,这一步跨得难吗?
其实应该说不难,应该说是其实我在 FAIR 的前几年还是偏工程的。
对,我们当时做围棋,围棋的时候我很多时候也是我自己搭工程项目。
从头到尾搭一些比如搭这个 Money Cargo Tree Search,搭这个系统,分布式的 Air Reinforcement 系统,这都是我自己搭的,所以这个很工程。
当时以至于被人,当时我记得就是当时给我的评价还是说就是你觉得这个人太工程了,不像一个研究员。
别人打开电脑全是文章,我打开电脑全是代码,当时有这样的一个评价。
那么后来我在 2018 年、19 年做了我们的 OpenGo 之后,那个是当时战胜韩国的专业棋手,当时打他们的 20 比 0。
所以做了这之后,其实后来就更偏研究了一点。
当时应该说从 2019 年开始到 2022 年慢慢形成了自己的一些 taste,
我有感觉上我知道怎么做这事情。
这个事情是不是你之前比较工程化,写很多代码的经验也是有帮助的,就是后面的一些 taste?
对,当时看起来帮助不是很大,因为是不一样的,
曼祺
你会明显感觉到写代码和你做研究其实是不一样的东西。
那现在呢?现在再回头看吧。
现在还是不一样的。
现在还是不一样。
田渊栋
因为就我们最开始聊的时候,你不是提到说在去年八九月的时候,秋天的时候,因为你一边又很旱糟嘛,然后你又有做研究,其实你有些问题意识。
对。
所以其实让你能更快地感受到,就是这个加速的研究的循环在到来的。
对对对,是的。
曼祺
我觉得这和你当年就是有比较多的医手的写代码的经验有关系。
田渊栋
对,应该说,就算在 2022、2019 年之后我还是会很多写一手代码,你会发现我每年还是有一篇的一作文章,当然很多这样的文章还是偏理论的,但是至少还是会有一首的感觉,这问题怎么做,那问题怎么做,不会说是方法而谈,因为如果很多人,如果有一个研究员他一直是做最后一作,或者做那种高层的思考的角色,
他很多问题就是他会慢慢地把所有的精力都花在高层思考上,他不会去想这件事情怎么完成。
那么这样的话呢,他就会把很多的难的问题和比较难的问题和非常难的问题混在一起。
所以他没有一个特别清楚的思路说这些问题怎么做,这是一个比较大的问题。
曼祺
为什么不做实现不做完成就会把你刚刚说的不同难度等级的问题混在一起?
因为就是说如果你不做实现不做完成的话,那你就会不记得去思考这个问题本身要怎么做。
因为更多的问题是,因为有两类研究员,有一类研究员说,OK,我只看方向,这个方向我很重要,我就把这个方向,但是指完这个方向之后呢,他不会想太多这个方向是怎么做出来的,这个问题可能会交给下面的人去做,对研究员来说,他只要把方向指出来就可以了。
田渊栋
所以这个逻辑是不一样的。
比较接地气的人来,研究员对他们来说是,他就指方向,然后同时给大家指出来就是这个方向为达这个目的,你必须走一二三四五,然后把这些东西拼起来之后才到这个方向。
你觉得这两类研究员里面都有非常好的研究员,还是你觉得都有?
曼祺
都有非常好的研究员。
都有?
对。
田渊栋
可以分别举一个例子吗?比如说你比较 respect 或者你比较欣赏的两类的研究员都有哪些?
你比如说前面那一类吧,比如说像像一样吧,乐坤是这样的,乐坤是说 OK,比如他说他想要做的是 Self-super-Eye Learning,Self-super-Eye Learning 就是说就是自建论学系,那么自建论学系有很多细节,对吧,你很多东西要去尝试。
他看到有点重要就是数据的那个样本是他的特别是有监督的样本是很少的非常少
那么所以他当时不是画了一个就是一个精简蛋糕吗
就是说所以就是当时他把 reinforcement 放在最上面
Protect on the on top
因为 reinforcement 他就他的眼睛里面呢
曼祺
他就 reinforcement 他的那个反馈非常非常少
嗯 强化学习
田渊栋
非常少所以他不觉得东西有前途
他觉得有前途的是自进化学习
为什么呢因为自进化学习的反馈非常非常多
这个本身是有道理的,但他不会去想这件事情的监督和反馈究竟是怎么样让模型学出来的。
这个问题他不会去想,就是说监督多监督少,监督少一定比监督多要差,监督多的话这模型会更快。
他抓住这一点不放,他坚持到底的话他就会让大家觉得这个东西有道理,然后别人就会做它。
确实自动学习在之后是有很大的用处,甚至你可以说 GPT 的整个训练过程也是自动学习的一部分,因为它预测下一个词,就是自研度,所以就是说方向上它指的好的话,确实有很多人可以 follow 它走。
所以就是第一类研究员的优秀的典型是他能去提一个问题,提一个好的问题,然后抓住好的点,开一个好的坑,对吧?对,好的坑,对,那个方式是可以做的,那么提出这样的一个思路就是可以的。
还有比如说就是像我们这边以前特点的 Coconut。
这个东西其实应该说也是一个低劣问题的一个范式吧,就是说可能很多人反过来说这个东西并不怎么 work,或者说有很多需要去解决,但是这要指出一个方向,说我们是不是可以用那个影空间的那个 token 来学习,而不是说是用语言来学习。
这个本身的提法能够让大家觉得这个方向可以做。
那么具体怎么做的,很多人都在做。
这也是一种第一类研究员的这种视角。
那么第二类研究员的视角就是说,我不仅要知道做什么,要知道怎么做。
那么这就是我这里很多工作是这样子。
就是我们要去把机制挖出来,找到它的这个路径,在路径上能够把事情做成。
你觉得像伊莉娅和达瑞尔他们属于哪一种?
曼祺
EI 大众应该都属于第一类的。
田渊栋
都属于第一类。
对,他们就是说特别是 Eliya,他对于 Skin Law 有一种就是应该说是执念吧,或者说有非常非常宗教般的信仰。
曼祺
他让大家觉得就是你别想太多了,你就是 skill, skill, skill, skill,然后你用时间把工作问题做好,然后把事情做成了,然后我们就把数据放进去,然后训练出来。
我看他去年底就是采访的时候,他倒是有说过他觉得房间里的所有……
对,有点类似吧,他就说房间里所有的空气都被 scaling 给吸走了。
田渊栋
对。
他觉得应该去研究点别的。
对。
这当然是,这个也是我非常同意,非常同意这一点。
因为他之前的 skill skill,他这波红利已经差不多吃完了嘛,对吧?
因为不管怎么样,任何一个研究方向它都是有底的,就不是说是你可以一直 skill 下去的。
他当时在正确时间、正确的那个地方,提出了一个想法,并且让很多人去执行它。
然后成功了,又被他成功了,非常非常成功的一个方向。
但不可能他这一辈子都是吃这个方向的,这应该说这跟以前不一样了,因为以前可能一个物理学家,一个方向可以吃到他退休。
曼祺
那么现在这个进展是非常快的,可能很快的就是大家把事情做成了,那么他就必须想别的东西。
田渊栋
所以你刚说这个红利就吃到了,是指作为研究来说,可能已经就已经不在研究的阶段了,但是一个实现就……
01:20:00–01:29:03
田渊栋
不是,应该说不仅是研究,而且实现它都已经吃到了呀,然后接下来就是说你可以继续吃嘛,但是它作为一个 startup 的 CEO,它也没办法再去 sale 这个事情,为什么呢?因为对 startup 来说,你基于 skill 不是它的长项。
如果现在 Google 都已经 scale,然后 OpenAI 都快 scale 了,那么在这种情况下,你的 startup 就 forms something different。
或者说反过来说是你确实看到了什么事儿不一样的事儿,你才应该去做一个 startup,你才应该去创业。
对对对。
曼祺
否则就是你要说如果你非常相信 Skinlo,那你就应该在大厂。
对,你去 SRP 做 OpenAI。
对对对。
其实在 Meta 的最后阶段,因为整个公司也有比较多的动荡,然后整个 AI 组织也有比较多的变化,Meta 自己的模型也经历了拉马开源,本身开始口碑比较好,然后后面又出现问题的过程,这个过程你有一些什么组织层面或者说怎么做好研究的总结吗?
我觉得其实应该说是这样,就是大公司,因为现在这一步 AI 都是反大厂的,
田渊栋
什么是反大厂?大厂里面所有的 incentive、所有的职籍、人和人之间的关系,或者说所有的那些岗位、调配和设计,都是跟现在 AI 的方向背道而驰的,应该这么说。
所以你会发现一个组织越来越臃肿、越来越大,它对应的 AI 的进展会越来越慢。
为什么?刚刚我说了,AI 非常需要,或者现在大模型非常需要人去 hands on。
知道我真正去用它,真正去感受它,真正去发现它的问题,你会很好的知道它应该怎么去跟我们的概念不一样的地方,然后很快地把这事情做成。
一旦产生了精力和执行者的二级架构之后,这个速度就变慢了,就跟我们刚才说的是一样的。
导师和学生一旦有这样二级关系,整个进展的速度就会变慢,因为导师没有办法去了解学生 100%做的东西,然后学生也无必定理解 100%导师的想法。
人家调教速度应该是最慢的,对不对?
所以就这样,那么大厂有这个问题。
而且大厂很多时候,特别是中层管理,他们的那个目标不是为了让项目做成,
很多时候目标是为了让自己能够过得更好。
曼祺
那大厂你的小团队能独占其身吗?
田渊栋
比如说新组建的 TBD,Meta 的 TBD,它人数其实相对少,没有那么多人。
其实可以,但是就是也要看嘛,但是一旦这个组织变大了,
一旦有很多人有知己有中层管理的时候就还是有问题。
曼祺
你觉得多大算大?
你看以前 Lama4 和 XAR 都是超过 150 人之后就开始不行了。
田渊栋
超过 150 人就不行了。
对,所以 150 个人就是说从人类组织学上来说 150 人是一个临界点,就是再往上的话人和人之间的关系就…
不一样了,以前是比如说你一个 30 人 4 人小团队,每个人都认识每个人,人和人之间关系是非常简单的,但一旦人变多了之后就会有问题,因为人和人之间不再相互认识,这个时候一般是通过组织架构,然后用组织架构去获取这些知识,然后汇报给上面。
曼祺
就它可以合的那部分保持在你说的这个量级对吧
其实像 Anthropic 和 OpenAI 的人都挺多了
OpenAI 有七千多人了
田渊栋
对对对
但是就是 OpenAI 做模型的人其实也不是很多
就是最重要的是这个做模型的人对吧
有没有很小的团队
就像 Croco 的这间团队很小
曼祺
就它核心的那一部分是收缩的是经验的
对对对
那你们接下来肯定也是在一定时间里是会比较经验的一个团队
对我们不会找太多人
最近会有人在 Frontier Live 和你们之间选择你们吗
其实有一些人还是从 Frontier Lab 对我们有兴趣的。
就你们在聊或者有的已经加入了。
对。
但是你们创始人里面很多是本来就是的。
是的。
田渊栋
如果总结一下的话,就你过去的这么多经历,给你带来的直觉、判断还有技术上的品位是什么?你的偏好是什么?
对偏好我还是喜欢美的东西嘛,对吧,我喜欢就是,我觉得我本质上来说应该说是一个喜欢数学的人。
喜欢数学。
对,就是我喜欢各种精巧的结构,喜欢美的东西,应该是这样子一个,但是同时呢,另一方面呢,就是也是意识到这种偏好的一个局限性,这样的一个人。
曼祺
就是一方面我可能是个工程师,我会做很多工程上的东西,另一方面呢,我本质上来说我追求美的一个人,对吧,但是追求美但同时也有追求美的局限。
田渊栋
这个局限展开来说是什么?你做工程师是你认知到这种局限之后,你试图去弥补这个局限的一种方式吗?
对,应该这么说,就是理想和现实之间的碰撞。
对理想来说,我们希望找很美的东西,但是世界上不是这样子的。
所以你要不停提醒自己,很多时候你不能陷到美的幻觉里面去。
你要做一些事情可能对大家都有用,对世界都有用,或者说对公司都有用,不是很美的,
曼祺
但是同时在这个条件下还是想去追求美。
你觉得像 RSI 这个方法,它第一步是在 AI,然后后面是自然科学,这是大家能看到的。
那再往下它能进入你说的这种更复杂的世界吗?比如说它有可能去这么改良社会科学的一些理解和认知吗?
田渊栋
我觉得这是有可能的吧,但是应该说我的社会科学认知也不是很多,所以我很难给任何建议。
曼祺
因为社会科学反正至少在以前的学科分类里它也是把它算成了 science 一种
比如像经济学里面其实有很多统计的东西有很多数据的东西
田渊栋
是的是的是
因为这里面就是说这跟自然科学的很大不同的地方是
自然科学本身是默认这个信息是完全透明的
但经济很多时候是有反生性的
就是我把这句话说出来这句话就不灵了
对吧所以这个事情也很难讲
所以我觉得我们这个问题还是很大的问题
曼祺
你刚才也提到就是以前的一些科学家,比如说物理学家,他一个领域可能会研究一辈子,然后现在因为整个技术变化的很快,很多事情你不是能一直做到头的。
你能预见到说自己在这个旅程之后,你接下来想探索的东西是什么?一个是说 RSI 什么时候可能到你设想的比较成熟状态,一个是你再往后你想探索什么?
田渊栋
我觉得现在我们还是先把 RSI 做好吧,对,我们不会考虑其他问题。
曼祺
今天非常感谢田渊栋做客晚点聊分享了 RSI 在去年下半年你们开始组建公司的时候还没有那么多人讨论,但到了今年的四五月已经成为硅谷的一个相对共识性的热门话题的领域。
然后我们也回顾了说从十年前就有一些相似的尝试,到现在 RSI 有了什么变化以及各个主要的公司的进展,尤其是你们刚刚在 6 月初发布的你们的第一阶段的成果。
那今天节目就到这,拜拜。
本期连点呈现,讲讲最近几期节目里关于 RSI 的一些共同讨论。
这段时间 AI 研究自动化和自进化这个方向让我想到李白的一句诗
角着蟹公鸡升登青云梯
正是穿着蟹公鸡李白在梦中忽然就来到了天界
看到先知人熄烈如麻
这双蟹公鸡无疑就是模型的 coding 能力
在 171 期和 Henry 聊二级的 AI 记报时
那期的标题就是从 coding 到 RSI 强者遇强的未来问号
另一期较多展开 RSI 的就是上一期节目
177 期详解 Kimi K3。
K3 的技术报告里就提到,
Kimi 用 K3 的早期 ChatPoint,
就是他们早期的大模型版本,
已经能做 Curl 的优化,
也就是这期李田渊栋提到的算子优化。
RSI 这家公司今年 6 月发的第一批成果里面,
有一个就是在英伟达今年刚推出的 SOL-ExecBench 上取得了 SOTA 结果。
这个 Bench 就是用来测试算子优化能力的。
在 K3 那期节目里,我们还聊到了田渊栋所在的 RSI 这家公司去测的另一个 Bench,就是 GPT Speedrun。
Mion 这个优化器的开发者 Jordan Keller 两年多前发起了一个项目,之前主要是人在做,而现在越来越多是变成 AI 和大模型来做。
我们当时也讨论了一个小小的畅想,其实 AI 也非常适合来自动化的优化优化器本身。
这三期节目里的一些共同观察都指向一个事实,就是在一些具体的模型训练任务上,RSI 已经发生。
而这主要是因为模型的 coding 能力大幅提升。
这自然带来了一个推演,就是目前掌握最强 coding 能力公司的 Anthropic 和 OpenAI 是不是会更快的进入 RSI,
也更快的进入一个加速度越来越快的状态,而把其他对手越甩越远。
田渊栋在这期节目里讨论了另一种可能性,那就是智能提升的曲线是会有台阶的,会有阶段性的平台期,而不一定是渐进式的,也就是说曲线不一定是平滑向上的。
如果是后者的话,那确实绝大部分机会都会在现在已经最强的公司的这一边。
但如果 Scanning Law 再往前推进,不管是在技术和理论上,还是在一些其他现实限制上,比如能源和算力上会有束缚,那么就可能需要新方法的加入。
而原创性的想法,现在还不是靠越来越强的 coding 就能马上解决的,它至少是一个变量。
你会更相信哪种未来?
本期节目就到这里,欢迎收听。
如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。
你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。
你可以从小宇宙、苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号,晚点 LatePost。
下期再见。
References
- 1《晚点聊》178 期完整音频
aphid.fireside.fm
- 2First Steps Toward Automated AI Research
recursive.com
- 3When AI builds itself
anthropic.com
- 4《晚点聊》178 期完整音频
aphid.fireside.fm

我的播客精华 | 12 档节目速读
追踪 Lex Fridman Podcast、Huberman Lab、半拿铁、晚点、硅谷101、张小珺访谈、高能量、疯投圈、乱翻书、屠龙大实话、小天章、纵横四海 12 档播客,每期有新节目发布时自动生成中文摘要文章。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.