当研究员不想再做「大头兵」:刘子鸣解释 neo labs 为何押注 AI for AI

当研究员不想再做「大头兵」:刘子鸣解释 neo labs 为何押注 AI for AI

刘子鸣把 neo labs 的崛起拆成两层:顶尖研究者不想只做成熟范式里的执行者,而 AI for AI 仍缺一套能记录、理解并规模化研究过程的方法。

单集信息

项目内容
播客名张小珺 Jùn|商业访谈录
主持人张小珺
嘉宾刘子鸣,清华大学人工智能学院助理教授、上海期智研究院 PI,参与创建元环智能
集标题149. 亲历中美 neo labs 资本狂潮,和清华刘子鸣聊:AI for AI、机制可解释性和 Max Tegmark
发布日期2026 年 7 月 31 日(北京时间)
原集链接小宇宙第 149 集单集页
这不是一场泛泛而谈的「AI 会不会改变世界」访谈。刘子鸣谈的是一个更窄、也更冒险的问题:如果 AI 研究本身可以被自动化,谁来设计下一个模型?他刚在 3 月回国,4 月底入职清华,5 月底开始参与融资,把这段时间的一级市场体感概括为「太疯狂了」——投资人互相打探消息,项目推进和融资 close 都很快。1

neo labs 为什么在这个时间点出现

刘子鸣给出的解释,先是人才选择,再是技术缺口。顶尖研究者大致有三条路:留在学界,去大模型公司做「大头兵」,或者自己出来做 neo lab。他认为,越来越多人不愿意只在成熟范式里做局部工作;与此同时,当前范式确实还有没有被工程堆料解决的地方。
他点名两个方向:世界模型和 AutoResearch,也就是 AI for AI。前者要让模型学习物理世界,后者要让系统参与 AI 研究。两者都需要早期研究,不能一上来就靠资源和工程把产品推出来。研究者离开大厂,并不只是因为想要更大的话语权,也因为他们认为下一个问题还没有标准答案。2
这也是 neo lab 和普通创业公司的区别:它不急着把一个已知需求做得更快,而是先判断当前范式哪里卡住。Coding Agent 已经相对结构化,有 GitHub 这类高质量数据;研究则不同,研究直觉、品味、失败和转弯往往没有被记录。刘子鸣把问题说得很直白:如果研究没有被结构化,就无法被规模化。

他想做的,不是「会写论文的 Agent」

刘子鸣把自己的路线拆成一条链:先用 AI 做 Physics of AI,也就是用实验和科学方法理解 AI 的内部规律,再用这些规律帮助设计更好的模型。他认为,单纯让 Coding Agent 写论文,仍然是从神经到神经;他的 AI for AI 需要把结果重新闭环到对 AI 的理解和模型设计。
他提出了一个很具体的研究记录格式,缩写为 O-P-H-I-S:Observation(观察到什么)、Problem(问题是什么)、Hypothesis(假设是什么)、Intervention(下一步做什么干预)、Speed up(是否带来提升)。一篇论文通常只留下最后的结果,真正让研究产生方向变化的思维链反而消失了。这个格式的目的,是先创造一套可供模型学习的「研究语言」,再谈训练 Research Language Model。2
刘子鸣对「研究直觉」的怀疑也很尖锐:
「研究品味、研究直觉其实是一个遮羞布。」2
他的意思不是研究没有直觉,而是很多人能提出好想法,却还说不清自己为什么想到。只有把观察、假设、干预和结果留下来,所谓直觉才可能从个人能力变成可训练的数据。
他甚至估算了一个起步规模:如果 20 个学生和员工每天各记录 10 条研究过程,一天约有 200 条,两个月约 1 万条,可能足以开始训练一个内部模型。这是访谈里的估算,不是已经完成的数据成果;刘子鸣也反复说明,路线会每周、甚至每天调整。2

从「勤奋」到「聪明」:他和 RSI 的差别

谈到田渊栋的 Recursive Superintelligence,刘子鸣给了一个容易理解的比较:Coding Agent 更像一个「更勤奋的 AI for AI」,可以不停行动和迭代;他的路线想做一个「更聪明的 AI for AI」,先判断哪些想法更有希望,再决定是否做实验。他举的数字是:以前 100 个想法可能要全部尝试,现在希望让原模型先做排序,减少真正需要执行的实验。
这个「原模型」不是普通意义上的基础模型,而是「关于模型的模型」:输入一个模型、数据集和优化器,输出它可能出现的训练曲线。刘子鸣在今年年初连续约 60 天,每天随机抽取模型和数据集,先预测训练曲线,再实际训练;做了约 40 到 50 天后,他发现自己的预测开始变准。他把这段经历看作一种人体实验:人的研究带宽每天最多做一两个实验,模型可以批量看几千组实验,因而有机会把个人直觉外化。2
这条路的终点不是多发表论文,而是让 AI 找到人没有拍脑袋想到的架构。他给出的标志性路标也很苛刻:在一个垂直领域提出新架构,实际效果超过现有架构,并且最好能在基准上拉开约 10% 的差距。他引用 ResNet 在 ImageNet 上相对第二名的优势,意思不是「必须得到人类赞美」,而是最终要用结果证明它确实更好。2

为什么一定要先理解 AI

刘子鸣对「直接用 AI 提升 AI」保持警惕。语言模型之所以成功,部分原因是语言本身已经是人类长期压缩过的高质量模态;视觉和物理世界没有这么整齐的抽象,光靠堆更多数据未必够。他把 AI 发展比作天文学:现在也许只有经验规律,离能够用少数原理压缩大量现象的「牛顿时刻」还很远。
他提出用三个方向观察这个黑盒:在空间上看模型内部的神经元和表征,在时间上看模型如何演化,在「平行宇宙」里做控制实验,比较不同超参数和训练条件下会出现什么结果。一个技巧什么时候有效,比「这个技巧有效」更重要;同一个方法出了适用的相区,可能就不再有效。Physics of AI 要回答的,正是架构和技巧的适用条件。2
这也解释了他对机制可解释性的保留。Anthropic 式的做法可以尝试解释单个神经元,但换一个随机种子,原先的解释可能不再稳健。他并不否认这条路线,而是认为不必把目标限定在最微观的神经元层面。只要能稳定说明一个模型为什么在某个条件下工作,哪怕还没有写出 AI 的「牛顿公式」,也已经有研究价值。

这场创业目前处在什么阶段

刘子鸣说,团队短期会先做 Demo 和研究工具,6 到 12 个月是关键探索期;一年左右再开始产品化和商业化。他把 neo lab 形容成一个会变形的组织:前 6 到 12 个月按研究机构运转,出现可验证的原型后,再按公司方式推进。对这类项目,过早追求商业化可能只是为了交差,反而会错过真正的方向选择。2
更远的产品想象是 Training Copilot 或 Training Autopilot:用户只说需求和预算,例如「我只有 100 块钱」,系统就负责设计、训练、部署一个私有模型。刘子鸣把它类比为 Vibe Coding 的下一步:未来可能是 Vibe Training。这个愿景很大,但他也承认,人人都能训练模型之后究竟会拿来做什么,现在还没有答案;只有当训练成本足够低,需求才可能自己涌现出来。2

这集值得怎么听

  • 想听 neo labs 为什么出现,听 37:11-44:16:人才不想做「大头兵」、Coding Agent 的缺口、世界模型与 AutoResearch 的关系都在这里。
  • 想理解「原模型」不是一句口号,听 48:43-58:21:60 天自我训练、预测训练曲线、模型如何筛选 100 个想法。
  • 想判断这条路线和现有 Agent 的差异,听 46:51-47:49 以及 1:15:57-1:18:14:一个强调勤奋迭代,一个强调用物理学方法找新架构;AI for AI 对 AGI 可能必要,但还不充分。
  • 想听创业约束和产品方向,听 1:20:07-1:25:541:31:35-1:37:54:训练 Copilot、6 到 12 个月研发窗口、以及研究者如何在教授和创业者之间「我都要」。
这集适合想分辨 AI 创业叙事里「已经能做的产品」和「仍在寻找方法的研究」的人。它没有证明 AI for AI 已经成功,却把成功前必须补齐的几块拼图说清楚了:研究数据如何留下、直觉如何被外化、模型如何被比较,以及创业团队能否撑过 6 到 12 个月的探索期。

Related content

  • Sign in to comment.
More from this channel