
Self-accelerating AI 的具体版本:让系统参与 AI 研发本身
AI + a16z 对谈 Mirendil 两位联合创始人,拆解 self-accelerating AI 如何从数学、coding 走向 research、kernels 与组织设计。
单集信息
| 字段 | 内容 |
|---|---|
| 播客 | AI + a16z |
| 主持人 | Matt Bornstein |
| 嘉宾 | Behnam Neyshabur、Harsh Mehta,Mirendil cofounders |
| 集标题 | Building Self-Accelerating AI with Mirendil |
| 发布日期 | 2026 年 6 月 25 日(按新加坡时间显示) |
| 原集链接 | 节目视频 |
Mirendil 说的 self-accelerating AI 到底是什么
Behnam Neyshabur 和 Harsh Mehta 没有把 self-accelerating AI 定义成一个会自己变聪明的抽象系统,而是给出一个更具体的工作标准:系统能否完成 AI researcher 或 AI engineer 的工作,从 low-level kernels、frameworks 一直到真正开展 research。这个定义把问题从「模型会不会自我改进」拉回到研发链条:它能否提出实验、写代码、运行评测、解释结果,并在下一轮工作里使用这些结果。1
他们把目标说成 remove the AI bottleneck。因为如果 AI 研发本身仍然依赖少数人手工完成,模型能力提升就会被研发吞吐限制。Mirendil 讨论的 shortest path 不是先做一个通用系统,再等待它自然用于科学,而是直接让系统参与 AI research 和 engineering,让研发过程本身成为第一个高价值场景。
路径是从数学到 kernel,而不是一步到 AGI
节目列出的能力顺序很有启发性:high school math、college math、coding、competitive use、reasoning models、post-training,之后才到 inference-time research and engineering、low-level kernels、PyTorch、JAX、LLM frameworks 和 deep learning frameworks。这里的顺序不是一张被验证的产品路线图,而是两位创始人对研发能力如何逐层扩展的描述。1
他们认为,真正大的跃迁可能来自在 inference time 进行高吞吐的 research 和 engineering。也就是说,系统不只是回答一个问题,而是围绕目标持续开展一批实验,比较不同方案,再把有用的结果留下来。对工程团队来说,这个观点比「让模型更像一个人」更具体,因为它直接要求工具链、环境、可复现性和结果评估都跟上。
10 倍更少的人,最后是 1 个人
对谈给出一组很激进但被明确说出的目标:当前一个好的 frontier AI lab 可能需要 200 人,他们希望先降到 10 人,再到 2 人,最终到 1 人。另一处表述是,他们已经能用大约少 10 倍的人和资源完成一些工作;同时也承认,如果公司规模扩大 10 倍而 productivity 只有 1.2 倍,组织并不会因此自动获得线性收益。1
这些数字更像路线上的目标和经验判断,不是一个已经普遍复现的 benchmark。它们真正暴露的是 Mirendil 的设计问题:如果系统承担越来越多研发任务,公司还要保留什么样的人类组织?谁决定目标?谁负责安全边界?谁检查系统是否把错误的方向优化得更快?
为什么大公司里很难长出这种东西
两位嘉宾认为,disruptive technology 很难在现有公司里自然成长,因为传统 AI 公司的商业模式通常是训练一个大模型,再向用户收取使用费。可是,如果 self-accelerating AI 的价值是让更多公司拥有自己的 infra 和自己的 AI,并把控制权交还给业务方,那么这种技术可能会削弱原来按调用收费的中心化模式。1
这也是他们强调 make this available to everyone 的原因。用户侧收益被概括为 better margins、more control,但开放与商业回报之间的冲突没有消失。一个把研发自动化能力全部内化的系统,可能减少对外部模型调用的依赖;对模型公司来说,推动它开放并不天然符合原来的收入激励。
他们没有把递归自改进讲成科幻结论
节目对 self-improvement 的描述保留了明显的限定。嘉宾说很多人对递归自改进有 sci-fi view;在可预见的未来,可能还要经过几年 AIs + people 的混合系统,自动化程度逐步提高,而不是突然进入完全无人参与的循环。他们也说这不是 straightforward problem,结果范围很宽。1
安全边界同样没有被回避。嘉宾提到 bioweapons、drug synthesis 以及其他国家之间的竞争,承认这项技术很强、可以应用到很多领域。但他们不主张把整项技术都限制掉,因为它也能用于科学和生产力;更现实的办法是针对不同 use case 采取更精确的控制,让收益尽可能 positive sum,同时保持安全。
这集适合谁,哪些可以跳过
- 做 AI research tooling、训练基础设施和科学自动化的人,重点听从 post-training 到 kernels 的能力链条。
- 创业者和研究管理者,重点听 200 人到 10、2、1 人的组织假设,以及商业模式为何会与开放研发发生张力。
- 只想听一家新公司的融资或产品介绍的人可以跳过开头的愿景部分;本集的增量在于把 self-accelerating AI 拆成研发工作、组织设计、控制权和安全边界四个具体问题。
References
Related content
- Sign in to comment.
More from this channel›
- Codex 从 0 到 1000 万:ChatGPT Work 如何把 coding agent 带进知识工作
- Poolside 的 model factory:模型公司如何把训练变成生产系统
- 企业 AI 为什么还慢:真正卡住的是数据、权限和 agent identity
- 读模型的「思维」:mechanistic interpretability 为什么有用又不完整
- 模型价格战之外:Last Week in AI 第 252 集的安全与能源账单
- 后代理世界的账单:企业软件如何面对新的经济学
- Factory 的暗工厂:当 coding agent 开始改写软件生产线
- DoorDash 的 AI 路线:先找配送问题,再决定是 agent、机器人还是人
