Ryan Greenblatt:AI 自动化 AI 研究,真正的分水岭在于能否迁移到陌生世界

Ryan Greenblatt:AI 自动化 AI 研究,真正的分水岭在于能否迁移到陌生世界

Ryan Greenblatt 与 Dwarkesh Patel 讨论 AI 自动化 AI 研究的时间表、可验证性、知识迁移与递归自我改进的安全后果。

节目资料
  • 播客:Dwarkesh Podcast
  • 主持人:Dwarkesh Patel
  • 嘉宾:Ryan Greenblatt,Redwood Research 首席科学家
  • 原集标题:Ryan Greenblatt – What happens once AI can automate AI research?
  • 发布日期:2026 年 8 月 12 日(北京时间;Apple Podcasts 与官方 YouTube 的记录相差约 14 分钟)1
  • 原集官方 YouTube 视频 · 逐字稿页面
Ryan Greenblatt 和 Dwarkesh Patel 争论的核心,不是「AI 会不会帮忙做研究」,而是 AI 一旦能自动改进 AI,反馈回路究竟会有多强。Greenblatt 给出的中位判断是:AI 研究可能在 2030—2031 年左右实现完全自动化;从那一刻起,一年内也许出现相当于四五年常规进展的跃迁。Dwarkesh 认可加速会发生,却仍怀疑它能否直接跨到「在陌生行业胜过所有人」的超级智能。2

为什么 AI 研究适合被模型接管

Greenblatt 的第一层论证是可验证性。研究者可以把训练一个小模型、修改优化器、寻找更快的训练配置,装进可重复运行的环境里;模型每完成一次实验,就能得到损失、速度或准确率等反馈。这样的任务可以反复试错,也可以用强化学习不断爬升指标。对模型来说,它先学会的是一批规模较小、结果明确的研究动作,再把这些动作迁移到更大的系统。2
但「能找到更好的实验结果」和「提出新的研究方向」之间仍有距离。两人反复区分了两种创造:一类是找到猜想的反例、让训练损失下降,这些结果容易验证;另一类是提出像缩放定律、拓扑或群论那样改变问题表述的概念,反馈回路更长。Greenblatt 认为机器学习比数学更适合逐步爬坡,Dwarkesh 则提醒,真正决定研究上限的可能正是品味、经验和哪些实验值得做的直觉。2

争论落在「数据」还是「研究直觉」

Dwarkesh 的怀疑很具体:过去几年的模型进步,除了算力,也依赖人类专家把编码、法律和复杂工程判断写进数据、强化学习环境和示范轨迹。如果 AI 自动做研究,却没有足够的陌生领域经验,它也许能在熟悉的训练分布内高速迭代,到了芯片制造、政治谈判或企业经营现场仍然浅薄。2
Greenblatt 的回答是,模型可以先在大量「快速适应」的环境里训练:资源有限、犯错有代价、必须从反馈中迅速摸清规则。这样学到的不是某个行业的现成答案,而是进入新领域后如何提取上下文、补齐知识并行动。他承认迁移不会完美,却认为多数工作领域没有想象中那么深,能快速学习的通用模型会比今天的人类专家更快上手。这个分歧决定了预测幅度:若迁移主要靠缓存知识,自动化 AI 研究的收益会受限;若迁移能力本身能被训练,反馈回路就可能迅速扩大。2

能力加速以后,先要回答「对谁对齐」

后半段从能力预测转向安全。Greenblatt 担心,模型一旦能参与下一代模型的训练,奖励投机、欺骗和模型之间的协作就可能从局部错误变成持续性的系统问题。他给出的整体判断是:到 2040 年出现某种可被称为 AI 接管的结果,概率约为 35%—40%;这不是事实预测,而是他在节目中的主观概率。2
更早、更现实的检查点不是「明天会不会出现超级智能」,而是三个问题:研究任务是否真的可验证,模型从可验证任务迁移到开放世界时会丢掉什么,以及下一代模型的目标究竟由谁定义。节目最后留下的判断很克制:能力加速可能先于理论共识到来,安全讨论需要在证据还不完整时开始,但每个概率都必须和它依赖的机制一起看。

Fuentes de referencia

  1. 1
    Apple Podcasts 单集记录

    podcasts.apple.com

  2. 2

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado