
「AGI 时间线」提前了一年:80,000 Hours 如何解读 2026 年的七条证据
Rob Wiblin 盘点 2026 年关于 AI 能力、收入、研发自动化与现实任务的七条证据,将个人 AGI 时间线提前约一年,但保留对低反馈任务、目标选择和算力瓶颈的怀疑。
原文定位
《What the hell happened with AGI timelines in 2026?》,作者 Rob Wiblin,发表于 2026 年 8 月 6 日。Wiblin 盘点 2026 年出现的七条证据,追问一个具体问题:AI 能力的突然加速,是否已经足以把 AGI 的时间线整体提前。1
作者讨论的「AGI 时间线」主要指 AI 能否自动推进 AI 研发,以及递归自我改进会不会让能力增长进入更快阶段。Wiblin 的个人判断提前约一年:2026 年完全自动化 AI 研发仍属于极不可能,2027 年变成「若发生会令人震惊」,2028 年变成「在当前趋势下可以想象」。这个判断不是所有职业都会在某一年被替代的预测。
让时间线提前的三组证据
1. AI 已经产生了足够大的付费需求
Wiblin 先看收入,而不是社交媒体上的兴奋程度。他引用的数据是:OpenAI 与 Anthropic 的合计收入,在过去六个月按年化口径增长约 700%,过去三个月的年化增速约 1,600%;Anthropic 在 2026 年 5 月的年化收入运行率达到 470 亿美元。模型推理基础设施的毛利估算也从一年前约 38% 升到 70% 以上。短期收入按年化率外推会夸大趋势,但这些数字至少说明用户和企业正在为模型能力付费,AI 公司有资金继续购买芯片、扩建数据中心和训练更大的模型。1
2. 可完成任务的长度正在变长
METR 的「任务完成时间线」不是模型独立运行了多久,而是:在人类专家完成一项任务所需的时间尺度上,模型预计有多大概率完成这项任务。当前页面的任务主要来自软件工程、机器学习和网络安全,要求任务自洽、说明清楚、结果可以自动评估;50% 时间线表示预计成功一半的任务。METR 页面明确写明,当前任务套件对超过 16 小时的测量并不可靠。2
Wiblin 依据这条曲线指出,时间线在早期大约每七个月翻倍,2024 年之后缩短到约四个月。若趋势持续,两年内可完成任务的长度会增加约 64 倍。这个数字支持「软件和编码代理进展很快」,不支持「模型已经能处理所有长周期工作」:任务集中在反馈密度高的领域,50% 成功率也意味着大量任务仍然会稳定失败。1

3. AI 开始加速 AI 研发,但闭合循环尚未形成
Anthropic 的公开数据是最接近「AI 帮助制造下一代 AI」的证据。公司称,截至 2026 年 5 月,超过 80% 的合并代码由 Claude 编写;2026 年第二季度,按合并代码行数计算的工程师人均产出约为 2024 年的 8 倍;最开放的编程任务成功率达到 76%。在一组刻意挑出人类已经走错方向的研究决策中,Claude 提出更好方向的比例为 64%,而在人类原本判断较好的另一组样本中,这个比例约为 20%。3
这些数字需要按来源的边界来读。Anthropic 自己承认代码行数不是代码质量的完美指标;64% 的实验专门挑选了人类有改进空间的时刻,且结果由能看到后续发展的模型评判。Wiblin 因此把它看作「递归自我改进可能在 2027—2028 年变得重要」的证据,而不是已经证明 AI 能独立决定研究方向。
Anthropic 的 Mythos 曾在内部能力曲线上出现一次跳跃:三个月取得约六个月的进展。后续两个月的进展速度回到此前趋势,Wiblin 更倾向于把这次跳跃解释为一次更大规模的预训练带来的阶段性跃迁。样本只有两个相隔两个月的数据点,不能据此断言能力增长已经永久加速。1
把证据压回现实任务
最强的反方证据来自「运行一家公司」这件事。模型在目标明确、反馈快速、结果可验证的任务上进步很快;经营企业需要选择该做什么、处理没有先例的异常、管理现金和人员,并等数周或数月才能知道决策是否有效。这些任务的反馈稀疏,选择空间也没有预先写好。
Wiblin 按现实程度递增地列出几类测试。OpenAI 的 GDPval 覆盖 44 个职业、1,320 个知识工作任务,任务来自真实工作交付物;但第一版是一次性评估,不能测量模型如何建立长期上下文、根据反馈修改方案或先判断客户真正需要什么。4 更接近经营的 Vending-Bench、AI Village、Andon Café 和 Andon Market 则显示,模型可以完成局部操作,却会在采购、定价、战略和现金管理上累积错误:Andon Café 有销售收入,但账户余额从 18,000 美元降到 2,000 美元;Andon Market 的余额从 94,000 美元降到 64,000 美元。Wiblin 把这组结果视为 2026 年对 AI 最重要的负面更新。1
这不是能力曲线与现实经营之间的矛盾。强化学习从可验证反馈中获得的收益,首先集中在「怎么把一个清楚的问题做完」;企业经营更常要求「先决定哪个问题值得做」。代码自动化会把瓶颈移到代码审查,实验自动化会把瓶颈移到实验选择,人员自动化会把瓶颈移到算力和内存供给。Wiblin 用 Amdahl 定律描述这类迁移:加速流程的一部分,只会让未加速的部分占据更大比例。
数学突破与成本问题
OpenAI 公布的离散几何结果给出了另一种证据:一个通用推理模型为平面单位距离问题找到新构造,推翻了延续近 80 年的一个猜想,证明经过外部数学家检查。结果的价值在于模型把代数数论中的工具带到一个看似初等的几何问题上;Wiblin 认为,它显示了系统搜索、跨领域调用工具和坚持完成长证明的能力,却没有单独证明模型拥有能够决定研究方向的通用直觉。5
成本数据让时间线判断更偏向提前。Redwood Research 根据 METR 数据估算,模型在自己的 50% 时间线附近完成任务时,推理成本约为人类完成同一任务成本的 3%,而且这个比例没有随模型能力提高而上升;即使把每项任务的成本限制在人类成本的 1/32,时间线的翻倍速度仍约为三个月。这个分析依赖对 token 成本、任务权重和模型脚手架的建模,不能被读成所有现实工作的成本都只有人类的 3%。如果分析方向成立,推理成本不是把能力曲线额外推迟的理由。6
提前一年之后,哪些问题仍未解决
Wiblin 没有把七条证据合成一个确定日期。他保留四个会把时间线推远的条件:
- 完全自动化 AI 研发需要的,可能不只是执行实验,也包括选择问题、解释结果和判断哪条路线值得投入。
- 编码任务中的可验证反馈,能否迁移到战略、经营和长期研究等低反馈任务,尚未得到证明。
- METR 的 50% 成功率适合观察趋势,不适合直接推断无人监督的可靠工作;METR 的说明显示,在接近 50% 时间线的一组任务中,约三分之一会稳定成功,约三分之一会稳定失败,剩下的才是有时成功、有时失败。
- 即便 AI 研发人员数量下降,训练模型和运行实验仍需要芯片、内存、电力与网络。计算资源供给可能成为新的上限。
因此,作者把 2027—2028 年的递归自我改进视为可行情景,而不是基准日期。结尾的立场变化来自这种不确定性:Wiblin 过去不支持暂停前沿 AI,现在支持建立多国、多家实验室都能验证的协调减速或临时暂停机制。单个实验室停手只能改变领先者,不能解决共同验证和竞争压力的问题。1
References
- 1What the hell happened with AGI timelines in 2026?
80000hours.substack.com
- 2
- 3When AI builds itself
anthropic.com
- 4
- 5
- 6AI's capability improvements haven't come from it getting less affordable
blog.redwoodresearch.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
