
AI 开始构建世界,但还不会可靠验收:8月2日核心人物推文精选
Karpathy 的 1M token 世界生成、OpenAI 的数学证明与多位产品实践共同显示:AI 的瓶颈正从生成能力转向验收、权限与任务定价。
窗口:北京时间 2026 年 8 月 2 日 00:05 至 8 月 3 日 00:05。
Andrej Karpathy 给 Opus 5 一个不太像 benchmark 的任务:把《魔戒》第一段变成一个可运行的 Three.js 世界。模型用了约 1M token、约 2 小时,写出约 5,500 行代码。结果「有点粗糙,但很有趣」;更关键的是,模型自己并不能顺畅地看视频或玩游戏来检查成品,只能慢慢截屏,过程中还反复出错。1
这条帖把本期的信号说得很清楚:生成能力已经开始越过「写一个小 demo」的边界,但验收能力没有同步跟上。模型能做什么,和人类能否快速判断它做得对不对,正在变成两件事。
从「会回答」到「能构建」
Karpathy 看到的不是一个漂亮网页,而是一种新型的低成本定制:过去没人会为一个只存在几分钟的世界手工写数千行代码,现在模型有足够的耐心把它做出来。这个变化让「想象一个世界」与「把它搭出来」之间的距离变短了。
代价也写在同一条帖里:世界越复杂,模型越难靠文字上下文完成自检。它需要感知画面、运行游戏、理解空间关系,再回到代码修改;如果这些环节只能靠低效的截图循环,生成速度就不等于交付速度。1
Aaron Levie 把这个现象放到了更大的能力曲线上。他认为,AI 在日常生产力与数学、科学、法律、编程等深领域之间会出现越来越大的分化;深领域的能力可能快速上升,但要把它变成现实突破,还需要数据集和具体工作流。这个判断来自 Box CEO 的个人帖,不是跨领域评测。2
OpenAI 8 月 1 日发布的文章提供了一个更具体的案例:团队称内部版本的 Astra 解决了数学与理论计算机科学中的十个长期问题,随后由人类整理证明,并把每个论证形式化成 Lean certificate;文章还披露了约 2,000 美元的 API 成本口径。Kevin Weil 的窗口内推文只是对此的强烈反应,称这十项都是重大结果;判断仍应以 OpenAI 原文为主。34
Loading content card…
这里有一个容易被忽略的区别:模型找到答案和人类把答案变成可验证的知识不是同一个动作。OpenAI 的 Lean 形式化与 Karpathy 的截图式验收,分别代表了两种补丁:把证明交给形式系统,或把成品交给视觉与交互检查。前者适合数学,后者仍然很脆弱。
Agent 的入口,开始像工作对象而不是聊天框
swyx 在观看一场关于「用 slop 对抗 slop」的演讲后写道,自己更认同「能容忍 slop」比「反 slop」有价值;他还提到有人在重新思考 AI-native programming language,让代码从运行原理开始改写。这里的重点不是鼓励低质量输出,而是承认:当生成成本足够低,系统必须把不完美的中间产物纳入流程,而不是假装每次都能一次交付。5
Loading content card…
Nan Yu 给出了一个更接近产品机制的设想:用户为自己提交的 issue 或开源仓库 issue 预先 pledge token,在 issue 中写好 spec;维护者接受后,GitHub 将原 spec 交给云端 coding agent,费用由请求者承担。它试图解决的不是「agent 会不会写 PR」,而是谁来为 PR 的价值负责。原帖是个人提案,不代表 GitHub 已经上线此功能。6
Loading content card…
Guillermo Rauch 则转发了 Eve 的产品形态:一个开源的 agentic CRM,模型无关,可自托管或 serverless 部署,支持多渠道且 headless。他的原帖没有展开实现细节,Eve 页面在本轮抓取时也只返回了脚本壳,因此这些只能按产品方描述阅读。7
Loading content card…
Ryo Lu 的问题更像一条设计注脚:他回忆 Rdio、Mailbox 和 Apple 如何让软件「更简单、更直觉地可触摸」,并追问离开 app 世界后,软件还会以什么方式保持可见、可感。这个问题与 agent 的产品入口直接相连——如果工作由一个长期运行的 agent 完成,用户看到的可能不再是页面,而是任务状态、证据和可以接管的节点。后半句是基于原帖的延伸解读,不是 Ryo 对 agent 产品的直接结论。8
Loading content card…
低成本执行,反而把判断推到前台
Peter Yang 对 Opus 5 的抱怨很具体:他觉得 Opus 4.6 的性格与写作风格更好,而 Opus 5 更容易写出过长回复,使用「Claude-speak」,也更爱评判。这不是模型评测,但它提醒产品团队:用户对 agent 的判断不只看任务完成率,也看交流是否自然、是否会在不必要的地方增加摩擦。9
Loading content card…
Peter Steinberger 的实验把权限边界暴露得更直白:他让 agent 访问 ESP32 节点的摄像头做端到端测试,调试 voice wake 时,设备不断喊「HI ESP」。这不是安全漏洞报告,也不是厂商确认;它展示的是个人实验里 agent 已经被允许进入摄像头、硬件和语音调试链路,而人类对它的行为仍然只能边运行边观察。10
Loading content card…
Amjad Masad 说自己的 LLM chess engine 已经在 LiChess 上自主与真人和 bot 对局,帖中给出 1253 Elo;详情卡当时显示它已经下了 52 局。这个数字只能作为作者自己的实验记录:棋类有明确规则和即时反馈,不能据此推导出模型在开放任务中的通用能力。11
Loading content card…
Dan Shipper 在窗口内只写了一句话:「AI creates more work for human experts」,并链接到 Every 的旧文。背景文章发表于 2026 年 5 月 21 日,论点是:当 AI 让初稿、PR、设计和客服输出变得廉价又趋同时,人类专家要花更多时间定义问题、审核质量、处理例外。它不是 8 月 2 日的新事实,但恰好解释了为什么本期反复出现「验收」这个词。1213
两个仍需观察的方向
Garry Tan 把自己的判断压缩成一句话:2026 年最有意思的变化之一,是 OpenAI 似乎在走向「开放平台」;他把「随时可用的 intelligence utility」与「把全栈都整合进去才最优」放在对照面上。这是投资人与创业者视角的路线判断,不是 OpenAI 的正式路线图。14
Loading content card…
Nikunj Kothari 从融资市场补了一层噪音:他认为早期融资与基本面脱节,AI tailwind、dry powder 和高竞争可能让这种状态持续 12–18 个月。帖中没有样本或统计方法,因此只适合当作投资者观察,不能当成市场预测。15
Loading content card…
本窗口留下的共同问题不是「哪个模型又赢了」:
- 模型能生成世界、证明或代码时,谁来定义通过标准?
- agent 能接入 issue、CRM、摄像头和真实对局时,权限与接管点放在哪里?
- 生成成本下降后,产品按 token 计价,还是按被人类接受的任务结果计价?
Karpathy 的 1M token 世界、OpenAI 的 Lean certificate、Nan Yu 的 token pledge 和 Steipete 的摄像头实验,分别给出了不同答案。它们还没有收敛成统一产品范式,但已经把「生成」和「验收」之间的距离摆到了台面上。
References
- 1Andrej Karpathy:Opus 5 生成程序化世界
- 2Aaron Levie:深领域能力与应用工作流
- 3OpenAI:Ten advances in mathematics and theoretical computer science
- 4Kevin Weil:对 OpenAI 数学结果的反应
- 5swyx:slop-tolerant 与 AI-native 编程语言
- 6Nan Yu:为 issue 绑定 token pledge
- 7Guillermo Rauch:Eve agentic CRM
- 8Ryo Lu:离开 app 世界后软件如何保持可见
- 9Peter Yang:Opus 5 的使用反馈
- 10Peter Steinberger:让 agent 访问摄像头测试 ESP32
- 11Amjad Masad:LLM chess engine 在 LiChess 自主对局
- 12Dan Shipper:AI 为人类专家创造更多工作
- 13Every:After Automation(2026 年 5 月 21 日)
- 14Garry Tan:OpenAI 走向开放平台的判断
- 15Nikunj Kothari:Series A 资金市场观察
Related content
- Sign in to comment.
