
从云端电脑到一百万 skills:Agent 正在争夺持续执行环境|7月30日精选
ChatGPT Work 的持久化电脑设想、Grok Build 的一键发布和 ARC-AGI-3 的 harness 数据,说明 agent 的下一道门槛是持续环境、权限治理与可复现实验。
窗口:北京时间 2026 年 7 月 30 日 00:15 至 7 月 31 日 00:05。对应 UTC 7 月 29 日 16:15 至 7 月 30 日 16:05。
今天最值得追的变化,不是又多了一个聊天入口,而是 agent 开始争夺一套能持续保存状态、调用权限、运行任务并把结果发布出去的环境。Peter Yang 想要一台带认证浏览器的云端电脑,Rauch 展示了从提示词直接发布应用的路径;Levie 和 OpenAI 的信号则提醒,环境越强,成本、权限和评测设置越不能藏在产品宣传后面。
先看结论
- 持久化环境正在成为 agent 产品的下一道门槛:插件和定时任务解决了调用问题,但跨任务保存项目、工具、文件和登录状态,才接近「可以关掉笔记本」的工作方式。
- 分发层正在从应用商店下沉到 agent 能直接安装的技能目录。Rauch 称 skills.sh 在六个月内达到 100 万个以上已发布 skills;这个数字是他的帖子口径,目录页面能确认其定位是可复用的 agent 能力,但不能替代独立的历史计数。
- 模型分数不是模型单体属性。OpenAI 在 ARC-AGI-3 上披露,同一 GPT-5.6 Sol 通过保留 reasoning 和 compaction,公开集分数从官方 harness 的 13.3% 提高到 38.3%,输出 token 约减少 6 倍。评测 harness、上下文管理和工具调用,已经是 agent 能力的一部分。
1. Agent 想要的不是浏览器,而是一台有记忆的电脑
Peter Yang 对 ChatGPT Work 的判断很具体:他认为当前产品可以通过插件连接 Gmail、Google Drive 和 Slack,可以在云端运行定时任务,也有面向公开网站的云浏览器;但他希望下一步拥有持久化的项目、文件、工具和工作环境,以及能保存登录状态的浏览器配置。这里的「当前能力」是 Peter 对产品的理解,不是 OpenAI 的完整产品规格;他的核心诉求是让 agent 在任务之间保留上下文和权限,而不是每次从一个空白会话重新开始。1
Loading content card…
这和前几天「手机上也能交代长任务」的信号不同。新问题不是 agent 能不能替你执行一次任务,而是它能否在第二天继续使用同一套文件、工具和身份。对企业来说,这同时把便利变成了治理问题:哪些登录状态可以复用,哪些数据能跨任务保留,谁可以撤销 agent 的权限,都需要产品层明确回答。
2. 从一句 prompt 到可发布软件,中间那层正在被产品化
Rauch 说,Grok Build 生成的应用由 Vercel 提供 hosting 和 CDN;用户只需提示 Grok 生成软件,再点击发布,就能把游戏、网站、内部应用或个人软件交付给一个用户或更大规模的用户。帖子没有给出部署限制、成本、权限模型或稳定性数据,因此这里能确认的是产品入口和部署承诺,不能把它写成「任何应用都能一键上线」。2
Loading content card…
同一窗口里,Rauch 又称 skills.sh 在六个月内达到 100 万个以上已发布 skills。skills.sh 的页面将 skills 定义为可复用的 agent 能力,并列出 Claude Code、Cursor、Codex、Copilot、Gemini 等多个 agent 入口;这解释了为什么技能数量比单个应用的下载量更接近基础设施指标。34
但数量不是采用率。目录里的 skill 是否可靠、能否升级、权限是否过宽、不同 agent 是否真的兼容,才决定它会不会成为长期依赖。上一期关注的是 skills 如何进入工作流;这次更进一步,问题变成了谁来维护这些可执行知识,以及它们如何被验证。
3. 推理价格可能下降,但企业权限不会自动变简单
Levie 不认同「最有经济价值的推理任务会把价格推到极高」这一推演。他的理由是,模型提供商和基础设施公司都会争夺这些工作负载,市场竞争会继续压低价格,直到产能跟上需求。这个判断是 Box CEO 的行业观点,不是价格预测或独立市场数据。5
Loading content card…
价格下降并不等于企业可以直接放开 agent 权限。Levie 在另一条帖子中把 agent 沙箱事件带来的企业工作列得很清楚:限制 agent 只能访问被授权的数据,保留审计轨迹,区分确定性与非确定性系统,并准备快速阻断失控 agent。他还指出,即使 agent 是善意的,「找出某项目的全部重要知识产权」也可能沿着过期权限一路读到本不该暴露的数据。6
这条链可以压缩成一句话:便宜的推理扩大了调用范围,持久化环境扩大了权限范围。企业真正要买的不会只是更低的每 token 价格,而是可撤销的身份、可追溯的过程和能把 agent 关掉的运行层。
4. 评测、游戏和科学发现,都在把「模型能力」推回工作流
Steipete 对 ARC-AGI-3 的吐槽只是一条个人反应,但它指向了一个可验证的评测问题:OpenAI 官方复盘称,ARC-AGI-3 的通用 harness 会丢弃模型的 reasoning,并用滚动截断丢掉更早的行动记录;改用 Responses API 保留 reasoning,再启用 compaction 后,GPT-5.6 Sol 在公开集的 RHAE 分数从 13.3% 到 38.3%,输出 token 约减少 6 倍。OpenAI 也明确提醒,这个结果测到的是模型、API 设置、harness、上下文管理和提示词的组合,而非模型孤立能力。78
Loading content card…
Peter Yang 对游戏的判断与此形成了产品侧的对应关系:AI 可以一次生成漂亮图形,但核心循环、成长系统和故事仍然难以一次做对;近期更现实的路径,是游戏团队用 AI 减少繁琐工作,同时保留人的品味来做成品。9
Google Labs 对 Lyria 3.5 的介绍也没有只说「模型更强」,而是落到了 Flow Music 的控制面:更准确地遵循创作方向、设置精确 BPM、导出 stems,以及更有表现力的歌声和更自然的编曲。这是同一条产品规律的另一种表现:模型能力只有进入可操作的工作流,用户才知道它到底改善了什么。10
5. 仍在跟踪区
- Sam Altman 称,OpenAI「非常接近」能显著加速科学发现的模型,并主张赋能科学家,而不是由模型公司替科学家决定问题。没有模型名称、时间表或可复现实验,这条先作为方向判断保存。11
- Zara Zhang 认为,真正有优势的人需要同时具备深领域经验和持续采用 AI 新工作方式的能力;她还说,面向真实用户的营销反馈会直接改善产品。两条都是个人判断,适合放在招聘与产品验证的观察栏,不足以推出普遍的就业结论。1213
- Ryo Lu 只用一句「your agents, anywhere」宣布 Cursor 登陆 iOS,没有补充可用范围、认证方式或任务边界;因此这里只记为移动端入口信号,不扩写成完整产品能力。14
本期的判断边界也很明确:持续环境、技能分发和 harness 设计正在变成 agent 产品的一部分,但「一百万 skills」「接近科学发现」和「市场会压低推理成本」分别来自公司高管或个人帖子,不能当作独立验证后的行业定论。真正值得继续追的是三件可核验的事:持久化浏览器如何做权限隔离,技能目录如何做质量与升级管理,以及下一轮 agent eval 是否把运行环境写进公开方法。
References
- 1Peter Yang:ChatGPT Work 与持久化云端电脑
- 2Guillermo Rauch:Grok Build 应用的发布路径
- 3skills.sh:The Agent Skills Directory
- 4Guillermo Rauch:skills.sh 的数量口径
- 5Aaron Levie:推理需求与市场竞争
- 6Aaron Levie:agent 沙箱事件与企业治理
- 7OpenAI:ARC-AGI-3 的 harness 设置与结果
- 8Peter Steinberger:对 ARC-AGI-3 结果的质疑
- 9Peter Yang:AI 与游戏制作
- 10Google Labs:Lyria 3.5 进入 Flow Music
- 11Sam Altman:科学发现与模型
- 12Zara Zhang:领域经验与 AI-native 工作方式
- 13Zara Zhang:营销与产品反馈
- 14Ryo Lu:Cursor on iOS
Related content
- Sign in to comment.
