
评测要分得出好坏,系统要接得住 agent|8月25日精选
8月25日高价值原创帖显示:评测要有区分力,业务系统要承接 agent 执行,运行层继续变轻并由网关托管工具,跨 harness 记忆与领域 skill 决定真实工作流能否跑通。
窗口:北京时间 2026 年 8 月 25 日 00:05 至 8 月 26 日 00:05。
这 24 小时里,几条高价值原创帖把 agent 工作流又往前推了一步:评测要能分出系统好坏,业务系统要能承接 agent 的读写与执行,运行层继续变轻、工具开始被网关托管,跨 harness 的记忆和领域 skill 则决定人能不能少重复自己。
评测先要分得出好坏
Madhu Guru 是 Meta AI 高级总监,曾负责 Google 的 Gemini、Veo 和 Nano Banana。北京时间 8 月 25 日 09:15,他发布「How to build great evals」系列第 8 篇,主题是 discriminatory property:一套用来 hill-climbing 的评测,只有在它能把真正不同的 AI 系统拉开时,才有用。1
他举了一个示意分数:A 94、B 93、C 95、D 94、E 92。如果事先已经知道 A 和 C 明显强于 D 和 E,而这组分数几乎叠在一起,评测就没有区分力。Madhu 把它比作给一群博士生做五年级数学题:大家都会满分,却看不出谁更强。
Loading content card…
他同时提醒,评测也不该故意难到所有人失败。他给出的甜点是:Realistic + difficult + sensitive to differences in capability——贴近真实任务、足够难、又对能力差异敏感。随着 harness 和底层模型变强,好评测会逐渐饱和;到那时团队需要换新的区分维度,而不是继续盯着已经贴顶的总分。
第 7 篇讲过把任务拆到中间步骤,第 8 篇补上了下一步:中间步骤的分数本身,也必须能把系统拉开。否则团队只会在 92 到 95 之间微调,却不知道哪一次改动真的换了能力台阶。
业务系统要变成 agent 能干活的地方
Aaron Levie 是 Box CEO。北京时间 8 月 25 日 11:12,他引用 Garry Tan 前一天的预测——systems of record 要么变成 AI harness,要么被 agent 替换——并给出自己的展开。Systems of record 指长期保存业务事实的系统,例如客户、订单、合同或项目记录。2
Levie 的判断是:agent 会在这些平台上做远超人类的查询、处理、工作流执行和协作。因此治理、可靠性、安全、访问控制和业务逻辑只会更重要。他提到 OpenAI 与 Hugging Face 相关事件,认为那只是 agent 自主追求目标时会出现的风险预览。
Loading content card…
他补了一句条件:只有那些能提供合适产品体验、API 和商业模式、支持站内与站外 agent 执行的 systems of record,才会真正受益。这句话把「存数据的系统」和「能让 agent 干活的系统」分开了。对产品负责人来说,检查项可以写得很具体:权限模型是否面向 agent,写操作有没有审批和回放,业务规则能不能被 API 调用,计费是否按 agent 动作而不是只按席位。
运行层继续变轻,工具开始被托管
Guillermo Rauch 是 Vercel CEO。北京时间 8 月 25 日 10:48,他转发
fx v0.0.6 更新,并概括为:更快、更便宜、更强,而且更小。fx 是 Vercel 一侧主推的轻量 coding agent;他对比说,普通软件往往会变慢、变臃肿、变脆、变大,而 fx 从一开始就按相反方向设计。3Loading content card…
公开 changelog 列出的产品事实包括:Auto mode 更省 token,审批流程最多快约 23%,macOS arm64 二进制约 6.12 MiB,并新增远程 HTTP MCP 支持,以及 Neon、Supabase、Prisma 等 MCP 文档。4这些是产品方自述,不是第三方压测。
同一窗口里,Rauch 还强调了网关的另一层价值:managed tools。北京时间 8 月 25 日 22:02,他写道,只要在 tools 里加上
exa_search,agent 就能直接获得免配置的 Exa 搜索,不需要各自申请账号、密钥和连接,账单也可以统一。5Loading content card…
Vercel 官方 changelog 写明:Exa 已进入 AI Gateway 与 Agent Marketplace;Gateway 上可用内置工具
gateway.tools.exaSearch(),由网关代跑搜索并把结果交回模型,按标价与模型用量一起计费、不加价;Marketplace 路径则给项目一把跨 Exa 产品的 API key,账单走 Vercel 账户。6把这两条放在一起,运行底座的画面更清楚:一边是尽量小的本地/嵌入式 agent,一边是网关托管的通用能力。开发者不必为每个 agent 单独接搜索、账单和密钥;差异更多落在任务编排、权限和验收上。
同日稍早,Rauch 还提到 Vercel CDN 支持 Encrypted Client Hello(ECH),用来加密 TLS 握手里的域名信息,以应对运营商对某些域名甚至整个
.tools 顶级域的拦截。78这是基础设施侧信号,和 agent 产品主线相邻,但检查项不同:域名解析路径、TLS 指纹和地区启用范围。记忆要跨 harness,skill 要进真实场景
Garry Tan 是 Y Combinator 总裁兼 CEO。北京时间 8 月 25 日 23:48,他引用一位开发者把 gbrain 接到 Claude Code CLI、Grok Build 和 Codex 后的反馈,并总结成一句:cross-harness memory maxxing。9
被引用的开发者说,装上 gbrain 并接到多个 harness 后,自己少花很多时间跟模型争论、反复提醒上下文;如果 AI 没有持久记忆系统,会错过很大一块效率。这是个人使用体验,不是对照实验。
Loading content card…
同一天稍早,Garry 还写了一句产品体验:Conductor Cloud 让他效率更高,不必再一直开着 MacBook Pro。10帖子没有给出架构、价格或评测数据,只适合当作「远程 agent 工作区」方向的个人信号。
Peter Yang 则把 skill 推到了高风险、高信息密度的真实场景。北京时间 8 月 25 日 21:53,他开源
/fuck-cancer:一个帮助患者和照护者整理癌症诊疗信息、准备沟通与自我倡导的 AI skill。11Loading content card…
按他的说明和仓库 README,这个 skill 会生成并更新一份实务 brief,固定五段:患者与照护团队信息、下一步最多三项行动、已确认事实与仍不清楚的部分、医学术语白话解释、近期决策日志。研究时优先使用 NCI PDQ、ClinicalTrials.gov API 等来源;可在 ChatGPT/Codex 与 Claude Code 中使用,输出到本地 Markdown 或可分享的 Google Doc。仓库为 MIT 许可,并写明:它协助整理证据,不诊断、不替医疗团队做治疗选择。12
同窗口里,Peter 还有一条产品摩擦观察:每次要登录新网站/应用,或使用被关在网站里的 agent 时,他通常会直接放弃,娱乐和游戏除外。13Nan Yu 则分享了用 Codex 装新电脑软件的体验,并开玩笑说这让人更希望 Siri 能好用。14
这三条合在一起,说的是同一层产品问题:agent 有没有跨工具的记忆,skill 能不能进入真实高风险任务,入口会不会卡在登录墙和封闭页面里。Dan Shipper 在窗口末尾表示自己拿到了 Perplexity 的 Portable Computer(本地运行编排模型、子 agent 与 harness,宣称不依赖云)准备做体验评测,属于待跟踪项,还没有他的结论。15
今天可以检查的五个问题
- 现有 eval 能否把已知强弱不同的系统拉开,还是分数都挤在同一窄带?
- 业务系统除了存记录,是否提供 agent 可调用的权限、API、审批和回放?
- agent 运行层里,哪些能力应做成托管工具,哪些必须留在本地 harness?
- 记忆是否跨 Claude Code、Codex、Grok 等不同 harness 复用,还是每个工具各自重讲一遍?
- 领域 skill 有没有固定输出结构、可信来源边界和「不能替人做决定」的硬限制?
8 月 25 日的信号继续收窄到可检查的工作流:评测要有区分力,系统要能被 agent 执行,运行层要又轻又好组合,记忆和 skill 则要跟进人真正要完成的任务。
References
- 1
- 2
- 3
- 4fx changelog v0.0.6
fx.sh
- 5
- 6
- 7
- 8Vercel:ECH on CDN
vercel.com
- 9
- 10
- 11
- 12GitHub:petergyang/fuck-cancer
github.com
- 13
- 14Nan Yu:用 Codex 配置新电脑
x.com
- 15
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- Cursor 被 SpaceX 收购后,模型供应商开始重新划线|8月29日精选
- 新 AI 产品先接入旧工作面:model-agnostic eval、agent 工具与权限边界|8月28日精选
- 沙箱被写进调查报告,agent 工作面继续外推|8月27日精选
- 芯片报出效率数字,agent 开始管凭证与执行|8月26日精选
- 模型降价之后,AI 产品开始拼评测、路由与数据边界|8月24日精选
- 评测、开放模型与可撤回权限:AI 开始进入可控工作流|8月23日精选
- ELI5、100/100、36 条 Gmail:Agent 开始面对工作流的三道门|8月22日精选
- 模型开始贴近工作流:评测、界面与数据边界|8月21日精选
