ELI5、100/100、36 条 Gmail:Agent 开始面对工作流的三道门|8月22日精选

ELI5、100/100、36 条 Gmail:Agent 开始面对工作流的三道门|8月22日精选

8 月 22 日的高价值原创帖把 agent 进入真实工作流的门槛拆成网页可读性、解释接口、分项评测和可撤回的数据权限。

窗口:北京时间 2026 年 8 月 22 日 00:05 至 8 月 23 日 00:05。
这一天的原创帖把 agent 进入真实工作流时的门槛拆得很具体:网页要先能被读懂,复杂任务要能被解释,质量不能被一个平均分遮住,接入的数据还要能被撤回。模型价格下降只是背景;真正需要继续验证的是工作流、反馈和权限。

网页先得让 agent 读得懂

Guillermo Rauch 是 Vercel CEO。北京时间 8 月 22 日 01:48,他转发了 Vercel Developers 发布的 Is Agentic:这个工具用 100 多项检查评估网站对 agent 的可读性,提供 agent 使用网站的可视化、修复问题的提示,以及一个 CLI。1
Rauch 补充说,他们把 Is Agentic 对着一个网站循环运行,直到得到 100/100;这个过程暴露并补上了不少缺口。他还特别强调,评测标准需要足够高,才值得消耗用户的时间和 token。2
Loading content card…
这条信号值得看的地方不是「100/100」本身,而是 agent 产品开始有了一个不同于传统网页性能测试的问题:人能不能打开页面,不等于 agent 能不能找到结构、理解语义并完成任务。Rauch 的帖只给出一次产品方自述的运行结果,没有说明测试对象、失败样本和评分是否能由外部复现。下一步要看的是,同一套检查换到不同网站后,分数是否仍然能预测 agent 的实际完成率。
Nikunj Kothari 则给了一个个人使用案例。北京时间 8 月 22 日 03:31,他说女儿学校的午餐信息放在一个随机网站上,页面数据没有清晰结构;他让 Claude Code 通过网络请求寻找 API,发现接口恰好没有认证,再把正确格式接进家里的 Hermes 机器人。现在,机器人每天早上会告诉他当天的早餐和午餐。3
Loading content card…
这是个人实验,不是「网站都可以这样接入」的证明。帖子没有说明该接口是否得到网站方授权,也没有给出访问频率、长期稳定性或隐私条件。它却说明了一个产品事实:当网页没有给 agent 准备正式入口时,网络请求日志可能成为新的可用性层;相应的风险也从「页面好不好用」延伸到接口是否稳定、是否允许这样访问,以及网站是否需要为 agent 提供明确的工具说明。
同一条工程线还有一个更轻的入口。Rauch 在北京时间 8 月 22 日 08:06 转发 fx 0.0.5 的更新,列出的变化包括支持 Grok 与 Codex 订阅、项目本地 skills、更好的安全性,以及多项修复;Rauch 说现在可以在 sandbox 里直接试用。这里的版本信息来自他引用的开发者说明,Rauch 本人帖子的重点是入口,而不是一次完整的产品评测。45

解释能力正在变成 agent 的工作接口

Thariq 是 Anthropic 的 Claude Code 成员。北京时间 8 月 22 日 03:32,他分享了一个「最近 Anthropic 内部经常使用」的 skill:输入 /eli5 和想解释的内容,让 Claude 用「大图片、少文字」的 HTML artifact,把模块、决策取舍或事故原因讲给不了解背景的人。67
Loading content card…
几秒后,Thariq 又给出了安装命令:可以从 anthropics/claude-plugins-community 添加 marketplace,再安装 eli5@claude-community。他同时说,团队还在讨论是否把它做成官方插件。8
这里有三层信息需要分开:HTML artifact 是一种输出形式,/eli5 是一个具体工作流,是否成为官方插件仍未确定。Thariq 的「内部经常使用」是产品团队成员的自述,不等于它已经被证明能提高所有任务的理解或执行质量。对 agent 产品来说,解释不是装饰:它可能成为交接、复盘和验收的接口;但产品仍要验证,读者看完图文解释后,是否更少误解、能否更快采取正确动作。

Eval 不能被平均数抹平

Madhu Guru 是 Meta AI 高级总监,个人简介还标注他曾在 Google 负责 Gemini、Veo 和 Nano Banana。北京时间 8 月 22 日 06:32,他提醒团队不要把复杂 eval suite 压成一个总分。他举的例子是:简单摘要从 85% 升到 89%,基础事实问答从 80% 升到 85%,复杂财务分析却从 70% 降到 63%;一个平均分会掩盖真正重要的回归。9
Loading content card…
Madhu 认为,加权总分也可能把判断伪装成数学精确。一个权重代表团队对任务重要性的取舍,不是从数据里自动长出来的客观真理。他给出的做法是保留按优先级排列的 eval,让能读懂细节的人检查关键结果,理解新系统在哪些地方失败、在哪些地方变好,再判断它对用户是否真的更好。
这条帖延续了他前一天提出的四层 eval:推动质量上限、检查回归、守住安全和产品身份等基础底线,以及尽量接近真实流量的上线评测。四层划分是 Madhu 分享的方法,不是统一行业标准;它的可复用之处在于,团队先定义某个 eval 要保护什么,再决定样本的真实程度、运行频率和上线门槛。10
Peter Yang 在北京时间 8 月 22 日 21:44 预告,他会让两位评测专家现场挑错自己为 creator skills 建的 eval,并介绍一个能把真实 AI 失败转成可复用 eval 的 Error Discovery skill。帖子是节目预告,没有披露该 skill 的实现细节或效果数据,因此本期只把它作为一个值得跟踪的工具入口,不把宣传语写成已验证能力。11

数据权限要能落到删除按钮

Peter Yang 在北京时间 8 月 22 日 06:58 公开质疑 Instinct:他认为产品未经许可索引并保留了自己的邮件,而且没有提供删除这些记录的办法;在问题解决前,他不愿推荐这个产品。12
Loading content card…
这是用户个人对产品行为的描述和评价,不是对 Instinct 全部数据处理流程的独立审计。它之所以值得放进日报,是因为 agent 接入 Gmail、日历或其他外部数据后,隐私承诺必须变成用户可以检查的控制项:存了什么、保存多久、谁能访问、用户如何撤回。
在文章窗口接近结束时,Peter Yang 又说,他已经能在 Instinct 的 Data Privacy 区域删除外部数据,并以自己的 36 条 Gmail 记录为例,称团队响应很快。这个后续仍然是他的个人确认;帖子没有提供产品方的完整隐私文档或第三方验证。13
这组前后帖比单独的「隐私」口号更有信息量:一个连接型 agent 是否值得进入正式工作流,至少要看权限和删除路径能不能在界面中被找到、被执行、被复查。

模型便宜之后,稀缺的是反馈环境

Aaron Levie 是 Box CEO。北京时间 8 月 22 日 13:43,他说 AI 的进展速度异常快:在相同任务上,模型变得更便宜、更通用、更快,也深入更多领域。他据此判断,当智能变得「便宜到不值得计量」时,机会会转向把 AI 扩散进经济;应用型 AI 公司会受益于模型创新和竞争带来的顺风。14
Loading content card…
「变便宜」和「机会转移」都来自 Levie 的判断,帖子没有给出跨模型、跨任务的价格统计,也没有证明应用型公司的结果。把它和本期其他帖子放在一起,读者可以看到更具体的落点:网站要提供 agent 能读的结构,解释要能进入工作交接,评测要保留关键失败,外部数据要有删除路径。模型降价只有在这些环节都能运行时,才会转化成更多真实使用。
swyx 在北京时间 8 月 22 日 07:47 谈到另一种可能的瓶颈。他说,把「Simulation is a new scaling law」当作营销夸张很容易,但在采访中他从玩笑转向认真:如果模型逐步自动化更多机器学习研究和 AI 工程,那么模拟人类与人类反馈可能成为剩下的关键障碍。他还提到自己看好 Simile 团队,并引用节目介绍中的数字分身与行为模拟说法。1516
这里的「85% accurate digital twins」等数字属于节目介绍和项目方语境,不是独立评测结论。swyx 的帖子真正提供的是一个研究方向判断:当模型可以更便宜地生成和执行,谁来提供高质量的人类反馈、行为环境和验收标准,可能比再增加一次模型调用更重要。

今天值得继续追踪的五个问题

  1. Is Agentic 的 100/100,换到不同类型的网站和任务后能否复现?分数是否真的预测 agent 的完成率?
  2. ELI5 skill 会不会成为正式插件?HTML artifact 是否让交接、复盘或行动变得更可靠?
  3. eval 分项能否捕捉复杂任务的回归,而不是只让总分变好看?
  4. Instinct 的外部数据删除入口,能否由界面、隐私文档和实际操作共同验证?
  5. 当模型调用更便宜,应用团队是否真的拥有工作流和反馈数据,而不只是拿到更低的单价?
本期最值得保留的不是某个产品的单句口号,而是一条待验证的链:agent 先要读得懂环境,再要说得清自己做了什么;团队要用分项 eval 验收,用户要能控制数据。模型能力继续上升之后,这些环节决定了它能不能从演示进入工作。
AI 前沿人物每日推文精选

AI 前沿人物每日推文精选

精选来自 Karpathy、swyx、Sam Altman、Amanda Askell 等 25 位 AI/科技领域核心人物的每日推文,过滤噪音,聚焦值得阅读的观点与动态。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.