芯片报出效率数字,agent 开始管凭证与执行|8月26日精选

芯片报出效率数字,agent 开始管凭证与执行|8月26日精选

8月26日高价值原创帖显示:OpenAI 公布 Jalapeño 首批推理效率,Vercel 把凭证、代码执行和安全体检产品化,ChatGPT Work 登录网站却不让模型见密码;评测路线图、应用层机会和人的能力上限也被一并写进讨论。

窗口:北京时间 2026 年 8 月 26 日 00:05 至 8 月 27 日 00:05
这 24 小时里,白名单账号的高价值原创帖把注意力又往外推了一层:OpenAI 公布自研推理芯片的首批实测;Vercel 把 agent 的凭证、代码执行和安全体检做成可调用产品;ChatGPT Work 开始在登录站点上做事,却不让模型看见密码。同一窗口里,评测路线图、应用层机会和人的能力上限也被重新写进了讨论。

推理芯片先报出效率数字

Sam Altman 是 OpenAI CEO。北京时间 8 月 26 日 03:53,他发了一句短帖:「we made a chip and it is fast。」1
Loading content card…
同日 OpenAI 工程博客给出了可核对的产品方口径:Jalapeño 是 OpenAI 的首款自研推理芯片,已在 SemiAnalysis 的 InferenceX 公开基准上,对 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 做了对比。公司称,在峰值吞吐下,Jalapeño 每瓦可完成的 AI 工作量约为对照系统的 1.5–1.9 倍,端到端延迟约为对照系统的 1.7–3.6 倍更低;面向高交互负载时,性能约为对照系统的 2.1–4.1 倍。OpenAI 计划在今年年底前把 Jalapeño 部署进自家算力基础设施,并写明会继续大规模使用 NVIDIA 等合作方加速器。2
这些数字来自 OpenAI 自报与其选定的对照设置,保留为产品方口径。对产品负责人,可检查的是:交互式 agent 链路里,哪些步骤最吃延迟;成本账本里,吞吐和时延哪一项先碰到预算墙。

Agent 要连服务,也要安全地跑代码

Guillermo Rauch 是 Vercel CEO。北京时间 8 月 26 日 04:44,他把 agent 建设里最难的一层写成:secure connectivity to services and data,并宣布 Vercel Connect 正式 GA。官方博客写明:应用不再长期存放服务商密钥,而是在运行时用 OIDC 身份申请短时、按任务收窄的令牌;已有 100 多个连接器,并补上 RBAC、审计日志与令牌/触发器可观测性。34
Loading content card…
同日稍晚,Rauch 发布 Run SDK:当 agent 写出动态代码时,不必每次都起完整沙箱,可以在轻量 QuickJS 安全上下文里执行,并通过 host functions 暴露窄接口,中途还能为认证或人工审批中断后再恢复。官方说明它是 AI SDK Code Mode 的内部执行层;需要操作系统、装包或进程级隔离时,仍应使用 Vercel Sandbox。56
Loading content card…
窗口末尾,Rauch 又转发 Security Dashboard GA:界面与 vercel security check CLI 可列出常见错误配置、按风险排序,并让 agent 在人在环或定时任务里逐项修复,例如打开 Git fork 保护、把环境变量标为敏感、用 OIDC 替换静态凭证。78
把这三条放在一起,运行底座的检查项更具体:凭证是否短时且按任务收窄;生成代码是否只拿到产品动作接口;安全问题能否被 CLI 和 agent 反复扫、修、复验。

登录墙还在,但密码不进模型

同一窗口里,OpenAI 把浏览器 agent 推进到「能登录网站做事」。北京时间 8 月 26 日 05:40,ChatGPT 官方账号说明:ChatGPT Work 现在可用自己的电脑和浏览器在网页与移动端登录站点,且 ChatGPT 看不到用户名和密码。Sam Altman 次日用一个字转发:「big」。910
Loading content card…
OpenAI 帮助中心把机制写得更清楚:Cloud browser 是 ChatGPT Work 在云端单独电脑上的浏览器;到达支持的登录页时会暂停,用户在安全表单里输入凭证,凭证直接进入远程浏览器,对模型不可见,也不会被 ChatGPT 存储;重要或难撤销的动作仍需用户确认。该能力面向付费 ChatGPT 计划中的 Work,不含 Free 与 Go,并随地区与工作区权限逐步放开。11
这是产品方自述的安全边界。对读者更有用的检查项是:哪些任务仍必须走官方连接器;哪些网站会拦自动化浏览器;确认步骤是否覆盖支付、提交和权限变更。

评测要跟着真实用法往前挪

Madhu Guru 是 Meta AI 高级总监,曾负责 Google 的 Gemini、Veo 和 Nano Banana。北京时间 8 月 26 日 09:36,他发布「How to build great evals」第 9 篇,主题是 Eval Roadmap Problem:多数评测失败,是因为团队把评测当成静态工件,而用户期望和行为已经变了。12
Loading content card…
他用金融研究 agent 举例:早期是总结 5 页财报;三周后是复盘近 5 份财报并讲增长故事;两个月后是用 15 份文件搭投资论点;再往后是监控持仓并在论点被实质改写时发警报。用法沿这些轴变化时,评测也要从短上下文到长上下文、单轮问答到多轮、简单问答到复杂综合、被动聊天到主动 agent。他给出的路线图步骤是:先画出用法会演进的维度,再排优先级,结合用户访谈与生产轨迹找偏移,为下一阶段补 P0 评测,再按失败模式 taxonomy 做 hill-climb。
这是方法分享。它把前几天系列里的分层评测和区分力,接到了更现实的问题:用户已经走到第 3 周,评测还停在第 1 周。

应用层机会,和人的能力上限

Aaron Levie 是 Box CEO。北京时间 8 月 26 日 12:17,他引用一篇关于规模化 applied AI 的长文,并给出自己的展开:模型与企业真实工作流之间仍有大缺口,机会落在能把智能扩散进业务结果的公司。他列的工作包括理解上下文、推动变革管理、具备可路由多模型的 harness、接入关键业务系统、解决人与 agent 在工作流中的 UX,以及该领域的 eval。13
Loading content card…
Zara Zhang 则把问题收到个人能力。北京时间 8 月 26 日 16:33,她写道:10x AI 用户与平庸用户的差距主要在两件事——领域专长决定你知道什么叫好结果,也决定 agent 的天花板;翻译能力决定你能否通过上下文、参考和迭代把品味传给 agent。后者几周可学,前者是职业生涯。14
Loading content card…
把这两条并读,企业侧看的是工作流、系统和 eval;个人侧看的是判断力与传话能力。两边都把「只比模型智商」往外推了一截。

记忆跨表面,工具要更可改

Cat Wu 负责 Anthropic 的 Claude Code 与 Cowork。北京时间 8 月 26 日 03:43,她确认:Chat 与 Cowork 的记忆已打通,用户告诉 Claude 一次,上下文可跨表面复用。官方 Claude 账号写得更直白:把任务交给 Cowork 时,它会从聊天里已有的项目、偏好和客户信息起步,且记忆内容由用户决定。1516
Loading content card…
Thariq 是 Claude Code 团队成员。北京时间 8 月 26 日 01:25,他回复反馈称,团队正在让 Claude Code 更可改写,包括更方便地使用 Agents.MD 或修改系统提示;当前立场是模型族不可随意互换,系统提示对性能影响大,因此不同模型有不同系统提示。短期可先从 Claude.MD 引用 Agents.MD。17
产品入口侧,Google Labs 在北京时间 8 月 26 日 00:50 发布实验 Play with Putty:实时协作的 vibe coding 工具,可多人一起搭工具和网站;Josh Woodward 同日用「Experimenting with multiplayer AI」转发。官网写明这是协作 vibe coding 研究实验,目前等待名单,美国且年满 18 岁。181920
工程风险方面,swyx 北京时间 8 月 26 日 14:02 发 PSA:先避开 Codex 的 “locked use” 能力,它依赖不稳定的 macOS 特性,本周已两次把他锁出 Keychain;并指向 Apple 开发者论坛承认的 known bug。这是个人踩坑报告,适合当作本地权限功能的风险提示。21
Dan Shipper 在窗口末尾同意一个判断:all of work is starting to look like AI research——更多公司会按前沿实验室的方式组织工作。这是方向信号。22

今天可以检查的五个问题

  1. 交互式 agent 的延迟和每瓦吞吐,是否已经进入你们的成本与体验账本?
  2. agent 访问 Slack、GitHub、Notion 时,用的是长效密钥,还是短时、按任务收窄的令牌?
  3. 生成代码执行时,暴露的是产品动作接口,还是整机权限?安全误配有没有 CLI / agent 可复验的回路?
  4. 现有 eval 对应的是用户第几周的真实用法,还是上线第一天的演示路径?
  5. 团队里「知道什么叫好结果」的人,是否能把标准写成 agent 可复用的上下文、参考和验收步骤?
8 月 26 日的信号继续收窄到可检查的工作流:推理效率开始有芯片层数字,agent 的凭证与执行边界被产品化,评测和应用层则要跟着真实用法与人的判断力一起往前挪。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content