Sama 把 Agent 做进工作台,Mollick 与 Marcus 追问代价

Sama 把 Agent 做进工作台,Mollick 与 Marcus 追问代价

过去 24 小时,Sama 展示 agent 工作台如何从聊天框走向实体设备,Mollick 警告反 slop 规则也会复制低质输出,Marcus 则把讨论拉回工程效率与基础设施成本。

本期判断

过去 24 小时里,AI 头部人物的高信号原创没有集中在新模型发布,而是落在一个更具体的问题上:当 agent 真正进入工作流程,谁来设计它的操作界面,谁来保证输出不变成批量废话,谁又来承担越来越高的基础设施成本?本期可核验的原创主要来自 Sam Altman、Ethan Mollick、Gary Marcus 和 François Chollet,Karpathy、LeCun、Demis Hassabis、Jim Fan、Ilya Sutskever 在窗口内没有可纳入的原创主条目。

Sama:Agent 开始拥有自己的工作台

Sama 分享 OpenAI 与 Work Louder 的联名页面,只写了一句:「amazing to me that some people want the silent version」。表面上这是对键轴声音的玩笑,链接里的产品却很认真地把 Codex agent 做成了一件实体设备:Codex Micro 售价 230 美元,配有 13 个机械按键、触摸传感器、旋钮和摇杆;每个 Agent Key 可以用 RGB 状态显示 agent 正在思考、运行、等待还是完成,摇杆可以触发代码审查、错误调试和重构等工作流,旋钮则可以即时调整 reasoning level。1 2
这件事的意义不在于一块键盘能否让模型更聪明。它说明 agent 产品正在从「打开一个聊天页面」转向「持续占据工作台」。当系统有多个任务并行运行,用户需要知道哪个 agent 在等权限、哪个已经完成、哪个值得提高推理强度,状态反馈就不再是装饰,而是控制面板的一部分。OpenAI 页面甚至把「看见每个 agent 在做什么」写成产品卖点,说明竞争已经延伸到模型之外的操作层。
Sama 没有在这条帖子里给出使用率、效率或能力 benchmark,所以不能把 Codex Micro 写成 agent 生产力已经被证明的证据。更准确的读法是:厂商开始用实体按键和灯光,给一种还很抽象的工作方式建立可触摸的入口。

Mollick:反 slop 文件也可能制造 slop

Mollick 观察到,一份走红的「anti-slop」Markdown 文件本身几乎是 100% AI 写的。他担心,这类文件被 agent 读取后,会把同一套看似反模板、实际高度模板化的写作习惯继续灌回模型,最后产出更多「mega-slop」。他的解决办法不是继续寻找一份万能规则,而是要求使用者具备品味,或者找一个有品味的人,再自行建立 skills 和 instructions。3
这条短帖对企业部署 agent 的提醒很直接:质量控制不能只靠提示词仓库。规则可以告诉 agent 不能做什么,却很难单独告诉它什么叫准确、克制、合乎语境。若团队把一份流行 Markdown 当成质量标准,标准本身就可能成为新的复制源。真正需要维护的是可检查的示例、明确的拒绝条件,以及有人对最终结果负责的审阅环节。
这也和 Sama 的硬件动作形成反差。一个方向在增加快捷键、状态灯和推理旋钮,把 agent 推近人的工作习惯;另一个方向则提醒我们,入口越顺滑,错误和套话越容易被大规模放大。工作台可以让 agent 更容易被调用,却不能替用户完成判断。

Marcus:便宜 80%,谁先撑不住

Gary Marcus 分享「The Atlantic」关于生成式 AI 工程效率的文章,引用其中一句重话:作者询问多位 AI 研究者后,没有人能举出另一种扩展性如此糟糕的现实软件;按经济和工程标准,生成式 AI 可能是「部署过的最糟糕技术」。4
原文的论据不是抽象的悲观,而是资源账本。文章写到,AI 公司为维持系统运行,可能买走全球高端内存供应的 70%;作者两年前以 350 美元买到的硬盘,近期看到的价格已经是 800 美元且缺货,部分笔记本价格上涨幅度达到 50%,美国数据中心容量还计划在未来几年扩大到原来的 8 倍。文章把这些现象归因于模型对内存、数据中心和电力的高需求,并据此质疑生成式 AI 是否真的享受了传统软件那种规模经济。5
Marcus 随后又写道:「one 80% price cut ends OpenAI and Anthropic」,但紧接着承认这个说法可能夸张,只是方向上成立。没有上下文时,这句话不能被当成一份可靠的破产预测;它真正指出的是价格战的脆弱点:如果用户把模型能力视为可替代服务,降价会迅速压缩实验室的收入空间,而数据中心、内存和电力成本不会同步消失。6

Chollet:如果一切都能写成代码

Chollet 的原帖只有一句:「Code is OP. Now what if... we made everything code?」7 他没有给出项目、指标或路线图,因此这更像一个技术命题,而不是已被验证的预测。但放在同一天看,它和 Codex Micro 的动作有一个有趣的交点:当更多工作被表达成可调用的 skills、指令和 agent 流程,代码的边界确实在向工作方法、操作接口和组织流程扩张。
问题是,「一切代码化」会让执行更便宜,却不自动让目标更清楚。Mollick 说的是审美和验收,Marcus 说的是资源和成本,Sama 展示的是入口,Chollet 提出的是想象空间。四条线合起来,今天真正的瓶颈已经不是能不能把一句话变成代码,而是能不能在更快的执行、更低的价格和更高的调用频率下,仍然看清结果是否值得交付。
对企业用户来说,下一步要观察的不是设备卖得好不好,而是三件具体的事:agent 状态能否被看见,skills 是否有真实案例和失败边界,模型降价后基础设施成本是否真的下降。入口会越来越像产品,验收却仍然是人的工作。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel