Sama 把 AI 竞争压到价格与入口,Mollick 发现产品还没跟上

Sama 把 AI 竞争压到价格与入口,Mollick 发现产品还没跟上

过去 24 小时,Sama 把 agent 产品的竞争落到使用增长、任务成本和推理供给,Mollick 则指出入口命名与文档仍在拖累采用,Chollet 展示了短信式执行的另一种产品路径。

覆盖范围与最强信号

过去 24 小时,白名单账号里真正形成信息密度的原创主要来自 Sam Altman、Ethan Mollick 和 François Chollet。Karpathy、LeCun、Demis Hassabis、Jim Fan 与 Ilya Sutskever 的窗口内时间线没有可纳入的原创长推,出现的相关条目主要是转推、短反应或窗口外内容。本期最强信号不是又一个模型分数,而是模型竞争开始同时落在三本账上:使用量、单位任务成本,以及用户能否顺利把能力接入日常工作。

Sama 把竞争压到供给和单位成本

7 月 14 日晚,Sama 先说 Codex 和 ChatGPT Work 这两类 agent 产品一周内使用量增加了 2.5 倍。这个数字来自 OpenAI 方面的公开表述,推文没有给出用户数、任务数或统计口径,因此不能直接当作全行业采用率。它能确认的是,OpenAI 正在把 agent 产品的增长放在「真实使用」的位置上,而不是只谈模型发布本身。1
紧接着,Sama 给出了一组更接近采购决策的比较:他称 GPT-5.6 Sol 在许多完成同一任务的场景中,价格约为 Fable 的一半,token 效率约为后者两倍,因此可以做到四分之一的价格。原帖没有披露任务集合、计算方法、上下文长度或失败率,这不能替代独立评测;但它明确透露出 OpenAI 的销售语言正在从「模型更强」转向「同一任务花费更少」。2
几个小时后,他又说 Sol 的增长「insane」,并把需求承载归功于推理团队,同时提醒短期内可能出现 hiccups。这里的重点不是把一次提醒解释成系统性故障,而是看到一个产品化约束:当 agent 使用量快速上升,模型能力、推理容量和交付稳定性会一起进入产品竞争。模型在实验室里多跑几步,和大量任务持续排队,是两种完全不同的工程问题。3
Sama 还说,看到自家模型终于擅长设计,仍然让他有些「打破认知」。这条话没有给出产品名、案例或指标,不能扩写成设计能力已经被证明,只能看作他对能力边界变化的主观反应。把它与前面的价格和使用量放在一起,能看出 OpenAI 当前想传递的组合:能力足够覆盖更多工作,单位成本下降,入口开始承载持续任务。4

Mollick 盯住入口,而不是发布口号

Mollick 的两条观察正好补上了 Sama 叙事中容易被忽略的部分。第一条针对 Claude 和 OpenAI 的「everything app」形态:在 Claude 侧,用户先在 Home 与 Code 之间选择,再进入 Chat 或 Cowork;在 OpenAI 侧,用户面对 ChatGPT Work 与 Codex,Chat 还被放进侧边菜单。他的结论带着讽刺意味:同一家公司的网站和应用端尚且不一致,两家产品的命名与入口也各有一套,谈不上直觉。5
这不是普通的界面吐槽。对 agent 产品来说,入口本身决定用户是否知道该把任务交给谁:聊天适合一次性问答,Work 或 Cowork 更接近持续协作,Code 则要求用户接受另一套权限、文件和执行语境。如果这些能力被拆在不同名称下,用户就必须先理解厂商的内部产品图,再决定如何工作。模型能力越强,入口错误带来的返工和放弃成本反而越高。
第二条观察更具体。Mollick 说,ChatGPT iOS 应用里的远程功能可以通过 Codex 控制电脑,但应用里的设置说明与桌面 ChatGPT 的菜单并不一致;他认为问题不难解决,却指出 Labs 中有不少文档已经过时。6
这给企业采用 agent 一个比「模型选哪家」更实际的验收项:功能能不能打开,权限是否说得清楚,失败时用户能不能定位问题,文档是否与当前界面同步。Sama 的成本优势如果要转化为持续使用,就必须穿过这些细节。每一次找不到入口、看不懂权限、照着旧文档操作失败,都会把模型节省下来的 token 成本变成组织里的人工成本。

Chollet 展示另一种入口

Chollet 在窗口内推荐了 AirTap。按他的原帖介绍,这个产品把短信变成移动应用的后台执行层:用户通过短信交代跑腿任务,系统在后台操作 DoorDash、TikTok 等应用,用纯文本更新进度,只在身份验证时请求用户介入。他把它称为一个有意思的消费级 AI 概念。产品官网在本轮抓取中没有返回可读内容,所以这里仅采用 Chollet 原帖明确写出的描述,不补充其架构、可用地区或实际成功率。7
AirTap 的价值不在于证明某个产品已经成熟,而在于它把 agent 的入口换成了用户已经熟悉的动作:发一条消息,等待进度,需要身份验证时再回来。它与 ChatGPT Work、Codex 的差别也因此变得清楚。后两者要求用户进入一个新的 AI 工作台,AirTap 则试图把 AI 藏到原有应用和通讯习惯之后。对消费者来说,这可能降低学习成本;对产品团队来说,后台执行、身份验证、状态反馈和异常恢复会变成必须解决的系统问题。

今天的判断

这几条原创放在一起,冲突点很明确。Sama 讲的是模型和推理系统已经足够便宜、足够受欢迎,接下来要扩大供给;Mollick 看到的却是入口命名和文档还没有跟上能力变化;Chollet 关注的则是能不能把复杂执行藏进更自然的交互里。
因此,今天不宜只问哪个模型更强。更接近真实采购的问题是:同一任务的总成本是多少,用户需要学习多少新入口,任务失败时谁能接管,产品团队能否持续维护权限、文档和状态反馈。模型优势只有经过这些环节,才会从一条发布推文变成可复用的工作流。

相似内容

  • 登录后可发表评论。
More from this channel