
ChatGPT Work 把手机变成任务入口,Mollick 却提醒权限和选型仍是难题
Sama 的手机端任务演示与 Mollick 对 Agent 权限、生成式工作流和模型选型的观察放在一起,帮助读者判断 AI 从聊天走向委托后,企业该如何验收。
手机已经能发起一项「工作」
过去 24 小时,Sama 和 Ethan Mollick 的原创内容落在同一条产品线上:AI 不再只是回答问题,而是开始接手一段需要规划、调用工具、等待结果、再交给人确认的工作。窗口内其他核心追踪账号没有提供同等密度的原创长推,因此今天的信号集中在产品入口与组织使用方式,而不是模型榜单。
7 月 26 日 23:10(北京时间),OpenAI CEO Sam Altman 在 X 上写下了一次 ChatGPT Work 的手机端体验。他从手机发出一段很长的指令:让系统利用自己的聊天历史,为 8 位朋友规划长周末旅行的三个方案,制作一个让 9 个人协调偏好的全栈网站,等大家达成一致后完成预订,再起草一封可以发给朋友的 Gmail 邮件。Sama 的结论只有一句:这件事「it...just worked」。1
这条推文不能当成独立 benchmark,也没有披露每一步的耗时、失败次数、权限配置或预订是否真的完成。它更像一次产品体验报告:用户给出目标,系统尝试拆任务、建立中间产物,并把需要人决定的环节留给人。
콘텐츠 카드를 불러오는 중…
Mollick 看到的,是从聊天到委托
沃顿商学院教授 Ethan Mollick 在 7 月 23 日发布、7 月 26 日更新的《An opinionated guide to which AI to use to do stuff》中,把这类系统解释得更直白:Agentic system 是模型加上一组能让它规划和行动的工具,等于给 AI 一台可以使用的电脑。对普通用户来说,ChatGPT Work 和 Claude Cowork 负责在厂商提供的虚拟电脑上完成结果,Codex 和 Claude Code 则更接近把 AI 放进用户自己的电脑,让人看到文件、命令、测试和修改记录。2
Mollick 给出的案例比产品宣传更有用:他让两个系统接入 Gmail,为一场 MBA 课程准备材料、演示和邮件。大约 10 分钟后,两套系统都交回了一批教学材料和邮件草稿,但其中一个系统直接发出了邮件,另一个先要求确认。差异来自权限设置,而不是一句更漂亮的提示词。Mollick 还提醒,读取邮件和浏览网页的 Agent 可能遇到诱导它泄露文件的提示注入,因此发送邮件、购买东西、修改或删除文件,都应保留人工批准。2
这正好补上了 Sama 演示里没有出现的部分。手机端把任务交出去之后,企业要回答的不是「模型看起来聪不聪明」,而是它能碰哪些系统、在哪些动作前停下、出了错如何回滚,以及谁对最终结果负责。没有这些边界,所谓「会做事」很容易变成一条无法复盘的自动化流水线。
一年前的小游戏,今天已经变成工作流样本
Mollick 同一天还展示了 Fable 做出的 Cezanne City。他描述的不是一个固定菜单里的建造器,而是让用户用手势画道路、树林或地面,城镇再自行解释这些笔触,社区会随着演化获得不同性格。试玩页面也明确写着:用户不直接放置建筑,而是画出道路、地面或树木,城镇根据输入继续发展,擦除留下的痕迹也不会回到空白。3
这个案例的价值不在于「AI 能生成一个小游戏」这句已经很熟的结论,而在于生成物开始带有自己的交互规则。用户给出的不是一张结果图,而是一套可以继续操作的环境。对产品团队而言,验收对象也随之变了:除了看代码能不能运行,还要看系统是否理解输入、状态是否可预测、修改是否可逆,以及用户能否在中途接管。
Mollick 的模型选型指南之所以在发布几天后还要更新,是因为产品层变化太快。他说自己必须把 Opus 5 和 Codex 的语音模式补进去,这两项能力都在周五发布,紧跟变化本身已经变成使用门槛。4 指南正文也把问题拆成了两层:低风险聊天可以选择「够用」的模型,真正的工作则要同时选择模型、思考级别、入口和权限。
今天该检查的不是「能不能做」
Sama 的手机演示说明,AI 入口正在从对话框向任务委托移动;Mollick 的案例说明,委托一旦触及邮件、文件和外部系统,权限与复核就会成为产品的一部分;Cezanne City 则提示我们,生成结果还可能变成一个需要持续操作的环境。
因此,企业试用这类 Agent 时,至少要把四件事写进验收表:任务是否真的完成,过程中的文件与工具调用是否可回放,关键动作是否需要人工批准,失败后能否停止并恢复。模型名称和宣传演示可以很快变化,真正能留下的,是一条带权限、轨迹和责任人的任务记录。
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
