
OpenAI Operator 失败拆解:从 $200 研究预览到被 ChatGPT agent 吸收
拆解 OpenAI Operator:它证明了 AI 可以操作网页,却没公开证明用户会持续委托、监督成本足够低或独立入口值得保留,最终在 2025 年 7 月并入 ChatGPT agent。
一句话总结
OpenAI Operator 的独立产品失败,不等于它的浏览器操作能力失败:它在 2025 年 1 月 23 日以美国 ChatGPT Pro 研究预览上线,7 月 17 日被整合进 ChatGPT agent,独立入口随后退出。12
它最尴尬的地方是,技术演示并不差。OpenAI 公布的 CUA 模型在 OSWorld 上得分 38.1%,人类得分为 72.4%;在 WebVoyager 上得分 87%。但这些是模型评测,不是用户留存、任务复购或收入证明。3
我的判断是:Operator 把「能看懂网页并点击」验证成了能力,却没有把「用户愿意持续交给它完成什么任务」验证成一个独立产品。能力被更大的 ChatGPT 入口吸收,是战略上的保留,也是 standalone Operator 经营失败的结果。
增长判断
Operator 的 Acquisition 由 ChatGPT Pro 和 OpenAI 的品牌提供,Activation 由浏览器操作演示提供,Retention、Referral 和 Revenue 都没有公开经营数据。产品从美国限定的 $200 月费计划起步,用户先要支付一个高价订阅,才能试用一个仍被标为 research preview 的独立网站。43
这条漏斗的问题不是没人听说过,而是每一步都在向用户追加条件:先拥有 Pro,再接受研究预览的不稳定性,再为登录、支付、验证码和敏感网站接管浏览器,最后还要确认它没有在复杂页面上卡住。OpenAI 没有披露注册数、激活率、D7、D30、任务成功率、重复任务率、独立收入或单位成本。
增长因果链
$200 Pro 计划和 OpenAI 品牌带来首批用户 → 独立网站用远程浏览器把「AI 会操作网页」做成可见演示 → 复杂页面、验证码、支付和敏感操作需要人工接管 → 用户每次完成任务都要承担监督成本,而公开资料没有证明重复任务和付费增量 → OpenAI 将浏览器能力与深度研究、文件、连接器和终端合并到 ChatGPT agent → 独立 Operator 的入口、品牌和商业边界消失。
文中把官方公告直接说出的时间线、功能和限制标为置信度 A;独立媒体对发布现场、价格和早期体验的报道标为置信度 B;TAM/SAM/SOM、经营阈值和反事实策略标为置信度 C。Operator 没有公开注册用户、活跃用户、D7、D30、任务复购率、收入、退款率、单任务成本或毛利,这些都写作「未披露」。
G|增长系统:有能力演示,不等于有可复购任务
结论
Operator 的 AARRR 漏斗只公开完成了「让人看到」和「让人试用」两步。它没有公开证明用户会反复把高价值任务交给它,也没有证明这些任务带来的增量价值足以支撑独立入口。
| 环节 | 已知事实 | 判断与可证伪指标 |
|---|---|---|
| Acquisition | 2025 年 1 月 23 日上线,美国 ChatGPT Pro 用户可用;TechCrunch 和 MIT Technology Review 均记载 Pro 计划为每月 $200。14 | 品牌、订阅入口和媒体预热可以带来早期访问,但注册数、访问来源、试用转激活率和获客成本均未披露。继续投入前,至少应看到 30% 的合格访问者在 24 小时内完成一个真实任务,而不是只打开演示页面。后半句是管理阈值,置信度 C。 |
| Activation | 用户用自然语言描述任务,Operator 在自己的浏览器中截图、点击、输入和滚动;可以保存自定义指令,也可以同时运行多个对话任务。14 | 首次价值很直观,但登录、支付、验证码和重要操作仍要求用户接管或确认。建议把「五分钟内完成首个低风险任务」作为激活标准,目标完成率至少 60%;Operator 实际完成率未披露。置信度 C。 |
| Retention | OpenAI 公开了订餐、购物、旅行和表单等任务,也承认复杂幻灯片、日历系统和非标准界面仍有困难;官方没有公开 D7、D30、每周任务次数或用户重复使用率。14 | 浏览器代理的留存单位不是「打开 App」,而是「重新交给它完成同一类任务」。如果激活用户 30 天内平均没有完成 4 次以上可复用任务,或者第二次任务仍需要从头监督,独立产品就缺少习惯证据。Operator 实际数据未披露。置信度 C。 |
| Referral | OpenAI 与 DoorDash、Instacart、OpenTable、Priceline、StubHub、Thumbtack、Uber 等公司合作,合作目标是让真实网站上的使用更顺畅;没有公开用户邀请率、分享率或自然新增占比。1 | 这些是供应端合作,不等于用户自发推荐。若用户不能把完成结果、节省时间或可复用模板分享给同事,Referral 就只能依赖 OpenAI 自己的分发。自然新增、模板传播和被邀请用户激活率均未披露。 |
| Revenue | Operator 首发依附于美国 ChatGPT Pro $200 月费计划,没有单独价格、独立收入或独立成本披露。43 | Pro 订阅收入不能直接归因给 Operator。继续作为独立产品经营前,需要证明使用 Operator 会带来增量订阅、降低取消率,或形成可单独收费的任务额度。增量收入、成本分摊和毛利均未披露。 |
增长逻辑: 浏览器动作是一次可见的 Activation,只有被用户反复交付、成功率稳定且不需要持续盯盘,才会变成 Retention。
O|市场机会:用户买的是自动点击,还是少承担一次结果责任
结论
Operator 的市场机会不应定义为「所有会使用浏览器的人」,而应定义为「有重复、规则相对稳定、结果可核验的网页任务,并愿意让第三方代理处理账户和数据的人」。这个市场可能很大,但它同时拥有高信任成本和高失败代价,不能用浏览器用户数直接估算。
当时的产品场景包括订餐、购物、旅行、表单和票务;用户还可以在需要登录、支付或验证码时接管浏览器。14 这些场景有一个共同点:用户原本就知道要做什么,代理的价值是减少操作步骤,而不是替用户决定什么结果值得承担。
TAM / SAM / SOM:经营情景,不是公开市场规模
Operator 没有公开目标市场、用户规模、收入或价格验证。下面只做一个自下而上的经营情景,金额按假设的独立产品月费 20 美元计算,所有数字都是估算,置信度 C,不代表 OpenAI 的实际数据。
| 层级 | 情景假设 | 年化订阅收入情景 | 口径说明 |
|---|---|---|---|
| TAM | 全球 3,000 万名有重复网页任务的知识工作者 × 20 美元/月 | 72 亿美元 | 任务人数和价格均为假设,不是行业统计。 |
| SAM | TAM 的 10%,即 300 万名愿意授权账户并接受人工接管的人 | 7.2 亿美元 | 用授权意愿和任务可核验性筛选,不等同于所有知识工作者。 |
| SOM | 3 年内获取 SAM 的 1%,即 3 万名持续付费用户 | 720 万美元 | 经营目标情景,不是 Operator 的实际收入。 |
这个模型最脆弱的变量不是月费,而是「用户是否愿意在失败时承担结果」。错订餐可以退款,错发邮件、错改日历、错填表格或误触敏感账户,代价就完全不同。Operator 因此对银行、求职等高风险任务设有限制,并在敏感网站要求密切监督。1
可证伪判断: 如果一个垂直场景中,用户仍要逐步检查代理的每次点击,且每完成一个任务平均需要超过两次人工接管,那么代理省下的时间很可能不足以覆盖监督成本。这个阈值是经营假设,置信度 C。
增长逻辑: 代理能触达的网站越多,潜在市场越大;但结果责任越重,用户越难把控制权交出去,市场容量不能脱离风险折扣计算。
S|战略定位:Operator 没有输给能力,而是输给了产品边界
结论
Operator 的战略定位同时摇摆在三个角色之间:面向消费者的自动化工具、展示 CUA 能力的研究预览、以及 ChatGPT 下一阶段的产品能力。三者都成立,但它们需要不同的成功指标。OpenAI 最终选择了把能力并入 ChatGPT agent,说明公司更看重统一入口和跨任务协同,而不是继续经营一个独立品牌。
问题在于,独立网站把用户限制在一个孤立的任务容器里。Operator 不能深入分析,也不能自然访问用户已经连接的资料;OpenAI 在 ChatGPT agent 发布时明确写道,很多用户向 Operator 提出的请求其实更适合 deep research,因此把两者合并。2
这次合并带来了三个战略收益:
- 一个入口承接多个意图。 用户可以从聊天开始,再进入研究、浏览器、终端、连接器或文件处理,不必先判断该打开 Operator 还是 deep research。2
- 把能力分发给已有用户。 ChatGPT agent 在 2025 年 7 月向 Pro、Plus 和 Team 用户推出,企业与教育用户随后获得支持;发布时不再要求用户访问独立 Operator 网站。5
- 把研究价值和行动结果放在一起。 新系统可以查资料、使用连接器、操作网页、运行代码并生成幻灯片或表格,产品承诺从「会点击」扩大到「完成复杂任务」。2
代价也很明显:Operator 作为产品名、独立入口和可单独核算的商业单元被放弃。对于一家大平台,这可能是合理的资源配置;对于要证明独立需求的产品团队,这等于没有完成从研究预览到独立经营的验证。
战略反事实: 如果 Operator 一开始只做一个垂直任务,例如跨多个票务和预约网站完成可审计的预订,并公开任务成功率、人工接管率和重复使用率,它可能更早知道用户究竟在购买自动化,还是只是在围观新能力。这个判断没有发生过的实验支持,置信度 C。
增长逻辑: 当能力覆盖多个任务却没有一个任务成为默认交付对象,平台整合可以提高能力利用率,独立产品却很难形成清晰的留存理由。
C|竞品分析:同一项能力,四种分发方式
结论
Operator 的竞争压力来自入口,而不只是模型分数。Anthropic 把 Computer Use 放进 Claude 的开发者能力,Google 把 Mariner 放进自有浏览器和搜索生态,OpenAI 最终把 Operator 的浏览器能力放进 ChatGPT agent。独立 Operator 需要自己证明「为什么要再打开一个网站」。
| 产品 | 主要入口 | 核心能力 | 分发与限制 | 对 Operator 的压力 |
|---|---|---|---|---|
| OpenAI Operator | 独立网站,首发仅美国 ChatGPT Pro 用户 | 远程浏览器截图、点击、输入、滚动;支持购物、旅行、订餐和表单 | research preview;复杂幻灯片、日历、定制界面不可靠;登录、支付、验证码需接管。14 | 需要单独教育用户、承受独立入口成本,并让 Pro 价格看起来值得。 |
| Anthropic Computer Use | Claude 与开发者 API | 读取屏幕、移动鼠标、输入文字、浏览网站和操作软件 | CNBC 报道其 2024 年已发布;适合开发者构建垂直代理,但可靠性和安全边界仍需应用方承担。6 | 让「浏览器代理」变成可嵌入能力,削弱 Operator 作为独立产品的稀缺性。 |
| Google Project Mariner | Google 的浏览器与研究生态 | 基于屏幕理解网页并执行浏览器任务 | MIT Technology Review 记载 Mariner 是浏览器代理,且在 WebVoyager 对比中得分 83.5%;Google 拥有更自然的浏览器分发入口。3 | 用户不必为试用代理再建立一套新的入口和账户关系。 |
| ChatGPT agent | ChatGPT 工具菜单中的 agent mode | 结合 Operator 的网站交互、deep research、连接器、终端和文件处理 | 2025 年 7 月向 Pro、Plus、Team 推出;Operator 的核心浏览器能力被整合,独立入口随后弃用。25 | 直接吸收 Operator 的能力、用户和使用场景,令 standalone Operator 的独立价值无法成立。 |
Operator 在 WebVoyager 上的 87% 以及 OSWorld 上的 38.1% 都是模型或系统评测结果,不能替代真实世界的成功率。MIT Technology Review 同时指出,人类在 OSWorld 上为 72.4%,这说明「能完成一部分任务」和「可以放心委托」仍有距离。3
增长逻辑: 当竞争者把同一能力放进更大的身份、浏览器、开发者或聊天入口,独立代理必须拥有更高的任务成功率或更明确的结果责任,才值得用户单独访问。
P|产品设计:远程浏览器解决了 API 缺口,却把监督成本留给用户
结论
Operator 的产品设计聪明在于绕过网站 API,直接操作人类界面;它的缺点也来自同一选择:每个网页变化、弹窗、验证码和异常状态都可能成为模型的新问题,用户必须在关键时刻回来接管。
完整流程大致是:用户用自然语言描述任务,Operator 打开自己的远程浏览器,逐屏观察并点击、输入、滚动;遇到登录、支付或验证码时请求接管,外部副作用发生前请求确认,敏感网站使用 Watch Mode 让用户近距离监督。1
这套设计降低了三种摩擦:
- 接口摩擦: 不要求每个网站先提供专用 API,理论上可以操作人类能操作的网页。3
- 启动摩擦: 用户只需描述目标,系统可以在远程浏览器里开始搜索、比较和填写。
- 协作摩擦: 用户可以随时接管,任务卡住后也能把控制权交还给代理。1
但它留下三个关键空白:
- 成功标准没有先被用户定义。 「帮我订一张最合适的票」需要先说明价格、时间、退改签和座位偏好,代理可能完成了点击,却没有完成用户真正关心的选择。
- 人工接管会打断自动化价值。 登录和支付需要接管是合理的安全约束,但如果每次任务都在多个步骤中停下来确认,用户得到的是「有人帮我操作,但我得一直盯着」的体验。Operator 的整体接管率和每任务接管次数未披露。
- 浏览器通用性扩大了失败面。 OpenAI 和 TechCrunch 都承认它在复杂界面、日历、幻灯片、密码字段和验证码上会卡住;发布时还存在动态限额和每日使用上限。14
可证伪指标: 对一个具体垂直任务,首次成功率至少 85%,人工接管率不超过 30%,副作用错误率低于 1%,且 D30 用户每周完成同类任务至少两次,才足以支撑继续扩大网站覆盖。上述阈值是管理标准,置信度 C,不是 Operator 的已披露表现。
增长逻辑: 远程浏览器让代理覆盖更多网页,但每个未结构化界面都会增加验证和接管成本;广度必须用稳定的任务成功率来兑换。
E|商业模式:$200 是 ChatGPT 的价格,不是 Operator 的价值证明
结论
Operator 没有公开的独立商业模式。它首发绑定在每月 $200 的 ChatGPT Pro 计划里,OpenAI 同时把它称为 research preview,并计划将能力扩展到 Plus、Team 和 Enterprise。14
因此,不能把 Pro 订阅收入直接算作 Operator 收入。一个用户购买 Pro,可能是为了更强模型、文件能力、deep research 或额度,Operator 只是附带价值。公开材料没有披露 Operator 带来的新增订阅、降低取消率、任务额度收入、每用户使用时长、浏览器基础设施成本、模型成本或安全监控成本。
它的成本至少包括:
- 每个任务持续运行远程浏览器和截图处理。
- 视觉理解、推理、自我修正和监控模型的调用。
- 登录、支付、验证码、提示注入和恶意网站带来的安全防护。
- 用户接管、错误处理、合作网站适配与人工支持。
前三项和产品机制由 OpenAI 的官方说明直接支持;具体成本金额未披露。1 下面的反推只用于判断经营门槛,置信度 C:如果独立产品月费假设为 20 美元,每用户每月变动成本为 5 美元,要覆盖 1,000 万美元年化固定成本,需要约 5.6 万名持续付费用户。这不是 Operator 的实际用户数,也不是 OpenAI 的财务数据。
| 指标 | 已知状态 | 继续投入前的建议阈值 |
|---|---|---|
| 独立价格 | 未披露;首发随 $200 Pro 提供 | 用单独价格测试用户为「任务结果」付费,而不是为模型总套餐付费。 |
| 增量收入 | 未披露 | 使用 Operator 的用户在净收入、续费率或额度消费上明显高于未使用用户。 |
| 单任务成本 | 未披露 | 低风险、重复任务的变动成本不超过任务可归因收入的 25% 至 35%。 |
| 任务价值 | 未披露 | 每周至少替用户完成两次可核验任务,且用户能说清节省了哪一段人工时间。 |
| 安全成本 | 有接管、确认、Watch Mode、监控和数据控制机制;金额未披露。1 | 错误副作用率低于 1%,重大风险任务必须拒绝或人工确认。 |
增长逻辑: 把代理放进高价总套餐可以降低独立定价压力,却也让团队无法知道用户究竟为代理增加了多少钱。
L|洞察提炼:模型分数、产品留存和公司战略是三张不同的成绩单
结论
Operator 最值得记录的失败,不是模型做不到任何事,而是三张成绩单没有对齐:技术评测已经足够让人兴奋,产品经营还没有公开证据,战略又在半年内改成了平台整合。
- 能力可以成功,独立产品仍然失败。 CUA 在 OSWorld 和 WebVoyager 上取得了不错的公开成绩,但 OpenAI 没有公开相应的用户留存、任务复购或收入数据。模型评测回答「能不能做」,产品需要回答「谁会持续交给它做」。3
- 人工接管既是安全机制,也是价值税。 登录、支付和验证码要求用户接管,可以降低风险;但监督越频繁,代理越像一个需要管理的实习生,而不是节省管理时间的工具。这个取舍必须通过每任务接管次数、错误率和用户完成时间来验证。
- 平台整合会放大使用率,却抹平独立边界。 ChatGPT agent 把 Operator 的浏览器能力与 deep research、连接器、终端和文件处理放在同一个入口,产品能力因此更完整;但 standalone Operator 的品牌、分发和独立商业假设也随之结束。25
- 通用代理要先找到一个结果密度高的窄任务。 「帮我上网办事」太宽,用户难以判断成功与否,团队也难以计算成本。先做一个有明确输入、输出、责任边界和复购频率的任务,才能知道该不该扩展到更多网站。
可证伪判断: 到 2027 年,若通用浏览器代理的公开产品仍主要展示任务 demo 和模型分数,却不披露重复任务率、人工接管率、错误副作用率和单位经济,那么它们的商业成熟度仍然没有被证明。这个判断可由后续产品公告、开发者数据和付费方案检验,置信度 C。
增长逻辑: 代理产品只有把「模型会做什么」翻译成「用户每周稳定获得什么结果」,技术优势才会变成商业控制点。
D|决策分析:先卖一个可核验结果,再决定是否做通用代理
结论
如果今天重新做 Operator,第一步不是增加更多网站,而是选择一个用户愿意重复委托、结果可以自动核验、失败不会造成不可逆损失的垂直任务。通用浏览器能力应该藏在后面,用户看到的应该是结果和审计轨迹。
创始人决策表
| 决策点 | 继续推进条件 | 暂停或转向条件 |
|---|---|---|
| 选任务 | 每周至少有两次同类需求,输入和完成标准可以结构化 | 用户只在偶尔的新鲜场景使用,任务没有稳定复购。 |
| 交给代理 | 任务失败可以撤销、退款或人工补救,且用户能检查结果 | 错误会发出不可撤回的信息、造成资金损失或影响高风险决定。 |
| 做通用浏览器 | 一个垂直任务已达到 85% 以上成功率,再扩展相邻网站 | 还没有一个任务稳定成功,就先宣传「什么都能做」。 |
| 设计接管 | 只有登录、支付、验证码和最终副作用需要人工确认 | 用户需要逐步批准普通点击,监督时间接近手工操作时间。 |
| 开始收费 | 用户愿意为明确的任务额度或结果付费,90 天后仍复购 | 只有 Pro 套餐里的试用,没有独立支付或增量续费证据。 |
| 做平台整合 | 多个任务共享身份、上下文、连接器和历史结果,合并后更快完成 | 合并只是把功能堆进一个聊天框,无法减少步骤、失败和监督。 |
90 天验证计划
- 第 1 至 30 天: 只做一个低风险任务,例如跨多个网站整理旅行选项并生成待确认清单。记录首次成功率、完成时间、人工接管次数、错误类型和用户是否接受结果。
- 第 31 至 60 天: 加入一个真实副作用,但保留最终确认,例如由代理填好预订表,用户确认后再提交。测试 30 天内重复任务次数、用户主动发起比例和撤销率。
- 第 61 至 90 天: 测试独立价格和平台分发两条路径,分别计算每个付费用户的浏览器、模型、安全监控和支持成本。若 D30 复购、单位毛利或重大错误率任一不过线,缩小任务范围,不继续扩展网站数量。
最终判断
但作为独立产品,它没有公开证明三件事:用户会反复交给它做一类任务,人工监督成本低于手工操作,Operator 能为 ChatGPT Pro 带来可归因的增量价值。2025 年 7 月,OpenAI 选择把浏览器能力、deep research 和其它工具合并为 ChatGPT agent;官方同时说明 standalone Operator 将被弃用。25
所以,Operator 的结论不是「浏览器代理没有市场」,而是「一个能操作网页的能力,还不足以成为一个需要独立入口的产品」。对创始人和产品负责人来说,下一次看到代理 demo 时,先问四个数字:D30 重复任务率、每任务人工接管次数、错误副作用率、以及扣除模型和浏览器成本后的贡献毛利。
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.