OpenAI 8月12日至13日动态:企业AI从问答走向代理执行,开放模型竞争升温

OpenAI 8月12日至13日动态:企业AI从问答走向代理执行,开放模型竞争升温

OpenAI 最新企业数据显示,前沿企业的人均 AI 输出深度已是典型企业的 8.3 倍;本期同时梳理 RingCentral 落地案例、开放权重模型竞争与产品状态页边界。

速览

本文覆盖 2026 年 8 月 12 日 09:00 至 8 月 13 日 09:00(北京时间)。窗口内最值得跟进的是 OpenAI 发布的企业 AI 使用数据:截至 6 月,Codex 占企业客户 Codex 与 ChatGPT 合计输出 token 的 64%;月度使用深度排名前 10% 的「前沿企业」,人均输出 token 已是典型企业的 8.3 倍。OpenAI 同日还发布 RingCentral 客户案例;Reuters 则报道,开放权重模型正在成为 OpenAI 需要面对的外部竞争变量。
变化影响谁需要核对什么
企业 AI 从问答转向代理执行,Codex 输出占比达到 64%企业 AI 负责人、开发者、产品团队任务是否有明确上下文、工具权限、验收标准和人工复核
前沿企业与典型企业的使用深度差距扩大到 8.3 倍负责 AI 规模化和预算的管理者不要只比较席位数;先看高价值工作流是否被重复使用
RingCentral 把 ChatGPT Work 与 Codex 推向工程和 PMO企业产品、研发和运营团队客户案例中的效率与采用描述属于企业自述,不是独立审计
开放权重模型在美国企业 AI 支出中的使用比例上升模型选型、采购和平台团队成本、数据驻留、可控性与最难任务的能力要分开评估

企业数据:差距不在有没有模型,而在怎么用

OpenAI 8 月 12 日更新的 Enterprise Signals 把企业客户按「每名活跃用户的输出 token」排序:每月排名前 10%的是前沿企业,处于第 45 至 55 百分位的是典型企业。按这个口径,截至 6 月,前沿企业的人均输出 token 是典型企业的 8.3 倍,而 1 月时是 2.6 倍。这个指标衡量的是使用深度,不是收入、利润或 AI 项目的直接回报。1
Token 数量只能当作代理指标。短回答可能很有价值,长输出也可能没有用;OpenAI 自己在报告中提醒了这一点。因此,8.3 倍不能直接翻译成「生产率高 8.3 倍」,更接近于:前沿企业让 AI 参与了更多、更长的工作流程。信息与技术行业的差距最大,为 11.7 倍;制造业最小,为 5.3 倍。1
变化最具体的地方是代理式使用。OpenAI 将 Codex token 作为代理式 AI 使用的口径;截至 6 月,它占企业客户 Codex 与 ChatGPT 合计输出 token 的 64%。ChatGPT 更偏向问答、构思和分析,Codex 与 ChatGPT Work 则可以在权限范围内调用工具、编辑文件、查找信息并执行多步骤任务。不同产品使用的是同一类前沿模型,区别在于模型是否被接入了执行环境。1
OpenAI 披露的另一组数字说明,代理并没有停留在软件工程:自 2 月以来,企业每周活跃 Codex 用户数在法律部门增长 108 倍,销售和招聘部门各增长 41 倍,营销部门增长 26 倍;工程部门为 5 倍。这里统计的是每周活跃用户数,不是完成任务数,也不是部门产出增长。1

高使用深度企业在做什么

前沿企业使用高级能力的比例也更高。每周活跃用户中,前沿企业使用 Plugins 的比例为 21%,典型企业为 9%;使用 skills 的比例分别为 19% 和 3%。OpenAI 还披露,内部员工每周使用 Plugins 的比例为 95%,这反映的是 OpenAI 自己的使用情况,不能当作普通企业的基准。1
这些能力的共同点不是「多一个聊天入口」,而是把企业上下文和动作权限接进模型。一个销售 Plugin 可以同时带入团队销售手册、CRM 客户信息和历史方案,再让代理先生成一份供人审核的回复。对企业来说,真正需要补齐的不是单一模型采购,而是四个条件:
  • 上下文:代理能读到哪些文件、系统和当前状态;
  • 工具:代理可以查询、修改或提交哪些系统;
  • 权限:哪些动作必须由人批准,哪些可以自动执行;
  • 验收:结果如何测试、记录和回滚。
OpenAI 对超过 1000 万条企业消息的分析还显示,ChatGPT 中最常见的用途仍是写作;在代理式消息中,编码以及系统/代理操作合计接近 75%。这两个比例不能直接相加比较,因为它们对应不同的消息集合。1

RingCentral:从工程挑战到 PMO 工作流

OpenAI 8 月 12 日发布的 RingCentral 客户案例称,这家企业通信公司让员工使用 ChatGPT Work 和 Codex,发起一项 AI-Native Challenge,要求参与者独立完成从规划、实现到测试、文档和 CI/CD 的完整项目。官方案例称,几乎每名参与者都建立了可运行的代码仓库,参与者包括非技术员工和高管。2
RingCentral 还称,PMO 团队用 ChatGPT Work 把 Jira、Google Sheets、CRM 等来源的项目状态接入工作流,自动生成通知、报告和待办事项。该案例给出的落地路径很清楚:先让员工自由试用,再把有效的个人工作流变成团队流程。但「更准确」「处理更多项目」等效果仍是 RingCentral 和 OpenAI 客户案例中的自述,页面没有提供独立审计方法或对照组。2
对准备在企业内推广代理的团队,这个案例的可借鉴部分不是具体工具名称,而是工作流顺序:先选一个能被测试和复核的流程,再接入数据源,最后决定哪些输出可以自动流转。没有权限边界和验收机制,自动化只会把错误更快地送入下一环节。

外部竞争:开放权重模型正在争夺成本敏感的任务

Reuters 8 月 12 日发布的报道把 OpenAI 放进更大的开放权重模型竞争中:Meta 恢复发布开放模型,Nvidia 也在推进相关系统;报道援引投资人和行业人士称,许多基础运营任务未必需要最前沿的闭源模型,企业会开始更仔细地核算投入产出。Reuters 将这一变化描述为 OpenAI 和 Anthropic 需要向投资者证明技术优势能覆盖模型训练与运行成本的压力。3
报道引用 Ramp 数据称,7 月约有 6.1% 的 AI 支出企业使用了提供开放权重或中国模型的平台,一年前为 4.5%。这只覆盖 AI 支出的一部分,不能据此推断 OpenAI 的客户流失率或整体市场份额;Reuters 还引述分析称,开放模型的增长尚未削弱对 OpenAI 和 Anthropic 的支出,但两家的采用增速正在放缓。3
对模型选型,今天的可执行结论不是「开放模型一定更好」或「前沿闭源模型仍然通吃」,而是把任务分层:低风险、重复、成本敏感的工作可以比较开放权重方案;代码、复杂推理和需要稳定工具调用的任务,则要单独测评准确性、延迟、治理和人工复核成本。Reuters 报道中的受访者仍预计 OpenAI 和 Anthropic 在最 demanding 的任务上保有优势,但这属于受访者判断,不是独立 benchmark 结论。3

产品与服务线:没有新的 8 月 12 日条目

截至本次核验,ChatGPT Release Notes 最新日期小节仍是 8 月 10 日的餐厅预订更新,页面顶部的「Updated」时间不等于新的产品发布时间;8 月 12 日和 13 日没有新的带日期产品条目。OpenAI Status 历史页显示的最近一批事件仍集中在 8 月 11 日,页面未列出 8 月 12 日至 13 日的新事件。45

今日判断

今天的新增信息有一条清晰的共同线索:OpenAI 正在用企业使用数据说明,竞争差异逐渐从「能不能调用模型」转向「能不能把模型接进真实流程」。8.3 倍差距、Codex 的 64% 输出占比、法律和销售等部门的用户增长,都支持这个判断;但这些数字来自 OpenAI 的聚合客户数据,不能直接当作全行业统计或生产率证明。
企业团队今天可以做三件事:用「每周活跃用户、完成任务数、人工复核率、失败回滚率」替代单纯席位数;为一个高频流程画清上下文、工具、权限和验收链路;再把开放权重模型与 OpenAI 模型放到同一批真实任务上比较,而不是只看公开榜单。
OpenAI 动态日报

OpenAI 动态日报

每日追踪 OpenAI 的产品发布、模型更新、研究进展与公司动态,整理成中文文章。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.