
OpenAI 日报:新「AI 价值评分卡」改看成功任务成本,Codex 权限问题仍在
OpenAI 将企业 AI 的衡量方式从席位数和 token 单价转向有用工作、成功任务成本、可靠性与规模化回报,并跟进 Codex 与新版 ChatGPT 应用的服务状态。
先看结论
截至北京时间 7 月 18 日 09:00,OpenAI 过去一天最值得关注的新发布不是新模型,而是 CFO Sarah Friar 在 7 月 17 日发表的一套企业 AI 价值衡量框架。文章把核心问题从「买了多少席位、用了多少 token」改成「AI 完成了多少有用工作,以及每个成功任务花了多少钱」。1
同一时间窗内,Codex 5.6-sol 的服务器过载错误已恢复;没有启用 Codex RBAC 的 Enterprise 用户使用新版 ChatGPT 桌面应用仍可能无法登录,状态页给出的临时建议是改用 ChatGPT Classic。GitHub 连接器错误也已恢复。234
OpenAI 给企业的四个指标
这篇文章提出的总括性指标是「Useful Intelligence per Dollar」,可以译为「每美元的有用智能」。它拆成四个问题:
- 完成了多少有用工作:例如解决了多少客户问题、交付了多少通过测试的代码变更、审阅了多少合同,或者为员工省下多少时间。
- 每个成功任务的真实成本是多少:不只看 token 价格,还要把推理计算、重试、延迟、人工复核和返工算进去。
- 结果有多可靠:OpenAI 建议把结果分成「可直接使用」「需要修正」和「需要人工接管」,这比只看模型准确率更接近工作流的实际成本。
- 规模扩大后,每一美元是否完成更多工作:持续跟踪同一工作流的成功任务数、总成本和单个成功任务成本,观察质量不下降时产出是否增长更快。
这套框架的价值在于,它把 AI 项目从采购和活跃用户统计,拉回到业务流程本身。企业需要先定义什么叫「完成」,再在客服、工程、法务或财务系统里记录结果是否达到质量门槛。1
对 GPT-5.6 的重新解释
OpenAI 在文章中把 GPT-5.6 的 Sol、Terra、Luna 三个层级作为成本与能力取舍的例子:高频、低复杂度工作可以优先考虑更快、更便宜的层级;需要更深推理、但一次成功能减少多轮重试的任务,则可能适合更高能力的层级。这里的判断单位不是单次调用价格,而是完成一项合格工作的总成本。1
需要注意的是,文章同时引用了 GPT-5.6 Sol 在代码代理基准和估算 API 成本上的表现。这些数字属于 OpenAI 文章中的厂商引用口径,适合看作产品方的价值主张,不能直接替代独立评测或企业自己的工作流数据。
企业管理员今天要注意什么
7 月 17 日的新版 ChatGPT 应用事件影响范围很窄,但对 Enterprise 管理员有明确操作含义:如果组织没有启用 Codex RBAC,用户安装新版应用后可能遇到
codex_cli_workspace_disabled,状态页仍将事件标为 Identified,并建议暂时使用 ChatGPT Classic。3开发者侧,Codex 5.6-sol 的过载事件已在 7 月 17 日晚间恢复,状态页记录了从 Identified、Monitoring 到 Resolved 的处理链路。遇到类似问题时,应先区分服务容量错误与代码、权限或模型行为本身的故障。2
发布检查:暂无 7 月 17 至 18 日新的 ChatGPT 日期条目
本轮抓取到的 ChatGPT Release Notes 最新日期小节是 7 月 16 日,内容为 macOS 和 Windows 桌面应用体验更新,面向所有计划开放。此前的 7 月 15 日条目则把 Plus、Pro、Enterprise、Business 和 Education 的自定义指令上限从 1500 字符提高到 5000 字符。它们都是近期可执行的产品提醒,但都不是 7 月 18 日新发布。5
API 侧仍有一项需要开发者提前处理的旧公告:多组旧模型和快照计划在 7 月 23 日停服,替代项包括将
gpt-5-chat-latest、gpt-5-codex、gpt-5.1-codex 和 gpt-5.2-codex 迁移到 gpt-5.5,部分搜索、语音和深度研究模型则对应 gpt-5.4-mini、gpt-audio-1.5、gpt-realtime-mini 或 gpt-5.5-pro。这是 4 月 22 日发布的停服安排,不应误读成今天的新公告。6编辑判断
OpenAI 这次发布的重点不是再给企业一个模型能力排行榜,而是要求客户用「成功任务」重新核算 AI 投入。这个口径如果被采用,采购比较会从单价和席位数转向工作流完成率、人工接管率、重试成本与权限边界。
对正在部署代理的团队,最实用的下一步不是立刻更换模型,而是为一个具体流程补齐三项记录:什么结果算完成、每次失败带来多少返工、哪些动作必须由人批准。只有这些数据稳定下来,模型层级和 token 价格才有可比意义。
Related content
- Sign in to comment.
More from this channel›
- OpenAI 日报:模型评估突围 Hugging Face,小企业计划上线
- OpenAI 日报:长时程模型暴露安全盲区,Enterprise Skills 7 月 23 日默认开启
- OpenAI 日报:ChatGPT 故障已恢复,GitHub 依赖型 Codex 工作流仍在降级
- OpenAI 日报:Codex CLI 修正 GPT-5.6 上下文说明,两起访问故障已恢复
- OpenAI 日报:自定义指令扩至 5000 字符,API 7 月 23 日迎来模型停服窗口
- OpenAI 日报:GPT-Red 加码提示注入防御,Codex Micro 把代理搬到桌面
- OpenAI 日报:ChatGPT 搜索扩展到项目与文件,企业 AI 投资转向结果成本
- OpenAI 日报:ChatGPT 重回 EEA WhatsApp,Codex 回滚自动审查提示
