Claude Opus 5 发布:把前沿智能压到每百万 token 5 美元,真正变化在自验证

Claude Opus 5 发布:把前沿智能压到每百万 token 5 美元,真正变化在自验证

Anthropic 发布 Claude Opus 5,固定 token 单价、长上下文和自验证能力同时升级,本文拆解其成本化 benchmark、Agent 工作流价值与 GPT-5.6、Gemini 3.6 Flash 的可比边界。

先给结论

Anthropic 在 7 月 24 日发布 Claude Opus 5。它的 API 单价是每百万输入 token 5 美元、每百万输出 token 25 美元,和 Opus 4.8 的 token 价格相同;但 Anthropic 声称,Opus 5 在多项需要长时间执行的任务上,用更低的单任务成本接近甚至超过 Fable 5。1
这次升级最值得看的地方不是又多了几个榜单第一,而是模型开始把「检查自己的工作」当成任务流程的一部分。它会主动写测试、构造验证器、回头检查根因,再继续迭代。对开发者和产品团队来说,这直接关系到一次任务究竟要花多少 token,能不能减少人工返工,以及模型是否适合被放进有真实副作用的 Agent 工作流。

发布信息与价格结构

项目Claude Opus 5
发布日期2026 年 7 月 24 日 1
API 模型 IDclaude-opus-5 2
输入价格5 美元 / 百万 token 2
输出价格25 美元 / 百万 token 2
上下文窗口1M token 2
额外计费能力Prompt caching 最高节省 90%,batch processing 节省 50% 2
单价本身并没有比 Opus 4.8 更低,变化发生在「完成一项任务要花多少钱」。在 CursorBench 3.2 的最高 effort 设置下,Anthropic 称 Opus 5 的分数距离 Fable 5 峰值不到 0.5%,但单任务成本只有一半;在 OSWorld 2.0 上,它也声称以略高于 Fable 5 最佳结果三分之一的成本超过了后者。这里的「一半」和「三分之一」都是特定 benchmark、特定 effort 与运行条件下的任务成本,不能直接理解为 API 标价打了折。1
按 token 标价计算,一次使用 10 万输入 token、生成 2 万输出 token 的调用约为 1 美元,尚未计入工具调用、失败重试、上下文缓存和平台差异。这个结构也说明了一个容易被忽略的事实:输出 token 单价是输入的 5 倍。模型越愿意反复检查,质量可能越高,但团队必须同时观察「每次成功任务的总 token」和「每次请求的平均 token」,不能只看单次回答价格。

自验证让 Agent 变得更像工作流

Anthropic 给出的案例并不是「模型回答得更流畅」,而是模型在没有直接观察条件时,自己补齐了验证环节。一项 Frontier-Bench 任务要求它根据机器零件图写出 FreeCAD 三维模型,但系统刻意不给模型直接查看图纸的能力。Opus 5 于是写了一套计算机视觉流程,从原始像素提取几何信息,再重建零件。另一个开源包管理器的真实漏洞案例中,它找到根因并修复社区补丁漏掉的边缘条件,而竞争模型只修掉表面症状就报告完成。1
还有一个更接近生产环境的例子:交易公司工程师让 Opus 5 为新交易所搭建行情数据流。因为没有可用的实时行情做校验,模型自己写了测试 harness,检查代码能否正确解析交易所数据。这个案例的价值不在于证明它永远不会出错,而在于它把「没有现成测试数据」当成工程问题处理了,而不是把无法验证的结果直接交出去。1
这也是 Opus 5 和普通代码补全工具的分界线:它尝试把任务拆成实现、验证、失败定位和再次实现的循环。部署时,团队应记录验证器是否真的覆盖了关键路径、重试是否引入新的副作用,以及模型为获得一次通过消耗了多少 token。自验证不是人工审批的替代品,尤其当 Agent 能修改代码、写入数据库或调用外部系统时,验证动作本身也必须处在权限和审计范围内。

榜单信号很强,但不能读成绝对排名

Anthropic 在发布页上给出的核心评测结论如下:
  • 在 Frontier-Bench 和 GDPval-AA 这类编码与知识工作评测上,Opus 5 被称为新的 state of the art;在 Frontier-Bench v0.1 上,官方称其表现超过其它模型,并且以更低单任务成本取得了 Opus 4.8 两倍以上的成绩。
  • 在 ARC-AGI 3 这种要求模型解决新问题的评测上,官方称 Opus 5 得分是次优模型的 3 倍。
  • 在 Zapier AutomationBench 上,官方称它以相同单任务成本取得约为次优模型 1.5 倍的通过率,即使使用最低 effort,也超过其它模型。
这些数字的共同点是:它们强调了「每项任务的成本」和「完成率」,而不只是单次回答准确率。这个方向更贴近 Agent 产品,但证据仍来自 Anthropic 自己的测试。发布页没有为每个结论都给出足以复现实验的完整 harness、提示词、工具权限和推理预算,读者不应把厂商的 SOTA 叙述直接当作跨模型总排名。1
OpenAI 的 GPT-5.6 官方表格提供了一个有用的参照:GPT-5.6 Sol 的 GDPval-AA v2 为 1,747.8 Elo,ARC-AGI-3 为 7.78%;但这两个数字和 Opus 5 发布页使用的 GDPval-AA、三倍次优模型的叙述,并不是同一张表或同一版本的完整对照。OpenAI 同一页面还列出 GPT-5.6 Sol 的输入和输出价格为 5 美元、30 美元。可以确定的是,Opus 5 的输入价格相同、输出价格低 5 美元;不能据此推出两者在真实 Agent 工作流中的单位经济一定由某一方全面胜出。3

与 GPT-5.6、Gemini 3.6 Flash 怎么选

维度Claude Opus 5GPT-5.6 SolGemini 3.6 Flash
官方公开单价输入 5 美元,输出 25 美元输入 5 美元,输出 30 美元 3当前模型页未列价格
上下文与输入1M token 2官方表格覆盖 512K 至 1M 的长上下文测试 3输入上限 1,048,576,输出上限 65,536 4
产品侧强项编码、知识工作、长任务、计算机使用和自动化任务的官方成本化评测 1代码、计算机使用、长上下文和工具评测覆盖较广 3支持代码执行、function calling、文件搜索、搜索 grounding 和 computer use Preview 4
这个表格更适合用来确定测试方向,而不是决定谁是「最强模型」。Opus 5 的公开叙事明显偏向长时间工作的完成率和成本;GPT-5.6 Sol 的官方材料给出了更完整的跨领域数字;Gemini 3.6 Flash 的模型页则更像一张工具接口清单,强调快速 Agent 循环和 Google 生态能力。三者公开材料的 benchmark 名称、版本、推理档位和工具条件都不完全相同,直接横排分数会制造一种不存在的精确性。

对开发团队的实际影响

第一,测试集要从「模型能不能写出一段代码」改成「模型能不能在约束下完成任务」。至少要保留失败重试次数、验证器结果、工具调用次数、人工接管点和最终 token 消耗。Opus 5 的自验证能力如果能减少返工,价值会体现在这些轨迹数据里,而不是只体现在一次性的 leaderboard 分数上。
第二,1M 上下文不等于应该把所有资料一次性塞进去。重复的系统说明、项目文档和工具 schema 应优先放进缓存,批处理任务可以利用官方给出的折扣;实时任务则要把上下文压缩和失败重试单独计价。对企业来说,真正需要审批的不是模型名,而是它能读写哪些数据、能执行哪些动作,以及验证失败后是否自动重试。
第三,Opus 5 的安全叙事仍需和执行权限分开看。模型更会自检,意味着它可能更愿意继续尝试,也可能在获得工具权限后执行更长的行动链。Anthropic 自己也明确写道,Opus 5 在网络安全任务上仍落后于 Mythos 5。对生产系统,最稳妥的落地方式是先让它在隔离环境里生成计划、测试和补丁,再由策略层决定哪些动作可以自动提交。1
Opus 5 的发布信号可以概括成一句话:前沿模型的竞争开始从「一次回答有多强」转向「完成一项复杂工作要花多少成本、能否自己发现错误」。这个判断值得关注,但最终能否兑现,要看独立复测和真实任务轨迹,而不是发布页上的最高分。

Related content

  • Sign in to comment.
More from this channel