Claude Opus 5:接近 Fable 5 的能力,成本曲线才是重点

Claude Opus 5:接近 Fable 5 的能力,成本曲线才是重点

Anthropic 的 Claude Opus 5 以与 Opus 4.8 相同的 token 单价,换来接近 Fable 5 的编码与 Agent 能力;真正需要核对的是 benchmark 口径、effort 成本和安全回退。

Claude Opus 5 于 2026 年 7 月 24 日发布。Anthropic 给它的定位很明确:接近 Claude Fable 5 的前沿能力,但把运行成本压到更低。API 标价其实与上一代 Opus 4.8 相同,为每百万 token 输入 5 美元、输出 25 美元;这里的「半价」主要对应与 Fable 5 的任务成本比较,而不是把 Opus 5 的 token 单价直接砍半。1
这次发布真正值得看的,不是一个单独的榜单第一,而是同一模型可以用 effort 档位调节推理深度、输出 token 和任务成本。Anthropic 的 benchmark 结果显示,Opus 5 在编码、长程知识工作和电脑操作上把能力与成本放在了同一张图里。

四项评测,指向同一个变化

评测Opus 5 的结果读法
FrontierBench v0.1System Card 总表为 43.3;另一套 mini-SWE-agent / GKE 运行中,xhigh effort 的平均 reward 为 44.4%终端环境里的科学与工程任务明显强于 Opus 4.8,但具体数字取决于 harness
CursorBench 3.2max effort 下距离 Fable 5 的 peak score 仅 0.5%,单任务成本约为一半编码峰值接近 Fable 5,成本差距更直观
ARC-AGI-3高 effort 下经 ARC Prize Foundation 验证的 RHAE 得分为 30.16%在没有规则和目标提示的交互游戏里,探索与迁移能力有明显提升
OSWorld 2.0首次尝试成功率 70.57%,五次运行取平均真实 Ubuntu 虚拟机上的电脑操作达到当前 System Card 的最高成绩
FrontierBench v0.1 是 Terminal-Bench 2.1 的后续版本,包含 74 个更难的终端任务,覆盖计算生物学、物理模拟、CAD、形式化证明和 GPU 性能等工作。System Card 的比较表中,Opus 5 为 43.3,Opus 4.8 为 21.1,Fable 5 为 33.8,GPT-5.6 Sol 为 34.4。另一段采用 mini-SWE-agent 和 GKE 的独立运行给出了 44.4% 的 xhigh 结果,同时注明 max effort 约为 43%。两组数字不能简单平均,但共同说明了一个事实:Opus 5 的优势很大程度上出现在需要连续使用终端、执行代码并修正结果的任务里。2
CursorBench 3.2 的结果更接近开发者的实际选择。max effort 下,Opus 5 距离 Fable 5 的峰值成绩只有 0.5%,单任务成本却约为一半;在 high、xhigh 和 max 三个 effort 档位上,给定成本下的表现也超过其他模型。这个比较没有公布一个可以脱离 effort 和任务设置单独理解的「通用分数」,所以更准确的说法是:在这套编码任务里,Opus 5 把接近峰值的能力放进了更低的预算。1
ARC-AGI-3 测的不是常见的题库问答。模型进入没有说明书、规则或明确目标的回合制游戏,需要自己探索环境,推断怎样才算获胜,再把学到的规律带到更难的关卡。Opus 5 在高 effort 下拿到 30.16% 的 Relative Human Action Efficiency,GPT-5.6 Sol 在 max effort 下为 7.78%,Opus 4.8 在 high effort 下为 1.52%。发布时 Opus 5 的 max effort 结果尚未公布,因此不能把 30.16% 说成它在所有推理预算下的最终上限。2
OSWorld 2.0 则把模型放进一台实时 Ubuntu 虚拟机,让它用鼠标和键盘完成电脑任务。System Card 记录的 70.57% 是首次尝试成功率,分辨率为 1080p,每项任务最多 500 个动作,结果取五次运行平均;需要模型评分的任务使用 Opus 4.8 作为 grader。这个设置比单轮代码题更接近真实 Agent,但也意味着分数仍然受到动作预算、评分器和任务集合的共同影响。2

effort 档位是成本控制器,不是装饰选项

Anthropic 在 FrontierBench 的运行中报告了一个有用的成本梯度:high effort 的平均 reward 为 39%,平均输出 token 比更高档位少 19%;low effort 的平均 reward 为 25%,平均输出 token 少 64%。xhigh 的平均 reward 为 44.4%,max 则约为 43%。这意味着任务不一定应该默认开到最大推理预算,稳定、可验证的工程任务可能更适合 high 或 xhigh;只有失败代价高、需要更长搜索链的任务,才有理由把预算继续往上推。2
Fast mode 的速度约为默认模式的 2.5 倍,但在 Claude Platform 上按基础价格的两倍计费。对交互式编码和需要快速返回的工作流,这个选项改变的是等待时间;对离线批处理,它未必比提高并发或使用较低 effort 更划算。1

安全边界变宽了,但没有消失

Opus 5 的网络安全分类器比 Fable 5 少介入约 85%,允许它在源代码中寻找漏洞,但仍阻止基于二进制的漏洞扫描、渗透测试和漏洞利用代码生成。加入 Cyber Verification Program 的企业和研究者可以获得限制更少的版本。被分类器标记的请求,在 Claude.ai、Claude Code 和 Claude Cowork 中默认回退到 Opus 4.8,API 也可以启用回退。1
System Card 给了一个更具体的对照:在 FrontierBench 运行里,Opus 5 的安全分类器标记了 5% 的 API 调用,涉及 4% 的试验,并回退到 Opus 4.8;Fable 5 分别是 42% 和 26%。这能解释为什么 Opus 5 在终端任务中显得更顺手,但不能把「少拦截」理解成「没有安全限制」。2
生物方向的边界也很清楚。Anthropic 称 Opus 5 是目前一般可用模型中更强的科学研究模型,但它在长时间、全自主的研究任务上仍有重要限制,Mythos 5 在这类生物工作上更强;发布方同时判断,Opus 5 没有把高风险双用途能力推到新的前沿。1

应该怎样读这次升级

如果你的任务是写代码、调用工具、在电脑界面里完成一串动作,Opus 5 的价值不只是榜单分数,而是能用 effort 和成本去换取不同的成功率。部署时应把「每任务成本、首次尝试成功率、重试次数、人工接管率」放在一起测,不能只拿 CursorBench 或 OSWorld 的峰值做采购结论。
也不能把「接近 Fable 5」理解成全面等价。System Card 的总表里,Opus 5 在 FrontierCode Main 上为 53.4,Fable 5 为 53.5;在 FrontierBench 上则是 43.3 对 33.8;HealthBench Professional 上又是 59.8 对 66.0。不同任务对模型能力、工具、评测器和安全分类器的要求不同,所谓前沿水平必须绑定到具体工作负载。2
最后还要留意评测条件:System Card 的多数结果采用最终模型快照、默认采样设置、5 次试验平均,并包含安全防护;上下文窗口依评测而定,不超过 100 万 token。ARC-AGI-3 的 30.16% 是高 effort 结果,OSWorld 2.0 的 70.57% 是首次尝试成功率,FrontierBench 的 43.3 和 44.4 又来自不同运行设置。把这些条件保留下来,才知道 Opus 5 到底适合哪一类 Agent,而不是只记住一句「半价接近 Fable 5」。2

Related content

  • Sign in to comment.
More from this channel