Claude Opus 5:官方 Benchmark 横向对比

Claude Opus 5:官方 Benchmark 横向对比

Anthropic 官方 System Card 显示,Claude Opus 5 在代码、长任务、工具调用和计算机使用上明显超过 Opus 4.8,但在部分 benchmark 上仍落后于 Fable 5 或 Mythos 5;本文合并抄录全部可核验分数并保留未披露项。

Claude Opus 5 的官方 benchmark 画像很集中:它把 Opus 4.8 在代码、长上下文知识工作、工具调用和计算机使用上的成绩整体抬高了一档,但没有在所有项目上超过 Fable 5 或 Mythos 5。System Card 的总表里,Opus 5 在 SWE-bench Pro、GDPval-AA v2、AA-Briefcase、AutomationBench、ARC-AGI-3 和 OSWorld 2.0 等项目领先;在 SWE-bench Pro、HLE、HealthBench、Chartography 和部分生命科学项目上,仍能看到更大模型的优势。1
Claude Opus 5 于 2026 年 7 月 24 日发布,API 名称为 claude-opus-5,价格为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同。Anthropic 称它当天已在所有平台提供,是 Claude Max 的默认模型,也是 Claude Pro 上能力最强的模型;开发者可通过 Claude API 使用,也可选择约为默认速度 2.5 倍的 Fast mode,Fast mode 按基础价格的两倍计费。1
下面的数值来自 Anthropic 发布页Claude Opus 5 System Card。表内空白表示当前官方材料没有披露该模型在该项上的可比数字,不是 0,也不是推断出的落后。System Card 总表的默认设置是 adaptive thinking、max effort、默认采样参数,每项平均 5 次试验;不同 benchmark 的上下文窗口、工具、harness 和评测集仍可能不同。2

全量 Benchmark 对照表

同一 benchmark 在官方总表和细分章节出现不同数值时,保留两种结果并用 ⚠️ 标出。百分比按原文保留;Elo、平均轮次和 voxel IoU 不换算成百分比。每行最高值加粗;「越少越好」的指标按最低值加粗。
Benchmark / 口径Claude Opus 5Claude Opus 4.8Claude Fable 5Claude Mythos 5Claude Sonnet 5GPT-5.6 Sol
SWE-bench Verified96.0%
SWE-bench Pro79.2%69.2%80.0%64.6%
SWE-bench Multilingual89.5%84.4%86.6%
SWE-bench Multimodal59.4%38.4%54.1%
DeepSWE v1.168.8%59.0%69.7%72.7%
FrontierCode 1.1 Main53.4%46.5%53.5%47.5%
FrontierCode 1.1 Extended63.6%59.6%60.6%
FrontierBench v0.1(总表)⚠️ 43.3%18.7%33.7%37.5%
FrontierBench v0.1(细分章节,xhigh)⚠️ 44.4%;max effort 约 43.0%18.7%33.7%17.0%37.5%
IMO 2026(42 分制)42/42,金牌线以上
ArxivMath(无工具)90.8%86.73%
ArxivMath(有工具)91.3%
ProgramBench(第 1 个 episode,hidden test pass rate)83%80%84%
ProgramBench(第 5 个 episode,hidden test pass rate)93%90%93%
Humanity's Last Exam(无工具)56.3%49.8%56.5%
Humanity's Last Exam(有工具)64.7%57.9%63.9%
BrowseComp(单 Agent)90.8%84.3%87.4%90.4%
BrowseComp(多 Agent,10-agent team)93.6%(预发布配置)
DeepSearchQA
DRACO
OSWorld 2.0(first-attempt success rate)70.57%(总表四舍五入为 70.6%)55.7%66.1%62.6%
Chartography(无工具)29.6%17.0%36.0%
Chartography(有工具)83.0%75.0%85.2%
BenchCAD Vision2Code(无工具,voxel IoU)0.3660.2770.378
BenchCAD Vision2Code(有工具,voxel IoU)0.8210.5210.678
GDP.pdf(无工具,mean criteria pass rate)83.4%77.5%81.8%
GDP.pdf(有工具,mean criteria pass rate)85.5%84.8%87.3%
OfficeQA78.1%77.6%79.0%
OfficeQA Pro66.9%66.2%67.1%
MCP Atlas(pass rate)85.8%82.2%
Legal Agent Benchmark(Full Public Set,全通过率)23.58%
Legal Agent Benchmark(Full Public Set,mean criterion-pass)93.74%
Legal Agent Benchmark(Harvey held-out,全通过率)11.7%
Legal Agent Benchmark(Harvey held-out,mean criterion-pass)94.1%
GDPval-AA v2(max effort,Elo)1861159317471736
GDPval-AA v2(xhigh effort,Elo)1827
AA-Briefcase(max effort,Elo)1720134615741505
AA-Briefcase(xhigh / high effort,Elo)1693 / 1606
Toolathlon Verified(Pass@1)80.6%79.9%79.3%74.7%
Toolathlon Verified(Pass@3)87.0%88.0%86.1%84.3%
Toolathlon Verified(Pass³)73.1%71.3%73.1%65.7%
Toolathlon Verified(平均轮次,越少越好)23.520.419.824.5
AutomationBench / Zapier AutomationBench(max effort)26.0%17.0%17.4%18.1%
AutomationBench(medium effort,单任务成本)24.0%,$0.89
ARC-AGI-1(max effort)97.50%92.50%97.50%
ARC-AGI-2(max effort)90.42%72.10%92.50%
ARC-AGI-3(high effort,RHAE)30.16%1.52%7.78%
HealthBench(raw)67.1%58.8%62.5%59.2%
HealthBench(length-adjusted)57.8%
HealthBench Professional(raw)73.4%60.3%70.3%62.4%
HealthBench Professional(length-adjusted)59.8%
GMMLU
MILU
INCLUDE
BioMysteryBench(Human Solvable)90.1%88.5%89.0%87.5%
BioMysteryBench(Human Difficult)49.4%42.4%46.5%34.1%
LatchBio SpatialBench Verified72.5%66.6%69.2%67.8%
LatchBio SingleCellBench60.6%58.2%59.3%56.2%
ProteinGym Hard47.7%40.0%45.8%36.6%
Protein Design42.5%32.0%41.4%21.2%
Organic chemistry V261.6%50.4%58.9%40.6%
Protocols(Troubleshooting)61.1%59.6%66.7%62.3%
Protocols(Understanding)78.4%62.3%68.1%60.5%
CursorBench 3.2(max effort)接近 Fable 5 峰值,差距小于 0.5%;单任务成本约为其一半Fable 5 峰值参照
以上数值全部来自同一轮官方材料;发布页和 System Card 对一些项目采用了不同展示方式。FrontierBench 是最明显的例子:总表写 Opus 5 为 43.3%,细分章节写 xhigh 为 44.4%,并说明 max effort 约为 43%。这里没有替选一个看起来更整齐的数字。2

三个最有用的对比

代码能力抬升明显,但还不是每项第一

对 Opus 4.8,Opus 5 在 SWE-bench Pro 从 69.2% 提升到 79.2%,DeepSWE v1.1 从 59.0% 提升到 68.8%,FrontierCode Main 从 46.5% 提升到 53.4%。FrontierBench 的细分章节则从 18.7% 提升到 44.4%(xhigh),提升幅度约 25.7 个百分点。2
但 SWE-bench Pro 上 Fable 5 仍以 80.0% 略高于 Opus 5,DeepSWE v1.1 和 FrontierCode Main 上 GPT-5.6 Sol、Fable 5 也分别更高。把 Opus 5 概括成「所有代码 benchmark 都第一」并不符合这张表。
FrontierBench v0.1 比 Terminal-Bench 2.1 更难,包含计算生物学、物理模拟、CAD、形式化证明和 GPU 性能等任务。Opus 5 使用 mini-SWE-agent harness 与 GKE 后端,xhigh 下每个任务尝试 5 次,平均 reward 为 44.4%;低 effort 下平均 reward 为 25%,但平均输出 token 少 64%。这个项目更接近长链条工程工作,而不是单轮代码题。2

Agent 和计算机使用是本次发布的强项

GDPval-AA v2 的 max effort 得分是 1861 Elo,xhigh 为 1827;AA-Briefcase 的 max、xhigh、high 分别是 1720、1693、1606。两个项目都由 Artificial Analysis 独立运行,前者覆盖 44 个职业、9 个行业的 220 项专业工作,后者模拟多周项目和数千份输入文件。Opus 5 以 xhigh 运行时,GDPval-AA 比 max 少用 25% 输出 token,AA-Briefcase 的 xhigh / high 分别少用 15% / 33%。2
AutomationBench 的 max effort 通过率是 26.0%,Opus 4.8 为 17.0%,Fable 5 为 17.4%。在 medium effort 下,Opus 5 仍有 24% 通过率,单任务成本为 0.89 美元,官方称其以不到一半的成本超过 Opus 4.8 和 Fable 5。Zapier 的任务要求模型在 47 个应用、数十个 API 端点和多层业务规则中完成端到端工作,不能只看成函数调用准确率。2
OSWorld 2.0 的 first-attempt success rate 为 70.57%,Opus 4.8 为 55.7%,Fable 5 为 66.1%,GPT-5.6 Sol 为 62.6%。BenchCAD Vision2Code 也显示了工具的价值:Opus 5 无工具时 voxel IoU 为 0.366,有工具时升到 0.821;这不是把 adaptive thinking 换成更多思考 token,而是让模型能够裁剪、检查和验证视觉输入输出。2

生命科学全面领先,安全能力仍有边界

在生命科学评测中,Opus 5 在 BioMysteryBench、SpatialBench Verified、SingleCellBench、ProteinGym Hard、Protein Design、有机化学 V2 和 Protocols Understanding 上都是当前表中最高;Protocols Troubleshooting 则落后于 Mythos 5。Organic chemistry V2 的 61.6% 比 Opus 4.8 高 11.2 个百分点,ProteinGym Hard 的 47.7% 比 Opus 4.8 高 7.7 个百分点。2
网络安全不能沿用同样的结论。发布页称 Opus 5 在发现漏洞方面接近 Mythos 5,但在开发漏洞利用方面明显落后;发布页没有给出可直接抄录的横向百分比,因此这里不补一个看似精确的安全分数。System Card 还报告了安全分类器和 fallback 机制:FrontierBench 中 Opus 5 有约 5% 的 API calls 被分类器标记,影响约 4% 的试验,并回退到 Opus 4.8。12

读表时需要保留的口径

第一,表里有几种不同性质的分数。SWE-bench、AutomationBench 和 ARC-AGI-3 是通过率或效率分数;GDPval-AA、AA-Briefcase 是 Elo;Toolathlon 同时报告 Pass@1、Pass@3、Pass³ 和平均轮次;BenchCAD 使用 voxel IoU。不同列不能跨 benchmark 直接排序。
第二,工具和 effort 会改变结果。Chartography 从无工具的 29.6% 升到有工具的 83.0%,BenchCAD Vision2Code 从 0.366 升到 0.821,GDP.pdf 从 83.4% 升到 85.5%。这些数字说明「模型本体分数」和「带工具的 agent 系统分数」不是同一个问题。2
第三,部分横向比较不是同一套运行条件。OSWorld 2.0 里使用了不同模型的发布页数据;Chartography 的 Gemini 3.5 Flash 和 GPT-5.6 Sol 数值来自 Surge AI 的公开报告;多 Agent BrowseComp 与 ProgramBench 使用预发布配置,System Card 明确提示它们适合看相对关系,不应当当作生产绝对分数。2
最后,Opus 5 与 Opus 4.8 的基础 API 价格相同。若只看单项最高分,Fable 5 在 SWE-bench Pro、HLE 无工具、GDP.pdf 有工具和 Chartography 有工具等项目仍然领先;若看长任务、工具调用和成本曲线,Opus 5 的领先范围更宽。官方发布页还披露了金融、法律、Box 和 Lovable 的内部评测改进,但这些结果没有全部提供公开可复核的横向表格,因此不把它们混入上面的精确总表。1

Related content

  • Sign in to comment.
More from this channel