
Claude Opus 5:官方 Benchmark 横向对比
Anthropic 官方 System Card 显示,Claude Opus 5 在代码、长任务、工具调用和计算机使用上明显超过 Opus 4.8,但在部分 benchmark 上仍落后于 Fable 5 或 Mythos 5;本文合并抄录全部可核验分数并保留未披露项。
Claude Opus 5 的官方 benchmark 画像很集中:它把 Opus 4.8 在代码、长上下文知识工作、工具调用和计算机使用上的成绩整体抬高了一档,但没有在所有项目上超过 Fable 5 或 Mythos 5。System Card 的总表里,Opus 5 在 SWE-bench Pro、GDPval-AA v2、AA-Briefcase、AutomationBench、ARC-AGI-3 和 OSWorld 2.0 等项目领先;在 SWE-bench Pro、HLE、HealthBench、Chartography 和部分生命科学项目上,仍能看到更大模型的优势。1
Claude Opus 5 于 2026 年 7 月 24 日发布,API 名称为
claude-opus-5,价格为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同。Anthropic 称它当天已在所有平台提供,是 Claude Max 的默认模型,也是 Claude Pro 上能力最强的模型;开发者可通过 Claude API 使用,也可选择约为默认速度 2.5 倍的 Fast mode,Fast mode 按基础价格的两倍计费。1下面的数值来自 Anthropic 发布页 与 Claude Opus 5 System Card。表内空白表示当前官方材料没有披露该模型在该项上的可比数字,不是 0,也不是推断出的落后。System Card 总表的默认设置是 adaptive thinking、max effort、默认采样参数,每项平均 5 次试验;不同 benchmark 的上下文窗口、工具、harness 和评测集仍可能不同。2
全量 Benchmark 对照表
同一 benchmark 在官方总表和细分章节出现不同数值时,保留两种结果并用 ⚠️ 标出。百分比按原文保留;Elo、平均轮次和 voxel IoU 不换算成百分比。每行最高值加粗;「越少越好」的指标按最低值加粗。
| Benchmark / 口径 | Claude Opus 5 | Claude Opus 4.8 | Claude Fable 5 | Claude Mythos 5 | Claude Sonnet 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 96.0% | |||||
| SWE-bench Pro | 79.2% | 69.2% | 80.0% | 64.6% | ||
| SWE-bench Multilingual | 89.5% | 84.4% | 86.6% | |||
| SWE-bench Multimodal | 59.4% | 38.4% | 54.1% | |||
| DeepSWE v1.1 | 68.8% | 59.0% | 69.7% | 72.7% | ||
| FrontierCode 1.1 Main | 53.4% | 46.5% | 53.5% | 47.5% | ||
| FrontierCode 1.1 Extended | 63.6% | 59.6% | 60.6% | |||
| FrontierBench v0.1(总表) | ⚠️ 43.3% | 18.7% | 33.7% | 37.5% | ||
| FrontierBench v0.1(细分章节,xhigh) | ⚠️ 44.4%;max effort 约 43.0% | 18.7% | 33.7% | 17.0% | 37.5% | |
| IMO 2026(42 分制) | 42/42,金牌线以上 | |||||
| ArxivMath(无工具) | 90.8% | 86.73% | ||||
| ArxivMath(有工具) | 91.3% | |||||
| ProgramBench(第 1 个 episode,hidden test pass rate) | 83% | 80% | 84% | |||
| ProgramBench(第 5 个 episode,hidden test pass rate) | 93% | 90% | 93% | |||
| Humanity's Last Exam(无工具) | 56.3% | 49.8% | 56.5% | |||
| Humanity's Last Exam(有工具) | 64.7% | 57.9% | 63.9% | |||
| BrowseComp(单 Agent) | 90.8% | 84.3% | 87.4% | 90.4% | ||
| BrowseComp(多 Agent,10-agent team) | 93.6%(预发布配置) | |||||
| DeepSearchQA | ||||||
| DRACO | ||||||
| OSWorld 2.0(first-attempt success rate) | 70.57%(总表四舍五入为 70.6%) | 55.7% | 66.1% | 62.6% | ||
| Chartography(无工具) | 29.6% | 17.0% | 36.0% | |||
| Chartography(有工具) | 83.0% | 75.0% | 85.2% | |||
| BenchCAD Vision2Code(无工具,voxel IoU) | 0.366 | 0.277 | 0.378 | |||
| BenchCAD Vision2Code(有工具,voxel IoU) | 0.821 | 0.521 | 0.678 | |||
| GDP.pdf(无工具,mean criteria pass rate) | 83.4% | 77.5% | 81.8% | |||
| GDP.pdf(有工具,mean criteria pass rate) | 85.5% | 84.8% | 87.3% | |||
| OfficeQA | 78.1% | 77.6% | 79.0% | |||
| OfficeQA Pro | 66.9% | 66.2% | 67.1% | |||
| MCP Atlas(pass rate) | 85.8% | 82.2% | ||||
| Legal Agent Benchmark(Full Public Set,全通过率) | 23.58% | |||||
| Legal Agent Benchmark(Full Public Set,mean criterion-pass) | 93.74% | |||||
| Legal Agent Benchmark(Harvey held-out,全通过率) | 11.7% | |||||
| Legal Agent Benchmark(Harvey held-out,mean criterion-pass) | 94.1% | |||||
| GDPval-AA v2(max effort,Elo) | 1861 | 1593 | 1747 | 1736 | ||
| GDPval-AA v2(xhigh effort,Elo) | 1827 | |||||
| AA-Briefcase(max effort,Elo) | 1720 | 1346 | 1574 | 1505 | ||
| AA-Briefcase(xhigh / high effort,Elo) | 1693 / 1606 | |||||
| Toolathlon Verified(Pass@1) | 80.6% | 79.9% | 79.3% | 74.7% | ||
| Toolathlon Verified(Pass@3) | 87.0% | 88.0% | 86.1% | 84.3% | ||
| Toolathlon Verified(Pass³) | 73.1% | 71.3% | 73.1% | 65.7% | ||
| Toolathlon Verified(平均轮次,越少越好) | 23.5 | 20.4 | 19.8 | 24.5 | ||
| AutomationBench / Zapier AutomationBench(max effort) | 26.0% | 17.0% | 17.4% | 18.1% | ||
| AutomationBench(medium effort,单任务成本) | 24.0%,$0.89 | |||||
| ARC-AGI-1(max effort) | 97.50% | 92.50% | 97.50% | |||
| ARC-AGI-2(max effort) | 90.42% | 72.10% | 92.50% | |||
| ARC-AGI-3(high effort,RHAE) | 30.16% | 1.52% | 7.78% | |||
| HealthBench(raw) | 67.1% | 58.8% | 62.5% | 59.2% | ||
| HealthBench(length-adjusted) | 57.8% | |||||
| HealthBench Professional(raw) | 73.4% | 60.3% | 70.3% | 62.4% | ||
| HealthBench Professional(length-adjusted) | 59.8% | |||||
| GMMLU | ||||||
| MILU | ||||||
| INCLUDE | ||||||
| BioMysteryBench(Human Solvable) | 90.1% | 88.5% | 89.0% | 87.5% | ||
| BioMysteryBench(Human Difficult) | 49.4% | 42.4% | 46.5% | 34.1% | ||
| LatchBio SpatialBench Verified | 72.5% | 66.6% | 69.2% | 67.8% | ||
| LatchBio SingleCellBench | 60.6% | 58.2% | 59.3% | 56.2% | ||
| ProteinGym Hard | 47.7% | 40.0% | 45.8% | 36.6% | ||
| Protein Design | 42.5% | 32.0% | 41.4% | 21.2% | ||
| Organic chemistry V2 | 61.6% | 50.4% | 58.9% | 40.6% | ||
| Protocols(Troubleshooting) | 61.1% | 59.6% | 66.7% | 62.3% | ||
| Protocols(Understanding) | 78.4% | 62.3% | 68.1% | 60.5% | ||
| CursorBench 3.2(max effort) | 接近 Fable 5 峰值,差距小于 0.5%;单任务成本约为其一半 | Fable 5 峰值参照 |
以上数值全部来自同一轮官方材料;发布页和 System Card 对一些项目采用了不同展示方式。FrontierBench 是最明显的例子:总表写 Opus 5 为 43.3%,细分章节写 xhigh 为 44.4%,并说明 max effort 约为 43%。这里没有替选一个看起来更整齐的数字。2
三个最有用的对比
代码能力抬升明显,但还不是每项第一
对 Opus 4.8,Opus 5 在 SWE-bench Pro 从 69.2% 提升到 79.2%,DeepSWE v1.1 从 59.0% 提升到 68.8%,FrontierCode Main 从 46.5% 提升到 53.4%。FrontierBench 的细分章节则从 18.7% 提升到 44.4%(xhigh),提升幅度约 25.7 个百分点。2
但 SWE-bench Pro 上 Fable 5 仍以 80.0% 略高于 Opus 5,DeepSWE v1.1 和 FrontierCode Main 上 GPT-5.6 Sol、Fable 5 也分别更高。把 Opus 5 概括成「所有代码 benchmark 都第一」并不符合这张表。
FrontierBench v0.1 比 Terminal-Bench 2.1 更难,包含计算生物学、物理模拟、CAD、形式化证明和 GPU 性能等任务。Opus 5 使用 mini-SWE-agent harness 与 GKE 后端,xhigh 下每个任务尝试 5 次,平均 reward 为 44.4%;低 effort 下平均 reward 为 25%,但平均输出 token 少 64%。这个项目更接近长链条工程工作,而不是单轮代码题。2
Agent 和计算机使用是本次发布的强项
GDPval-AA v2 的 max effort 得分是 1861 Elo,xhigh 为 1827;AA-Briefcase 的 max、xhigh、high 分别是 1720、1693、1606。两个项目都由 Artificial Analysis 独立运行,前者覆盖 44 个职业、9 个行业的 220 项专业工作,后者模拟多周项目和数千份输入文件。Opus 5 以 xhigh 运行时,GDPval-AA 比 max 少用 25% 输出 token,AA-Briefcase 的 xhigh / high 分别少用 15% / 33%。2
AutomationBench 的 max effort 通过率是 26.0%,Opus 4.8 为 17.0%,Fable 5 为 17.4%。在 medium effort 下,Opus 5 仍有 24% 通过率,单任务成本为 0.89 美元,官方称其以不到一半的成本超过 Opus 4.8 和 Fable 5。Zapier 的任务要求模型在 47 个应用、数十个 API 端点和多层业务规则中完成端到端工作,不能只看成函数调用准确率。2
OSWorld 2.0 的 first-attempt success rate 为 70.57%,Opus 4.8 为 55.7%,Fable 5 为 66.1%,GPT-5.6 Sol 为 62.6%。BenchCAD Vision2Code 也显示了工具的价值:Opus 5 无工具时 voxel IoU 为 0.366,有工具时升到 0.821;这不是把 adaptive thinking 换成更多思考 token,而是让模型能够裁剪、检查和验证视觉输入输出。2
生命科学全面领先,安全能力仍有边界
在生命科学评测中,Opus 5 在 BioMysteryBench、SpatialBench Verified、SingleCellBench、ProteinGym Hard、Protein Design、有机化学 V2 和 Protocols Understanding 上都是当前表中最高;Protocols Troubleshooting 则落后于 Mythos 5。Organic chemistry V2 的 61.6% 比 Opus 4.8 高 11.2 个百分点,ProteinGym Hard 的 47.7% 比 Opus 4.8 高 7.7 个百分点。2
网络安全不能沿用同样的结论。发布页称 Opus 5 在发现漏洞方面接近 Mythos 5,但在开发漏洞利用方面明显落后;发布页没有给出可直接抄录的横向百分比,因此这里不补一个看似精确的安全分数。System Card 还报告了安全分类器和 fallback 机制:FrontierBench 中 Opus 5 有约 5% 的 API calls 被分类器标记,影响约 4% 的试验,并回退到 Opus 4.8。12
读表时需要保留的口径
第一,表里有几种不同性质的分数。SWE-bench、AutomationBench 和 ARC-AGI-3 是通过率或效率分数;GDPval-AA、AA-Briefcase 是 Elo;Toolathlon 同时报告 Pass@1、Pass@3、Pass³ 和平均轮次;BenchCAD 使用 voxel IoU。不同列不能跨 benchmark 直接排序。
第二,工具和 effort 会改变结果。Chartography 从无工具的 29.6% 升到有工具的 83.0%,BenchCAD Vision2Code 从 0.366 升到 0.821,GDP.pdf 从 83.4% 升到 85.5%。这些数字说明「模型本体分数」和「带工具的 agent 系统分数」不是同一个问题。2
第三,部分横向比较不是同一套运行条件。OSWorld 2.0 里使用了不同模型的发布页数据;Chartography 的 Gemini 3.5 Flash 和 GPT-5.6 Sol 数值来自 Surge AI 的公开报告;多 Agent BrowseComp 与 ProgramBench 使用预发布配置,System Card 明确提示它们适合看相对关系,不应当当作生产绝对分数。2
最后,Opus 5 与 Opus 4.8 的基础 API 价格相同。若只看单项最高分,Fable 5 在 SWE-bench Pro、HLE 无工具、GDP.pdf 有工具和 Chartography 有工具等项目仍然领先;若看长任务、工具调用和成本曲线,Opus 5 的领先范围更宽。官方发布页还披露了金融、法律、Box 和 Lovable 的内部评测改进,但这些结果没有全部提供公开可复核的横向表格,因此不把它们混入上面的精确总表。1
Fuentes de referencia
Contenido relacionado
- Inicia sesión para comentar.
