
Claude Opus 5 发布:接近 Fable 5,价格不变,API 已可用,Copilot 渐进开放
Anthropic 发布 Claude Opus 5:官方称其在多项编码、知识工作和推理评测中达到新高,API 价格与 Opus 4.8 相同,Claude Max、Claude Pro、API 和 GitHub Copilot 均已提供或开始提供入口。
先看结论
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。它是 Opus 4.8 的直接升级,API 价格不变,却把目标性能推到接近 Claude Fable 5 的位置;Anthropic 在 Frontier-Bench v0.1、GDPval-AA 和 ARC-AGI 3 等评测中宣称取得新的最高结果。对需要长程编码、复杂知识工作和多工具协作的团队,Opus 5 值得立刻放进对照测试;对只看低价吞吐的任务,价格不变意味着是否迁移仍要看每个任务的完成成本。1
Opus 5 已可通过 Claude API 使用,也是 Claude Max 的默认模型和 Claude Pro 当前最强模型。GitHub Copilot 同日宣布逐步开放,覆盖 Copilot Pro+、Max、Business 和 Enterprise 用户,但 Business 与 Enterprise 需要管理员打开策略开关。1 2
发布信息与价格
| 项目 | Claude Opus 5 |
|---|---|
| 发布方与时间 | Anthropic,2026 年 7 月 24 日;GitHub Copilot 可用性记录的发布时间折算为 7 月 25 日 00:40(频道时区) |
| 模型定位 | Opus 旗舰,面向长程 Agent、软件工程、知识工作和科学研究 |
| 参数规模 | 官方发布公告未披露;本文不补传闻参数 |
| 上下文窗口 | 本轮核验的官方发布材料未列出,待模型文档进一步确认 |
| API 模型 ID | claude-opus-5 |
| API 价格 | 输入 $5、输出 $25,每 100 万 token;与 Opus 4.8 相同 |
| Fast mode | 约为默认速度的 2.5 倍,Claude Platform 价格为基础价格的 2 倍 |
| 公开入口 | Claude API、Claude.ai、Claude Code、Claude Cowork;GitHub Copilot 逐步开放 |
Anthropic 还表示,Opus 5 的通用访问不要求数据保留。GitHub Copilot 按供应商 API 标价采用用量计费,具体请求消耗要以 Copilot 的模型定价页和账户界面为准。1 2
评测信号:强项集中在长程任务
下面的数字和排名均来自 Anthropic 发布页,属于厂商披露结果,不是独立复测。它们适合决定第一轮测试哪些任务,不适合直接替代团队自己的任务集。
| 评测 | Anthropic 对 Opus 5 的披露 | 对选型的含义 |
|---|---|---|
| Frontier-Bench v0.1 | 超过所有其他模型,性能超过 Opus 4.8 的两倍,同时单任务成本更低 | 重点观察复杂编码、调试和需要持续验证的 Agent 任务 |
| CursorBench 3.2 | 最大 effort 下距离 Fable 5 峰值分数不到 0.5%,单任务成本约为后者一半 | 适合测试代码库级修改、反复运行和最终检查 |
| GDPval-AA | Anthropic 宣称取得新的 state-of-the-art 结果 | 适合纳入知识工作和专业任务的第一轮对照集 |
| ARC-AGI 3 | 分数约为下一名模型的 3 倍 | 说明其在新问题和陌生任务上的推理能力是发布重点 |
| Zapier AutomationBench | 相同单任务成本下通过率约为下一名模型的 1.5 倍;最低 effort 设置也超过其他模型 | 适合测量从理解需求到完成业务动作的完整链路 |
| OSWorld 2.0 | 在相同成本档位都超过其他模型,超过 Fable 5 最好结果时的成本略高于其三分之一 | 适合把浏览器和计算机操作加入对照集 |
Frontier-Bench v0.1 的说明是 Anthropic 内部运行,使用 mini-SWE-agent harness 和 GKE 后端,每个任务取 5 次尝试的平均奖励;Opus 5 和 Fable 5 遇到安全分类器拒绝时使用 Opus 4.8 回退。这个口径会影响横向比较,评测时应把拒答、回退和重复尝试单独记账。1
能力变化:会检查,也会继续做
Anthropic 对 Opus 5 的重点描述不是单轮回答更长,而是模型更愿意验证结果、发现问题后继续迭代。发布页给出的案例包括:在看不到机器零件图像的条件下,模型自行写计算机视觉管线,从原始像素重建 FreeCAD 模型;面对开源包管理器的真实 bug,模型修复了社区补丁遗漏的边界问题;在没有可用实时数据流做校验时,模型自己搭建测试工具,完成交易所行情接入。上述案例来自 Anthropic 的早期测试与客户反馈,不能当作所有任务都能复现的保证。1
科学研究也是本次升级的重点。Anthropic 称,Opus 5 在结构生物学、有机化学和生物信息学的内部评测中均超过 Opus 4.8;在从光谱数据推断分子结构的任务上高 10.2 个百分点,在判断蛋白质序列变化如何影响功能的任务上高 7.7 个百分点。这些仍是 Anthropic 内部评测,不能直接等同于真实科研流程中的准确率。1
安全边界:漏洞发现可以做,攻击链不开放
Anthropic 表示,Opus 5 没有推进高风险双用途能力的前沿,在生物研究和进攻性网络安全上仍落后于 Mythos 5。它在发现代码漏洞方面接近 Mythos 5,但把漏洞转成可执行 exploit 的能力明显落后。1
具体限制也更清楚:安全分类器允许对源代码做漏洞发现,但会拦截基于二进制的漏洞扫描、渗透测试和 exploit 生成。Claude.ai、Claude Code 与 Claude Cowork 中被拦截的请求默认回退到 Opus 4.8,API 也可以启用回退。GitHub Copilot 的 Changelog 同样提醒,涉及高危网络安全内容的请求可能被拦截。做安全评测时,应把「找问题」和「利用问题」拆成两组授权任务,不要用一次通过来代表完整攻击能力。1 2
现在怎么测
- 先和 Opus 4.8 做同任务对照。 记录一次完成率、工具调用次数、输出 token、重试次数、端到端延迟和最终成本。Opus 5 单价没有下降,只有在少走工具循环或减少人工返工时,迁移才会体现为真实节省。
- 分 effort 设置测成本曲线。 至少比较默认设置和高 effort,单独记录推理 token 与任务完成质量。若需要更低延迟,再把 Fast mode 作为独立档位测试,不要把它和基础价格混在一起。
- 把代码库级任务放进第一批。 选择真实的 bug 修复、跨文件重构、测试补齐和浏览器验证任务,检查模型是否会主动运行测试、识别回归并修正,而不是只看第一版补丁能否生成。
- Copilot 用户先确认入口。 Pro+、Max、Business 和 Enterprise 都在开放范围内,但 rollout 是渐进的;Business 与 Enterprise 还需要管理员开启 Opus 5 策略。看不到模型时,先检查账户和组织策略,不要把暂时不可见理解成模型未上线。
- 安全团队保留人工授权和回退记录。 对漏洞研究使用明确的测试范围,记录被分类器拦截的请求与自动回退模型;涉及渗透测试或 exploit 生成的任务不要绕过限制。
官方入口:
Related content
- Sign in to comment.
