Claude Opus 5 发布:接近 Fable 5,价格不变,API 已可用,Copilot 渐进开放

Claude Opus 5 发布:接近 Fable 5,价格不变,API 已可用,Copilot 渐进开放

Anthropic 发布 Claude Opus 5:官方称其在多项编码、知识工作和推理评测中达到新高,API 价格与 Opus 4.8 相同,Claude Max、Claude Pro、API 和 GitHub Copilot 均已提供或开始提供入口。

先看结论

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。它是 Opus 4.8 的直接升级,API 价格不变,却把目标性能推到接近 Claude Fable 5 的位置;Anthropic 在 Frontier-Bench v0.1、GDPval-AA 和 ARC-AGI 3 等评测中宣称取得新的最高结果。对需要长程编码、复杂知识工作和多工具协作的团队,Opus 5 值得立刻放进对照测试;对只看低价吞吐的任务,价格不变意味着是否迁移仍要看每个任务的完成成本。1
Opus 5 已可通过 Claude API 使用,也是 Claude Max 的默认模型和 Claude Pro 当前最强模型。GitHub Copilot 同日宣布逐步开放,覆盖 Copilot Pro+、Max、Business 和 Enterprise 用户,但 Business 与 Enterprise 需要管理员打开策略开关。1 2

发布信息与价格

项目Claude Opus 5
发布方与时间Anthropic,2026 年 7 月 24 日;GitHub Copilot 可用性记录的发布时间折算为 7 月 25 日 00:40(频道时区)
模型定位Opus 旗舰,面向长程 Agent、软件工程、知识工作和科学研究
参数规模官方发布公告未披露;本文不补传闻参数
上下文窗口本轮核验的官方发布材料未列出,待模型文档进一步确认
API 模型 IDclaude-opus-5
API 价格输入 $5、输出 $25,每 100 万 token;与 Opus 4.8 相同
Fast mode约为默认速度的 2.5 倍,Claude Platform 价格为基础价格的 2 倍
公开入口Claude API、Claude.ai、Claude Code、Claude Cowork;GitHub Copilot 逐步开放
Anthropic 还表示,Opus 5 的通用访问不要求数据保留。GitHub Copilot 按供应商 API 标价采用用量计费,具体请求消耗要以 Copilot 的模型定价页和账户界面为准。1 2

评测信号:强项集中在长程任务

下面的数字和排名均来自 Anthropic 发布页,属于厂商披露结果,不是独立复测。它们适合决定第一轮测试哪些任务,不适合直接替代团队自己的任务集。
评测Anthropic 对 Opus 5 的披露对选型的含义
Frontier-Bench v0.1超过所有其他模型,性能超过 Opus 4.8 的两倍,同时单任务成本更低重点观察复杂编码、调试和需要持续验证的 Agent 任务
CursorBench 3.2最大 effort 下距离 Fable 5 峰值分数不到 0.5%,单任务成本约为后者一半适合测试代码库级修改、反复运行和最终检查
GDPval-AAAnthropic 宣称取得新的 state-of-the-art 结果适合纳入知识工作和专业任务的第一轮对照集
ARC-AGI 3分数约为下一名模型的 3 倍说明其在新问题和陌生任务上的推理能力是发布重点
Zapier AutomationBench相同单任务成本下通过率约为下一名模型的 1.5 倍;最低 effort 设置也超过其他模型适合测量从理解需求到完成业务动作的完整链路
OSWorld 2.0在相同成本档位都超过其他模型,超过 Fable 5 最好结果时的成本略高于其三分之一适合把浏览器和计算机操作加入对照集
Frontier-Bench v0.1 的说明是 Anthropic 内部运行,使用 mini-SWE-agent harness 和 GKE 后端,每个任务取 5 次尝试的平均奖励;Opus 5 和 Fable 5 遇到安全分类器拒绝时使用 Opus 4.8 回退。这个口径会影响横向比较,评测时应把拒答、回退和重复尝试单独记账。1

能力变化:会检查,也会继续做

Anthropic 对 Opus 5 的重点描述不是单轮回答更长,而是模型更愿意验证结果、发现问题后继续迭代。发布页给出的案例包括:在看不到机器零件图像的条件下,模型自行写计算机视觉管线,从原始像素重建 FreeCAD 模型;面对开源包管理器的真实 bug,模型修复了社区补丁遗漏的边界问题;在没有可用实时数据流做校验时,模型自己搭建测试工具,完成交易所行情接入。上述案例来自 Anthropic 的早期测试与客户反馈,不能当作所有任务都能复现的保证。1
科学研究也是本次升级的重点。Anthropic 称,Opus 5 在结构生物学、有机化学和生物信息学的内部评测中均超过 Opus 4.8;在从光谱数据推断分子结构的任务上高 10.2 个百分点,在判断蛋白质序列变化如何影响功能的任务上高 7.7 个百分点。这些仍是 Anthropic 内部评测,不能直接等同于真实科研流程中的准确率。1

安全边界:漏洞发现可以做,攻击链不开放

Anthropic 表示,Opus 5 没有推进高风险双用途能力的前沿,在生物研究和进攻性网络安全上仍落后于 Mythos 5。它在发现代码漏洞方面接近 Mythos 5,但把漏洞转成可执行 exploit 的能力明显落后。1
具体限制也更清楚:安全分类器允许对源代码做漏洞发现,但会拦截基于二进制的漏洞扫描、渗透测试和 exploit 生成。Claude.ai、Claude Code 与 Claude Cowork 中被拦截的请求默认回退到 Opus 4.8,API 也可以启用回退。GitHub Copilot 的 Changelog 同样提醒,涉及高危网络安全内容的请求可能被拦截。做安全评测时,应把「找问题」和「利用问题」拆成两组授权任务,不要用一次通过来代表完整攻击能力。1 2

现在怎么测

  1. 先和 Opus 4.8 做同任务对照。 记录一次完成率、工具调用次数、输出 token、重试次数、端到端延迟和最终成本。Opus 5 单价没有下降,只有在少走工具循环或减少人工返工时,迁移才会体现为真实节省。
  2. 分 effort 设置测成本曲线。 至少比较默认设置和高 effort,单独记录推理 token 与任务完成质量。若需要更低延迟,再把 Fast mode 作为独立档位测试,不要把它和基础价格混在一起。
  3. 把代码库级任务放进第一批。 选择真实的 bug 修复、跨文件重构、测试补齐和浏览器验证任务,检查模型是否会主动运行测试、识别回归并修正,而不是只看第一版补丁能否生成。
  4. Copilot 用户先确认入口。 Pro+、Max、Business 和 Enterprise 都在开放范围内,但 rollout 是渐进的;Business 与 Enterprise 还需要管理员开启 Opus 5 策略。看不到模型时,先检查账户和组织策略,不要把暂时不可见理解成模型未上线。
  5. 安全团队保留人工授权和回退记录。 对漏洞研究使用明确的测试范围,记录被分类器拦截的请求与自动回退模型;涉及渗透测试或 exploit 生成的任务不要绕过限制。
官方入口:

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel