
Claude Opus 5 发布:接近 Fable 5 的长任务能力,价格减半
Anthropic 发布 Claude Opus 5:1M 上下文、128k 输出、$5/$25 每百万 token,重点强化长程编码代理和复杂企业工作,本文梳理它与 Fable 5、Opus 4.8、Sonnet 5 的取舍及迁移风险。
一句话判断
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,API 模型 ID 是
claude-opus-5。它的标准价格仍是每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同;Anthropic 将它定位为接近 Claude Fable 5 前沿智能、但价格只有一半的 Opus 系列新旗舰。1对已经使用 Opus 4.8 的团队,Opus 5 值得直接做灰度评测;对需要长时间运行的编码代理、复杂企业工作和多步工具调用的团队,它比单轮问答更有吸引力。若任务主要受吞吐量和预算约束,Sonnet 5 仍然是更便宜的候选;若目标是广泛可用模型里的最高能力,Fable 5 仍在它上面。
规格、价格和可用性
| 项目 | Claude Opus 5 |
|---|---|
| Claude API ID | claude-opus-5 |
| 上下文窗口 | 1M token,且这是默认值和上限 |
| 同步 Messages API 最大输出 | 128k token |
| 标准价格 | 输入 $5 / MTok,输出 $25 / MTok;MTok 指百万 token |
| 批处理价格 | 输入 $2.50 / MTok,输出 $12.50 / MTok,Batch API 提供 50% 折扣 |
| 能力 | 文本和图像输入、文本输出、多语言、视觉;支持 adaptive thinking |
| 模型 ID 形态 | 无日期后缀,但仍是固定快照,不是自动漂移的 evergreen 指针 |
| 知识截止信息 | 可靠知识截止时间和训练数据截止时间均为 2026 年 5 月 |
发布公告称 Opus 5 已在发布当天通过 Claude API 以及 Anthropic 列出的各个平台提供,包括 Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry。不同平台的账单、区域端点和数据路由规则可能不同,不能只拿 Claude API 的单价估算全部部署成本。12
有两个价格细节容易被忽略。第一,Fast mode 约为默认速度的 2.5 倍,但价格翻倍到输入 $10、输出 $50 / MTok;官方定价页说明它目前只适用于第一方 Claude API,不适用于 Bedrock 或其他合作云平台。第二,重复发送大型系统提示、代码库或文档时,缓存命中价格是标准输入价格的 10%,但缓存写入和数据驻留等计费项仍需单独核算。13
它提升的不是聊天腔,而是长任务完成率
Anthropic 的核心卖点是长程代理工作。官方文档把 Opus 5 的重点任务写成复杂的代理式编程和企业工作,具体包括多文件功能、大型重构和端到端交付。它在已有 Opus 4.8 提示词上通常可以直接工作,但官方建议重新评估
effort 设置:low 和 medium 在较低 token 消耗和延迟下仍能保持较强质量,困难的编码和代理任务再升到 xhigh。4发布公告给出的基准结果,重点可以这样读:
- 在 Frontier-Bench v0.1 上,Anthropic 称 Opus 5 超过其他模型,性能超过 Opus 4.8 的两倍,同时单任务成本更低。
- 在 CursorBench 3.2 的最高 effort 设置下,它与 Fable 5 的峰值分数相差不到 0.5%,但单任务成本约为后者的一半。
- 在 Zapier AutomationBench 上,它以相同单任务成本取得约为下一名 1.5 倍的通过率;在 OSWorld 2.0 上,官方称它用略高于 Fable 5 最佳结果三分之一的成本超过了后者。
- 在 ARC-AGI 3 上,官方称它的分数约为下一名模型的三倍。
这些数字都是 Anthropic 发布页中的评测结果,适合说明官方的产品定位,不应直接当作跨任务、跨提示词的独立结论。尤其是 Frontier-Bench 的脚注说明,Opus 5 和 Fable 5 遇到安全分类器拒答时会使用 Opus 4.8 fallback,实际接入仍要用自己的任务集复测。1
对工程团队来说,更有用的变化是它会主动验证和迭代。Anthropic 举了几个早期测试案例:模型从不能直接查看的机器零件图像原始像素中自行搭建视觉管线,再重建 FreeCAD 模型;它修复开源包管理器中的根因,而不只绕过表面症状;在交易公司的案例中,它找不到可用的实时行情流后,自己搭建测试工具验证解析结果。案例不能替代你自己的成功率数据,但它们说明评测重点已经从「能不能写出一段代码」移到了「能不能把任务做完并检查结果」。1
与 Fable 5、Opus 4.8、Sonnet 5 怎么选
| 需求 | 优先评估 | 判断依据 |
|---|---|---|
| 长时间运行的编码代理、多文件重构、复杂企业工作 | Opus 5 | 官方定位就是复杂代理式编程和企业工作,价格与 Opus 4.8 相同。14 |
| 想要接近 Fable 5 的能力,但需要控制模型单价 | Opus 5 | 官方称它在部分编码和知识工作评测上接近或超过 Fable 5,标准输入输出价格为 Fable 5 的一半。12 |
| 大量常规请求、速度和预算优先 | Sonnet 5 | 模型总览将 Sonnet 5 定位为速度与智能的组合;截至 2026 年 8 月 31 日,介绍价为 $2/$10,之后为 $3/$15 / MTok。23 |
| 追求当前广泛发布模型中的最高能力 | Fable 5 | 官方模型总览仍将 Fable 5 列为最强的广泛发布模型,但其标准价格是 $10/$50 / MTok。2 |
| 需要受限网络安全能力 | 不能默认选 Opus 5 | Opus 5 仍限制二进制漏洞扫描、渗透测试和 exploit 生成;这类工作需要查看组织是否符合相应访问计划。1 |
Opus 5 和 Fable 5 都有 1M 上下文、128k 最大输出,但相同的上下文规格不代表相同的任务取舍。Opus 5 的优势在于以较低单价承接复杂工作;Fable 5 仍适合把最高公开能力放在第一优先级的场景。Sonnet 5 则更适合把单位成本、延迟和规模放在第一优先级的服务。
从 Opus 4.8 迁移,先改评测,不要先改架构
Opus 5 对 Opus 4.8 用户的迁移成本看起来不高:模型总览给出了新的模型 ID,官方提示工程文档也说原有 Opus 4.8 提示词通常可以直接使用。真正需要重新测的是以下几项。
- 把
effort纳入测试矩阵。 Opus 5 在 Claude API 和 Claude Code 上默认使用high。先用现有任务测low、medium、high和必要时的xhigh,比较成功率、总 token、延迟和工具调用次数,不要沿用旧模型的默认设置。 - 检查思考开关。 模型总览把 Opus 5 列为不支持旧式
thinking.type: "enabled",但支持 adaptive thinking;提示工程文档又说明它默认启用 thinking,并允许在high或更低 effort 下关闭。迁移时应按新 API 行为检查请求和响应,不要把旧模型的 thinking 参数原样复制过来。24 - 重新设定输出长度。 官方文档提醒,Opus 5 的默认用户可见回答往往比上一代更长;
effort主要控制思考量,不会稳定地缩短最终回答。面向用户的产品要在提示中明确要求篇幅,而不是只调低 effort。 - 给代理设定边界。 Opus 5 更容易主动叙述、扩大任务范围和调用子代理。对窄任务,要写清交付范围、停止条件和是否允许委派,避免一个小改动变成不必要的长流程。4
- 核对固定快照。
claude-opus-5虽然没有日期后缀,官方仍将它定义为固定快照。生产环境要把模型 ID、版本变更和回滚路线写进发布流程,不要把它当成永远指向最新 Opus 的别名。2
安全限制和生产风险
Opus 5 的能力开放范围比 Fable 5 更宽,但不是无防护版本。Anthropic 表示,它没有在高风险生物学或攻击性网络安全能力上推进前沿,相关能力仍落后于受限的 Mythos 5。官方还说,Opus 5 没有针对网络安全任务专门训练,却因为通用能力提升而更擅长发现漏洞;它在漏洞发现上接近 Mythos 5,但在把漏洞转化为实际 exploit 方面明显落后。1
具体限制包括:允许从源代码中发现漏洞,但会拦截更容易与恶意行为相关的二进制漏洞扫描、渗透测试和 exploit 生成。被安全分类器拦截的请求,在 Claude.ai、Claude Code 和 Claude Cowork 中默认回退到 Opus 4.8,API 也可以开启 fallback。Anthropic 预计 Opus 5 的分类器介入频率比 Fable 5 低约 85%,这是官方测试口径,接入方仍应按自己的安全策略测试误报和漏报。1
生命科学任务也不能只看榜单分数。官方承认 Opus 5 在长时间、自主运行的生物研究任务上仍有重要限制。另一方面,面向一般用户的访问没有数据留存要求,至少消除了 Opus 5 接入评审中的一项硬障碍;组织自己的合同、区域路由和平台条款仍需单独核对。13
接入建议
如果你已经在用 Opus 4.8,Opus 5 是本次最值得做 A/B 测试的模型:价格不变,规格更大,官方定位也明确指向长任务和复杂代理。第一轮不要只测最终答案,至少把多文件修改、失败恢复、工具调用、长上下文检索、代码审查和高风险请求 fallback 放在同一个评测集里。
如果你还没有 Opus 级模型,建议按任务成本来选。Sonnet 5 负责高频、低延迟工作,Opus 5 处理失败代价高、需要较多判断的任务,Fable 5 留给最高能力确实能改变结果的场景。对于一次性或非实时的大批量任务,再比较 Batch API 的折扣;对于重复上下文,先测缓存命中率,别只看名义上的 $5/$25 单价。
目前最稳妥的结论是:Claude Opus 5 不是把 Fable 5 原价砍半后简单下放,而是把接近 Fable 5 的长任务能力放进了更适合日常生产的价格档。它是否值得全面替换 Opus 4.8,取决于你的任务能否把额外的自主性、验证能力和 1M 上下文转化为更少的人工介入;这个答案要由自己的工作流评测给出。
関連コンテンツ
- ログインするとコメントできます。
