Fable 5 价值重估周报 Vol.8:Opus 5 上位,旗舰变成场景选择

Fable 5 价值重估周报 Vol.8:Opus 5 上位,旗舰变成场景选择

Opus 5 发布后,Fable 5 在知识工作和部分编码测试中不再独占优势,但事实知识、安全路由和高成本窄场景仍各有边界,本文把官方定位、独立基准与社区实测放在同一张决策表里。

先看结论

7 月 24 日,Anthropic 发布 Claude Opus 5,并把它设为 Claude Max 的新默认模型。官方的说法很直接:它接近 Claude Fable 5 的前沿智能,但单任务成本约低一半;在 CursorBench 3.2 的 max effort 档位,Opus 5 距离 Fable 5 峰值分数不到 0.5%。1
这让 Fable 5 的位置发生了变化。它仍然是高上限模型,但「旗舰」不再等于所有任务都该优先调用。知识工作、终端编码和日常复杂任务,Opus 5 已经把选择题变成了成本题;事实知识、安全分类器和长程任务的稳定性,则还不能靠一次发布会下结论。
观察维度本周可确认的信号读法
官方定位Opus 5 接近 Fable 5 智能,定位为 Max 默认模型日常默认路由向 Opus 5 移动
知识工作Artificial Analysis Intelligence Index:Opus 5 为 61,Fable 5 为 60;AA-Briefcase 领先 Fable 5 146 Elo领先发生在特定 agent harness 和高推理档位
终端编码Frontier-Bench v0.1:43.3% 对 33.7%;FrontierCode v1.1 与 Fable 5 持平官方开发者账号公布的结果,不能替代独立复测
代码审查CodeRabbit:可执行精度高于生产混合基线,但覆盖更低、nitpick 更多Reviewer 的召回和噪音仍是问题
社区 3D 生成MineBench 15 个构建中,Opus 5 比 Fable 5 慢 78%,总成本高 64%创意表现更强,不等于更便宜或更稳

Opus 5 先赢在知识工作和终端编码

Artificial Analysis 的独立分析给出了比发布页更完整的边界。它用自家的开源参考 agent harness Stirrup 测试专业输出和知识工作:Opus 5 max 在 GDPval-AA v2 上拿到 1861 Elo,比 Fable 5 高 114;在 AA-Briefcase 上是 1720 Elo,比 Fable 5 高 146。Artificial Analysis Intelligence Index 则是 Opus 5 取 61、Fable 5 取 60,前者只领先一分。2
成本口径也值得看清。Artificial Analysis 记录的 Intelligence Index 单任务平均成本是 Opus 5 max $2.03,Fable 5 含 fallback 为 $2.75。这个数字来自该机构的评测任务,不是 Anthropic 的统一 API 报价,更不能直接换算成一个真实项目的月度账单。2
Anthropic 的开发者账号在 X 上给出了另一组更窄的编码结果:Frontier-Bench v0.1 中,Opus 5 为 43.3%,Fable 5 为 33.7%;FrontierCode v1.1 中两者持平,官方称 Opus 5 价格只有一半。这里的测试名、推理档位和价格口径都来自官方开发者账号,不能和 Artificial Analysis 的数字混成同一张总榜。3
콘텐츠 카드를 불러오는 중…

领先不是所有场景都领先

Artificial Analysis 同时给出了反例:Opus 5 在 AA-Omniscience 的事实知识仍低于 Fable 5。它比 Opus 4.8 提高了 7 个百分点,但幻觉率上升 14 个百分点至 50%。这说明「agentic knowledge work」的领先,不能直接翻译成「查事实更可靠」。2
代码审查的结果也没有形成全面替代。CodeRabbit 用约 100 个来自真实开源 Pull Request 的错误模式,每种配置运行 3 次,并将 Opus 5 x-high 与自己的生产模型混合基线比较。Opus 5 的 actionable precision 是 39.3%,高于基线的 35.2%;但命中已知问题的比例是 55.2%,低于基线的 61.1%,完整输出 precision 也从 32.8% 降到 28.6%。更麻烦的是,Opus 5 产生了 92 个 nitpick,基线只有 23 个。4
这组数据没有直接回答「Fable 5 是否比 Opus 5 更适合 code review」,但它说明了评测要问得更细:你需要的是尽量找全问题,还是只希望收到少量高置信评论?如果团队把 review 结果直接接入合并门禁,覆盖率下降和噪音增加都可能变成工程成本。

安全分类器和回退路径也不同

Opus 5 不是把 Fable 5 原样换成更便宜的名字。Anthropic 在发布页中说,Opus 5 的网络安全分类器比 Fable 5 少限制约 85%,允许发现源代码漏洞,但仍会阻止二进制漏洞扫描、渗透测试和 exploit 生成。被分类器标记的请求,在 Claude.ai、Claude Code 和 Cowork 中默认回退到 Opus 4.8,API 也可以开启自动回退。1
因此,任何「Opus 5 便宜而且跑分更高」的结论,都要先问两件事:任务是否触发了安全分类器,最终回答是不是由 Opus 4.8 完成。上周围绕 Fable 5 的成本记录已经表明,选中的模型和实际完成任务的模型必须分开记;这周 Opus 5 的发布让这条记录要求更不能省略。

社区实测更像两种工作风格

r/ClaudeAI 用户 ENT_Alam 在 MineBench 上比较了 Fable 5 和 Opus 5。这个公开 benchmark 让模型把 3D 建筑转换成坐标 JSON,测试的是空间构造和细节,不是通用编程能力。作者统计 15 个构建:Opus 5 平均耗时 32 分 10 秒,Fable 5 为 18 分 04 秒;Opus 5 总成本 $89.97,Fable 5 为 $54.93;Opus 5 还因 12 次无效 JSON schema 需要重复尝试。5
作者认为 Opus 5 的建筑细节和内部结构更丰富,但也承认这个 benchmark 是自己维护的公开项目,题目正在趋于饱和。评论区有人把两者概括成「Fable 更干净准确,Opus 更 flashy」,也有人指出测试范围过窄。6 这类反馈适合用来发现工作风格,不适合推导模型总排名。
同一发布页在 Hacker News 上也引发了大规模讨论,主帖抓取时显示 1,764 points 和 1,315 条评论。热度能说明开发者在意这次重新定价,却不能替代具体任务上的复测。7

给团队的使用建议

  1. 日常复杂任务先测 Opus 5。 它已经是 Max 的默认模型,知识工作和终端编码都有接近或超过 Fable 5 的本周数据。先用自己的任务集测完成率、人工介入和总成本,再决定是否保留 Fable 5 的高档位预算。
  2. 长程规划和高失败成本任务继续保留 Fable 5。 目前公开数据不足以证明 Opus 5 在长时间自主任务、事实检索和所有安全相关任务上都能替代 Fable 5。尤其是有 fallback 的场景,必须把实际回答模型写进日志。
  3. 代码审查把召回和精度分开验收。 CodeRabbit 的结果已经说明,评论更精准不代表发现更多问题。合并门禁要看已知问题覆盖、误报、重复评论和人工复核时间,不能只看一个 pass rate。

本周信号

Opus 5 让 Fable 5 的稀缺性第一次有了一个具体的替代参照:在一些知识工作和编码测试中,便宜模型已经追平甚至超过;在事实知识、窄场景审查、创意生成的成本效率和安全路由上,结论仍然分裂。下周最值得盯的是实际产品里的模型路由,以及使用 credits 或订阅限额后,Opus 5 和 Fable 5 在真实任务上的完成成本,而不是再找一张没有统一 harness 的总榜。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel