Fable 5 任务成本周报 Vol.12:Low 跑到 89 分,7 月占 Anthropic 模型支出 8%

Fable 5 任务成本周报 Vol.12:Low 跑到 89 分,7 月占 Anthropic 模型支出 8%

VulcanBench 的 Fable 5 Low 在真实仓库任务中拿到 89 分,但 7 月企业支付数据里只占 Anthropic 模型支出的 8%;本期把跑分、effort、实际路由和社区工作流分开看。

先看结论

本周(2026 年 8 月 17 日至 24 日 09:00)Anthropic 的新闻页没有出现新的 Fable 5 版本或功能公告;最新条目仍是 8 月 14 日的文本水印说明。1 真正值得记录的增量落在三个地方:第三方 VulcanBench 把 Fable 5 的 Low effort 跑到 89 分,7 月企业支付数据里 Fable 5 占 Anthropic 模型支出的 8%,开发者则开始围绕 effort 档位和多模型分工重新安排 Claude Code 工作流。
这三条信息回答的是不同问题:89 分说明某个真实工程评测里的低 effort 上限,8% 描述一个月前的企业支出结构,社区帖子提供的是使用线索。把三者放在一起,读者得到的判断是:Fable 5 的选型重点正在从「能不能做」移向「用什么 effort、由谁执行、一个完整任务花多少钱」。
维度本周可核验信号读法
官方更新新闻页最新条目为 8 月 14 日的文本水印说明Fable 5 暂无新的官方版本信号
第三方评测VulcanBench Eval Suite 3:Fable 5 Low 为 89,Grok 4.5 High 为 90,DeepSeek V4-Flash Max 为 88真实仓库工程任务里的 effort 结果,不是通用总榜
企业采用Simon Willison 转述的 Ramp 7 月数据:Fable 5 占 Anthropic 模型支出的 8.0%数据来自 7 月,不能当作本周实时流量
社区反馈开发者报告 Claude Code 可能在服务端测试新的 Fable 5 effort 映射;Reddit 出现多智能体持久工作区实践帖可用性和工作流线索,等待官方说明或独立复现

官方面:没有新版本,成本指南更具体

Anthropic 新闻页把 8 月 14 日的文本水印公告列为当前最新新闻,8 月 17 日至 24 日之间没有列出新的 Fable 5 发布、模型更新或价格调整。1 因此,本周适合更新使用口径,暂时不适合写成「Fable 5 又升级了」。
Claude Platform 的成本指南给了一个更具体的比较方法:开发者可以分别选择模型、effort 和任务架构,再用「每个完整任务的成本」比较结果。Anthropic 在自己的编码测量中写道,先用低 effort 执行、失败后用默认高 effort 重跑,完成率大致保持不变,成本约为直接全部使用高 effort 的一半;页面同时注明这些结果属于内部、方向性的测量,需要在自己的任务上复现。2
这个口径很适合解读本周的两条社区信号。低 effort 的好成绩值得关注,但它首先是一个任务配置结果;高 effort 的调用也不能只用单次 token 价格衡量,因为失败重试、人工验收和模型切换都会改变完整任务成本。

VulcanBench:Fable 5 Low 距离第一名只差 1 分

VulcanBench 在 2026 年 8 月 21 日发布 Eval Suite 3 排名。该评测使用真实代码仓库里的工程任务,排除了谜题、数学题和虚构架构;评测方先跑完整的 effort sweep,再报告每个模型取得最高准确率的档位。3
模型与档位得分测试口径
Grok 4.5 High90VulcanBench Eval Suite 3,真实仓库工程任务
Claude Fable 5 Low89同一评测,低 effort
DeepSeek V4-Flash Max88同一评测,最高档 effort
这个结果的重点在档位:Fable 5 的 89 分来自 Low,而 DeepSeek V4-Flash 用 Max 得到 88 分。评测方的原话是,许多工程团队习惯直接开 High 或 Max,却可能为同样的准确率支付更多 token、等待更久。3
VulcanBench 仍然是一家评测项目自己的测试,样本范围、任务分布和成本计算细节不能替代官方 benchmark。它能支持的判断更窄:在这套真实仓库任务里,Fable 5 Low 值得作为默认起点测一遍;它无法单独证明 Fable 5 在知识工作、视觉或安全任务上也应该使用 Low。

采用面:7 月支出里,Fable 5 占 8.0%

2026 年 8 月 23 日,Simon Willison 转述《金融时报》关于 Anthropic 企业采用情况的报道,并整理了 Ramp AI Index 的 2026 年 7 月数据。Ramp 通过约 7 万家使用其公司卡的企业支出,估算不同模型的采用结构;这组数据里的 Fable 5 占 Anthropic 模型支出的 8.0%,排在 Opus 4.8 的 28.0%之后。4
8.0%描述的是 7 月的企业支付结构,发布这条转述的时间是 8 月 23 日。两个时间点需要分开:企业可能在 8 月换用了新的模型或方案,Ramp 这组数字也没有提供单个任务的调用量、token 数、成功率和实际完成模型。
这条数据仍然有用,因为它把「最强模型」和「最常被企业购买」分开了。Fable 5 的能力排名、订阅限额、usage credits、自动回退以及企业愿意为完整任务支付的成本,应该放进同一张记录表里;单看模型榜单,读者无法判断一个模型是否适合日常规模化使用。

社区面:effort 争议与长流程实践

一条待官方确认的 effort 线索

2026 年 8 月 22 日,X 用户 argofowl 发布观察:Claude Code 2.1.236 及更高版本的 Fable 5 会被服务端加入一个实验,部分用户看到缩小后的 effort 映射;他随后补充说,旧版本和 Opus 5 没有出现同样变化。5 这条帖子描述的是用户观察和作者推断,Anthropic 新闻页没有对应的正式说明。1 Hacker News 随后出现了同题讨论页。6
当前最稳妥的记录方式,是把 requested_effort 和模型实际返回的 effort、actual_model、任务结果一起保存。一次「High 感觉像 Low」的体验可以触发排查,但单条帖子还不足以证明 Fable 5 被全量降档,也不足以证明模型能力发生了变化。

Fable 5 的价值越来越依赖执行环境

Simon Willison 在 8 月 19 日记录了一次 Fable 5 的实测:他让 Claude Code for Web 调查 smolvm,目标是运行不可信的 Python 和 JavaScript,同时限制 CPU、内存、网络和文件系统权限。云端环境缺少嵌套虚拟化所需的 /dev/kvm,Fable 5 无法直接运行真实测试;它转而创建 GitHub Actions 工作流,在有 KVM 的 runner 上执行测试。7
这个案例展示了 Fable 5 的长流程能力,也展示了能力边界:模型可以识别环境限制、改写计划并继续推进,但最后能否完成任务,取决于执行环境是否提供正确的权限和硬件。一个 Reddit 用户在 8 月 24 日发布了题为「Multi-Agent Persistent Workspace」的 ClaudeAI 实践帖,讨论方向同样从单次问答转向持久工作区和多智能体协作。8 这是一条社区实践线索,适合拿来设计自己的工作流,不能直接当成完成率数据。

给本周使用的三个动作

  1. 先做 effort sweep,再决定默认档位。 选取一组真实仓库任务,分别跑 Low、High 和需要时的更高档位,记录通过测试的任务数、完整任务耗时、输入输出 token、失败重试次数和人工修改时间。VulcanBench 的结果只能告诉你 Low 值得测,不能替你确定项目默认值。
  2. 把模型路由写进日志。 每次调用至少记录 selected_modelrequested_effortactual_modelfallbacktask_costverification_result。安全分类器、服务故障或自动回退发生时,最终完成任务的模型必须单独记账。
  3. 把 Fable 5 与执行器分开比较。 对长任务设置一组单模型基线,再测试「Fable 5 负责拆解与审查、低价模型负责机械执行」的组合。比较对象是通过验收的完整任务成本,不是某个模型在一轮回答里的 token 单价。官方成本指南也把 advisor、orchestrator 和模型选择分成不同杠杆。2

本周信号

本周 Fable 5 的新信息集中在「低 effort 是否足够」和「企业是否愿意持续为它付费」。VulcanBench 的 89 分把问题落到了真实仓库任务;Ramp 的 8.0%把问题落到了企业支出;Claude Code 的 effort 实验和多智能体工作区,则把问题落到了实际路由与执行环境。
下周优先盯四个触发点:Anthropic 是否公开解释 effort 映射实验,VulcanBench 是否发布新的任务集和完整方法,Ramp 是否出现 8 月数据,以及 Claude Code 的 actual_modelfallback 是否能在用户日志里稳定观测。对自己的团队,先把完整任务成本和验收结果记下来,再决定 Fable 5 应该占据默认位、advisor 位,还是只处理最宽的任务。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content