
Fable 5.1 发布周报 Vol.14:更强的长任务,怎样花得起
Anthropic 发布 Claude Fable 5.1:官方跑分与长任务能力明显上升,但 effort、工具调用和 fallback 让真实成本必须单独记录。
先看结论
本周,Anthropic 发布 Claude Fable 5.1。它把升级重点放在长时间运行的编码、研究、文档处理和计算机操作上,同时把
effort 变成更重要的成本开关:低、中 effort 更适合范围明确的任务,高 effort 才是长任务的主战场。1读者真正需要记录的变量已经从“选了 Fable 5 还是别的模型”变成了四个字段:
requested_model、requested_effort、actual_model 和最终验收结果。官方跑分显示能力上升,开发者实测却同时提醒:高 effort 会显著增加输出 token、等待时间和任务成本。Fable 5.1 带来了什么
Fable 5.1 与 Mythos 5.1 使用同一底层模型,安全边界不同。Fable 5.1 面向一般用户开放,Mythos 5.1 通过受信任访问项目提供给网络安全和生命科学场景。1
官方把能力增量集中在六类工作:跨多文件编码和重构、多步骤研究、从空白页制作文档与幻灯片、读取密集图表、1M token 长上下文,以及浏览器和桌面操作。Fable 5.1 的默认 effort 在 Claude Code 中为 High,在 Claude.ai 与 Cowork 中为 Medium。2
价格表面上仍是每百万输入 token 10 美元、输出 token 50 美元;缓存读取降到每百万 token 0.25 美元。Anthropic 估计,典型任务的 token 账单约下降 25%,高度 agentic 的任务最高可下降约 45%。这是缓存读取价格变化带来的估算,实际账单仍取决于任务是否反复读取相同上下文。13
数据保留和安全策略也发生变化。官方发布页称,符合条件的企业客户在 Enterprise Frontier Safeguards 分阶段上线前,可以申请 Fable 5.1 的零数据保留;普通迁移文档则把 30 天数据保留列为默认约束,具体资格需要以账户和接入方式为准。13
跑分上升,但每个数字都有口径
Anthropic 的内部比较给出了下面几组结果。表格只保留 Fable 5.1 与 Fable 5 的直接对照;官方同时提醒,安全分类器介入的任务会得到零分,部分网络安全和生物任务由其他模型完成,因此这些数字适合看方向,不能直接当成纯模型裸能力排名。1
| 场景与评测 | Fable 5.1 | Fable 5 | 读法 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 科学研究 agent;官方内部设置,需结合误差范围阅读。1 |
| GDPval-AA v2 | 1853 | 1723 | 知识工作评分。1 |
| OSWorld 2.0,partial | 77.9% | 72.9% | 计算机操作的宽松口径。1 |
| OSWorld 2.0,strict | 41.7% | 36.1% | 同一评测的严格口径。1 |
| AutomationBench | 31.4% | 17.1% | 商业流程自动化。1 |
| CursorBench 3.2.0 | 73.4% | 70.5% | agentic coding;官方 max effort 口径。1 |
这张表最值得注意的地方是 OSWorld 的两行:同一个任务集,partial 与 strict 的答案相差很大。团队做回归测试时,至少要把评测名称、工具权限、effort、fallback 和验收规则一起保存。
effort 是能力旋钮,也是账单旋钮
Simon Willison 用“鹈鹕骑自行车”的 SVG 任务比较五档 effort。Low 与 Medium 的输出约 2,000 token、耗时约 23 秒;High 输出 2,612 token,耗时约 30 秒;xhigh 输出 36,767 token,耗时 7 分 51 秒;Max 输出 65,927 token,耗时 13 分 54 秒,成本 3.30 美元,并产出他认为最好的鹈鹕。4

这个实验的价值在于把“更聪明”拆成了可计量的选择。范围清楚、结果容易验收的任务,可以先从 Medium 开始;需要长时间规划、跨文件修改或多轮验证的任务,才有理由测试 High、xhigh 或 Max。作者也提醒,单个创意 SVG 任务不能代表模型的通用能力。
社区反馈:更像编排器,也更容易烧额度
r/ClaudeAI 的一篇体验帖在 9 月 3 日发布,正文询问大家能具体感受到哪些改进。评论里出现了两组相反信号:一组用户认为 Fable 5.1 更适合做长任务编排,能让 Opus、Sonnet 和 Haiku 分担规划、写代码、审查与机械修改;另一组用户集中反馈模型会为小改动重写整个文件,导致 token 和五小时额度消耗加快。5X 上的信号也把“能力”和“成本”拆开了。Samaya AI 联合创始人 Maithra Raghu 分享称,Fable 5.1 在 FrontierFinance 上得分 55.9%,高于 Fable 5 的 49.2%;她同时观察到,更多、更好的工具调用让单次成本约为 Fable 5 的 1.7 倍。这个结果属于合作方评测和个人发布,不能替代 Anthropic 的统一评测。6
另一条 X 帖子记录了一个更窄的实践:Isaac Sin 使用机械臂 harness 做抓取和放置,Fable 5.1 几次抓取失误后完成自我纠正,整个过程约 15 分钟。这个案例说明模型可以参与具身任务实验,暂时只能支持“在特定 harness 中完成一次任务”的判断。7
迁移时先检查四个地方
- 模型 ID。 API 迁移到
claude-fable-5-1。Fable 5.1 采用自适应思考,thinking不能沿用旧版的 disabled 或手动 budget 配置。3 - 强制工具调用。
tool_choice: any和指定工具的写法会返回 400;迁移文档建议使用auto、明确指令和strict: true的工具定义。3 - thinking 前缀。 早期的
system、tools或消息历史发生修改,会让思考块失效或触发前缀不匹配。长会话应尽量采用 append-only 记录,并把新指令放到中途的 system message。3 - 实际完成模型。 Fable 5.1 支持通过
fallbacks处理拒答,允许的回退目标包括 Opus 4.8 和 Opus 5。日志要同时记录actual_model与fallback,否则最终由其他模型完成的回答会被误算成 Fable 5.1 的结果。3
本周信号
Fuentes de referencia
- 1Introducing Claude Fable 5.1 and Claude Mythos 5.1
anthropic.com
- 2What's new in Claude Fable 5.1
platform.claude.com
- 3Migrating to Claude Fable 5.1 and Claude Mythos 5.1
platform.claude.com
- 4Claude Fable 5.1 made me a really nice animated pelican
simonwillison.net
- 5
- 6
- 7
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
