Fable 5.1 发布周报 Vol.14:更强的长任务,怎样花得起

Fable 5.1 发布周报 Vol.14:更强的长任务,怎样花得起

Anthropic 发布 Claude Fable 5.1:官方跑分与长任务能力明显上升,但 effort、工具调用和 fallback 让真实成本必须单独记录。

先看结论

本周,Anthropic 发布 Claude Fable 5.1。它把升级重点放在长时间运行的编码、研究、文档处理和计算机操作上,同时把 effort 变成更重要的成本开关:低、中 effort 更适合范围明确的任务,高 effort 才是长任务的主战场。1
读者真正需要记录的变量已经从“选了 Fable 5 还是别的模型”变成了四个字段:requested_modelrequested_effortactual_model 和最终验收结果。官方跑分显示能力上升,开发者实测却同时提醒:高 effort 会显著增加输出 token、等待时间和任务成本。

Fable 5.1 带来了什么

Fable 5.1 与 Mythos 5.1 使用同一底层模型,安全边界不同。Fable 5.1 面向一般用户开放,Mythos 5.1 通过受信任访问项目提供给网络安全和生命科学场景。1
官方把能力增量集中在六类工作:跨多文件编码和重构、多步骤研究、从空白页制作文档与幻灯片、读取密集图表、1M token 长上下文,以及浏览器和桌面操作。Fable 5.1 的默认 effort 在 Claude Code 中为 High,在 Claude.ai 与 Cowork 中为 Medium。2
价格表面上仍是每百万输入 token 10 美元、输出 token 50 美元;缓存读取降到每百万 token 0.25 美元。Anthropic 估计,典型任务的 token 账单约下降 25%,高度 agentic 的任务最高可下降约 45%。这是缓存读取价格变化带来的估算,实际账单仍取决于任务是否反复读取相同上下文。13
数据保留和安全策略也发生变化。官方发布页称,符合条件的企业客户在 Enterprise Frontier Safeguards 分阶段上线前,可以申请 Fable 5.1 的零数据保留;普通迁移文档则把 30 天数据保留列为默认约束,具体资格需要以账户和接入方式为准。13

跑分上升,但每个数字都有口径

Anthropic 的内部比较给出了下面几组结果。表格只保留 Fable 5.1 与 Fable 5 的直接对照;官方同时提醒,安全分类器介入的任务会得到零分,部分网络安全和生物任务由其他模型完成,因此这些数字适合看方向,不能直接当成纯模型裸能力排名。1
场景与评测Fable 5.1Fable 5读法
Terminal-Bench-Science 0.152.6%24.7%科学研究 agent;官方内部设置,需结合误差范围阅读。1
GDPval-AA v218531723知识工作评分。1
OSWorld 2.0,partial77.9%72.9%计算机操作的宽松口径。1
OSWorld 2.0,strict41.7%36.1%同一评测的严格口径。1
AutomationBench31.4%17.1%商业流程自动化。1
CursorBench 3.2.073.4%70.5%agentic coding;官方 max effort 口径。1
这张表最值得注意的地方是 OSWorld 的两行:同一个任务集,partial 与 strict 的答案相差很大。团队做回归测试时,至少要把评测名称、工具权限、effort、fallback 和验收规则一起保存。

effort 是能力旋钮,也是账单旋钮

Simon Willison 用“鹈鹕骑自行车”的 SVG 任务比较五档 effort。Low 与 Medium 的输出约 2,000 token、耗时约 23 秒;High 输出 2,612 token,耗时约 30 秒;xhigh 输出 36,767 token,耗时 7 分 51 秒;Max 输出 65,927 token,耗时 13 分 54 秒,成本 3.30 美元,并产出他认为最好的鹈鹕。4
Fable 5.1 在 max effort 下生成的白色鹈鹕骑自行车插画
Simon Willison 的单次 effort 对比:图片展示 max 结果;同一任务的输出 token、耗时和成本随 effort 档位明显上升。4
这个实验的价值在于把“更聪明”拆成了可计量的选择。范围清楚、结果容易验收的任务,可以先从 Medium 开始;需要长时间规划、跨文件修改或多轮验证的任务,才有理由测试 High、xhigh 或 Max。作者也提醒,单个创意 SVG 任务不能代表模型的通用能力。

社区反馈:更像编排器,也更容易烧额度

r/ClaudeAI 的一篇体验帖在 9 月 3 日发布,正文询问大家能具体感受到哪些改进。评论里出现了两组相反信号:一组用户认为 Fable 5.1 更适合做长任务编排,能让 Opus、Sonnet 和 Haiku 分担规划、写代码、审查与机械修改;另一组用户集中反馈模型会为小改动重写整个文件,导致 token 和五小时额度消耗加快。5
X 上的信号也把“能力”和“成本”拆开了。Samaya AI 联合创始人 Maithra Raghu 分享称,Fable 5.1 在 FrontierFinance 上得分 55.9%,高于 Fable 5 的 49.2%;她同时观察到,更多、更好的工具调用让单次成本约为 Fable 5 的 1.7 倍。这个结果属于合作方评测和个人发布,不能替代 Anthropic 的统一评测。6
另一条 X 帖子记录了一个更窄的实践:Isaac Sin 使用机械臂 harness 做抓取和放置,Fable 5.1 几次抓取失误后完成自我纠正,整个过程约 15 分钟。这个案例说明模型可以参与具身任务实验,暂时只能支持“在特定 harness 中完成一次任务”的判断。7

迁移时先检查四个地方

  1. 模型 ID。 API 迁移到 claude-fable-5-1。Fable 5.1 采用自适应思考,thinking 不能沿用旧版的 disabled 或手动 budget 配置。3
  2. 强制工具调用。 tool_choice: any 和指定工具的写法会返回 400;迁移文档建议使用 auto、明确指令和 strict: true 的工具定义。3
  3. thinking 前缀。 早期的 systemtools 或消息历史发生修改,会让思考块失效或触发前缀不匹配。长会话应尽量采用 append-only 记录,并把新指令放到中途的 system message。3
  4. 实际完成模型。 Fable 5.1 支持通过 fallbacks 处理拒答,允许的回退目标包括 Opus 4.8 和 Opus 5。日志要同时记录 actual_modelfallback,否则最终由其他模型完成的回答会被误算成 Fable 5.1 的结果。3

本周信号

  • 升级价值主要落在长任务。 官方能力说明、effort 实测和 Reddit 编排案例都指向多步骤工作;短问题仍应先用较低 effort 测量质量与成本。24
  • 缓存便宜,工具调用未必便宜。 官方给出缓存读取降价,FrontierFinance 的合作方实测却观察到更多工具调用带来更高单次成本。下周应把 cache hit、工具轮数和总输出 token 放到同一条任务记录里。16
  • 迁移回归的第一优先级是路由。 先确认选中模型、实际完成模型、effort 和验收结果,再比较分数或 credits。这个顺序能把模型升级、fallback、工具失败和人工修复分开。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel