
Fable 5 复开后周报 Vol.6:贵模型开始退到编排层
Fable 5 复开后一周,官方和社区的增量不再是能否访问,而是怎样省着用、怎样回退、哪些任务不值得直接上 Fable。本文梳理多模型编排、GPT-5.6 对比跑分、PR 安全审查反例和 Claude Code 真实案例。
复开后的第二周,Fable 5 的问题已经从「能不能用」变成了「什么时候该用」。最清楚的信号来自 ClaudeDevs:他们公开建议把 Fable 5 放在 advisor 或 orchestrator 的位置,让 Sonnet 5 执行大多数 token 密集的工作,从而把主要账单留在更低的执行模型费率上。1
这不是一句省钱口号。Fable 5 仍然在 AA-Briefcase 这类复杂知识工作里保持领先,但 GPT-5.6 Sol 已经把综合智能分数追到只差 1 分,并在编码 agent 指数里领先。Fable 5 的位置正在收窄:它更像规划、判断和复核层,不再适合被无脑设成所有任务的默认执行层。
本周快读
| 信号 | 本周变化 | 对开发者的影响 |
|---|---|---|
| 官方使用建议 | ClaudeDevs 在 7 月 7 日提出「Sonnet 5 执行、Fable 5 提供指导」的模式,理由是多数 token 可按更低的执行模型费率计费。1 | Fable 5 更适合前期拆题、关键设计评审和最终验收,不适合承担搜索、批量修改和普通测试输出。 |
| 第三方综合跑分 | Artificial Analysis 称 GPT-5.6 Sol 在 Intelligence Index 得 59 分,只比 Fable 5 低 1 分,单任务成本约为 Fable 5 的三分之一;但 Fable 5 仍在 AA-Briefcase 的 rubric score 和 analytical quality 上领先。2 | 选型不能只看「最强模型」。如果任务是代码 agent 或成本敏感的通用推理,Sol/低价模型组合已经逼近 Fable。 |
| 安全 PR 评测反例 | Dam Secure 在 10 个带漏洞 PR 上跑 10 个模型,每个模型重复 5 次;Fable 5 → Opus 4.8 fallback 的 F1 为 0.85、成本约 $3.61/PR,GPT-5.6 Sol 的 F1 为 0.91、成本 $0.70/PR。3 | 对 PR 安全审查这类窄任务,Fable 5 不一定是性价比答案。更贵的模型没有自动带来更好的边际收益。 |
| 社区实践 | r/ClaudeAI 的高热视频帖把「Fable 编排、便宜模型执行」包装成 Claude Code 配置方案,并给出 pilotfish 项目;该帖拿到 1374 分和 234 条评论,GitHub 项目页显示 387 stars。45 | 社区已经开始把 Fable 5 当「大脑」,把 Haiku/Sonnet/Opus 当不同工种;这类配置值得研究,但不要把 README 里的节省比例当成自己的账单结果。 |
| 官方产品侧 | Anthropic 在 7 月 9 日推出 Claude 使用反思 beta,可回看 1、3、6、12 个月的使用模式,并设置 quiet hours 或休息提醒;该功能面向 Free、Pro、Max 且需要开启 memory。6 | 在 usage credits 后,Anthropic 也在把「你怎样使用 Claude」变成产品能力。对重度用户来说,这类视图会影响预算和工作流调整。 |
Fable 5 正在变成编排层
Anthropic 的 Fable 5 提示指南把模型优势说得很直接:长程自主性、复杂问题的一次通过率、视觉理解、企业工作流、代码审查和调试、模糊任务导航,以及并行 subagent 调度。7 这些能力的共同点不是「输出更多字」,而是能在不完整的目标里判断下一步该做什么。
这也解释了本周 ClaudeDevs 的 advisor 建议。让 Sonnet 5 跑执行层,再让 Fable 5 在关键节点给方向,等于把 Fable 的强项留在高杠杆环节。搜索、批量改文件、机械测试和格式清理消耗大量 token,但判断密度不高;需求拆解、架构取舍、失败诊断和验收标准则相反,token 不一定最多,但错了会让整轮工作跑偏。
Claude Platform 的多 agent 文档也支持这种结构:协调者可以把独立子任务并行分发给不同 agent,每个 agent 有自己的模型、系统提示、工具和上下文;适合的模式包括并行化、专业分工和升级咨询。8 这给了 API 用户一个更正式的迁移方向:不要只问「我要不要用 Fable」,而是问「哪几个环节必须由 Fable 判断」。
跑分压力来自两边
Artificial Analysis 本周的新数据让 Fable 5 的领先更贵了。GPT-5.6 Sol 在 Intelligence Index 得 59 分,接近 Fable 5 的 60 分;AA 还称 Sol 在 Codex harness 下拿到 Coding Agent Index 80 分,领先其三项编码评测,而且每任务成本比 Claude Code 里的 Fable 5 低约 40%。2
但这不是「Fable 被反超」这么简单。AA-Briefcase 上,Fable 5 仍靠 rubric score 56% 对 Sol 42%、Analytical Quality Elo 1764 对 1592 保持优势。2 也就是说,Fable 的强项仍在复杂知识工作和分析质量,而不是所有 agent 任务的平均性价比。
更刺眼的反例来自 Dam Secure 的 PR 安全审查。它的测试只看新增 PR 里的访问控制漏洞,不是全仓库漫游,也不是通用安全能力。就在这个窄场景里,Fable 5 → Opus 4.8 fallback 的 recall 88%、precision 83%、F1 0.85,成本约 $3.61/PR;GPT-5.6 Sol recall 100%、F1 0.91,成本 $0.70/PR。3
这条结果对 Fable 5 很不友好,但对读者有用。安全任务正好是 Fable 分类器最敏感的区域之一。Anthropic 自己也说明,Fable 5 的安全分类器覆盖 offensive cybersecurity、生命科学内容和思维提取,良性网络安全工作也可能触发 safeguards;被拒绝的请求应配置回退到 Opus 4.8。7 如果你的 workload 就是 PR 安全扫描,先做小规模复测,比直接押 Fable 更稳。
真实组织案例显示执行层还在 Opus/Sonnet
Anthropic 7 月 6 日发布的 Alberta 政府案例没有说用 Fable 5,而是说该团队用 Claude Code 搭配 Opus 和 Sonnet 模型扫描政府系统。案例里给出的量级很大:1,280 个应用、3,400 个代码仓库,约 50 个 agent 并行,在 20 小时内评估 4.66 亿行代码,并对每个应用检查约 95 项安全控制。9
这对 Fable 5 追踪反而是个提醒:企业级 agent 工作流不一定靠单个最强模型硬跑。Alberta 的案例更像「多 agent + 可验证流程 + 人类工程师审核」的组合。Claude Code 先用规则引擎标出已知模式,再让模型审查并引用具体文件和行,修复上线前仍由团队审查批准。9
如果把这套方法迁移到 Fable 5,Fable 最可能承担的不是 4.66 亿行代码的全部阅读,而是定义扫描策略、判断哪些发现需要升级、复核高风险修复。低价值遍历交给低价层,关键判断交给 Fable,这和本周社区讨论的方向一致。
社区已经开始写省额度的基础设施
Reddit 那个 1374 分的帖子很有代表性。作者把 Fable 5 放在主会话或编排位,把 Haiku/Sonnet/Opus 分成 scout、mechanical executor、verifier、security executor 等角色,并特别提到安全角色不走 Fable,因为良性安全工作可能被分类器误伤。4 对普通 Claude Code 用户来说,这比抽象 benchmark 更接近日常问题:为什么额度消耗得这么快,哪些后台搜索其实不该用高价模型跑。
pilotfish 项目把这套思路做成配置包。它的 README 说自己安装的是三层结构:settings 里设置主模型和 fallback,agents 里定义不同角色,CLAUDE.md 里写委派策略;GitHub 页面显示最新 release v1.1.4 在 7 月 12 日发布。5 这不是官方产品,也不能证明所有人都能省到同样比例,但它说明 Fable 5 的成本问题已经催生了一类新工具:模型路由配置本身变成了开发者生产力的一部分。
下周要盯的三个信号
第一,usage credits 后的真实账单。社区现在讨论最激烈的不是 Fable 能不能做事,而是 $200 订阅用户还要不要为 Fable 额外买单。下周如果出现更多可复现的工作流账单样本,价值会比单条抱怨高得多。
第二,编排模式有没有官方化。ClaudeDevs 已经公开讲 advisor pattern,Platform 文档也有多 agent 编排能力。下一步要看 Anthropic 会不会把「Fable 做大脑、Sonnet 做手」包装成更明确的产品入口,而不只是文档和社区配置。
第三,安全类任务的 fallback 口径。Dam Secure 的 PR 评测给了一个反例,Anthropic 的提示指南也承认良性安全工作可能触发 safeguard。后续如果有更多安全 benchmark,需要分清楚是 PR diff、全仓库扫描、漏洞修复还是红队任务;把这些混成一个「Fable 安全能力」结论,会误导选型。
参考ソース
- 1ClaudeDevs:Fable 5 advisor pattern
- 2GPT-5.6 benchmarks across Intelligence, Speed and Cost
- 3The AI PR Security Review Frontier
- 4Reddit:Fable 5 orchestrates, cheap models execute
- 5GitHub - Nanako0129/pilotfish
- 6A new way to reflect on how you use Claude
- 7Prompting Claude Fable 5
- 8Multi-agent sessions - Claude Platform Docs
- 9Government of Alberta uses Claude to find and fix cybersecurity vulnerabilities
関連コンテンツ
- ログインするとコメントできます。
