
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
量子位报道 Anthropic 发布 Fable 5.1 与 Mythos 5.1,梳理基准表现、智能体成本、科研案例及 API 反蒸馏机制。
转载说明:本文转载自微信公众号「量子位」,作者署名:梦晨,发自凹非寺;公众号 QbitAI;发表于 2026 年 9 月 2 日。本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码及装饰性页面残留。
梦晨在这篇报道中介绍了 Anthropic 同时发布的 Fable 5.1 与 Mythos 5.1:前者面向所有用户开放,后者面向经过审核的网络安全和生命科学机构。报道把性能、智能体任务成本、科研案例和 API 反蒸馏机制放在了一起,读者可以据此看见这次发布从模型能力延伸到开发规则的完整变化。1
两款模型同时发布
原文把这次发布结果概括为:8 项公开基准测试全部第一,价格最高下降 45%。Fable 5.1 在中、低推理程度下的表现,接近旧版 Mythos 5 开到极高甚至最高推理程度的水平。1

基准表显示,Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,在 Terminal-Bench 4.0 上得分 55.8%,在 GDPval-AA v2 上得分 1853。在 OSWorld 2.0 的 partial 与 strict 设定下,Fable 5.1 分别为 77.9% 和 41.7%;在 Humanity’s Last Exam 中,模型在无工具和带工具设定下分别得到 60.9% 和 65.0%。1
价格变化集中在缓存读取。Fable 5.1 将缓存读取价格降到每百万 token 0.25 美元,降幅 75%;输入价格和输出价格保持不变,分别为每百万 token 10 美元和 50 美元。Anthropic 按实际使用情况估算,典型工作负载的成本比 Fable 5 低约 25%,高度智能体化任务最多低 45%。1

多步骤任务与科研实战
原文把 Fable 5.1 的优势归因于多步骤任务处理能力。多步骤任务往往需要连续完成几十个动作,前面一步出现小错误,后面的结果就可能全部失效。Fable 5.1 会持续输出;遇到暂时无法解决的问题时,模型会说明已经尝试过的方案和卡住的环节。1
研究员 Flix Rieseberg 还提到,Fable 5.1 写作时减少使用粗体、标题、列表和引号,并且更好地遵循风格提示词。1
科研案例主要由 Mythos 5.1 和 Fable 5.1 分担:
- 蛋白质设计。 Anthropic 让 Mythos 5.1 使用开源蛋白质设计与折叠工具,设计高亲和力结合蛋白,再把方案交给两家外部机构验证。在 3 个靶标上,模型设计的结合亲和力达到 Adaptyv Bio 蛋白质设计竞赛最佳方案的 10 倍;在全部 12 个靶标上,命中率接近 50%,而该领域典型命中率为 10%—15%。1
- 金星地形图。 Fable 5.1 使用 NASA 麦哲伦号 30 多年前拍摄的雷达图像训练神经网络,为金星约三分之一的表面生成新的高分辨率地形图。原有地形图覆盖金星约五分之一的面积,分辨率为 10—20 公里;新地图把分辨率提高到 2—3 公里,高度精度提高 25%,并以 CC 协议开源,供 NASA VERITAS 和 ESA EnVision 任务参考。1
- GPU 加速。 Mythos 5.1 通过编写自定义 GPU 内核、缓存中间结果,把 7 个开源深度学习模型的运行速度最高提高 2.5 倍,并保持输出一致。原文估算,这类优化可以让相关研究的 GPU 成本降低 30%—60%;Anthropic 计划近期开源这些优化。1

反蒸馏机制怎样工作
Fable 5.1 的网络安全误报率比 Fable 5 低 60%,因此可以用于发现软件漏洞;漏洞利用程序仍属于禁止范围。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务,会被重新路由到 Opus 系列模型。基础生物学和医学问题的误报率降低 85%,生命科学研发查询仍需要通过 Mythos 5.1 的生命科学验证计划(LSVP)访问。1
这次 API 更新的重点,是给思维链增加前缀校验。从 2026 年 9 月 2 日起,新注册的 API 账户在多轮对话中手动编辑 Claude 上下文时,无法继续保留思维链记录。此前,开发者可以修改历史上下文,同时保留思维链记录,再让模型在新的对抗性指令下重放原来的推理过程。新机制直接限制了这种做法。1
系统会给每个思维链区块加上签名。开发者把助手回复放回后续 API 请求时,签名会检查两件事:当前模型是否有权读取这个区块,以及区块之前的整段对话是否保持原样。检查范围包括系统提示词、工具列表和历史消息。对话前缀发生变化,签名校验就会失败。1
开发者可以通过
prefix_mismatch_behavior 设定失败后的处理方式:error是默认值。校验失败时,API 返回 400 状态码,请求被拒绝。drop_block会静默丢弃失效区块和它之后的全部思维链,请求继续执行。被丢弃的部分不计费,并会出现在响应的input_transformations数组中。
以下操作会让前缀校验失败:
- 编辑、重新排列或删除历史中的用户、助手或系统消息;
- 改动顶层系统提示词;
- 对工具列表进行增删或改名;
- 从对话中间移除某个思维链区块,同时保留后面的区块;
- 两次请求之间引用返回内容发生变化的图片或文档 URL。
以下操作属于安全范围:在对话末尾追加消息,从历史开头移除思维链区块,修改
max_tokens 等请求参数,增减 cache_control 标记,以及使用服务端压缩或上下文编辑。由于思维链区块还会记录前一个区块的信息,从链条中间移除一个区块,后面的每个区块都会失效。1Anthropic 给出的替代方案包括:
- 需要在中途改变指令时,使用对话内系统消息,不直接改动顶层提示词。
- 需要每轮增加临时提醒时,使用带
clear_at参数的轮次级系统消息。 - 需要调整工具时,使用
tool_addition和tool_removal区块。 - 需要裁剪上下文时,使用服务端压缩和上下文编辑。
Claude Code、claude.ai、Claude Managed Agents 和 Claude Agent SDK 已经自动保证对话前缀保持一致。直接调用 Messages API 的开发者,则需要把
messages 数组按只追加方式维护,并在 prefix_mismatch_behavior 设为 drop_block 的情况下完成多轮会话测试,检查日志中是否出现 prefix_binding_mismatch。1One More Thing
原文最后提到,OpenAI 的新模型 Astra 尚未准备完成,目前先发布预告;Ilya 则在 Fable 5.1 和 Astra 发布之际呼吁加强网络安全。1
原文摘录
“无论你此前让 Claude 处理什么任务,Fable 5.1 都能做更多,并且把最难的部分完成得更出色。”——Anthropic 发布视频,量子位官方公众号原文引述。1
“现在这条路直接堵死了。”——梦晨,量子位官方公众号原文,指代手动篡改上下文并保留思维链记录的做法。1
References
- 1量子位原文
mp.weixin.qq.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
