Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

量子位报道 Anthropic 发布 Fable 5.1 与 Mythos 5.1,梳理基准表现、智能体成本、科研案例及 API 反蒸馏机制。

转载说明:本文转载自微信公众号「量子位」,作者署名:梦晨,发自凹非寺;公众号 QbitAI;发表于 2026 年 9 月 2 日。本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码及装饰性页面残留。
梦晨在这篇报道中介绍了 Anthropic 同时发布的 Fable 5.1 与 Mythos 5.1:前者面向所有用户开放,后者面向经过审核的网络安全和生命科学机构。报道把性能、智能体任务成本、科研案例和 API 反蒸馏机制放在了一起,读者可以据此看见这次发布从模型能力延伸到开发规则的完整变化。1

两款模型同时发布

原文把这次发布结果概括为:8 项公开基准测试全部第一,价格最高下降 45%。Fable 5.1 在中、低推理程度下的表现,接近旧版 Mythos 5 开到极高甚至最高推理程度的水平。1
Fable 5.1、Fable 5、Opus 5 与 GPT-5.6 Sol 的基准测试对比表
原文基准测试表列出智能体科研、智能体编程、知识工作、计算机使用、多学科推理、商业工作流和 CursorBench 等结果;绿色列为 Fable 5.1,图中数值与排名均来自量子位官方公众号原文。1
基准表显示,Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,在 Terminal-Bench 4.0 上得分 55.8%,在 GDPval-AA v2 上得分 1853。在 OSWorld 2.0 的 partial 与 strict 设定下,Fable 5.1 分别为 77.9%41.7%;在 Humanity’s Last Exam 中,模型在无工具和带工具设定下分别得到 60.9%65.0%1
价格变化集中在缓存读取。Fable 5.1 将缓存读取价格降到每百万 token 0.25 美元,降幅 75%;输入价格和输出价格保持不变,分别为每百万 token 10 美元50 美元。Anthropic 按实际使用情况估算,典型工作负载的成本比 Fable 5 低约 25%,高度智能体化任务最多低 45%1
Fable 5 与 Fable 5.1 在典型工作负载和高度智能体化工作负载中的成本对比
原文成本图以 Fable 5 的成本为 100,显示 Fable 5.1 在典型工作负载中的指数成本为 75,在高度智能体化工作负载中的指数成本为 55;图中工作负载定义与数据说明来自量子位官方公众号原文。1

多步骤任务与科研实战

原文把 Fable 5.1 的优势归因于多步骤任务处理能力。多步骤任务往往需要连续完成几十个动作,前面一步出现小错误,后面的结果就可能全部失效。Fable 5.1 会持续输出;遇到暂时无法解决的问题时,模型会说明已经尝试过的方案和卡住的环节。1
研究员 Flix Rieseberg 还提到,Fable 5.1 写作时减少使用粗体、标题、列表和引号,并且更好地遵循风格提示词。1
科研案例主要由 Mythos 5.1 和 Fable 5.1 分担:
  • 蛋白质设计。 Anthropic 让 Mythos 5.1 使用开源蛋白质设计与折叠工具,设计高亲和力结合蛋白,再把方案交给两家外部机构验证。在 3 个靶标上,模型设计的结合亲和力达到 Adaptyv Bio 蛋白质设计竞赛最佳方案的 10 倍;在全部 12 个靶标上,命中率接近 50%,而该领域典型命中率为 10%—15%1
  • 金星地形图。 Fable 5.1 使用 NASA 麦哲伦号 30 多年前拍摄的雷达图像训练神经网络,为金星约三分之一的表面生成新的高分辨率地形图。原有地形图覆盖金星约五分之一的面积,分辨率为 10—20 公里;新地图把分辨率提高到 2—3 公里,高度精度提高 25%,并以 CC 协议开源,供 NASA VERITAS 和 ESA EnVision 任务参考。1
  • GPU 加速。 Mythos 5.1 通过编写自定义 GPU 内核、缓存中间结果,把 7 个开源深度学习模型的运行速度最高提高 2.5 倍,并保持输出一致。原文估算,这类优化可以让相关研究的 GPU 成本降低 30%—60%;Anthropic 计划近期开源这些优化。1
麦哲伦号雷达图、旧地形图、新 DEM 与金星火山渲染结果
原文配图依次展示麦哲伦号雷达图、10—20 公里范围的测高数据、新生成的 300 米 DEM,以及一座直径约 15 公里的盾状火山渲染结果;图片来源为量子位官方公众号原文。1

反蒸馏机制怎样工作

Fable 5.1 的网络安全误报率比 Fable 5 低 60%,因此可以用于发现软件漏洞;漏洞利用程序仍属于禁止范围。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务,会被重新路由到 Opus 系列模型。基础生物学和医学问题的误报率降低 85%,生命科学研发查询仍需要通过 Mythos 5.1 的生命科学验证计划(LSVP)访问。1
这次 API 更新的重点,是给思维链增加前缀校验。从 2026 年 9 月 2 日起,新注册的 API 账户在多轮对话中手动编辑 Claude 上下文时,无法继续保留思维链记录。此前,开发者可以修改历史上下文,同时保留思维链记录,再让模型在新的对抗性指令下重放原来的推理过程。新机制直接限制了这种做法。1
系统会给每个思维链区块加上签名。开发者把助手回复放回后续 API 请求时,签名会检查两件事:当前模型是否有权读取这个区块,以及区块之前的整段对话是否保持原样。检查范围包括系统提示词、工具列表和历史消息。对话前缀发生变化,签名校验就会失败。1
开发者可以通过 prefix_mismatch_behavior 设定失败后的处理方式:
  • error 是默认值。校验失败时,API 返回 400 状态码,请求被拒绝。
  • drop_block 会静默丢弃失效区块和它之后的全部思维链,请求继续执行。被丢弃的部分不计费,并会出现在响应的 input_transformations 数组中。
以下操作会让前缀校验失败:
  • 编辑、重新排列或删除历史中的用户、助手或系统消息;
  • 改动顶层系统提示词;
  • 对工具列表进行增删或改名;
  • 从对话中间移除某个思维链区块,同时保留后面的区块;
  • 两次请求之间引用返回内容发生变化的图片或文档 URL。
以下操作属于安全范围:在对话末尾追加消息,从历史开头移除思维链区块,修改 max_tokens 等请求参数,增减 cache_control 标记,以及使用服务端压缩或上下文编辑。由于思维链区块还会记录前一个区块的信息,从链条中间移除一个区块,后面的每个区块都会失效。1
Anthropic 给出的替代方案包括:
  1. 需要在中途改变指令时,使用对话内系统消息,不直接改动顶层提示词。
  2. 需要每轮增加临时提醒时,使用带 clear_at 参数的轮次级系统消息。
  3. 需要调整工具时,使用 tool_additiontool_removal 区块。
  4. 需要裁剪上下文时,使用服务端压缩和上下文编辑。
Claude Code、claude.ai、Claude Managed Agents 和 Claude Agent SDK 已经自动保证对话前缀保持一致。直接调用 Messages API 的开发者,则需要把 messages 数组按只追加方式维护,并在 prefix_mismatch_behavior 设为 drop_block 的情况下完成多轮会话测试,检查日志中是否出现 prefix_binding_mismatch1

One More Thing

原文最后提到,OpenAI 的新模型 Astra 尚未准备完成,目前先发布预告;Ilya 则在 Fable 5.1 和 Astra 发布之际呼吁加强网络安全。1

原文摘录

“无论你此前让 Claude 处理什么任务,Fable 5.1 都能做更多,并且把最难的部分完成得更出色。”
——Anthropic 发布视频,量子位官方公众号原文引述。1
“现在这条路直接堵死了。”
——梦晨,量子位官方公众号原文,指代手动篡改上下文并保留思维链记录的做法。1

Fuentes de referencia

  1. 1
    量子位原文

    mp.weixin.qq.com

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel