Claude Fable 5.1 / Mythos 5.1:同一权重,分开的能力与安全边界

Claude Fable 5.1 / Mythos 5.1:同一权重,分开的能力与安全边界

Claude Fable 5.1 与 Mythos 5.1 使用同一权重但采用不同安全配置,本文用官方 benchmark 总表拆解两者在长程工程、知识工作、电脑操作和生命科学任务上的位置与可用边界。

同一权重,分开的可用能力

Anthropic 在 2026 年 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1。两者使用同一组模型权重,差异主要来自 safeguards:Fable 5.1 面向一般可用,Mythos 5.1 通过受审查的 trusted access programs 向网络安全和生命科学组织开放。1
这个关系决定了横向表必须把两个名字分开。Fable 5.1 在保留生产防护的条件下,已经允许所有访问级别进行源代码漏洞发现;渗透测试、漏洞利用生成和基于二进制的漏洞扫描仍会被限制或转交其他配置。Mythos 5.1 则是同一权重在网络安全和生命科学领域使用更宽松防护的版本,所以 Mythos 的专业任务分数不能直接当作普通用户获得的 Fable 5.1 体验。1

一张总表看位置

下面只填官方材料明确打印的分数。 表示本轮官方材料没有给出该型号在该行的数字,不是零分;“官方图示未逐点标数”表示材料确认做过评测,但当前材料只给了图,没有可靠的逐点数值。除特别注明外,System Card 的汇总表使用自适应思考、最高 effort、默认采样设置,并以五次试验平均;竞品数字有些来自各自开发者的 System Card 或公开 leaderboard,不能自动视为 Anthropic 在完全相同 harness 上复测。1
Benchmark / 条件Claude Fable 5.1Claude Mythos 5.1Claude Fable 5Claude Mythos 5Claude Opus 5Claude Opus 4.8Claude Sonnet 5GPT-5.6 SolGemini 3.1 Pro
SWE-bench Pro 181.281.28079.264.6
SWE-bench Multilingual 189.189.186.689.5
SWE-bench Multimodal 154.754.754.159.4
DeepSWE v1.1 167.4%
FrontierCode 1.1 Extended(Fable 5.1 medium;Fable 5 xhigh)163.6%64.9%
FrontierCode 1.1 Main(Fable 5.1 medium;Fable 5 xhigh)150.9%53.5%
FrontierSWE v2(0–1)10.570.480.520.32
Terminal-Bench 4.0 155.8%60.9%42.0%45.0%52.3%37.3%
Terminal-Bench-Science 0.1 152.6%24.7%29.0%22.4%
CursorBench 3.2.0(max effort)173.4%70.5%70.0%67.2%
CursorBench 3.2.0(Fable 5.1 medium)168.0%67.2%
CritPT-Corrected(max effort with tools)1官方图示未逐点标数
ArXivMath(无工具)191.33%图示未逐点标数86.73%65.99%
ArXivMath(有工具)193.88%图示未逐点标数
ProgramBench(单代理,166 个 golden tasks)187.6%86.3%85.4%
Multi-Agent ProgramBench(曲线)1官方图示未逐点标数
HLE(no tools)160.9%57.8%56.6%
HLE(with tools)165.0%63.8%63.6%
DRACO(工具代理,judge 口径见说明)1官方图示未逐点标数
Chartography(无工具)142.6%36.6%29.6%图示未逐点标数图示未逐点标数
Chartography(有工具)186.2%84.2%83.0%
BenchCAD Vision2Code(无工具;Claude 为随机 1,000 文件子集)10.4370.3760.366图示未逐点标数
BenchCAD Vision2Code(有工具;Claude 为随机 1,000 文件子集)10.8430.6750.821图示未逐点标数
OSWorld 2.0(partial)177.9%72.9%75.4%
OSWorld 2.0(strict)141.7%36.1%39.6%
GDP.pdf(无工具)185.4%82.7%83.4%
GDP.pdf(有工具)185.1%87.1%85.5%
OfficeQA 180.2%79.0%78.1%
OfficeQA Pro 169.0%67.1%66.9%
Legal Agent Benchmark(core all-pass,n=5)119.09% ±0.92
Legal Agent Benchmark(core criterion-pass)190.81%
Legal Agent Benchmark(held-out all-pass)116.7%
Legal Agent Benchmark(held-out criterion-pass)193.3%
GDPval-AA v2(max effort)11853172318241711
GDPval-AA v2(Fable 5.1 xhigh)11835
AA-Briefcase(max effort)1169415721685
Toolathlon Verified(Pass@1)177.8%79.3%80.6%79.9%74.7%
Toolathlon Verified(Pass@3)181.5%86.1%87.0%88.0%84.3%
Toolathlon Verified(Pass³)173.1%73.1%73.1%71.3%65.7%
Toolathlon Verified(平均轮次,越少越好)123.719.823.520.424.5
AutomationBench 131.4%17.05%26.9%19.6%
ARC-AGI-1 197.5%98.5%97.5%96.5%
ARC-AGI-2 190.0%89.2%90.42%92.5%
HealthBench(raw)166.7%61.2%67.1%59.2%
HealthBench(length-adjusted)160.0%
HealthBench Professional(raw)174.2%68.9%73.4%62.4%
HealthBench Professional(length-adjusted)162.1%
GMMLU(42 languages)194.0%93.6%92.5%89.0%
MILU(11 languages)193.0%92.9%92.1%89.3%
ExploitBench(cyber)1官方图示未逐点标数官方图示未逐点标数官方图示未逐点标数
OSS-Fuzz(cyber)1官方图示未逐点标数官方图示未逐点标数官方图示未逐点标数
Firefox 147(cyber)1官方图示未逐点标数官方图示未逐点标数官方图示未逐点标数
ExploitGym(cyber)1官方图示未逐点标数官方图示未逐点标数官方图示未逐点标数
BioMysteryBench(Human Solvable)190.3%90.1%91.4%84.9%86.1%83.6%
BioMysteryBench(Human Difficult)144.1%44.7%51.8%39.4%28.8%32.9%
SpatialBench Verified 177.6%69.2%72.5%67.8%
SingleCellBench 161.9%59.3%60.6%56.2%
ProteinGym Hard 149.3%45.8%47.7%36.6%35.5%37.0%
Protein Design(Sequence Generation)146.0%40.4%42.4%20.2%
Protein Design(Library Ranking)149.3%48.2%48.0%41.3%
Organic chemistry, V2 169.2%64.3%65.7%43.7%43.2%45.9%
Protocols(Troubleshooting)170.2%66.6%61.1%62.3%56.4%58.1%
Protocols(Understanding)177.2%69.7%80.0%60.5%63.9%52.8%
表中 Fable 5.1 / Mythos 5.1 在官方汇总中有时被合并,但正文详细章节能拆出差异的地方已分别列出;没有拆出数字的列保留空白。HealthBench Professional 的 62.1% 是 length-adjusted,不与 raw 行混排。Toolathlon Verified 的平均轮次是越少越好,其余指标是越高越好。1

长程执行先拉开差距

最清楚的提升出现在需要持续执行、反复验证和处理复杂状态的任务。Fable 5.1 在 Terminal-Bench-Science 0.1 上为 52.6%,Fable 5 为 24.7%,Opus 5 为 29.0%;在 FrontierSWE v2 上为 0.57,超过 Opus 5 的 0.52 和 Fable 5 的 0.48。CursorBench 3.2.0 的 max-effort 结果也从 Fable 5 的 70.5% 上升到 Fable 5.1 的 73.4%,而官方同时报告 Fable 5.1 medium effort 为 68.0%,高于 GPT-5.6 Sol max effort 的 67.2%。1
这些数字共同指向一个较窄但有用的判断:Fable 5.1 的主要增量不只是短题准确率,而是让 agent 在长时间执行中更少丢失上下文、更多完成验证闭环。ProgramBench 的 166 个稳定任务上,Fable 5.1 为 87.6%,Fable 5 为 86.3%,Opus 5 为 85.4%;但 FrontierCode 1.1 Extended 和 Main 上,Fable 5 在 xhigh effort 仍分别以 64.9% 和 53.5% 高于 Fable 5.1 medium 的 63.6% 和 50.9%。后一个反例说明:当 grader 对“只改任务范围内文件”惩罚额外改动时,更高 effort 可能把更积极的执行变成扣分。1
Toolathlon 更能说明“完成率”和“执行成本”不是同一个维度。Fable 5.1 的 Pass@1 为 77.8%,低于 Opus 5 的 80.6% 和 Mythos 5 的 79.3%;Pass³ 三者都是 73.1%。平均轮次上,Mythos 5 的 19.8 少于 Opus 5 的 23.5 和 Fable 5.1 的 23.7。与此同时,Fable 5.1 使用了生产 safeguards 和拒答 fallback,而其他对照配置不同,因此这些数字更适合用来判断不同部署配置下的行为,不适合抽象成纯粹的权重排名。1

知识工作与电脑操作不是同一件事

在需要生成可交付工作产物的任务上,Fable 5.1 的位置更稳定。GDPval-AA v2 的 max-effort ELO 为 1853,高于 Opus 5 的 1824、Fable 5 的 1723 和 GPT-5.6 Sol 的 1711;AA-Briefcase 为 1694,高于 Opus 5 的 1685 和 Fable 5 的 1572。AutomationBench 也从 Fable 5 的 17.05% 上升到 Fable 5.1 的 31.4%,高于 Opus 5 的 26.9% 和 GPT-5.6 Sol 的 19.6%。1
电脑操作的结果同样支持这个方向,但必须保留指标的含义。OSWorld 2.0 的 partial 分数从 Fable 5 的 72.9% 到 Fable 5.1 的 77.9%,strict pass 从 36.1% 到 41.7%;HLE 则从 Fable 5 的 57.8% / 63.8% 提升到 Fable 5.1 的 60.9% / 65.0%,分别对应 no tools / with tools。Chartography 在有工具时从 84.2% 到 86.2%,BenchCAD Vision2Code 的 voxel IoU 从 0.675 到 0.843。工具让模型可以裁剪、执行、检查中间结果,所以“有工具”不是单纯给同一模型加一个开关,而是改变了任务闭环。1
这里有两个容易误读的边界。第一,OSWorld 使用 benchmark 作者的 2026 年 8 月任务发布版,Fable 5 和 Opus 5 已在同一条件下重跑,但任务文件与更早版本不同,所以不能拿旧版 OSWorld 数字继续横比。第二,BenchCAD 的 Claude 结果来自随机 1,000 个文件子集,而 GPT 的公开数字来自完整 17,900 个文件;表中保留 GPT 的“图示未逐点标数”,不把不同评测范围拼成一个精确排序。1
Fable 5.1 也没有在每个知识或推理任务上取第一。ARC-AGI-1 上,Fable 5 的 98.5% 高于 Fable 5.1 的 97.5%;ARC-AGI-2 上,GPT-5.6 Sol 的 92.5% 高于 Opus 5 的 90.42% 和 Fable 5.1 的 90.0%。HealthBench raw 上 Opus 5 的 67.1% 也略高于 Fable 5.1 的 66.7%。这些反例把结论限制在长程执行和专业工作流等已被材料支持的维度,而不是“全面第一”。1

Mythos 5.1 的专业分化

网络安全是两种配置差异最直观的地方。System Card 报告 Fable 5.1 和 Mythos 5.1 的整体 cyber 能力达到 Anthropic 已发布模型中的最高水平,并在 ExploitBench、OSS-Fuzz、Firefox 147 和 ExploitGym 等评测上重点展示 Mythos 5.1 相对 Opus 5 的优势;但这些项目在当前可读材料中主要以图表呈现,逐点分数没有可靠打印,因此表中只标“官方图示未逐点标数”。1
生命科学部分给出了更完整的数字。Mythos 5.1 在 SpatialBench Verified 上为 77.6%,高于 Opus 5 的 72.5% 和 Mythos 5 的 69.2%;在 SingleCellBench 上为 61.9%,高于 Opus 5 的 60.6% 和 Mythos 5 的 59.3%;ProteinGym Hard 为 49.3%,高于 Opus 5 的 47.7% 和 Mythos 5 的 45.8%;Organic chemistry, V2 为 69.2%,高于 Opus 5 的 65.7% 和 Mythos 5 的 64.3%。Protocols Troubleshooting 也是 Mythos 5.1 领先,70.2% 高于 Mythos 5 的 66.6% 和 Opus 5 的 61.1%。1
但生命科学并非每行都支持“新版本全面替代旧版本”。BioMysteryBench Human Difficult 上,Opus 5 为 51.8%,Mythos 5 为 44.7%,Mythos 5.1 为 44.1%;Protocols Understanding 上,Opus 5 仍为 80.0%,高于 Mythos 5.1 的 77.2%。ArXivMath 的 Mythos 5.1 结果也要保留题集风险:91.33%(无工具)和 93.88%(有工具)来自 2026 年 6 月 arXiv 摘要题集,System Card 明确说训练数据可能与该时间重叠,污染不能排除。1
这组交叉结果说明了 Mythos 5.1 的真实位置:更宽松的专业 safeguards 让同一权重能够把代码执行、工具调用和领域工作流转化为生命科学或网络安全成果;但 safeguards 的放宽不会自动消除 benchmark 的题集、grader 或任务难度差异,也不会让每个专业子任务都超过 Opus 5。专业领先和普通可用性是两个独立变量。

评测口径决定选型边界

表中的数字首先是条件化测量,而不是一个跨任务的总分。Terminal-Bench-Science 每个模型的标准误差为 ±3.5–4.5 个百分点,且任务结果高度两极化;接近这个范围的差距不能写成确定性优势。FrontierCode 对任务范围外的额外修改判失败,所以 Fable 5.1 的高 effort 分数会因更积极的改动下降。OfficeQA 的绝对分数会随 PDF 读取方式明显变化;HealthBench Professional 的 62.1% 是 length-adjusted,不能与 74.2% raw 或其他 raw 分数直接并排解释。1
价格改变了长程 agent 的实际门槛。Fable 5.1 的 cache reads 为每百万 token 0.25 美元,普通 input/output 价格仍为每百万 input tokens 10 美元、每百万 output tokens 50 美元;Anthropic 估计典型 workload 相对 Fable 5 成本低约 25%,高度 agentic workload 最高约低 45%。这是特定计费结构和 workload 的估计,不是每个 benchmark 或每个请求都固定便宜相同幅度。1
因此,三个边界比一个总排名更可靠:
  • 一般软件工程、知识工作、电脑操作和长程 agent 任务,Fable 5.1 已经在本轮公开数字中明显超过 Fable 5,并在 GDPval-AA v2、CursorBench、AutomationBench、OSWorld 等项目上处于领先位置;但 ARC-AGI-1、Toolathlon Pass@1、HealthBench raw 等反例说明,读者仍应按任务类型看表。
  • 需要网络安全漏洞研究或生命科学研究能力的受审查组织,才有理由关注 Mythos 5.1 的专业列;其生命科学和网络安全结果不能转写成普通 Fable 5.1 用户的默认能力,因为访问权限和 safeguards 不同。
  • 对长上下文、重复工具调用和持续验证最敏感的工作,Fable 5.1 的成本变化与 CursorBench、GDPval-AA v2、AA-Briefcase 等结果一起看,信息量高于单独比较一个最高分;但工具条件、fallback 和评测版本必须保持一致,才有可复核的结论。
本轮最稳妥的判断不是“同一权重带来两个排名”,而是:Fable 5.1 把长程工程和知识工作推进到更低成本的通用可用配置,Mythos 5.1 则把同一能力继续推向受限的网络安全和生命科学工作流;两者的差异首先是安全边界,随后才在可执行任务的分数上显现。

Fuentes de referencia

  1. 1

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado