Fable 五的生物安全护栏:少误伤,不等于开放专业研究

Fable 五的生物安全护栏:少误伤,不等于开放专业研究

Anthropic 将 Fable 五的生物相关误触发减少约百分之八十五,但仍把双重用途的专业研究转交给 Opus 五;本期解释这条分类器边界为什么这样移动,以及它还没有证明什么。

0:00 / 4:22

节目导览

Anthropic 在 2026 年 8 月 7 日宣布,Fable 五的生物相关 fallback 在测试中减少约 百分之八十五。这里的 fallback,是系统把请求转交给生物能力更弱的 Opus 五,而不是让 Fable 五直接回答。1
这期解释三个问题:Anthropic 为什么一开始几乎拦下所有生物问题;这次怎样减少误报;以及「能回答更多日常健康问题」为什么仍然不等于「开放专业生物研究」。

这次更新改了什么

Anthropic 说,它重写了分类器规则,按新规则更新训练数据,听取内部和外部专家意见后重新训练并测试分类器。新的边界放行更多日常健康、教育和部分临床任务,但继续拦截公司认为具有双重用途风险的病毒学、毒理学、分子设计,以及专业生物研究和药物开发请求。1
公告给出的百分之八十五,是生物相关 fallback 的测试结果,不是分类器准确率,也不是整体安全风险下降的比例。不同产品里,所有原因造成的 fallback 降幅从百分之七到百分之六十七;原文没有公布误报和漏检的原始分母、召回率、越狱测试结果或外部独立复核。1

背景与对照

Anthropic 在 Fable 五和 Mythos 五的系统卡中称,未加相关护栏的 Mythos 五接近「非新型武器合成」能力级别,尚未越过「新型武器合成」门槛,但可能显著提升资源充足的高风险行为者的能力。Anthropic 另一篇生物风险研究则把模型知识、计划设计测试和真实实验室能力分开讨论。23
行业对照包括 OpenAI 对 GPT 五受控湿实验评估的公开结果,以及 Google DeepMind 与 Isomorphic Labs 的生物韧性方案。两者都把能力评估和系统级缓解放在一起,但公开材料的任务、指标和访问方式不同,不能直接横向排名。45
国际 AI 安全报告 2026 也把生物和化学风险列为前沿通用模型的滥用风险,并提醒技术护栏仍有明显局限,多层防护比单一措施更稳健。6

本期判断

这次公告最准确的理解是:Anthropic 在保留高风险生物研究限制的前提下,重新收窄 Fable 五的安全裕度,减少正常用户遇到的误触发。它解决了可用性问题,但还没有公开足够数据证明危险请求的漏检率、越狱表现或可信访问机制已经达到什么水平。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado