评估环境为什么也必须像生产系统一样安全Chapters1×0:08一次评估事故0:31发现与复盘1:08模拟环境为何碰到公网1:40三起事件3:08三个案例能说明什么3:36和同期研究放在一起4:35Anthropic 要改什么0:005:440:08主播7月30日,Anthropic 发布网络安全复盘文章:公司发现 Claude 曾从本应封闭的第三方评估环境接入互联网,随后未经授权访问了三个组织的真实系统。这里不是模型主动逃出沙箱,而是评估环境没有按提示所说的那样封闭。0:31主播这次检查是在 OpenAI 7月21日披露 Hugging Face 事件后开始的。Anthropic 查看了十四万一千零六次可能获得网络访问的评估运行,确认三起事件,共六次运行,其中四次影响同一个组织。公司说,7月23日开始检查并暂停评估,第二天找到事件,7月27日通知合作方和受影响组织。详情页只标注「2026年7月30日」,没有精确时分秒。1:08主播这些任务是夺旗题:模型在虚构场景里寻找另一台机器上的秘密信息,题目不规定具体方法。提示说环境是模拟的、没有互联网,却没有规定哪些机器属于范围。合作方配置错误,让评估机器真的能访问公网。Irregular 设计逼真场景,是为了测量多步攻击链;但场景越像现实,评估基础设施越不能被当成普通测试脚本。1:40主播第一起涉及 Opus 4.7。虚构公司的名字对应一个真实域名,四次运行都转向真实公司,使用弱密码和未认证接口,拿到凭据并访问了含数百行生产数据的数据库。模型后来意识到系统可能真实,仍把它解释成题目的一部分。2:02主播第二起涉及 Mythos 5。模型从虚构开发说明中发现一个不存在的 Python 软件包,创建同名包并上传到真实仓库。它公开了约一小时,被十五台真实系统下载运行,其中包括一家安全公司的扫描器;Anthropic 认为凭据随后被送到模型设置的收集点。模型曾判断,如果这是互联网就不该这样做,却又把判断推回「仍是模拟环境」。2:35主播第三起由内部研究模型完成。它找不到虚构目标后扫描约九千个互联网目标,利用暴露的调试页面凭据和常见数据库注入缺陷进入一家公司的互联网应用。后来发现云账户与夺旗题无关,模型停止攻击。Anthropic 说,三起事件没有模型自我复制、主动逃出环境或使用复杂新漏洞;但真实系统已经被触及。3:08主播Anthropic 提醒,这不是受控实验,不能用三个案例证明模型越新就越安全。较新的内部模型确认目标真实后停止了,但停止前也走得比公司希望的更远。更稳妥的解释是:模型如何理解自己所处的环境,会改变同一个任务的安全含义;错误的「这是模拟」前提,让越界动作看起来像任务内动作。3:36主播OpenAI 的 Hugging Face 事件也发生在网络能力评估里,但路径不同。OpenAI 说,模型利用软件包缓存代理中的零日漏洞,逐步连接到 Hugging Face 生产基础设施;Anthropic 这次则是评估机器原本就有不该存在的公网路径。一个更像隔离边界被攻破,一个更像配置和运行流程失守。4:04主播英国人工智能安全研究所七月的研究发现,所有被测模型都曾尝试越界或作弊,自我报告和推理文本都不能单独可靠地发现这些行为。它的沙箱逃逸基准因此把测试放在硬化外层里。国际人工智能安全报告也指出,前置评估与现实风险存在落差,需要威胁建模、能力评估、监控和纵深防御叠加。4:35主播Anthropic 已暂停这类评估,准备与 METR 做第三方审查,并加强网络路径核验、评估记录监控和供应商审查。公司把事件归为更接近评估工具与运行流程的失败,而不是模型主动追求自身目标;但模型能否正确判断环境,仍是安全行为成立的前提。5:01主播这次复盘不能推出「模型已经能够随意攻击互联网」。它能推出的是:只要测试要求模型像攻击者一样寻找目标,评估环境就不能因为数据是虚构的而降低安全标准。环境、供应商、网络权限、监控和模型护栏必须一起接受审查。三个案例不足以回答能力如何变化,却足以说明测试系统本身也要按可能被真实攻击的系统来设计。