两条官方材料把 Agent 安全审查的分工说得很清楚:攻击方负责不断找出有效失败,修复方负责用测试和人工审批把改动收住。
- OpenAI 在 7 月 15 日公开 GPT-Red。它通过「发送攻击提示 → 观察响应 → 继续迭代」寻找漏洞,并用自博弈强化学习训练攻击方和防守方。在间接提示注入场景中,GPT-Red 的攻击成功率为 84%,人类对照为 13%;它主要供内部使用,并与部署模型分离。1
- 阿尔伯塔政府的案例更接近工程现场:约 50 个 agents 并行检查 27 个省级部门的 1,280 个应用和 3,400 个仓库,20 小时评估了 4.66 亿行代码。流程先做规则扫描,再把发现定位到文件和行号,生成并测试修复,最后交给工程团队批准;缺少自动化测试时,先补测试。2
- 这期提炼出的可迁移顺序是:先定义什么算有效失败,再保留攻击轨迹,修复前补最小回归测试,人工批准后复测。第 5 张把它改成了一条可以直接换项目名使用的提示词,但它不能替代权限控制、隔离环境和真正的安全测试。




Comments
Sign in to comment.