OpenAI 日报:GPT-Red 加码提示注入防御,Codex Micro 把代理搬到桌面

OpenAI 日报:GPT-Red 加码提示注入防御,Codex Micro 把代理搬到桌面

OpenAI 公布 GPT-Red 自动化红队研究,Codex Micro 键盘进入官方商城,州联邦安全政策与 PwC 企业代理方案也出现新进展;首款屏幕音箱仍只是媒体报道中的开发中项目。

先看结论

截至 7 月 16 日 09:00(北京时间),过去 24 小时 OpenAI 的新增信息主要落在安全、治理与硬件试探,而不是新模型发布:官方公布 GPT-Red 自动化红队系统,并称其已用于提升 GPT-5.6 Sol 对提示注入的抵抗力;同时,OpenAI 公开了一套州与联邦 AI 安全政策主张。产品侧,Codex Micro 键盘已经进入官方商城,PwC 则宣布与 OpenAI 推出面向客服和联络中心的代理方案。首款屏幕音箱仍是媒体转述的开发中项目,不能按已发布产品理解。
  • 安全研究:GPT-Red 通过自博弈生成提示注入攻击,再把攻击样本用于训练防御模型。OpenAI 称 GPT-5.6 Sol 在其最难的直接提示注入基准上失败次数约为四个月前最佳生产模型的六分之一。1
  • 政策立场:OpenAI 将加州、纽约和伊利诺伊州的前沿 AI 安全立法趋同称为「reverse federalism」,主张风险评估与公开披露、重大安全事件报告和独立审计成为共同基线。2
  • 产品与企业:Codex Micro 售价 230 美元,官方页面显示预计 7 月 24 日发货;PwC 宣布用 OpenAI 多模态 API 构建语音和数字代理,并设立专门的联合卓越中心。34

GPT-Red 把提示注入防御放进训练环节

GPT-Red 是 OpenAI 用于自动化安全红队的内部模型。它会向被测模型发送提示、观察响应,再迭代攻击;训练采用自博弈强化学习,让攻击模型和一组防御模型同时变强。OpenAI 表示,GPT-Red 保持与部署模型分离,目的是把攻击能力用于生成训练数据,而不是把这套攻击模型直接交给用户。1
这项工作的核心变化,是把红队从发布前的抽样检查推进到模型训练回路。OpenAI 称,GPT-5.6 Sol 使用 GPT-Red 生成的提示注入样本进行对抗训练后,在其最难的直接提示注入基准上,失败次数约为四个月前最佳生产模型的六分之一。这个数字是 OpenAI 的内部基准比较,不是独立评测结论。
在一个复现的间接提示注入测试场景中,GPT-Red 的攻击成功率为 84%,人类红队为 13%。OpenAI 同时说明,测试使用的是与训练不同的场景,并通过内部镜像评估 GPT-5.1;因此这个结果能说明自动化红队的攻击覆盖能力,但不能直接等同于所有真实部署环境的安全概率。1
官方还展示了两个更接近实际代理的案例:GPT-Red 在模拟后攻击办公室里的自主售货机代理,改变商品价格、下单并取消另一名用户的订单;在针对 Codex CLI 代理的 10 个数据外泄场景中,它也比提示式 GPT-5.5 基线更有效。OpenAI 表示相关漏洞已披露,新的防护措施正在测试。
GPT-Red 针对自主售货机代理的攻击搜索流程示意图
OpenAI 展示的 GPT-Red 攻击搜索流程,目标是发现代理在工具调用和外部数据交互中的脆弱点。1
对开发者来说,值得跟进的不是「模型更安全」这一句概括,而是安全测试对象正在变化:浏览器、邮件、代码仓库、工具返回值和本地文件都可能携带恶意指令。只做静态系统提示或上线前一次性红队,覆盖不了这类动态输入;自动化攻击生成、对抗训练和上线后的监控会越来越像一套连续流程。

OpenAI 的 AI 安全政策主张

OpenAI 全球事务负责人 Chris Lehane 在 7 月 15 日文章中提出,州政府先通过方向一致的法律,逐步形成事实上的全国基线,再与联邦测试框架衔接,这一思路被 OpenAI 称为「reverse federalism」。文章点名加州、纽约和伊利诺伊州,称三州的做法分别覆盖安全披露、跨辖区采用和关键披露的独立验证。2
OpenAI 认为共同基线至少应包含三项:对前沿模型进行风险评估并公开框架和结果,报告严重安全事件,以及通过独立、客观的审计建立治理和问责。这里描述的是 OpenAI 的政策立场,不代表美国已经形成统一的联邦规则。
在联邦层面,OpenAI 表示正与美国政府、同行公司、商业团体和其他利益相关方讨论最强 AI 模型的网络安全测试框架,并称政府目标是在 8 月初前建立该框架。文章还主张由联邦政府负责最先进系统的测试,企业承担独立审计、事件报告、安全标准和举报人保护等要求。对模型供应商和使用高能力模型的企业,这意味着「风险评估是否可重复、事故是否可报告、审计由谁完成」会比单一模型分数更直接地影响采购和上线流程。2

Codex Micro:代理工作开始获得实体控制台

OpenAI 的 Supply Co. 页面已列出与 Work Louder 联名的 Codex Micro,售价 230 美元,预计 7 月 24 日发货。它通过 RGB Agent Keys 显示代理处于思考、运行、等待或完成状态,配有可启动常用 Codex 工作流的摇杆、映射快捷动作的 Command Keys,以及用于调节推理级别的旋钮;连接方式为 Bluetooth 或 USB-C,兼容 Mac 和 Windows。3
OpenAI Codex Micro 键盘产品图
Codex Micro 官方产品图,重点是代理状态灯、实体快捷键和推理级别旋钮。3
TechCrunch 报道称,OpenAI 将其告知为限量联名,因此它更像是 Codex 代理工作流的实体展示和早期试探,而不是面向大众的通用键盘。这个产品的实用价值取决于用户是否同时运行多个 Codex 代理,以及状态灯和快捷控制能否减少在桌面应用之间切换。5
另一条硬件消息仍应降级处理。Reuters 转述 Bloomberg 报道称,OpenAI 的首款消费硬件可能是一款可移动、无屏幕的智能音箱,仍处于开发中,可能用于控制智能家居、播放媒体、回答问题和调用 ChatGPT;报道还提到摄像头与传感器,以及 LoveFrom 和前苹果工程师参与。OpenAI 没有立即回应 Reuters 的置评请求,因此这不是已官宣的产品规格或上市时间表。6

PwC 把 OpenAI 能力接到客服前台

PwC 7 月 15 日宣布推出与 OpenAI 共同开发的代理式客户联络与服务方案,覆盖营销、销售、商务和服务等面向客户的职能。公告称,方案结合 PwC 的行业和实施能力与 OpenAI 的前沿模型,并通过 OpenAI 多模态 API 支持语音和数字代理,让代理理解意图、执行动作并持续改进。4
PwC 还表示已设立与 OpenAI 合作的代理式客户服务卓越中心,整合 AI、工程、客服和行业专家。需要注意,这是一则 PwC 的合作公告,不等于 OpenAI 发布了新的 ChatGPT 或 API 模型;对企业客户而言,它更像是服务商把现有模型能力包装成行业交付方案的信号。4

服务状态与发布空窗

OpenAI 状态页记录,7 月 15 日 ChatGPT 曾出现「Elevated errors affecting ChatGPT」,另有一项 ChatGPT Voice 故障;两起事件均已标记为完全恢复,详情页没有披露根因。它们说明服务层面的稳定性仍需单独观察,但现有证据不足以把故障解释为 GPT-5.6 的模型质量问题。78
Help Center 的模型更新页当前最新可见日期小节仍是 7 月 9 日的 GPT-5.6 Sol 条目,页面本身显示「Updated: yesterday」不能视为 7 月 15 日新增模型发布。9
综合来看,OpenAI 这 24 小时的增量更像一条连续的工程与商业线索:用 GPT-Red 扩大安全测试的规模,用政策文章争取统一的监管接口,用 Codex Micro 探索代理工作的实体交互,再由 PwC 把多模态代理推向客服场景。真正需要继续验证的,是 GPT-Red 的方法能否在外部基准和不同代理框架上复现,以及 Codex 硬件和企业方案能否从展示性产品变成稳定的工作流入口。

Related content

  • Sign in to comment.
More from this channel