OpenAI Presence:让企业 Agent 从上线走向持续改进Capítulos1×0:08事件播报1:30这条消息里的循环2:44技术背景:从结果评估到路径评估3:51给团队的落地建议4:46一个需要盯住的边界0:005:460:08早间主持人OpenAI 在 7 月 22 日发布了 Presence。它不是一个面向所有人的自助式 Agent Builder,而是一套只向符合条件的企业客户开放的产品,用来把语音和聊天 Agent 放进客服、外呼销售,以及高风险的内部工作流里。0:24早间主持人OpenAI 给出的工作方式很具体。每次部署先从一个明确任务开始,比如处理账单问题、支持保险理赔,或者响应员工的 IT 服务请求。Agent 只拿完成这项任务所需要的知识和系统权限。0:40早间主持人企业可以自己规定 Agent 能做什么,哪些动作必须审批,什么情况下交给人工。Presence 目前仍是有限开放,部署通常由 OpenAI 的前线工程师和系统集成商参与,并不是点几下按钮就能上线的标准 SaaS。0:58早间主持人OpenAI 还披露了一个已经运行的案例:它的英文电话支持渠道使用 Presence 处理开放式来电、核验来电者、读取账户上下文,并执行批准过的操作。OpenAI 声称,这个渠道目前有百分之七十五的来电可以在没有人工协助的情况下解决。1:15早间主持人另一个数字更贴近 Loop Engineering。OpenAI 说,在十天里,Codex 驱动的改进循环让人工转接下降了十五个百分点。这里的重点不是一个漂亮的成功率,而是生产会话真的被接回了 Agent 的下一轮工程修改。1:30早间主持人Presence 的设计可以拆成三段。第一段是上线前的控制循环。团队先写清楚标准操作流程、政策、护栏和批准动作,再用模拟请求、边缘案例和高风险场景去压测 Agent。1:44早间主持人评估不只看最后有没有答对。OpenAI 的描述里,grader 还会检查 Agent 有没有遵守政策、有没有正确使用工具,以及该升级给人工时有没有真的升级。1:55早间主持人第二段是运行时循环。Agent 做事时,每一次模型调用、工具调用、Agent 切换、护栏触发和人工交接,都应该留下可检查的执行记录。OpenAI Agents SDK 文档把这些记录称为 traces,并明确建议先用 trace 调试,再进入评估循环。2:14早间主持人第三段是生产改进循环。生产会话、人工升级和质量信号先暴露问题,Codex 再分析这些信号,提出政策、工具流程或 Agent 行为的更新。团队可以先在生产版本上测试提议,再决定是否受控发布。2:30早间主持人这三段连在一起,才构成一个完整的 Agent loop。上线前的模拟解决可预见的问题,运行时的 trace 解释问题怎么发生,线上信号则告诉团队哪些问题值得优先修。2:44早间主持人很多团队做 Agent 评估,习惯只看最终答案。可是在真实工作流里,同一个答案可能来自完全不同的路径:一次用了正确权限和合规工具,另一次绕过审批、读了过多数据,最后碰巧答对。3:00早间主持人OpenAI 的 trace grading 文档把 trace evals 放在更细的层级上。Trace 是 Agent 的端到端执行记录,里面可以看到决策、工具调用和推理过程;grader 按测试标准给这些执行过程打分,再用一批已评分的 trace 去比较版本、发现回归。3:19早间主持人这正好解释了 Presence 为什么把模拟、grader、人工接管和 Codex 放在一起。一个企业 Agent 的质量,不是上线那天测一次就结束,而是每次失败都要能定位到动作、权限、政策或者交接环节。3:36早间主持人从工程角度看,这相当于把 Agent 的控制面从 Prompt 扩展成四类东西:任务边界、可执行动作、可观察轨迹,以及能够回滚的发布流程。模型当然还在循环里,但它不再是唯一的控制点。3:51早间主持人如果你正在做企业 Agent,我建议先选一个边界窄、结果能验收的任务。不要一开始就说让 Agent 负责整个客服部门,可以先做一种账单解释,或者一种内部工单分流。4:04早间主持人第二步,把动作分成三档:只读、可逆写入、不可逆操作。前两档可以逐步放量,最后一档必须有明确审批和人工接管,而且要把升级原因记录下来,不能只记一个失败状态。4:17早间主持人第三步,评估用例要覆盖路径。除了问答案对不对,还要检查用了哪个工具、读了什么数据、是否遵守权限、何时暂停,以及人工接手后能不能继续完成任务。4:29早间主持人最后,把线上反馈接回版本管理。每次策略、工具描述或路由变化,都应该能回到一组历史 trace 上重跑,知道它修复了哪个问题,又有没有引入新的回归。没有这一步,所谓自我改进很容易变成凭感觉调 Prompt。4:46早间主持人Presence 现在仍然是有限开放,OpenAI 参与部署,也说明这套产品还没有把企业 Agent 的复杂性压缩成一个通用按钮。它把很多工程工作明确摆到了台面上:权限怎么给,风险动作谁批,失败由谁接手,线上数据怎样推动下一版。5:03早间主持人所以今天这条动态最值得带走的判断是:企业 Agent 的核心交付物,不只是一个会回答问题的模型,而是一条能够被评估、被暂停、被接管、被回放,也能根据生产信号持续修改的执行循环。5:18早间主持人下次你看到一个 Agent 产品宣称自己已经可以上线,可以先问一句:它有没有把一次失败变成下一次可验证的改进?这个问题,往往比模型排行榜上的分数更接近生产现实。5:31早间主持人这里是 AI Loop Engineering 每日深度播客,我们明早继续。