别只调提示词:Agent harness 要进控制层챕터1×0:08开场0:47事件播报2:08技术拆解3:18工程意义4:11落地建议5:00收尾0:005:430:08主持人过去二十四小时里,我没有看到足够新的独立一手事件,能撑起一期扎实的 Agent Loop 深挖。所以今天把窗口扩大到近一周,讲七月八日 LangChain 和 NVIDIA 发布的 NemoClaw Deep Agents 蓝图。它不是单纯多了一个编码 Agent,而是把模型、工具、沙箱、审批、审计和评估放进同一条受控执行链。0:29主持人这期的核心问题是:长循环 Agent 真正进入生产后,控制权到底放在哪里?如果一切都靠提示词约束,系统看起来灵活,出了事却很难追责。NemoClaw 和 Deep Agents Code 给出的答案是,把模型外面的 harness 做成可治理的工程层。0:47主持人先说事件。LangChain 公告称,NemoClaw for LangChain Deep Agents blueprint 已经可用。它组合了三层:Nemotron 三 Ultra 这样的开源模型,Deep Agents Code 这个负责计划、读写文件、调用工具和执行任务的 harness,以及 NVIDIA OpenShell 运行时。换句话说,Agent 不是直接扑到代码仓库上,而是在沙箱和策略里工作。1:11主持人配套技术文章把风险说得很直:编码 Agent 可能读写文件、跑 shell、装依赖、访问网络。NemoClaw 的做法是默认拒绝网络出口,敏感操作需要人批准,凭据留在沙箱外,运行过程可以快照成审计日志。对老系统迁移、依赖升级和安全修补这类任务来说,这些边界和记录,往往比模型一次回答得漂亮更重要。1:37主持人还有一条性能线。LangChain 同日的 harness 调优文章说,他们固定 Nemotron 三 Ultra 的模型权重,只调整系统提示、工具描述和 middleware,把 Deep Agents suite 的典型得分从大约零点八零推到零点八四,最好一次到零点八六。公告还给出一次完整 suite 约四点四八美元、对比四十三点四八美元的成本差异。这个数字不能外推到所有任务,但足以说明:长循环 Agent 的质量和成本,不只由模型决定。2:08主持人harness 不是更长的系统提示。它是模型外面的执行架构:任务怎么拆,工具怎么暴露,工具结果回到上下文哪里,什么时候重试,什么时候停止,什么时候要求人确认,哪些 trace 必须留下。模型负责推理和生成,但系统里的确定性约束,不应该全交给模型记住。2:28主持人LangChain 的例子很有工程味。他们发现,把「文件读满一页就继续读」写进工具描述里,模型未必照做;把同一句提醒放在工具返回结果旁边,效果反而更好。原因很简单:Agent 是在观察、行动、再观察的循环里工作,规则出现的位置,决定了模型在那一刻能不能真的用上。2:50主持人另一个例子是 middleware。调用次数上限、工具失败后只重试一次、计划写完以后再检查计划,这类东西不适合靠「请你总是这样做」。代码在循环边上拦一下,比把十条纪律塞进提示词里可靠。七月九日提交到 arXiv 的《From Prompts to Contracts》也得出类似方向:把确定性行为移到代码、manifest、schema 和验证工件里,让有来源支撑的声明成为回答依据。3:18主持人对团队来说,关键不是「开源模型终于能替代闭源模型」。更准确的问题是:你的 Agent 循环里,哪些权力属于模型,哪些属于 harness,哪些属于运行时策略,哪些必须留给人?层次拆开以后,失败才有地方归因。是模型不会推理,还是工具描述放错了位置?是权限太松,还是 eval 没覆盖?这些答案会指向完全不同的修复动作。3:44主持人成本也要放在这套结构里看。长循环 Agent 一次任务会有很多次模型调用,还会反复读文件、压缩上下文、调工具、验证结果。便宜模型有价值,但如果 harness 让它反复读错文件、漏掉历史或过早停止,便宜也会被浪费。反过来,一个更稳的 harness 可以让团队用同一个模型跑更多 eval、比较更多工具方案,并把真实失败样本收回改进循环。4:11主持人如果你的团队已经在做编码 Agent、研究 Agent 或内部运维 Agent,先做四个检查。第一,列出 Agent 能执行的所有外部动作,尤其是文件写入、shell、网络、凭据和审批。会改变外部世界的动作,不要只靠模型自觉,至少要有权限边界、日志和可回放记录。4:31主持人第二,把失败样本从「模型答错了」改写成 trace 里的行为模式。它是没读完文件,没理解工具返回,没复核计划,还是测试失败后继续写?第三,给关键输出做合同:哪些声明必须有来源,哪些字段不能出现在用户面前,哪些建议必须降级成事实陈述。第四,先把默认拒绝网络、敏感命令等人点头、循环次数到上限就停这些朴素控制做好。5:00主持人今天这条动态给我的判断是:Agent Loop Engineering 正在从「模型会不会想」转向「系统让不让它安全地做」。NemoClaw 蓝图不一定是唯一答案,但它把问题摆得很直:长循环 Agent 需要一个能被审计、能被调优、也能替换模型的执行层。5:18主持人你可以带走一个检查题:如果明天把你现在的 Agent 换成另一个模型,哪些安全、来源、审批和追踪保证还会继续成立?如果答案是「主要靠提示词里写着」,那这条循环还没有真正工程化。