
从模型到 Agent Harness:Practical AI 解释多智能体系统到底多了什么
Practical AI 第 367 集把 model、agent、agent harness 和 multi-agent system 拆成可操作的架构层,重点解释权限、供应商依赖与小步试错之间的取舍。
单集信息
| 字段 | 内容 |
|---|---|
| 播客 | Practical AI 1 |
| 主持人 | Daniel Whitenack,Prediction Guard CEO;Chris Benson,Lockheed Martin AI / Autonomy Research Engineer 1 |
| 嘉宾 | 无;本集是两位主持人的双人对谈 |
| 集标题 | Models, Harnesses, and Multi-Agent Systems,Episode #367 1 |
| 发布日期 | 2026 年 8 月 6 日(北京时间)1 |
| 原集链接 | Practical AI 第 367 集 |
如果把模型看成一个「输入—输出」函数,agentic AI 新增的部分就不在模型本身,而在它周围的业务逻辑、权限、工具和执行循环。这是 Practical AI 第 367 集最值得带走的判断。Daniel Whitenack 和 Chris Benson 没有追逐某个新模型,而是先把 model、agent、agent harness、multi-agent system 拆开,再讨论企业为什么会同时需要可替换的模型和垂直整合的产品栈。1
四层东西,别再混成一个「AI 系统」
两位主持人的定义可以压缩成下面四层。它们的边界决定了部署时该买什么、自己维护什么,以及风险应该落在哪一层。1
| 层 | 本集的定义 | 具体例子 |
|---|---|---|
| Model | 对数据做一次转换的函数,例如文字生成文字、图像生成文字或预测未来数值。1 | LLM、vision-language model、image generation model |
| Agent | 围绕一个目标运行、至少具备部分自主性的应用软件。1 | 读取邮件、日历和企业数据库后完成一个任务 |
| Agent harness | 管理模型、agent、工具调用和执行流程的软件层,Chris 把它比作 AI 的 operating system。1 | 任务编排、权限、状态和多模型路由 |
| Multi-agent system | 多个拥有不同职责、权限或专长的 agent 协作完成复杂目标。1 | 供应链异常、网络防御或机器人任务的分工协作 |
这张表里最容易被忽略的是 agent harness。普通聊天界面把用户输入几乎原样交给模型,再把输出交回来;agent 则需要访问 Gmail、WhatsApp、Google Drive、日历,或企业的 NetSuite、Workday 和交易数据库。模型生成的是建议,harness 才决定能调用哪些工具、以什么权限执行、失败后是否重试,以及是否把结果交给另一个 agent。1
Agent 的分界线不是「会不会聊天」
Daniel 给出的区分很实用:AI feature 通常是人和软件之间的一问一答,用户输入后等结果;agent 则接收一个结果或目标,在没有人逐回合盯着的情况下推进任务。自动生成现金流预测可以是一个 AI feature;连接企业系统、自己完成一组操作的程序,才更接近 agent。1
多 agent 的必要性也不来自「数量越多越先进」。它来自任务的边界和权限边界。一个 agent 不应该同时拥有整个公司的所有数据和操作权;让采购异常、供应商搜索、订单草拟分别由不同 agent 处理,可以把职责拆开,也可以让每个 agent 使用更合适的模型。代价是编排、通信、权限和故障恢复都更难,系统不能只看单个模型的回答质量。1
节目给了三个层次不同的例子。网络攻击发生时,多个防御 agent 可以分别盯住组织的不同系统;制造业收到供应商告警后,一个 agent 识别供应链问题,另一个搜索替代供应商,再由后续流程把结果写入 NetSuite。机器人和无人机则把安全约束推到现实世界:agent 不只要完成任务,还得考虑设备失联、人与设备碰撞,以及动作是否会造成伤害。1
反直觉的地方:更强模型不会自动消灭多 agent
节目把「未来只需要一个更强的模型」和「多 agent 是过渡性补丁」放在一起讨论。Chris 的答案很明确:模型会继续变强,但在资源受限的设备和复杂的现实系统里,许多更小、更专门的模型仍然会以不同方式协作。他甚至判断 multi-agent architectures 会变成基础设施的一部分,而不是一个很快被淘汰的产品名词。这个判断是嘉宾的观点,不是本集给出的实验结论。1
他还区分了 fleet 和 swarm:「A swarm is usually a fleet, but a fleet is not necessarily a swarm.」前者强调大量实体之间的交叉通信和任务共享,后者可以只是多个各自负责一块工作的 agent。这个区分看似术语问题,实际对应不同的通信成本和控制方式。1
Daniel 用 F1 pit stop 作类比:团队把原本约 20 秒的动作压到约 2 秒,靠的不是每个人都变成全能选手,而是让一个人只负责一个非常具体的动作。放到企业里,人可能从执行单点任务变成带领一组 agent 的 team principal 或 strategist。这个比喻有启发,也有代价:如果更多人被推向策略层,组织到底需要多少人、谁拥有最终权限,就不能靠「效率提升」四个字带过。1
可替换模型与垂直整合,两个方向都会存在
另一场讨论是模型是否会像零件一样被 agent harness 随时替换,还是用户会直接购买一套从模型、算力到界面的垂直产品。节目没有把它包装成赢家通吃的竞争。Chris 认为两者会并存:Gemini、Claude、OpenAI 的 frontier models 适合某些任务;Gemma 等较小模型可以在设备上运行,成本和控制权又是另一组约束。1
垂直整合的优势是开箱即用,尤其当企业已经深度使用 Google Workspace 或 Microsoft 365;可替换架构的优势是控制权、迁移能力和长期成本。Daniel 的判断是,企业的核心 digital workforce 不应完全寄托在某个厂商的内置 widget 上。厂商改价、改权限或改变产品方向,都可能把一项关键流程变成别人的开关。主持人还回顾了「token maxing」很快被成本追上的阶段,转而主张先看任务、架构和经济性,再决定模型。1
真要落地,从小任务和备份方案开始
节目最后没有给出一张成功率排行榜,而是给了一个更朴素的起点:先选一个边界清楚的小任务,允许快速迭代,记录模型、权限、工具调用和人工接管分别出了什么问题。Chris 还提醒,单一 vendor 的垂直整合可能在一次产品变更后影响企业的高价值流程,因此实验时要准备替代模型、替代 harness,甚至多套备份方案。1
这也是本集的证据边界:46 分 49 秒的节目提供了术语、架构判断、网络安全、机器人和供应链的例子,但没有给出某个 multi-agent system 的成功率、成本曲线或企业部署实验。它适合用来校准系统设计的语言,不适合拿来证明「多 agent 已经在某行业普遍创造了多少 ROI」。
可引用原话
「An AI model is really a transformation of data.」——Daniel Whitenack 1
「I personally am quite convinced that multi-agent architectures ... will be absolutely and completely pervasive in the future.」——Chris Benson 1
「I would start small with the expectation of rapid iteration.」——Chris Benson 1
适合谁,哪些可以跳过
- 适合:正在设计 agent runtime、企业 AI 控制面、模型路由、权限系统或多模型部署的工程师;需要向产品和管理层解释「模型之外还要建设什么」的人,也能从这集的分层中找到说法。
- 核心增量:把 model、agent、harness 和 multi-agent system 分开后,读者能分别判断模型能力、执行控制、权限风险和供应商依赖,而不是用一个「AI 系统好不好」的问题覆盖全部责任。
- 可以跳过:如果你只想看新模型 benchmark、论文实验数字或具体框架的代码教程,这集不是合适的入口;它的重点是架构词汇、组织分工和落地取舍。最后约 10 分钟的模型可替换性、垂直整合和小步试错最值得保留。
References
- 1官方单集页
youtube.com

AI 工程与研究播客精读
盯住 8 个英文 AI 技术播客,新一集发布后产出中文高信噪比精读,一集一篇。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
More from this channel›
- AI 不只是找漏洞了:Truffle Security 与 Socket 解释为什么 supply chain 成了第一防线
- vLLM 不只是推理库:Inferact 如何把 open-weight 模型变成可控的 AI 基础设施
- 视频不是一串字幕:TwelveLabs 如何用 Marengo、Pegasus 和 Jockey 把 10 万小时变成可检索资产
- Trillion-Dollar AI 公司不是估值题:No Priors 把「市场多大」与「多久做成」分开
- 从 0.1% 到约 15%:Chai Discovery 为什么把药物设计当成 scaling problem
- 从 200,000 个 token 到 10× 加速:Baseten 如何把模型权重变成可用 API
- 从 2.8 万亿参数到 365,000 个环境:Last Week in AI #253 重新定义 AI 进展的单位
- AI 先接管暖气维修的调度层:Netic 为什么不急着造机器人