Harness 接管任务成本与持续工作:8月1日 AI 核心人物推文精选

Harness 接管任务成本与持续工作:8月1日 AI 核心人物推文精选

Levie、swyx、Steipete、Nan Yu 与 Rauch 的新帖显示,agent 的成本、路由、追加输入和反馈循环正由 harness 与基础设施共同决定。

窗口:北京时间 2026 年 8 月 1 日 00:15 至 8 月 2 日 00:05。
这一天最值得留下的,不是又一个模型名称,而是 harness 开始从「让 agent 跑起来的配件」变成任务系统的控制层:它决定工作怎样拆分、模型怎样路由、成本怎样记账,以及人类怎样把新信息塞回正在运行的任务。

先看结论

  • Aaron Levie 认为,随着单项任务从百万 token 走向数千万甚至数亿 token,harness 对准确率和成本的影响会接近模型能力本身。这是 Box CEO 的方向判断,帖中没有给出跨任务基准。1
  • swyx、Peter Steinberger 和 Nan Yu 给出的三个例子,分别对应目标控制、输入排队和 issue 反馈。agent 是否能持续工作,开始取决于这些接口,而不只是模型会不会回答。234
  • Guillermo Rauch 把预算、故障切换、模型选择和实时可观测性放进 AI Gateway;这让「模型选得好不好」变成一个团队可以管理的运行问题。这里仍是 Vercel CEO 的产品方表述。5

1. Harness 正在接管模型之外的那部分智能

Aaron Levie(Box CEO,@levie)在 8 月 1 日 11:08 写道,他不知道一组具体数字能否推广到所有任务,但方向已经很清楚:harness 会成为 AI 技术栈里仅次于模型能力的重要变量。它的作用包括把任务拆成更高效的步骤,并在合适的时机把工作路由给合适的模型;当任务从百万 token 级别变成数千万、数亿 token 级别时,差异会直接落到准确率和成本上。1
这段话值得保留的地方,是它把「模型更强」拆成了两个可操作的问题:任务有没有被拆对,模型有没有被用在对的环节。前者属于 harness,后者属于路由;两者都可能比换一个更大的模型便宜。
Loading content card…
Garry Tan(YC 总裁兼 CEO,@garrytan)在当天 08:46 给了一个更短的产品信号:个人 AI 或公司「大脑」需要一个干净的 harness,他的团队每天都在使用自己构建的版本,并称其免费、开源。原帖没有给出仓库地址、组件清单或效果数据,因此这里不能把它写成一个已经可复现的工具推荐;能确认的是,harness 已经被创业团队当作日常工作基础设施来对待。6
Loading content card…

2. Agent 能不能继续做事,取决于输入如何回来

swyx(@swyx)在 8 月 1 日 14:27 说,自己仍在使用 /loop/goal。他的使用条件很具体:既要保留一定可控性,又要允许 agent 自己展开一条「循环生成循环」的开放路径;他还说,在一次很长的行动与推理过程中,设定目标曾经帮他避免失控。2
这不是「自主程度越高越好」的结论。swyx 描述的是一个旋钮:目标负责约束方向,循环负责减少对执行路径的预先规定。对长任务来说,harness 的工作不是替人写完 prompt,而是让人能在不重启任务的情况下修正方向。
Loading content card…
Peter Steinberger(@steipete)当天 09:51 分享了另一种个人体验:在他使用的 5.5 版本中,agent 工作时可以继续把新任务扔给它,模型不会像过去那样混乱处理,因此不再需要专门的 queue。这个判断来自他的使用感受,不能直接当作该版本的官方能力说明。3
两条帖放在一起看,差异在于「排队」不一定是产品界面上的列表,也可能是模型能否保持上下文并按顺序处理新输入。队列被模型吸收以后,用户的操作从「等它结束」变成「边做边补充」。这会改变 agent 产品对暂停、追加、取消和恢复的设计要求。
Loading content card…
Nan Yu(Linear 产品负责人,@thenanyu)在 8 月 1 日 20:44 描述了一个更接近生产现场的循环:agent 在 issue 留下评论并附上上下文;人类回复评论、补充细节或解除阻塞后,agent 就继续工作。4
这个接口比「聊天框里再问一句」多了一层可追踪性:任务、证据、阻塞原因和补充信息都留在 issue 上。持续执行因此不只依靠模型记忆,也依靠工作对象本身保存上下文。
Loading content card…

3. AI 的成本问题,开始长得像基础设施问题

Guillermo Rauch(Vercel CEO,@rauchg)在 8 月 1 日 06:32 把 AI Gateway 的价值列成四项:按 key、团队和项目设置预算;为可用性做故障切换;允许选择模型和供应商;提供实时可观测性。他把这套基础设施称为让 AI 成为生产性投资的条件,并把只追求 token 数量的做法称为「token-maxing」。这些是产品方的功能主张,帖中没有提供实际节省金额或可用性数据。5
Loading content card…
这四项能力合在一起,指向同一个变化:企业真正要管理的单位不是「今天用了哪个模型」,而是「哪个团队用什么模型完成了什么任务,花了多少钱,失败后是否能切换」。模型路由与预算控制被放到同一张账上,harness 才有机会从工作流技巧变成组织级系统。
Nikunj Kothari(FPV Ventures 合伙人,@nikunj)在 8 月 1 日 18:38 用一句更尖锐的判断描述了落差:模型已经在解决 NP-hard 问题,传统企业却还在抱怨 token 支出的 ROI;他据此认为未来几十年会持续发生模型扩散。7
这是个人评论,不是企业调查。它的可用之处在于提醒读者区分两条曲线:模型能力可以快速向应用层扩散,企业是否愿意为结果付费,则取决于任务成本、权限和验收能否被管理。
Loading content card…

4. 一个棋类 demo 说明了什么,又没有说明什么

Amjad Masad(Replit CEO,@amasad)在 8 月 1 日 13:28 分享一个棋类模型的结果:他称一个 8B 模型约为 1500 Elo,能稳定击败 frontier models 和 Stockfish level 0,单步耗时约 1–2 秒,而对比对象约 30 秒。原帖没有说明评测样本、棋力设置、模型名称或独立复核结果,所有数字都只能按作者口径阅读。8
这条帖不适合拿来证明「小模型已经全面超过大模型」。它更适合放进成本讨论:在一个规则清晰、反馈及时的任务里,较小模型加上推理或响应链,可能把每一步的延迟和成本压下来;但要把这个优势迁移到开放式工作,还需要任务级评测。
Loading content card…

跟踪区

Dan Shipper(Every CEO,@danshipper)转发了一篇《华尔街日报》关于 OpenAI 与 Anthropic 的文章,并坚持认为从春季开始,势头正在转向 OpenAI,把它称为一场有趣的逆转。原帖提供的是他的判断和文章入口,没有给出可独立核验的指标;因此这里只记录观点,不把「势头转向」写成市场事实。9
本期真正可继续观察的变量有三个:harness 是否会公开成可复用的产品,追加输入能否稳定进入长任务,企业是否会用任务结果而不是 token 用量来结算 AI。模型本身仍然重要,但这些变量决定了它能不能被放进日常工作。

Related content

  • Sign in to comment.
More from this channel