从模型训练到上线安全:8% 推理数据、$/task 与 agent 边界|7月28日精选

从模型训练到上线安全:8% 推理数据、$/task 与 agent 边界|7月28日精选

Amjad 的棋类模型实验、swyx 的任务成本判断,以及 Codex、ChatGPT Work 和 Vercel 的真实案例,显示 agent 的验收单位正从 token 转向任务结果与执行边界。

先看结论

7 月 28 日的信号,集中在一个变化上:AI agent 的价值开始用「任务完成得怎么样」来衡量,而不只是模型多聪明、消耗多少 token。Amjad Masad 在一次棋类模型训练中发现,约 8% 的失败推理轨迹混入普通训练数据后,在相同训练预算下超过纯棋盘到走法数据;swyx 则认为,按输入和输出 token 计价已经不够,应该看完成一项任务花多少钱。1 2
另一组帖子把问题推到了交付现场:Peter Yang 转述 Codex 远程修改发布视频的案例,Dan Shipper 说自己用 ChatGPT Work 的语音模式完成了 Codex 历史文章的采访整理和写作;Guillermo Rauch 则同时谈到 agent 的安全边界和模型的价格性能。3 4 5
下面这些内容覆盖北京时间 7 月 28 日 00:05 至 7 月 29 日 00:05。个人实验、公司高管判断和产品案例分别标出,不把单个样本写成行业定论。

1. 8% 的失败推理轨迹,可能比完整思维链更有用

Amjad Masad 是 Replit CEO。7 月 28 日,他分享了一个棋类大模型训练实验:只用棋盘到走法的数据训练时,模型很快遇到明显的收益递减;一次「先想再走」分支因为产生幻觉走法而失败,但把约 8% 的这类推理轨迹混入普通训练数据后,在相同预算下超过纯走法数据。1
他的解释是,模型在推理阶段不必显式展开这套思考,却把其中一部分能力内化了。这里的重点不是「8%」本身可以迁移到所有模型,而是训练数据里「失败但有结构的过程」可能有用。失败轨迹没有被当成正确答案直接喂给模型,而是与常规数据混合后观察结果,这和单纯增加更多成功样本是两条不同的路。
这仍然只是 Masad 的个人实验,没有给出模型规模、训练步数、评测集或可复现实验脚本。能确认的只有他的实验口径:在他的棋类模型上,约 8% 的推理轨迹混合数据在相同预算下胜过纯 board-to-move 数据。
Loading content card…

2. token 价格表正在让位给任务价格

swyx 在 7 月 28 日写道,按输入和输出 token 计算美元成本,已经不再是有用的成本指标;他建议把横轴改成「$/task」,也就是完成一个具体任务的成本。2
这条判断没有给出新的价格数据,却点中了 agent 产品的账本问题。一个 agent 可能用更少的 token,但因为反复调用工具、等待人工反馈、失败后重试,最终每项任务更贵;也可能多读了一些上下文,却一次完成了交付。只看 token,很容易把推理过程里的浪费和有效工作混在一起。
如果把「$/task」落到团队内部,至少要先定义任务边界:什么算完成,失败重试算不算,人工审核和外部工具费用是否计入,结果能否直接上线。否则这个指标也会变成另一个漂亮但空泛的数字。swyx 没有在原帖里给出统一算法,现阶段更适合作为评估方向,而不是现成标准。
同一窗口里,swyx 还反思了自己的 agent lab 判断:他认为 Claude Code 今年近似「意外开源」,但竞争对手的路线图并没有因此发生明显变化。6 这是一条个人观察,不能替代产品路线的完整比较,却和「任务成本高于模型标签」指向同一个问题:真正拉开差距的,可能是工作流和交付结果。

3. agent 开始接手一串连续动作

Peter Yang 是 AI 教程与访谈作者。7 月 27 日,他转述 OpenAI 开发者体验团队成员的案例:对方骑车时收到同事让他修改发布视频的请求,于是用手机远程连接,让 Codex 通过 computer use 编辑视频、导出并发回 Slack。约 20 分钟后,视频出现在 Slack 线程里;随后他要求 Codex 每 30 分钟检查反馈并导出 V2、V3、V4,回家时视频已经通过审核。3
这里真正有信息量的部分不是「用手机写代码」,而是任务被拆成了一个持续循环:读取线程、处理反馈、重新导出、再次提交。它已经不是一次生成,而是把外部沟通渠道当成了任务状态。
这个案例仍然是被 Peter Yang 转述的个人经历,不能证明 Codex 对所有视频任务都能稳定完成。对团队来说,值得照抄的是边界条件:反馈从哪里来,多久检查一次,版本如何命名,谁拥有最终批准权。没有这些约束,自动重试只会把错误更快地复制出去。
Loading content card…
Dan Shipper 是 Every CEO。7 月 28 日,他说自己在沙发上用 ChatGPT Work 的语音模式写 Codex 的历史文章,素材来自对团队成员的深入采访;他没有碰键盘和鼠标,语音模式完成了整理访谈、建立时间线、写作、编辑和修改。文章预计几周后发布。4
这条帖子的证据边界更窄:文章尚未发布,读者无法检查采访整理和成稿质量。它可以作为创作者自述的工作流信号,不能当成已完成的编辑质量评测。相比「AI 帮我写了一段文字」,Shipper 描述的是从资料组织到多轮修改的连续过程,这也是语音 agent 最容易被检验的地方。
Loading content card…

4. 运行 agent 的容器,可能不是足够的安全边界

Guillermo Rauch 是 Vercel CEO。7 月 28 日,他转述 Kimi 的一篇论文,称论文里的实验显示,agent 在容器级隔离下仍可能通过 kernel panic 让底层机器崩溃;他据此判断,Firecracker microVM,也就是 Vercel Sandbox 使用的微型虚拟机,才是安全的运行边界。7
这里要分清两层信息。第一层是 Rauch 对论文实验的概括;第二层是他对 Firecracker 的安全判断。原帖没有给出完整论文链接和实验条件,因此本文不把「容器一定不安全」或「microVM 在所有场景都安全」写成普遍结论。能直接提取的工程提醒是:agent 一旦拥有执行代码、调用工具和访问文件的能力,隔离层级必须与最坏情况下的内核级故障一起评估,不能只看进程是否被放进容器。
Loading content card…
Rauch 同日还分享了 Vercel Labs 的 Deepsec benchmark。他说,在这组网络安全评测中,Grok 4.5 的价格性能最好:成本约为 Sol 的十分之一、Opus 5 的五分之一点七、Kimi K3 的二分之一点二,同时达到接近 Kimi 的表现;他仍把 Sol 放在前沿性能位置。5
这些数字来自产品方对自家 benchmark 的描述,评测范围、任务构成和价格口径都没有在推文中展开。它适合说明一件事:当 agent 进入安全扫描等高调用量任务后,模型选择会同时受能力和单位任务成本约束;不适合直接当作通用模型排名。
Loading content card…

5. 企业没有只用 AI 裁员,Levie 看到的是岗位迁移

Aaron Levie 是 Box CEO。7 月 28 日,他写道,自己接触到的各行业企业仍在招聘,只是岗位类型发生了变化。他列举了三类需求:招聘工程师去解决过去做不了的问题,招聘销售以便借助 AI 深入客户关系,以及招聘内部 FDE 帮助企业部署 AI。Levie 认为,只把 AI 当成削减成本工具的公司,最终会被用 AI 改善客户服务和推进新业务的公司超过。8
这是一位企业 CEO 根据自身接触到的企业做出的判断,不是就业统计,也没有给出样本数或时间范围。Jevons paradox 在这里指的是效率提高后,资源使用量反而可能继续增长。把它放回企业 AI 场景,Levie 的说法是:如果 AI 降低了处理一个问题的成本,公司可能会去做更多以前嫌贵、嫌慢的工作,于是新增的工程、销售和部署岗位抵消了部分「自动化即减员」的效果。
对管理者来说,帖子里的可操作问题是:AI 项目预算到底来自裁员目标,还是来自更多客户问题、更快实验和内部部署能力。如果只有前一种目标,项目会优先追求少用人;如果要追求更多业务结果,就必须同时记录新增解决的问题和新增的工作量。

6. 两条轻量观察:探索空间与个人工作台

Amjad Masad 还写道,AI agent 可能让这一代人探索「计算宇宙」,搜索算法、程序、证明和设计的巨大空间。9 这是愿景式表达,没有具体产品或实验支撑,适合当作他对 agent 长期用途的想象,不宜当成能力事实。
Nikunj Kothari 是 FPV Ventures 合伙人。7 月 28 日,他说自己在两周旅行中把 Claude Code 当作主要界面,回来后又让它对这段使用经历做完整复盘,询问下次还能怎样改进。10 原帖没有展开任务清单和复盘结果,因此这里只保留「把 agent 当作日常工作台」这一层信号,不把它扩写成完整产品评测。

今天可以带走的三个问题

  1. 评估模型训练时,是否只保留成功答案,还是也能识别失败轨迹里的结构信息?
  2. 评估 agent 产品时,能否把成本换算成「完成一个任务要多少钱」,并把重试、人工审核和外部工具算进去?
  3. 让 agent 进入真实系统前,隔离边界能否承受它访问文件、运行代码和触发内核故障的最坏情况?
这三条问题分别对应了模型训练、产品账本和运行安全。它们共同指向同一个验收标准:agent 的价值要落在可复盘的任务结果上,风险也要落在可测试的执行边界里。

Related content

  • Sign in to comment.
More from this channel