Every 的新信号:AI 公司的下一件产品,是可衡量的「好」

Every 的新信号:AI 公司的下一件产品,是可衡量的「好」

Every 7 月 19 日 newsletter 把 AI 竞争从换模型推进到定义业务目标、建立 benchmark,并把高质量数据变成新的经营资产。

先说结论

Every 7 月 19 日的 newsletter《The Model Is the Easy Part》,把 AI 公司的竞争重点从「换一个更强的模型」移到了三个更难的问题:业务到底要什么结果,怎样测出结果好不好,以及这些测量产生的数据能不能反过来创造收入。1
这不是一句泛泛的「数据很重要」。文章给出的案例是,针对具体目标训练出来的小模型,可能比通用大模型更便宜、更适合生产;而一套围绕真实用户和明确目标建立的 benchmark,既能改善产品,也可能成为卖给模型公司的数据产品。

AI 采用进入「定义好」的阶段

把 AI 工具发给团队只是采用的第一步。Every 认为,下一步是给每个业务场景定义一个可衡量的「好」:客服计划要达到什么标准,游戏中的 AI 对手怎样才算让玩家觉得好玩,研究流程又要减少哪一种错误。
这个变化很实际。没有目标,团队只能统计调用量、token 和登录次数;有了目标,才知道哪些调用真的产生了价值,也才可能控制成本。文章把这件事说得很直白:AI 使用量正在增长,但公司需要把花出去的计算资源和可观察的业务结果连起来。1
Every 自己参与的 Good Start Labs 案例,围绕游戏公司 Arkadium 的产品目标展开。Arkadium 想让玩家和 AI 对局时觉得「这是一场好游戏」,双方于是建立 benchmark,并用真实玩家作参照。Game Lab 现在也把 Gin Rummy、填字游戏等游戏作为模型评测入口,按不同的认知要求组织环境。2
Game Lab 的 Daily Crossword 评测页面,包含模型对局回放和排行榜
Game Lab 把模型表现放进具体游戏和可回放的对局中,而不是只给出一个抽象的聊天分数。2

小模型为什么能赢大模型

按 Every 文章给出的案例口径,Arkadium 的游戏测试暴露了一个反直觉结果:能在数学和科学任务中取得好成绩的前沿模型,在 Gin Rummy 对局中却输给了休闲玩家九成的对局。原因不复杂,模型见过大量数学材料,却没有足够多的 Gin Rummy 经验。1
于是,Good Start Labs 没有继续堆更大的通用模型,而是训练了一个 460 万参数、18 MB、可以在普通 CPU 上运行的专家模型。文章称,在每天 100 万次请求的假设下,这个模型每年成本约为 60 美元;同样规模的前沿大模型调用成本会达到数百万美元。这个数字属于 Every 对该案例的估算,不应直接当成所有 AI 场景的通用成本结论。1
这里的重点不是「小模型战胜大模型」这句容易传播的口号,而是模型选择终于被放回业务目标里:如果目标是让玩家玩得更好,模型是否足够专门、成本是否能承受,比参数规模更先决定方案。

数据开始有第二种收入逻辑

同一个目标还带来另一层收益。Arkadium 既能用 benchmark 改善玩家体验,也能把匿名的高质量游戏数据卖给模型公司。对模型实验室来说,真实玩家在「好游戏」中的决策记录,比一堆脱离场景的合成问答更能帮助模型学习。Every 文章称,Arkadium 已经从这类数据获得新的收入线,Reddit、Shutterstock 和 News Corp 也在把数据转成持续收入。1
这让「数据资产」不再只是公司内部的存档。它至少有两种用法:一是改善自己的产品,二是把经过结构化、匿名化和质量筛选的数据卖给正在训练模型的实验室。前提是公司先把什么叫好、什么叫坏记录下来,否则手里只有原始日志,没有能交易的证据。
文章也留了一个重要限制:如果数据本身就是产品的核心,例如设计工具或代码工具,向模型实验室开放数据可能等于帮助潜在竞争者复制自己。Every 提到的 Figma、Cursor 和大型制药公司的例子,都指向同一个判断,数据能卖多少钱,取决于买方是否正在进入你的业务。1

对 Every 的新观察角度

这篇文章让 Every 的公司追踪多了一条比「又发布了什么功能」更具体的线索:它正在把 AI 工作方法和可衡量的结果绑定起来。
过去几期里,Every 写过代理如何处理业务运营、如何由编辑用 Codex 造产品,也写过 skills 和工作循环。这一期往前走了一步,开始讨论怎样把结果变成 benchmark,怎样把 benchmark 变成数据,再怎样把数据变成业务收入。这里仍然是文章提出的方向和案例,不等于 Every 已经公开了一套完整的商业化方案。
后续可以盯三个触发点:
  • Every 是否公开更多内部产品或业务 benchmark,而不只是介绍使用了哪些模型。
  • Good Start Labs 或 Game Lab 是否披露新的模型评测结果、数据合作或定价信息。
  • Every 的产品文章是否开始同时给出任务完成率、错误率、成本或关键场景表现。
如果这些指标持续出现,Every 的「AI 原生公司」实验就不只是让员工更快地做事,而是在尝试建立一套可以衡量、复用和出售的工作结果系统。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel