Temporal、Jack & Jill、Vals、Mantic、OpenAI:Agent 增长开始站在两方中间

Temporal、Jack & Jill、Vals、Mantic、OpenAI:Agent 增长开始站在两方中间

本期追踪 Temporal、Jack & Jill、Vals、Mantic 与 OpenAI 在窗口内的五条增长信号,拆解它们各自站在哪两方之间、靠哪一手把两边接起来,并给出 Neodrop 一周内可执行的动作。

这一周五家公司的增长动作落在同一个位置上:站在两方中间,替两边把那一手做完。
Temporal 用 5.5 亿美元 E 轮把估值推到 125.5 亿美元,卖的是「一段工作跑到一半断了,还能接着跑」;Jack & Jill 拿到 4000 万美元 A 轮,在求职者和雇主两边各放一个 Agent,两边都点头了才让人见面;Vals 收钱给模型出成绩单,出钱的是卖模型的公司和买模型的公司;Mantic 用 2500 万美元种子把「对未来的概率」做成能交付的东西;OpenAI 开始测试赞助 Agent,把 ChatGPT 里的一条广告变成一段可以被追问的对话。
这五家的公开材料共同证明的是融资规模、产品范围和可执行入口;留存、付费和真实生产里的准确率,五家都没有给出完整数字。下面出现的数字分四类——媒体核实、公司自报、投资方口径、X 触达——每一处都写明归属,读者可以自己判断每个数字能拿它做什么。

时间窗与方法

本期时间窗为 2026 年 9 月 7 日至 9 月 20 日(Asia/Shanghai),运行日为 9 月 20 日。窗口与上一期的日期区间有重叠,但本期五个对象上一期一个都没有写过,具体信号集中在 9 月 14 日至 19 日。
入选标准与上一期一致:对象是 AI Agent 或 agentic 产品的公司,并在窗口内出现可核验信号——融资与产品发布、用户或客户里程碑、公司官方博客、官方或创始人 X 原帖。事实只来自本轮实际打开的详情页、官方公告和 X 单帖详情,搜索结果只用来发现候选。
读表时的归位规则:融资、估值和投资方属于商业信号;客户数、用户数和处理量属于使用信号;X 的 views、likes 和 bookmarks 属于传播信号;产品能做什么属于能力描述。媒体或官方核实过的数字,与公司或投资方自报的数字分开写,两类不能互相顶替。

一眼对照表

公司与信号数字归属第一次可执行入口增长动作能力边界关键公开来源时间
Temporal:5.5 亿美元 E 轮,估值 125.5 亿美元融资、估值与投资方来自公司公告;收入增速、留存率、客户数与处理量全部是公司自报;GeekWire 另行给出年化收入超过 2.5 亿美元开发者用原有的语言写普通代码,把跨系统的编排和状态交给 Temporal把可靠性做成采购项:取消月度基础费,用客户名和平台处理量报数「OpenAI 是最大客户」来自媒体报道,公司未确认;没有客户分层留存与生产环境失败率Temporal 官方公告GeekWire9 月 14 日(公告);9 月 18 日(报道)
Jack & Jill:4000 万美元 A 轮,Air Street Capital 领投金额与领投方由 Axios Pro 独家报道与公司博客共同确认;38 万用户、5000 家公司属公司自报求职者直接跟语音 Agent Jack 聊;雇主方向由 Jill 接把招聘入口从「投递」换成「两个 Agent 先谈」,谈拢了才引荐没有配对成功率、offer 转化率和雇主续费;两个 Agent 代表两边谈条件的责任划分未公开公司博客Axios Pro9 月 14 日(Axios);9 月 15 日(官方)
Vals:4000 万美元 A 轮、估值 4 亿美元,9 月被一线媒体报道融资、估值与投资方来自公司 A 轮公告;收入 8 倍、客户翻倍、团队三倍是公司自报,TechCrunch 只核到人员规模与联邦项目团队在 Vals Smith 上用任意 GitHub 仓库建一个自定义编程评测,有 120 个免费额度把「谁来发成绩单」做成生意:测试集不公开,同时向模型公司和买模型的人收费没有绝对收入数字;测试集不公开,外部无法复核,「独立」这个说法本身验证不了Vals 官方公告TechCrunch9 月 17 日至 19 日(窗口信号);8 月 13 日(融资)
Mantic:2500 万美元种子,Radical Ventures 领投轮次、领投方与竞赛结果来自 Reuters 核实;「超过 676 名人类」是创始人自报,Reuters 写的是输给一个叫 laertes 的机器人官网目前只有预约演示入口;产品做三件事:扫描苗头、给出带推理的概率、跟着新信息更新先用公开竞赛当成绩单,再把成绩单换成企业合同;客户名不公开估值与客户都未披露;竞赛题有明确结算日期,企业里的预测问题没有这么干净的记分牌ReutersMantic 官网9 月 18 日
OpenAI:测试赞助 Agent,ChatGPT 的广告可以点进一段对话产品机制来自 OpenAI 官方公告与 Reuters 报道;测试范围是美国部分广告主,官方没有给出广告主数量与转化数字广告主在 ads.openai.com 开户,或者从 HubSpot、Shopify 后台接 ChatGPT Ads把广告的落点从网页换成对话,同时把建计划、写文案也交给 AI官方没有在自己的 X 账号公布这条,X 上的扩散由媒体账号带动;「对话与回答分开」是产品设计说法,没有数据OpenAI 官方公告Reuters9 月 16 日

五个案例:两方之间那五个位置

Temporal:站在代码和没跑完的工作之间

信号与数字归属。 Temporal 在 9 月 14 日的官方公告里宣布 5.5 亿美元 E 轮,估值 125.5 亿美元,由 Lightspeed 与 Wellington Management、Goldman Sachs Alternatives 的增长股权团队、Tiger Global 共同领投,T. Rowe Price 和 SV Angel 参与,老股东 a16z、Sequoia、Index、GIC、Sapphire Ventures 与 Amplify 继续跟投。1 公司同时给出了一整套业务数字:年化收入运行率同比增长超过 200%,净收入留存率自 2 月以来保持在 200% 以上,8 月单月处理 1.9 万亿次计费动作(同比增加 350% 以上),开源安装量超过 4300 万(自 2025 年 12 月增加 134%),付费客户超过 4300 家(同比增加 139%),客户名单里有 OpenAI、Snap 和 NVIDIA。1
这些业务数字出自公司公告,属于使用信号。GeekWire 在 9 月 18 日的采访里补了一组记者拿到的数字:估值比 2 月的 50 亿美元翻了一倍多,年化收入运行率近期超过 2.5 亿美元,公司累计融资 12 亿美元,30 家头部 AI 原生公司里有 18 家在用 Temporal。2
第一次可执行入口。 开发者要做的第一个动作很轻:用自己本来就在用的语言写普通代码,把跨系统的编排交给 Temporal,状态由平台保存,出错后自动从断点接着跑。GeekWire 引述 CEO Samar Abbas 的说法是,Snap 的每一条 Story、Taco Bell 的每一笔订单,步骤都跑在 Temporal 上编排;一些最流行的编程 Agent 也把它当作外层执行框架。2
增长动作。 Temporal 把「可靠性」从工程细节搬到了采购清单上。融资公告里,公司用「客户让 Agent 连续跑几天、几周甚至几个月」这件事来解释需求,并把 Durable Execution 定义成一层基础能力:应用可以等几天审批,也可以在故障之后接着跑。1 同一周,公司在 X 上推了一个没有月度基础费的随用方案,把试用门槛降到最低。3 融资公告里还专门给出客户证言的位置:OpenAI 基础设施副总裁 Venkat Venkataramani 说,公司在 OpenAI 内部建了一套基于 Temporal 的持久编排框架。1
官方账号在 9 月 14 日发帖说「我们又做了一次」,该帖约 20.4 万 views、736 likes、238 bookmarks。4
Loading content card…
领投方之一 Lightspeed 的账号随后发了一条讲可靠性的帖子,引用了创始人的话,约 4300 views、15 likes。5
能力边界。 收入增速、留存率、客户数和处理量全部来自公司公告,GeekWire 拿到的年化收入数字也没有超出公司口径。Abbas 对 GeekWire 说,最近三个月曝出的 Agent 失控事件「追究下去,都是没人真的知道这些 Agent 一步一步做了什么」,公司据此把可追踪、可拦截当成卖点;他也承认解决 AI 安全是模型实验室的事,自己能做的是让企业知道 Agent 干了什么。2 客户集中度是另一个空白:Bloomberg 在 8 月报道 OpenAI 是 Temporal 最大的客户,GeekWire 就此追问,创始人的回答是不会过度依赖,但公司没有公布单一客户的收入占比。云厂商和模型实验室都在做自己的 Agent 框架和可靠性工作,最大的客户也具备变成竞争者的条件。2

Jack & Jill:站在求职者和雇主之间

信号与数字归属。 Axios Pro 在 9 月 14 日以独家报道披露,伦敦的 Jack & Jill 完成 4000 万美元 A 轮,由 Air Street Capital 领投,公司 CEO Matt Wilson 向 Axios 确认了这笔交易。6 公司第二天在自己的博客上公布了同一轮,写明 Air Street Capital 领投,Creandum 与 Madrona 参与。7
使用者数字出自公司博客:38 万人正在旧金山、纽约和伦敦跟 Jack 聊天,5000 多家公司在用 Jill 招聘,其中包括 Corgi、Ramp、Multiverse、Maze 和 Attio。7 这些数字没有第三方核验,Axios 只确认了融资金额与领投方。
第一次可执行入口。 求职者的第一步是跟 Jack 说话。Jack 是一个语音 Agent,通过通话和消息了解这个人的经历、想要什么、换工作时最看重什么;雇主那一侧由 Jill 把招聘需求问清楚,包括「这个岗位上做得好具体意味着什么」。两边都判断合适时,Agent 直接把候选人和公司引荐给彼此,投递环节被跳过。7 公司账号在简介里写明,求职者这一侧免费。8
增长动作。 这家公司换掉的是招聘的入口。公司博客把行业现状写成两种失败:招聘网站给出数量,却把工作留给求职者,多数投递没有回音;好猎头有判断力,但一次只能服务少数客户。Jack & Jill 的答案是两边各放一个 Agent,只有双方都愿意接电话时才介绍。7
创始人在 9 月 15 日发帖公布了这一轮,把叙事放在「人生最重要的决定之一却交给运气」上;该帖约 5.4 万 views、209 likes、112 bookmarks,是这条新闻里互动最高的一条。公司账号同日的帖子约 1.2 万 views、29 likes。9
Loading content card…
能力边界。 38 万人、5000 家公司、客户名单都出自公司自己的材料。公开材料里没有配对成功率、没有从引荐到面试再到 offer 的转化率,也没有雇主的续费率。这家公司把两个 Agent 放在谈判桌的两边,谁来为一次错误引荐负责、如何避免筛选中出现歧视,这些问题公司还没有公开说明。领投方 Air Street Capital 的合伙人 Nathan Benaich 在博客里给出的判断属于投资方口径。7

Vals:站在模型公司和买模型的人之间

信号与数字归属。 Vals 在 9 月 17 日用官方账号发布了一条长程 Agent 评测结果:GPT-6 Astra 在游戏《Factorio: Space Age》里跑了 165 小时游戏时间、2 天现实时间通关。该帖约 56.3 万 views、3012 likes、507 bookmarks,是本周由公司账号发出、互动最高的一条内容。10
9 月 19 日,TechCrunch 刊出 Vals 的长篇报道,讲这家公司想成为 AI 评测的标准;同一天 Vals 官方账号转发回应,配的是一句「模型前进的速度已经超过旧基准能跟上的速度」。1112
融资是 8 月的事,作为背景:公司在 8 月 13 日的公告里写明完成 4000 万美元 A 轮,估值 4 亿美元,a16z 领投,8VC、Pear VC、BloombergBeta 继续参与,HRT Ventures 与 Next Ladder 新进入。13 同一篇公告里的经营数字属于公司自报:收入是 2025 年全年的 8 倍,客户数翻倍,团队在六个月内扩大到三倍。TechCrunch 核到的是人员规模——公司年初只有 8 个人,现在 25 人——以及它近期启动了一个面向联邦机构的评测项目。12
第一次可执行入口。 想给自己模型或产品打分表的团队,第一步是在 Vals Smith 上用任意一个 GitHub 仓库建一套自定义的编程评测,公司给了 120 个免费额度;政府与前沿风险方向上有另一组基准,包括与 CoreWeave 合作的 RSI Index 和一套与学者共同搭建的网络安全评测。13 买模型的一方走的是另一条路:直接看 Vals 给出的排名来挑模型。13
增长动作。 Vals 把「谁来发成绩单」做成了一门生意。公司公告里的解释是,模型开发的速度超过了社区造新考卷的速度,而新考卷常常由做模型的公司自己出题自己考,于是它选择做独立的第三方评测机构,测试集不公开,防止题目被训练进去。公告还说,它的结果已经被 OpenAI、Anthropic、Google、Meta 和 xAI 写进各自的模型卡,一些大型企业 AI 部署用它来选模型。13 TechCrunch 把这个模式总结成一句创始人自己的比喻:就像学生付钱去考 SAT。12
传播路径也值得记一笔。这一周真正跑起来的一条内容,是 Vals 自己出的评测结果,56 万次浏览来自公司账号本身;9 月 19 日的媒体长报道则是由 TechCrunch 的账号带动,那条帖约 4.2 万 views,Vals 自己转发的回应约 1690 views。1011
Loading content card…
能力边界。 收入倍数、客户翻倍、团队三倍都出自公司公告,公司没有给出任何绝对金额。测试集不公开保护了题目的有效性,代价是外部无法复核它的判断,「独立」这个标签目前只能由公司自己维护;它对标的是模型公司的自评,而它自己的分数同样是单方面的。此外,评测成绩说明的是模型在特定题目上的表现;165 小时通关一款游戏反映的是长时间任务里的稳定性,企业关心的生产环境准确率还需要另一类数据。

Mantic:站在决策者和不确定的未来之间

信号与数字归属。 Reuters 在 9 月 18 日报道,伦敦的 Mantic 完成 2500 万美元种子轮,由 Radical Ventures 领投,估值未披露,微软旗下的 M12、Thinking Machines Lab、Balderton Capital 等参与。Reuters 给出的竞赛结果是:在 2026 年夏季的 Metaculus Cup 里,Mantic 对政治、经济和文化事件给出的概率比人类参赛者更准,这是第一次由技术在该赛事中占上风;它击败了所有人类参赛者,但输给了一个叫 laertes 的机器人。CEO Toby Shevlane 与 Ben Day 在 2024 年创办了这家公司。14
创始人同一天在 X 上发了公布帖,写法是「今年夏天,Mantic 的预测超过了那场比赛里的全部 676 名人类」。这条帖子约 224.6 万 views、896 likes、321 bookmarks,是本轮五家里触达最高的原帖。15 「676 名人类」这个数字出自创始人,Reuters 的表述是击败所有人类选手、另有一个机器人排在它前面,两者放在一起看更完整。
Loading content card…
第一次可执行入口。 官网目前只有「预约演示」一个按钮,产品承诺的是三件事:按你关心的主题扫描正在出现的苗头、给出带推理和引用的概率预测、在新信息出现时更新预测。预测的时间跨度是一个星期到一年,覆盖地缘政治、商业、政策、技术和文化。16
增长动作。 Mantic 先做了一张公开的成绩单,再用它换企业合同。Radical Ventures 的合伙人 Aaron Rosenberg 对 Reuters 说,公司已经收到全球企业和政府机构的兴趣,部分机构已经把它的系统接进了自己的流程;对冲基金和交易公司尤其积极。Mantic 拒绝透露客户名字。14 官网把媒体报道放在显眼位置,并展示了从 2025 年夏季赛第 4 名(539 名人类中的第 4 名,前 0.7%)到今年夏季的进步曲线。16
创始人还给出了一个具体的优势来源:人类预测者容易扎堆,Mantic 不会。Reuters 引的两个例子是,在一个关于歌手 Shakira 单曲能否超越旧作的题目上,人类一边倒地认为不会,结果错了;在哥伦比亚总统选举上,Mantic 给出的概率约 40%,而共识约 30%,最后赢得选举的是它押中的那位。14
能力边界。 这一轮没有公布估值,也没有公布客户。2500 万美元是种子轮,商业结果目前只有投资方的一句「已经有人接进去了」。竞赛成绩要外推到生意还有一段距离:Metaculus 的题目有明确的结算日期和公开答案,企业里真正难判断的问题往往没有这么干净的记分牌,也没有办法在几个月后自动判卷。官网自己的曲线也说明,它在 2025 年夏季赛排第 4(539 名人类参赛者里的前 0.7%),到今年的赛事才击败全部人类。16

OpenAI:站在用户和商家之间

信号与数字归属。 OpenAI 在 9 月 16 日的官方公告里宣布测试 Sponsored Agents:用户在 ChatGPT 里点开一条广告之后,可以进入一段标明是赞助内容的对话,直接跟商家自己的 Agent 提问,问清楚再决定要不要去商家网站。公司写明这段对话与 ChatGPT 自己的回答分开,也与用户本来那场对话分开,测试范围是美国的部分广告主。17 Reuters 同日报道了这件事,把它放在「AI 营销市场争夺加剧」的背景里,并确认了范围与形式。18
同一批更新里还有三件事:广告主可以在 ChatGPT Work 里用几句自然语言建计划、改计划、看效果;Ads Manager 新增 AI 创意工具,可以根据落地页和投放目标建议文案与图片;HubSpot 成为第一个 CRM 伙伴,Shopify 成为第一个电商伙伴,Shopify 的应用从 9 月 23 日起在已开通 ChatGPT Ads 的市场落地。17 公告里没有给出广告主数量、对话转化率或任何收入数字。
第一次可执行入口。 广告主的第一步是去 ads.openai.com 开户,或者干脆不离开自己已经在用的软件:在 HubSpot 里接一个 ChatGPT Ads 账号,或者在 Shopify 应用商店装一个 ChatGPT Ads 应用,然后在里面建计划、跟线索、看效果。17 用户这一侧不需要做任何设置,看到广告时可以选择进去聊。
增长动作。 OpenAI 把广告的落点从网页换成了对话。官方举的例子很具体:一个人看到餐桌的广告,关心的是它放不放得下、能坐几个人、表面怎么保养,这些在落地页上要翻很久,在对话里问一句就有答案。17 同时,公司把工具塞进商家已经在用的 HubSpot 和 Shopify,让投放成本尽量落在原地。17
传播这一环有一处值得单独记:这条公告没有出现在 OpenAI 或 ChatGPT 的 X 账号上,X 上的扩散主要由媒体和聚合账号带动。Techmeme 那条帖子约 4900 views,是这一周里被转得较多的一条二手传播。19 作为对照,同一周 OpenAI 官方账号互动最高的一条是 9 月 16 日的模型行为披露帖,约 646 万 views、6928 likes,讲的是一套公开披露模型失准行为的框架。20
Loading content card…
能力边界。 测试范围只有美国部分广告主,官方没有给出规模、转化或收入数字。把广告做成一段对话,等于让用户在自己本来用来求答案的界面里跟商家对话;官方强调这段对话与 ChatGPT 的回答分开、也标明是赞助内容,但用户是否真的分得清,目前没有数据可查。这一条与本期其他四家还有一个结构上的差别:OpenAI 用的是自己的流量位置,另外四家站的位置都不属于自己。

可复用打法

站在两方之间,比多做一层功能更值钱。 Temporal 卖的是系统之间的编排,Jack & Jill 卖的是人和公司之间的引荐,Vals 卖的是实验室和买方之间的评分,Mantic 卖的是决策者和未来之间的概率,OpenAI 卖的是用户和商家之间的对话。这五个位置都有明确的付费方和被服务方,门槛落在接进去的权限上,用户可以保留原有习惯。
先做出一张别人认的成绩单。 Mantic 用的是公开竞赛,Vals 用的是可被引用的评测,Temporal 用的是 OpenAI、Snap、NVIDIA 这样的客户名和平台处理量。成绩单的作用是把「我们很强」换成别人可以自己去看的数字。
把入口免费的那一侧选对。 Jack 对求职者免费,Vals Smith 给了 120 个免费额度,Temporal 取消了月度基础费。免费的一侧决定传播速度,收费的一侧决定收入,两边分开设计比一起收钱更容易起来。
把工具放进别人已经在用的软件里。 OpenAI 接的是 HubSpot 和 Shopify,Temporal 把开源和社区做成默认入口,Vals 把自己的评测基础设施开源出来。用户不必先学会一套新软件。
传播素材要能自己跑起来。 Vals 这一周跑得最远的一条内容,是它自己出的评测结果,56 万次浏览来自公司账号本身;Jack & Jill 靠创始人的公布帖拿到 5.4 万 views;OpenAI 的公告没在自家账号上发,扩散交给了媒体。同一周里,能被截图、能被转述、能被争论的那一条,就是传播的主力。

对 Neodrop 的可执行借鉴

第 1 天:把频道的位置写出来。 这份日报站在读者和原始来源之间:替读者筛出窗口内的信号、核对每个数字是谁说的、标出第一步点哪里。把这三件事写进频道说明的固定段落,读者一眼就知道这里提供什么。
第 2 天:给对照表定一套固定字段。 照 Vals 的做法,用同一套题考所有人:数字归属、第一次可执行入口、增长动作、能力边界四项每周不变。方法是公开的,判断可以复核,这比每期换一套说法更容易被引用。
第 3 天:把内容接进读者已经在用的入口。 照 OpenAI 接 HubSpot 和 Shopify 的思路,先从读者已有的入口做起:同一期内容在不同载体上各写一段适配的开头,比每个载体从头重做一遍省事。
第 4 天:把生产做成能续上的流程。 照 Temporal 的做法,每期保留一份状态:来源清单、引用编号、哪些数字还缺第二来源、哪些公司留到下一期继续跟。换人接手时,从这份状态接着做。
第 5 天:用一条能自己跑起来的素材带动传播。 本期跑得最远的一条内容,是 Vals 自己出的评测结果——有具体题目和分数的那种。可以固定做一个跨公司比较的小实验,比如同一套判断标准横向跑五家,把方法写出来、把结果做成能截图的格式,再看它会不会被转。

风险与下一期观察点

这一期最普遍的能力落差是:五家都能证明自己站在了两方之间,却没有一家能证明自己站住了。Temporal 的收入增速、留存率、客户数和处理量全部来自公司公告,最大的客户是谁要靠媒体报道,客户集中度没有公开;Vals 的收入倍数是公司口径,没有绝对金额,测试集不公开让外部无法复核;Jack & Jill 的 38 万用户和 5000 家公司没有第三方核验,配对成功率和雇主续费都没有数字;Mantic 的估值和客户都没有披露,投资方的说法代替不了客户名单;OpenAI 连测试规模都没有给出。留存、付费和真实生产里的准确率,这一周没有一家交出来。
第二层风险在这几个位置都不属于自己。Temporal 的最大客户也是最有能力自己做一套的客户;OpenAI 的广告位是它自己的流量,规则可以自己改,商家只能接受;Vals 的「独立」要靠自己不公开题库来维持,一旦被质疑就只能自证;Mantic 的成绩单依赖 Metaculus 这套赛制继续办下去;Jack & Jill 站在招聘的两端,责任划分和合规审查迟早要面对。中间位置的特点是两头都要同意,任何一头的态度变化都会直接影响这一层。
第三层风险是叙事跑在证据前面。五家这一周讲的故事都比数字完整:Temporal 用「Agent 会连续跑几个月」来解释需求,Vals 用「AI 需要一个独立的测量机构」来解释估值,Mantic 用「人类预测者会扎堆」来解释优势。这些判断都合理,也都还没有被自己的业务数字验证。
下一期看四件事。第一,Temporal 会不会公布客户集中度,OpenAI 作为最大客户的角色会不会被写进风险提示。第二,Jack & Jill 会不会给出配对成功率或雇主的续费数据,以及招聘环节的合规问题会不会被提起。第三,Vals 面向联邦机构的评测项目会不会出现可核验的结果,它的基准会不会被其他实验室引用进模型卡。第四,OpenAI 的赞助 Agent 会不会走出美国,以及公司会不会公布从对话到购买的任何数字。这四件里任何一件有了数字,都能把「站在两方之间」从判断变成可以核对的事实。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content