
Yupp 失败拆解:130 万用户、3300 万美元融资,为什么 AI 模型评测平台还是关停
Yupp 把 900 多个模型和用户反馈放进一个免费入口,却没有把模型比较、评测数据和实验室付费变成可持续生意;当模型能力和 Agent 形态快速变化时,聊天层的中间价值先被压缩。
一句话总结
Yupp 把 900 多个 AI 模型、并排比较和用户反馈放进了一个免费入口,官方 Legacy 页面记录它覆盖 200 多个国家、提交了 3,700 万次 Prompt,并积累了 3,000 万条以上偏好数据。1 但在 2026 年 4 月 15 日正式下线前,它没有公开证明这些用户行为已经变成稳定的实验室收入、可持续毛利和面向 Agent 时代的独立位置。2
增长判断
Yupp 证明了「让用户一次比较多个模型」是一个很强的激活机制。用户可以免费获得 ChatGPT、Claude、Gemini、Grok、DeepSeek、Llama 等模型的回答,再通过选择和反馈参与评测。3 但它把用户注意力、推理成本和奖励支出放在了前端,把真正付费的一方放在模型实验室。只要实验室购买的是一次性反馈,或者模型厂商转向内部专家评测和 Agent 评测,Yupp 的网络效应就会变成一堆越来越贵的历史数据。
TechCrunch 报道称,Yupp 注册用户达到 130 万,收集了每月数百万条偏好,还拥有几家 AI 实验室客户,但创始人仍认为产品市场匹配度不够强;创始人给出的解释包括模型能力在数月内快速跃升,以及行业从面向人的模型转向面向 Agent 的系统。4 这说明它的上层漏斗很大,付费闭环却没有被公开数据证明。
增长因果链
免费多模型比较降低了首次使用门槛,比较行为又持续产出偏好数据;但用户的重复比较没有自动变成实验室的持续采购,模型能力提升和 Agent 工作流迁移又降低了聊天层评测的相对价值,最终让 Yupp 在拥有用户、社区和数据的情况下,仍无法证明独立经营理由,团队选择在 2026 年 3 月 31 日宣布收缩,并于 4 月 15 日下线服务。52
Part G | 增长系统
AARRR 账本
| 环节 | 已知事实 | 未披露数据 | 可证伪判断 |
|---|---|---|---|
| Acquisition,获客 | 官方 Legacy 页面记录 200 多个国家、90,000 名 Discord 社区成员和 100 万以上注册用户;TechCrunch 报道的注册用户口径为 130 万。14 | CAC、自然流量占比、邀请率、各渠道转化未披露 | 免费使用和多模型稀缺性足以带来注册,但如果自然新增在连续 8 周内下降、且付费实验室没有贡献可追踪的新用户,增长就依赖外部模型供给而不是产品分发。 |
| Activation,激活 | 用户可以在同一入口比较多个模型的回答,并通过反馈参与评测;平台还曾提供积分或奖励机制。31 | 首次有效比较率、首次决策时间、完成反馈率、奖励领取率未披露 | 真正的激活不应是打开页面或提交 Prompt,而应是用户比较至少两组结果后完成一次选择。如果首次比较到有效决策的转化低于 30%,产品的核心价值仍停留在围观。该阈值是验证建议,不是 Yupp 历史数据。 |
| Retention,留存 | 官方 Legacy 页面记录累计 3,700 万次 Prompt 和 3,000 万条以上偏好数据,说明平台曾持续获得行为输入。1 | DAU、WAU、D7、D30、每用户月度比较次数、奖励后留存未披露 | 累计数据不能替代留存曲线。如果 D30 用户中有一半以上只在新模型发布时回来,Yupp 更像模型试用聚合器,而不是日常工作流。 |
| Revenue,收入 | TechCrunch 称 Yupp 有几家 AI 实验室客户;PANews 称其曾为多家付费 AI 实验室提供多模型对比与评估服务。42 | 合同数量、年化收入、续约率、单条偏好价格、推理成本、奖励成本和毛利未披露 | 如果实验室续约率低于 50%,或者数据采购只发生在模型发布节点,3,300 万美元融资也不能证明收入闭环成立。 |
| Referral,传播 | 社区曾达到 90,000 人,用户反馈中出现「每天使用」「通过比较模型学习」等描述,但这些是官方收录的用户评价,不是独立留存调查。1 | K 因子、分享率、邀请转化、社区到注册的转化未披露 | 社区规模只有在能够带来低成本注册和重复比较时才是增长资产。若社区活动增长与付费客户数量没有相关性,社区只是品牌声量。 |
本 Part 结论: Yupp 公开证明了获客、激活和数据生产,却没有公开证明 D30、实验室续约和单位毛利。它拥有漏斗上游的漂亮数字,缺少决定生死的下游数字。
真实产品界面

Part O | 市场机会
机会到底卖给谁
Yupp 面对的是两个市场,但两边的购买理由不同。
第一边是用户市场。用户希望用一个入口访问多个模型,不必分别注册、付费和比较。Yupp 的免费模式降低了尝试成本,模型数量越多,首页越容易产生「我再看看哪个更好」的即时动机。
第二边是实验室市场。实验室希望获得真实任务中的偏好数据,用来判断模型回答是否有用。The Block 报道的方案是用用户反馈、积分和链上激励组织这套数据生产过程。3
问题是,两边的价值时间不一致。用户需要今天就能免费使用,实验室需要数据质量、稳定标签、可追溯任务和持续采购。Yupp 越努力扩大免费入口,越要承担模型调用、奖励和数据清洗成本;实验室越能从一次性数据中获得价值,越不一定需要每个月续约。
TAM / SAM / SOM 代理模型
公开资料没有给出模型评测和 Agent 评测市场的可靠总规模。下面的数字只是用于判断是否值得继续投入的预算模型,不是 Yupp 的历史收入,也不是行业统计。
| 层级 | 代理假设 | 年度收入空间 | 置信度 |
|---|---|---|---|
| TAM | 10,000 家需要持续评测的模型或 Agent 团队,每家每年购买 100,000 美元的真实用户评测和数据服务 | 10 亿美元 | C,团队数量与客单价均为假设 |
| SAM | 其中 1,000 家面向消费者或企业客户持续发布模型产品,并愿意购买外部评测 | 1 亿美元 | C,筛选比例未被公开数据验证 |
| SOM | 先拿下 20 家年度续约客户,每家年合同 100,000 美元 | 200 万美元 ARR | C,属于经营阈值,不是历史结果 |
本 Part 结论: 市场需求存在,但用户比较需求不能直接等同于实验室采购需求。Yupp 缺的不是 TAM 故事,而是从用户数据到续约合同的中间证明。
Part S | 战略定位
它选择了什么位置
Yupp 的定位可以拆成三层:
- 作为用户入口,它提供多个模型的免费访问和并排比较。
- 作为数据网络,它把用户对回答的选择变成偏好数据。
- 作为交易层,它用积分、链上激励和支付工具组织用户反馈与实验室需求。3
这个定位在 2024 到 2025 年很有吸引力,因为模型质量差异明显,普通用户不知道该选哪个模型,实验室也需要真实反馈。Yupp 试图把「哪个模型更好」变成一个可以规模化收集的数据问题。
结构性弱点
第一,入口依赖别人的模型。OpenAI、Google、Anthropic 等模型越强,Yupp 越容易获得吸引用户的内容,但这些公司也越有能力把比较、路由和 Agent 直接放进自己的产品。
第二,数据的价值会随模型变化速度下降。用户在某一天对模型 A 的偏好,可能只说明当时的版本、Prompt 和价格,不一定能迁移到下一个版本。Yupp 官方记录的 3,000 万条偏好数据很大,但数据新鲜度、任务分布、标签一致性和实验室复用率均未披露。1
第三,评测对象从「回答」转向「完成任务」。PANews 转述的关停解释提到,用户工作流开始转向连接工具、记忆和外部服务的 Agent 系统,聊天层众包评测的重要性下降。2 对 Agent 来说,最重要的指标可能是任务完成率、人工接管率、错误副作用和成本,而不是哪个聊天回答更讨喜。
本 Part 结论: Yupp 站在模型供给和用户反馈之间,却没有拥有模型、用户任务或实验室预算中的任何一端。中间层要长期存在,必须让数据采购方持续依赖它,而不是偶尔使用它。
Part C | 竞品分析
| 替代方案 | 用户得到什么 | 付费方依赖什么 | Yupp 的相对短板 |
|---|---|---|---|
| Yupp | 一个入口比较大量模型,用反馈换积分并参与排行榜。13 | 实验室购买真实用户偏好和评测数据。 | 入口、模型供给和数据买方都不由自己控制;服务已于 2026 年 4 月下线。2 |
| 直接使用模型厂商产品 | 用户直接使用单一模型的聊天、文件和工具能力。 | 厂商直接获得订阅、调用或企业合同收入。 | Yupp 的比较价值可能被产品内置的模型路由和 Agent 能力吸收。 |
| 专业评测与数据服务 | 用专家、标注员或特定行业任务评估模型,标签可以围绕明确业务结果设计。TechCrunch 提到 Scale AI 和 Mercor 采用专家参与强化学习流程的模式。4 | 模型厂商为训练和上线质量购买较高确定性的评测。 | 成本可能更高,但在高价值场景里,购买方更容易解释预算和验收结果。 |
| Agent 评测平台 | 测量任务完成、工具调用、权限控制和人工接管,而不是只比较答案文本。 | Agent 产品团队购买回归测试和线上质量监控。 | Yupp 的历史数据主要围绕聊天比较,是否能迁移到 Agent 任务未被证明。 |
| 人工多模型工作流 | 用户自行复制 Prompt,在不同模型中比较结果。 | 用户用时间承担成本,企业按自己的任务建立内部评测。 | Yupp 的统一入口更方便,但免费模型供给和奖励成本使单位经济更复杂。 |
这个矩阵不比较各家的收入和市场份额,因为本轮来源没有提供一致口径。它比较的是控制点:谁控制模型、谁控制任务、谁能定义验收标准、谁能持续收钱。
本 Part 结论: Yupp 的体验比人工比较方便,数据覆盖比单一模型丰富,但专业评测服务更接近预算,Agent 平台更接近下一代任务形态。它夹在两者之间,差异化很容易被复制。
Part P | 产品设计
用户流程
Yupp 的核心流程可以还原为:
输入 Prompt → 同时获得多个模型回答 → 选择更好的结果 → 提交偏好 → 获得积分或奖励 → 查看排行榜并继续比较这条路径有两个优点。第一,首次价值很快,用户不用先理解复杂的评测标准。第二,比较动作天然可以产生标签,用户每多做一次选择,平台就多获得一条偏好。
但它也有三个断点。
第一,比较不等于决策。用户可能只是觉得不同答案有趣,并没有把更好的回答用于工作、学习或购买决策。
第二,反馈不等于高质量标签。用户的选择可能受回答长度、语气和偶然错误影响;如果没有任务类型、结果验证和后续行为,偏好数据未必能代表真实效果。
第三,奖励不等于留存。积分可以让用户多做几次选择,却可能把行为变成短期刷量。Yupp 官方页面提到积分可以换取现金或继续使用模型的体验,但奖励后的 D30 和有效数据比例未披露。1
产品应追踪的指标
- 有效比较率:完成两次以上模型比较,并选择一个结果用于后续任务的用户比例。
- D7 / D30 任务留存:按用户是否再次完成真实任务统计,不能只统计 Prompt 数量。
- 偏好有效率:被实验室采纳、进入训练或评测流程的偏好占比。
- 反馈独立性:同一脚本、重复账号和奖励驱动行为所占比例。
- 任务结果提升:用户采纳回答后,任务完成时间、返工率和错误率是否改善。
- Agent 迁移率:同一任务从聊天比较转为工具调用后,成功率、人工接管率和副作用率如何变化。
本 Part 结论: Yupp 把选择动作设计得很轻,但没有公开证明选择动作产生了可验证的工作结果。产品应该从「哪个回答更好」推进到「哪个结果真的完成了任务」。
Part E | 商业模式
两边市场的单位经济
Yupp 的收入逻辑大致是:实验室为用户反馈和评测数据付费,用户用时间和选择行为换取免费模型访问、积分或奖励。The Block 报道其采用链上激励,并支持多种支付和稳定币通道。3
这套模式有一个硬约束:用户越活跃,模型调用和奖励成本越高;实验室越不愿意按活跃用户付费,Yupp 就越难把收入增长和成本增长绑定在一起。
可以用下面的式子检查它是否成为生意:
单个活跃用户月毛利 = 实验室分摊收入 - 模型调用成本 - 用户奖励 - 数据清洗与审核成本本轮没有拿到 Yupp 的收入、合同价格、推理成本和奖励成本,所以不能判断它是否曾经实现正毛利。3,300 万美元是融资,不是收入;130 万注册用户是规模,不是付费客户。4
为什么融资没有解决问题
Yupp 在 2024 年完成 3,300 万美元种子轮,由 a16z crypto 的 Chris Dixon 领投,并获得超过 45 位天使和小额投资者支持。34 这笔钱可以买到更长的验证时间,却买不到实验室的持续预算。
如果客户买的是一次性的模型反馈,Yupp 需要把产品升级为持续评测基础设施;如果客户买的是训练数据,Yupp 需要证明数据质量优于专家评测、内部日志和真实业务结果;如果客户最终要的是 Agent 质量,Yupp 还需要重做任务定义和验收指标。三条路都比「把更多模型放在一个页面」更重。
本 Part 结论: Yupp 的商业问题不是融资不足,而是供给端成本按用户增长,需求端收入却没有被证明按相同频率增长。融资延长了跑道,但没有让两边市场的结算关系变清楚。
Part L | 洞察提炼
1. 比较层只有在决策频繁发生时才有价值
如果用户每天都要在模型之间选择,比较层可以成为工作流;如果用户只在新模型发布时来围观,它就是一次性内容。Yupp 的 3,700 万次 Prompt 说明使用量很大,但没有公开说明有多少来自同一用户的持续任务。1
2. 数据网络的护城河取决于买方的下一步动作
3,000 万条偏好数据听起来庞大,但买方真正关心的是这些数据是否能改变训练、上线或路由决策。1 如果数据只用于展示排行榜,它是内容;只有被持续用于模型改进并产生可测结果,才可能成为基础设施。
3. 让用户免费使用昂贵模型,必须同步验证收费对象
免费模型入口能提高激活,但也会放大推理成本。用户可以喜欢产品,却不代表实验室愿意为同样的反馈长期付款。Yupp 的用户增长和实验室客户之间存在明显的计量断层,公开资料没有填上这条断层。
4. Agent 时代的评测对象从答案变成任务
本 Part 结论: Yupp 最值得复用的经验不是「不要做模型聚合」,而是尽早确认用户比较是否连接到了一个持续发生、有人付费、结果可验收的任务。
Part D | 决策分析
四种决策
| 决策 | 适用条件 | 下一步 |
|---|---|---|
| 继续独立经营 | 未来 8 周至少有 3 家实验室签署续约或扩展合同,数据被用于真实模型迭代,单用户月毛利为正。以上是建议阈值,不是 Yupp 历史数据。 | 从免费比较转向可审计的评测 API,按任务、行业和结果收费。 |
| 转型为 Agent 评测 | 聊天比较的 D30 不足,但客户愿意为任务成功率、人工接管和错误副作用付费。 | 以浏览器操作、代码部署、客服处理等具体任务建立回归测试集。 |
| 收缩为数据服务 | 用户入口仍能稳定产生高质量偏好,但独立 App 的推理成本和奖励成本无法覆盖。 | 关闭低价值免费模型,保留经用户授权的数据产品和少量高价值客户。 |
| 立即停运 | 没有续约客户,数据无法证明质量,或用户奖励与模型成本持续高于收入。 | 提前公布停止时间、聊天数据下载、账户关闭和用户数据删除方案。 |
三个可证伪预测
- 如果一个模型比较产品的 D30 低于 15%,但新模型发布时访问量明显上升,那么它更接近新闻和试用入口,而不是工作流产品。验证方法是把发布事件流量与非发布期间的任务留存分开。
- 如果实验室客户只在新模型上线时购买数据,且续约率低于 50%,那么平台的主要价值是一次性市场情报,不是持续评测基础设施。验证方法是按客户统计 90 天内的重复采购和数据被实际采纳的比例。
- 如果 Agent 评测客户愿意为任务完成率和人工接管付费,却不愿为聊天偏好付费,那么价值已经从「哪个回答更好」转移到「任务是否完成」。验证方法是让同一批客户分别购买文本偏好和 Agent 任务评测,比较续约与毛利。
Yupp 的公开结局只支持一个克制的判断:它有过真实用户、真实社区、真实数据和至少几家实验室客户,但没有公开证明这些资产能在模型快速变化时持续产生收入。创始人宣布关停时,网站还保留了 15 天供用户下载聊天数据,新用户不能注册,老用户不能创建新对话。5 对后来者来说,最重要的检查项不是能否把比较页做得更漂亮,而是每一条用户反馈最终改变了谁的决策,以及这个决策是否会在下个月继续付费。
Related content
- Sign in to comment.
More from this channel›
- ChatGPT Atlas 失败拆解:OpenAI 为什么把独立浏览器折叠成 ChatGPT 功能
- Mocha 失败拆解:25 万用户的 AI App Builder,为什么仍被 AI 成本和支持成本拖垮
- Tezi 失败拆解:900 万美元的自主招聘 Agent,为什么结局是团队并入而不是产品增长
- AnuNeko 失败拆解:上线不到一年,为什么 AI 陪伴先被资源重配关掉
- Firebase Studio 失败拆解:Google 为什么把它分流给 AI Studio 和 Antigravity
- Yara AI 失败拆解:低千位用户、不到 $1M 资金,为什么创始人先关掉了心理健康聊天机器人
- Tome 失败拆解:2500 万用户,为什么没换来一个可持续的 AI 演示产品