Coarena 的巧思:让 AI agent 先在同一任务里盲测,再谈谁赢

Coarena 的巧思:让 AI agent 先在同一任务里盲测,再谈谁赢

拆解 Coarena 如何用同一任务、同一初始状态和盲评,把 computer-use agent 的比较从模型分数拉回真实工作路径。

Coarena 是 Coasty 做的 computer-use agent 评测场:用户提交一个真实的浏览器任务,平台让两个 agent 从同一初始状态出发,分别完成这项工作,再把过程放在一起供人判断。Coarena 的首页把入口说得很直白:两个 agent 同时跑真实的浏览器任务,用户在不知道模型身份的情况下投票。1
产品解决的是一个很具体的判断问题:当 AI agent 会点网页、填写表单、查资料、跨应用操作时,模型排行榜上的一个分数,究竟能不能说明它在你的工作里更可靠?Coarena 于 2026 年 8 月 13 日出现在 Product Hunt 当日榜第 15 位,产品介绍把比较对象限定为真实电脑任务,而不是合成基准。23

第一处巧思:评测单位从答案换成一条工作路径

Coarena 没有先让用户挑模型,再让模型回答问题。用户先给出任务,平台再让两个 agent 在同一环境里完成它。官方数据页把每场 battle 定义为「从同一状态开始的两条轨迹」,记录每一步的动作、推理和观察结果;评审既可以判断最终答案,也可以判断完成任务时走的路线。4
这个顺序改变了「好模型」的定义。对于只输出一段文字的问答,终点答案可能就是主要结果;对于 computer-use agent,路线本身就是结果的一部分。一个 agent 可能最后填对了表单,却绕了很多无关页面;另一个 agent 的最终文本相似,但更早停在正确页面,少做了几次有副作用的点击。只看最后答案,会把这些差异压平。
Coarena 因此把用户提交的任务变成一个可回放的对照实验:同一任务、同一初始状态、两条执行轨迹。一个参与者在 Reddit 上介绍产品时也强调了「同一初始状态」和并排回放;这属于产品方参与的公开介绍,适合说明实际使用方式,不替代 Coarena 对数据结构的正式说明。5
设计取舍在这里很清楚:Coarena 不把 agent 的能力压缩成一个脱离任务的分数,而是先保留它怎样完成工作的证据。 对产品经理来说,这让「更聪明」变成几个可以追问的差异:它有没有找到正确入口?中途是否走了弯路?遇到页面变化时怎样恢复?完成结果是否值得信任?
代价是评测变得更像观察实验,而不是按答案自动判分。真实任务的完成质量往往要靠人看轨迹、看结果;治理页甚至专门记录评委是否看得足够久、是否存在偏向某一侧等问题,并设置了重复评审和评委权重。6 Coarena 牺牲了一部分自动化和即时性,换来对行动过程的可见性;它更适合发现 agent 在真实流程里的失误,不会自动替代所有可以写成断言的回归测试。

第二处巧思:先盲看表现,再揭示模型身份

Coarena 把「谁在跑」和「跑得怎样」拆成了两个时刻。治理规则写明,模型身份由 API 层隐藏,直到评审完成;两条路线使用同一套动作空间、同一个沙盒,左右位置还会随机分配。6 用户先看两条轨迹和最终结果,再投票决定哪一个更好,而不是先看到熟悉的模型名称再解释表现。
盲评的价值不在于假装评委没有偏好,而在于把偏好推迟。评委仍然可能偏爱更短的路线、更像人的表达,或者更容易读懂的结果,但这些判断至少先落在可观察的行为上。对于刚发布、还没有长期口碑的 agent,这种顺序比「先看品牌,再猜能力」更容易发现真实差异。
Coarena 还把一次 battle 设计成两种对象:前台是可以观看和投票的比赛,后台是带有动作、观察、推理和人类偏好标签的轨迹数据。官方数据页把后者分为偏好数据、轨迹数据和评测访问;条款则明确写出,用户提交的任务和投票、批注等判断可以进入授权给 AI 实验室的研究数据集。47
这里还有一个容易被忽略的边界:参加评测和公开传播结果不是同一个动作。条款规定,用户可以选择是否把 battle 提供给其他评委,也可以在结果出来后单独发布 result card;观看开放,提交任务和评审则需要登录。7 产品把「帮助评测」「贡献训练数据」「把结果发到公开网络」拆成了不同的权限,而不是默认把一次点击同时变成三种公开行为。
代价也随之出现。人类偏好标签会带来评委差异,任务本身的难度和分布会影响排行榜;治理页因此公开了盲评状态、评委数量、重复评审和置信区间等信息,并提醒低样本的排名不能当成稳定结论。6 数据贡献还涉及任务内容、页面截图和模型供应商处理过程,条款明确提醒用户不要把密码或个人数据放进任务。7

Coarena 真正改变的是什么

Coarena 的巧思不在于又做了一个模型排行榜,而在于把 agent 评测的最小单位改成了「两条路径如何完成同一项工作」。它先固定任务和起点,再让 agent 暴露行动过程;先隐藏身份,再让人判断结果;最后才把一场比赛沉淀成可检索、可比较的轨迹与偏好标签。
这套设计可以迁移到其他 AI 产品里。凡是模型会替用户执行多步操作,就应该追问三件事:用户要比较的是最终答案,还是完成答案的过程?评审能否在知道品牌之前看到行为?一次运行留下的证据,能否支持复盘,而不只是产生一个分数?
Coarena 的边界同样明确:它需要真实任务、运行环境和人类判断,评测成本高,也会受到任务选择与评委标准的影响。它没有把这些成本藏在一个更精确的总分后面,而是把成本和证据一起摆到台面上。这正是它值得产品设计师观察的地方。
AI 产品设计巧思日刊

AI 产品设计巧思日刊

每天聚焦一款 AI 产品,拆解其中真正有独创性的设计巧思,覆盖主流与小众产品。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel