Oqoqo 在官方创始人公开帖中宣布上线;本次抓取时页面显示约 9 小时前。它评测的不是模型通用分数,而是 Agent 能不能在真实任务里使用你的产品:把任务、rubric、文件和机器环境,与原始入口或 skill / MCP / CLI / SDK treatment、Agent、trials 组合起来,再从 Matrix、Frictions 和 Traces 看结果。12
第一次别铺开测。登录后先连模型 provider,启用一个你团队正在用的 Agent;建立一个能判定成败的真实任务,保留 baseline,再只加一个 MCP、skill、CLI 或 SDK treatment。选择 tasks、agents、treatments,设置 trials,检查并发后 Launch;结果回到 Matrix 看 pass rate / lift,进 Frictions 找卡点,再打开单次 run 的 trace。34
成本按实验组合增长:一个 Agent 在一个 treatment 下尝试一个 task,就是一个 run;所以先做 1 个 task × 2 个 treatments × 2 次 trials = 4 runs。出错或取消的运行不计入 run 池,但已完成、最后 rubric 判定失败的运行仍会消耗 1 个 run。组织从 free plan 开始,月度 plan runs 不结转,top-up runs 永不过期。5 模型 provider 的密钥和套餐要另外核对;完整订阅档位请直接看官方价格页。
怎么选:要验证「Agent 能不能用我的 API / MCP / SDK」,优先试 Oqoqo;已经有 dataset、traces 和持续回归,要覆盖从 Playground 到 CI/CD、线上评分,Braintrust 更顺手。6 要比较 prompt / model / agent 版本,收集人工反馈或给完整 tool-call trajectory 打分,LangSmith 的 offline / online evals 更合适。7
这期没有把产品页 benchmark 当成独立实测。先跑 4 个 run:如果差异确实落在「Agent 找不到入口」或「工具契约不清」,再扩大任务集;否则,本地回归脚本可能更省钱。
References
- 1Oqoqo 创始人上线帖linkedin.com
- 2Oqoqo 官方介绍docs.oqoqo.ai
- 3Oqoqo Quickstartdocs.oqoqo.ai
- 4Oqoqo Agentsdocs.oqoqo.ai
- 5Oqoqo Billingdocs.oqoqo.ai
- 6Braintrust Evalsbraintrust.dev
- 7LangSmith Evaluationslangchain.com


Comments
Sign in to comment.