Oqoqo:先测 Agent 会不会用,再谈哪家模型强

评测刚上线的 Oqoqo:用 4 个低成本 run 验证 Agent 能否真正使用你的 API、MCP 或 SDK,并拆清它与 Braintrust、LangSmith 的选择边界。

Oqoqo 在官方创始人公开帖中宣布上线;本次抓取时页面显示约 9 小时前。它评测的不是模型通用分数,而是 Agent 能不能在真实任务里使用你的产品:把任务、rubric、文件和机器环境,与原始入口或 skill / MCP / CLI / SDK treatment、Agent、trials 组合起来,再从 Matrix、Frictions 和 Traces 看结果。12
第一次别铺开测。登录后先连模型 provider,启用一个你团队正在用的 Agent;建立一个能判定成败的真实任务,保留 baseline,再只加一个 MCP、skill、CLI 或 SDK treatment。选择 tasks、agents、treatments,设置 trials,检查并发后 Launch;结果回到 Matrix 看 pass rate / lift,进 Frictions 找卡点,再打开单次 run 的 trace。34
成本按实验组合增长:一个 Agent 在一个 treatment 下尝试一个 task,就是一个 run;所以先做 1 个 task × 2 个 treatments × 2 次 trials = 4 runs。出错或取消的运行不计入 run 池,但已完成、最后 rubric 判定失败的运行仍会消耗 1 个 run。组织从 free plan 开始,月度 plan runs 不结转,top-up runs 永不过期。5 模型 provider 的密钥和套餐要另外核对;完整订阅档位请直接看官方价格页
怎么选:要验证「Agent 能不能用我的 API / MCP / SDK」,优先试 Oqoqo;已经有 dataset、traces 和持续回归,要覆盖从 Playground 到 CI/CD、线上评分,Braintrust 更顺手。6 要比较 prompt / model / agent 版本,收集人工反馈或给完整 tool-call trajectory 打分,LangSmith 的 offline / online evals 更合适。7
这期没有把产品页 benchmark 当成独立实测。先跑 4 个 run:如果差异确实落在「Agent 找不到入口」或「工具契约不清」,再扩大任务集;否则,本地回归脚本可能更省钱。

References

  1. 1
  2. 2
    Oqoqo 官方介绍docs.oqoqo.ai
  3. 3
    Oqoqo Quickstartdocs.oqoqo.ai
  4. 4
    Oqoqo Agentsdocs.oqoqo.ai
  5. 5
    Oqoqo Billingdocs.oqoqo.ai
  6. 6
    Braintrust Evalsbraintrust.dev
  7. 7
AI 新工具每日评测

AI 新工具每日评测

每日精选 1-2 款新发布 AI 工具,以图片笔记形式呈现实操上手指南与同类工具横向对比,帮你快速判断值不值得用、怎么用好。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.