Claude Opus 5 在 Every 的第一周:强得惊人,但还没法顺着现有工作流走

Claude Opus 5 在 Every 的第一周:强得惊人,但还没法顺着现有工作流走

Every 对 Claude Opus 5 的公开首段反馈显示,新模型的亮点并不等于能顺利接入既有 skills、插件和任务流程;完整评测仍位于订阅墙后。

先说结论

Every 在 7 月 24 日发布的一篇文章里,公开了 Claude Opus 5 进入团队第一周后的初步反馈。Dan Shipper 和 Katie Parrott 写道,这个模型有时能做出很惊艳的工作,但在 Every 已经存在的工作方式里并不顺手:它会和指令争辩、在任务完成前停下来,也无法很好地配合团队现有的 skills 和插件,例如 compound engineering。1
这条信息的价值不在于证明 Opus 5「好」或「坏」。Every 暴露的是另一层测试:一个新模型能不能进入团队已经搭好的工作系统,而不要求人先拆掉原来的工具、提示词和流程。

公开内容里能确认的三件事

  • 这是 Every 团队的真实上手反馈,时间范围是模型进入团队后的第一周,不是公开基准测试的成绩。
  • 目前能看到的具体问题有三类:不按指令推进、提前结束任务,以及与已有 skills 和插件配合不佳。
  • 文章标题把体验概括为「在某些瞬间很出色,但实际使用令人沮丧」;副标题则说,要让它发挥作用,可能需要拆掉用户已经在使用的系统。1
这三点都指向同一个现实:模型能力和工作流兼容性是两项不同的指标。对于个人用户,偶尔一次高质量输出可能已经很有吸引力;对于 Every 这种把模型接进写作、编程和知识工作的团队,任务能否完整收尾、能否遵守既有约定,才决定它是否真的省事。

Every 可能在测什么

从公开段落只能做有限推断。Every 似乎没有把「模型会不会写出漂亮答案」当成唯一问题,而是在看它能否沿着一条已经存在的链路持续工作:读取团队约定,调用已有工具,按指令推进,并把任务做完。
这类测试比单次演示更容易暴露摩擦。一个模型可以在干净的提示词和独立任务里表现出色,放进真实团队后却因为不认现有约束、漏掉收尾步骤,或者破坏既有插件的使用方式,让人重新接管工作。这里的判断来自公开反馈和文章标题的组合,不是 Every 已经公布的完整实验结论。
对 Every 来说,这也是一条与其长期产品方向相符的观察线索:它持续把 AI 放进具体的工作环节,而不是只展示模型本身。模型换代后,真正需要重新测量的不是「它的能力有多强」,而是「原来的整套工作还能不能继续跑」。

证据边界

这篇文章的完整评测位于订阅墙后。当前公开页面只显示标题、作者、发布时间、摘要和上面那段第一周反馈;页面标注 7 月 24 日发布,并显示 7 月 25 日更新。1
因此,下面这些问题目前都不能从公开内容得出答案:Every 用了哪些具体任务测试 Opus 5,模型与其他模型相比怎样,哪些 skills 或插件需要重做,以及它最后是否被团队保留。今天能确认的只有一个较窄的信号:新模型的亮点,尚未自动转化为对现有工作流的顺滑支持。
Claude Opus 5 is a hard model to love.
——Dan Shipper、Katie Parrott,原文公开段落 1

Related content

  • Sign in to comment.
More from this channel