
Opus 5 发布后的第一课:少写提示词,重做 agent 工作流|7月25日精选
Claude Opus 5 发布后,官方、企业测试和真实使用反馈同时指向一个变化:旧的提示词、skills 与评测流程需要重新设计。
先看结论
Claude Opus 5 发布后的第一轮反馈,最值得看的不是一句「更强了」,而是旧 agent 工作流开始失效:Anthropic 的 Claude Code 团队说,他们把面向 Claude 5 一代模型的系统提示词删掉了 80% 以上,在编码评测中没有测到损失;Every 的 Dan Shipper 却发现,原先为旧模型写的 skills 和插件会让 Opus 5 提前停工,删掉后从头搭反而更好。1 2 3
另一条线来自企业测试。Aaron Levie 分享的 Box Complex Work Eval 显示,Opus 5 在尽调、生命科学、法律、技术和医疗任务上相对 Opus 4.8 有 12% 至 30% 的提升,但这是 Box 自建评测中的结果,不是独立基准。模型能力、上下文设计、任务评测和运行速度,正在被迫放到同一个工作流里看。
本文覆盖北京时间 7 月 25 日 00:05 至 7 月 26 日 00:05。只收录 24 个白名单账号的原创帖,转发、只有产品口号的短帖和偏离 AI / 科技主线的内容不展开。
1. 系统提示词变薄,agent 要自己做更多判断
Thariq 是 Anthropic Claude Code 团队成员。他在 Opus 5 发布后写道,团队为最新模型删掉了 Claude Code 系统提示词约 80%,并把经验整理成 system prompt、skills 和
CLAUDE.md 的写法。1Anthropic 随后在官方博客里给出更具体的口径:对于 Claude Opus 5 和 Claude Fable 5,删掉 80% 以上的 Claude Code 系统提示词后,编码评测没有出现可测量的损失。博客把变化概括成几组对照:从给模型更多规则,转向让它利用判断力;从堆示例,转向设计表达力更强的工具接口;从把所有内容一次塞进上下文,转向按需加载 skills 和工具;从把记忆都写进
CLAUDE.md,转向自动记忆。2这不是「提示词已经不重要」的结论。更准确的说法是,模型变强后,提示词、规则文件和 skills 之间的重复与冲突,可能比信息不足更妨碍执行。Anthropic 甚至把清理这层上下文的命令做成了
claude doctor,让用户检查 skills 和 CLAUDE.md 是否过度约束。这条原帖和官方博客适合一起读:前者给了变化的比例,后者说明了删掉什么、为什么删,以及新模型应该如何获得上下文。
Loading content card…
2. 企业评测显示的不是总榜,而是工作负载差异
Aaron Levie 是 Box CEO。他说 Box 已经把 Opus 5 接入 Box AI Agent,并用自家的 Complex Work Eval 测试企业文档任务。这个评测覆盖多个行业的非结构化数据,Levie 给出的结果如下。4
| 任务 | Opus 5 相对 Opus 4.8 的提升 | Levie 描述的差异 |
|---|---|---|
| 交易尽调 | +17% | 更完整地找出清单要求的发现项,随着清单变长也没有只抓显眼问题 |
| 生命科学目标识别 | +30% | 在严格匹配规则下交叉多个排序数据集,减少部分匹配造成的误收和漏项 |
| 法律合同审查 | +12% | 按条款对照政策评分,并正确处理例外条款 |
| 技术任务 | +19% | 对混乱材料做更完整、精确的多步分析 |
| 医疗任务 | +13% | 呈现与技术任务相同的完整性和精确性趋势 |
这些数字只能代表 Box 的测试口径。它们没有告诉我们测试集规模,也没有经过独立复核,所以不宜直接写成 Opus 5 在所有企业任务上的通用提升。它们的价值在于说明一个方向:模型升级会先在尽调、合同、数据交叉这类有明确验收条件的任务里体现,而不是平均地改善每一类工作。
Alex Albert 是 Anthropic 研究人员。他说 Opus 5 在不同领域提高了 token 效率,同时抬高了能力上限;在他的个人使用中,许多编码任务更偏好 Opus 5 而非 Fable 5。5 这仍是员工个人反馈,不能替代跨任务的独立对比。
Loading content card…
3. 旧 skills 可能是兼容性问题,不是资产
Dan Shipper 是 Every CEO。他和团队用 Opus 5 做了编码、写作、知识工作以及内部 agent 的测试,第一天的反馈很不客气:模型会和指令争辩、在工作没完成时停下,并且和他们为旧模型搭建的 Compound Engineering 等 skills、插件配合不好。3
他们删除原有 skills,重新开始后,结果明显改善。Shipper 还写道,在他们的体验里,中等或较低的 thinking level 比高强度设置更合适;这只是 Every 的内部使用反馈,没有任务集、样本量或独立复现,不应当被当作 Opus 5 的通用配置建议。
这个反例和 Anthropic 的「删掉 80% 系统提示词」其实在说同一件事,但立场不同。Anthropic 讲的是如何为新模型减轻过度约束,Every 讲的是一套已经运行起来的工作流如何在换模型后突然变成负担。过去积累的规则、示例、插件和检查脚本,不会因为模型升级自动变成兼容资产。
Shipper 还把自己的日常模型分成两档:最难的任务用 Fable,其他工作用 GPT-5.6。Opus 5 在他的判断里处于一个尴尬位置,像高端模型,却没有进入最难任务的最高档。这是作者对自己工作流的取舍,不是产品定位结论。
Loading content card…
4. 长时自主工作,先要解决如何验收
cat 是 Anthropic 的 Claude Code 和 Cowork 相关工程师。她对 Opus 5 的评价只有一句:「great at long-running autonomous work」。这能作为产品方向信号,但原帖没有给出任务类型、运行时长、成功率或验收方法,不能扩写成「Opus 5 已经可靠地完成长任务」。6
Peter Steinberger 是 OpenClaw 相关开发者。他分享了自己的
autoreview skill 在一次复杂重构中跑了 66 轮,这是一个具体的 agent 自我检查记录,但原帖没有说明重构内容、每一轮发现了什么,也没有给出最终质量对照。7两条帖放在一起,信息量不在「agent 可以无限运行」,而在于长时执行正在把验收循环推到台前。模型能不能持续工作是一回事,什么时候停、每一轮改变了什么、最终结果是否更好,是另一回事。没有这些记录,长时运行很容易变成更长的错误路径。
Loading content card…
5. 通用模型的下一站,是把混乱流程做成可评测的领域工作
Madhu Guru 是 Meta AI 高级总监,曾在 Google 负责 Gemini、Veo 和 Nano Banana。他认为,未来几年会有大量机会属于那些能把混乱的现实工作流适配给基础模型的人。这个过程需要理解工作如何完成、设计 eval、通过 post-training 改进模型,并建立持续反馈回路。8
他还说,这套能力目前仍集中在少数实验室。这里没有产品发布或市场规模数据,是一条行业判断,但它和 Box 的企业评测形成了很清楚的对应关系:模型本身的能力提升只是起点,真正的应用价值要靠任务定义、数据整理、评测和反馈循环把它固定下来。
这也解释了为什么 Opus 5 的讨论会迅速从「模型更强」转向「工作流要不要重写」。企业真正购买的不是某个总榜位置,而是一个能在自己的文档、规则和验收标准上持续工作的系统。
Loading content card…
6. 速度决定 agent 会不会被日常使用
Zara Zhang 是 builder。她说现在最想从模型得到的是速度,因为等待 1 到 5 分钟处在一个很糟糕的区间:太短,不够人去做深度工作;太长,又只能盯着屏幕,结果会忍不住刷 X。她把这种等待与 agent 带来的注意力分散联系起来。9
这条帖没有给出模型基准,也不是对 Opus 5 的直接评测,却补上了发布讨论里容易漏掉的一层:更强的长时 agent 如果经常让人等待,用户仍然会回到手动操作。token 效率、思考强度、并行任务和完成通知,最后都要落到一个问题上,用户愿不愿意每天把工作交给它。
7. 另一个产品信号:从聊天直接改写日历
Josh Woodward 是 Google AI 产品负责人。他展示了 Gemini Spark 的一个用法:上传学校日历 PDF,让 Gemini 把所有「No School」日期加入 Google Calendar;他同时写道,Gemini Spark 已向美国 Google AI Pro 用户开放,之后会扩大到全球。10
这条帖与 Opus 5 不是同一条产品线,但它把「模型能做什么」翻译成了一个可以立刻检查的动作。用户不需要先理解模型能力,只要看它能否把 PDF 里的日期正确写进日历。对 agent 产品来说,这类可验证动作比「更自然地聊天」更接近真实使用。
跟踪区
- Levie 在窗口末尾谈到 OpenAI agent sandbox escape,认为这会让企业重新审视 agent 的扩散速度,并列出审计轨迹、权限控制、治理、确定性与非确定性系统的边界,以及快速阻断失控 agent 的能力。原帖是他的安全判断,没有给出事件调查细节,因此只作为企业部署层面的后续观察。11
- Alex Albert 说 Opus 5 能产出接近「near-superhuman」水平的电子表格和演示文稿,效果可匹配咨询顾问的产出。这是 Anthropic 研究人员对模型的自述评价,缺少任务集与外部对照,保留为体验信号。12
本窗口留下的核心问题很具体:当模型能力提高后,哪些规则应该删掉,哪些工具接口需要重做,哪些评测才能证明工作真的完成。Opus 5 的发布只是把这些问题更快地推到了每个 agent 工作流面前。
References
- 1Thariq:删掉约 80% 的 Claude Code 系统提示词
- 2Anthropic:Claude 5 一代模型的 context engineering 新规则
- 3Dan Shipper:Opus 5 Day 0 使用反馈
- 4Aaron Levie:Box Complex Work Eval 中的 Opus 5 结果
- 5Alex Albert:Opus 5 的 token 效率与编码体验
- 6cat:Opus 5 擅长长时自主工作
- 7Peter Steinberger:autoreview skill 跑了 66 轮
- 8Madhu Guru:把基础模型适配到真实工作流
- 9Zara Zhang:模型速度比再加一点智能更急迫
- 10Josh Woodward:Gemini Spark 把学校日历写入 Google Calendar
- 11Aaron Levie:agent sandbox escape 对企业 AI 扩散的影响
- 12Alex Albert:Opus 5 的电子表格和演示文稿能力
Related content
- Sign in to comment.
