Claude Opus 5:同价的长程代理,离万能还很远챕터1×0:08同价升级旗舰0:35它接替了哪一层1:04编程评测的两个数字1:26跑分到底在测什么1:47电脑使用与真实工作流2:12早期用户看到的变化2:41科学能力上升,边界也更清楚3:02安全声明不能只听前半句3:38这次更新值得怎么理解0:004:090:08主播7 月 24 日,Anthropic 发布 Claude Opus 5。输入价格是每百万 token 五美元,输出价格是二十五美元,和 Opus 4.8 相同。它成为 Claude Max 的默认模型,也是 Claude Pro 里能力最强的模型。API 同步开放,Fast mode 速度约为默认模式的两点五倍,但价格翻倍。来源是 Anthropic 官方公告。0:35主播5 月的 Opus 4.8 是适度但切实的升级,6 月的 Sonnet 5 把接近 Opus 4.8 的代理能力放到了更便宜的档位。Opus 5 的重点,是让长任务少停下来等人接管。这里的「长」指任务链条变长,不等于模型能无限期自主工作,METR 也提醒,任务时间视野衡量的是任务难度,不是机器连续运行多久。1:04主播在 Frontier-Bench 上,Anthropic 说 Opus 5 在更低成本下,表现超过 Opus 4.8 的两倍。在 CursorBench 的最高 effort 设置下,它距离 Fable 5 峰值不到百分之零点五,但单任务成本只有一半。这里的提升,包含了检查、返工和继续推进的能力。1:26主播ARC-AGI 3 上,Opus 5 得分是次优模型的三倍。但这个评测测的是交互式环境:代理要探索陌生规则,根据反馈调整策略。三倍分数不能翻译成「所有推理都强三倍」,只能说明它在连续试错的任务上表现突出。1:47主播Zapier AutomationBench 里,它按同样成本取得约一点五倍的通过率;OSWorld 2.0 上,它用略高于 Fable 5 最佳结果三分之一的成本超过那个结果。OSWorld 2.0 包含一百零八个日常和专业长流程。外部研究提醒,这仍是被设计过、可评分的任务,不能直接代表所有办公室工作。2:12主播公告里的早期用户反馈,集中在复杂调试、根因分析、代码审查、金融研究、法律代理和合同审阅。有人说它会根据测试结果持续修改方案,也有人说它在基因组分析里会主动选择统计检验。这些是客户证言,不是独立对照试验,但和长程评测指向同一件事:模型更愿意把工作做完再交回来。2:41主播生命科学评测中,Anthropic 说 Opus 5 每项结果都高于 Opus 4.8;有机化学高出十点二个百分点,蛋白质任务高出七点七个百分点。不过,长时间、完全自主的生物研究仍是限制区间,Mythos 5 在这类工作上更强。3:02主播Anthropic 的行为审计把 Opus 5 称为目前最符合其 Constitution 的模型,整体不对齐行为分数是二点三。同时,官方承认它在网络安全上落后于 Mythos 5:发现源代码漏洞接近,但开发利用程序明显更弱。分类器允许漏洞发现,拦截二进制扫描、渗透测试和利用程序生成;Claude.ai、Claude Code 和 Claude Cowork 中的标记请求默认回退到 Opus 4.8。3:38主播Opus 5 的核心变化,是在同样价格下,把模型推向更长的任务链、更高的工具效率和更稳定的专业工作。对写代码、做研究、处理文档的人,它值得测试;对生物研究和网络安全这类高风险工作,不能把「更强」当成「可以放手」。