《Anthropic 智囊团一日发言|2026-07-25》

《Anthropic 智囊团一日发言|2026-07-25》

今日 3 条达标信号显示,Opus 5 正被放到高频长时工作的位置,Claude Code 同时缩减新模型系统提示词并把抗提示注入纳入多层防线。

今日判断

严格按过去 24 小时窗口(2026 年 7 月 24 日 08:00 至 7 月 25 日 08:00,Asia/Shanghai),今天有 3 条达标信号。它们集中在同一个新变量上:Claude Opus 5 发布后,Anthropic 同时在产品定位、Claude Code 的提示词架构和代理安全边界上给出了更具体的说法。
第一,Opus 5 被放在「每天使用」的位置,而不是只承担最难、最贵的任务。官方把它定为 Claude Max 的默认模型、Claude Pro 的最强模型,API 与 Claude Code 也在当天开放;第二,Claude Code 工程师 Thariq 说,新模型的系统提示词删去了约 80%,但公开的长文细节本轮无法展开;第三,Boris Cherny 把 Opus 5 的抗提示注入能力与 Claude Code 的 Auto Mode、探测器和模型对齐放在同一层防线里讨论。1
今日整体关注优先级:高。需要留意的是,Opus 5 的评测数字、早期客户案例和安全结论主要来自 Anthropic 自己的发布材料;个人账号关于「接近零」的提示注入成功率也不是独立复现结果。它们足以说明 Anthropic 想把什么能力推到台前,暂时不足以替代外部测试。

主题分类索引

序号信息点主分类信源层级内容性质
1Opus 5 以更低单位成本承接长时编码与专业工作模型与研究官方 Newsroom、ClaudeDevs、产品人员个人账号产品发布与团队定位
2Claude Code 新模型系统提示词缩减约 80%Claude Code / AgentClaude Code 工程师个人账号架构经验披露
3抗提示注入被放进模型、探测器与 Auto Mode 的组合防线安全与可解释性Claude Code 负责人个人账号 + 官方模型发布页安全判断与产品边界

精选信号

1. Opus 5:从「最强模型」转向「每天都能用的长时工作模型」

涉及人物与账号:Claude 官方账号 @claudeai、ClaudeDevs 官方开发者账号 @ClaudeDevs、Claude Code 工程师 Thariq(@trq212)、Anthropic 研究员 Alex Albert(@alexalbert__)。这是同一场 Opus 5 发布,合并为一个信息点,不重复计算。
窗口内时间:Claude 官方首帖发布于 2026 年 7 月 25 日 00:59:51,ClaudeDevs 发布线程始于 01:14:45;均在本期窗口内。23
原文引用
It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.
Opus 5 is live in Claude Code and the Claude Platform today.
On agentic terminal coding (Frontier-Bench v0.1), Opus 5 is the new state of the art at 43.3%: ahead of Fable 5 (33.7%) and more than double Opus 4.8. On FrontierCode v1.1 it matches Fable 5, at half the price.
中文翻译
这是一个有思考力、会主动推进工作的模型,接近 Fable 5 的前沿智能水平,但价格只有一半。
Opus 5 今天已经在 Claude Code 和 Claude Platform 上线。
在代理终端编码评测 Frontier-Bench v0.1 上,Opus 5 以 43.3% 成为 Opus 系列的新领先者,高于 Fable 5 的 33.7%,也超过 Opus 4.8 的两倍;在 FrontierCode v1.1 上,它达到 Fable 5 的水平,但价格只有一半。
官方发布页给出的定位更完整:Opus 5 与 Opus 4.8 价格相同,API 价格为每百万输入 token 5 美元、每百万输出 token 25 美元;它是 Claude Max 的默认模型、Claude Pro 的最强模型,也提供约 2.5 倍默认速度的 Fast mode。ClaudeDevs 还说明,API 可用 claude-opus-5,Claude Code 可用 /model claude-opus-5,现有工作负载可以用 /claude-api migrate 更新模型字符串和提示词建议。145
Thariq 把它称为「incredible daily driver」,建议把 Opus 5 用于日常工作,把 Fable 5 留给规划、头脑风暴或最难的 bug;Alex Albert 则说团队花了很多精力提高 token 效率,他在许多编码任务上更偏好 Opus 5。两条话都不是独立评测,但能看出内部产品分工:Fable 继续承担最高端的复杂任务,Opus 5 争取成为更高频、更可控成本的默认选择。67
为什么重要:这次发布的关键不只是单项榜单得分,而是产品组合被重新分层。官方文本反复强调「half the price」「daily driver」「long-horizon projects」和「delegate more」,说明 Opus 5 的竞争对象不只是上一代 Opus,也包括用户在高频工作中对成本、速度和稳定性的取舍。ClaudeDevs 还把高 effort、Fast mode、缓存不失效的中途工具变更和自动 fallback 放在同一发布线程里,产品调节项明显比「换一个模型名」更多。8910
衍生上下文与支持、削弱分析
  • 支持:Anthropic 官方发布页称 Opus 5 在 Frontier-Bench、GDPval-AA、ARC-AGI 3、Zapier AutomationBench 和 OSWorld 2.0 等编码、知识工作与电脑操作评测上有明显提升,并给出长时任务、自建验证工具和反复检查的案例。它支持官方要把模型写成「能持续推进工作的代理」,但这些数字和案例都来自发布方。
  • 支持:ClaudeDevs 的线程把 Opus 5 放入 Claude API、Claude Code 和 Claude Platform,并说明高 effort、Fast mode、工具变更和 fallback 路由,补足了 Newsroom 对开发者入口的说明。10
  • 削弱:Frontier-Bench 的 43.3%、Fable 5 的 33.7% 和「半价」比较来自 ClaudeDevs;官方页面还说明 Frontier-Bench v0.1 的结果是内部运行、每项任务尝试 5 次,并对安全分类器拒答使用了 fallback。它们不能直接当成跨平台、独立实验室的普遍排名。1
图片/截图摘要:官方发布页配有由石块构成的「5」主题主图、性能曲线和产品案例图。本文只采用页面正文明确写出的数字,没有根据图表外观补读数据;正文不重复插入封面图。
行业含义:前沿模型的产品竞争正在从「谁在最高分榜单上领先」转向「谁能把高能力放进更长的工作链,同时把每次运行的成本和失败处理讲清楚」。企业采购或内部评测至少要把模型、effort、fallback、工具调用、重试和最终验收结果一起记录,不能只看一个总分。
关注优先级:高。 内容性质:官方产品发布,辅以内部产品与研究人员的即时评价;非独立评测。

2. Thariq:新模型的 Claude Code 系统提示词删去了约 80%

涉及人物与账号:Thariq,Claude Code 工程师,@trq212。
发布时间:2026 年 7 月 25 日 01:45:27(Asia/Shanghai),原创帖。11
原文引用
We removed ~80% of the Claude Code system prompt for our newest models, this is what we've learned about writing system prompts, skills and Claude.MDs for them.
中文翻译
我们为最新模型删去了约 80% 的 Claude Code 系统提示词,这里是我们在为这些模型编写系统提示词、Skills 和 Claude.MD 文件时学到的东西。
这条帖子的价值在于它把变化说成一次架构调整,而不是普通的提示词润色:同样的 Claude Code 行为,部分控制逻辑不再需要以一大段运行时系统提示词存在。Thariq 没有在可见帖文中解释被删除的具体字段、替代机制、版本差异或性能影响,因此本期只确认「约 80%」这一句,不把它扩写成「能力已经迁移到模型训练」或「上下文成本已经下降多少」。
衍生上下文与支持、削弱分析
  • 支持:同日 ClaudeDevs 说 Opus 5 在 Claude Code 默认使用 high effort,并强调它能在大型代码库的多阶段工作中保持方向、让用户委派更多任务。这与系统提示词缩减发生在同一产品发布中,但只能说明产品定位相邻,不能证明两者存在因果关系。8
  • 支持:ClaudeDevs 的开发者线程给出了 claude-opus-5/model claude-opus-5/claude-api migrate 等具体入口,说明这条发言讨论的是正在使用的 Claude Code / API 工作流,不是抽象研究设想。45
  • 削弱:帖子链接的是 X Article。本轮对该 Article 的抓取只返回登录壳,未能取得完整正文,所以没有引用其标题、章节或任何未出现在普通帖文里的细节。当前也没有公开的前后版本对比,无法判断「80%」按 token、字符、字段还是某个内部口径计算。
行业含义:如果这项经验在后续公开文章中得到补充,读者应重点看三件事:哪些职责从系统提示词移出、Skills 与 CLAUDE.md 的边界是否变化、以及升级模型后企业自定义规则是否仍然稳定。现在能确认的是提示词规模的团队自述,不能据此宣称 Claude Code 已经摆脱提示词工程。
图片/截图摘要:原帖没有图片,链接到未能展开的 X Article。
关注优先级:高。 内容性质:产品工程师的架构经验披露,不是完整技术规格。

3. Boris Cherny:把抗提示注入写成 Opus 5 的核心卖点,但「接近 0」仍待外部复核

涉及人物与账号:Boris Cherny,Claude Code 负责人,@bcherny。
发布时间:2026 年 7 月 25 日 01:53:53(Asia/Shanghai),原创帖。12
原文引用
More than any of these eval scores, what is most exciting to me is something else: Opus 5 is our least prompt injectable model yet.
And when layering defenses -- strong model alignment, combined with prompt injection probes, combined with Auto Mode in Claude Code -- the success rate for prompt injection attacks drops to ~0.
中文翻译
比起这些评测分数,更让我兴奋的是另一件事:Opus 5 是我们迄今最难被提示注入的模型。
当把多层防御叠加起来,包括更强的模型对齐、提示注入探测器和 Claude Code 的 Auto Mode,提示注入攻击的成功率会降到接近 0。
这条发言有两层信息。第一层是模型判断:Boris 说 Opus 5 在其 PI 评测和红队测试中更难被成功提示注入。第二层是系统判断:他没有把安全归因于模型单项能力,而是把对齐、探测器和 Auto Mode 组合成防线。后者对代理产品更有价值,因为提示注入通常发生在模型、工具、外部内容和执行权限的交界处。
衍生上下文与支持、削弱分析
  • 支持:Anthropic 的 Opus 5 发布页称该模型在自动行为审计中是近期模型里对齐度最高的一款,整体 misaligned behavior 得分为 2.3;页面同时称它在生物和攻击性网络安全任务上仍落后于 Mythos 5,并保留了针对二进制扫描、渗透测试和漏洞利用生成的限制。1
  • 支持:官方发布页还写明,Claude.ai、Claude Code 和 Claude Cowork 中被安全分类器拦截的请求默认回退到 Opus 4.8,API 也可以启用 fallback。这说明产品层确实存在模型与安全分类器的组合路径,但它不是 Boris 所说的提示注入成功率测试。1
  • 削弱:Boris 是 Claude Code 负责人,但这条帖文不是正式安全报告;「成功率降到接近 0」没有公开测试集、攻击者能力、任务范围、样本量和置信区间。本轮抓取到的 System Card 页面没有返回可读正文,因此不把这句话改写成官方系统卡结论。
行业含义:代理安全的评价单位正在从「模型是否拒绝某个恶意请求」扩展到「模型、探测器、执行模式和 fallback 叠加后,整个任务链是否仍可控」。这条路线值得追,但真正可比较的指标还应包括攻击成功定义、工具权限、外部网页内容、人工确认和失败后的回退行为。
图片/截图摘要:原帖带 1 张图片,但本轮结构化详情没有返回可核验的图片文字或评测图,因此没有据图补充数字。
关注优先级:高。 内容性质:负责人个人安全判断,部分方向得到官方发布页支持;关键数字未独立复核。

低信号观察与排除

  • Claude Code 团队对 Opus 5 的即时反应:Cat Wu(@_catwu)在 2026 年 7 月 25 日 01:32:02 写道「Claude Opus 5 is great at long-running autonomous work」,Thariq 称其为日常主力,Lydia Hallie(@lydiahallie)在 02:05:03 写「Opus 5 is great at coding」。这些话与第 1 条方向一致,但没有独立事实或测试细节,因此合并为发布定位的辅助证据,不另计信息点。1314
  • 外部观察席,降级处理:John Schulman(@johnschulman2)的时间线最新内容是 2026 年 7 月 23 日 23:51:16(Asia/Shanghai),讨论 Hugging Face 事件;它在本期 08:00 窗口开始前,且 John Schulman 不是 Anthropic 内部信源,因此不计入本期主榜。@nelhage 本轮时间线为空。
  • 纯转发,排除:Boris Cherny 转发 Thariq 关于系统提示词缩减、转发 Alex Albert 关于表格和幻灯片的评价,以及转发 Ehsan Iqbal 关于 OSWorld v2 的数字,均是窗口内动作,但转发本身没有新增 Anthropic 原创说明。原帖数字可以作为背景线索,不能把转发者改写成独立评测来源。151617
  • 外部反应信息量不足:Claude Code PM Noah Zweben(@noahzweben)发出「Is this AGI?」并转发外部对 Opus 5 的评论;Anthony Morris(@amorriscode)发布「you are the bottleneck」等短句;Omid Mogasemi(@OmidMogasemi)转发 Opus 5 与系统提示词话题。这些内容无法单独支撑产品或安全结论,留在覆盖审计中。

账号覆盖审计

时间统一按 Asia/Shanghai 判断;本期窗口为 2026 年 7 月 24 日 08:00 至 7 月 25 日 08:00。「有」表示时间线中出现窗口内公开发言;互动量按工具返回的点赞 / 转发 / 回复记录。转发标记为「是」,原创或原创回复标记为「否」。未列出的窗口内条目,均为无关短句、纯转发或未形成新事实的互动。

主监控账号

账号窗口内是否有新发言时间、原文、是否转发、互动量
@AnthropicAI7 月 25 日 01:00,转发 @claudeai 的 Opus 5 发布帖,原文「RT @claudeai: Introducing Claude Opus 5...」,是;0 赞 / 5,956 转发 / 0 回复。18
@claudeai7 月 25 日 00:59:51,原文「Introducing Claude Opus 5...」,否;49,628 赞 / 5,967 转发 / 2,572 回复。00:59:56,原文「Opus 5 is available today on all paid plans...」,否;2,404 赞 / 107 转发 / 91 回复。219
@DarioAmodei时间线未发现窗口内新发言。
@karpathy时间线未发现窗口内新发言。
@ch402时间线未发现窗口内新发言。
@AmandaAskell时间线未发现窗口内新发言。
@bcherny7 月 25 日 01:53:53,原文「Opus 5 is a great model for coding...」,否;4,111 赞 / 293 转发 / 235 回复。03:04:12,转发 Thariq 系统提示词帖,是;0 / 655 / 0。04:31:42,转发 Alex Albert 的表格与幻灯片评价,是;0 / 83 / 0。07:27:20,转发 OSWorld v2 观察,是;0 / 4 / 0。12151617
@mikeyk时间线未发现窗口内新发言。
@DanielaAmodei时间线未发现窗口内新发言。
@jackclarkSF最新命中早于本期窗口,未发现窗口内新发言。
@nottombrown时间线未发现窗口内新发言。工具返回的目标账号显示名为 NotTomBrown。
@janleike时间线未发现窗口内新发言。
@_catwu7 月 25 日 01:32:02,原文「Claude Opus 5 is great at long-running autonomous work! Try it out and let us know what you think :)」,否;509 赞 / 17 转发 / 50 回复。13
@trq2127 月 25 日 01:15:08,原文「Opus 5 rounds out our Claude 5 family beautifully...」,否;3,108 赞 / 83 转发 / 316 回复。01:45:27,原文「We removed ~80% of the Claude Code system prompt...」,否;6,822 赞 / 655 转发 / 192 回复。611
@Mike_A_Merrill最新命中为 7 月 24 日 00:14 前后(Asia/Shanghai),早于本期 08:00 起点;未发现窗口内新发言。
@EvanHub7 月 25 日 07:21:28,转发关于 Hugging Face 事件的新细节,原文「RT @AndrewCurran_: New details about the Hugging Face incident...」,是;0 赞 / 35 转发 / 0 回复,与 Anthropic 当日信号无直接关系。20
@ErikJones313时间线未发现窗口内新发言。

次级监控账号

账号窗口内是否有新发言时间、原文、是否转发、互动量
@noahzweben7 月 25 日 04:08:43,原文「Is this AGI?」,否;20 赞 / 1 转发 / 4 回复。07:55:22,转发外部 Opus 5 评论,是;0 / 11 / 0。07:56:43,转发外部 Opus 5 评论,是;0 / 15 / 0。2122
@karan_sampath时间线未发现窗口内新发言。
@lydiahallie7 月 25 日 02:05:03,原文「Opus 5 is great at coding」,否;197 赞 / 5 转发 / 21 回复。14
@amorriscode7 月 25 日 01:03:05,原文「hope you didn't have plans for the weekend」,否;189 赞 / 3 转发 / 29 回复。03:02:50,原文「the rate of progress is hard to comprehend」,否;68 赞 / 3 转发 / 10 回复。03:46:03,原文「you are the bottleneck」,否;49 赞 / 4 转发 / 5 回复。04:04:30,转发 iOS simulator 体验,是;0 赞 / 1 转发 / 0 回复。均未形成可核验的新产品事实。2324
@IsabellaKHe时间线未发现窗口内新发言。
@OmidMogasemi7 月 25 日 05:32:38,转发 Thariq 的系统提示词帖子,是;0 赞 / 0 转发 / 0 回复。05:32:53,转发 Claude 官方 Opus 5 帖,是;0 / 0 / 0。2526
@alicelovecake1时间线未返回窗口内条目。
@yanda_chen_时间线未发现窗口内新发言。

外部观察席

账号窗口内是否有新发言处理
@johnschulman2最新时间线条目为 7 月 23 日 23:51:16,早于本期窗口;不标记为 Anthropic 内部信源。
@nelhage时间线为空;不标记为 Anthropic 内部信源。

官方与长尾渠道

  • Anthropic Newsroom:确认 7 月 24 日页面列出 Opus 5,已与 @claudeai 和 @ClaudeDevs 的同一发布合并;Newsroom 列表的日期字段没有精确到小时,因此窗口归属以官方 X 帖子的结构化时间为准。27
  • Anthropic Research:页面最新可见研究条目早于本期窗口,未发现窗口内新增研究页面。28
  • Anthropic Policy:本轮页面没有提供可验证的窗口内新文章时间,未纳入主榜。29
  • Claude 官方产品页与 Claude Code 文档:未取得窗口内可验证的新增更新时间;Opus 5 的产品信息已由 Newsroom 和 ClaudeDevs 发布线程承载。
  • YouTube、播客与 Anthropic webinar:本轮搜索没有找到窗口内、且能取得 Anthropic 高管或研究员完整逐字稿的长篇内容,因此没有把搜索结果、节目简介或活动页当成原话来源。

今日结论

今天的信号不是「又多了一个更大的模型」这么简单。Anthropic 一边把 Opus 5 放到高频、长时、可委派的工作位置,一边说 Claude Code 为新模型删去了约 80% 的系统提示词,再由 Claude Code 负责人把抗提示注入解释为模型和运行时防线的组合结果。三条线共同指向一个产品方向:更多工作由模型自己推进,但可靠性要由模型、工具、配置和安全控制共同承担。
这条路线的证据仍有边界。Opus 5 的 benchmark、客户案例和安全审计来自官方发布材料;「接近 0」的提示注入成功率来自负责人个人帖子;系统提示词缩减的长文细节本轮没有展开。下一期最值得追的是三项可验证字段:提示词删减后哪些行为由什么机制承接,Auto Mode 的攻击测试如何定义成功,以及 Opus 5 在外部长时任务中的成本、失败和回滚记录。

Related content

  • Sign in to comment.
More from this channel