
《Anthropic 智囊团一日发言|2026-07-27》
严格窗口内仅 5 条达标信号:Anthropic 产品团队把评测、模型路由和跨界面用户反馈放到 Claude Code 的日常工作流中心,官方渠道本期没有新发布。
今日判断
严格按北京时间 2026 年 7 月 26 日 08:00 至 7 月 27 日 08:00 的窗口扫描,本期有 5 条达标信号,但没有足够材料凑满 10 条。信号主要来自 Claude Code 产品团队的实际使用与用户反馈,以及 Anthropic 产品负责人 Dianne Penn 的一场长访谈;Anthropic 官方 Newsroom、Research 和 Claude 博客在窗口内没有新的发布,7 月 24 日的 Opus 5 与上下文工程文章只能作为背景。
- Anthropic 产品团队正在把「评测结果」放到传统 PRD 之前。Dianne Penn 直接说,团队内部有一句话叫「evals are the new PRDs」,并要求产品经理亲自用模型、亲自交付。
- 模型选择开始按任务角色分工。Claude Code 团队成员 Lydia Hallie 描述的做法是:模糊任务先让 Fable 5 规划,Opus 5 执行;这不是官方默认路由,而是一个内部使用信号。
- Claude Code 的代理想象正在离开「写代码」本身。Thariq 把 Opus 5 放进手游经济的日常 A/B 测试、头脑风暴和实现循环,但他也明确说这仍然需要人的实际工作。
- Cowork 与 Code 之间的边界仍有摩擦。Lydia Hallie 连续追问用户为何切换界面、如何迁移指令,并说降低 effort 到 medium 能缓解一类反馈,说明产品团队仍在观察上下文传递和成本控制的真实缺口。
- 外部观察席出现一条与模型供应链安全有关的讨论,但它不是 Anthropic 内部发言,也没有直接指向 Anthropic,只作为低信号观察保留。
今日关注优先级:中。 内部产品信号连续出现,足以说明工作方式正在变化,但本期没有新的官方发布、研究论文或高管政策发言,不能据此推导路线图或正式功能承诺。
今日精选信息点
1. Anthropic 把 evals 放到 PRD 之前,产品经理必须亲自把模型用到交付环节
- 涉及人物 / 账号:Dianne Penn,Anthropic AI Research and Labs 产品负责人;长访谈发表于北京时间 7 月 26 日 20:30。她是 Anthropic 的首位技术产品经理,访谈简介称她参与过 Claude 2 之后多代模型,以及 Claude Code、MCP、Skills、computer use、tool use 和 reasoning 的孵化。1
- 主题分类:产品与企业落地
- 中文摘要:在她描述的工作方式里,产品定义不再从一份预先写好的 PRD 开始,而是从可重复运行的评测、用户痛点和结果反馈开始。
- 信源层级:Anthropic 产品负责人公开长访谈,属于内部自述;不是外部验证。
- 内容性质:产品研发方法与组织工作方式信号。
- 重要性说明:模型能力变化太快时,静态需求文档很容易在交付前失效。把 eval 作为工作的定义方式,意味着产品团队要先把「什么算完成」变成可观察结果,再决定具体实现路径。
原文与中文翻译
「we actually have a saying on the team of evals are the new PRDs」中文:我们团队有一句话,叫「评测就是新的 PRD」。2
她还说,产品经理和团队管理者不能只做试用和摆弄,而要真正用这项技术完成交付;在模型产品上,「使用过」和「把结果送进生产」之间的差距,正是评测集和反馈闭环要填的部分。2
衍生上下文
- Claude Opus 5 的官方发布页把 effort 设定描述为在智能、速度和成本之间做选择,并将模型定位为日常使用和长时代理的基础模型。这支持「结果和成本一起评测」的方向,但不证明 Anthropic 的所有团队都已采用同一流程。3
- Claude 官方的上下文工程文章称,团队为 Opus 5 和 Fable 5 删除了超过 80% 的 Claude Code system prompt,且编码评测没有可测量损失。这是一个具体的内部迭代案例,能说明为什么评测比固定文档更适合验证上下文策略,但文章没有披露独立复现。4
2. Claude Code 的产品与模型被当成同一个采用系统来设计
- 涉及人物 / 账号:Dianne Penn,Anthropic AI Research and Labs 产品负责人;同一场 93 分钟访谈,发表于北京时间 7 月 26 日 20:30。1
- 主题分类:产品与企业落地
- 中文摘要:她把模型能力和 Claude Code 的产品体验描述成相互放大的组合,并用「Claude 8 到来后用户会做什么」来反推今天的产品是否面向未来兼容。
- 信源层级:内部产品负责人的公开自述。
- 内容性质:模型适配、产品采用与前瞻性规划信号。
- 重要性说明:这比单独宣称模型更强更有信息量。模型能力只有在工作流、工具和交互面里变成可持续使用的行为,才会转化为采用;反过来,产品暴露的摩擦又会回流到模型和评测设计。
原文与中文翻译
「What changes in what users do? What does that mean for how you're building today? Is it going to be forward compatible to that experience?」中文:用户的行为会发生什么变化?这对你今天的构建方式意味着什么?它是否能面向那种体验保持前向兼容?2
访谈还把模型和产品体验放在同一个采用循环里讨论:模型提供能力跃迁,Claude Code 提供把能力变成日常工作的载体。这个判断来自团队自述,不能当作外部因果验证,但它解释了为什么近期的 Claude Code 更新常常同时涉及模型、上下文、工具和长时任务。
衍生上下文
- Anthropic 官方把 Opus 5 定位为面向长时代理、编码和知识工作的日常模型,并公开 effort 与成本曲线。这与「模型能力必须嵌入工作流」的判断一致,但官方发布页没有确认访谈中所说的内部组织机制。3
- Claude 官方上下文工程文章把 system prompt、Skills、CLAUDE.md、memory 和工具描述都视为影响结果的上下文组成部分,说明产品体验的边界并不只在模型本身。4
Loading content card…
3. Thariq:编码代理可以进入手游经济的 A/B 测试循环,但人的工作没有消失
- 涉及人物 / 账号:Thariq,Claude Code 团队成员,@trq212。
- 发布时间:北京时间 7 月 26 日 11:06 和 11:12,连续回复同一讨论。5 6
- 主题分类:Claude Code / Agent
- 中文摘要:他认为手游成功很大程度取决于持续迭代和测试游戏内经济,coding agents 可能加快找到合适经济模型的过程;如果今天做手游,他会让 Opus 参与每天的头脑风暴、A/B 测试和新方案实现。
- 信源层级:产品团队成员个人账号的一手回复。
- 内容性质:代理工作流设想与团队实践信号,不是产品发布。
- 重要性说明:这里的增量不在「模型也能写游戏代码」,而在于把代理放进一个需要持续实验、观测反馈、再改动的经济系统。它接近一个可循环的业务实验助手,而不是一次性代码生成器。
原文与中文翻译
「The success of a mobile game is actually mostly about the in-game economy and monetization, which is heavily iterated on and tested. I think coding agents might make it faster to find the right economy now.」中文:手游的成功实际上很大程度取决于游戏内经济和变现,而这部分需要大量迭代和测试。我认为 coding agents 现在可能会让找到合适经济模型的过程更快。5
「I would probably set up an economy, and let opus run all the a/b tests, brainstorm with it each morning and have it implement and try new ones. But imo this is both actual work for you and makes the game more likely to succeed.」中文:如果今天做手游,我可能会先搭出一个经济系统,然后让 Opus 运行所有 A/B 测试,每天早上和它一起头脑风暴,再让它实现并尝试新方案。但在我看来,这同时也是你真正要做的工作,而且会让游戏更可能成功。6
衍生上下文
- Opus 5 官方发布页强调其在软件工程、知识工作和长时代理任务上的定位,这能支撑它被拿来讨论持续工作流,但没有证明它已经具备自动经营手游经济的正式能力。3
- Dianne Penn 在同日公开访谈中反复强调要亲自使用模型来发现更好的产品想法,并提醒人的判断仍然重要。两条材料互相补充,但都属于 Anthropic 内部人员的自述,不是独立的游戏业务效果评估。2
4. Lydia Hallie:模糊任务先用 Fable 5 规划,Opus 5 执行
- 涉及人物 / 账号:Lydia Hallie,Claude Code 团队成员,@lydiahallie。
- 发布时间:北京时间 7 月 26 日 12:00。7
- 主题分类:模型与研究
- 中文摘要:她说自己大多数任务使用 Opus 5;当任务不明确、模糊或上下文不足时,会让 Fable 5 先做规划,再让 Opus 执行。
- 信源层级:产品团队成员个人账号的一手使用经验。
- 内容性质:模型路由与任务分解实践,不是官方默认配置。
- 重要性说明:这是一种按任务阶段分工的模型选择:规划阶段优先处理不确定性,执行阶段优先处理落地。它提示「最强模型统一包办一切」未必是成本和质量的最优解,但样本只有一位内部用户,不能推成普遍最佳实践。
原文与中文翻译
「Opus 5 for most of my tasks, but when something’s not clearly specified/vague/not much context I’ll have Fable 5 plan it out and Opus execute」中文:大多数任务我会用 Opus 5;但如果任务没有明确说明、比较模糊或上下文不多,我会让 Fable 5 先规划,再让 Opus 执行。7
衍生上下文
- Claude Opus 5 官方页面明确把 effort 设定与成本、速度和任务难度联系起来,说明「任务分层」本身就是官方鼓励用户测量的变量;但页面没有公布 Fable 5 到 Opus 5 的官方规划路由。3
- Claude 官方上下文工程文章称,模型收到的上下文还包括 Skills、CLAUDE.md、memory 和工具信息。Lydia 提到的「上下文不足」因此不只是提示词长短,也可能是任务状态和持久指令不完整。4
5. Cowork 与 Code 的切换和 effort 设置仍在暴露真实产品缺口
- 涉及人物 / 账号:Lydia Hallie,Claude Code 团队成员,@lydiahallie。
- 发布时间:北京时间 7 月 26 日 22:50、23:49,以及 7 月 27 日 01:40,均在同一段用户反馈讨论中。8 9 10
- 主题分类:Claude Code / Agent
- 中文摘要:Lydia Hallie 询问用户为什么需要在 Cowork 和 Code 之间切换、如何迁移指令,并追问哪些工作负载让 Opus 失效;她随后说把 effort 降到 medium 可能有帮助,但类似反馈已经听到多次。
- 信源层级:产品团队成员公开用户反馈回复。
- 内容性质:用户研究、产品摩擦与参数调节信号。
- 重要性说明:这组回复没有宣布新功能,却比泛泛的「欢迎反馈」更具体。团队正在把界面边界、指令迁移、模型能力缺口和成本参数放在同一条反馈链里处理。与此同时,Lydia 的表述也说明 medium effort 是现阶段的缓解办法,不等于问题已经解决。
原文与中文翻译
「Why do you need to switch between Cowork and Code? For most sessions you should be able to stay on one surface, so would love to hear where we have gaps」中文:你为什么需要在 Cowork 和 Code 之间切换?大多数会话应该可以留在同一个界面上,所以我们想知道这里有哪些缺口。8
「Lowering effort to medium can help here, but I've heard this a few times now so it's good feedback!」中文:把 effort 降到 medium 可能有帮助,但我已经听到好几次类似反馈了,这是很有价值的反馈。10
衍生上下文
- Claude 官方上下文工程文章把 system prompt、Skills、CLAUDE.md 和 memory 都列为上下文来源,并承认不同层的指导可能互相冲突。这解释了为什么「指令怎么迁移」会成为跨 Cowork / Code 使用时的实际问题,但没有证明 Cowork 与 Code 已经共享全部上下文。4
- Opus 5 官方发布页说明 effort 可以向上换取更高智能,也可以向下换取更快、更便宜的结果。Lydia 的回复把这一官方参数变成了具体用户反馈中的排障手段,但没有给出适用任务的统一阈值。3
低信号观察
- 外部观察席:模型来源与后门取证仍被认为研究不足。 Thinky Machines 的 John Schulman 在北京时间 7 月 27 日 06:23 回复一段讨论时写道,模型公开表现并不能告诉我们训练数据、训练方式和潜在后门,针对这些问题可以做大量取证,但「this problem is under-studied」。他是外部观察席,不是 Anthropic 内部信源;这条内容也没有直接指向 Anthropic,因此不计入今日 5 条达标信号。11
- 产品细节未升格: Claude Code 工程师 Anthony Morris 在北京时间 7 月 27 日 07:39 说,几乎没人使用某组快捷键,团队决定改用
cmd+num做会话切换,并仍在寻找合适快捷键。由于原帖上下文不足,无法确认被替换的快捷键、具体客户端或是否已经上线,因此只作为设计讨论记录,不当作功能公告。12 - 纯转发不计入主榜: @EvanHub 在窗口内转发「如果今天能协调全球能力放缓,我会按下那个按钮」的内容,但没有新增解释;依频道规则仅记入覆盖审计,不提升为 Anthropic 信号。13
主题分类索引
- 模型与研究:4. 模糊任务由 Fable 5 规划、Opus 5 执行。
- Claude Code / Agent:3. coding agents 进入手游经济实验循环;5. Cowork / Code 切换、指令迁移与 effort 反馈。
- 产品与企业落地:1. evals 取代 PRD 成为工作定义;2. Claude Code 与模型能力构成相互放大的采用系统。
- 安全与可解释性:低信号观察。John Schulman 关于模型来源、训练过程与后门取证的讨论。
- 政策与治理:本窗口无达标信号。
- 外部观察席:低信号观察。John Schulman 的模型取证讨论。
完整覆盖审计
时间窗为北京时间 2026 年 7 月 26 日 08:00 至 7 月 27 日 08:00。下表记录本轮对主监控与次级监控账号的公开时间线检查结果;「有」不代表该账号所有发言都达标,正文只纳入经过相关性和信息增量筛选的内容。
| 账号 | 窗口内有新公开发言 | 处理结果 |
|---|---|---|
| @AnthropicAI | 无 | 官方账号最近相关内容早于窗口,未计入主榜 |
| @claudeai | 无 | 官方 Opus 5 发布早于窗口,未计入主榜 |
| @DarioAmodei | 无 | 无 |
| @ch402 | 无 | 无 |
| @AmandaAskell | 有 | 个人回复与频道主题无关,排除 |
| @bcherny | 有 | 低信息回复,排除 |
| @mikeyk | 无 | 最近内容早于窗口 |
| @DanielaAmodei | 无 | 无 |
| @jackclarkSF | 有 | 非主题性回复,排除 |
| @nottombrown | 无 | 无 |
| @janleike | 无 | 无 |
| @_catwu | 无 | 最近内容早于窗口 |
| @trq212 | 有 | 2 条相关回复,纳入第 3 条 |
| @Mike_A_Merrill | 无 | 最近内容早于窗口 |
| @EvanHub | 有 | 纯转发,无新增解释,降级记录 |
| @ErikJones313 | 无 | 无 |
| @noahzweben | 无 | 最近内容早于窗口 |
| @karan_sampath | 无 | 无 |
| @lydiahallie | 有 | 多条相关回复,合并为第 4、5 条 |
| @amorriscode | 有 | 设计细节上下文不足,降级记录 |
| @IsabellaKHe | 无 | 无 |
| @OmidMogasemi | 无 | 最近内容早于窗口 |
| @alicelovescake1 | 有 | 主要为外部内容转发或回复,未纳入主榜 |
| @lamismukta | 无 | 无 |
| @yanda_chen_ | 无 | 无 |
| @ClaudeDevs | 无 | 最近官方开发者更新早于窗口 |
外部观察席:@johnschulman2 窗口内有相关回复,作为低信号观察;@nelhage 窗口内无新公开发言。外部观察席不标记为 Anthropic 内部信源。
Claude 官方动态速览
本窗口内没有达到单列条件的 Claude / Claude Code 官方新更新。@AnthropicAI、@claudeai、@ClaudeDevs 的最新相关产品发布集中在 7 月 24 日的 Opus 5 及其开发者说明,早于本期窗口,故只作为背景,不重复计数。14
References
- 1Dianne Penn 访谈视频
- 2Dianne Penn 访谈逐字稿
- 3Introducing Claude Opus 5
- 4The new rules of context engineering for Claude 5 generation models
- 5Thariq 关于手游经济与 coding agents 的回复
- 6Thariq 关于让 Opus 运行 A/B 测试的回复
- 7Lydia Hallie 关于 Fable 5 与 Opus 5 分工的回复
- 8Lydia Hallie 追问 Cowork 与 Code 的切换原因
- 9Lydia Hallie 追问 Opus 工作负载缺口
- 10Lydia Hallie 关于降低 effort 的回复
- 11John Schulman 原文
- 12Anthony Morris 原文
- 13Evan Hub 转发内容
- 14Anthropic Newsroom
Related content
- Sign in to comment.
