
Anthropic 智囊团一日发言|2026-07-26
严格 24 小时窗口内仅 1 条达标信号:Anthropic 员工解释 Opus 5 在 FrontierCode 上为何可能出现 medium effort 高于 high effort,并把关键原因指向任务范围与评测规则。
今日判断
严格按 2026 年 7 月 25 日 08:00 至 7 月 26 日 08:00(Asia/Shanghai)的过去 24 小时窗口,本期只有 1 条达标信号。它不是新模型或新功能发布,而是 Anthropic 员工对 Claude Opus 5 在 FrontierCode 上出现的一个反直觉结果给出解释:高推理 effort 并非在每一种编码评测上都更高分,原因可能是模型做了超出任务范围的重构,而评测器只奖励与任务描述一致、可合并的 diff。
这条信号的含义需要收窄理解:它不支持「高 effort 普遍更差」,因为同一线程同时说,Opus 5 在 FrontierBench、CursorBench、ProgramBench 和 AA Coding Agent Index 等其他评测上,随着 high/xhigh effort 增加,编码表现明显提升。更准确的结论是,effort 选择正在变成「任务范围 × 评测口径」的联合调参问题。
对实际使用者,今天最值得记住的是:窄任务先把边界写清楚,并把 medium 作为低成本基线;需要探索、泛化或复杂代理工作的任务,再用 high/xhigh。Claude 官方提示指南也明确提醒,Opus 5 可能主动扩大任务范围,要求它「停在明确超出请求之前」比一味增加思考量更直接。1
今日精选信息点
1. Opus 5 的高 effort 不一定在 FrontierCode 得分更高,关键在于「做得更多」可能被评测扣分
- 涉及人物 / 账号:@jerhadf,Anthropic 员工,账号自述为个人观点;@trq212,Claude Code 团队成员
- 主题分类:模型与研究
- 信源层级:个人账号一手发言;随后被 Claude Code 团队成员转发扩散
- 内容性质:评测解释与使用方法信号
- 窗口时间:@jerhadf 于 7 月 25 日 08:04:39 至 08:04:42 发布连续线程;@trq212 于 7 月 26 日 00:20:32 转发。以上时间均已换算为 Asia/Shanghai。2 3
- 重要性说明:它补上了上一期 Opus 5 评测观察中缺失的机制解释。若把高 effort 的低分简单解读为模型能力倒退,会误判;当前可见证据更像是「任务范围控制」与「基准评分规则」发生了耦合。
原文与中文翻译
「Opus 5 has a better FrontierCode score at medium effort than higher effort - despite increasing performance with effort on other evals. Why?」中文:Opus 5 在 FrontierCode 上的 medium effort 得分高于更高 effort,尽管它在其他评测中的表现会随 effort 提升而上升。为什么?2
「After looking into this with Cognition, we found it’s because some grading criteria penalize out-of-scope edits. In some tasks at high/xhigh effort, Opus 5 does more than the task requires, i.e. refactoring.」中文:与 Cognition 调查后,我们发现原因在于某些评分标准会惩罚超出范围的修改。在一些任务中,Opus 5 使用 high/xhigh effort 时会做超出要求的事情,例如进行重构。4
这条信号支持什么、不能支持什么
- 支持:在以「是否生成符合任务描述的可合并 diff」为目标的 FrontierCode 中,额外修改可能被判为偏离任务。@jerhadf 对该评测的定义是:即使额外改动让代码更好,评分器仍会惩罚超出明确请求的部分。5
- 支持:增加一条要求模型留在任务范围内的短提示,显著改善了 scope criteria;但这并没有让 high/xhigh 在该评测上完全超过 medium。6
- 削弱过度解读:同一线程称,在 FrontierBench、CursorBench、ProgramBench 和 AA Coding Agent Index 等评测上,Opus 5 的编码表现会在 high/xhigh effort 下明显提升;作者还说,在多数评测与测试中,更多 test-time compute 会带来更充分的验证、更强的方案和更好的新任务泛化。7
衍生上下文
- 官方提示指南:Claude 官方文档明确写道,Opus 5 可能扩大任务范围;对窄任务应显式限制范围,并「停在明确超出请求之前」。文档还建议依据自己的评测重新做 effort sweep,把 low/medium 作为低成本主力,把 xhigh 留给高难度编码和代理任务。这支持「先控制范围、再调 effort」的实践,但文档没有证明 FrontierCode 的具体分数。1
- Claude Code 团队扩散:@trq212 转发了原始线程,说明该解释至少进入了 Claude Code 团队成员的公开讨论;但转发本身没有新增实验数据,不能当作独立复核。3
- 作者自己的使用取舍:@jerhadf 说自己仍常用 high effort,因为它往往给出更好、更有创意、更稳健的方案;如果任务需要,则会改用 medium。这是个人使用经验,不是外部效果验证,也不能代替跨任务的独立基准结果。8
对行业的含义
模型能力评测正在从「答案够不够好」转向「答案是否完成了被要求的工作,而且没有擅自改写任务」。对编码代理尤其如此:更强的模型可能更愿意替用户修复、重构和补全,但在严格的变更评测里,这些行为会从加分项变成越界。未来更有解释力的评测,可能需要把「结果质量」「范围遵守」「额外改动」分开报告,而不是只给一个总分。
图片 / 截图摘要:本条原始帖子没有可核实的截图或图表,因此不使用正文插图。
低信号观察:Opus 5 讨论仍在扩散,但没有形成第二条达标信息点
- @noahzweben(Claude Code PM)7 月 25 日 10:23:47 发帖,称自己最喜欢的一条 Opus 5 帖子涉及大学 3D 图形课中的龙卷风物理作业;93 个赞、5 次转发、2 条回复。它展示了员工对模型示例的兴趣,但没有给出可复核的模型行为、评测结果或产品边界,因此降为观察。9
- @lydiahallie 7 月 26 日 03:22:35 发帖询问大家如何使用 Opus 5、正在构建什么;256 个赞、9 次转发、139 条回复。它是用户互动与扩散信号,不是新事实。10
- @amorriscode 在窗口内转发了 @alex_erm 关于 Opus 5 图像测试的帖子;转发字段只返回了截断摘录,且没有一手评测细节,未纳入主榜。@jackclarkSF 在窗口内的新帖是家庭生活内容,与本频道主题无关,按排除条件剔除。
主题分类索引
- 模型与研究:1 条——Opus 5 的 effort、任务范围与 FrontierCode 评分口径。
- Claude Code / Agent:本期无新的达标信息点。
- 产品与企业落地:本期无新的达标信息点。
- 安全与可解释性:本期无新的达标信息点。
- 政策与治理:本期无新的达标信息点。
- 外部观察席:本期无新的达标信息点;@johnschulman2 与 @nelhage 在窗口内未出现相关新发言。
监测覆盖审计
严格窗口:2026 年 7 月 25 日 08:00 至 2026 年 7 月 26 日 08:00,Asia/Shanghai。表中「有」只表示账号在窗口内有新公开帖子,不代表该帖达标;纯转发、寒暄和无关内容仍会被记录后降级或剔除。
主监控账号
| 账号 | 窗口内新发言 | 时间与处理 |
|---|---|---|
| @AnthropicAI | 无 | 未发现窗口内新帖 |
| @claudeai | 无 | 未发现窗口内新帖 |
| @DarioAmodei | 无 | 未发现窗口内新帖 |
| @karpathy | 无 | 未发现窗口内新帖 |
| @ch402 | 无 | 未发现窗口内新帖 |
| @AmandaAskell | 无 | 未发现窗口内新帖 |
| @bcherny | 无 | 未发现窗口内新帖 |
| @mikeyk | 无 | 未发现窗口内新帖 |
| @DanielaAmodei | 无 | 未发现窗口内新帖 |
| @jackclarkSF | 有 | 7 月 25 日 11:00:22;原创,家庭生活内容,503 赞、3 次转发、19 条回复;剔除 |
| @nottombrown | 无 | 未发现窗口内新帖 |
| @janleike | 无 | 未发现窗口内新帖 |
| @_catwu | 无 | 未发现窗口内新帖 |
| @trq212 | 有 | 7 月 26 日 00:20:32;转发 @jerhadf 的 Opus 5 / FrontierCode 线程,0 赞、35 次转发、0 条回复;并入主信号,不单独计数 |
| @Mike_A_Merrill | 无 | 未发现窗口内新帖 |
| @EvanHub | 无 | 未发现窗口内新帖 |
| @ErikJones313 | 无 | 未发现窗口内新帖 |
次级监控账号
| 账号 | 窗口内新发言 | 时间与处理 |
|---|---|---|
| @noahzweben | 有 | 7 月 25 日 10:23:47;原创,Opus 5 示例讨论,93 赞、5 次转发、2 条回复;低信号观察 |
| @karan_sampath | 无 | 未发现窗口内新帖 |
| @lydiahallie | 有 | 7 月 26 日 03:22:35;原创,询问用户使用 Opus 5,256 赞、9 次转发、139 条回复;低信号观察 |
| @amorriscode | 有 | 7 月 26 日 02:51:02;转发 @alex_erm 的 Opus 5 图像测试摘录,0 赞、118 次转发、0 条回复;原文细节截断,未纳入主榜 |
| @IsabellaKHe | 无 | 未发现窗口内新帖 |
| @OmidMogasemi | 无 | 未发现窗口内新帖 |
| @alicelovescake1 | 无 | 未发现窗口内新帖 |
| @lamismukta | 无 | 未发现窗口内新帖 |
| @yanda_chen_ | 无 | 未发现窗口内新帖 |
外部观察席与长尾发现
- 外部观察席:@johnschulman2、@nelhage 均未发现窗口内相关新发言,且没有把他们标记为 Anthropic 内部信源。
- 长尾 X 发现:关键词检索发现 @jerhadf 的 Opus 5 / FrontierCode 连续线程。该账号简介自述与 Anthropic 有关,但明确标注个人观点;因此正文按个人一手信源处理,不包装成 Anthropic 官方声明。
- 官方渠道:Anthropic Newsroom 页面当前可见最新条目为 7 月 24 日的 Opus 5;Research 页面也显示 7 月 24 日的 Project Pilot,但页面没有提供更精确的绝对发布时间。本期不把这两个页面日期不足以证明落入严格窗口的条目冒充 7 月 25 日至 26 日新动态,也未发现 3 条以上 Claude / Claude Code 官方更新。
- YouTube / 播客 / 大会长内容:本轮主动检索了 Anthropic 高管、研究员及 Claude Code 相关长内容;检索到的候选缺少窗口内可验证的绝对发布时间,或未取得完整逐字稿,未纳入主榜。由此本期长篇内容覆盖存在证据缺口,不能据此断言过去 24 小时没有未被公开索引的访谈。
今日关注优先级:中
唯一达标信号解释了一个值得关注的评测现象,但它来自员工个人线程,且没有公开完整的 FrontierCode 任务集、分数表或独立复核。当前最稳妥的动作不是调整所有任务的默认 effort,而是把「范围遵守」加入自己的评测:同一任务分别跑 medium、high、xhigh,单独记录功能正确性、额外改动、可合并性和 token / 延迟成本。
下一窗口重点看三件事:官方系统卡或文档是否补充更多范围控制细节;Anthropic 是否公开 FrontierCode 的更多任务级数据;以及高 effort 的额外重构在真实代码库中究竟是净收益还是审核负担。
今日仅 1 条达标信号。
Related content
- Sign in to comment.
