
《Anthropic 智囊团一日发言|2026-07-20》
今日 4 条达标信号显示,Claude Code 正把代理持续运行拆成可验证的完成条件、并行执行、独立复核和更轻的上下文;另有一条关于 Fable 从代写转向子编辑的个人观察。
先看结论
今日共 4 条达标信号,其中 3 条来自 Claude Code 团队成员 Thariq 在 7 月 19 日公开的一场新访谈,1 条来自 Anthropic 政策与沟通负责人 Jack Clark 的个人使用观察。今天的新增不在于又上线了一个命令,而在于 Claude Code 团队把「让代理持续工作」拆成了可验证的完成条件、并行执行与独立复核;同时,团队开始反思随着模型能力提高,固定指令和示例是否反而占用上下文、限制模型发挥。
- 产品方法的重心在移动:Thariq 将
/loop、/goal和 workflows 视为让代理跨多个回合持续工作的不同机制,重点从「怎样写一个更长的提示词」转向「怎样定义退出条件、拆分任务并验证结果」。1 - 上下文管理开始进入产品设计层:Thariq 在访谈中说,Claude Code 团队把系统提示词缩短了 80%,理由是更强的模型需要更少的方向、约束和示例;这不是「删掉所有规则」的建议,而是一次针对新模型的指令审计。2
- 计划不再只是实现前的文档:Thariq 把规划描述为持续探索、调查并消除未知数的过程,并强调人需要真正读计划,而不是把生成的 Markdown 当成自动批准按钮。访谈中他还自述 Anthropic 内部用 HTML artifacts 分享计划、PR 和事故报告。3
- Fable 的新信号是编辑而非代写:Jack Clark 说自己认为 AI 直接写作「普遍令人痛苦」,但 AI 子编辑已经很有帮助;这是个人体验,不是能力基准,却为 Fable 的近期使用场景提供了一个比「生成一篇文章」更具体的观察。4
整体关注优先级:高。本期最值得跟踪的是 Claude Code 是否继续把「持续运行、规划、复核和上下文控制」做成一组相互配合的工作机制。需要保留的边界是:核心材料主要来自一场团队成员访谈和一条个人体验,尚无独立基准或公开采用数据可以证明这些方法已经在外部用户群体中普遍有效。
今日达标主信号
1. Thariq:模型变强后,Claude Code 先删掉 80% 的系统提示词
发言人 / 账号:Thariq,Claude Code 团队成员,@trq212。发言场合是 Peter Yang 的 Behind the Craft 视频访谈,视频于 2026 年 7 月 19 日 21:00(Asia/Shanghai)公开;Peter Yang 随后在 X 上于 22:15 摘录了这段内容。12
Thariq 的原话是:
As the models have gotten smarter, they need less direction, fewer constraints, and fewer examples.We cut the Claude Code system prompt by 80%.
中文翻译:
随着模型变得更聪明,它们需要的方向、约束和示例都更少了。我们把 Claude Code 的系统提示词缩短了 80%。
重要性说明:这条信息的价值不在 80% 这个数字本身,而在于它把「模型升级」和「代理脚手架重写」直接连在了一起。Thariq 进一步解释,过去系统提示词里会写工具用法、多个示例和大量「不要这样做」的约束;对更新后的模型而言,示例可能变成模仿边界,绝对化的禁止语句也可能把「通常不要做」误读成「永远不要做」。这意味着下一轮模型发布后,用户侧的
CLAUDE.md、skills 和项目规范也应重新审计,而不是把历史指令原封不动地叠加上去。衍生上下文:
- Claude Code Skills 官方文档说明,skill 内容一旦加载会留在当前会话上下文中,正文越长,后续每一轮的固定成本越高;文档也建议把 skill 主体保持简洁。5这支持「指令需要持续瘦身」的方向。
- 同一场访谈的完整字幕里,Thariq 把缩减系统提示词与「给模型更多运行空间」联系起来,而不是声称模型已经不需要边界。1
- Peter Yang 的访谈摘要把这条经验压缩为「新模型发布后先尝试删指令」,但这是采访者的提炼,不是公开实验结论。2
支持 / 削弱分析:支持证据是 Thariq 的完整口述和 Peter Yang 的同日原文摘录,二者在数字和解释上相互吻合;削弱因素是没有公开系统提示词版本差异、评测集或外部复现实验,因此不能把 80% 推广成所有 Claude Code 项目都应执行的比例。更稳妥的做法是保留安全边界、权限边界和可验证验收条件,只删除已经变成重复说明、过时示例或过度具体的过程指令。
内容性质:团队内部产品实践分享。信源层级:Anthropic 员工个人长访谈,外部发布。行业含义:模型能力提升后,提示词工程的一部分工作可能从「增加规则」转成「移除过时规则并保留可验证约束」。
2. Thariq:/goal 的关键不是让代理不停跑,而是给它一个能被检查的终点
发言人 / 账号:Thariq,@trq212;同一场 2026 年 7 月 19 日公开的 Behind the Craft 访谈。1
Thariq 对三种持续工作机制的概括是:
We've got /loop, we've got /goal, and we've got workflows. These are all geared at trying to get the agent to run for long periods of time.
他对 workflows 的解释更具体:可以启动多个子代理,让它们分别完成工作、并行工作和验证工作。中文翻译如下:
我们有/loop、/goal和 workflows,它们都指向同一个方向:让代理运行更长时间。workflows 可以启动子代理,让它们分别做事、并行推进和验证结果。
Claude Code 官方文档补足了这条发言的产品边界:
/goal 设置一个完成条件,上一轮结束后由一个小型快速模型判断条件是否满足;如果没有满足,Claude 会继续下一轮。官方示例要求条件包含一个可测量的终点,例如所有测试通过、构建退出码为 0 或队列为空。一个会话同时只能有一个 goal,且 /goal 不能替代权限设置。6重要性说明:这把「长时间运行」从一个模糊的自动化愿望,收敛成三层设计:任务如何继续、什么算完成、谁来检查完成。对开发者而言,
/goal 更像带外部评估器的持续回合,而不是一句「一直做下去」的强化版提示词;对复杂任务而言,验证代理和执行代理分开,也是在降低「模型偏爱自己产出」带来的复核偏差。衍生上下文:
- Claude Code /goal 文档明确写出,评估器只读取对话中已经呈现的内容,不会独立调用工具或读取文件。因此「测试通过」这类条件要让 Claude 把检查结果带回对话,不能把不可观察的主观目标直接交给评估器。6
- Claude Code 子代理文档说明,子代理拥有独立上下文、工具范围和权限配置,适合把探索、实现或专门检查从主对话中分离出来。7这与 Thariq 对并行工作和独立验证的描述一致。
- Peter Yang 的同日 X 摘录记录了 Thariq 的另一句提醒:
/goal应配合明确的完成标准,不应把「做一个很棒的游戏」这种无法验证的目标直接交给循环。2
支持 / 削弱分析:支持证据来自访谈原话与官方
/goal 文档的机制描述;削弱因素是文档证明了功能如何工作,却不能证明工作流一定能产出高质量结果。结果质量仍取决于完成条件是否能被观察、权限是否合适,以及执行代理和验证代理是否有不同而充分的上下文。内容性质:产品机制与团队实践。信源层级:Anthropic 员工长访谈,官方文档作边界核验。行业含义:代理产品的竞争点正在从「能否调用工具」转向「能否持续推进并以独立信号结束任务」。
3. Thariq:规划是消除未知数的循环,人必须读计划
发言人 / 账号:Thariq,@trq212;同一场访谈,视频章节位于 08:17 的规划讨论、14:32 的 HTML artifacts 讨论和 18:35 的 Slack 并行任务讨论。3
Thariq 对规划的原话是:
Planning is an iterative process of exploring, investigating, finding out what you don't know, what you want.I like to say getting rid of your unknowns.
中文翻译:
规划是一个反复探索、调查、弄清自己不知道什么以及想要什么的过程。我更愿意把它叫作消除未知数。
他还特别指出,失败模式之一是人把代理生成的计划快速扫一眼就跳过;计划的意义在于人真正读它,知道重要假设、边界和待解决问题。访谈中他举了自己做视频工作流的例子:先让 Claude 解释 Whisper 转录的沉默、分段和说话人识别等边界,再做 HTML 设计探索和小型原型,最后才进入更昂贵的实现。1
Thariq 同时自述,Anthropic 内部会让 Claude 创建 HTML artifacts,用于分享计划、已经完成的 PR、状态报告和事故报告;他还描述了在 Slack 中运行多个 Claude 任务,把后台工作、团队协作和单个主任务分开。这些是受访者对团队实践的描述,不应等同于 Anthropic 对所有组织的正式产品承诺。3
重要性说明:这条信号把「agentic coding」的核心风险从代码生成错误,扩展到了问题定义和验收标准。如果未知数没有在实现前被显式暴露,代理可能只是更快地把错误假设写成一套看起来完整的系统。HTML artifact 在这里也不是装饰性的可视化,而是一个让人审阅、比较和继续修改计划的中间工作面。
衍生上下文:
- Claude Code Skills 文档把 skill 定义为可复用的指令、检查清单和多步骤流程,并建议把复杂内容拆到支持文件中;这与「先探索,再把稳定步骤封装成 skill」的实践吻合。5
- Claude Code 子代理文档将 Explore 和 Plan 设为独立的只读工作角色,目的之一就是把代码库探索留在单独上下文中,避免主会话被搜索结果和日志淹没。7这支持把规划当作独立阶段,而不是一条提示词里的附属句子。
- Peter Yang 的访谈摘要把「先消除未知数、再开始构建」列为访谈重点,但页面同时也显示材料来自一次团队成员访谈和其个人工作方法,不能替代对外部团队的效果评估。3
支持 / 削弱分析:支持证据是完整字幕中连续的规划、原型、HTML artifact 和 Slack 使用描述;削弱因素是这些案例由 Thariq 自述,缺乏项目成功率、返工率或成本数据。可以把它作为工作方法信号,而不是「Anthropic 已经解决软件工程协作」的结论。
内容性质:团队内部工作方法分享。信源层级:Anthropic 员工长访谈,第三方节目页面提供章节和发布信息。行业含义:未来的代理工作流可能需要一个可读的探索层,把人从逐行指挥者变成假设、范围和验收条件的审阅者。
4. Jack Clark:Fable 的一个具体用法是「子编辑」,不是代替作者写作
发言人 / 账号:Jack Clark,Anthropic 政策与沟通负责人,@jackclarkSF。发布时间为 2026 年 7 月 20 日 02:33(Asia/Shanghai)。4
Jack Clark 写道:
Fable just had a good suggestion for some text of a fictional story to delete. I find AI writing broadly excruciating, AI sub-editing pretty helpful, and feels like 'AI editing' is now coming online.
中文翻译:
Fable 刚刚对一段虚构故事文本提出了一个不错的删除建议。我总体上觉得 AI 写作很痛苦,但 AI 子编辑很有帮助;感觉「AI 编辑」正在开始真正可用。
重要性说明:这不是 Fable 的新功能公告,也没有给出可复现的文本样本或评测结果。它的价值在于使用场景足够具体:模型不必负责从零产出整篇作品,而是作为一个能提出删除建议的编辑层参与创作。对模型产品来说,这条路径更容易保留作者的意图,也更容易由人快速接受或拒绝局部修改。
衍生上下文:
- Claude 官方 Fable 5 计划说明显示,Fable 5 的访问在此前曾因需求难以预测而分阶段安排;这解释了为什么当前更值得记录真实使用场景,而不能把一条个人体验写成新版本发布。该帖发布时间在上一期窗口,仅作背景。8
- Anthropic 的 Fable 5 重新上线说明把 Fable 5 的安全护栏、误报取舍和使用范围写成正式背景,但没有为「AI 编辑」提供独立能力评测。9
- Jack Clark 原帖本身是一次个人体验,互动数据不构成质量验证,也没有公开被删除的文本和模型建议。4
支持 / 削弱分析:支持证据是 Anthropic 内部人员在窗口内给出的具体使用反馈;削弱因素是单一案例、无原文对照、无独立评测,且「有用」的判断由发言者本人给出。它应被标为中低强度的产品使用观察,不应升级成 Fable 已经解决长文本写作的结论。
内容性质:个人使用观察。信源层级:Anthropic 内部人员个人账号。行业含义:高能力模型的落地不一定先表现为整篇代写,局部删改、审阅和提供反例建议可能是更容易被专业用户接受的入口。
主题分类索引
- 模型与研究:#1,系统提示词随模型能力变化而缩减;当前没有公开基准证明 80% 缩减带来的效果变化。
- Claude Code / Agent:#1、#2、#3,覆盖上下文、持续运行、完成条件、子代理、规划和验证。
- 产品与企业落地:#3,Thariq 对 HTML artifacts、Slack 并行任务和内部协作方式的自述;不把团队实践写成普遍可用的企业功能承诺。
- 安全与可解释性:本窗口无达标新信号。
- 政策与治理:本窗口无达标新信号。
- 外部观察席:本窗口无达标信号;@johnschulman2 与 @nelhage 在严格窗口内没有新的可核对发言。Jack Clark 是 Anthropic 内部人员,不归入外部观察席。
今日关注优先级
高:Claude Code 是否会继续把「更长运行时间」产品化为可定义、可观察、可验证的多回合工作流。读者应优先看
/goal 官方文档的完成条件和评估边界,再判断自己的任务是否适合持续运行。中高:系统提示词缩减 80% 释放出一个实际问题:每次模型升级后,团队是否有机制审计
CLAUDE.md、skills、MCP 说明和权限规则。删指令本身不是目标,减少过时约束并保留可验证边界才是。中:Fable 的「AI 子编辑」观察值得继续跟踪,但后续需要公开样本、可重复测试或更多用户反馈,才能判断它是 Jack Clark 的个人偏好,还是更稳定的产品使用模式。
窗口覆盖审计
覆盖窗口:2026 年 7 月 19 日 08:00 至 2026 年 7 月 20 日 08:00(Asia/Shanghai)。X/Twitter 的时间均按 Asia/Shanghai 展示;「有」只表示账号在窗口内出现新公开动作,不等于该动作进入主榜。严格窗口内没有足够高价值信号时,本期不使用窗口外旧帖补足数量。
| 账号 | 监控层级 | 窗口内新发言 | 处理 |
|---|---|---|---|
| @AnthropicAI | 主监控 | 无 | 无窗口内新发言 |
| @claudeai | 主监控 | 无 | 最新可见发言早于窗口;Fable 计划帖为上一期背景 |
| @DarioAmodei | 主监控 | 无 | 无窗口内新发言 |
| @karpathy | 主监控 | 无 | 无窗口内新发言 |
| @ch402 | 主监控 | 无 | 无窗口内新发言 |
| @AmandaAskell | 主监控 | 有 | 生活 / 体育内容,与频道主题无关,排除 |
| @bcherny | 主监控 | 无 | 无窗口内新发言 |
| @mikeyk | 主监控 | 无 | 无窗口内新发言 |
| @DanielaAmodei | 主监控 | 无 | 无窗口内新发言 |
| @jackclarkSF | 主监控 | 有 | 1 条个人使用观察,纳入 #4 |
| @nottombrown | 主监控 | 无 | 无窗口内新发言 |
| @janleike | 主监控 | 无 | 无窗口内新发言 |
| @_catwu | 主监控 | 无 | 无窗口内新发言 |
| @trq212 | 主监控 | 有 | 1 条关于访谈后续的窗口内新帖;访谈本身作为长尾深度内容拆为 #1-#3 |
| @Mike_A_Merrill | 主监控 | 无 | 无窗口内新发言 |
| @EvanHub | 主监控 | 无 | 无窗口内新发言 |
| @ErikJones313 | 主监控 | 无 | 无窗口内新发言 |
| @noahzweben | 次级监控 | 无 | 无窗口内新发言 |
| @karan_sampath | 次级监控 | 无 | 无窗口内新发言 |
| @lydiahallie | 次级监控 | 无 | 无窗口内新发言 |
| @amorriscode | 次级监控 | 无 | 无窗口内新发言 |
| @IsabellaKHe | 次级监控 | 无 | 无窗口内新发言 |
| @OmidMogasemi | 次级监控 | 无 | 无窗口内新发言 |
| @lamismukta | 次级监控 | 无 | 无窗口内新发言 |
| @yanda_chen_ | 次级监控 | 无 | 无窗口内新发言 |
| @johnschulman2 | 外部观察席 | 无 | 无窗口内新发言 |
| @nelhage | 外部观察席 | 无 | 时间线无窗口内新内容 |
补充扫描:
- 长尾深度内容:Peter Yang 的 Behind the Craft 访谈于窗口内公开,视频时长 41 分 18 秒,已取得完整字幕并按 #1-#3 逐项核对;节目简介、章节和字幕在系统提示词、规划、HTML artifacts、Slack、多代理验证等关键点上相互吻合。1
- Anthropic Newsroom、Research 和 Policy 页面:本轮检索未找到窗口内新增且可核对的长文或研究发布;帮助中心可见的最近发布记录也早于本窗口。10
- 官方开发者账号 @ClaudeDevs:本轮没有窗口内新发言。其「Claude Code 周限额保持高于基准 50% 至 8 月 19 日」的帖子发布时间为 7 月 19 日 00:04(Asia/Shanghai),早于本期 08:00 的起始边界,且已在上一期日报中处理,本期不重复计数。11
Contenido relacionado
- Inicia sesión para comentar.
