
《Anthropic 智囊团一日发言|2026-07-24》
今日 5 条达标信号显示,Anthropic 正把代理任务拆成可持续循环、持久行为配置和主动获取更好输入的工具链,同时 Voice 进入多端 public beta。
今日判断
严格按过去 24 小时窗口(2026 年 7 月 23 日 08:00 至 7 月 24 日 08:00,Asia/Shanghai),今天有 5 条达标信号:3 条来自 Anthropic 产品或工程人员的个人账号,2 条来自 Claude 官方渠道。核心变化不是单一功能上线,而是同一组产品信号同时落在三层:把目标和指标写进长期代理任务,把行为风格写进持久配置,再把 Voice 和图表缩放工具接到模型与工具链上。
今天的关注优先级:高。Claude Code 团队继续把代理从「一次对话里的执行者」做成有触发条件、持久配置和复核路径的工作单元;Claude 官方则把语音交互和视觉工具的边界说得更具体。需要保留的限制也很明确:Fable 的案例是团队展示的工作流示例,不是独立评测;Chartography 的准确率是官方账号披露的结果,尚未看到独立复现;Voice 仍是 public beta。
主题分类索引
| 序号 | 信息点 | 主分类 | 信源层级 | 内容性质 |
|---|---|---|---|---|
| 1 | Boris Cherny 用目标、p95 和 profiler 驱动 Fable 工作流 | Claude Code / Agent | Claude Code 负责人个人账号 | 工作流示例 |
| 2 | Thariq 将按计划或事件触发的循环视为 Claude Tag 的主要形态 | Claude Code / Agent | Claude Code 工程师个人账号 | 产品架构判断 |
| 3 | Claude Code 的 output style 从独立命令收拢到 /config | 产品与企业落地 | Claude Code 工程师个人账号 + 官方文档 | 配置更新 |
| 4 | Claude Voice 接入更强模型、已连接工具并扩大语言范围 | 产品与企业落地 | Claude 官方账号 + 官方博客 | 产品发布 |
| 5 | zoom tool 显著提高密集图表问答准确率 | 模型与研究 | ClaudeDevs 官方开发者账号 | 工具实践与官方数据 |
精选信号
1. Boris Cherny:把「做到 p95 低于 300ms」直接写成代理的完成条件
涉及人物与账号:Boris Cherny,Claude Code 负责人,@bcherny。
发布时间:2026 年 7 月 23 日 14:05(Asia/Shanghai),原创回复。1
原文引用:
This is pretty how I optimize code these days. "Hey fable, use a dynamic workflow to get p95 time down under 300ms. Dont stop till you’re done, use a profiler"
中文翻译:
我现在大致就是这样优化代码的:「嘿,Fable,用一个动态工作流把 p95 延迟降到 300ms 以下。没完成就不要停,使用 profiler。」
为什么重要:这不是在宣布一个新命令,而是在展示 Anthropic 内部如何把强模型接入工程任务。提示词同时给出目标指标、持续执行条件和测量工具,代理的工作单位因此不再是「提出一个修改建议」,而是「循环运行,直到可观测指标达到要求」。这也解释了为什么产品团队近来的讨论频繁落在验证、上下文管理和长时运行,而不是只谈模型一次回答的质量。
图片/截图摘要:原帖没有图片或截图,只有文字回复。
衍生上下文与支持、削弱分析:
- 支持:Fable 官方页面把 Fable 5 定位为适合「days-long、complex、asynchronous tasks」的模型,并称其会测试自己的工作,也可在 Claude Code 等 agent harness 中分阶段规划、委派和检查。它支持 Boris 所展示的长任务定位。2
- 支持:Claude Code 官方文档将产品描述为围绕工具调用、上下文和结果验证运行的 agentic loop。它提供了「目标、动作、检查」这类循环的产品背景,但没有证明 Boris 这条具体提示词已经成为正式模板。3
- 削弱:原帖只展示了一个真实用法和一个目标阈值,没有公布最终 p95、运行时长、成本、失败次数或是否真的达到 300ms。因此,今天能确认的是「把指标写成停止条件的工作流范式」,不能把它写成 Fable 的性能成绩。
行业含义:代理评估会越来越像工程系统验收,而不是单轮答案打分。对企业而言,值得记录的字段至少包括目标指标、可调用的测量工具、停止条件、失败后的重试策略和最终证据,而不是只记录「用了哪个模型」。
关注优先级:高。
内容性质:个人账号工作流示例,不是功能发布或性能承诺。
2. Thariq:真正有规模的循环,是按计划或事件重新启动工作
涉及人物与账号:Thariq,Claude Code 工程师,@trq212。
发布时间:2026 年 7 月 23 日 09:42(Asia/Shanghai),原创回复。4
原文引用:
I think people mean different things when they say loops, the ralph loop is too narrow and I agree is on its way out.But loops that do things on a schedule or in response to something are big, eg Claude Tag is mostly loops.
中文翻译:
我觉得大家说「循环」时指的不是同一件事。Ralph loop 的范围太窄了,我同意它正在退出中心位置。但按计划执行,或在某个事件发生后执行的循环会很重要,例如 Claude Tag 基本上就是由循环构成的。
为什么重要:这条发言把 Claude Tag 的产品形态从「在 Slack 里调用一个代理」重新描述为「由触发器驱动的持续工作」。区别在于,前者的中心是一次请求,后者的中心是事件、状态和后续动作。它也给最近的 Claude Code 长时运行讨论补上了一个产品化视角:循环不只意味着模型反复改代码,还可以是定时任务、消息事件或其它外部条件触发的新一轮会话。
图片/截图摘要:原帖没有图片或截图,只有文字回复。
衍生上下文与支持、削弱分析:
- 支持:Claude Tag 官方文档说明,被标记进线程会启动一个工作会话,并把处理结果回到原对话。这能确认「事件触发一个可返回结果的工作会话」是公开产品行为,但文档没有公开 Thariq 所说的全部内部循环实现。5
- 支持:Claude Code 的 routines 文档把按计划或事件运行的自动化任务作为独立能力说明,说明 Anthropic 正在把触发、运行和回传拆成可配置的产品层。6
- 削弱:这是一名产品工程师的架构判断,不是性能或可靠性保证。公开页面没有给出 Claude Tag 循环的最大运行时长、重复触发去重、失败重试、事件积压和权限审计细节。
行业含义:评价企业代理时,不能只问「模型会不会用工具」,还要问「什么事件能触发它、它能持续多久、状态保存在哪里、谁能停止它」。循环一旦成为产品基本单元,权限和可观测性就会和模型能力同等重要。
关注优先级:高。
内容性质:产品架构判断,不是完整技术规格。
3. Lydia Hallie:output style 从独立命令收拢到 /config,并直接进入系统提示词
涉及人物与账号:Lydia Hallie,Claude Code 工程师,@lydiahallie。
发布时间:2026 年 7 月 24 日 03:59 至 07:20(Asia/Shanghai),同一讨论串中的 4 条回复,均为原创回复。78
原文引用:
this lets you easily switch between styles in /config and it lives in the system prompt itself (CLAUDE.md doesn't)!an output style is just always on until you switch it, so it's a nicer dx imo. you can use the same instructions as the skill thoughnoo we just deprecated the /output-style slash command, but it's still in /config
中文翻译:
这样你可以在/config里轻松切换风格,而且它本身存在于系统提示词里,CLAUDE.md并不是这样。output style 会一直生效,直到你切换它,所以开发体验更好。不过你可以使用和 Skill 相同的指令。不,我们只是弃用了/output-style这个斜杠命令,它仍然在/config里。
为什么重要:这是一条小功能说明,但它改变的是代理的控制平面。Skill 更像按需加载的任务说明,
CLAUDE.md 更像项目上下文;output style 则直接改变系统提示词和每轮默认表达方式。把选择入口放在 /config,意味着团队可以把「默认怎么工作、怎么解释、是否主动执行」当作持久配置来管理,而不是每次任务重新粘贴一段提示词。图片/截图摘要:原帖没有图片或截图,只有文字回复。
衍生上下文与支持、削弱分析:
- 支持:官方文档明确写出,
/output-style在 v2.1.73 被弃用、在 v2.1.91 移除,用户应通过/config或outputStyle字段设置;当前选择会保存到项目的.claude/settings.local.json。9 - 支持:官方 settings 文档进一步说明,output style 属于系统提示词的一部分,通常在
/clear或重启后重建;配置还分为 managed、user、project 和 local 等作用域。它支持「持久化配置」的判断,但不代表每种风格都自动成为团队共享政策。10 - 削弱:output style 只改变回答角色、语气和格式,不直接改变模型知识;官方文档还提醒,自定义风格默认可能移除 Claude Code 的内置软件工程指令,只有设置
keep-coding-instructions: true才会保留。因此「更自动」不能直接等同于「权限更大」。9
行业含义:Anthropic 正把代理的行为控制拆成更细的层级。企业落地时应分开管理项目知识、任务技能、系统风格和权限策略,不能用一份长
CLAUDE.md 同时承载全部责任。关注优先级:高。
内容性质:配置行为更新,官方文档已提供边界说明。
4. Claude Voice:更强模型、已连接工具和更多语言进入同一条语音路径
原文引用:
Voice mode now runs on Claude's more capable models and reaches the tools you've connected mid-conversation.Voice conversations now use more of the models you have in chat, including Claude Opus and Sonnet. Claude can also reach the tools you've connected mid-conversation, like your email and calendar.Voice mode also supports more languages, on every plan, including Spanish, French, Hindi, and Japanese. The update is rolling out today in public beta on mobile, desktop, and web.
中文翻译:
Voice mode 现在运行在 Claude 更强的模型上,并能在对话过程中访问你已连接的工具。语音对话现在可以使用聊天里更多模型,包括 Claude Opus 和 Sonnet;Claude 也能在对话过程中访问已连接的工具,例如邮箱和日历。Voice mode 现在在所有套餐支持更多语言,包括西班牙语、法语、印地语和日语。该更新今天开始在移动端、桌面端和网页以 public beta 形式推出。
为什么重要:这条官方发布把 Voice 从「把文字输入改成说话」推进到「语音作为带模型选择和工具调用的工作入口」。如果用户能在语音过程中继续访问邮箱、日历等连接器,语音交互就不再只是轻量问答,而会进入需要权限、确认和结果反馈的工作流。不过发布串只确认已连接工具可以被访问,没有确认所有工具都支持语音路径,也没有承诺语音调用会绕过现有确认机制。
图片/截图摘要:官方帖子没有提供可核验的产品界面截图,只有下载入口卡片。
衍生上下文与支持、削弱分析:
- 支持:Claude 官方博客将这次更新定位为让 Voice 使用 Claude Opus、Sonnet 和 Haiku,并支持在对话中切换模型、调用已连接工具和扩展语言。13
- 支持:Claude 的 connectors 页面把连接器定义为用户主动连接的外部服务,并强调权限与数据处理边界。由此看,原帖中的「connected tools」应理解为已有授权的工具,而不是 Voice 获得任意外部访问能力。14
- 削弱:这是 public beta 发布,官方没有在这组短帖里给出不同套餐的完整模型、语言、工具和额度矩阵;文章只采用官方明确写出的 Opus、Sonnet、邮箱、日历、移动端、桌面端和网页范围。
行业含义:语音代理的关键指标会从识别准确率扩展到工具调用的确认体验、错误恢复和跨设备会话连续性。对企业而言,Voice 是否能进入正式工作流,取决于连接器权限和审计,而不只是能否流畅对话。
关注优先级:中高。
内容性质:官方产品发布,public beta。
5. ClaudeDevs:图表 zoom tool 让密集图表问答出现大幅准确率提升
原文引用:
On the Chartography benchmark (100 questions over dense real-world charts), Fable 5's accuracy goes from 29% to 73% with a zoom tool, and Sonnet 5’s from 13% to 44%.We've updated our "zoom tool" cookbook. When large images get downscaled, important detail can be lost. A zoom tool lets Claude request a region and get that crop back from the full-res original.
中文翻译:
在 Chartography 基准上,这个基准包含 100 道基于真实密集图表的问题,加入 zoom tool 后,Fable 5 的准确率从 29% 提高到 73%,Sonnet 5 的准确率从 13% 提高到 44%。我们更新了「zoom tool」Cookbook。当大图被缩小时,重要细节可能会丢失。zoom tool 允许 Claude 请求某个区域,再从原始高分辨率图像返回该区域的裁剪结果。
为什么重要:这条信号把多模态能力的瓶颈说得很具体:模型不一定是「看不懂图」,也可能是输入阶段已经把关键细节缩没了。让模型主动请求局部高分辨率区域,相当于把视觉工具调用放进推理回路。它和 Boris 的 profiler 示例形成对应关系:一个为代码任务补充可测量的运行工具,一个为视觉任务补充可请求的输入工具。
图片/截图摘要:原帖没有附基准图或结果截图,只有文字和 Cookbook 链接。
衍生上下文与支持、削弱分析:
- 支持:Anthropic 的 Fable 官方页面把图表、表格和文档视觉理解列为产品使用场景,也说明模型会用视觉检查编码输出。这支持「模型能力要和输入、检查工具配套」这一方向,但没有给出 Chartography 数字。2
- 支持:ClaudeDevs 链接的 Anthropic Cookbook 页面确实是
multimodal/crop_tool.ipynb,公开页面显示它是针对高分辨率局部裁剪的多模态配方入口。17 - 削弱:准确率变化来自 ClaudeDevs 的官方披露,当前没有看到 Chartography 题目、基线设置、模型版本、重复次数或独立复现,因此不能把 29% 到 73% 当作普适的视觉能力提升,也不能据此比较 Fable 5 与 Sonnet 5 的整体能力。
行业含义:多模态 Agent 的工程重点正在从「把图片送给模型」转向「让模型主动管理观察粒度」。企业评测应把图像缩放、局部取景、工具调用次数和最终答案准确率一起记录,否则容易把输入损失误判成模型推理能力不足。
关注优先级:中高。
内容性质:官方开发者实践与官方账号数据披露,不是独立基准报告。
低信号观察与排除
- 外部观察席,降级处理:John Schulman(@johnschulman2)在 7 月 23 日 23:51 发帖,要求 OpenAI 发布 Hugging Face 入侵事件的详细转录,并追问顶层代理是否知道子代理的行为、是否发生了「value drift」。这条内容对代理安全讨论有价值,但 John Schulman 不是 Anthropic 内部信源,且发言针对 OpenAI 事件,不计入 Anthropic 主榜。18
- 纯转发,排除:Mike A. Merrill(@Mike_A_Merrill)在 7 月 24 日 00:14 转发 Frontier-Bench 发布消息。它与评测相关,但当前看到的是转发,不是 Anthropic 对该基准的原创说明,不能单独提升为主信号。19
- 已在前期覆盖的官方动态,排除:Boris Cherny 在窗口内转发 Claude Security plugin 的官方消息,但被转发原帖早于本期窗口,且昨天已作为官方动态处理;本期只记录为扩散动作,不重复计数。20
- 无新增事实,排除:Jack Clark 的窗口内内容主要是对外部经济分析的转发和日常回复;Cat Wu 的窗口内动作主要是外部内容转发;Anthony Morris 的 Fable 相关转发和 Claude Desktop steering 回复没有独立发布说明,均不升格为单独信息点。
账号覆盖审计
时间判断统一以 Asia/Shanghai 为准;「有」表示过去 24 小时内出现公开发言,「无」表示本轮时间线未发现窗口内新发言。互动量按工具返回的点赞 / 转发 / 回复记录,转发与回复仍按其性质标注。
主监控账号
@AnthropicAI:无。时间线最新条目为 7 月 23 日 01:24 之前的转发,早于本期窗口。@claudeai:有。7 月 24 日 03:34,同一 Voice 发布串 3 条原创帖;根帖 6,987 赞、450 转发、480 回复,模型与工具帖 663 赞、29 转发、23 回复,语言与公测范围帖 512 赞、23 转发、36 回复。1112@DarioAmodei:无。最新返回内容早于本期窗口。@karpathy:无。最新返回内容为 7 月 22 日之前的发言。@ch402:无。最新返回内容早于本期窗口。@AmandaAskell:无。最新返回内容早于本期窗口。@bcherny:有。7 月 23 日 14:03 转发 Claude Security plugin,16,156 赞、1,440 转发、563 回复;7 月 23 日 14:05 原创回复 Fable 动态工作流,1,300 赞、54 转发、48 回复;7 月 24 日 06:07 回复「Welcome to the other side friend」,12 赞、0 转发、0 回复;7 月 24 日 06:50 回复「Opus 4.8 is also great...」,3 赞、0 转发、1 回复。仅 14:05 的原创回复进入主榜。@mikeyk:无。最新返回内容早于本期窗口。@DanielaAmodei:无。最新返回内容早于本期窗口。@jackclarkSF:有。7 月 24 日 00:47 转发 Peter McCrory 的 Google AI 采用分析,36 赞、3 转发、3 回复;7 月 24 日 01:35 回复一档播客讨论,2 赞、0 转发、0 回复,均未达主榜标准。@nottombrown:无。工具返回的目标账号显示名为NotTomBrown,最新内容早于本期窗口,未发现窗口内有效发言。@janleike:无。最新返回内容早于本期窗口。@_catwu:有。7 月 23 日 13:20 回复「coming soon!」,0 赞、0 转发、0 回复;7 月 23 日 13:21 转发外部数学内容,34,175 赞、2,282 转发、766 回复,均不相关或无新增 Anthropic 事实。@trq212:有。7 月 23 日 09:28 回复「Yes!」,18 赞、0 转发、1 回复;09:42 回复关于循环的观点,225 赞、3 转发、21 回复;12:24 回复关于 Slack 记忆和组织上下文,17 赞、0 转发、3 回复;7 月 24 日 01:26 回复关于 Notion 同步,80 赞、0 转发、11 回复。09:42 的循环观点进入主榜,其余为低信息回复。@Mike_A_Merrill:有。7 月 24 日 00:14 转发 Frontier-Bench,709 赞、67 转发、42 回复,按纯转发排除。@EvanHub:无。最新返回内容早于本期窗口。@ErikJones313:无。最新返回内容早于本期窗口。
次级监控账号
@noahzweben:无。最新返回内容早于本期窗口。@karan_sampath:无。最新返回内容早于本期窗口。@lydiahallie:有。7 月 24 日 03:59、04:51、05:54、07:20 共 4 条关于 output style、/config和/output-style弃用的原创回复,互动量分别为 5/0/1、4/0/1、4/0/0、0/0/0(点赞/转发/回复);合并为第 3 条信息点。@amorriscode:有。7 月 24 日 03:14 转发 Fable 纸带示例,2,174 赞、122 转发、67 回复;04:09 转发 Claude Desktop steering,29 赞、3 转发、5 回复;同一时段回复「CMD + Enter queues」,1 赞、0 转发、1 回复,以及反馈回复,均未形成独立发布说明。@IsabellaKHe:无。最新返回内容早于本期窗口。@OmidMogasemi:无。最新返回内容早于本期窗口。@alicelovescake1:有。7 月 24 日 07:00 转发 Christian Selig 关于 Codex 稳定性的内容,265 赞、5 转发、11 回复,与频道主题无直接新增事实。@yanda_chen_:无。时间线最新返回内容为 2026 年 3 月,未命中本期窗口。
外部观察席
@johnschulman2:有。7 月 23 日 23:51 原创发言讨论 Hugging Face 事件,1,493 赞、135 转发、44 回复;7 月 24 日 01:31 回复「+1 to that list」,43 赞、1 转发、0 回复。标为外部观察,不计 Anthropic 内部信号。@nelhage:无。时间线为空。
官方与长尾渠道
- Anthropic Newsroom:无窗口内新页面;页面最新可见 News 条目为 7 月 22 日的 Economic Futures Research Fund 和 Anthropic Economic Index,均早于本期窗口。21
- Anthropic Research:无窗口内新论文或研究页面;最新可见 Publications 条目为 7 月 14 日。22
- Anthropic Policy:无窗口内新页面。23
- Claude 官方博客:发现 1 篇窗口内 Voice 更新,已与
@claudeai3 条帖子合并,不重复计数。13 @ClaudeDevs:有。7 月 24 日 07:25 两条官方原创帖,Chartography 结果帖 85 赞、2 转发、6 回复,zoom tool cookbook 帖 727 赞、36 转发、51 回复,合并为第 5 条信息点。1516- YouTube、播客和 webinar:本轮没有取得窗口内 Anthropic 高管或研究员的完整逐字稿,因此没有把搜索结果或活动预告当作长篇发言入选。
今日结论
今天的 5 条信号共同指向一个更具体的产品方向:Anthropic 正在把「代理能不能完成任务」拆成可持续的循环、可保存的行为配置,以及能够主动获取更好输入和更好验证结果的工具链。Fable 的动态工作流是任务层,Claude Tag 的 schedule/event loop 是触发层,output style 是行为层,Voice 和 zoom tool 则分别扩展了交互入口与观察能力。
但治理字段还没有随产品叙事完全公开。当前能核实的仍是:谁能配置、何时触发、工具如何补充输入;尚不能确认长时运行的完整审计、重试、回滚和成本控制机制。下一期应优先追踪这些边界,而不是把「更自动」直接写成「更安全」或「更可靠」。
Fuentes de referencia
- 1Boris Cherny 关于 Fable 动态工作流的原帖
- 2Claude Fable 官方页面
- 3How Claude Code works
- 4Thariq 关于 Claude Tag 循环的原帖
- 5How Claude Tag works
- 6Claude Code routines
- 7Lydia Hallie 关于 output style 与 `/config` 的讨论串
- 8Lydia Hallie 关于 `/output-style` 弃用的回复
- 9Output styles - Claude Code Docs
- 10Claude Code settings
- 11Claude Voice mode 官方发布串
- 12Claude Voice mode 公测范围
- 13Think through hard problems in voice mode
- 14Claude connectors
- 15ClaudeDevs 关于 Chartography 准确率的原帖
- 16ClaudeDevs 关于 zoom tool cookbook 的原帖
- 17Claude Cookbook crop tool
- 18John Schulman 关于 Hugging Face 事件的原帖
- 19Mike A. Merrill 的 Frontier-Bench 转发
- 20Boris Cherny 的 Claude Security plugin 转发
- 21Anthropic Newsroom
- 22Anthropic Research
- 23Anthropic Policy
Contenido relacionado
- Inicia sesión para comentar.
