Anthropic 智囊团一日发言|2026-08-11

Anthropic 智囊团一日发言|2026-08-11

严格覆盖过去24小时,今日确认3条个人达标信号,并单列3条官方动态:Claude的数学研究工作流、Claude Code Auto mode与WebFetch路由调整,以及Fable 5的席位和用量排障边界。

覆盖窗口:2026-08-10 08:00 至 2026-08-11 08:00(Asia/Shanghai)
今日仅 3 条个人账号达标信号;另有 3 条 Claude / Claude Code 官方动态,按官方更新速览单列。长篇视频、播客和 Webinar 扩展检索没有找到窗口内同时具备原始页面、准确发布时间和完整逐字稿的新增内容,因此没有用旧访谈补榜。

先看 3 个判断

  1. 模型进展的可用单位,正在从「答对一道题」转向「找到值得做的问题,并把结果交给人验证」。 Anthropic 公开的 Riemann zeta 结果不是证明黎曼猜想,而是把一个相关下界从 41.6% 推到 67.2%;Claude Code 团队成员 Thariq 把其中的价值概括为「compute allocation」和「thought partnership」。
  2. Auto mode 的默认化带来了第二层产品调整:模型路由也在跟着安全默认值改变。 Thariq 说团队正在把 WebFetch 中的 Haiku 移除,但原话是「正在做」,不是「已经全量上线」;这更像路由、成本和安全策略的联动调参。
  3. Fable 5 的使用问题首先是席位和用量问题,其次才是模型能力问题。 Boris Cherny 在回复中把排查路径说得很具体:Teams Premium 与 Standard 的待遇不同,/usage 看消耗,/effort 降低单次任务的用量;帮助中心的套餐矩阵与这条回复相符,但回复本身不是新政策公告。

1. Thariq:Claude 的数学进展,关键不只是答案而是「挑题 + 合作验证」

涉及人物/账号:Thariq(Claude Code,@trq212);Jarred Sumner(Anthropic 员工,@jarredsumner);Anthropic 官方账号 @AnthropicAI。 时间:Thariq 的核心评论发表于 2026-08-11 05:44(北京时间);他在 02:03 转发并评论了同一事件。 信源层级:Anthropic 员工个人原创评论 + Anthropic 官方研究页和官方账号补充。 内容性质:原创引用与方法判断,不是模型发布公告。

原文与中文翻译

Thariq 在引用 Anthropic 的 Riemann 结果时写道:
I think this shows 2 key skills w/ AI
  1. compute allocation - for most jobs there's not a list of "X most important problems", you have to decide what problems are worth it
  2. thought partnership - @alpoge had to really dig into and understand the proof to know it was real
中文翻译:
我认为这显示了 AI 的两项关键能力:一是「计算分配」——多数工作并没有一张「最重要的 X 个问题」清单,你得先判断哪些问题值得投入;二是「思想伙伴」——Levent Alpöge 必须深入理解这份证明,才能判断它是否真实成立。
更早一条引用中,Thariq 写道:「sometimes all you need to do is tell Claude to keep going」(有时你只需要告诉 Claude 继续)。12

这条信号实际确认了什么

Anthropic 的研究页给出了可核对的事件链:一个未公开的研究版本 Claude 没有证明黎曼猜想,却把「黎曼猜想成立的零点比例下界」从 41.6% 提高到 67.2%。这里的「下界」是已知至少有多大比例的黎曼 ζ 函数零点位于临界线上,不是「67.2% 的猜想已经被证明」,也不是对黎曼猜想本身的解决。3
这项工作是在两段 Claude Code 会话中完成的,官方自述总计用了 3100 万输出 token;第二轮协调了约 60 个子代理,运行 2400 条 shell 命令、写了数百个 Python 脚本,并在数值检查、相互审阅和反例搜索中筛选思路。第一轮曾生成并尝试 650 个想法,没有一个成功。两名 Anthropic 数学家 Levent Alpöge 和 Ralph Furman 检查了工作,Anthropic 还公开了通过 Lean comparator 验证的形式化证明;两位外部数学专家 Brian Conrey 和 Dan Goldston 也在短时间内审阅了论文。34

支持与削弱

  • 支持:官方研究页、论文、形式化证明和 Thariq 的原始评论相互对应;公开材料足以确认「相关问题上的新下界」和「长时间、多代理、反复验证的工作流」确实发生过。
  • 削弱:这是 Anthropic 对自家未公开研究版本的报告,结果仍然依赖数学家审阅和既有数学文献;它没有证明黎曼猜想,也不能单凭一次案例推出 Claude 已普遍具备自主数学研究能力。Thariq 的「compute allocation / thought partnership」是个人解释,不是 Anthropic 的正式能力评测指标。

行业含义

这条信号值得关注的地方不在「Claude 解出了黎曼猜想」——事实并非如此,而在任务分工发生了变化:模型负责提出、筛选和反复检验大量候选方向,人类负责判断问题是否值得投入,并确认关键证明是否站得住。对代理评测而言,单轮答案准确率可能漏掉两个字段:模型是否找到了值得追的方向,以及它能否把自己的中间结论交给合适的人验证。这个判断是基于上述公开工作流的分析,不是 Anthropic 已发布的统一评测结论。
Loading content card…

2. Thariq:Auto mode 默认后,WebFetch 的模型路由还在调整

涉及人物/账号:Thariq(@trq212);ClaudeDevs(官方开发者账号,@ClaudeDevs)。 时间:2026-08-10 23:58 与 2026-08-11 06:36(北京时间)。 信源层级:Anthropic 产品团队成员个人回复 + 官方开发者账号;官方产品文章作背景。 内容性质:产品实现边界和进行中的路由调整,不是完整发布说明。

原文与中文翻译

Thariq 对 WebFetch 的问题直接回复:
@simonw we're working on removing Haiku from WebFetch now that automode is default
中文翻译:
Auto mode 现在已经是默认值,我们正在把 WebFetch 中的 Haiku 移除。
同期,ClaudeDevs 的官方帖写道:
We recently made auto mode the default in Claude Code, which means you no longer have to approve every action. But what determines if something is safe to run? Watch how it works.
中文翻译:
我们最近把 Auto mode 设为 Claude Code 的默认模式,这意味着你不再需要批准每一个动作。但什么决定了某个动作是否安全可运行?可以通过视频了解它的工作方式。
原文分别见 56

不能把这条消息读成什么

「正在移除」不等于已经在所有用户、所有 WebFetch 请求中完成切换。原帖没有给出生效版本、灰度比例、替代模型或具体路由规则,也没有说明 Haiku 被移除后每类请求会去哪里。因此,当前最多可以确认:Auto mode 默认化之后,团队在重新审视 WebFetch 的模型分工;不能写成「WebFetch 已全面改用某个指定模型」。
作为背景,Claude 官方文章写明:Pro、Max 和 Team 的新会话将从 2026-08-14 起默认运行 Auto mode;此前已自定义默认值的用户可能看到一次切换提示,固定了默认值的用户不变。文章还说,Auto mode 用分类器在每次工具调用前判断不可逆、破坏性或越出环境的动作,并在连续被拦截三次或单次会话累计二十次后回退到手动批准。该文章发表于 2026-08-07,早于本窗口,只用于解释边界,不计作今日新信号。78

支持与削弱

  • 支持:ClaudeDevs 的窗口内官方帖确认默认模式和分类器是当前产品动作;官方文章补充了生效时间、Enterprise/API 仍为 opt-in、分类器开销不再计入 Pro/Max/Team 用量等边界。
  • 削弱:Thariq 的个人回复只确认团队正在调整 WebFetch,不确认变更已完成;官方文章中的安全实验、客户采用率和分类器命中率属于 Anthropic 自述,不能直接当作独立复现的生产安全保证。

行业含义

Auto mode 不只是把「是否批准」从人手里拿走,也会改变代理系统如何安排模型、工具和安全检查。WebFetch 的路由调整说明,模型成本、工具延迟和安全默认值可能要一起优化。对使用者来说,短期应观察三个公开字段:实际生效版本、WebFetch 的模型/限额说明,以及 Auto mode 被拦截或回退时的日志;目前这三项都没有在 Thariq 的窗口内回复中完整公开。
Loading content card…

3. Boris:遇到 Fable 5 不能用,先查席位再查 usage

涉及人物/账号:Boris Cherny(Claude Code,@bcherny)。 时间:2026-08-10 23:34 至 23:35(北京时间)。 信源层级:Anthropic 产品负责人个人支持回复 + Claude Help Center 套餐说明。 内容性质:用户排障与使用边界,不是新套餐发布。

原文与中文翻译

Boris 在一条关于 Fable 5 的回复中写道:
Fable should be included in Teams Premium seats. Make sure you’re not on a Standard seat.
To reduce usage, try:
  1. Disabling plugins/skills that are eating up your tokens (run /usage for a detailed breakdown)
  2. Switching to a lower effort setting (run /effort to do that)
中文翻译:
Fable 应该包含在 Teams Premium 席位中。先确认你不是 Standard 席位。
如果要降低用量,可以:关闭消耗 token 的插件或 Skills,用 /usage 查看详细消耗;或者切换到较低的 effort 设置,用 /effort 完成调整。
随后他又回复另一位用户,说明自己在个人账号上很少遇到 20x 的限额,并建议用 claude -p /usage 复制用量信息以便排查。910

上下文核对

Help Center 的套餐说明与 Boris 的回复基本一致:Fable 5 在 Max、Team Premium 和旧版按席位计费的 Enterprise Premium 中属于套餐标准用量,最多使用每周用量的 50%;Pro、Team Standard 和旧版 Enterprise Standard 则从一开始使用按量付费的 usage credits。Fable 5 可在 Claude Code 中使用,但需要 Claude Code 2.1.170 或更高版本。11
Fable 5 的正式发布页则说明了模型的定位、一般可用和安全分类器背景,但发布时间是 2026-06-09;帮助中心矩阵在 2026-07-20 更新,也不属于今日窗口。它们能支持套餐和产品背景,不能把 Boris 的回复包装成 8 月 10 日新政策。12

支持与削弱

  • 支持:Boris 的两条回复给出了一条可执行的排障顺序,帮助中心的正式矩阵也明确区分了 Premium、Standard 和 Pro。
  • 削弱:Boris 使用了「should be」而不是完整的资格说明;具体账号还可能受组织管理员开关、版本、usage credits 和当前限额影响。单个用户的限额对话不能代表所有 Team 用户的实际可用量。

行业含义

当模型能力差距扩大,企业用户遇到的第一类问题会越来越像「身份、席位、预算和用量」而不是「模型有没有这个能力」。把模型名称写进产品手册还不够,组织需要同时记录席位类型、模型访问权限、usage credits、插件/Skills 消耗和 effort 设置。Boris 的回复展示了排障入口,但没有给出完整的企业治理或审计方案。
Loading content card…

Claude 官方动态速览

过去 24 小时内,@AnthropicAI、@claudeai 和 Claude / Claude Code 官方账号合计确认 3 条发布或更新,单列如下,不与上面的个人信号重复计数。
  1. Riemann 相关数学进展|@AnthropicAI|2026-08-11 01:28 官方称未公开研究版本 Claude 没有解决黎曼猜想,但把相关零点比例下界从 41.6% 提高到 67.2%。13
  2. Claude Sonnet 5 入门价格永久保留|@claudeai|2026-08-11 03:03 官方称此前至 2026-08-31 的每百万输入 token 2 美元、每百万输出 token 10 美元的入门价格不变。14
  3. Auto mode 默认值与分类器说明|@ClaudeDevs|2026-08-10 23:58 官方开发者账号引导用户观看 Auto mode 如何判断工具调用是否安全;正文没有给出 WebFetch 的具体替代模型。6

主题分类索引

  • 模型与研究:信息点 1;官方速览 1。
  • Claude Code / Agent:信息点 2;官方速览 3。
  • 产品与企业落地:信息点 3;官方速览 2。
  • 安全与可解释性:本窗口没有单独达到主榜门槛的新个人原创信号;Auto mode 的分类器只作为信息点 2 的上下文。
  • 政策与治理:无窗口内达标新信号。
  • 外部观察席:无窗口内达标新信号。

今日关注优先级

整体:高。 优先看信息点 1 和 2:前者关系到长时代理是否能把「找题、试错、验证」串成可复用的研究流程,后者关系到 Claude Code 将多少安全判断交给分类器,以及模型路由是否随默认模式改变。信息点 3 的优先级为中,适合正在使用 Fable 5 或排查 Team 席位、用量问题的读者。

低信号观察与排除

  • Thariq 在 2026-08-11 07:25 回复称一个影响「相对少量账号」的 bug 很快会恢复;没有公开根因、影响范围、恢复时间或产品名称,因此只作运营观察,不进入主榜。15
  • Karan Sampath 在窗口内只用「🤯」引用 Jarred Sumner 关于 Riemann 结果的帖子;Lydia Hallie 转发的是 8 月 7 日 ClaudeDevs 关于分类器开销的旧帖。两者都是扩散信号,未增加可独立核验的新事实,不单列信息点。
  • Andrej Karpathy 在窗口内有一条关于「像和普通人一样与电脑对话」的回复,但没有指向 Anthropic、Claude 或其产品边界;Jack Clark 的两条窗口内回复同样没有形成与本频道主题相关的新判断,因此排除。

账号覆盖审计

以下为主监控、次级监控和外部观察席账号的逐个结果。时间已换算为北京时间;「有」包括窗口内低信息量或纯扩散动作,是否入选另按信息增量筛选。
账号窗口内新公开发言记录与处理
@AnthropicAI01:28 原创 Riemann 帖;非转发;互动量约 1,151 转发、560 回复、11,379 喜欢;列入官方速览。
@claudeai03:03 引用帖,宣布 Sonnet 5 入门价格永久保留;非转发;约 328 转发、811 回复、6,265 喜欢;列入官方速览。
@DarioAmodei窗口内检索无结果。
@karpathy00:15 回复「与电脑像与人交谈」;非转发;约 30 转发、17 回复、580 喜欢;与主题无直接关系,排除。
@ch402窗口内检索无结果。
@AmandaAskell窗口内检索无结果。
@bcherny23:34、23:35 两条产品支持回复,均非转发;约 0/1 转发、3/3 回复、5/12 喜欢;合并为信息点 3。
@mikeyk窗口内检索无结果。
@DanielaAmodei可见时间线没有窗口内新发言。
@jackclarkSF05:57、06:02 两条简短回复;非转发;内容为泛泛评价或人名回复,排除。
@nottombrown窗口内检索无结果。
@janleike窗口内检索无结果。
@_catwu窗口内检索无结果。
@trq21223:58、02:03、05:44、06:36、07:25 多条回复/引用;非转发;主张分拆为信息点 1、2,bug 回复降为低信号。
@Mike_A_Merrill窗口内检索无结果。
@EvanHub窗口内检索无结果。
@ErikJones313窗口内检索无结果。
@noahzweben窗口内检索无结果。
@karan_sampath01:42 以「🤯」引用 Riemann 相关帖;非转发但无新增事实;排除。
@lydiahallie02:15 引用 8 月 7 日 ClaudeDevs 旧帖;扩散信号,无新增事实;排除。
@amorriscode23:13 与 Wealthsimple 相关的个人回复;与频道主题无关,排除。
@IsabellaKHe窗口内检索无结果。
@OmidMogasemi窗口内检索无结果。
@johnschulman2窗口内检索无结果;外部观察席。
@nelhage窗口内检索无结果;外部观察席。
@lamismukta窗口内检索无结果。
@yanda_chen_窗口内检索无结果。
补充扫描的 @ClaudeDevs 在窗口内有 1 条原创官方帖,已并入官方速览;它不是主监控名单账号,所以单独标注,不把其员工转发或互动拆成新信息点。

研究与核验范围

  • X/Twitter:逐个检查上述 27 个名单账号,并补查 @ClaudeDevs;窗口为 2026-08-10 00:00 至 2026-08-11 00:00 UTC,再换算为北京时间判断归属。入选帖均通过单条帖子详情核验发布时间和原文。
  • 官方渠道:检查 Anthropic Newsroom、Research、Policy、Claude Blog、Claude Code Docs 和 Webinar 入口。Newsroom、Policy、Claude Blog、Claude Code Docs 未发现窗口内新的可核验发布;Research 列表和 Riemann 详情页确认 8 月 10 日研究内容,X 原帖提供窗口内精确时间。
  • 长尾内容:检索 YouTube 的 Anthropic、Dario Amodei、Claude Code、Anthropic podcast 关键词,以及 Google 的 Anthropic podcast、conference、webinar 线索;返回内容主要早于 72 小时或缺少完整字幕/原始演讲页,未进入主榜。
  • 时间边界:官方 Auto mode 文章发布于 2026-08-07,Fable 套餐帮助页更新于 2026-07-20,均只作背景;没有把它们伪装成窗口内新发布。

引用来源

  1. Anthropic:Learning more about Claude's mathematical capabilities
  2. Anthropic:Claude Fable 5 on your plan
  3. Claude:Auto mode is now the default in Claude Code
  4. Claude Code Auto mode 文档
  5. Anthropic:Claude Fable 5 and Claude Mythos 5
说明:窗口内 X 原文以每条信息点旁的原始帖子链接为准;官方文章、帮助中心和形式化证明只用于核对背景、边界和可复现材料。
Anthropic 智囊团一日发言

Anthropic 智囊团一日发言

每日追踪 Anthropic 智囊团在 X/Twitter 及官方渠道的高价值发言,生成含原文引用、衍生溯源、主题分类和关注优先级的结构化分析日报。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.