Fable 5 水印周报 Vol.11:官方公布文本标记机制,旧模型进入过渡期

Fable 5 水印周报 Vol.11:官方公布文本标记机制,旧模型进入过渡期

Anthropic 公布 Claude 文本水印的工作方式与限制,但 Fable 5 属于 8 月 2 日前发布的旧模型,水印仍处于未来数月的过渡期;本期同时梳理 EEBench 社区转述、服务故障,以及 Fable 5 驱动的确定性物理引擎和多智能体实践。

先看结论

本周(8 月 10 日—17 日)Fable 5 没有出现一条可核实的新版本公告,真正的增量来自「输出如何被识别」和「任务如何被验收」:Anthropic 在 8 月 14 日公布了 Claude 文本水印的机制。水印不插入字符、不增加 token,也不改变价格;它利用生成过程中本来就存在的低风险选词,把一段文字是否可能由 Claude 参与生成变成可检测的概率。1
Fable 5 的特殊点在于,它是 2026 年 6 月 9 日发布的模型,属于 Anthropic 所说的「2026 年 8 月 2 日前发布的旧模型」。官方说这批模型也会加上水印,但会在未来数月逐步推出;这篇公告没有说 Fable 5 当前的每次输出已经带有水印。12
维度本周确认对使用的判断
官方更新文本水印全球推出;旧模型的接入仍在未来数月的过渡期。1先把「模型选择」和「是否已经有水印」分开记录,不要把普通 AI 检测器当成官方水印检测。
评测信号X 上流传 EEBench 电气工程榜单转述:Grok 4.6 被称为超过 Fable 5;另一条转述给出 Opus 5 为 61.6、Grok 4.6 为 57.1。原始榜单行未在本轮白名单材料中核实。34这是待复核信号,不是 Fable 5 的新总榜排名。
可用性8 月 17 日北京时间 05:58,Claude.ai、Claude Code 和 Cowork 出现认证问题;随后 Platform 和 API 也被纳入影响范围,06:34 标记恢复。5服务中断、模型 fallback 和模型能力要分开记账。
实践案例SunaBox 作者称 Fable 5 参与了数学、代码和对抗性审查;另有用户让 Fable 5 参加 Among Us 多智能体实验。67Fable 5 的长流程价值仍要靠确定性约束、回放和人工验收来证明。

水印改变的是随机性来源

大语言模型在生成下一个词时,通常会在多个合理候选中做选择。Anthropic 的方法不强行把模型推向某个固定词,而是把原本用于选择的随机数,换成由密钥和前文共同决定的随机性。读者看到的词仍然自然,知道密钥的人则可以检查这串选择是否符合 Claude 的水印模式。1
这也解释了几个容易混淆的边界:水印只能判断「Claude 可能参与过」,不能证明整段文字都由 Claude 独立写成,也不能识别具体用户、组织或对话。样本太短时,候选词太少,检测信心会下降;Claude 只做少量校对时,可留下水印的词也很少。相反,翻译或从头生成长文时,模型做出的选择更多,水印更有机会被检测到。1
对 Fable 5 开发者更实际的边界在代码里。精确代码通常只有一个能通过编译或测试的写法,水印很少有空间介入;代码注释等自然语言部分仍可能留下更多痕迹。Anthropic 说水印不增加 token,因此不会单独抬高调用价格,也不会改变读者看到的质量和可读性。1
这意味着团队做内容或代码审计时,最好增加两个字段:selected_modelactual_model,再记录 human_edit_level。水印检测回答的是「Claude 是否可能参与」,而这三个字段回答的是「哪一个模型完成了哪一段工作,以及人改了多少」。两者解决的是不同问题。

EEBench 这条新跑分,暂时只能降权使用

8 月 14 日北京时间 23:39,一条 X 帖子称,Grok 4.6 在 EEBench 电气工程 benchmark 上超过 Claude Fable 5、Claude Opus 4.8、Gemini 3.1 Pro、GPT-5.5 和 GPT-5.6 Sol。原帖没有给出分数、题目样本或运行参数。3
随后一条日文转述称,最新 Leaderboard 视频中 Opus 5 为 61.6、Grok 4.6 为 57.1,并把 EEBench 描述为一组接近真实硬件开发的循环:理解规格、设计电路、选元件、仿真、失败后修改,还要考虑成本;得分由技术性能 65% 和成本效率 35% 组成。作者同时承认,自己无法从当前可取得的 EEBench 官方页面直接核对这行榜单。4
所以本周对 EEBench 的正确读法只有一层:专业工作流型评测正在成为 Fable 5 必须面对的新场景。还不能把「Grok 超过 Fable」写成已确认的官方排名,也不能把电路设计循环外推成通用编码、知识工作或视觉能力。
如果要在自己的团队复现,至少要把模型版本、effort、工具权限、失败重试次数、输入输出 token、材料或 API 成本,以及最后是否通过构建和仿真检查一起保存。只记录最终分数,无法判断差距来自模型、工具链还是成本权重。

一次故障提醒:先确认模型真的能被调用

这次事件的时间线很短,但影响面很宽。r/ClaudeAI 的事件帖记录,8 月 17 日北京时间 05:58 开始调查影响 Claude.ai、Claude Code 和 Cowork 的认证问题;06:02 扩大为多个服务的性能下降,06:22 进入监控,06:34 标记恢复。Claude Platform 和 Claude API 也在事件说明中被列入影响范围。5
这不是 Fable 5 单独失效的证据,而是一次入口和服务层面的故障。对使用者来说,最容易误判的是把「选中了 Fable 5 但请求失败」写成模型能力问题,或把短时不可用写成 credits 政策变化。一次请求至少应记录请求时间、入口、选中模型、实际回答模型、是否 fallback、HTTP 或服务状态,以及任务最终是否完成。
当前 Claude Platform 的成本指南也把「每个 token 的价格」和「每个任务的完成成本」分开处理:Anthropic 的内部测量显示,prompt caching 在其 agent-loop benchmark 中可把成本降低约 2.5 至 3.7 倍;在有测试或验证器的工作流里,先用低 effort 执行、失败后再以默认高 effort 重跑,在其编码 benchmark 上约能以一半成本维持通过率。文档明确提醒这些结果是内部、方向性的测量,不能直接当成你的项目保证。8

两个案例把「会做」和「可验收」分开了

SunaBox:确定性约束比一句「已完成」更有价值。 8 月 16 日北京时间 21:12,r/ClaudeAI 用户分享了 SunaBox 和 SunaEngine。作者称,Fable 5 负责数学、代码和对抗性审查,底层引擎使用整数计算和与顺序无关的累加,让 WebGPU 浏览器上的粒子物理保持一致;项目还用回放哈希检查了 Apple M 系列、iPhone、Steam Deck、Intel 集成显卡和 NVIDIA RTX 2070S。6
这些是作者的项目自述,不是独立复测。但它展示了一个值得复制的验收形态:让模型负责复杂实现和对抗性检查,再用确定性算法、跨设备哈希和可回放输入约束结果。社区评论也把「确定性很难」视为项目的主要难点,而不是把演示视频本身当成证明。9
Hyperbubble:长流程的产物仍需要人定义验收标准。 Hacker News 上一位亚利桑那州立大学教授介绍,他通过 Claude Code 让 Fable 5 研究自己过去 20 年的研究,再设计一款能独立成立的浏览器游戏;经过 90 多轮迭代,产物是一个单文件 HTML 游戏,包含程序化图形和合成音轨,没有库、构建步骤或注册流程。原帖页面在本次检索时显示为两天前,但没有提供绝对发布时间,因此这里把它当作本周社区案例,而不是严格的时间统计。10
另一个 X 用户在 8 月 17 日北京时间 05:51 记录了一个更窄的实验:让 Fable 5 作为船员与 Kimi K3 扮演的内鬼进行 Among Us 模拟,Fable 5 一局获胜。作者的目标是研究欺骗、心智理论和多智能体合作,并把 AI 真人秀拆成相邻的小问题。这个结果说明实验设计在扩展,不能说明 Fable 5 已经具备稳定的社会推理能力。7

给本周使用的三个动作

  1. 给水印留出过渡期字段。 记录输出生成日期、选中模型、实际模型和人工改写比例;在 Anthropic 没有明确说明 Fable 5 已完成 rollout 前,不要把每段 Fable 输出都标成「已带水印」,也不要用第三方检测器代替官方检测 API。官方说检测 API 将推出,但目前仍在确定实现细节。1
  2. 把新 benchmark 当成题型,而不是总榜。 EEBench 若要进入内部选型,先复现电路、工具、成本和验收口径;把「模型完成」定义成构建、仿真或业务检查通过,而不是生成了一段看起来合理的解释。
  3. 让 Fable 负责长任务,让验证器负责收口。 对多文件工程、研究转原型或模拟实验,可以让 Fable 负责拆解、跨文件协调和审查;同时保留确定性回放、自动测试、权限检查和人工发布门槛。Claude Platform 的成本指南建议先在自己的任务上测每个完整任务的成本,再决定是否把 frontier 模型放在 advisor 或 orchestrator 位置。8

本周信号

Fable 5 本周新增的观察轴不是一个更高的总分,而是「输出能否被追溯、任务能否被复现」。Anthropic 已经公布水印的原理和限制,但 Fable 5 仍在旧模型过渡期;EEBench 的电气工程结果值得追踪,却还没有足够的一手材料支撑排名;服务事件和 SunaBox、Hyperbubble 等案例则说明,Fable 的长流程能力必须和实际可用性、确定性约束、人工验收一起计算。
下周最该盯三件事:Fable 5 的水印 rollout 是否出现明确的模型级说明,水印检测 API 是否开放,以及 EEBench 是否发布可直接核验的榜单和方法。对自己的任务,先把 selected_modelactual_modelfallbackverification_result 和完整任务成本记录起来,下一次比较才不会把路由、服务状态和模型能力混成一个数字。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel