
Fable、ARC、LibreOffice、Nori 与一场 AI 预测复盘:AI 说自己会做之后,证据落在哪里?
从 Claude Fable 5.1、ARC 小模型、Codex 运行时和 Nori 机器人等热帖出发,拆开“更强、更准、更便宜”背后的测试规则、隐藏依赖与接手条件。
截至北京时间 2026 年 9 月 2 日 08:02,Hacker News 当前 top 榜把 Claude 新模型、AI 怀疑主义预测复盘、ARC 小模型实验、桌面应用依赖和低价机器人放在了同一页。这个榜单包含前一天发帖后继续升温的内容,下面的分数与评论数是抓取时快照,并非自然日新发清单。
五条材料表面上差别很大:有人发布模型,有人复算预测,有人用 67 美分训练一个小 Transformer,有人从缓存目录里发现一整套办公软件,还有人用 1688 美元销售双臂机器人。它们共同把一个问题摆到了读者面前:当产品声称“更强”“更准”“更便宜”或“更能干”时,谁来验收这句话,验收凭什么完成?
| 帖子 | 抓取时热度 | HN 发帖时间(北京时间) | 提交者 |
|---|---|---|---|
| Claude Fable 5.1 and Claude Mythos 5.1 | 852 分,813 条评论 1 | 9 月 2 日 01:53 | denysvitali |
| How accurate have Ed Zitron's AI skeptic predictions been? | 342 分,403 条评论 2 | 9 月 2 日 02:35 | jatins |
| I trained a small transformer in 1.5hrs and it beats many LLMs | 552 分,148 条评论 3 | 9 月 1 日 17:52 | porridgeraisin |
| The ChatGPT/Codex app bundles a full copy of LibreOffice | 215 分,106 条评论 4 | 9 月 2 日 04:07 | timpera |
| Launch HN: Nori Robotics (YC S26) – A low-cost humanoid robot for development | 110 分,38 条评论 5 | 9 月 2 日 01:35 | AntonioLi |
Claude Fable 5.1:模型分数之外,还有一张护栏账单
Anthropic 将 Fable 5.1 定位为编码、知识工作和长时程问题解决模型,将 Mythos 5.1 定位为同一模型的受信任访问版本。Fable 面向通用使用,Mythos 只向经过审核的网络安全与生命科学专业人士开放。两者的差异主要落在安全护栏和访问资格,而非一个简单的模型大小菜单。6
官方页面列出了 Fable 5.1 在多个测试中的结果:Terminal-Bench 4.0 为 55.8%,OSWorld 2.0 为 77.9% partial / 41.7% strict,Humanity’s Last Exam 在使用工具时为 65.0%,CursorBench 3.2.0 为 73.4%。官方同时说明,生产护栏会在部分任务中介入;护栏触发会改变得分,Mythos 与 Fable 在 Terminal-Bench 的差距也受到网络安全护栏影响。6
Mythos 5.1 的生命科学与网络安全能力还对应一组限制。官方称模型在生物安全和网络安全评估中仍处于既定风险框架的较低层级,生命科学请求会经过 LSVP,网络安全中的漏洞利用生成等请求会转到其他模型或被限制。页面还写明,超长上下文、多智能体协作和极端任务的覆盖仍然有限。6
HN 评论把验收条件往生产环境里拉。一组用户说,涉及
seccomp、签名 Cookie 或 Windows 底层代码时,Fable 会因为护栏过敏而把任务转给 Opus;另一组用户表示,自己主要用它做规划和业务逻辑,几乎没遇到同样的问题。评论还争论用量窗口与模型降价之间的关系,以及 Fable 输出过长、反复使用固定措辞的问题。1这条材料的验收对象因此有三层:基准得分、护栏触发条件、实际账户的用量规则。只看分数,读者看不到任务被拒绝、转交或消耗配额的路径;只看一次成功演示,读者也看不到边界任务如何落地。模型发布页把能力写成数字,生产团队还需要把拒绝率、转交规则、上下文保留方式和用量窗口写进自己的测试记录。
Ed Zitron 预测复盘:反对意见也需要一张可复算的表
Dan Luu 的长文逐条复盘了 Ed Zitron 自 2024 年以来关于生成式 AI、OpenAI、Anthropic、Meta、Google、Microsoft 和 AI 泡沫的预测。Luu 先说明自己的位置:他没有在 AI 实验室或供应链公司任职,也没有把这篇文章写成某家公司的投资推介。7
复盘中最容易核对的一类预测是公司会不会“死亡”。Luu 对照 Meta、Alphabet 和 Microsoft 的收入与利润数据,指出三家公司在相关年份都保持增长;他还列出多条已经过期的判断,包括生成式 AI 已经到顶、OpenAI 即将崩溃、Cursor 会死,以及 AI 泡沫会在 2026 年第二季度前破裂。预测是否成立,取决于原句的时间范围和可证伪条件,而非作者后来如何解释原句。7
Luu 还复算了一份 Anthropic 收入估算表。原文记录了多处日期错误:一段日期被漏算,另一段被重复计算,8 月 21 日到 10 月 21 日被当成一个月,表格里甚至出现了 2 月 30 日。修正日期后,收入数字的解释发生了变化。7
HN 评论大体围绕三个争点展开。评论者一方面认为,大量明确预测已经被现实推翻;另一方面也有人提醒,预测失准并不能自动证明每一条关于成本、利润或产品质量的批评都错误。还有评论指出,固定订阅受众可能让作者更难承认自己判断失误。2
这条材料把“观点质量”落到了几个可复算字段:原句是什么,截止日期是什么,什么事实可以推翻它,计算表能否由别人重做。对于技术趋势判断,读者可以先把“会失败”“已见顶”“没有产品市场契合度”改写成数字、时间和观察条件,再决定这是一条预测、一条分析,还是一条持续移动的立场。
ARC-AGI-1 的 67 美分:便宜结果依赖怎样的测试规则
Mithil Vakde 的实验从零训练一个小型自回归 Transformer。模型使用 8 层网络、SwiGLU、RMSNorm、3D RoPE 和每个 puzzle 独立的可学习嵌入;模型读取 ARC 的输入输出网格,并在测试时继续训练。作者记录的训练设备是 RTX 5090,整个生命周期的计算成本约为 0.67 美元,训练时间约 1.5 小时。8
作者报告 ARC-1 public eval 约 44%,ARC-2 约 7%。消融实验显示,去掉 3D RoPE 或每个任务的独立嵌入后,得分约降到 25% 或 24%;把 3D RoPE 换成 1D 后,得分约为 24%。作者还说,多次运行的已解决任务并集约为 55%,并据此推测 Transformer 路线仍有提升空间。8
“67 美分”需要和测试规则一起读。模型在 eval puzzle 的示例输入和隐藏测试输入上做 test-time training,测试标签保持隐藏;作者把这种方法归为 ARC 允许的 transductive learning。评论者则认为,把 eval puzzle 的输入放进训练过程已经属于 benchmaxxing,即使过程没有接触测试答案。评论还追问同时训练所有测试任务后再按任务平均成本,是否会让成本看起来过低。3
这场争论还有一个容易被标题掩盖的边界:作者自己说,这个模型不是 LLM,也没有和 LLM 做直接对比;文章的公开基线主要是 TRM、HRM 和 CompressARC 等同类方法。模型在 ARC-1 上的结果支持“专用小模型可以在特定基准上取得高分”,它暂时承担不了“通用模型更便宜”的结论。9
读者真正要验收的是 harness:测试集允许模型看到什么、训练发生在什么时候、成本如何摊销、增强是否计入、基线是否可比。一个漂亮的百分比只有放回这些规则里,才知道它测量的是模型能力、测试时适应能力,还是作者针对某个基准设计出的整套流程。
Codex 捆绑 LibreOffice:应用能力藏在多大的运行时里
Simon Willison 检查 macOS 的
~/.cache/ 目录时发现,OpenAI Codex 桌面应用后来更名为 ChatGPT 的运行时目录占用约 1.7GB。这个目录包含完整的 Python 和 Node.js 环境,也包含 Poppler、Git 和 LibreOffice 的本地二进制;相关 skills 文件告诉 Codex 如何找到并使用这些程序。10这条发现说明,文档处理能力往往依赖应用自身携带的工具链。LibreOffice 能处理复杂的 Office 文件格式,Poppler 负责 PDF 相关操作,Python 与 Node.js 则提供其他脚本环境。应用把这些工具藏在运行时目录里,用户看到的是“让 agent 处理文件”,系统实际交付的是一组本地依赖、版本和缓存规则。10
HN 评论把细节继续拆开。有人指出,实际使用的可能是约 429.7MB 的 headless 版本,并且组件是在安装后首次运行时下载到缓存,而非全部随安装包发出。评论还讨论了 LibreOffice 的 MPL 2.0 / GPL 许可责任,以及是否应检测用户电脑已有的办公软件,避免再次下载一套大型依赖。4
支持者认为,成熟的 LibreOffice 转换链比重新实现旧版
xls 等格式更可靠;反对者则认为,用户为一个 AI 应用承担近 1.7GB 的运行时体积,至少需要看到组件清单、下载时机、更新方式和许可证说明。两种观点都指向同一个验收面:应用交付的功能,依赖是否可见、可更新、可替换。这件事对 agent 产品尤其重要。模型可以生成“请把文档转成 PDF”的意图,真正执行动作的却是本地二进制、文件权限和格式转换器。团队要测量的字段包括运行时版本、缓存位置、网络依赖、失败日志、输入文件是否原样保留,以及用户能否独立更新或移除其中一个组件。
Nori A3:1688 美元买到的是机器人,还是开发入口
Nori Robotics 在 HN 的 Launch HN 帖子中介绍了一款面向开发者和研究者的双臂移动机器人。帖子给出的价格是 1688 美元,硬件包含 19 个自由度、两条 7+1 DOF 手臂、每臂 1.5 千克负载、轮式底盘、四个 720p 摄像头、2D 激光雷达、麦克风阵列和 432Wh 电池。树莓派 5 负责 SLAM 与安全控制,较重的 ACT 与 VLA 模型需要经由局域网或广域网连接外部电脑或服务器。5
Nori 的官网把 A3 写成一台 1688 美元、预计 2026 年秋季发货的双臂机器人,并列出 6—8 小时续航、12 米激光雷达范围、四个最高 30 fps 的 RGB 摄像头,以及用于训练、操作和管理机器人的 Nori Lab 应用。官网还把技能市场、家庭训练、技能分享和美国旧金山组装写入产品叙事。11
低价来自几项明确取舍。团队使用高减速比舵机,而不是更昂贵的准直驱电机;团队使用轮式底盘,而不是双足结构。HN 帖子还提到开源 SDK、浏览器模拟器、3D 打印维修件,以及清洁、开抽屉、补货和倒啤酒等演示任务。5
评论区的验收问题很直接。有人怀疑演示视频是否经过编排,要求团队说明动作是否由人遥操作、视频是否加速,以及“会做一件事”能否持续重复。有人指出,低成本舵机可能带来动作抖动、精度不足和缺少力反馈;还有人担心机器人研究设备、家庭玩具和消费产品之间的定位仍然模糊。5
所以 1688 美元真正需要配套的验收表包括:任务成功率、重复次数、遥操作占比、网络断开时的安全动作、维修件供应、SDK 版本、模拟器与真实硬件的差异,以及外部推理服务的长期费用。硬件价格可以降低进入门槛,开发者仍然要为控制链、数据采集和维护周期付账。
五条材料放在一起:承诺落在哪一本账上
| 材料 | 表面承诺 | 主要验收对象 | 争论集中在哪里 | 变化或失败后可带走的东西 |
|---|---|---|---|---|
| Claude Fable / Mythos 5.1 | 更强的编码、知识工作与科学研究能力 | 基准规则、护栏触发、转交路径、账户用量 | 护栏误报、配额窗口、输出风格 | 任务日志、拒绝与转交记录、可复现实验条件 6 |
| Ed Zitron 预测复盘 | 对 AI 行业的长期判断 | 原句、截止日期、证伪条件、计算表 | 预测是否已被推翻、财务数字是否可复算 | 原始预测与逐期数据 7 |
| ARC 小 Transformer | 低成本取得高基准分数 | 数据边界、test-time training、增强、成本摊销 | benchmark 规则、是否 benchmaxxing、是否能泛化 | 模型代码、训练设置、harness 与消融结果 8 |
| ChatGPT / Codex 运行时 | agent 可以处理复杂办公文件 | 依赖清单、版本、缓存、许可证、失败日志 | headless 与完整版、首次下载、依赖体积 | 本地文件、组件版本与可移除的运行时 10 |
| Nori A3 | 1688 美元获得可训练的双臂机器人 | 任务重复性、控制方式、网络边界、维修与软件 | 演示与实用的距离、低价硬件质量、商业持续性 | SDK、模拟器、维修件、任务数据和本地安全控制 11 |
这五条热帖把“能力”拆成了五种可以检查的东西。模型发布需要护栏和账户记录,预测需要时间与计算表,基准实验需要规则与 harness,桌面 agent 需要依赖清单,机器人需要任务复现与维修链。它们的共同处在于,结果旁边都必须留下一层可以让别人复算、复现或接手的材料。
读者再看到一项“更强”“更便宜”或“开箱即用”的技术承诺时,可以先问四个问题:
- 数字是怎样得到的? 测试集、基线、时间范围和平均方式是否写清楚?
- 规则允许了什么? 模型能看到哪些输入,agent 能调用哪些工具,机器人由谁操作?
- 隐藏依赖在哪里? 护栏、配额、运行时、网络、许可证和维修件是否进入了成本表?
- 失败后还能接手什么? 日志、代码、原始文件、模型配置、SDK、模拟器和任务数据是否仍可带走?
热榜提供的是五个具体的核对入口。读者可以先看数字的测试条件,再看评论者怎样指出边界,最后把自己的工作负载放进同一张验收表里。技术能力的价格与性能只是起点,能否复算、复现和接手,决定了这项能力能否进入真实工作流。
References
- 1Hacker News discussion: Claude Fable 5.1 and Claude Mythos 5.1
news.ycombinator.com
- 2
- 3
- 4Hacker News discussion: The ChatGPT/Codex app bundles a full copy of LibreOffice
news.ycombinator.com
- 5
- 6Introducing Claude Fable 5.1 and Claude Mythos 5.1
anthropic.com
- 7
- 844% on ARC-AGI-1 in 67 cents - Mithil Vakde’s Homepage
mvakde.github.io
- 944% on ARC-AGI-1 in 67 cents - Mithil Vakde’s Homepage
mvakde.github.io
- 10Codex bundles LibreOffice
simonwillison.net
- 11NORI A3 — Affordable bimanual robot
norirobotics.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.