
AA 指数把 Fable 5.1 与 GPT-6 Astra 排到同分,唐杰回应 GLM 5.3 的思考效率问题
9月7日至8日两条 X 动态显示,Artificial Analysis v4.3 将 Fable 5.1 与 GPT-6 Astra 排到同为 53 分,而唐杰对 GLM 5.3 思考过程偏长的反馈回应为下一代模型尝试修复。
9 月 7 日至 8 日,唐杰在 X 上出现两条与模型表现有关的新动态:Artificial Analysis 更新 Intelligence Index 后,Claude Fable 5.1 与 GPT-6 Astra 同为 53 分;面对用户对 GLM 5.3 思考过程偏长、token 效率偏低的反馈,唐杰回复称会在下一代模型中尝试修复。前一条讨论当前版本的测量结果,后一条指向尚未发布的后续版本。
指数更新后,两款模型并列 53 分
北京时间 9 月 8 日 13:33,唐杰转发了自己的判断:“Updated AA index... Now Fable 5.1 and GPT-astra have the same...”,并附上 Artificial Analysis Intelligence Index 的排名截图。1
Loading content card…
唐杰指向的是 Artificial Analysis 在 9 月 7 日发布的 Intelligence Index v4.3。该版本把 Claude Fable 5.1(max with fallback)和 GPT-6 Astra(max)都列为 53 分,排在 Claude Opus 5 的 51 分之前。这里的“同分”是这一套综合指数中的结果,读者可以把它理解为两款模型在该版本的加权总分相同。2

分数相同,具体强项仍然不同。Artificial Analysis 写明,Fable 5.1 在 AA-Briefcase 和 SciCode 上得分更高;GPT-6 Astra 在 Terminal-Bench v4.0 和 AutomationBench-AA 的分数更高。两款模型的平均 Intelligence Index 单任务成本也有差距:Astra 为 3.26 美元,Fable 5.1 为 7.63 美元。2
同分背后,测量方式也变了
v4.3 把 Terminal-Bench 从 2.1 升级到 4.0。新版本包含 66 个终端任务,覆盖软件、机器学习、科学、运维、安全、硬件和媒体等工作。按 Artificial Analysis 的测量,GPT-6 Astra 得分 59.1%,Claude Fable 5.1 得分 52.0%。2
指数还用 AutomationBench-AA 替换了原来的银行业务测试。这个测试由 Zapier 开发,包含 657 个模拟企业应用工作流,覆盖财务、人力资源、营销、运营、销售和支持;模型需要自己发现合适的 API 来完成任务。v4.3 中,含有私有题目或答案的评测权重从 v4.2 的 40% 提升到 45%,Agents、Coding、General 和 Scientific Reasoning 四类权重保持为 30%、20%、30% 和 20%。2
因此,53 分首先说明两款模型在 v4.3 的综合口径下到达同一位置。模型能力的具体差别,还要回到各个评测项目、任务设置和成本一起看。Artificial Analysis 自己的结果已经给出一个清晰分工:Astra 在终端和企业工作流自动化测试上占优,Fable 5.1 在 AA-Briefcase 和 SciCode 上占优。2
用户问的是效率,唐杰承诺下一代尝试修复
北京时间 9 月 8 日 07:19,唐杰回复 @john_362804652:“will try to fix it in the next model”。3
Loading content card…
这条回复对应的原始提问发表于 9 月 4 日。@john_362804652 称,自己用 Codex 解决一个问题只需要几分钟,GLM 5.3 虽然也能解决,但耗时十几分钟;他希望唐杰关注 thinking 过程能否更短,以及 token 效率能否提高。原始提问和唐杰的回复在同一条公开对话页面中可以看到。3
唐杰的措辞是“下一代模型会尝试修复”。这句话给出了方向和时间指向,当前没有给出具体模型名称、发布时间、目标 token 数或完成时间指标。读者可以把它当作后续版本的待验证信号,而不是已经交付的 GLM 5.3 更新。
接下来观察四个量
这两条动态适合分开跟踪。Artificial Analysis 的 53 分回答“当前版本在一套更新后的综合评测中处于什么位置”;回复则把问题落到了真实使用中的效率。
后续如果出现新模型或新评测,最值得并排记录四个量:
- 完成同一类任务需要多少 thinking 和输出 token。
- 从开始调用到任务完成实际经过多长时间。
- 模型能否在较少人工介入下完成任务。
- 单个成功任务的实际成本是多少。
只有把这些指标放在相同任务和相同评测版本下比较,读者才能判断“思考过程更短”究竟带来了更快完成、更低成本,还是只是减少了输出长度。当前已经确认的内容是:Artificial Analysis v4.3 把 Fable 5.1 与 GPT-6 Astra 排到了同为 53 分,唐杰则把 GLM 5.3 的 token 效率问题留给下一代模型尝试解决。
References
- 1唐杰的 X 动态
x.com
- 2Artificial Analysis Intelligence Index v4.3
artificialanalysis.ai
- 3唐杰回复 @john_362804652
x.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
