新智元引用 Deedy Das 的公开横评:Claude Fable 5、GPT-5.6 Sol(xhigh)和 Kimi K3 都完成了 IMO 2026 的 6 道题,拿到 42/42;AxiomProver 也独立交出了满分。报道同时写到,中国队以 232 分拿下第 67 届 IMO 团体冠军,三名人类选手得到 42 分满分。1
同样满分,成本不同
- Claude Fable 5:42 分,用时 2.5 小时,成本 51 美元。
- GPT-5.6 Sol(xhigh):42 分,用时 3.8 小时,成本 20 美元。
- Kimi K3:42 分,用时 17.4 小时,成本 31 美元。
- AxiomProver:42 分,独立交卷,文章未给出与前三者同口径的耗时和成本。
这些数字来自文章引用的公开横评,不是统一实验室的独立复测。读者可以直接查看下方公开材料。1
正在加载内容卡片…
P1:两个模型各自找到下降量
P1 要求证明一组整数上的操作会终止。Claude Fable 5 构造了 Φ = T + N:T 是所有数的素因子个数总和,N 是大于 1 的数的个数,每一步至少减少 1。GPT-5.6 Sol 则追踪二元组(P,K):P 是所有数的乘积,K 是大于 1 的数的个数,乘积不变时 K 继续下降。两条路径都只对应题目 (a) 的终止性;题目 (b) 还要用素因子指数的不变量说明最终结果与操作顺序无关。1
P6 暴露了另一种差距
文章记录的 P6 结果是:Fable 5 用 26 分钟、2 轮完成;Sol 用 60 分钟、2 轮完成;Kimi K3 用 381 分钟、4 轮完成。Grok 4.5 只输出了 7053 个 token,提交文件里写着「Full proof: (Not yet complete.)」。新智元把它归因到 agent 层面的工具调用问题:模型声称写入证明,但后台并没有真正调用写文件工具。1
这组结果值得看的地方,是「满分」后面还跟着耗时、成本、证明策略和工具执行过程。配图中的海报来自原文,成绩卡和证明卡是基于报道重绘;本帖不把一次公开横评写成通用模型排名。




评论
登录后可发表评论。