7 月 20 日后 AI benchmark 更新:ARC-AGI-3 的 13.3%/38.3% 与 Gemini 3.6 的 1M 长上下文

7 月 20 日后 AI benchmark 更新:ARC-AGI-3 的 13.3%/38.3% 与 Gemini 3.6 的 1M 长上下文

同一模型在 ARC-AGI-3 的分数可因 harness 从 13.3% 变为 38.3%,而 Gemini 3.6、Robostral 与语音和安全评测进一步显示:工具、版本和聚合口径必须与数字一起读。

7 月 29 日,OpenAI 给出了一个很难忽略的对照:同一个 GPT-5.6 Sol,在 ARC-AGI-3 public set 上,使用 official harness 得分 13.3%;保留 reasoning、启用 compaction 的 Responses API harness 得分 38.3%。这两个数字都是真的,但不能被合并成一个「模型分数」。1
这组对照把 7 月 20 日之后公开评测的共同问题说清楚了:benchmark 结果至少同时属于模型、题目版本和运行脚手架。工具权限、上下文如何裁剪、是否保留中间 reasoning、调用次数、推理预算,以及分数如何聚合,都会进入结果。只抄最后一列数字,读者拿到的是一个缺少实验条件的摘要。

七条能力线速览

能力线窗口内可核验增量证据级别与可比性
推理ARC-AGI-3:GPT-5.6 Sol 在 official harness 为 13.3%,在 retained reasoning + compaction 的 Responses API harness 为 38.3%。1官方文章;设置不同,不是同一榜单点位
代码Gemini 3.6 Flash 报告 SWE-Bench Pro Public 58.7%、DeepSWE v1.1 49%、Terminal-bench 2.1 / Terminus-2 harness 78.0%。2官方 model card;多数行未披露完整运行设置
数学没有纳入一条同时具备 benchmark 名称、版本或 split、指标、评测设置和窗口内详情页时间的官方数学成绩。明确缺口;不拿窗口外材料补齐
多模态Gemini 3.6 Flash 的 CharXiv Reasoning 为 no tools 85.2%、with tools 89.4%;Robostral Navigate v2 在 R2R-CE validation unseen 报告 SR 77.4%。23官方 model card + arXiv 技术报告;图表推理与具身导航不可合并
AgentGemini 3.6 Flash 报告 OSWorld-Verified 83.0%、GDPVal-AA v2 Elo 1421;Robotics ER 2 报告 progress classification accuracy 57.4%、moment-finding accuracy 91.3%。24官方材料;任务、脚手架和指标各自不同
安全Gemini 3.5 Flash Cyber 在固定 invocation 数下发现 55 个 V8 unique confirmed issues,mainline Gemini 3.5 Flash 为 47,Claude Opus 4.6 为 36。5官方专题评测;unique issues 不是通用代码正确率
长上下文GDM-MRCR v2(8-needle)在 Gemini 3.6 Flash 上为 128k average 91.8%、1M pointwise 54.0%。2官方 model card;average 与 pointwise 不能直接画成同一条趋势
这张表里最重要的不是谁排在前面,而是同一个单元格里缺了什么。Gemini 3.6 Flash 的 model card 明确写了 benchmark 名称、部分版本和工具条件;但多数成绩没有同时给出 reasoning budget、temperature、sample count、完整 prompt 和具体工具配置。因此它可以作为官方报告值,不能自动变成一张可复现实验总榜。

ARC-AGI-3:harness 不是脚注

OpenAI 对 official harness 的解释很具体:每次游戏动作之后,private reasoning 会被丢弃;历史变长后,系统用 rolling truncation 丢掉更早的动作。Responses API harness 则保留跨 turn 的 reasoning,并用 compaction 替代 rolling truncation。官方文章把 175,000 tokens 作为实现中的上下文限制,还说明完整评测没有披露 temperature、sample count 和 prompt。1
所以 13.3% 到 38.3% 之间的差,不应直接写成「模型能力提高了 2.9 倍」。更准确的说法是:在 OpenAI 自己的两套运行协议下,保留思考状态和改变上下文管理,改变了同一个模型在 ARC-AGI-3 上的结果。这个例子测到的既有模型,也有状态管理和 harness 设计。
这也是推理 benchmark 最容易被忽略的字段:模型是否可以看见自己的前序推理,工具调用之后上下文是否完整,长任务中旧状态如何被压缩。没有这些字段,单一 accuracy 或 RHAE 数字只说明一个实验配置的产物。

Gemini model card:数字很多,横向条件仍不齐

Gemini 3.6 Flash 的 model card 把代码、Agent、图表推理和长上下文放进同一张表,覆盖面很宽。它还把 CharXiv 的 no tools 和 with tools 分开,这比把工具调用藏起来更诚实。2
测试Gemini 3.6 Flash 结果必须保留的条件
SWE-Bench Pro (Public)58.7%Public split;其余运行细节未完整披露。2
Terminal-bench 2.178.0%使用 Terminus-2 harness。2
CharXiv Reasoningno tools 85.2%;with tools 89.4%工具开关本身就改变结果,但具体工具策略未展开。2
GDM-MRCR v2 (8-needle)128k average 91.8%;1M pointwise 54.0%上下文长度和聚合口径不同。2
Gemini 3.5 Flash-Lite 的 model card 把这个问题暴露得更直白:GDM-MRCR v2 在 128k average 上是 72.2%,在 1M pointwise 上是 21.3%;CharXiv 则从 no tools 的 74.5% 变成 with tools 的 76.5%。这两组结果都能用于描述模型在特定设置下的表现,但不能把 128k 和 1M 当作同一种长度曲线,也不能把工具开关后的数字当作同一条件的提升。6

版本与专题协议,正在制造新的边界

Robostral Navigate v2 是一个 8B VLM、约 121M diffusion policy 和 motion controller 组成的具身导航系统,输入是自然语言指令和单目 RGB 图像流。arXiv v2 在 R2R-CE validation unseen 报告 SR 77.4%、SPL 74.2%、NE 3.20;VLM 以 0.5 Hz 预测 waypoint,diffusion policy 以 10 Hz 生成轨迹,controller 以 100 Hz 输出电机命令。3
同一个项目的 Mistral 公告写的是 validation unseen SR 76.6%,seen SR 79.4%,而不是 v2 页面中的 77.4% 与 79.43%。这不是可以用四舍五入掩盖的小数差异,而是版本和发布口径需要同时保留的信号。73
语音模型也采用了不同的测量组合。xAI 在 Grok Voice Think Fast 2.0 的官方页面引用 Artificial Analysis,报告 Big Bench Audio 97.2%、Full Duplex Bench 95.1%、tau-voice Bench 56.5%,以及 0.70 秒的 Time to First Audio。页面没有给出该模型的 exact split、reasoning budget 和 tool configuration,所以这些数字应标为部分官方披露,而不是无条件的语音总榜。89
安全和机器人评测则把「任务定义」本身放到了分数前面。Gemini 3.5 Flash Cyber 在固定调用次数下比较发现的 V8 漏洞数量,CodeMender 最多调用 Cyber 五次;这个设计回答的是漏洞发现覆盖,而不是代码能否通过测试。5 Gemini Robotics ER 2 把视频进度分成五档,报告 progress classification accuracy 57.4%;在关键时刻定位任务上报告 91.3% accuracy 和 0.96 秒平均绝对距离,但没有公开完整 benchmark 名称、样本量和阈值设置。4

数学空缺,以及不该入榜的公告

当前公开官方材料中,没有一条同时提供 benchmark 名称、版本或 split、指标、评测设置和窗口内详情页时间的数学成绩。它不表示数学评测没有新工作,只表示本期没有一条能承担可比数字的来源。
其他厂商的窗口内动态也有类似边界。DeepSeek-V4-Flash 的官方帖子声称 agent benchmark 成绩远超 V4-Pro-Preview,但没有 benchmark 名称、分数、split 或设置;Qwen-Audio-3.0-ASR-Flash 给出 medical term recall 95.36% 和 industrial term recall 93.24%,却没有 benchmark identity 或 split。两者都可以记为模型公告,不能写进公开成绩表。1011
Anthropic 的 Claude Opus 5 公告列出 Frontier-Bench v0.1、CursorBench 3.2、ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0 和 OSS-Fuzz,但可读正文主要是相对表述,不能替代带完整条件的分数表。12

下一次看榜,至少把这八个字段放在一起

  1. 模型确切版本:不要把系列名当成可复现实验对象。
  2. benchmark 版本和 split:Public、Verified、v1.1、v2 不是装饰性标签。
  3. harness:包括 API、状态管理、上下文裁剪、重试和调用上限。
  4. 工具权限:尤其要区分 no tools、with tools,以及工具的具体类型。
  5. 推理预算和解码设置:reasoning effort、temperature、sample count 缺一项,都可能影响结果。
  6. 任务边界:漏洞发现、导航成功、图表问答、语音对话和数学证明不是同一个能力。
  7. 指标定义:accuracy、SR、SPL、Elo、RHAE、unique issues 分别回答不同问题。
  8. 聚合口径:128k average、1M pointwise、pass@1 和多次调用后的最佳结果不要排成一条线。
7 月 20 日之后最值得保留的增量,不是一张新的总榜,而是评测条件被更多官方材料写到了台面上。ARC-AGI-3 让 harness 对分数的影响变得可见;Gemini 的 model card 让工具开关和长上下文口径有迹可循;Robostral 的版本差异提醒读者回到原始版本;Cyber、Robotics 和语音评测则说明,Agent、安全和多模态能力必须连同任务定义一起读。benchmark 的数字仍然有用,但只有把它产生的条件一起保存,数字才不会在传播中变成另一件事。

Related content

  • Sign in to comment.
More from this channel