AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?

AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?

一份截至 2026 年 7 月的 AI benchmark 地图:解释核心测试在测什么、任务长什么样,以及主流模型公开成绩为何不能简单排成一张总榜。

先看结论:Benchmark 不是一张总成绩单

截至 2026 年 7 月 20 日,主流模型的评测已经分成七条相互独立的能力线:通用知识与推理、数学、代码、Agent、视觉与视频、安全、长上下文。模型在其中一条线拿到高分,不等于它能在另一条线上稳定完成真实任务。
最容易误读的是「同名 benchmark 分数」。SWE-bench Verified 和 SWE-bench Pro 不是同一套题;MMMU 的 Val、Test 与 MMMU-Pro 也不是同一协议;AIME 的 pass@1、cons@64 和多次采样平均值更不能排在一列里。下面的数字只在评测版本、数据集切分、工具权限、推理预算和 agent scaffold 都接近时才适合横向比较。
这份基线盘点回答三个问题:每个核心 benchmark 在测什么,题目或任务长什么样,主流模型目前交出了什么成绩。数字旁边保留了原始论文、官方 model card 或官方项目页;第三方排行榜和 X 帖子只作为补充,并会标出它们的证据等级。

七条能力线速览

能力线核心 benchmark题目 / 任务形态主要看什么
通用知识与推理MMLU-Pro、GPQA Diamond、BBH、LiveBench多学科选择题、研究生级科学题、多步推理与客观问答知识调用、复杂推理、抗污染能力
数学MATH-500、AIME、MathArena、OlymMATH竞赛数学题、整数答案、证明题、Lean 4 形式化证明多步推导、精确计算、证明能力
代码HumanEval、MBPP、LiveCodeBench函数补全、竞赛编程题、代码执行与修复代码正确性、算法能力、数据污染风险
软件工程 AgentSWE-bench、SWE-bench Live/Pro、SWE-EVO、Terminal-Bench真实 GitHub issue、多文件演化、容器终端长任务环境操作、定位问题、长期执行与回归测试
浏览与计算机使用 AgentGAIA、BrowseComp、WebArena、OSWorld、τ²-bench网页搜索、浏览器 / 桌面操作、API 调用、状态达成规划、工具调用、跨步骤可靠性
多模态MMMU、MMMU-Pro、MathVista、MMBench、Video-MME图表、地图、乐谱、数学图形、长视频问答看图、读字、知识与视觉推理的联合能力
安全与长上下文SimpleSafetyTests、HarmBench、StrongREJECT、WildGuard、XSTest、LongBench v2、RULER、MRCR危害提示、越狱、过度拒答、长文检索、多针指代风险边界、拒答质量、有效上下文长度

1. 通用知识与推理:从「会答题」到「能处理陌生问题」

MMLU-Pro:把普通选择题变成更难的综合考

MMLU-Pro 有约 12,000 道研究生级选择题,覆盖 14 个学科,并把原版 MMLU 的四选一扩展到十选一。它仍然像考试,但选项更多、干扰项更接近,题目也更依赖推理。论文报告,相比 MMLU,模型在 MMLU-Pro 上会下降约 16% 至 33%;这也是为什么它比原版 MMLU 更适合观察模型是否真的在分析题目,而不是靠熟悉的题型模式作答。1
任务例子可以抽象成:「给出一段专业问题和十个候选答案,选出正确项,并在需要时给出推导。」指标通常是准确率。它测的是知识和推理的混合物,不适合单独当作「纯知识分」或「纯推理分」。

GPQA Diamond:专家写给非专家也难以搜索的科学题

GPQA 包含生物、物理、化学领域的研究生级多选题,Diamond 子集是其中最难的 198 题。题目由领域专家编写,论文报告领域专家准确率约 65%,剔除自认错误后约 74%;高技能非专家即使允许自由上网,准确率也只有约 34%。它要测的不是背诵,而是把专业知识、公式和多步推理拼在一起。2
题目形态仍是选择题,但「搜索得到相关网页」不等于能作答。模型若只会检索关键词,往往能找到背景资料,却无法判断几个相近选项的关键差异。

BBH:23 个硬任务,适合看推理方法但已经偏饱和

BIG-Bench Hard 从 BIG-Bench 中挑出 23 个当时模型难以超过人类平均水平的任务,覆盖多步算术、逻辑、因果判断、对象追踪等类型。原论文的重点发现是,链式思考在部分任务上带来明显跃升。3
它的题目规模不大,当前前沿模型在不少子任务上已经超过 90%,所以 BBH 更适合作为历史基线,或观察「是否需要显式推理」的控制变量,不宜用来区分今天的顶级模型。

LiveBench:每月换题,专门对抗静态数据污染

LiveBench 按月更新题目,覆盖推理、数学、编程、语言、数据分析和指令遵循六类、18 项任务。题目来自最新竞赛、arXiv 论文、新闻和 IMDb 等来源,评分尽量采用有客观答案的自动评测,不依赖 LLM judge。4
它的任务长相不是固定的一种题型,而是一组会更新的客观问答。例如给一段新近论文或数据,要求模型计算、排序、抽取或按条件作答。阅读成绩时必须写清 release 日期,因为 2024 年 11 月版和之后的题池不是同一套考试,分数不能直接串成一条趋势线。

2. 数学:MATH-500 已接近天花板,AIME 与形式化证明更有区分度

MATH 与 MATH-500:经典竞赛数学基线

原始 MATH 有 12,500 道竞赛数学题,覆盖代数、几何、数论、计数与概率、预备代数和预备微积分,并附有逐步解答。MATH-500 是常被模型报告引用的 500 题子集,通常用 pass@1 准确率。5
典型任务是读一道完整的文字数学题,给出整数或最终表达式。它对早期模型很有区分力,但如今前沿模型在 MATH-500 上普遍接近 95% 以上。不同实现的题目子集、采样次数和答案归一化规则仍可能不同,不能只看一个百分比。

AIME:每年换题的整数答案竞赛

AIME 每套 30 题,答案是 000 到 999 的整数,涉及代数、几何、数论和组合。模型必须把多步推导压到一个精确整数,猜中并不代表过程可靠。MathArena 把 AIME、CMIMC、IMO 等新竞赛题接入实时评测,并指出 AIME 2024 已出现较强的污染迹象。67
公开成绩的差异往往来自评测协议:GPT-5 在 AIME 2025 的官方报告是 94.6%,标注为不使用工具;Grok 3 Think 的 93.3% 是 cons@64,即多次采样后取一致答案。两者都不能直接写成「谁高谁低」。89

OlymMATH:把数学答案推进到 Lean 4 证明

OlymMATH 收录 350 道奥数题,其中一部分采用自然语言数值答案,另一部分用 Lean 4 形式化验证。题目来自印刷出版物,并提供中英双语版本,目标是减少训练数据泄漏,同时把「答案对不对」和「证明能否被形式化检查」区分开。10
这类 benchmark 的任务不再只是「算出一个数」,而是要生成可被证明助手检查的证明脚本。它更接近研究型数学与形式化软件,但工程成本也更高,模型分数不宜和 AIME 的整数答案准确率放在同一张排行榜上。

3. 代码与软件工程:函数补全已经不够了

HumanEval / MBPP:仍有历史价值,区分力明显下降

HumanEval 有 164 个手写 Python 函数题,MBPP 约有 1,000 道入门级 Python 题,按生成代码能否通过测试来计算 pass@k。它们奠定了代码模型评测的基本形式:给函数签名和自然语言要求,输出可执行代码。1112
问题在于题目短、环境简单,而且已有较多数据泄漏证据。Web-Bench 论文报告,HumanEval 的 pass@1 已达到 99.4%、MBPP 达到 94.2%,所以它们今天更像回归测试,而不是前沿模型的有效分水岭。1314

LiveCodeBench:从最新竞赛题里抽题

LiveCodeBench 持续从 LeetCode、AtCoder 和 Codeforces 收集新题,覆盖代码生成、代码修复、代码执行和测试输出预测,并按 Easy、Medium、Hard 分层。题目来自模型训练截止时间之后的竞赛窗口,设计目标是降低污染。15
它的题型仍偏算法竞赛。2026 年 7 月的公开追踪数据中,Gemini 3 Pro Preview 约 91.7%、Gemini 3 Flash Preview 约 90.8%、DeepSeek V3.2 Speciale 约 89.6%、GPT-5.2 约 89.4%;这些数字来自第三方排行榜,必须同时核对 release 版本和题目窗口,不能把它们当作软件工程能力。16

SWE-bench:让模型真的修一个 GitHub issue

SWE-bench 的输入是真实开源项目中的 GitHub issue 和代码库,输出是跨文件 patch,再由项目测试套件验证。原始数据有 2,294 个问题,来自 12 个 Python 仓库;这比写一个孤立函数更接近工程师接单。17
SWE-bench Verified 是其中 500 个经人工检查的问题,指标通常是单次尝试的 Resolve Rate。SWE-bench Pro 与 Live 则试图缓解静态数据污染和题目可预测性。这里有一个必须记住的限制:分数是「模型 + 工具链 + agent scaffold」的结果。Claude Code、Codex CLI 和 SWE-agent 的文件检索、重试和测试策略不同,不能把它们的成绩当作裸模型能力。
以官方发布的不同协议为例,GPT-5 在 SWE-bench Verified 的固定验证子集上报告 74.9%;Claude Opus 4 在完整 500 题上报告 72.5%,高计算设置为 79.4%;Claude Sonnet 4 的高计算设置为 80.2%。题数、基础设施和计算预算都不同,这组数字只能说明模型处在同一问题族中,不能组成严格排名。818

SWE-EVO 与 Terminal-Bench:从「修一个 issue」走向长周期工作

SWE-EVO 把软件演化做成长期任务:48 个任务来自 7 个成熟 Python 项目的 release notes,平均每个任务要改 21 个文件、通过约 874 个测试。GPT-5.4 配合 OpenHands 在该设置下只有 25%,而同类模型在 SWE-bench Verified 上能超过 70%,差距说明单 issue 修复不能代表持续开发能力。19
Terminal-Bench 2.1 则把任务放到 Docker 终端环境,要求模型训练模型、调试系统、配置服务或完成其他长周期命令行工作。当前公开榜单中,Claude Code + Fable 5 的 resolve rate 为 83.8% ± 1.2%,Codex + GPT-5.5 为 83.1% ± 1.1%;这两个分数都包含 harness 的作用,并不是同一模型在同一 agent 框架下的对照实验。2021

4. Agent:最终状态比漂亮的对话更重要

GAIA:一个需要网页、文件和工具的真实问题

GAIA 有 466 个真实世界问题,分为三个难度等级,要求 Agent 组合推理、多模态理解、网页浏览和工具使用,最终答案通常按精确字符串核对。原始论文中,人类基线为 92%,GPT-4 加插件只有 15%。22
当前 Princeton HAL 榜单的一个快照中,Claude Sonnet 4.5 配合 HAL Generalist Agent 在 165 题公开验证集上为 74.55%,GPT-5 配合 HF Open Deep Research 为 62.80%。两者使用不同 scaffold,不能解读为模型本体的纯差距。23

BrowseComp:答案很短,搜索过程很长

BrowseComp 有 1,266 道开放互联网问题,答案短而容易验证,但需要 Agent 长时间搜索、交叉核对和拼接分散信息。它不像简单的网页问答,更接近「查清一个难搜的事实」。24
它目前缺少稳定、透明的公共 leaderboard,很多新分数来自厂商报告或 X 讨论。社区帖子曾报告 Claude Opus 4.6 在 BrowseComp 上 84.0%、GPT-5.4 为 82.7%,这类数字应当标为社区结果,等待模型厂商或独立评测复核。25

WebArena 与 OSWorld:操作网页和电脑,而不是描述操作步骤

WebArena 在自托管的电商、论坛、协作开发、内容管理和地图网站中布置 812 个长任务,模型需要真正点击、输入、导航并达到目标状态。原始论文中 GPT-4 的端到端成功率为 14.41%,人类为 78.24%。26
OSWorld 把环境扩展到真实桌面应用和文件系统,原始版本有 369 个任务,包含浏览器、办公软件和跨应用工作流。评测同样看最终状态,而不是语言回答;论文初始最佳模型成功率只有 12.24%,人类为 72.36%。27
OSWorld-Verified 与 OSWorld 2.0 已修订任务、验证器和长周期工作流。不同版本的成功率不能混写,尤其不能把原始版本与 Verified 版本的跃升简单写成「模型能力提升了多少」。

τ-bench / τ²-bench:客服场景里的工具调用和状态一致性

τ-bench 模拟零售和航空客服,模型要与用户多轮对话、调用数据库 API、遵守业务政策,并最终把共享世界状态改对。τ²-bench 进一步让 Agent 和用户都能操作状态,形成 dual-control 环境。2829
这类任务的好处是能暴露「说得很对,但没改对订单」的问题。缺点是指标和榜单协议差异很大:τ-bench 常报告 pass rate 或 pass^k,τ²-bench 也有 accuracy。GLM-5 的 89.7% accuracy 与 Claude Opus 4.5 的 79% pass rate 不能直接比较。30

5. 多模态:看见、读懂和推理必须同时成立

MMMU 与 MMMU-Pro:从大学知识题到「文字藏在图里」

MMMU 有约 11,500 道大学水平、多学科多模态题,覆盖 30 个科目和 183 个子领域,图片类型包括图表、地图、表格、乐谱和化学结构。题目既有选择题,也有开放问答,测的是视觉感知、专业知识和推理的联合作用。31
MMMU-Pro 是更鲁棒的改版:过滤掉纯文本就能答的题目,把选项扩展到十个,并加入 vision-only 设定,把问题文字也放进图片里。论文报告,模型在 MMMU-Pro 上的准确率会掉到约 16.8% 至 26.9% 的区间,说明「文字模型先答一遍,再把图像当作辅助」的策略并不等于真正的图文整合。32
MMMU 初版验证集上,GPT-4V 约 56%,人类专家约 82%;后来第三方榜单上的 GPT-5.5、Gemini 3.1 Pro 等 83% 左右的成绩来自不同评测管道,不能与初版数字排在同一列。MMMU 原作者在 X 上发布过项目公告,可作为追踪论文和榜单更新的入口。33

MathVista:把数学题放进图表、几何图和函数图像

MathVista 有 6,141 道题,来自 28 个既有多模态数学数据集和 3 个新数据集,覆盖代数、算术、几何、逻辑、数值、科学和统计。任务包括图形问答、几何求解、数学应用题、教材问答和视觉问答,既有开放题也有选择题。34
GPT-4V 在论文初版 test 集约 49.9%,GPT-4o 在后续榜单显示约 63.8%,但 testmini 与 test 的答案公开状态不同,评测 prompt 和实现也可能不同。MathVista 的价值不在于给模型一个单独的「视觉数学总分」,而在于拆出它究竟是读不清图,还是读清了图却不会做数学。

MMBench:把视觉能力拆成 20 个维度

MMBench 是中英双语的多模态选择题基准,包含 OCR、空间推理、属性比较等 20 个能力维度,并通过 CircularEval 把自由形式输出转换成预定义选项。它适合看视觉语言模型的能力剖面,而不是只报一个总分。35
当前实际评测常通过 OpenCompass 的 VLMEvalKit 运行。官网入口和版本需要核对,MMBench、MMBench-Video 与后续 Live 版本不能混为一个名字。

Video-MME:从短视频到一小时视频

Video-MME 有 900 个视频、约 254 小时素材和 2,700 个问答,覆盖 6 个大领域、30 个子领域,视频长度从 11 秒到 1 小时。输入可以组合视频帧、字幕和音频,问题要求模型理解事件、时序和声音信息。36
论文初版在带字幕设定下,Gemini 1.5 Pro 为 75.0%,GPT-4o 为 71.9%,GPT-4V 为 59.5%。这组数字属于 2024 年的论文协议,Video-MME-v2 等新版本已经改变评测范围,不能用来代表 2026 年模型的现状。

6. 安全:低分不一定坏,高分也不一定安全

安全 benchmark 没有统一总分。拒答率、攻击成功率、危害响应率、过度拒答率和安全知识准确率回答的是不同问题。
benchmark测什么任务形态与指标
SimpleSafetyTests关键危害的快速筛查100 条提示,覆盖儿童伤害、自残、诈骗、非法物品和身体伤害;看不安全响应率。37
HarmBench红队攻击方法和模型防御约 400 条行为测试,比较攻击方法对目标模型的成功率,核心指标是 ASR。38
StrongREJECT越狱响应是否真的提供了有害帮助由自动评估器判断回答的危害性与有用程度,重点是纠正字符串匹配对越狱成功率的高估。39
WildGuard / WildGuardMix提示是否恶意、回答是否危险、模型是否拒答92K 多任务标注样本和 5K 测试集,覆盖 13 类风险。40
XSTest模型是否把安全请求也拒绝了250 条安全提示和 200 条不安全提示,观察 Full Refusal Rate 与 Partial Refusal Rate。41
SafetyBench安全知识与判断11,435 道中英双语多选题,覆盖 7 类安全问题,指标是准确率。42
CyberSecEval网络安全代码风险、攻击请求遵从、prompt injection 等Meta Purple Llama 系列持续迭代,v1、v2、v3 的覆盖维度不同,不可跨版本直比。43
例如 XSTest 的低拒答率可能说明模型不容易过度拒绝,也可能意味着它在某些边界上更宽松;HarmBench 的低 ASR 说明攻击方法没有让模型产生目标行为,但不等于模型在所有风险领域都安全。模型卡若只给一张安全总表,读者应继续追问数据集、攻击者、评估器和失败案例。

7. 长上下文:上下文窗口多大,不等于有效记忆多大

LongBench v2:深度理解,不只是大海捞针

LongBench v2 有 503 道多选题,上下文长度从 8K 到 2M words,覆盖 6 大任务类别。题目要求从长文档中抽取分散信息并完成深度理解与推理。论文报告,人类专家在 15 分钟限时下为 53.7%;直接回答的最强模型为 50.1%,o1-preview 结合更长推理达到 57.7%。4445
官方页面的一个带 CoT 快照中,Gemini 2.5 Pro 为 63.3%、Gemini 2.5 Flash 为 62.1%、Qwen3-235B-A22B-Thinking 为 60.6%。阅读时要区分 w/ CoT 与 w/o CoT,也要记住不同长度子集的题目分布不一样。

RULER:把「有效长度」拉出来单独测

RULER 是可配置的合成长上下文压力测试,包含检索、多跳追踪、聚合和问答四类、13 项任务。它可以改变序列长度、needle 数量和任务复杂度,因此比只测一个固定的 NIAH 大海捞针更能观察模型在上下文变长后的退化。4647
任务例子是把一个或多个关键信息埋在大段干扰文本里,要求模型返回指定信息、聚合多个位置的数字,或完成多跳关系。评测结果高度依赖 haystack、needle 数量和长度配置,所以只能在同一配置下比较。

MRCR 与 NoLiMa:难点从「找原句」变成「找对那个原句」

MRCR 让模型在多轮合成对话里面对多个相似的写作请求,再按要求返回第 2 个、第 4 个或第 8 个实例,考的是多针检索和指代消解。OpenAI 的公开数据集有 2,400 个样本,长度分桶从 4K 到 1M tokens。48
NoLiMa 则把 needle 和上下文的字面重叠尽量降到最低,避免模型只靠关键词匹配。论文测试了 13 个声称支持至少 128K 上下文的模型,发现 GPT-4o 在短上下文为 99.3%,到 32K 时降至 69.7%。这类结果提醒我们,厂商写在规格页上的 context window 是最大输入长度,不是每种任务都能稳定利用的有效长度。49

8. 主流模型当前表现:能放在一起看的,只有一部分

下面这张表只放本轮读到的官方发布页、model card 或原始技术报告中的数字。没有公开精确分数的厂商,不用第三方推断补齐。
厂商与模型已公开的代表分数评测设置与读法
OpenAI GPT-5AIME 2025 94.6%;SWE-bench Verified 74.9%;MMMU 84.2%;GPT-5 Pro GPQA Diamond 88.4%。AIME 标为不使用工具;SWE 使用固定 477 题子集,不能直接和 500 题结果比较。8
OpenAI GPT-5.6 SolGPQA Diamond 94.6%;SWE-bench Pro 64.6%;Terminal-Bench 2.1 88.8%;MMMU-Pro 83.0%(无工具);MRCR v2 8-needle 256K–512K 91.5%。页面使用 max reasoning effort;Ultra 还使用 4-agent 并行,不能与普通单模型结果混排。50
Anthropic Claude Opus 4 / Sonnet 4SWE-bench Verified 高计算设置分别为 79.4% / 80.2%;GPQA Diamond 无 extended thinking 为 74.9% / 70.0%;MMMU 为 73.7% / 72.6%。发布页同时给出 extended thinking 与非 extended thinking,AIME 无 extended thinking 仅 33.9% / 33.1%,不要和推理模式成绩混用。18
Google Gemini 3.5 Flash / 3.1 ProFlash:Terminal-Bench 2.1 76.2%、SWE-bench Pro 55.1%、MMMU-Pro 83.6%、MRCR v2 128K 平均 77.3%;Pro:Terminal-Bench 70.3%、SWE-bench Pro 54.2%、MMMU-Pro 80.5%。使用 Terminus-2 harness 的 Terminal-Bench;MRCR 还有 1M pointwise 结果,不能与 128K 平均值混看。51
Meta Llama 4公开页确认 Behemoth 在 MATH-500、GPQA Diamond 上超过页面列出的 GPT-4.5、Claude Sonnet 3.7、Gemini 2.0 Pro;Maverick 强调多模态、代码和长上下文;Scout 标注 10M context。关键 benchmark 表以图片发布,本轮没有从文字证据提取出可复核的精确数字,因此不把宣传性比较改写成百分比。52
DeepSeek-V3MMLU 88.5%;MMLU-Pro 75.9%;GPQA Diamond 59.1%;MATH-500 报告为超过 o1-preview。技术报告以 pass@1 为主,且比较对象区分 long-CoT 与非 long-CoT;没有把不同推理预算的成绩混在一起。53
Qwen3官方页明确列出 ArenaHard、AIME'24/25、LiveCodeBench、CodeForces、Aider、LiveBench、BFCL、MultiIF、GPQA 等对比维度。具体对比表主要以图片发布,本轮不从图片描述反推精确数字;Qwen3 同时有 Thinking 和 Non-Thinking 模式,模式必须随分数记录。54
Mistral Large 3 / Ministral 3官方页文字确认 Ministral 3 14B reasoning variant 在 AIME'25 为 85%;Large 3 与 DeepSeek-V3、Kimi-K2 对比 GPQA、MMMU、SimpleQA、AMC、LiveCodeBench。其余大量数字在图表图片中,本轮不把图表中的模糊比较转成精确榜单。55
xAI Grok 3Grok 3 Beta:AIME'24 52.2%、GPQA Diamond 75.4%、MMLU-Pro 79.9%、MMMU 73.2%;Grok 3 Think:AIME'25 93.3%(cons@64)、GPQA 84.6%、LiveCodeBench 79.4%。Think 与非 Think 是两个不同模式;AIME 的 cons@64 也不能和 pass@1 直接相比。9
这张表有一个刻意保留的空白:Anthropic 的 Fable 5 / Mythos 5、xAI 的 Grok 4 / 4.5 等新型号,部分成绩只出现在其他厂商的对比表、社区榜单或图片里。它们可以作为发现线索,不能在没有直接 model card 或可复核评测设置时冒充厂商自报成绩。5657

9. 近一年新 benchmark 在测什么

新 benchmark 的共同方向很清楚:旧题集更容易饱和,真实工作更长、更开放,也更容易发生污染。
  • RiddleBench 用 1,737 个英语谜题考逻辑、空间感知和约束满足;论文报告顶级模型准确率约 60% 至 63%,并观察到模型会接受其他模型的错误推理。58
  • Gaia2 让环境独立于 Agent 动作继续演化,加入时间约束、噪声和协作;论文中的 GPT-5 high 最高为 42% pass@1,时间敏感任务仍容易失败。59
  • SkillsBench 用 87 个任务和 18 组 model-harness 配置测 Agent Skills 是否真的有用;Curated Skills 把平均通过率从 33.9% 提升到 50.5%。60
  • LoCoBench 把代码上下文从 10K 拉到 1M tokens,覆盖跨文件重构、bug 调查、集成测试和安全分析,说明「能写函数」与「能理解整个仓库」之间仍有距离。61
  • SafeSearch 把红队工作放进搜索 Agent,测试间接 prompt injection、误信息等风险;它提醒人们,模型一旦能浏览互联网,安全问题就不再只发生在输入框里。62
X / Twitter 适合发现这类新评测的发布瞬间:作者会先贴出论文、代码仓库、leaderboard 或首轮结果;但单条帖子通常不能替代原始论文和可复现评测。近期 X 上关于 Kimi K3、Grok 4.5 的 benchmark 数字,就是「发布方或社区先报分,独立验证随后跟进」的典型,应该分别记录为 vendor-reported 或 community-reported,而不是直接写成最终排名。6364

10. 读一张 benchmark 表时,先检查这六项

  1. 版本:MMLU-Pro、MMMU-Pro、SWE-bench Pro、MRCR v1/v2 都不是原版 benchmark 的同义词。
  2. 数据切分:Val、Test、testmini、公开验证集和隐藏测试集要分开写。
  3. 推理预算:是否启用 thinking、CoT、cons@64、max reasoning effort,直接改变结果。
  4. 工具与 scaffold:工具、浏览器、终端、检索、代码执行和重试次数是否一致。
  5. 指标:accuracy、pass@1、pass^k、resolve rate、ASR、refusal rate 和 judge score 不在同一尺度上。
  6. 发布时间与污染:静态旧题的高分可能包含训练数据记忆;新题、滚动题池和 canary 只能降低风险,不能自动证明没有污染。
因此,模型目前的真实状态不是「谁的总分最高」,而是几张不同形状的能力地图:GPT-5.6 Sol 在 GPQA、Terminal-Bench 和 MRCR 的官方数字很强,Gemini 3.5 Flash 在多模态和部分 Agent 评测上有竞争力,DeepSeek-V3 仍提供了开源模型在 MMLU-Pro 和 GPQA 上的明确基线,Claude 4 的软件工程成绩依赖高计算设置,Qwen3、Llama 4 和 Mistral 3 的不少关键结果仍需要直接读取图表或复现实验。把协议一起写出来,排行榜才有意义。

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
    MBPP 论文

    arxiv.org

  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
    GAIA 论文

    arxiv.org

  23. 23
    HAL GAIA 榜单

    hal.cs.princeton.edu

  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31
    MMMU 论文

    arxiv.org

  32. 32
  33. 33
  34. 34
  35. 35
  36. 36
  37. 37
  38. 38
  39. 39
  40. 40
  41. 41
    XSTest 论文

    arxiv.org

  42. 42
  43. 43
  44. 44
    LongBench v2 官方页

    longbench2.github.io

  45. 45
  46. 46
    RULER 论文

    arxiv.org

  47. 47
  48. 48
    OpenAI MRCR 数据集

    huggingface.co

  49. 49
    NoLiMa 论文

    arxiv.org

  50. 50
  51. 51
  52. 52
  53. 53
  54. 54
    Qwen3 官方发布页

    qwenlm.github.io

  55. 55
  56. 56
  57. 57
  58. 58
  59. 59
    Gaia2 论文

    arxiv.org

  60. 60
  61. 61
  62. 62
  63. 63
  64. 64

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content