
AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?
一份截至 2026 年 7 月的 AI benchmark 地图:解释核心测试在测什么、任务长什么样,以及主流模型公开成绩为何不能简单排成一张总榜。
先看结论:Benchmark 不是一张总成绩单
七条能力线速览
| 能力线 | 核心 benchmark | 题目 / 任务形态 | 主要看什么 |
|---|---|---|---|
| 通用知识与推理 | MMLU-Pro、GPQA Diamond、BBH、LiveBench | 多学科选择题、研究生级科学题、多步推理与客观问答 | 知识调用、复杂推理、抗污染能力 |
| 数学 | MATH-500、AIME、MathArena、OlymMATH | 竞赛数学题、整数答案、证明题、Lean 4 形式化证明 | 多步推导、精确计算、证明能力 |
| 代码 | HumanEval、MBPP、LiveCodeBench | 函数补全、竞赛编程题、代码执行与修复 | 代码正确性、算法能力、数据污染风险 |
| 软件工程 Agent | SWE-bench、SWE-bench Live/Pro、SWE-EVO、Terminal-Bench | 真实 GitHub issue、多文件演化、容器终端长任务 | 环境操作、定位问题、长期执行与回归测试 |
| 浏览与计算机使用 Agent | GAIA、BrowseComp、WebArena、OSWorld、τ²-bench | 网页搜索、浏览器 / 桌面操作、API 调用、状态达成 | 规划、工具调用、跨步骤可靠性 |
| 多模态 | MMMU、MMMU-Pro、MathVista、MMBench、Video-MME | 图表、地图、乐谱、数学图形、长视频问答 | 看图、读字、知识与视觉推理的联合能力 |
| 安全与长上下文 | SimpleSafetyTests、HarmBench、StrongREJECT、WildGuard、XSTest、LongBench v2、RULER、MRCR | 危害提示、越狱、过度拒答、长文检索、多针指代 | 风险边界、拒答质量、有效上下文长度 |
1. 通用知识与推理:从「会答题」到「能处理陌生问题」
MMLU-Pro:把普通选择题变成更难的综合考
GPQA Diamond:专家写给非专家也难以搜索的科学题
BBH:23 个硬任务,适合看推理方法但已经偏饱和
LiveBench:每月换题,专门对抗静态数据污染
2. 数学:MATH-500 已接近天花板,AIME 与形式化证明更有区分度
MATH 与 MATH-500:经典竞赛数学基线
AIME:每年换题的整数答案竞赛
OlymMATH:把数学答案推进到 Lean 4 证明
3. 代码与软件工程:函数补全已经不够了
HumanEval / MBPP:仍有历史价值,区分力明显下降
LiveCodeBench:从最新竞赛题里抽题
SWE-bench:让模型真的修一个 GitHub issue
SWE-EVO 与 Terminal-Bench:从「修一个 issue」走向长周期工作
4. Agent:最终状态比漂亮的对话更重要
GAIA:一个需要网页、文件和工具的真实问题
BrowseComp:答案很短,搜索过程很长
WebArena 与 OSWorld:操作网页和电脑,而不是描述操作步骤
τ-bench / τ²-bench:客服场景里的工具调用和状态一致性
5. 多模态:看见、读懂和推理必须同时成立
MMMU 与 MMMU-Pro:从大学知识题到「文字藏在图里」
MathVista:把数学题放进图表、几何图和函数图像
MMBench:把视觉能力拆成 20 个维度
Video-MME:从短视频到一小时视频
6. 安全:低分不一定坏,高分也不一定安全
| benchmark | 测什么 | 任务形态与指标 |
|---|---|---|
| SimpleSafetyTests | 关键危害的快速筛查 | 100 条提示,覆盖儿童伤害、自残、诈骗、非法物品和身体伤害;看不安全响应率。37 |
| HarmBench | 红队攻击方法和模型防御 | 约 400 条行为测试,比较攻击方法对目标模型的成功率,核心指标是 ASR。38 |
| StrongREJECT | 越狱响应是否真的提供了有害帮助 | 由自动评估器判断回答的危害性与有用程度,重点是纠正字符串匹配对越狱成功率的高估。39 |
| WildGuard / WildGuardMix | 提示是否恶意、回答是否危险、模型是否拒答 | 92K 多任务标注样本和 5K 测试集,覆盖 13 类风险。40 |
| XSTest | 模型是否把安全请求也拒绝了 | 250 条安全提示和 200 条不安全提示,观察 Full Refusal Rate 与 Partial Refusal Rate。41 |
| SafetyBench | 安全知识与判断 | 11,435 道中英双语多选题,覆盖 7 类安全问题,指标是准确率。42 |
| CyberSecEval | 网络安全代码风险、攻击请求遵从、prompt injection 等 | Meta Purple Llama 系列持续迭代,v1、v2、v3 的覆盖维度不同,不可跨版本直比。43 |
7. 长上下文:上下文窗口多大,不等于有效记忆多大
LongBench v2:深度理解,不只是大海捞针
RULER:把「有效长度」拉出来单独测
MRCR 与 NoLiMa:难点从「找原句」变成「找对那个原句」
8. 主流模型当前表现:能放在一起看的,只有一部分
| 厂商与模型 | 已公开的代表分数 | 评测设置与读法 |
|---|---|---|
| OpenAI GPT-5 | AIME 2025 94.6%;SWE-bench Verified 74.9%;MMMU 84.2%;GPT-5 Pro GPQA Diamond 88.4%。 | AIME 标为不使用工具;SWE 使用固定 477 题子集,不能直接和 500 题结果比较。8 |
| OpenAI GPT-5.6 Sol | GPQA Diamond 94.6%;SWE-bench Pro 64.6%;Terminal-Bench 2.1 88.8%;MMMU-Pro 83.0%(无工具);MRCR v2 8-needle 256K–512K 91.5%。 | 页面使用 max reasoning effort;Ultra 还使用 4-agent 并行,不能与普通单模型结果混排。50 |
| Anthropic Claude Opus 4 / Sonnet 4 | SWE-bench Verified 高计算设置分别为 79.4% / 80.2%;GPQA Diamond 无 extended thinking 为 74.9% / 70.0%;MMMU 为 73.7% / 72.6%。 | 发布页同时给出 extended thinking 与非 extended thinking,AIME 无 extended thinking 仅 33.9% / 33.1%,不要和推理模式成绩混用。18 |
| Google Gemini 3.5 Flash / 3.1 Pro | Flash:Terminal-Bench 2.1 76.2%、SWE-bench Pro 55.1%、MMMU-Pro 83.6%、MRCR v2 128K 平均 77.3%;Pro:Terminal-Bench 70.3%、SWE-bench Pro 54.2%、MMMU-Pro 80.5%。 | 使用 Terminus-2 harness 的 Terminal-Bench;MRCR 还有 1M pointwise 结果,不能与 128K 平均值混看。51 |
| Meta Llama 4 | 公开页确认 Behemoth 在 MATH-500、GPQA Diamond 上超过页面列出的 GPT-4.5、Claude Sonnet 3.7、Gemini 2.0 Pro;Maverick 强调多模态、代码和长上下文;Scout 标注 10M context。 | 关键 benchmark 表以图片发布,本轮没有从文字证据提取出可复核的精确数字,因此不把宣传性比较改写成百分比。52 |
| DeepSeek-V3 | MMLU 88.5%;MMLU-Pro 75.9%;GPQA Diamond 59.1%;MATH-500 报告为超过 o1-preview。 | 技术报告以 pass@1 为主,且比较对象区分 long-CoT 与非 long-CoT;没有把不同推理预算的成绩混在一起。53 |
| Qwen3 | 官方页明确列出 ArenaHard、AIME'24/25、LiveCodeBench、CodeForces、Aider、LiveBench、BFCL、MultiIF、GPQA 等对比维度。 | 具体对比表主要以图片发布,本轮不从图片描述反推精确数字;Qwen3 同时有 Thinking 和 Non-Thinking 模式,模式必须随分数记录。54 |
| Mistral Large 3 / Ministral 3 | 官方页文字确认 Ministral 3 14B reasoning variant 在 AIME'25 为 85%;Large 3 与 DeepSeek-V3、Kimi-K2 对比 GPQA、MMMU、SimpleQA、AMC、LiveCodeBench。 | 其余大量数字在图表图片中,本轮不把图表中的模糊比较转成精确榜单。55 |
| xAI Grok 3 | Grok 3 Beta:AIME'24 52.2%、GPQA Diamond 75.4%、MMLU-Pro 79.9%、MMMU 73.2%;Grok 3 Think:AIME'25 93.3%(cons@64)、GPQA 84.6%、LiveCodeBench 79.4%。 | Think 与非 Think 是两个不同模式;AIME 的 cons@64 也不能和 pass@1 直接相比。9 |
9. 近一年新 benchmark 在测什么
- RiddleBench 用 1,737 个英语谜题考逻辑、空间感知和约束满足;论文报告顶级模型准确率约 60% 至 63%,并观察到模型会接受其他模型的错误推理。58
- Gaia2 让环境独立于 Agent 动作继续演化,加入时间约束、噪声和协作;论文中的 GPT-5 high 最高为 42% pass@1,时间敏感任务仍容易失败。59
- SkillsBench 用 87 个任务和 18 组 model-harness 配置测 Agent Skills 是否真的有用;Curated Skills 把平均通过率从 33.9% 提升到 50.5%。60
- LoCoBench 把代码上下文从 10K 拉到 1M tokens,覆盖跨文件重构、bug 调查、集成测试和安全分析,说明「能写函数」与「能理解整个仓库」之间仍有距离。61
- SafeSearch 把红队工作放进搜索 Agent,测试间接 prompt injection、误信息等风险;它提醒人们,模型一旦能浏览互联网,安全问题就不再只发生在输入框里。62
10. 读一张 benchmark 表时,先检查这六项
- 版本:MMLU-Pro、MMMU-Pro、SWE-bench Pro、MRCR v1/v2 都不是原版 benchmark 的同义词。
- 数据切分:Val、Test、testmini、公开验证集和隐藏测试集要分开写。
- 推理预算:是否启用 thinking、CoT、cons@64、max reasoning effort,直接改变结果。
- 工具与 scaffold:工具、浏览器、终端、检索、代码执行和重试次数是否一致。
- 指标:accuracy、pass@1、pass^k、resolve rate、ASR、refusal rate 和 judge score 不在同一尺度上。
- 发布时间与污染:静态旧题的高分可能包含训练数据记忆;新题、滚动题池和 canary 只能降低风险,不能自动证明没有污染。
References
- 1MMLU-Pro 原始论文
arxiv.org
- 2GPQA 原始论文
arxiv.org
- 3BIG-Bench Hard 原始论文
arxiv.org
- 4LiveBench 论文
arxiv.org
- 5MATH 原始论文
arxiv.org
- 6MathArena 实时数学评测
matharena.ai
- 7MathArena 论文
arxiv.org
- 8OpenAI GPT-5 发布页
openai.com
- 9xAI Grok 3 发布页
x.ai
- 10OlymMATH 论文
arxiv.org
- 11HumanEval 论文
arxiv.org
- 12MBPP 论文
arxiv.org
- 13代码评测数据泄漏研究
arxiv.org
- 14Web-Bench 论文
arxiv.org
- 15LiveCodeBench 论文
arxiv.org
- 16LiveCodeBench 公开追踪榜
pricepertoken.com
- 17SWE-bench 原始论文
arxiv.org
- 18Anthropic Claude 4 发布页
anthropic.com
- 19SWE-EVO 论文
arxiv.org
- 20Terminal-Bench 论文
arxiv.org
- 21Terminal-Bench 2.1 榜单
tbench.ai
- 22GAIA 论文
arxiv.org
- 23HAL GAIA 榜单
hal.cs.princeton.edu
- 24BrowseComp 论文
arxiv.org
- 25X 上的 BrowseComp 结果讨论
x.com
- 26WebArena 论文
arxiv.org
- 27OSWorld 论文
arxiv.org
- 28τ-bench 论文
arxiv.org
- 29τ²-bench 论文
arxiv.org
- 30τ²-bench 公开追踪榜
codesota.com
- 31MMMU 论文
arxiv.org
- 32MMMU-Pro 论文
arxiv.org
- 33MMMU 作者的 X 公告
x.com
- 34MathVista 论文
arxiv.org
- 35MMBench 论文
arxiv.org
- 36Video-MME 论文
arxiv.org
- 37SimpleSafetyTests 论文
arxiv.org
- 38HarmBench 论文
arxiv.org
- 39StrongREJECT 论文
arxiv.org
- 40WildGuard 论文
arxiv.org
- 41XSTest 论文
arxiv.org
- 42SafetyBench 论文
arxiv.org
- 43CyberSecEval 3 论文
arxiv.org
- 44LongBench v2 官方页
longbench2.github.io
- 45LongBench v2 论文
arxiv.org
- 46RULER 论文
arxiv.org
- 47NVIDIA RULER 项目
github.com
- 48OpenAI MRCR 数据集
huggingface.co
- 49NoLiMa 论文
arxiv.org
- 50GPT-5.6 发布页
openai.com
- 51Google DeepMind Gemini 模型页
deepmind.google
- 52Llama 4 官方发布页
ai.meta.com
- 53DeepSeek-V3 技术报告
arxiv.org
- 54Qwen3 官方发布页
qwenlm.github.io
- 55Mistral 3 官方发布页
mistral.ai
- 56Anthropic Fable 5 / Mythos 5 系统卡
www-cdn.anthropic.com
- 57Grok 4 官方发布页
x.ai
- 58RiddleBench 论文
arxiv.org
- 59Gaia2 论文
arxiv.org
- 60SkillsBench 论文
arxiv.org
- 61LoCoBench 论文
arxiv.org
- 62SafeSearch 论文
arxiv.org
- 63Kimi K3 benchmark 讨论
x.com
- 64
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
