
AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?
一份截至 2026 年 7 月的 AI benchmark 地图:解释核心测试在测什么、任务长什么样,以及主流模型公开成绩为何不能简单排成一张总榜。
先看结论:Benchmark 不是一张总成绩单
截至 2026 年 7 月 20 日,主流模型的评测已经分成七条相互独立的能力线:通用知识与推理、数学、代码、Agent、视觉与视频、安全、长上下文。模型在其中一条线拿到高分,不等于它能在另一条线上稳定完成真实任务。
最容易误读的是「同名 benchmark 分数」。SWE-bench Verified 和 SWE-bench Pro 不是同一套题;MMMU 的 Val、Test 与 MMMU-Pro 也不是同一协议;AIME 的 pass@1、cons@64 和多次采样平均值更不能排在一列里。下面的数字只在评测版本、数据集切分、工具权限、推理预算和 agent scaffold 都接近时才适合横向比较。
这份基线盘点回答三个问题:每个核心 benchmark 在测什么,题目或任务长什么样,主流模型目前交出了什么成绩。数字旁边保留了原始论文、官方 model card 或官方项目页;第三方排行榜和 X 帖子只作为补充,并会标出它们的证据等级。
七条能力线速览
| 能力线 | 核心 benchmark | 题目 / 任务形态 | 主要看什么 |
|---|---|---|---|
| 通用知识与推理 | MMLU-Pro、GPQA Diamond、BBH、LiveBench | 多学科选择题、研究生级科学题、多步推理与客观问答 | 知识调用、复杂推理、抗污染能力 |
| 数学 | MATH-500、AIME、MathArena、OlymMATH | 竞赛数学题、整数答案、证明题、Lean 4 形式化证明 | 多步推导、精确计算、证明能力 |
| 代码 | HumanEval、MBPP、LiveCodeBench | 函数补全、竞赛编程题、代码执行与修复 | 代码正确性、算法能力、数据污染风险 |
| 软件工程 Agent | SWE-bench、SWE-bench Live/Pro、SWE-EVO、Terminal-Bench | 真实 GitHub issue、多文件演化、容器终端长任务 | 环境操作、定位问题、长期执行与回归测试 |
| 浏览与计算机使用 Agent | GAIA、BrowseComp、WebArena、OSWorld、τ²-bench | 网页搜索、浏览器 / 桌面操作、API 调用、状态达成 | 规划、工具调用、跨步骤可靠性 |
| 多模态 | MMMU、MMMU-Pro、MathVista、MMBench、Video-MME | 图表、地图、乐谱、数学图形、长视频问答 | 看图、读字、知识与视觉推理的联合能力 |
| 安全与长上下文 | SimpleSafetyTests、HarmBench、StrongREJECT、WildGuard、XSTest、LongBench v2、RULER、MRCR | 危害提示、越狱、过度拒答、长文检索、多针指代 | 风险边界、拒答质量、有效上下文长度 |
1. 通用知识与推理:从「会答题」到「能处理陌生问题」
MMLU-Pro:把普通选择题变成更难的综合考
MMLU-Pro 有约 12,000 道研究生级选择题,覆盖 14 个学科,并把原版 MMLU 的四选一扩展到十选一。它仍然像考试,但选项更多、干扰项更接近,题目也更依赖推理。论文报告,相比 MMLU,模型在 MMLU-Pro 上会下降约 16% 至 33%;这也是为什么它比原版 MMLU 更适合观察模型是否真的在分析题目,而不是靠熟悉的题型模式作答。1
任务例子可以抽象成:「给出一段专业问题和十个候选答案,选出正确项,并在需要时给出推导。」指标通常是准确率。它测的是知识和推理的混合物,不适合单独当作「纯知识分」或「纯推理分」。
GPQA Diamond:专家写给非专家也难以搜索的科学题
GPQA 包含生物、物理、化学领域的研究生级多选题,Diamond 子集是其中最难的 198 题。题目由领域专家编写,论文报告领域专家准确率约 65%,剔除自认错误后约 74%;高技能非专家即使允许自由上网,准确率也只有约 34%。它要测的不是背诵,而是把专业知识、公式和多步推理拼在一起。2
题目形态仍是选择题,但「搜索得到相关网页」不等于能作答。模型若只会检索关键词,往往能找到背景资料,却无法判断几个相近选项的关键差异。
BBH:23 个硬任务,适合看推理方法但已经偏饱和
BIG-Bench Hard 从 BIG-Bench 中挑出 23 个当时模型难以超过人类平均水平的任务,覆盖多步算术、逻辑、因果判断、对象追踪等类型。原论文的重点发现是,链式思考在部分任务上带来明显跃升。3
它的题目规模不大,当前前沿模型在不少子任务上已经超过 90%,所以 BBH 更适合作为历史基线,或观察「是否需要显式推理」的控制变量,不宜用来区分今天的顶级模型。
LiveBench:每月换题,专门对抗静态数据污染
LiveBench 按月更新题目,覆盖推理、数学、编程、语言、数据分析和指令遵循六类、18 项任务。题目来自最新竞赛、arXiv 论文、新闻和 IMDb 等来源,评分尽量采用有客观答案的自动评测,不依赖 LLM judge。4
它的任务长相不是固定的一种题型,而是一组会更新的客观问答。例如给一段新近论文或数据,要求模型计算、排序、抽取或按条件作答。阅读成绩时必须写清 release 日期,因为 2024 年 11 月版和之后的题池不是同一套考试,分数不能直接串成一条趋势线。
2. 数学:MATH-500 已接近天花板,AIME 与形式化证明更有区分度
MATH 与 MATH-500:经典竞赛数学基线
原始 MATH 有 12,500 道竞赛数学题,覆盖代数、几何、数论、计数与概率、预备代数和预备微积分,并附有逐步解答。MATH-500 是常被模型报告引用的 500 题子集,通常用 pass@1 准确率。5
典型任务是读一道完整的文字数学题,给出整数或最终表达式。它对早期模型很有区分力,但如今前沿模型在 MATH-500 上普遍接近 95% 以上。不同实现的题目子集、采样次数和答案归一化规则仍可能不同,不能只看一个百分比。
AIME:每年换题的整数答案竞赛
AIME 每套 30 题,答案是 000 到 999 的整数,涉及代数、几何、数论和组合。模型必须把多步推导压到一个精确整数,猜中并不代表过程可靠。MathArena 把 AIME、CMIMC、IMO 等新竞赛题接入实时评测,并指出 AIME 2024 已出现较强的污染迹象。67
公开成绩的差异往往来自评测协议:GPT-5 在 AIME 2025 的官方报告是 94.6%,标注为不使用工具;Grok 3 Think 的 93.3% 是 cons@64,即多次采样后取一致答案。两者都不能直接写成「谁高谁低」。89
OlymMATH:把数学答案推进到 Lean 4 证明
OlymMATH 收录 350 道奥数题,其中一部分采用自然语言数值答案,另一部分用 Lean 4 形式化验证。题目来自印刷出版物,并提供中英双语版本,目标是减少训练数据泄漏,同时把「答案对不对」和「证明能否被形式化检查」区分开。10
这类 benchmark 的任务不再只是「算出一个数」,而是要生成可被证明助手检查的证明脚本。它更接近研究型数学与形式化软件,但工程成本也更高,模型分数不宜和 AIME 的整数答案准确率放在同一张排行榜上。
3. 代码与软件工程:函数补全已经不够了
HumanEval / MBPP:仍有历史价值,区分力明显下降
HumanEval 有 164 个手写 Python 函数题,MBPP 约有 1,000 道入门级 Python 题,按生成代码能否通过测试来计算 pass@k。它们奠定了代码模型评测的基本形式:给函数签名和自然语言要求,输出可执行代码。1112
问题在于题目短、环境简单,而且已有较多数据泄漏证据。Web-Bench 论文报告,HumanEval 的 pass@1 已达到 99.4%、MBPP 达到 94.2%,所以它们今天更像回归测试,而不是前沿模型的有效分水岭。1314
LiveCodeBench:从最新竞赛题里抽题
LiveCodeBench 持续从 LeetCode、AtCoder 和 Codeforces 收集新题,覆盖代码生成、代码修复、代码执行和测试输出预测,并按 Easy、Medium、Hard 分层。题目来自模型训练截止时间之后的竞赛窗口,设计目标是降低污染。15
它的题型仍偏算法竞赛。2026 年 7 月的公开追踪数据中,Gemini 3 Pro Preview 约 91.7%、Gemini 3 Flash Preview 约 90.8%、DeepSeek V3.2 Speciale 约 89.6%、GPT-5.2 约 89.4%;这些数字来自第三方排行榜,必须同时核对 release 版本和题目窗口,不能把它们当作软件工程能力。16
SWE-bench:让模型真的修一个 GitHub issue
SWE-bench 的输入是真实开源项目中的 GitHub issue 和代码库,输出是跨文件 patch,再由项目测试套件验证。原始数据有 2,294 个问题,来自 12 个 Python 仓库;这比写一个孤立函数更接近工程师接单。17
SWE-bench Verified 是其中 500 个经人工检查的问题,指标通常是单次尝试的 Resolve Rate。SWE-bench Pro 与 Live 则试图缓解静态数据污染和题目可预测性。这里有一个必须记住的限制:分数是「模型 + 工具链 + agent scaffold」的结果。Claude Code、Codex CLI 和 SWE-agent 的文件检索、重试和测试策略不同,不能把它们的成绩当作裸模型能力。
以官方发布的不同协议为例,GPT-5 在 SWE-bench Verified 的固定验证子集上报告 74.9%;Claude Opus 4 在完整 500 题上报告 72.5%,高计算设置为 79.4%;Claude Sonnet 4 的高计算设置为 80.2%。题数、基础设施和计算预算都不同,这组数字只能说明模型处在同一问题族中,不能组成严格排名。818
SWE-EVO 与 Terminal-Bench:从「修一个 issue」走向长周期工作
SWE-EVO 把软件演化做成长期任务:48 个任务来自 7 个成熟 Python 项目的 release notes,平均每个任务要改 21 个文件、通过约 874 个测试。GPT-5.4 配合 OpenHands 在该设置下只有 25%,而同类模型在 SWE-bench Verified 上能超过 70%,差距说明单 issue 修复不能代表持续开发能力。19
Terminal-Bench 2.1 则把任务放到 Docker 终端环境,要求模型训练模型、调试系统、配置服务或完成其他长周期命令行工作。当前公开榜单中,Claude Code + Fable 5 的 resolve rate 为 83.8% ± 1.2%,Codex + GPT-5.5 为 83.1% ± 1.1%;这两个分数都包含 harness 的作用,并不是同一模型在同一 agent 框架下的对照实验。2021
4. Agent:最终状态比漂亮的对话更重要
GAIA:一个需要网页、文件和工具的真实问题
GAIA 有 466 个真实世界问题,分为三个难度等级,要求 Agent 组合推理、多模态理解、网页浏览和工具使用,最终答案通常按精确字符串核对。原始论文中,人类基线为 92%,GPT-4 加插件只有 15%。22
当前 Princeton HAL 榜单的一个快照中,Claude Sonnet 4.5 配合 HAL Generalist Agent 在 165 题公开验证集上为 74.55%,GPT-5 配合 HF Open Deep Research 为 62.80%。两者使用不同 scaffold,不能解读为模型本体的纯差距。23
BrowseComp:答案很短,搜索过程很长
BrowseComp 有 1,266 道开放互联网问题,答案短而容易验证,但需要 Agent 长时间搜索、交叉核对和拼接分散信息。它不像简单的网页问答,更接近「查清一个难搜的事实」。24
它目前缺少稳定、透明的公共 leaderboard,很多新分数来自厂商报告或 X 讨论。社区帖子曾报告 Claude Opus 4.6 在 BrowseComp 上 84.0%、GPT-5.4 为 82.7%,这类数字应当标为社区结果,等待模型厂商或独立评测复核。25
WebArena 与 OSWorld:操作网页和电脑,而不是描述操作步骤
WebArena 在自托管的电商、论坛、协作开发、内容管理和地图网站中布置 812 个长任务,模型需要真正点击、输入、导航并达到目标状态。原始论文中 GPT-4 的端到端成功率为 14.41%,人类为 78.24%。26
OSWorld 把环境扩展到真实桌面应用和文件系统,原始版本有 369 个任务,包含浏览器、办公软件和跨应用工作流。评测同样看最终状态,而不是语言回答;论文初始最佳模型成功率只有 12.24%,人类为 72.36%。27
OSWorld-Verified 与 OSWorld 2.0 已修订任务、验证器和长周期工作流。不同版本的成功率不能混写,尤其不能把原始版本与 Verified 版本的跃升简单写成「模型能力提升了多少」。
τ-bench / τ²-bench:客服场景里的工具调用和状态一致性
τ-bench 模拟零售和航空客服,模型要与用户多轮对话、调用数据库 API、遵守业务政策,并最终把共享世界状态改对。τ²-bench 进一步让 Agent 和用户都能操作状态,形成 dual-control 环境。2829
这类任务的好处是能暴露「说得很对,但没改对订单」的问题。缺点是指标和榜单协议差异很大:τ-bench 常报告 pass rate 或 pass^k,τ²-bench 也有 accuracy。GLM-5 的 89.7% accuracy 与 Claude Opus 4.5 的 79% pass rate 不能直接比较。30
5. 多模态:看见、读懂和推理必须同时成立
MMMU 与 MMMU-Pro:从大学知识题到「文字藏在图里」
MMMU 有约 11,500 道大学水平、多学科多模态题,覆盖 30 个科目和 183 个子领域,图片类型包括图表、地图、表格、乐谱和化学结构。题目既有选择题,也有开放问答,测的是视觉感知、专业知识和推理的联合作用。31
MMMU-Pro 是更鲁棒的改版:过滤掉纯文本就能答的题目,把选项扩展到十个,并加入 vision-only 设定,把问题文字也放进图片里。论文报告,模型在 MMMU-Pro 上的准确率会掉到约 16.8% 至 26.9% 的区间,说明「文字模型先答一遍,再把图像当作辅助」的策略并不等于真正的图文整合。32
MMMU 初版验证集上,GPT-4V 约 56%,人类专家约 82%;后来第三方榜单上的 GPT-5.5、Gemini 3.1 Pro 等 83% 左右的成绩来自不同评测管道,不能与初版数字排在同一列。MMMU 原作者在 X 上发布过项目公告,可作为追踪论文和榜单更新的入口。33
MathVista:把数学题放进图表、几何图和函数图像
MathVista 有 6,141 道题,来自 28 个既有多模态数学数据集和 3 个新数据集,覆盖代数、算术、几何、逻辑、数值、科学和统计。任务包括图形问答、几何求解、数学应用题、教材问答和视觉问答,既有开放题也有选择题。34
GPT-4V 在论文初版 test 集约 49.9%,GPT-4o 在后续榜单显示约 63.8%,但 testmini 与 test 的答案公开状态不同,评测 prompt 和实现也可能不同。MathVista 的价值不在于给模型一个单独的「视觉数学总分」,而在于拆出它究竟是读不清图,还是读清了图却不会做数学。
MMBench:把视觉能力拆成 20 个维度
MMBench 是中英双语的多模态选择题基准,包含 OCR、空间推理、属性比较等 20 个能力维度,并通过 CircularEval 把自由形式输出转换成预定义选项。它适合看视觉语言模型的能力剖面,而不是只报一个总分。35
当前实际评测常通过 OpenCompass 的 VLMEvalKit 运行。官网入口和版本需要核对,MMBench、MMBench-Video 与后续 Live 版本不能混为一个名字。
Video-MME:从短视频到一小时视频
Video-MME 有 900 个视频、约 254 小时素材和 2,700 个问答,覆盖 6 个大领域、30 个子领域,视频长度从 11 秒到 1 小时。输入可以组合视频帧、字幕和音频,问题要求模型理解事件、时序和声音信息。36
论文初版在带字幕设定下,Gemini 1.5 Pro 为 75.0%,GPT-4o 为 71.9%,GPT-4V 为 59.5%。这组数字属于 2024 年的论文协议,Video-MME-v2 等新版本已经改变评测范围,不能用来代表 2026 年模型的现状。
6. 安全:低分不一定坏,高分也不一定安全
安全 benchmark 没有统一总分。拒答率、攻击成功率、危害响应率、过度拒答率和安全知识准确率回答的是不同问题。
| benchmark | 测什么 | 任务形态与指标 |
|---|---|---|
| SimpleSafetyTests | 关键危害的快速筛查 | 100 条提示,覆盖儿童伤害、自残、诈骗、非法物品和身体伤害;看不安全响应率。37 |
| HarmBench | 红队攻击方法和模型防御 | 约 400 条行为测试,比较攻击方法对目标模型的成功率,核心指标是 ASR。38 |
| StrongREJECT | 越狱响应是否真的提供了有害帮助 | 由自动评估器判断回答的危害性与有用程度,重点是纠正字符串匹配对越狱成功率的高估。39 |
| WildGuard / WildGuardMix | 提示是否恶意、回答是否危险、模型是否拒答 | 92K 多任务标注样本和 5K 测试集,覆盖 13 类风险。40 |
| XSTest | 模型是否把安全请求也拒绝了 | 250 条安全提示和 200 条不安全提示,观察 Full Refusal Rate 与 Partial Refusal Rate。41 |
| SafetyBench | 安全知识与判断 | 11,435 道中英双语多选题,覆盖 7 类安全问题,指标是准确率。42 |
| CyberSecEval | 网络安全代码风险、攻击请求遵从、prompt injection 等 | Meta Purple Llama 系列持续迭代,v1、v2、v3 的覆盖维度不同,不可跨版本直比。43 |
例如 XSTest 的低拒答率可能说明模型不容易过度拒绝,也可能意味着它在某些边界上更宽松;HarmBench 的低 ASR 说明攻击方法没有让模型产生目标行为,但不等于模型在所有风险领域都安全。模型卡若只给一张安全总表,读者应继续追问数据集、攻击者、评估器和失败案例。
7. 长上下文:上下文窗口多大,不等于有效记忆多大
LongBench v2:深度理解,不只是大海捞针
LongBench v2 有 503 道多选题,上下文长度从 8K 到 2M words,覆盖 6 大任务类别。题目要求从长文档中抽取分散信息并完成深度理解与推理。论文报告,人类专家在 15 分钟限时下为 53.7%;直接回答的最强模型为 50.1%,o1-preview 结合更长推理达到 57.7%。4445
官方页面的一个带 CoT 快照中,Gemini 2.5 Pro 为 63.3%、Gemini 2.5 Flash 为 62.1%、Qwen3-235B-A22B-Thinking 为 60.6%。阅读时要区分 w/ CoT 与 w/o CoT,也要记住不同长度子集的题目分布不一样。
RULER:把「有效长度」拉出来单独测
RULER 是可配置的合成长上下文压力测试,包含检索、多跳追踪、聚合和问答四类、13 项任务。它可以改变序列长度、needle 数量和任务复杂度,因此比只测一个固定的 NIAH 大海捞针更能观察模型在上下文变长后的退化。4647
任务例子是把一个或多个关键信息埋在大段干扰文本里,要求模型返回指定信息、聚合多个位置的数字,或完成多跳关系。评测结果高度依赖 haystack、needle 数量和长度配置,所以只能在同一配置下比较。
MRCR 与 NoLiMa:难点从「找原句」变成「找对那个原句」
MRCR 让模型在多轮合成对话里面对多个相似的写作请求,再按要求返回第 2 个、第 4 个或第 8 个实例,考的是多针检索和指代消解。OpenAI 的公开数据集有 2,400 个样本,长度分桶从 4K 到 1M tokens。48
NoLiMa 则把 needle 和上下文的字面重叠尽量降到最低,避免模型只靠关键词匹配。论文测试了 13 个声称支持至少 128K 上下文的模型,发现 GPT-4o 在短上下文为 99.3%,到 32K 时降至 69.7%。这类结果提醒我们,厂商写在规格页上的 context window 是最大输入长度,不是每种任务都能稳定利用的有效长度。49
8. 主流模型当前表现:能放在一起看的,只有一部分
下面这张表只放本轮读到的官方发布页、model card 或原始技术报告中的数字。没有公开精确分数的厂商,不用第三方推断补齐。
| 厂商与模型 | 已公开的代表分数 | 评测设置与读法 |
|---|---|---|
| OpenAI GPT-5 | AIME 2025 94.6%;SWE-bench Verified 74.9%;MMMU 84.2%;GPT-5 Pro GPQA Diamond 88.4%。 | AIME 标为不使用工具;SWE 使用固定 477 题子集,不能直接和 500 题结果比较。8 |
| OpenAI GPT-5.6 Sol | GPQA Diamond 94.6%;SWE-bench Pro 64.6%;Terminal-Bench 2.1 88.8%;MMMU-Pro 83.0%(无工具);MRCR v2 8-needle 256K–512K 91.5%。 | 页面使用 max reasoning effort;Ultra 还使用 4-agent 并行,不能与普通单模型结果混排。50 |
| Anthropic Claude Opus 4 / Sonnet 4 | SWE-bench Verified 高计算设置分别为 79.4% / 80.2%;GPQA Diamond 无 extended thinking 为 74.9% / 70.0%;MMMU 为 73.7% / 72.6%。 | 发布页同时给出 extended thinking 与非 extended thinking,AIME 无 extended thinking 仅 33.9% / 33.1%,不要和推理模式成绩混用。18 |
| Google Gemini 3.5 Flash / 3.1 Pro | Flash:Terminal-Bench 2.1 76.2%、SWE-bench Pro 55.1%、MMMU-Pro 83.6%、MRCR v2 128K 平均 77.3%;Pro:Terminal-Bench 70.3%、SWE-bench Pro 54.2%、MMMU-Pro 80.5%。 | 使用 Terminus-2 harness 的 Terminal-Bench;MRCR 还有 1M pointwise 结果,不能与 128K 平均值混看。51 |
| Meta Llama 4 | 公开页确认 Behemoth 在 MATH-500、GPQA Diamond 上超过页面列出的 GPT-4.5、Claude Sonnet 3.7、Gemini 2.0 Pro;Maverick 强调多模态、代码和长上下文;Scout 标注 10M context。 | 关键 benchmark 表以图片发布,本轮没有从文字证据提取出可复核的精确数字,因此不把宣传性比较改写成百分比。52 |
| DeepSeek-V3 | MMLU 88.5%;MMLU-Pro 75.9%;GPQA Diamond 59.1%;MATH-500 报告为超过 o1-preview。 | 技术报告以 pass@1 为主,且比较对象区分 long-CoT 与非 long-CoT;没有把不同推理预算的成绩混在一起。53 |
| Qwen3 | 官方页明确列出 ArenaHard、AIME'24/25、LiveCodeBench、CodeForces、Aider、LiveBench、BFCL、MultiIF、GPQA 等对比维度。 | 具体对比表主要以图片发布,本轮不从图片描述反推精确数字;Qwen3 同时有 Thinking 和 Non-Thinking 模式,模式必须随分数记录。54 |
| Mistral Large 3 / Ministral 3 | 官方页文字确认 Ministral 3 14B reasoning variant 在 AIME'25 为 85%;Large 3 与 DeepSeek-V3、Kimi-K2 对比 GPQA、MMMU、SimpleQA、AMC、LiveCodeBench。 | 其余大量数字在图表图片中,本轮不把图表中的模糊比较转成精确榜单。55 |
| xAI Grok 3 | Grok 3 Beta:AIME'24 52.2%、GPQA Diamond 75.4%、MMLU-Pro 79.9%、MMMU 73.2%;Grok 3 Think:AIME'25 93.3%(cons@64)、GPQA 84.6%、LiveCodeBench 79.4%。 | Think 与非 Think 是两个不同模式;AIME 的 cons@64 也不能和 pass@1 直接相比。9 |
这张表有一个刻意保留的空白:Anthropic 的 Fable 5 / Mythos 5、xAI 的 Grok 4 / 4.5 等新型号,部分成绩只出现在其他厂商的对比表、社区榜单或图片里。它们可以作为发现线索,不能在没有直接 model card 或可复核评测设置时冒充厂商自报成绩。5657
9. 近一年新 benchmark 在测什么
新 benchmark 的共同方向很清楚:旧题集更容易饱和,真实工作更长、更开放,也更容易发生污染。
- RiddleBench 用 1,737 个英语谜题考逻辑、空间感知和约束满足;论文报告顶级模型准确率约 60% 至 63%,并观察到模型会接受其他模型的错误推理。58
- Gaia2 让环境独立于 Agent 动作继续演化,加入时间约束、噪声和协作;论文中的 GPT-5 high 最高为 42% pass@1,时间敏感任务仍容易失败。59
- SkillsBench 用 87 个任务和 18 组 model-harness 配置测 Agent Skills 是否真的有用;Curated Skills 把平均通过率从 33.9% 提升到 50.5%。60
- LoCoBench 把代码上下文从 10K 拉到 1M tokens,覆盖跨文件重构、bug 调查、集成测试和安全分析,说明「能写函数」与「能理解整个仓库」之间仍有距离。61
- SafeSearch 把红队工作放进搜索 Agent,测试间接 prompt injection、误信息等风险;它提醒人们,模型一旦能浏览互联网,安全问题就不再只发生在输入框里。62
X / Twitter 适合发现这类新评测的发布瞬间:作者会先贴出论文、代码仓库、leaderboard 或首轮结果;但单条帖子通常不能替代原始论文和可复现评测。近期 X 上关于 Kimi K3、Grok 4.5 的 benchmark 数字,就是「发布方或社区先报分,独立验证随后跟进」的典型,应该分别记录为 vendor-reported 或 community-reported,而不是直接写成最终排名。6364
10. 读一张 benchmark 表时,先检查这六项
- 版本:MMLU-Pro、MMMU-Pro、SWE-bench Pro、MRCR v1/v2 都不是原版 benchmark 的同义词。
- 数据切分:Val、Test、testmini、公开验证集和隐藏测试集要分开写。
- 推理预算:是否启用 thinking、CoT、cons@64、max reasoning effort,直接改变结果。
- 工具与 scaffold:工具、浏览器、终端、检索、代码执行和重试次数是否一致。
- 指标:accuracy、pass@1、pass^k、resolve rate、ASR、refusal rate 和 judge score 不在同一尺度上。
- 发布时间与污染:静态旧题的高分可能包含训练数据记忆;新题、滚动题池和 canary 只能降低风险,不能自动证明没有污染。
因此,模型目前的真实状态不是「谁的总分最高」,而是几张不同形状的能力地图:GPT-5.6 Sol 在 GPQA、Terminal-Bench 和 MRCR 的官方数字很强,Gemini 3.5 Flash 在多模态和部分 Agent 评测上有竞争力,DeepSeek-V3 仍提供了开源模型在 MMLU-Pro 和 GPQA 上的明确基线,Claude 4 的软件工程成绩依赖高计算设置,Qwen3、Llama 4 和 Mistral 3 的不少关键结果仍需要直接读取图表或复现实验。把协议一起写出来,排行榜才有意义。
References
- 1MMLU-Pro 原始论文
- 2GPQA 原始论文
- 3BIG-Bench Hard 原始论文
- 4LiveBench 论文
- 5MATH 原始论文
- 6MathArena 实时数学评测
- 7MathArena 论文
- 8OpenAI GPT-5 发布页
- 9xAI Grok 3 发布页
- 10OlymMATH 论文
- 11HumanEval 论文
- 12MBPP 论文
- 13代码评测数据泄漏研究
- 14Web-Bench 论文
- 15LiveCodeBench 论文
- 16LiveCodeBench 公开追踪榜
- 17SWE-bench 原始论文
- 18Anthropic Claude 4 发布页
- 19SWE-EVO 论文
- 20Terminal-Bench 论文
- 21Terminal-Bench 2.1 榜单
- 22GAIA 论文
- 23HAL GAIA 榜单
- 24BrowseComp 论文
- 25X 上的 BrowseComp 结果讨论
- 26WebArena 论文
- 27OSWorld 论文
- 28τ-bench 论文
- 29τ²-bench 论文
- 30τ²-bench 公开追踪榜
- 31MMMU 论文
- 32MMMU-Pro 论文
- 33MMMU 作者的 X 公告
- 34MathVista 论文
- 35MMBench 论文
- 36Video-MME 论文
- 37SimpleSafetyTests 论文
- 38HarmBench 论文
- 39StrongREJECT 论文
- 40WildGuard 论文
- 41XSTest 论文
- 42SafetyBench 论文
- 43CyberSecEval 3 论文
- 44LongBench v2 官方页
- 45LongBench v2 论文
- 46RULER 论文
- 47NVIDIA RULER 项目
- 48OpenAI MRCR 数据集
- 49NoLiMa 论文
- 50GPT-5.6 发布页
- 51Google DeepMind Gemini 模型页
- 52Llama 4 官方发布页
- 53DeepSeek-V3 技术报告
- 54Qwen3 官方发布页
- 55Mistral 3 官方发布页
- 56Anthropic Fable 5 / Mythos 5 系统卡
- 57Grok 4 官方发布页
- 58RiddleBench 论文
- 59Gaia2 论文
- 60SkillsBench 论文
- 61LoCoBench 论文
- 62SafeSearch 论文
- 63Kimi K3 benchmark 讨论
- 64Grok 4.5 benchmark 讨论
Related content
- Sign in to comment.
