
DeepSeek-V4-Pro GA:官方 Benchmark 横向对比
DeepSeek-V4-Pro GA 相比预览版在 10 项官方 benchmark 上全面抬升,并在多项工程与自动化任务中进入第一梯队;本文完整转录官方对照表,保留未披露项并说明 HLE、工具配置与峰谷价格口径。
8 月 13 日,DeepSeek 将 V4-Pro 从预览版推到 GA。官方横向表显示,V4-Pro-0813 在这张表覆盖的 10 个项目中,相比 V4-Pro-Preview 的已披露分数全部上升;其中 Terminal Bench 2.1、NL2Repo、Cybergym 和 AutomationBench Public 已高于其他列出的对照模型。它仍不是所有项目的第一名:HLE、DeepSWE、Toolathlon-Verified、Agents' Last Exam 和两项 DSBench 上,Kimi-K3、Opus-4.8 或 Fable 5 仍有更高分。1
这组结果更像一张分化的能力画像:GA 版对自己的预览版完成了一次大幅抬升,在工程和代理任务上进入第一梯队;但跨 benchmark 直接排一个总名次,既不符合官方表,也会把不同工具和评测设置混在一起。
发布信息与可用范围
官方发布页把本次版本写作 DeepSeek-V4-Pro GA,并同时介绍 V4-Flash。V4-Pro 已可在 DeepSeek 网页和 App 的「Expert Mode」中使用,也可通过 API 调用。发布页还称,V4-Pro 与 V4-Flash 支持可调 reasoning effort:简单任务可以使用较低档,复杂任务使用更高档;V4 系列支持 OpenAI Responses API,并针对 Codex 做了适配。1
API 名称方面,页面只说明模型名称保持不变;价格图列出的型号名是
DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。页面没有在这次公告中另列 endpoint 名称,因此这里不把名称扩展成额外的 API 路径。全量 Benchmark 横向对照
下表把官方图片中的 10 行、8 列完整转录为一张表。HLE 的单元格格式是「无工具 / 有工具」;其他项目按官方图中的单值保留。每一行最高值加粗。空白表示官方这张表没有披露该模型在该项目上的数值,不代表 0。
| Benchmark | DeepSeek-V4-Pro-0813 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro-Preview | DeepSeek-V4-Flash-Preview | GLM-5.2 | Kimi-K3 | Opus-4.8 | Fable 5(含 fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE(无工具 / 有工具)1 | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | 34.8 / 45.1 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.11 | 87.9 | 82.7 | 72.1 | 61.8 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo1 | 61.5 | 54.2 | 38.5 | 39.4 | 48.9 | 69.7 | ||
| Cybergym1 | 83.3 | 76.7 | 52.7 | 38.7 | 80.0 | 78.3 | 83.1 | |
| DeepSWE1 | 62.7 | 54.4 | 12.8 | 7.3 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified1 | 74.1 | 70.3 | 55.9 | 49.7 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents' Last Exam1 | 25.7 | 25.2 | 16.5 | 15.8 | 23.8 | 27.6 | 25.7 | |
| AutomationBench(Public)1 | 31.8 | 25.1 | 12.8 | 10.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack1 | 71.1 | 68.7 | 41.8 | 37.0 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard1 | 67.2 | 59.6 | 31.1 | 25.8 | 54.5 | 63.0 | 71.7 | 68.3 |
三个读表结论
相对预览版,GA 版的提升不是单点修补
V4-Pro-0813 在官方表中的 10 个项目都高于 V4-Pro-Preview。提升最明显的几行是 DeepSWE,从 12.8 升到 62.7;DSBench-FullStack,从 41.8 升到 71.1;DSBench-Hard,从 31.1 升到 67.2;AutomationBench Public,从 12.8 升到 31.8。Terminal Bench 2.1 也从 72.1 升到 87.9,NL2Repo 从 38.5 升到 61.5。1
这说明 GA 版相对旧预览版的变化,主要体现在多步工程任务、代码仓库修改、自动化和代理任务上,而不是只在某一个 benchmark 上刷高分。这里的结论仍限于官方表中这 10 个项目,不能外推成所有公开评测都同步提升。
工程任务领先,HLE 与长链路代理仍有对手
V4-Pro-0813 在 Terminal Bench 2.1 上拿到 87.9,低于 Kimi-K3 的 88.3 和 Fable 5 的 88.0,但高于 Opus-4.8 的 85.0。它在 NL2Repo 的 61.5、Cybergym 的 83.3 和 AutomationBench Public 的 31.8 则是这几行中最高的已披露值。1
另一边,HLE 的无工具 / 有工具分数是 42.7 / 60.0,Fable 5 为 53.3 / 63.0,Opus-4.8 为 49.8 / 57.9。DeepSWE 上,Fable 5 的 70.0 和 Kimi-K3 的 67.5 也高于 V4-Pro 的 62.7。Toolathlon-Verified、Agents' Last Exam、DSBench-FullStack 和 DSBench-Hard 的最高值同样分别落在 Fable 5、Kimi-K3、Fable 5 和 Opus-4.8。1
因此,比较 V4-Pro 时最稳妥的说法是「工程和自动化任务的竞争力明显增强」,而不是「全面超过其他旗舰」。
V4-Flash 的位置也被官方表明确标出来了
V4-Flash-0731 在大多数行低于 V4-Pro-0813,但仍高于两列 Preview。例如它在 Terminal Bench 2.1 上为 82.7,在 Cybergym 上为 76.7,在 DSBench-FullStack 上为 68.7;对应的 V4-Pro-Preview 是 72.1、52.7 和 41.8。1
V4-Flash 也不是简单的「低一档版本」:在 Agents' Last Exam 上,它以 25.2 高于 GLM-5.2 的 23.8,且接近 V4-Pro 的 25.7。读者如果关心吞吐和成本,应该把 Flash 与 Pro 的价格、任务类型和具体 benchmark 放在一起看,而不是只看模型名中的 Pro 或 Flash。
API 价格:峰谷价从 8 月 17 日 00:00(北京时间)起生效
官方价格图给出的新价格如下。输入分成缓存命中和缓存未命中,输出单独计价,单位都是美元 / 百万 token。1
| 模型 | 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|---|
| DeepSeek-V4-Flash 1 | 非峰 | $0.007 | $0.22 | $0.66 |
| DeepSeek-V4-Flash 1 | 峰时段 | $0.014 | $0.44 | $1.32 |
| DeepSeek-V4-Pro 1 | 非峰 | $0.022 | $0.66 | $1.98 |
| DeepSeek-V4-Pro 1 | 峰时段 | $0.044 | $1.32 | $3.96 |
按价格图计算,V4-Pro 的峰时段价格正好是非峰价格的两倍,V4-Flash 也是如此。实际账单还取决于缓存命中率、输入输出 token 数和调用发生的时间;这组价格不能反推 benchmark 的成本效率,因为官方 benchmark 表没有提供每项测试的 token 消耗或调用成本。
读表前要保留的边界
第一,官方表只统一展示了模型、benchmark 和分数,没有在公告正文中为每一行补充完整的 harness、样本数、采样次数、上下文长度和工具配置。HLE 明确把无工具和有工具分开,其余项目的运行条件不能仅凭这张图补齐。1
第二,Fable 5 的列名带有「w/ fallback」。这意味着它不是一个可以无条件视作单一模型本体的对照列;它仍然是官方表中的有效参考,但读者在把 Fable 5 与其他列比较时,应保留这一运行条件。
第三,官方图里的空白不能被第三方榜单填上。GLM-5.2 在 Cybergym 上没有披露值,Kimi-K3 和 Fable 5 在 NL2Repo 上没有披露值,Fable 5 在 Agents' Last Exam 上没有披露值。把这些格子填成 0,会把「未测」错误地变成「测过但失败」。
这张表支持的判断很具体:DeepSeek-V4-Pro GA 相对 V4-Pro Preview 完成了跨工程与代理任务的整体跃升,并在 Cybergym、NL2Repo、AutomationBench Public 等项目上给出强信号;它同时在 HLE、DeepSWE、Toolathlon 和 DSBench 的不同项目里暴露出与其他旗舰的差距。要判断它是否适合自己的工作流,下一步应在同一任务类型、同一工具配置和相近 reasoning effort 下复测,而不是把 10 行分数压成一个总排名。
References
- 1DeepSeek-V4-Pro GA Release
api-docs.deepseek.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
