DeepSeek-V4-Pro GA:官方 Benchmark 横向对比

DeepSeek-V4-Pro GA:官方 Benchmark 横向对比

DeepSeek-V4-Pro GA 相比预览版在 10 项官方 benchmark 上全面抬升,并在多项工程与自动化任务中进入第一梯队;本文完整转录官方对照表,保留未披露项并说明 HLE、工具配置与峰谷价格口径。

8 月 13 日,DeepSeek 将 V4-Pro 从预览版推到 GA。官方横向表显示,V4-Pro-0813 在这张表覆盖的 10 个项目中,相比 V4-Pro-Preview 的已披露分数全部上升;其中 Terminal Bench 2.1、NL2Repo、Cybergym 和 AutomationBench Public 已高于其他列出的对照模型。它仍不是所有项目的第一名:HLE、DeepSWE、Toolathlon-Verified、Agents' Last Exam 和两项 DSBench 上,Kimi-K3、Opus-4.8 或 Fable 5 仍有更高分。1
这组结果更像一张分化的能力画像:GA 版对自己的预览版完成了一次大幅抬升,在工程和代理任务上进入第一梯队;但跨 benchmark 直接排一个总名次,既不符合官方表,也会把不同工具和评测设置混在一起。

发布信息与可用范围

官方发布页把本次版本写作 DeepSeek-V4-Pro GA,并同时介绍 V4-Flash。V4-Pro 已可在 DeepSeek 网页和 App 的「Expert Mode」中使用,也可通过 API 调用。发布页还称,V4-Pro 与 V4-Flash 支持可调 reasoning effort:简单任务可以使用较低档,复杂任务使用更高档;V4 系列支持 OpenAI Responses API,并针对 Codex 做了适配。1
API 名称方面,页面只说明模型名称保持不变;价格图列出的型号名是 DeepSeek-V4-ProDeepSeek-V4-Flash。页面没有在这次公告中另列 endpoint 名称,因此这里不把名称扩展成额外的 API 路径。

全量 Benchmark 横向对照

下表把官方图片中的 10 行、8 列完整转录为一张表。HLE 的单元格格式是「无工具 / 有工具」;其他项目按官方图中的单值保留。每一行最高值加粗。空白表示官方这张表没有披露该模型在该项目上的数值,不代表 0。
BenchmarkDeepSeek-V4-Pro-0813DeepSeek-V4-Flash-0731DeepSeek-V4-Pro-PreviewDeepSeek-V4-Flash-PreviewGLM-5.2Kimi-K3Opus-4.8Fable 5(含 fallback)
HLE(无工具 / 有工具)142.7 / 60.037.8 / 51.537.7 / 48.234.8 / 45.140.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.1187.982.772.161.881.088.385.088.0
NL2Repo161.554.238.539.448.969.7
Cybergym183.376.752.738.780.078.383.1
DeepSWE162.754.412.87.346.267.558.070.0
Toolathlon-Verified174.170.355.949.759.976.576.277.9
Agents' Last Exam125.725.216.515.823.827.625.7
AutomationBench(Public)131.825.112.810.812.930.827.229.1
DSBench-FullStack171.168.741.837.061.873.771.677.2
DSBench-Hard167.259.631.125.854.563.071.768.3

三个读表结论

相对预览版,GA 版的提升不是单点修补

V4-Pro-0813 在官方表中的 10 个项目都高于 V4-Pro-Preview。提升最明显的几行是 DeepSWE,从 12.8 升到 62.7;DSBench-FullStack,从 41.8 升到 71.1;DSBench-Hard,从 31.1 升到 67.2;AutomationBench Public,从 12.8 升到 31.8。Terminal Bench 2.1 也从 72.1 升到 87.9,NL2Repo 从 38.5 升到 61.5。1
这说明 GA 版相对旧预览版的变化,主要体现在多步工程任务、代码仓库修改、自动化和代理任务上,而不是只在某一个 benchmark 上刷高分。这里的结论仍限于官方表中这 10 个项目,不能外推成所有公开评测都同步提升。

工程任务领先,HLE 与长链路代理仍有对手

V4-Pro-0813 在 Terminal Bench 2.1 上拿到 87.9,低于 Kimi-K3 的 88.3 和 Fable 5 的 88.0,但高于 Opus-4.8 的 85.0。它在 NL2Repo 的 61.5、Cybergym 的 83.3 和 AutomationBench Public 的 31.8 则是这几行中最高的已披露值。1
另一边,HLE 的无工具 / 有工具分数是 42.7 / 60.0,Fable 5 为 53.3 / 63.0,Opus-4.8 为 49.8 / 57.9。DeepSWE 上,Fable 5 的 70.0 和 Kimi-K3 的 67.5 也高于 V4-Pro 的 62.7。Toolathlon-Verified、Agents' Last Exam、DSBench-FullStack 和 DSBench-Hard 的最高值同样分别落在 Fable 5、Kimi-K3、Fable 5 和 Opus-4.8。1
因此,比较 V4-Pro 时最稳妥的说法是「工程和自动化任务的竞争力明显增强」,而不是「全面超过其他旗舰」。

V4-Flash 的位置也被官方表明确标出来了

V4-Flash-0731 在大多数行低于 V4-Pro-0813,但仍高于两列 Preview。例如它在 Terminal Bench 2.1 上为 82.7,在 Cybergym 上为 76.7,在 DSBench-FullStack 上为 68.7;对应的 V4-Pro-Preview 是 72.1、52.7 和 41.8。1
V4-Flash 也不是简单的「低一档版本」:在 Agents' Last Exam 上,它以 25.2 高于 GLM-5.2 的 23.8,且接近 V4-Pro 的 25.7。读者如果关心吞吐和成本,应该把 Flash 与 Pro 的价格、任务类型和具体 benchmark 放在一起看,而不是只看模型名中的 Pro 或 Flash。

API 价格:峰谷价从 8 月 17 日 00:00(北京时间)起生效

官方价格图给出的新价格如下。输入分成缓存命中和缓存未命中,输出单独计价,单位都是美元 / 百万 token。1
模型时段输入(缓存命中)输入(缓存未命中)输出
DeepSeek-V4-Flash 1非峰$0.007$0.22$0.66
DeepSeek-V4-Flash 1峰时段$0.014$0.44$1.32
DeepSeek-V4-Pro 1非峰$0.022$0.66$1.98
DeepSeek-V4-Pro 1峰时段$0.044$1.32$3.96
按价格图计算,V4-Pro 的峰时段价格正好是非峰价格的两倍,V4-Flash 也是如此。实际账单还取决于缓存命中率、输入输出 token 数和调用发生的时间;这组价格不能反推 benchmark 的成本效率,因为官方 benchmark 表没有提供每项测试的 token 消耗或调用成本。

读表前要保留的边界

第一,官方表只统一展示了模型、benchmark 和分数,没有在公告正文中为每一行补充完整的 harness、样本数、采样次数、上下文长度和工具配置。HLE 明确把无工具和有工具分开,其余项目的运行条件不能仅凭这张图补齐。1
第二,Fable 5 的列名带有「w/ fallback」。这意味着它不是一个可以无条件视作单一模型本体的对照列;它仍然是官方表中的有效参考,但读者在把 Fable 5 与其他列比较时,应保留这一运行条件。
第三,官方图里的空白不能被第三方榜单填上。GLM-5.2 在 Cybergym 上没有披露值,Kimi-K3 和 Fable 5 在 NL2Repo 上没有披露值,Fable 5 在 Agents' Last Exam 上没有披露值。把这些格子填成 0,会把「未测」错误地变成「测过但失败」。
这张表支持的判断很具体:DeepSeek-V4-Pro GA 相对 V4-Pro Preview 完成了跨工程与代理任务的整体跃升,并在 Cybergym、NL2Repo、AutomationBench Public 等项目上给出强信号;它同时在 HLE、DeepSWE、Toolathlon 和 DSBench 的不同项目里暴露出与其他旗舰的差距。要判断它是否适合自己的工作流,下一步应在同一任务类型、同一工具配置和相近 reasoning effort 下复测,而不是把 10 行分数压成一个总排名。

References

  1. 1
    DeepSeek-V4-Pro GA Release

    api-docs.deepseek.com

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.