DeepSeek-V4.1-Flash:取代 V4-Pro 成为现役主力的全量官方 Benchmark 与架构解析

DeepSeek-V4.1-Flash:取代 V4-Pro 成为现役主力的全量官方 Benchmark 与架构解析

DeepSeek 正式发布 V4.1-Flash 并宣布逐步淘汰 V4-Pro,本文完整转录涵盖 19 项指标的官方横向对比总表,剖析 8B/16B 非对称激活与全局 KV Cache 缩减对长程工程任务的效率机理与选型边界。

DeepSeek 于 2026 年 9 月 10 日发布了 DeepSeek-V4.1-Flash 的官方更新公告。1 尽管型号名称带有 Flash,官方在公告中明确确认该模型在性能、成本、运行速度与总耗时上均优于现役旗舰 DeepSeek-V4-Pro。DeepSeek 正在逐步淘汰 V4-Pro,并决定自世界协调时 2026 年 9 月 14 日 04:00(北京时间 12:00)起,把所有面向 deepseek-v4-pro 的 API 请求自动路由至 V4.1-Flash,直到未来 V4.1-Pro 正式发布。这项调整意味着 V4.1-Flash 已成为 DeepSeek 当前阶段对外的核心主力模型。
随着新模型上线,DeepSeek 披露了涵盖 19 项指标的全量官方 benchmark 对照表,并同步公开了开源权重与技术报告链接。123 这批官方数据清晰界定了新模型在代码工程、终端操作、多模态理解与安全防御上的真实分界。

模型列与评测条件

全量横向对比总表收录官方对比材料覆盖的 7 组模型列:DeepSeek-V4.1-Flash、DeepSeek-V4-Pro(0813 版本)、DeepSeek-V4-Flash(0731 版本)、GLM 5.3、Kimi K3、GPT 5.6-Sol 以及 Claude Opus 5。各家实验室未测或官方材料未披露的项目统一保留为空白
表格遵循两项关键口径说明。第一项是 Humanity's Last Exam(HLE)的测试范围:V4.1-Flash、V4-Pro、V4-Flash 与 GLM 5.3 标注星号 * 的数值对应 HLE 的纯文本子集;V4.1-Flash 在全量评测集上的得分为 36.8%,在纯文本子集上为 39.1%。第二项是工具链配置:HLE (w/tools)、Chartography (w/tools)、BabyVision (w/tools) 以及 ZeroBench-main (w/tools) 均在接入外部环境工具的条件下运行。1

全量官方横向对比总表

Benchmark类别与指标条件DeepSeek-V4.1-FlashDeepSeek-V4-Pro 0813DeepSeek-V4-Flash 0731GLM 5.3Kimi K3GPT 5.6-SolClaude Opus 5官方口径与说明
GPQA Diamond学术推理;百分比90.992.489.988.192.994.193.4GPT 5.6-Sol 保持首位 1
HLE学术前沿;百分比36.8 (39.1*)42.7*37.8*42.0*43.544.556.3*带星号为纯文本子集;Claude Opus 5 全集领先 1
Codeforces (Rating)算法竞技;积分值347133483289V4.1-Flash 创下 DeepSeek 内部新纪录 1
MathArena Apex竞赛数学;百分比65.665.358.665.6V4.1-Flash 与 Kimi K3 并列最高 1
Terminal-Bench 2.1终端环境;百分比90.687.982.788.288.388.889.1V4.1-Flash 突破 90 分大关 1
Terminal-Bench 3.0终端复杂任务;百分比30.011.87.628.317.734.443.3Claude Opus 5 领跑,V4.1-Flash 超前代 Pro 达 18.2 个百分点 1
Terminal-Bench 4.0终端长程任务;百分比31.212.47.037.912.639.951.8Claude Opus 5 领先,GLM 5.3 居次席 1
DeepSWE v1.1软件工程;解决率百分比74.262.754.466.967.573.074.0V4.1-Flash 略微超过 Claude Opus 5 1
ProgramBench长程代码合成;百分比20.315.519.017.523.037.0Claude Opus 5 维持显著优势 1
NL2Repo-Bench仓库级代码构建;百分比65.461.554.258.058.056.875.3Claude Opus 5 保持领先,V4.1-Flash 超越 GPT 5.6-Sol 1
CyberGym网络攻防;百分比88.183.376.784.580.084.5V4.1-Flash 在攻防环境获得最高分 1
SEC-Bench Pro安全工程;百分比62.856.430.974.3GPT 5.6-Sol 保持首位 1
ExploitGym漏洞利用验证;百分比15.35.41.815.033.722.1GPT 5.6-Sol 领跑该项基准 1
HLE (w/tools)学术综合(带工具);百分比63.960.051.562.559.863.6V4.1-Flash 略超 Claude Opus 5 1
Automation-Bench自动化工作流;百分比54.843.237.748.846.745.850.3V4.1-Flash 在复杂自动化任务居首 1
Agents' Last Exam智能体综合;百分比31.825.725.228.527.626.728.6V4.1-Flash 在该基准超越各家主力 1
Chartography (w/tools)视觉图表(带工具);百分比78.968.179.984.0Claude Opus 5 保持领先 1
BabyVision (w/tools)基础视觉(带工具);百分比89.685.788.994.1Claude Opus 5 保持领先 1
ZeroBench-main (w/tools)零样本评测(带工具);百分比49.041.053.052.0GPT 5.6-Sol 与 Claude Opus 5 领先 1
DeepSeek 官方发布的 benchmark 完整横向对比表格
官方对比表完整记录了 DeepSeek-V4.1-Flash 与同门前代及各家主力模型在 19 项指标上的评测结果。1

非对称架构与长程代码任务的效率跃升

官方披露的四项重点指标直观展现了 V4.1-Flash 在工程与自动化场景中的跃升幅度。模型在 Terminal-Bench 3.0 上录得 30.0%,在 DeepSWE v1.1 上达到 74.2%,在 CyberGym 达到 88.1%,在 Automation-Bench 达到 54.8%。相较上一代 V4-Pro,Terminal-Bench 3.0 的解决率从 11.8% 跃升至 30.0%,提升了近两倍;DeepSWE v1.1 提升了 11.5 个百分点。
DeepSeek-V4.1-Flash 与 Kimi-K3、GLM-5.3、Claude Opus 5、GPT-5.6-Sol 在四项关键基准上的柱状图对比
官方柱状图选取 Terminal-Bench 3.0、DeepSWE v1.1、CyberGym 与 Automation-Bench,展示 V4.1-Flash 在工程自动化领域的相对位置。1
这项性能跃升由底层的模型架构重构驱动。V4.1-Flash 采用了 552B 总参数的混合专家(MoE)结构,并引入全新的因果编码器-解码器(Causal Encoder–Decoder)非对称架构。在处理用户输入的 Prompt 阶段,模型仅激活 8B 参数;在自回归生成输出阶段,模型激活 16B 参数。这种非对称设计大幅降低了长输入预填充(Prefill)阶段的显存带宽与计算压力,让模型能够以极小的激活代价处理超长上下文代码仓库与长日志。
与此同时,V4.1-Flash 将全局键值缓存(KV Cache)压缩至每个 token 仅 890 字节。与前几代架构相比,这一数字展现出指数级的收敛过程:2023 年 11 月的 DeepSeek-V1 每个 token 占用 389,120 字节;2025 年 12 月的 DeepSeek-V3.2 降至 48,068 字节;2026 年 4 月的 DeepSeek-V4-Flash 降至 3,514 字节;V4.1-Flash 在此基础上继续减少了 3.9 倍。
DeepSeek 各代模型每个 token 所需全局 KV Cache 字节数演化历程
官方演化图记录了全局 KV Cache 从 V1 的 389,120 字节逐代降至 V4.1-Flash 的 890 字节,展现了显存与存储占用的缩减幅度。1
在多轮工程任务中,智能体需要反复读取终端报错、补全修补补丁并执行单元测试,会话上下文在反复重试中快速膨胀。V4.1-Flash 的 KV Cache 仅需上一代四分之一的高带宽显存(HBM)与八分之一的固态硬盘(SSD)存储空间。更小的缓存占用降低了上下文缓存命中时的计费开销,使得工程团队能够以极具竞争力的边际成本运行多轮自动化修代码任务。

优势任务与高阶推理短板的分野

全量数据同时揭示了新模型的能力边界。V4.1-Flash 的优势集中在强交互、长流程、有反馈回路的执行型工程任务中。在 Codeforces 竞赛编程中,该模型斩获 3471 的积分,高出 V4-Pro 123 分;在 Agents' Last Exam 中取得 31.8%,领先总表中的所有对比旗舰;在 NL2Repo-Bench 中达到 65.4%,高出 GPT 5.6-Sol 8.6 个百分点。
然而,在涉及深层符号抽象、高阶复杂逻辑与前沿网络渗透的测试集上,V4.1-Flash 依然与顶级前沿模型保持着明确差距。
在 ProgramBench 深度代码推理测试中,V4.1-Flash 录得 20.3%,落后于 Claude Opus 5 的 37.0%。在 ExploitGym 真实漏洞利用验证中,该模型得分 15.3%,明显低于 GPT 5.6-Sol 的 33.7% 与 Claude Opus 5 的 22.1%。在未接入工具的 HLE 全集基准测试中,V4.1-Flash 的得分为 36.8%,低于 GPT 5.6-Sol 的 44.5% 与 Claude Opus 5 的 56.3%。
多模态能力方面,V4.1-Flash 具备原生视觉理解支持,在接入工具后取得了 BabyVision 89.6%、Chartography 78.9% 以及 ZeroBench 49.0% 的成绩。这组数值超越了 Kimi K3,但在图表精细分析与视觉泛化能力上仍略低于 Claude Opus 5(94.1% 与 84.0%)。
这组分化表明,V4.1-Flash 通过大规模强化学习(RL)把实用代码工程、终端命令纠错与网络攻防基线推到了主力位置,但在无外部环境支持的纯粹抽象推理与深层漏洞挖掘领域,顶尖闭源前沿旗舰依然保持着壁垒。

费率结构与生产环境迁移路径

DeepSeek 在发布模型的同时公布了全新的 API 计费标准,并在 2026 年 9 月 10 日 04:00 UTC 正式生效。
官方继续推行高峰时段与非高峰时段的阶梯价格机制。非高峰时段的费率为高峰时段的 50%。在工作日 01:00–04:00 UTC 与 06:00–10:00 UTC 的高峰时段,缓存命中的输入价格为每百万 token 0.006 美元,未命中的输入价格为每百万 token 0.3 美元,输出价格为每百万 token 1.2 美元。在其他所有时段(包括全部周末与法定假日),缓存命中的输入价格降至每百万 token 0.003 美元,未命中的输入价格为每百万 token 0.15 美元,输出价格为每百万 token 0.6 美元。
DeepSeek-V4.1-Flash 官方 API 定价表
官方定价图详列了高峰与非高峰时段在缓存命中、未命中及输出 token 上的具体单价。1
面向开发者的迁移安排包含三条确定时间线:
第一,现有的 deepseek-flash 模型端点已默认切换为 V4.1-Flash,直接获得多模态理解与新架构推理能力;旧有的 deepseek-v4-flashdeepseek-v4-flash-vision-exp 均已退役,请求临时自动路由至 V4.1-Flash。
第二,针对使用 deepseek-v4-pro 的企业生产环境,DeepSeek 设立了 4 天的平滑过渡期。自 2026 年 9 月 14 日 04:00 UTC(北京时间 12:00)起,所有 V4-Pro 请求将被强制路由至 V4.1-Flash,计费费率同步下调至 V4.1-Flash 标准。官方目前推荐开发者提前主动切换。
第三,在实际选型上,对于依赖长上下文审查、终端命令交互、持续代码测试与自动化 Agent 的业务,V4.1-Flash 在性能与综合 Token 账单上均已优于 V4-Pro;而对于依赖超高阶数学定理证明与复杂逆向漏洞分析的专项研究任务,建议在评估 HLE 与 ExploitGym 差距后,按需保留特定前沿模型的混合调度方案。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado