DeepSeek-V4-Flash-0731 转为正式版:Agent 评测跃升,1M 上下文与 API 价格公开

DeepSeek-V4-Flash-0731 转为正式版:Agent 评测跃升,1M 上下文与 API 价格公开

DeepSeek-V4-Flash-0731 于 7 月 31 日转为正式版 API 公测,模型名和调用方式不变,重点升级 Agent 后训练并开放 1M 上下文、Responses API、Codex 适配和 Hugging Face 权重。

先看结论

DeepSeek 在 2026 年 7 月 31 日把 deepseek-v4-flash API 更新为 DeepSeek-V4-Flash-0731 正式版并开放公测:模型名、接口地址和调用方式不变,但后训练重新做过,Agent 评测明显高于 V4-Pro-Preview。官方账号在北京时间 7 月 31 日 14:56 公布了这次更新,并确认原生支持 Responses API、针对 Codex 做了适配。12
对开发者来说,这不是一次必须改模型名的迁移,而是一次必须重跑 Agent 评测的后训练升级。API 可以直接继续调用 deepseek-v4-flash;需要本地部署的人则要单独下载 Hugging Face 权重,不能把 API 可用等同于本地服务已经配置好。3

先把规格对齐

项目当前可核实信息对选型的影响
API 版本模型名仍为 deepseek-v4-flash,官方 API 现在提供 DeepSeek-V4-Flash-0731 正式版公测;调用方式不变。1现有代码不必因为版本号改写;应把旧版 Agent 回归测试重新跑一遍。
上下文与输出官方价格页列出 1M 上下文、最大 384K 输出;Codex 配置文件把上下文窗口写为 1,048,576。45适合长代码库、长日志和长程 Agent,但单次输出上限不等于每个任务都应该生成 384K。
模型规模Hugging Face 当前仓库页面的模型元数据显示 304B 参数;DeepSeek 的 V4 技术报告对 preview 版本写的是 284B 总参数、13B 激活,Artificial Analysis 也按 284B/13B 记录。官方更新日志同时说 0731 与 preview 的结构和尺寸保持一致。1367公开材料存在 304B 与 284B 的总参数口径差异,不能把「304B 总参数、13B 激活」当成已经由同一份官方材料完整确认的组合。部署时应以实际 checkpoint 元数据和硬件测试为准。
能力与接口官方确认 Agent 能力重新增强,原生支持 Responses API,并针对 Codex 适配;模型卡还列出 lowhighmax 三档 reasoning_effort13编程 Agent、工具调用和 Codex 是本次升级的主测试场景,普通聊天质量不能替代这些任务的实测。
价格官方价格页当前按人民币列出:缓存未命中输入 ¥1、缓存命中输入 ¥0.02、输出 ¥2,均为每百万 token;Artificial Analysis 独立页面折算显示约为 $0.14、$0.003、$0.28。47预算应按缓存命中比例拆开算。官方页面还预告峰谷定价,高峰时段按两倍计费,但当前价目表仍是平价,具体执行时间以官方通知为准。
权重与许可Hugging Face 已有 deepseek-ai/DeepSeek-V4-Flash-0731 官方仓库,模型卡标注 MIT 许可,并给出 vLLM、SGLang 和本地推理说明。3API 试用和本地自部署是两条路径;本地部署前要核对显存、量化格式、推理框架和实际吞吐。

这次升级改了什么

DeepSeek 的官方更新日志把边界写得很清楚:只有 deepseek-v4-flash API 升级,V4-Pro API 以及 App、Web 端模型没有改动;0731 的结构和尺寸与 V4-Flash-Preview 保持一致,只重新进行了后训练。这个信息比「换了一个全新底座」更重要,因为它把预期放在工具调用、任务规划、拒答和输出行为的变化上,而不是硬件成本突然换档。1
Hugging Face 模型卡把这次版本称为替代 preview 的正式发布,并说明它沿用带 DSpark speculative decoding(推测解码)模块的结构。模型卡没有在正文中给出一组新的「总参数 / 激活参数」数字;页面下方的模型元数据单独显示 304B。因此,当前最稳妥的写法是:13B 激活是技术报告与独立评测沿用的 preview 口径,304B 是当前仓库元数据的总参数显示,两者不应被强行拼成一个无冲突的官方规格。367
上下文则没有这个歧义:DeepSeek 官方 API 价格页写的是 1M,Codex 集成文档给出精确值 1,048,576。官方公开资料没有在本次更新页中证明「4K 升到 1,040K」这一历史变化,能确认的是当前 0731 API 的百万 token 上下文和 384K 最大输出。45

官方 benchmark:Agent 指标整组上升

DeepSeek 在 API 更新日志和官方模型卡中给出九项 Agent 评测。公开 Code Agent 任务使用即将发布的 DeepSeek Harness 极简模式,max 推理档位,temperature=1.0top_p=0.95DSBench-FullStackDSBench-Hard 是内部测试集,不能与外部公开榜单直接等量比较。13
评测V4-Flash-0731V4-Flash-PreviewV4-Pro-Preview
Terminal Bench 2.182.7 161.8 372.1 3
NL2Repo54.2 139.4 338.5 3
Cybergym76.7 138.7 352.7 3
DeepSWE54.4 17.3 312.8 3
Toolathlon-Verified70.3 149.7 355.9 3
Agents' Last Exam25.2 115.8 316.5 3
AutomationBench Public25.1 110.8 312.8 3
DSBench-FullStack †68.7 137.0 341.8 3
DSBench-Hard †59.6 125.8 331.1 3
这组数字支持一个有限的判断:0731 的后训练确实把官方 Agent 评测往上推了一大截,尤其是 DeepSWE、Cybergym 和 Terminal Bench 2.1。但它们仍是 DeepSeek 自己的结果,且测试框架、推理强度和工具环境会影响 Agent 分数;不能直接推导出所有代码库、所有工具链都会按同样比例提升。

独立评测怎么看

Artificial Analysis 在 7 月 31 日的独立评测中给 DeepSeek V4 Flash 0731 的 Intelligence Index 评分 50,比前一代 DeepSeek V4 Flash 高 10 分;该指数包含 GDPval-AA v2、Terminal-Bench v2.1、SciCode、GPQA Diamond、AA-Omniscience 等九项评测。它还记录了 GDPval-AA v2 的 1559 Elo、Terminal-Bench 2.1 的 79%,以及比前一代低 12% 的总输出 token 使用量。8
另一项值得留意的信号是 AA-Omniscience Index 为 -16。Artificial Analysis 解释,这一项相较前代的改善主要来自更低的幻觉率,而不是总体答对率上升;该页面同时记录幻觉率为 84%、准确率为 37%。这不意味着模型已经适合无审核地执行生产任务,反而说明 Agent 评测之外,仍要把事实可靠性和拒答行为纳入回归集。8
AA 模型页给出的第一方 API 观测值是约 122.7 output tokens/s,页面将模型记录为文本输入、文本输出、1M 上下文、284B 总参数和 13B 激活;这些是独立评测方的模型记录,不是 DeepSeek 0731 更新页新增的规格声明。7

API、Codex 和本地权重

API 侧的迁移动作很短:继续使用 model=deepseek-v4-flash,接口地址保持不变。官方文档目前只让 V4-Flash 接入 Codex,Responses API 已原生支持;Codex CLI、ChatGPT 桌面端和 VS Code 插件共用一份配置,适合把同一套代码 Agent 评测直接换到新版本。15
价格要把三种 token 分开记:官方当前价目表是缓存未命中输入 ¥1、缓存命中输入 ¥0.02、输出 ¥2 / 百万 token。峰谷定价已在文档中预告,高峰时段定义为北京时间每日 9:00~12:00 和 14:00~18:00,价格按两倍计算,但页面写明具体启用时间以正式通知为准。4
本地侧,官方 Hugging Face 仓库已经开放权重并标为 MIT,提供 vLLM、SGLang 和推理脚本;vLLM 示例使用 4×GB300 节点,并启用 DSpark speculative decoding。这个入口对研究和私有部署有价值,但硬件门槛不能从「13B 激活」这个数字直接估算,MoE 仍要承载完整权重、KV cache 和运行时开销。3

开发者现在该怎么测

  1. 保留原有 API 配置,只把线上或测试环境中的 deepseek-v4-flash 重新跑一遍;记录任务成功率、工具调用成功率、重试次数、输入缓存命中率、输出 token 和端到端延迟。
  2. 把官方 benchmark 的强项拆成自己的任务集:终端操作、真实仓库修复、多工具编排、浏览器或 SaaS 自动化分别计分,不要用一次聊天问答替代 Agent 回归。
  3. 如果使用 Codex,直接测试 Responses API 路径,并检查 lowhighmax 三档 reasoning effort 对成功率、速度和费用的影响;同一任务至少固定随机性、工具权限和上下文长度。
  4. 如果准备自部署,先从官方权重仓库核对 checkpoint、量化格式和推理框架,再测显存占用与吞吐。304B 和 284B 的公开总参数口径尚未统一,采购硬件时不要只按文章标题里的参数数字下结论。

References

  1. 1
    DeepSeek API 更新日志api-docs.deepseek.com
  2. 2
  3. 3
  4. 4
    DeepSeek API 模型与价格api-docs.deepseek.com
  5. 5
    接入 Codexapi-docs.deepseek.com
  6. 6
  7. 7
    Artificial Analysis 模型页artificialanalysis.ai
  8. 8
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.