DeepSeek 正式上线 deepseek-flash:调价全面生效,9 月 14 日起全量路由接管 V4 Pro

DeepSeek 正式上线 deepseek-flash:调价全面生效,9 月 14 日起全量路由接管 V4 Pro

DeepSeek 官方正式上架生产模型 ID deepseek-flash(DeepSeek-V4.1-Flash)并宣布旧 Flash 模型退役,9 月 10 日中午降价已在价目表正式生效,且确定自 9 月 14 日 12:00 起将 deepseek-v4-pro 全量路由至 V4.1 Flash 并按 Flash 资费结算。

DeepSeek 官方开发文档与模型定价页于 2026 年 9 月 10 日完成实质变更,正式在 API 列表与调用入口中上线生产模型 ID deepseek-flash,对应模型版本确认为 DeepSeek-V4.1-Flash。12 伴随正式模型上架,此前使用的 deepseek-v4-flashdeepseek-v4-flash-vision-exp 均已标记为退役,现有针对旧 ID 的请求直接由 DeepSeek-V4.1-Flash 服务并统一按照 Flash 新价格计费。12 与此同时,官方预告的 9 月 10 日 12:00 价格调整已在官方计费系统正式执行,谷时缓存未命中输入单价下调至 0.15 美元/1M tokens,输出下调至 0.60 美元/1M tokens。2 官方同时公布了对旗舰模型 deepseek-v4-pro 的有序退役安排:自北京时间 2026 年 9 月 14 日 12:00 起,所有发往 deepseek-v4-pro 的请求将全量自动路由至 V4.1 Flash 并按 Flash 单价结算,直至未来 V4.1 Pro 发布。12

先说结论

对于正在使用 DeepSeek 接口的技术团队,本次官方更新锁定了以下四项核心实施细节:
  1. 生产模型 ID 正式定名并放开并发配额。官方正式推荐的生产调用 ID 为 deepseek-flash。此前开放的内测临时端点 deepseek-v4.1-flash-expires-on-0910 标记于 9 月 10 日到期且限制 20 并发;正式 ID deepseek-flash 开放后,并发配额直接提升至 2500,团队可以放心切换生产集群配置。12
  2. 官方新调价方案正式生效执行。价目表以美元计价,谷值时段费用为峰值的一半。Flash 模型谷时缓存命中输入为 0.003 美元/1M tokens,未命中输入为 0.15 美元/1M tokens,补全输出为 0.60 美元/1M tokens;峰时相应价格翻倍。2
  3. V4 Pro 的退役与自动降价路由确定于 9 月 14 日中午生效。官方将现有 V4 Pro 版本号标注为 DeepSeek-V4-Pro-0813。自 2026 年 9 月 14 日 12:00(北京时间)起,发往 V4 Pro 的流量将由平台在服务端静默重定向至 V4.1 Flash,费用同步切换为 Flash 标准。12
  4. 模型支持完整的多模态与推理参数deepseek-flash 在支持 1M(1,000,000 tokens)上下文长度和 384K 最大输出的同时,官方文档确认其原生支持视觉输入(Vision)、工具调用、JSON 输出、Responses API,并在调用示例中公开了思考模式配置项。12

快速核对:新旧模型核心规格与策略对比

评估维度deepseek-flash(当前主力)deepseek-v4-pro(过渡状态)官方信源说明
底层版本名称DeepSeek-V4.1-FlashDeepSeek-V4-Pro-0813官方定价页已标明具体底层版本号。2
生产模型 IDdeepseek-flashdeepseek-v4-pro官方首选 ID,旧 Flash ID 请求由其承接。12
生命周期状态正式在线服务,承接旧版流量计划有序退役,9/14 12:00 起自动路由至 Flash官方文档写明路由过渡期直至未来 V4.1 Pro 发布。12
上下文窗口1,000,000 tokens(1M)1,000,000 tokens(1M)两款模型均支持 1M 上下文。2
最大输出上限384,000 tokens(384K)384,000 tokens(384K)官方文档标记 MAXIMUM 为 384K。2
模态支持支持文本与视觉输入(Vision)仅支持文本,不支持 Vision官方价目表在 Vision 一栏对 Flash 标打勾、Pro 标叉。2
思考模式支持支持(文档示例提供 thinking 字段)支持(文档示例提供 thinking 字段)官方调用示例演示了 high 等级的思考模式配置。1
默认并发限制2,500 并发500 并发官方定价页明确公布默认并发限制。2
参数规模说明官方未披露具体参数量与技术报告官方未披露具体参数量官方文档目前仅列出 API 参数与价格,未放模型权重。12

官方新定价结构与峰谷计费规则

DeepSeek 官方 API 价格按每 1M tokens 计费,采用峰谷时段差别定价。谷值时段价格严格为峰值价格的 50%。2
  • 峰值时段(Peak):UTC 时间周一至周五 01:00–04:00 与 06:00–10:00,换算为北京时间为周一至周五 09:00–12:00 与 14:00–18:00。2
  • 谷值时段(Off-Peak):除上述峰值时段之外的工作日其余时段以及全部周末时间。2
下表汇总了官方价目表中两款模型的最新资费:
费用项目(美元 / 1M tokens)deepseek-flash(谷值)deepseek-flash(峰值)deepseek-v4-pro(谷值)deepseek-v4-pro(峰值)
输入 tokens(缓存命中)$0.003$0.006$0.022$0.044
输入 tokens(缓存未命中)$0.150$0.300$0.660$1.320
补全输出 tokens$0.600$1.200$1.980$3.960
从账单成本看,deepseek-flash 的缓存命中单价(谷时 $0.003)仅为未命中单价($0.150)的五十分之一。对于使用长前缀、多轮对话或多轮工具交互的业务系统,命中缓存后输入成本能降低 98%。2

旧模型退役机制与 9 月 14 日路由接管细节

针对模型迭代过程中的服务平稳过渡,DeepSeek 采取了两项针对性安排:
第一项针对历史 Flash 模型:官方将 deepseek-v4-flashdeepseek-v4-flash-vision-exp 列入已退役模型名单。如果现有的业务代码仍向这两个旧 ID 发起调用,API 接口仍会保持正常接收,但后端会将请求直接交给 DeepSeek-V4.1-Flash 服务,账单结算也完全按照 Flash 的新调降单价执行。12
第二项针对旗舰模型 deepseek-v4-pro:官方公布了明确的退役时间线。自北京时间 2026 年 9 月 14 日 12:00 起,所有调用 deepseek-v4-pro 的请求将由平台统一路由至 V4.1 Flash,计费单价同步降低为 Flash 价格,该路由机制将持续至未来的 V4.1 Pro 发布。在官方说明中,DeepSeek 称经过内部与外部多方测试,V4.1 Flash 在性能、成本、生成速度以及处理总耗时等各方面均超越了现有的 V4 Pro。12

开发者生产部署与工程建议

根据官方文档公布的最新接口规范与过渡安排,技术团队可从以下三方面规划业务调整:
  1. 将客户端配置更新为正式 ID 并充分利用并发额度。此前参与内测的团队应及时清理 deepseek-v4.1-flash-expires-on-0910 这一临时 ID,替换为标准的 deepseek-flash。新端点拥有 2500 路高并发,能够直接承载正式生产环境的高并发访问需求。12
  2. 在 9 月 14 日全量路由生效前完成业务回归验证。虽然官方声明 V4.1 Flash 性能全面超越 V4 Pro,但两代模型在复杂长逻辑推理、结构化代码编写和特定指令微调上的输出风格与行为表现仍可能存在差异。依赖 V4 Pro 运行核心业务的团队,建议在 9 月 14 日中午前主动调用 deepseek-flash 跑一遍既有测试集,确认输出符合预期。12
  3. 固定提示词前缀以最大化发挥前缀缓存效益。在新的计费标准下,缓存命中的单价具备压倒性优势。系统架构师在设计 Agent 或多轮交互时,应尽量保持系统提示词(System Prompt)、工具描述(Tool Definitions)和背景知识库切片的排列一致性,避免非必要的动态前置文本打破缓存连续性。2

References

  1. 1
  2. 2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content