DeepSeek 逆转 V4 Pro 退役计划:API 9 月 14 日后继续提供,原价结算不自动路由

DeepSeek 逆转 V4 Pro 退役计划:API 9 月 14 日后继续提供,原价结算不自动路由

DeepSeek 官方在 API 开发文档首页及价目表更新脚注,宣布在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 调用服务且计费方式不变,推翻了此前全量自动路由至 V4.1 Flash 的退役方案。

北京时间 2026 年 9 月 11 日,DeepSeek 官方在 API 开发文档首页及价目表页面同步更新了脚注,正式推翻此前公布的退役与全量自动路由计划。12 官方在两处页面的脚注中明确公布:“为响应广大用户的需求,我们决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 调用服务,计费方式保持不变。后续若有调整将另行通知。”12 这项更新直接撤回了 9 月 10 日确立的安排——当时官方计划自 9 月 14 日 12:00 起,对 deepseek-v4-pro 的全部调用请求自动路由至新上线的 V4.1 Flash,并按 Flash 单价结算。随着最新脚注生效,DeepSeek 的 API 体系确立了旗舰与轻量双轨长期并行的方案。12

先说结论:开发团队的三项即时应对

对于已在生产环境中接入 deepseek-v4-pro 的工程团队,本次官方政策转向带来了三项直接影响:
  1. 调用链路无需改动。使用 deepseek-v4-pro 模型 ID 的服务在 9 月 14 日后将持续正常响应,请求不会发生中断,底层模型也不会被强制替换。1
  2. 账单不会自动下调。继续调用 V4 Pro 将严格按照既有价目结算,不会享受 Flash 模型的超低资费。在空闲时段,V4 Pro 的输出费率为每百万 tokens 1.98 美元,明显高于 Flash 的 0.60 美元。如果团队预期通过切换模型降低开销,需要主动在业务配置中将模型 ID 更新为 deepseek-flash2
  3. 并发限制与功能边界保持原样。V4 Pro 的官方默认并发限制维持在 500,远低于 V4.1 Flash 的 2500;同时,V4 Pro 依然只支持纯文本,不支持多模态视觉输入。2

核心参数与计费明细核对

根据 DeepSeek 官方最新价目表与接口规范,当前两款主力模型的最新规格与资费明细对比如下:
评估维度deepseek-v4-prodeepseek-flash官方信源说明
底层模型版本DeepSeek-V4-Pro-0813DeepSeek-V4.1-Flash官方价目表确定的当前线上生产版本。2
官方服务状态9 月 14 日后继续提供服务,原价计费正式生产模型(接管旧版 Flash 流量)首页及价目表新增脚注 (2) 明确说明继续提供。12
上下文长度1M(1,000,000 tokens)1M(1,000,000 tokens)两款模型均支持 1M 上下文窗口。2
最大输出长度384K(384,000 tokens)384K(384,000 tokens)输出上限保持一致。2
思考模式支持支持非思考与思考模式(默认开启)支持非思考与思考模式(默认开启)两款模型均支持 thinking 模式与自由切换。2
多模态视觉(Vision)不支持支持V4 Pro 仅支持文本,Flash 模型支持图像输入。2
默认并发限制5002500Flash 模型的官方并发配额高出 4 倍。2
缓存命中输入(每 1M tokens)空闲 $0.022 / 高峰 $0.044空闲 $0.003 / 高峰 $0.006峰谷定价已全量执行,高峰期价格恰为空闲期 2 倍。2
缓存未命中输入(每 1M tokens)空闲 $0.66 / 高峰 $1.32空闲 $0.15 / 高峰 $0.30Flash 模型的输入资费仅为 Pro 的 22.7% 左右。2
输出价格(每 1M tokens)空闲 $1.98 / 高峰 $3.96空闲 $0.60 / 高峰 $1.20Flash 模型的输出单价仅为 Pro 的约 30.3%。2
注:官方价目表规定,高峰时段为周一至周五 UTC 01:00 至 04:00、06:00 至 10:00,换算为北京时间即 09:00 至 12:00、14:00 至 18:00,其余时间均为半价的空闲时段。2

业务迁移与模型选型建议

双轨并存的局面确立后,技术团队可以根据业务场景采取不同策略:
  • 维持调用 deepseek-v4-pro 的场景:业务如果重度依赖 DeepSeek-V4-Pro-0813 在特定复杂逻辑任务中的推理习惯或输出格式,且系统峰值并发请求稳定在 500 以内,团队可以直接保留既有配置,无需承担切换模型带来的回归测试成本。2
  • 主动迁移至 deepseek-flash 的场景:对于关注 Token 成本、需要处理图文混合任务,或者生产环境并发需求高于 500 的系统,团队应当主动将调用参数更新为 deepseek-flash。迁移至 Flash 模型后,输入与输出资费将下调 70% 至 85% 左右,同时可获得 2500 的高并发配额与原生多模态视觉支持。12

References

  1. 1
  2. 2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content