DeepSeek 计划今日正式发布 V4.1 Flash:全量路由接管 V4 Pro,Flash 全系午间降价最高 60%

DeepSeek 计划今日正式发布 V4.1 Flash:全量路由接管 V4 Pro,Flash 全系午间降价最高 60%

DeepSeek 宣布计划于今日前后正式发布采用全新原生多模态架构的 V4.1 Flash,全面超越 V4 Pro 并对其实施全量自动路由与降价计费,同时 Flash 系列自今日 12:00 起下调 API 费率最高达 60%。

DeepSeek 开放平台于 2026 年 9 月 9 日发布官方通知,宣布计划在北京时间 2026 年 9 月 10 日前后正式发布 DeepSeek V4.1 Flash。官方称经内部与外部多方测试,该模型在性能、费用、速度与总用时等指标上全面超越 V4 Pro,并在 V4.1 Flash 正式上线后至 V4.1 Pro 上线前,把所有发往 V4 Pro 的请求全量路由至 V4.1 Flash,统一按 V4.1 Flash 的单价结算。与模型升级同步,DeepSeek 宣布自 9 月 10 日 12:00 起下调 Flash 系列 API 价格,闲时缓存命中输入单价降幅达 60%。123

先说结论

截至北京时间 2026 年 9 月 10 日 10:30,DeepSeek 官方 API 价格与模型文档中仍列出 deepseek-v4-flash(0731 版本)、deepseek-v4-pro(0813 版本)与 deepseek-v4-flash-vision-exp 三款现有模型,V4.1 Flash 的正式模型 ID 与专属更新日志尚未同步开放。开发者当前在官方社群中获得的调用入口为临时测试端点 deepseek-v4.1-flash-expires-on-0910,该端点单账号限制 20 路并发,命名标记将于 9 月 10 日到期。34
对于使用 DeepSeek 接口进行业务部署的技术团队,本次变动的核心影响集中在两处:一是对于正在调用 deepseek-v4-pro 的企业,官方正式上线后会自动将流量调度至 V4.1 Flash,调用方无需改动客户端代码即可直接享受 Flash 级别的计费单价与更低的延迟;二是对于高频调用 Flash 系列接口的系统,自今日中午 12:00 起生效的新阶梯价格将显著降低长上下文前缀缓存的维护成本。12

快速核对

评估维度官方已确认口径与规格社区实测与当前边界状态官方信源与边界说明
模型名称与版本DeepSeek V4.1 Flash;计划 9 月 10 日前后正式发布9 月 8 日下午起开放内测,临时 ID 标记 9 月 10 日到期官方通知经科技媒体转述,正式发布以开放平台为准。14
生产 API 模型 ID待正式文档上架确认正式 ID内测临时 ID 为 deepseek-v4.1-flash-expires-on-0910,每账号限 20 并发官方文档当前未收录正式 ID,临时端点具备有效期限制。34
模型架构与模态采用新模型结构,原生多模态支持改变了此前为文本基座外挂视觉塔的做法,支持图文直接处理官方确认原生多模态结构,技术报告参数留待后续披露。14
参数规模披露官方未公开总参数与激活参数量现有 V4 Flash 基座为 284B 总参数、13B 激活参数官方文档与开源仓库暂未上线新模型卡与权重信息。34
评测与性能表现官方称内部与外部测试全面超越 V4 Pro社区第三方流式吞吐实测为 300 至 500 tokens/秒官方口径涵盖性能与用时,社区测试属于轻载自测。14
上下文与最大输出官方文档尚未单独公布 V4.1 页面第三方开发平台显示继承 V4 家族 1M 上下文与 384K 输出上限官方基线规格参照 V4 家族通用标准。3
路由与过渡机制正式上线后全量接管 V4 Pro 请求并按 Flash 计费持续至 V4.1 Pro 上线为止,平滑迁移线上既有调用官方通知明确请求全量转发与计费下调规则。1
API 调价生效时间2026 年 9 月 10 日 12:00(北京时间)闲时缓存命中 0.02 元、未命中 1 元、输出 4 元 / 1M tokens官方开放平台已发布价格调整细则公告。2

原生多模态架构与性能定位

DeepSeek 在官方通知中将 V4.1 Flash 定位为中期重大升级版本。该模型采用了经过重构的模型结构,具备原生多模态支持能力。在此之前,DeepSeek 于 8 月下旬推出的 deepseek-v4-flash-vision-exp 属于实验性质的外挂方案,通过在已有的 V4 文本基座之上叠加视觉编码器与对齐层来实现图像理解。V4.1 Flash 将视觉理解能力直接融入基座设计,减少了模态转换带来的计算损耗。14
在性能表现上,官方强调 V4.1 Flash 在综合能力、推理速度、调用费用和长任务总用时上全面胜过现有主力旗舰 V4 Pro。在过往的大模型阶梯中,Flash 系列主打轻量高速与低成本,Pro 系列承担复杂推理与深度工具调用。DeepSeek 官方交流群在内测问卷中将“V4.1 Flash 是否具备完全替代当前线上 V4 Pro 的能力”列为关键调查项,表明团队正在推进轻量架构对重型旗舰的实质性替代。14
官方声明与社区实测存在明确的口径边界。DeepSeek 官方目前将技术报告与详细学术榜单留待后续公布。社交网络与技术社区流传的解码吞吐数据(例如多位开发者测得的 300 至 500 tokens/秒、极值超过 500 tokens/秒)以及单项代码任务得分,均来自开发者在内测端点上的自测表现。这些数字反映了实验端点在较轻并发负载下的瞬时表现,实际高并发业务下的延迟与吞吐仍需等待正式服务上线后的大规模验证。4

价格调降与 V4 Pro 全量路由策略

伴随新模型发布预告,DeepSeek 开放平台公布了 Flash 系列的全新定价表,自北京时间 2026 年 9 月 10 日 12:00 起正式执行。本次调价继续沿用峰谷分时计费规则(高峰时段为周一至周五 09:00–12:00 与 14:00–18:00,其余为闲时时段),重点大幅降低了输入端的单价。2
Token 类型调价前闲时价格(元/1M tokens)9/10 12:00 起闲时价格(元/1M tokens)闲时降幅9/10 12:00 起高峰价格(元/1M tokens)
输入缓存命中0.050.0260.0%0.04
输入缓存未命中1.501.0033.3%2.00
补全输出4.504.0011.1%8.00
按照官方路由安排,在 V4.1 Flash 正式上线至后续 V4.1 Pro 推出前的窗口期内,所有发往 deepseek-v4-pro 的调用都会由平台后端自动路由至 V4.1 Flash,并且直接按 Flash 的价格进行计费结算。这意味着现有 V4 Pro 用户的账单单价将直接从原有高位(闲时输入未命中 3 元、输出 9 元)降至 Flash 调价后的新标准(闲时输入未命中 1 元、输出 4 元),调用成本降幅超过 50%。对于包含固定指令、长提示词与知识库文档的 Agent 应用,配合降至 0.02 元的命中缓存单价,综合调用开销将进一步压缩。123

开发者接入与生产选型建议

面对新模型发布与路由切换,技术团队在接入和迁移时需要关注以下工程细节:
  1. 将内测临时 ID 严格隔离于生产配置之外。临时端点 deepseek-v4.1-flash-expires-on-0910 带有明确的失效日期,仅支持单账号 20 路并发,专用于前哨验证与特性测试。生产集群应继续保留现有模型标识或等待官方控制台更新正式模型 ID,确保业务链路的稳定性。4
  2. 核验自动路由对长程 Agent 流程的实际影响。由于官方会将 V4 Pro 请求全量重定向至 V4.1 Flash,两者在思维链推理深度、工具调用的容错率以及多轮对话的上下文依从性上可能存在细微差异。使用 V4 Pro 承载高严谨度代码审查或复杂数据分析的团队,需在正式切换前后运行自动化回归测试集,校验最终输出的正确率。1
  3. 充分利用前缀缓存机制降低成本。9 月 10 日中午调整后,缓存命中的单价(0.02 元)仅为未命中单价(1.00 元)的五十分之一。开发者在架构多轮会话或多模态交互时,应尽量保持系统提示词、格式说明及参考图片在输入流起始位置的排列稳定性,最大化发挥缓存单价下调带来的经济效益。2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel