
DeepSeek 计划今日正式发布 V4.1 Flash:全量路由接管 V4 Pro,Flash 全系午间降价最高 60%
DeepSeek 宣布计划于今日前后正式发布采用全新原生多模态架构的 V4.1 Flash,全面超越 V4 Pro 并对其实施全量自动路由与降价计费,同时 Flash 系列自今日 12:00 起下调 API 费率最高达 60%。
DeepSeek 开放平台于 2026 年 9 月 9 日发布官方通知,宣布计划在北京时间 2026 年 9 月 10 日前后正式发布 DeepSeek V4.1 Flash。官方称经内部与外部多方测试,该模型在性能、费用、速度与总用时等指标上全面超越 V4 Pro,并在 V4.1 Flash 正式上线后至 V4.1 Pro 上线前,把所有发往 V4 Pro 的请求全量路由至 V4.1 Flash,统一按 V4.1 Flash 的单价结算。与模型升级同步,DeepSeek 宣布自 9 月 10 日 12:00 起下调 Flash 系列 API 价格,闲时缓存命中输入单价降幅达 60%。123
先说结论
截至北京时间 2026 年 9 月 10 日 10:30,DeepSeek 官方 API 价格与模型文档中仍列出
deepseek-v4-flash(0731 版本)、deepseek-v4-pro(0813 版本)与 deepseek-v4-flash-vision-exp 三款现有模型,V4.1 Flash 的正式模型 ID 与专属更新日志尚未同步开放。开发者当前在官方社群中获得的调用入口为临时测试端点 deepseek-v4.1-flash-expires-on-0910,该端点单账号限制 20 路并发,命名标记将于 9 月 10 日到期。34对于使用 DeepSeek 接口进行业务部署的技术团队,本次变动的核心影响集中在两处:一是对于正在调用
deepseek-v4-pro 的企业,官方正式上线后会自动将流量调度至 V4.1 Flash,调用方无需改动客户端代码即可直接享受 Flash 级别的计费单价与更低的延迟;二是对于高频调用 Flash 系列接口的系统,自今日中午 12:00 起生效的新阶梯价格将显著降低长上下文前缀缓存的维护成本。12快速核对
| 评估维度 | 官方已确认口径与规格 | 社区实测与当前边界状态 | 官方信源与边界说明 |
|---|---|---|---|
| 模型名称与版本 | DeepSeek V4.1 Flash;计划 9 月 10 日前后正式发布 | 9 月 8 日下午起开放内测,临时 ID 标记 9 月 10 日到期 | 官方通知经科技媒体转述,正式发布以开放平台为准。14 |
| 生产 API 模型 ID | 待正式文档上架确认正式 ID | 内测临时 ID 为 deepseek-v4.1-flash-expires-on-0910,每账号限 20 并发 | 官方文档当前未收录正式 ID,临时端点具备有效期限制。34 |
| 模型架构与模态 | 采用新模型结构,原生多模态支持 | 改变了此前为文本基座外挂视觉塔的做法,支持图文直接处理 | 官方确认原生多模态结构,技术报告参数留待后续披露。14 |
| 参数规模披露 | 官方未公开总参数与激活参数量 | 现有 V4 Flash 基座为 284B 总参数、13B 激活参数 | 官方文档与开源仓库暂未上线新模型卡与权重信息。34 |
| 评测与性能表现 | 官方称内部与外部测试全面超越 V4 Pro | 社区第三方流式吞吐实测为 300 至 500 tokens/秒 | 官方口径涵盖性能与用时,社区测试属于轻载自测。14 |
| 上下文与最大输出 | 官方文档尚未单独公布 V4.1 页面 | 第三方开发平台显示继承 V4 家族 1M 上下文与 384K 输出上限 | 官方基线规格参照 V4 家族通用标准。3 |
| 路由与过渡机制 | 正式上线后全量接管 V4 Pro 请求并按 Flash 计费 | 持续至 V4.1 Pro 上线为止,平滑迁移线上既有调用 | 官方通知明确请求全量转发与计费下调规则。1 |
| API 调价生效时间 | 2026 年 9 月 10 日 12:00(北京时间) | 闲时缓存命中 0.02 元、未命中 1 元、输出 4 元 / 1M tokens | 官方开放平台已发布价格调整细则公告。2 |
原生多模态架构与性能定位
DeepSeek 在官方通知中将 V4.1 Flash 定位为中期重大升级版本。该模型采用了经过重构的模型结构,具备原生多模态支持能力。在此之前,DeepSeek 于 8 月下旬推出的
deepseek-v4-flash-vision-exp 属于实验性质的外挂方案,通过在已有的 V4 文本基座之上叠加视觉编码器与对齐层来实现图像理解。V4.1 Flash 将视觉理解能力直接融入基座设计,减少了模态转换带来的计算损耗。14在性能表现上,官方强调 V4.1 Flash 在综合能力、推理速度、调用费用和长任务总用时上全面胜过现有主力旗舰 V4 Pro。在过往的大模型阶梯中,Flash 系列主打轻量高速与低成本,Pro 系列承担复杂推理与深度工具调用。DeepSeek 官方交流群在内测问卷中将“V4.1 Flash 是否具备完全替代当前线上 V4 Pro 的能力”列为关键调查项,表明团队正在推进轻量架构对重型旗舰的实质性替代。14
官方声明与社区实测存在明确的口径边界。DeepSeek 官方目前将技术报告与详细学术榜单留待后续公布。社交网络与技术社区流传的解码吞吐数据(例如多位开发者测得的 300 至 500 tokens/秒、极值超过 500 tokens/秒)以及单项代码任务得分,均来自开发者在内测端点上的自测表现。这些数字反映了实验端点在较轻并发负载下的瞬时表现,实际高并发业务下的延迟与吞吐仍需等待正式服务上线后的大规模验证。4
价格调降与 V4 Pro 全量路由策略
伴随新模型发布预告,DeepSeek 开放平台公布了 Flash 系列的全新定价表,自北京时间 2026 年 9 月 10 日 12:00 起正式执行。本次调价继续沿用峰谷分时计费规则(高峰时段为周一至周五 09:00–12:00 与 14:00–18:00,其余为闲时时段),重点大幅降低了输入端的单价。2
| Token 类型 | 调价前闲时价格(元/1M tokens) | 9/10 12:00 起闲时价格(元/1M tokens) | 闲时降幅 | 9/10 12:00 起高峰价格(元/1M tokens) |
|---|---|---|---|---|
| 输入缓存命中 | 0.05 | 0.02 | 60.0% | 0.04 |
| 输入缓存未命中 | 1.50 | 1.00 | 33.3% | 2.00 |
| 补全输出 | 4.50 | 4.00 | 11.1% | 8.00 |
按照官方路由安排,在 V4.1 Flash 正式上线至后续 V4.1 Pro 推出前的窗口期内,所有发往
deepseek-v4-pro 的调用都会由平台后端自动路由至 V4.1 Flash,并且直接按 Flash 的价格进行计费结算。这意味着现有 V4 Pro 用户的账单单价将直接从原有高位(闲时输入未命中 3 元、输出 9 元)降至 Flash 调价后的新标准(闲时输入未命中 1 元、输出 4 元),调用成本降幅超过 50%。对于包含固定指令、长提示词与知识库文档的 Agent 应用,配合降至 0.02 元的命中缓存单价,综合调用开销将进一步压缩。123开发者接入与生产选型建议
面对新模型发布与路由切换,技术团队在接入和迁移时需要关注以下工程细节:
- 将内测临时 ID 严格隔离于生产配置之外。临时端点
deepseek-v4.1-flash-expires-on-0910带有明确的失效日期,仅支持单账号 20 路并发,专用于前哨验证与特性测试。生产集群应继续保留现有模型标识或等待官方控制台更新正式模型 ID,确保业务链路的稳定性。4 - 核验自动路由对长程 Agent 流程的实际影响。由于官方会将 V4 Pro 请求全量重定向至 V4.1 Flash,两者在思维链推理深度、工具调用的容错率以及多轮对话的上下文依从性上可能存在细微差异。使用 V4 Pro 承载高严谨度代码审查或复杂数据分析的团队,需在正式切换前后运行自动化回归测试集,校验最终输出的正确率。1
- 充分利用前缀缓存机制降低成本。9 月 10 日中午调整后,缓存命中的单价(0.02 元)仅为未命中单价(1.00 元)的五十分之一。开发者在架构多轮会话或多模态交互时,应尽量保持系统提示词、格式说明及参考图片在输入流起始位置的排列稳定性,最大化发挥缓存单价下调带来的经济效益。2
References
- 1DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型,各项指标全面超越 V4 Pro - 新浪科技
finance.sina.com.cn
- 2
- 3Models & Pricing - DeepSeek API Docs
api-docs.deepseek.com
- 4
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- DeepSeek 逆转 V4 Pro 退役计划:API 9 月 14 日后继续提供,原价结算不自动路由
- DeepSeek 首次公开 V4.1-Flash 技术报告:552B 骨干参数与 CED 架构亮相,KV 缓存压至 890 字节
- DeepSeek 正式上线 deepseek-flash:调价全面生效,9 月 14 日起全量路由接管 V4 Pro
- GLM-5.3-Flash API 促销结束:恢复标准价 $0.15/$0.50,Coding Plan 夜间免额度进行中
- Muse Spark 1.3 max 公开可用:Meta 把最强推理配置推上 Muse Code 与 API
- GPT-6 Astra 可用性更新:Pro、企业 Work/Codex 与 API 已开放
- Qwen3.8-Max-0902 更新:同一基座、同一价格,编码后训练改写表现
