DeepSeek把KV缓存压到四分之一,轻量模型凭什么接管旗舰?

DeepSeek把KV缓存压到四分之一,轻量模型凭什么接管旗舰?

DeepSeek发布V4.1-Flash并宣布其将接管V4-Pro商业流量;本文拆解其KV缓存压缩至四分之一的工程机制与算力账本,说明大模型竞争为何正在从参数上限转向推理吞吐。

导读

大模型工程的竞争重心,正在从比拼参数规模上限,转向比拼每 token 的长程推理吞吐与显存驻留成本。
作者丨 AI 科技评论编辑部
编辑丨林默
大模型行业过去习惯了一种线性的叙事。
每次版本号往前跳跃,伴随而来的往往是更庞大的参数量、更昂贵的算力消耗,以及一份击败上一代旗舰的跑分表。
在过去的预期里,旗舰模型负责开拓能力边界,轻量模型负责降级妥协。
这种惯性在 2026 年 9 月 10 日迎来了转向。
路透社在当天下午刊发简短电讯,报道中国人工智能初创企业 DeepSeek 正式推出 DeepSeek-V4.1-Flash 模型。1
路透社引述公司声明称,该模型是其全新架构家族中体量最小的一款,专为更强能力、更快推理、更高吞吐与扩展至更大模型而设计。1
路透社电讯报道的是发布动作本身,DeepSeek 官方公布的接口调整则揭示了更具体的商业安排。
DeepSeek 没有按惯例先推出体量更大的旗舰,而是宣布将原有的旗舰接口直接定向至轻量模型。

01|轻量接管旗舰的倒计时

AI 科技评论注意到,比模型发布本身更关键的动作,藏在 DeepSeek 官方 API 的变更日志里。
DeepSeek 官方公告明确宣布,自北京时间 2026 年 9 月 14 日 12 时起,直到未来 V4.1-Pro 上线之前,所有发往旗舰接口 deepseek-v4-pro 的调用请求,都将自动路由至 V4.1-Flash,并统一按照 Flash 的费率计费。23
官方对此给出的理由是,经过密集测试,V4.1-Flash 在综合性能、运行成本、响应速度和端到端总耗时上,已经超过现有的 V4-Pro。23
这是大模型商业化进程中罕见的举措:模型实验室主动通过接口路由,由轻量版本全面接管原有旗舰版本的商业流量。
在 Hugging Face 社区,DeepSeek 同步放出了遵循 MIT 协议的开源权重,宣布支持 100 万 token 的上下文窗口与 38.4 万 token 的单次最大输出。4
翻开开源模型卡,V4.1-Flash 的底座并非小规模模型。
它的主干由 5520 亿(552B)参数的混合专家(MoE)结构构成。4
它的核心在于稀疏激活控制。
在预填充阶段,每个 token 仅激活 80 亿(8B)参数;在解码阶段,每个 token 仅激活 160 亿(16B)参数。4
未被激活的专家网络在计算时不参与前向传播,系统只调用被选中的路由专家进行实时运算。
这种计算形态如同自动化立体仓库。
成千上万个货架整齐排布,每一次取货仅调动两台敏捷的穿梭车。
在 AI 科技评论看来,V4.1-Flash 展现的趋势在于,轻量模型正通过控制激活参数规模,把长上下文场景下的单次计算开销压降到生产可用区间。
商业接口从 Pro 切换至 Flash,反映出模型服务商开始将显存占用与推理速度视作首要指标。

02|把 KV 缓存压到 890 字节

阻碍大模型走向复杂 Agent 生产环境的物理瓶颈,集中在 GPU 显存的带宽与容量限制中。
行业早期主要关注浮点算力峰值。
随着长上下文检索和多轮工具调用成为常态,系统运行中产生的键值(KV)缓存成为吞噬显存的主要来源。
当一个 Agent 在 100 万 token 的代码库或长文档中持续推理时,历史上下文留下的 KV 缓存会迅速占满高带宽显存。
算力核心往往需要等待显存的数据搬运。
为了降低显存占用,DeepSeek 在 V4.1-Flash 中采用了因果编解码器(CED)架构。4
该架构由 20 层因果编码器与 20 层解码器构成。4
解码器的全局 KV 状态由编码器最后一层的隐藏状态投影得到,避免了每层独立计算和存储全局 KV 的开销。4
结合第二代压缩稀疏注意力(CSA2)、层级稀疏索引与 FP4 低精度主 KV 缓存,系统将每个 token 占用的全局 KV 缓存降低至 890 字节。34
890 字节大约是前代 V4-Flash(3514 字节)的四分之一,更远低于 2023 年底初代 DeepSeek-V1 的 389,120 字节。3
DeepSeek 官方公布的历代全局 KV 缓存单 token 占用对比
DeepSeek 历代模型每 token 全局 KV 缓存占用变化:从初代 V1 的 389,120 字节降至 V4.1-Flash 的 890 字节。3
KV 缓存体积的大幅收缩,直接缓解了显存容量对长程任务并发处理的约束。
在官方 API 规则中,DeepSeek 将 V4.1-Flash 的并发调用上限设为 2500,高于 V4-Pro 的 500 上限。5
单 token 显存占用的降低,使得服务器在承载多轮长文本会话时能保持更高的驻留效率。
DeepSeek 官方技术报告以《逼近 KV 缓存压缩极限》为题,显示出研发重点对硬件资源瓶颈的针对性优化。
模型不仅需要在算法层面提升智能,更需要在有限硬件规格下实现更高的吞吐效率。

03|降价背后的算力账本

伴随模型上线,DeepSeek 的 API 价格体系完成了新一轮调整。
新价格在北京时间 9 月 10 日 12 时起正式执行。5
在空闲时段,缓存命中的输入价格为每百万 token 0.003 美元(约合人民币 0.02 元),未命中输入为 0.15 美元(约合人民币 1 元),输出价格为 0.6 美元(约合人民币 4 元)。5
高峰时段各项单价均为对应空闲时段的两倍。5
第一财经统计指出,对比 8 月中旬涨价后的执行价格,新版空闲时段缓存命中单价降低 60%,未命中输入降价约 33%,输出价格降幅约 11%。6
观察这轮调价需要结合历史基线。
在 2026 年 8 月中旬之前,DeepSeek 曾因算力供求压力对 API 进行过一次整体提价。6
当前空闲时段的输入单价虽然回到了 8 月涨价前的水平,但每百万 token 4 元人民币的输出价格,依然是此前 2 元价格的两倍。6
这次价格调整主要体现为对上一轮紧缺溢价的部分回调,降价重点集中在显存开销下降的缓存命中环节。
缓存命中单价的下调,与 KV 缓存压缩技术形成呼应。
历史上下文占用的显存体积减少,服务商维护缓存上下文的硬件成本相应降低,使服务商具备向高频调用场景让利的余地。
在价格之外,DeepSeek 官方公布的基准测试结果同样呈现出明确的特征。
在官方披露的 19 项评测指标中,V4.1-Flash 在代码与特定 Agent 自测项目上表现突出。4
其在 Terminal-Bench 2.1 上取得 90.6 分,接近 Claude Opus-5.0 的 89.1 分;在软件工程评测 DeepSWE v1.1 上取得 74.2 分,与 Opus-5.0 的 74.0 分持平。4
但在处理长程系统交互与通用推理任务时,模型依然存在能力边界。
在考察长程终端任务的 Terminal-Bench 3.0 上,V4.1-Flash 得分为 30.0 分,低于 Opus-5.0 的 43.3 分;在 Terminal-Bench 4.0 上,其得分为 31.2 分,低于 Opus-5.0 的 51.8 分。4
在考察科学推理的 GPQA Diamond 测试中,V4.1-Flash 录得 90.9 分,同样低于 Opus-5.0 的 93.4 分。4
厂商自测分数展示了特定评测框架下的表现。
实际工程部署依然需要面对各种复杂任务的检验。

04|等待三张验收清单

路透社在报道末尾提及,DeepSeek 正在准备上海证券交易所科创板上市。17
随着企业走向公开资本市场,研发与技术指标需要转化为可持续的商业收入与健康的毛利率,这对实际部署效益提出了更严格的要求。
在 AI 科技评论看来,V4.1-Flash 在接管旗舰流量之后,产业界正在等待三项更具体的验证结果。
第一项是独立第三方机构的同口径实测。
截至北京时间 9 月 10 日下午,大模型独立评测机构 Artificial Analysis 的数据库中仅收录了 V4-Pro 和旧版 V4-Flash,尚未录入 V4.1-Flash 的独立评测数据。8
官方自测的基准数据,仍需等待第三方在盲测机制、实际生成吞吐量(tokens/s)与首字时延(TTFT)维度的独立复验。
第二项是异构硬件集群上的大规模部署表现。
DeepSeek 在官方公告中公开征集拥有 2000 块以上 GPU 规模的集群合作方。3
这类结合因果编解码与稀疏注意力的模型架构,在进入不同企业与云厂商的生产环境时,其算子兼容性与多机调度效率有待实践检验。
第三项是未来高阶新架构的定位。
官方在更新日志中说明,现有接口替换将持续至“未来 V4.1-Pro 上线”。2
当只激活 8B/16B 参数的轻量模型在特定代码任务上逼近原有旗舰,后续完整规格的新模型能否在长程推理与复杂决策任务中建立新的能力基准,成为接下来的关注点。
轻量模型开始接管旗舰接口,表明大模型竞争正从单纯追求参数规模,转向追求每 token 的工程效益。
在算力供给与硬件成本的现实制约下,能够在有限显存空间内提供高吞吐和高并发的模型,正在赢得长期的工业部署空间。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado