DeepSeek 首次公开 V4.1-Flash 技术报告:552B 骨干参数与 CED 架构亮相,KV 缓存压至 890 字节

DeepSeek 首次公开 V4.1-Flash 技术报告:552B 骨干参数与 CED 架构亮相,KV 缓存压至 890 字节

DeepSeek 首次公开 V4.1-Flash 完整技术报告与模型卡,披露其 552B 骨干参数、分阶段激活(prefill 8B / decode 16B)的 CED 架构、压至 890 字节/token 的全局 KV 缓存与厂商自测基准,模型权重与代码遵循 MIT 协议开源。

北京时间 2026 年 9 月 10 日下午,DeepSeek 在其官方 Hugging Face 仓库中首次公开了《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》完整技术报告,并同步更新了模型卡与架构说明。12 官方仓库提交记录显示,技术报告于北京时间 13:33 至 13:51 期间上传,包含架构拓扑与 benchmark 得分的 README 文件于 15:17 至 16:18 之间完成合并。3 在此前上一期发稿时,官方文档仅开放了 API 端点与资费,正文中明确标注「官方未披露具体参数量与技术报告」。本次技术报告与模型卡的公开,标志着这款新主力模型的内部结构、参数规模、优化算法以及本地权重全面揭开面纱。12

先说结论

对于正在评估模型私有化部署、微调或构建高吞吐 Agent 系统的技术团队,本次官方技术披露锁定了以下五项核心要点:
  1. 核心参数规模首次定论为 552B,采用非对称动态激活。模型骨干参数(Backbone Parameters)为 552B,但打破了传统 MoE 架构在预填(Prefill)与解码(Decode)阶段激活相同参数量的做法。在 CED 架构下,模型在 Prefill 阶段每 token 仅激活 8B 参数,在 Decode 阶段每 token 激活 16B 参数。12
  2. 全局 KV 缓存压缩至每 token 890 字节,大幅降低显存墙限制。通过引入 Compressed Sparse Attention 2(CSA2,压缩稀疏注意力 2)跨层复用机制与 FP4 主 KV 缓存(E2M1 格式),模型驻留 HBM 的全局 KV 缓存降至 890 bytes/token,仅为上一代 DeepSeek-V4-Flash 的四分之一左右(缩减约 3.9 倍),相比初代 DeepSeek-V1 缩减约 437 倍。12
  3. 架构全面转向因果编码器-解码器(CED)配合多项工程创新。全模型共 40 层,由 20 层因果编码器与 20 层解码器组成;配合 SWA Bounded Replay(滑动窗口注意力有界重放)技术,SSD 持久化 KV 缓存仅需保留约八分之一;辅助模块集成 196B 参数的 Engram 条件记忆与 DSpark 投机解码。12
  4. 官方自测成绩在代码与 Agent 领域超越 V4 Pro。在厂商自测环境下,Instruct 版本在满血推理力度(reasoning_effort=100)下,Terminal-Bench 2.1 达 90.6、DeepSWE v1.1 解决率达 74.2%、Codeforces 评分达 3471、AutomationBench 达 54.8,均优于 DeepSeek-V4-Pro。需要注意,上述指标属于 DeepSeek 内部框架与自测口径,独立第三方评测仍待社区验证。12
  5. 权重开放且协议为宽松 MIT。官方已在 Hugging Face 开放完整模型权重(Safetensors 格式,BF16/FP8 等),代码与权重均遵循 MIT 许可证,无商业营收门槛或专有商用限制。1

快速核对:新旧世代核心规格与底层架构对比

下表整理了官方技术报告中披露的 DeepSeek-V4.1-Flash 完整规格,并与历史基准模型进行横向比对:
评估维度DeepSeek-V4.1-Flash(最新技术报告)DeepSeek-V4-Flash(上一代)DeepSeek-V4-Pro-0813(过渡旗舰)官方信源说明
模型基础架构Causal Encoder-Decoder(CED)因果编码器-解码器自回归 Decoder-Only MoE自回归 Decoder-Only MoE官方报告第 2 节详细定义了 CED 架构拓扑。12
骨干总参数量552B(另含 196B Engram 条件记忆)284B1.6T官方技术报告首次披露各版本确切骨干参数。12
每 Token 激活参数Prefill 阶段 8B / Decode 阶段 16B13B(两阶段相同)49B(两阶段相同)4.1 版首次实现预填与解码的分离非对称激活。12
MoE 专家配置1 共享专家 + 384 路由专家(激活 6 个)1 共享专家 + 256 路由专家(激活 8 个)1 共享专家 + 多路由专家路由专家数量大幅扩展至 384 个以提升稀疏表征。12
全局 KV 缓存大小890 bytes/token(HBM 驻留)3,514 bytes/token官方未公开具体字节数结合 CSA2 与 FP4 KV 缓存,占用降至上一代四分之一。12
持久化 KV 缓存约上一代 1/8(SSD 驻留)基准持久化占用需持久化完整上下文通过 SWA Bounded Replay 仅持久化关键状态。12
支持上下文与输出1M(1,000,000)上下文,384K 最大输出1M 上下文,384K 输出1M 上下文,384K 输出与当前 API 生产配置保持一致。14
视觉模态支持原生 DeepSeek-ViT(2D-RoPE + 3×3 unshuffle)实验性挂载视觉分支(Exp)不支持视觉输入预训练阶段 45T 多模态数据端到端联合训练。12
预训练语料规模45T 多模态 tokens(34T 起扩至 1M 上下文)未单独披露未单独披露官方报告 Pre-Training 章节数据。12
开源许可证MIT License(权重与代码均开源)MIT License仅提供 API 商业服务官方仓库已附带 MIT License 文件。1

架构拆解:CED、CSA2 与每 Token 890 字节缓存的实现机制

DeepSeek-V4.1-Flash 技术报告的核心贡献,集中在破解高吞吐长文本 Agent 场景下的「显存带宽墙」与「预填计算开销」。官方给出的解决方案是一套从模型拓扑、注意力算法到系统重放的系统性工程方案:2

1. 因果编码器-解码器(CED)与非对称激活

传统自回归大模型采用统一的 Decoder-Only 架构,无论在读取提示词的 Prefill 阶段还是逐字生成的 Decode 阶段,每一层都需要实时计算完整的注意力与前馈网络。在 Agent 长前缀场景下,这导致 Prefill 算力成本高昂。2
DeepSeek-V4.1-Flash 采用 40 层的 CED 架构,将其划分为 20 层因果编码器与 20 层解码器。关键设计在于:解码器的全局 KV 缓存直接由编码器最后一层的隐藏状态(Hidden States)通过线性投影生成,而不再依赖解码器内部各层重复计算。这一架构让模型在 Prefill 时仅需激活 8B 参数,而在 Decode 时激活 16B 参数。对于以长上下文提示、复杂工具调用和多轮环境反馈为主的 Agent 任务,预填阶段的计算与能量消耗大幅降低。12

2. 压缩稀疏注意力 2(CSA2)与跨层索引复用

在长序列推理中,KV 缓存膨胀是限制并发的核心瓶颈。CSA2 为每个注意力层静态指定三种工作模式之一:Full(完整模式)Reindex(重索引模式)Reuse(复用模式)。通过在层间共享主 KV 张量与索引键(Indexer K),并跨层直接复用 Top-K 稀疏注意力寻址索引,模型避免了每一层单独保存冗余 KV 状态。12
在解码器中,DeepSeek 进一步引入了分层稀疏索引器(Hierarchical Sparse Indexer),后续索引层仅在第一个 Full Mode 层建立的候选池中进行二次过滤,使得深层索引器的检索开销与整体上下文长度解耦。12
DeepSeek 历代模型 KV 缓存压缩演进
DeepSeek 官方公布的历代模型每 token 全局 KV 缓存占用演进图。V4.1-Flash 达到 890 bytes/token,相比 V4-Flash 的 3,514 bytes 缩减近 4 倍,较初代 DeepSeek-V1 缩减约 437 倍。图片来源:21

3. FP4 主 KV 缓存与 SWA Bounded Replay

除了注意力架构改进,官方在数值精度与存储层级上进行了联合压缩:12
  • FP4 主 KV 缓存:采用 E2M1 数据格式,每 16 个通道分配一个 E4M3 缩放系数。这种精细的分组量化将 HBM 中驻留的全局 KV 缓存大小直接压缩至 890 字节/token。12
  • SWA Bounded Replay(滑动窗口注意力有界重放):针对滑动窗口注意力(SWA),传统做法需要将窗口外部的 KV 状态持久化刷写到主机内存或 SSD。DeepSeek-V4.1-Flash 在推理服务中放弃了向 SSD 写入完整 SWA 状态,而是在需要时仅重放最近一个窗口长度()的少量 tokens 来即时重建丢失状态。这一系统优化将 SSD/主机内存中的持久化 KV 缓存占用压低至上一代 V4-Flash 的八分之一左右。12

4. 辅助效率模块与原生多模态视觉

报告还披露了三项强化吞吐与表达能力的辅助架构:12
  • Single-Pass mHC:采用经过改良的残差流混合机制,并搭配高效的 Mega-mHC 定制算子以提升通信吞吐。2
  • Engram 条件记忆:外置 196B 参数的静态记忆表,通过基于 token 的稀疏查表机制按需访问,在不增加稠密浮点计算负担的前提下扩展了模型的常识记忆容量。12
  • DSpark 投机解码:采用半自回归草稿生成与置信度调度校验,进一步拉高推理生成速度。12
  • 自研 DeepSeek-ViT:原生训练的视觉编码器结合 2D-RoPE 位置编码与 3×3 像素反混洗(Pixel-Unshuffle)下采样技术,通过两层 MLP 投射至语言模型隐藏空间,并在 45T 多模态数据中从初始阶段端到端联合训练。12

评测表现与能力边界:厂商自测基准深度核对

在官方技术报告与模型卡中,DeepSeek 分别给出了 Base 模型与经过后训练的 Instruct 模型的基准成绩。读者在参考这些数据时,需要注意评测口径均为厂商自测,并在特定的 Harness 环境下取得:12

1. 基础模型常识与理科基准(Base Model)

根据官方在相同内部评测框架下的测试结果,在无后训练微调的情况下,DeepSeek-V4.1-Flash-Base 与上一代 Flash 及旗舰 Pro 的对比如下:12
  • 世界知识与学科综合:MMLU-Pro 5-shot 精准匹配率(EM)达到 74.1,高于 V4-Pro-Base 的 73.5 与 V4-Flash-Base 的 68.3;C-Eval 为 92.1(V4-Pro-Base 为 93.1);AGIEval 为 83.4(V4-Pro-Base 为 84.4)。1
  • 代码与数学推理:HumanEval 0-shot Pass@1 达到 79.4%,显著领先 V4-Pro-Base(76.8%)与 V4-Flash-Base(69.5%);BigCodeBench 3-shot 为 60.6%(高于 Pro 的 59.2%);GSM8K 8-shot 为 93.0%(高于 Pro 的 92.6%);但在 MATH 4-shot 上,V4.1-Flash-Base 为 61.1%,仍略低于 V4-Pro-Base 的 64.5%。1
  • 原生多模态表现:MMMU-Pro 4-shot 为 56.5,DocVQA 为 95.6,CVBench 为 77.9,补齐了此前 Base 模型无原生多模态评分的空白。1

2. Instruct 模型在 Agent 与复杂编码任务的表现

在后训练阶段,DeepSeek 采用了大规模自动化 Agent 任务合成配合强化学习(RL)与同策略蒸馏(On-Policy Distillation)。模型支持 reasoning_effort 从 1 到 100 整数连续调节。官方公布的最高推理力度(reasoning_effort=100,采样参数 temperature=1.0, top_p=0.95)评测显示:12
DeepSeek-V4.1-Flash 官方 Agentic 基准对比柱状图
DeepSeek 官方公布的 V4.1-Flash 与 Kimi-K3、GLM-5.3、Claude Opus-5.0、GPT-5.6 Sol 在 4 项核心 Agentic 基准上的自测得分对比。图片来源:12
  • 软件工程解决能力(DeepSWE v1.1):使用官方 mini-swe-agent 运行环境下,DeepSeek-V4.1-Flash 的解决率达到 74.2%,不仅超越 V4-Pro(62.7%)与 V4-Flash(54.4%),也微幅超越 GPT-5.6 Sol(73.0%)与 Opus-5.0(74.0%)。官方模型卡同时公布了不同 Agent 脚手架下的表现:在 DSH Minimal 下为 72.6%,Claude Code 下为 69.8%,Codex 下为 65.6%。1
  • 终端与环境交互(Terminal-Bench):在无网络环境的 Terminal-Bench 2.1 上,V4.1-Flash 取得 90.6% 的 Pass@1,名列第一;而在更严苛的 Terminal-Bench 3.0 与 4.0 上,其得分分别为 30.0% 与 31.2%,相比上一代 V4-Flash(7.6% / 7.0%)有跨代提升,但相比行业顶级基准 Opus-5.0(43.3% / 51.8%)仍有清晰差距。1
  • 网络安全与自动化:CyberGym 取得 88.1% Pass@1,优于 GLM-5.3(84.5%)与 GPT-5.6 Sol(84.5%);AutomationBench 达到 54.8%,优于 Opus-5.0(50.3%);在竞赛编程 Codeforces 上,官方测得评分达到 3471 分。1

本地推理生态与开发者工程建议

伴随权重与技术报告公开,DeepSeek 针对本地开发者与系统集成商同步开源了配套工程工具,并对部署环境提出了明确规范:1

1. 放弃 Jinja 模板,推出专用 deepseek-recipe 工具库

针对复杂对话、图像穿插、工具调用以及推理力度控制,本次发布未随附传统的 Jinja-format 模板。官方在仓库中提供了自包含的 Python 参考实现 encoding.py,并单独在 GitHub 开源了用 Rust 开发并提供 Python 绑定的专用库 deepseek-recipe15 该工具库能够直接将 OpenAI 兼容的 Messages、Chat Completions 以及 Responses API 请求转换为 DeepSeek V4 与 V4.1 的原生 Prompt 与 Token ID,并负责将流式与完整输出反向解析为思考链与工具调用,工程团队无需再手写脆弱的正则解析器。15

2. 本地推理与私有化部署建议

  • 显存与硬件评估:尽管模型在 HBM 中的 KV 缓存压低至 890 bytes/token,但由于 552B 骨干参数的存在,即使经过 FP8 量化或激活稀疏化,完整的本地全精度推理仍然需要企业级多卡集群(如多台 8×80GB GPU 节点)。对于显存有限的团队,优先采用 API 调用更为经济实用。14
  • 长文本 Agent 架构优化:对于自建长前缀知识库或代码排错系统的团队,技术报告证实了前缀缓存(Prefix Caching)的绝对价值。由于解码器全局 KV 可以由编码器最后一层直接映射,在业务中固定系统提示与工具协议顺序,能够最大化利用底层 KV 复用机制,大幅压缩并发请求时的计算与传输延迟。12
  • 商业集成权限:由于代码与权重均获得宽松的 MIT License 授权,企业与开发者可以直接将模型集成于商业系统、SaaS 平台或私有化算网中,无需额外签署定制授权协议。1

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel