
Kimi K3 完整权重开放:2.8T MoE、104B 激活,技术报告补齐架构细节
Kimi K3 完整权重已在 Hugging Face 开放,技术报告公开 896 专家、KDA/AttnRes、MXFP4 等细节;本文梳理 benchmark、API 价格和本地部署限制。
先说结论
Kimi K3 的完整模型权重已经在 Hugging Face 开放下载,官方技术报告也随之公开。对开发者来说,这次更新把 K3 从「API 先行、权重待发布」推进到了可以自行部署和研究的阶段:2.8T 总参数、104B 激活参数、1,048,576 Token 上下文、原生视觉能力,以及 MXFP4 权重和 MXFP8 激活的量化训练细节,都能在官方模型页和报告入口中核对。12
这是一条实质性的后续更新,不是首发消息的重复。Kimi API 仍可调用,但本地部署、推理引擎适配和对架构的二次研究现在有了公开入口。
这次新增了什么
| 项目 | 已确认信息 |
|---|---|
| 更新时间 | 2026 年 7 月 27 日,Hugging Face 模型页显示完整权重已更新 |
| 模型形态 | 开放权重、原生多模态 Agent 模型 |
| 总参数 | 2.8T |
| 激活参数 | 104B |
| 上下文长度 | 1,048,576 Token |
| 专家结构 | 896 个专家,每个 Token 选择 16 个专家,另有 2 个共享专家 |
| 注意力层 | 69 层 Kimi Delta Attention,24 层 Gated MLA |
| 视觉编码器 | MoonViT-V2,401M 参数 |
| 量化 | MXFP4 权重、MXFP8 激活,采用量化感知训练 |
| 许可 | Kimi K3 License |
上表的「104B 激活参数」是模型页明确列出的规格,不能和总参数 2.8T 混为一谈。896 个专家中的 16 个被选中,也不等于每次推理只需要加载 104B 的显存;实际部署还要看权重格式、并行方式、KV Cache 和推理引擎。1
技术报告补齐了哪些细节
Kimi K3 的核心架构可以拆成三层理解。
第一层是长上下文注意力。K3 将 Kimi Delta Attention(KDA)和 Gated MLA 混合使用,模型页列出的比例是 69 层 KDA 加 24 层 Gated MLA。KDA 负责更高效地处理长序列,Gated MLA 保留全局信息交互;Attention Residuals 则让模型可以跨深度选择性取回表示,而不是把每一层的信息一股脑累加。12
第二层是 Stable LatentMoE。它把路由专家数量扩展到 896 个,但每个 Token 只选择 16 个专家,官方称这套设计相较 Kimi K2 带来约 2.5 倍的整体 scaling efficiency 提升。这个数字是厂商对自身训练和扩展效率的披露,不是独立机构对推理速度或成本的复测。13
第三层是量化和训练方式。K3 从 SFT 阶段开始做量化感知训练,使用 MXFP4 权重和 MXFP8 激活。对于超大规模 MoE 来说,这个信息比「2.8T」本身更直接地影响部署:它决定了硬件兼容性、权重存储方式和推理栈需要支持的数值格式。1
Benchmark:接近前沿,但不是全线第一
下面的数字来自 Moonshot 发布的完整评测表。Kimi K3 使用最高思考强度;不同项目使用的 Agent harness 不同,表中的 Claude Fable 5 还标注了 fallback,因此这些数字适合做方向判断,不适合当成严格统一协议下的排行榜。1
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 读法 |
|---|---|---|---|---|
| ProgramBench | 77.8 | 76.8 | 77.6 | K3 略高于两者 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 接近 GPT-5.6 Sol,仍低 0.5 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 低于 Fable 5,高于 GPT-5.6 Sol |
| SWE-Marathon | 42.0 | 35.0 | 39.0 | K3 在官方表中领先 |
| BrowseComp | 91.2 | 88.0 | 90.4 | K3 高于两者 |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 文档理解项目中领先 |
K3 的强项集中在长程编程、工具调用和文档型 Agent 任务。它在 DeepSWE 上是 67.5,低于 Fable 5 的 70.0 和 GPT-5.6 Sol 的 73.0;在 GDPval-AA v2 这类更贴近综合知识工作的指标上,K3 为 1686,也低于 Fable 5 的 1747 和 GPT-5.6 Sol 的 1736。读者不应该把「开放权重」和「所有任务超过闭源模型」画上等号。1
现在怎么用
本地部署:完整权重入口是 Hugging Face 的 moonshotai/Kimi-K3 模型页,许可为 Kimi K3 License。官方 README 当前推荐 vLLM、SGLang 和 TokenSpeed 三类推理引擎,并提供对应的 recipe 或 cookbook 链接。1
API 调用:Kimi API 的模型名仍是
kimi-k3,提供 OpenAI 和 Anthropic 兼容接口。官方价格是缓存命中输入 $0.30 / MTok、缓存未命中输入 $3.00 / MTok、输出 $15.00 / MTok。13接入 Agent 时的硬限制:K3 采用 preserved thinking history 训练方式。多轮对话和工具调用必须把 API 返回的完整 assistant 消息原样传回,包括
reasoning_content 和 tool_calls,不能只保留最终 content。如果中途从另一个模型切换到 K3,官方提示生成质量可能明显不稳定。1这意味着第一次测试不应只发一个聊天请求。更稳妥的做法是固定 Agent harness、工具集合和预算,分别测试长代码库、视觉调试、文档研究和多轮工具调用,再观察完整思考历史是否能在自己的框架中正确保存与回传。
给开发者的判断
如果目标是研究超大规模 MoE、长上下文注意力或开放权重 Agent,Kimi K3 现在已经值得下载评估。若目标是立刻获得最稳定的综合办公体验,官方表格本身也显示它在 GDPval-AA、FrontierSWE 和部分视觉任务上仍落后于 Fable 5 或 GPT-5.6 Sol。
本轮更新最适合被理解为「可部署性和可研究性显著增加」,而不是一次单纯的 benchmark 宣称。完整权重、技术报告和 API 三条路径已经同时存在,下一步差异会落在硬件规模、推理栈和 Agent 框架的实际适配上。
Related content
- Sign in to comment.
