Kimi K3 完整权重开放:2.8T MoE、104B 激活,技术报告补齐架构细节

Kimi K3 完整权重开放:2.8T MoE、104B 激活,技术报告补齐架构细节

Kimi K3 完整权重已在 Hugging Face 开放,技术报告公开 896 专家、KDA/AttnRes、MXFP4 等细节;本文梳理 benchmark、API 价格和本地部署限制。

先说结论

Kimi K3 的完整模型权重已经在 Hugging Face 开放下载,官方技术报告也随之公开。对开发者来说,这次更新把 K3 从「API 先行、权重待发布」推进到了可以自行部署和研究的阶段:2.8T 总参数、104B 激活参数、1,048,576 Token 上下文、原生视觉能力,以及 MXFP4 权重和 MXFP8 激活的量化训练细节,都能在官方模型页和报告入口中核对。12
这是一条实质性的后续更新,不是首发消息的重复。Kimi API 仍可调用,但本地部署、推理引擎适配和对架构的二次研究现在有了公开入口。

这次新增了什么

项目已确认信息
更新时间2026 年 7 月 27 日,Hugging Face 模型页显示完整权重已更新
模型形态开放权重、原生多模态 Agent 模型
总参数2.8T
激活参数104B
上下文长度1,048,576 Token
专家结构896 个专家,每个 Token 选择 16 个专家,另有 2 个共享专家
注意力层69 层 Kimi Delta Attention,24 层 Gated MLA
视觉编码器MoonViT-V2,401M 参数
量化MXFP4 权重、MXFP8 激活,采用量化感知训练
许可Kimi K3 License
上表的「104B 激活参数」是模型页明确列出的规格,不能和总参数 2.8T 混为一谈。896 个专家中的 16 个被选中,也不等于每次推理只需要加载 104B 的显存;实际部署还要看权重格式、并行方式、KV Cache 和推理引擎。1

技术报告补齐了哪些细节

Kimi K3 的核心架构可以拆成三层理解。
第一层是长上下文注意力。K3 将 Kimi Delta Attention(KDA)和 Gated MLA 混合使用,模型页列出的比例是 69 层 KDA 加 24 层 Gated MLA。KDA 负责更高效地处理长序列,Gated MLA 保留全局信息交互;Attention Residuals 则让模型可以跨深度选择性取回表示,而不是把每一层的信息一股脑累加。12
第二层是 Stable LatentMoE。它把路由专家数量扩展到 896 个,但每个 Token 只选择 16 个专家,官方称这套设计相较 Kimi K2 带来约 2.5 倍的整体 scaling efficiency 提升。这个数字是厂商对自身训练和扩展效率的披露,不是独立机构对推理速度或成本的复测。13
第三层是量化和训练方式。K3 从 SFT 阶段开始做量化感知训练,使用 MXFP4 权重和 MXFP8 激活。对于超大规模 MoE 来说,这个信息比「2.8T」本身更直接地影响部署:它决定了硬件兼容性、权重存储方式和推理栈需要支持的数值格式。1

Benchmark:接近前沿,但不是全线第一

下面的数字来自 Moonshot 发布的完整评测表。Kimi K3 使用最高思考强度;不同项目使用的 Agent harness 不同,表中的 Claude Fable 5 还标注了 fallback,因此这些数字适合做方向判断,不适合当成严格统一协议下的排行榜。1
BenchmarkKimi K3Claude Fable 5GPT-5.6 Sol读法
ProgramBench77.876.877.6K3 略高于两者
Terminal-Bench 2.188.388.088.8接近 GPT-5.6 Sol,仍低 0.5
FrontierSWE81.286.671.3低于 Fable 5,高于 GPT-5.6 Sol
SWE-Marathon42.035.039.0K3 在官方表中领先
BrowseComp91.288.090.4K3 高于两者
OmniDocBench91.189.885.8文档理解项目中领先
K3 的强项集中在长程编程、工具调用和文档型 Agent 任务。它在 DeepSWE 上是 67.5,低于 Fable 5 的 70.0 和 GPT-5.6 Sol 的 73.0;在 GDPval-AA v2 这类更贴近综合知识工作的指标上,K3 为 1686,也低于 Fable 5 的 1747 和 GPT-5.6 Sol 的 1736。读者不应该把「开放权重」和「所有任务超过闭源模型」画上等号。1

现在怎么用

本地部署:完整权重入口是 Hugging Face 的 moonshotai/Kimi-K3 模型页,许可为 Kimi K3 License。官方 README 当前推荐 vLLM、SGLang 和 TokenSpeed 三类推理引擎,并提供对应的 recipe 或 cookbook 链接。1
API 调用:Kimi API 的模型名仍是 kimi-k3,提供 OpenAI 和 Anthropic 兼容接口。官方价格是缓存命中输入 $0.30 / MTok、缓存未命中输入 $3.00 / MTok、输出 $15.00 / MTok。13
接入 Agent 时的硬限制:K3 采用 preserved thinking history 训练方式。多轮对话和工具调用必须把 API 返回的完整 assistant 消息原样传回,包括 reasoning_contenttool_calls,不能只保留最终 content。如果中途从另一个模型切换到 K3,官方提示生成质量可能明显不稳定。1
这意味着第一次测试不应只发一个聊天请求。更稳妥的做法是固定 Agent harness、工具集合和预算,分别测试长代码库、视觉调试、文档研究和多轮工具调用,再观察完整思考历史是否能在自己的框架中正确保存与回传。

给开发者的判断

如果目标是研究超大规模 MoE、长上下文注意力或开放权重 Agent,Kimi K3 现在已经值得下载评估。若目标是立刻获得最稳定的综合办公体验,官方表格本身也显示它在 GDPval-AA、FrontierSWE 和部分视觉任务上仍落后于 Fable 5 或 GPT-5.6 Sol。
本轮更新最适合被理解为「可部署性和可研究性显著增加」,而不是一次单纯的 benchmark 宣称。完整权重、技术报告和 API 三条路径已经同时存在,下一步差异会落在硬件规模、推理栈和 Agent 框架的实际适配上。

Related content

  • Sign in to comment.
More from this channel