1/5

Kimi K3 公开权重:先用 API,再谈自托管

Kimi K3 公开权重后的首轮评测:从 API、Kimi Code 到自托管,先看价格、硬件门槛和最短试用路线。

7 月 27 日,Moonshot AI 的 Kimi K3 官方仓库出现公开权重资料更新,Hugging Face 模型卡也在同日更新。这个增量值得单独看,但重点不是「下载链接在哪」,而是公开权重之后,普通团队到底该走哪条入口。1 2

先记住 3 个数字

Kimi K3 是 MoE 模型,总参数 2.8T,激活参数 104B,支持 1,048,576 token 上下文,并具备原生视觉能力。2
这组数字很容易让人先想到本地部署,但官方技术博客给出的路线是:Kimi.com、Kimi Work、Kimi Code、Kimi API 都能用 K3;公开权重只是把研究与自托管的可能性打开,不代表个人电脑马上能跑。3

最短上手路线

  1. 打开 Kimi API Platform,选择 kimi-k3,先用一份可回滚仓库做只读分析、补测试或写文档。
  2. 如果你的任务本来就在终端里,走 Kimi Code,在会话里用 /model 选择 kimi-k3。官方模型卡把 Kimi Code 列为 K3 的 coding agent framework。2
  3. 做多轮调用时,完整保留上一轮返回的 reasoning_contenttool_calls。模型卡明确提醒,缺掉 thinking history,质量可能变得不稳定;中途从别的模型切换到 K3 也不推荐。2

API 价格怎么读

官方技术博客列出的 Kimi API 单价是:缓存命中输入 $0.30 / MTok,缓存未命中输入 $3.00 / MTok,输出 $15.00 / MTok。按这个口径,100 万缓存未命中输入加 10 万输出约为 $4.50。3
这是先做真实验证的低门槛入口。自托管还要另算推理集群、显存、并行、运维和带宽,不能把「开放权重」理解成「零成本」。

自托管的硬边界

官方技术博客建议把 Kimi K3 部署在 64 个或更多加速器的 supernode 配置上,并提到 MXFP4 权重、MXFP8 激活值和 vLLM 社区实现;模型卡另外列出 vLLM、SGLang、TokenSpeed 三条推理引擎路线。3 2
所以首轮建议很简单:先用 API 或 Kimi Code 验证任务价值,等有稳定的调用量、硬件预算和工程维护人,再评估自托管。商用前也要读完 Kimi K3 License

和 GPT-5.6、Claude Fable 5 怎么选

Kimi 官方技术博客把 GPT-5.6 Sol 和 Claude Fable 5 列为更强的 proprietary models,同时承认 Kimi K3 的整体体验仍有差距。反过来,Kimi K3 的优势是公开权重、原生视觉、百万上下文,以及一条清楚的 API 入口。这个对比更适合用同一份真实任务做 A/B,不适合只看榜单。3
我的判断:想用公开权重和官方 API 先做验证,值得试;想在个人电脑本地跑,先别下载,先算集群成本。

Related content

Comments

Sign in to comment.