Kimi K3 发布:2.8T 参数、1M 上下文,完整权重定于 7 月 27 日前开放

Kimi K3 发布:2.8T 参数、1M 上下文,完整权重定于 7 月 27 日前开放

月之暗面发布 Kimi K3,本文梳理 2.8T MoE、1M 上下文、官方 benchmark、API 价格、完整权重时间表和开发者测试建议。

先说结论

月之暗面在 2026 年 7 月 16 日发布 Kimi K3。它把 2.8T 总参数、1M Token 上下文、原生视觉理解和长周期 Agent 编程放进同一个模型,并先开放 Kimi 产品与 API。对开发者来说,今天可以开始调用和测试;对想本地部署的人来说,完整权重要等到官方承诺的 7 月 27 日前发布,首发当天还不能把它当成已经可下载的模型。12

这次发布了什么

项目已确认信息
模型Kimi K3,月之暗面新一代旗舰基础模型
发布时间2026 年 7 月 16 日
参数规模2.8T,总参数;官方未给出单次推理的激活参数总量
架构MoE,结合 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE;官方描述为有效激活 896 个专家中的 16 个
上下文1M Token
模态原生视觉理解,面向文本、图片和视频等多模态任务
权重官方称完整模型权重将在 2026 年 7 月 27 日前发布
API模型名为 kimi-k3,Kimi API 已可用
其中,2.8T 是总参数规模,不能直接换算成显存需求或单次推理成本。官方还没有公布完整技术报告,激活参数量、推荐的量化部署配置和最终权重许可细节,仍要等后续资料。上述架构、上下文和权重时间表来自 Kimi 官方发布页。1
月之暗面把 K3 的重点放在三类工作上:长时间运行的软件工程任务、复杂知识工作和推理。官方案例包括在大代码仓库中持续操作终端、结合截图迭代前端和游戏项目,以及从论文、数据处理到交互式报告的一整套研究流程。这里的能力描述主要来自厂商案例,适合用来判断产品定位,不等同于独立复测结果。1

Benchmark 怎么看

官方首发页给出了完整对比表。Kimi K3 的所有结果都使用最大思考强度,温度为 1.0、top-p 为 1.0;不同 benchmark 使用了 KimiCode、Claude Code 或 Codex 等不同 harness,不能把不同项目的数字当成同一套实验直接横比。下面摘录几项对软件工程选型最有参考价值的结果:1
BenchmarkKimi K3 (max)官方表内最高分读法
DeepSWE67.5GPT-5.6 Sol:73.0高于表内 GLM-5.2 的 46.2,但不是该表最高
Program Bench77.8Kimi K3:77.8高于 GPT-5.6 Sol 的 77.6 和 GLM-5.2 的 63.7
Terminal Bench 2.188.3GPT-5.6 Sol:88.8与最高分接近,高于 GLM-5.2 的 82.7
FrontierSWE81.2Claude Fable 5:86.6高于 GPT-5.6 Sol、Opus-4.8、GPT-5.5 和 GLM-5.2
SWE Marathon42.0Kimi K3:42.0高于 Opus-4.8 的 40.0 和 GPT-5.6 Sol 的 39.0
Kimi K3 官方软件工程 benchmark 对比图
Kimi K3 在软件工程 benchmark 中的官方对比结果。1
官方表中的 Kimi Code Bench 2.0 是内部项目,Kimi K3 得分 72.9;这类结果可以帮助理解厂商自己的工作流定位,但不应和公开 benchmark 混为一谈。发布报道还提到 SWE-bench Verified、LiveCodeBench、Tau2 和 AIME 等项目,并将 K3 描述为开源模型中的领先选手,但首发官方页面没有为这些项目列出可复核的具体分数,所以这里不补写数字。12

现在怎么用

Kimi K3 已经出现在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API。Kimi Work 桌面端需要 3.1.0 或更高版本,Kimi Code 可以在终端中通过 /model 选择 Kimi K3;API 平台列出的模型名是 kimi-k3,并确认了 1M Token 上下文。13
API 价格如下,单位是美元每百万 Token:
计费项价格
缓存命中输入$0.30
缓存未命中输入$3.00
输出$15.00
官方称,Kimi API 在编码工作负载中的缓存命中率超过 90%。这属于厂商披露的服务侧数据,实际账单仍取决于请求前缀、缓存策略和你的调用方式。13

选型时要留意的限制

Kimi 官方在发布页主动列出三点限制:如果 agent harness 没有完整传回历史思考内容,或者在会话中途从另一个模型切换到 K3,生成质量可能明显不稳定;模型在任务边界含糊时可能过度主动替用户做决定;整体用户体验仍落后于最强的闭源模型。对接入现有编程 Agent 的团队,保留完整 thinking history、固定系统约束,并在 AGENTS.md 中写清不可越过的操作边界,比只看一个 benchmark 排名更重要。1

给开发者的判断

Kimi K3 最值得立即测试的地方,是长代码库、截图加代码的视觉调试,以及需要连续调用工具的研究任务。建议先用 API 做一轮固定 prompt、固定工具和固定预算的 A/B 测试,再决定是否等待完整权重落地;不要根据 2.8T 总参数直接估算本地部署成本,也不要把官方自测表格当作独立排行榜。
7 月 27 日前后的两个信号值得继续跟踪:完整权重是否按期发布,以及技术报告是否补齐激活参数、权重许可、训练细节和更多公开 benchmark。1

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel