
Kimi K3 发布:2.8T 参数、1M 上下文,完整权重定于 7 月 27 日前开放
月之暗面发布 Kimi K3,本文梳理 2.8T MoE、1M 上下文、官方 benchmark、API 价格、完整权重时间表和开发者测试建议。
先说结论
月之暗面在 2026 年 7 月 16 日发布 Kimi K3。它把 2.8T 总参数、1M Token 上下文、原生视觉理解和长周期 Agent 编程放进同一个模型,并先开放 Kimi 产品与 API。对开发者来说,今天可以开始调用和测试;对想本地部署的人来说,完整权重要等到官方承诺的 7 月 27 日前发布,首发当天还不能把它当成已经可下载的模型。12
这次发布了什么
| 项目 | 已确认信息 |
|---|---|
| 模型 | Kimi K3,月之暗面新一代旗舰基础模型 |
| 发布时间 | 2026 年 7 月 16 日 |
| 参数规模 | 2.8T,总参数;官方未给出单次推理的激活参数总量 |
| 架构 | MoE,结合 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE;官方描述为有效激活 896 个专家中的 16 个 |
| 上下文 | 1M Token |
| 模态 | 原生视觉理解,面向文本、图片和视频等多模态任务 |
| 权重 | 官方称完整模型权重将在 2026 年 7 月 27 日前发布 |
| API | 模型名为 kimi-k3,Kimi API 已可用 |
其中,2.8T 是总参数规模,不能直接换算成显存需求或单次推理成本。官方还没有公布完整技术报告,激活参数量、推荐的量化部署配置和最终权重许可细节,仍要等后续资料。上述架构、上下文和权重时间表来自 Kimi 官方发布页。1
月之暗面把 K3 的重点放在三类工作上:长时间运行的软件工程任务、复杂知识工作和推理。官方案例包括在大代码仓库中持续操作终端、结合截图迭代前端和游戏项目,以及从论文、数据处理到交互式报告的一整套研究流程。这里的能力描述主要来自厂商案例,适合用来判断产品定位,不等同于独立复测结果。1
Benchmark 怎么看
官方首发页给出了完整对比表。Kimi K3 的所有结果都使用最大思考强度,温度为 1.0、top-p 为 1.0;不同 benchmark 使用了 KimiCode、Claude Code 或 Codex 等不同 harness,不能把不同项目的数字当成同一套实验直接横比。下面摘录几项对软件工程选型最有参考价值的结果:1
| Benchmark | Kimi K3 (max) | 官方表内最高分 | 读法 |
|---|---|---|---|
| DeepSWE | 67.5 | GPT-5.6 Sol:73.0 | 高于表内 GLM-5.2 的 46.2,但不是该表最高 |
| Program Bench | 77.8 | Kimi K3:77.8 | 高于 GPT-5.6 Sol 的 77.6 和 GLM-5.2 的 63.7 |
| Terminal Bench 2.1 | 88.3 | GPT-5.6 Sol:88.8 | 与最高分接近,高于 GLM-5.2 的 82.7 |
| FrontierSWE | 81.2 | Claude Fable 5:86.6 | 高于 GPT-5.6 Sol、Opus-4.8、GPT-5.5 和 GLM-5.2 |
| SWE Marathon | 42.0 | Kimi K3:42.0 | 高于 Opus-4.8 的 40.0 和 GPT-5.6 Sol 的 39.0 |

官方表中的 Kimi Code Bench 2.0 是内部项目,Kimi K3 得分 72.9;这类结果可以帮助理解厂商自己的工作流定位,但不应和公开 benchmark 混为一谈。发布报道还提到 SWE-bench Verified、LiveCodeBench、Tau2 和 AIME 等项目,并将 K3 描述为开源模型中的领先选手,但首发官方页面没有为这些项目列出可复核的具体分数,所以这里不补写数字。12
现在怎么用
Kimi K3 已经出现在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API。Kimi Work 桌面端需要 3.1.0 或更高版本,Kimi Code 可以在终端中通过
/model 选择 Kimi K3;API 平台列出的模型名是 kimi-k3,并确认了 1M Token 上下文。13API 价格如下,单位是美元每百万 Token:
| 计费项 | 价格 |
|---|---|
| 缓存命中输入 | $0.30 |
| 缓存未命中输入 | $3.00 |
| 输出 | $15.00 |
选型时要留意的限制
Kimi 官方在发布页主动列出三点限制:如果 agent harness 没有完整传回历史思考内容,或者在会话中途从另一个模型切换到 K3,生成质量可能明显不稳定;模型在任务边界含糊时可能过度主动替用户做决定;整体用户体验仍落后于最强的闭源模型。对接入现有编程 Agent 的团队,保留完整 thinking history、固定系统约束,并在
AGENTS.md 中写清不可越过的操作边界,比只看一个 benchmark 排名更重要。1给开发者的判断
Kimi K3 最值得立即测试的地方,是长代码库、截图加代码的视觉调试,以及需要连续调用工具的研究任务。建议先用 API 做一轮固定 prompt、固定工具和固定预算的 A/B 测试,再决定是否等待完整权重落地;不要根据 2.8T 总参数直接估算本地部署成本,也不要把官方自测表格当作独立排行榜。
7 月 27 日前后的两个信号值得继续跟踪:完整权重是否按期发布,以及技术报告是否补齐激活参数、权重许可、训练细节和更多公开 benchmark。1
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
More from this channel›
- Claude Opus 5 发布:接近 Fable 5,价格不变,API 已可用,Copilot 渐进开放
- Google 一次发布三款 Gemini Flash:3.6 降价,Lite 更快,Cyber 先做安全试点
- Qwen3.8-Max-Preview 发布:2.4T 参数旗舰预览版,正式版与开放权重待定
- 阿里 Qwen-Audio-3.0-Realtime 发布:实时语音开始自己调用工具
- GPT-5.6 Sol 跟进:AWS Bedrock 上线,5 小时限制临时取消
- Meta Muse Spark 1.1 发布:1M 上下文、公开预览 API,押注多模态 Agent
- OpenAI GPT-Live 发布:全双工语音模型接管 ChatGPT Voice,API 还在路上
