
Grok 4.6 发布:长程 Agent 进入 API,$2/$6 起,参数未披露
xAI 正式发布 Grok 4.6,主打长程 Agent、编码与交互式视觉项目;API 输入/输出价格为每百万 token 2/6 美元,官方参数规模未披露。
先看结论
如果你要测试长流程编码、知识工作或把产品想法直接做成可运行原型,Grok 4.6 已经可以进入第一轮评测:xAI 在 2026 年 8 月 12 日宣布模型上线,Cursor、Grok Build、API 以及 OpenRouter、Vercel、Cloudflare 等合作入口均已提供。API 起价为输入每百万 token 2 美元、输出每百万 token 6 美元;快速变体按两倍价格计费。1
但不要把它读成「所有榜单都第一」。xAI 公布的表格里,Grok 4.6 在 Artificial Analysis Intelligence Index 得分 61,与 GPT-5.6 Sol 持平;在 CursorBench 3.2、GDPVal-AA v2、AA-Briefcase 等项目上有竞争力,在 DeepSWE v1.1 和 Terminal-Bench v3.0 上则低于表中的部分对手。表内数字来自 xAI 汇总的自报成绩或公开结果,适合决定是否试用,不等于控制变量一致的独立排行榜。1
这次发布了什么
| 项目 | 已确认信息 | 选型时要问的问题 |
|---|---|---|
| 发布时间 | 2026 年 8 月 12 日 | 这是正式发布,不是此前「later this week」的预告。1 |
| 模型定位 | 长程 Agent、知识工作,以及更复杂的交互和视觉项目 | 任务是否需要连续多步执行、自测和反复修改?1 |
| 参数规模 | 官方公告未披露 | 不能用参数量推断成本、速度或能力。1 |
| 上下文窗口 | 官方公告未给出 | 长文档任务要以实际 API 文档和调用限制为准,不能从「长程」一词推断窗口大小。1 |
| 首发入口 | Cursor、Grok Build、API;另有 OpenRouter、Vercel、Cloudflare | 想先体验可走 Grok Build 或 Cursor,想做可重复评测则优先固定 API 入口。1 |
xAI 对训练过程的描述包括更长的补充训练、面向推理和技术概念的模型生成数据、高质量工程数据,以及改进后的优化器和训练配方。后续 SFT 轨迹由 Grok 4.5 重新生成,再用于推理、Agent harness、STEM、软件工程和知识工作等场景;RL 任务还覆盖内核优化、网页开发和计算机辅助设计。以上是厂商对训练过程的披露,不是独立复现实验。1
Benchmark 怎么读
官方表格覆盖 9 个评测。下面保留最能帮助选型的几项,括号内是同一张表中的对照成绩:
- AA Intelligence Index:61。与 GPT-5.6 Sol 的 61 持平,低于 Fable 5 的 62。该指数是 9 个 benchmark 的综合分,不是单项任务成功率。1
- GDPVal-AA v2:1753。高于 GPT-5.6 Sol 的 1728 和 Fable 5 的 1741。这个结果支持把它放进知识工作和产出物生成的候选集,但不能单独证明真实业务质量。1
- CursorBench v3.2:69.9%。高于 GPT-5.6 Sol 的 67.2%,低于 Fable 5 的 70.5%。它更直接对应 Cursor 类编码 Agent 场景。1
- DeepSWE v1.1:65.9%。低于 GPT-5.6 Sol 的 73% 和 Fable 5 的 70%,但高于 Grok 4.5 的 54%。如果你的核心任务是软件工程,不能只看 AA 总分。1
- APEX-Agents:57.5%、FrontierCode v1.1(Extended):61.3%。两项都高于 Grok 4.5 的 47.1% 和 56.6%,说明这次升级的主要信号确实落在 Agent 与编码轨道。1
这组数据最稳妥的读法是:Grok 4.6 的升级方向很明确,长程 Agent 和交互式开发值得实测;但它并非所有编码评测的最高分模型。xAI 还注明,第三方模型成绩取各自公开或自报结果中的最好值,比较时要保留这个口径差异。1
能力亮点与安全信息
xAI 称,Grok 4.6 能在较长轨迹中完成陌生领域调研、应用结构设计、核心交互实现,并根据多轮反馈继续修改。官方还观察到更多自测和验证行为:模型会在继续执行前检查自己的工作。对于需要把一句产品想法变成首个可运行版本的任务,这比单轮问答能力更值得测。1
视觉与交互项目是另一个重点。xAI 表示,Grok 4.6 比 Grok 4.5 更擅长一次建立应用的结构和视觉语言,再在循环中迭代。这个判断仍是厂商自述,实际效果要用真实前端项目、设计约束和人工验收来验证。1
安全部分,公告称已改进 safeguards,并进行了更大范围的发布前能力与安全校准测试,以及发布后的第三方测试;公告没有附上具体安全指标、完整 system card 或可复核的测试明细。涉及漏洞修复、工程设计和 AI 研究时,建议把权限、网络访问、代码执行和人工审批单独设为评测变量,不要只看 benchmark 分数。1
现在怎么试
- 先做低成本体验:Grok Build 可免费试用;Cursor 和 Grok Build 在官方宣布后的首周提供 2 倍包含用量。1
- 需要可重复数据时走 API:从 xAI API 控制台 创建密钥,按输入 $2、输出 $6 每百万 token 估算预算;快速变体按两倍价格计算。1
- 用真实任务而不是榜单复现:准备一个多文件代码库、一个陌生领域调研任务和一个交互式页面原型,记录完成率、人工接管次数、耗时、token 消耗和返工次数。
- 先确认限制再上生产:公告没有给出参数规模和上下文窗口,也没有在正文中展开 rate limit、数据保留和安全评测细节。上线前应查看 API 文档 的当前说明,并核对账户实际可用模型与限额。1
对大多数团队,Grok 4.6 的合理动作不是立刻替换现有模型,而是把它加入长流程 Agent、代码库操作和交互式原型的对照组。它的价格和入口已经足够支持小规模试用,真正还缺的答案则是:在你的工具链、权限边界和人工验收标准下,长程能力能否转化成更少的返工。
References
- 1xAI 官方发布公告
x.ai

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.