
xAI Grok 4.5 发布:低价切入编程 Agent,Cursor 与 Grok Build 同步可用
xAI/SpaceXAI 发布 Grok 4.5,主打编程 Agent、知识工作和更低单位成本。本文梳理官方披露的价格、benchmark、可用入口、参数缺口和开发者该如何测试。
Grok 4.5 这次没有绕着「聊天更聪明」打转。官方把它直接放进 coding、agentic tasks 和 knowledge work 三个场景里,价格也压到每 100 万输入 token 2 美元、输出 token 6 美元。1
对开发者来说,这是一条很明确的信号:xAI 想让 Grok 从问答模型变成能接代码库、终端、办公文档和长任务的工作流模型。Reuters 同日也确认,Grok 4.5 已通过 Grok Build、Cursor 和 SpaceXAI console 开放,EU 可用性预计到 7 月中旬。2
先看结论
这是一款面向编程 Agent 和知识工作的单模型发布,不是多档家族。官方没有披露参数规模,也没有在可读公告里给出上下文长度;能确认的信息集中在价格、工程类 benchmark、训练基础设施、可用入口和地区限制上。1
如果你只关心是否值得试,先看两点。第一,Grok 4.5 并没有在所有 coding benchmark 上拿第一,但在 SWE Marathon、Terminal Bench 2.1 和 SWE Bench Pro 上给出了足以进入一线模型比较的分数。第二,它把 80 TPS、较低输出 token 和 2/6 美元的 API 价格放在一起讲,明显是在打「单位成本完成更多工程任务」这张牌。1
关键参数与发布信息
| 维度 | 信息 |
|---|---|
| 发布时间 | 官方公告发布日期为 2026 年 7 月 8 日。1 |
| 模型名称 | grok-4.5。官方称其面向 coding、agentic tasks 和 knowledge work。1 |
| 参数规模 | 官方公告未披露参数规模;目前不能用传闻参数补空。1 |
| 上下文长度 | 可读官方公告未披露上下文长度;开发者文档页本轮抓取只返回页面壳,暂不写具体数值。 |
| 价格 | 每 100 万输入 token 2 美元、每 100 万输出 token 6 美元。1 |
| 可用入口 | 已在 Grok Build、Cursor 和 SpaceXAI console 开放;通过 console 可用 API key 调用。1 |
| 地区限制 | 官方说明 Grok 4.5 暂未在 EU 的任何 SpaceXAI 产品或 API console 中开放,预计 7 月中旬开放。1 |
Benchmark:重点是工程任务,不是通用问答
官方把 Grok 4.5 的评测重点放在真实软件工程任务上。DeepSWE 1.0 中,Grok 4.5 得分 62.0%,低于 Fable max 的 66.1% 和 GPT 5.5 xhigh 的 64.31%,高于 Opus 4.8 max 的 55.75%。DeepSWE 1.1 中,Grok 4.5 为 53%,低于 Fable max、GPT 5.5 xhigh 和 Opus 4.8 max。1
它更有优势的地方在另几项。SWE Marathon resolution rate pass@1 中,Grok 4.5 为 29.0%,高于 Opus 4.8 max 的 26.0% 和 Fable max 的 24.0%。Terminal Bench 2.1 中,Grok 4.5 为 83.3%,几乎贴着 GPT 5.5 xhigh 的 83.4%,也高于 Opus 4.8 max 的 78.9%。SWE Bench Pro resolve rate 中,Grok 4.5 为 64.7%,低于 Fable max 和 Opus 4.8 max,但高于 Opus 4.7 max、GLM 5.2 和 GPT 5.5 xhigh。1
这组数据的意思比较直白:Grok 4.5 不是「榜单全胜」型发布,而是把自己放到工程 Agent 的第一梯队里,再用速度和价格补上说服力。
能力亮点:xAI 想抢哪类工作流
1. 更偏真实代码库的 Agent 任务
官方称 Grok 4.5 的训练数据覆盖 coding、science、engineering 和 math,并把强化学习重点放在多步软件工程任务上。训练过程还支持长时间 agentic rollout,任务可以跑很多小时,学习过程继续在大规模 GPU 集群上推进。1
这说明它的目标不是只回答一道算法题,而是接住「查代码、改代码、跑工具、看结果、再修一轮」这种更接近真实开发的任务。
2. 速度和 token 效率被放到主卖点
官方称 Grok 4.5 的服务速度为 80 TPS,并在 SWE Bench Pro 任务上平均输出 15,954 个 token,约为 Opus 4.8 max 67,020 个输出 token 的四分之一。1
这对 Agent 成本很关键。很多工程任务贵,不是最后答案长,而是中间尝试、日志和修复轮次多。输出 token 少、速度快,才有机会把一次任务从「能跑」变成「跑得起」。
3. Grok Build、Cursor 和 Office 工作流一起推
官方公告写明,Grok 4.5 现在是 Grok Build 的默认模型,并且可在 Cursor 中使用。公告还展示了 Excel、PowerPoint 和 Word 场景,强调它能处理多表公式、复杂图示和文档写作。1
这条线很像是把 coding agent 和办公室自动化合到一个叙事里:同一个模型既要能改代码,也要能做表格、演示稿和文档。对企业用户来说,这比单纯聊天能力更容易落到预算表里。
限制与待观察点
第一,参数规模仍是空白。官方公告没有披露参数量,Reuters 也没有给出参数规模;这期只能写「官方未披露」。2
第二,安全信息不够完整。官方公告主要讲训练、工程能力、价格和可用入口,本轮没有读到独立系统卡或安全评估页面。对要把 Grok 4.5 接进生产 Agent 的团队,权限边界、工具调用审计和数据隔离还需要等更完整的官方文档。
第三,EU 暂不可用会影响跨地区团队测试。官方说 EU 可用性预计在 7 月中旬,这意味着本周内如果团队成员或客户在 EU,API 和产品侧试用可能会被卡住。1
读者该怎么跟进
如果你已经在用 Cursor 或自建 coding agent,可以先拿 Grok 4.5 跑三类任务:旧代码库 bug 修复、跨文件重构、带外部资料检索的实现任务。不要只看一次问答结果,重点看完成率、总 token、耗时和人工返工次数。
如果你负责模型选型,先把 Grok 4.5 当作「低价一线工程模型」测试,而不是默认替代旗舰通用模型。它的价格很有攻击性,但目前公开材料还缺上下文长度的可读原文、独立安全文档和更多第三方评测。真正值得盯的是后续两件事:开发者文档是否补齐,以及独立评测能否复现官方在工程任务上的效率优势。
Fuentes de referencia
Contenido relacionado
- Inicia sesión para comentar.
