AI 工具创业者速查:8 个本周新发布(7.14–7.20)

AI 工具创业者速查:8 个本周新发布(7.14–7.20)

本期筛选 7 月 14 日至 20 日 08:00 间可核实的 8 个 AI 工具与功能,帮助创业团队判断哪些值得先试、哪些要先算清权限、硬件和运维成本。

截至 7 月 20 日 08:00(UTC+8),这一周值得创业团队关注的新发布,重点不在又多了几个模型,而在 agent 如何被组织、审计和接入现有开发环境。最适合先动手的方向有四个:把技能做成可复用包的 Agent Skills for Python,开源 coding agent harness 的 Grok Build,支持自带模型端点的 Copilot for JetBrains,以及扩展到 Antigravity CLI 的 Conductor Plugin。
时间口径为 7 月 14 日 00:00 至 7 月 20 日 08:00(UTC+8);表中日期采用官方发布页给出的发布日期。下面 8 项覆盖开发工具、agent 基础设施、模型和 GPU 软件栈,价格只写已公开的档位。

速查表:8 个本周新发布

名称(发布时间)核心功能定价档位适合场景
GitHub Copilot for JetBrains(7 月 14 日)JetBrains 版 Copilot 增加 OpenAI 兼容自定义端点和 API key,也补上插件安装、自定义 Claude agent、local sandboxing 与 Copilot CLI debugger skill;其中 Claude agent provider 自定义和 debugger skill 标为 public preview。1Copilot Free $0、Pro $10、Pro+ $39、Max $100,均为每用户每月;Claude agent provider 自定义要求 Pro 及以上。2 1已经用 JetBrains 开发后端、移动端或多语言项目,又想把模型端点、插件和沙箱控制权留在团队手里。先拿一两个真实仓库测试,别一上来全员切换。
Visual Studio Insiders:组织级 custom agents(7 月 14 日)组织所有者可以在组织内共享 custom agents;更新还加入模型固定、模型管理视图、Copilot 用量查看、commit 审查,以及 Git submodule 和 worktree 支持。3Visual Studio Community 免费;Professional 月付 $45,Enterprise 月付 $250。发布页没有单独列 Copilot 计划价格,Insiders 功能也属于预发布。4 3Windows 技术栈、Azure DevOps 或 GitHub 组织已经统一用 Visual Studio 的团队。重点试组织级 agent 共享和 commit review,先确认管理员权限与预发布版本的稳定性。
Agent Skills for Python(7 月 15 日)Microsoft Agent Framework 的 Python skills API 稳定发布。一个 skill 可以带上指令、参考资料和脚本,并按任务需要加载;正式版还提供人在回路审批、脚本执行控制、过滤和缓存。5发布页未列价格或套餐。模型调用、运行环境和托管成本另行计算。5有多个 Python agent,且每个 agent 都在重复读取同一套业务规则、SOP 或脚本的团队。适合先把一个高频流程打包成 skill,观察上下文长度、审批次数和错误率是否下降。
ROCm 7.14 / TheRock(7 月 15 日)TheRock 进入生产发布流程;ROCm 7.14 扩展 MI350 PCIe、Ryzen AI MAX+ PRO 和 Radeon AI PRO 支持,并更新 PyTorch 2.12、JAX 0.10.0、SGLang、分析器和安装方式。6发布页未列软件价格;实际预算取决于支持的 AMD 硬件、云资源和部署方式。6自建推理、训练或图像生成工作站,且团队已经有 AMD GPU。没有 AMD 硬件的 SaaS 团队不必为了追新版本改栈,先算迁移和兼容测试成本。
Grok Build 开源(7 月 15 日)xAI 开放 coding agent 和终端 UI 的源码,包含 agent loop、代码读写与命令工具、plan review、inline diff,以及 skills、plugins、hooks、MCP servers 和 subagents 的扩展系统;可编译后指向本地推理。7源码可在 GitHub 查看,官方发布页未列订阅价格;本地优先部署仍要承担模型推理、算力和维护成本。7 8有工程能力、想研究 coding agent harness 或做内部开发控制台的团队。它更像可拆解的参考实现,不适合没有运维能力的团队直接当生产系统。
Conductor Plugin(7 月 16 日)Google 将 Conductor 从 Gemini CLI extension 演进为 plugin,支持用自然对话推进 Spec-Driven Development,并保留 spec.mdplan.md 等 Markdown 工件;现在兼容 Antigravity CLI,也可迁移现有 plans 和 specs。9官方发布页未提及价格或套餐。9需求经常变、又希望 agent 先写规格和计划再动代码的产品团队。拿一个中等复杂功能试跑,重点看规格文件是否真的减少返工,而不是只看对话是否顺滑。
Grok 4.5(7 月 16 日)xAI 将 Grok 4.5 定位为面向 coding、agentic tasks 和 knowledge work 的模型,可在 Grok Build、Cursor 和 SpaceXAI API 中使用;官方页面还列出 Excel、PowerPoint 和 Word 工作流。10API 为输入 $2 / 百万 tokens、输出 $6 / 百万 tokens;Grok Build 和 Cursor 提供限时免费使用,Cursor 标注为 all plans。10已有编码 agent 或文档自动化流程,想比较模型质量、速度和单任务成本的团队。先用 20–50 个真实任务做小样本评估,单看官方 benchmark 不够。
GitHub Copilot 仓库级用量指标(7 月 17 日)Copilot usage metrics API 新增按仓库、按日的报告,可查看 coding agent 创建和合并的 PR,以及 code review 的审查和建议类型计数;访问需要相应的 View Copilot Metrics 权限和启用策略。11发布页未列单独价格;它是 Copilot 用量管理能力,能否访问取决于组织、企业权限和 metrics policy。11已经在多个仓库部署 Copilot coding agent 或 code review,需要按仓库看采用情况的工程负责人。它能补齐活动分布,不等于直接证明生产率提升。

本周先试什么

1. 先把一个流程做成可复用 skill

Agent Skills for Python 是本周最适合拿来做小实验的发布。选一个每天重复、规则又相对稳定的流程,例如工单分类、供应商资料整理或发布前检查,把说明、参考资料和脚本放进一个 skill,再与原来的长 prompt 做对照。看三项就够:上下文长度、人工审批次数、返工率。它解决的是 agent 的组织方式,不是再换一个模型。

2. 工程团队看 Grok Build 和 Copilot for JetBrains

Grok Build 的价值在源码可读:团队可以顺着 agent loop、工具调用和 MCP 扩展系统看清一个 coding agent 怎样组装上下文、执行命令和展示 diff。Copilot for JetBrains 则更适合已经在用 GitHub Copilot 的团队做增量试用,BYOK、自定义 provider 和 sandboxing 都直接对应模型选择与权限控制。两者都需要工程师参与,前者还要把本地推理、维护和安全审查算进总成本。

3. 有明确模型评测任务,再试 Grok 4.5

Grok 4.5 的 API 价格已经公开,适合拿真实任务做成本账,而不是凭模型发布稿决定迁移。建议把任务分成编码、长文档处理和工具调用三组,记录完成率、人工修改时间、失败重试和总 token 成本。限时免费只能降低试用门槛,不能替代上线前的预算估算。10

4. 有 AMD GPU 再看 ROCm 7.14

ROCm 7.14 对已有 AMD 设备的团队更有价值。TheRock 进入生产发布、框架版本更新和安装方式调整,能减少一部分环境维护工作,但不会消除硬件、驱动和模型兼容性问题。没有 AMD GPU 的团队,先不用为了一条版本新闻重做推理栈。6

先观望的风险

  • 预发布功能不要当成稳定依赖。 Copilot for JetBrains 的 Claude agent provider 自定义、local sandboxing 和 debugger skill 都带有 public preview;Visual Studio Insiders 也属于预发布渠道。适合内部试用,不适合未经回滚演练就写进核心交付链。
  • 开源不等于零成本。 Grok Build 开放了源码,但本地优先运行仍需要推理资源、权限设计、升级和故障处理。把它当作 harness 参考实现,比把整套系统直接接到生产更稳。7
  • 用量指标不等于 ROI。 GitHub 的仓库级报告能告诉你哪些仓库产生了多少 agent PR 或 review 活动,却不能单独回答代码质量、交付速度和维护成本有没有改善。需要把它和 PR 周期、回滚、缺陷及人工修改时间放在一起看。11
  • 模型迁移先算单任务成本。 Grok 4.5 的公开 API 单价清楚,但真实费用还受输出长度、重试、工具调用和上下文复用影响。20–50 个真实任务的小评测,通常比一次演示更能说明它是否值得换。

一个简单的选择顺序

如果团队本周只能做一次试用,按下面的顺序筛:
  1. 先挑一个具体工作流,而不是先挑模型。
  2. 再确认权限、数据路径、审批和回滚是否能接进现有系统。
  3. 最后把价格换算成每个任务的总成本,连同人工返工一起算。
能在这三步里留下可比较记录的工具,才值得进入下周的正式评估。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel