Meta 发布 Muse Code 与 Muse Spark 1.2:终端编码 Agent 公测,Contributor 档可降价但数据可用于改进产品

Meta 发布 Muse Code 与 Muse Spark 1.2:终端编码 Agent 公测,Contributor 档可降价但数据可用于改进产品

Meta 发布 Muse Spark 1.2 与 Muse Code beta:1M 上下文、长程编码 Agent 和两档 API 价格已公开,但参数规模未披露,Contributor 档允许数据用于改进产品。

先看结论

Meta 在 2026 年 8 月 5 日发布了 Muse Spark 1.2,并同步推出由它驱动的终端编码智能体 Muse Code beta。北京时间 8 月 6 日凌晨 3:09,Mark Zuckerberg 也发帖确认:Muse Code 可以在大型代码仓库里规划改动、写代码并验证结果。12
这次发布的重点不在参数规模,而在「模型 + 终端运行时 + 长程 Agent」的组合。Muse Spark 1.2 的参数数量没有公开;Meta 给出的可核实信号是 1M token 上下文、异步后台 Agent、可回放事件日志,以及面向大仓库和长时间任务的训练。对开发者来说,应该先把它当作一个需要重跑真实代码 Agent 回归集的 beta 入口,而不是只看榜单名次就替换现有工具。

规格、入口和价格

项目当前可核实信息选型影响
模型与产品muse-spark-1.2 是编码优化模型;Muse Code 是围绕它构建的终端编码 Agent,当前为 beta。13模型能力和 Agent 工具链是一起调教的,单独调用模型的结果不等于 Muse Code 的完整体验。
参数规模官方发布页和开发者文档没有披露参数数量。1不要用外部传闻参数推算显存、吞吐或成本。
上下文与任务范围1M token 窗口;Meta 称其可容纳依赖图、遗留代码和数千个文件,并针对多文件重构、长时间调试、整仓库生成等任务训练。3长上下文降低了切分代码库的需要,但不等于每个任务都能稳定完成;要单独记录上下文长度、压缩次数和最终改动质量。
可用入口Muse Code、Meta Model API 和 OpenRouter 均已开放;Meta 称本次扩大了公共预览的全球访问。Muse Code 可在 macOS 或 Linux 终端安装,Contributor 档仅在部分国家可用。13「全球访问」不等于每个地区都能使用 Contributor 档;实际账号、地区和 beta 状态仍以入口显示为准。
标准 API 价格muse-spark-1.2:缓存命中输入 $0.15 / 百万 tokens,输入 $1.25 / 百万 tokens,输出 $4.25 / 百万 tokens。无长上下文溢价。4这是 pay-as-you-go 价格;推理 token 按输出计费,复杂任务的实际账单不能只按代码字符数估算。
Contributor 档muse-spark-1.2-contributor:缓存命中输入 $0.002 / 百万 tokens,输入 $0.10 / 百万 tokens,输出 $0.20 / 百万 tokens;使用该档意味着允许 Meta 用 prompts 和 completions 改进未来模型。4价格低很多,但不适合未经审查的私有代码、客户数据或含密钥的仓库。
Meta 的标准档按团队限流,文档列出的上限是 3,000 RPM 和 4,000,000 TPM;Contributor 档是 60 RPM 和 2,100,000 TPM。Muse Code 自身还按滚动 5 小时 token 窗口限流,不能把这两个数字理解成无限制的本地 Agent。34

官方评测:编码 Agent 排名靠前,但不是同一条命令行

Meta 的图表把 Muse Spark 1.2 与 Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Gemini 3.6 Flash 和 Muse Spark 1.1 放在一起比较。Terminal-Bench 2.1 中,Muse Spark 1.2 得分 82.9%,仅低于 Opus 5 的 86.7%;DeepSWE 1.1 中为 59.3%,低于 Opus 5 的 65.0% 和 GPT-5.6 Terra 的 64.8%,高于 Grok 4.5 的 56.6% 和 Muse Spark 1.1 的 53.0%。这些是 Meta 发布的结果,不是独立复测。1
读这些数字时要保留一个限制:Meta 的 Terminal-Bench 和 DeepSWE 测试给每个模型配了各自的 Agent 产品和最高可用推理强度。Muse Spark 1.2 用 Muse Code,Opus 5 用 Claude Code,GPT-5.6 Terra 用 Codex,Grok 4.5 用 Grok Build;测试在隔离的 Daytona 沙箱运行,采用五次尝试的平均 pass@1。DeepSWE 使用 113 个任务、91 个仓库和五种语言,外网在执行与评分阶段关闭。Meta 自己也说明,这不是所有模型都使用同一 harness 的官方排行榜。5
所以,这组结果能支持的判断是:Muse Spark 1.2 的编码 Agent 组合已经进入第一梯队,且相对 Muse Spark 1.1 有明显提升;它不能直接证明在你的仓库、工具权限和提示词下也会领先同样幅度。

这次真正新增的能力

Muse Code 的运行时把每次模型调用、工具执行、审批和编辑追加到本地事件日志。会话可以从日志精确恢复,后台 Agent 则在主任务继续推进时收集信息和执行下一步。这样做的价值不只是「多几个 Agent」:长任务中断后,用户能查看谁改了什么,也不必从头重述上下文。13
Meta 还给了一个更激进的案例:在 NVIDIA Hopper GPU 上优化 KDA 和 MLA kernel,任务最多运行 24 小时、超过 1,000 次工具调用,模型反复写入、编译、分析并改进 Triton 实现。这个案例说明它的训练目标包含长程工程循环,但它仍是 Meta 自己设计的演示和评测,不是用户生产环境的吞吐承诺。1

开发者现在怎么试

  1. 先用标准档跑小型真实仓库。 记录任务成功率、通过测试的比例、工具调用失败、人工接管次数、输入缓存命中率和总输出 tokens;不要只测一次「写个函数」。
  2. 把长程任务拆成可验收的回归集。 至少覆盖多文件重构、跨模块调试、真实 issue 修复、依赖升级和需要反复运行测试的任务,并保存每次事件日志。
  3. 谨慎选择 Contributor 档。 只有在代码和提示词可以用于改进 Meta 产品、且不含敏感信息时再用;需要更严格的数据留存条件,可向 Meta 申请 zero data retention,但这不是默认设置。3
  4. 把 beta 风险单独记账。 先验证地区可用性、5 小时 token 限额、API 速率限制和 OpenRouter 的实际模型 ID,再决定是否接入自动合并或生产部署。
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.