Muse Spark 1.3 max 公开可用:Meta 把最强推理配置推上 Muse Code 与 API

Muse Spark 1.3 max 公开可用:Meta 把最强推理配置推上 Muse Code 与 API

Meta 已将 Muse Spark 1.3 的 max reasoning 配置开放到 Muse Code 与 Meta Model API,本文核对能力、评测边界、价格和适合的测试方法。

Muse Spark 1.3 max 公开可用后,开发者可以直接在 Muse Code 或 Meta Model API 里测试这套更高推理配置。Meta 官方把更新重点放在长程编码、工具调用和多步骤 agent 工作流;模型参数规模仍未披露。1

先说结论

这次消息的关键变化是 max reasoning 从受限预览进入公开可用。Meta 在北京时间 2026 年 9 月 5 日凌晨确认,Muse Spark 1.3 max 已接入 Muse Code 和 Meta Model API;开发者可以从 Meta Model API 开发入口 开始测试。2
如果团队正在评估编码智能体、长时间运行的任务或多工具协作,1.3 值得安排一轮真实工作流测试。测试重点应放在任务完成所需的工具调用次数、总 token 消耗、失败后的恢复能力和需要人工确认的节点,而不是只看一张厂商分数表。

快速核对

项目已核实信息
模型Muse Spark 1.3;公开公告特别确认 max reasoning 配置可用。3
发布时间Meta 研究博客显示日期为 2026 年 9 月 2 日;Meta 官方账号在北京时间 2026 年 9 月 5 日 02:20 左右确认 max 已公开可用。12
参数规模官方未披露。1
主要能力长线程里维护多个工作流、补齐上下文、发现计划缺口、请求澄清,并在有后果的动作前要求确认。1
可用范围Muse Code 与 Meta Model API;API 入口为 dev.meta.ai2
Standard 价格缓存输入每百万 tokens 0.15 美元,输入 1.25 美元,输出 4.25 美元;限额为 3,000 RPM、4,000,000 TPM。4
Contributor 价格缓存输入每百万 tokens 0.002 美元,输入 0.10 美元,输出 0.20 美元;限额为 100 RPM、3,000,000 TPM。4
现在的动作窗口先用一组真实编码与工具调用任务,对比 Muse Spark 1.2 的成本、耗时和完成率。

1.3 具体改了什么

Meta 对 Muse Spark 1.3 的描述集中在“把一项工作做完”所需的连续动作。模型会在长线程中同时维护多个工作流,主动补充缺失的上下文,发现原计划里的空档,在信息不足时请求澄清,并在执行可能产生后果的操作前等待确认。1
这组变化更适合用完整任务观察。比如,测试可以让模型读取代码库、制定修改计划、调用工具运行测试、处理报错,再提交一份可审阅的改动。单轮问答能测出回答质量,却很难测出模型是否会在第 12 个工具调用时丢掉目标。
Meta 工程师内部比较显示,Muse Spark 1.3 在编码工作中平均少调用约 20% 的工具,token 消耗约少 25%,对比对象是 Muse Spark 1.2。这个数字属于 Meta 内部比较,适合当作测试假设,不能直接当成所有代码库和提示词都会得到的降幅。1

benchmark 该怎样读

Meta 官方发布页配套的 scorecard 覆盖编码、工作任务、搜索和智能体能力。图中的数字是 Meta 发布的结果,部分结果来自 Meta API、指定产品或固定 harness;它适合帮助读者了解 Meta 选择的比较维度,不能替代团队自己的任务集。1
Meta Muse Spark 1.3 与其他模型的 benchmark scorecard
这张 benchmark scorecard 来自 Meta 的 Muse Spark 1.3 官方发布页,图中结果属于厂商发布的比较材料。1
Meta 的评测方法报告说明,Muse Spark 1.3、Claude Opus 5 和 GPT-5.6 Sol 使用 max reasoning,Muse Spark 1.2 使用 xhigh;部分编码智能体结果还使用指定产品或固定 harness。报告同时说明,第三方模型采用 best-effort 设置,结果可能没有使用各家最优的 provider 配置。5
独立评测 Artificial Analysis 在 2026 年 9 月 2 日的文章中给出 Muse Spark 1.3 xhigh Intelligence Index 61、max 62、Muse Spark 1.2 57;文章当时把 max 标为 limited preview。Meta 在北京时间 9 月 5 日凌晨的官方公告更新了 max 的可用状态,所以这两条信息分别回答“早期测到多少”和“现在是否公开可用”。26
Artificial Analysis 对 xhigh 的独立评测还记录了几项相对 1.2 的变化:Tau3-Bench Banking 为 35% 到 47%,Terminal-Bench 2.1 为 80% 到 85%,GDPval-AA v2 为 1615 到 1709 Elo;max 在 Tau3-Bench Banking 为 52%,GDPval-AA v2 为 1754 Elo。不同测试的任务构成和运行设置不同,读者应把这些数字当作分项信号。6

可用范围和费用

Meta Model API 的 Standard 档列出 muse-spark-1.3,缓存输入价格为每百万 tokens 0.15 美元,普通输入为 1.25 美元,输出为 4.25 美元;该档限额为每分钟 3,000 次请求、每分钟 4,000,000 tokens。文档还写明没有 long-context premium,prompts 和 completions 不用于训练 Meta 模型。4
Contributor 档列出 muse-spark-1.3-contributor,价格为缓存输入 0.002 美元、输入 0.10 美元、输出 0.20 美元,单位均为每百万 tokens;对应限额为每分钟 100 次请求、每分钟 3,000,000 tokens。Contributor 条款允许 Meta 使用 prompts 和 completions 训练未来模型,团队在接入前需要把数据使用条件纳入评估。4

现在适合怎么测

  1. 准备一组能跑 20 分钟以上的任务。 让模型连续完成代码阅读、计划、工具调用、测试和修复,记录中途是否需要人工接管。
  2. 把 Muse Spark 1.2 作为对照。 使用相同代码库、相同工具、相同提示词和相同验收标准,再比较成功率、工具调用次数、token 消耗和总耗时。
  3. 单独测试高风险动作。 删除文件、修改部署配置、写入生产系统等动作需要人工确认;测试应记录模型是否在正确的节点停下来。
  4. 区分 max 与早期 xhigh 结果。 Artificial Analysis 的独立数据记录了两种配置,Meta 后续公告才确认 max 公开可用。测试报告应把配置、运行日期和 API 版本写清楚。26
对开发者来说,Muse Spark 1.3 的首要测试问题是:它能否用更少的中途动作完成更长的任务,并且在需要人确认的地方停得准确。Meta 的内部成本数字和公开 benchmark 提供了起点,真实代码库里的完成率与人工接管次数才决定它是否值得替换现有模型。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content