Meta Muse Spark 1.1 发布:1M 上下文、公开预览 API,押注多模态 Agent

Meta Muse Spark 1.1 发布:1M 上下文、公开预览 API,押注多模态 Agent

Meta 发布 Muse Spark 1.1,重点是多模态 Agent、工具调用、代码能力和 1M token 上下文。本文快速梳理公开预览入口、价格、关键 benchmark 和读者该怎么试。

Meta 这次把 Muse Spark 1.1 写成了一个面向 agent 的主力模型,而不是单纯的聊天升级。它既进了 Meta AI app 和 meta.ai 的 Thinking 模式,也通过 Meta Model API 向开发者开放了公测;开发者账号还会先拿到 20 美元免费额度。1 2

先看结论

如果你关心的是工具调用、电脑操作和代码任务,Muse Spark 1.1 这次的信号比上一版更明确:它把优势压在 agentic workflowscodingmultimodal perception 上,同时把接入门槛压低到 OpenAI 兼容的 SDK 和 muse-spark-1.1 这个模型名。1 2

关键信息

维度信息
发布时间2026 年 7 月 9 日。<MarkdownCitation index="1" title="Introducing Muse Spark 1.1
模型家族Muse Spark 1.1,是 Meta Superintelligence Labs 从 Muse Spark 升级而来。<MarkdownCitation index="1" title="Introducing Muse Spark 1.1
参数规模官方未披露。<MarkdownCitation index="1" title="Introducing Muse Spark 1.1
可用范围现在可在 Meta AI app 和 meta.ai 的 Thinking 模式里使用;Meta Model API 进入公测,页面明确写的是面向美国开发者。<MarkdownCitation index="1" title="Introducing Muse Spark 1.1
价格新账户先送 20 美元免费额度;按量计费从每 100 万输入 token 1.25 美元、输出 token 4.25 美元起。<MarkdownCitation index="2" title="Build with Muse Spark, now available on Meta Model API
接入方式Meta Model API 兼容 OpenAI SDK,开发者可以把 base URL 指向 api.meta.ai/v1,模型名用 muse-spark-1.1。<MarkdownCitation index="2" title="Build with Muse Spark, now available on Meta Model API

Benchmark 看点

Meta 这次没有只讲「更强」,而是直接把 agent、终端、代码和多模态放到同一张表里。挑最有代表性的几项看,Muse Spark 1.1 在 MCP Atlas 上是 88.1,在 OSWorld-Verified 上是 80.8,在 SWE-Bench Pro 上是 61.5,在 DeepSWE 1.1 上是 53.3;这几项都高于旧版 Muse Spark,也压过了表里列出的 GPT-5.5 对照值。3
更有意思的是,它的优势不是只有一种形态。JobBenchTerminal-Bench 2.1DeepSWE 1.1 这些更偏 agent / coding 的任务,提升幅度都很大;比如 JobBench 从 17.0 提到 54.7,DeepSWE 从 10.0 提到 53.3。3
但这不等于每个多模态榜单都全面领先。官方表里 BabyVision 是 76.3,仍低于 GPT-5.5 的 83.6;CharXiv Reasoning 则是 88.4,和对照组相差不大。读法很简单:Muse Spark 1.1 的最强项,还是工具、代码和长链路任务。3

这次真正变了什么

Meta 把这版模型的卖点写得很直白:一是可以编排多 agent 工作流,二是能做 computer use,三是能处理图片、视频和文档,四是更适合仓库级代码编辑和调试。它甚至直接把「看截图、改代码、再回到浏览器里复验」写进了开发者指南。1 2
对开发者来说,真正有用的不是宣传语,而是接入成本。Meta 这次给的是 OpenAI 兼容接口、免费额度、公开预览和一套已经写好的 cookbook。它想争的不是「谁更会聊天」,而是「谁更容易拿去跑 agent 工作流」。2

读者该怎么判断

如果你已经在做 coding agent、浏览器自动化、RAG 工作流或多模态工具调用,Muse Spark 1.1 值得直接试;它的价格门槛和接入门槛都不高,适合先拿真实任务测一轮。2
如果你只需要一个普通聊天模型,这次不必被 1M 上下文这个数字带跑。更该盯的是它在你的任务里能不能少一轮工具往返、少一次人工补救、少一层脚本胶水。1 3

相似内容

  • 登录后可发表评论。
More from this channel