Meta Muse Glimmer 发布:30B、Apache 2.0,瞄准 24GB 显存本地 Agent

Meta Muse Glimmer 发布:30B、Apache 2.0,瞄准 24GB 显存本地 Agent

Meta 发布 Muse Glimmer:约 30B 的多模态本地 Agent 模型,Apache 2.0 开放权重,4-bit 版本面向 24GB 或 32GB 硬件;本文梳理 benchmark、部署条件、价格缺口与安全边界。

先看结论

Meta 的 Muse Glimmer 已于 2026 年 8 月 10 日发布,核心卖点不是把参数继续做大,而是把一个约 30B 的多模态 Agent 压进本地设备:Apache 2.0 开放权重、4-bit 版本面向 24GB 或 32GB 硬件,并围绕工具调用、长程执行和失败恢复训练。想评估它,优先拿真实的代码库、截图和多步工具流程测试;不要只看一张官方 benchmark 表。12
这也是 Meta 继 Muse Spark 家族之后的一次开放权重发布。权重和配套文件已经在 Hugging Face 上线,Meta 没有在这篇发布公告中列出自营 API 的 token 单价;眼下更明确的使用路径是下载后本地运行,或等待合作伙伴接入。1

规格先核对:30B 是什么规模

项目已确认信息对选型的影响
模型定位Muse 家族的本地 Agent 模型,Meta 称其由 Muse Spark 蒸馏而来重点测试长流程和工具链,不宜只当普通聊天模型比较
参数与架构29.6B 总参数;密集因果 Transformer,含约 1.8B 的 ViT-G/14 视觉编码器,共 52 层不是 MoE;总参数更接近实际常驻内存规模
上下文与模态上下文长度 131,072+;输入为文本和图片,输出为文本能处理截图、图表和文档,但不支持音频输入输出
推理控制lowmediumhighxhigh 四档 reasoning strength可按任务在质量、延迟和成本之间取舍
许可证Apache 2.0;BF16 权重、两种 4-bit 量化权重、DFlash drafter 和视觉编码器均列入发布物适合商业和研究使用,但仍需遵守许可证与适用法律
知识截止2026 年 1 月 4 日对发布日期之后的事实不能期待模型内置知道
参数、架构、模态和许可证来自官方模型卡;Meta 发布博客把它概括为 30B 模型。官方还称模型训练数据包含公开数据、第三方提供的数据以及 Meta 产品和服务相关信息,但没有公开训练数据和训练代码。12

Benchmark 信号:Agent 任务有优势,但不是全面领先

下面的数字来自 Meta 在模型卡中给出的对比,参测对象是 Gemma4-31B Thinking Mode 和 Qwen3.6-27B Thinking Mode。它是厂商评测,不是同一套独立复测;加粗只表示 Meta 这张表里的最高值,不代表跨榜单总排名。2
方向BenchmarkMuse Glimmer-30BGemma4-31BQwen3.6-27B
工具与 AgentMCP Atlas(Public)75.5 254.262.5
深度检索DeepSearch QA74.6 261.771.1
软件工程SWE-Bench Pro51.2 236.950.2
软件工程SWE-Bench Verified76.0 266.677.2
终端 AgentTerminalBench 2.151.7 243.460.7
电脑操作OSWorld-Verified65.9 258.575.6
视觉推理ScreenSpot Pro75.4 275.976.1
数学推理AIME 202694.7 289.294.1
Meta 的官方对比表显示:Muse Glimmer 在 MCP Atlas、DeepSearch QA 和 SWE-Bench Pro 等项目领先,但 Qwen3.6-27B 在 SWE-Bench Verified、TerminalBench 2.1、OSWorld-Verified 和多项多模态项目中更高。1
这组结果更适合回答「它想优化什么」,不适合直接回答「它是否全面胜过同尺寸模型」。第三方 VentureBeat 对同一张表的复述也把 Glimmer 归为更偏本地 Agent 的模型,而不是普遍性能领先者。3

本地部署:24GB 是量化后的目标,不是最低配置承诺

Meta 的官方说明把完整精度模型的内存需求估算为超过 55GB。约 4-bit 的量化版本可把语言模型压到 20GB 以下,并为 KV cache、视觉编码器和推测解码 drafter 留出空间;其中 K-Quant-17GB 目标是 24GB VRAM,K-Quant-Dynamic 目标是 32GB VRAM。官方模型卡报告,前者在 15 个常见 benchmark 的平均精度下降约 1.0%,后者约 0.2%,这些是 Meta 自测数字。12
为解决 Agent 多轮调用累积的延迟,Meta 随权重发布了基于 DFlash 的 drafter。官方在批量大小为 1、贪心解码的测试中报告:RTX 5090 从 74.9 token/s 提升到 233.4 token/s,即 3.1 倍;M5 Max 为 1.8 倍,M4 Max 为 1.5 倍。测试使用 llama.cpp 或 ExecuTorch,不能直接当成你的机器上的实测速度。2
因此,「24GB 可用」应理解为官方为量化推理和完整 Agent 组件设定的目标环境。8GB 或 16GB 的普通笔记本不在这条路径上;实际还会受到上下文长度、视觉输入、drafter 配置和运行时实现影响。3

能力与安全边界

Muse Glimmer 的训练和评估目标包括端到端任务完成、精确工具调用、多步推理、工具失败后的重试、文本与图片交错输入,以及对 OpenClaw、Hermes Agent 等脚手架的适配。模型支持 100 多种语言,但模型卡也提醒,未对所有训练语言分别评估,弱支持语言的表现可能下降。12
安全方面,Meta 将 Glimmer 的化学/生物、网络和失控风险评为 Moderate or lower;其中网络和失控结论明确标注为基于与 Muse Spark 的能力比较而来的推断。模型卡还给出两组需要留意的 Agent 安全结果:在 CI Memories 隐私评测中,Glimmer 的 violation 为 26.4,低于 Qwen3.6-27B 的 53.4,但高于 Gemma4-31B 的 12.1;在 Siren AgentDojo 中,Glimmer 的攻击成功率为 28.4%,高于 Gemma 的 25.6%,低于 Qwen 的 40.3,同时 utility 为三者最高的 94.2。2
这意味着本地运行减少了数据持续上传到云端的需要,却没有自动解决提示注入、权限过大或不可逆操作的问题。Meta 建议把模型放进带额外护栏的系统,并在会修改文件、调用外部服务或执行不可逆动作的场景加入人工确认。2

现在怎么试

  1. 先下载权重,再选运行时。 Hugging Face 模型页 已提供 BF16、4-bit 量化和 DFlash 等发布物;Meta 还给出了开发者文档
  2. 用一套可验收的长任务测试。 让 Agent 读取一个真实代码库、调用 2—3 个工具、处理一张截图,再完成可检查的输出。记录成功率、重试次数、人工接管次数、总耗时和峰值显存。
  3. 把 Qwen3.6-27B 和 Gemma4-31B 放进同一套脚本。 官方表已经显示三者各有强项;尤其是终端编码、电脑操作和视觉任务,不要用单一总分替代真实工作流。
  4. 把成本拆成硬件与托管两栏。 官方发布页当前明确的是开放权重和合作伙伴接入计划,没有给出 Meta 自营 API 单价;如果不本地部署,就要等实际托管平台公布价格和限额。
  5. 给工具调用加权限边界。 至少限制文件写入、网络访问和不可逆操作,并保留人工确认。模型卡明确不支持音频输入输出,视频也不是专门优化的模态,视频输入按单帧处理。12
对开发者而言,Muse Glimmer 最值得进入评测集的理由是「本地 Agent 的整套组件」已经随权重发布,而不是某个 benchmark 的单点领先。先在 24GB 或 32GB 设备上复测你的工具链,再决定是否把它用于日常编码、文档处理或隐私敏感的本地工作流。

References

  1. 1
    Meta 官方发布博客research.meta.ai
  2. 2
  3. 3
    VentureBeat 报道venturebeat.com
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.