
Meta Muse Glimmer 发布:30B、Apache 2.0,瞄准 24GB 显存本地 Agent
Meta 发布 Muse Glimmer:约 30B 的多模态本地 Agent 模型,Apache 2.0 开放权重,4-bit 版本面向 24GB 或 32GB 硬件;本文梳理 benchmark、部署条件、价格缺口与安全边界。
先看结论
Meta 的 Muse Glimmer 已于 2026 年 8 月 10 日发布,核心卖点不是把参数继续做大,而是把一个约 30B 的多模态 Agent 压进本地设备:Apache 2.0 开放权重、4-bit 版本面向 24GB 或 32GB 硬件,并围绕工具调用、长程执行和失败恢复训练。想评估它,优先拿真实的代码库、截图和多步工具流程测试;不要只看一张官方 benchmark 表。12
这也是 Meta 继 Muse Spark 家族之后的一次开放权重发布。权重和配套文件已经在 Hugging Face 上线,Meta 没有在这篇发布公告中列出自营 API 的 token 单价;眼下更明确的使用路径是下载后本地运行,或等待合作伙伴接入。1
规格先核对:30B 是什么规模
| 项目 | 已确认信息 | 对选型的影响 |
|---|---|---|
| 模型定位 | Muse 家族的本地 Agent 模型,Meta 称其由 Muse Spark 蒸馏而来 | 重点测试长流程和工具链,不宜只当普通聊天模型比较 |
| 参数与架构 | 约 29.6B 总参数;密集因果 Transformer,含约 1.8B 的 ViT-G/14 视觉编码器,共 52 层 | 不是 MoE;总参数更接近实际常驻内存规模 |
| 上下文与模态 | 上下文长度 131,072+;输入为文本和图片,输出为文本 | 能处理截图、图表和文档,但不支持音频输入输出 |
| 推理控制 | low、medium、high、xhigh 四档 reasoning strength | 可按任务在质量、延迟和成本之间取舍 |
| 许可证 | Apache 2.0;BF16 权重、两种 4-bit 量化权重、DFlash drafter 和视觉编码器均列入发布物 | 适合商业和研究使用,但仍需遵守许可证与适用法律 |
| 知识截止 | 2026 年 1 月 4 日 | 对发布日期之后的事实不能期待模型内置知道 |
参数、架构、模态和许可证来自官方模型卡;Meta 发布博客把它概括为 30B 模型。官方还称模型训练数据包含公开数据、第三方提供的数据以及 Meta 产品和服务相关信息,但没有公开训练数据和训练代码。12
Benchmark 信号:Agent 任务有优势,但不是全面领先
下面的数字来自 Meta 在模型卡中给出的对比,参测对象是 Gemma4-31B Thinking Mode 和 Qwen3.6-27B Thinking Mode。它是厂商评测,不是同一套独立复测;加粗只表示 Meta 这张表里的最高值,不代表跨榜单总排名。2
| 方向 | Benchmark | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| 工具与 Agent | MCP Atlas(Public) | 75.5 2 | 54.2 | 62.5 |
| 深度检索 | DeepSearch QA | 74.6 2 | 61.7 | 71.1 |
| 软件工程 | SWE-Bench Pro | 51.2 2 | 36.9 | 50.2 |
| 软件工程 | SWE-Bench Verified | 76.0 2 | 66.6 | 77.2 |
| 终端 Agent | TerminalBench 2.1 | 51.7 2 | 43.4 | 60.7 |
| 电脑操作 | OSWorld-Verified | 65.9 2 | 58.5 | 75.6 |
| 视觉推理 | ScreenSpot Pro | 75.4 2 | 75.9 | 76.1 |
| 数学推理 | AIME 2026 | 94.7 2 | 89.2 | 94.1 |
Meta 的官方对比表显示:Muse Glimmer 在 MCP Atlas、DeepSearch QA 和 SWE-Bench Pro 等项目领先,但 Qwen3.6-27B 在 SWE-Bench Verified、TerminalBench 2.1、OSWorld-Verified 和多项多模态项目中更高。1
这组结果更适合回答「它想优化什么」,不适合直接回答「它是否全面胜过同尺寸模型」。第三方 VentureBeat 对同一张表的复述也把 Glimmer 归为更偏本地 Agent 的模型,而不是普遍性能领先者。3
本地部署:24GB 是量化后的目标,不是最低配置承诺
Meta 的官方说明把完整精度模型的内存需求估算为超过 55GB。约 4-bit 的量化版本可把语言模型压到 20GB 以下,并为 KV cache、视觉编码器和推测解码 drafter 留出空间;其中 K-Quant-17GB 目标是 24GB VRAM,K-Quant-Dynamic 目标是 32GB VRAM。官方模型卡报告,前者在 15 个常见 benchmark 的平均精度下降约 1.0%,后者约 0.2%,这些是 Meta 自测数字。12
为解决 Agent 多轮调用累积的延迟,Meta 随权重发布了基于 DFlash 的 drafter。官方在批量大小为 1、贪心解码的测试中报告:RTX 5090 从 74.9 token/s 提升到 233.4 token/s,即 3.1 倍;M5 Max 为 1.8 倍,M4 Max 为 1.5 倍。测试使用 llama.cpp 或 ExecuTorch,不能直接当成你的机器上的实测速度。2
因此,「24GB 可用」应理解为官方为量化推理和完整 Agent 组件设定的目标环境。8GB 或 16GB 的普通笔记本不在这条路径上;实际还会受到上下文长度、视觉输入、drafter 配置和运行时实现影响。3
能力与安全边界
Muse Glimmer 的训练和评估目标包括端到端任务完成、精确工具调用、多步推理、工具失败后的重试、文本与图片交错输入,以及对 OpenClaw、Hermes Agent 等脚手架的适配。模型支持 100 多种语言,但模型卡也提醒,未对所有训练语言分别评估,弱支持语言的表现可能下降。12
安全方面,Meta 将 Glimmer 的化学/生物、网络和失控风险评为 Moderate or lower;其中网络和失控结论明确标注为基于与 Muse Spark 的能力比较而来的推断。模型卡还给出两组需要留意的 Agent 安全结果:在 CI Memories 隐私评测中,Glimmer 的 violation 为 26.4,低于 Qwen3.6-27B 的 53.4,但高于 Gemma4-31B 的 12.1;在 Siren AgentDojo 中,Glimmer 的攻击成功率为 28.4%,高于 Gemma 的 25.6%,低于 Qwen 的 40.3,同时 utility 为三者最高的 94.2。2
这意味着本地运行减少了数据持续上传到云端的需要,却没有自动解决提示注入、权限过大或不可逆操作的问题。Meta 建议把模型放进带额外护栏的系统,并在会修改文件、调用外部服务或执行不可逆动作的场景加入人工确认。2
现在怎么试
- 先下载权重,再选运行时。 Hugging Face 模型页 已提供 BF16、4-bit 量化和 DFlash 等发布物;Meta 还给出了开发者文档。
- 用一套可验收的长任务测试。 让 Agent 读取一个真实代码库、调用 2—3 个工具、处理一张截图,再完成可检查的输出。记录成功率、重试次数、人工接管次数、总耗时和峰值显存。
- 把 Qwen3.6-27B 和 Gemma4-31B 放进同一套脚本。 官方表已经显示三者各有强项;尤其是终端编码、电脑操作和视觉任务,不要用单一总分替代真实工作流。
- 把成本拆成硬件与托管两栏。 官方发布页当前明确的是开放权重和合作伙伴接入计划,没有给出 Meta 自营 API 单价;如果不本地部署,就要等实际托管平台公布价格和限额。
- 给工具调用加权限边界。 至少限制文件写入、网络访问和不可逆操作,并保留人工确认。模型卡明确不支持音频输入输出,视频也不是专门优化的模态,视频输入按单帧处理。12
对开发者而言,Muse Glimmer 最值得进入评测集的理由是「本地 Agent 的整套组件」已经随权重发布,而不是某个 benchmark 的单点领先。先在 24GB 或 32GB 设备上复测你的工具链,再决定是否把它用于日常编码、文档处理或隐私敏感的本地工作流。
References
- 1Meta 官方发布博客
research.meta.ai
- 2Muse Glimmer 官方模型卡
huggingface.co
- 3VentureBeat 报道
venturebeat.com

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.