Qwen3.8 开放权重落地:Max 级模型开放了,云端能力没有一起打包

Qwen3.8 开放权重落地:Max 级模型开放了,云端能力没有一起打包

Qwen3.8-2.4T-A95B 已在 Hugging Face 公开完整 BF16 权重,但文本模型、分布式部署与云端多模态工具之间仍有清晰边界。

Qwen3.8 的开放权重已经落地,但它不是 Qwen3.8-Max 云端产品的原样复制:Hugging Face 上公开的是一个 2.4 万亿总参数、约 950 亿激活参数的文本模型,而图像、视频输入、内置工具和默认百万 token 上下文仍属于云端版本的产品边界。12
这个区分决定了它对不同读者的价值:想研究 Max 级模型的行为、改造推理栈或验证 MoE 部署的人,现在拿到了真正的开放权重;想直接使用多模态 Agent 能力的人,仍然面对的是另一套云端接口。

先看开放了什么

Hugging Face 官方 API 显示,Qwen/Qwen3.8-2.4T-A95B2026 年 8 月 8 日创建,仓库公开且无需 gated 访问;文件列表包含 213 个 safetensors 分片,以及 config.jsongeneration_config.json 和许可证文件。模型卡将许可证标为 qwen3.8-max,并说明这些权重采用 Transformers 格式,可接入 vLLM、SGLang 和 TokenSpeed。1
这比「开放了一个模型页面」更实在:外部团队获得了模型参数、配置和推理入口,可以检查架构、替换 serving 框架,也可以在自己的环境中测量行为。它同时也远未等于「下载后单机运行」。
2.4 万亿是全部专家参数的总和,950 亿是每个 token 路由时实际激活的参数规模。模型使用 512 个专家,每次激活 10 个路由专家和 1 个共享专家;92 层的布局交替使用 Gated DeltaNet 与 Gated Attention。MoE 减少了单个 token 的计算量,却不会把全部专家权重从显存需求中抹掉。1
如果只用 BF16 张量大小做粗略换算,仓库 API 返回的 2,446,182,725,504 个参数对应约 4.9 TB 原始权重存储;这不是官方给出的最低显存,也不包含 KV cache、运行时缓冲、并行通信和框架开销。官方没有在模型卡中给出最低 GPU 数量或端到端吞吐,因此不能把它包装成一份单机部署教程。

为什么 Qwen 把它称为 Max 级开放模型

Qwen3.8-Max 的官方博客把重点放在长时间、开放目标和反馈循环上,而不只是一次问答的分数。官方案例包括持续十多天自动维护代码仓库、用约五天时间从论文重建数据筛选实验并尝试改进,以及在 24 小时竞赛中连续提交 45 次方案。3
论文复现实验是其中最容易核对的一组数字。Qwen 官方称,模型从论文和 GPU 开始,重写数据处理、训练和评测代码,约 125 小时完成 33 轮 GPU 训练;它先把论文方法复现到 AIME24 49.58%,再测试 18 个改进想法,最终将最高成绩提高到 52.29%,相对复现基线增加 2.71 个百分点。这个结果说明官方展示的是「模型能否组织一个研究循环」,不是只比较一次生成答案的准确率。3
官方 benchmark 表还报告了 Qwen3.8-Max 在 Terminal Bench 2.1 上 86.6、SWE-bench Pro 上 67.7、PaperBench 上 93.0、CoWorkBench 上 74.8 的成绩。图中的横向比较覆盖编码 Agent、办公任务、研究复现和视觉 Agent,但脚注同时说明:不同模型使用了不同 harness,部分任务是 Qwen 内部 benchmark,部分外部模型分数取自公开榜单或官方报告。3
Qwen3.8-Max 在软件工程、研究复现、办公任务和视觉 Agent 等任务上的官方对比成绩
图中蓝色柱为 Qwen3.8-Max;例如 PaperBench 为 93.0、OSWorld-Verified 为 86.1。不同 benchmark 的 harness、评测设置和分数来源并不完全相同,不能把各柱简单相加成一个总排名。3
因此,官方材料能支持的判断是:Qwen3.8 把训练目标推进到了长链条任务的执行、验证和反复修正;它还不能单凭这张图证明在所有 Agent 工作流中都稳定领先。尤其是一个模型在自己的 harness、内部 benchmark 或精选案例中表现良好,与外部团队用统一环境复测,是两件不同的事。

开放模型和云端 Max 不是同一个接口

这次发布最容易被混淆的地方,是「Qwen3.8-2.4T-A95B」和「Qwen3.8-Max」的名称关系。Qwen 官方博客先在 8 月 3 日介绍云端 Qwen3.8-Max,并称开放权重将在随后发布;Hugging Face 仓库随后公开了对应的 Qwen3.8-2.4T-A95B。仓库说明,Qwen3.8-Max 是基于该开放模型的官方版本,但加入了更多产品能力。13
差异可以直接从两份官方说明中对照出来:
  • 输入模态:QwenCloud 的 Qwen3.8-Max 页面列出文本、图像和视频输入;Hugging Face 模型卡明确写明开放权重版本是文本模型,不支持多模态输入。12
  • 上下文长度:云端页面列出的上下文为 1M,最大输入约 991K;开放模型原生上下文为 262,144 token,模型卡称可扩展到约 1,010,000 token。扩展上限不等于每个本地配置都能稳定承载百万 token。12
  • 推理控制:开放模型支持 reasoning_effort,可选 xhighmediumlow,并默认保留 thinking;但模型卡明确写明开放版本必须使用 thinking,不能关闭。1
  • 工具能力:QwenCloud 页面列出代码解释器、网页搜索、网页提取和图像搜索等内置工具;这些是云端服务能力,不能从开放权重仓库的模型参数中自动获得。2
所以,「Qwen3.8 开放了」的准确含义是:模型本体开放了;云端产品围绕模型搭建的多模态输入、工具调用、服务化上下文和托管体验没有随权重一起变成一套本地软件包。

对部署团队,真正的门槛在哪里

第一道门槛是权重规模。MoE 让每个 token 只激活部分专家,因此不能用 2.4T dense 模型的计算直觉估算速度;但所有专家仍要被加载、分片和调度。95B 激活参数代表计算路径的一部分,不代表整个模型只需要存放 95B 参数。
第二道门槛是长上下文的系统成本。即使模型结构允许扩展到约 1M token,KV cache、并行通信和请求调度也会随上下文增长。仓库提供的是模型配置和权重,未提供一条由 Qwen 官方保证的最低硬件方案;工程团队需要自己测量显存、吞吐、首 token 延迟和长上下文退化。
第三道门槛是开放权重与产品能力的边界。需要图像或视频输入、内置搜索、关闭 thinking,或者希望直接获得百万上下文托管服务的场景,不能因为模型名字相同就假定本地版本具备同样能力。需要检查模型行为、改造专家路由、接入自己的 Agent harness 的团队,才是这次开放权重最直接的受益者。

这次发布改变了什么,没改变什么

它改变的是开放模型的上限:Qwen 首次把 Max-class 模型的完整权重入口放到了公开仓库,而不是只开放 API。仓库的公开状态、213 个 safetensors 分片和可接入主流推理框架的配置,使外部研究和工程复测成为可能。1
它没有改变三个现实。第一,开放权重的原始存储规模仍接近 TB 级,部署需要分布式基础设施。第二,官方能力数字仍混合了不同 harness、内部 benchmark 和官方自测,外部团队要在统一设置下复测。第三,云端 Qwen3.8-Max 的多模态和工具能力不能直接从文本权重推导出来。
对研究者,这个仓库足以支持模型结构、推理效率和后训练行为研究;对基础设施团队,下一步应先验证框架版本、并行策略、BF16 权重占用和 reasoning_effort 行为;对普通 API 用户,云端版本仍然更接近官方博客展示的完整体验。把它称为「Max 级开放权重」是准确的,把它称为「下载即用的 Max 产品」则超出了现有材料能支持的范围。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.