
Qwen3.8-Max 开放权重上架:2.4T/95B,先分清本地模型与 QwenCloud
Qwen3.8-Max 官方开放权重已在 Hugging Face 上架;本文核对 2.4T/95B、262K 原生上下文、部署兼容性与许可边界,并区分本地模型和 QwenCloud 托管版本。
先看结论
Qwen3.8-Max 的开放权重已经落地。官方 Hugging Face 仓库
Qwen/Qwen3.8-2.4T-A95B 的元数据显示,最近一次更新发生在 2026 年 8 月 12 日 18:24(UTC+8);仓库包含 Transformers 格式的权重和配置文件,可下载到本地,并提供 vLLM、SGLang、TokenSpeed 的部署入口。这个时间是仓库变更时间,不等同于 Qwen3.8-Max 最初发布博客的时间。12对开发者来说,最容易混淆的一点是:开放仓库不是 QwenCloud 上的完整托管产品形态。仓库里的
Qwen3.8-2.4T-A95B 是纯文本、必须开启 thinking 的模型;QwenCloud 的 qwen3.8-max 才提供视觉输入、默认 1M 上下文和内置工具。想本地部署,先评估显存、并行和推理框架;想直接接入产品,则应按 QwenCloud 的模型 ID、价格和限流来算账。23开放权重到底开放了什么
| 项目 | 官方已确认信息 | 对选型的影响 |
|---|---|---|
| 模型与规模 | Qwen3.8-2.4T-A95B;总参数 2.4T,激活参数 95B | 这是超大规模 MoE,不应按 95B 密集模型估算硬件 |
| MoE 架构 | 512 个 experts;每次路由 10 个专家,另有 1 个共享专家 | 激活量低于总参数,但权重存储和分布式加载仍是主要门槛 |
| 上下文 | 原生 262,144 tokens,官方称可扩展到 1,010,000 tokens | 长上下文能力取决于运行时、显存和 KV cache 配置,不能只看模型卡上限 |
| 文件与格式 | BF16、Safetensors,Hugging Face Transformers 格式;页面还列出量化模型 | 本地部署需要准备模型文件、量化方案和并行推理环境 |
| 官方兼容 | vLLM、SGLang、TokenSpeed,并分别提供部署配方 | 优先使用最新框架版本,先验证算子、显存和吞吐,再进入生产 |
| 许可证字段 | Hugging Face 元数据为 license: other,模型卡没有把它写成 Apache 2.0 或 MIT | 不要把「开放权重」直接理解成任意商用;上线前应核对仓库当前许可文本 |
其中,2.4T 是总参数,95B 是激活参数,两者回答的是不同问题:前者更接近权重规模和分布式存储压力,后者更接近单次计算中参与路由的参数量。512 专家、10 个路由专家加 1 个共享专家的结构也来自官方模型卡,而不是社区推测。2
需要特别留意许可。当前仓库元数据显示为
other,模型卡正文把它称为 Qwen3.8-Max 的官方开放版本,但没有在可读正文中给出 Apache、MIT 这类熟悉的许可名称。对于商业部署,先把许可文件和模型卡里的限制读完,不要只根据「open release」四个字做合规判断。12开放仓库与 QwenCloud 不是同一个接口
| 使用路径 | 模型 ID / 入口 | 输入与上下文 | 价格或部署信息 |
|---|---|---|---|
| 本地或自建推理 | Qwen/Qwen3.8-2.4T-A95B;官方 Hugging Face 仓库 | 纯文本;必须使用 thinking,不能关闭 thinking;原生 262K,可扩展约 1.01M | 权重本身没有 token 计费,但硬件、显存、带宽和运维成本由使用者承担 |
| QwenCloud 托管 API | qwen3.8-max;官方模型页 | 文本、图片、视频输入;上下文 1M;最大输入约 991K,最大输出 131K | 输入 $2 / 1M tokens,输出 $6 / 1M tokens;隐式缓存读取 $0.25 / 1M tokens |
开放仓库的 API 示例要求启用
enable_thinking,并支持 reasoning_effort 的 xhigh、medium、low 三档;模型卡同时明确写着不支持多模态输入,也不能关闭 thinking。若业务依赖图片、视频、非思考模式或内置工具,不能把本地仓库直接当成 QwenCloud 的等价替代。2QwenCloud 页面列出的托管版本还包括函数调用、结构化输出、上下文缓存、批量调用、网页搜索和代码解释器等能力;页面当前给出的限流为 2M TPM、15K RPM。这些是服务页面上的托管配置,不应反推成本地权重已经内置了同样的工具或限流机制。3
Benchmark:强项集中在长程任务,但口径不能横着比
下面的数字来自 Qwen 官方模型卡的对比表,属于厂商自测。不同模型使用的 harness、超时、采样次数和上下文设置并不完全一致;官方还把部分外部模型的已发布最好成绩放进同一表格。因此,这张表适合判断 Qwen3.8 的目标方向,不适合当作一张严格控制变量的独立排行榜。2
| 评测 | Qwen3.8-Max | 对照结果 | 读法 |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | GPT-5.6 Sol 88.8;Claude Opus 4.8 84.6;Qwen3.7-Max 74.5 | 接近前沿编码 Agent,但不是表内最高 |
| SWE-bench Pro | 67.7 | Claude Fable 5 80.0;Claude Opus 4.8 69.2;Qwen3.7-Max 60.6 | 软件工程表现靠前,仍明显受 harness 影响 |
| PaperBench | 93.0 | GPT-5.6 Sol 90.5;Claude Fable 5 88.8;Qwen3.7-Max 64.8 | 复杂研究型任务是官方突出强项 |
| IFBench | 82.8 | Qwen3.7-Max 79.1;GPT-5.6 Sol 72.7;Claude Opus 4.8 62.2 | 指令遵循信号较强 |
| MRCR v2 256K(8-needle) | 92.9 | GPT-5.6 Sol 93.8;Qwen3.7-Max 86.7;Claude Opus 4.8 83.2 | 长上下文检索接近最高,但不是全面领先 |
如果你的任务是让 Agent 连续修改代码、阅读长文档、调用工具并根据反馈修正,官方数据足以支持把 Qwen3.8 放进第一轮评测集。若是视觉问答或多模态办公,则应测试 QwenCloud 版本,而不是拿纯文本开放仓库下结论。23
现在适不适合试
适合本地评测的团队:已有多卡服务器或成熟的分布式推理栈,需要在代码、研究、长流程 Agent 任务中比较开放模型,并且能接受自行承担权重存储、并行调度和故障排查成本。第一步应从官方 vLLM 或 SGLang 配方启动小规模测试,记录首 token 延迟、生成速度、峰值显存、上下文长度和工具调用成功率。2
更适合先用 API 的团队:需要视觉输入、内置工具、结构化输出或快速验证产品效果,不想先解决 2.4T 权重的部署问题。按 QwenCloud 当前页面,
qwen3.8-max 的输入和输出价格分别是每百万 token 2 美元和 6 美元;长上下文应用还应把缓存和最大输出一起计入预算。3建议用同一组真实任务同时测两条路径:一个多文件代码库、一个需要长文档检索的流程、一个带图片或视频的任务,再把成功率、耗时、token、人工接管次数和总成本放在同一张表里。这样才能看出开放权重带来的部署自由,是否抵消了它在纯文本输入、硬件门槛和许可确认上的限制。
References
- 1Hugging Face 官方模型 API 元数据
huggingface.co
- 2Qwen3.8-2.4T-A95B 官方模型卡
huggingface.co
- 3QwenCloud Qwen3.8-Max 模型页
qwencloud.com

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.