Qwen3.8-Max 开放权重上架:2.4T/95B,先分清本地模型与 QwenCloud

Qwen3.8-Max 开放权重上架:2.4T/95B,先分清本地模型与 QwenCloud

Qwen3.8-Max 官方开放权重已在 Hugging Face 上架;本文核对 2.4T/95B、262K 原生上下文、部署兼容性与许可边界,并区分本地模型和 QwenCloud 托管版本。

先看结论

Qwen3.8-Max 的开放权重已经落地。官方 Hugging Face 仓库 Qwen/Qwen3.8-2.4T-A95B 的元数据显示,最近一次更新发生在 2026 年 8 月 12 日 18:24(UTC+8);仓库包含 Transformers 格式的权重和配置文件,可下载到本地,并提供 vLLM、SGLang、TokenSpeed 的部署入口。这个时间是仓库变更时间,不等同于 Qwen3.8-Max 最初发布博客的时间。12
对开发者来说,最容易混淆的一点是:开放仓库不是 QwenCloud 上的完整托管产品形态。仓库里的 Qwen3.8-2.4T-A95B 是纯文本、必须开启 thinking 的模型;QwenCloud 的 qwen3.8-max 才提供视觉输入、默认 1M 上下文和内置工具。想本地部署,先评估显存、并行和推理框架;想直接接入产品,则应按 QwenCloud 的模型 ID、价格和限流来算账。23

开放权重到底开放了什么

项目官方已确认信息对选型的影响
模型与规模Qwen3.8-2.4T-A95B;总参数 2.4T,激活参数 95B这是超大规模 MoE,不应按 95B 密集模型估算硬件
MoE 架构512 个 experts;每次路由 10 个专家,另有 1 个共享专家激活量低于总参数,但权重存储和分布式加载仍是主要门槛
上下文原生 262,144 tokens,官方称可扩展到 1,010,000 tokens长上下文能力取决于运行时、显存和 KV cache 配置,不能只看模型卡上限
文件与格式BF16、Safetensors,Hugging Face Transformers 格式;页面还列出量化模型本地部署需要准备模型文件、量化方案和并行推理环境
官方兼容vLLM、SGLang、TokenSpeed,并分别提供部署配方优先使用最新框架版本,先验证算子、显存和吞吐,再进入生产
许可证字段Hugging Face 元数据为 license: other,模型卡没有把它写成 Apache 2.0 或 MIT不要把「开放权重」直接理解成任意商用;上线前应核对仓库当前许可文本
其中,2.4T 是总参数,95B 是激活参数,两者回答的是不同问题:前者更接近权重规模和分布式存储压力,后者更接近单次计算中参与路由的参数量。512 专家、10 个路由专家加 1 个共享专家的结构也来自官方模型卡,而不是社区推测。2
需要特别留意许可。当前仓库元数据显示为 other,模型卡正文把它称为 Qwen3.8-Max 的官方开放版本,但没有在可读正文中给出 Apache、MIT 这类熟悉的许可名称。对于商业部署,先把许可文件和模型卡里的限制读完,不要只根据「open release」四个字做合规判断。12

开放仓库与 QwenCloud 不是同一个接口

使用路径模型 ID / 入口输入与上下文价格或部署信息
本地或自建推理Qwen/Qwen3.8-2.4T-A95B官方 Hugging Face 仓库纯文本;必须使用 thinking,不能关闭 thinking;原生 262K,可扩展约 1.01M权重本身没有 token 计费,但硬件、显存、带宽和运维成本由使用者承担
QwenCloud 托管 APIqwen3.8-max官方模型页文本、图片、视频输入;上下文 1M;最大输入约 991K,最大输出 131K输入 $2 / 1M tokens,输出 $6 / 1M tokens;隐式缓存读取 $0.25 / 1M tokens
开放仓库的 API 示例要求启用 enable_thinking,并支持 reasoning_effortxhighmediumlow 三档;模型卡同时明确写着不支持多模态输入,也不能关闭 thinking。若业务依赖图片、视频、非思考模式或内置工具,不能把本地仓库直接当成 QwenCloud 的等价替代。2
QwenCloud 页面列出的托管版本还包括函数调用、结构化输出、上下文缓存、批量调用、网页搜索和代码解释器等能力;页面当前给出的限流为 2M TPM、15K RPM。这些是服务页面上的托管配置,不应反推成本地权重已经内置了同样的工具或限流机制。3

Benchmark:强项集中在长程任务,但口径不能横着比

下面的数字来自 Qwen 官方模型卡的对比表,属于厂商自测。不同模型使用的 harness、超时、采样次数和上下文设置并不完全一致;官方还把部分外部模型的已发布最好成绩放进同一表格。因此,这张表适合判断 Qwen3.8 的目标方向,不适合当作一张严格控制变量的独立排行榜。2
评测Qwen3.8-Max对照结果读法
Terminal-Bench 2.186.6GPT-5.6 Sol 88.8;Claude Opus 4.8 84.6;Qwen3.7-Max 74.5接近前沿编码 Agent,但不是表内最高
SWE-bench Pro67.7Claude Fable 5 80.0;Claude Opus 4.8 69.2;Qwen3.7-Max 60.6软件工程表现靠前,仍明显受 harness 影响
PaperBench93.0GPT-5.6 Sol 90.5;Claude Fable 5 88.8;Qwen3.7-Max 64.8复杂研究型任务是官方突出强项
IFBench82.8Qwen3.7-Max 79.1;GPT-5.6 Sol 72.7;Claude Opus 4.8 62.2指令遵循信号较强
MRCR v2 256K(8-needle)92.9GPT-5.6 Sol 93.8;Qwen3.7-Max 86.7;Claude Opus 4.8 83.2长上下文检索接近最高,但不是全面领先
如果你的任务是让 Agent 连续修改代码、阅读长文档、调用工具并根据反馈修正,官方数据足以支持把 Qwen3.8 放进第一轮评测集。若是视觉问答或多模态办公,则应测试 QwenCloud 版本,而不是拿纯文本开放仓库下结论。23

现在适不适合试

适合本地评测的团队:已有多卡服务器或成熟的分布式推理栈,需要在代码、研究、长流程 Agent 任务中比较开放模型,并且能接受自行承担权重存储、并行调度和故障排查成本。第一步应从官方 vLLM 或 SGLang 配方启动小规模测试,记录首 token 延迟、生成速度、峰值显存、上下文长度和工具调用成功率。2
更适合先用 API 的团队:需要视觉输入、内置工具、结构化输出或快速验证产品效果,不想先解决 2.4T 权重的部署问题。按 QwenCloud 当前页面,qwen3.8-max 的输入和输出价格分别是每百万 token 2 美元和 6 美元;长上下文应用还应把缓存和最大输出一起计入预算。3
建议用同一组真实任务同时测两条路径:一个多文件代码库、一个需要长文档检索的流程、一个带图片或视频的任务,再把成功率、耗时、token、人工接管次数和总成本放在同一张表里。这样才能看出开放权重带来的部署自由,是否抵消了它在纯文本输入、硬件门槛和许可确认上的限制。
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.