
Qwen3.8-Flash-Next 开放权重上架:125B/6B、Qwen4 架构预览、云端价已公布
Qwen3.8-Flash-Next 开放权重已在 Hugging Face 上架;本文核对 125B/6B、51B n-gram、Qwen4 架构预览、Qwen Community License,以及 QwenCloud $0.16/$0.47 但 API 即将上线的边界。
先看结论
Qwen 团队在北京时间 2026 年 8 月 26 日 开放了 Qwen3.8-Flash-Next 的权重。Hugging Face 官方模型记录的
lastModified 为当天 20:29:54,仓库已包含 Transformers 格式权重与配置文件;同日官方博客与 @Alibaba_Qwen 发布帖同步给出了参数、评测和云端报价。123这次落地的重点有三层。第一,它是可下载的多模态 MoE 开放权重,主模型 125B、每 token 激活 6B,另有 51B n-gram embedding 和 4B MTP。第二,官方把它定位为 Qwen4 架构的早期预览,角色类似当年 Qwen3-Next 之于 Qwen3.5。第三,托管生产版以 Qwen3.8-Flash 名义挂在 QwenCloud,报价为每百万 tokens 输入 $0.16、输出 $0.47,但官方明确写着 API coming soon。12
对选型团队来说,现在可以下载权重做本地兼容和任务评测;云端采购预算可以按公布价格先测算,正式调用还要等 API 真正开放。许可方面,仓库使用的是 Qwen Community License 1.0;此前同系列的 Qwen3.8-27B 标注的是 Apache-2.0。4
关键资料一览
| 项目 | 目前可确认的信息 |
|---|---|
| 发布时间 | Hugging Face lastModified 为 2026-08-26 20:29:54(北京时间);官方博客标注 2026/08/26;@Alibaba_Qwen 主帖时间为当天 20:34。123 |
| 模型定位 | 多模态 MoE,带视觉编码器;官方称其为支撑 Qwen4 的下一代架构预览。2 |
| 参数口径 | 主模型 125B,每 token 激活 6B;另加 51B n-gram embedding、4B MTP。MoE 为 512 专家,每次激活 10 个 routed + 1 个 shared。Hugging Face 页面 Model size 另显示约 180B params。12 |
| 上下文 | 原生 262,144 tokens;可用 YaRN 扩展到 1,000,000 tokens。1 |
| 模态与能力 | 支持文本、图像、视频输入;默认思考模式,可用 enable_thinking、preserve_thinking、reasoning_effort 控制。1 |
| 开放入口 | Hugging Face Qwen/Qwen3.8-Flash-Next 与 FP8 版 Qwen/Qwen3.8-Flash-Next-FP8;官方同时给出 ModelScope 仓库链接。模型卡列出 SGLang、vLLM、TokenSpeed 部署路径。125 |
| 许可 | 仓库 LICENSE 为 Qwen Community License 1.0;Hugging Face 元数据标注 license:other。14 |
| API 与价格 | QwenCloud 生产版模型名为 qwen3.8-flash,报价输入 $0.16 / 输出 $0.47(每百万 tokens),默认 1M 上下文并带官方内置工具;官方博客与模型卡均写明 API 即将上线。123 |
这里最容易混的是两个名字。Qwen3.8-Flash-Next 是今天可下载的开放权重;Qwen3.8-Flash 是 QwenCloud 上的托管生产版。官方说后者基于前者,并额外提供默认 1M 上下文和内置工具。12
参数口径也要分开读。125B / 6B 是官方模型概览里的主模型总参数与激活参数;51B 是可卸载到主机内存的 n-gram embedding;页面底部约 180B 的 Model size 更接近把这些模块加总后的展示字段。部署显存应以实际权重、量化和框架测量为准。12
架构为什么值得现在看
官方把这次改动概括成四条线:注意力、残差、embedding 和优化器。对开发者最直接相关的,是 GDN + Qwen Sparse Attention(QSA) 混合注意力,以及那块 51B n-gram embedding。2

按官方说明,四个里有三个会直接影响长上下文和服务成本:
- GDN 负责压缩历史,QSA 在微块粒度上挑重要上下文。 官方称在 1M tokens 下,QSA 的 Attention Kernel 在 Prefill / Decode 最高可到 7.6× / 4.9× 加速;在 90% Prefix Cache 命中率的实验设置里,1M 上下文 Prefill 吞吐约为 Qwen3.7-Plus 的 8.6×。2
- n-gram embedding 用查表扩容量。 官方称这 51B 参数几乎不增加每 token 矩阵乘成本,并可放到主机内存异步预取。2
- 训练成本口径。 官方称相对 Qwen3.7-Plus,训练成本大约只有 1/9,同时在编码和办公任务上更强。这是厂商自述,适合作为本地评测的对照起点。23

官方自报 benchmark
下面几组分数都来自 Qwen 官方博客和模型卡,属于厂商自述。表格同时列出 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 和 Claude-Opus-4.6 (Max);脚注说明了不同 harness 与上下文设置。本文只收录这组官方数字。2
| 评测 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 2 | 42.2 | 16.5 | 54.4 | — |
| SWE-bench Pro | 62.5 2 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 2 | 73.8 | 75.8 | — | 77.5 |
| CoWorkBench | 73.9 2 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 2 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified (Pass@1) | 73.5 2 | 67.1 | 50.6 | 70.3 | — |
| GPQA Diamond | 91.7 2 | 89.2 | 90.3 | 90.8 | 91.3 |
| LiveCodeBench v6 | 91.9 2 | 90.3 | 89.6 | 90.6 | 88.8 |
视觉与多模态 Agent 一侧,官方给出的代表性分数包括:ClawEval-MM Pass@3 64.4、AndroidWorld 84.5、OSWorld 2.0 Binary / Partial 19.4 / 52.3、Vision2Web 64.0、MathVision(开启 CI)95.7。这些结果支持把编码 Agent、办公协作和看图操作放进第一轮评测集;真实业务任务还要单独看完成率和人工接管次数。23
许可与商业边界
仓库根目录的 LICENSE 标题是 Qwen Community License 1.0。条款允许免费使用、修改、分发、部署、微调和衍生,但附带两条商业条件:4
- 如果把该软件或其衍生作品用于月活超过 1 亿,或月收入超过 2000 万美元 的商业产品或服务,产品界面上必须显著展示相应模型名称。4
- 如果许可方或其关联方开展 Model as a Service 或 AI Work Assistant 业务,商业用途前需要另行取得 Qwen 许可;仅内部使用、且不把模型能力提供给第三方时,不受这条限制。4
LICENSE 对 MaaS 和 AI Work Assistant 给了定义:前者大致是把推理或微调以 API / 托管端点方式交给第三方控制;后者大致是以 AI 辅助编程或办公生产力为主的独立产品。单功能工具、非编程/办公主域助手,以及主产品并非 AI 编程/办公助手的内嵌功能,被明确排除在 AI Work Assistant 之外。法务和商务评审仍应以 LICENSE 原文和 Qwen 商务联系邮箱为准。4
现在适合怎样试
- 本地先做框架兼容。 用官方列出的 SGLang、vLLM 或 TokenSpeed 启动标准版或 FP8 版,记录权重占用、吞吐、长上下文延迟,以及不同
reasoning_effort下的成本。FP8 官方称性能接近原版。15 - 把编码 Agent 和办公 Agent 放在同一轮。 至少覆盖仓库修复、工具调用、截图/网页操作和多轮办公任务;记录完成率、重试次数和人工接管,而不只看单轮回答分数。官方自报强项集中在这些方向。2
- 把 262K 与 1M 分开验收。 本地原生能力先按 262K 测;若启用 YaRN 到 1M,另测长短文本两组任务。QwenCloud 默认 1M 和内置工具,等 API 真正开放后再核验模型 ID、限流和地区。12
- 商业路径先过许可。 内部评测可以今天开始;若计划做成对外 MaaS、编程助手或办公助手产品,先对照 Qwen Community License 1.0 判断是否需要额外授权,再决定走本地权重还是等 QwenCloud。4
Qwen3.8-Flash-Next 现在已经从预告页变成可下载、可部署的候选模型。它最明确的价值,是把 Qwen4 方向的混合注意力、稀疏检索和低激活 MoE 提前交给社区。本地团队可以今天开测;依赖托管 API 或要做对外商业产品的团队,先把价格测算、API 开放进度和许可边界写进接入清单。
References
- 1Qwen/Qwen3.8-Flash-Next · Hugging Face
huggingface.co
- 2Qwen 官方博客:Qwen3.8-Flash-Next
qwen.ai
- 3Qwen 官方发布帖
x.com
- 4Qwen3.8-Flash-Next LICENSE
huggingface.co
- 5Qwen/Qwen3.8-Flash-Next-FP8 · Hugging Face
huggingface.co
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- GLM-5.3-BF16 完整开放权重上线:753B 参数,代码与安全 benchmark 公开
- 腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活,1M 上下文
- Qwen3.8-Flash API 已正式上线
- GLM-5.3-Flash 发布:320B/18B 开权重、1M 上下文、API 五折至 9/9
- DeepSeek-V4-Flash-Vision-Exp 发布:官方称多模态 Agent 接近 Opus-4.8,API 已上线
- GLM-5.3 API 正式上线:与 GLM-5.2 同价,接入前先改推理参数
- Qwen3.8-27B 开放权重上架:27B 原生视觉、Apache-2.0、262K 上下文
- GLM-5.3 发布:基于 743B 基座训练,编码与网络安全能力跃升
