Qwen3.8-Flash-Next:6B 激活预览 Qwen4 架构,训练 FLOPs 约前代 1/9

Qwen3.8-Flash-Next:6B 激活预览 Qwen4 架构,训练 FLOPs 约前代 1/9

阿里 Qwen 开放 Qwen3.8-Flash-Next:125B+51B N-gram、6B 激活的多模态 MoE,官方称训练 FLOPs 约 Qwen3.7-Plus 的 1/9,并作为 Qwen4 架构预览。

阿里 Qwen 团队在 2026 年 8 月 26 日发布官方技术博客与技术报告,开放 Qwen3.8-Flash-Next 权重,并预告云端生产版 Qwen3.8-Flash。官方把它写成 Qwen4 架构的早期预览:角色类似当年 Qwen3-Next 对 Qwen3.5 系列的关系——先把结构改动交给社区检验,再在其上搭完整家族。12
核心主张可以收成一句话:用 125B 主干 + 51B N-gram Embedding、每 token 只激活 6B 的多模态 MoE,在大约 1/9 训练 FLOPs 的预算下,把基座质量拉到接近前代 397B 总参 / 17B 激活(Qwen3.7-Plus),并在编码、办公 Agent 与多模态任务的官方表上继续拉开差距。12

开放了什么,云端叫什么

两个名字不要混:
名称形态读者能立刻用的东西
Qwen3.8-Flash-NextHugging Face / ModelScope 开放权重架构检验、本地/自建 serving、量化与 runtime 适配
Qwen3.8-FlashQwenCloud 生产服务默认 1M 上下文、官方内置工具;API 博客写明 coming soon
上表边界来自官方博客与模型卡对两个名称的分工说明。13
参数口径以模型卡为准:125B 主干参数、6B 激活,另加 51B N-gram Embedding 与 4B MTP48 层;布局为 12 组「3×(GDN→MoE) + 1×(QSA→MoE)」;MoE 为 512 专家,每 token 10 个路由专家 + 1 个共享专家;原生上下文 262,144 token,可用 YaRN 扩到 1,000,0003
config.jsonmodel_typeqwen4_exparchitecturesQwen4ExpForConditionalGeneration,与博客「Qwen4 架构预览」的说法一致。3
与本频道此前解读的 Qwen3.8-2.4T-A95B(Max 级开放权重) 不在同一档:Max 是约 2.4T 总参、95B 激活的文本权重;Flash-Next 是更小激活、带视觉编码器的多模态 MoE,并显式承担 Qwen4 结构试验。
云端报价写在博客与官方帖里:每百万 input token 0.16 美元,output 0.47 美元;国内媒体转述的人民币价(输入 1 元 / 输出 3 元)与此同量级,但以 QwenCloud 上线时页面为准。14

四条改动各自堵哪一类瓶颈

技术报告把设计拆成同一问题的三个轴:下游能力、训练/推理成本、训练稳定性与最优超参。四块组件分别对准不同瓶颈。2
Qwen3.8-Flash-Next 架构总览:GDN 与 QSA 交替、Gated Residual、Layer 2 的 N-gram Embedding 与 MTP
官方技术博客给出的架构图。1

注意力:GDN 记历史,QSA 做精确检索

沿用 Qwen3.5 以来的混合思路:每 4 层里 3 层 GDN、1 层全局注意力。GDN 把前缀压进固定大小的循环状态,代价近似线性;穿插的全局层保留有限状态记忆很难精确复现的 token 级检索。12
继续预训练阶段,这些全注意力层换成 Qwen Sparse Attention(QSA)。相对 token 级 indexer(如 DSA 路线),QSA 先把序列聚成 micro-block,在块级估重要性再展开做 attention,从而同时压低 attention 本身与 indexer 开销;索引在层内独立完成,适配 GDN 与 attention 交错的 hybrid。模型卡给出 indexer 预算:512 blocks 或 2048 tokens13
QSA:压缩轻量 indexer、top-k 选择与稀疏 core attention
官方 QSA 结构示意。1
1M token 设定下,官方报告 QSA Attention Kernel 相对稠密 attention:Prefill 最高约 7.6×、Decode 约 4.9×。在 90% prefix cache 命中 的在线服务近似设置中,Flash-Next 在 1M 上下文上的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6×1
90% cache hit 时相对 Prefill 吞吐随上下文长度变化;1M 处 Flash-Next 标为 8.6×
官方相对 Prefill 吞吐曲线。1

残差:Gated Residual 把一条流拆成四条

传统 Transformer 各层读写同一 residual stream,深层时早期特征容易被反复混合稀释。Gated Residual(GR) 把残差扩成 4 条并行分支,用数据依赖的 elementwise 读 gate 与按分支的写 gate 控制读写;实现上简化了 Hyper-Connection 的分支混合项以省访存。残差状态支持 FP8 存储。报告还把 GR 的 gate 标为压力测试里稳定性增益的关键来源之一。12

Embedding:51B N-gram 查表,算力几乎不加在 token 路径上

N-gram Embedding 用当前 token 与前若干 token 构成的局部上下文查表,给常见短语和局部模式额外表示。关键性质是:可以大幅加参数,却几乎不增加每 token 矩阵乘。51B 表可放在 host memory,靠异步 prefetch 与计算重叠;最终只在网络靠前位置(模型卡写 Layer 2)放一层。报告明确提醒:扩大 n-gram 词表会单调降 loss,但下游准确率会饱和——loss 最优与准确率最优可以分叉。123

优化:Muon + 重拟合 scaling law

对真正充当二维线性映射的权重(Attention / GDN / MoE expert 主权重)用 Muon;Embedding、MoE router、GR 低秩参数等仍用 AdamW;融合矩阵先按独立线性变换拆开再分别正交化。新架构与优化器一起把最优 learning rate 与 batch size 上移;实验显示从小学 batch 再 warmup 到目标 batch 多花约 18.8% optimizer steps 且不提升最终结果,最终 recipe 直接从目标 batch 起步。压力测试中,4× 最优 LR 下旧结构频繁 spike,新 recipe 全程稳定;全规模训练称未出现 loss spike,也未依赖 qk-clip / SwiGLU-clip 一类显式 clipping。2
其余仍沿 Qwen3-Next→3.5–3.8 线:超稀疏 MoE多步训练的 MTP(全注意力层同样换 QSA)、zero-centered RMSNorm 等稳定性组件。1

官方数字落在哪些对照条件上

基座:6B 激活对 17B 激活前代

技术报告摘要写得很硬:在 14 项预训练基准上,Flash-Next-Base 8 项领先 397B-A17B 前代,其余落后 不超过 2.6 分;激活参数约 1/3、训练 token 约 1/3、训练 FLOPs 约 1/92
博客基座表中,Flash-Next-Base 在 MMLU-Pro 73.23、SuperGPQA 51.36、BBH 90.87、GSM8K 93.29、EvalPlus 78.76、SWEBench-Pretrain 50.99、MGSM 89.33、MMMLU 84.86 等 8 项取最优;MMLU、MATH、MultiPL-E 等仍贴近或略低于 Qwen3.7-Plus-Base。1

后训练:编码与办公拉得很开,个别项落后

博客语言表对照 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731、Claude-Opus-4.6 (Max)。摘若干官方粗体最优或高亮项:
任务Flash-Next主要对照
DeepSWE 1.158.7DeepSeek-V4-Flash 54.4;Qwen3.7-Plus 16.5
SWE-bench Pro62.5Claude-Opus-4.6 (Max) 官方分 53.4;Qwen3.7-Plus 55.8
SWE-bench Multilingual81.0Claude 77.5
CoWorkBench(内部长程办公)73.9Claude 68.2;DeepSeek-V4-Flash 45.1
JobBench(内部)55.7Claude 36.6
Toolathlon Verified Pass@173.5DeepSeek-V4-Flash 70.3
IFBench81.3Claude 62.5
GPQA Diamond91.7Claude 91.3
LiveCodeBench v691.9Claude 88.8
NL2Repo-Bench48.1DeepSeek-V4-Flash 54.2 更高
HLE35.9Claude 40.0 更高
上表数字均摘自官方博客语言评测表。1
脚注必须一起读:DeepSWE 取 Claude Code 与 mini-SWE-agent 两套 harness 的最高分;SWE-bench Pro 除 Claude 用官方已发分数外,其余用 Claude Code、temp=1.0、top_p=0.95、256K,且对有问题任务做了修正并重测基线;CoWorkBench、JobBench、部分 Agents' Last Exam 等为 Qwen 内部或自建协议1
多模态表同样由官方自测主导。例如 AndroidWorld 84.5(Claude 62.0)、MathVision with CI 95.7ERQA 72.3ClawEval-MM Pass@3 64.4;OSWorld 2.0 binary 19.4 / partial 52.3。1
官方帖另点名:DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5、MathVision (with CI) 95.74

部署与许可边界

  • 权重入口Hugging Face Qwen/Qwen3.8-Flash-NextModelScope;博客另链 FlashQLA技术报告 PDF1
  • 推理栈:模型卡写明兼容 Transformers、vLLM、SGLang、TokenSpeed;默认 thinking,可用 enable_thinking / preserve_thinking 控制;长上下文 YaRN 需改 rope_parameters,官方提醒静态 YaRN 可能影响短文本。3
  • 许可证qwen-community-1.0。可免费使用、修改、分发与微调,但 月活超 1 亿或月收入超 2000 万美元 的商业产品须显著展示模型名;开展 Model as a Service 或 AI Work Assistant 商业业务前须另获 Qwen 许可(内部使用有例外条款)。具体以仓库 LICENSE 全文为准。3
  • API:博客开发章节标明 API 尚未上线,示例在启用后可用;产品侧提到 QwenWork「Standard」模式接入,以及 Claude Code / Codex / Qwen Code 等配置样例。1

局限与值得继续看的点

  1. 对照条件高度依赖官方 harness 与内部基准。 CoWorkBench、JobBench、RecreationBench 等无法直接与外部榜单横比;SWE 类分数在修正任务集与统一 harness 后才与表中基线可比。独立复测仍空窗。1
  2. 「1/9 训练成本」在报告里首先是 FLOPs 口径(约 1/3 激活 × 约 1/3 tokens),博客口语化成 training cost;美元账单、集群占用与数据配方细节未在博客展开。2
  3. N-gram 表扩大降 loss 但不保证下游同步提升;报告把 loss / benchmark 分叉写成设计时必须显式处理的现象。2
  4. 生产接口与开放权重仍是两套边界:1M 默认上下文与官方工具属于 Qwen3.8-Flash 云端;本地 Next 权重原生 262K,工具与托管能力需自建。13
  5. Qwen4 本身尚未发布。 本次交付的是 qwen4_exp 结构与 Flash 档位样本;完整家族规模、训练数据与产品分层仍在后续。
对工程读者,优先核三件事:本机/集群能否吃下 125B MoE + 可 offload 的 51B N-gram;vLLM/SGLang/llama.cpp 等对 QSA、GR、N-gram 的 day-0 支持进度;以及目标业务是否落在 community license 的商业门槛内。对研究读者,技术报告的价值在 ablation 方法——每个改动同时报 loss、成本与稳定性,并标出三者不一致时的取舍。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content