Qwen3.8-Max 正式版 GA:2.4T 参数、95B 激活,API 已上线

Qwen3.8-Max 正式版 GA:2.4T 参数、95B 激活,API 已上线

阿里正式发布 Qwen3.8-Max:QwenCloud API 已可用,2.4T 总参数、95B 激活,官方 benchmark 重点覆盖编码、办公协作与多模态,并承诺次周开放权重。

先看结论

Qwen3.8-Max 的 GA 版本已经可以直接试用:先在 QwenCloud 用 qwen3.8-max 跑一组真实的长程编码或多步骤工作任务,再决定是否重跑你的模型评测。它的卖点不是单项问答分数,而是 2.4T 参数、95B 激活、1M 上下文和面向长任务的多模态 Agent 能力;但目前能确认的 benchmark 仍以 Qwen 官方测试为主,不能直接当成跨模型的独立排行榜。12
这次补发的是 2026 年 8 月 3 日的正式版 GA,不是 7 月 19 日的 Qwen3.8-Max-Preview。官方 X 帖文显示,北京时间 8 月 3 日 10:15,Qwen 宣布正式版上线,并公布了 API 价格和开放权重计划。2

GA 版本把什么带到了手上

项目已确认信息对选型的影响
模型家族Qwen3.8-Max;官方称其基于 Qwen3.5 的架构基础,定位是 Qwen 家族截至当时能力最强的模型重点应放在长程任务、编码、办公和研究流程,而不只是短问答
参数总参数 2.4T,激活参数 95B;这是 MoE 模型,单次计算只激活部分参数不能把 2.4T 直接换算成显存需求;本地部署要等权重、量化和推理文档
上下文QwenCloud 模型页列出 1M context,最大输入 991K、最大输出 131K适合把大型代码库、长文档或长流程放进同一任务,但长上下文不等于一次完成率稳定
输入输出支持文本、图片和视频输入,输出为文本可把文档、截图、视频和工具结果放进同一条工作链
开放权重Qwen 官方博客写明:Qwen3.8-Max 权重「下周」开放,同时开放 Qwen3.8-27B这是正式版的发布承诺;本稿不把该承诺等同于已确认的下载、许可证或部署条件
上述参数和能力来自 Qwen 发布博客与 QwenCloud 模型页;「激活参数」指 MoE 推理时每个 token 实际参与计算的参数规模,不是模型总参数。13

Benchmark 信号:长任务强,但别把厂商表格当成独立榜单

Qwen 官方给出的代表性结果如下。分数是官方博客中的对比表;其中既有 Qwen 自测,也混用了公开榜单或其他模型的已发布成绩,测试 harness、推理强度和运行时并不完全相同。
方向BenchmarkQwen3.8-Max 官方分数读法
编码 AgentTerminalBench 2.186.6已进入第一梯队,但官方表中 GPT-5.6 Sol 为 88.8
研究复现PaperBench93.0这张表中高于 Qwen3.7-Max 的 64.8
专业协作CoWorkBench74.8比 Qwen3.7-Max 的 64.6 高,但低于表中的 Fable5 75.9
电脑操作OSWorld-Verified86.1高于表中的其他对比模型分数
指令遵循IFBench82.8高于 Qwen3.7-Max 的 79.1
多模态推理MMMU-Pro82.3高于 Qwen3.7-Max 的 79.0,但不是所有对比结果都来自同一测试流程
官方博客还给了几类长程任务案例:Qwen3.8-Max 在一个持续 10 多天的自主编码运行中,从空目录搭建并维护项目;在约 125 小时的论文复现实验里完成约 7,600 行代码、1,100 多次动作和 33 轮 GPU 训练;在芯片设计案例中经过 500 多轮交互,把一个可行设计的门数从 8,298 降到 678。它们能说明模型被训练来持续执行、运行反馈并修正计划,但仍是厂商展示案例,不是独立评测。1

API、价格和可用范围

QwenCloud 已提供 qwen3.8-max,支持兼容 OpenAI 的 Chat Completions / Responses API,也提供 Anthropic API 兼容方式。博客还给出 reasoning_effortlowmediumxhigh 三档,默认是 xhigh,可用来在效果、速度和成本之间取舍。1
计费项价格(每百万 token)
输入$2.00
输出$6.00
隐式缓存输入$0.25
显式缓存创建$2.50
显式缓存读取$0.17
价格来自 Qwen 官方 X 帖文和 QwenCloud 模型页;缓存价格不是把普通输入价格简单打折,长前缀重复调用时才有明确价值。23
入口可以分成两条:想快速体验,可打开 QwenCloud 模型体验页;要接入程序,可从 QwenCloud API Key 页面 获取密钥,并使用模型 ID qwen3.8-max。阿里云百炼的官方文档也已列出这一模型,并给出北京、新加坡、美国弗吉尼亚、德国法兰克福和日本东京等地域的接入信息;不同地域的 endpoint、价格和限流额度可能不同。345
QwenCloud 模型页当前列出的上限是 15,000 RPM、2M TPM;阿里云百炼限流文档则显示,北京地域的 qwen3.8-max 为 30,000 RPM / 5M TPM,新加坡为 15,000 RPM / 2M TPM。做压测时,先确认实际使用的地域和账号额度,不要把 QwenCloud 页面上的数字套到所有百炼 endpoint。35

现在怎么试,才不会被 2.4T 带偏

  1. 先跑真实长任务。 用一套能验收的多文件重构、跨模块调试、长文档分析或带截图的工作流,分别测试 reasoning_effort=mediumxhigh,记录完成率、人工接管次数、总 token 和耗时。
  2. 把官方 benchmark 当作选题,不当作结论。 如果你关心编码,优先复测 TerminalBench 或自己的 issue 集;如果你关心办公 Agent,就测工具调用失败、文件修改正确率和最终交付物,而不是只抄一行分数。
  3. 先别按 2.4T 规划本地集群。 官方发布页只确认了「下周开放权重」的计划,没有在同一页给出许可证、量化版本、推理硬件和完整部署要求。等权重与模型卡落地后,再决定本地化、私有化或继续走 API。
对开发者来说,Qwen3.8-Max 的 GA 版本已经值得进入评测集;是否替换现有模型,仍要由你的长任务成功率、数据合规要求和每次任务成本决定。
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.