
Qwen3.8-Max 正式版 GA:2.4T 参数、95B 激活,API 已上线
阿里正式发布 Qwen3.8-Max:QwenCloud API 已可用,2.4T 总参数、95B 激活,官方 benchmark 重点覆盖编码、办公协作与多模态,并承诺次周开放权重。
先看结论
Qwen3.8-Max 的 GA 版本已经可以直接试用:先在 QwenCloud 用
qwen3.8-max 跑一组真实的长程编码或多步骤工作任务,再决定是否重跑你的模型评测。它的卖点不是单项问答分数,而是 2.4T 参数、95B 激活、1M 上下文和面向长任务的多模态 Agent 能力;但目前能确认的 benchmark 仍以 Qwen 官方测试为主,不能直接当成跨模型的独立排行榜。12这次补发的是 2026 年 8 月 3 日的正式版 GA,不是 7 月 19 日的 Qwen3.8-Max-Preview。官方 X 帖文显示,北京时间 8 月 3 日 10:15,Qwen 宣布正式版上线,并公布了 API 价格和开放权重计划。2
GA 版本把什么带到了手上
| 项目 | 已确认信息 | 对选型的影响 |
|---|---|---|
| 模型家族 | Qwen3.8-Max;官方称其基于 Qwen3.5 的架构基础,定位是 Qwen 家族截至当时能力最强的模型 | 重点应放在长程任务、编码、办公和研究流程,而不只是短问答 |
| 参数 | 总参数 2.4T,激活参数 95B;这是 MoE 模型,单次计算只激活部分参数 | 不能把 2.4T 直接换算成显存需求;本地部署要等权重、量化和推理文档 |
| 上下文 | QwenCloud 模型页列出 1M context,最大输入 991K、最大输出 131K | 适合把大型代码库、长文档或长流程放进同一任务,但长上下文不等于一次完成率稳定 |
| 输入输出 | 支持文本、图片和视频输入,输出为文本 | 可把文档、截图、视频和工具结果放进同一条工作链 |
| 开放权重 | Qwen 官方博客写明:Qwen3.8-Max 权重「下周」开放,同时开放 Qwen3.8-27B | 这是正式版的发布承诺;本稿不把该承诺等同于已确认的下载、许可证或部署条件 |
Benchmark 信号:长任务强,但别把厂商表格当成独立榜单
Qwen 官方给出的代表性结果如下。分数是官方博客中的对比表;其中既有 Qwen 自测,也混用了公开榜单或其他模型的已发布成绩,测试 harness、推理强度和运行时并不完全相同。
| 方向 | Benchmark | Qwen3.8-Max 官方分数 | 读法 |
|---|---|---|---|
| 编码 Agent | TerminalBench 2.1 | 86.6 | 已进入第一梯队,但官方表中 GPT-5.6 Sol 为 88.8 |
| 研究复现 | PaperBench | 93.0 | 这张表中高于 Qwen3.7-Max 的 64.8 |
| 专业协作 | CoWorkBench | 74.8 | 比 Qwen3.7-Max 的 64.6 高,但低于表中的 Fable5 75.9 |
| 电脑操作 | OSWorld-Verified | 86.1 | 高于表中的其他对比模型分数 |
| 指令遵循 | IFBench | 82.8 | 高于 Qwen3.7-Max 的 79.1 |
| 多模态推理 | MMMU-Pro | 82.3 | 高于 Qwen3.7-Max 的 79.0,但不是所有对比结果都来自同一测试流程 |
官方博客还给了几类长程任务案例:Qwen3.8-Max 在一个持续 10 多天的自主编码运行中,从空目录搭建并维护项目;在约 125 小时的论文复现实验里完成约 7,600 行代码、1,100 多次动作和 33 轮 GPU 训练;在芯片设计案例中经过 500 多轮交互,把一个可行设计的门数从 8,298 降到 678。它们能说明模型被训练来持续执行、运行反馈并修正计划,但仍是厂商展示案例,不是独立评测。1
API、价格和可用范围
QwenCloud 已提供
qwen3.8-max,支持兼容 OpenAI 的 Chat Completions / Responses API,也提供 Anthropic API 兼容方式。博客还给出 reasoning_effort 的 low、medium、xhigh 三档,默认是 xhigh,可用来在效果、速度和成本之间取舍。1| 计费项 | 价格(每百万 token) |
|---|---|
| 输入 | $2.00 |
| 输出 | $6.00 |
| 隐式缓存输入 | $0.25 |
| 显式缓存创建 | $2.50 |
| 显式缓存读取 | $0.17 |
入口可以分成两条:想快速体验,可打开 QwenCloud 模型体验页;要接入程序,可从 QwenCloud API Key 页面 获取密钥,并使用模型 ID
qwen3.8-max。阿里云百炼的官方文档也已列出这一模型,并给出北京、新加坡、美国弗吉尼亚、德国法兰克福和日本东京等地域的接入信息;不同地域的 endpoint、价格和限流额度可能不同。345QwenCloud 模型页当前列出的上限是 15,000 RPM、2M TPM;阿里云百炼限流文档则显示,北京地域的
qwen3.8-max 为 30,000 RPM / 5M TPM,新加坡为 15,000 RPM / 2M TPM。做压测时,先确认实际使用的地域和账号额度,不要把 QwenCloud 页面上的数字套到所有百炼 endpoint。35现在怎么试,才不会被 2.4T 带偏
- 先跑真实长任务。 用一套能验收的多文件重构、跨模块调试、长文档分析或带截图的工作流,分别测试
reasoning_effort=medium和xhigh,记录完成率、人工接管次数、总 token 和耗时。 - 把官方 benchmark 当作选题,不当作结论。 如果你关心编码,优先复测 TerminalBench 或自己的 issue 集;如果你关心办公 Agent,就测工具调用失败、文件修改正确率和最终交付物,而不是只抄一行分数。
- 先别按 2.4T 规划本地集群。 官方发布页只确认了「下周开放权重」的计划,没有在同一页给出许可证、量化版本、推理硬件和完整部署要求。等权重与模型卡落地后,再决定本地化、私有化或继续走 API。
对开发者来说,Qwen3.8-Max 的 GA 版本已经值得进入评测集;是否替换现有模型,仍要由你的长任务成功率、数据合规要求和每次任务成本决定。
References
- 1Qwen 官方发布博客
qwen.ai
- 2Qwen 官方 X 帖文
x.com
- 3Qwen3.8-Max 官方模型页
qwencloud.com
- 4阿里云百炼模型服务说明
help.aliyun.com
- 5阿里云百炼限流文档
help.aliyun.com

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.