
Qwen3.8-Max-0902 更新:同一基座、同一价格,编码后训练改写表现
Qwen3.8-Max-0902 是面向 Coding 与 Cowork 的后训练快照,本文核对 API、价格、限额,以及厂商 benchmark 与 Arena 独立盲测的边界。
Qwen3.8-Max-0902 是 Qwen3.8-Max 的一次 API 快照更新。Qwen 官方在北京时间 2026 年 9 月 2 日上午宣布,模型继续使用 2.4T 参数规模和 1M context,并针对 Coding 与 Cowork 做了进一步 post-training;QwenCloud 已提供 API。1
先说结论
Qwen3.8-Max-0902 值得编码团队和企业工作流团队单独做一轮回归测试,原因有两个:官方给出了日期快照与新的 API 模型名,Arena.ai 的社区盲测也记录了它在 Code Arena 的 WebDev 排名第一。
这次更新的重点落在后训练、工具协作和 API 可用性。Qwen 官方页面把 0902 称为
qwen3.8-max 的 upgraded snapshot,并继续提供 thinking mode、内置工具生态和 1M context。2快速核对
| 项目 | 已核实信息 |
|---|---|
| 模型名称 | Qwen3.8-Max-0902;API alias 为 qwen3.8-max-2026-09-02。2 |
| 发布时间 | Qwen 官方公告时间为北京时间 2026 年 9 月 2 日 10:00 左右。1 |
| 参数规模 | 官方披露总参数 2.4T;公告没有给出 0902 的 active parameters。1 |
| 上下文 | Context 1M;最大输入 991K,开启 thinking 时最大输入 983K,最大输出 131K,最大 reasoning 262K。2 |
| 更新方向 | Coding 与 Cowork 的进一步 post-training;重点覆盖复杂工程项目、长程自主开发、多工具协作和端到端交付。12 |
| API 价格 | 输入每百万 tokens 2 美元,输出 6 美元;implicit cache 0.25 美元,explicit cache creation 2.50 美元,explicit cache read 0.17 美元。2 |
| API 限额 | TPM 1M、RPM 15K。2 |
| 独立信号 | Arena.ai Code Arena 的 WebDev 项目 1691 分、排名第一;高于 Claude Opus 5 Max 3 分、高于 Kimi K3 Max 17 分、高于上一代 Qwen3.8-Max 22 分。3 |
| 现在的动作窗口 | 在固定代码库和办公任务上,把 0902 与当前生产模型做一次同提示、同工具、同验收标准的回归测试。 |
0902 更新了什么
Qwen 官方把 0902 定义为 Qwen3.8-Max 的 upgraded snapshot,更新重点是 Coding 与 Cowork 的进一步 post-training。QwenCloud 页面将适用任务写得更具体:复杂工程项目、长程自主开发、多工具协作、端到端交付、图表推理、文档解析和多模态理解。12
这个命名方式对接入方很重要。生产环境可以把
qwen3.8-max-0902 作为固定快照写入回归测试,把模型能力变化和服务端无日期 alias 的变化分开记录。QwenCloud 官方示例也使用 qwen3.8-max-0902,并支持 OpenAI-compatible DashScope endpoint 与 enable_thinking。2benchmark:厂商披露与独立盲测要分开
Qwen 发布表格显示,0902 相比旧 Qwen3.8-Max 的 TerminalBench 3.0 从 11.3 提升到 29.0,ProgramBench 从 10.5 提升到 28.0,JobBench 从 53.4 提升到 64.0,WorkArena Elo 从 1348 提升到 1468。CellCog 对这组材料的整理指出,这些数字属于 Qwen 披露的结果,其中 QwenSWEBench V2、CoWorkBench 和 WorkArena 属于 Qwen 自有评测;TerminalBench 的跨模型比较还涉及 harness 差异。4
因此,上述数字适合回答“Qwen 认为后训练改善了哪些任务”,适合用来挑选测试集,不能直接当成第三方复现的总分。TechTimes 对这次更新的报道也把 0902 描述为后训练快照,并提醒内部 benchmark 与独立验证需要分开看。5
Arena.ai 提供了另一种信号:Qwen3.8-Max-0902 在 Code Arena 的 WebDev 项目取得 1691 分、排名第一,领先 Claude Opus 5 Max 3 分、Kimi K3 Max 17 分,并比上一代 Qwen3.8-Max 高 22 分。这个结果来自社区盲测,范围是 WebDev 偏好;它更适合说明网页开发场景里的相对受欢迎程度,不能代表所有软件工程任务。3
价格和 API 规格
QwenCloud 当前模型页列出的价格为:输入每百万 tokens 2 美元,输出 6 美元;implicit cache 命中 0.25 美元,explicit cache creation 2.50 美元,explicit cache read 0.17 美元。2
页面同时列出 1M context、991K 最大输入、983K 最大输入(开启 thinking)、131K 最大输出和 262K 最大 reasoning;服务限制为 TPM 1M、RPM 15K。长上下文测试需要把输入长度、thinking 开关和输出长度分别记录,否则同一个“1M context”标签下会混入不同的实际限制。2
官方 API 示例使用模型名
qwen3.8-max-0902,通过 OpenAI-compatible DashScope endpoint 调用,并可使用 enable_thinking。这让团队可以在保留现有客户端结构的情况下,把日期快照加入评测矩阵。2现在适合怎么测
- 先锁定快照。 在配置文件和日志中记录
qwen3.8-max-0902,不要只记录 Qwen3.8-Max 这一家族名。2 - 把 Coding 与 Cowork 分开。 Coding 测试代码修改、测试修复和仓库级任务;Cowork 测试文档解析、图表推理、多工具协作和端到端交付。官方更新把这两个方向并列为后训练重点。12
- 记录缓存和 thinking 条件。 输入价格、缓存读取方式和 thinking 开关都会影响成本与结果,回归表需要把这些条件单独列出。2
- 把 Arena 当作场景信号。 WebDev 第一名说明它在该类社区盲测中有竞争力,团队仍需用自己的代码库、办公材料和验收标准复核。3
Qwen3.8-Max-0902 的实际价值,要看后训练带来的任务增益能否在团队自己的代码库和工作流里稳定出现。当前可验证的增量包括日期快照、API 入口、价格与限额,以及 Arena WebDev 的独立排名;下一步应把这些条件固定下来,再和现有生产模型做同口径比较。
References
- 1
- 2QwenCloud Qwen3.8-Max-0902 模型页
qwencloud.com
- 3
- 4Qwen3.8-Max-0902: What changed?
cellcog.ai
- 5Qwen3.8-Max-0902 beats Claude Opus 5 in coding
techtimes.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
