
Qwen3.8-27B 开放权重上架:27B 原生视觉、Apache-2.0、262K 上下文
Qwen3.8-27B 已在 Hugging Face 上架,公开 27B dense、原生图像与视频理解、Apache-2.0 和 262K 原生上下文;本文区分本地权重、YaRN 扩展与尚未开放定价的 QwenCloud 托管版。
先看结论
这次真正落地的是一个可下载的 Qwen3.8-27B dense(稠密)模型,不是 QwenCloud 的托管版本。Qwen 官方账号在北京时间 2026 年 8 月 14 日 21:08 预告仓库即将上线;Hugging Face 的官方模型记录随后显示
last_modified 为北京时间 23:00:01,仓库已经包含 Transformers 格式的模型权重和配置文件。12对开发者来说,Qwen3.8-27B 的吸引力在于:27B 级别、原生图像与视频理解、Apache-2.0、262K 原生上下文,以及编码和多步 Agent 评测中的一组高分。但这还不是一个可以直接按 1M 上下文和现成 API 价格采购的云端产品:1M 是扩展配置或 QwenCloud 托管版本的说法,QwenCloud 页面在模型卡中仍标为即将提供,价格也没有公开。2
关键资料一览
| 项目 | 目前可确认的信息 |
|---|---|
| 上架时间 | Hugging Face 官方模型记录的 last_modified 为 2026 年 8 月 14 日 23:00:01(北京时间)。2 |
| 模型形态 | 语言模型部分为 27B 参数的 dense 模型,并带视觉编码器;模型卡将它定位为紧凑、便于部署的原生视觉语言模型。2 |
| 参数口径 | 模型概览明列 Language Model 为 27B;Hugging Face 页面底部另显示 Model size 为 28B params。官方没有给出更细的总参数拆分,部署时应以实际权重和框架测量为准。2 |
| 上下文 | 原生上下文长度 262,144 tokens;模型卡给出通过 YaRN 扩展到 1,000,000 tokens 的配置方法。2 |
| 模态与能力 | 原生理解图像和视频,覆盖文档、科学图示、视觉问答、网页和计算机操作等任务;默认开启思考,可按请求关闭,并支持 reasoning_effort 调节推理深度。2 |
| 本地生态 | 模型卡列出 Transformers、vLLM、SGLang 和 TokenSpeed 兼容路径,Hugging Face 元数据标记为 endpoints_compatible。2 |
| 许可 | Hugging Face 官方模型元数据标注 Apache-2.0。实际集成仍应一并核对仓库中的 LICENSE、NOTICE 和所用推理框架依赖。2 |
| API 与价格 | 本地权重可按开源仓库部署;QwenCloud 托管版本被描述为默认提供 1M 上下文和官方内置工具,但服务仍在准备中,模型卡没有给出 token 价格。2 |
这里最容易混淆的是两个数字。27B 是模型概览里明确写出的语言模型参数规模;页面显示的 28B 是 Hugging Face 的模型大小字段。当前官方材料没有说明两者之间的精确统计边界,所以不应拿 28B 直接推导显存需求,也不应把 27B 理解成 MoE 的激活参数。
能力亮点落在两条线上
第一条是编码和软件工程。模型卡给出的官方表格显示,Qwen3.8-27B 在 SWE-bench Pro、DeepSWE 1.1、QwenSWEBench 和 LiveCodeBench v6 上分别为 61.7、42.2、79.0 和 90.3;Terminal Bench 2.1(Terminus)为 73.0。这些数字是 Qwen 的自报结果,表格同时列出多个其他模型,不能把不同 benchmark 的分数相加,也不能仅凭一张厂商表格判断生产环境中的总体胜负。2
第二条是视觉 Agent。官方表格列出 OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、Vision2Web 62.9,以及 MathVision 在开启 CI(代码解释器)时 94.6。这组结果支持一个更具体的判断:它值得加入需要看图、读网页、操作电脑或复现应用的评测集;它并不等于模型已经在所有视觉任务上稳定可用。2
模型卡还把几个容易影响成本和延迟的控制项写得比较清楚:思考模式默认开启,
reasoning_effort 可设为 xhigh、medium 或 low;preserve_thinking 默认保留历史消息中的思考内容,也可以关闭。对于多轮 Agent,降低单轮推理深度不一定缩短总任务时间,因为失败和重试可能抵消单轮节省。2262K 原生,不等于现在就有 1M API
本地模型的原生上下文是 262K tokens。模型卡提供了用 YaRN 把
max_model_len 扩展到 1M 的方法,但也提醒静态 YaRN 可能影响较短文本的表现。换句话说,1M 是需要按框架和任务配置的扩展上限,不能当作所有本地部署的默认能力。2QwenCloud 是另一条路径。模型卡称托管版会默认提供 1M 上下文和官方内置工具,但同一处也写明服务即将提供。当前资料没有公开模型 ID、调用价格、速率限制或可用地区,因此团队现在可以下载权重做本地评测,却还不能据此编写一份确定的云端采购预算。2
现在适合怎样评测
- 先按本地模型验证资源边界。 用 Transformers、vLLM、SGLang 或 TokenSpeed 之一启动,记录实际权重占用、KV cache、吞吐和不同
reasoning_effort下的延迟。不要只依据 27B 或页面上的 28B 字段估算硬件。2 - 把视觉和 Agent 任务放在同一轮测试。 至少覆盖文档问答、图表理解、网页操作、代码仓库修复和带工具的多步任务;记录人工接管次数、失败重试、工具调用偏差和最终完成率,而不只看回答文本。
- 把 262K 与 1M 分开验收。 262K 可以作为当前原生能力测试;如果要用 YaRN 扩展,另测长文本和短文本两组任务,并把配置写进结果记录。QwenCloud 的 1M 和内置工具则等官方服务真正开放后单独核验。2
- 上线前补做许可与安全检查。 Apache-2.0 是当前仓库元数据给出的许可标签;模型卡本次公开的重点是能力、部署和 benchmark,尚未提供独立安全评估或生产级风险边界。涉及浏览器、终端或高权限工具时,应先在隔离环境验证提示注入、越权操作和敏感信息处理。2
Qwen3.8-27B 现在已经从「待追的开放权重」变成可以下载、部署和复测的候选模型。它最明确的价值是把视觉理解、长程 Agent 和编码能力放进 27B 级别的 dense 权重里;它尚未补齐的部分则是云端价格、正式 API 细节和独立安全材料。对有本地部署需求的团队,可以今天开始测;对依赖 1M API 或要做生产迁移的团队,先等 QwenCloud 的可用性与价格落地。
References
- 1Qwen 官方 X 预告
x.com
- 2Qwen/Qwen3.8-27B · Hugging Face
huggingface.co

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.