Qwen3.8-27B 开放权重上架:27B 原生视觉、Apache-2.0、262K 上下文

Qwen3.8-27B 开放权重上架:27B 原生视觉、Apache-2.0、262K 上下文

Qwen3.8-27B 已在 Hugging Face 上架,公开 27B dense、原生图像与视频理解、Apache-2.0 和 262K 原生上下文;本文区分本地权重、YaRN 扩展与尚未开放定价的 QwenCloud 托管版。

先看结论

这次真正落地的是一个可下载的 Qwen3.8-27B dense(稠密)模型,不是 QwenCloud 的托管版本。Qwen 官方账号在北京时间 2026 年 8 月 14 日 21:08 预告仓库即将上线;Hugging Face 的官方模型记录随后显示 last_modified 为北京时间 23:00:01,仓库已经包含 Transformers 格式的模型权重和配置文件。12
对开发者来说,Qwen3.8-27B 的吸引力在于:27B 级别、原生图像与视频理解、Apache-2.0、262K 原生上下文,以及编码和多步 Agent 评测中的一组高分。但这还不是一个可以直接按 1M 上下文和现成 API 价格采购的云端产品:1M 是扩展配置或 QwenCloud 托管版本的说法,QwenCloud 页面在模型卡中仍标为即将提供,价格也没有公开。2

关键资料一览

项目目前可确认的信息
上架时间Hugging Face 官方模型记录的 last_modified 为 2026 年 8 月 14 日 23:00:01(北京时间)。2
模型形态语言模型部分为 27B 参数的 dense 模型,并带视觉编码器;模型卡将它定位为紧凑、便于部署的原生视觉语言模型。2
参数口径模型概览明列 Language Model 为 27B;Hugging Face 页面底部另显示 Model size 为 28B params。官方没有给出更细的总参数拆分,部署时应以实际权重和框架测量为准。2
上下文原生上下文长度 262,144 tokens;模型卡给出通过 YaRN 扩展到 1,000,000 tokens 的配置方法。2
模态与能力原生理解图像和视频,覆盖文档、科学图示、视觉问答、网页和计算机操作等任务;默认开启思考,可按请求关闭,并支持 reasoning_effort 调节推理深度。2
本地生态模型卡列出 Transformers、vLLM、SGLang 和 TokenSpeed 兼容路径,Hugging Face 元数据标记为 endpoints_compatible2
许可Hugging Face 官方模型元数据标注 Apache-2.0。实际集成仍应一并核对仓库中的 LICENSE、NOTICE 和所用推理框架依赖。2
API 与价格本地权重可按开源仓库部署;QwenCloud 托管版本被描述为默认提供 1M 上下文和官方内置工具,但服务仍在准备中,模型卡没有给出 token 价格。2
这里最容易混淆的是两个数字。27B 是模型概览里明确写出的语言模型参数规模;页面显示的 28B 是 Hugging Face 的模型大小字段。当前官方材料没有说明两者之间的精确统计边界,所以不应拿 28B 直接推导显存需求,也不应把 27B 理解成 MoE 的激活参数。

能力亮点落在两条线上

第一条是编码和软件工程。模型卡给出的官方表格显示,Qwen3.8-27B 在 SWE-bench Pro、DeepSWE 1.1、QwenSWEBench 和 LiveCodeBench v6 上分别为 61.7、42.2、79.0 和 90.3;Terminal Bench 2.1(Terminus)为 73.0。这些数字是 Qwen 的自报结果,表格同时列出多个其他模型,不能把不同 benchmark 的分数相加,也不能仅凭一张厂商表格判断生产环境中的总体胜负。2
第二条是视觉 Agent。官方表格列出 OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、Vision2Web 62.9,以及 MathVision 在开启 CI(代码解释器)时 94.6。这组结果支持一个更具体的判断:它值得加入需要看图、读网页、操作电脑或复现应用的评测集;它并不等于模型已经在所有视觉任务上稳定可用。2
模型卡还把几个容易影响成本和延迟的控制项写得比较清楚:思考模式默认开启,reasoning_effort 可设为 xhighmediumlowpreserve_thinking 默认保留历史消息中的思考内容,也可以关闭。对于多轮 Agent,降低单轮推理深度不一定缩短总任务时间,因为失败和重试可能抵消单轮节省。2

262K 原生,不等于现在就有 1M API

本地模型的原生上下文是 262K tokens。模型卡提供了用 YaRN 把 max_model_len 扩展到 1M 的方法,但也提醒静态 YaRN 可能影响较短文本的表现。换句话说,1M 是需要按框架和任务配置的扩展上限,不能当作所有本地部署的默认能力。2
QwenCloud 是另一条路径。模型卡称托管版会默认提供 1M 上下文和官方内置工具,但同一处也写明服务即将提供。当前资料没有公开模型 ID、调用价格、速率限制或可用地区,因此团队现在可以下载权重做本地评测,却还不能据此编写一份确定的云端采购预算。2

现在适合怎样评测

  1. 先按本地模型验证资源边界。 用 Transformers、vLLM、SGLang 或 TokenSpeed 之一启动,记录实际权重占用、KV cache、吞吐和不同 reasoning_effort 下的延迟。不要只依据 27B 或页面上的 28B 字段估算硬件。2
  2. 把视觉和 Agent 任务放在同一轮测试。 至少覆盖文档问答、图表理解、网页操作、代码仓库修复和带工具的多步任务;记录人工接管次数、失败重试、工具调用偏差和最终完成率,而不只看回答文本。
  3. 把 262K 与 1M 分开验收。 262K 可以作为当前原生能力测试;如果要用 YaRN 扩展,另测长文本和短文本两组任务,并把配置写进结果记录。QwenCloud 的 1M 和内置工具则等官方服务真正开放后单独核验。2
  4. 上线前补做许可与安全检查。 Apache-2.0 是当前仓库元数据给出的许可标签;模型卡本次公开的重点是能力、部署和 benchmark,尚未提供独立安全评估或生产级风险边界。涉及浏览器、终端或高权限工具时,应先在隔离环境验证提示注入、越权操作和敏感信息处理。2
Qwen3.8-27B 现在已经从「待追的开放权重」变成可以下载、部署和复测的候选模型。它最明确的价值是把视觉理解、长程 Agent 和编码能力放进 27B 级别的 dense 权重里;它尚未补齐的部分则是云端价格、正式 API 细节和独立安全材料。对有本地部署需求的团队,可以今天开始测;对依赖 1M API 或要做生产迁移的团队,先等 QwenCloud 的可用性与价格落地。
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.