Qwen3.8 Max Preview:2.4T 旗舰先上线,真正的考试还在权重和 benchmark

Qwen3.8 Max Preview:2.4T 旗舰先上线,真正的考试还在权重和 benchmark

Alibaba Qwen 于 7 月 19 日推出 Qwen3.8-Max-Preview,2.4T 参数和「仅次于 Fable 5」仍是未给出 benchmark 支撑的厂商说法;本文拆解它的产品入口、部署成本缺口,并与 Kimi K3 对照开放兑现条件。

先看结论

北京时间 7 月 19 日 16:29,Qwen 官方账号宣布 Qwen3.8-Max-Preview 开始提供早期体验,并称它拥有 2.4T 参数、性能「仅次于 Fable 5」,很快会开放权重。预览版已经进入 Alibaba Token Plan、Qoder 和 QoderWork。1
这条消息有两个层面。产品层已经发生了:用户可以在阿里的订阅和工作流工具里试用模型。技术层还没有闭环:2.4T 是厂商自报,官方没有同时给出架构、每 token 激活参数、benchmark 表、模型卡、license 或权重仓库。Qwen 工程师 Shuai Bai 补充称,这是 Qwen 首个超过 1T 参数的多模态模型,可处理图片、视频和文档,并面向视觉编码、内容生成和复杂任务执行。2 这些是发布方对能力的描述,不等于独立评测结果。
正在加载内容卡片…
所以,Qwen3.8 目前更像一次「先把前沿模型放进产品,再等待技术材料补齐」的发布。它的新闻价值很高,但还不能据此认定 Qwen 已经在性能、成本或开放程度上超过 Kimi K3。

这次发布到底交付了什么

项目当前能确认的状态读者应如何理解
模型Qwen3.8-Max-Preview,预览版是可用产品,不是完整技术发布
参数2.4T,来自 Qwen 官方说法目前没有模型卡或规格页交叉确认
能力Qwen 工程师称支持文本、图片、视频、文档,并用于视觉编码与复杂任务没有公开任务集、分数和测试条件
入口Alibaba Token Plan、Qoder、QoderWork先通过订阅和工作流产品分发
开放计划「soon」开放权重没有具体日期、license 或仓库地址
性能定位官方称接近前沿模型、仅次于 Fable 5没有公开 benchmark 表,不能当成排名
第三方报道也把当前缺口列得很清楚:没有 benchmark、模型卡、许可证和 active parameter count;「仅次于 Fable 5」只能按内部评估或发布口径处理。3
其中最容易被忽略的是「2.4T」后面缺少的半句话:这是总参数,还是每个 token 实际参与计算的参数?如果它采用稀疏 MoE,二者会相差很大;即使它不是 MoE,用户也仍然需要知道权重精度、上下文长度、推理并行方式和吞吐。公开材料目前没有给出这些信息。

2.4T 不是部署规格

把 2.4T 参数换算成一个粗略的工程问题,就能看到缺口有多大。假设每个参数以 4 bit 保存,2.4T 参数的权重裸数据约为 1.2 TB,还没有算 KV cache、路由、运行时和通信开销。这个计算建立在「2.4T 说法属实、全模型以 4 bit 保存」的条件上,不能被读成 Qwen3.8 的实际硬件要求。3
对稀疏模型来说,active parameter count 才是估算单 token 计算量和服务成本的关键变量。总参数更像模型容量的上限,active 参数决定一次前向传播究竟要算多少东西。Qwen3.8 没有公布这个数字,开发者就无法从 2.4T 推出它的延迟、吞吐和 API 经济性,也无法判断所谓「开源」之后是否真的适合本地部署。
这也是它和 Kimi K3 当前最重要的差别。Moonshot 在 K3 发布页给出了 2.8T 总参数、16/896 的稀疏激活、1M 上下文、API 入口和多项 benchmark,并把完整权重开放时间定在 7 月 27 日。那套材料仍然带有厂商自测和不同 harness 的限制,但至少让读者知道下一步该复核什么。4

产品先行,意味着什么

Qwen3.8 的第一批入口不是一个可下载的权重仓库,而是 Token Plan、Qoder 和 QoderWork。Qwen Cloud 的文档显示,Token Plan 用 Credits 统一结算,覆盖个人版和团队版,并能接入 Claude Code、Cursor、Qwen Code、OpenClaw 等工具;文档把 qwen3.8-max-preview 列入可用模型,但没有把它拆成透明的按 token API 价格。5
Qwen 工程师则称,预览阶段白天的 Credits 消耗降到标准费率的 10%,夜间还会更低。这个信息应理解为早期体验优惠,而不是稳定的模型单位经济。真正值得测量的是:一次任务花多少 Credits、调用几次工具、失败后重试几轮,以及结果是否需要人工接管。2
QoderWork 的官方产品页把自己定位为本地优先的工作助手,能读取用户授权的文件夹、浏览网页、生成文档和表格,并通过 Skills 扩展任务。6 Qwen3.8 进入这一层,说明它的首发价值不只在回答问题,还在于能否把视觉理解接到文件、浏览器和交付物上。但这也提高了验证要求:模型看懂一张截图是一回事,能否在授权目录里正确修改文件、保持任务边界并留下可追踪记录,是另一回事。

和 Kimi K3、Fable 5 怎么比

维度Qwen3.8-Max-PreviewKimi K3Fable 5
公开材料预览公告,暂无 benchmark 表和模型卡有技术博客、评测表和开放时间表Qwen 将其作为「仅次于」的参照对象
开放性承诺 soon 开放权重,无日期和 license计划 7 月 27 日开放完整权重当前比较重点仍是托管访问和安全边界
可验证的技术数字2.4T,但 active 参数、上下文和推理规格未公布2.8T、16/896、1M 上下文等已披露Qwen 没有给出可复核的同条件分数
当前使用路径Token Plan、Qoder、QoderWorkKimi.com、Kimi Work、Kimi Code、APIClaude Platform、Claude.ai、Claude Code、Cowork 等
Kimi K3 的公开材料并不自动证明它全面更强,官方 benchmark 也受 harness、推理档位和评测集影响。可是,Qwen3.8 现在连可复核的分数和 active 参数都没有,二者暂时不能放在同一张性能排行榜上比较。Fable 5 也一样,Qwen 的「second only」是一个需要证据的厂商判断,不是横向评测结论。Anthropic 对 Fable 5 的公开材料更集中在安全分类器、访问分层和产品恢复,和 Qwen 当前的预览公告并不是同一种披露口径。7
时间顺序本身很有信号:Kimi K3 在 7 月 17 日发布,Qwen3.8 在两天后给出预览。两家都把「超大规模、前沿能力、多模态或 Agent 工作流、开放计划」放在同一竞争语境里,但 Kimi 先交了技术报告和评测材料,Qwen 先交了产品入口。谁的路线更有价值,要等 Qwen 把权重和规格文件补上后再判断。

开发者现在该怎么试

今天可以试,但不应迁移生产流量。更有效的做法是建立一组小而固定的任务集,覆盖视觉编码、长文档抽取、视频或截图理解、带文件读写的办公任务,再记录以下几项:端到端完成率、工具调用次数、延迟、Credits 消耗、错误恢复和人工接管率。这样才能把「多模态旗舰」翻译成团队自己的工程数据。
在 Qwen3.8 开放之前,至少有五个发布材料需要补齐:
  1. 模型卡和完整架构,尤其是 active parameter count、上下文长度和多模态输入限制。
  2. 权重仓库、明确 license、量化版本和推理实现。
  3. 官方 benchmark 表,以及每个分数使用的模型快照、推理档位、harness 和工具权限。
  4. API 的正式价格、速率限制、缓存规则和 Credits 到 token 的换算方式。
  5. 独立评测,至少覆盖编码、视觉理解、长任务执行和实际成本,而不是只复述「仅次于 Fable 5」。

判断:这次发布的价值,暂时在入口而不在排名

Qwen3.8-Max-Preview 已经足以影响模型试用和产品选型,因为它把一个宣称 2.4T 的新模型放进了订阅、编码和桌面工作流。但截至 7 月 20 日,公开证据还不足以支持三种更强的结论:它一定是 2.4T 的可审计模型;它的性能确实仅次于 Fable 5;它开放后能以可接受成本部署。
因此,Qwen3.8 当前最准确的定位是「产品已上线、技术证明待补齐的前沿预览」。等模型卡、active 参数、license、权重和 benchmark 同时出现,开发者才有资格把它和 Kimi K3 放进同一套可复现实验里;在那之前,2.4T 是一个值得关注的发布信号,不是迁移理由。

相似内容

  • 登录后可发表评论。
More from this channel