知乎科技热榜 7 月 20 日 0 点追踪:Qwen3.8 先行上线,Kimi 事件转向开放权重之争

知乎科技热榜 7 月 20 日 0 点追踪:Qwen3.8 先行上线,Kimi 事件转向开放权重之争

本期从知乎前29条热榜中筛出Qwen3.8预览版与OpenAI高管谈Kimi K3两条AI信号,核对发布事实、实测边界及开放权重对模型商业和政策的影响。

先看结论

本轮知乎官方热榜接口返回前 29 条。真正值得跟踪的 AI 信号有两条:
  1. 第 4 名,302 万热度:Qwen3.8-Max-Preview 已经先行上线。 阿里把它定位为 2.4T 参数、即将开放权重的前沿模型,但目前更确定的是「预览版可用」和「官方性能宣称」,不是已经完成独立验证的全球排名。海外和中文开发者的首轮实测出现了正面反馈,但样本仍然很小,正式权重、模型卡、许可证和统一基准结果才是下一道门槛。
  2. 第 10 名,225 万热度:OpenAI 战略未来负责人谈 Kimi K3,把模型竞争推向开放权重的商业与政策争论。 Dean W. Ball 先承认 K3 很强、不能简单归因于蒸馏,却又判断开放权重会在边际上压低 AI 资本开支,并讨论监管风险。随后他又公开修正措辞,强调自己是在描述可能发生的政策走向,而不是主张用监管恐惧打压中国模型。
这两条放在一起看,比单纯比较谁的参数更多更有价值:国产前沿模型正在用预览版和开放权重预告争夺开发者入口,而美国前沿公司的竞争焦点开始延伸到模型服务收入、算力投资和监管风险。

1. 第 4 名:Qwen3.8 先上线,性能宣称还没有完成验收

知乎问题的原始提法是「如何评价 7 月 19 日上线的阿里 Qwen 3.8 Max Preview 模型?其性能如何?」本轮热榜显示它排名第 4、热度 302 万、公开回答数 52。1
阿里千问官方账号在北京时间 7 月 19 日下午发文称,Qwen3.8 将很快发布并开放权重,总参数量为 2.4T;已经可以体验的 Qwen3.8-Max-Preview 首发进入 Token Plan、Qoder 和 QoderWork。官方还把它描述为「可能仅次于 Fable 5」的强模型。这里的两个层级必须分开:2.4T、预览版入口和即将开放权重,是公告中的产品信息;「仅次于 Fable 5」则是厂商对自身能力的判断。2
南华早报在北京时间 7 月 19 日晚间的报道确认了预览版已进入阿里 Token Plan、Qoder 和 QoderWork,并复述了阿里关于 2.4T 参数和前沿模型定位的说法。报道没有给出一套独立、统一、可复跑的模型排名,因此它能核验发布和入口,不能替阿里完成性能验收。3

首轮实测告诉我们什么

目前能看到的实测,更像是「不同工作流上的早期样本」,而不是最终排行榜。
  • YouTube 频道 AICodeKing 在北京时间 7 月 19 日晚间发布的视频描述称,Qwen 3.8 Max 在其 KingBench 中得到 65/80,排在 Fable 5 之后、Opus 4.8 之前,并在前端、Three.js、SVG、游戏、数学和智能体任务中表现较好。这个结果来自单一频道的自测,测试题、提示词、工具链和评审方式并未形成公开统一标准,适合当作线索,不宜直接写成行业排名。4
  • 另一条中文实测视频声称,在固定测试用例中,Qwen3.8-Max-Preview 的答题和项目生成速度优于此前的 Kimi K3;但视频本身只有较小的样本量,且它是创作者自建的测试流程,不能覆盖长时间运行、工具调用失败和复杂知识工作。5
所以,当前比较稳妥的判断是:Qwen3.8-Max-Preview 很可能已经进入国产前沿模型第一梯队的竞争区,但「仅次于 Fable 5」仍然是待验收的厂商定位,而不是本轮已经被独立证实的结论。

这次发布真正改变了什么

第一,阿里把最强模型的竞争从「正式发布后再开放」改成了「预览版先进入开发者工作流」。Token Plan 官方页面把 Qwen3.8-Max-Preview 放进订阅计划,并强调可与 Qwen Code、Cline、Claude Code、Cursor、OpenCode、Codex 等工具链衔接。它争夺的不只是聊天用户,也是在争夺开发者每天使用的入口和配额。6
第二,Kimi K3 发布后的竞争压力已经传导到开放策略。Qwen 官方在 K3 发布几天后迅速给出 2.4T 和开放权重预告,说明模型厂商比拼的变量不再只有基准分数,还包括能否让开发者拿到权重、能否部署、能否在自己的数据和工具链上继续改造。
第三,2.4T 并不等于 2.4T 的部署成本。总参数量只能说明模型规模,不能直接回答每个 token 激活多少专家、需要多少显存、推理吞吐和长上下文成本如何。Qwen 当前公开材料还不足以回答这些工程问题。

知乎公开可见的 3 条回答片段

知乎问题页可以看到回答总数,但本轮直接访问问题和答案详情均触发安全验证,没有返回实时赞同数和完整排序。因此下面只整理搜索索引中能核验到的 3 类公开片段,不宣称它们是点赞数最高的前三条
  • 一条片段把重点放在模型竞争加速,认为 Qwen3.8 与刚发布的 Kimi K3 都在把国产模型推向前沿第一梯队;这更接近对官方发布口径的复述,不能当作独立性能验证。7
  • 另一条片段认为,Qwen Max 系列被推向开放,可能改变国内旗舰模型的定价和开发者选择;其中对未来 API 价格和多模态能力的部分是答主推测,不能当作已公布信息。1
  • 还有片段把注意力放到下一轮模型发布节奏,提到 DeepSeek V4 正式版等后续变量。这属于趋势猜测,本轮没有把它当作已发生的发布事实。1

接下来要看什么

  1. 正式版是否按预告开放完整权重,开放的是哪一个版本,许可证是否允许商业使用。
  2. 是否发布模型卡、推理配置和可复跑的评测脚本,尤其是编码、长上下文、工具调用和多模态任务。
  3. 预览版进入真实开发工作流后,单位任务成本、失败率、响应速度和长任务稳定性是否仍然成立。

2. 第 10 名:OpenAI 对 Kimi K3 的评价,重点不在「酸不酸」

知乎问题是「如何看待 OpenAI 战略未来负责人对 Kimi K3 的公开发言?」本轮排名第 10、热度 225 万、公开回答数 21。它不是对 Kimi K3 发布本身的重复讨论,而是对一位 OpenAI 现任高管公开评论的追问。8
Dean W. Ball 在北京时间 7 月 17 日晚间发布的原文,先给了一个相当明确的技术判断:他称 Kimi K3 是「非常好的模型」,认为它在智能体编程中大致达到 2026 年第一季度公开模型的水平,不能简单用蒸馏解释;但他自己的有限使用也观察到 K3 很「吃 token」,因此不认为它的运行成本已经显然便宜。9
这段话里最值得保留的是前半句的证据层级:这是 OpenAI 战略未来负责人基于有限亲自使用的判断,不是 OpenAI 官方模型评测,也不是独立基准报告。它能说明 K3 已经强到让竞争对手内部的高管认真回应,但不能单独证明 K3 在所有任务上超过 OpenAI 或 Anthropic。
争议来自后半段。Ball 把开放权重描述为可能在边际上抑制 AI 资本开支,并推演开放权重主导的世界可能走向由国家提供数字公共基础设施;他还写到,美国政府可能通过增加监管不确定性来降低受监管企业使用中国开放权重模型的意愿。TechCrunch 对这段原文做了完整转述,同时也指出这引发了围绕中国、开放源代码 AI 和政策的争论。10

他后来修正了哪些说法

北京时间 7 月 19 日上午,Ball 又发文说自己想纠正原文中的错误并澄清立场。他明确表示,关于美国政府通过软法规制造对中国 AI 的不信任,他是在描述自己认为可能发生的政策路径,不是在提倡这种做法;他还承认自己不该把开放权重笼统地称为「减速主义」,更准确的说法是开放权重可能在资本开支这一条轴线上产生边际减速作用,而在很多其他方面仍然具有加速作用。11
因此,这个热榜话题不能被简化成「OpenAI 承认 Kimi 很强」或「OpenAI 要封杀开源」。更准确的拆分是:
  • 能力层: 一位 OpenAI 高管承认 K3 的智能体编程能力已接近其所说的 2026 年第一季度公开前沿水平,但样本有限,且指出 token 消耗偏高。
  • 商业层: 如果强模型权重开放,模型能力本身更容易变成可复制的基础设施,闭源模型公司需要把利润更多放到推理服务、工具链、企业支持和数据工作流上。这是产业推演,不是已经发生的财务结果。
  • 政策层: 原文提出了监管风险的可能路径,后续又说明那是预测而非倡议;截至本轮证据,没有看到美国政府已经针对 Kimi K3 采取具体新措施。

知乎公开可见的 3 条回答片段

该问题的实时点赞排序同样无法通过公开访问核验。搜索引擎仍能暴露若干回答 permalink 和片段,但不足以证明排序,因此本节仍是受限版摘要:
  • 一条片段认同 K3 的能力已经接近前沿模型,同时指出实际使用中的速度慢和 token 效率问题;这与 Ball 的亲自体验有部分重合,但不能因此推导出两者使用了同一测试条件。12
  • 一条片段主要提供了 Ball 原文和译文,价值在于让读者直接核对「能力评价」「开放权重风险」和「监管风险」是否被二次转述夸大。13
  • 另一条片段把争议解释为大模型企业在安全、监管和商业利益之间的自我保护,属于答主对动机的推断,不等于 OpenAI 或美国政府的正式立场。14

接下来要看什么

  1. 7 月 27 日 Kimi K3 完整权重是否按官方计划发布,以及模型卡、技术报告和许可证是否同步到位。Moonshot 官方目前确认了 2.8T、原生视觉、100 万 token 上下文,并写明完整权重计划在 7 月 27 日发布;这些是产品方口径,仍要等文件落地。15
  2. Qwen3.8 和 Kimi K3 的开放权重是否真的能被中小团队部署,而不是只有云端预览入口。这里要看量化版本、推理框架适配、显存需求和实际每任务成本。
  3. 美国公司是否把回应集中到更强的闭源模型、低价 API、企业合规方案,还是出现正式的监管限制。社交平台上的政策争论不能替代政府文件。

本期筛选与重复说明

本轮热榜接口返回 29 条候选。第 6 名的 DeepSeek-V4 灰度测试与频道前期已经追踪过的模型传闻高度重合,本轮没有拿到新的官方发布材料,因此不重复改写;第 15 名的 Kimi K3 模型发布也已在上一期覆盖,本期只保留第 10 名中关于 OpenAI 高管公开评论的新增角度。其余前列条目主要是体育、社会、消费和天气话题,虽然热度较高,但没有足够的 AI 或科技一手证据,未为凑数纳入。
知乎问题页和答案页在本轮均触发登录或安全验证,无法取得实时点赞数排序。文中两组「3 条回答」均已明确标为公开索引片段,不冒充点赞数最高前三。对这期读者来说,最值得记住的不是 Qwen3.8 是否已经击败所有模型,而是两个验收问题:开放权重能否真正交付,早期优势能否在真实工作流中复现;以及当强模型变得更容易复制时,模型公司的商业模式和监管边界会怎样变化。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel