
硅谷101速读:开放权重到底开了什么?从 DeepSeek、Kimi 到「黄仁勋联盟」
《硅谷101》从模型训练流程、开放程度和许可证出发,解释 DeepSeek、Kimi K3 等开放权重模型如何改变企业部署、模型商业化与 AI 安全边界。
这期《硅谷 101》在回答一个常被一句「开源模型」带过的问题:模型公司究竟把什么交给了外部世界?节目先从训练数据、模型架构、算力基础设施和模型权重的关系讲起,再把闭源、开放权重和完全开源放到同一条开放程度的光谱里比较。后半段转向许可证、云服务、企业部署和 AI 安全,最后解释为什么黄仁勋推动的开放安全 AI 联盟会得到多数美国科技公司的响应,而 Anthropic 选择站在联盟之外。
本期视频发布于 2026 年 8 月 13 日 11:24(北京时间),时长 23 分 11 秒。视频简介列出的采访嘉宾是前 Hugging Face 亚太生态负责人王铁震、TinyFish 联合创始人 Keith Zhai;公开字幕没有提供可核对的说话人分离,因此下文把具体判断归给「节目」或「视频」,不把无法核实的句子强行归给某位嘉宾。1
Loading content card…
先说结论:开放的不是一个按钮,而是一条链
节目最值得带走的判断是:「开放权重」让别人拿到模型训练完成后的核心结果,但没有自动交出训练这套结果所需的全部方法、数据和工具。 因此,判断一个模型是否「开源」,不能只看下载按钮,也不能只看模型公司自己采用了什么宣传名称,而要逐层追问:开放了哪些文件、哪些工程经验、哪些使用权,以及哪些内容仍然留在公司内部。1
这一区分直接影响三件事。对开发者,它决定模型能否被下载、修改和本地运行;对企业,它决定能否把数据留在自己的服务器里,以及供应商停服或改变政策时有没有替代路径;对模型公司,它决定开放之后还能否通过云算力、企业部署、微调和 API 赚钱。节目没有把「开放」写成单纯的道德选择,而是把它放回一条技术和商业链中观察。
一个模型是怎样被做出来的
节目把从训练到交付的大模型流程拆成几层。这个拆分的作用,是让读者知道「开放权重」究竟位于哪一层,而不是把模型想成一个可以整体打包的程序。1
- 训练数据。 团队先决定使用网页、书籍、代码等哪些材料,以及各类材料如何配比、清洗和筛选。数据选择决定模型接触过什么,也影响它的能力底子。
- 模型架构和参数规模。 团队要确定模型采用什么结构、需要多少参数,以及训练配置如何设置。参数规模不是训练数据的大小,而是模型在训练过程中需要被调整的数值位置有多少;位置越多,模型能拟合的规律通常越复杂,但训练成本也会上升。
- 训练基础设施。 GPU 集群、高速网络、存储系统和训练框架共同构成 AI Infra。节目把 DeepSeek 的 DeepGEMM、Kimi K3 的 FlashKDA 和 MoonEP 放在这一层:它们解决的是计算、通信或训练环境中的工程问题,不是单独的一份模型权重。
- 训练过程。 预训练、微调和强化学习会反复调整参数。中间的存档让团队可以继续训练、测试或回滚。
- 模型权重。 训练结束后,数十亿到数万亿个参数被保存为一组数字。它们记录了模型在训练中形成的知识和能力,是开放权重模型交给外部使用者的核心成果。
- 部署。 权重需要被放进服务器,通过 API 或本地部署提供服务。仅有一份数字文件,使用者还需要知道怎样读取它、按什么顺序计算,以及如何把结果转换为回答。
- 技术报告和工具链。 报告会说明架构、数据大致构成、训练经验和评测结果,但它不一定等于可以照着复现的操作手册。训练代码、数据配方、内部调参策略和工具链,可能仍然是公司最重要的商业资产。
这里有一个很容易混淆的地方:权重是模型学到的结果,代码是运行这些结果的方法,数据和训练流程则解释了结果是怎样形成的。 把其中一层开放,不能自动推出另外几层也开放。
三种开放程度:闭源、开放权重、完全开源
节目用三种类型建立坐标系。它们不是三个绝对稳定的法律分类,更像是在比较一个模型对外释放了多少信息和控制权。1
- 闭源模型。 训练数据、训练代码、权重和内部工具链都不公开,用户主要通过产品或 API 使用能力。视频把 Anthropic、OpenAI 和 Google 的大部分模型归到这一形式。
- 开放权重模型(Open Weight)。 至少把训练后的权重,以及让权重能够运行或微调的部分代码交出来。使用者可以下载、部署和继续调整,但通常看不到完整数据配方、训练过程和内部工具链。
- 完全开源模型(Open Source)。 节目用 Ai2 的 OLMo 系列作为代表,强调它不仅公开结果,还尽量公开训练数据、训练代码、中间存档和技术报告,使外部团队更接近复现和检查完整过程。
所以,市场上大量被口头称作「开源模型」的产品,实际更接近开放权重。这个词并非语义挑剔:当开发者要判断能否复现、修改、商用或审计时,差别会直接落到文件、许可证和责任边界上。
DeepSeek、Kimi K3 和 Llama:同样能下载,开放的内容不同
节目没有把「能下载」当作比较终点,而是用三组模型说明开放程度的差异。1
Llama:权重和运行方式开放,训练过程更像黑箱
如果从 Hugging Face 下载 Kimi K3 或其他模型的权重,拿到的是按照架构约定排列的大量浮点数。权重本身不能直接回答问题,还需要推理代码告诉服务器怎样读取和计算。节目把 Meta 的 Llama 系列作为基础开放权重的代表:权重和运行、微调所需的一部分代码对外发布,但训练数据的具体配方、训练中不断调整的策略,以及支撑训练的内部工具链没有全部公开。
视频还指出,Llama 从早期版本到 Llama 4 的技术披露方式有所变化:早期技术报告更详细,后来更偏向简短博客。这个变化说明「开放权重」内部也有梯度,发布一份权重,不代表公司愿意把工程经验全部交出去。
DeepSeek:把工程细节也变成公共基础设施
节目认为,DeepSeek V3 和 DeepSeek-R1 的冲击不只来自权重本身,还来自技术报告和基础设施组件的开放。报告讨论了 MoE(Mixture of Experts,混合专家)模型的设计、MLA(Multi-head Latent Attention,多头潜在注意力)如何降低 KV Cache 的内存占用、FP8 训练如何稳定运行,以及为什么团队放弃其他方案。DeepEP、FlashMLA 等组件则把原本更可能留在内部工程团队的训练和推理经验,变成外部团队可以使用的工具。
这里的价值在于,外部开发者看到的不只是「最终分数」,还包括模型团队遇到的约束和做取舍的理由。技术报告仍然不等于完整复现,但它把黑箱打开了一部分:别人可以沿着同一工程问题继续改进,而不是从一份权重反推所有路径。
Kimi K3:把通信、计算和训练环境一起交出来
节目把 Kimi K3 描述为延续 DeepSeek 路线的开放权重模型。除了详细技术报告,Kimi K3 同步开放了三项底层基础设施:MoonEP 处理 MoE 中多个专家之间的通信效率,FlashKDA 加快注意力计算,AgentEnv 为智能体训练提供可运行环境。它们分别对应大模型训练中经常遇到的通信、计算和训练环境三个瓶颈。1
这也是节目对「开放」一词最有用的补充:开放的价值不只在于企业能不能把模型下载到自己的机器上,也在于别人能不能复用训练一个模型时积累的工程经验。模型权重开放,解决的是「我能不能拿来跑」;基础设施开放,解决的是「我能不能把它跑得更快、更便宜、更稳定」;训练方法公开,则让后来者更容易知道下一步该从哪里改。
许可证决定「能用」离「能卖」有多远
权重能够下载,只能回答获取问题。真正决定开发者能不能修改、商用和再发布的,是许可证(License)。它是一份使用规则,规定哪些行为被允许、哪些行为需要保留声明、哪些规模或场景会触发额外条件。1
节目提到的几类协议,边界并不相同:
- MIT License。 视频以 DeepSeek V3、R1 和智谱 GLM 的协议变化为例,认为在保留版权声明的前提下,开发者通常可以较自由地下载、修改和商用,限制相对少。
- Apache 2.0。 视频提到阿里 Qwen 从自定义协议转向 Apache 2.0,认为这降低了商业使用门槛。它属于广泛使用的开源许可证,但具体项目仍要结合附加条款和模型卡阅读。
- Kimi K3 License。 节目说,Kimi K3 对大多数开发者和中小企业提供免费下载、修改和商用的路径,但设置了规模条件:产品月活超过 1 亿或月收入超过 2,000 万美元,需要在界面显著展示「Kimi K3」标识;模型即服务托管业务连续 12 个月总收入超过 2,000 万美元,则需要另行签署商业协议。
- Llama Community License。 节目把它列为限制更多的自定义协议,提到超大月活产品需要额外授权、部分版本有地区限制,以及禁止利用 Llama 输出训练其他大型模型等条款。
这组比较带来一个实际检查顺序:先看权重是否能拿到,再看许可证是否允许你的用途,最后看你的用户规模、收入规模、部署方式和再分发方式是否触发额外条件。 「免费」只说明价格可能为零,不等于没有合规成本,也不等于可以把模型改名后随意转卖。
开放权重怎样赚钱:免费模型是入口,服务才是收入层
如果模型权重可以免费下载,模型公司为什么还愿意开放?节目给出的答案是,企业下载模型只是第一步,生产环境真正需要的是算力、存储、网络、运维、安全评测、数据清洗、模型适配和持续更新。开放权重改变了收费位置,却没有消灭收费需求。1
云和基础设施
企业大规模部署模型,需要 GPU、云存储、网络、数据库和模型管理平台。对阿里这样的云厂商,模型可以免费,运行模型的整套云服务仍然收费。对英伟达、AMD 等基础设施公司,模型越容易被部署,潜在的训练、推理和微调需求就越多。节目用「卖铲子」来概括这个位置:基础设施公司并不一定要拥有最成功的模型,只要生态中有更多人挖矿,就会需要更多铲子。
私有化部署和行业定制
金融、医疗、政府和大型企业可能不愿意把内部数据发送给外部 API。它们下载权重后,还要完成数据清洗、安全评测、推理优化、行业微调和长期维护。模型公司因此可以出售私有化部署、技术支持和行业解决方案。
后训练和模型开发平台
企业越来越希望把自己的数据、业务规则和评测标准加入现有模型,做成更适合特定任务的专用模型。微调、强化学习、评测、数据管理和版本管理都可以变成收费的平台能力。节目引用的观点是,企业会逐渐追问:AI 智能是向模型厂商租用,还是应该沉淀成自己的资产?开放权重让「拥有和改造」变得可行,但是否值得自建,仍取决于企业的算力、团队、数据和维护能力。
MaaS:别人替你托管开放模型
MaaS(Model as a Service,模型即服务)厂商把开放权重部署到自己的 GPU 集群,再通过 API 卖给开发者;云厂商也会提供同类模型服务。节目提到 Together AI、Fireworks AI,以及 Kimi K3 许可证下可能涉及的商业协议。
这里有一个有意思的商业变化:许可证收钱不一定只是阻碍。节目认为,MaaS 厂商如果获得模型方的认证,反而能向客户证明自己提供的 token 在准确性和性能上有保障。于是模型公司开放权重,同时通过供应商验证、企业服务和 API 认证保留商业关系。
企业为什么愿意从闭源 API 迁移一部分任务
节目给出的企业动机有三个层次,分别对应成本、控制权和可改造性。1
- 成本。 Coding agent 普及后,企业的 token 账单快速上涨。节目描述的一种现实组合是:最困难、最需要顶级能力的任务继续使用闭源模型,日常任务则交给能力接近、价格更低、能够本地部署的开放权重模型。这样做不是对某一类模型的永久站队,而是按任务难度分配成本。
- 所有权和可持续性。 使用外部 API,企业会受到供应商政策、监管变化、价格和服务连续性的影响。如果模型权重在自己手里,至少保留了部署和迁移的可能性。视频用美国商务部可能限制某项模型服务的假设说明这种担忧:一旦外部服务停止,原有流程可能同时失效;本地权重不能解决所有问题,却能保留一条自主路径。
- 定制和创新。 开发者拿到权重与技术报告后,可以继续训练、修改模型,让它适应不同场景。vLLM、SGLang 等开源推理引擎对许多开放模型提供快速支持,降低了自己解决部署问题的门槛。开放模型因此成为 AI Agent、机器人等项目的基础材料,而不仅是一款可以聊天的产品。
对企业而言,判断是否迁移,不能只比较一次 API 调用价格。还要把 GPU 采购或租赁、工程团队、数据治理、安全更新、许可证审查和故障责任一起算进去。节目主要回答「为什么开放权重有吸引力」,没有替每家公司给出自建或外包的结论。
「黄仁勋联盟」为什么能聚起竞争对手
节目把黄仁勋推动的开放安全 AI 联盟放在产业利益的交叉点上。视频描述的联盟主张是:美国既需要最先进的闭源模型,也需要最先进的开放模型;开放模型对网络安全、AI 创新和 AI 主权有价值,监管应针对具体风险,而不是因为安全担忧就直接限制开放权重这条技术路线。1
这些公司支持开放模型,并不代表它们都接受同一套技术或安全判断。云厂商的利益很直接:客户最终运行的是 OpenAI、Llama、DeepSeek 还是 Kimi,只要算力和服务跑在云上,云厂商都可能获益。芯片和基础设施公司同样希望更多模型被部署,因为训练、推理和微调都会消耗计算资源。Palantir、Databricks 等企业软件公司出售的是数据平台、应用和行业方案,模型越开放,它们能服务的场景可能越多。
所以「联盟」不是竞争对手突然放弃商业利益,而是不同公司在模型开放带来的基础设施市场上找到了交集。开放权重对闭源模型供应商的压力,可能是它们对其他产业环节的机会。
Anthropic 为什么留在联盟之外
节目呈现了两套都需要认真对待的解释,而没有把其中一套写成唯一答案。
第一套是安全担忧。 Anthropic 的立场是,它没有主张禁止开放权重模型,但担心最前沿的开放模型会降低危险能力被恶意使用的门槛。闭源模型至少由少数公司掌握权重,可以持续监控、修补和更新;如果最强模型的权重被公开,任何人都能下载、部署和修改,风险控制就很难依赖单一运营方。节目还提到 Anthropic 对蒸馏(distillation)的担忧:较小或较新的模型通过大量调用前沿闭源模型,学习其输出,从而降低追赶前沿能力所需的算力。这里是节目转述的立场,不是本篇独立验证了蒸馏规模或因果关系。1
第二套是商业解释。 开放权重会增加企业本地部署和自主定制的选择,削弱闭源 API 的依赖;模型能力也更容易被追赶和复制,闭源模型赖以建立的竞争壁垒会受到压力。因此,Anthropic 坚持闭源,既可能包含安全判断,也可能包含保护商业模式的动机。节目并没有提供足以把两种动机拆开的证据,读者应把它们当作竞争性的解释。
两边的论点各自抓住了不同风险。开放权重带来审计、迁移和创新空间,也把安全更新、部署责任和滥用控制分散到更多主体手中;闭源服务可以集中运营和修补,但企业要承担供应商锁定、政策变化和服务中断的风险。真正困难的地方在于,能力越接近前沿,这两组收益与成本就越同时放大。
读者可以怎样判断一套模型「开」了什么
如果你正在评估一个模型是否适合个人项目、企业部署或商业产品,可以把节目内容转成一张检查表:
- 拿到的到底是什么? 是权重、推理代码、微调代码,还是只有 API?
- 训练过程公开到哪一步? 有没有数据说明、技术报告、中间存档、训练代码和可复现实验?缺失的部分是什么?
- 许可证允许什么? 能否修改、商用、再发布、提供托管服务?是否有月活、收入、地区、品牌展示或模型蒸馏限制?
- 部署成本由谁承担? 自建 GPU、云端托管、模型压缩、推理优化、监控和升级分别需要多少团队与预算?
- 数据和责任在哪里? 数据是否必须离开公司?发生错误、泄露或模型行为变化时,谁负责修复和通知用户?
- 模型更新是否可持续? 开放权重可以保留当前版本,但并不自动保证后续安全补丁、性能更新和兼容性维护。
- 开放带来的收益是否值得风险? 成本下降、可定制和供应商独立性,需要和安全评测、许可证合规、滥用控制及维护成本一起比较。
这张表不能替读者决定该用 DeepSeek、Kimi、Llama 还是闭源 API。它的用处是把「开源」这个过大的词拆成几项可核对的事实:你拿到了哪些资产,获得了哪些权利,又接手了哪些责任。
按问题选听
- 00:00–03:51:大模型由哪些部分组成,权重与训练数据、架构、基础设施是什么关系。
- 03:51–08:34:闭源、开放权重和完全开源的差别,以及 Llama、DeepSeek、Kimi K3 的开放梯度。
- 08:34–11:37:MIT、Apache 2.0、Kimi K3 License 和 Llama Community License 如何改变商用边界。
- 11:37–15:18:云计算、私有化部署、后训练平台和 MaaS 如何承接开放模型的商业价值。
- 15:18–19:41:企业为什么在成本、所有权和定制之间重新分配模型任务,黄仁勋联盟为何形成。
- 19:41–结束:Anthropic 的安全担忧、蒸馏争议,以及开放权重扩张后的治理难题。
时间点与节目章节来自官方视频简介,观点和细节以视频原声及其公开字幕为准。1
完整逐字转录稿
以下为本期公开字幕的完整 ASR 原始转写。仅增加讲话人标签、每 10 分钟时间轴和段落排版,不删减、不润色、不修正口误、错字或专名误识别。公开字幕没有可靠的说话人分离信息,因此统一使用中性标签「讲话人 1」;视频结尾虽有主持人自我介绍,但不足以据此把整段字幕中的每个字都归给某位可核对的说话人。原声入口:《硅谷 101》完整视频。
00:00–10:00
讲话人 1
DeepSeek V4 Pro 正式登场 给开源模型生态又添一把猛火 从 Kimi K3 到 MiniMax H3 再到 DeepSeek V4 flash DeepSeek V4 Pro 在中国开源模型的猛攻之下 美国的 AI 公司这次是真的坐不住了 中国刚刚抹平了 美国在人工智能领域的领先优势 我们看到市场真的非常恐慌 黄仁勋亲自下场发表了人生第一条推文 呼吁全行业共同推动美国开源生态的发展 目前 这个联盟除了 Anthropic 之外 美国 AI 圈的主要玩家几乎全员到齐 Sam Altman、Sundar Pichai 等 闭源模型掌门人 也都罕见发文表示支持 为什么这些平时斗得最厉害的公司 这次却罕见地站到了同一战线 而 Anthropic 坚持不加入的原因又是什么 要回答这个问题 我们要先来弄明白一个更基础的问题 那就是 AI 行业当下所说的“开源” 究竟是什么 而模型开源之后 对于模型公司 以及整个 AI 行业生态的影响又是什么呢 今天这期视频 我们就来把“开源”这件事讲清楚 很多人觉得 一个模型可能就是一整套代码 开源就是把这套代码发布出去 其实不是这样的 要弄明白开源开的到底是什么 我们要先来捋一遍 一个大模型从训练到最终发布 背后的一整套流程 这个过程大致可以拆成七个部分 第一 训练数据 研发团队首先要决定 用什么数据来训练模型 比如网页、书籍、代码 各类数据如何配比 再经过清洗和筛选 这一步就决定了模型的“底子”好不好 第二 模型架构和参数规模 这个阶段主要做的是模型的规划设计 比如采用什么模型架构、参数规模有多大 以及各种训练配置 这些设计决定了模型的能力上限 和训练效率 有一点需要注意的是 参数规模并不是指训练数据的大小 训练一个模型 其实是在不断地做“调整” 而参数规模 说的是“这次总共要调整多少个地方” 参数规模越大 模型能捕捉和处理的细节、规律也越复杂 第三 训练基础设施 模型设计完成后 需要庞大的算力来完成训练 这就包括 GPU 集群、高速网络、存储系统 以及各种训练框架 而如何把这些算力高效组织起来 正是如今最火的 AI Infra 领域 像 DeepSeek 的 DeepGEMM Kimi K3 的 FlashKDA、MoonEP 都属于这一层的创新 关于 AI Infra 行业最近在做什么 我们其实也刚刚出了一期视频 欢迎大家配合观看 数据有了、架构设计好了 基础设施也到位了之后 就进入了真正的训练流程 在这个阶段 模型会进行预训练、微调和强化学习 在训练过程中也会不断“存档” 方便继续训练、测试或回滚 经过漫长的训练之后 模型内部数十亿甚至数万亿个参数 都会被逐步调整到合适的数值 这些参数最终形成的集合 就是“模型权重” 也是整个模型最核心的成果 记录着模型在训练过程中 学到的知识和能力 最后 还需要将权重部署到服务器 通过 API 或者本地部署的方式 真正提供给开发者和企业使用 这些流程结束之后 模型厂商们通常还会写一个“技术报告” 里面会介绍模型架构设计的思路 数据大致的构成、训练中踩过的坑 和最终的评测结果等内容 让外界理解这个模型是怎么做出来的 但技术报告不是可以照着复现的操作步骤 它讲的更多是一种方法论 好了 训练流程清楚了 现在我们就可以来回答这个问题了 “开源”到底开的是什么环节呢 按照模型的开放程度 现在主要分为闭源、开放权重 和完全开源这三大类型 我们先说两端 闭源模型就很好理解 就是以上环节全部不对外开放 客户只能在模型部署层面 通过 API 或者具体产品使用模型能力 Anthropic、OpenAI 和谷歌 目前的大部分模型都是这种形式 完全开源的模型叫做 Open Source 是指从训练数据、训练代码 和中间存档、技术报告都完全公开 Ai2 艾伦人工智能研究所 推出的 OLMo 系列就是这样的代表 但现在我们所说的大部分开源模型 其实都不是真正的 Open Source 而是处在开源和闭源中间地带的 Open Weight 开放权重 相当于只是送出了训练后模型的最终结果 你可以直接拿去用 也可以在结果之上进行微调和改进 但现在在不同的开放权重模型之间 开放的程度其实也存在很大的差异 我们就拿几个比较典型的例子来说一下 首先 “模型权重”严格来说 只是一个巨大的数字文件 光靠它是没法直接用的 如果你从 Hugging Face 上 直接下载 Kimi K3 的权重 拿到的是 2.8 万亿个浮点数 按照模型架构规定好的顺序 整整齐齐地排列在里面 所以除了权重本身 厂商通常还会公开一份推理代码 专门负责教你怎么读取这份权重文件 按照什么顺序做计算 以及最后怎么把结果变成一句话回复你 最基础的“开放权重”就是把模型权重 以及这个能跑、能微调的推理代码 公布出来 让任何人都可以把模型下载下来 在自己的服务器上运行 其中最具代表性的 就是 Meta 的 Llama 系列 但是 训练数据的具体配方 训练过程当中不断调整的策略 以及支撑整个模型训练的内部工具链 这些更核心的部分 Meta 始终没有开放 此前 从 Llama 1 到 Llama 3 Meta 还会发布较为详细的技术报告 分享模型设计和工程经验 但到了去年的 Llama 4 Meta 只发布了一篇简短的博客 没有再公开完整的技术报告 开放的程度也变得更加保守 而 DeepSeek 之所以震撼整个行业 其中一个重要的原因就是 它不仅是把方法详细地讲了出来 还把内部的工程工具链也开源了 相当于是“Open Weights”的 Plus 版本 在此之前 大部分模型厂商的技术报告更像是公关稿 通常会告诉你模型有多少参数 在哪些 Benchmark(基准测试)上取得了什么成绩 却很少解释这些成绩是怎么做出来的 但 DeepSeek V3 和 DeepSeek-R1 却把过去一些很少公开的研发细节 几乎毫无保留地写了出来 比如它详细介绍了 MoE(混合专家)模型 是如何设计出来的 为什么要采用 Multi-head Latent Attention(MLA) 来降低 KV Cache 的内存占用 FP8 训练是如何稳定实现的 以及不同方案之间 为什么最终选择了现在的设计 放弃了其他路线 除了技术报告 DeepSeek 还陆续开源了 DeepEP FlashMLA 等训练和推理基础设施组件 把很多过去只属于 内部工程团队的工程经验 也变成了整个行业都可以使用的工具 DeepSeek 可以说是开启了一种 新的模型开放的形式 而这次 Kimi K3 也延续了这种做法 和 DeepSeek 一样 Kimi K3 也公布了非常详细的技术报告 介绍模型架构、训练方法和大量工程细节 与此同时 Kimi K3 此次同步开放了 三大自研底层基础设施 其中包括解决 MoE(混合专家)模型里 几百个“专家”之间通信效率的 MoonEP 加快注意力计算的 FlashKDA 以及给智能体训练 搭建可运行环境的 AgentEnv 这三项分别对应训练大模型时 会遇到的三个卡点 通信、计算、训练环境 让大家能更了解 Kimi 团队 是怎么高效训练出这个模型的 目前在整个训练环节中 大多数开放权重模型真正公开的 其实只有模型权重 推理代码 以及一部分技术报告和基础设施工具 而训练数据和完整训练流程 仍然是各家最核心的商业机密 而且 开放权重也并不是毫无限制 真正决定开发者能不能将模型修改 商用 以及再发布的 是模型附带的许可证 也就是 License 过去一年 一个很明显的趋势是 中国大部分模型厂商的许可证 正在变得越来越开放 比如 DeepSeek 最早发布模型时 采用的是自己制定的协议 对于使用场景还有一些限制 但到了 DeepSeek-V3 和 R1 已经全面切换到了 MIT License 这意味着 只要保留版权声明 开发者几乎可以自由下载、修改、商用 限制非常少 阿里的 Qwen 也走了一条类似的路线 从最初采用阿里自定义协议 到后来切换为国际上广泛使用的 Apache 2.0 许可证 同样大幅降低了商业使用门槛 值得注意的是 此前 Qwen 的旗舰 Max 系列 一直是保持闭源 只能走 API 但在这个月初 阿里表态 将首次把旗舰模型 Qwen3.8-Max 的权重开源 智谱 GLM 也是一样 他们从 2025 年的 GLM-4-0414 开始使用 MIT License 后来一直沿用至今 商业使用限制很宽松 当然了 也并不是所有公司都会选择“完全开放” Kimi 之前的 K2 系列 用的是一种叫 Modified MIT 的许可证 但这次 K3 启用了一份全新 叫做 Kimi K3 License 的协议 不再自称是 MIT 的修改版本 那这是什么意思呢 对绝大多数开发者和中小企业来说 其实实际使用体验和 MIT 差别不大 因为都是免费下载、商用和修改 但它加了两道门槛
10:00–20:00
讲话人 1
第一是产品月活超过 1 亿 或者月收入超过 2000 万美元的 需要在界面上显著展示“Kimi K3”标识 第二 如果你做的是 模型即服务的托管生意 且连续 12 个月总收入超过 2000 万美元 就必须先和月之暗面 另行签署商业协议才能商用 而限制最多的则是 Meta 的 Llama 它没有采用 MIT、Apache 这些主流开源许可证 而是自己制定了一个 Llama Community License 中间的限制就非常多了 例如月活用户超过 7 亿的产品 需要额外申请授权 部分版本曾经限制在欧盟地区使用 同时协议还明确禁止 开发者利用 Llama 的输出 去训练其他大型模型等等 不过 Meta 近期也在重回开放路线 它们最新发布了 300 亿参数的 开放权重模型 Muse Glimmer 就采用了 Apache 2.0 许可证 此外扎克伯格还宣布 Meta 目前最强基础模型 Muse Spark 1.2 也即将开放权重 他现在把这个东西写清楚之后 很多专门做模型推理和云厂商 实际上没有办法去 take free ride(不劳而获) 因为之前很多开源项目 我们不说模型 就比如说开源的一些数据库的项目 现在最担心的就是 云厂商没有出工 没有出力 然后拿这个开源项目部署在自己的云上 就可以卖钱了 所以 free ride(不劳而获)这个事情 实际上是开源社区一直想要避免的 当然了 许可证只是划定了红线 而不是直接把模型转化为收入 那么问题就来了 这些开源公司究竟怎么赚钱呢 实际上 开放权重并不等于放弃商业化 企业下载模型只是第一步 要想真正把模型稳定部署到生产环境 还需要算力、运维、持续更新 以及针对业务场景的定制开发等等 相比自己组建团队 很多企业依然会选择 直接购买模型公司的 API 服务 企业版部署或者行业解决方案 因此 开放模型可以带动一整套 围绕模型的服务收入 第一种是通过开放模型带动云计算 和基础设施消费 以千问为例 模型权重虽然可以免费下载 但企业想要大规模部署 依然需要 GPU、云存储、网络、数据库 和模型管理平台 对于阿里这样的云厂商来说 开放模型更像是一个入口 模型本身可以免费 但运行模型所需要的整套云服务 都是收费的 第二种是为企业提供部署和定制服务 很多金融、医疗、政府或大型企业 不希望把内部数据发送给外部 API 还是希望把模型部署在自己的服务器 或者私有云里 但下载权重之后 企业还需要完成模型适配、数据清洗 安全评测、推理优化和后续维护 模型公司可以向这些客户出售私有化部署 行业微调、技术支持和长期维护服务 第三种则是提供收费的后训练 和模型开发平台 现在的企业更希望 在现有开放模型的基础上 加入自己的数据和业务规则 把它变成更适合特定任务的专用模型 模型公司可以提供微调、强化学习、评测 数据管理和版本管理等工具 并且按照训练算力、使用量 或者企业订阅收费 像 Thinking Machines 的思路 就更接近这种 因为一个核心点就是关于 AI Intelligence(智能)到底是 我应该是租借的 还是我应该是自己来变成自己的 很多的企业现在越来越接受的观点 就是智能应该为我所有 而不应该是 rent(租借) 这就是整个的大背景下 以 Kimi 为例 虽然模型权重已经开放 但它们依然提供付费订阅、API 调用 以及企业级的 AI 服务 除此之外 开源模型厂商的另一部分收入来源 是模型级服务 Model as a Service 也就是 MaaS 厂商以及云厂商 MaaS 厂包括最近很火的 Together AI、Fireworks AI 等等 是把开放权重模型 部署到自己的 GPU 集群上 再通过 API 提供给开发者使用 云厂商也就是大家熟悉的 卖基础设施的 AWS、阿里云等等 现在也会卖模型服务 在 K3 这样的许可证下 这类厂商也要向 Kimi 交钱 公开信息显示 月之暗面当前的年化经常性收入 ARR 已经达到了 3 亿美元 可能是一个反常识的观点 就是云厂和这个 MaaS 厂 实际上应该是非常欢迎 Kimi 找它来收钱的 因为只要你来收钱 就说明你跟 Kimi 有一个官方的认证关系 包括你卖的这个 token 质量等等 都是有官方给你做保证和背书的 大家如果去看 Kimi 官方的一些发布 它实际上是有一套 vendor verification(供应商验证)的流程的 就有点像之前大家比如说买个芯片 说什么 Intel Inside(英特尔商标) 只有你过了这个验证的流程 你卖出来的这个 token 才能被证明说是好的 token 包括准确性 包括性能都是有保障的 消费者去买你们的这些 token 其实也都是知道说要买谁的 token 所以开放权重并不意味着商业价值的消失 更多是一种商业模式的变化 而对于整个 AI 生态来说 它也有着非常重要的价值 过去几年 Claude、ChatGPT、Gemini 这些业界最强的模型几乎都是闭源的 也就意味着这些模型的能力 始终牢牢掌握在少数几家公司手里 而开放权重 则让拥有前沿能力的 AI 模型 可以像软件一样被下载、部署和微调 并在此基础上继续创新 对于企业用户来说 这绝对是件天大的好事 首先是成本 还记得今年年初编程 agent(智能体)开始流行 每家企业都开始 token maxxing 的几个月吗 这一通操作下来 每家公司都发现 自己的 token 账单是水涨船高 在这样的背景下 开源模型显然成了最优解 毕竟中国开源模型能力 已经能追平最强的闭源模型 又很便宜 还能自己调整 谁不爱呢 而现在一种主流的企业做法就是 最困难的任务 还是使用几家能力最强的闭源模型 日常的任务 就都通过中国这些开放权重模型来实现 其次是所有权的问题 如果模型一切都是取决于对方是否开放 这就是 Fable 今年早一点 Anthropic 的这个事情 其实对大家影响很大的 突然有一天 美国商务部说这不可以用了 那就一夜之间就都不可以用了 之前你做的部署 之前什么可能都没有了 那这种情况怎么办 这就是为什么对于企业来说 在能力几乎相当的情况下 开源模型具有绝对的优势了 而对于普通开发者来说 开源模型也同样大大降低了 参与创新的门槛 以前开发者想要基于 GPT 或者 Claude 开发产品 能做的事情其实很有限 但借助权重和技术报告 开发者就能够自己去尝试修改模型 继续模型训练 甚至让模型适配完全不同的场景 而现在 vLLM 和 SGLang 等开源推理引擎 都能够对大部分开源模型 做到 Day-0 的支持 这也意味着开发者们 不需要自己解决复杂的推理部署问题 就能直接部署模型 如今开放权重模型已经成为大量 AI Agent 机器人等项目的重要基础 推动着整个 AI 创业生态的繁荣 此外开放权重本身也在加速着模型的迭代 比如在 Kimi K3 的技术报告里 有一部分专门介绍了 他们如何优化 MoE(混合专家)模型中的负载均衡 而这套方法 就是他们在 DeepSeek V3 方案基础上的 继续演进 闭源模型的技术突破 很可能永远留在自己的服务器里 但借助于开放的技术经验 整个行业都能够站在巨人的肩膀上 加速往前走 所以无论是从商业 还是整个 AI 生态的角度 开放权重都在成为一条 非常重要的技术路线 这也是为什么这次会由黄仁勋 牵头来做这件事 并且一呼百应 最近针对中国开源模型的强势崛起 有消息传出 美国政府正在考虑采取相关限制行动 “开放安全 AI 联盟”的核心观点是 美国既需要最先进的闭源模型 也需要最先进的开放模型 他们认为 开源模型对网络安全和 AI 创新 AI 主权都至关重要 监管应该针对具体风险 而不是因为安全担忧 就限制开放权重这种技术路线本身 但这个联盟背后也有着更深的商业考量 比如对于微软、亚马逊、谷歌 这几个大型云厂商来说 不管客户最终部署的是 OpenAI, Llama DeepSeek 还是 Kimi 只要运行在云上 它就能从中获益 对于英伟达、AMD、Baseten 这样的基础设施企业来说 开放权重 意味着会有更多企业、开发者和国家 把模型部署到自己的服务器 而每一次部署、微调和推理 都会带来新的算力需求 不少基础设施公司的业务增长 甚至就是伴随着一代代开源模型 而发展壮大 其实从芯片、基础设施这个角度来看 那肯定是所有人 每个人都能自由搭建一个(模型)最好 这样的话 他就可以卖出更多的铲子 因为他并不在乎谁能挖到金子 甚至挖金子什么人完全不重要 重要的就是他能卖更多的铲子 而对于像 Palantir、Databricks 这样的企业软件和 AI 应用公司来说 它们卖的本来就是模型之上的数据平台 AI 应用和行业解决方案 模型越开放 它们能够服务的客户和场景反而越多 目前 这个联盟聚齐了 美国所有重要的 AI 公司的名字 但唯独少了一个 Anthropic
20:00–23:11
讲话人 1
他们也专门发了一条长文 来阐释自己的立场 Anthropic 首先表态 他们从来没有主张过禁止开放权重模型 但他们担心两件事 一是前沿开放模型带来的安全风险 在闭源的情况下 一些危险的安全能力 还被掌握在少数模型公司手里 但如果最强大的模型权重被公开 任何人都可以下载、部署、修改 那么恶意使用这些能力的门槛 也会随之降低 这将让整个世界都处于危险之中 第二是蒸馏问题 它认为中国的开源模型 之所以发展得这么快 就是大规模地蒸馏了 美国最前沿的这些闭源模型 进而也会大幅降低 追赶最前沿模型所需要的算力 与其纠结要不要管开源 美国政府更应该先管管“蒸馏” 但也有很多人认为 Anthropic 坚持不开源 更多还是出自商业利益的考量 对于闭源模型来说 开放权重 无疑是会严重冲击它们的商业模式 因为一旦越来越多高性能的开放模型出现 企业就有了更多本地部署 和自主定制的选择 对闭源 API 的依赖也会降低 而模型能力本身 也更容易被快速追赶和复制 让闭源模型赖以建立的竞争壁垒受到挑战 而最近 在美国全行业 越来越强的开源声势下 Anthropic 坚持闭源的立场 正在遭受越来越大的压力 对它 AI 安全立场的质疑声也逐渐变大 因此 Anthropic 及其他公司 对自己和行业施加的限制 正迫使大量公司转而采用开源中国模型 从初创公司到大型企业 整个行业都在经历这一转变 但是我们也看到 并不是所有人 都反对 Anthropic 的这些观点 比如本次 Kimi K3 开源之后 网上就出现了不少声音 认为把这样已经达到最前沿能力的模型 开放出来 本身就是一种风险 最近 OpenAI 和 Anthropic 的模型 接连曝出越狱攻击事件 让这种担忧进一步升温 因为即使是部署在官方服务器 拥有持续监控和安全更新能力的闭源模型 目前看来也并非绝对安全 而如果未来 越来越多能力接近 Fable 5 这一水平的开放权重模型 被部署到成千上万家企业、本地服务器 甚至个人设备上 情况就会变得更加复杂 模型治理、安全更新和风险控制 必然将面临更大的挑战 目前业界关于开源模型的讨论 还在激烈地进行着 但无论如何 开放权重模型都已经成为了 推动这一波 AI 发展的重要力量 它降低了技术门槛 加快了创新速度 也让越来越多的企业和开发者 可以参与到 AI 生态当中 但与此同时 它们也带来了更多的问题和安全挑战 对此 我们《硅谷 101》 也专门录制了一期播客讨论这个话题 欢迎大家收听 我们之后也会持续追踪 中美开源模型的进展 以及它对整个 AI 行业的影响 以上就是我们这期视频的全部内容了 感谢大家的收看 大家的点赞、留言和转发 是我们做好深度科技 和商业内容的最佳的动力 欢迎关注《硅谷 101》 我是 Yiwen 那我们下期再见了
References
- 1《硅谷101》视频:从 DeepSeek、Kimi 到「黄仁勋联盟」
youtube.com

我的播客精华 | 12 档节目速读
追踪 Lex Fridman Podcast、Huberman Lab、半拿铁、晚点、硅谷101、张小珺访谈、高能量、疯投圈、乱翻书、屠龙大实话、小天章、纵横四海 12 档播客,每期有新节目发布时自动生成中文摘要文章。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
More from this channel›
- Kurt Andersen 谈美国政治分裂:身份、代际与市场为何走到一起
- 晚点聊 179 速读:蒸馏不是抄答案,模型竞争转向数据、组织与成本
- Lenny's Podcast 速读:OpenAI 设计负责人 Ian Silber——AI 时代,为什么现在是成为设计师的最佳时机
- 《硅谷101》对话曹原速读:从 Discovery Loop 到 AI for Science 的验证瓶颈
- 高能量 Vol.229 速读:美元资本周期到了尾部,先变的是资金流向
- 半拿铁 No.214 速读:小红书与 B 站,为什么社区最难复制
- 高能量 Vol.228 速读:单伟建谈周期与投资——见过下行,才知道什么叫能力
- 晚点聊 178 期速读:从 coding agent 到 AutoResearch,RSI 离模型自进化还有多远