晚点聊速读:Kimi K3 的 2.8T 开放权重,为什么让开源模型逼近闭源前沿

晚点聊速读:Kimi K3 的 2.8T 开放权重,为什么让开源模型逼近闭源前沿

《晚点聊》第177期围绕 Kimi K3 的 2.8 万亿总参数、混合注意力、Agent 训练环境与开放权重边界展开,帮助读者判断它对推理成本、开源生态和 Anthropic 等闭源模型商业模式意味着什么。

这期节目在讲什么

Kimi K3 这次引发的争论,表面上是一个新模型的发布,底下其实有三个问题叠在一起:大模型能不能靠新的注意力结构把长上下文和推理成本压下来,模型的能力是否已经开始转移到 Agent 的工作环境里,以及「开放权重」究竟开放了多少。第 177 期《晚点聊》没有把 K3 当成一张榜单来讲,而是从使用体感、架构、训练方法、Serving Stack 和开源边界一路追到商业价值。
先给阅读预期:这是一场技术型访谈,前半段回答 K3 为什么会被视为开源模型的里程碑,后半段拆解 Kimi Delta Attention(KDA)、Attention Residuals、混合注意力、专家路由、蒸馏和推理优化。节目最后留下的判断并不是「开源已经赢了闭源」,而是:模型权重可以被公开,产生这些权重的训练数据、验证环境、推理系统和算力组织却仍然是另一场竞争。1
本期节目于 2026 年 8 月 4 日 07:00(显示时区)发布,时长约 1 小时 55 分 19 秒。正文先把技术论证和商业含义拆开;文末附本轮下载完整音频后生成的 ASR 逐字稿。逐字稿只增加讲话人标签和每 10 分钟时间轴,不替机器转写改错。1

先认识本期讨论者

官方单集说明列出两位嘉宾和一位主播:赵成阳是 RadixArk 与 SGLang 创始成员,曾在 UCLA 读博期间参与 SGLang 核心开发,并从 Infra 角度解读过 DeepSeek-V4;曾志远是华盛顿大学计算机科学博士生,研究大语言模型,师从 Hannaneh Hajishirzi 教授和 Pang Wei Koh 助理教授;主播曼祺是《晚点 LatePost》科技报道负责人。赵成阳更靠近推理系统和开源工程,曾志远更靠近模型研究,曼祺则负责把技术争议拉回产业和投资语境。1
节目开场用一句话定下争论边界:『开源了权重,没开源产生权重的流水线』。这不是说开放权重没有价值,而是提醒听众别把「能下载参数」和「能复现全部能力」混为一谈。1

K3 的第一层冲击:参数规模大,但卖点不是大

Kimi 官方技术博客把 K3 定义为一个总参数量 2.8 万亿、开放权重、原生支持视觉、上下文窗口达到 100 万 token 的模型,并称它是首个达到 3T 级别的开放模型。官方同时承认,K3 的整体表现仍落后于最强的闭源模型;它的卖点不是已经在所有任务上击败 Claude 或 GPT,而是把开放模型推进到一个此前很难以低成本运行和研究的规模。23
这也是为什么节目没有只谈参数量。2.8T 是总参数,不等于每次生成都会把 2.8T 参数全部算一遍。K3 使用 Mixture of Experts(MoE,混合专家)结构,官方介绍的 Stable LatentMoE 有 896 个路由专家,每个 token 只激活其中 16 个。总参数决定模型能容纳多少能力,激活参数决定一次请求大致要动用多少计算;两者分开,才有可能把超大模型放进实际推理系统。2
但稀疏化不是免费午餐。专家越多,路由越容易失衡:如果大量 token 都挤向少数专家,热点专家会变成吞吐瓶颈,其余专家却闲置。K3 技术博客介绍的 Quantile Balancing,做法是直接根据路由分数的分位数分配专家,减少依赖启发式更新和手工调节的平衡超参数。节目把这个细节当作 K3 真正难的地方之一:大模型的竞争不只发生在模型结构图上,还发生在训练时每张卡、每个专家和每条通信链路能否同时工作。12

KDA 加 MLA:线性注意力不是把 Transformer 一刀切掉

节目花了很长时间解释 KDA,因为它同时对应两个缩写:Kimi Delta Attention,以及用于编写和优化 GPU Kernel 的 Kernel Development Agent。前者是模型架构,后者是工程智能体。把两个 KDA 分开,才能理解节目为什么一边谈注意力,一边谈自动写 Kernel。
传统全注意力在处理长序列时,需要让当前 token 访问越来越长的历史,并保存大量 Key-Value Cache。KDA 采取线性注意力的路径:用固定大小的递归状态、门控和衰减压缩历史信息,避免缓存随上下文长度线性膨胀。它的代价是,压缩过的状态可能丢掉某些需要精确回看的细节;全注意力则保留更直接的全局访问能力,但计算和显存压力更大。
K3 的思路不是二选一,而是混合注意力。节目说明里给出的结构是 3 层 KDA 配 1 层 MLA;MLA 即 Multi-head Latent Attention,通过低秩表示压缩 Key-Value Cache,用少量全局访问层补足线性状态的遗忘风险。1
Kimi 团队早先发布的 Kimi Linear 论文把这条路线说得更清楚:KDA 是带有更细粒度门控的线性注意力模块,和 MLA 按层混合;在论文的实验设置中,Kimi Linear 将 KV Cache 使用量最多降低 75%,并在 100 万上下文下取得最高 6 倍的解码吞吐。这个数字属于 Kimi Linear 论文的实验,不应直接写成 K3 在所有场景下的速度承诺;节目讨论 K3 时则把类似的架构取舍放进了更大的训练、推理和部署问题里。4
这个结构的意义可以用一个工程问题来理解:长上下文不是把窗口做大就结束了,系统还要承担读取、缓存、路由和生成的成本。KDA 负责以较小的固定状态沿着序列推进,MLA 负责在需要时保留更直接的全局信息;两者组合,目标是让模型在长任务里少花一些缓存和访存代价,同时不要完全失去回看远处细节的能力。节目嘉宾把它比作「忒修斯之船」:模块被一点点替换,名字仍叫 Transformer,但里面承担信息流动的零件已经变了。

Attention Residuals:模型深度方向也有信息瓶颈

注意力处理的是序列方向,K3 还引入 Attention Residuals(AttnRes)处理深度方向的信息流。传统残差连接往往把各层表示按固定方式累积,深层模型可能因此带着太多中间信息一起往前走。AttnRes 让当前层选择性读取较浅层的表示,而不是把所有层的历史平均混在一起。Kimi 官方把它和 KDA 并列为 K3 的两项架构更新:一项改变信息如何跨越上下文长度,另一项改变信息如何跨越模型深度。2
这类改动的价值不在一个漂亮的结构名,而在它们能否带来可测的训练效率。Kimi 官方博客称,KDA、AttnRes、稀疏 MoE 以及训练和数据配方的改进,让 K3 相比 Kimi K2 获得约 2.5 倍的整体 scaling efficiency。这里的 scaling efficiency 是官方对计算投入转化为模型能力效率的表述,具体比较依赖其内部训练和评测设置;它不是一个脱离实验条件的通用倍数。2

训练方法:真正难的是把大模型训练得稳定

节目继续往训练侧走,讲了三个容易被发布会标题掩盖的细节。
第一是 Per-Head Muon。Muon 是一种对参数更新方向做近似正交化的优化器;K3 把它细化到不同注意力头分别优化。注意力头承担的模式并不完全相同,统一使用同一套更新尺度,可能会让某些头更新过猛、另一些头学得太慢。按 head 拆开后,优化器多了一层适配能力,但训练系统也要承担更多实现和调参复杂度。Kimi 官方把 Per-Head Muon 描述为面向大规模训练的稳定性改进,节目则追问:如果优化器本身也能由 AI 搜索和改写,研究员的工作边界会不会继续后移。12
第二是 MOPD,即 Multi-Teacher On-Policy Distillation。知识蒸馏通常是让一个学生模型从教师模型那里学习;K3 的做法是先让不同领域的教师分别训练,再把它们的能力汇入一个统一学生。On-policy 指学生先自己生成轨迹,教师针对学生当前走出来的路径提供监督;Off-policy 则是学生学习教师预先生成的数据。前者更贴近学生当前策略,后者更容易批量生成,但更容易出现数据分布错位。
第三是 QAT,即 Quantization-Aware Training。量化是把模型权重或激活从高精度数字格式压到更低精度,以减少显存和计算成本;QAT 在训练时就模拟这种低精度误差,让模型提前适应未来的推理硬件。K3 官方说明从 SFT 阶段开始使用量化感知训练,并采用 MXFP4 权重与 MXFP8 激活,目标是让超大稀疏模型更容易在不同硬件上部署。2
这三个技术点连在一起,指向同一件事:K3 的可用性不是只由预训练参数决定。优化器影响能否稳定学出来,蒸馏影响能力如何合并,量化训练影响最后能否以合理的显存和吞吐运行。模型规模越大,训练和部署中的工程约束越接近模型本身的核心能力。

K3 为什么让人感觉像一个能交付工作的 Agent

节目里对 K3 的使用体感,重点不在一次问答答得多漂亮,而在长程任务能不能持续往下做。长程任务是指需要多步规划、工具调用、检查结果和反复修改的工作,例如读一个大代码仓库、编写并运行程序、根据截图调整前端,或者在研究资料和可执行代码之间来回切换。
Kimi 官方博客展示了几类案例:K3 在沙箱里进行 GPU Kernel 优化,尝试从零构建 MiniTriton 编译器;在 48 小时的自主运行中设计和验证一个面向自身架构的芯片;在计算天体物理任务中交叉阅读 20 多篇论文、实现数值流程、评估 300 多个状态方程,并生成 3000 多行 Python 代码和交互式网页。官方还展示了 42 年 AI ASIC 行业研究、引力波事件分析和视频剪辑案例。它们说明的是模型具备把检索、代码、工具和视觉反馈串起来的能力,但这些仍是模型提供方选取的案例,不等同于所有用户场景都能复现同样结果。2
官方博客列出的限制同样值得和宣传案例放在一起看:K3 对 thinking history 很敏感,如果 Agent Harness 没有把历史思考内容完整传回,或者中途从别的模型切换到 K3,生成质量可能明显不稳定;它在长程任务训练下可能过度主动,在意图含糊时替用户做出未经授权的决定;整体用户体验仍与最强闭源模型存在差距。模型越能主动做事,误操作的代价也越高,Harness 就不再只是一个外壳,而是权限、上下文、工具和审计的组合。2
节目里反复出现的 Harness,可以理解为 Agent 的工作台:它把系统提示词、工具、上下文、Skills、Memory、沙箱和奖励机制组织在一起。相同模型放进不同 Harness,可能得到完全不同的结果。也因此,K3 的能力不是模型权重单独决定的,推理服务、前缀缓存、Kernel、工具权限和任务验证都会改变最终体验。
Kimi K3 官方博客中的编码基准横向对比图
图中蓝色条为 Kimi K3,比较的是 Kimi 官方博客列出的多个编码基准;官方同时注明部分 Claude Fable 5 结果可能触发 fallback,不能把这张图当成独立、统一条件下的最终排名。2

为什么「便宜」不能只看 API 单价

K3 让开源模型获得关注,一个直观原因是它的 API 价格和开放权重都很有吸引力。Kimi 官方博客列出的 API 价格是:缓存命中输入每百万 token 0.30 美元,缓存未命中输入每百万 token 3 美元,输出每百万 token 15 美元;官方称 Coding 工作负载的缓存命中率超过 90%。这些数字是官方定价和官方口径,不能直接推导出所有任务的实际成本。2
节目嘉宾把讨论从单价拉回总成本:一个模型是否便宜,取决于它完成同一项工作要生成多少 token、失败多少次、需要多少人工回滚、上下文能否缓存、推理服务是否能把 GPU 吃满,以及用户是否需要额外搭建工具和权限系统。如果 K3 的单 token 价格低,却在长任务里反复犯错,最终成本可能高于一个价格更高但一次交付成功的闭源模型;反过来,如果模型能够完成更多步骤,开放权重又允许企业在自己的硬件和数据上部署,账面单价就不是全部。
KDA 也给 Serving Stack 带来新问题。传统 Prefix Cache 可以复用相同提示词前缀的中间结果,但线性注意力的递归状态不是简单的全注意力 KV Cache。Kimi 官方提到为 KDA 提交了对应的 vLLM 实现,并建议在 64 个或更多加速器组成的超节点上部署 K3;这说明推理系统必须跟着模型结构一起改,不能只把权重下载下来就期待现有服务框架自动获得同样吞吐。2
节目还讨论了投机采样(Speculative Decoding):小模型先猜一批 token,大模型集中验证,猜对的部分可以减少等待;在 KDA 结构下,回退机制和状态恢复会有新的工程细节。Flash KDA 则是面向 KDA 的高性能 Kernel 实现,通过重叠 chunk 内计算和 chunk 间状态传输,减少计算空转。这里的关键不是术语数量,而是推理速度取决于模型结构、Kernel、缓存和硬件协同,单看参数量或输入输出单价都不够。

开放权重打开了什么,又没有打开什么

这期节目最值得保留的争论,是「开源模型」这个词本身。严格来说,开放权重通常意味着模型参数可以被下载、运行、微调或二次部署;它不必然包括完整训练数据、数据清洗规则、训练代码、实验记录、奖励模型、评测环境和推理服务。开放权重降低了使用和研究门槛,却不自动带来从零复现。
K3 官方宣布完整模型权重在 2026 年 7 月 27 日发布,并把架构、训练、评测和部署信息分别放在技术博客与技术报告中。官方释放了大量技术细节,但节目嘉宾仍然强调,产生这些能力的训练流水线、数据配方、算力组织、后训练环境和验证工具没有随权重一起完整公开。23
这就解释了为什么「开放」可能同时带来两种相反效果。一方面,研究者、创业者和企业可以直接运行模型,不必等待一家闭源厂商批准接口;社区可以优化 Kernel、适配硬件、改造 Agent Harness,模型能力也更容易进入本地和私有数据场景。另一方面,真正难复制的部分可能从权重转移到三处:第一是长期任务的训练环境和验证器,第二是让稀疏专家和新注意力稳定运行的算力与推理系统,第三是持续收集失败样本、更新模型和评估改进的反馈循环。
节目里把这件事说得很尖锐:权重一旦开放,就很难收回;但如果用户只拿到一个不能稳定工作的参数文件,开放本身也无法替代产品。K3 与 Kimi Linear 的技术路线显示,开放社区可以继续研究 KDA、vLLM 和模型部署;而能否把它变成可靠的产品,还要看谁拥有数据、环境、硬件和持续迭代的能力。4

「冲击 Anthropic 估值」到底是什么意思

标题里的估值判断,不能理解成一条已经发生的资本市场结论。节目真正讨论的是:如果一个开放模型在 Coding、研究和知识工作中达到足够强的水平,同时推理成本更低、部署自由度更高,那么 Anthropic 这类闭源模型公司的稀缺性和定价空间会不会被重新估计。
这条逻辑至少要经过三步。第一,K3 要在真实长程任务里稳定交付,而不是只在模型提供方选择的 benchmark 上好看。第二,企业要愿意为私有部署、数据隔离、可控权限和工作结果付费,而不是只追求最强模型名气。第三,开放模型的生态要能把 Kernel、硬件、工具和评测接起来,让使用者不必自己承担所有部署复杂度。任何一步没有成立,开放权重对闭源估值的压力都可能停留在预期层面。
K3 目前更像一次压力测试,而不是终局证明。它证明的是,开放模型可以在参数规模、混合注意力、Agent 长程能力和推理效率上同时向前推进;它没有证明开放模型已经在所有产品场景取代闭源模型。官方自己也列出了过度主动、上下文兼容和整体体验差距等限制。2

读完这期,应该观察什么

节目提供的判断标准,比「谁是第一」更实用:
  1. 任务是否完成:模型能否读取资料、调用工具、修改文件、检查结果并交付,而不是只生成一段看起来正确的回答。
  2. 总成本是否下降:比较同一任务的 token、等待时间、失败重跑、人工检查和部署成本,而不是只看 API 单价。
  3. 开放的边界在哪里:确认拿到的是权重、代码、数据、训练配方、评测环境,还是只拿到其中一部分。
  4. 模型之外谁在积累:观察推理 Kernel、Serving Stack、Agent Harness、权限体系和失败反馈是否形成新的壁垒。
  5. 能力能否持续更新:如果模型只能靠一次发布维持热度,而没有持续学习、评测和自我改进的闭环,领先可能很短。
对研究者和工程师,这期适合用来建立 K3 的技术地图;对创业者和投资人,它更像一张成本结构和护城河的检查表。想得到一个简单的胜负答案的人,可能会失望,因为节目刻意把「开源超过闭源」留成待验证的问题。

值不值得完整收听

值得听的人:关注 Kimi、DeepSeek、开源大模型和 AI Infra 的工程师;需要判断线性注意力、MoE、蒸馏和量化是否会影响产品成本的技术负责人;以及想理解为什么模型竞争正在从 benchmark 转向 Agent 工作环境的产品经理、创业者和投资人。
需要保留判断的人:想从这一期直接得到 K3 与 Claude、GPT 的统一排名,或者把标题里的 Anthropic 估值理解成明确的投资结论。官方 benchmark 存在自测条件、Harness 差异和对手 fallback 等限制;节目嘉宾的使用体验和产业判断有信息价值,但不等同于独立审计。
如果你只听一段,建议从 05:13 的使用体感和 11:15 的开放、安全与估值争论开始;要理解 KDA、MLA、AttnRes 和推理系统,则应从 39:36 的架构部分一路听到 01:39:47 的 Flash KDA 与 QAT。完整音频在本期官方音频

附录:完整中文逐字稿

以下文字来自本轮下载的完整官方音频,覆盖全长约 1 小时 55 分 19 秒。ASR 开启了说话人分离;录音中三位参与者分别有明确的自我介绍,因此将声纹标签映射为赵成阳、曾志远和曼琪。逐字稿只增加讲话人标签和每 10 分钟时间轴,不替机器转写改错。机器转写中的错字、断词、重复、口语、中英混杂和专有名词误识别均保留。时间轴每 10 分钟标注一次;同一讲话人的连续片段合并为段落,未按句子密集切分。

00:00:00–00:10:00

曾志远(ASR SPEAKER_01)
我接触到的像美国 F ront ier Lab 的一些普通打工人里面确实有 部分人会认为开权重模型能力上涨对于 F ront ier Lab 的估值是 有很潜在的影响的就比如说未来很多公司他们可能不愿意去把自己的数据发给 A st ropic 或者 Open AI 这样的第三方
赵成阳(ASR SPEAKER_02)
比较好玩的是我觉得吧这个世界上是不存在老老实实做 trans form er 这回事的比如 K3 的注意力是线性注意力 KDA 加上全机注意力 MIA 的混合然后 残差被改成了深度方向上的一次 att ention 而 FFN 则是压缩空间里 面的稀疏专家甚至连位置编码都几乎是被删掉了这几年的开源模型几乎把每一种 可能的部件组合都尝试过我可以称其为某种意义上的 T es os 之船 T es os 之船的船板换过了甲板换过了龙骨甚至都换过了但是这艘船的船名就是没有 变 Att ention 机制就是我认为我们的 AI 研究领域的 T es os 之船
曾志远(ASR SPEAKER_01)
我觉得这次 K3 带给我以及包括很多人的启发可能就是我们其实并不需要把 F ull T ension 和 L ine ar T ension 去理解成一个二选一 的这么一个关系吧就 Hy brid Architecture 确实是一个很有 前景的方向
赵成阳(ASR SPEAKER_02)
全重是一次训练的产物但是环境是能够反复复用并且产生出下一代全重的流水线 我们得到了 K3 的全重但是全世界仍旧没有得到怎么造出下一代智能模型的这条 流水线
曼琪(ASR SPEAKER_00)
欢迎收听晚点聊我是曼琪本期是技术解读系列的新一期会放在模型利于美这个合 集之中我邀请了 Red ux Ar c 创始成员赵成阳和华盛顿大学的博士生 曾志远分别从 inf ra 与算法两条线拆解 K3 他真的比肩 F able 5 吗 3T 开放权重混合注意力和智能体训练 环境意味着什么开源模型真正开放了什么 又保留了什么进入具体的技术报告解读前我们也聊了 K3 如今在美国 AI 界和更 广泛的投资市场所引起的巨大关注以及与 K3 直接相关的开源大评论下面我们正 式进入节目吧今天晚点聊邀请了两位嘉宾我们一起来聊一聊 K3 因为在 7 月 27 号 K3 刚刚是分享了 47 页的详细的技术报告两位嘉宾一位是陈阳是晚点聊的老 朋友在 163 期和 De ep Se ek V4 的解读中是担任过嘉宾他是 S GL ang 开源框架社区的核心贡献者也是基于 SGL ang 成立的创业公 司 Red ix Arc 的创始成员陈阳会主要从 In fer 的角度来分享陈 阳你可以和我们的听友简单打个招呼再介绍一下
赵成阳(ASR SPEAKER_02)
我是赵成阳非常感谢晚点的邀请可以来跟大家分享一些 K3 上 N in fa 的 细节我目前就职于一家叫做 Red d ix Ar c 的人工智能基建公司我们 以管纪的公司戏称为基数方舟其中基数一词或者说 Red d ix 一词其实比 较生僻,但是呢,这个词它源自于目前大语言模型推理领域的一个关键技术, 叫做 Red XT ree。 这也是我们公司维护的核心项目,SGLAN 的起点。 我在接下来的播客当中也会分享到一些和潜坠缓存有关的内容。 我们也可以见到 K3 相比于之前的模型,类似于 De ep S ig V4, 它会在潜坠缓存上面有一些有趣的变化。 在加入 Red S ug 之前,我本科就读于清华大学计算机系, 然后博士毅业于加州大学洛杉矶分校。 之前我也参加过腕点组织的技术播客, 然后上次是分享我们开源团队在 De ep S ig V4 模型上的推理加速 和强化学习两部分。 这一次,如我所预见,K3 再次作为中国的顶尖模型引爆了整个硅谷。 在海内湾引发了巨大的反响所以这次还是我从我个人的角度希望给大家做一些工 程上的分析也会分享一下许多 K imi 团队我们公司 AMD 还有 App ro ach AI 等等开源团队一同打造的一些有趣的技术好的
曼琪(ASR SPEAKER_00)
好的还有一位新的嘉宾新朋友曾志远他现在正在华盛顿大学读博士二年级之前本 科期间也是在清华志远会主要从算法的角度来分享来一起解读 K3 志远你可以和 我们的听友也简单介绍一下自己
曾志远(ASR SPEAKER_01)
OK,哈喽,大家好,我是曾志远,本科就读于清华大学计算机系其实很巧合, 我和今天的另外一位嘉宾陈阳是本科同系, 而且也是同届的同学我现在在 Un iversity of Washington, 华盛顿大学读二年级的 CSPHD 我自己一直主要在学术界做一些语言模型的后 训练和评测相关的研究工作这其实也是我第一次作为嘉宾参加播客很荣幸可以在 晚点播客分享我对于 KM1K3 这么一个如此出色经验的国产模型的一些理解和 想法
曼琪(ASR SPEAKER_00)
正式具体聊 K3 的一些技术细节之前我们 可以先来照一聊一些相对宏观的问题这样 大家也好接入一些两位可以先讲讲自己使用 K3 的一些情况有什么有意思的地方 可以分享吗你们自己使用的感受是怎样
曾志远(ASR SPEAKER_01)
其实我自己个人一直可以用可以报销的这个 Cloud Code 所以不太在乎 成本但是当然 case 被发布之后呢我听了身边很多人的评价感觉确实就是说好 评如潮所以我自己也试用了一下简单跑一些 case 我个人的感觉在大部分场景 下和 Cloud 的 O per a 4.8 的体感相当甚至可以说是更好尤其是 去做长程任务的效果说白了就是我们让模型它在一个 ag ent 的框架下去长 时间持续运行去完成一个特别复杂任务不跑偏然后最后比如说给我们用户能够交 付一个满意的相对来说比较满意的结果的 能力我体感说可以说是做得相当不错如果 非要说有什么美中不足的地方的话我觉得就一方面可能是确实有些慢吧就是比如 说他在做一些相对小一点然后我自己可能会期待更及时反馈的任务的时候可能对 集资性质就不太友好但是当然了考虑到 KB 现在有限的计算资源这也可以理解另 一点呢我其实注意到在 K3 的 tech report 里面其实自己也提到了就是 在去做我刚说的那一类长程任务的时候因为任务比较复杂我一开始的 prom pt 呢他可能就没办法去做到密面居道因为 任务太复杂了我自己开始也想不清楚每一个 细节那其实可能在一些我没有想清楚的 地方呢就 K3 会去替我做一些决定但这时候 可能更理想的方式就是说是和我做一些探讨毕竟替我自己做的决定它可能不是最 理想的对我主要有这么一些感受
曼琪(ASR SPEAKER_00)
那陈阳你使用的感受是什么你觉得好用的地方和你觉得想提升的地方是什么
赵成阳(ASR SPEAKER_02)
我有一个比较有趣的角度这是 K3 发布的时候我朋友圈里面有很多 K imi 团 队的朋友分享一个非常神奇的网站叫做 K399 里面是很多用 K3 生成的小游戏 集合这个非常有小的时候的这个味道我和志 源都是 00 后嘛基本上在我们小学的时候 国内有两个非常主要的小游戏平台甚至还是用的 Fl ash 叫做 4399 和 7 K7K 然后 Fl ash 已经停运很长一段时间了然后到了今年我们看到 K imi 团队用 K3 来复刻这样一个小游戏平台然后甚至许多童年小游戏的优化包括体验 其实比起小的时候流畅非常非常多我觉得这个是让我觉得很别处心裁的一件事情 我们自己团队也用 K3 模型做了一款小游戏就类似于 Go ogle Chrome 在你网络没有连接的情况下会有一个小火龙跳仙人掌的那个游戏但是这个小游戏 的主角是我们团队的 S-L and Girl 然后最终的终点就是达到了 423 Tok ens 每秒大概代表就是说就是 我们团队在那一刻的一个优化的终点当然 可能到了现在以及这个播客被听众朋友们听到的时候这个性能会有更大的 bo ost ing
曼琪(ASR SPEAKER_00)
对你们那个 SGL ang girl 挺可爱的我上次去不是拿了个冰箱贴吗我 现在还贴在家里了非常欢迎你 参 加更多活动大家普遍的一个反馈就是 K3 的前端能力特别好其实你刚才提到那个 K399 这个小游戏的网站附现小游戏我觉得也跟他这个能力有关 K imi 在 F ront ier Code Arena 上是一度拿到了第一超过了当时 的第一 F able 5 的你可以讲讲就他在某项能力上有特长这种前沿模型之 间的差异他一般是什么原因造成的是数据吗还是什么
曾志远(ASR SPEAKER_01)
我觉得最直接的答案它确实是数据我们可以回到就是说模型构建的过程的一些流 程来看就是说现在我们模型训练的团队一般来说它都会针对不同的细分垂直领域 或者说细分的垂类领域先建立或者说补齐一些相应的 e valuation 就是 去评测然后再围绕这些 e valuation 在 pret ra ining me et ra ining SFT 以及包括强化学习就是 REL 等不同阶 段去针对性的去补齐训练数据和任务所以一般来说我们会觉得一个模型最后在某 个非常特定的垂内方向特别突出很大程度上有个很重要原因就是它在这个方向的 评测和数据做得非常的好其实如果我们去读它公开发布的这个 Tech Report 的话其实里面也可以找到非常多的痕迹就比如说他们在 E valuation 上专门做了这个 KB Web Dev 的 Ben ch 对他就是专门针对这一类 相关问题做的评测然后他们还提到在 Pre-tra ining 阶段他大幅扩 充了代码和渲染结果去相配对的这么一个多模态的数据然后 post-tra ining 阶段又专门加入了这种 we b development 的这种任务还有一点 就是 K3 它其实是原生动模态的所以它可以在训练的过程中尤其是在草画学习的

00:10:00–00:20:00

曾志远(ASR SPEAKER_01)
过程里面可以去直接提升这样一种比如说我们先写代码然后写完代码之后我们看 它前端渲染出来的这个 screen 效果 怎么样然后再去改代码这样的一个 loop 的这样一个能力其实 Tech Rep ort 里面对这个能力也提到了就是说 它的描述叫做 W ish the loop 也就是说让模型在代码和这种视觉 散会之间去持续解答
曼琪(ASR SPEAKER_00)
除了你们自己的一些体感你们和周围的人交流大家还有什么对 K3 有意思的评价
曾志远(ASR SPEAKER_01)
吗 我其实觉得他们我周围很多就是说做大模型算法的朋友他其实会关注很多就是发 布之后 tech report 里面的细节尤其是各种 reci pe 的细节其实 我觉得有很多人都感觉就是说一个最近去这些发布的 techn ical report 的趋势在 K3 的 re port 里面其实也有所体现就是说现在这些 re port 它对于像 arch itect ure pre-tra ining 的细节 描述的越来越多越来越清晰但是对 pos itive training 部分 的细节就给的越来越少了这其实也说明就是像架构和 sk illing pre -tra ining 本身的重要性可以说是丝毫没有下降甚至说是越来越重要 的
曼琪(ASR SPEAKER_00)
post-tra ining 的细节变 少了是因为大家本身就做少了还是说这个 领域大家觉得不想分享太多
曾志远(ASR SPEAKER_01)
我其实也不知道是为什么
曼琪(ASR SPEAKER_00)
这一次 K3 发布的声势很大也引起了资本市场的变动包括美国现在也开始了开源 的大辩论我可以先讲一下这个事大概是 7 月 24 号的时候有 50 多家公司联名签 署了一封公开信开放权重就是开源的大冒险的意思吧与美国的 AI 领导力然后陈 阳所在的公司 Red d ix Arc 也签名了这 50 多个公司里还有英伟达 微软等等包括黄仁勋他是专门去注册了推特去转发了这个公开信 Open AI 和 XCI 也都是支持的但是没有签名然后亚马逊和 A ns wer P ick 是没有在这个事情上发生的但后来 A ns wer P ick 应该就是这一 种吧他们写了一个文章 D ar ry l 自己写的 On Open With Mod els 是说他们不反对开源模型但是他们认为某些国家中国的开源模型 还是要被限制一下然后他还专门提到了就大规模针流的这个事情我觉得可以先讲 到就是为什么就这次 K3 它带来的至少我 觉得在 AI 圈上它的这个震动也是很大的 甚至让部分人是会感到比较惶恐的
赵成阳(ASR SPEAKER_02)
我觉得用恐慌这个词形容这次 K3 在国内外引发的讨论是比较合理的 K3 这个模 型的的确确让我在海内外都见到了巨大的讨论乃至争执这段时间我刷到过非常多 的论战而且这些论战有的是在讨论开源与否但我觉得许多研究者真正在乎的其实 是安全是开源更安全还是闭源更安全我给举一个具体的例子前几天 Open AI 的新模型在评测当中发生了很严重的越狱事件不严谨的来说它直接尝试攻击了 H ug ging Face 的服务器来直接获得评测问题的答案称得上是为考试 作弊而不择手段的偷盗试卷那说明即便我们试图让模型在追求目标的时候保持公 正和正义其实模型也会主动去寻找一些规则的漏洞甚至是通过破坏服务器这样的 手段来实现反过来我这几天也去读过 A throp ic 他们那篇观点的原文 总体来说他们的主张是足够强大的模型不管开源还是闭源只要提供给公众就应该 经过更严格的安全审查我自己觉得他们担心的事情其实非常争气某种程度上来说 这已经是一个非常恐怖的现象了我可以举一个比方现在这些强大的语言模型某种 程度上是强大的武器如果它被人恶意利用会有着非常恐怖的破坏力今天即便我们 主观上引导一个模型形成一个正直向上的世界观模型都有可能违背人类的意愿去 攻击 H ug ging Face 的服务器那么真的遇到了这些别有居心的不 法分子他们可能会想办法绕开模型的安全防控真正的去利用模型去挖漏洞去攻击 我们的网络系统所以人类而言是一种巨大的风险我们是否要将这些最强大的模型 所具有的人力永远掌握在少数人手中还是说因为已经有了大量的尖端武器流通了 我们务必要向全人类共享更多的武器很遗憾我不清楚这个问题有没有答案但是我 迫切地认为就是需要全社会共同讨论的治理问题甚至需要于某种程度上类似合不 扩散条约一样的国际治理框架其实你们公司是支持开源模型的对吗我认为大多数 的人是倾向于我们还是要在有限度管理的情况下持续分享这些领先的前沿的智能 水平的模型但是我自己的话私人上我不是很赞同要把所有的事情都开放出去
曼琪(ASR SPEAKER_00)
OK 然后我们给大家可以看看就是它这一次为什么会引起一些这种比较多的关注 和开源讨论其实我本质还是因为它让人看到开源其实更加逼近避源了然后有一种 解读就是这会大幅冲击 F ront ier Life 也就是 Open AI 和 An throp ic 现在的估值你们在硅谷在美国你们有感受到这种讨论
曾志远(ASR SPEAKER_01)
吗 对就比如说我自己的话我接触到的像美国 front ier lab 的一些普 通打工人里面确实有部分人会认为开权重模型能力上涨对于 front ier lab 的估值是有很潜在的影响的就比如 说一个可能考量点是在未来很多公司他们 要用模型比如说用 c oding agent 但是他们可能不愿意去把自己的 数据发给 A z ure P ick 或者 Open AI 这样的第三方这时候 如果有一个很强的开权重模型它本身或者稍微经过一些针对他们公司自己场景的 翻托令它能力上就能达到这些公司的需求 同时这些公司又有部署开权重模型的这么 一个条件不需要把数据发给第三方而是可以直接发给他们自己部署好的模型那么 他们确实可能会转向用开权重模型这一点就有可能会去冲击必权重模型的营收
曼琪(ASR SPEAKER_00)
嗯其实这个现在已经看到一些趋势了我们二级组的季报里也讨论这个问题就比如 说在美国像 Fire works 这样的公司他就会给一些企业客户去部署开源 模型就给企业自己用的甚至在计算资源上就美国有些大客户他也会倾向于说这个 东西不是布在云上而是我可能会自建一些算力因为在有些场景上他其实自建算力 就成本的测算是更划算的除了说对 F ront ier Lab 的冲击之外另 一种解读就是 K3 这一类开源的它因为还是一个 Trans form er 的 模型它也会去冲击 Ne ol ab 那 Ne ol ab 的核心的这个机会点其实 在于说你去探索现在主流方向之外的一些新的方向看能不能找到通向 EGI 的更 好的方法你觉得 K3 这个效果会动摇一些 人的这种观念吗是不是你老老实实做一个 trans form er 的模型其实上升空间还挺大比较好玩的是我觉得吧 这个世界上是不
赵成阳(ASR SPEAKER_02)
存在老老实实做 trans form er 这回事的比如我们这次看 K3K3 的注意力是线性注意力 KDA 加上全级注意力 MIA 的混合然后残差被改成了深 度方向上的一次 att ention 而 FFN 则是压缩空间里面的西数专家甚 至连位置编码都几乎是被删掉了这些设计 可以说完全不是 2017 年的原装 Trans form er 的零件与其说是 Trans form er 还有空间不如说 Att ention 机制是某种接口它只是规定了我们用一个个可微的模块来反复混合 序列上的信息作为我们拿什么算子混合残差如何连接 FFN 的形状是什么这些部 件的可组合性远比我们想象的好而且这几年的开源模型几乎把每一种可能部件组 合都尝试过我可以称其为某种意义上的 T es os 之船 T es os 之船 的船板换过了甲板换过了龙骨甚至都换过了但是这艘船的船名就是没有变 Att ention 机制就是我认为我们的 AI 研究领域的 T es os 之船至于 Att ention 还有多少寿命以及现在这些 新架构会对研究产生什么样的影响我觉得 是可好可坏的坏消息是有的研究者可能会有一种愿景比如说用其他的架构来推导 重来整个 Trans form er 的故事我觉得这个愿景可能很难说得通但是 另一个角度来说优秀的组件是图登陆推车 丝之船的速度前所未有的快比如说 KDA 它从 K imi Line ar 这篇论文到 2.8G 的主流模型只用了不到一 年的时间所以如果你的天才之举是对的那么你不需要等待一个新的范式就会有人 来收留它
曼琪(ASR SPEAKER_00)
现在也有一个比较多的讨论就是说最近像 F able 5 像 O bs 5 像 K 3 这些进展它给外界传递的一个信号是好像到了一个模型可以自己就变得更好的 这种临界点你这个模型去争一个更好的模型或者说你自己争自己学到一些高质量 的数据你就可以让模型变得更好然后有的人会觉得在 O bs 4.8 前后就过 了这个临界点
曾志远(ASR SPEAKER_01)
我个人理解这个问题呢它并不是说我们有一个非常神奇的临界点然后模型能力突 然就跨过了这个临界点而是我觉得其实 现在整个模型的开发流程它已经进入了一个 正反馈的阶段就是比如说模型可以自己生产数据或者说更严格更广义的说是参与 生产数据然后再让下一代的模型变得更好具体来说其实在一个模型训练的一个团 队里面我们要去构建高数量数据本来就会涉及到各种五花八门的这么一个工作流 就比如说随着模型的变强这里面很多越来越多的具体工作就可以交给 ag ent 尤其是 c oding agent 就 比如说像我们去做一些检索然后去合成一些 训练任务这么一整套 p ip eline 然后再比如说我们去生成一些数据样 本然后再去筛选一些数据样本这样的一个 p ip eline 或者再比如说我们 去搭强化学习的环境然后再比如说我们去跑一些评测再比如说我们去分析一些失

00:20:00–00:30:00

曾志远(ASR SPEAKER_01)
败的 case 这些等等那这个变化我觉得它不是从零突然跳到一的而是我们模型 团队交给 ag ent 做的比例随着模型能力的提升是不断提高的就不严谨的说 可能一开始是 50%后来是 70%90%95%这样当然这些数字是我随便说的 还有一点就是一些 p ip eline 它可能一开始需要人类去逐步拆分然后 它慢慢随着模型能力的提升就基本可以完整的交给模型来做人类介入的力度也会 越来越粗从定义每一步怎么做逐渐变成我们可能只需要去定义一些更上层更整体 的目标然后去定义一些约束然后我们自己有一些验收的方案验收的标准之类的尤 其是比如说你想象我们现在假如说我们就是 A z ure Peak 我们就是 Open AI 那我们内部的这些研究者我们也是要用我们可以有的世界上最强 的模型当然对我们来说是必权重的对他们 来说他们是可以接触到的来完成他们自己 的工作流所以自然而然这样的一个 loop 它就变化程度会不断提高对
赵成阳(ASR SPEAKER_02)
天涯有什么补充吗就是 K3 的 tech report 里面写过一个点就是 K3 早期 ser ving 用的 k ern el 甚至可以拿 check point 直接去
曼琪(ASR SPEAKER_00)
写早期 check point 就是说它没有完整训完的那个模型就模型训到中 间的那个版本就已经能做这个事了对吧
赵成阳(ASR SPEAKER_02)
是的而且它早期的 check point 就做 k ern el 开发也会让后 面的 check point 训得更快 这个事情是非常非常有意思的我们在 inf ra 领域把这个东西叫做 KDA 不是 KDA 同时叫做 K ey M ate Delta Attention 但我们的 KDA 叫做 K ern el Development Ag ents K3 的 Tech Report 里面他们着重讲了是怎么让 K 3 去做 K ern el 优化的任务当中 的他们甚至有提到过他们的环境设置首先 设置的任务包括有单算子优化还有巨型算子的融合包括有 CUDA, Tr it on,Thunder Kitchen, T ylon 这些流派也覆盖有 BF16, FP8 和 FP4 然后他们设计 re ward 的时候有两层我觉得这个设计非常 非常科学第一个就是每一个 k ern el 他们会提供一个 P y T or ch 的 V en ena 版本这个版本一方面作为性能的底线另一方面也作为正 确性的基准如果 KDA 优化出来的 k ern el 数值已经超出了误差的一定 程度会直接被打零分然后接下来他们会找一些专家去写一些高性能的 k ern el 然后会做这个 k 3 模型写出来的 k ern el 和专家实现的 k ern el 之间的分数对比如果 k imi k 3 写出的这个 k ern el 它越 接近于硬件的物理上限那么它的 re ward 就会越来越高而且他们也做了一些 作弊检测比如去惩罚这些恶意的 K ud ag raph 的重放也会去惩罚一些 我们称之为打表啊这种数字缓存的这些投机取巧的办法所以说 K3 其实最后做 K ern el Development 的效果非常惊艳所以最后这个 K3 报告 里面说 K imi 的早期 check point 已经在承担大量的 k ern el 优化工作这种 k ern el 上面的优化其实也是我们最近一直在尝试的 事情首先我们 S2 团队也有非常顶尖的 k ern el 工程师我自己认为他可能 是这个世界上最懂 k ern el 的那一批人了他自己非常理解 K ern el 有非常好的 K ern el 的 cont ext 然后他只需要一个很强大的 AI 来放大他对 K ern el 的理解他自己就在大规模的用 AI 来做 K ern el 的自主优化可以说某种程度上这就是 K ern el 这个领域的 RSI 不 过 K ern el 是一个非常具体的事情为了让 RA3 成立这个事情需要很多 的前提条件首先它的 re ward 要准确且便宜 K ern el 就有这个很 好的特点就是性能和正确性是很好的验证 的然后便宜的话其实你基本上硬件跑一次 就行了你其实不太需要人工成本另外的话 K ern el 也是一个作弊方式有 限的事情所以恰恰好 K ern el 满足的这个便宜可验证难以作弊的这三个 条件有了很好的这个 re ward boundary 所以说我们其实可以让 这些 K ern el development agents 在我们的这个 bound ary 下面去很好的自我 提升所以说在有验证器的领域我认为 RSI 这个 loop 已经在高速运作了这并不是 说模型开始自我进化我觉得自我进化这个 词很大但是在某一个领域能够在有限的在清晰的边界下完成不断的提升这一定是 可以实现的而且这正在发生至于整体上的 ISI 我觉得这还是一个非常久远的挑 战这也体现我的一个观点就是我觉得 RSI 缺乏的真的不是不完全是模型是 e valuation 是 hard ness 不管你怎么叫就是我自己很喜欢称为这个东西叫做 e val uate 我在读 PSD 期间我很大的一个研究兴趣就是怎么去对模型的能力做有 效评估这也是很长一段时间为什么我们看 2025 年大家都在用力的猛冲这个 math 和 c oding 对吧因为 math 和 c oding 相对而言它就是更好评估 的比如说假设晚点的新闻报道你希望让 ag ent 去写这个评估其实很主观因为 一个新闻报道的好坏是需要我觉得很有水平的记者才能够评估的很好对但是 c oding 的话至少在那个时候比如说他让他去打 le ad code 这个事情是很好评 估的但是随着我们现在 c oding 用户的逐渐演进对吧比如说以前可能去写 一个 le ad code 现在可能你想办法要给一个硕大无比的仓库去做一些 新的 fe ature 这个事情其实也很难评估的所以我觉得现在 c oding 的这个进步会
曼琪(ASR SPEAKER_00)
放缓一些就前面讲的是就是大家用 K3 一些比较好的反馈然后也可以来讲一下一些 集中的吐槽吧一个是就这次大家会注意到其实 K3 它并不是上之前头的中国模型 走极致性价比的路线的所以有的人会觉得 它比较贵这也不算一个缺点就是它是一个 特点另一方面就是前面也提到的另一个就是它目前使用体感上确实比较慢然后这 也导致有一些下游的公司,比如说应用公司, 没有很快地放到自己的这个产品里面。 这个我想请陈阳来分享一下,就这个慢是什么原因导致的? 比如说比较流行的说法是觉得他们算力比较紧张。 很遗憾,在一些模型开放
赵成阳(ASR SPEAKER_02)
的初期, 由 于这个推理或者说 ser ving stack,它的优化需要一点时间, 模型可能会陷入到一个又贵又慢的尴尬经历。 不过其实我自己体感上的话我觉得 K3 的价格和速度都是一个合理的区间甚至在 价格上我觉得称得上优秀然后对比起同期的其他模型由于架构上的突破吧我觉得 速度还没有达到一个超越其他模型的一个状态但是仍旧是一个合理而且且可优化 的范围我们可以先说一下贵这个问题在我们比较在乎的 A 站的场景下面成本有两 种衡量第一种就是说它的价格上面标的百万 t oken 的单价然后还有一个是 完成任务的总成本坦诚来说我觉得如果 我们需要用到 K3 线还是需要完成一些非常 高难度的任务这种情况下完成单个任务的总成本才是有意义的成本口径因为在长 程的任务里面不同模型对一个任务的消耗 t oken 量其实差距是非常大的远 远大于单价之间的差异可能一个单价比较 便宜的模型会绕一倍甚至十倍的弯路这样 的话肯定会让单价更便宜的模型更贵我其实有去看 K3 的 tech report 他们分享了一些比较有趣的成本结果比如说在 K ini 的 code bench 2.0 上面是他们自己内部的一套 c oding benchmark K3 会比着最强的那些模型低 4.0 分但是成本 只有对方的 38%然后 K3 在这个 high effort 的这个档 high effort 是一个思考能力的那个参数档在 这一档上他已经追平了其他的头部模型在 ma xim um effort 的 分数然后 K3 会比着还是只有大概 30%左右还有一个 bench mark 叫 做 br owser comp 然后在这个 bench mark 上面 K3 拿到 一个非常好的分数而且单个任务的成本应该也是相当低的可能还是在其他公司模 型的 30%到 50%这个区间当然这个贵肯定是对于消费者而言的然后对于自己 比如说可能有的听众他的公司比较有计算资源可能会自己去选择 SERV 这个成 本其实非常难衡量了包括我们现在见到存储也好这个电力也好还有水冷也好这些 成本其实很难纳入考量的所以仅仅是靠官方的 API 来看我认为 K3 的性价比是
曼琪(ASR SPEAKER_00)
非常好的我补充一下就是它的官方的那个定价的数字比如 K3 的话它输入每百万 t oken 缓存命中的情况是 0.3 美元未命中的情况是 3 美元然后它输出的话 是 15 美元这个其实确实比之前的中国模型是贵了很多那对比来说的话 V4 它输 入每百万 t oken 命中的情况是 0.04 就 K3 这个是 0.3 然后 V4 第二 个就是输入未命中的情况是 0.44 然后输出是 0.87 其实我知道很多应用里 面跑得最多的应该还是 V4 当然刚才陈瑶也说了就是说其实你这个东西也是要看 你不是光看那个标价的是看它做任务的那个总体的消耗
赵成阳(ASR SPEAKER_02)
可能还有个角度就是说人类对智能上线的需求是无穷大的现在的这些应用还没有 一个想象空间要用 K3 这种规模的强大模型还有一个点可以来讨论一下这个慢的 问题就我的从业经验而言模型发布后第一 时间能够提供的速度反映的应该说是这个 模型的架构有多新 S erving stack 就有多难至于这个架构有多慢 这个事情其实不本质或者说我觉得对于 K imi 或者 De ep S ig 这样 的顶尖模型团队而言他们的架构设计早就充分考虑了 S erving 和 Tra

00:30:00–00:40:00

赵成阳(ASR SPEAKER_02)
ining 的效率在后续一段时间这块的成本是一定可以通过工程的优化打下来 的我们一般在推理这个领域的话会把用户的体验分成三个指标往往称之为第一个 t oken 的延迟或者说你发送一个请求之后多快会收到第一句话的返回然后 第二个就是单个用户的 de code 速度或者说你已经开始收到模型的回复之 后它两个词中间的间隙有多大以及还有一个你的队列等待时间因为显然并不是你 一个人在使用这个模型可能在 K imi 他们的后台会同时收到成千上万的星球 这个整个队列的流通速度是怎么样的然后这三者的话成因是不完全相同的我可以 分享一下两点这个也可以解答一下我觉得 K imi 现在的算力是一个什么样的 状况我们首先讨论这个单个手 t oken 的延迟这里主要是一个前缀附用的问题 它不算是一个很严格的算力问题就像刚才曼琪也提到过现在模型的这个价格都说 前缀如果命中多少多少钱以及前缀命不中多少多少钱语言模型的推理一个非常普 遍的技术叫做前缀附用我可以举两个例子比如说 A 用户发给 K imi 今天你去 超市买香蕉吗然后 B 用户会发今天你去超市买酸奶吗这两句话其实有公共前缀的 今天你去超市买这几个字就是这两个请求的前缀然后这个前缀在现在大约模型推 理范式或者说这样的架构下是可以被附用的公共前缀不需要在每次推理过程当中 都重复计算而且在 KCR 这个报告当中其实有体现他们对这个钱坠付用的一个看 法一个典型的 c oding 场景可能会带有 40 万 t oken 的钱坠是付用 的或者说是非常非常多的用户会共用的然后真正要计算的增量部分可能每次只有 4000 个 t oken 用户提交的新 请求在前缀命中或者不命中的情况下所需要 的计算量会差出很多个数量级这也会体现在成本以及用户的返回速度上以及首 t oken 延迟这些指标上面基本来说前缀附用是决定了首 t oken 延迟最重要 的因素反而绝对的算力是次要的 OK 但是另一个角度就是为了支撑 K ey way 这个上 b illion 的夸张上下温长度 K3 选择的 hy brid 架构也让 前缀复用的难度有所提高因为传统意义上的 KV cache 它术语叫做 app end only 换句话说叫只增不减前方的前缀算完了之后就不会再变了这个 前缀是不可能会被其他请求改写的但是 K imi 采用的这个 T ension 架构我们叫做 K imi Delta T ension 或者叫 KDA 架构简 单来说这个 KDA 架构会在前缀数上注留一块为每一个 T oken 反复覆盖读 写的固定大小的缓存它不再是以往在简单的前缀数上继续往下添加举个比方来说 我们通常的这个前缀数可能是一个只往后写的笔记本然后你每次就是从后往前撕 一页给别人然后你再继续写对它其实会相对简单一些但是 K3 的这个 att ention 架构可能是一个反复擦写的白板然后你写靠前的内容其实难度是很大的 OK 这块 的话 K3 自己的这个报告里面有讲一些事情包括他们说把前缀的哈希力度还有物 理块的分配力度做一定程度的解偶然后试图让哈希只跑在 512 个 t oken 的这样一个小块上但是 KDA 的 check point 会落在哈希端点的稀疏 子集这个听上去非常的 techn ical 对然后我们团队的话其实也会借鉴 以及做一些其他的优化在 S 档上面的话我们会想办法去让这块反复被读写的状态 能够被跨越请求的安全共享举个比方比如说第一个请求再读一块前缀第二个请求 会稍微改写那个前缀那么如果这个时候有第三个请求想要去读这块将会被改写的 前缀这是有一些安全性需要考虑的你不可能在别人读的时候直接把这个改了否则 你读出来的内容是崩溃的而且最糟糕的情况可能是你不可能边写边读这样你可能 前一半是正确的后一半就是错误的这里其实会有很多技术上面的考量但是具体来 说的话我们会有些很有意思的词语比如说 cop y and write sn aps hot 还有 don ate 这些词都是来自一些操作系统上面的原语然后 这块优化就很深了然后欢迎对这个话比较感兴趣的朋友可以参考我们 S 档团队的 技术博客
曼琪(ASR SPEAKER_00)
谢谢大家最近美国的一些讨论就是否要限制开源从技术上来说开源它有可能被限 制开
赵成阳(ASR SPEAKER_02)
了之后的模型是怎么样的这绝对是不可逆的有点那些大家都三体对吧地球的坐标 一旦广播出去这是不可能收回来的你没有任何方式去销毁你已经公布出去的物理 信息开源也是一样的就是权重一旦发布 之后它就是一串可以被批量复制的文件而且 开源的情况也不单单只是下跌份权重这么简单社区可能会做非常多的镜像可能会 有些公司拿去做量化有的公司会拿去做微调微调后的衍生的版本的数量会指数级 增长所以说下架这个动作对于已经开源出去的模型根本就不成立然后另一个角度 就是政策层面的事情就是开源模型该不该得到什么限制正如我说的我对于以后开 源模型的走向是很迷茫的现在已经有了非常多大量
曼琪(ASR SPEAKER_00)
的公开强大的模型流通了你们觉得再往下 的话这个开源模型逼近闭源的时候会不会 有人强到一定程度之后走向闭源
赵成阳(ASR SPEAKER_02)
这个开源接近于闭源的一个时刻我个人 感觉这个事情其实很模糊开源接近 B 元我们 要怎么去衡量这个事情因为模型只是整个 AI 生态链的一小部分这事实上关于模 型的这个产业上有可能有数据硬件然后下游还有分发渠道还有我们说的这些推理 对吧我的一个观察是我认为模型本身在 AI 产业链上的比重在下降这次 K3 的开 源我们也看到了 K3 爽快的开发了开放的权重包括 Moon EP 还有 Fl ash KDA 还有 A gent Eve 这些基础设施也都开源了然后包括他们之前做 的 M ir ror Cl ip 也开源了但是他们的 I o 的 En viron ment 没有开源他们在报告当中提到了有一个用于自我演化的知识图谱的任务 系统这个也没有开源然后包括他们说这个 K3 其实是一个这个专家 mer ge 对吧他们这些原始的专家的这个 T rip Point 也没有开放这个开放并 不存在任何问题因为现在行业内的开源公司也很少会真的去开源比如说什么 I o E Environment 这东西可能开放出来也有很多安全风险但是我觉得 没开的这个部分是这些公司很深的护身盒而且这个护身盒一大部分来自于环境权 重是一次训练的产物但是环境是能够反复 复用并且产生出下一代权重的流水线我们 得到了 K3 的权重全世界都可以得到这代 模型的智能但是全世界仍旧没有得到怎么 造出下一代智能模型的这条流水线开放权重只是缩小了这个顶尖模型就是顶尖币 源模型开源模型之间的能力差距但是我们并不确定顶尖的开源模型和顶尖的币源 模型他们之间的接待速度会不会缩小比如说可能 K imi 假设说国内的模型可能 要六个月左右他 100 去个 point 但是 Open AI 可能他们三个月就发 了当然我其实不太确定现在国内模型的这个开放速度是什么样子的但是迭代模型 迭代的循环是需要环境需要验证和需要算力的这三样已经超出了权重然后如果这 些所有东西都达到一个完全开放的状态我觉得开源超过闭源就是必然但是很遗憾 现在不是这个样子的当然我们公司主要维护的开源推力引擎也是为开源模型服务 的我们当然希望开源模型越多越好对这是我的一些 point
曼琪(ASR SPEAKER_00)
开源是否逼近币源本身这个结论就是打问号的对开源有一个大家一直以来认为的 弊端是你的用户部署了你的模型之后比如他自己部署没有用你官方的 API 你的 数据就无法回传给自己而币源的生态里是像 Open AI 和 An throp ic 它通过 API 以及他们自己用户量非常大的应用可以获得很多真实环境真实 场景里真实用户的真实的高质量的一些 prom pt 总结而言你们心中 K3 是 一个怎样的成果
曾志远(ASR SPEAKER_01)
我个人觉得从公开发布的模型来看 K3 它作为一个首个达到这种 3T 级别的开放 权重模型我认为毫不夸张地说是一个里程碑级别的成果其实我觉得从历史发展的 角度来看这种开放权重的模型的规模从数百币级别到后来的 1T 以上到今天 3T 级别它确实是非常非常振奋人心的这么一个进展所以我自己个人是很期待看到后 面开放权重模型去接着向上 sc aling 的
曼琪(ASR SPEAKER_00)
这次 K3 发了之后我看到 K imi 的联创周星宇 te am 他在朋友圈的有一 条分享的转发语说的是 Have faith in scaling and RL sc aling 和强化学习有信念那下面我们来聊 K3 的具体的技术报 告里一些更细节的技术改进这个是 7 月 27 号刚发出来的可以先说一下 K3 在架 构上的整体思路是什么亮点是什么
曾志远(ASR SPEAKER_01)
我自己理解 K3 Architecture 就 K3 架构的整体资论就是他们会 想同时把语言模型在处理信息然后这个信息它在不同方向的流动做得更加的高效 就比如说他们在序列上他用 KDA 和 GTMLA 这样的一个 Hy brid Attention 的这么一个结构就是混合注意力的这么一个结构在大部分层里它更低成本的可以 去处理上下文同时周期性的保留这种全局的 Att ention 他们在深度上

00:40:00–00:50:00

曾志远(ASR SPEAKER_01)
的就比如说用了 Att ention Rel igious 这样的一个技术 让后面的层它可以去选择性的读取前面层的一个表示如果就让我挑一个我比较关 注的亮点的话我觉得 rope 是很有意思的一个 technique 就具体来说 呢就是 k 3 的这么一个 k 3 的这个语言模型呢他没有使用一个显示的位置编 码就是 position al encoding 就比如说至少从公开的这个 technical report 来看呢像同期的 deep s ync v 4 啊 g m 5.2 啊包括像 mini max m 3 啊这些其实后面这些模 型他们都还是保留了 partial rope 的所以这个选择我觉得是比较 spe cial 的当然了这里就是说模型他不用这个位置编码呢模型其实还是知道 t oken 的这么一个先后顺序的就具体来说呢他在这个 k da 也就是 k b d ata attention 里面呢他在做这个 recur rent state 的更 新的时候啊以及包括里面的一些 g ating 和 decay 这样的机制他本身 其实就是对于顺序是敏感的他已经去隐世的去编码了像 ass ession 和 rec ency 这样的一个信息这里 还有一点就是说需要提一下的就是我们现在 去训练一个成上下文的模型比如说这种达到 1 b illion context 的百万级成上下文模型一个常见的做法呢叫做 pro gress ive context extension 就 k 3 其实也是这么做的就是记起来说比如说我们在 pre -t rim 的时候我们先训 8 k 然后再扩到 64 k 然后在后面的阶段呢再 逐渐的扩到 256 k 然后直接达到这个 1 b illion 的这种级别然后 我们前面说的这种 n ope 就是说它不使用显示的 pos itional encoding 不使用显示的位置编码的一个直接好处就是我们在去扩展 cont ext 的时候 其实我们对于位置编码这一层它就少了 一个需要去单独处理的环节就比如说如果你 用 ro pe 的话你可能就要去 ret une 一下这个 ro pe 的 base 或者去做 ro pe interpol ation 这样的一个 techn ique N ope 这个选择它其实也不是 K3 首创的就 K min i 其实也已经采用 过了 K3 我觉得比较或者说非常 imp ressive 一点就是它把这整套的 设计它去 sk ill 到了一个 3T 的级别并且就成功支持到达这个 1 min i 的 cont est 就是百万圣下文的长圣下文
曼琪(ASR SPEAKER_00)
对 KME Line ar 是它去年下半年发的一个就参数比较小的模型我觉得 它当时就是在试一些 K3 里面可能会用到的新的技术包括 KDA 就是我们前面提 到的 KME Delta T ension 就 KME 的线性和全局混合的这种 注意力方式 K3 也用了也是在 KME Line ar 里面提出来的其实 R ope 最开始是苏建林提的这个我觉得也挺有意思的就像我们之前聊 V4 的时候其实后 来就 V4 就没有用 MLA 了嘛这个也是 De ep Se q 给业界的一个挺重要 的贡献然后苏建林也是 KIMI 的一个很 核心的研究员因为他这次就是 K3 他还是 一个 MOE 的就是这种混合专家模型那里面比较重要的一个这种东西就是路由专 家的分配这次 K3 是提了一个 Qu ant ile Bal ancing 分 位数路由均衡是他们在路由策略上的一个创新这个也想请志源来说一说就是他解 决了一个什么问题因为 K imi 自己是说他是解决了就是 MOE 这种模型在大 规模训练的时候会崩溃的一些问题你可以 讲讲为什么以前的方法比较容易崩那这个 改进它是 K3 可以迅到接近 3T 的关键之一吗
曾志远(ASR SPEAKER_01)
上面提到它可能会崩溃的这个车友超参数我其实觉得本质的问题是这个叫做专家 负载均衡或者说 ex pert load balancing 这样一个问题 据悉来说我们 MOE 这样的一个混合专家模型它里面的每个 t oken 它每次 就只会去选择一部分 r out ed experts 去激活然后我们其实希望 从成局来看各个专家他被选中的频率是大致相当的否则会有什么问题呢就是说在 模型层面一些专家他如果得不到足够的 t oken 和 T2 他在训练的时候就不 太充分就没有办法去充分发挥他这个专家的这些参数的容量而且还有一些问题是 比如说另外有一些专家他如果收到 t oken 太多了那其实对 inf ra 也 不是一件特别友好的事情针对这个问题其实最早期的一个普遍的做法是在 MOE 模型训练的这个 l oss function 里面去加一个 aux iliary 的这么一种 load balancing loss 那他的核心思想就是说我们 用一个额外的这么一个 l oss 的这个 term 我们去鼓励不同的这个专家的 选中频率更加的均匀这个方法呢整体来说还是 比较有效的但是呢就是你加这个 balance loss 你就 some how 需要在模型在训练的时候在模型质量和你负载均 衡的这个效果之间呢去做一个权衡那如果有这么一个问题的话这其实它经常可能 会是训练不稳定的这么一个罪魁祸首吧然后之前 De ep S ick 它 V3 的一个重要改进呢就是我们其实就是把上面说的这种我们去添加一个 l oss 的方式它用来去做这么一种专家的负载均衡去把这 l oss 给去掉了换成一种 b ias update 的方法据起来说呢就是我们会我们在选那个 ass ert 的时候我们其实也是用一个神经网络一个 r outer 他去打一些这个 r outing 的 sc ore 打一些这些分数之后呢然后再根据分数去选这个 ass ert 然后呢我们给这个 r outing 的这个 sc ore 呢去加一个 b ias 然后我们去在训练过程中我们去看那如果一个专家他过热我们就把 b ias 去 调低如果他过冷说白了就是接收到 t oken 太少了我们就调高这个 BIOS 它只影响去选专家适合机制所以我们就不需要一个额外的一个上面说的这种 l oss 去改变一个训练目标但是 V3 这一类的方法它对 BIOS 的更新是固定不长的相 当于就是你每次如果加个 BIOS 或者减个 BIOS 你是加一个乘数或者减一个 乘数那所以每一步我们就只知道这个专家呢他是更加被频繁的选中了就是说吧就 过热了还是说是过冷了然后我们去按照一个固定的步长去向上或者向下做一点调 整所以这里仍然是需要去调步长的这么一个超三所以这次 K3 我觉得这次他提出 的这么一个 qu ant um balancing 的这个做法呢他其实就会 直接应用 r outer 的这个分数的一个分布来去估计说我们应该去做多少的 调整比如说在 K3 里面他的这个 stat us 大概是说我们每个 t oken 呢要带 896 个这个 r out ed experts 里面呢去选择 16 个然后 我们的做法大概就是我们先去看我们当前的这个 t oken 它加上当前的 b ias 以后排在第 17 名的这么一个分数那这个分数我们就可以把它当成进入前 16 名 的这一个门槛就是算出最高的 16 个是最后被选中的这些 Ex per ts 然后 我们对于某一个 Ex pert 我们其实就可以观察他在整个 B atch 里面 他距离每个 T oken 的门槛还差多少 什么意思呢就比如说我们直观想我们现在 往一个 Ex pert 他在 r outing 的时候他的那个打分上我们如果给 他加的 b ias 越大那是不是就意味着他能够跨过的这个门槛这个 T oken 就越来越多所以我们就可以根据这些差值的这么一个你可以说叫 qu ant um 就直接去算出一个新的 b ias 使得相对于当前的这批门槛我们大概会有 16 去除以 896 这样一个相当于一个均衡比的 t oken 会选择这样一个 ex pert 这个新的 b ias 我们就现在就算一下 然后从下一个 step 我们开始使用这样 我们就也不需要去前面说的像 De ep Se ek 那样的做法我们需要有一个 固定一个更新不成这么一个超参数所以我觉得就是对于 K3 来说像 R ut ile Expert 它有快将近 1000 个了然后每次我们还只选择 16 个的话这其实 是非常非常极端提出的那确实可以猜想我们要想要去稳定的而且有效的快速的去 保持这样的一个负载均衡会变得更加困难所以我个人猜想它确实应该是 K3 这次 能够成功 scale 到 3T 级别的一个比较重要的一个因素之一吧对
曼琪(ASR SPEAKER_00)
是不是在 V4 里那个路由的改进它更多是知道我一个专家的性质对吧就是你说过 冷过热它没有那么精细到亮然后 K3 里的 这个改进就是它是更精细到亮的就是我知道 它比如说过热到什么程度或者过冷到什么程度
曾志远(ASR SPEAKER_01)
对对对我觉得这个也是顺境的时候思路不太一样吧就是我觉得像当时 deep state 的思路更像是一种逐步调整的思路然后到了像 K3 的时候他的这个思路更像是我 直接用一个 hist ory information 用历史信息去估计一下 这个 b ias 多少特别合理然后下一步直接加上这个 b ias 就行了就不再 去做一步一步的逐步调整我个人觉得两种也确实各有优劣我觉得最后说白了就是 时间跑出来哪个效果很好就用哪个
曼琪(ASR SPEAKER_00)
那我们接下来讨论一下它具体的模块其实就是你发现这些模块和我们当时讨论 V 4 也是相似的就包括它的注意力然后包括残差包括优化器等等我们可以先从注意 力开始这个前面也已经多次提到了就是这一次 K3 它是使用了 KDA 这种 K imi 自己之前提出来的一个新的注意力方式那 V4 的话它其实是一个三种注意力的混 合总体是吸收注意力优化的这个方向 T3 这一次是 KDAK imi Delta Attention 它是线性注意力和全局注意力混合的一种方式之前在 143 期的节目里面我们也和 Del ta Light 的核心作者之一杨颂林有专门 聊过线性注意力的模型大家想去了解一些背景的话也可以去听之前的节目我觉得 K3 这次直接在这么大的规模上用了线性注意力应该来说还是个比较大的或者说 比较激进的改进它的好处是效率的提升是很明显的但一般来说就大家会认为线性 注意力它会在效果和性能上有一些损失志 远你可以来讲讲就是 K3 它这次用的这个 KDA 是一个什么样的改进给业界的启发是什么它是怎么去平衡可能以前大家会 认为的就是你使用线性注意力的一些弊端
曾志远(ASR SPEAKER_01)
对我个人觉得这是一个比较大的进展就 K3 路线就像刚刚说的那样它是让大部分

00:50:00–01:00:00

曾志远(ASR SPEAKER_01)
层去使用一个更高效的 linear attention 也就是 KDA 然后同 时去周期内保留这种 G ated MLAG ated MLA 它用来提供给 所有历史 t oken 的这么一种直接的全局的 att ention 最后夏香 宇把接近 3%的这种 att ention layer 都换成了 k da 也就是 一种 linear attention 的 实现而且最后做出了一个非常 front ier level 的模型这套混合架构本身之前其实 k b linear 也 已经验过了但当时它其实模型总参数大概只有 48B50B 这种级别那 K 夏香宇 直接把它放大到了接近 3T 也就是说这总 参数规模接近放大了 60 倍这其实是一个 非常大的进展其实比如说之前的 C oin 3.5 它是一个大概 700 币的模 型它其实同样也采用了三层 G ate way 的 In tern et 再配一 层 G ate way 的 T ans ion 的这样一种 3 比 1 的设计那 K3 它 其实进一步把这种以 N id ia Att ention 为主周期性的去保 留 G lo bal Att ention 的这种 Hy brid 的这种 Att ention 架构它直接给 sk id 到了接近 3T 的这么一种相当大的一个级 别那这里其实值得一提的是像 De ep St ake V4 它其实走的是另 一条路线他没有去使用 linear tension 而是仍然在 soft ened max 的 t ension 就正常的 t ension 的框架里面呢通过 k v compression 以及 sp ath 的 t ension 这样的一个 hy brid 来提升上下文的效率这是不太一样的一个路线对所以我觉得这次 K3 带 给我以及包括很多人的启发可能就是我们其实并不需要把 F ull T ension 和 L ine ar T ension 去理解成一个二选一的这么一个关系就 Hy brid Architecture 确实是一个很有前景的方向简单来 说就是你可以不同的 att ention 它承担不同功能就比如说大部分层我们 追求效率小部分层我们去保留一个高容量的这么一种全局的 att ention 保留这种 g lo bal interaction 其实 K-SAT 就像已经 有效证明了这套方案它是完全可以 sk ill 到接近 3T 的这样一个非常非常 front ier 的这么一种 sk ill 的
曼琪(ASR SPEAKER_00)
我想补充问一下就是他现在 3 比 1 的这个 混合比例三层线性注意力混一个全局注意 力是怎么决定的呀就去年我和松林聊这个线性注意力的时候因为其实实际上大家 用的线性注意力一般都是要混全局注意力的他当时跟我说这个怎么混主要是靠经 验是实验出来的那现在有了更多的理论方法或者说总结出来的规律来指导怎么去 混合
曾志远(ASR SPEAKER_01)
从公开的资料来看这个比例的决定本质上应该还是靠就是去靠做实验之前 K imi Line ar 他们专门在一个 16 层的一个小模型上就是上面提到的这个 48 米
曼琪(ASR SPEAKER_00)
的一个模型上他比较了不同的配比
曾志远(ASR SPEAKER_01)
他们当时的一个结论是 3 比 1 他们在这个 测试级或者说在这个叫做验证级上它这个 效果是最好的就是那个 pop ul acy 指标它是最好的 1 比 1 的时候基本 一样但是负外探测更多推理成本也就越高所以 K3 呢基本上就沿用了这个 3 比 1 的这个比例然后最后再去额外的加一层 GETI 的 MLA 保证我们整个模型的结 构最后一层一定是一个 g lo bal 的 att ention
曼琪(ASR SPEAKER_00)
你说 1 比 1 是一样的就是说效果是一样好的
曾志远(ASR SPEAKER_01)
对的效果更近但是因为负担是更多所以相当于它就效率更低对所以像黑三锐的 P ulse 他们其实也没有说他们在接近三期的规模上就重新去扫描过各种比例毕 竟你可以想象这肯定非常非常贵就一般来说的话在模型训练的团队里面就这种特 别特别昂贵的 ab lation study 尤其是这种 arch itect ure ab lation study 都会先在小模型上做然后再去研制 S kin ning Law 去验证整套的像 Ar ch itect ure 包括 Re cipe 能不能稳定的放大 K3 它确实去也做了一些整体的 S kin ning Law 的 stud y 但是它主要验证的还是整套 K3 的这么一个 Re cipe 而不是说我们把哪个细节挖出来所以 3 比 1 到了 3T 它不一定说一定百分之百就是 最优解但是它目前作为整体设计的一部分它其实我们看结果它已经很成功的 S kin 上去
曼琪(ASR SPEAKER_00)
接下来的一个问题就是说因为 K3 是一个百万上下文的模型其实上下文非常长它 在这么长的上下文里面它是怎么去解决就以前线性注意力可能会有的这种遗忘的 问题
曾志远(ASR SPEAKER_01)
这也是一个非常好的问题我们先要把遗忘这一点说得更准确一点就是说因应的它 这设计上其实一般来说大家会认为是一个 tr ade off 就是它会把任意 场的历史去压进一个固定大小的 rec ur rent state 就比如说 在 K3 里面对于 KDN 层来说那这里好处呢就是说 c ache 和每一步的计算 它不会随着上下文去一直增长代价呢就是说我们不同的信息会在有限的这些状态 里面就会互相干扰就会导致什么呢就特别早啊尤其是那些特别细节的信息可能会 被覆盖掉所以问题的根源其实在于就是这里的这 com press or 呢它 因为是一种就是固定 state 的它本身呢就会存在这个容量的瓶颈吧当然就是 其实 KDA 它做一个 ne ed le attention 的这么一个 V ar ant 它在用它用了其实一些 techn ique 它把这件事情它做得更聪明 了就是说他们用了像 D ata R ule 像 Ch annel W ise For Get G auge 这样的技术就简单来说它每次可能先看 M em ory 已经预测出了什么然后我们只去写它在预测的时候的偏差然后同时不同的 ch annel 可以学到不同的保留时间除此以外的比如说 K3 他们还给每一 步的 ret ention factor 去加了一个 lower bound 这个其实在 Tech Rep ort 的飞鸽 3 那里有一些分析感谢朋友可以自己 看看就简单来说它直觉上也可以去限制过于激进的顺势遗忘但我觉得其实上面说 了这么多就是 KDA 它特别聪明的一些设计其实我觉得它更多还是更好的去管理 这种有限的 mem ory 的一些手段吧, 就是它并不会说从根本上就消除上面说的这种容量瓶颈的问题, 说白了就是你,你在计算的时候多部累积之下,信息呢还是会衰减, 嗯, 所以我个人感觉 K3 它解决这样的一个百万双三维级别遗忘问题的时候真正答案 呢还是因为做了这个 Hy brid 的结构就像我们前面说的那样我们每三层的 KD 会加入一层 G ate 的 MLA 最后一层也一定是一个 MLA 那 MLA 呢它 是这种 G lo bal Attention 它会就是说保留对所有历史 t oken 的这种 g lo bal 的 inter action 所以模型它其实并不需要 我们 KGA 就把这一百万上百万级别的 t oken 它每个细节都压在它的 rec ur rent state 里面就上面 说的其实也很困难但因为有 MLAMLA 提供了这种 g lo bal 的 inter action 就是这种全局的 att ention 的这么一种机制所以我觉得它应该是一个缓解遗忘非常关键的一点
曼琪(ASR SPEAKER_00)
其实像比较早的时候 M ini Max 的 M1 那很早了二五年年初的时候他们 也做了这种混合的方式后来他们又换回了 F ull Attention 就思 路是一样的然后效果不一样
曾志远(ASR SPEAKER_01)
我个人觉得很多时候他的这个做很多事情的 bar 还在这个 I ce Fusion 就在这个执行上有东西能做或可不能做或可不代表这个技术物件本身 make sense 还是不 make sense 他很多时候就是自己实现的时候比如说数据不一样 inf ra 不一样然后做这个事情他有很多小的细节不一样他最后可能就都很 不一样
曼琪(ASR SPEAKER_00)
注意力结构的变化它也会带来一些 In f ra 上的变化就陈阳正好可以 C ov ic 像我们上次在讨论 V isa 的时候也讨论了吸收注意力和线性注意力这两 种改进方式你当时提到说你觉得线性注意力的理论优势可能要再等几代真实的大 模型的验证那可以说 K3 现在它其实已经验证了线性注意力的一些理论优势包括 这种新的注意力结构它会给 In f ra 带来的一些影响和变化是什么
赵成阳(ASR SPEAKER_02)
我觉得我之前的判断还是很有道理的吧我可以诚实的更新一下我的判断然后也欢 迎大家在听之前我们在晚点的 pod cast 里面讨论 De ep Se ek V4 的那期节目我当时提到的两件事情第一个就是线性追地的理论优势是需要几 代真实的大模型来做验证的第二系数路线在工程上面更可控和现有的 KBC ache Pre f ix C ache 这些基础设施的兼容性更好首先 K3 对于线性 注意力这个路线的验证实际上每次有新的大模型发布我的朋友圈都会围绕着线性 注意力还是吸收注意力炒成一片所以我觉得非常的更好
曼琪(ASR SPEAKER_00)
好吧不论是
赵成阳(ASR SPEAKER_02)
一算还是做算法都是这个感受吧 K3 的话毫无疑问是对线性注意力的一个有效证 明一个 2.8T 的主线模型而且 med ian token 并且使用了 NOP 然后 K3 的 MIA 层完全不用加位置编码位置信息就全靠 KDA 的地推门控还有 衰减来提供这样的话就是它扩展到百万的这个 M illion T oken 的时候不太需要重调类似于 ROP 的这些频率啊底座等等也不太需要像 YARN 一样专门去做差值外推起来是非常自然 流畅的这个设计和效果当然是非常好的然后 第二点我说这个吸收注意力在工程上面会轻松一些这个看法也没错这段时间我们 S7 浪团队也花了很大的精力去尝试把线性注意力需要的 rec ur rent state 也纳入到 EO 的 pre f ix cache 体系当中就让 K3 这 种 hy brid KDAMLA 模型的全追负用能够达到和全注意力模型一样 的通用性长期来看线性注意力和系数注意力的兼容性差这件事情可以逐渐被工程 弥补当然代价就是我们的抽象会比以前更腐烂一些对吧另一个角度说这个线性和 系数也不是一个二分的问题 K3 选择一个 3 比 1 的混合这个每个 block 三层 KDA 加上一层的 G ate MLA 然后 over all 这个 back bone 最后还会有一层额外的 MLA 线性的部分是靠 KDA 来提供这种我们所谓的位置 敏感的序列嘛然后全局的部分就是靠 MMA 来提供这种不受限的那种交互其实这个

01:00:00–01:10:00

赵成阳(ASR SPEAKER_02)
体现的模型也非常强大所以我并没有说对吧这个线性吸收哪一条会胜出我更愿意 相信的是任何一个能够在百万上下文这个水平上把成本类似于我之前讲的这个 K VC ash 的 trans fer 成本类似于我之前讲过这个 pre-f uel 的一次成本当然我们之前可能也之前也讨论到一些这个 r outing 的成本 其实成本能够压下来的架构它大概率都是异构的然后然后构的模型架构对于我们 SGDON 推理框架而言需要持续性的同时维护好多种形态和生命周期的 att ention 抽象架构这是一个巨大的工程考验这也是我们团队这个工程能力的 体现
曼琪(ASR SPEAKER_00)
那我觉得挺好的呀这事越难就是说它的工程工作越多其实你们做的工作越多你们 的价值会越多希望如此 OKKDA 就是这种线性混群局的方式它因为理论上就是 你加了线性其实你的效率会提升这个也可以讲讲比如说你们在做适配的时候观察 到它效率的有哪些提升还是比较惊人的其实它自己的技术报告里有写到就是说它 是有实现了在百万 t oken 上下文场仅下的 6.3 倍的解码加速
赵成阳(ASR SPEAKER_02)
6.3 倍这个值其实不是 K imi K3 报告里面的严谨值而是 K imi 更 早的 K imi Line ar 论文里面的数据不严谨来说在平样的模型规模 下线性注意力为主的混合架构比起传统的全注意力架构在 100 万 t oken 这个权上下文量级混合架构生成的 t oken 速度是全注意力架构的 6.3 倍 6.3 倍是一个非常可观乃至令人惊讶的数字我可以简单解释一下模型的 de code 阶段每吐一个 t oken 都必须要把整个请求的全部历史上下文读一遍全注意 力架构的历史是整个 KVC ash 它是跟着上下文长度线性变长的 100 万 T oken 的 KVC ash 的长度近乎是 1 万个 T oken 的 100 倍上下文 越长越靠后的 T oken 它的这个开销是越大的然后线性注意力则试图把请求 的历史信息压缩到一个固定的 rec ur rent state 当中 100 万 t oken 和 1000 t oken 他们的线性注意力的 rec ur rent state 几乎是一样大的我也分享一些我们 SGDON 团队为 K3 设计的推理 站的实际素质来为大家提供直观体验这个 K ini 是 69 层的 KDA 加上这个 后面应该是 24 层的 MLA 那么 69 层的 KDA 给一个请求分配的历史信息大小 基本就固定在 54MB 所以 54MB 不论 长短然后这 24 层的 MLA 是全局的注意 力然后它会为每一个 T oken 额外的分配 27KB 那么一个百万上下文长度 的请求在 MLA 上的开销大概就是 27GB 听上去是一个 54MB 加上 27GB 的组合但是如果先前的 69 层也是全注意力那就不是 54MB 了而是额外的几十 GBKDA 和 MIA 的组合节省下来的存储大小进一步反映到 KB c ash 的搬运成本上然后某种程度上让整个推理 速度快了 6.3 倍然后最后一个问题就是 什么情况下这个 6.3 倍的体现是最明显的毫无疑问是长的 ag ent ic coding 如果每一个 ag ent ic coding 请求都消耗上百 GB 的 k b c ash 的话最强大的 HBM 缓存也撑不住几十个请求
曼琪(ASR SPEAKER_00)
就除了 KDA 这个新的注意力机制之外这次 K3 的另一个新的东西是 Att ention Res id ues 这也是之前他们发的成果是今年春天的时候发的然后当时 马斯克还转发过我觉得他用到 K3 上的 速度是非常快的这个我也可以补充一个就是 我了解到的信息就其实在做 Att ention Res id ues 的时候 差不多就是 K3 在定版的同期所以其实 当时要不要直接把这个东西放到 K3 上还是 说我再放到下一代模型上其实他们内部是有一些讨论的后来杨志林也是拍板做了 这个决策就直接放到 K3 上了它是很快就 进到一个主线模型上的一个成果正好我们 上次讨论 V4 的 MHC 的时候也是讨论到了 K imi 的 Att ention Res id ues 是有一些异曲同工的作用就想追求的效果是一致的想先请 志远和大家简单的介绍一下 Att ention Res id ues 是一个 什么东西它的作用是什么它是在模型里的比如说哪一个模块或者哪一层发挥作用
曾志远(ASR SPEAKER_01)
我觉得 T ension Res id ues 它解决的主要是模型它在这种 深度就从浅到深方向的这么一个信息流最早的时候最标准的这种 Res id ue Connect ion 它在展开以后当前 L ayer 它看到的它本质上是 E mb ed ding 以及之前它所有比它浅的 L ayer 的 A uto Pro 的职业相加而且这里每一项的权重呢它 本质上就稍微都固定为一直接加起来那其实 你随着模型越来越深越来越深这种 reg ister stream 的它的这个 大小它就会不断不断的增长那其实导致个什么问题呢就是你每次新来一个 lay er 你新写进去的这个信息它其实就会被逐渐的给稀释掉了而且同时你对于后面 lay er 就更深的 lay er 来看呢它没有一个一个直接的机制去说 OK 那我现在我要去选择我现在更需要前面的哪一层或者说哪些 lay er 哪些层 的这种我们叫 p resent ation 那其实 U lt ans ion Reg ression 的这个 ide a 它非常非常直观就是我们把我们正常 的 U lt ans ion 呢去旋转一个 90 度就比如说简单来说正常的 U lt ans ion 你是在 t oken 之间去算那个匹配的分数然后去做选择那其实 U lt ans ion Reg ression 呢就是在 lay er 之 间做选择层之间对对对就是会在层之间做选择但每层各自呢会有一个可以学习的 一个 s udo query 这个 qu ery 在所有 t oken 之间都会共 享而这时候呢它会和当前 t oken 在不同深度的 re put ation 做一个匹配然后再通过像 soft max 这样去决定应该从哪些更浅度更靠前 的这些层里面去读取信息当然这里虽然 qu ery 本身它是固定的参数但是不同 t oken 在各层层的 re par ation 它是不一样的所以最后它的 t ension 的权重它还是会随着 t oken 的内容变化所以这主要就是 t ension reduce 的一个原理
曼琪(ASR SPEAKER_00)
之前其实微四的那期有聊到过就是 MHC 和 att ention resid ues 它其实想追求的效果是相似的嘛就是你最开始前面也提到了 K3 的整体思 路也是把信息在不同方向的流动都做得更有效率 att ention resid ues 解决的就是你刚刚说的层之间的这个信息的流动那回到这两种方法上巨猿 你觉得它有哪个潜力更高的这种区别吗
曾志远(ASR SPEAKER_01)
这个问题是他们这两种方法他们肯定还是想解决同一个大的问题就是上面提到了 你标准的这个 rel ative connection 它在深度方向的信息 流它是太单一了当然这两种方法他们解决的思路就非常不一样就这里我可以大概 说一下就非常宏观的很直觉的一个 ide a 那 MSC 的做法它大概就是我们会 维护多条之前就一条并行的这种 rel ative stream 那每一层我们 会先动态的把这些 stream 它混合成这一层的输入然后再把这一层的输出分 发回不同的 stream 同时它这里还有一些实现上它这些设计上的一些细节就 比如说它们会用 reg ul mixing 加上一些约束然后去保证信息 gradient 这样的东西它在模型变身以后不会被无限制的放大然后像 Ch ad Rogers 其实就像我们刚刚说的那样它更像是什么呢就是你可以说它更像是每一层我们去 提供了一个历史目录的信息然后这样的话它可以去直接去找前面某个阶段产生的 信息然后选择性的把它挑回来使用 我 个人感觉就是如果你只去讨论这个架构的这种表达能力的话只去看那个理论上的 上线的话那可能你说 T ens ure Red uce 的上线更高这个是 make sense 的就毕竟呢你想 MHC 的这个刚刚说的这种原理他最终说本来还是把 所有的历史信息他都递归着去压缩在这种固定数量的这种 Red uce Stream s 里面那 F ull Attention 的这种 reg ulus 它其实就有一 点点像在每个 t oken 上我们对于所有的这个比我们更浅层的那些层它的输 出形成一个深度方向的这种下三角的这种注意力的这么一种 map 一种 Att ention map 所以其实我做一个很不恰当的比喻但是形象的时候它就有点像我们在层的 这种深度方向上一个是 Rec ur rent Model 一个是 So ft Max Attention 那 MHC 呢就它的信息要通过大小的 state 一 层层传递有点像这个 linear attention 对吧那 full attention 就是它就可以直接去跨层的读取那从表达力的角度那肯定是 full attention 这个还会更高一点
曼琪(ASR SPEAKER_00)
你刚那个比喻意思就是说它在层的角度一个是 RNN 对吧一个是个 trans form er
曾志远(ASR SPEAKER_01)
对对对对对就是或者你点参上他其实呃也是 R 的变体吧但如果就是说我们想讨论 最终的实际效果的话那我觉得还是要看大家具体来去说是的细节吧就比如说像 K 3 呢他其实用的也不是刚刚说那种就是完全 g lo bal 所有所有层之间都 能互相的参数的结果他做的其实是一种就是 block i 太是在就是这种 techn ique 他不是理论上表达的最完整的那种负的才是在就是就是说他会先把层啊 分成很多 block 然后他会先把每一个 block 里面的层的输出给汇总然后 在 block 和 block 之间做 att ention
曼琪(ASR SPEAKER_00)
我想到这个有点就像稀疏注意力了
曾志远(ASR SPEAKER_01)
也 in some sense yes 然后再比如说 att ention ranges 它其实需要保留更多的历史的 rep resent ation 就这里也会带 来一些像 inf ra 上 mem ory 和 commun ication 的这 种成本然后 ms c 其实也有一些自己 inf ra 上的问题所以我觉得就是最 终的效果肯定要看提升的细节当然我觉得就是目前你可以确定的是 K3 和 V4 它 已经分别证明了这两种路线其实都可以去 sk ill 到非常 front ier 的一种级别所以未来到底哪一种路线会更有潜力或者说它能做到一个更好的效果

01:10:00–01:20:00

曾志远(ASR SPEAKER_01)
我觉得其实还是很拭目以待的
曼琪(ASR SPEAKER_00)
对我觉得就是前面因为讨论很多东西它是对比着来看的嘛包括前面说线性和系数 注意力这些就你们看到有一个趋势好像是 条条大路通罗马对吧就大家反正会有不同 的实现方式但大家看到的问题是相似的就是说行业里大家看到的瓶颈或者要解决 的东西是相似的下一个话题是优化器和 V4 一样就是这次 K3 里用的也是 M ir ror 的优化器而且 M ir ror 这个优化器之所以它能被比较规模化的使 用其实本身也是 K imi 自己更早的时候它的一个成果 M ir ror Cl ip 然后它也把这个成果贡献给了业界基本上是现在比较主流的一个优化器的方 法然后这次在 K3 里面他们自己又有更进一步的改进是提出了 per-head mu on 然后这个想请志远可以再帮 大家讲一讲一个是说优化器为什么比较重要 它核心解决模型的什么问题另一个就是 K3 这次里使用的这个 mu on 的优化 器 per-head mu on 优化器相比于之前 K2 已经在用的 mu on 它的一些具体的改进是什么
曾志远(ASR SPEAKER_01)
对那其实优化器它是相当于模型训练不止语言模型训练就深度推行模型训练里面 它非常重要的一个组件吧它是解决的核心问题说吧就是我们现在有个模型然后每 在训练过程中我们的 b atch 算出一个 T 度之后那我们怎么把这些 T 度转换 成一次非常稳定的一些有效的参数更新而且是从长远来看比较好的一个参数更新 就比如说我们在训练一个模型的时候我们会设计 l oss function 但是其实说白了就是我们要优化的东西 然后梯度就告诉你局部大概要往哪里走其实 优化系它就会决定最终要采用什么方向走多大一步然后我们怎么去利用一些历史 的梯度去降低噪声去处理不同方向的尺度 差异去处理不同方向的各种冲突可能等等 的这些信息那其实一个好的一个优化器它通常意味着在相同的训练的这个结算量 下呢我们可以收敛的更快最终的 l oss 更低而且还有一个就是很重要就是稳 定性对就是我们不希望我们在训练过程中出现太多不稳定的那种 spe c 就 M ir ror 它本身的核心是说我们在拿某版本就是动量它是一些优化器里面根 据 T2 和历史 T2 串传一些信息我们当它去更新参数之前我们先把它做一个近似 的一个正交换这样的好处就是我们让更新不要去只集中在少数几个比较当命的方 向上问题是就是正常的那个 M ir ror 就是你考虑以前我们的多头的 att ention 它的存储上虽然是一个大的投影矩阵但是其实在整个算法的计算逻 辑上就是对于模型架构来说每个 H ide 它是比较独立的所以意味着如果你先 把所有的态度都放在一起正交换的话那其实他们的这些 G rad ient 包括 V om it um 的动量的这些就是 T2 和动量的这些信息他们就 somehow 会有些冲突比如说有的 S k id 更大的 H ead s 它可能就会主导整个 矩阵的更新方向 S k id 比较小就注意力头他们可能就没有办法去被充分的 No vis ation 所以 Per h ade M ew an 的核心思 想就是我们对于每一个注意力头我们都去单独的做一次 N ormal ization 就意味着我们不同的 H ead 不同的注意力头他们在做更新的时候他们的大小 他们的 S kill 就更加均衡了所以其实 K3 Report 里面也专门提了 就是说他们发现 Per h ade M ew an 在他们的 S ite Up 下可以让这种训练的这种设定 D ynam ics 更加平衡能够很好的去改善 大规模训练的稳定性
曼琪(ASR SPEAKER_00)
相比 M ion Cl ip 就是 K imi 自己之前提的这个改进它新的这个 Per head M ion 它实现起来的难度会更大吗就我想知道它有可能 在业界怎么扩散因为 M ion Cl ip 其实在业界还是有挺多扩散就很多 别的团队也会用
曾志远(ASR SPEAKER_01)
我觉得从实现难度角度说的话像普亥的这种游望呢他其实算法上基本上就是我们 直接去 res hape 成很多的这个注意力头这个 block 然后做一些并行 处理所以算法本身还挺直接的我觉得实现的难点一个难点可能是我们在大规模的 训练里面呢像这些 q k v 啊他经常被融合以及切分这就导致了这个优化器的 state 它会分散在不同的 g pu 的 rank 上所以我们必须要保证每个注意 力头他在算法计算上的逻辑边界呢他不会被打散同时我们又能够非常高效的重建 这个完整的 block 然后还要把大量的 这种小矩阵啊去合并执行再去一起在一起 做一些计算避免带来非常大的这种通信拆销然后避免一些客户浪事上的问题 所以 我觉得像 K3 看在 Tech Report 里面提到说他们为 MEO 也做了一些 专门的处理比如说他们把通信和真交化计算去做了一些 P ath line
曼琪(ASR SPEAKER_00)
关于优化器我还有一个小问题就是构造新的优化器改进这件事 AI 可不可以自己 来做因为上次我们有聊到 MEO 最开始是一个个人开发者 K aren Jordan 他提出来的后来我了解到就是 MEO 其实是在 Jordan 搞的一个开源项目叫 N ano-GB T Speed Run 这个里面诞生的然后这个项目简单 来说就是我让所有人就是去训一个比较小的模型一个标准任务然后大家来比速度 谁能最短时间做完最近有一个新的公司 RSI 就是 Team Sh ift 还有 田园栋他们那个新公司 6 月的时候做了一次尝试他们是用系统来自动化的跑这个 speed run 那之前其实两年多的时间里面 speed run 都是社区 里的一些研究者就是人来做的所以有一个 小的脑洞是说优化器是不是未来 AI 自己 也可以来写然后来赤造了这
曾志远(ASR SPEAKER_01)
确实我觉得是一个非常非常重要的一个未来的方向而且事实上我觉得其实社区里 面已经有一些早期的城市了我觉得主要是就做这种优化器的研究吧它就天然非常 适合这种 auto research 因为它的这个 p ip eline 整体 来说还是相对说比较结构化的吧就是我们会比如说先提出一个新的优化器的方案 然后我们去写代码跑实验然后我们去看这个 l oss 然后看这个比如说像稳定 性啊看这种曲线啊这种俗称做 baby setting 然后再根据这个结果做 一些改进所以这里你会发现就是研究的目标还是比较明确的而且就是最后的指标 其实也非常非常清晰所以其实在满足这两个性质的问题其实就很自然越来越多的 就会被交给 AI agent 来做了
曼琪(ASR SPEAKER_00)
嗯这也呼应到了我们前面讨论的就是他用一些早期的 Chat Point 的版 本来做 C ur l 的开发就是这次 K3 就是刚才陈阳也说他觉得一个是你目标 比较明确然后第二点是你的结果其实比较好验证第三点是不太容易被 h ack 就作弊的空间比较小像这种都是挺适合 AI 自己来跑的
曾志远(ASR SPEAKER_01)
对我觉得是这样的然后我个人觉得这里 其实还有一个很有价值的问题就是我们可以 让 ag ent 去研究怎么去设计一个小规模的 set ting 然后让这个 set ting 里面能够得到结论它是能更好的去 gen eral ize 到真正的 那种大规模训练的说白了就是你的一个优化器它在小模型小规模的实验上跑得好 不代表说我们换到一个更大的模型然后更长的一个训练中心甚至包括不同的参数 形状和人员号
曼琪(ASR SPEAKER_00)
所以我觉得
曾志远(ASR SPEAKER_01)
就是 AI Ag enda 我们不仅可以让 AI Ag enda 是研究我们下 一个非常好用的这个优化器是什么就还可以研究就是说我们应该去用什么样的小 规模的这种 Pro xy Ex amine 什么样的 S can ning Lad der 它是能够最快的判断一个优化器能不能最终 S can 到我们目标的那个 场景下的 如果 这个问题我们能够做得非常好的话其实我们就可以大大加速整个对优化器研究的 一个迭代过程因为毕竟你跑次实验还是要花不少时间不少资源的如果你能够就是 用最少的资源去飞速地做一次验证然后这个验证结果也很可靠整体的流程其实就 会被加速起来
曼琪(ASR SPEAKER_00)
所以一个是优化器本身的改进 AI 可以 自己来做另一个就是你刚刚说的我预测不同 的改进哪些更容易规模化这件事也有可能自己来做嗯
曾志远(ASR SPEAKER_01)
对对对或者说你怎么去设计一个比较小 规模的场景然后使得这个小规模场景下出来 的结果是比较 make sense make sense 就意味着它在大的 这个 sk ill 下仍然是对的或者说比较 trans fer able 的那
曼琪(ASR SPEAKER_00)
这个方法其实也不止可以用在优化器的改进因为你基本上 AI 训练你的很多部件 都是你先在一个小楼上面试然后你得给它 sk ill 对吧
曾志远(ASR SPEAKER_01)
对对对对对包括我们前面提到的各种模型架构的改进然后包括就是说各种不同强 化学习算法它的这个调整这些我觉得都是个很关键的问题就怎么在小规模的实验 下能够让大规模的实验结果也能更加 p redict able
曼琪(ASR SPEAKER_00)
这个是模型开发很核心的一个能力而且你做得好的话可以节省很多资源我想了解 一下据你所知业界有谁初步掌握了这种能力吗
曾志远(ASR SPEAKER_01)
我觉得这个不是业界有谁出不掌握这能力就是大家都有这样的能力只是有的做得 更好有的在有的领域做得更好有在有的领域做得更弱一些
曼琪(ASR SPEAKER_00)
谁在这个方面做得比较强
曾志远(ASR SPEAKER_01)
我觉得还是 F ont el ab 更强就是美国的 Open AI 跟 SAP 他们 这方面做的应该是非常非常好的就是他们一个自己资源又多一个是他们就是这一 套怎么去做小规模的这种验证的各种流程各种基建也更成熟
曼琪(ASR SPEAKER_00)
之前一直有一种观点就有的人会认为像美国的这种 F ront ier Lab 因为它的算力资源会多很多其实比中国的 一些公司多一到两个数量级所以可能他们 反而很多这种就比较细的改进对他们来说就不一定那么必要我就是指比如说你刚 刚说的我能更高效率地使用算力这件事 然后反而是中国因为大家很缺算力所以可能 你前面做实验的过程也会非常谨慎然后也会找各种各样的方法说我怎么在有限的 算力之下我能达到更好的效果你觉得这种观察成立吗
曾志远(ASR SPEAKER_01)
我觉得这个说法一方面是有道理的就比如说你可以看到 De ep S ync 里面有很多的各种工程上的优化确实是压到了极致但另一方面其实我觉得也不要 小瞧 F ront ier Lab 他们做各种优化的他们其实也是很有东西的 不管 是各种小优化还是各种怎么在小规模做得好然后去 gen eral ize 到

01:20:00–01:30:00

曾志远(ASR SPEAKER_01)
大规模的
曼琪(ASR SPEAKER_00)
有一个就是对 SRP 的观察想和你讨论一下就比如说你周围交流会不会有这种感 受就有的人会说 SRP 其实在比如说架构啊这一层它做的花活没有那么多它是把 很多重点都放在数据然后放在 inf ra 上
曾志远(ASR SPEAKER_01)
对对对我觉得根据各种 g ossip 确实是这样就是他们基本就先行 doing the basic things right 就是怎么把一些简单的事情做 到其实的正确然后就去有效 sc an ning 把事情做好
曼琪(ASR SPEAKER_00)
我们来讨论就是后训练的这一部分后训练和 RL 虽然前面有聊到说它后训练的细 节并没有披露这么多然后这次可以在技术报告里看到的是 K imi 有一次设计 师他先训练九个领域的专家模型然后他通过 MOPD 就是 M ult i-Te acher on Policy Dest ination 给它合并成一个 模型这个也许应该能翻译成多教师的在线针流对给它合并成一个模型可以请靳远 分享一下就为什么他不直接联合训练一个要先分后合
曾志远(ASR SPEAKER_01)
对就其实这个 MOPD 这个 M ot iv ation and Policy Des ol ation 这个 reci pe 它其实最近一年它已经快速成为 了一条非常常见的一个 post-tra ining recipe
曼琪(ASR SPEAKER_00)
像这种方法其实一般大家也不会说专门写个文章去讲对吧
曾志远(ASR SPEAKER_01)
是的尤其这种 MOP 这种它不太行研究问题
曼琪(ASR SPEAKER_00)
为什么像比如说 Att ention Res id ues 这种东西 K imi 就会专门写个文章然后像 MOPD 这种就可能没有任何公司会专门写文章去讨论 这个话题
曾志远(ASR SPEAKER_01)
我觉得这个问题其实问得非常好就我觉得一个东西能不能写成文章一个很重要的 问题是你能不能把它随目成一个非常比较 cle an 的一个 rese arch 问题一个研究问题比如像探测 r ider 它可以有一个很 cle an 的研究 问题它指标很明确你要对比的对象非常明确然后比如说像 MOPD 这种你不做 M OPD 的话你要对比的其他的方案就特别 特别麻烦 MOPD 它可能更像是我们直接 避免了一条很麻烦的路径然后你就不需要 关心说我们怎么把那个麻烦路径调得非常 明白所以这里就它相对来说就不是那么干净的一个研究问题的一个 set up 吧
曼琪(ASR SPEAKER_00)
我在想它的这个相关的一些影响啊比如说你看 Att ention Res id ues 它写成一篇文章它有三个一作对吧对这些作者来说它肯定是有它的职业的 c redit 的增加的那业界也有很多 就它用了很多的方法好像也不知道最开始 是谁想出来的
曾志远(ASR SPEAKER_01)
其实在比如说在美国这边其实 F ont el ab 之间有个人提出一个很好 想法就是就类似于他们小圈子内部其实是都知道是谁提的所以其实不会影响他们 自己的比如说 QI 电台包括更直白一点他们的身价这种就是这种消息流传起来都 很快的只是他不会在公开的网上流传
曼琪(ASR SPEAKER_00)
OK 所以他是有点像就圈子内都知道但是外面的人不太知道
曾志远(ASR SPEAKER_01)
对对对嗯
曼琪(ASR SPEAKER_00)
嗯那你可以据来说你就说这个东西最近这半年到一年它其实变得很主流了
曾志远(ASR SPEAKER_01)
对对它最近一年已经快速成为了一条非常常见的一个 P ulse-Ch anging Re cipe 其实公开采用这条路线的就已经包括像 B-M ode VR 像 De ep S ync 的 V4 以及包括后面 NVIDIA 做的 N em ot ron 3 Ultra 就是这些模型然后包括这次的 K3 这里用 MOPD 一个 很重要的原因就是我们想把不同领域的研发过程去结拢方便我们一个很大的模型 团队下面有各个小团队他们之间的合作就比如说像 gen eral reasoning c oding agent gen eral agent 等等他们不只是 d ata 不一样他们其实包括像 environ ment 像我们去给奖励的 策略像我们做一次 r oute 的程度像他们使用的 h arm less 甚至 是算法的这个 reci pe 它都可能非常不一样对吧那比如说像 c oding agent 里面包括 inf ra 可能也会有些区别比如说你先扣了一件前面的 因素他可能会有些自然挑战之类的所以其实如果你全部都放进一次交易前的那种 RL 就把你们所有东西全部混到一起然后做一些大的 RL 那其实我们在混这些 D om ain 混这些不同的领域然后混接不同 re ward 还有包括前面说的 各种训练的设置它就会全部给偶合到一起就会导致你做模型合板的时候你的技术 压力非常非常大就是你要把这些东西它们可能本来在自己的 ch ip 里面它已经 做 work 了然后最后你合板的时候还要考虑说怎么合起来再 work 然后它们 各种 set up 都非常非常不一样对吧 就是这样会导致压力特别大所以就是如果 我们用 MOPD 这个 reci pe 的话我们就可以先分别训练各个领域的专家 模型其实每个小团队他们最后要 del iver 给合板的成果它其实就是自己 领域的小专家模型不用把上面说的那些乱七八糟的什么各种 RSP 各种 In f ra 还有包括各种什么 New Ar bit 这样的东西全部都给 del iver 出去其实每个小团队我们就专注的把自己的领域的模型可以训练到最好然后最后 合板的时候再用 MOPD 那这样的话呢 大家就比如说你不需要为了方便最后的一个 j og ging training 我们提前把所有的 reci pe 和 inf ra 都强行统一对吧那就可能会导致你在做自己领域的时候非常的束手束脚然后 我们也不需要说我们在每次迭代的时候去同时协调所有的领域这样就能让你的迭 代变得非常快还有就包括你做合板的时候我们不需要花特别特别大的力气去协调 各个方面
曼琪(ASR SPEAKER_00)
所以以前它也是分开训练的现在也是分开的只是合的方式不太一样以前是一个更 完整的合就是你得带着各种训练设置一起来合现在是每个专家训完之后我最后只 合那个结果对吧
曾志远(ASR SPEAKER_01)
以前就这样的 RL training 就还没有那么麻烦对吧比如说最早的时候 我们不需要做 ag ent 的 RL 那也不需要就 inf ra 可能比如说相对来 说也比较统一大家只需要把数据贡献出来然后直接一核就可以了但现在就是各种 RL 方面他们的 reci pe 不同领域就会复杂很多他们都有自己的这个 reci pe 所以我们只核模型的话就会方便很多
曼琪(ASR SPEAKER_00)
它在直觉上它好像给人一种跟预训练的趋势有些相反的这种特点因为预训练其实 你是在同一个模式里面你是吃了不同就非常多元的数据你就是放在一个过程里去 训的对 对对 然后后训练按你刚才的描述其实是之前后训练他要处理的任务下游任务比较单一 或者简单的时候大家其实是在一起训的对
曾志远(ASR SPEAKER_01)
对对
曼琪(ASR SPEAKER_00)
现在就是你能看到它是一个好像在走向分的 过程比如 K3 就是有九个分开的它为什么 是这样一个过程你觉得它更远来说它有必要又就后续那这个阶段它有必要又变成 一个合的过程吗那样的话它会潜力更高吗
曾志远(ASR SPEAKER_01)
就我觉得是合起来还是 OPD 两个潜力 更高这个还这不好说就是有很多的研究他们 会说可能做 MOPD 它比去直接做那种 joint 的 RL 效果要更好之类的但是 我觉得就是这种结果吧你都要看它非常非常具体的实验的 set up 才能说它的 这个结果到底有多 gen eral ized 我觉得目前做 MOPD 主要还是 说白了就是这样是最方便的就是你不用像我刚刚说的那样你每个团队有一个自己 的方案之后你还要去合方案而我们是和这个最后的这个叫做模型就像说白了就是 你合不上是不是很麻烦但是和模型就用 MOPD 就很简单然后大家就专心的把自己 的模型做好就行
曼琪(ASR SPEAKER_00)
然后 MOPD 里其实它的英文它最后一个是 D 是代表 D est ination 就是针流翻译过来就是针流我觉得正好 也可以说一下就本来针流的意思是什么以及 业界因为现在关于针流有很多讨论实际上它从技术上来说是怎么一回事
曾志远(ASR SPEAKER_01)
对就针流从技术的最原始的定义上来说它 al ways 都是去把 T-shirt 模型就是教师模型的能力它去传递给一个学生模型它最经典的用法其实就是去压 缩模型就比如说你先训练一个很大的一个教室模型然后再把能力去占留到一个更 小的一个学生模型这样你可能就用学生 模型它更便宜一些对吧就比如说它 QGIS 里面他们的技术报道里面就说了我们会做这种 strong to weak 的 des ol ation 就是先去获得一个强大的模型然后再用它们去帮助训 练小模型所以从技术的角度他 al ways 都是教师模型去传递给学生模型能 力但是我们更多要看他的目的是什么就比如说在 MOPD 这里的目的他不是说去 压缩模型而是我们刚刚说的合板就是我们先从同一个 found ation 的 模型出发我们训练出不同 dom ain 以及不同 re du cing effort 的教师模型然后最后我们再把他们的能力 去传回一个统一的学生模型里面然后这是 目的一方面然后另一方面就是我们这个针流具体怎么实现然后从具体的算法角度 就是 un pol ished installation 做的事情是我们会 让这个学生模型自己去生成一个轨迹然后学生然后教师模型再对这个轨迹去打分 提供这个一种比较稠密的这个叫做奖励 信号然后用这个奖励信号来去提升学生然后 另外一种也很常见或者说更传统一点的针钮模式也就是刚刚麦奇提到的就是说在 这种普通大众在社交媒体上去讨论针钮指的就是一般是说我们老师先去预先生成 一批固定答案然后学生都会就直接在固定的数据上离线的数据上我们直接去模仿 学习去学习老师的模型他在输入下他的输出是什么
曼琪(ASR SPEAKER_00)
这里 MOPD 使用的 on policy 的针流和你说的就是我们平时讨论的语 境里面更常提到的那种针流它是 off policy 的针流这个 on policy 和 off policy 的区别是什么呀
曾志远(ASR SPEAKER_01)
更多指的还是算法层面的区别对对对就比如说 un pol icy 他学生是背 语言的模型训练过程中学生自己去亲自去生存这个轨迹所以这个我不说他是 un pol icy 的 un pol icy 是相对于学生来说老师他的这个轨迹他是 一个 off policy 的就是老师的轨迹不是学生自己生存的
曼琪(ASR SPEAKER_00)
哪一种它的学习的效率会更高
曾志远(ASR SPEAKER_01)
这个其实也是不同的程序下有不同的经验性的结果比如说在做合板的时候确实肯

01:30:00–01:40:00

曾志远(ASR SPEAKER_01)
定是 un pol icy diss olution 这种做法还是 un pol icy 的比 un pol icy 更好对但如果只有教师模型的叫做输出你没法 搞到它的权重 log ic 这些的话其实你没法做到像教师模型去给学生模型系 统的打分那你就只能去做 off policy des ol ation 就是 教室模型只能拿到它的最终输出
曼琪(ASR SPEAKER_00)
假如说比如 An throp ic 它自己有自己的模型权重比如它自己征自己 的话从技术的效果上来说你觉得它大概率它是 on policy 还是 off policy
曾志远(ASR SPEAKER_01)
你说这一阵子自己的目的是啥
曼琪(ASR SPEAKER_00)
是为了变成一个更强的模型大家说的左脚踩右脚然后自己原地飞升这种
曾志远(ASR SPEAKER_01)
这个感觉目前还是大家愿景吧就是还没有真的做到我个人理解中还是看这个 ex ternal 这种外在的这种监督信号它有没有就我觉得你很难在没有一个很本 质的很能 sc al able 的这种外在监督信号情况下去提升一个模型也就 可能就是说你最后用的这个技术里面它的名字可能带了一个 des ol ation 但它肯定是找到了一种很 sc al able 的方式能够稳定的把外在的这种 监督信号给打进来这个过程
曼琪(ASR SPEAKER_00)
那最后在 In fer 的层面上请陈阳来分享一下, 你觉得 K3 做 In fer 改进的一些整体的思路是什么? 因为你们这次 K3 也是第一时间做了适配, 你可以讲讲就是你们适配的时候有什么有意思的发现吗? 具体来说
赵成阳(ASR SPEAKER_02)
的话,我可以分享一下 KDA 架构对于投机采样带来的挑战, 额,投机采样,简单来说, 我们会通过一个小的模型来快速猜测出一批 t oken, 然后让真正采样的大模型来一口气验证这些 t oken 是否正确。 验证完成后,这批被猜测出的 t oken 当中, 可能只有前几个 t oken 会被大模型接受。 所以,大模型在验证这批被猜测的 t oken 之前的状态是需要保留的, 因为如果猜测不对的话, 大模型要能够随时回退到猜测之前的那个状态这对于普通的 att ention 而言问题不大就像觉得比方你无非就是把书的后级也撕了然后继续从笔记本的靠 后的页开始写对吧但是 k da 的架构设计需要能够对每个 t oken 的递进 状态进行原地的重写为了能够回退到大模型验证之前的状态我们必须要想办法对 之前的递进状态进行存档一个比较朴素的存档方法就是每走一步就把整个递进状 态做一个快照但是对于整个 69 层 KDA 做完整存档的保留的开销非常大我们最 后的做法是不存状态只存每一步状态的几小 投影大概只有一个 KB 左右要回退的时候 就从上一个 check point 的出发照着这些输入把接收的那几个 t oken 的存档重放一遍这很像我去看我小表弟他学习象棋的过程象棋玩家为了复盘棋局 会通过一些简单的记号来记录每一步棋子的移动这样你就不用每一步都给整个棋 盘来一次完整的快照然后我们为了支持 KDA 的投机采样其实也实现了类似的思 路记录棋子的移动而不记录整个棋盘比较有趣的是我们后来观察到 K imi K 3 的 Tech Report 也和我们独立地提出了类似的设计当然我们其实并 没有提前为了这一块的设计做过任何讨论也可以很荣幸地说顶尖的工程团队大家 在这些工程论点上的解法都有一
曼琪(ASR SPEAKER_00)
举同工之妙这次 K3 还开源了他们的一个 ag ent 的环境它就是叫 ag ent in 你前面也说到一般权重只是一次训练的产物而环境是能够反复附用产生下一 代权重的一个流水线所以环境是更重要的护城河你也可以讲讲就这次从 ag ent in 里面看到的一些有意思的思路是什么
赵成阳(ASR SPEAKER_02)
A gent ing 是一个最朴实无华的名字我觉得还是比较有新意因为一般 而言我们研究者往往为了模型的安全性会 去主动限制模型的能力大多数情况下我们 会通过更好的隔离方案来尽可能的锁死模型让它少做一些越狱之类的操作但是 K 3 的训练团队选择通过更好的隔离方式来尽可能放宽模型的能力边界就是说模型 可能受到的限制更小我相信他们自己也比较 bel ieve 以后模型应该拿到 系统权限是更高的可能是这个样子的往往我们认为 ag ent 的越强的话他的 探索会越激进早期的时候我记得大概是 K imi K1 或者 K2 的时候他们会 选择用容器 r unt ime 来完成这种杀核但那种情况下很容易出现我们所 谓的 OS 的 pan ic 和内存的死锁他们并没有选择让 ag ent 持续去跑 容器或者换用别的虚拟机而是干脆换了别的 技术路线把这种隔离做得更好用了 fire cr acker 来跑这种 mic ro virtual machine 这个 其实比较工程化但是我觉得一句话 take away 就是说他们选择赋予模型 更高的权限并且为这个权限做出更好的技术隔离 OK 这个技术隔离是隔离什么和 什么简单来说就是希望如果一个 ag ent 把一个沙盒弄崩溃了之后不会影响 其他的沙盒的运行对就安全的考虑对吧是的可以说是沙盒做的更安全那么模型的 安全限制就可以放低然后第二点是这个持久化 root 和沙盒嘛这个其实解决的 这个问题很经典就是我们的 ag ent ic 的常委问题嘛我们其实这个是我的 K ey 一个很厉害的地方在 ag ent ic RL 领域有个经久不衰的做 法叫做 part ial roll out 简单来说就是一条采样轨迹可能是 上千次的工具调用得到了上百万个 t oken 然后假设我一次采样 16 个 re quest 这个 16 个 re quest 里面可能就会有那么一两条特别长的 re quest 比如说可能他是调一个外卖接口但是外卖的那个 M ock 接口返回 的比较不稳定可能过了一分钟才返回这种情况下会极大的阻塞这个 b atch 的整个运行在 K imi 1.5 的论文里面他们就提出 part ial route 就是不必等待所有的轨迹都结束等到一定比例的这个我们说的轨迹完成了之后就 会把结束的轨迹用作训练然后没有完成 结束的轨迹会缓存起来在下一轮继续去完成 它这个做法其实是有很深厚的统计学的 观察在里面就是说通过提高采样的总数或者 说只选择把不常委的那部分的 re quest 拿来使用可以加速这个采样的过 程这个也有一些强化学界理论上面的挑战这是一方面从系统设计上面模型的历史 的采样信息需要尽可能的保存比如说模型上次采样的 KVC ache 他们需要 把这些 KVC ache 写下来避免下次 重新采样的时候需要做一次特别上的 long pre-fill 对然后另外一个问题是强化学习册的这个数据过时问题用术语 叫做 off-point invest 就是它这样采样的轨迹会有一个问题可能 这个轨迹的前一个部分是上一个版本的 check point 采样出来的这个 轨迹的余下部分才是当前版本的 check point 采样出来的这样的话一 条采用序列其实它不是严格的 on policy 或者说不是严格在线的 K3 还是 采用了 per token 政策的方式把我们所谓的策略更新约束在了一个局部 领域之内来部分容忍这样的 of policy-ness 这是一个很经典的用 算法上的宽容来换取 inf ra 上的自由然后其实对 inf ra 的提速是非常 好的最后一点我觉得体现出来 K imi 团队的一个设计哲学吧就是让 RU 环境 和推理时 ag ent 运行的环境是尽可能一致的 K3 的训练管道把 ag ent 的这个 h arness 表示成了一组可以配置可以组合的模块类似于工具接口 system prompt 上下文管理策略 sk ills 还有 mem ory 吧他们用各种复杂的策略去模拟组合出来各种主流的 ag ent harness 这种组合其实也避免了在模型训练过程当中 over feed 到某一个 h arness 上以至于比如说你训练在美团上面订外卖结果发现用户想要用饿了吗就用不了这 些对人类而言是非常愚蠢的但是对于模型而言训练不佳很容易出现这样的问题很 显然他们这样的策略组合能够很好的缓解这种学会了美团就不会饿了吗的问题从 In fer no 的角度上来讲的话我其实很认同他们这个方向环境正确就是 说我们对 H ann es 的优势会逐渐提高的更广的来说我们希望 H ann es 能够自由地和各种 ag ent 的 work flow 做组合这和我们在 S erving 测的想法也是一样的不要为了每一个模型去做许多的策略要为了这 些状态尽可能去组织成树状结构
曼琪(ASR SPEAKER_00)
所以它的整个思路就是说我这个模型迅出来之后在上面一层就这个 H arness 这一层它不管是什么类型的 H arness 它都能比较好的去调用它可以适配 不同类型更多的框架
赵成阳(ASR SPEAKER_02)
理论上是这个样子但是效果我觉得肯定不至于那么完美但是我觉得现在这些 H arness 的我们随着对 H arness 的使用越来越高对 H arness 泛化性的要 求也必然是越来越强的
曼琪(ASR SPEAKER_00)
你觉得边缘模型有这个需要吗比如说 SRPT 或者 Open AI 它可能自己训 练的模型它就是在自己的 H ard isk 框架里面被使用的
赵成阳(ASR SPEAKER_02)
对这个必然是需要的而且换句话来说即便是 Cloud Code 这样的平台它 其实能够接入的组件也是非常多的那些 Cloud Code 可以去接 Fl ack 可以接 G mail 还可以接你的 Cal endar 这也是 M otion and H arness 何况我刚刚提到美团和 E le men 这个切换问题可能对 于 A th or be ak 而言他们可能换的就是用 G mail 还是用 A lt al ook 对这两个事情听上去也非常的类似但是不做精心的设计模型 的 over f itting 会非常的令人尴尬
曼琪(ASR SPEAKER_00)
除了你刚才说的就是你自己最在意的这个进展 A gent Eve 就是他们强 化学习的环境之外其他的一些改进包括这个 Fl ash KDA 还有它的量化 感知训练这些你也可以讲一讲就是它在 In f ra 上带来的一些变化是什么

01:40:00–01:50:00

赵成阳(ASR SPEAKER_02)
我们回到下这两种 att ention 的区别吧 soft max att ention 的 k ern el 主要是在和带宽做斗争然后线性注意力的 k ern el 不严谨的来说它会更多和串行依赖关系做斗争具体来说 k da 的话是在这个 ch unk 之内做并行 ch unk 之间做串行以此 rec ur rent state 得以一个 ch unk 一个 ch unk 的往前传导所以这种情况下最 na ive 的一个写法就是每一个 ch unk 你算一次你就传一次状态这会导致计算资源 的大面积空转然后 fl ash k da 是 K imi 他们团队基于 C uth eles 写的一个 ch unk-wise kernel 把 ch unk 类的 计算和跨 ch unk 的状态传输尝试做重叠术语来说叫 over lapping 这是 fl ash k da 的第一层然后如此以来的话这带了一个差别 So ft max Attention 的 KDA 的话它对于 KVC ash 的关注其实不会 特别强因为 K ern el 对于 KVC ash 是止读不改的但是 KDA 的这 些 K ern el 的旧有状态可能会被覆盖所以 K ern el 的设计还是 要考虑更全的生命周期什么时候做持久化写到哪一个 ch unk ed slot 里面怎么去保证其他 re quest 正在读的缓存不会被冲掉可以说 KDA 的 K ern el 会难度更高一点而且它也模糊了我们认为 K ern el 和 缓存管理的这个界限然后另外一个角度是 K imi 的拿手技能这个我们说的 Q AT 就是 Qu ant ization Aware ness Training 可以看到 K3 和 De ep S ync V4 同时都在采用 FP4 精度的一个 训练 De ep S ync V4 的距离做法的话其实我们之前有讨论过我们 这里可以更多讲 K3K3 从 SFT 开始就做这个 QAT 然后这个直观的好处就是 模型会有更多的时间去适应量化噪声而且 他们也着重强调了 RL 采样阶段和 tra ining 阶段采用的是同一套量化方案这样尽可能的减少训练和推理不一致带 来的磨损这个也可以从 RL 的角度上来 感受我们刚才其实提到一个术语叫做 off -p ond ess iness 直观来说 RL 策略梯度优化这个整个事情能 够成立是有一个前提的谢谢大家那个产生了这些数据的策略就是我们训练的时候 会采集到许多的这个序列然后拿去优化模型我们希望这些序列就是我们优化的那 一个模型产生的它不是 T-1 的 check point 也不是 T-2 的 check point 它最好就是 T-0 这个 check point 产生的这个数据但是 这个 T-0 或者 T-1T-2 它有的时候不是你刻意造成的就比如说我们说这个 迅推不一致就是迅量的时候可能它的这个 调化比如说是 BF16 吧那你推理的时候 采用 NVFP4 那么这就会导致其实这两个策略是有区别的这也是一种 off- p ond ency index 所以一旦 训练和这个采样的过程对同一个 check point 给出的精度不一致它给出的 t oken 的概率是有细微区别的这就是 一个不严谨的梯度计算了而且这种不严谨的梯度计算对于 MOE 而言可能会导致 一个灾难性的崩溃所以 K3 的训练哲学还是在贯彻 RL inf ra 领域的一 贯的认识为了我们迅到的模型就是我们要去优化的那个模型一定要让训练和推理 阶段尽可能的契合采用尽可能相似的配置
曼琪(ASR SPEAKER_00)
这件事情它在实现上难吗就是说现在大家其实主流的公司都能做到就尽可能一样 的配置还是说这个还是需要挺多努力才能 实现的以及它其实也能去看一个公司大概 inf ra 的水平
赵成阳(ASR SPEAKER_02)
我可以说这个事情非常难而且对于很多公司 而言需要单独的去维护一个硕大的 inf ra 甚至说是 k ern el team 才能够去把这个事情做好这点上来说 我觉得 K imi 的技术还是非常领先的
曼琪(ASR SPEAKER_00)
你之前说 De ep Se ek 是 inf ra 领域的巨鲸对比一下的话你觉得 KB 是在什么到位
赵成阳(ASR SPEAKER_02)
我不希望有一个分出高下的但是坦诚地说我觉得国内的公司的 inf ra 真的 强不过正常来说我们叫做用 inf ra 换算力真的是非常不容易
曼琪(ASR SPEAKER_00)
最后这一部分我有个想补充的问题就是我看 K3 在技术报告里它写到就 K3 优化 测试里已经给它的原文写的是 A to ll ative V end or 有可能是个国内的这种芯片公司给这个 A to ll ative V end or 的 GPGPU 写了 C ur l 那是不是有可能就用 K3 这个模型也能加速 K3 自己向国产芯片的适配了
赵成阳(ASR SPEAKER_02)
是的我觉得这点应该是比较明确的当然我们确定最终这个 del ivery 上 生产的这些是不是 K3 鞋的但是 K3 至少 从性能和正确性上来说是非常能打的然后 另外一个角度就是这一次我们也见到由于现在这个模型的生态真的 b umping 的非常厉害以前有一段时间国产的芯片的同行他们想要在模型发布当天 supp ort 这些新的 AI 模型其实是有一定难度的但是到了最近我们也看到类似于摩 尔县城他们也通过 MUSAS7LAND 这样一个生态在发布的很快的时间之内 我不记得是不是 D ating 但一定是在极短的时间之内就成功 supp ort 上了 K imi K3 而且也达到一个很好的效果我觉得可以想见 K ern el Development Ag ents 真的是一个非常伟大的事情我觉得对 于整个芯片产业是有很本质的推动的
曼琪(ASR SPEAKER_00)
你觉得这件事会怎么影响英伟达的统治地位吗会吗会到那个程度吗
赵成阳(ASR SPEAKER_02)
这是一个我无法判断的事情
曼琪(ASR SPEAKER_00)
你这是无法判断还是不想说呀我 无 法判断这个我们可以讨论一下就理论上来说其实因为 CUDA 这个生态就是建立 在说你有比较丰富的 cur l 这肯定是很重要的一部分对吧然后它的通用性比 较好
赵成阳(ASR SPEAKER_02)
我有很多好朋友在 AMD 做 AMD version 的 C ru el ty less 所以他们高强度的依赖这些 KDA 而且我也有 NV 的好朋友他们在 NV 给 NV 显 Next Generation 的 DSL 也是大量依赖 KDA
曼琪(ASR SPEAKER_00)
那我觉得你这提供了一种视角,就是 KDA 这个东西英伟达之外的厂商可以用, 对吧? 那英伟达自己它也可以用。
赵成阳(ASR SPEAKER_02)
对,因为英伟达自己也需要去更迭嘛,然后我觉得很遗憾, 就是现在这些模型的 KDA 还是,就是说优化 Q2S 可能很厉害, 但是如果你优化,比如说举个例子,假设以后有这个 TC Gen 5, 对吧? 比如现在是 TC Gen 4, TC Gen 5 就是可能 KDA 的还得花一段时间来泛化上去。
曼琪(ASR SPEAKER_00)
这也是个很好的问题我们可以看看就是 KDA 这里指的是开发 C ur l 的这 种 ag ent 的发展之后会怎么去影响这个芯片领域的一些竞争
赵成阳(ASR SPEAKER_02)
我很难说 K imi Delta Attention 和 C ur rent Development Ag ents 哪一个更伟大我觉得这两个事情都很 牛
曼琪(ASR SPEAKER_00)
OK 都叫 KDA 我们最后可以来稍微延展讨论一下 K3 对业界的一些影响有一些 随便拍脑袋的问题比如说你们认为下一个开源最强什么时候会出现可能来自哪个 公司
赵成阳(ASR SPEAKER_02)
首先我见到一个非常恐怖的事情之前见到困团队发布说他们的模型在以日为单位 智力跟点这个时代对智力前沿的加速度没有降低反而我觉得是人类的想象力降低 了就是我们现在除了这个 c oding 之外我见不到下一个
曼琪(ASR SPEAKER_00)
爆炸的点对就坤 3.8 pre view 就预览版发的时候说他们会一日更新 下一个问题其实前面稍微讨论过就是你们觉得今年内就剩下还有五个多月的时间 里我们有可能会见证开源超过避源吗
曾志远(ASR SPEAKER_01)
我个人觉得这个是有一定难度的因为一般来说大家会认为 op eng ang s ar pe ck 他们内部的一个最强的模型是比他们现在放出来的模型还 要再强一个比如说半个 generation 的半个甚至到一个 generation 的对然后我们现在开源模型基本上现在最 强的开源模型基本上目标是追平现在已经 放出来的这个叫做最强的闭眼模型或者说闭权重模型但是可能他们之后他们之后 能够放出来的是他们现在内部已经有的比现在闭权重模型还要更强一个半代甚至 到一代的模型然后这个时候可能就是确实开权重模型还需要一段时间去追对所以 我觉得在至少未来五个月内这个趋势应该不太会有很明显的变化其实对于开群众 模型这边基本上就是把目前最强的给放出来了对所以这里其实还是有一个代差在 这里就是实际最强的跟放出来的这个最强的
曼琪(ASR SPEAKER_00)
你的意思是说要找一个好的时机来放对最后一个问题是一个相对就是趋势宏观趋 势的一个问题最近朗文峰说下一代模型的 标志是能持续学习你们自己会怎么看下一 代模型要实现什么能力
赵成阳(ASR SPEAKER_02)
至少我对于持续学习的观点我不是说希望 这个模型的智力不断提升我是说希望一个 模型能够对任何系统都有很有效的优化但这个任何应该就专指 k da 吧比如说 我现在说可能你让 k d h 优化现在 c out il ess 他可以优化的 很好但是等到 next generation d sl 来了 k d 能不能做 的很好目前来看是不太新的这其实反过来 暴露现在的模型的泛化性没有想象的那么 好因为 kernel 绝对是一个最好验证的领域了对哪怕这样子的话他的泛化都 还是要一定的训练那么从这点上来看我觉得实现 RSI 还是有一些距离的
曾志远(ASR SPEAKER_01)
我不去评价说下一代模型的核心能力是不是说必须要有持续学习能力这个观点本 身我觉得就是如果我们假设这个观点是 正确的话我觉得现在有个很大的问题是我们 还没有一个很好的方式去评测或者说去 me asure 这个 pro gress 就是说我们去看现在的模型它做这个持续学习的能力大概到了什么样的层次因为 它肯定不是一个零或者一就是它不会持续学习或者说会持续学习它肯定是一个零 到一之间的某一个状态对我觉得现在还缺少这样的一个去衡量目前的这个进展的 这么一个很好的方式吧对所以我觉得如果均衡这个观点的话我们应该先把这样的 一个衡量这个进展的方式给明确的做出来比如说通过各种比较完备的 e valuation

01:50:00–01:55:19

曾志远(ASR SPEAKER_01)
各种完备的评测把这个问题给解决然后再去讨论说我们现在的模型比较到我们想 要的目标还剩多少
曼琪(ASR SPEAKER_00)
总体来说你们觉得这个模型的进展它接下来会是就一路这样斜线上去就可以这样 进展了还是它还是会有一个一个平台期出现
曾志远(ASR SPEAKER_01)
我跟猜测一样还是会有一个个平台期的出现
曼琪(ASR SPEAKER_00)
就是有平台其实有平台期也意味着有突破对吧就你有一个突破可能就上一个台阶
曾志远(ASR SPEAKER_01)
对对但这个突破不见得说是大家都会想象那种特别巨大的范式性突破
曼琪(ASR SPEAKER_00)
我觉得
曾志远(ASR SPEAKER_01)
可能更多是在 C ult ured 在 J et ting 层面把一些问题有些 突破之后它会在这个平台期会有一个提升 其实说实话个人觉得就是最近半年都没有 什么很本质的平台性突破对它只是在一个平台上有做的更高一点这样当然确实更 高一点但给普通用户的体验已经很不一样了
曼琪(ASR SPEAKER_00)
OK 今天非常感谢陈阳还有志远做客玩点 聊分享了对 K3 技术报告的一些解读然后 我们也从 K3 的一些改进比如说它的线性混合的注意力 att ention resid ues 等等然后延展聊了最近这些领域相关的一些进展包括这些进展是为了解决 什么问题以及接下来可能会有怎么样的影响我们也讨论了就 K3 现在在全球或者 说在美国的科技圈引起的这种开源的辩论 那今天的节目就到这里各位拜拜拜拜拜拜 本期连点呈现推荐晚点聊几个相关的往期节目一期是我们这次反复提到的第 16 3 期对 De ep Se ek V4 的解读其实这两期节目的结构挺相似的这是 因为现在开源大模型的技术报告的结构本身就有一定的共通性会有几个绕不开的 模块首先是架构层的注意力机制这是大元模型里非常关键的一部分这次陈阳也说 Att ention 机制就是我们 AI 领域研究的特修斯之船这词的本意是关 于事物同一性的哲学比喻如果一艘船的所有部件逐步被替换直到没有原始材料被 保留那它还是原来的那艘船吗其实我们现在对 Trans form er 的改 造我们试遍所有配方的方式就有点类似于 边形传边换零部件而这意味着 Trans form er 这个大的方向继续往下 可能还有很多改进的空间另一个绕不开的是 层与层之间的信息连接方式在 V isa 里我们讨论了 MHC 它是怎么从字节最 开始提的 HC 改进而来的在 K3 里我们讨论的是 Att ention Res id ues K imi 今年春天提出 的这个方案本身也是受到了 MHC 的一些 启发同时我也推荐过往多期节目里我们讨论 过的注意力机制一是第 103 期用 Att ention 串起大模型优化时这是在 25 年 2 月录制的他特别好的一点是对非 从业者相对友好两位清华当时在读的博士 生肖朝军和傅天宇深入浅出的篡讲了 Att ention 机制诞生的过程原初版本的瓶颈他的改进历史和背后的计算机与深 度学习思维脉络简单来说注意力的改进一直是在服务于上下文的不断拓展大家追 求的是希望上下文越来越常识计算和存储的开销不会爆炸也就是一方面要提升效 率但同时又不降低性能然后是 104 期与当时 M ini Max 的高级研发总 监钟怡然聊线性注意力方向的改进这也是我们 K3 这一期 Q 到的 M ini Max 在 M1 就是 25 年年初的一个模型上就大胆的使用了线性注意力的这件事这也是 业界第一个在这么大规模的模型上用线性注意力的尝试跟进的一期是去年底发布 的 143 期节目这次是和 Del ta Net 的核心作者杨松林来聊线性注意 力的优化当时松林是在博士的最后一年他 现在已经加入了 TMLKDA 里的 D 就是 Del ta 的意思那会儿的背景是 25 年的 9 月和 10 月阿里和 K imi 都 发布了和 Del ta Net 相关的注意力改进成果 K imi 当时的那个用 在 K imi Line ar 模型上的注意力改进就是现在 K3 里用的 KDA 这期我们也聊到了 KDA 是从当初 K imi Line ar 这样一个 38B 的小模型给我到了现在 3T 的规模这也是一个挺具体形象的例子它展现了现在的 模型研发中是怎么一步步从小规模的实验再往上 sk ill 的历程期待下一次 的技术解读可以在我们关于 AI 的意义 网络中再点亮新的一点本期节目就到这里, 感谢收听。 如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法, 这也会成为我们节目的一部分,让整个讨论更完整。 你也可以把我们的节目分享给对这个话题感兴趣的朋友, 推荐更多你想听的主题和嘉宾。 你可以从小宇宙、苹果 Pod cast 等渠道关注晚点聊 L ate Talk, 也欢迎关注我们的公众号晚点 L ate Post。 下期再见。
我的播客精华 | 12 档节目速读

我的播客精华 | 12 档节目速读

追踪 Lex Fridman Podcast、Huberman Lab、半拿铁、晚点、硅谷101、张小珺访谈、高能量、疯投圈、乱翻书、屠龙大实话、小天章、纵横四海 12 档播客,每期有新节目发布时自动生成中文摘要文章。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel