
E251|推理芯片之战:Groq、Cerebras 与 OpenAI 三条路径,和 Bill Dally 的芯片设计哲学:完整逐字稿和精华摘要
基于 E251 完整音频整理两位 AI 芯片创业者对 Groq、Cerebras 与 OpenAI 三条推理芯片路径的拆解、推理芯片的评价指标,以及 Bill Dally 的芯片设计方法论,附按说话人分段的完整逐字稿。
节目定位
《硅谷 101》E251 的主播是泓君,嘉宾是两位 AI 芯片创业者。Mark 负责推理芯片的硬件与系统架构,本科毕业后到斯坦福读博,导师是英伟达首席科学家 Bill Dally;徐子扬负责软件与编译器方向,上一段工作在亚马逊 Annapurna Labs,做 Trainium 芯片的软件栈。1 本期讨论的是推理芯片,也就是模型训练完成之后、真正决定 AI 服务成本的那一环,以及 Groq、Cerebras 与 OpenAI 三条路径各自付出的代价。1
本期音频在官方 RSS 的发布时间是 2026 年 9 月 16 日 08:00(北京时间),官方单集页标注时长 1 小时 31 分 32 秒。录制发生在 2026 年 6 月 24 日,节目结尾有一次补录,专门拆解当天 OpenAI 与博通发布的首颗自研推理芯片 Jalapeño。1 本文的摘要与逐字稿都依据完整音频整理,原始入口是 E251 官方单集页,完整音频来自官方 RSS,视频版在硅谷 101 播客的 YouTube 频道。2
官方简介里有一处数字需要对照:简介写 Cerebras「今年 6 月 IPO,市值达到 670 亿美元」,公开报道记录的上市首日则是 2026 年 5 月 14 日,发行价 185 美元,首日收盘上涨约 68%,市值约 950 亿美元。3 本文涉及这组数字时,按公开报道的口径呈现。
这期节目讲了什么
节目从一件容易算错的事开始:训练和推理对芯片的期待并不一样。Mark 给出的第一个理由是商业模式:训练本身没有直接回报,大家只能赌一个最强的集群;推理则是一笔可以算清的账,用户愿意为每百万个 token 付多少钱,系统推出这些 token 又要花多少成本,于是推理追求的是性价比。1 技术上的差别落在并行度:训练和 prefill 阶段有大量 token 可以同时处理,瓶颈在算力;decode 阶段逐 token 生成,每吐一个词都要把整个模型的权重从存储读到计算单元,瓶颈转到带宽。
GPU 应对这个问题的办法是批处理。它把上万个用户的任务凑成一批,同一个位置的 token 一起算完,代价是每个用户都要等同批里其他人算完,这也是单用户推理速度受限的原因之一(约 09:09)。两位嘉宾押注的是另一条路:把权重存进计算芯片内部,用 SRAM 换取更高一个层次的带宽性价比。代价是容量,SRAM 要 6 个晶体管存 1 bit,单芯片能装的容量比 HBM 低大约两个数量级,于是一个模型要拆到上千颗芯片上,瓶颈从芯片内部转移到芯片之间(约 37:38)。
Groq 和 Cerebras 都看到了这个带宽需求,也都在这一步分岔。Groq 把调度放到编译期,让编译器提前排好未来每个时钟周期做什么计算、什么时候开始通信,运行时不再需要动态调度;Cerebras 则把原本放在一个机柜里的几百颗芯片做成一片晶圆,用物理距离换取通信带宽(约 18:20)。两种解法都有代价。Groq 的静态调度预知不了 MoE 的动态性,每个 token 在运行时才决定激活哪些专家,保守做法会让一部分芯片空转,只能用别处节省的带宽性价比把这笔账找回来;Cerebras 要为整片晶圆的良率负责,一片上坏点过多整片作废,它用 partial-good 的设计把可接受的坏点比例做到约 30%,再叠加软件与机柜系统的适配成本,最后都摊到 token 成本上(约 25:18—30:13)。
关于英伟达为什么花约 200 亿美元把 Groq 收进来,Mark 的判断是,推理对带宽提出了 GPU 架构不好解决的新需求,而 CUDA 这样的护城河同时也是创新的包袱,成熟公司内部很难把一个研究方向颠覆式地推给产品团队,直接买下团队和技术更快(约 32:32—33:53)。4 两位嘉宾都认为推理时代 CUDA 会被绕过:训练时代大家愿意为软件好用买单,推理时代的天平偏向 token 成本与速度,而软件门槛本身还在下降——今天需要适配的模型类别收敛到 Transformer 这一大类,算子优化又能被 AI 加速(约 33:58—36:11)。
评价一颗推理芯片,他们给出的顺序是每 token 产出的成本、单用户推理速度、每 token 的耗电量,利用率影响的是成本,并且认为只有在系统层面衡量一颗芯片才有意义(约 41:23)。速度被反复强调的理由在 agent 时代更清楚:大量 token 是给模型自己或别的 agent 读的,交互时间不变的情况下,更快的推理意味着模型能在同样的一分钟里用更多 token 做内部思考(约 44:25—48:00)。
Mark 完整讲了一遍芯片从需求走到交付的流程:需求分析、系统与芯片架构、微架构、feature list、RTL、验证(大量测试用力与形式化证明)、后端版图、流片、封装测试与良率、PCB 与集群的供电散热供网,并说明后端制造要和很多合作方一起完成(约 55:22—60:12)。徐子扬补上了国内的两点结构性优势:推理基础设施(数据中心怎么建、用水用电)的搭建能力,以及可以稳定获取的开源模型,并用亚马逊的「从系统反推硬件」加「customer obsession」解释这套工程哲学(约 01:01:16—01:17:22)。
节目后半段属于 Bill Dally。他在 2009 年 1 月加入英伟达担任首席科学家,此前在斯坦福任教 12 年,做的是后来成为 GPU 基础的流处理研究。5 Mark 讲了从导师那里学到的几件事:找最难、对整个系统影响最大的问题;要做数量级的提升,就必须想清楚牺牲什么,才能跳出局部最优;以及「计算机体系结构就像房地产,关键是位置、位置、位置」——芯片设计的一切围绕局部性展开(约 01:05:17—01:12:22)。
补录部分把 OpenAI 的 Jalapeño 放进同一套框架里比较。这颗芯片由 OpenAI 与博通合作,从设计到流片用了 9 个月。6 徐子扬认为它的思路与两位嘉宾不同:它是一颗通用推理芯片,把 prefill 与 decode、Attention 与 FFN 都收进一颗芯片,把 HBM4 的单封装带宽堆到每秒 15.4TB,并用暗硅(Dark Silicon)的方式在芯片内部做异构。7 这些选择对应的约束是美国的电力供给:数据中心不缺资本和空间,缺的是电,所以每瓦能产出的 token 成了第一位的指标(约 01:17:30—01:29:20)。
嘉宾的几个判断
训练看算力,推理看带宽
- 训练阶段无法用训练本身收回成本,大家追求的是最强集群;推理阶段每一百万 token 的收入与成本都能算清楚,所以系统目标从极致性能转向性价比(约 04:46—05:44,Mark)。
- prefill 阶段一次读完模型就能并行处理整段输入,算力吃得满;decode 阶段每产出一个 token 都要重新读一遍模型权重,带宽成为瓶颈(约 06:34—07:05,Mark;07:15—07:36,徐子扬)。
- GPU 靠批处理摊薄读取成本,把上万用户的同一位置 token 一起算,单用户的等待时间因此被同批用户拉长(约 09:19—09:54,Mark)。
SRAM 路线:用容量换带宽性价比
- 三种存储的距离不同:DRAM 便宜但离得远,HBM 搬到计算芯片旁边、容量大速度快但贵且全球产能紧张,SRAM 能直接做进计算芯片,最快,但同样数据占用的面积是 DRAM 的几十倍到上百倍(约 14:13—15:13,泓君)。
- SRAM 每块钱买到的带宽比 HBM 高两到三个数量级,代价是容量低约两个数量级,所以必须把系统做大,把通信调度变成设计的一部分(约 17:25—18:14,Mark)。
- 两位嘉宾的方案是单颗芯片放几百 MB SRAM,而一个量化后约 1TB 的模型需要上千颗芯片组成网络,让每颗芯片的 SRAM 带宽都被用起来,把连接本身做成不成为瓶颈的拓扑(约 37:29—38:40,徐子扬)。
Groq 和 Cerebras:两种解决通信瓶颈的方式
- Groq 把计算与通信的调度全部提前到编译期,用确定性替代运行时调度;Cerebras 把一柜子芯片压进一片晶圆,缩短物理距离(约 18:24—19:13,Mark)。
- Groq 的确定性建立在对未来的静态假设上,MoE 让每个 token 在运行时挑选专家,静态方案要么把所有专家都送过去造成空转,要么换一个切分维度,而后者很难把现在的模型切得干净高效(约 19:34—21:02,徐子扬)。
- Cerebras 的良率问题被 Mark 用开模类比解释:流片成本可以靠出货量摊薄,但一整片晶圆只要坏点超过阈值就作废,这部分成本直接落在每一颗产出的芯片上(约 25:35—28:04)。
英伟达为什么买 Groq
- Mark 认为原因在于推理带来的新带宽需求 GPU 架构不好解决,而英伟达内部并不缺相关研究,缺的是把研究变成产品的路径(约 32:38—33:53)。
- 这笔交易在公开报道里以「非独家技术许可 + 核心团队加入」的形式呈现,金额约 200 亿美元,是英伟达历史上最大的一笔。4
「推理时代 CUDA 一定会被绕过」
- 徐子扬的判断是绕过 CUDA 会百分之百发生,理由很具体:只要把 Transformer 里的算子在新芯片上写出来,商业逻辑就跑通了,而这件事如今还有 AI 帮忙加速(约 34:16—35:22)。
- Mark 补充了背后的动机变化:训练时代愿意为软件好用买单,推理时代更愿意为更好的性能和性价比买单,DeepSeek 愿意写底层 PTX 汇编就是一个例子(约 35:30—36:11)。
评价一颗推理芯片看什么
- 顺序是每 token 成本、单用户推理速度、耗电量,利用率影响成本;端侧芯片算的是另一笔账,一颗盒子芯片往往先看 100 美元的成本能不能卖出对应速度(约 41:23—42:44,Mark 与徐子扬)。
- TCO 分成一次性投入与运行成本两部分,国内电费约占三分之一,美国约占三分之二,这决定了客户更关心每瓦 token 数还是每美元 token 数(约 42:51—43:55,Mark)。
- 两位嘉宾更关心两个数字:单颗系统每秒能服务单用户多少 token,以及每个 token 的成本;很多做推理芯片的公司给不出这两个数(约 44:06—44:25,Mark)。
速度越快,AI 越聪明
- 人读不动的 token 才是大头:思维链和 agent 产生的 token 主要给模型自己或别的 agent 读,人能读到的速度大约 100 token 每秒(约 44:48—45:36,徐子扬)。
- 交互时间受限于用户耐心,如果一分钟是接受范围,更快的推理意味着这一分钟里能做更多内部思考;黄仁勋演讲里把纵轴设为每瓦 token、横轴标为「更聪明的 AI」,说的就是这件事(约 45:51—47:20,Mark)。
芯片设计的全流程与供应链
- 从需求分析、系统与芯片架构、微架构、feature list、RTL、验证、后端、流片到封装测试与交付,真正写 RTL 只占其中两三个月,前期的需求与架构占掉大部分时间(约 55:22—57:16,Mark)。
- 流片只是第一次掩膜的成本,良率才是量产阶段影响每颗芯片成本的部分;最终交付的是系统,还要包括 PCB、交换芯片、集群供电散热与供网(约 57:37—59:05,Mark)。
- 国内未来两到三年芯片市场会长期供小于求,能否成功的关键不是设计得多好,而是能不能造出足够多的芯片;大胆的架构创新放松了对最先进制程的要求(约 01:00:21—01:01:11,Mark)。
- 模型厂商做芯片要兼顾训练、图像生成与推理等多元业务,纯模型公司与芯片公司需要的能力并不相同(约 01:03:57—01:05:16,Mark)。
Bill Dally 的方法论
- Bill Dally 在 2009 年 1 月加入英伟达担任首席科学家,之前在斯坦福任教 12 年,流处理研究是今天 GPU 的源头之一。5
- Mark 说导师关心的是本质问题:找最难、对系统影响最大的点;只做微小提升时不必牺牲什么,要做数量级提升就必须想清楚哪些可以牺牲(约 01:11:43—01:12:22)。
- 「计算机体系结构就像房地产,关键是位置、位置、位置。」时间局部性与空间局部性在 decode 阶段被算法抹平,所以要用硬件上的局部性来补(约 01:10:46—01:11:38)。
- 他给学生的创业建议是不要用 PhD 写的代码;做研究的本质是用最小的代价获取最多的知识,工程实现贡献的是能不能做出来的那部分(约 01:13:03—01:14:46)。
OpenAI 的另一种取舍:芯片内异构与暗硅
- 徐子扬认为 Jalapeño 是一颗通用芯片:它对小维度矩阵乘法做了支持,小 batch 下性能也好,把此前分散在不同芯片上的活收进一颗芯片,公开信息里甚至提到下一代要支持训练(约 01:18:05—01:19:31)。
- 它走的是 HBM4 这条路,指向的是约束差异:美国的瓶颈是电力供给,资本开销相对不敏感,所以每瓦产出的 token 比每美元买到的带宽更重要(约 01:20:42—01:21:31)。
- SRAM 的优势窗口没有关上:HBM 每一代带宽的增量从哪里来本身也不确定(约 01:24:43—01:25:09,徐子扬)。
- 暗硅是芯片内部的异构:需要时关掉部分单元以换取电效率,代价是花更多钱买芯片;系统级异构与芯片内异构是两种回答,各自对应不同的限制条件(约 01:27:20—01:28:08,徐子扬)。

关键节点
以下时间点依据官方单集页的节目章节,内容按完整音频整理。1
- 04:17|为什么训练看算力,推理看带宽:训练赌最强集群,推理要算清每 token 的成本;prefill 有并行度,decode 逐 token 自回归。
- 14:13|SRAM、DRAM、HBM 的优劣:泓君用「离干活的地方有多远」解释三种存储,并给出各自的代价。
- 16:39|Groq 和 Cerebras 的技术路径选择:两家都选了 SRAM,代价是容量,系统随之做大。
- 19:34|Groq:确定性、静态编译调度,动态性不足:编译器提前排好调度,遇到 MoE 的运行时选择就只能用空转换确定性。
- 25:18|Cerebras 的软肋:良率、成本与系统适配:整片晶圆一处不达标整片作废,软件与机柜适配都要自己解决。
- 32:32|英伟达为什么要 acqui-hire Groq:推理的带宽需求是 GPU 架构不好解决的部分,外部团队比内部推动更快。
- 33:58|「推理时代 CUDA 一定会被绕过」:为软件好用付费的时代过去了,为 token 成本和速度付费的时代到来。
- 39:19|两位芯片创业者的 SRAM 推理芯片方案:单颗几百 MB,量化后约 1TB 的模型交给上千颗芯片与一套拓扑。
- 41:07|最重要的指标:速度、性价比、耗电量:成本优先,利用率影响成本,端侧与云端算的是两笔账。
- 44:25|速度越快,AI 越聪明:token 主要给模型自己读,交互时间不变时速度换来的是内部思考量。
- 49:04|面对模型迭代,抓住「不变量」:attention 还在变,MoE 之后的 FFN 相对稳定,芯片挑收敛的部分做。
- 54:15|消失的算力:为何芯片利用率跑不满:计算与访存的比例不在 GPU 的甜点上,细碎算子又带来调度损失。
- 58:27|芯片设计全流程:需求、架构、RTL、验证、后端、流片、封装测试、良率、交付。
- 01:01:16|国内优势:供应链 + 基础设施 + 开源生态:成熟制程加架构创新,数据中心与开源模型都在手边。
- 01:03:17|创业者做芯片,如何和模型厂商竞争:大厂芯片要兼容多元业务,模型公司与芯片公司需要的是不同能力。
- 01:05:17|为未来 AI 补齐强逻辑:Bill Dally 早早关注强逻辑加速,这条路的算法到今天还没收敛。
- 01:09:40|「一切围绕局部性展开」:时间与空间局部性在 decode 阶段被抹平,硬件要把局部性补回来。
- 01:11:43|跳出 local minimum,必须想清楚牺牲什么:数量级提升的前提是承认代价。
- 01:13:03|Bill 给学生的创业建议:不要用 PhD 写的代码。
- 01:14:47|亚马逊的工程哲学:从系统反推硬件,先想清楚用户最后要什么。
- 01:17:30|Jalapeño:通用芯片,低能耗,9 个月流片:一颗芯片包下 prefill 与 decode、Attention 与 FFN。
- 01:20:10|选择 HBM4,不缺钱,但缺电:约束不同,最优解不同。
- 01:24:15|SRAM 优势还能保持多久:HBM 的带宽增量来源本身也不确定,KV Cache 是 SRAM 不舒适的区间。
- 01:27:03|芯片内异构,暗硅,另一种路径:用更多芯片成本换电效率,系统级异构之外的另一条回答。
术语
- Prefill / Decode:大模型推理的两个阶段。Prefill 一次并行处理完整输入,生成 KV Cache 与第一个 token,吃算力;Decode 基于 KV Cache 逐个自回归生成后续 token,每生成一个词都要把模型权重从存储读到计算单元,吃带宽。
- KV Cache:注意力机制里的中间计算结果,用来避免重复计算历史 token 的键值向量;长上下文对它的容量需求很大,也是本期讨论 SRAM 是否适用的关键场景。
- Attention / FFN:Transformer 的两大模块。Attention 负责让每个 token 关注序列里的其他 token,参数量较小、计算模式随上下文长度变化;FFN 独立处理每个 token,是静态权重的主体。
- SRAM / DRAM / HBM:SRAM 用 6 个晶体管存 1 bit,延迟最低、带宽性价比最高,容量极小,可以做进计算芯片内部;DRAM 用 1 个晶体管加 1 个电容,容量大成本低,但延迟高;HBM 是 3D 堆叠的 DRAM,靠超宽总线做高带宽,容量大、成本高、产能紧张。
- MoE(混合专家):把 FFN 拆成很多个专家,每个 token 在运行时只激活其中一小部分,比如 128 个里选 8 个,这层选择无法在编译期预知。
- 局部性(Locality):时间局部性指刚用过的数据很可能马上再用,空间局部性指用到一段数据时往往也会用到它周围的数据。本期用它解释为什么把权重放得离计算更近能换来带宽。
- Roofline / MFU / MBU:Roofline 描述计算与访存之间的平衡,决定了某个模型跑在这颗芯片上能到什么水平;MFU 是算力利用率,MBU 是访存带宽利用率,两者都要看。
- 流片(Tape Out):设计完成后把版图交给晶圆厂制造的过程,晶圆厂据此制作掩膜再光刻生产。先进制程一次流片可达数百万美元,第一次掩膜是固定成本,良率才是量产阶段的成本变量。
- 异构:用最合适的硬件做对应部分的应用。本期区分了两种:系统级异构是把不同芯片组合起来分工,芯片内异构是一颗芯片里放不同单元、按需开关。
- 暗硅(Dark Silicon):芯片内部并非所有单元同时工作,可以通过关闭部分单元或降低其功耗来换取电效率,代价是为一颗更全能的芯片付更多钱。
- acqui-hire:以技术许可加团队的方式把人和技术收进来,公司本身仍然独立运营。本期指英伟达与 Groq 之间约 200 亿美元的这笔交易。
- TCO / CAPEX / OPEX:数据中心的总持有成本分成一次性投入(芯片、机房)与运行成本(电力、散热等),两者的比例决定了客户更关心每美元 token 还是每瓦 token。
几句原话
「computer architecture is like real estate, it's all about location, location, location.」
——Mark 转述 Bill Dally 的原话,约 01:10:46。
「Groq 的话其实是在他做出我需要依靠编译器做完全静态的调度和编译这个选项的时候,没有办法去预先知道现在大模型 Transformer 推理里面有如此大的动态性。」
——Mark,约 19:34。
「做研究的本质就是用最小的代价获取最多的知识,这是他认为研究的本质。」
——Mark 转述 Bill Dally,约 01:13:53。
「所以未来我们是否能成功的关键并不一定在于比如说我们的芯片设计的多好,其实就在于能不能造出足够多的芯片了。」
——Mark,约 01:00:30。
「我觉得这个其实就是在不同的市场下,它的限制条件不一样,会走出不一样的路径。」
——徐子扬,约 01:28:47。
完整逐字稿(按说话人)
下面按音频时间顺序保留完整识别片段,每一段标注说话人与时间。逐字稿基于完整音频生成,已补全句读并校正明显的人名与术语识别错误,保留口语、重复语与中英文混用;识别异常处用标记说明,中插广告等非访谈内容单独标出。说话人依据语音区分并结合上下文校正,个别快速交替处的归属可能存在偏差,引用某句话前建议对照音频时间点。
主播/泓君|00:00:01 Hello 大家好,欢迎来到硅谷 101,我是泓君。
主播/泓君|00:00:04 过去几年,我们通过播客与视频,跟大家一起追踪了这一轮 AI 浪潮中最值得关注的公司、技术还有人。
主播/泓君|00:00:13 今年,我们会继续把讨论带到线下,也把那些真正身处在变化中心的人带到大家的面前。
主播/泓君|00:00:21 今年 10 月 10 号到 11 号,硅谷 101 会在硅谷的 Sunnyvale 举办我们第三届 Alignment 2026 年度大会。
主播/泓君|00:00:29 我们也会在现场聊一聊日常创作节目中的一些花絮,期待与大家线下见。
主播/泓君|00:00:35 报名链接我已经放在 Show Notes 中了,感兴趣的听众欢迎通过 Show Notes 报名。
主播/泓君|00:00:41 那今天我们来聊一聊推理芯片。
主播/泓君|00:00:44 随着 Token 经济的发展,推理消耗的 Token 在过去几年是涨了几个数量级。
主播/泓君|00:00:50 这一集我们就聊一聊推理芯片到底是什么,以及像 Groq 和 Cerebras 它们不同的技术路径和各自的优缺点是什么。
主播/泓君|00:01:00 我们的录制是在今年的 6 月 24 号,巧的是在那天,OpenAI 发布了它们第一颗推理芯片。
主播/泓君|00:01:07 而它在存储上的选择和我们今天的两位嘉宾判断不太一样,这一点我们会在节目最后专门去拆解。
主播/泓君|00:01:16 本期嘉宾自己也在做 AI 推理芯片的创业,只是还在更早的阶段,所以我们今天聊到的这些公司对他们来说既是研究对象,也是参照系。
主播/泓君|00:01:27 其中,Mark 是英伟达首席科学家 Bill Dally 的学生。
主播/泓君|00:01:31 那 Bill Dally 他是现代 GPU 并行架构最重要的奠基者之一。
主播/泓君|00:01:37 我们也会通过 Mark 的视角聊一聊这位芯片大师是怎么看问题、拆解问题的。
主播/泓君|00:01:43 下面就请收听我们今天的节目。
主播/泓君|00:01:47 今天跟我在一起的两位嘉宾,一位是负责推理芯片的硬件,还有系统架构的 Mark。
主播/泓君|00:01:52 Hello Mark 你好。
嘉宾/Mark|00:01:53 Hello, 大家好。
主播/泓君|00:01:54 还有一位是子扬,子扬是负责软件和编译器方向的。
嘉宾/徐子扬|00:01:59 Hello, 大家好,我是子扬。
主播/泓君|00:02:00 因为我们今天要讲推理芯片,大家要不要先简单介绍一下自己的背景,以及自己跟芯片的关系是什么?
嘉宾/Mark|00:02:07 OK 我是 17 年的时候去 Stanford 读了 PhD 然后方向也是 EE 的方向。
嘉宾/Mark|00:02:12 导师是 Bill Dally Bill 是在英伟达从早期的 GPU 显卡芯片转型到现在 AI 芯片这个过程中。
嘉宾/Mark|00:02:19 参与了非常多技术上面的方向和决策。
嘉宾/Mark|00:02:23 所以本身我读 Ph.D 的时候就对 AI 计算尤其 GPU 怎么做这方面有相对的了解。
嘉宾/Mark|00:02:28 但是其实我本身读 Ph.D 的时候更多的注重在可能面向一个大的 CPU 集群里面的一些内存语义的调度控制通信这方面的很多系统层次的架构的设计。
嘉宾/Mark|00:02:40 我 PhD 毕业之后在国内的芯片大厂做了三年左右的偏向通用 GPU 类芯片研发的工作。
嘉宾/Mark|00:02:47 我可能做的硬件比较多,其实是因为我当时做的可能更多的是从芯片架构的设计一直到几百个芯片这种类似超级点的设计。
主播/泓君|00:02:55 嗯嗯,那也请子扬来介绍一下自己过往的工作经历。
嘉宾/徐子扬|00:02:59 我的上一段工作是在亚马逊的 Annapurna Labs 做 Trainium 芯片上的软件栈。
嘉宾/徐子扬|00:03:05 作为 scientist 的 role,所以会看更前瞻一些的东西。
嘉宾/徐子扬|00:03:09 我从最下面的这种算子的编译优化,一直到上面的算法的模型切割,怎么把这个模型确定地放在我们这种大集群上,都做了很多工作。
嘉宾/徐子扬|00:03:19 我在本科的时候,当时还是上一波语音和图像识别的时候,我就在做云端编的一些整合。
嘉宾/徐子扬|00:03:26 我的本科毕业论文其实就在做的端测和编测的语音识别的加速工作。
嘉宾/徐子扬|00:03:32 其实我在本科在爱丁堡交换时候还做了语言模型的一些前期工作,不过和现在大语言模型没什么关系。
嘉宾/徐子扬|00:03:40 博士在普林斯顿读的时候,我做的一段和 AI 相对没有什么关系的,在做多核上的并行计算。
嘉宾/徐子扬|00:03:48 其实把单一现成的一个东西放在 500 多个 CPU 核上去做,这个其实和现在的一些 AI 系统上要做的一些加速有一些关系,
嘉宾/徐子扬|00:03:56 但是当时做的这个 workload 本身是传统的一些 CPU workload。
主播/泓君|00:04:00 对,所以我可以简单来说就是 Mark 你其实是一直在研究这个芯片它的硬件怎么搭,包括跟它的内存、它的通信之间是有很多的关系的。
主播/泓君|00:04:10 子扬其实你在亚马逊的工作经历主要是从跟芯片结合的软件层来去做这一部分的工作的。
嘉宾/徐子扬|00:04:17 没错。
主播/泓君|00:04:17 大家要不要跟我们的听众简单的介绍一下?
主播/泓君|00:04:21 大家通常在说大模型需要 GPU,但是这个 GPU 它也是分类的,比如说有一部分是训练芯片,现在可能更多的是推理芯片。
主播/泓君|00:04:30 那么芯片训练跟推理对芯片的不同要求是什么?为什么它可能要的是两种不一样的芯片?
嘉宾/Mark|00:04:37 这点我觉得有两个层面,可能不光是技术科普的角度,我觉得从商业模式上,其实大家需要这个系统来做什么样的事情本身也是有比较大的区别。
嘉宾/Mark|00:04:46 一个是大家有多关心成本,另外一个点是技术上大家多关心带宽,而不是多关心算力,成本的角度我觉得是商业模式决定的。
嘉宾/Mark|00:04:56 就在训练的时代,大家是没有办法依靠训练来获得任何商业上的回报的。
嘉宾/Mark|00:05:02 就训练本身是一个没有直接回报的事情。
嘉宾/Mark|00:05:06 所以当大家开始计算训练的成本的时候,这个东西是不可量化的。
嘉宾/Mark|00:05:10 大家的期望都是我要赌一个最强大的训练集群。
嘉宾/Mark|00:05:14 可以让我拥有最强大的模型。
嘉宾/Mark|00:05:16 而这个最强大的模型未来可能会在推理的场景下。
嘉宾/Mark|00:05:19 帮助我把之前训练投入的成本都能够收回来。
嘉宾/Mark|00:05:23 但是推理的时候。
嘉宾/Mark|00:05:24 从商业上的角度来讲。
嘉宾/Mark|00:05:25 这就是一个可以很容易很清楚算明白账的事情。
嘉宾/Mark|00:05:29 用户愿意为比如每百万个 Token 付多少钱。
嘉宾/Mark|00:05:32 我推理的系统推理出这百万 Token。
嘉宾/Mark|00:05:34 我需要花多少成本。
嘉宾/Mark|00:05:35 成本可能包括比如我要买 GPU 的成本。
嘉宾/Mark|00:05:37 包括我推理的时候要消耗电。
嘉宾/Mark|00:05:39 所以推理这件事情从商业的角度来讲。
嘉宾/Mark|00:05:42 它是一个追求性价比。
嘉宾/Mark|00:05:44 而不是追求极致的性能,他会更多的把成本考虑进来。
嘉宾/Mark|00:05:48 比较有意思的点就是算力密度,它的英文是 arithmetic intensity,也简称 AI。
嘉宾/Mark|00:05:53 对,然后其实本质的点是训练的时候你是有海量的数据,可以把你多的这部分算力都充分的另起来。
嘉宾/Mark|00:06:00 它有足够的并行度。
嘉宾/Mark|00:06:02 但是推理的时候,语言模型大家认为是一个强逻辑的事情。
嘉宾/Mark|00:06:05 这个逻辑是需要一定的顺序来完成的。
嘉宾/Mark|00:06:09 举个例子,我说一句话,我可能必须得第一点是什么,第二点是什么。
嘉宾/Mark|00:06:13 我第二点可能要基于我第一点说了什么来顺序的去展开。
嘉宾/Mark|00:06:16 所以说导致现在整个语言模型 token 生产的这个过程,
嘉宾/Mark|00:06:20 在推理的过程里面是严格意义上线性的,或者说是严格意义上自回归的。
嘉宾/Mark|00:06:25 就我必须知道了我当前的 token 推出来的结果是什么,我把这个结果作为输入喂给我的模型,它才能告诉我下一个 token 应该是什么。
嘉宾/Mark|00:06:34 就这种就导致了它的计算的模式变成了像训练或者在一些比如 prefill 阶段的特征是你有很多个 token 可以并行的处理。
嘉宾/Mark|00:06:43 但是在 Decode 真的产生 Token 的时候,变成了我必须一个一个 Token 去产生。
嘉宾/Mark|00:06:48 但是每次产生一个 Token 的代价,其实是把你所有这么大的一个模型,1.6T 的模型,都从你的存储介质里面读到计算单元里面。
嘉宾/Mark|00:06:57 所以这个是本质的产生了推理,尤其是 Decode 的阶段对于算力和带宽的需求产生了本质的变化。
主播/泓君|00:07:05 我可不可以理解成 GPU 在训练部分要核心解决的问题是算力,
主播/泓君|00:07:10 然后在推理部分要核心解决的问题是内存带宽,
嘉宾/徐子扬|00:07:15 应该是说在训练的时候,或者在推理的分成两个阶段,pre-fill 的这个阶段,它有大量的并行度,所有的 token 都是已知的。
嘉宾/徐子扬|00:07:25 我用大量的并行度可以在读取一次数据以后同时做非常多的计算。
嘉宾/徐子扬|00:07:30 GPU 这个本身的硬件需要你同时做非常多的运算,才能把它硬件资源给用满。
嘉宾/徐子扬|00:07:36 它这个比例下的带宽其实不足的。
主播/泓君|00:07:39 OK,我们给用户一个更加形象化的解释吧。
主播/泓君|00:07:42 就比如说我给大模型问了一个问题,你出一个今天我们的采访提纲,当用户把这样的一个提示词输给大模型,然后他要开始去做推理,他要开始去写这个提纲的时候,他会用到多少的 GPU 或者是推理芯片?
主播/泓君|00:08:01 用 GPU 跟用专业的推理芯片,它产生的结果从延迟性、从成本上会有什么样的不一样?
嘉宾/Mark|00:08:09 对,我觉得这是一个比较好的例子。
嘉宾/Mark|00:08:11 在 prefill 阶段,它是可以并行地处理我刚刚说的所有的单词的,
嘉宾/Mark|00:08:16 它可以把这一整句话同时喂给这个模型,
嘉宾/Mark|00:08:19 让它去推理出它要出的提纲的第一个词,比如它的回答可能是好的,
嘉宾/Mark|00:08:24 那这个好的是它在接收到的这句完整的信息之后吐出的第一个 token。
嘉宾/Mark|00:08:28 刚刚说的 prefill 这部分,它是有充足的并行度的,
嘉宾/Mark|00:08:31 它只要把模型从 GPU 的 HBM 里面读到计算单元里面一次,
嘉宾/Mark|00:08:35 就可以把刚刚说的一句话里面比如 10 个 token 同时处理完。
嘉宾/Mark|00:08:39 但是你刚刚指的 10 个 token 很可能是你先喂给它的一些文章。
嘉宾/Mark|00:08:42 那这些东西其实可以带来足够多的并行度。
嘉宾/Mark|00:08:44 让 GPU 把它的算力都充分的利用起来。
嘉宾/Mark|00:08:47 但是到了推理这块比如说他要说。
嘉宾/Mark|00:08:49 好的下面是我为你准备的一份采访提纲。
嘉宾/Mark|00:08:52 比如说那这一句话里面每一个 token 每一个词。
嘉宾/Mark|00:08:55 都意味着你需要把你的模型从存储阶级里面读上来一遍。
嘉宾/Mark|00:09:00 这个是我觉得更形象的说了在读取模型次数上面大家可以很清楚的感受到你是一句话读一次还是一个词读一次读的量都是整个模型的权重。
嘉宾/Mark|00:09:09 实际过程中我们看到因为 GPU 它其实不能接受你把模型从 HBM 读到计算单元里面就只真的处理一个用户的 token。
嘉宾/Mark|00:09:19 所以它真正做的其实是它要做我们叫 batching 或者批量化处理这样一个操作,它要收集 1 万个用户的不同的推理的任务。
嘉宾/Mark|00:09:27 他虽然对于一个用户来说,他必须要顺序的一个词跟着一个词来推理,但是他可以并行的把这一万个用户里面的所有的比如第一个词、第二个词、第三个词一起推理出来。
嘉宾/Mark|00:09:38 所以这时候从用户的角度,他会感受到为什么我这推一个 token 这么慢的点,其实核心在于如果用 GPU 来做这件事情的话,你不光是在等 GPU 推理完你自己这一个 token,你还在等 GPU 算完和你同一批里面其他 9999 个用户的这一个 token。
嘉宾/Mark|00:09:54 因为 GPU 这种大的算力密度,用 HBM 提供了非常昂贵的带宽,导致其实用户体验下来,现在不管是 agent 的场景,还是 reasoning 自己思考的场景,大家对于推理的速度有比较强的限制。
主播/泓君|00:10:06 对,那如果用推理芯片呢?
嘉宾/Mark|00:10:08 我觉得推理芯片其实是一个非常非常非常范的词。
嘉宾/Mark|00:10:13 因为本身推理也是一个足够复杂的任务。
嘉宾/Mark|00:10:15 分这个 prefill 分这个 decode。
嘉宾/Mark|00:10:17 decode 里面其实因为模型还分什么。
嘉宾/Mark|00:10:19 tension ffn。
嘉宾/Mark|00:10:20 我们是觉得未来我们希望的推理系统。
嘉宾/Mark|00:10:23 就它里面可能包含了很多种不同的芯片。
嘉宾/Mark|00:10:26 能够做到把实际 decode token 这个过程做得足够便宜,而且足够快。
嘉宾/Mark|00:10:32 这可能是我们现在看到的一些需要打破 GPU 传统的这种架构,
嘉宾/Mark|00:10:37 做一些更针对性的新的架构,以及用一些有异于 HBM 的其他介质,来做的意义所在。
主播/泓君|00:10:44 我知道你们也在做这个方向。
主播/泓君|00:10:46 从现在市面上已经出来的说我要自己做推理芯片的这些公司来说,
主播/泓君|00:10:53 你觉得做最好的是哪一家?比如说 Groq 怎么样?
嘉宾/Mark|00:10:55 我觉得 Groq 和 Cerebras 都是在这个技术路线上。
嘉宾/Mark|00:10:59 我觉得大家是看到了正确的问题。
嘉宾/Mark|00:11:01 我觉得他们确实在已经把东西做出来。
嘉宾/Mark|00:11:04 而且像 Groq 现在和英伟达配合的关系。
嘉宾/Mark|00:11:07 确实是我们设想中比较理想的。
嘉宾/Mark|00:11:09 比如 GPU 处理哪一部分任务。
嘉宾/Mark|00:11:11 然后由 Groq 处理哪一部分任务。
嘉宾/Mark|00:11:13 所以我觉得整体在这件事情大的方向上面。
嘉宾/Mark|00:11:16 尤其是在英伟达把 Groq 收进来之后。
嘉宾/Mark|00:11:19 更好地做一个异构的推理系统的角度来讲。
嘉宾/Mark|00:11:22 其实我现在是比较看好 Groq 的技术路线。
主播/泓君|00:11:25 嗯嗯,怎么说,可以展开聊一下吗?
嘉宾/Mark|00:11:27 我觉得最关键两个点吧。
嘉宾/Mark|00:11:29 一个是怎么提供刚刚说的高性价比的带宽。
嘉宾/Mark|00:11:33 包括我们最初想做我们现在的这个项目,
嘉宾/Mark|00:11:36 其实也是因为看中了有远比 HBM 要好两三个数量级更好带宽性价比的介质。
嘉宾/Mark|00:11:42 这种介质其实不在介质本身,而在于你要关注局部性的问题。
嘉宾/Mark|00:11:46 你要提供比起 HBM 更高一层的局部性,
嘉宾/Mark|00:11:50 也就是 HBM 其实是把存储和计算放到了一个封装里面。
嘉宾/Mark|00:11:54 这个其实是 HBM 它之所以带宽能做到很高。
嘉宾/Mark|00:11:56 但其实我们是希望把这个高放到下一个层次。
嘉宾/Mark|00:12:00 就我们希望把存储直接放到计算的芯片里面。
嘉宾/Mark|00:12:03 因为带宽其实核心就是你连线的密度以及频率。
嘉宾/Mark|00:12:07 当你把这个线从封装的走线。
嘉宾/Mark|00:12:10 变成了计算芯片内部光刻的这个线。
嘉宾/Mark|00:12:14 这两种线的本质在线的密度、线的成本,包括能耗上面都是有本质的差别的。
嘉宾/Mark|00:12:20 如果有些介质让我能够把模型权重放到我的计算单元或我的计算芯片上面,那其实就是一个质的提升,这个是解决最本质的带宽的问题的方法。
嘉宾/Mark|00:12:30 而 SRAM 只是刚好一个在目前这个阶段最成熟的、最可靠的,可以让你有机会把存储放到计算芯片里面的一个方式。
主播/泓君|00:12:40 嗯,现在 Groq 是这种方式吗?我知道你们要做这样的方式,然后 Groq 也是这种方式。
嘉宾/Mark|00:12:45 对,Groq 是这种方式,就是我刚刚说的一个点。
嘉宾/Mark|00:12:46 然后另外一个点,其实我去觉得是异构的这个点。
嘉宾/Mark|00:12:49 就我之所以觉得 Groq 比起 Cerebras 做的稍微好一点的点,其实就在于它和 GPU 可以更好结合起来。
嘉宾/Mark|00:12:56 因为我们刚刚聊到的推理的这些过程,大家发现推理不是钢板一块,它里面其实有这个算力密集的部分。
嘉宾/Mark|00:13:03 当你同时处理第一句的 prompt 的部分的时候,你是有机会做的很算力密集的。
嘉宾/Mark|00:13:08 那部分更多的 GPU 做的也很好。
嘉宾/徐子扬|00:13:11 如果你未来的一个系统是一个更好的把异议扣这个点可以做的比较极致的话,其实在芯片以外的系统层次,我觉得会有更大的一些优势。
嘉宾/徐子扬|00:13:21 我们其实刚刚的一段时间的讨论都是围绕着云端的推理芯片。
嘉宾/徐子扬|00:13:25 推理芯片是一个很巨大的市场,其实还有端侧的推理芯片,云端的边侧的,大家各有侧重。
嘉宾/徐子扬|00:13:32 我们这里也会更深入地研究云端这个推理芯片它是什么样子的。
嘉宾/徐子扬|00:13:36 大家都要去获得相对低廉的这个带宽,但比如说在端侧上它有其他的一些限制,比如它物理上的空间上的限制。
主播/泓君|00:13:45 它这是一个小设备,它没有办法把足够的你这个内存的带宽放进去。
嘉宾/徐子扬|00:13:49 对,然后还有一些功耗上的限制,这样就导致了在端册上面我可能会看到还有其他的一些思路,比如说 3D DRAM,其实有很多思路都在提供更高更便宜的带宽,包括我们现在听到的所有 HB 开头的这个词,HBM, HBF,它都是想要把原先的一个介质做到更高的带宽,当然在这个做的过程中也希望它能更便宜。
主播/泓君|00:14:13 那我先花一点时间解释一下我们这集要频繁提到的三个词 SRAM、DRAM 还有 HBM。
主播/泓君|00:14:20 最简单的理解方式就是它们都是存储数据的地方,
主播/泓君|00:14:24 但是区别就是说离干活的地方有多远。
主播/泓君|00:14:27 DRAM 是你电脑里面的内存条,它能装很多,但是离得远。
主播/泓君|00:14:32 来回取数据要花时间。
主播/泓君|00:14:34 HBM 把 DRAM 搬到了计算芯片的旁边,
主播/泓君|00:14:38 而且还开了很多条通道,
主播/泓君|00:14:40 所以它的容量大速度也快,
主播/泓君|00:14:42 现在英伟达的高端 GPU 用的就是它。
主播/泓君|00:14:45 它的代价是什么呢?
主播/泓君|00:14:46 就是贵,而且全球的产能非常紧张。
主播/泓君|00:14:50 SRAM 不一样,它可以直接坐在计算芯片里面,
主播/泓君|00:14:54 所以它其实是最快的方案,快很多。
主播/泓君|00:14:56 但是它有一个致命的缺点就是太占地方。
主播/泓君|00:15:00 存同样多的数据,SRAM 需要的芯片面积是 DRAM 的几十倍上百倍。
主播/泓君|00:15:05 所以我们总结一下,就是说 DRAM 它的方向是便宜,但是慢。
主播/泓君|00:15:10 HBM 快,但是贵,而且抢不到货。
主播/泓君|00:15:13 SRAM 最快,但是它装不下。
主播/泓君|00:15:15 那好,子扬你继续。
嘉宾/徐子扬|00:15:17 对,但是我们刚刚讨论的在云端这个场景,我们可能对整个系统铺多大,没有那么大的限制,只要它能给我们提供足够多的吞吐。
嘉宾/徐子扬|00:15:26 那我们会去很本质地考虑在这么一个限制条件下,什么样的物理介质能为我们提供最密的连线和最高的带宽,所以我们是找到的 SRAM。
嘉宾/徐子扬|00:15:37 另外一个补充点就是 Groq 和 Cerebras 这两家公司本质上它的速度和它可能的性价比现在还没有他们没有在注重说这一点。
嘉宾/徐子扬|00:15:46 其实都是来自于 SRAM。
嘉宾/徐子扬|00:15:48 不仅仅是他们。
嘉宾/徐子扬|00:15:49 现在其他的一些美国的 AI 推理芯片的创业公司。
嘉宾/徐子扬|00:15:53 包括 D-Matrix, Metax。
嘉宾/徐子扬|00:15:55 他们也是往这 SRAM 方向走。
嘉宾/徐子扬|00:15:57 并且大厂 TPU, Trainium。
嘉宾/徐子扬|00:15:59 如果我们去看现在所有发布的芯片。
嘉宾/徐子扬|00:16:01 每一代它的 SRAM 都是变得越来越大的。
嘉宾/徐子扬|00:16:04 每一个具体的云端的推理的解决方案里,大家用 SRAM 的方式是不同的。
嘉宾/徐子扬|00:16:10 比如说谷歌他可能会把 SRAM 用更多来存 KV Cache,至少他的 blog 是这么说的。
嘉宾/徐子扬|00:16:16 其他的公司都有其他的设想,但本质上用好这个大带宽的介质来把整个系统的访存更加速更廉价。
嘉宾/徐子扬|00:16:24 整个 SRAM 和现有的其他的提供存储的介质来比,从带宽这个角度,它无论是绝对的数量,还是它每块钱能买到的它的性价比都是非常高的。
嘉宾/徐子扬|00:16:35 所以其实我们能看到大家都在往这个方向去收敛。
主播/泓君|00:16:39 嗯嗯对,因为我刚提到有 trade-off 嘛,大家可不可以先跟大家一句话总结一下,Cerebras 它相当于是在一个巨大的晶圆上做一整块的芯片设计,它的优点是什么,缺点是什么,它跟 Groq 相比它的优劣是什么,然后大家各自的 trade-off 是什么?
嘉宾/Mark|00:16:57 对我觉得可以以一个更统一的视角去看大家做的这些事情。
嘉宾/Mark|00:17:01 比如以 Cerebras 和 Groq 为例。
嘉宾/Mark|00:17:03 我觉得大家是在 Transformer 还出来之前。
嘉宾/Mark|00:17:05 就看到了未来可能有一部分 AI 的系统是对于带宽有非常非常大的需求的。
嘉宾/Mark|00:17:11 大家都经历了我们刚刚经历的这个思想过程。
嘉宾/Mark|00:17:13 怎么把带宽做的更便宜做的更高。
嘉宾/Mark|00:17:16 最后都发现其实 SRAM 是一个比较好的介质。
嘉宾/Mark|00:17:19 但是做这件事情似乎有 trade off,就是你要跳出 local minimum,你是要损失一点东西的。
嘉宾/Mark|00:17:25 SRAM 损失的东西其实就是单芯片的容量。
嘉宾/Mark|00:17:27 DRAM 是一个晶体管和一个电容去做一个比特存储,然后 SRAM 本质需要六个晶体管。
嘉宾/Mark|00:17:33 就这也是代表它面积,存储一个比特的代价会变高,一个芯片上能做的容量会变得很低,就可能比 HBM 要低两个数量级。
嘉宾/Mark|00:17:41 大家都发现了这一点,怎么把容量提升呢?就是最简单最直接的就是你要把整个系统做的很大,你要做几百个芯片几千个芯片,单纯就为了把你所有的模型全程都能放到 6 个晶体管的 SRAM 里面。
嘉宾/Mark|00:17:53 大家就会发现放式都能放下去,只要我系统做的够大就能放下,但这问题在于你光放下了,它如果就在里面存着其实不能产生 token,你得以一种方式把它读出来并且做有效的计算。
嘉宾/Mark|00:18:05 这时候大家会发现当你系统做得足够大了之后。
嘉宾/Mark|00:18:08 很多计算或整个系统效率的瓶颈就卡在了怎么做通信这件事情上面。
嘉宾/Mark|00:18:14 所以本身大家思想的思维实验其实都做到了这一步。
嘉宾/Mark|00:18:17 这时候 Cerebras 和 Groq 开始产生分歧了。
嘉宾/Mark|00:18:20 大家用了两条不同技术路线来尝试解决大集群通信调度的问题。
嘉宾/Mark|00:18:24 Groq 的思路是因为这个实际的调度。
嘉宾/Mark|00:18:27 它如果在运行时去做 那开销往往会很大。
嘉宾/Mark|00:18:31 他希望把这个实际的调度放在运行之前。
嘉宾/Mark|00:18:34 也就是在编译器这个时间点。
嘉宾/Mark|00:18:36 就把未来芯片整个系统里面可能做的所有的计算通信都想明白了。
嘉宾/Mark|00:18:41 我们哪个时钟周期要做什么样的计算。
嘉宾/Mark|00:18:43 然后我哪个时钟周期要开始做通信。
嘉宾/Mark|00:18:46 他把这些都排不好了之后,实际运行的时候就没有调度的这个问题了。
嘉宾/Mark|00:18:50 这时候某种程度上缓解了刚刚说的集讯大了,调度成为瓶颈的问题。
嘉宾/Mark|00:18:56 Cerebras 我们觉得就更简单粗暴一点,
嘉宾/Mark|00:18:58 就是说你之所以集讯通信有代价是因为你是要一个柜子几百个芯片做这个事情,
嘉宾/Mark|00:19:03 大家总是物理距离的嘛,
嘉宾/Mark|00:19:05 那如果把你一个柜子的事情塞到了一个大的 wafer 上面,
嘉宾/Mark|00:19:08 那自然这个物理的距离啊,
嘉宾/Mark|00:19:10 然后它能出的这个线的带宽啊都会变得更好一些。
嘉宾/Mark|00:19:13 但是我们看起来首先他们在他们做这个技术决策那个时间点。
嘉宾/Mark|00:19:18 没有足够的信息来支撑他们未来需要具体面向哪样一个 workload 来优化。
嘉宾/Mark|00:19:24 因为那首 transformer 其实还没有出来。
嘉宾/Mark|00:19:25 Cerebras 最后可能面临的比较大的技术挑战。
嘉宾/Mark|00:19:28 就是如何控制这一整个 wafer 的良率以及成本。
嘉宾/Mark|00:19:32 这个可能是他最大的挑战。
嘉宾/Mark|00:19:34 Groq 的话其实是在他做出我需要依靠编译器做完全静态的调度和编译这个选项的时候。
嘉宾/Mark|00:19:40 没有办法去预先知道现在大模型 Transformer 推理里面有如此大的动态性。
嘉宾/Mark|00:19:47 就比如 MoE 的产生其实原理上和它做出的技术选择并没有匹配的很好。
主播/泓君|00:19:53 这个怎么说可以详细解释一下吗。
嘉宾/徐子扬|00:19:55 对,其实 MoE 这样一个网络它是有非常多的专家,然后每一个 token 在推理的时候,它是去激活专家里的一小部分。
嘉宾/徐子扬|00:20:06 这个一小部分是在运行时决定的,随着我们不同的 token 在选择,比如说在 128 个专家里头去选 8 个。
嘉宾/徐子扬|00:20:15 这件事情你没有办法在编译的时候去预测,它是不同的 token 它是会选不同的专家的。
嘉宾/徐子扬|00:20:21 所以我们再去考虑现在的单颗 SRAM 能放的容量的时候,它没有办法把整个网络都放进去。
嘉宾/徐子扬|00:20:27 就一定会出现有一些专家在一部分芯片上。
嘉宾/徐子扬|00:20:31 那这里就有一个调度问题,我要把这样的一个 token 送到哪一颗芯片上去。
嘉宾/徐子扬|00:20:36 这本身是有一定的动态性。
嘉宾/徐子扬|00:20:39 如果我想要用一个静态的方式去解决这个动态性,一种思路就是我非常的保守,我把它都送过去,那有一个叫做空转。
嘉宾/徐子扬|00:20:48 那另一种解决方式,我就换一种方法来切这个模型。
嘉宾/徐子扬|00:20:52 但是具体的我们推演了,如果你把这个模型不用这个专家去切分的话,现在这个模型的大小很难用其他的这几个维度把它切得很干净很高效。
嘉宾/徐子扬|00:21:02 所以刚刚的这个动态性就变成了它的静态调度的很大的问题。
主播/泓君|00:21:07 我印象中 MoE 应该是当时 DeepSeek 那个发布,它变得非常主流,引起大家强烈的关注的。
主播/泓君|00:21:16 但是 NVIDIA 在 acqui-hire, Groq 它应该是在 2025 年底,我觉得他们应该也是能看到这些问题的。
主播/泓君|00:21:25 它当时为什么会做出收购的这个决策,大家有没有一些相关的消息跟推理?
嘉宾/徐子扬|00:21:32 因为本身刚刚说的从一个保守的方式来去想。
嘉宾/徐子扬|00:21:35 它会有一些芯片空转。
嘉宾/徐子扬|00:21:38 这件事情只会影响性价比。
主播/泓君|00:21:40 对。
嘉宾/徐子扬|00:21:40 然后现在。
主播/泓君|00:21:41 但它依然是当下除了 GPU 以外。
主播/泓君|00:21:44 比较好的一个选择,就是它还是需要一款推理芯片的。
嘉宾/徐子扬|00:21:47 这里就说到了现在市场上对于 Groq 和 Cerebras 它的定位其实就是快。
主播/泓君|00:21:52 性价比呢?
嘉宾/徐子扬|00:21:53 性价比其实没有被拿到台前上去那么多的讨论。
主播/泓君|00:21:57 就是低延迟。
嘉宾/徐子扬|00:21:58 对,现在整个商业逻辑是这样的,如果我做的这个推理比别人快几倍,比如说我是 100 token 每秒,
嘉宾/徐子扬|00:22:05 但是拿 Cerebras 能做到 750 每秒,甚至 2000 token 每秒,那么我可以为此付非常多的溢价。
主播/泓君|00:22:12 所以 Cerebras 跟 Groq 谁更贵?
嘉宾/徐子扬|00:22:16 我觉得是 Cerebras。
主播/泓君|00:22:18 Cerebras 更贵。
主播/泓君|00:22:19 我们待会儿可以聊一下为什么。
嘉宾/徐子扬|00:22:20 对,在这个角度上来说,比如说 SRAM 有一些芯片它空转了,
嘉宾/徐子扬|00:22:24 它并不影响我能做到很快这件事情。
嘉宾/徐子扬|00:22:27 另外一个角度是本身 SRAM 和 HBM 相比,
嘉宾/徐子扬|00:22:31 性价比其实是有两到三个数量级的优势。
嘉宾/徐子扬|00:22:34 所以我们在做整个系统里面其实可以浪费掉。
嘉宾/徐子扬|00:22:37 一个数量级。
嘉宾/徐子扬|00:22:38 对。
主播/泓君|00:22:39 为什么浪费掉?你换取了什么?
嘉宾/徐子扬|00:22:42 它首先有三个数量级的优势,那我牺牲掉一个数量级,我还是可以比它更好。
嘉宾/徐子扬|00:22:47 所以牺牲掉的其实就是它为了解决这个 MoE 去做技术上的一个 trade-off。
嘉宾/徐子扬|00:22:53 所以哪怕现在在使用 SRAM 这种多卡的系统里头,没有充分利用所有 SRAM 的带宽,从带宽这个角度来说,性价比还是更高的。
嘉宾/Mark|00:23:04 对,我觉得从商业的角度来讲,当你可以做出一个比别人更快而且更便宜的东西的时候,你不会告诉别人你的成本其实更便宜的,因为别人如果愿意为更快买单的话。
主播/泓君|00:23:16 对对对,Jonathan Ross 他其实也是谷歌 TPU 的一个奠基人跟创始人,对不对?他在设计这两套架构的时候,他的主要思想的核心的关注点的区别是什么?
嘉宾/徐子扬|00:23:27 整个 Groq 的这个思路其实围绕着编译器发生的,因为 Jonathan Ross 本身也是编译器团队的一个 lead,。
嘉宾/徐子扬|00:23:34 然后他出来做这个整个东西的思路,就是把一个确定性的编译,然后围绕这个编译去做这个硬件,
嘉宾/徐子扬|00:23:41 所以就从静态的编译和静态的调度这里重新设计了硬件。
嘉宾/徐子扬|00:23:45 刚刚说的一个静态的调度是一点,还有另外一点其实是一个 determinism,它是一个确定性。
嘉宾/徐子扬|00:23:51 比如说我们想要从一个存储介质里面把东西读出来,它是 100 纳秒之后出来还是 3 秒纳秒出来,它是会有一个抖动的。
嘉宾/徐子扬|00:23:59 这个抖动在 DRAM 之中里头更明显。
嘉宾/徐子扬|00:24:02 当它用了整个 SRAM 再加上芯片的设计,它其实是去把这个确定性做到极致,也把静态的时钟的同步做到极致。
嘉宾/徐子扬|00:24:10 这一切都是围绕着最后我能在编译器看到整个系统并且为它做这么样一个排列。
嘉宾/徐子扬|00:24:17 但是就它创业的这个时间点的一些特性。
嘉宾/徐子扬|00:24:20 16 年 Groq 成立,他们最开始想要做的很多是和图像和语音,但他们一直想做的是推理。
嘉宾/徐子扬|00:24:27 在那个时代,它的整个模型和今天 Transformer 和包括 MoE 出来以后模型是不一样的。
嘉宾/徐子扬|00:24:33 所以包括一些动态性在那个时间点和今天它的需求是不一样的。
嘉宾/徐子扬|00:24:38 在那个时间点如果我会去决策的话,我也会觉得围绕着编译器去设计硬件是一个非常有意思的思路,到今天也是一个很有意思的思路。
嘉宾/徐子扬|00:24:46 但是可能今天会有一些问题就需要用一些方法去解决。
主播/泓君|00:24:51 对,我们刚刚讲到了其实 Groq 跟 Cerebras 都是有一些时代的局限性在里面的,比如说他们创业的那个时间点,那个时候生成式 AI 跟大模型还没有出来,但是其实深度学习整个业界应该是一个比较主流的方向了,但是是不是以 Transformer 为主的,我们不知道,包括我们刚刚提到了像 Groq 它在事前预测的时候跟 MoE 也会有一点点小小的不 match,。
主播/泓君|00:25:18 那 Cerebras 为什么它的成本比 Groq 还要高?
主播/泓君|00:25:22 包括它当时创业以及现在在 2026 年的这个时间点。
主播/泓君|00:25:27 将近 9 到 10 年之后。
主播/泓君|00:25:29 它又站到了一个大家关注的焦点上。
主播/泓君|00:25:32 你觉得在这个中间它调整了什么?做对了什么事情?
嘉宾/Mark|00:25:35 我觉得我先回答第一个问题吧,就是关于我为什么刚刚第一反应是它的成本会比 Groq 高。
嘉宾/Mark|00:25:41 一个是首先它从本身的技术路线来上来讲,因为它更多是需要以一个 wafer 的 scale,以一个整个晶圆的规模去生产它的产品。
嘉宾/Mark|00:25:50 这时候其实会遇到在芯片生产过程中非常关键的一个参数,就是良率。
嘉宾/Mark|00:25:57 如果我们按照传统的,比如像我们现在设计芯片,可能单芯片尺寸的极限就是差不多 800 平方毫米。
嘉宾/Mark|00:26:04 如果在这样的相片的话,你一个晶圆上面可以切出四五十个类似的芯片,可能三四十个的。
嘉宾/Mark|00:26:10 所以你的良率会影响这三四十个里面有多少是好的,有多少是坏的。
嘉宾/Mark|00:26:15 比如说你的良率是 50%,你可能就能切出来 20 个是好的。
嘉宾/Mark|00:26:18 但如果当你单一芯片或者单一产品的尺寸就是整个 wafer 的时候,
嘉宾/Mark|00:26:23 那只要这个 wafer 上面可能有超过 30%的瑕疵,因为 Cerebras 很大的工程上面的技术壁垒在怎么接受这个良率,比如它能接受到 30%的这个良率,但是你是没有这么多个晶圆可以让你切出 30%的这个良率的水平的。
主播/泓君|00:26:40 你是想说 30%的良率还是 70%的良率?
嘉宾/Mark|00:26:43 其实这样我觉得是有两个良率的概念。
嘉宾/Mark|00:26:45 比如说正常的一个芯片。
嘉宾/Mark|00:26:47 如果我们没有做任何 partial good 的设计的话。
嘉宾/Mark|00:26:50 比如它好就是好 坏的就是坏了。
嘉宾/Mark|00:26:52 这是我刚刚说的比如 50%良率。
嘉宾/Mark|00:26:54 我们可以生产出来 20 个好的芯片。
嘉宾/Mark|00:26:56 但是 Cerebras 会做很多事情在于我接受我这个芯片上面 30%的点都是坏的。
嘉宾/Mark|00:27:02 仍然让我这个产品能用。
嘉宾/Mark|00:27:04 但这时候仍然和你其实大概率里面 40% 50%都是坏了的这个良率是不匹配的。
嘉宾/Mark|00:27:10 而且它的坏是一旦你整个晶圆达不到它对于良率的需求。
嘉宾/Mark|00:27:14 整个晶圆其实就作废了。
嘉宾/Mark|00:27:16 这个背后就意味着当你要刻出或制造出一个成功的或好的晶圆级的产品的时候。
主播/泓君|00:27:23 成本极高。
嘉宾/Mark|00:27:24 成本是非常非常高的。
主播/泓君|00:27:25 这个成本能达到多少?就是一次流片。
嘉宾/Mark|00:27:29 这个不是流片的成本,这个是实际,因为整个芯片成本就是两部分。
嘉宾/Mark|00:27:34 流片的成本在如果你出货量足够大的情况下,它是可以被摊薄的。
嘉宾/Mark|00:27:38 比如你去做个玩具,对吧?
主播/泓君|00:27:39 做玩具,一个玩具一块钱两块钱,但是你可能找那个玩具厂开模。
主播/泓君|00:27:43 对,它在更上一步。
主播/泓君|00:27:44 对,它是那个掩膜的成本,或者首次流片的成本,其实是开模的那个成本。
主播/泓君|00:27:49 然后那个不会直接影响到你实际掩膜开了之后,你玩具是每造一个需要多少成本,这是两个概念。
主播/泓君|00:27:57 但是 Cerebras 的问题在于,就是你这个掩膜开完之后,仍然你每造 10 个,可能里边 9 个都不能用。
嘉宾/徐子扬|00:28:04 那这时候其实影响的是你实际生产时候的成本。
嘉宾/徐子扬|00:28:07 对,我觉得除了刚刚说到的良率和怎么用的问题,它还有一个整个系统要为这么一个和其他芯片都完全不一样的设计做系统的改变。
嘉宾/徐子扬|00:28:18 比如说刚刚说的软件上,这整个晶圆上可能是有几十万个小的 Core。
嘉宾/徐子扬|00:28:23 坏了哪些部分我是能绕过去的,如果坏在一些比较关键的部分,这怎么做?
嘉宾/徐子扬|00:28:28 这些事情之前都没有针对这样一个系统研究过,所以它首先要解决这边的软件问题。
嘉宾/徐子扬|00:28:33 还有你这个系统要怎么去插到这么一个机柜里,这里也有一些额外的事情它都要自己解决。
嘉宾/徐子扬|00:28:40 因为它可能是现在唯一一个比较有名的这种晶圆级的生产商。
嘉宾/Mark|00:28:46 我觉得这个问题非常非常复杂,我们要捋一下这个逻辑。
嘉宾/Mark|00:28:49 首先当我们说实际的成本的时候,大家最关心的其实是 token 的成本。
嘉宾/Mark|00:28:55 token 的成本其实是我们刚刚强调了很多带宽的成本,因为你每推一次 token 意味着你要把整个模型从这个存储介绍比如在 SRAM 里面读上来。
嘉宾/Mark|00:29:04 但是最终大家关心这个 token 的成本其实回到这个数据中心本质的成本其实有两个部分。
嘉宾/Mark|00:29:10 就一个是你去采购这个系统的成本。
嘉宾/Mark|00:29:12 另外一个是你实际运行中电费比如能源的消耗这部分的成本。
嘉宾/Mark|00:29:17 大家计算的方式是比如说我有一个新的芯片我要建一个新的数据中心。
嘉宾/Mark|00:29:21 我计划这个数据中心比如服务三年或者服务五年的时间内我能推理出多少 token。
嘉宾/Mark|00:29:26 可能是一个非常大的量级。
嘉宾/Mark|00:29:28 除以整个的我需要消耗在上面的硬件的成本以及能源的成本。
嘉宾/Mark|00:29:32 Cerebras 刚刚提到的所有由于良率导致的成本高,都是它硬件的那部分成本高。
嘉宾/Mark|00:29:38 这部分其实某种程度上摊薄了,它能够在实际带宽上获得的收益。
嘉宾/Mark|00:29:43 就比如说我们看到如果是简单的芯片,没有那些良率的问题。
嘉宾/Mark|00:29:48 可能我单芯片的成本可以做到英伟达的十分之一,
嘉宾/Mark|00:29:51 然后带宽可能做到它的十倍,
嘉宾/Mark|00:29:53 就比如 Groq 这种形态,
嘉宾/Mark|00:29:55 但由于它制造那部分的成本太高了,
嘉宾/Mark|00:29:57 它很有可能是比如十倍英伟达的带宽,
嘉宾/Mark|00:30:00 但是三倍 HBM 的成本,
嘉宾/Mark|00:30:02 就这中间带宽实际的性价比就要打一个折扣,
嘉宾/Mark|00:30:06 这个其实很类似比如 Groq,
嘉宾/Mark|00:30:07 我们认为要在为它的确定性打一个折扣,
嘉宾/Mark|00:30:10 那 Cerebras 要为它的复杂的良率成本打一个折扣,
嘉宾/Mark|00:30:13 这个最终这个折扣是要打到 Token 的成本上面的,
主播/泓君|00:30:17 对,我记得在 80 年代的时候也有人想做这种晶圆级的芯片,但是失败了。
嘉宾/徐子扬|00:30:24 为什么现在做芯片是一个好时候?
嘉宾/徐子扬|00:30:27 之前去做各种奇奇怪怪的芯片实验,
嘉宾/徐子扬|00:30:30 包括 Intel 也出了 Itenium 芯片,
嘉宾/徐子扬|00:30:32 有一个灾难的被丢掉的这么一个芯片的架构。
嘉宾/徐子扬|00:30:36 去做我们说这种异构的或者是一个全新的芯片,
嘉宾/徐子扬|00:30:39 或者为了芯片它可能对软件战有一个新的依赖,
嘉宾/徐子扬|00:30:42 它有两件事情,一个是经济性上,
嘉宾/徐子扬|00:30:45 我做一个芯片要对它投入的研发成本和新的生产设计的成本,
嘉宾/徐子扬|00:30:50 我需要能摊薄。
嘉宾/徐子扬|00:30:51 所以在之前的那些时代,我们没有看到一个单一的大应用,能够像今天的 AI 一样,这么容易把摊薄这件事情说清楚。
嘉宾/徐子扬|00:31:00 现在 AI 的各种系统开销里面,我们去留一次片的几百万美金,上亿的研发成本,好像都不算一个大的数了。
嘉宾/徐子扬|00:31:08 所以在今天去做一个新的芯片本身,经济上的难度降低了。
嘉宾/徐子扬|00:31:13 第二个是今天这个时代做软件栈的难度其实大大降低了。
主播/泓君|00:31:17 为什么?
嘉宾/徐子扬|00:31:18 因为尤其是推理芯片这里,一方面是我们有一个单一的大应用,以前在 Intel 里头,它可能会有几百个重要公司的几千款应用,每一个 CPU 要设计出来,它要在这几千款应用里面都跑一个测试,我们叫 benchmarking,最后它要和它之前的一代芯片相比,不能任何一个公司,任何一个应用掉队太多,这样就会影响,所以你之前的这个做芯片,你要就做了整个软件优化,你要考虑我要把这几千个应用都要做好,
嘉宾/徐子扬|00:31:56 今天的话其实只有一个单一的大的应用,甚至这个单一大应用里面只有一个比较大的一个模型分类,就是这种 Transformer 的这个分类。
嘉宾/徐子扬|00:32:01 它本身也是一个大力出奇迹的,所以它本身的结构是相对简单的。
嘉宾/徐子扬|00:32:09 我们看到现在这个模型就几十层,几乎结构一模一样的层,所以你去分解来看,它的本身应用简单了很多。
嘉宾/徐子扬|00:32:20 第二,随着 AI 的 coding 的能力,编程的能力在不断地提高,软件这种尤其针对推理的 kernel 算子的优化,其实可以被 AI 大大加速的。
嘉宾/徐子扬|00:32:29 所以我们在看到这种新的模型出来了以后,有一些新的需求在和之前的模型差别不是很大的时候,AI 自己就可以解决这个问题。
嘉宾/徐子扬|00:32:32 所以软件栈上的入门的门槛被降低了。
主播/泓君|00:32:38 英伟达为什么要花 200 亿去 acqui-hire Groq:英伟达最看重的点是什么?
嘉宾/Mark|00:32:40 我觉得这也很 straightforward。
嘉宾/Mark|00:32:43 就确实我跟 Bill 会聊很多技术上面的一些需求。
嘉宾/Mark|00:32:45 是 GPU 这个架构没有办法很好解决的。
嘉宾/Mark|00:32:49 其实就是大家看到了推理上面带来的新的大带宽的需求。
嘉宾/Mark|00:32:50 我觉得从 Nvidia 的角度。
嘉宾/Mark|00:32:53 它也有一些大公司有些技术架构上面。
嘉宾/Mark|00:32:54 比如 CUDA 的护城河。
嘉宾/Mark|00:32:56 对于它来说既是一个很强的护城河。
嘉宾/Mark|00:33:00 同时也是在某种程度上创新的一个包袱。
嘉宾/Mark|00:33:03 但是它确实我觉得 Jensen 很清楚地意识到了。
嘉宾/Mark|00:33:10 未来推理里面算力不一定是唯一的,它需要补充带宽的这部分技术能力。
主播/泓君|00:33:16 综合各种原因考虑,Aquihire 一个有这种能力的公司,我觉得是一个非常好的决定。
主播/泓君|00:33:27 对,我刚刚其实也是在想,因为达他肯定是能看到趋势是什么的,他也知道他哪一部分是短板的,他其实也是可以从内部做的,但很难吗?
嘉宾/Mark|00:33:35 对,因为我会知道,因为 Bill 在 NV Research,他们其实会做非常多的架构层面的创新,而且从很早就开始做。
嘉宾/Mark|00:33:46 当然 CGRA 什么东西,paper 其实都发了很多,但是这个东西在一个成熟的公司里面,把一个 research idea 颠覆式的推给产品的团队,还是难度非常大。
主播/泓君|00:33:53 即使是英伟达这样的公司,不如我干脆 acqui-hire 一个和之前团队没有什么关系,新的技术团队。
嘉宾/徐子扬|00:34:10 对,所以你觉得现在比如说我们在做一个推理芯片,或者在做芯片,因为我们之前说英伟达它有很大的一个护城河是它的 CUDA 的体系,你觉得有多大程度上可以绕过 CUDA 或者说建立一套全行业通用的软件体系?
嘉宾/徐子扬|00:34:16 对,所以从推理芯片这个角度,我觉得绕过 CUDA 是百分百会发生的。
主播/泓君|00:34:25 事实上比如我们去看这几家大厂的推理芯片,比如说 TPU,比如说亚马逊的 Trainium,都没有一丁点的说要兼容 CUDA。
主播/泓君|00:34:30 但依然大家会觉得 TPU 它的软件系统是难用的。
主播/泓君|00:34:33 就是为什么 Anthropic 它能大量地去采购 TPU。
主播/泓君|00:34:36 我听到一个说法就是因为它有很多的工程师是谷歌过去的,
主播/泓君|00:34:39 大家知道那个 JAX 在这个上面怎么用。
主播/泓君|00:34:44 但是呢,如果你让一个从来没有做过软件编译器的工程师去做这件事情的话,
主播/泓君|00:34:49 大家会觉得还是难的,就是 TPU 在这个软件层它还是一个黑盒,
主播/泓君|00:34:52 除非非常懂的人,除非谷歌自己的人。
嘉宾/徐子扬|00:34:56 对,关于这个本身难的这件事情,其实我刚刚那个问题是很好回答的。
嘉宾/徐子扬|00:35:03 它只要不是非常多个难的问题,是一个难的问题,那我解完这个问题,这事就解决了。
嘉宾/徐子扬|00:35:08 我只要把 Transformer 里的所有的算子都在这个新的芯片上写出来,那我 Transformer 就能跑了。
嘉宾/徐子扬|00:35:10 我这个商业上的逻辑其实就通了。
嘉宾/徐子扬|00:35:17 然后第二个就是有了 AI 的加持,现在我们看到针对算子和整个运行时的开发其实大大加速了。
主播/泓君|00:35:22 我先说一个结论,大家认为推理芯片绕过 CUDA 是一定的事情。
嘉宾/Mark|00:35:30 对,然后我想说一下原理,比如用 TPU 的软件,用 AWS 的软件,包括比如用华为的软件,其实很难用,这一点我不否认。
嘉宾/Mark|00:35:41 核心的点在于训练时代和推理时代,大家多么愿意为软件的好用买单,相比于为绝对 token 成本降低买单。
嘉宾/Mark|00:35:45 我觉得这一点在训练时代和推理时代发生了比较本质的变化。
嘉宾/Mark|00:35:51 有一些软件它是很难用的,但是如果难用能够带来它有更好的性能,有更好的性价比﹖。
嘉宾/Mark|00:35:56 这个在推理时代可能大家的天平会更多的往更好的性能性价比上面倾斜,
嘉宾/Mark|00:36:01 以至于我们看到的很多已有的做法比如说 DeepSeek 虽然它用 GPU 的芯片,
嘉宾/Mark|00:36:07 但其实它更愿意本质的去写很底层的 PTX 的汇编的那些代码去做很底层的优化。
主播/泓君|00:36:11 我觉得这是为什么我们觉得推理时代 CUDA 是一定会被绕过的。
主播/泓君|00:36:26 嗯,我们刚刚一直在说成本这件事情,那现在来看 Groq、Cerebras 还有你们未来做的芯片,你觉得它的性能跟性价比相比于现在用市场上主流的芯片,我们说 GPU,大概是一个什么样的量级?
主播/泓君|00:36:33 已经做到的情况下,我们刨除掉所有的因素跟比如说我们刚刚说的一些正面跟反面,就是现在综合的一个性价比。
嘉宾/Mark|00:36:48 从我们很多原理分析的角度,认为未来一个更理想的整个的推理系统,我觉得是有机会在速度上做到比现在 GPU 或者以通用 AI 芯片 GPU、HBM 这种架构,在推理速度上至少两到三个数量级的提升。
主播/泓君|00:36:58 就从可能几十个 Token per second 到一千个甚至一万个 Tokens per second,这样一个对于单用户推理速度的提升,以及十倍左右性价比的提升。
主播/泓君|00:37:02 那你要不要讲一下你们的 SRAM 的解决方案是什么?
主播/泓君|00:37:03 你们做推理芯片的方案是什么?
嘉宾/徐子扬|00:37:07 对,我们其实刚刚说到了 SRAM 本质的性价比,
嘉宾/徐子扬|00:37:10 还有一个它的 trade-off 的点,就是它的容量。
嘉宾/徐子扬|00:37:17 所以我们本质上就是在 SRAM 和 HBM 本质有两到三个数量级的芯片层的性价比的提升的情况下,
嘉宾/徐子扬|00:37:20 我想最后把它变成整个系统。
嘉宾/徐子扬|00:37:29 在有比如说上千颗芯片的时候,它还能有 10 倍,就是一个数量级的性价比的提升和一到两个数量级的速度的提升。
嘉宾/徐子扬|00:37:38 本质的说我们一个芯片上能放的 SRAM 的数量,这个是很公开的,就你单颗芯片上就是几百兆币的 SRAM 的数量。
嘉宾/徐子扬|00:37:46 现在的模型大概在一个 T,如果是 FP8 的量化的话,那也是刚好是一个 TB 的这样一个量级。
嘉宾/徐子扬|00:37:54 所以你把这两个数除一除,大概需要上千颗芯片才能在容量上放下整个模型,才能去做相对应的推理。
嘉宾/徐子扬|00:38:01 所以我们在做的事情就是如何把这上千个芯片用某一种拓扑把它连接起来,
嘉宾/徐子扬|00:38:07 使得中间的每颗芯片和芯片之间的连接不成为我推理时候的瓶颈,
嘉宾/徐子扬|00:38:12 然后让每一个芯片这个 SRAM 它本身的带宽充分地利用起来。
嘉宾/徐子扬|00:38:20 肯定会有一定的损失,但是在这个损失最后折算下来,整个系统的成本和它的带宽要能提高 10 倍的性价比。
嘉宾/徐子扬|00:38:27 所以我们从技术上来看,单颗芯片,比如说 500 兆币这样的一个大小,去放模型的参数。
嘉宾/徐子扬|00:38:36 我的整个 token 的隐藏的叫 hidden state,一点一点的穿过我们的芯片网络,从一边走到另一边就是出最后的结果。
嘉宾/徐子扬|00:38:40 还有一个点是我们这个芯片刚说到一个很重要概念是异构。
嘉宾/徐子扬|00:38:45 所以我们的芯片和我们的系统不会去做整个模型的所有的事情。
嘉宾/徐子扬|00:38:50 因为我们很相信应该用最合适的硬件去做对应部分的应用。
嘉宾/徐子扬|00:38:56 所以整个模型会被区分成注意力的一边和非注意力的 FFN 的一边。
嘉宾/徐子扬|00:39:02 然后我们会比较类似 Groq 也不完全一致的去做后半段非注意力的一边。
嘉宾/Mark|00:39:07 对,然后这个我觉得是解释一下为什么本来是三个数量级的成本性价比的提升最后变成了 10 倍。
嘉宾/Mark|00:39:13 其实是因为 我们的系统是一个异构的系统,我们解决了 90%的问题,但是我们留了那 10%的问题给 GPU 来解决。
主播/泓君|00:39:19 所以最多我们的系统就能提升 10 倍,虽然我们可能以 1000 倍的提升效率解决了那个 90%的问题。
主播/泓君|00:39:27 我觉得现在其实整个中国不管在训练推理上芯片其实都是供不应求的,我们都不说产业链了,就从芯片层面上也是供不应求的。
主播/泓君|00:39:32 从你们现在开始做到整个的芯片会出来,你觉得大概它需要一个多长的时间呢?
嘉宾/徐子扬|00:39:51 这是一个非常好的问题,其实我们也在不断地更新我们对这部分的认知,因为传统上做一个芯片就是从你开始设计,从用户端开始反推,直到流片测试大概是一年半到两年这样一个事情,但是我们也看到 OpenAI 发布了自己的芯片的时候号称是九个月完成流片。
嘉宾/徐子扬|00:40:03 当然有其他的一部分原因,但我们的确是认为在足够聚焦且 AI 可以赋能的情况下,我们是觉得流片的节奏和更快的迭代,对,这个迭代的节奏可以加快很多。
嘉宾/徐子扬|00:40:12 真正制约我们的当然还有一些物理上的设计和流片那一部分,但剩下的部分我觉得会慢慢的更像一个软件的公司。
主播/泓君|00:40:14 哦,有意思啊。
主播/泓君|00:40:20 Mark 你刚刚一直在说你是在用一套全新的架构去解决这个供应链上的问题吗?
主播/泓君|00:40:25 它是一个更底层的创新吗?从推理的角度还是它是一个微创新?
主播/泓君|00:40:26 就像你刚刚开始我们提到的。
嘉宾/Mark|00:40:30 我们用全新的架构肯定就供应链的问题是一部分可以顺便解决的。
主播/泓君|00:40:35 但是肯定要解决最本质的问题是我刚刚说的 token 的速度 token 的成本的问题。
嘉宾/Mark|00:40:38 相比于现有的推理芯片你觉得它是一个颠覆式的创新还是一个微创新?
嘉宾/Mark|00:40:40 是一个在架构层次颠覆性的创新。
嘉宾/Mark|00:40:42 因为其实分了很多不同的层。
嘉宾/Mark|00:40:44 因为你芯片造出来。
嘉宾/Mark|00:40:45 其实有很多物理上的事情要解决。
嘉宾/Mark|00:40:46 比如光刻的事情怎么解决。
嘉宾/Mark|00:40:49 再比如说现在国内很多公司。
嘉宾/Mark|00:40:52 包括英伟达其实都很希望解决的 3D 堆叠的问题。
嘉宾/Mark|00:40:54 又是另外一个层次的问题。
嘉宾/Mark|00:40:58 但其实我们是希望在我们做一家 AI 芯片设计公司。
嘉宾/Mark|00:41:01 在芯片设计以及系统设计这个角度。
嘉宾/Mark|00:41:03 做真的颠覆式的东西。
主播/泓君|00:41:06 来提供更好的产品竞争力。
主播/泓君|00:41:10 对,你们觉得怎么样去判断一个推理芯片它是不是好的?
主播/泓君|00:41:13 大家的评价框架是什么?
主播/泓君|00:41:23 比如说每个 Token 产出的成本、推理的速度、然后每个 Token 的耗电量、芯片的算力到底被利用到了多少、利用率、以及软件跟编译器。
主播/泓君|00:41:24 你们觉得哪些方向是重要的?
主播/泓君|00:41:27 我觉得在推理的时代前三个是重要的。
主播/泓君|00:41:29 前三个,成本、速度、耗电量。
嘉宾/Mark|00:41:35 对,然后第四个会影响第一个,就是你的利用率会影响到你的成本,但是最终大家关心的肯定是成本。
嘉宾/Mark|00:41:48 就因为我们看未来整个系统是异构的,所以对一个芯片来说,它可能并不能单纯的从它的算力、带宽、容量,让大家对整个系统产生一个综合的认知,未来衡量芯片的好话一定要在系统这个层次去衡量。
嘉宾/徐子扬|00:41:51 还是要再强调一下我们在说的这种云端的 AI 推理芯片,
嘉宾/徐子扬|00:41:59 如果我们说的是一个盒子或者放在手机上的芯片,可能每一个 token 的成本并不是最重要的事情。
嘉宾/徐子扬|00:42:04 它最重要的可能是我最多花 100 美元为这个芯片付这么样一个成本。
嘉宾/徐子扬|00:42:10 这 100 个美元能达到某一个速度的推理,这个东西就能卖得出去。
嘉宾/徐子扬|00:42:15 所以对于这种端侧的 AI 芯片,它考虑的是完全另外一个事情。
嘉宾/徐子扬|00:42:19 但是从我们云端的考虑,最终的成本会被分解到每个 token 的成本。
嘉宾/徐子扬|00:42:25 所以我们会第一优先级的去考虑这个 token 生产的成本是什么,第二优先级的去考虑速度。
嘉宾/徐子扬|00:42:31 但是速度我们认为是未来非常重要的一个指标,是很核心的一个 AI infra 的一个指标。
嘉宾/徐子扬|00:42:41 后面的用电量在云端的角度来看,在今天的总的持有成本,现在用电量是在整个比例里头是较小的那一端。
嘉宾/徐子扬|00:42:44 国内和美国其实这一点上有比较大的区别。
主播/泓君|00:42:46 对,主要是美国缺电缺能源。
嘉宾/Mark|00:42:51 对对对,这个可能是倒拐的,国内我们了解到大概是三分之一在电,美国大概三分之二在电。
嘉宾/Mark|00:42:58 所以这个其实会导致大家有多关心,比如老黄天天讲 tokens per watt,还是大家关心 tokens per dollar。
嘉宾/Mark|00:43:02 你刚提到能源三分之一的成本是说什么三分之一的成本?
嘉宾/Mark|00:43:09 就是电费,比如算下来,刚刚提到 TCO 里面分两部分,一个是 CAPEX 一个是 OPEX。
嘉宾/Mark|00:43:12 CAPEX 就是你买芯片买机房的这部分一次性投入。
嘉宾/Mark|00:43:18 OPEX 是你比如说计划这一代数据中心运行五年,这五年里面你的功耗是多少,
嘉宾/Mark|00:43:22 然后乘以时间长度再乘以你的电费,这部分是 OPEX 的成本。
嘉宾/Mark|00:43:25 包括散热这些对应的能源消耗。
主播/泓君|00:43:29 如果你们在国内做的话,所以你们耗电量可能关注的就小一点,
主播/泓君|00:43:32 我觉得不是我们关注的小一点,是因为客户关注的会小一点。
主播/泓君|00:43:37 对,我是在想芯片之间你怎么去做性能成本的平衡。
嘉宾/Mark|00:43:43 因为我觉得长远来讲,芯片成本是钱的事情,就钱不是一个很本质的限制。
嘉宾/Mark|00:43:49 但是能源是,就未来我们看整个 AI 更大的一些未来发展的趋势的话。
主播/泓君|00:43:55 OK,如果你们遇到同行了,或者看一家芯片公司,你们会怎么去判断一家芯片公司行不行?
主播/泓君|00:43:59 如果用一个问题去问这个芯片公司,你们会觉得它是什么呢?
嘉宾/Mark|00:44:06 我觉得你刚刚说那三个问题其实都是很好的问题,但我觉得我们比较关心的其实就是两个问题,就是你的 tokens per second 可以做得多快多便宜。
嘉宾/Mark|00:44:13 如果你还站在从芯片的角度出发的话,可能很多实际在做推理芯片的公司根本没有这个数字。
主播/泓君|00:44:25 对,我觉得从用户端的角度理解,就是在芯片组成的系统,它的 per token 的价格和它每秒对于单一用户的推理速度,这两个是我们关心的最核心的问题。
主播/泓君|00:44:29 推理速度现在会是一个核心的制约瓶颈吗?
主播/泓君|00:44:32 因为从我自己作为一个用户的体验来说,
嘉宾/徐子扬|00:44:34 我觉得现在推理速度够用了。
嘉宾/徐子扬|00:44:39 这是一个非常非常好的问题,是一个我们其实思考了非常多的一个问题。
嘉宾/徐子扬|00:44:42 就是做快,这个快本身有多大的意义。
嘉宾/徐子扬|00:44:48 我们先从今天的商业逻辑来说,自从 Agent 开始大规模爆发以后,
嘉宾/徐子扬|00:44:53 我们现在大量的大模型产生的 token 其实并没有被人来赌。
嘉宾/徐子扬|00:44:57 这里有两个点,一个是在 Agent 之前有个东西叫 chain of thought,。
嘉宾/徐子扬|00:45:02 这个是思维链它在产生 token 的这一部分其实不是给你看的。
嘉宾/徐子扬|00:45:05 是给模型自己去产生最后结论这个智能的。
嘉宾/徐子扬|00:45:08 这一部分的速度要快一些。
嘉宾/徐子扬|00:45:10 因为它是最后给自己看的。
嘉宾/徐子扬|00:45:12 agent 的这一部分它产生也不是给人看的。
嘉宾/徐子扬|00:45:14 是去给别的 agent 去读的。
嘉宾/徐子扬|00:45:21 所以人本身阅读 token 的这个速度的确没有那么快,我们可能做到 100 token 每秒,人就已经读不完了。
嘉宾/徐子扬|00:45:30 所以今天的很多 GPU 或者别的系统它去反推的时候都是往着 100 token 每秒这个时间上去发展的,甚至会低一些 50 token 每秒。
嘉宾/徐子扬|00:45:36 但是对于这种 agent 的系统,我们认为这个速度其实是一定程度上没有上限的,越快越好。
嘉宾/徐子扬|00:45:43 这更核心的可能是一个 AI 长期的一个制约里头有一个刚刚说到的能耗,还有就是时间。
嘉宾/Mark|00:45:51 我们在单位时间里面能解决掉多少事情,这个本质上就是我们要用系统的对单用户的这个速度去解决的。
嘉宾/Mark|00:45:55 对我觉得刚刚你提的一个很好点就是你觉得已经很快了。
嘉宾/Mark|00:45:56 你觉得已经够用了。
嘉宾/Mark|00:45:58 然后我觉得核心点就是。
嘉宾/Mark|00:45:59 它一定会让你觉得够用了。
嘉宾/Mark|00:46:02 但是它会在别的地方去实现这一点。
嘉宾/Mark|00:46:04 比如说它知道用户不能接受。
嘉宾/Mark|00:46:05 我一个问题要想两天。
嘉宾/Mark|00:46:07 甚至一个小时可能都不能接受。
嘉宾/Mark|00:46:09 所以这时候实际上本质的限制了。
嘉宾/Mark|00:46:11 在这一天或者一个小时之内。
嘉宾/Mark|00:46:14 我能生产多少 token 来解决用户的这个问题。
嘉宾/Mark|00:46:16 所以推理的速度更快并不意味着。
嘉宾/Mark|00:46:18 你要从一分钟的思考。
嘉宾/Mark|00:46:21 最后你跟它的交互速度要变成一秒钟。
嘉宾/Mark|00:46:23 而是在都是一分钟交互速度的情况下,
嘉宾/Mark|00:46:25 你这个模型可以用 10 倍更多的 token,
嘉宾/Mark|00:46:27 做更多内部自我的思考,
嘉宾/Mark|00:46:29 来提升它的智能水平。
嘉宾/徐子扬|00:46:32 或者用 agent 的方式去做很多确实的实验,
嘉宾/徐子扬|00:46:34 来回答这个问题。
主播/泓君|00:46:39 有意思,就是在我看到答案的时间可能是一样的,
主播/泓君|00:46:43 但是背后是这个模型它思考了一遍,
主播/泓君|00:46:44 还是它思考了 10 倍,
【转写异常】 此处的识别结果出现连续重复词,原音内容无法可靠辨识。
嘉宾/Mark|00:46:59 对对对,是的是。所以你看老黄的演讲的 PVT,他的这个图的坐标纵轴是 tokens per watt 或者什么 tokens per second per watt 是说 token 的成本。
嘉宾/Mark|00:47:07 横轴其实他讲的就是推理的速度,那个 Bill 喜欢叫 interactivity,但是老黄的 PVT 里面那个横轴的标数就是 smarter AI。
主播/泓君|00:47:13 他认为推理更快的速度意味着整个 AI 可以变得更聪明,就是基于我刚刚的那个逻辑。
主播/泓君|00:47:20 哦,我理解了。所以说有的时候比如说我看到一些应用,它很快能给我答案,可能只是因为 AI 思考的少而已。
嘉宾/徐子扬|00:47:21 是,是。
主播/泓君|00:47:22 哦,这个太有意思了。
嘉宾/徐子扬|00:47:32 对,我们甚至会觉得之后这个会慢慢地向大部分更大程度的 token 其实都在 AI 自己的这个系统里去转来,为你产生最终的那个智能。
嘉宾/徐子扬|00:47:38 比如说如果哪一天这个 AI 系统足够聪明,我就说你去解决癌症。
嘉宾/徐子扬|00:47:42 然后他在那慢慢去解决,这大部分的 token 是在他自己里头赚。
嘉宾/徐子扬|00:47:47 这个自己里头赚的这部分 token 至少有一些思维链的速度当然是越快越好。
嘉宾/徐子扬|00:47:53 剩下的可以用并行度去换,但是有一些逻辑思考的部分是越快越好。
嘉宾/徐子扬|00:47:57 如果你问这么一个问题,比如说他用了 100 年思考,那可能对我们意义不大。
嘉宾/徐子扬|00:48:00 那我们会希望它在有限的时间内解决。
嘉宾/徐子扬|00:48:04 刚刚那个例子其实不是特别直接能体会出时间的紧迫性,
嘉宾/徐子扬|00:48:08 但比如说我想让一个 AI 系统来判断明天的股票市场怎么样,
嘉宾/徐子扬|00:48:11 它如果用两天的时间去想这个问题,
嘉宾/徐子扬|00:48:13 那这个回答就没有任何的意义。
嘉宾/徐子扬|00:48:17 所以我们为什么觉得时间是一个非常重要的本质约束?
嘉宾/徐子扬|00:48:20 因为世界这个时间不会为了别的慢下来。
嘉宾/徐子扬|00:48:24 很多事情是需要一个确定时间点之前就要得到这个答案。
嘉宾/徐子扬|00:48:28 比如说等一个小时就不耐烦了,需要一分钟之内得到也是这么一个时间的卡点。
嘉宾/徐子扬|00:48:34 我们就希望在确定的时间卡点里获得更多智能,这个就翻译成快。
主播/泓君|00:48:37 所以对最后的 AI 芯片的快其实是有要求的。
主播/泓君|00:48:47 因为我们说现在整个模型在训练、预训练的方法上,包括在推理上,包括现在整个 Agent 它的互联上,它是有很多的创新的。
主播/泓君|00:48:55 比如说刚刚我们提到了像思维链的这个模式,它可能就会对 Groq 它的这些整个工作的原理会产生影响。
主播/泓君|00:48:58 那我觉得现在模型也在提这个 RSI。
主播/泓君|00:49:25 然后也在提强化学习,同时整个 agent 的市场它也在发生改变,所有这些在大模型预训练领域里面发生的这些改变会影响大家芯片的设计,以及比如说你们现在在设计一场芯片的时候,包括我们说还有大模型跟所有的图片模型、视频模型、世界模型,它的不同的训练方法,所有的这些不同的预训练的方式会改变大家的芯片的设计方式吗?
嘉宾/徐子扬|00:49:28 以及你们现在在设计的时候会往前看一两年两三年吗?
嘉宾/徐子扬|00:49:28 先回答最后一个问题,我们肯定是要向前看的。向前看的时候是去找一些本质的会影响我们芯片设计的,就前半部分的这个问题。
嘉宾/徐子扬|00:49:37 首先模型结构本身一定会影响,就比如说刚刚说到的这个视频生成,图像生成,这里头生成里头很大的一部分是一个 Diffusion Model,这种模型它和现在 Transformer 的方式就是不一样的。
嘉宾/徐子扬|00:49:51 所以我们就要做两个选择,一个是芯片做不做这件事情,就是异构的选择。
嘉宾/徐子扬|00:49:56 我们去想清楚我们要解决的那个更核心的问题是什么。
嘉宾/徐子扬|00:50:00 第二个是如果要做的话,在我们的心里面怎么做这件事情。
嘉宾/徐子扬|00:50:03 所以像这种 diffusion 这种事情,技术上来说它是一个计算非常密集的一个事情。
嘉宾/徐子扬|00:50:09 所以它适合的硬件可能是另外一种方式。
嘉宾/徐子扬|00:50:12 另外一个去看本质的这个 transformer 它会怎么变,就是我们想要瞄准的这一块它会不会有很大的变化。
嘉宾/徐子扬|00:50:18 我们先看这整个模型大规模的在变的是哪一部分。
嘉宾/徐子扬|00:50:22 现在还没有收敛的算法上是哪一部分。
嘉宾/徐子扬|00:50:25 和已经收敛的是哪一部分。
嘉宾/徐子扬|00:50:27 这家公司优先去解决已经收敛的这部分。
嘉宾/徐子扬|00:50:31 可以去做芯片的这一部分。
嘉宾/徐子扬|00:50:33 所以我们现在看到的刚刚从模型本身来说,Transformer 模型里头注意力的机制这边其实在算法上还有非常多的格性。
嘉宾/徐子扬|00:50:42 每一个新的 Lab 出来,它会经常发一些 paper 说我又做了一个什么新的思路。
嘉宾/徐子扬|00:50:47 但是后面的这段 FFN 自从变成 MoE 以后,其实变成了一个相对不变量。
嘉宾/徐子扬|00:50:53 刚刚说到有些 2L 的这些东西其实是没有本质的影响这个模型的结构的。
嘉宾/徐子扬|00:50:58 如果这个模型本身结构是一样的,它只是尤其 2L 如果在后训练里头,更是没有影响这个模型的结构。
嘉宾/徐子扬|00:51:05 那这个对于我们来说就是一个相对没有那么重要的事情。
主播/泓君|00:51:09 所以你们现在主要是做 Transformer 的模型,就是 Diffusion 的推理,你们是现阶段还没有考虑进去的?
嘉宾/Mark|00:51:16 对,更多我考虑问题的点其实是在于,未来 AI 的系统不管是什么模型,很本质的它会有两部分的需求。
嘉宾/Mark|00:51:22 现在看到比较明确的有算力的需求,我们看到现在解决不太好的有带宽的需求。
嘉宾/Mark|00:51:27 其实我们是希望找到一个最贴近于当前带宽需求的从芯片到系统的解决方案。
嘉宾/Mark|00:51:33 这个未来我觉得不绑定在具体的模型上面。
嘉宾/Mark|00:51:36 虽然我们现在看的肯定会觉得未来等我们芯片出来的时候。
嘉宾/Mark|00:51:39 大概率还是很 Transformer 更适合运行在我们上面。
嘉宾/Mark|00:51:42 但其实我们是有这种比如说图像的生成 视频的生成。
嘉宾/Mark|00:51:47 这些未来算法上有很大的空间。
嘉宾/Mark|00:51:50 它可能也变成自回归式的。
嘉宾/Mark|00:51:51 然后甚至是两种的结合。
嘉宾/Mark|00:51:53 但这种的话就如果它变成了我们可能可以支持很好。
嘉宾/Mark|00:51:56 如果它没有变成的话。
嘉宾/Mark|00:51:58 那它天然就不是我们想解决这个问题面对的对象。
主播/泓君|00:52:02 嗯,了解。
主播/泓君|00:52:03 我看现在有很多的国产芯片啊,甚至我们说包括像英伟达的芯片,大家有一个宣传出来的纸面的算力的值。
主播/泓君|00:52:12 但是大家在真实地用起来,感觉这个算力是不是没有跑满啊,有的时候是不是连一个对折都没有打到啊。
主播/泓君|00:52:18 这中间消失的算力去哪了,为什么会有一部分算力的浪费,它达不到这个理论算力的值?
嘉宾/Mark|00:52:23 我觉得两部分吧,因为如果单纯想算力浪费的话,其实现在很多 Worker 包括现在的一些注意力的机制,很多应用,它的计算和访存的比例就没有长在英伟达 GPU 的甜点上面。
嘉宾/Mark|00:52:36 这个是可能比较大的一些之所以算力用不起来的方向,因为你卡在带宽上,计算机体结构有一个这个 roofline。
嘉宾/Mark|00:52:43 这怎么没法翻译呢?
嘉宾/Mark|00:52:45 好像是没有一个屋顶结构。
嘉宾/Mark|00:52:47 对,它有一个基本的这个结构。
主播/泓君|00:52:49 如果你是带宽瓶颈,那显然你的算力就用不起来。
主播/泓君|00:52:52 然后另外因为推理其实是一个非常快速,有很多很多细小的算子组成的,
主播/泓君|00:52:57 你想每秒钟都两三百个 token 了。
主播/泓君|00:53:00 这时候你每一个 token 对应的计算任务其实变得非常细碎,
主播/泓君|00:53:04 比起训练的那种都是大矩阵相乘。
主播/泓君|00:53:06 然后这种细碎其实是会造成你有一部分调度的损失的。
主播/泓君|00:53:11 它是使用者用的问题还是芯片设计的问题还是软件层的问题?
嘉宾/徐子扬|00:53:15 这三个都有。
主播/泓君|00:53:16 都有。
嘉宾/徐子扬|00:53:17 对,其实刚 Mark 说到的那部分比如说算力和访存,这个就更本质一些,这个可能是硬件设计和现在用的 Workload 这个应用它不匹配造成的。
嘉宾/徐子扬|00:53:29 再技术一点的话,现在经常会说它的芯片在等数据从别的芯片传过来,这个的意思就是其实是我们在互联中卡住了。
嘉宾/徐子扬|00:53:38 任何的一个数据它没有及时的到要去算的那一边。
嘉宾/徐子扬|00:53:41 无论是因为你在这一片上的 HBM 带宽不够大。
嘉宾/徐子扬|00:53:45 你从那读出来的时间太长了。
嘉宾/徐子扬|00:53:47 它的计算单元在那空转。
嘉宾/徐子扬|00:53:49 或者是我要从别的地方传这个数据导致的空转。
嘉宾/徐子扬|00:53:53 最后就导致了我们的计算单元在做矩阵乘法。
嘉宾/徐子扬|00:53:56 现在的模型里最大的东西就是做矩阵乘法。
嘉宾/徐子扬|00:53:59 我们在算 MFU 模型算力利用率里头。
嘉宾/徐子扬|00:54:02 基本上只在算矩阵乘法的这一块。
嘉宾/徐子扬|00:54:05 所以一旦我们发现矩阵乘法在空转,我们最后会得到一个比较低的 MFU,所以我们就会说这个芯片没有被很好的用起来。
嘉宾/徐子扬|00:54:14 回到刚刚那个 Roofline Model,我们其实在推理,尤其是为了高单用户推理速度的这个场景的时候,其实还有另外一个场景叫 MBU,是 Memory Bandwidth Utilization,访存的带宽有多少被用起来,所有的利用率它都是到了 100%,这一点就没有问题了。
嘉宾/徐子扬|00:54:33 但是比如说我带宽拉到了 100%,我这个芯片是不是 100%用起来,也不完全是,因为这个芯片它又至少有两个单位,一个是访存带宽有没有百分用起来,一个是算力有没有百分用起来,这个就回到刚刚说的第一点,就如果我设计的时候,我这带宽设计的非常小,算力非常非常的大,那我把带宽吃满的时候,我的算力可能就还是空着,是,所以它是一个综合的问题,你们自己在设计推理芯片的时候,会把这些考虑在里面吗,理论上的利用率跟实际的利用率,
嘉宾/Mark|00:55:13 我们会考虑在里面,就怎么说避免一些实际执行过程中的调度啊,一些摩擦导致的利用率的损失,就这点可能是我们更多可以在芯片设计上面做优化的点。
主播/泓君|00:55:22 嗯,嗯,对。大家要不要给听众的科普一下,就比如说一个芯片,它如果要设计一整个流程的话,它是什么样的,对。
嘉宾/Mark|00:55:27 一开始的时候肯定是更多的架构上面的设计,其实是需求的分析。
嘉宾/Mark|00:55:29 这个芯片定位是什么,我要解决什么样的问题,
嘉宾/Mark|00:55:32 哪些问题是技术上的问题,哪些问题是一些客户的问题,
嘉宾/Mark|00:55:36 有些客户可能要求一些安全性,这肯定是第一步的点,先梳理需求。
嘉宾/Mark|00:55:39 为而这些需求就会有具体的高层架构的设计,
嘉宾/Mark|00:55:41 这个架构可能包含了不光是芯片本身,
嘉宾/Mark|00:55:45 就未来实际我交付的可能是一个服务器,甚至是一个集群。
嘉宾/Mark|00:55:48 这种集群里面拆解到对于系统的需求,
嘉宾/Mark|00:55:51 比如芯片兼互联的需求,对于服务器兼互联的需求,
嘉宾/Mark|00:55:54 以及拆解到对于具体每一颗芯片的需求。
主播/泓君|00:55:56 而且我理解这个里面其实是有很多创业机会的。
主播/泓君|00:55:59 你做服务器集群是一种,你做芯片是一种。
嘉宾/Mark|00:56:04 然后你卖一个从芯片软硬件一提的这种解决方案的可能还是一种。
嘉宾/Mark|00:56:12 是,但是我的意思是从系统架构的层面,你要考得清楚你未来支持的场景是什么,以及围绕这个场景去做真的实际芯片架构的定义。
嘉宾/Mark|00:56:27 到芯片架构定义之后就会有一些更多微架构的定义,比如说我芯片里面打算计算单元核打算怎么设计,核里面的矩阵单元打算怎么设计,向上单元打算怎么设计,然后我用什么样的指令集存储放在哪儿,比如说我们想用 SRAM 来做,SRAM 放在哪儿。
嘉宾/Mark|00:56:38 这些都确定了之后,你就会有一个非常详细的特性列表,feature list,这里面就会具体指导实际做 RTL 编码的时候该怎么去做一个一个模块去写 RTL 编码的编写。
嘉宾/Mark|00:56:46 大家都说做芯片要一两年的时间,实际这一部分编写时间可能也就两三个月,但是大部分事情会发在比如前期的需求、架构上面。
嘉宾/Mark|00:56:50 说到 RTL 编码之后,其实就是一些验证的工作。
嘉宾/Mark|00:56:55 至少传统意义上来讲,大家说做一个大芯片,流片的成本是相当相当高的。
嘉宾/Mark|00:56:59 所以大家希望在流片的时候保证这个芯片不需要有一些功能上的问题。
嘉宾/Mark|00:57:04 所以在流片之前会做非常充足的对于芯片编码的验证,比如我写的是不是有 bug,。
嘉宾/Mark|00:57:08 要么比如说靠很复杂很多的测试用力,
嘉宾/Mark|00:57:12 要么是比如靠一些形式化的验证从这个数学上去做证明。
嘉宾/Mark|00:57:16 这个又回到了我当时在博士的时候做的强逻辑的那个东西,
嘉宾/Mark|00:57:19 就是这部分的形式化证明就会用那部分东西去做。
嘉宾/Mark|00:57:37 当你把验证充分的做完了之后,会有很多后端的东西,就是刚刚说的那些东西基本上都算芯片的前端,当你每一个晶体管怎么连都确定,后端会实际的把它尝�就真的变成了实际光刻我需要在哪一块刻什么样的晶体管这些信息。
嘉宾/Mark|00:57:47 但是那个过程中又有很多的我们叫 DRC 就是根据比如 FAB 的一些信息去做很多重复的检查。
嘉宾/Mark|00:57:53 但是最终就是要保证在流片的时候不要出很大的问题。
嘉宾/Mark|00:57:56 等这些做完之后你就可以去流片了。
嘉宾/Mark|00:57:59 其实流片本身这个动作是它去给你生产这个模具、研磨、Mask。
嘉宾/Mark|00:58:03 这个其实只是第一次流片会有一个这个东西。
嘉宾/Mark|00:58:06 因为你这个东西如果没有问题的话。
嘉宾/Mark|00:58:08 后续的量产你这个模具就不用做特别大的改动了。
嘉宾/Mark|00:58:11 等真的第一代芯片量产回来之后。
嘉宾/Mark|00:58:14 又会有很多封装测试的东西在里面。
嘉宾/Mark|00:58:16 因为其实本身大家看到这个英伟达的一个芯片好像都很大。
嘉宾/Mark|00:58:19 都快半个手机大了。
嘉宾/Mark|00:58:20 但其实里面真正实际光刻出来那部分占比比较小。
嘉宾/Mark|00:58:24 更多的是要在一个比较大的封装里面去解决怎么把那么细的光刻的线引到我实际产品的板子上面的线。
嘉宾/Mark|00:58:33 当然测试的工作在于刚刚说到有良率的问题。
嘉宾/Mark|00:58:36 那你需要有一个很体系的方法,让你能够知道你造了一批芯片出来,哪些是好哪些是坏的。
嘉宾/Mark|00:58:42 这本身又是一个很大的课题,到后面实际你要去交付的时候,如果你要交付一个比较复杂的系统,你又会涉及到比如实际你的 PCB 板子要怎么设计。
嘉宾/Mark|00:58:51 你的芯片可能只是系统的一部分,上面可能会有一些控制芯片,有一些 switch 交换的芯片,有一些网口,其他的接口怎么去设计。
嘉宾/Mark|00:59:00 再到整个集群的供电散热供网怎么去设计这部分。
主播/泓君|00:59:05 我听到这段话我自己有一个感受啊,就 Mark 你太厉害了。
主播/泓君|00:59:09 我觉得芯片创业是一个门槛很高的事情,它的每一个环节首先它要解决无数的技术挑战,
主播/泓君|00:59:16 其次它是一个成本很高的东西,你需要很多的钱去做这些事情,去流片、去设计,然后承担各种流片的风险,
主播/泓君|00:59:25 包括到最后量产了以后我们要去控制良率,同时你还要去解决供应链的事情。
主播/泓君|00:59:31 因为现在大家知道包括连谷歌连英伟达他们在去做芯片的时候整个供应链上的各种环节都是缺货的所以硬件是一个很难的事情。
嘉宾/Mark|00:59:41 但是赔率足够大。
主播/泓君|00:59:42 对而且我之前其实有问过很多英伟达的科学家我就说你们其实有这么多年的经验芯片又这么缺为什么不自己出来创业呢。
主播/泓君|00:59:50 大家觉得这个事情要撬动的产业链太大了。
嘉宾/徐子扬|00:59:54 对,的确,我们也不是一个人在战斗,尤其是后端其实是要和很多很多的合作方一起去配合的。
嘉宾/徐子扬|01:00:01 我们这里更多的是把用户和这个模型怎么去设计这款芯片想得非常清楚了。
嘉宾/徐子扬|01:00:08 后面会有非常多的和供应商的沟通和互相帮助的阶段。
主播/泓君|01:00:12 你们现在在整个设计过程跟流片跟我不知道你们到哪个环节了,可能到最后量产的环节,供应链会是一个问题吗?
嘉宾/Mark|01:00:21 供应链会是一个非常非常关键的问题,因为我们看其实国内整个芯片的市场可能在未来两到三年都会长期处于一个供小于求的状态。
嘉宾/Mark|01:00:30 所以未来我们是否能成功的关键并不一定在于比如说我们的芯片设计的多好,其实就在于能不能造出足够多的芯片了。
嘉宾/Mark|01:00:38 但是其实在这上面我们反而有我们自己的一些优势。
嘉宾/Mark|01:00:41 正是因为我们在设计上面有了很多比较大胆的创新。
嘉宾/Mark|01:00:45 所以更多的放松了我们对于最先进制程的要求。
嘉宾/Mark|01:00:49 比如说我们是有机会把大家可能用不起来或者已经认为淘汰掉了的成熟的制程用得很好。
嘉宾/Mark|01:00:56 制造出来可能使用了成熟的工艺。
嘉宾/Mark|01:00:59 但是在最终我们关心的 tokens per second tokens per dollar 上面。
嘉宾/Mark|01:01:03 比可能先进工艺做出来的系统还要更好的一些解决方案。
主播/泓君|01:01:08 所以是通过架构创新做到的。
嘉宾/Mark|01:01:11 是的。
主播/泓君|01:01:11 但是在供应链上依然会是面临很多的挑战。
嘉宾/Mark|01:01:15 是的。
主播/泓君|01:01:17 你们为什么要回国创业?
主播/泓君|01:01:18 其实 Mark 我觉得你的这个背景即使在美国创业也是会很成功的。
嘉宾/Mark|01:01:22 我当时回国不是因为创业这一件事情回国,
嘉宾/Mark|01:01:25 是因为当时毕业之后有一些在国内比较好的工作的机会,
嘉宾/Mark|01:01:29 然后我也很感兴趣,我就已经回来了。
嘉宾/Mark|01:01:31 所以我在国内已经待了三年左右,
嘉宾/Mark|01:01:33 但这个过程中因为我很多 PhD 的朋友、
嘉宾/Mark|01:01:36 老师、备忘还在美国,
嘉宾/Mark|01:01:38 所以就每年也会有几次去硅谷和大家继续交流。
嘉宾/Mark|01:01:41 虽然现在国内有这些先进制程的实际技术上面的一些限制和约束,
嘉宾/Mark|01:01:46 但我觉得长远在一些更挑战比如控制成本、控制性价比的供应解决上面,国内整个的环境是有更大的优势。
主播/泓君|01:01:55 主要是供应链比较完善,供应商也比较多,即使你在美国可能也经常要回来看这些硬件的环节。
嘉宾/徐子扬|01:02:04 再本质一点就是搭基础设施的这个能力。
嘉宾/徐子扬|01:02:07 因为我们本身去搭的是一个推理的基础设施。
嘉宾/徐子扬|01:02:10 这里涉及到几个最核心的点。
嘉宾/徐子扬|01:02:12 比如说你的数据中心在哪怎么建。
嘉宾/徐子扬|01:02:15 用水用电。
嘉宾/徐子扬|01:02:16 中国有非常强的优势。
嘉宾/徐子扬|01:02:18 可能还有另外一个点就是中国也是一个非常大的一个市场。
嘉宾/徐子扬|01:02:21 它是能完全转起来的。
嘉宾/Mark|01:02:24 其实还有另外一个角度。
嘉宾/Mark|01:02:25 当时 Groq、Cerebras 做的比较艰难的点在于。
嘉宾/Mark|01:02:29 美国最主流的模型不是开源的。
嘉宾/Mark|01:02:32 当你做一个很新的芯片,你要让也不懂你芯片的人适配你的模型也不太现实。
嘉宾/Mark|01:02:37 你要强行让自己去适配一个自己不知道的模型也不太现实。
嘉宾/Mark|01:02:41 所以当你做出一个芯片,你其实更希望的是有些开源的东西可以让你自己拿来跑在自己上面做出一些效果来。
嘉宾/Mark|01:02:48 但是至少当时那些开源的比如像千问、像 Lama,显然不是美国最主流用的最多的模型。
嘉宾/Mark|01:02:55 所以他们在商业化上会面临着短期只能看到逆时的那部分小的开源的市场。
嘉宾/Mark|01:03:01 但是在国内反而是倒过来的,就是国内一些最强大的模型以 DeepSeek 为代表,智谱,至少在架构层面,它们都是更开放。
嘉宾/Mark|01:03:08 而且从市场角度来讲,国内可以稳定获取的最好的 AI 的模型的 API 其实也都是这些开源模型。
主播/泓君|01:03:18 但像千问也在做自己的芯片。
主播/泓君|01:03:21 我觉得这个问题是不是模型厂商也在做自己的芯片?
主播/泓君|01:03:24 对,你要怎么去竞争?
嘉宾/徐子扬|01:03:27 如果是一个开源的话,模型厂商做自己的芯片和我们做芯片,他们没有比我们很本质的优势。
嘉宾/徐子扬|01:03:35 做这个系统要把系统其他的部分想清楚,在这一点上模型厂商他不是做这个。
主播/泓君|01:03:40 但他们可能更加先进的模型并没有完成开源,以及他在设计模型的时候,他的软硬件团队是可以协同的,比如说谷歌的 TPU。
主播/泓君|01:03:52 他可以在模型往前发展的时候,就把芯片应该怎么设计,考虑进去。
嘉宾/Mark|01:03:57 就我觉得首先模型厂商分几类吧,一类是比如传统的互联网大厂,我们说国内啊,
嘉宾/Mark|01:04:03 就当他们做芯片的时候,因为本身如果你同时做模型,你同时会有很多训练的需求,
嘉宾/Mark|01:04:09 同时你的模型也是种种多样的,你会有很多像自己也有 C-Dance 那一部分模型的需求,
嘉宾/Mark|01:04:14 当你开始投入资源做芯片的时候。
嘉宾/Mark|01:04:17 你希望这个芯片不要那么针对性的只对你部分的需求有效果。
嘉宾/Mark|01:04:22 而说要更好地兼容你上面所有对于 AI 有需求的业务。
嘉宾/Mark|01:04:27 包括训练 包括各种图像生成。
嘉宾/Mark|01:04:29 也包括这个 Transformer 推理。
嘉宾/Mark|01:04:31 我们看到实际大家在做的可能还是更多的去替代已有的通用的 AI 芯片。
主播/泓君|01:04:37 嗯,训练偏多。
嘉宾/Mark|01:04:38 训练或者通用性偏多,就实际用可能推理也很多,但推理里面可能有一部分是 prefill,有一部分比如说是图像生成,AIGC 这部分。
嘉宾/Mark|01:04:47 我觉得纯粹的模型厂商,比如像 DeepSeek、智谱、Kimi,设计一个好的模型需要的能力和设计一个好的芯片需要的能力是完全不一样的。
嘉宾/Mark|01:04:56 就甚至有时候当你把完全不一样的能力整合进同一家公司的时候不一定是个好事。
嘉宾/Mark|01:05:01 就这件事也是需要异构的。
嘉宾/Mark|01:05:03 我觉得是需要一家氛围上面更适合算法设计的公司来做模型的事情。
嘉宾/Mark|01:05:08 氛围上面更适合芯片设计相关的公司来做芯片的事情。
嘉宾/Mark|01:05:12 这个东西把大家都融合在一起不一定完全是一个非常非常好的事情。
主播/泓君|01:05:16 嗯,Mark 当时你去 Stanford 读 PhD 的时候,Bill Dally 他其实很有名嘛,因为他的首席科学家,我们也可以说他是整个芯片领域的 GPU 的奠基人。
主播/泓君|01:05:26 因为他通过在 Stanford 做的流处理研究,变成了今天的 GPU。当时你为什么选他做导师?就是你跟他的交流是怎么样的?
嘉宾/Mark|01:05:35 你说这个 Stream Processing 这其实应该是他在 2000 年之前做的工作。
嘉宾/Mark|01:05:39 只是后面 NVIDIA 更成功地把这件事情做商业化。
嘉宾/Mark|01:05:42 但是他后面随着和 NVIDIA 合作。
嘉宾/Mark|01:05:44 其实逐渐他又重新在产业上面主导了很多类似的方向。
嘉宾/Mark|01:05:49 我是在应该是大四的有一个学期。
嘉宾/Mark|01:05:51 我去和韩松就是他当时马上要毕业的一个学生。
嘉宾/Mark|01:05:55 但是后面他其实做了很多成功的公司。
嘉宾/Mark|01:05:56 包括他后面去 MIT 当 Professor。
嘉宾/Mark|01:05:58 但其实当时是他拉我过去想让我帮忙他做一些 Research Assistant。
嘉宾/Mark|01:06:03 所以当时做的更多工作是围绕着他当时的模型的简直压缩,我们叫 pruning quantization,这些点继续往下做了一些更新的,如何让模型更 efficient 的跑在硬件上的算法层面的研究。
嘉宾/Mark|01:06:16 然后那时候就虽然是松哥之前 mentor 我,但是就是美洲会和 Bill 有例会,就这个人给我的第一反应是非常非常聪明的一个人。
嘉宾/Mark|01:06:24 然后另外一个点其实是他在 research 上看的问题是一些很本质的问题。
嘉宾/Mark|01:06:29 就他不会去尝试解一些 low hanging fruit 因为那个已经也不在他的 career path 的必要性上面。
嘉宾/Mark|01:06:35 他是一个很 senior professor 。
嘉宾/Mark|01:06:37 他没有任何短期学术上需要比如发多少 paper 的这些的压力。
嘉宾/Mark|01:06:40 所以他看到的一些更本质是他实际上感兴趣的技术上面的一些点。
嘉宾/Mark|01:06:44 这些点往往是那些其实很难做。
嘉宾/Mark|01:06:47 但一旦做出来可能对整个学界业界有非常非常大的影响的一些点。
嘉宾/Mark|01:06:52 这是我非常非常从那时候开始就欣赏它的特质。
主播/泓君|01:06:55 对,你刚刚提到了 Bill 他看问题是看到了非常本质的地方,你觉得从你开始读他的 PhD,17 年开始,有哪几个他在关注的主要方向,以及他有哪几次在跟你的交流中,你觉得 OK 他没有去关注这个表面上的细节,而是直接戳到了比如说当前芯片设计的最核心的一个环节。
嘉宾/Mark|01:07:17 我真的去加入他的组里,跟他非常认真的去做一些研究的时候,
嘉宾/Mark|01:07:21 他当时一上来非常感兴趣的一点,
嘉宾/Mark|01:07:23 其实我觉得除了他没有人看到那个点,
嘉宾/Mark|01:07:25 他当然去尝试做完全和现在的深度学习不一样的,
嘉宾/Mark|01:07:29 另外一类完全逻辑的 AI 的加速,
嘉宾/Mark|01:07:32 从过去 AI 的发展是有两个不同的分支的,
嘉宾/Mark|01:07:35 一个是偏深度学习,
嘉宾/Mark|01:07:36 神经网络这种感知的这种分支,
嘉宾/Mark|01:07:39 然后另外一个是强逻辑的分支,
嘉宾/Mark|01:07:41 然后那种分支其实大家往往会去尝试构建很大的知识图谱,
嘉宾/Mark|01:07:45 去建立非常严谨的逻辑。
嘉宾/Mark|01:07:47 现在就变成比如说大家尝试去用 AI 证明一些数学定理。
主播/泓君|01:07:50 那是哪一年。
嘉宾/Mark|01:07:51 17 年的时候。
嘉宾/Mark|01:07:52 对但那个逻辑的 AI 的发展其实已经过去三四十年都有。
嘉宾/Mark|01:07:56 而且到现在为止都有很强的应用在比如我刚才提到的一些数学原理的证明。
嘉宾/Mark|01:08:01 再到一些芯片后面不拘不限里面其实是有非常强的逻辑的 AI 参与的。
嘉宾/Mark|01:08:06 所以被我当时很感兴趣的点就是。
嘉宾/Mark|01:08:08 英伟达已经可以把这种偏感知的神经网络类的 AI 加速的很好。
嘉宾/Mark|01:08:13 但是他看来其实未来的 AI 是强逻辑加强感知。
嘉宾/Mark|01:08:17 但强逻辑那一部分其实当时的角度基本没有人在关心。
嘉宾/Mark|01:08:20 因为之前几乎没有人做过针对性的硬件去做这件事情。
嘉宾/Mark|01:08:23 大家可能更多停留在软件层面。
嘉宾/Mark|01:08:25 那是我们从头去设计的一个全新的芯片架构。
嘉宾/Mark|01:08:28 就它和现在 CPU GPU 包括我们想做这些完全不一样的一个专门的加速器的架构来加速这件事情。
嘉宾/Mark|01:08:35 从现在的角度看来,因为我知道现在硅谷其实很多创业公司,大家开始有这个想法,
嘉宾/Mark|01:08:39 如何让比如现在的这些大模型 Transformer 更好地为一些数学原理,物理原理来服务。
嘉宾/Mark|01:08:46 其实这部分,我觉得未来可能也会是非常非常有影响力的一部分新的芯片的工作。
主播/泓君|01:08:53 所以你觉得它当时跟你们主导的这个强逻辑的芯片,就是重新设计的这个芯片,
主播/泓君|01:08:58 在今天的 AI 时代已经变成了一个主要方向,还是说它还是一个研发中的东西?
嘉宾/Mark|01:09:03 我觉得它还处在算法研发的过程中。
嘉宾/Mark|01:09:06 本身解这个逻辑问题的算法是非常固定的,叫 SAT 问题。
嘉宾/Mark|01:09:10 但如何把这个问题和 Transformer 更好结合起来,
嘉宾/Mark|01:09:15 让 Transformer 去把实际的复杂的数学和物理的问题拆解成这种强逻辑的问题。
嘉宾/Mark|01:09:21 我觉得是现在很多在尝试做 AI for Science 的公司在做的事情,
嘉宾/Mark|01:09:25 现在在算法层面还没有收敛。
嘉宾/Mark|01:09:28 未来如果大家发现这个真的很有效,以及未来如果真的科学探索的瓶颈在如何更快地解一个很复杂逻辑的问题上面的话,对芯片和硬件的需求会是确定的。
主播/泓君|01:09:40 嗯,你觉得它给你的启发更多的是在芯片领域上说,在学术领域的一些具体的我要走哪条路,哪个方向的一些学术上的启发,还是它的思考方式,沟通方式,一些人格特质上的启发更多?
嘉宾/Mark|01:09:56 我觉得是后者,刚刚提到我跟 Bill 做的第一个项目,之后包括我 PhD 的 Seasons 那些很多东西并不一定是某一个确定的方向。
嘉宾/Mark|01:10:06 比如说大家会看到他现在是 GPU 的奠基人,但其实我觉得本质他并没有和 GPU 绑定,GPU 只是结果,原因是因为他是一个非常好的 Researcher,非常好的一个 Architect。
嘉宾/Mark|01:10:16 所以他能发现最重要的东西是什么,并以最好的方式把它做出来,这个成就了现在的 GPU,
嘉宾/Mark|01:10:22 但是它对我影响更大的可能是一些芯片设计,系统设计,甚至怎么做研究,
嘉宾/Mark|01:10:28 更本质的需要关注的一些点,
主播/泓君|01:10:29 举一个例子,
嘉宾/Mark|01:10:31 举一个例子就是我们现在做的很多芯片,
嘉宾/Mark|01:10:34 会围绕一个点去出发叫 Locality 局部性,
嘉宾/Mark|01:10:37 而这件事情最早我是从 Bill 那一块得到了非常大的震撼,
嘉宾/Mark|01:10:41 他跟我说整个芯片设计,
嘉宾/Mark|01:10:43 一切都是围绕局部性去展开的。
主播/泓君|01:10:45 什么叫局部性?
嘉宾/Mark|01:10:46 局部性就是 location,把东西放在哪。
嘉宾/Mark|01:10:49 它的原话是,computer architecture is like real estate,。
嘉宾/Mark|01:10:53 it's all about location, location, location。
嘉宾/Mark|01:10:55 就时间上的局部性,空间上的局部性。
嘉宾/Mark|01:10:57 比如说我们之前会有 CPU 里面 Cache 的设计,
嘉宾/Mark|01:11:00 其实本身就是一种时间的局部性和空间局部性的使用。
嘉宾/Mark|01:11:04 时间局部性就是如果我用了一段数据。
嘉宾/Mark|01:11:06 那我会在未来的一段时间里面。
嘉宾/Mark|01:11:09 大概率会重复地使用这段数据。
嘉宾/Mark|01:11:10 这是时间局部性。
嘉宾/Mark|01:11:11 后面局部性说如果我用了一段数据。
嘉宾/Mark|01:11:14 那我大概率马上会用到它周围的一部分数据。
嘉宾/Mark|01:11:17 这是空间局部性。
嘉宾/Mark|01:11:18 然后我们现在想做的很多东西。
嘉宾/Mark|01:11:19 其实是我们在做 AI 芯片。
嘉宾/Mark|01:11:21 把模型的权重存在哪这件事情。
嘉宾/Mark|01:11:23 为什么我们想用 SRAM 来做这件事情。
嘉宾/Mark|01:11:26 就是因为希望使用 SRAM 提供最好的局部性。
嘉宾/Mark|01:11:29 因为在 AI 的这个时代。
嘉宾/Mark|01:11:30 尤其是我们做推理 decode 的这个过程。
嘉宾/Mark|01:11:33 时间局部性和空间局部性在算法上都被抹平了,就这些都不复存在了。
嘉宾/Mark|01:11:38 所以我们要在架构上做更多实际硬件上面的局部性来弥补这一点。
嘉宾/Mark|01:11:43 我觉得他在知道怎么更好的做事情,或者找到更值得做的事情的时候,我觉得他的逻辑是要找到最难的事情。
嘉宾/Mark|01:11:51 然后找到对整个系统影响最大的那个点,并尝试去解决它。
嘉宾/Mark|01:11:56 他会关心 trade-off,就是当你只做微小的提升的时候,其实你是可以保全大局的,你不需要做颠覆式的修改。
嘉宾/Mark|01:12:04 但如果你要做很难的数量级的提升的时候,你一定要很清楚地想明白哪些东西是你可以牺牲掉的。
嘉宾/Mark|01:12:11 哪些东西是你真正关键的?
嘉宾/Mark|01:12:12 只有当你想明白这些问题的时候,
嘉宾/Mark|01:12:14 你才能在整个系统层面做出更关键的选择,
嘉宾/Mark|01:12:16 你能跳出这个 local minimum,。
嘉宾/Mark|01:12:18 就像是深度学习的时候,
嘉宾/Mark|01:12:20 找到一个更大的全局最优的解。
主播/泓君|01:12:22 对,我觉得很有意思,
主播/泓君|01:12:23 这个其实就是说我们不要去做微创新,
主播/泓君|01:12:25 我们要找到最难的那个问题,
主播/泓君|01:12:27 从全局的角度去做颠覆式创新,
主播/泓君|01:12:30 但它意味着失败的概率很高。
主播/泓君|01:12:32 你跟 Bill 在合作的过程中有遇到说,
主播/泓君|01:12:35 OK,我找到了一个解,
主播/泓君|01:12:37 我尝试从这个方向做,
主播/泓君|01:12:39 但是它失败了。
嘉宾/Mark|01:12:40 我觉得非常非常多呀,但是我刚刚说的点其实和成功失败没有关系,就是它是你做事情的逻辑,就是什么样的事情是 Bill 觉得值得做的,以及现在是我们觉得值得做的,但是做的过程中肯定会有很多很多失败的情况,但是他不会否定你要解决的这个问题不是正确的问题,他只是你可能没有找到正确的解法,甚至这个解法可能是没有的。
主播/泓君|01:13:01 我觉得这段非常鼓舞人心。
主播/泓君|01:13:03 你回来创业,Bill Dally 给了你什么样的建议?
嘉宾/Mark|01:13:06 我跟 Bill 会讨论很多很多技术上面的细节。
嘉宾/Mark|01:13:10 就比如说当时我有一些想法,想把 SRAM 来做的时候,我会跟他讨论非常多。
嘉宾/Mark|01:13:13 因为他一开始也没有很细节地去看这个方向,但是当时我们是真的很仔细地去算了这个点。
嘉宾/Mark|01:13:19 他会给我很多技术上面的建议,因为其实我现在想做的很多东西和我当时 PhD 跟他一块做的东西,从方法原理上来讲是很相像的。
嘉宾/Mark|01:13:28 具体创业的建议的话,我想想。
嘉宾/Mark|01:13:31 哦 Bill 给我的建议就是。
嘉宾/Mark|01:13:33 一定不要用 PhD 写的代码。
嘉宾/Mark|01:13:35 因为这是 Bill 上一个创业里面的惨痛教训。
主播/泓君|01:13:40 嗯,他的整个特质还是更偏一个科学家。
嘉宾/Mark|01:13:43 是是是,对,这是 exactly,我刚刚其实想说,Bill 当时给我另外一些点,其实是怎么做研究。
嘉宾/Mark|01:13:49 但其实我现在会发现,比如那些东西并不一定是做公司最好的点。
嘉宾/Mark|01:13:53 我觉得做研究的本质就是用最小的代价获取最多的知识,这是他认为研究的本质。
嘉宾/Mark|01:13:59 所以当时比如说涉及到其他很多会愿意真的去流片,用科研经费把片子造出来,
嘉宾/Mark|01:14:05 但是在 Bill 看来这个就完全不必要,因为你已经在流片之前获得 99%的支持了,流片并不能给你带来一些额外的除了工程上面实现之外的东西。
嘉宾/Mark|01:14:13 但是就现在创业这件事情其实就是你要去解决那个剩下 1%工程上面的事情,而且这部分可能要花费你 99%的精力。
主播/泓君|01:14:21 工程可能不算剩下 1%,它应该也是一个占挺大的比重的。
嘉宾/Mark|01:14:26 对对对,我的意思是实际上你要花很多的精力去做它,但是它对于这件事情能不能做成的贡献就是没有那么大。
嘉宾/Mark|01:14:32 你可以在不做工程之前就从设计的角度知道这件事情技术的瓶颈在哪,能不能做。
嘉宾/Mark|01:14:40 但是实际工程上要解决的实际设计散热供电的那些问题是你要花很多的精力去真的把它做出来的。
主播/泓君|01:14:47 嗯嗯,那子扬,你要不要讲一下,就是你在亚马逊做自研的 AI 芯片,比如说你给他们写编译器,写软件栈,因为我在亚马逊它也有一个非常哲学思考的问题,跟刚刚 Mark 说的是有一些一脉相承的,就是说我们不要先从一个细小的点去推这个事情。
主播/泓君|01:15:06 你认为这个事情应该怎么样?因为你要先设计整个系统,再去反推最优的芯片是什么样的?
主播/泓君|01:15:13 你要不要讲一下整个亚马逊它的,包括你做软件的这一套工程哲学?
嘉宾/徐子扬|01:15:18 首先从系统上来说,软件是在系统最上方的,用户是从软件入手的。
嘉宾/徐子扬|01:15:23 其实亚马逊有两个哲学,一个跟芯片相关,是从系统去反推硬件,还有一个就是 customer obsession,我们要想的是用户最后想要的是什么。
嘉宾/徐子扬|01:15:33 所以用户他去用的这个软件栈要来反推之前的所有的东西,另外一种方法可能是以中为始。
嘉宾/徐子扬|01:15:40 所以我们在去思考这件事的时候,比如说我们要做一个 AI 的加速器,那要很明确地想清楚我们这个要加速的 work load 是什么样的,它是哪一些模型或者是哪一类的模型会放在我们这个加速器上去做,它是去做训练还是推理,还是两者都做。
嘉宾/徐子扬|01:15:58 这个会直接地影响到你从每一层的,从高维的系统往回反推,最后到芯片上的一个具体的设计是怎么样的。
嘉宾/徐子扬|01:16:07 首先大方向要掌握对,然后要能从这个大方向一点一点的有逻辑的反推回来。
嘉宾/徐子扬|01:16:13 比如说其实在这个芯片设计里面有一个非常重要的参数,它的定义是指你的计算的带宽和你的访存带宽的一个比值。
嘉宾/徐子扬|01:16:23 这个会决定我们在读取一份数据以后,在这一份数据上要做多少次计算,它才能把计算和访存都给用到。
嘉宾/徐子扬|01:16:32 这个比值会直接的影响到哪一些模型或者应用在这款芯片上它用的是最好的。
嘉宾/徐子扬|01:16:39 所以比如我们在设计下一代的芯片的时候,就会很明确的去想最终的 workload 是什么样的。
嘉宾/徐子扬|01:16:46 我们的系统会是多少个节点去做完整的系统。
嘉宾/徐子扬|01:16:50 这可能要先从这多少个节点可以在物理上装得下,能装下模型,和在物理上能被接纳。
嘉宾/徐子扬|01:16:56 这样再去反推,最后去结合到最后我们要把这个比值定在多少。
嘉宾/徐子扬|01:17:02 当硬件一旦确定的话,我们之后其实会直接影响你要怎么去对不同的软件做优化。
嘉宾/徐子扬|01:17:08 所以我觉得整体的方向上首先要知道用户想要的是什么。
嘉宾/徐子扬|01:17:12 这个有可能不一定是用户今天在用的,有可能是用户在芯片制作出来的那个时候会想要的时候。
主播/泓君|01:17:18 未来两三年会用到的。
嘉宾/徐子扬|01:17:19 对,未来两三年,因为本身芯片是一个长周期的一个事情。
主播/泓君|01:17:22 好的好的,好谢谢,谢谢两位。
嘉宾/徐子扬|01:17:24 好谢谢大家。
主播/泓君|01:17:31 那今天是我们在节目发出前的一次补录,来聊一聊 OpenAI 的推理芯片啊。
主播/泓君|01:17:36 因为 OpenAI 其实是在我们录制的当天,也就是 6 月 24 号,它是跟博通发布了第一颗自研的推理芯片 Jalapeño。
主播/泓君|01:17:46 子扬,你们在这些天有没有研究 OpenAI 它的推理方案是怎么样的,就跟你们想的思路有什么不一样?
嘉宾/徐子扬|01:17:54 对的,我们其实也在 Jalapeño 出了以后,认真地探索了一下他们公开资料有的这些信息,包括他们在 Hot Chips 分享的一些内容。
嘉宾/徐子扬|01:18:05 首先他们做的这个芯片目前是一个 AI 推理芯片,但是定性的它是一个通用的 AI 推理芯片,和 GPU 还是比较接近的。
嘉宾/徐子扬|01:18:15 它的通用性体现在它可以跑各种模型,甚至一些游戏它都 demo 可以跑出来。
嘉宾/徐子扬|01:18:22 可以说几个我们看下来它的几个侧重点,包括一些和我们不一样的点。
嘉宾/徐子扬|01:18:27 最重要的一个其实是我们之前讨论过的一个电的效率和钱的效率上。
嘉宾/徐子扬|01:18:33 OpenAI 看到的是它对电的效率非常非常的敏感,因为现在美国这个数据中心缺的并不是资本和这些空间,而是这个电的供给。
嘉宾/徐子扬|01:18:42 所以它非常需要同样的电的产能,能产出更多的 token,产出更多的智能,也意味着更多的收入。
嘉宾/徐子扬|01:18:50 然后我们看到这颗芯片它在功耗上做了很多的工作,所以它的每瓦每或者每 MW 能产出的这个 token 数是大于英伟达对应的 Rubin 的架构的。
嘉宾/徐子扬|01:19:02 另外一个特点,刚刚说到它是一个通用的,这也包含很多的意涵。
嘉宾/徐子扬|01:19:07 首先它通用性体现在它把我们之前说的一些异构的部分,包括 Pre-Filled Decode,然后还有 Attention FFN,其实它都用一颗芯片全包了。
嘉宾/徐子扬|01:19:17 它在设计上比如说加入了一些对小的维度的矩阵乘法这个支持,所以在整个 batch size 比较小的情况下,性能也能做到比较好。
嘉宾/徐子扬|01:19:26 还有一些公开的信息甚至说它下一代要去支持训练。
嘉宾/徐子扬|01:19:31 所以其实在通信上是和我们的一些包括 Groq,Cerebras 系统级的异构思路上是有一些不同的。
嘉宾/徐子扬|01:19:39 还有一个小的特点,就是这颗芯片它其实去说了,它用了很多的这个 AI 来帮助。
嘉宾/徐子扬|01:19:46 包括从这个软件栈上看,它的乌鲁朗的语言写的 kernel,很多的优化很大程度上交给了 Codex。
嘉宾/徐子扬|01:19:53 另外它的芯片的设计,无论是性能的优化,还是 time to market,就从它的项目启动到流片的一些速度。
嘉宾/徐子扬|01:20:01 我们看到是和之前的这些芯片项目比有挺大的提升的,它的说是启动到流片用了 9 个月。
主播/泓君|01:20:08 对,这个速度是相当快了。
主播/泓君|01:20:10 那我其实有一个疑问啊,就是当时我们在录播客的时候,
主播/泓君|01:20:14 我们是讲到其实业界,您提到推理芯片,它是在向 SRAM 的这条路径收敛,
主播/泓君|01:20:21 但是我们看其实 OpenAI 的这个芯片,它并没有走上存储的这条路啊,
主播/泓君|01:20:26 而是把 HBM4 的带宽堆到了单封装每秒 15.4TB。
主播/泓君|01:20:32 我好奇的问题是比如说它同样是解决带宽的问题啊,
主播/泓君|01:20:36 但 HBM 它其实是挺贵的一条路,为什么他们会选这一条最贵的路?
嘉宾/徐子扬|01:20:42 对,其实这个贵就是很重要的一点,这个贵是代表着你买对应的芯片,买存储,买这个存储的带宽,你的价格比较高。
嘉宾/徐子扬|01:20:51 但是比如刚刚说,其实 OpenAI 它的最本质的限制在于电,它可能对于这个资本的开销,对于造芯片的这些成本来说没有那么敏感。
嘉宾/徐子扬|01:20:59 这个其实也和中美的一些在算整个经济账上不太一样。
嘉宾/徐子扬|01:21:04 中国的电的比例比较低,占三分之一甚至更少。
嘉宾/徐子扬|01:21:08 在美国是三分之二,更多是电。
嘉宾/徐子扬|01:21:11 但其实这个本身成本是一部分,另外一部分是供给。
嘉宾/徐子扬|01:21:14 美国的电本身有比较明确的一个每年能提供多少新增的电的产能。
嘉宾/徐子扬|01:21:20 如果我想要在这个确定产能内去产出更多的 token 更多的智能,
嘉宾/徐子扬|01:21:24 其实我们更关心的是这个芯片的电转换成 token 的效果。
嘉宾/徐子扬|01:21:31 我们之前提到的 SRAM 的最本质的一个优势是每一块钱的买到的带宽比 HBM 高很多数量级。
嘉宾/徐子扬|01:21:44 这一点转化成了你最后花同样的价格去生产芯片,或者是同样的芯片产能去生产芯片,我们能得到更多的 token,
嘉宾/徐子扬|01:21:53 但目前来看 OpenAI 跟关系的是另外一个指标,就是从电的角度。
主播/泓君|01:21:57 OK 总结来说还是第一点省电。
嘉宾/徐子扬|01:21:59 对,省电其实是反过来为什么 SRAM 相对来说没那么诱惑的一点是他们对这个成本没那么关心。
嘉宾/徐子扬|01:22:07 SRAM 它的带宽非常高,但是它在容量上比较受限。
嘉宾/徐子扬|01:22:11 所以在做这个芯片的通用性上其实是比较受限。
嘉宾/徐子扬|01:22:15 包括我们自己的方案,包括 Groq 和 Cerebras 的方案,
嘉宾/徐子扬|01:22:21 一个芯片要去和别的芯片去配合,但我们看到 OpenAI 的选择方案是去做一个更通用的芯片。
嘉宾/徐子扬|01:22:28 这个其实我们在上一次讨论的时候说到了这种模型公司和这种云厂商,它业务比较多元,然后也有训练的需求,模型也无法把我们语音这种图像的模型也要跑。
嘉宾/徐子扬|01:22:40 所以它对于这个芯片的通用能力要求比较高。
嘉宾/徐子扬|01:22:43 这本身做芯片都是 trade-off 嘛,当你的需求的点,你有一些对容量要求很高,有些对带宽要求很高。
嘉宾/徐子扬|01:22:50 那我就要找一个更全能的,它可能会更贵的一个解决方案。
嘉宾/徐子扬|01:22:54 它的最后就指向在这个点上,HBM 的确做得很好,
嘉宾/徐子扬|01:22:58 尤其是 HBM 的 4,它的带宽的确比之前也有很大的提高。
主播/泓君|01:23:03 那如果是长上价文的 KV Catch,HBM 的方案会比 SRAM 有优势吗?
嘉宾/徐子扬|01:23:09 这个其实涉及到还是我们要不要做异构,
嘉宾/徐子扬|01:23:12 包括我们自己想的方案和,
嘉宾/徐子扬|01:23:19 Cation 这部分的 KV Cache 放在了另外一块芯片上,就是不是大 SRAM 的这个方案上。
嘉宾/徐子扬|01:23:26 至于这个长上下文,它对于这个 KV Cache,对于这个容量需求有多大,其实我们看到最近的几个月有非常大的变化,包括 DeepSeek 的新模型出了之后,它的第一张图就是每一个 Token 的 KV Cache,它在每一代都往下缩,这一次是缩了四分之一到八分之一,所以具体就是在我们之后遇到场上下文,它对容量有多大的需求,这个是一个正在变化的事情,但是因为。
嘉宾/徐子扬|01:24:04 SRAM 用的数量会不断地增长,所以一定程度上对于容量的性价比是有要求的。
主播/泓君|01:24:14 这一点就落在了一个 SRAM 不太舒适的区间内,所以我们自己去想这个问题的时候是,我们不会优先地考虑用 SRAM 去存 KV Cache。
主播/泓君|01:24:23 哦,了解。那还有一个问题是,因为 HBM 它每一代的带宽提升比 SRAM 它的密度提升要快嘛,
主播/泓君|01:24:33 所以 SRAM 其实它是需要 6 个晶体管才能存一个比特的,那 SRAM 它路径的优势窗口会不会在两三年以后就关上了,
主播/泓君|01:24:39 因为其实芯片的周期还是很快的,比如说一年半到两年,然后 OpenAI 这个 9 个月就造出来了。
嘉宾/徐子扬|01:24:43 但是我们去看 HBM 它的带宽的增长。
嘉宾/徐子扬|01:24:46 虽然现在已经做到一个很好的一个数字。
嘉宾/徐子扬|01:24:50 但它带宽的增长其实也没有大家想的那么乐观。
嘉宾/徐子扬|01:24:53 包括这一代之后的带宽增长从哪里来。
嘉宾/徐子扬|01:24:54 其实也不是很确定。
嘉宾/徐子扬|01:24:56 这个其实第一性的去思考的。
嘉宾/徐子扬|01:25:02 就是你的连线还是通过走着某一种同线。
嘉宾/徐子扬|01:25:03 它不一定是同线。
嘉宾/徐子扬|01:25:06 但是它不是光刻出来的这个线去走。
嘉宾/徐子扬|01:25:07 在一个代内的这个。
(中插广告) 音频在此处插入约半分钟节目广告,不属于访谈内容。
主播/泓君|01:25:43 你觉得 SRAM 它现在相比于其他的方案它有哪些缺点?
嘉宾/徐子扬|01:25:58 对,最大的缺点其实就是容量的性价比,因为它要用六个 transistor 去锁一个 bit,而且一般来说我们为了达到这个带宽要放在同一个带上,所以 SRAM 的堆叠其实是会降低它的出来的带宽的。
嘉宾/徐子扬|01:26:01 所以在这个点上它的容量的性价比非常的低。
嘉宾/徐子扬|01:26:08 如果我们对存储有很大的需求,需要存非常多的数据,那 SRAM 它可能不是一个最优的方案。
嘉宾/徐子扬|01:26:15 但这个其实要分成两个问题讨论,你要存的数据量可能很大,但它是一个固定的量的时候。
嘉宾/徐子扬|01:26:23 那比如说我们要把模型的权重全部存在 SRAM,那我们可以用很多个芯片去组成一个集群去做。
嘉宾/徐子扬|01:26:38 这个还是在 SRAM 可以接受空间内,但如果你的要存的数据它是一个变化很多,并且可能未来持续增长,比如说我们刚刚说到这个 KV Cache,那我们就认为它在容量上的受限这个缺点,就会使得它不适合这个场景。
嘉宾/徐子扬|01:26:40 嗯,了解。
嘉宾/徐子扬|01:26:42 上一次其实我们在聊天的时候,
主播/泓君|01:26:46 你有说到你觉得业界推理芯片的方案在向 SRAM 收敛,
主播/泓君|01:26:48 那 OpenAI 这个芯片出来以后,
主播/泓君|01:26:50 你还会保持这个判断吗?
嘉宾/徐子扬|01:26:54 呃,我觉得在一定程度上,
嘉宾/徐子扬|01:26:56 在这个大的系统级异构中,
嘉宾/徐子扬|01:26:59 为了提高 Token 的性价比这边,
嘉宾/徐子扬|01:27:02 还会有很多公司在向 SRAM 这里收敛。
嘉宾/徐子扬|01:27:04 但是的确 OpenAI 提出这个思路,
嘉宾/徐子扬|01:27:06 有非常有意思的地方,
嘉宾/徐子扬|01:27:09 它其实是把异构的这一点给。
嘉宾/徐子扬|01:27:15 芯片里有很多的这些部分,它们之间是异构的。
嘉宾/徐子扬|01:27:20 OpenAI 提出了一个 Dark Silicon 暗硅的一个概念,当然这个概念一直都存在。
嘉宾/徐子扬|01:27:31 OpenAI 认为它比较容易接受这个的成本代价,就是我拿着一个芯片去做不同的事,做某些事的时候可以把其中一些部分关掉或者降低它的功耗。
嘉宾/徐子扬|01:27:42 这种样的异构和我们想的系统级的异构的最大的区别其实还是它是用了更多的成本去买这个芯片,但是它可以做到电的效率更高。
嘉宾/徐子扬|01:27:46 所以从 per dollar 的角度,它这个方案其实是不会很好的。
嘉宾/徐子扬|01:27:54 我觉得这个其实涉及到一个我们在不同的市场条件下,限制条件不同,它会收敛到不太一样的地方。
嘉宾/徐子扬|01:28:01 然后我们看到在对带宽的要求非常高和带宽性价比非常高的地方,还是会收敛到 SRAM 这个方案。
嘉宾/徐子扬|01:28:08 但是比如说对电是第一限制的话,可能 OpenAI 这个方案也是一个很好的解决方案。
主播/泓君|01:28:14 你们在研究它这个方案的时候,会觉得对你们现在做芯片的思路有什么样的启发吗?
嘉宾/徐子扬|01:28:23 我觉得其实对于 AI 的使用上,一部分验证我们的一些想法,包括软件战能被 AI 快速地提升,
嘉宾/徐子扬|01:28:29 但是他们比如说这个 AI 怎么来做这个芯片的设计和优化,这个对我们其实有一定的启发。
嘉宾/徐子扬|01:28:47 异构是发生在系统级,用不同的芯片去组异构,还是发生在芯片内,在芯片内用不同的单元去组异构,我觉得这个其实就是在不同的市场下,它的限制条件不一样,会走出不一样的路径,这个在我们看清楚了之后,我们觉得我们的一些想法还是成立的。
主播/泓君|01:28:53 对,然后异构发生在芯片内,这个现在业界是只有 OpenAI 这样做了,对不对?
嘉宾/徐子扬|01:29:00 哦,就是异构发生在这个芯片内,这个是 OpenAI 比较明确地展示出来。
嘉宾/徐子扬|01:29:08 但比如说原先的英伟达 GPU 也可以理解为异构发生在芯片内,只不过它是一个通用的芯片,更强调它的通用性。
嘉宾/徐子扬|01:29:17 就是它没有想 OpenAI 去说我把不同的需求放在一起,并且通过各种方式能关闭一些东西来提高它的电的效率。
嘉宾/徐子扬|01:29:21 这个是我第一次看到这样一个解决方案。
嘉宾/徐子扬|01:29:30 异构发生在系统级,包括之前讨论到的 Groq,Cerebras,和现在很多的 AI 芯片,其实都是在往系统级的方式走。
嘉宾/徐子扬|01:29:39 一些芯片来配合做不同的事情,包括 PD 分离这个大的场景下,包括训练和推理分离,这些都是异构发生在系统级。
主播/泓君|01:29:48 嗯,了解。您觉得现在或者说未来整个推理芯片市场还会是英伟达的天下吗?整个市场格局会变成什么样?
嘉宾/徐子扬|01:29:54 啊,这个问题很难回答。我们当然不希望它是英伟达的天下。
嘉宾/徐子扬|01:30:02 那这样,这么多在做有意思探索的公司,那这句话就意味着这些公司就不会存活嘛,包括我们。
嘉宾/徐子扬|01:30:14 以 GPU 为核心的英伟达在做一些其他的探索上可能会在迭代的速度上,包括他们的方案的选择上会有一定的限制。
嘉宾/徐子扬|01:30:23 所以我们也看到了就是有很多在做的新的方案其实不是从英伟达出发的,包括 Groq,也看到了英伟达去 acqui-hire 的 Groq。
嘉宾/徐子扬|01:30:34 对,所以我觉得我没有办法直接回答这个问题,但是我们希望整个 AI 的芯片变得更多彩一些,这个方案变得更多一些,这个也符合我们对于整个异构物的一个认知。
主播/泓君|01:30:38 嗯,感谢子扬的这个补充,我觉得还是解决了很多困惑的。
主播/泓君|01:30:40 嗯,好的好的。
主播/泓君|01:30:49 好了,那这就是我们今天的节目,这集节目确实比较技术,理解起来会有一点困难。
主播/泓君|01:30:55 如果大家不在这个行业呢,听不懂也没关系,因为我自己也花了一些时间去消化它。
主播/泓君|01:31:01 但是呢,其实特别开心啊,能跟这个行业里面很多有想法的年轻人去聊天。
主播/泓君|01:31:11 不仅仅是前沿技术的方向,每次聊到能把一个产业带起来像 Bill Dally 的这些学术大咖们,也总能从他们的身上去获得很多力量。
主播/泓君|01:31:15 大家听完是什么样的感受,欢迎与我们分享留言。
主播/泓君|01:31:20 大家可以通过苹果播客小宇宙 Spotify 来收听订阅我们。
主播/泓君|01:31:26 视频的听众也可以通过 B 站和 YouTube 搜索硅谷 101 播客找到我们。
主播/泓君|01:31:28 我是泓君,感谢大家的收听。
References
- 1E251 官方单集页
sv101.fireside.fm
- 2E251 官方 RSS
feeds.fireside.fm
- 3
- 4
- 5NVIDIA Research:William Dally
research.nvidia.com
- 6
- 7
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.