唐杰引用 Liam Fedus:FLOPs 是 intelligence,参数是 knowledge

唐杰引用 Liam Fedus:FLOPs 是 intelligence,参数是 knowledge

唐杰引用 Liam Fedus 回顾 Switch Transformers 的帖子,认可「计算量与参数量承担不同作用」这一判断;文章解释 1.6T 总参数与少于 3B 激活参数背后的稀疏路由,并划清它与新模型发布之间的边界。

一条引用转帖,新增的是一个判断

北京时间 2026 年 8 月 21 日 16:56,清华大学教授、智谱 AI 首席科学家唐杰在 X 引用了 Liam Fedus 的帖子。Liam Fedus 目前在 Periodic Labs 从事工业规模科学研究,曾任 OpenAI 后训练负责人;他在原帖中回顾了 Switch Transformers 的稀疏模型实验,并称这段内容是「来自 @jietang 的一段很好的 scaling law 历史」。12
Liam Fedus 的回顾重点是:2020 年,研究者用 Switch Transformers 探索稀疏性的边界,让每个 token 只路由到 2048 个专家中的 1 个。模型的总参数量达到约 1.6T,但实际激活的参数少于 3B。Liam Fedus 还写道,这个模型在 C4 困惑度上超过了 T5,在 TriviaQA 上取得当时的最佳结果,却在 SuperGLUE 这类推理任务上表现很差。2
唐杰给这段回顾的评论是:
「cool comment: FLOPs were intelligence; parameters were knowledge!」1
这条动态提供的是唐杰对一段模型扩展历史的公开认可。帖子里没有给出新模型、新评测或新的 GLM 配置。
Cargando tarjeta de contenido…

Switch Transformers 把两条扩展轴拆开了

FLOPs 是浮点运算次数,可以把它理解成模型处理一个输入时实际做了多少计算。参数量则是模型中可学习权重的总规模。稠密模型让同一套权重处理所有 token;Switch Transformer 把 Transformer 的稠密前馈网络替换成稀疏的 Switch FFN,再由路由器把每个 token 送到概率最高的单个专家。3
当专家数量增加时,每个专家都有自己的前馈网络权重,所以模型的总参数量会继续增长。每个 token 仍然只经过一个专家,单个 token 的专家计算量就可以大致保持在同一量级。原论文把这件事概括为:在接近固定 FLOPs 的条件下,增加参数量,观察更多参数能否提升样本效率和模型质量。3
读法本条回顾中的量具体含义
总参数量约 1.6T所有专家的权重加总,代表模型可以容纳的总参数规模。2
激活参数量少于 3B一次处理 token 时,真正参与计算的参数只是总参数的一部分。2
路由方式1 / 2048路由器从 2048 个专家中为每个 token 选择 1 个;论文将这种方式称为 top-1 routing。3
这就是那句英文的技术背景。这里的 intelligence 更接近实际计算预算:模型能为一个 token 做多少步变换。knowledge 更接近参数所承载的表征和容量。把 knowledge 直接理解成训练数据里逐条存储的事实,会把这句经验性概括读得过窄。

参数更多,为什么仍然可能「推理很差」

Switch 的设计说明,总参数量与单次计算量可以沿着不同方向增长。参数更多,意味着模型拥有更多专家和更大的权重集合;单次计算量受路由限制,意味着一个 token 只调用其中一小部分。模型因此可以在相近的计算预算下扩大参数规模,但每个任务实际调用了哪些专家、任务需要多少计算,仍然会影响结果。3
Liam Fedus 提到的 C4、TriviaQA 和 SuperGLUE,正好把这个边界放在同一条线上:语言建模困惑度、知识问答和推理任务需要的能力并不相同。一个模型在前两类指标上变好,不能直接推出它在推理任务上也会同步变好。这个结论来自他对历史实验的回顾,唐杰的评论认可了其中的经验判断;它本身仍然需要放回具体任务和评测协议中理解。2
工程上,稀疏路由也会带来额外条件。论文讨论了专家之间的通信、专家容量、token 溢出和负载均衡;路由器选得再稀疏,设备间传输和不均衡的专家负载仍然会消耗计算资源。3

唐杰这句评论的边界

唐杰写的是「cool comment」,他认可的是 Liam Fedus 对一段历史经验的压缩表达:计算量和参数量承担的作用可能不同,扩展模型时不能只盯着一个数字。 这句话延续了他近期关于 scaling law 的公开讨论,但当前这条引用转帖没有把判断落到某个新模型、某个训练配方或某项 GLM 评测上。
后续看到新模型或新版本时,读者可以分开看三组数字:
  • 总参数与激活参数:模型究竟把多少参数放进专家池,每个 token 实际调用多少参数;
  • 训练与推理计算量:厂商报告的是 FLOPs、tokens、训练时间,还是部署时的真实吞吐;
  • 任务和评测协议:模型是在语言建模、知识问答、代码还是多步推理上变好,评测是否给出了足够的任务细节。
本条动态的新增信息很集中:唐杰公开认可 Liam Fedus 对 Switch Transformers 历史的概括,并再次把「参数规模」与「实际计算」放在同一张 scaling law 图里讨论。至于这条判断将如何对应后续 GLM 模型,仍要看唐杰或智谱公布具体架构、训练预算和任务结果。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel