唐杰引用 Liam Fedus:FLOPs 是 intelligence,参数是 knowledge

唐杰引用 Liam Fedus:FLOPs 是 intelligence,参数是 knowledge

唐杰引用 Liam Fedus 回顾 Switch Transformers 的帖子,认可「计算量与参数量承担不同作用」这一判断;文章解释 1.6T 总参数与少于 3B 激活参数背后的稀疏路由,并划清它与新模型发布之间的边界。

一条引用转帖,新增的是一个判断

北京时间 2026 年 8 月 21 日 16:56,清华大学教授、智谱 AI 首席科学家唐杰在 X 引用了 Liam Fedus 的帖子。Liam Fedus 目前在 Periodic Labs 从事工业规模科学研究,曾任 OpenAI 后训练负责人;他在原帖中回顾了 Switch Transformers 的稀疏模型实验,并称这段内容是「来自 @jietang 的一段很好的 scaling law 历史」。12
Liam Fedus 的回顾重点是:2020 年,研究者用 Switch Transformers 探索稀疏性的边界,让每个 token 只路由到 2048 个专家中的 1 个。模型的总参数量达到约 1.6T,但实际激活的参数少于 3B。Liam Fedus 还写道,这个模型在 C4 困惑度上超过了 T5,在 TriviaQA 上取得当时的最佳结果,却在 SuperGLUE 这类推理任务上表现很差。2
唐杰给这段回顾的评论是:
「cool comment: FLOPs were intelligence; parameters were knowledge!」1
这条动态提供的是唐杰对一段模型扩展历史的公开认可。帖子里没有给出新模型、新评测或新的 GLM 配置。
콘텐츠 카드를 불러오는 중…

Switch Transformers 把两条扩展轴拆开了

FLOPs 是浮点运算次数,可以把它理解成模型处理一个输入时实际做了多少计算。参数量则是模型中可学习权重的总规模。稠密模型让同一套权重处理所有 token;Switch Transformer 把 Transformer 的稠密前馈网络替换成稀疏的 Switch FFN,再由路由器把每个 token 送到概率最高的单个专家。3
当专家数量增加时,每个专家都有自己的前馈网络权重,所以模型的总参数量会继续增长。每个 token 仍然只经过一个专家,单个 token 的专家计算量就可以大致保持在同一量级。原论文把这件事概括为:在接近固定 FLOPs 的条件下,增加参数量,观察更多参数能否提升样本效率和模型质量。3
读法本条回顾中的量具体含义
总参数量约 1.6T所有专家的权重加总,代表模型可以容纳的总参数规模。2
激活参数量少于 3B一次处理 token 时,真正参与计算的参数只是总参数的一部分。2
路由方式1 / 2048路由器从 2048 个专家中为每个 token 选择 1 个;论文将这种方式称为 top-1 routing。3
这就是那句英文的技术背景。这里的 intelligence 更接近实际计算预算:模型能为一个 token 做多少步变换。knowledge 更接近参数所承载的表征和容量。把 knowledge 直接理解成训练数据里逐条存储的事实,会把这句经验性概括读得过窄。

参数更多,为什么仍然可能「推理很差」

Switch 的设计说明,总参数量与单次计算量可以沿着不同方向增长。参数更多,意味着模型拥有更多专家和更大的权重集合;单次计算量受路由限制,意味着一个 token 只调用其中一小部分。模型因此可以在相近的计算预算下扩大参数规模,但每个任务实际调用了哪些专家、任务需要多少计算,仍然会影响结果。3
Liam Fedus 提到的 C4、TriviaQA 和 SuperGLUE,正好把这个边界放在同一条线上:语言建模困惑度、知识问答和推理任务需要的能力并不相同。一个模型在前两类指标上变好,不能直接推出它在推理任务上也会同步变好。这个结论来自他对历史实验的回顾,唐杰的评论认可了其中的经验判断;它本身仍然需要放回具体任务和评测协议中理解。2
工程上,稀疏路由也会带来额外条件。论文讨论了专家之间的通信、专家容量、token 溢出和负载均衡;路由器选得再稀疏,设备间传输和不均衡的专家负载仍然会消耗计算资源。3

唐杰这句评论的边界

唐杰写的是「cool comment」,他认可的是 Liam Fedus 对一段历史经验的压缩表达:计算量和参数量承担的作用可能不同,扩展模型时不能只盯着一个数字。 这句话延续了他近期关于 scaling law 的公开讨论,但当前这条引用转帖没有把判断落到某个新模型、某个训练配方或某项 GLM 评测上。
后续看到新模型或新版本时,读者可以分开看三组数字:
  • 总参数与激活参数:模型究竟把多少参数放进专家池,每个 token 实际调用多少参数;
  • 训练与推理计算量:厂商报告的是 FLOPs、tokens、训练时间,还是部署时的真实吞吐;
  • 任务和评测协议:模型是在语言建模、知识问答、代码还是多步推理上变好,评测是否给出了足够的任务细节。
本条动态的新增信息很集中:唐杰公开认可 Liam Fedus 对 Switch Transformers 历史的概括,并再次把「参数规模」与「实际计算」放在同一张 scaling law 图里讨论。至于这条判断将如何对应后续 GLM 模型,仍要看唐杰或智谱公布具体架构、训练预算和任务结果。
唐杰THU 动态追踪

唐杰THU 动态追踪

追踪唐杰THU(清华教授、智谱AI首席科学家)在微博与X平台的公开动态,涵盖发帖、回复与互动。

이 콘텐츠는 채널이 자동으로 생성했습니다. 한 문장이면 Neodrop이 당신을 위해 계속 만들어 냅니다.

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel