唐杰质疑「倒推模型规模」:最优尺寸取决于激活参数、数据量与推理成本

唐杰质疑「倒推模型规模」:最优尺寸取决于激活参数、数据量与推理成本

9 月 10 日上午唐杰在 X 引用转帖,公开质疑简单根据能力倒推 Fable 5 规模的假设,指出最优模型规模取决于数据量、激活参数量、强化学习环境数与目标推理成本,并发布了教师节寄语与微博动态。

2026 年 9 月 10 日上午,清华大学计算机系教授、智谱首席科学家唐杰在 X 与微博平台连续发布三条公开动态。三条动态集中在 40 分钟内:10:04 在微博发布一条指向其个人主页的短链接;10:10 在 X 引用转帖,公开质疑「根据模型能力倒推参数规模」的做法,并列举了确定最优模型规模的四个关键变量;10:43 在 X 发布英文祝福,庆祝教师节并附带工作加油寄语。

质疑 Charlie O'Neill 的模型规模推断

北京时间 9 月 10 日 10:10,唐杰在 X 平台对 Charlie O'Neill(@oneill_c,就职于 Baseten)前一日的推断发表了引用转帖。1
Cargando tarjeta de contenido…
Charlie O'Neill 在北京时间 9 月 9 日 22:32 发布推文,试图估算 Anthropic 旗下 Claude Fable 5 的模型参数量。他写道:Fable 的参数量大概在 2T 至 2.5T,而非传闻的 10T;Kimi K3 的总参数量为 2.8T,训练使用了大约 2 万至 3 万张 Blackwell 等效芯片;在实际能力上,K3 与 Fable 5 相当接近;Anthropic 拥有远多于月之暗面的算力储备、更好的强化学习环境、更优的架构以及更强效的优化器,这些条件都会增加单个参数所承载的能力;在上述前提下,如果 Fable 5 仅略微领先 K3,那么 Fable 几乎可以确定是一个更小体积的模型;随后的 GPT-5.5 与 5.6 体积还会更小。2
Cargando tarjeta de contenido…
面对这套推导,唐杰在转帖中表达了明确的反问:
“Are you sure? Finding the optimal model size is tricky: data volume, active parameter count, the number of environments, and the target inference cost. Model performance also depends on many other factors, each introducing its own variability.” 1
唐杰将确定模型最优规模的核心约束归纳为四个维度:数据总量(data volume)、激活参数量(active parameter count)、强化学习环境数量(the number of environments),以及目标推理成本(target inference cost)。在他看来,模型最终展现出的性能受到大量复杂因素影响,每一项都会给系统引入独立的变量,简单根据基准跑分差距来反推基础模型参数规模往往脱离了真实的工程边界。1
北京时间 10:27,Charlie O'Neill 对唐杰的质疑做出公开回复:“No im not sure but i believe it’s a decent guess”(我确实无法确定,但我相信这是一个合理的猜测)。这一互动引发了社区对大模型参数效率与稀疏架构的进一步讨论。3

两种视角的维度对照

Charlie O'Neill 的估算属于基于外部观察的线性推演,唐杰则从大模型研发与部署全流程提出了具体的工程约束。两者关注的变量对比如下:
评估维度Charlie O'Neill 的外部推断假设唐杰指出的工程约束核心变量
参数口径关注总参数量(推测 Fable 约为 2-2.5T,对比 K3 的 2.8T)强调激活参数量(Active Parameters),在稀疏 MoE 架构中起决定作用
数据与环境宽泛提及拥有更多算力与更好优化器明确区分数据总量(Data Volume)与强化学习环境数量(Environments)
落地约束主要以基准能力和同级别表现作为倒推依据将目标推理成本(Target Inference Cost)作为定义最优规模的硬性前提
确定性认知认为能力相近且算力更充裕时参数必然更小强调影响性能的变量极多,每一项都在引入独立波动

微博短链与教师节发帖

在讨论模型规模的前后,唐杰还在微博和 X 发布了两条简短动态。
北京时间 9 月 10 日 10:04,唐杰在微博发布了一条纯链接内容:“http://t.cn/AX01vW26”。原帖未附带文字说明或图片。4 经实测解析,该微博短链接执行 HTTP 302 重定向后,最终指向唐杰本人的微博个人主页(weibo.com/u/2126427211)。5 评论区中,读者主要在教师节当天留言表达节日祝贺,也有投资者讨论相关技术与市场变化。
北京时间 10:43,唐杰在 X 平台发布了一条原创短帖:“Add oil and Happy Teacher's Day”6
Cargando tarjeta de contenido…
9 月 10 日是中国教师节。唐杰身兼清华大学计算机系长聘教授职务,长期指导一线博士生与科研团队,这条发帖直接对应了其教师身份。「Add oil」(加油)也是他近期的惯用口头表达,例如在 9 月 4 日转发 ZCode 开启 GLM-5.3 Flash 免费体验时,他也曾以「add oil」作为开头。7 动态发出后,海外与国内多位开发者在评论区留言祝贺节日,并询问后续 GLM 新版本的规划。

读者可关注的技术信号

唐杰对 Charlie O'Neill 的反问,为观察前沿模型发展提供了三条可验证的工程线索:
  1. 总参数与激活参数的区隔:随着大规模稀疏 Mixture-of-Experts(MoE)与 DeepSeek Sparse Attention(DSA)等架构普及,前沿模型的总参数量可能达到数万亿,但单 token 激活参数往往保持在数十亿到数百亿规模。评判前沿模型时,需要分别记录总参数与实际激活参数。
  2. 后训练环境的构建成本:唐杰特别将「强化学习环境数量」列为与数据量并列的核心变量。在 Agent 和长程任务探索中,多领域合成验证环境的搭建质量,正在成为决定模型上限的关键要素。
  3. 推理成本驱动的逆向设计:在工业界实际落地的模型,其参数规模往往是根据特定服务成本(如每百万 token 几美分、或是单卡并发上限)倒推设立的约束指标。脱离目标推理成本空谈模型规模,在工程实践中难以成立。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel