WeLM 617B:把隐式思考折叠进序列

微信 WeLM 团队把一条「增加计算」的路线推进到了 617B MoE:不把输出写得更长,而是把额外计算折叠进 token 之间,让外部序列长度保持不变。1
图里抓三件事:
  • 从 3 月的 80B 规模推进到 617B MoE;
  • 文章称增量续训只用了完整训练量的 5.3%,9 个评测均超过自回归基线;
  • 方法侧包括 Stream-Factorized Attention 与 KV-mirror,用来处理扩展序列的注意力成本,并把额外计算并行化。
这些数字和机制是新智元文章以及 WeLM 论文、博客的报告口径,不等于独立复测。想看原始材料,可读 Hidden Decoding at Scale 博客论文代码仓库

References

  1. 1

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments