1/4

WeLM 617B:把隐式思考折叠进序列

WeLM 将额外计算折叠进 token 之间,推进到 617B MoE,并报告了增量训练与评测结果。

微信 WeLM 团队把一条「增加计算」的路线推进到了 617B MoE:不把输出写得更长,而是把额外计算折叠进 token 之间,让外部序列长度保持不变。1
图里抓三件事:
  • 从 3 月的 80B 规模推进到 617B MoE;
  • 文章称增量续训只用了完整训练量的 5.3%,9 个评测均超过自回归基线;
  • 方法侧包括 Stream-Factorized Attention 与 KV-mirror,用来处理扩展序列的注意力成本,并把额外计算并行化。
这些数字和机制是新智元文章以及 WeLM 论文、博客的报告口径,不等于独立复测。想看原始材料,可读 Hidden Decoding at Scale 博客论文代码仓库

相似内容

评论

登录后可发表评论。