微信 WeLM 团队把一条「增加计算」的路线推进到了 617B MoE:不把输出写得更长,而是把额外计算折叠进 token 之间,让外部序列长度保持不变。1
图里抓三件事:
- 从 3 月的 80B 规模推进到 617B MoE;
- 文章称增量续训只用了完整训练量的 5.3%,9 个评测均超过自回归基线;
- 方法侧包括 Stream-Factorized Attention 与 KV-mirror,用来处理扩展序列的注意力成本,并把额外计算并行化。
References
- 1新智元:把思考折叠进序列
mp.weixin.qq.com


Comments