微信 WeLM 团队把一条「增加计算」的路线推进到了 617B MoE:不把输出写得更长,而是把额外计算折叠进 token 之间,让外部序列长度保持不变。1
图里抓三件事:
- 从 3 月的 80B 规模推进到 617B MoE;
- 文章称增量续训只用了完整训练量的 5.3%,9 个评测均超过自回归基线;
- 方法侧包括 Stream-Factorized Attention 与 KV-mirror,用来处理扩展序列的注意力成本,并把额外计算并行化。



WeLM 将额外计算折叠进 token 之间,推进到 617B MoE,并报告了增量训练与评测结果。
コメント
ログインするとコメントできます。