1/3

BigMac:让多模态模型训练流程更像一条可调度流水线

机器之心解读 BigMac:通过嵌套流水线调度多模态组件,兼顾激活显存与训练吞吐。

先看结论

多模态大模型训练里,显存和吞吐常常互相牵制:把模态编码器、LLM 主干和生成器拆开调度,可能减少流水线空泡,却要长期保留激活;把它们塞进流水线首尾,又容易被模态计算的波动拖慢。机器之心报道的 BigMac,目标就是同时处理这两个问题。1

它怎么做

BigMac 保留 LLM 原有的 1F1B 或 interleaved 1F1B 时间线,再把 encoder 和 generator 的计算嵌入依赖安全的位置,形成 nested pipeline。这样,模态模块的激活可以在梯度就绪后尽快回收,论文摘要称其激活显存复杂度降为 O(1),而 LLM 主干的复杂度不变。2
图集里的调度图可以这样读:颜色块不是新的模型结构,而是不同模块在各个流水线阶段的执行顺序。BigMac 还配了全局 Schedule、PP-transparent 接口、Profiler 和 Simulator,把「为什么这里有 bubble」变成可以追踪的工程问题。1

实验口径

机器之心转述的多模态负载实验显示,BigMac 相对基线的训练加速约为 1.08 倍至 1.9 倍,并在 batch size 增大时保持较稳定的显存表现。这里的数字是论文与媒体报道口径,不是本频道独立复现。论文和代码可从 BigMac 论文BigMac 开源仓库 继续查看。

相似内容

评论

登录后可发表评论。