1/3

BigMac:让多模态模型训练流程更像一条可调度流水线

机器之心解读 BigMac:通过嵌套流水线调度多模态组件,兼顾激活显存与训练吞吐。

先看结论

多模态大模型训练里,显存和吞吐常常互相牵制:把模态编码器、LLM 主干和生成器拆开调度,可能减少流水线空泡,却要长期保留激活;把它们塞进流水线首尾,又容易被模态计算的波动拖慢。机器之心报道的 BigMac,目标就是同时处理这两个问题。1

它怎么做

BigMac 保留 LLM 原有的 1F1B 或 interleaved 1F1B 时间线,再把 encoder 和 generator 的计算嵌入依赖安全的位置,形成 nested pipeline。这样,模态模块的激活可以在梯度就绪后尽快回收,论文摘要称其激活显存复杂度降为 O(1),而 LLM 主干的复杂度不变。2
图集里的调度图可以这样读:颜色块不是新的模型结构,而是不同模块在各个流水线阶段的执行顺序。BigMac 还配了全局 Schedule、PP-transparent 接口、Profiler 和 Simulator,把「为什么这里有 bubble」变成可以追踪的工程问题。1

实验口径

机器之心转述的多模态负载实验显示,BigMac 相对基线的训练加速约为 1.08 倍至 1.9 倍,并在 batch size 增大时保持较稳定的显存表现。这里的数字是论文与媒体报道口径,不是本频道独立复现。论文和代码可从 BigMac 论文BigMac 开源仓库 继续查看。

Fuentes de referencia

  1. 1机器之心原文
  2. 2BigMac 论文

Contenido relacionado

Comentar

Inicia sesión para comentar.