8月18日 CUDA 与 AI 系统加速速览:MoE 小 batch 1.33×、VLM 共享 1.30×与端云推荐

8月18日 CUDA 与 AI 系统加速速览:MoE 小 batch 1.33×、VLM 共享 1.30×与端云推荐

本期整理 DeaMoE 小 batch MoE 解码、Rollplex VLM 强化学习资源复用、Neuron barrier-free 同步和 PriCoRec 端云推荐四条更新,标出性能数字、适用边界与最小验证动作。

今天的四条更新有一个共同点:收益来自重新安排数据和执行的路径,而不是简单堆更多算力。小 batch MoE 先减少专家权重搬运,VLM 强化学习把 prefix 计算塞进 decode 空档,编译器按真实依赖替代全引擎 barrier,推荐系统则把敏感特征留在设备侧。

快速判断

分组更新已报告结果适用场景先验证什么行动窗口
推理 / MoEDeaMoE:department 共享参数 + 两阶段 routingper-step loaded weights 最多减少 50.9%;A40 上端到端 TPOT 最高 1.33× 1小 batch、低延迟的 MoE 解码权重加载量、TPOT、模型质量和 batch 变化现在适合做单卡 serving 原型
GPU 资源调度Rollplex:跨 rollout、打分与训练阶段复用显存32 张 H800 上,相对串行共置 1.23×–1.30×;相对分离部署 1.57×–2.24× 2VLM on-policy RL,GPU 预算固定prefix 是否被 decode 窗口隐藏、HBM 峰值和 TP 配置适合先做离线 RL 回放
AI 编译器 / 运行时Barrier-Free Synchronization:循环依赖使用动态 thresholdML kernel 延迟下降 10%–45%;同步微基准 3.3× 3AWS Trainium / Neuron 多引擎内核loop trip count、依赖正确性和 barrier 开销适合编译后端实验,不应直接外推到 CUDA
推荐系统PriCoRec:云端预排序 + 端侧个性化排序三个数据集的云端 pre-ranking:gAUC 80.29 / 89.36 / 73.69 4年龄、性别等敏感特征必须留在端侧shortlist 召回、端侧延迟、模型大小和通信量先在离线特征切分上复现

小 batch MoE:先省权重搬运

MoE 在小 batch 解码时常常受限于专家权重加载,而不是算术吞吐。DeaMoE 把专家按专业领域分成多个 department。同一 department 的专家共享大部分 gate、up、down 投影,只保留少量 private 子矩阵表达差异;routing 先选 department,再在 department 内选具体专家。这样,同一批 token 可以复用已经加载的共享参数。15
论文把目标锁定在实时交互式解码,常见设置约为每步 4–128 个 token。对 vanilla MoE,DeaMoE 把每步加载的权重最多减少 50.9%;在 A40 上,7B 级预训练模型的端到端 TPOT speedup 最高 1.33×。DeepSeek-V3 的微基准则在 A40 和 H100 上分别报告 2.00×1.97× peak speedup。后两组是 microbenchmark 数字,不能当作完整服务吞吐。15
这个结构的边界也很清楚:作者重点优化的是小 batch 解码延迟。batch 变大后,吞吐和并行度的权重会上升,department 共享是否仍能抵消额外 routing 与结构改动,需要重新测量。最小实验应同时记录每步实际加载字节数、TPOT、显存读带宽、不同 batch 下的质量,以及 pre-training 或微调后的任务指标。

VLM RL:把 prefix 计算塞进 decode 窗口

VLM 的同步 on-policy RL 通常按 rollout、reference scoring、actor 前后向和 optimizer update 顺序执行。Rollplex 观察到,视频输入和 prompt prefix 的处理与当前 response 的生成相对独立,可以放进 rollout decode 的空档,同时保持同一个 actor snapshot 和同步更新语义。26
它解决的不是一个简单的并发 kernel launch 问题。Qwen2.5-VL-32B 在 rollout、reference 和 training 重叠时,朴素方案约需 165 GiB/GPU,超过 H800 的 80 GB HBM。Rollplex 用按 producer-consumer lifetime 管理 HBM 驻留,用 CUDA VMM 在虚拟地址不变的情况下切换物理驻留;训练和 rollout 则按张量分片关系共享同一份 actor storage,只有不兼容的 tensor 才复制或重排。6
32 张 H800、相同 GPU 预算下,Rollplex 相对 serial colocation 的 speedup 是 1.23×–1.30×,相对 disaggregation 是 1.57×–2.24×。收益上限是 min(T_decode, T_prefix):prefix 超出 decode 窗口的部分仍在关键路径上。论文还指出,training 偏好更宽的 TP,例如 TP=8,rollout 更偏好 TP=4;如果强行使用 TP=8,rollout 最多会慢 1.31×26
复现时先固定视频长度、prefix 长度、decode token 数和 TP degree,再比较串行共置、分离部署与跨阶段共享三条路径。除了总时延,还要记录 decode slowdown、HBM 峰值、VMM 映射切换次数和训练结果是否与串行基线一致。

编译器同步:循环里别用全引擎 barrier

多引擎 AI 加速器里,数据依赖可能跨 DMA、Tensor Engine 等专用引擎,也可能发生在同一引擎内部。传统 barrier-based 方案在循环入口和每次迭代边界插入 all-engine barrier,等待所有引擎清空在途指令,再重置 semaphore。它容易保证正确,却会让没有依赖关系的引擎一起停下来。37
这篇工作把算法实现为 AWS Neuron ISA 层的 compiler backend pass。编译器从 kernel 和 dependency graph 出发,为每条依赖分配 semaphore;遇到动态边界循环时,运行时根据外层循环的迭代次数计算 threshold,让 consumer 只等待自己的真实依赖。论文还在 Lean proof assistant 中用约 15K 行、0 个 admitted lemmas 的 bisimulation proof 验证了分配正确性。37
在由 production NKI kernels 编译出的 tiled matrix multiplication、RMSNorm、FlashAttention、AdamW 和 dropless MoE 内核上,作者相对 barrier-based baseline 报告 10%–45% 的延迟下降;隔离 barrier 成本的微基准达到 3.3×。这些数字绑定 AWS Trainium / Neuron 的多引擎执行模型和编译后端,不能直接写成 CUDA kernel 的普遍收益。37
对 CUDA 或 Triton 工具链的可复用部分,是把同步成本拆成「真实依赖等待」和「为方便实现而支付的全局等待」,并按 loop trip count 测量两者的差距。真正移植前,还要确认目标硬件是否有同类的跨引擎 semaphore 和编译期 dependency graph;只有名称相似,不能推出实现可移植。

推荐系统:敏感特征留在端侧,云端提供排序信号

PriCoRec 针对的是云端不能处理年龄、性别和细粒度行为等敏感特征的推荐部署。它把 item 与请求上下文等 cloud-accessible features 用于云端 pre-ranking,再把候选交给端侧 ranking;device-only features 始终留在设备上。端侧模型接收云端 relevance logit 作为辅助特征,使用更小的 embedding(cloud 侧 32 维、device 侧 4 维),并配合词表重映射和 FP16 存储压缩模型。48
云端 pre-ranking 用 PNN 和 DPP 风格的 diversity regularizer,目标是减少 shortlist 中的候选冗余。Table 2 报告的 gAUC 与 Recall@100 如下;三个数据集的特征切分和对照方法都遵守同一项云端可见性约束。4
数据集gAUCRecall@100
OpenMCC80.2950.41 4
TaobaoAd89.3668.29 4
Ali-CCP73.6947.72 4
这组数字回答的是云端 shortlist 质量,不等于端侧完整排序已经具备同样效果。落地时应把 cloud-only、端云协同和全量端侧特征三条基线分开,至少补测端侧 P99、模型大小、通信字节数、设备功耗和 Top-K 质量。否则只看到 pre-ranking 的 gAUC,无法判断隐私边界带来的系统成本。

最小验证顺序

  1. 小 batch MoE: 先做 A40 或目标 GPU 上的 vanilla MoE / DeaMoE 双路径,对齐权重格式和路由结果,再比较每步加载字节数与 TPOT。
  2. VLM RL: 用固定的 prefix、decode 窗口和 TP degree 做 Rollplex 三路对照,检查 overlap 是否把 decode slowdown 和 HBM 峰值推高。
  3. 编译器同步: 从一个带 loop-carried dependency 的内核开始,分别记录 barrier 数量、实际等待周期和结果一致性,再扩大到 FlashAttention 或 MoE。
  4. 端云推荐: 先按 PriCoRec 的 feature split 重放离线数据,分别记录 pre-ranking Recall@100、端侧延迟、模型大小与通信量,再决定是否进入小流量实验。
四条材料共同提醒了一件事:性能数字只有在执行路径、硬件、batch、同步语义和特征边界都对齐时才有意义。下一步应优先复现这些条件,而不是先把论文里的最高 speedup 当成系统预算。
CUDA 与 AI 系统加速日报

CUDA 与 AI 系统加速日报

面向工程与算法读者的日报频道,追踪 CUDA、GPU、性能加速、AI 编译器优化,以及推荐模型与推荐系统相关进展。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel