8月15日 CUDA 与 AI 系统加速速览:OpScale 少 36.3% GPU、vToken 吞吐 1.37×与 Qwen3-235B +4%–6%

8月15日 CUDA 与 AI 系统加速速览:OpScale 少 36.3% GPU、vToken 吞吐 1.37×与 Qwen3-235B +4%–6%

本期整理算子级扩缩容、MoE makespan 调度、可回收 KV cache、输入自适应矩阵乘和 PCVR 推荐预测,重点标出性能数字、适用边界与第一步验证动作。

今天几篇新工作放在一起,指向同一个工程问题:GPU 上真正值得优化的单位,往往不是整模型,而是算子、expert、KV token 或一次矩阵乘里的有效维度。OpScale 把扩缩容单位下沉到算子,TEMPO 重新定义 MoE dispatch 的成本,vToken 让被淘汰的 token 真正释放物理 KV block,RMM 则把输入自适应裁剪放到 attention 的矩阵乘内部。它们的共同前提是先测清楚瓶颈,再决定优化单位;没有 profiling 的 headline 很难直接搬进线上。1234

快速判断

分组更新已报告结果适用场景先验证什么行动窗口
GPU 推理 / 扩缩容OpScale:以 operator 为 provisioning 与 autoscaling 单位最多少用 36.3% GPU、少 28% 功耗;固定成本下吞吐最高 +44% 1算子耗时差异大、流量突发、模型级扩缩容出现空闲或 SLO 违约先按算子记录 TTFT、SM/显存占用和副本放置,再与 model-level scaling 对照有生产 trace 就能做离线 replay
MoE servingTEMPO:按 memory / compute 两种 regime 估算 expert makespan混合 regime 中模型评分最高 +15.5%;Qwen3-235B 端到端吞吐 +4%–6%、p99 inter-token latency 约降 15.6% 2EP decode 中 hot/cold expert 同时存在,token balance 与 activation balance 都失真先测每个 expert 的 token 数、activated replica 数和 128-tile padding,再画 phase diagram先做 routing replay,不要直接替换 dispatcher
KV cache / CUDA GraphvToken:token-table indirection + 异步 repack,让 block 内空洞可回收retained KV block 减少 27.2%–72.3%;SLA 约束吞吐最高 1.37×;受限预算下可行并发最高 3token eviction 已存在,但 block-granular allocator 仍被部分占用的 block 卡住固定 eviction policy 和 KV budget,对比 Native、Naive-Evict、vToken 的 block/request、p95 和可行并发H100/vLLM 原型可先做小规模压测
Kernel / 推理优化RMM:按输入选择 contraction dimension 的有效 sliceLLaMA 3.1 8B、A100、batch 1、保留率 0.8 时,序列长 4096 的端到端延迟 1.40× 加速 5长上下文、attention 矩阵乘占比高,能接受训练无关的输出一致性校验按 attention / MLP 分开扫 retention ratio,并把 top-k 选择开销算进 kernel 时间先在代表性 prompt 上做无标签一致性 sweep
推荐系统STAR:structured tokenization + target-aware interest + weighted InfoNCEPCVR challenge 全模型 test AUC 0.836546,官方 baseline 为 0.819961,差值 +0.016585 6PCVR 排序同时受高基数稀疏特征、多行为序列和候选 item 影响先复现 baseline/full model,再逐项做时间特征、InfoNCE、target-aware interest 消融适合先做离线复现,线上收益尚未验证

GPU 推理:扩缩容单位可以下沉到算子

OpScale 处理的是模型级 autoscaling 的盲区:同一个模型里的算子,计算密度、显存访问和对 SLO 的贡献并不一样。它把 profiling、provisioning、placement 和 serving 组合成算子级编排,在生产 trace 上评估最多 40 张 A100 和 24 张 GB200。论文报告,在满足 SLO 的条件下最多少用 36.3% GPU、少 28% 功耗;如果成本预算固定,吞吐最高提高 44%。这些数字来自论文自己的集群和 trace,不能直接当作任意模型的资源折扣。7
这条路线适合两类系统:流量有明显突发,或者模型内部某些算子先成为瓶颈、其他算子仍然空闲。最小验证不需要马上改 serving runtime。先对一段真实 trace 记录每个 operator 的 TTFT 贡献、SM 与显存带宽占用、请求级 SLO,再把 model-level scaling 和 operator-level placement 放进同一个回放器。只有当算子间差异在多个流量窗口里重复出现,拆分扩缩容单位才值得进入线上灰度。
vToken 解决的是更具体的 KV cache 浪费。PagedAttention 以 block 管理物理内存,但许多 eviction policy 按 token 决定保留与淘汰;一个 block 只要还剩一个 live token,就不能被 allocator 复用。vToken 用 token table 把逻辑 token 与物理位置解耦,再异步把 live token repack 到更少的 block 中,同时保留原有 PagedAttention kernel 和 CUDA Graph 路径。8
在 H100 80 GB、Mistral-7B 和 Llama-3.1-8B 的 ShareGPT/LongBench 实验中,vToken 相对相同 eviction 决策下的 Naive-Evict,把 retained block 数减少 27.2%–72.3%。在共同的 SLA 约束下,Mistral-7B 的可选吞吐提高 9.9%–37.3%;Llama-3.1-8B 在六组 workload-policy 组合中平均提高 18.9%,p95 latency 平均下降 14.7%。8
这里最值得复用的是对照方法,而不是单个加速比:固定 prompt、eviction policy、模型和 KV budget,只切换物理回收后端。论文在 gpu_mem_util=0.35 的 Llama-3.1-8B 检查中,把可行并发边界从 5 推到 8;在 0.50 的预算下,边界从 11 推到 22。异步 copy 仍会和 decode 争用 GPU 资源,原型还要求 vLLM block size 至少 16 token,因此压测时要同时记录 planner 开销、copy/decode overlap 和 p95,而不是只看吞吐。8

MoE serving:先测 regime,再换 dispatcher

TEMPO 先指出了 token balance 为什么不够。它在两代数据中心 GPU 上测到:每个 expert 的 token 数低于约 156–168 时,HBM 读取 expert 权重的固定成本占主导;更高时,grouped GEMM 会把 token 数向 128-token 的 M tile 对齐,拆分 expert 反而可能制造 padding。于是一次 batch 里的 hot expert 和 cold expert 可能处在不同 regime,按 token 数或 activated expert 数优化,都会把一部分成本漏掉。9
TEMPO 用 t=max(a+bG, c+βN) 同时描述 activated replica 数 G 和 token 数 N,再把每个 batch 的 dispatch 写成 makespan 问题。记录的 batch 中,不同 proxy dispatcher 的 modeled block time 相差 1.4×–1.6×,p95 可到 1.7×。8-GPU microbenchmark 上,TEMPO 在评估网格里始终保持在最佳固定 baseline 的 1% 以内,在 regime 混合的区域最高赢 15.5%。后一个数字包含模型评分,最大收益来自 EP32–64 的外推,不能直接视作端到端吞吐。9
端到端结果更能说明适用边界:Qwen3-235B 在长上下文和 decode-heavy traffic 上吞吐提高 4%–6%,p99 inter-token latency 约下降 15.6%;DeepSeek-V3 位于通信主导的区域,测试到的只是机制成本。也就是说,先做 per-kernel calibration 和 routing replay,比先换一个更复杂的 dispatcher 更重要。验证时至少保留 token balance、activation balance 和 TEMPO 三条路径,记录 expert token 数、activated replicas、EP topology、通信时间和 p99。9

Kernel 与推理优化:attention 比 MLP 更适合先裁剪

RMM 是 training-free 的输入自适应方法:它在矩阵乘的 contraction dimension 上挑选信息量更高的 slice,不改模型权重,用 retention ratio 控制计算量。论文的组件消融显示,attention-side matrix product 比 MLP 更能承受裁剪;因此工程上更合理的顺序是先从 QKᵀAV 等 attention 操作开始,再单独评估 MLP,而不是给整层套一个统一比例。5
在 LLaMA 3.1 8B、A100、batch size 1、retention ratio 0.8 的端到端实验里,序列长度 1024、2048、4096 的 speedup 分别是 1.05×、1.27×、1.40×,延迟平均 10 次运行。kernel benchmark 把 norm、top-k selection 和 reduced matrix multiplication 都算进来,避免只报理论 FLOPs 节省。实现用自定义 Triton attention kernel;因此这个结果同时依赖 Triton kernel、backend 和 batch/sequence 形状。5
RMM 的可复用验证动作很小:在代表性 prompt 上,把 attention 和 MLP 分开扫 retention ratio,同时测端到端 latency、输出一致性和任务指标。论文的 LLaMA 3.1 70B 附加实验里,序列长 2048 的 speedup 为 1.41×;序列长 4096 时,dense 配置 OOM,而 RMM 完成了推理。这个结果说明 RMM 能减少受影响矩阵乘的活动计算和 workspace 压力,但它没有压缩模型权重,不能替代量化或权重分片。5

推荐系统:把训练—推理一致性当成性能问题

STAR 面向 KDD Cup 2026 Tencent UniRec Challenge 的 PCVR 预测。它在 HyFormer-style 多序列骨干上加入 structured feature tokenization、target-aware sequence decoding、高基数特征恢复、显式 user-item interaction token,以及 weighted user-item contrastive objective。另一个工程点是:训练保存的 remapping table 和结构超参数,会在推理时重建,避免训练和推理使用不同的特征映射。610
在挑战数据集上,官方 baseline 的 test AUC 是 0.819961,STAR 的全模型为 0.836546,差值 +0.016585;validation AUC 也从 0.829582 提高到 0.844503。消融结果里,移除绝对时间特征让 test AUC 下降 0.002043,移除 weighted InfoNCE 下降 0.000336,target-aware DIN decoder 和高基数 sequence recovery 也有较小的正贡献。LogLoss 与 AUC 的方向并不一致:focal loss 保留了小幅 AUC 优势,却损害概率校准,因此校准敏感的 serving 不能只看 AUC。6
这篇工作的部署提醒比模型结构更实用:频率映射、hash allowlist 和 feature remapping 都是要跟 checkpoint 一起版本化的 sidecar artifact。最小复现可以先跑官方 baseline 与 full model,再只改一个因素,分别跟踪 AUC、LogLoss、训练 wall time、特征表大小和推理重建失败率。论文只覆盖离线 challenge setting,没有线上 A/B 或业务指标;因此 +0.016585 应被当作离线 ranking 信号,而不是点击率或收入提升。6
今天的验证路径可以按系统形状来分:突发流量和算子间资源差异,先回放 OpScale;MoE decode,先校准 TEMPO 的两种 regime;KV 压力下已有 token eviction,先做 vToken 的 block 回收对照;长上下文且 attention 计算占比高,再试 RMM;PCVR 排序,则先把 STAR 的特征映射和离线消融复现出来。五组数字来自不同硬件、模型、数据和 baseline,适用边界本身就是结果的一部分。

References

  1. 1
  2. 2
    TEMPO 摘要arxiv.org
  3. 3
    vToken 摘要arxiv.org
  4. 4
    RMM 摘要arxiv.org
  5. 5
    RMM 实验arxiv.org
  6. 6
    STAR 实验arxiv.org
  7. 7
  8. 8
  9. 9
  10. 10
    STAR 方法arxiv.org
CUDA 与 AI 系统加速日报

CUDA 与 AI 系统加速日报

面向工程与算法读者的日报频道,追踪 CUDA、GPU、性能加速、AI 编译器优化,以及推荐模型与推荐系统相关进展。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel