
8月15日 CUDA 与 AI 系统加速速览:OpScale 少 36.3% GPU、vToken 吞吐 1.37×与 Qwen3-235B +4%–6%
本期整理算子级扩缩容、MoE makespan 调度、可回收 KV cache、输入自适应矩阵乘和 PCVR 推荐预测,重点标出性能数字、适用边界与第一步验证动作。
今天几篇新工作放在一起,指向同一个工程问题:GPU 上真正值得优化的单位,往往不是整模型,而是算子、expert、KV token 或一次矩阵乘里的有效维度。OpScale 把扩缩容单位下沉到算子,TEMPO 重新定义 MoE dispatch 的成本,vToken 让被淘汰的 token 真正释放物理 KV block,RMM 则把输入自适应裁剪放到 attention 的矩阵乘内部。它们的共同前提是先测清楚瓶颈,再决定优化单位;没有 profiling 的 headline 很难直接搬进线上。1234
快速判断
| 分组 | 更新 | 已报告结果 | 适用场景 | 先验证什么 | 行动窗口 |
|---|---|---|---|---|---|
| GPU 推理 / 扩缩容 | OpScale:以 operator 为 provisioning 与 autoscaling 单位 | 最多少用 36.3% GPU、少 28% 功耗;固定成本下吞吐最高 +44% 1 | 算子耗时差异大、流量突发、模型级扩缩容出现空闲或 SLO 违约 | 先按算子记录 TTFT、SM/显存占用和副本放置,再与 model-level scaling 对照 | 有生产 trace 就能做离线 replay |
| MoE serving | TEMPO:按 memory / compute 两种 regime 估算 expert makespan | 混合 regime 中模型评分最高 +15.5%;Qwen3-235B 端到端吞吐 +4%–6%、p99 inter-token latency 约降 15.6% 2 | EP decode 中 hot/cold expert 同时存在,token balance 与 activation balance 都失真 | 先测每个 expert 的 token 数、activated replica 数和 128-tile padding,再画 phase diagram | 先做 routing replay,不要直接替换 dispatcher |
| KV cache / CUDA Graph | vToken:token-table indirection + 异步 repack,让 block 内空洞可回收 | retained KV block 减少 27.2%–72.3%;SLA 约束吞吐最高 1.37×;受限预算下可行并发最高 2× 3 | token eviction 已存在,但 block-granular allocator 仍被部分占用的 block 卡住 | 固定 eviction policy 和 KV budget,对比 Native、Naive-Evict、vToken 的 block/request、p95 和可行并发 | H100/vLLM 原型可先做小规模压测 |
| Kernel / 推理优化 | RMM:按输入选择 contraction dimension 的有效 slice | LLaMA 3.1 8B、A100、batch 1、保留率 0.8 时,序列长 4096 的端到端延迟 1.40× 加速 5 | 长上下文、attention 矩阵乘占比高,能接受训练无关的输出一致性校验 | 按 attention / MLP 分开扫 retention ratio,并把 top-k 选择开销算进 kernel 时间 | 先在代表性 prompt 上做无标签一致性 sweep |
| 推荐系统 | STAR:structured tokenization + target-aware interest + weighted InfoNCE | PCVR challenge 全模型 test AUC 0.836546,官方 baseline 为 0.819961,差值 +0.016585 6 | PCVR 排序同时受高基数稀疏特征、多行为序列和候选 item 影响 | 先复现 baseline/full model,再逐项做时间特征、InfoNCE、target-aware interest 消融 | 适合先做离线复现,线上收益尚未验证 |
GPU 推理:扩缩容单位可以下沉到算子
OpScale 处理的是模型级 autoscaling 的盲区:同一个模型里的算子,计算密度、显存访问和对 SLO 的贡献并不一样。它把 profiling、provisioning、placement 和 serving 组合成算子级编排,在生产 trace 上评估最多 40 张 A100 和 24 张 GB200。论文报告,在满足 SLO 的条件下最多少用 36.3% GPU、少 28% 功耗;如果成本预算固定,吞吐最高提高 44%。这些数字来自论文自己的集群和 trace,不能直接当作任意模型的资源折扣。7
这条路线适合两类系统:流量有明显突发,或者模型内部某些算子先成为瓶颈、其他算子仍然空闲。最小验证不需要马上改 serving runtime。先对一段真实 trace 记录每个 operator 的 TTFT 贡献、SM 与显存带宽占用、请求级 SLO,再把 model-level scaling 和 operator-level placement 放进同一个回放器。只有当算子间差异在多个流量窗口里重复出现,拆分扩缩容单位才值得进入线上灰度。
vToken 解决的是更具体的 KV cache 浪费。PagedAttention 以 block 管理物理内存,但许多 eviction policy 按 token 决定保留与淘汰;一个 block 只要还剩一个 live token,就不能被 allocator 复用。vToken 用 token table 把逻辑 token 与物理位置解耦,再异步把 live token repack 到更少的 block 中,同时保留原有 PagedAttention kernel 和 CUDA Graph 路径。8
在 H100 80 GB、Mistral-7B 和 Llama-3.1-8B 的 ShareGPT/LongBench 实验中,vToken 相对相同 eviction 决策下的 Naive-Evict,把 retained block 数减少 27.2%–72.3%。在共同的 SLA 约束下,Mistral-7B 的可选吞吐提高 9.9%–37.3%;Llama-3.1-8B 在六组 workload-policy 组合中平均提高 18.9%,p95 latency 平均下降 14.7%。8
这里最值得复用的是对照方法,而不是单个加速比:固定 prompt、eviction policy、模型和 KV budget,只切换物理回收后端。论文在
gpu_mem_util=0.35 的 Llama-3.1-8B 检查中,把可行并发边界从 5 推到 8;在 0.50 的预算下,边界从 11 推到 22。异步 copy 仍会和 decode 争用 GPU 资源,原型还要求 vLLM block size 至少 16 token,因此压测时要同时记录 planner 开销、copy/decode overlap 和 p95,而不是只看吞吐。8MoE serving:先测 regime,再换 dispatcher
TEMPO 先指出了 token balance 为什么不够。它在两代数据中心 GPU 上测到:每个 expert 的 token 数低于约 156–168 时,HBM 读取 expert 权重的固定成本占主导;更高时,grouped GEMM 会把 token 数向 128-token 的
M tile 对齐,拆分 expert 反而可能制造 padding。于是一次 batch 里的 hot expert 和 cold expert 可能处在不同 regime,按 token 数或 activated expert 数优化,都会把一部分成本漏掉。9TEMPO 用
t=max(a+bG, c+βN) 同时描述 activated replica 数 G 和 token 数 N,再把每个 batch 的 dispatch 写成 makespan 问题。记录的 batch 中,不同 proxy dispatcher 的 modeled block time 相差 1.4×–1.6×,p95 可到 1.7×。8-GPU microbenchmark 上,TEMPO 在评估网格里始终保持在最佳固定 baseline 的 1% 以内,在 regime 混合的区域最高赢 15.5%。后一个数字包含模型评分,最大收益来自 EP32–64 的外推,不能直接视作端到端吞吐。9端到端结果更能说明适用边界:Qwen3-235B 在长上下文和 decode-heavy traffic 上吞吐提高 4%–6%,p99 inter-token latency 约下降 15.6%;DeepSeek-V3 位于通信主导的区域,测试到的只是机制成本。也就是说,先做 per-kernel calibration 和 routing replay,比先换一个更复杂的 dispatcher 更重要。验证时至少保留 token balance、activation balance 和 TEMPO 三条路径,记录 expert token 数、activated replicas、EP topology、通信时间和 p99。9
Kernel 与推理优化:attention 比 MLP 更适合先裁剪
RMM 是 training-free 的输入自适应方法:它在矩阵乘的 contraction dimension 上挑选信息量更高的 slice,不改模型权重,用 retention ratio 控制计算量。论文的组件消融显示,attention-side matrix product 比 MLP 更能承受裁剪;因此工程上更合理的顺序是先从
QKᵀ、AV 等 attention 操作开始,再单独评估 MLP,而不是给整层套一个统一比例。5在 LLaMA 3.1 8B、A100、batch size 1、retention ratio 0.8 的端到端实验里,序列长度 1024、2048、4096 的 speedup 分别是 1.05×、1.27×、1.40×,延迟平均 10 次运行。kernel benchmark 把 norm、top-k selection 和 reduced matrix multiplication 都算进来,避免只报理论 FLOPs 节省。实现用自定义 Triton attention kernel;因此这个结果同时依赖 Triton kernel、backend 和 batch/sequence 形状。5
RMM 的可复用验证动作很小:在代表性 prompt 上,把 attention 和 MLP 分开扫 retention ratio,同时测端到端 latency、输出一致性和任务指标。论文的 LLaMA 3.1 70B 附加实验里,序列长 2048 的 speedup 为 1.41×;序列长 4096 时,dense 配置 OOM,而 RMM 完成了推理。这个结果说明 RMM 能减少受影响矩阵乘的活动计算和 workspace 压力,但它没有压缩模型权重,不能替代量化或权重分片。5
推荐系统:把训练—推理一致性当成性能问题
STAR 面向 KDD Cup 2026 Tencent UniRec Challenge 的 PCVR 预测。它在 HyFormer-style 多序列骨干上加入 structured feature tokenization、target-aware sequence decoding、高基数特征恢复、显式 user-item interaction token,以及 weighted user-item contrastive objective。另一个工程点是:训练保存的 remapping table 和结构超参数,会在推理时重建,避免训练和推理使用不同的特征映射。610
在挑战数据集上,官方 baseline 的 test AUC 是 0.819961,STAR 的全模型为 0.836546,差值 +0.016585;validation AUC 也从 0.829582 提高到 0.844503。消融结果里,移除绝对时间特征让 test AUC 下降 0.002043,移除 weighted InfoNCE 下降 0.000336,target-aware DIN decoder 和高基数 sequence recovery 也有较小的正贡献。LogLoss 与 AUC 的方向并不一致:focal loss 保留了小幅 AUC 优势,却损害概率校准,因此校准敏感的 serving 不能只看 AUC。6
这篇工作的部署提醒比模型结构更实用:频率映射、hash allowlist 和 feature remapping 都是要跟 checkpoint 一起版本化的 sidecar artifact。最小复现可以先跑官方 baseline 与 full model,再只改一个因素,分别跟踪 AUC、LogLoss、训练 wall time、特征表大小和推理重建失败率。论文只覆盖离线 challenge setting,没有线上 A/B 或业务指标;因此
+0.016585 应被当作离线 ranking 信号,而不是点击率或收入提升。6今天的验证路径可以按系统形状来分:突发流量和算子间资源差异,先回放 OpScale;MoE decode,先校准 TEMPO 的两种 regime;KV 压力下已有 token eviction,先做 vToken 的 block 回收对照;长上下文且 attention 计算占比高,再试 RMM;PCVR 排序,则先把 STAR 的特征映射和离线消融复现出来。五组数字来自不同硬件、模型、数据和 baseline,适用边界本身就是结果的一部分。
References
- 1OpScale 摘要
arxiv.org
- 2TEMPO 摘要
arxiv.org
- 3vToken 摘要
arxiv.org
- 4RMM 摘要
arxiv.org
- 5RMM 实验
arxiv.org
- 6STAR 实验
arxiv.org
- 7OpScale 方法与结果
arxiv.org
- 8vToken 机制与兼容性
arxiv.org
- 9TEMPO 成本模型
arxiv.org
- 10STAR 方法
arxiv.org

CUDA 与 AI 系统加速日报
面向工程与算法读者的日报频道,追踪 CUDA、GPU、性能加速、AI 编译器优化,以及推荐模型与推荐系统相关进展。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
More from this channel›
- 8月19日 CUDA 与 AI 系统加速速览:稀疏 GPU 64.34×、边缘 MoE 2.3×与 KV-Pipe 迭代时间 -9.8%
- 8月18日 CUDA 与 AI 系统加速速览:MoE 小 batch 1.33×、VLM 共享 1.30×与端云推荐
- 8月17日 CUDA 与 AI 系统加速速览:GPU kernel 契约违规 62.1%、移植 5.1×与边缘缓存 1.65×
- 8月16日 CUDA 与 AI 系统加速速览:DARTree 9.73×、DrEM 评论 +1.388%与 FlashInfer FP8/MoE 修订
- 8月14日 CUDA 与 AI 系统加速速览:MoE 训练吞吐 +14.89%、GPU-side 控制最高 2.39×
- 混合 RL rollout +53.3%、LLMVisor 解码误差降 4.4×:8月13日 CUDA 与 AI 系统加速速览
- 8月12日 CUDA 与 AI 系统加速速览:SwiftQK 降 TPOT 29.5%、UnionSparse 边缘 decode 2.63×与 IntHQ UVCTR +1.60%
- 8月11日 CUDA 与 AI 系统加速速览:HiSparse 长上下文 4.7×、Muse Glimmer 单卡 20K tok/s 与 20K 推荐序列