CUDA 与 AI 系统加速日报2026-08-178月18日 CUDA 与 AI 系统加速速览:MoE 小 batch 1.33×、VLM 共享 1.30×与端云推荐本期整理 DeaMoE 小 batch MoE 解码、Rollplex VLM 强化学习资源复用、Neuron barrier-free 同步和 PriCoRec 端云推荐四条更新,标出性能数字、适用边界与最小验证动作。
CUDA 与 AI 系统加速日报2026-08-168月17日 CUDA 与 AI 系统加速速览:GPU kernel 契约违规 62.1%、移植 5.1×与边缘缓存 1.65×本期从 FlashInfer nightly、GPU kernel 正确性审计、边缘缓存、AI 辅助 GPU 移植和生成式 embedding 五个方向,整理可复用的验证动作与性能边界。11
CUDA 与 AI 系统加速日报2026-08-158月16日 CUDA 与 AI 系统加速速览:DARTree 9.73×、DrEM 评论 +1.388%与 FlashInfer FP8/MoE 修订本期聚焦 FlashInfer RC2 的 kernel 覆盖窗口、DARTree 推测解码、FSGR 的生成式推荐公平性与 DrEM 的线上抗噪排序,标出性能数字、适用边界和最小验证动作。1
CUDA 与 AI 系统加速日报2026-08-148月15日 CUDA 与 AI 系统加速速览:OpScale 少 36.3% GPU、vToken 吞吐 1.37×与 Qwen3-235B +4%–6%本期整理算子级扩缩容、MoE makespan 调度、可回收 KV cache、输入自适应矩阵乘和 PCVR 推荐预测,重点标出性能数字、适用边界与第一步验证动作。2
CUDA 与 AI 系统加速日报2026-08-138月14日 CUDA 与 AI 系统加速速览:MoE 训练吞吐 +14.89%、GPU-side 控制最高 2.39×本期聚焦 MoE 训练的 expert placement 与 packing、GPU-side agent 控制、跨平台多 GPU 通信,以及推荐模型训练信号与 serving 成本的验证边界。
CUDA 与 AI 系统加速日报2026-08-12混合 RL rollout +53.3%、LLMVisor 解码误差降 4.4×:8月13日 CUDA 与 AI 系统加速速览本期整理混合 RL rollout 调度、多租户延迟归因、低比特量化、推荐 MoE 压缩与显存受限训练的可复用验证动作,并标明每组性能数字的适用边界。
CUDA 与 AI 系统加速日报2026-08-118月12日 CUDA 与 AI 系统加速速览:SwiftQK 降 TPOT 29.5%、UnionSparse 边缘 decode 2.63×与 IntHQ UVCTR +1.60%从跨 GPU QK-Norm、Jetson 低比特稀疏 decode、GPU-backed RAG 到多任务生成式推荐,整理可复用的性能数字、适用边界和第一步验证动作。
CUDA 与 AI 系统加速日报2026-08-108月11日 CUDA 与 AI 系统加速速览:HiSparse 长上下文 4.7×、Muse Glimmer 单卡 20K tok/s 与 20K 推荐序列本期聚焦 HiSparse 的分层 KV 管理、Muse Glimmer 的单卡长上下文推理,以及 TM20K 与 MISO 在推荐序列和排序模型上的验证边界,给出可复现实验条件与最小验证动作。
CUDA 与 AI 系统加速日报2026-08-098月10日 CUDA 与 AI 系统加速速览:CUTLASS JIT 少 50ms、SGLang MoE Prefill 1.92×与推荐权重审计本期聚焦 CUTLASS 4.6.2 的 JIT 开销优化、SGLang MoE prefill 的 DWDP 路径,以及推荐权重与向量召回 benchmark 的复现边界。
CUDA 与 AI 系统加速日报2026-08-088月9日 CUDA 与 AI 系统加速速览:B300 16卡 53k tok/s、bursty 调度与直播排序本期聚焦 B300 两节点微调的 53k tok/s 强扩展、vLLM ModelOpt FP8 兼容性修复、bursty 推理调度、GPU 执行计划排序和直播推荐的延迟反馈分离,区分实测、仿真与线上 A/B 的适用边界。
CUDA 与 AI 系统加速日报2026-08-078月8日 CUDA 与 AI 系统加速速览:TensorCast 降 TTFT 93.2%、PLoRA 6.6× 与单模型推荐 +1.41%本期聚焦池化内存多 LoRA、统一张量管理、单模型推荐级联和碳感知 GPU 路由,区分论文模拟、线上 A/B 与历史回放的适用边界,并给出验证清单。1
CUDA 与 AI 系统加速日报2026-08-068月7日 CUDA 与 AI 系统加速速览:稀疏 GPU kernel 2.7×、云边推测解码 28× 与部署搜索本期聚焦 SparseDitto 的按矩阵定制稀疏 kernel、AsymSpec 的云边推测解码、AFD-Ledger 部署搜索,以及 FlashInfer ABI hotfix 和直播推荐的延迟反馈建模,给出可复现边界、性能数字与验证动作。