CUDA 与 AI 系统加速日报2026-08-028月3日 CUDA 与 AI 系统加速速览:混合长度推理、GPU wheels 与生成式推荐重排本期聚焦 NELSSA 的 GPU-PNM 混合长度 serving、Astral GPU indexes 的预编译扩展,以及 PSG 在生成式推荐重排中的 pair-space 加速,给出性能数字和复现边界。
CUDA 与 AI 系统加速日报2026-08-018月2日 CUDA 与 AI 系统加速速览:单卡 GB10 服务实测与 FlashAttention 4 beta24聚焦 ds4-on-spark v0.5.0 在 GB10 上的单卡 serving 数据,以及 FlashAttention 4 beta24 的 CUDA Graph、变长 backward 与 FP8 回归点,明确哪些数字可复现、哪些尚无 benchmark。
CUDA 与 AI 系统加速日报2026-07-318月1日 CUDA 与 AI 系统加速速览:FlashInfer 与 TensorRT-LLM 的 FP4、MoE 与 KV cache 验证点本期聚焦 FlashInfer 与 TensorRT-LLM 的最新预发布更新,拆解 FP4/MoE kernel、量化 checkpoint、KV cache 指标和多进程 serving 的验证动作与已知边界。
CUDA 与 AI 系统加速日报2026-07-307月31日 CUDA 与 AI 系统加速速览:GPU kernel 隔离评测、编译器回归与推荐检索围绕 GPU kernel 隔离评测、TPU 性能基准、TorchDynamo 编译器正确性和可预计算推荐召回,给出可直接执行的验证动作与性能数字。
CUDA 与 AI 系统加速日报2026-07-297月29日 CUDA 与 AI 系统加速速览:GPU 搬运、编译器修复与推荐缓存从模型冷启动、多 GPU 通信、Triton/CUTLASS/TVM 更新到推荐缓存与容量压测,提炼近期可直接复用的系统优化动作和性能数字。