
8月2日 CUDA 与 AI 系统加速速览:单卡 GB10 服务实测与 FlashAttention 4 beta24
聚焦 ds4-on-spark v0.5.0 在 GB10 上的单卡 serving 数据,以及 FlashAttention 4 beta24 的 CUDA Graph、变长 backward 与 FP8 回归点,明确哪些数字可复现、哪些尚无 benchmark。
先看结论
本期覆盖 2026 年 7 月 29 日 07:00 至 8 月 2 日 07:00(北京时间)。有两条更新可以直接放进验证队列:
ds4-on-spark v0.5.0 把 DeepSeek-V4-Flash-0731 的单卡 GB10 serving 指标推进到可复测的工程样本;FlashAttention fa4-v4.0.0.beta24 则在变长反向、完整 CUDA Graph 组合 kernel 和 FP8 数值上做了小步修改。前者有性能数字但只有作者自测,后者没有发布 benchmark,不能把版本说明写成速度承诺。AI 编译器和推荐系统方向,本窗口没有找到时间与详情都足够清楚的新条目。本期保留这个空位,不用窗口外版本填满栏目。
GPU/CUDA 与推理系统
ds4-on-spark v0.5.0:先复现 GB10 上的服务曲线
适用场景:手上有 DGX Spark 或其他 GB10 设备,想评估 DeepSeek-V4-Flash-0731 的本地 serving、连续 batching、prefix cache 和 speculative decode,而不是只比较单次生成速度。
NVIDIA Developer Forum 的工程主帖作者称,
ds4-on-spark v0.5.0 在单张 GB10 上测试新权重:517,963 个 token 用时 667 秒,持续 prefill 约 776 tok/s;2K context 的 prefill 约 960 tok/s,最佳点超过 1,000 tok/s,64K 时为 933 tok/s。带 speculation 的 chat decode 在 12K context 约 28 tok/s,240K 时仍约 22 tok/s;12 个并发请求的多 agent serving 合计约 59 tok/s。1这些数字的比较基线也写在主帖里:同权重、同硬件下,相对上游 engine,2K context 的 prefill 为 2.4 倍,64K 为 3.3 倍;单机可驻留 766K 以上的跨 session context,并能跑一个 1M token conversation。它们是项目作者的单机测量,不是跨硬件或跨框架的统一 benchmark。代码、完整 benchmark 和变更记录分别放在 ds4-on-spark 仓库 与 Entrpi/ds4 的 batched-serving 分支。1
先做这四个验证:
- 固定 0731 权重、量化文件、GB10、引擎版本和 context 配置,跑 2K、64K、240K 三个点;分别记录 prefill、decode、TTFT、TPOT 和显存峰值。
- 把单请求 decode 和 12 并发 aggregate throughput 分开报。后者适合服务容量估算,不能替代单用户延迟。
- 打开和关闭 speculative decode 各跑一遍,并记录接受长度与实际 draft 次数;只看最终 tok/s,无法确认 speculation 是否真的生效。
- 把 256K 与 128K context 的内存曲线单独保存。线程回复中的一个 GB10 样本显示,前者 context buffers 约 5,855 MiB、
MemAvailable归零,后者约 3,111 MiB、仍有约 6 GB 可用;这只是单机样本,适合当作排查起点,不是通用上限。2
FlashAttention fa4-v4.0.0.beta24:CUDA Graph 路径值得做回归
适用场景:正在测试 FlashAttention 4 的变长 backward、FP8 或完整 CUDA Graph 捕获,尤其是需要确认 beta 版本是否改变编译依赖与反向数值的团队。
fa4-v4.0.0.beta24 于 7 月 29 日发布,仍是 pre-release。变更包括:允许 score modification 用于变长 backward;让 FLASHATTENTION_DISABLE_DROPOUT 不再带入不需要的头文件;为完整 CUDA Graph 的 combine kernel 增加 linearize scheduling;以及 FP8 数值微调。release 页面没有给出吞吐、延迟或显存收益数字。3建议验证动作:以 beta23 为基线,在同一 GPU、同一变长分布和同一 backward loss 下,分别记录编译时间、首次捕获时间、graph replay 延迟与梯度误差;FP8 单独做数值对照。若只观察到编译依赖变少或捕获成功率变化,不要把它写成端到端加速。
AI 编译器与推荐系统:本期无新纳入项
在 7 月 29 日至 8 月 2 日的覆盖窗口里,没有找到 Triton、TVM 或 XLA 的独立更新,也没有找到推荐系统 serving、embedding 或召回方向能同时满足时间与详情页核验的新增论文。Triton 3.7.1、CUTLASS 和近期 embedding 论文都落在窗口外;用它们补齐栏目,会把旧信息伪装成今天的更新。
带回仓库的检查清单
- GB10 serving:先复现 2K / 64K / 240K 的 prefill 与 decode 曲线,再判断 3.3 倍是否出现在自己的权重和量化配置上。
- 并发容量:单独记录 1 请求与 12 请求,增加 P50/P95/P99 和显存峰值,避免用 aggregate tok/s 代替用户体验。
- FlashAttention beta24:把变长 backward、FP8 数值和 CUDA Graph replay 作为三组独立回归,不要为没有 benchmark 的 release notes 补一个想象中的百分比。
Related content
- Sign in to comment.
