
从 200,000 个 token 到 10× 加速:Baseten 如何把模型权重变成可用 API
Latent Space 对谈 Baseten 的 Philip Kiely 与 Ali Taha,解释 KV cache、量化、speculative decoding 和硬件协同如何把新模型从能运行推进到可稳定服务。
单集信息
| 字段 | 内容 |
|---|---|
| 播客 | Latent Space: The AI Engineer Podcast 1 |
| 主持人 | swyx、Vibhu;逐字稿中的主要提问者标注为 swyx 2 |
| 嘉宾 | Philip Kiely、Ali Taha,Baseten |
| 集标题 | The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten |
| 发布日期 | 2026 年 8 月 4 日(北京时间;Apple Podcasts 记录为 2026-08-03T21:44:03Z) 1 |
| 原集链接 | The Inference Engineering Masterclass |
这集真正讲的不是某个 kernel
这集最有用的判断是:能把新模型跑出 token,和能在真实流量下提供 production-ready API,是两件不同的事。 Philip Kiely 和 Ali Taha 把 inference engineering 定义为一门独立工程:把训练后的权重变成足够快、可靠、可负担的产品。读者如果正在评估自部署模型、GPU 成本或 agent 后端,应该听完整集;它讨论的不是又一个 benchmark,而是模型进入生产后会遇到的路由、缓存、硬件、失败模式和维护成本。2
一个 200,000-token 请求,先是路由问题
Swyx 用一个 200,000-token 请求开场。Philip 的第一反应不是增加 GPU,而是问:这条请求或它的前缀以前来过吗?如果命中 KV cache,系统可以跳过部分 prefill;如果没有缓存,就把输入交给 prefill worker,生成 KV cache 和第一个 token,再把状态交给另一组 GPU 做 decode。对 coding 或多轮 agent 请求,缓存命中尤其重要,因为重复计算输入会直接增加延迟和成本。2
这条链路里还有 speculative decoding:较小的 draft model 先猜多个 token,大模型一次性验证,猜对的就批量接受。它不是免费加速器。draft model 自己要占资源,调度也要变复杂;更重要的是,它高度依赖流量类型。只做 coding 的 endpoint 可以训练专用 speculator,接受率可能比混合流量的共享服务高。节目给出的实际取舍是,每小时租用专属部署在每小时百万级 token 的场景下可能比按 token 付费更便宜,同时还能换来更可控的可靠性和并行策略。2
「支持新模型」至少有两个版本
节目把新模型上线拆成两个层次。第一层是「我能让它吐出一个 token」;第二层是「我有一个 production-ready API」。前者通常可以借助 vLLM、SGLang 等开源引擎较快完成,后者却要重新做量化、speculator、runtime 适配、基础设施部署、压测和故障处理。Baseten 使用 zero data retention,因此不能直接拿用户流量训练 speculator,只能用公开数据集模拟 coding 和 agentic traffic。对新架构来说,真正耗时的是那些不在标准路径上的部分,例如 GLM-5.2 的 sparse attention 需要被写进 runtime。2
一个很具体的例子是把 Kimi 的 vision encoder 接到 GLM-5.2 上。团队没有直接改语言模型权重,而是冻结「眼睛」和「大脑」,先训练一个只有几百万参数的 projector,负责把视觉编码映射到语言模型能读懂的表示。最初只做图像 caption,效果有限;改成围绕每张图的多问题问答后,projector 才逐渐学会对齐。这个例子说明,开放模型的价值不止是可下载,还包括可以把不同架构的组件重新组合,再用训练把接口对齐。2
性能数字来自组合,而不是单一魔法
量化部分最反直觉。Ali 说,量化误差不一定单向累积:如果前一层的误差向右,后一层向左,最终 logits 反而可能更接近 full-precision 模型。Baseten 用 KL divergence 比较量化模型和原模型的 logits 分布,而不是只看一个 benchmark 分数;Ali 还把他们的 GLM-5.2 结果描述为「比 NVIDIA 更好的量化版本」。这是 Baseten 嘉宾的内部经验,不应读成独立复现实验或普遍保证,但它说明了正确的问题不是「4-bit 一定损失多少」,而是「哪些层该量化、如何校准、误差最终怎样传播」。2
节目还给出了一组能帮助工程师建立量级感的数字:单项优化可能带来 20%、100% 甚至 200% 的提升,组合 NVFP4、speculative decoding、prefill/decode 分离和新 kernel 后,团队把 10× 作为某些服务的目标;baseline 若是每秒 30 至 50 个 token,极端情况下会追求每秒 300 至 400 个 token。这些数字是嘉宾对 Baseten 工程实践的描述,不是本集提供的统一基准。2
硬件也会改变答案。Philip 提到 B200 每张卡约 180 GB 显存,8 卡一节点约 1,440 GB;在 FP4 下,他用约 0.5 byte/parameter 做口头估算。Tensor parallelism 适合低延迟,expert parallelism 更适合 MoE 的吞吐,pipeline parallelism 则常在不得不跨节点时使用,因为节点间通信更慢。NVIDIA Dynamo 在节目中的定位也不是「一键加速」,而是负责在集群里搬运信息的 toolkit,覆盖 KV-aware routing、KV offloading 和 prefill/decode disaggregation。2
生产环境会把「确定性」拆开
这集最值得工程团队带走的部分,可能是失败模式。某些 GLM 版本在特定 prompt 和 temperature 下会重复同一个 token;Baseten 的处理方式是检测连续重复,达到 4 次以上就中止或重试。Ali 还描述了同一组权重在 SGLang 上出问题、在 vLLM 上正常的情况:根因可能不是模型,而是 kernel 的 race condition、barrier 或同步问题。不同集群的互联速度不同,也会让同一个问题只在某个部署上出现。所以 temperature=0 也不等于跨硬件、跨调度完全确定。2
tool calling 也被放回了正确的位置。LLM 不会自己执行动作,它只能生成建议;真正的动作由外部系统读取格式化输出后完成。structured output 可以用状态机约束 JSON 形状,却不能保证模型选对工具,甚至不能保证它应该调用工具。对 agent 基础设施来说,这个区分很实际:格式正确只是接口层通过,权限、选择、重试和执行结果仍然属于系统控制面。2
这集的核心增量
把这些细节放在一起,节目提出的是一条比「模型越大越强」更靠后的生产链:模型结构决定能否量化和并行,硬件决定哪些优化值得做,runtime 决定同一份权重是否稳定,真实流量又反过来决定 cache、speculator 和部署形态。local AI 的目标是把模型塞进本地设备并让它「less dumb」;data-center inference 的目标是让模型「less slow」。最后一段进一步把训练、部署、评测和持续改进接成闭环,甚至设想模型帮助优化运行自己的 kernel。2
适合谁,哪些可以跳过
- 适合:负责 LLM serving、GPU 集群、推理成本、agent runtime 或开放模型落地的工程师;做模型评测的人也能从「benchmark 通过」到「真实 endpoint 稳定」之间的差距里获得具体参照。
- 核心增量:理解 200,000-token 请求如何经过 cache-aware routing,理解新模型 day-zero 支持为什么不等于能跑起来,理解量化、speculation、并行和 kernel 必须组合评估。
- 可以跳过:如果你只关心模型排行榜、AGI 时间表或 Baseten 的融资故事,可以跳过开场闲聊和产品背景;这集的价值集中在约 00:01:00 到 01:40:06 的工程细节。2
可引用原话
Three years ago, inference engineering barely existed as a category. Today, it is one of the most critical disciplines in AI.Philip Kiely。2
The LLM is not capable of doing anything. It’s only capable of making suggestions of what to do.Philip Kiely。2
Quantization errors have canceled out.Ali Taha。2
References
- 1Latent Space 官方单集页
latent.space
- 2Latent Space 官方完整 transcript
api.substack.com

AI 工程与研究播客精读
盯住 8 个英文 AI 技术播客,新一集发布后产出中文高信噪比精读,一集一篇。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.