覆盖说明:本期已基于 Latent Space 官方 RSS / Apple 单集描述中的完整文字稿、官方 YouTube 字幕和完整音频 ASR 做全片顺序精读;由于逐句无删减全文译本体量很长,本期不是逐句全文译本,而是按节目顺序整理全部主要论点、案例、技术名词和金句。后续如频道承载方式支持长附件,可把逐句译本拆分发布。
图集导读
- 封面:Agent 时代,云基础设施为什么要重做。
- 嘉宾卡:Akshat Bubna,Modal 联合创始人兼 CTO。
- DX → AX:Modal 把团队思考从 developer experience 转向 agent experience。
- 10 万沙盒:RL rollout 和 agent 执行环境的真实瓶颈。
- 弹性推理:GPU snapshot、DeFlash、Auto Endpoints 与生产级推理。
- 护栏:生产级 agent 更需要权限、网络、日志和可观察性。
稿源与事实边界
Latent Space 这期单集题为「Why AI Infrastructure must evolve for Agent Experience — Akshat Bubna, Modal CTO」,Apple / RSS 显示发布时间为北京时间 2026-07-09 06:55,单集时长约 57 分 55 秒,并提供完整 mp3 音频。1 官方 YouTube 版本标题为「The 100,000 Sandbox Problem — Akshat Bubna, Modal CTO」,简介列出完整章节、嘉宾链接和讨论范围。2 Substack 单集页可访问音频播放器和标题,但未直接暴露完整正文。3
Modal 官网把自己定位为面向 AI 工作负载的高性能基础设施,强调 inference、training、batch processing 和 sandboxes,支持 sub-second cold starts、instant autoscaling 以及开发者本地感体验。4 Modal 的沙盒产品页也把 coding agents、background agents、RL rollouts 和 GPU-accelerated research 放在同一执行层里,强调隔离、弹性和规模化并发。5
关于「Modal 刚完成 3.55 亿美元 Series C」:该数额出现在本期官方单集描述中,本轮没有找到 Modal 官网可访问的一手融资公告页;因此本文只把它作为节目背景,不展开融资条款判断。1
一句话核心
这期真正有价值的地方,不是「Modal 又是一家 GPU 云」,而是 Akshat 把云基础设施的用户从人类开发者换成了 AI agent:过去的好体验是让人少写 YAML、少管 Kubernetes;下一步的好体验是让 agent 能写代码、启动环境、观察结果、调试失败,再自己迭代。
嘉宾背景
Akshat Bubna 是 Modal 联合创始人兼 CTO。单集介绍列出他的 LinkedIn、X 和 Modal 官网入口,并把他放在 Modal 从 developer experience 转向 agent experience 的主讲位置。2 公开资料显示,Akshat 的职业背景包括 Modal 和 Scale AI;本期讨论集中在 Modal 如何为 AI 工作负载重建运行时、推理、沙盒和多云容量池。1
按节目顺序精读
1. Modal 的起点:不是「再做一个云」,而是先做一个更好的 runtime
Akshat 回忆,他最早通过投资人认识 Modal CEO Erik Bernhardsson。当时 Erik 已经在思考新的 runtime:很多 workflow orchestration 产品难用,不是因为用户不懂云,而是因为它们最终都要落到 Kubernetes 上。Kubernetes 很强,但它更像给相对稳定的 web server 和传统服务编排而生,不天然适合突发、计算密集、镜像差异大、资源形态频繁变化的 AI 工作负载。1
Modal 最初的突破点是 serverless functions 和 self-provisioning infrastructure:把资源声明放回代码旁边,通过 decorator 描述函数需要的 CPU、GPU、镜像和环境,而不是让开发者在大量 YAML、集群配置和控制台之间来回切换。Akshat 说,这个设计不是后来的 UI 包装,而是早期就很重要的产品哲学:把基础设施变成可以像代码一样被编辑、审查和运行的东西。
这也是为什么 Modal 很早就加入 GPU。Akshat 说他们在 ChatGPT 之前一年就把 GPU 加进产品,当时并不知道这会变成如此大的机会;他们看到的是更底层的趋势:越来越多工作负载不是长期稳定服务,而是需要突然爆发、用完归零、环境高度定制的 compute-heavy jobs。
2. 从 DX 到 AX:Agent 不该去读几百个 Kubernetes 文件
本期最重要的概念是 AX,也就是 agent experience。Akshat 说 Modal 已经把 SDK 团队的思考从 developer experience 调整为 agent experience。原因很直接:过去人类开发者不想读 YAML、不想手动拼 Kubernetes;今天的 agent 更不应该被迫读几百个配置文件、猜哪些字段有类型、再写一堆脆弱 YAML。
他给出的判断是:DX 和 AX 的好体验高度相似。对人好用的东西,通常也对 agent 好用:少一点隐式状态,多一点类型和可观察反馈;少一点控制台跳转,多一点代码内声明;少一点模糊文档,多一点 agent 可以直接修改和验证的接口。
这不是「给 agent 做一个聊天框」那么简单。Modal 关心的是 agent 的闭环:写代码、启动运行时、拿到日志、理解失败、修改配置、再跑一次。也就是说,基础设施不是静态资源,而是 agent 推理和行动循环中的一部分。
3. 沙盒成为 agent cloud 的关键原语
节目中多次回到 sandboxes。原因是 agent 不只是调用模型,它还要在真实环境里行动:写文件、跑测试、安装依赖、访问工具、处理凭证、执行长任务。如果这些都在没有隔离和边界的环境里发生,安全、成本和可控性都会出问题。
Modal 官网把 sandboxes 描述为 AI systems 的 execution layer:从 coding agents 到 background agents,再到 RL rollouts,都需要可编程、隔离、可扩缩的执行环境。5 Akshat 在节目中进一步解释,生产级 agent 不只需要「能跑代码」,还需要配置 surface、存储、网络、权限和观察能力。
本期标题里的「100,000 sandbox problem」来自 RL rollouts 的规模问题:如果一个训练或评估流程需要大量并发轨迹,瓶颈不是单个模型回答得快不快,而是能不能快速拉起、隔离、调度和回收海量执行环境。2 这就是为什么 Akshat 会把 sandboxes 与 inference、training 放在同一套基础设施里看。
4. 弹性推理:Modal 卖的不是裸 GPU,而是软件层的控制力
主持人不断追问:如果用户已经能用 vLLM、SGLang 或直接租 GPU,Modal 到底增加了什么?Akshat 的回答集中在生产级推理的长尾问题:冷启动、尾延迟、并发突发、模型路由、成本控制、跨 GPU 类型切换,以及把优化后的 endpoint 交给工程团队稳定运行。
节目里提到几组具体能力:GPU snapshotting 用于缩短冷启动;DeFlash 和 speculative decoding 用于推理加速;Auto Endpoints 让优化后的 inference endpoint 更容易部署。2 Modal 官网的 inference 产品页也强调它从 proxy layer 到 GPU scheduler 都围绕真实推理工作负载优化,覆盖 LLM inference、多模态 inference、batch / async inference 和在线推理。6
这一段对 AI builder 的启发是:未来做 AI 产品,瓶颈可能不在「能不能拿到一个模型 API」,而在你能不能把自定义模型、推理引擎、GPU 类型、延迟预算和成本策略一起变成可调度的软件系统。
5. 17 家云容量池:supercloud 的本质是调度与金融工程
单集简介提到 Modal 有跨 17 家云提供商的 capacity pool。2 Akshat 在后半段解释,Modal 的 compute strategy 不只是买 GPU 或订云资源,而是持续判断不同 GPU、区域、合同期限和供应链变化之间的组合。
主持人把它类比为航空公司对燃油价格做对冲:算错会影响成本结构,算对才能给客户更低价格或更稳定容量。Akshat 说 Modal 正在做 batch tier:如果客户不在意即时返回,可以给出更便宜的价格,在未来 24 小时内完成。这背后的前提是 Modal 控制了更多调度层,能把延迟敏感与非延迟敏感工作负载错峰排布。
这部分听起来像财务运营,但对 AI infra 来说是核心产品能力。GPU 供应稀缺、区域差异、模型工作负载波动共同决定了「云」不再只是机器列表,而是一套动态资产调度系统。
6. 网络、RDMA 与多节点训练:post-training 更需要弹性
节目中间有一段很硬核:private IPv6、overlay network、TCP、eBPF、RDMA、InfiniBand 和多节点训练。Akshat 解释,Modal 的网络能力一开始是为 distributed training 产品服务的:给一个函数加 decorator,就能拿到一组 GPU,并用高速网络跑分布式训练任务。
他也明确说,Modal 不是要服务最大规模 pre-training,而更适合较小规模 post-training、中等模型调优、研究分支探索和自动化实验。对这些任务来说,弹性比长期占用一个巨大集群更重要:研究员或 agent 可以快速拉起一组实验,跑完释放,再把结果反馈给下一轮搜索。
这里有一个重要判断:auto research 目前未必已经完全成熟,但 Modal 内部已经用类似形态做 auto inference,让 agent 启动 sweeps、跑 profiler、调整 GPU 类型和配置,最后找到更合适的推理设置。这说明 agent 不只是业务层用户,也正在成为基础设施优化的使用者。
7. 生产级 agent 的难点:不是写代码,而是看懂运行结果
Akshat 说,现在的模型已经能比较好地 one-shot 写出 Modal 代码,但它们仍会卡在更真实的问题上:如何使用日志、指标和可观察性来判断失败原因,然后修改正确的地方。这也是 Modal 做 Modal Bench 的原因:找到 LLM 在真实基础设施任务上的缺口,再反过来改产品和 skill surface。
这一点很重要。Agent 时代,代码生成会越来越强,但生产系统的判断力不等于写出语法正确的代码。它还包括:是否知道哪里失败、是否能定位资源限制、是否理解权限和网络边界、是否能从日志里抽出下一步动作。
所以 Akshat 对 AX 的理解不是「让 agent 更会写」,而是让产品把反馈面向 agent 暴露出来。过去 UI 里只有人能读懂的日志、指标和按钮,未来要有 CLI、API 和结构化输出,让 agent 也能消费。
8. Python、TypeScript 与 agent 的语言选择
节目最后谈到 SDK 和语言。Modal 最早选择 Python,是因为数据和机器学习用户都在那里;但 Modal 现在也有 Go 和 TypeScript SDK,runtime 本身不绑定 Python。Akshat 的观察是:inference 和 training 仍然高度 Python;但 agent 相关用例里,TypeScript 的占比会上升,因为很多 agent 应用更接近产品、工具和运行时编排,而不是传统 ML 训练。
主持人开玩笑说,未来可能只剩两种语言:Python 和 TypeScript,另一个是 English / prompting。这个玩笑背后是真问题:如果 LLM 本身参与写代码,语言生态、训练数据、工具链和可观察性会共同决定 agent 的生产力。
金句精译
- 「我们已经把 SDK 团队的思考从开发者体验转向了 agent 体验。」
- 「为什么要让一个 agent 读几百个 Kubernetes 文件、写没有类型的 YAML?它明明可以改几行 decorator,就拿到一个自我配置的运行时。」
- 「Kubernetes 不是为突发的、计算密集的 AI 工作负载设计的。」
- 「Agent 不只是调用模型,它需要一个地方写代码、运行、检查输出、改变环境、调试失败,然后再试一次。」
- 「看代码会变少,观察运行结果会变重要。」
- 「很多 post-training 和研究任务,不需要最大规模集群,它们需要的是弹性。」
给创业者和 AI builder 的启发
- Agent 产品的护城河会向运行环境移动。 如果 agent 要真实行动,沙盒、权限、网络和日志不再是内部工程细节,而是产品能力。
- AI infra 的价值从「资源可得」转向「反馈闭环」。 谁能让 agent 更快试错、更快定位失败、更低成本扩缩,谁就更接近下一代云的入口。
- 推理成本优化会越来越软件化。 模型、GPU、调度、冷启动和尾延迟会被打包成一个可持续优化系统,而不是一次性部署动作。
- 可观察性会成为 agent 的 API。 过去日志给人看;未来日志、指标和错误状态也要给 agent 看。
- AX 不是替代 DX,而是把 DX 的标准提高。 对 agent 好用的基础设施,通常也会让人类开发者更少被配置和环境问题拖住。
本期未展开的缺口
逐句全文翻译尚未作为正文完整承载。本轮已完成完整稿源精读和完整 ASR 放行,但逐句无删减译本长度接近一篇独立长文,当前以「顺序精读 + 金句精译 + 图文卡片」交付,避免把读者误导为已发布逐句全文译本。




评论
登录后可发表评论。