1/4

无问芯穹「Token工厂」:跨集群异构 PDD 如何把分散算力接成推理管线

机器之心报道无问芯穹发布跨集群异构 PDD,用 RLD 接力解码掩盖跨机房 KV Cache 传输延迟,读懂它如何把分散芯片接成更灵活的推理系统。

Agent、长上下文和多轮任务把推理请求推向更复杂的交互。无问芯穹在 WAIC 发布的 PDD,试图回答一个很工程的问题:当 Prefill 和 Decode 分处不同机房、甚至使用不同芯片,怎么把延迟和成本压下来?

1. 先看它要解决什么

机器之心报道,无问芯穹把 Agentic Infra 分成「算力集散中心」「Token 工厂」和「AI 生产力商店」三块,并在 WAIC 发布跨集群异构 PD 分离架构 PDD。文章称,公司当前已触达超过 37,000P 算力,覆盖 16 种主流芯片。1
Agent 的问题在于,用户不是只等一次回答。一问、多轮上下文和工具调用叠加后,几秒的单轮延迟会变成整条工作流的等待。文章引用的场景里,64K 总长度、90% 前缀命中率下,未优化的跨机房方案 P50 首 Token 延迟(TTFT)为 6.7 秒,P90 为 18.3 秒,P99 为 29.7 秒。1

2. PDD 怎么接力

传统 PD 分离把 Prefill 和 Decode 拆开。PDD 再加一层 Relay Decode:P 在集群 A 处理输入,RLD 在集群 A 先拿到 KV Cache 并开始输出,MD 在远端集群 B 收齐数据后接手。跨机房链路不再等待整段 KV Cache 传完才开始服务。1
交接时,RLD 只把已经生成的 Token ID 交给 MD,MD 用 Token ID 和本地收到的 KV Cache 重算增量 KV。文章引用的微基准里,100 个 Token 的 ID 负载为 1.5KB,直传增量 KV Cache 的负载则是 4649KB。项目仓库见 PDD:Unleashing Economical And Flexible Heterogeneous LLM Inference

3. 数字怎么读

文章给出的发布与论文口径包括:TTFT 降低 51.5%,单 Token 成本降低 37.5%;PDD 论文在一组部署中报告 BCR 最高提升 37.5%。文章还转述论文称,90% 平均前缀命中率下,跨机房带宽需求最多可降 10 倍。1
这些数字分别对应公司发布、论文和采访口径,不是本频道的独立复测。PDD 的适用性也取决于前缀命中、跨机房网络和 P/D 阶段的负载配比。图集中的架构图是概念示意,不是产品界面或实验截图。

Related content

Comments

Sign in to comment.