跳到内容

9 章 · 约 26 分钟

分布式推理

计算与状态放在哪里,如何分工、共享和扩缩?

阅读中·实验未完成·考核未交

放置

阶段不同,该用的机器也不同

Prefill 要矩阵峰值,decode 要带宽和 KV 容量。把它俩绑在同一组卡上,往往两头都不舒服:decode batch 被 prefill 的尖峰打乱,prefill 又被 decode 的长尾拖住。Prefill–Decode 分离让 P 池和 D 池各自批处理,代价是要把 KV 从 P 交给 D。

Qwen3-8B 的 8K BF16 KV 是 1.125 GiB。25 GB/s 要 48 ms,50 GB/s 要 24 ms。DeepSeek 的紧凑 MLA 大约一半。交接时间必须低于分离带来的批处理收益,否则就是亏本的架构表演。

Prefill 池
KV
Decode 池
P 池处理输入,把 KV 交给 D 池继续生成。交接是要付的税。

注意力与 FFN、专家、KV 路由

Attention–FFN 分离把记忆型的注意力和吞吐型的前馈拆到不同硬件。Qwen3-8B 每层要送一个 8 KiB 的隐藏向量并取回结果,36 层就是 72 次往返——又是小消息延迟问题。

MoE 的专家并行用 AllToAll 把 token 送到被选中的专家。负载不均时,少数专家变热,容量和计算都会倾斜。KV 则可以按请求哈希、前缀树或会话亲和来放:命中省计算,未命中就要跨节点取回或重算 prefill。

实验

PD 分离

KV 交接

22.50 ms

P 利用率示意

70%

D 利用率示意

71%

是否划算

交接税可接受

考核

第 9 章考核

3 题

  1. 1.PD 分离何时划算?

  2. 2.8K Qwen3-8B KV 在 50 GB/s 上直传大约?

  3. 3.AF 分离在 decode 上更难受,主要因为?

全部作答后交卷。