第 9 章 · 约 26 分钟
分布式推理
计算与状态放在哪里,如何分工、共享和扩缩?
阅读中·实验未完成·考核未交
放置
阶段不同,该用的机器也不同
Prefill 要矩阵峰值,decode 要带宽和 KV 容量。把它俩绑在同一组卡上,往往两头都不舒服:decode batch 被 prefill 的尖峰打乱,prefill 又被 decode 的长尾拖住。Prefill–Decode 分离让 P 池和 D 池各自批处理,代价是要把 KV 从 P 交给 D。
Qwen3-8B 的 8K BF16 KV 是 1.125 GiB。25 GB/s 要 48 ms,50 GB/s 要 24 ms。DeepSeek 的紧凑 MLA 大约一半。交接时间必须低于分离带来的批处理收益,否则就是亏本的架构表演。
Prefill 池
KV
Decode 池
注意力与 FFN、专家、KV 路由
Attention–FFN 分离把记忆型的注意力和吞吐型的前馈拆到不同硬件。Qwen3-8B 每层要送一个 8 KiB 的隐藏向量并取回结果,36 层就是 72 次往返——又是小消息延迟问题。
MoE 的专家并行用 AllToAll 把 token 送到被选中的专家。负载不均时,少数专家变热,容量和计算都会倾斜。KV 则可以按请求哈希、前缀树或会话亲和来放:命中省计算,未命中就要跨节点取回或重算 prefill。
实验
PD 分离
KV 交接
22.50 ms
P 利用率示意
70%
D 利用率示意
71%
是否划算
交接税可接受
考核
第 9 章考核
3 题
1.PD 分离何时划算?
2.8K Qwen3-8B KV 在 50 GB/s 上直传大约?
3.AF 分离在 decode 上更难受,主要因为?
全部作答后交卷。