跳到内容

6 章 · 约 26 分钟

超节点

模型如何在多卡之间分工,协作该有多大?

阅读中·实验未完成·考核未交

从单卡到多卡

切分是在回答五个问题

一张卡装不下权重,或单卡带宽喂不饱延迟目标时,就要让多卡一起算。切分不是一堆互不相关的缩写:矩阵在卡内可以分块,模型在多卡上也可以按样本、序列、特征、层或专家分工。两者都要先确定每块由谁计算,再安排输入到达与结果汇合。区别在于块之间跨越的是片上存储、HBM 还是 NVLink。

DP
TP
PP
SP
EP
ZeRO
切样本、切矩阵、切层、切序列、切专家、切片状态。
六种常见并行
方式切什么主要通信
DP 数据并行样本梯度 AllReduce
TP 张量并行一层内的矩阵每层 AllReduce / AllGather
PP 流水线并行层的连续段阶段边界的激活
SP / CP 序列并行序列维注意力所需的 KV 交换
EP 专家并行MoE 专家token 派发 AllToAll
ZeRO 分片 DP优化器/梯度/参数Collect / ReduceScatter

规模由通信税决定

TP 把一层的矩阵切开,通信发生在每一层、每一个 micro-batch。Qwen3-8B 隐藏向量 BF16 只有 8 KiB,decode 一步一次 AllReduce 看起来不大;但 36 层、每层两次,启动延迟会累积。这就是为什么 TP 喜欢停在超节点内部的高带宽域(NVLink、UB),而不是跨机柜的以太网。

PP 把通信集中到阶段边界,适合跨节点;代价是流水线气泡——阶段在填满和排空时会空转。DP 最简单,但每卡复制完整状态。组合这些方式,是在容量、延迟和气泡之间找一个放得进超节点的点。

实验

并行切分

卡数

2

每卡权重

8.19 GB

TP 每步激活通信

589.82 KB

PP 边界激活

0 B

TP 把通信打进每一层,适合超节点内。PP 减少次数,但会引入气泡。

考核

第 6 章考核

3 题

  1. 1.Decode 一步、TP=8,每层要对隐藏向量做 AllReduce。主要风险是?

  2. 2.什么时候更该用流水线并行而不是把 TP 拉到跨节点?

  3. 3.数据并行复制状态。64 卡各存一份 Qwen3-8B 的 131 GB 训练状态,总容量?

全部作答后交卷。