跳到内容

术语

速查

先记住这些量和公式,再回头看章节。数字会变,关系不变。

名词与公式

  • M / F / R / T

    容量、运算量、读写量、时间。T_lower = max(F/Π, R/β),且 M ≤ Mcap。

  • MFU / MBU

    模型 FLOPs 利用率 F/(ΠT) 与带宽利用率 R/(βT)。回答离物理极限还有多远。

  • Prefill / Decode

    预填充一次处理已知输入;解码逐步生成新 token,复用 KV。

  • KV cache

    已处理 token 的键与值。c_KV = 2·L·n_KV·d_h·b。用存储换回重算。

  • GQA / MQA / MLA

    分组、多查询、低秩潜空间三种减少 KV 的注意力变体。

  • Roofline

    算术强度 I=F/R 与脊点 I*=Π/β 比较,判断算力墙还是带宽墙。

  • Amdahl

    Speedup = 1/((1−f)+f/s)。剩余串行部分规定加速上限。

  • PagedAttention

    把 KV 分页映射到物理块,降低预留碎片,提高并发。

  • FlashAttention

    在算子内分块并做在线 softmax,减少 HBM 上的中间结果。

  • TP / PP / DP / EP

    张量、流水线、数据、专家并行。切的维度不同,通信形态不同。

  • ZeRO

    按阶段分片优化器、梯度、参数,用通信换复制的容量。

  • PD 分离

    Prefill 与 Decode 分池。收益来自独立批处理,成本是 KV 交接。

  • 超节点

    通过高带宽互联紧密协作的一组加速器,scale-up 域。

  • Scale-up / Scale-out

    柜内高带宽协作 vs 跨节点网络扩展。

  • TTFT / TPOT

    首 token 时间与每输出 token 间隔。吞吐不能代替它们。