跳到内容

结业

十五问

不考名词堆砌。每题都在问:这个方案有没有漏掉容量、带宽、通信或串行依赖。

题目

考核

结业考核

15 题

  1. 1.时间下界 T_lower = max(F/Π, R/β) 的前提是?

  2. 2.容量检查应写成?

  3. 3.Qwen3-8B 的 c_KV = 144 KiB。8192 token 是多少 GiB?

  4. 4.GQA 相对 MHA,在 Qwen3-8B 上把 KV 变成原来的?

  5. 5.单请求 decode 的算术强度大约 2 FLOP/byte。H100 脊点约 295 FLOP/byte。结论?

  6. 6.70B 8-bit 约 73.73 GB 放进 80 GB H100 后还剩约 6 GB。能否再接一条 8K、2.68 GB KV 的 70B 请求?

  7. 7.PagedAttention 和 FlashAttention 的分工?

  8. 8.PD 分离交接 1.125 GiB KV,经池中转相对直传?

  9. 9.朴素数据并行 64 卡训练 Qwen3-8B,状态复制总量约?

  10. 10.Amdahl:工具等待占 70%,模型加速到瞬时。最大整体加速?

  11. 11.为什么 decode 的张量并行不适合跨公网?

  12. 12.训练期限分析漏掉故障恢复,会发生什么?

  13. 13.400 Gbit/s = ?

  14. 14.MoE 总参数 35B、每 token 激活 3B。一步 decode 的矩阵工作更接近?

  15. 15.本课最核心的设计口诀是?

全部作答后交卷。