0%
课表
按“理解工作需求 — 认识执行资源 — 组织完整系统”展开。先自己估一遍,再进实验核对。
Part 1
工作从哪里来:计算量、数据量、任务依赖。
如何用几个关键数字,估算一次模型执行?
计算、参数和上下文状态,如何变成 M、F、R?
请求怎样到来,资源需求与等待如何被改写?
芯片的计算、存储和数据通路,怎样变成服务能力?
Part 2
资源怎样承担这些工作:单卡、算子、超节点、网络。
如何组织执行,少搬、少提交、少等待?
模型如何在多卡之间分工,协作该有多大?
数据跨加速器传输时,交接、拥塞和故障如何拖住计算?
如何安排批处理、请求和缓存,提高给定加速器的服务效率?
计算与状态放在哪里,如何分工、共享和扩缩?
Part 3
如何组织请求、状态、期限,以及端边云的位置。
如何安排状态、通信与恢复,在期限内取得有效进展?
如何把模型、工具和共享资源组织成完整任务?
结合传输与交互,任务该放在端、边还是云?