第 11 章 · 约 20 分钟
资源调度与运行环境
如何把模型、工具和共享资源组织成完整任务?
阅读中·实验未完成·考核未交
任务
模型调用只是图中的一类节点
Agent 要读文件、跑测试、查数据库、再把结果写回上下文。加速器、CPU 沙箱、网络出口和配额是不同的资源池。调度器看到的不该只是 GPU 利用率,而是整张任务图:哪些节点必须串行,哪些可以重叠,失败后从哪恢复。
运行环境的创建和销毁本身就有成本。冷启动一个带依赖的沙箱可能要秒级,而一次工具调用的模型侧只要几十毫秒。把环境留着,占的是内存和并发槽;用完就扔,下一次再付启动。
共享出口会变成新的上限
强化学习里,训练组要把新权重发到多个生成实例。Qwen3-8B 一份 16.38 GB,六路接收、共享 200 Gbit/s 出口时,发送方要累计送出约 98 GB,至少 3.93 s;每个接收口 50 Gbit/s,单份至少 2.62 s。加速器空着,也得等权重到齐。
模型服务的选择同样是调度:本地 LoRA、共享基模多适配器、远程 API,延迟、成本和隔离各不相同。计费如果只看 token,会低估工具和空等。
实验
任务链
整体加速
1.32×
理论上限
1.43×
工具、审批、网络是 1−f。把模型做到瞬时,也跳不出这个上限。
考核
第 11 章考核
3 题
1.六份 16.38 GB 权重共享 200 Gbit/s 出口,发送方至少?
2.工具调用占墙钟 70%,把模型加速 10 倍。任务加速大约?
3.为什么沙箱要和模型实例一起调度?
全部作答后交卷。