痛点:AI 训练任务抢 GPU,集群资源乱成一锅粥
跑过 AI/ML 训练任务的运维都知道这个痛:团队 A 提交了一个 8 卡 GPU 的大模型微调任务,团队 B 同时提交了 20 个数据预处理 Job,结果所有任务一起抢资源,谁都跑不动。更头疼的是:
- 原生 Job 没有排队机制:
kubectl apply之后 Pod 直接创建,不管资源够不够,Pending 一堆 - 多团队资源配额靠 ResourceQuota 太粗糙:只能限制上限,不能做公平调度和借用
- GPU 等昂贵资源没有优先级抢占:低优先级任务占着 GPU 不释放,高优先级任务干等
- 批处理和在线服务混部时互相干扰:没有统一的准...