痛点:大模型上了 K8s,但推理服务总是翻车
越来越多团队把 LLM 推理服务搬上 Kubernetes——听起来很美,实际落地全是坑。
典型场景:团队用 FastAPI 包了个 Hugging Face Transformers 模型,丢进 K8s 跑。结果呢?单个请求吃满 24GB 显存,并发一上来就 OOM;模型加载要 3 分钟,Pod 重启一次用户等到崩溃;GPU 利用率忽高忽低,A100 一个月烧几万刀却跑不满。
核心问题:传统的模型推理方式没有针对 LLM 的长序列、大显存、高并发做优化。你需要一个专为 LLM 设计的推理引擎,而 vLLM 就是目前最成熟的选择。