内容摘要
云原生AI·K8s上跑LLM 灏 灏天文库 · AI基础设施与推理优化 第 5 期 AI基础设施与推理优化 · 第 5 期 GPU利用率30%? 共享一张卡 翻倍 云原生AI · K8s GPU调度 · 多租户 大模型服务的通病:一张卡只跑一个模型,GPU利用率常低于30%。K8s + Device Plugin + MIG/时间分片,让 多个推理服务共享一张GPU ,利用率翻倍、成本砍半。云原生AI不是把模型塞进容器那么简单,是把GPU当可切分的资源来调度。 ⏱ 约 10 分钟 🎯 想在K8s上高效跑LLM的人 📦 源:ht-cloud-native-ai 教程 01 问题:GPU是孤岛 传统部署一个模型占一张卡,请求来了才用、空闲时GPU空转——昂贵的H100利用率30%是常态。 K8s原生只管CPU/内存,GPU是「二等公民」:早期要靠nvidia-docker,调度器不认识GPU。NVIDIA Device Plugin补上这层——把GPU作为extended resource暴露给K8s,Pod可以request nvidia.com/gpu: 1 。