- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
这是一本把 GLM-5.2 推理稳稳送上 Kubernetes 生产环境的实战小书。我们不堆术语,只讲能落地的路:从 GPU 如何在 K8s 里被调度、vLLM 为什么是首选框架,到 Deployment/Service 的真刀真枪 YAML、KV Cache 显存精算、长上下文的 1M 陷阱、MIG 与时间切片 GPU 共享的取舍、压测找上限、灰度与监控回滚。
和同类教程最大的不同:我们不假装一路顺风。全书围绕真实踩坑现场展开——探活探针设错导致重启死循环、上下文拉满直接 OOM、多副本丢会话上下文、一块卡用不满又不敢切分……每一个坑都来自真部署血泪,并给出可复用的配置模板与一句能拍板的结论。
读完你能带走:一套显存精算公式(几句话算出你的卡能扛多少并发)、一份 GPU 共享选型决策表、可直接套用的 vLLM Deployment YAML,以及「先降 max-model-len/限流,再考虑加卡」这类替你做过取舍的判断。
目录大纲:
第一章 基础准备:1.1 集群与 GPU 准备、1.2 推理框架选型(为什么首推 vLLM)、1.3 GLM-5.2 模型档案
第二章 核心部署:2.1 模型权重上线(PVC/本地盘/镜像预热取舍)、2.2 用 Deployment 把 vLLM 跑起来(逐行拆解会埋雷的参数)、2.3 Service/Ingress 与会话亲和
第三章 进阶原理:3.1 KV Cache 显存精算与长上下文策略、3.2 MIG 与时间切片 GPU 共享取舍
第四章 实战案例:4.1 压测摸清上限、4.2 灰度与生产化
第五章 总结与展望:5.1 从能用到用好
目录大纲
最新文档
知识宇宙
正在加载知识图谱...