文集文档索引

云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践


  • 文集信息
  • 目录大纲
  • 最新文档
  • 知识宇宙

文集详情

文集导读

云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践 > 面向 AI 平台工程师、MLOps/LLMOps 工程师与技术决策者的体系化教程。从传统 AI 开发的工程化困境切入,围绕「底座建设 → 生产流水线 → 高效交付 → 稳定运行」四大支柱,系统讲清 Kubernetes GPU 调度、MLOps 流水线、vLLM 高性能推理与可观测性弹性。本教程为架构深度优先的中文长文体系,不写可运行工程代码、不贴大段 YAML,聚焦系统架构设计与针对 AI 负载的优化策略。 一、核心摘要 云原生 AI(Cloud Native AI) 是把云原生思想(容器化、声明式、不可变基础设施、自动化、弹性)系统性地引入 AI 全生命周期,让模型从「单机 notebook 里的一次性实验」变为「可调度、可复现、可弹性、可观测」的生产级工程产物。它的核心是「调度 → 训练 → 推理 → 可观测」四层闭环:底层 Kubernetes 把 GPU/CPU/异构资源调度好,中层 MLOps 与分布式训练把模型造出来,上层高性能推理把模型高效交付出去,最后由可观测性与弹性保障大流量下的稳定运行。

云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践

> 面向 AI 平台工程师、MLOps/LLMOps 工程师与技术决策者的体系化教程。从传统 AI 开发的工程化困境切入,围绕「底座建设 → 生产流水线 → 高效交付 → 稳定运行」四大支柱,系统讲清 Kubernetes GPU 调度、MLOps 流水线、vLLM 高性能推理与可观测性弹性。本教程为架构深度优先的中文长文体系,不写可运行工程代码、不贴大段 YAML,聚焦系统架构设计与针对 AI 负载的优化策略。

一、核心摘要

云原生 AI(Cloud Native AI) 是把云原生思想(容器化、声明式、不可变基础设施、自动化、弹性)系统性地引入 AI 全生命周期,让模型从「单机 notebook 里的一次性实验」变为「可调度、可复现、可弹性、可观测」的生产级工程产物。它的核心是「调度 → 训练 → 推理 → 可观测」四层闭环:底层 Kubernetes 把 GPU/CPU/异构资源调度好,中层 MLOps 与分布式训练把模型造出来,上层高性能推理把模型高效交付出去,最后由可观测性与弹性保障大流量下的稳定运行。

本教程按「底座 → 流水线 → 交付 → 运行」的递进逻辑组织:

  • 底座层(第 2-3 章):Kubernetes 与 GPU 基础调度、共享 GPU 与拓扑感知调度——回答「GPU 怎么调度、怎么共享、怎么打满利用率」。
  • 流水线层(第 4-5 章):MLOps 全景与特征存储、分布式训练与 Kubeflow Pipelines——回答「模型怎么工程化生产、训练怎么分布式、流水线怎么编排」。
  • 交付层(第 6-7 章):vLLM 与 PagedAttention、批处理/量化/投机解码——回答「大模型怎么高效推理、怎么降本提速」。
  • 运行层(第 8 章):可观测性、自动扩缩容、限流降级与综合案例——回答「上线后怎么监控、怎么弹性、怎么扛住大流量」。
  • 导论层(第 1 章):从传统 AI 工程化困境切入,建立全书认知坐标系。

二、核心逻辑:云原生 AI 四层架构闭环

闭环的关键判读:

维度 传统 AI 开发 云原生 AI
环境 单机 notebook、依赖漂移 容器镜像、声明式、不可变
资源 GPU 孤岛、独占浪费 共享 GPU、拓扑感知、弹性调度
流水线 人工串脚本、不可复现 MLOps DAG、可版本化、可重跑
推理 单进程、低吞吐 PagedAttention、连续批处理、量化
运行 黑盒、被动救火 Prometheus 监控、KEDA 弹性、限流降级

三、导航索引

cloud-native-ai/ ├── README.md │ ├── 01-导论-传统AI困境与云原生AI范式/ │ ├── 01-传统AI开发的工程化困境.md ← 环境地狱/GPU孤岛/不可复现 │ ├── 02-云原生AI的定义与核心价值.md ← 容器化/声明式/不可变基础设施 │ ├── 03-从MLOps到LLMOps的演进.md ← 成熟度模型/LLMOps 新挑战 │ └── 04-CNCF-AI生态全景与本书地图.md ← Kubeflow/Ray/vLLM/KServe 谱系 │ ├── 02-Kubernetes基础设施与GPU基础调度/ │ ├── 01-AI负载特性与K8s适配挑战.md ← 批vs在线/长时训练/有状态 │ ├── 02-GPU资源建模Device-Plugin与CDI.md ← Device Plugin/CDI/Extended Resource │ ├── 03-GPU与CPU混合调度与异构资源.md ← 节点池/亲和/污点/A100-H100 标签 │ └── 04-训练作业的Operator范式.md ← PyTorchJob/MPIJob/DeepSpeedJob │ ├── 03-共享GPU与拓扑感知与高级调度/ │ ├── 01-GPU共享技术MIG与MPS.md ← MIG/MPS/时分复用切分对比 │ ├── 02-拓扑感知调度NVLink与RDMA.md ← NVLink/InfiniBand 拓扑打分 │ ├── 03-批处理调度器Volcano与Kueue.md ← Gang Scheduling/Volcano/Kueue/YuniKorn │ └── 04-抢占重调度与弹性训练.md ← 抢占/Descheduler/断点续训/Spot │ ├── 04-MLOps流程设计与特征存储/ │ ├── 01-MLOps全景端到端闭环.md ← 0/1/2 级成熟度/MLOps vs DevOps │ ├── 02-特征存储离线在线一致性.md ← Feast/Tecton/Point-in-Time/Skew │ ├── 03-实验跟踪与元数据管理.md ← MLflow/W&B/Kubeflow Metadata │ └── 04-模型注册中心与版本治理.md ← Model Registry/Model Card/回滚 │ ├── 05-分布式训练与Kubeflow-Pipelines/ │ ├── 01-分布式训练范式DP-TP-PP.md ← 数据/张量/流水线并行/AllReduce/ZeRO │ ├── 02-K8s训练Operator与Ray-Train.md ← Training Operator vs Ray Train 选型 │ ├── 03-Kubeflow-Pipelines的DAG编排.md ← 组件/DAG/Artifact/缓存 │ └── 04-模型训练的CI-CD集成.md ← GitOps for ML/DVC/Argo CD 门禁 │ ├── 06-高性能推理服务一-服务化架构与PagedAttention/ │ ├── 01-模型服务化架构KServe与Triton.md ← KServe/Triton/Ray Serve 选型 │ ├── 02-自回归推理的KV-Cache困境.md ← KV Cache 增长/碎片/Prefill-Decode │ ├── 03-PagedAttention分页显存原理.md ← Block Table/虚拟物理块映射 │ └── 04-vLLM与TGI对比与工程取舍.md ← 调度器/CUDA Graph/Prefix Caching │ ├── 07-高性能推理服务二-批处理量化与投机解码/ │ ├── 01-连续批处理与Chunked-Prefill.md ← Chunked Prefill 切分/混合调度 │ ├── 02-模型量化INT8-INT4-AWQ-GPTQ.md ← 量化粒度/AWQ/GPTQ/KV Cache 量化 │ ├── 03-Speculative-Decoding投机采样.md ← 草稿-校验/Medusa/EAGLE 无损加速 │ └── 04-分离式推理与多模态Agent推理.md ← PD 分离/长上下文/Agent KV 复用 │ └── 08-可观测性与弹性扩缩容与大流量稳定性/ ├── 01-AI系统可观测性Prometheus与GPU指标.md ← DCGM Exporter/TTFT/TPOT/告警 ├── 02-自动扩缩容HPA-VPA与KEDA.md ← KEDA ScaledObject/GPU 弹性 ├── 03-大流量稳定性限流降级与过载保护.md ← 令牌桶/排队/熔断/降级路由 └── 04-综合案例与未来展望.md ← 端到端平台/Serverless GPU/绿色 AI

四、章节定位速查

你想了解 直接看
传统 AI 开发为什么工程化难 第 1 章 01
云原生 AI 到底是什么、核心特性 第 1 章 02
MLOps 与 LLMOps 的区别 第 1 章 03
CNCF AI 生态有哪些项目、本书怎么看 第 1 章 04
Kubernetes 怎么管理 GPU 第 2 章 02
GPU/CPU 怎么混合调度 第 2 章 03
一张 GPU 怎么给多个任务共享 第 3 章 01
分布式训练为什么要拓扑感知调度 第 3 章 02
Volcano、Kueue、YuniKorn 怎么选 第 3 章 03
MLOps 成熟度怎么评估 第 4 章 01
特征存储怎么解决训练-服务不一致 第 4 章 02
数据并行/张量并行/流水线并行区别 第 5 章 01
ZeRO 三阶段显存切分原理 第 5 章 01
Training Operator 与 Ray Train 怎么选 第 5 章 02
Kubeflow Pipelines 怎么编排训练 第 5 章 03
LLM 推理为什么慢、KV Cache 瓶颈 第 6 章 02
vLLM 的 PagedAttention 原理 第 6 章 03
vLLM 与 TGI 怎么选 第 6 章 04
模型量化 INT8/INT4 怎么选、精度掉多少 第 7 章 02
Speculative Decoding 怎么无损加速 第 7 章 03
Prefill/Decode 分离推理 第 7 章 04
AI 系统该监控哪些指标 第 8 章 01
GPU 负载怎么自动扩缩容 第 8 章 02
大流量冲击下怎么保稳定 第 8 章 03
端到端云原生 AI 平台长什么样 第 8 章 04

五、阅读路径建议

  • 路径 A · 完整体系构建(AI 平台工程师 / 技术决策者):1 → 2 → 3 → 4 → 5 → 6 → 7 → 8,全章节顺序阅读,约 40 篇,建立端到端平台认知。
  • 路径 B · 调度与基础设施侧(云原生 / SRE 工程师):1 → 2 → 3 → 8,重点理解 GPU 调度、共享、拓扑、弹性与稳定性。
  • 路径 C · 训练与 MLOps 侧(算法 / MLOps 工程师):1 → 4 → 5 → 8,重点理解 MLOps 闭环、分布式训练与流水线编排。
  • 路径 D · 推理服务侧(LLMOps / 推理工程师):1 → 6 → 7 → 8,重点理解 vLLM、PagedAttention、量化、投机解码与弹性。
  • 路径 E · 快速入门(产品 / 决策者):1 → 6(01、03)→ 8(04),约 6 篇建立全景认知。

目录大纲

    最新文档

    知识宇宙

    正在加载知识图谱...


    转发
    作者与出处
    发布者 / 整理账号: 灏天文库智能体
    来源:灏天文库
    由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
    《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》是什么?
    从传统 AI 开发的工程化困境切入,围绕「底座建设 → 生产流水线 → 高效交付 → 稳定运行」四大支柱,系统讲清 Kubernetes GPU 调度、MLOps 流水线、vLLM 高性能推理与可观测 本站提供目录导航、全文检索与在线阅读,便于系统化学习。
    《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》适合谁阅读?
    适合希望系统学习《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》的初学者,以及需要查漏补缺、按需查阅的进阶学习者。
    《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》包含哪些内容?
    文集围绕主题系统展开,共收录 41 篇文档。本站将全部内容按目录结构化呈现,支持全文检索与在线阅读,方便按主题跳转与反复查阅。
    《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》的内容从何而来?
    本文集由灏天文库平台收录,内容或由平台用户上传分享,仅供学习交流,版权归原作者所有。
    《云原生 AI 技术原理:从 Kubernetes 调度到高性能模型推理的工程实践》的版权如何归属?
    本文集版权归原作者所有,灏天文库平台仅提供在线收录与学习展示;如需转载或商用请遵循原版权方要求。