第 1 章 · 导论:传统 AI 开发的困境与云原生 AI 范式 本章是全书的认知坐标系。云原生 AI(Cloud Native AI)并非新词,但在大模型时代获得了全新含义——它把「会训练的算法」装进「可调度的平台」,让模型从「单机 notebook 里的一次性实验」变为「可调度、可复现、可弹性、可观测」的生产级工程产物。理解传统 AI 工程化的五大痛点与云原生 AI 的五大特性,是理解后续所有章节的钥匙。 章节摘要 本章从传统 AI 开发的工程化困境切入——「环境地狱、资源孤岛、版本混乱、不可复现、扩展难」五大痛点长期困扰算法团队。随后讲清云原生 AI 的定义与五大核心特性(容器化、声明式、不可变基础设施、自动化、弹性),辨析这些特性如何对症下药地化解传统痛点。
本章是全书的认知坐标系。云原生 AI(Cloud Native AI)并非新词,但在大模型时代获得了全新含义——它把「会训练的算法」装进「可调度的平台」,让模型从「单机 notebook 里的一次性实验」变为「可调度、可复现、可弹性、可观测」的生产级工程产物。理解传统 AI 工程化的五大痛点与云原生 AI 的五大特性,是理解后续所有章节的钥匙。
本章从传统 AI 开发的工程化困境切入——「环境地狱、资源孤岛、版本混乱、不可复现、扩展难」五大痛点长期困扰算法团队。随后讲清云原生 AI 的定义与五大核心特性(容器化、声明式、不可变基础设施、自动化、弹性),辨析这些特性如何对症下药地化解传统痛点。接着梳理从 MLOps 到 LLMOps 的演进路径,指出大模型时代给工程化带来的新挑战(长上下文、推理成本、Prompt 治理)。最后绘制 CNCF AI 生态全景图,按调度、训练、推理、可观测四层梳理 Kubeflow、Ray、vLLM、KServe、Kueue、Volcano、Feast、MLflow 等主流项目谱系,并标注本书各章的落点,为后续 7 章铺平道路。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | 传统 AI 开发的工程化困境:环境地狱、资源孤岛与不可复现 | 为什么 AI 项目落地这么难?五大痛点分别是什么? | 全书动机 |
| 02 | 云原生 AI 的定义与核心价值:容器化、声明式与不可变基础设施 | 云原生 AI 到底是什么?五大特性如何化解痛点? | 第 2-3 章(底座) |
| 03 | 从 MLOps 到 LLMOps:云原生承载的演进路径 | MLOps 和 LLMOps 差在哪?大模型带来哪些新挑战? | 第 4-7 章(流水线+交付) |
| 04 | CNCF AI 生态全景与本书地图 | 主流开源项目有哪些?本书怎么看? | 全书导航 |
四个子章节构成「痛点 → 方案 → 演进 → 地图」的递进:先看清问题(01),再给出云原生的解法(02),然后看到大模型时代的新演进(03),最后用一张生态地图把全书项目坐标标清楚(04)。读完这四节,你将拥有一张完整的认知地图,知道后续每一章在这张地图上的位置。
云原生 AI、Cloud Native AI、MLOps、LLMOps、CNCF AI 生态、Kubeflow、容器化 AI、声明式基础设施、AI 工程化困境、不可变基础设施、模型推理服务、GPU 调度、特征存储、分布式训练。
README.md 了解全教程结构与四层架构闭环。