第 4 章 · MLOps 流程设计与特征存储 模型不是代码——它需要数据、特征、实验、版本、注册、监控一整套工程化治理,才能从「notebook 里的实验」变成「生产系统的稳定服务」。本章讲清 MLOps 的全景闭环,并聚焦其中最容易踩坑的「特征存储」。 章节摘要 第 2-3 章建立了「调度底座」,解决了「资源怎么管」的问题。本章进入「生产流水线层」,解决「模型怎么工程化生产」的问题。 本章从 MLOps 的全景闭环讲起:数据 → 训练 → 评估 → 部署 → 监控,并介绍 Google 提出的 MLOps 0/1/2 级成熟度模型,用它评估团队现状。
模型不是代码——它需要数据、特征、实验、版本、注册、监控一整套工程化治理,才能从「notebook 里的实验」变成「生产系统的稳定服务」。本章讲清 MLOps 的全景闭环,并聚焦其中最容易踩坑的「特征存储」。
第 2-3 章建立了「调度底座」,解决了「资源怎么管」的问题。本章进入「生产流水线层」,解决「模型怎么工程化生产」的问题。
本章从 MLOps 的全景闭环讲起:数据 → 训练 → 评估 → 部署 → 监控,并介绍 Google 提出的 MLOps 0/1/2 级成熟度模型,用它评估团队现状。随后聚焦流水线中最关键的「特征存储(Feature Store)」:它如何用离线/在线双写解决训练-服务一致性(Training-Serving Skew),如何用 Point-in-Time 正确性保证时间穿越避免,Feast 与 Tecton 两个代表项目的差异。接着讲实验跟踪与元数据管理(MLflow、W&B、Kubeflow Metadata),解决「模型怎么训出来的、能否复现」的问题。最后讲模型注册中心与版本治理(Model Registry、Model Card、阶段管理),让模型从训练产物变成可治理、可回滚的资产。
读完本章,你将掌握把团队从「notebook 黑盒」带到「MLOps 闭环」的全部工程认知。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | MLOps 全景:从数据到生产的端到端闭环 | MLOps 是什么?成熟度怎么评? | 第 5 章流水线 |
| 02 | 特征存储:离线训练与在线服务的一致性 | 训练和服务特征为什么不一致?怎么治? | 第 6 章推理 |
| 03 | 实验跟踪与元数据管理 | 模型怎么训出来的?能复现吗? | 第 5 章训练 |
| 04 | 模型注册中心与版本治理 | 模型怎么管版本?怎么回滚? | 第 5-6 章上线 |
四个子章节构成「全景 → 特征 → 实验 → 模型」的递进:先建立端到端认知(01),再深入最容易踩坑的特征一致性(02),然后讲实验可复现(03),最后把模型作为资产治理(04)。读完这四节,你将拥有从数据到模型上线的完整 MLOps 工程化图景。
MLOps、MLOps 成熟度模型、特征存储、Feature Store、Feast、Tecton、Training-Serving Skew、Point-in-Time、MLflow、Weights & Biases、W&B、Kubeflow Metadata、实验跟踪、模型注册中心、Model Registry、Model Card、模型版本治理、元数据管理、血缘追踪。