第 18 章 ML 系统设计


文档摘要

第 18 章 ML 系统设计 训练出一个好模型只是起点,真正决定一个 AI 产品能不能落地、能不能服务亿万用户的,是它背后的系统设计。本章把客户端-服务器、负载均衡、缓存、数据库、云基础设施、分布式训练集群、ML 生命周期与监控串成一条完整的链路,并通过推荐、搜索、广告、欺诈检测、内容审核、RAG 聊天和图像搜索七个完整案例,带你走完从"我训了个模型"到"我做了个可扩展的生产系统"的全部过程。系统设计是 DeepMind、OpenAI 等公司高级 AI 工程面试的核心环节,也是日常工作里把模型变成产品的关键能力。 本章简介 ML 系统设计(ML systems design)是连接"单机模型"与"支撑亿万用户的分布式 ML 系统"的桥梁。

第 18 章 ML 系统设计

训练出一个好模型只是起点,真正决定一个 AI 产品能不能落地、能不能服务亿万用户的,是它背后的系统设计。本章把客户端-服务器、负载均衡、缓存、数据库、云基础设施、分布式训练集群、ML 生命周期与监控串成一条完整的链路,并通过推荐、搜索、广告、欺诈检测、内容审核、RAG 聊天和图像搜索七个完整案例,带你走完从"我训了个模型"到"我做了个可扩展的生产系统"的全部过程。系统设计是 DeepMind、OpenAI 等公司高级 AI 工程面试的核心环节,也是日常工作里把模型变成产品的关键能力。

本章简介

ML 系统设计(ML systems design)是连接"单机模型"与"支撑亿万用户的分布式 ML 系统"的桥梁。一个上线了的推荐引擎,远不止是一个模型——它是一个 API 服务器、一个特征存储、一个模型注册表、一层缓存、一个消息队列,再加上一整套监控和迭代机制,全部通过网络协同工作。理解系统设计,正是区分"我训了个模型"和"我做出了一个产品"的分水岭。本章先从最基础的构件讲起:客户端-服务器架构、网络协议、DNS、负载均衡、缓存、数据库、消息队列和容错模式(第 01 节);再把视角抬到云上,讲清楚 IaaS/PaaS/SaaS、Kubernetes、存储、网络、serverless、成本管理和基础设施即代码(第 02 节);接着进入大规模基础设施——分布式系统、微服务、数据流水线、GPU 集群与 InfiniBand、容错、向量检索和可观测性(第 03 节);随后聚焦 ML 专属的系统问题——ML 生命周期、数据管理、特征存储、A/B 测试、反馈回路、公平性、监控和退化治理(第 04 节);最后用七个端到端案例把全部概念串起来(第 05 节)。系统设计面试考的不是某个算法,而是你能不能把数据、特征、模型、服务、监控、迭代作为一个整体来设计。

本章小节

  • 01 系统设计基础(Systems Design Fundamentals):客户端-服务器、网络协议、DNS、代理、负载均衡、缓存、数据库(SQL/NoSQL、CAP、分片、索引)、消息队列、一致性模型、容错模式——所有分布式系统的通用积木。
  • 02 云计算(Cloud Computing):IaaS/PaaS/SaaS/FaaS、AWS/GCP/Azure、容器与 Kubernetes、存储分层、云网络与 VPC、serverless、成本管理、多区域部署、基础设施即代码(Terraform)。
  • 03 大规模基础设施(Large Scale Infrastructure):可扩展性、分布式系统(共识、时钟、锁)、微服务、批/流数据流水线、GPU 集群与 InfiniBand 网络、训练存储、作业调度、容错与弹性训练、数据库扩展、搜索与向量系统、可观测性、可靠性(SLO/SLI/SLA)、CI/CD。
  • 04 ML 系统设计(ML Systems Design):ML 生命周期、数据收集与标注、特征存储与训练-服务偏差、实验跟踪、离线/在线评估、A/B 测试与影子部署、批量与实时服务、模型注册表、特征工程、ML 流水线、数据/概念漂移监控、反馈回路、嵌入表管理、公平性。
  • 05 ML 设计案例(ML Design Examples):推荐系统、搜索排序、广告点击预测、欺诈检测、内容审核、RAG 聊天机器人、大规模图像搜索——七个端到端案例,以及一套通用的系统设计面试框架。

学习路径

  • 前置知识:本章建立在三章之上。第 13 章(计算与操作系统)提供容器、网络(TCP/IP)、进程/线程、调度和阿姆达尔定律的背景,是理解 K8s、负载均衡和扩展性的根基;第 15 章(生产软件工程)讲过部署、CI/CD、监控(Prometheus/Grafana)、实验跟踪和特征存储的实操,本章会把它们放进更大的系统设计语境;第 17 章(AI 推理)的量化、批处理、KV-cache、前缀缓存等概念会直接出现在服务架构的讨论里。此外第 6 章(分布式训练)的数据/模型/流水线并行是 GPU 集群一节的前置。
  • 后续章节:第 19 章(应用 AI)和第 20 章(前沿 AI)会把本章的系统设计模式用到具体应用和最新研究方向中;如果你目标是 DeepMind、OpenAI 等公司的 ML 系统或 infra 岗位,本章是面试准备的核心。

关键概念速览

  • 负载均衡(load balancing):把到来的请求分发到多台服务器上——轮询、最少连接、加权轮询、一致性哈希各有适用场景,是水平扩展的第一道关。
  • CAP 定理(CAP theorem):在分布式数据库里,一致性(C)、可用性(A)、分区容错性(P)三者最多只能同时满足两个;由于网络分区不可避免,真正的选择是 CP 还是 AP。
  • 特征存储(feature store):用同一份特征计算同时喂给离线训练和在线服务,消除训练-服务偏差,是现代 ML 平台的枢纽组件。
  • A/B 测试(A/B testing):把线上流量随机分成对照组和实验组,用统计显著性比较业务指标,是评估 ML 变更的金标准,必须配合护栏指标一起看。
  • 反馈回路(feedback loop):模型的预测影响用户行为,这些行为又成了下一版模型的训练数据——可能是良性的,也可能是恶性的,需要靠探索、反事实日志和留出集来缓解。
  • SLO/SLI/SLA:分别表示服务等级目标、指标和协议;错误预算把可靠性从一个抽象目标变成可度量的资源,决定你能不能放心地做有风险的变更。

发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U