AI Engineering · 第 18 章 基础设施与生产化


文档摘要

AI Engineering · 第 18 章 基础设施与生产化 章节摘要:本章对应原课程「17-infrastructure-and-production」,属「第四篇·Agent 与生产」。推理服务、量化、缓存、可观测性、SRE——把模型上线。本章共 28 节,前置依赖为「第11、15章」。训出一个模型只完成 10%,剩下 90% 是让它又快又稳又便宜地跑起来。 本章将带你逐节吃透这一领域的核心概念,并尽量从零手工实现,再用主流框架对比验证。 学习目标 阅读完本章,你应当能够: 理解基础设施与生产化在整个 AI 工程体系中的定位(推理服务、量化、缓存、可观测性、SRE——把模型上线)。 掌握本章 28 节覆盖的核心概念与算法。 能够从零实现本章的关键模型/机制,并用框架对比验证。

AI Engineering · 第 18 章 基础设施与生产化

章节摘要:本章对应原课程「17-infrastructure-and-production」,属「第四篇·Agent 与生产」。推理服务、量化、缓存、可观测性、SRE——把模型上线。本章共 28 节,前置依赖为「第11、15章」。训出一个模型只完成 10%,剩下 90% 是让它又快又稳又便宜地跑起来。 本章将带你逐节吃透这一领域的核心概念,并尽量从零手工实现,再用主流框架对比验证。

学习目标

阅读完本章,你应当能够:

  1. 理解基础设施与生产化在整个 AI 工程体系中的定位(推理服务、量化、缓存、可观测性、SRE——把模型上线)。
  2. 掌握本章 28 节覆盖的核心概念与算法
  3. 能够从零实现本章的关键模型/机制,并用框架对比验证。
  4. 说清本章与前后章节的依赖关系(前置:第11、15章)。
  5. 识别本章主题在生产实践中的常见应用与陷阱。

注:具体学习目标将在各子节汉化时细化为可考核的能力点。

核心概念速览

训出一个模型只完成 10%,剩下 90% 是让它又快又稳又便宜地跑起来。

注:本章的 Mermaid 概念图将在支柱页完善时替换为本章核心架构/流程图(基于原 Phase README 与首节内容绘制)。

子章节导航

01 Managed LLM Platforms — Bedrock, Vertex AI, Azure OpenAI

02 Inference Platform Economics — Fireworks, Together, Baseten, Modal, Replicate, Anyscale

03 GPU Autoscaling on Kubernetes — Karpenter, KAI Scheduler, Gang Scheduling

04 Serving Engine Internals — PagedAttention, Continuous Batching, Chunked Prefill

05 EAGLE-3 Speculative Decoding in Production

06 Prefix-Cache Serving — RadixAttention and KV Reuse

07 Hardware-Specialized Inference Compilation — FP8 and NVFP4 on Blackwell

08 Inference Metrics — TTFT, TPOT, ITL, Goodput, P99

...(本章共 28 节,详见原项目 phases/17-infrastructure-and-production/)

子章节之间的逻辑关系

本章共 28 节,按原课程的编号顺序递进。详细的逻辑关系图将在支柱页完善时补充(基于各节的依赖与铺垫关系)。

本章第 01 节 ... ──► 第 28 节 │ ▼ 下一章(第 19 章)

前置知识与后续延伸

前置知识:

  • 第11、15章

本章为后续章节奠定的基础:

  • 见原课程 README 的 Phase 依赖图(原项目根 README.md)。

本章支柱页为骨架初稿,各板块将在对应章节汉化推进时细化。原英文内容位于 phases/17-infrastructure-and-production/,每节正文为 docs/en.md,汉化状态见「教程规划.md」的待汉化清单。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U