文集文档索引

AI Engineering from Scratch · 中文技术教程


  • 文集信息
  • 目录大纲
  • 最新文档
  • 知识宇宙

文集详情

文集导读

AI Engineering from Scratch · 中文技术教程 从一行矩阵乘法到能动手的 Agent:读懂现代 AI 工程的完整链路 这本教程讲什么 本教程是开源课程库「AI Engineering from Scratch」(Rohit Gupta,MIT 协议)的中文体系化改编版。原课程以一句口号立身——「你不只是学 AI,而是亲手把它从零搭出来,端到端」。 全书共 20 章、503 节、约 320 小时,覆盖一条从地基到屋顶的完整链路:数学与机器学习基础 → 深度学习与视觉/语音/NLP → Transformer 与生成式 AI → 大模型工程 → Agent 工程与生产化。每一节都遵循同一个信条——先用原始数学和原理手工实现一遍,再用主流框架对比验证,代码以 Python 为主,辅以 TypeScript、Rust、Julia。 重要说明:原课程正文 100% 为英文,本教程的工作是「结构重组 + 全量汉化 + 套用中文教学模板」。原课程的 Phase 编号科学且自带依赖图,本教程保留原编号作为底层骨架(本教程 0120 章对应原 P0P19),只在顶层用「五篇学习路径」为中文读者重新串讲,既尊重原作的认知递进设计,又给出一条更清晰的主线。 文件组织:原英文项目的 README.md / ROADMAP.md / LESSONTEMPLATE.

AI Engineering from Scratch · 中文技术教程

从一行矩阵乘法到能动手的 Agent:读懂现代 AI 工程的完整链路

这本教程讲什么

本教程是开源课程库「AI Engineering from Scratch」(Rohit Gupta,MIT 协议)的中文体系化改编版。原课程以一句口号立身——「你不只是学 AI,而是亲手把它从零搭出来,端到端」。

全书共 20 章、503 节、约 320 小时,覆盖一条从地基到屋顶的完整链路:数学与机器学习基础 → 深度学习与视觉/语音/NLP → Transformer 与生成式 AI → 大模型工程 → Agent 工程与生产化。每一节都遵循同一个信条——先用原始数学和原理手工实现一遍,再用主流框架对比验证,代码以 Python 为主,辅以 TypeScript、Rust、Julia。

重要说明:原课程正文 100% 为英文,本教程的工作是「结构重组 + 全量汉化 + 套用中文教学模板」。原课程的 Phase 编号科学且自带依赖图,本教程保留原编号作为底层骨架(本教程 0120 章对应原 P0P19),只在顶层用「五篇学习路径」为中文读者重新串讲,既尊重原作的认知递进设计,又给出一条更清晰的主线。

文件组织:原英文项目的 README.md / ROADMAP.md / LESSON_TEMPLATE.md / phases/ 保持原样不动,本中文改编层另起文件。

五篇学习路径一览

全教程按认知递进划分为五篇,遵循「打地基 → 深度学习 → 生成与强化 → 大模型工程 → Agent 与生产」的主线:

第零篇·打地基 ── 是什么、怎么算 第1章 开发环境 · 第2章 数学 · 第3章 机器学习 │ 第一篇·深度学习 ── 怎么学、怎么看听说 第4章 深度学习核心 · 第5章 视觉 · 第6章 NLP · 第7章 语音 │ 第二篇·生成与强化 ── 怎么生成、怎么优化 第8章 Transformer · 第9章 生成式 AI · 第10章 强化学习 │ 第三篇·大模型工程 ── 怎么训、怎么用、怎么连 第11章 从零构建 LLM · 第12章 LLM 工程化 · 第13章 多模态 · 第14章 工具与协议 │ 第四篇·Agent 与生产 ── 怎么自治、怎么上线 第15章 Agent 工程 · 第16章 自主系统 · 第17章 多智能体 · 第18章 基础设施 · 第19章 安全对齐 · 第20章 毕业项目

你也可以按目标跳读:

  • 想快速理解 LLM 应用 → 直接看第三篇(第 11~14 章);
  • 想搞懂 Agent 与工具调用 → 从第 15 章切入,回看第 12、14 章补基础;
  • 想打牢原理底子 → 老老实实从第零篇开始,尤其是第 2、4 章。

章节目录

第零篇 · 打地基

第 1 章 开发环境与工具链(原 P0,12 节)
开发环境、Git、GPU 与云端、API 密钥、Jupyter、Python 环境、Docker、编辑器、数据管理、终端 Shell、Linux、调试与性能分析。先把工具链配齐,后续每一节才能跑起来。

第 2 章 数学基础(原 P1,22 节)
线性代数直觉、向量矩阵运算、矩阵变换、微积分、链式法则与自动微分、概率分布、贝叶斯、优化、信息论、降维、SVD、张量、数值稳定性、范数距离、统计、采样、线性方程组、凸优化、复数、傅里叶变换、图论、随机过程。AI 的「地板」。

第 3 章 机器学习基础(原 P2,18 节)
什么是机器学习、线性/逻辑回归、决策树与随机森林、SVM、k 近邻、无监督学习、特征工程、模型评估、偏差—方差、集成方法、超参数调优、ML 流水线、朴素贝叶斯、时间序列、异常检测、不平衡数据、特征选择。

第一篇 · 深度学习

第 4 章 深度学习核心(原 P3,13 节)
感知机、多层网络与前向传播、从零实现反向传播、激活函数、损失函数、优化器、正则化、权重初始化、学习率调度、搭建迷你框架、PyTorch 入门、JAX 入门、调试神经网络。这一章是理解后续一切的钥匙。

第 5 章 计算机视觉(原 P4,28 节)
图像基础、从零实现卷积、CNN 从 LeNet 到 ResNet、图像分类、迁移学习、YOLO 目标检测、U-Net 分割、Mask R-CNN、GAN、扩散模型、Stable Diffusion、视频理解、3D 视觉与 NeRF、ViT、边缘部署、视觉流水线毕业项目、自监督视觉、CLIP、OCR、图像检索、关键点检测、3D 高斯泼溅、扩散 Transformer、SAM 3、视觉语言模型、单目深度、多目标跟踪、世界模型与视频扩散。

第 6 章 自然语言处理(原 P5,29 节)
文本处理、词袋与 TF-IDF、Word2Vec、GloVe 与 FastText、情感分析、命名实体识别、词性标注与句法分析、CNN 与 RNN、序列到序列、注意力机制、机器翻译、文本摘要、问答系统、信息检索、主题模型、Transformer 前的文本生成、聊天机器人、多语言 NLP、子词分词、结构化输出、自然语言推断、嵌入模型、RAG 分块策略、共指消解、实体链接、关系抽取与知识图谱、LLM 评估、长上下文评估、对话状态跟踪。

第 7 章 语音与音频(原 P6,17 节)
音频基础、频谱图与梅尔特征、音频分类、语音识别(ASR)、Whisper、说话人识别、文本转语音、语音克隆与转换、音乐生成、音频语言模型、实时音频处理、语音助手流水线毕业项目、神经音频编解码、语音活动检测与轮次切换、流式语音到语音、语音反欺诈与水印、音频评估指标。

第二篇 · 生成与强化

第 8 章 Transformer 深入(原 P7,16 节)
为什么需要 Transformer、从零实现自注意力、多头注意力、位置编码、完整 Transformer、BERT、GPT、T5 与 BART、视觉 Transformer、音频 Transformer、混合专家(MoE)、KV 缓存与 Flash Attention、缩放定律、从零构建 Transformer 毕业项目、注意力变体、投机解码。

第 9 章 生成式 AI(原 P8,15 节)
生成模型分类与历史、自编码器与 VAE、GAN、条件 GAN 与 Pix2Pix、StyleGAN、从零实现 DDPM、潜在扩散与 Stable Diffusion、ControlNet 与 LoRA、图像编辑、视频/音频/3D 生成、流匹配、评估指标、视觉自回归。

第 10 章 强化学习(原 P9,12 节)
MDP、动态规划、蒙特卡洛方法、时序差分(Q 学习与 SARSA)、DQN、策略梯度 REINFORCE、Actor-Critic、PPO、奖励建模与 RLHF、多智能体 RL、Sim-to-Real、游戏 RL(AlphaZero、MuZero 与 LLM 推理时代)。

第三篇 · 大模型工程

第 11 章 从零构建 LLM(原 P10,24 节)
分词器、从零构建分词器、预训练数据流水线、预训练迷你 GPT、分布式训练扩展、指令微调(SFT)、RLHF、DPO、Constitutional AI、评估、量化、推理优化、完整 LLM 流水线、开源模型架构剖析、投机解码与 EAGLE-3、差分注意力、原生稀疏注意力、多 token 预测、DualPipe 并行、DeepSeek-V3 架构剖析、Jamba 混合架构、异步推理、梯度检查点。

第 12 章 LLM 工程化(原 P11,17 节)
提示工程、少样本与思维链/思维树、结构化输出、嵌入与向量表示、上下文工程、RAG、进阶 RAG、LoRA 与 QLoRA 微调、函数调用与工具使用、LLM 应用评估、缓存限流与成本、护栏与安全、生产级 LLM 应用、模型上下文协议(MCP)、提示缓存、Agent 状态机、Agent 框架取舍。这是想做 LLM 应用读者最该先读的一章。

第 13 章 多模态 AI(原 P12,25 节)
ViT 与 patch token、CLIP、BLIP-2、Flamingo、LLaVA、任意分辨率视觉、开源 VLM 配方、LLaVA-OneVision、Qwen-VL、InternVL3、Chameleon、Emu3、Transfusion、Show-o、Janus-Pro、MIO、视频语言模型、长视频理解、音频语言模型、全模态模型、具身 VLA、文档与图表理解、ColPali、多模态 RAG、多模态 Agent(毕业项目)。

第 14 章 工具与协议(原 P13,23 节)
工具接口、函数调用深入、并行工具调用与流式、结构化输出、工具模式设计、MCP 基础、构建 MCP 服务端、构建 MCP 客户端、MCP 传输、MCP 资源与提示、MCP 采样、Roots 与 Elicitation、异步任务、MCP Apps、MCP 安全(工具投毒)、MCP 安全(OAuth 2.1)、MCP 网关与注册中心、MCP 生产鉴权、A2A 协议、OpenTelemetry GenAI、LLM 路由层、Skills 与 Agent SDK、工具生态毕业项目。

第四篇 · Agent 与生产

第 15 章 Agent 工程(原 P14,42 节,全书最大单章)
Agent 循环、ReWOO 与计划-执行、Reflexion、思维树与 LATS、自我精炼与 CRITIC、工具使用、Agent 记忆、记忆块与睡眠时计算、混合记忆、技能库(Voyager)、HTN 与进化规划、Anthropic 工作流模式、状态图编排、Actor 模型、角色制团队、OpenAI Agents SDK、Harness 即库、生产运行时、基准测试、Computer Use、语音 Agent、OpenTelemetry 约定、可观测性、多智能体辩论、失败模式、提示注入防御、编排模式、生产运行时、评估驱动开发、Agent Workbench 工程系列(共 12 节)、毕业项目。

第 16 章 自主系统(原 P15,22 节)
从聊天机器人到长程 Agent、STaR 系列、AlphaEvolve、Darwin Godel Machine、AI Scientist v2、自动化对齐研究、递归自我改进、有界自我改进、自主编码 Agent 全景、权限模式、浏览器 Agent、持久执行、动作预算、熔断与金丝雀、人在环中、检查点与回滚、Constitutional AI、Llama Guard、负责任扩展策略、前沿安全框架、METR 时间跨度、社会级风险。

第 17 章 多智能体与集群(原 P16,25 节)
为什么需要多智能体、FIPA-ACL 遗产、通信协议、多智能体原语模型、监督者模式、层级架构、心智社会与辩论、角色专业化、并行/集群/网络架构、群聊与发言者选择、交接与例行程序、A2A 协议、共享记忆与黑板、共识与拜占庭容错、投票与辩论拓扑、协商与讨价、生成式 Agent、心智理论、集群优化、MARL、Agent 经济、生产扩展、失败模式、协调评估、2026 案例与前沿。

第 18 章 基础设施与生产化(原 P17,28 节)
托管 LLM 平台、推理平台经济学、Kubernetes GPU 自动伸缩、服务引擎内部(PagedAttention)、EAGLE-3 投机解码、前缀缓存服务、硬件专用推理编译、推理指标、生产量化、冷启动缓解、多区域服务、边缘推理、可观测性、提示与语义缓存、批处理 API、模型路由、分离式预填充/解码、生产服务栈、AI 网关、灰度与金丝雀、A/B 测试、负载测试、面向 AI 的 SRE、混沌工程、安全与审计、合规框架、LLM FinOps、自托管服务选型。

第 19 章 伦理、安全与对齐(原 P18,30 节)
指令遵循作为对齐信号、奖励黑客与古德哈特定律、DPO 家族、谄媚、Constitutional AI 与 RLAIF、内嵌优化与欺骗对齐、潜伏 Agent、上下文谋算、对齐伪装、AI 控制、可扩展监督、红队、多样本越狱、ASCII 与视觉越狱、间接提示注入、红队工具、WMDP 双用途评估、前沿安全框架、模型福祉、偏见、公平性、差分隐私、水印、监管框架、EchoLeak 与 AI 的 CVE、模型/系统/数据卡、数据溯源、对齐研究生态、内容审核、双用途风险。

第 20 章 毕业项目(原 P19,85 节)
17 个完整产品级毕业项目(终端编程 Agent、代码库 RAG、实时语音助手、多模态文档问答、自主研究 Agent、Kubernetes 排障 Agent、端到端微调流水线、生产级 RAG 聊天机器人、代码迁移 Agent、多智能体软件团队、LLM 可观测性看板、视频理解流水线、带注册中心的 MCP 服务、投机解码推理服务、Constitutional 安全防线、GitHub Issue 转 PR Agent、个人 AI 家教)+ 9 条深度构建赛道(Agent Harness、从零构建 GPT、预训练/分布式、AI Scientist、多模态/VLM、进阶 RAG、评估、分布式训练、安全)。

适合读者

本教程适合有一定编程与数学基础、想系统掌握现代 AI 工程的开发者:

  • 想从原理层面理解深度学习与 LLM,而不是只会调 API 的工程师
  • 需要把大模型/Agent 落地到产品的应用工程师与算法工程师
  • 想读懂一篇论文、复现一个模型的研究者或高年级学生
  • 负责训练、推理服务或 Agent 平台的基础设施工程师

前置知识:

  • Python 基本语法与一点 NumPy 经验
  • 高等数学与线性代数的基本概念(不必熟练,本教程第 2 章会重建直觉)
  • 读第 11、18 章的分布式与系统部分时,一些 Linux、Docker、网络基础会有帮助,但并非硬性要求——关键原理都用伪代码说明

关于原文版本与汉化

本教程对照的原文来自 Rohit Gupta 的开源仓库「AI Engineering from Scratch」(MIT 协议,接受社区贡献)。教程中描述的架构、原理与代码以该仓库的实际内容为准;原课程仍在持续更新,若你使用的版本与本教程有差异,请以本地源码为最终依据。

原课程的 503 节正文目前均为英文,本教程逐步汉化。

目录大纲

    最新文档

    知识宇宙

    正在加载知识图谱...


    转发
    什么是「AI Engineering from Scratch · 中文技术教程」?
    AI Engineering from Scratch · 中文技术教程 是灏天文库(aiknowledge.cn)面向开发者与技术学习者的结构化精品文集,收录相关教程、实践指南与问题解决方案,支持在线阅读与全文检索。
    「AI Engineering from Scratch · 中文技术教程」适合谁学习?
    适合希望系统化学习 AI Engineering from Scratch · 中文技术教程 相关技术的开发者、工程师与学生;零基础可先阅读导读与入门文档,有基础者可按目录进阶。
    如何阅读「AI Engineering from Scratch · 中文技术教程」中的文档?
    进入文集页后可按左侧目录浏览;单篇文档支持代码高亮、Mermaid 图表与阅读进度记录。注册登录后可收藏文档并同步学习进度。
    「AI Engineering from Scratch · 中文技术教程」的内容来源是什么?
    内容由灏天文库团队与创作者结构化整理,原创编译或标注原始来源;我们坚持可理解、可实践、可复用的质量标准,避免无价值批量搬运。