AI Engineering · 第 19 章 伦理、安全与对齐 章节摘要:本章对应原课程「18-ethics-safety-alignment」,属「第四篇·Agent 与生产」。奖励黑客、越狱、对齐、监管——让 AI 安全可控。本章共 30 节,前置依赖为「第11、15章」。对齐不是可选项——一个强大但不安全的模型,比一个弱模型更危险。 本章将带你逐节吃透这一领域的核心概念,并尽量从零手工实现,再用主流框架对比验证。 学习目标 阅读完本章,你应当能够: 理解伦理、安全与对齐在整个 AI 工程体系中的定位(奖励黑客、越狱、对齐、监管——让 AI 安全可控)。 掌握本章 30 节覆盖的核心概念与算法。 能够从零实现本章的关键模型/机制,并用框架对比验证。
章节摘要:本章对应原课程「18-ethics-safety-alignment」,属「第四篇·Agent 与生产」。奖励黑客、越狱、对齐、监管——让 AI 安全可控。本章共 30 节,前置依赖为「第11、15章」。对齐不是可选项——一个强大但不安全的模型,比一个弱模型更危险。 本章将带你逐节吃透这一领域的核心概念,并尽量从零手工实现,再用主流框架对比验证。
阅读完本章,你应当能够:
注:具体学习目标将在各子节汉化时细化为可考核的能力点。
对齐不是可选项——一个强大但不安全的模型,比一个弱模型更危险。
注:本章的 Mermaid 概念图将在支柱页完善时替换为本章核心架构/流程图(基于原 Phase README 与首节内容绘制)。
本章共 30 节,按原课程的编号顺序递进。详细的逻辑关系图将在支柱页完善时补充(基于各节的依赖与铺垫关系)。
本章第 01 节 ... ──► 第 30 节 │ ▼ 下一章(第 20 章)
前置知识:
本章为后续章节奠定的基础:
本章支柱页为骨架初稿,各板块将在对应章节汉化推进时细化。原英文内容位于
phases/18-ethics-safety-alignment/,每节正文为docs/en.md,汉化状态见「教程规划.md」的待汉化清单。