第 1 章 · 生成式AI图像技术概述 本章要回答的三个问题:生成式AI和传统的"识别/分类"AI到底差在哪,为什么它能凭空造图?图像生成与编辑是这两年才出现,还是有一条清晰的历史脉络?今天主流的生成模型(GAN、VAE、扩散)放在同一张桌子上的胜负手是什么? 为什么会有这一章 很多人第一次接触生成式AI,是先被结果唬住:输入一句话,出来一张几乎以假乱真的图。于是本能地把"会画画"当成一种神秘魔法,遇到更深的问题(为什么会崩、为什么有的模型快有的模型慢)就无从下手。这一章的使命是把这团浆糊摊开——先说生成式AI的数学身份是"学分布再采样",再讲这条路是从噪声到清晰的一套思路,然后横向摆出 GAN、VAE、扩散三类范式,让你在进入扩散细节之前,先拥有一张全图。
本章要回答的三个问题:生成式AI和传统的"识别/分类"AI到底差在哪,为什么它能凭空造图?图像生成与编辑是这两年才出现,还是有一条清晰的历史脉络?今天主流的生成模型(GAN、VAE、扩散)放在同一张桌子上的胜负手是什么?
很多人第一次接触生成式AI,是先被结果唬住:输入一句话,出来一张几乎以假乱真的图。于是本能地把"会画画"当成一种神秘魔法,遇到更深的问题(为什么会崩、为什么有的模型快有的模型慢)就无从下手。这一章的使命是把这团浆糊摊开——先说生成式AI的数学身份是"学分布再采样",再讲这条路是从噪声到清晰的一套思路,然后横向摆出 GAN、VAE、扩散三类范式,让你在进入扩散细节之前,先拥有一张全图。你不能在没握过方向盘之前就冲进弯道;同理,也不建议在没建起范式坐标系之前就啃 DDPM 的公式。
本章开头定位:这是一套教程的第一层地基。第二章的扩散原理之所以能讲得顺,依赖你对"分布采样"与"噪声逐步清退"两个直觉有印象。我们全册反复用到的比喻——把画面当作一张被打满噪点、又被一口气一口气擦净的画稿——正是从这里的"分布采样"起步:噪声是分布里的随机点,去噪是从分布回推清晰点的过程。先有这张画室台面的想象,后面讲调度曲线、讲条件注入,你才有地方安放它们。
把开篇的三个问题对号入座:
| 节号 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 1.1 生成式AI基础与图像数字化 | 生成式和判别式差在哪 | 分布采样直觉 + 图像数字化与潜在空间概念 |
| 1.2 核心生成模型范式对比 | 三套主线方案怎么 PK | GAN/VAE/扩散的对比矩阵与选型直觉 |
这里的划分很刻意:1.1 负责把"地面"铺平——先说什么是分布、什么是采样、图像在机器里是什么;1.2 才进入"路线之争",把三套主流范式拿出来对质。这样你读第二章时,手里既有概念工具,又有范式坐标,不至于在 DDPM 的公式里迷路。
读完后你的手电就照亮了第二章的门口。第二章会沿着本章"扩散范式"这条支线,把"先加噪、再去噪"展开成马尔可夫链、噪声调度公式、反向去噪网络与训练目标。这一章欠你的每一块拼图,都会在第二章里严丝合缝地嵌回来;而你在本章建立的范式坐标,也将成为第四、五、六章做方案对比时反复调用的一把尺子。
同时,这一章也在教你一种"不被某个模型吓住"的眼光:当别人炫耀某张惊艳的图时,你能在脑子里快速把它归位到"哦,这是一个扩散/GAN/VAE 系的存在",并大致说得出它靠的是哪套配方的强项。这种把热闹还原成本质的能力,是第一层地基真正要交付给你的东西——它不像给出一串术语那么炫,却能让你在后续几十节里每一步都踩得踏实。