01 生成式AI图像技术概述


文档摘要

第 1 章 · 生成式AI图像技术概述 本章要回答的三个问题:生成式AI和传统的"识别/分类"AI到底差在哪,为什么它能凭空造图?图像生成与编辑是这两年才出现,还是有一条清晰的历史脉络?今天主流的生成模型(GAN、VAE、扩散)放在同一张桌子上的胜负手是什么? 为什么会有这一章 很多人第一次接触生成式AI,是先被结果唬住:输入一句话,出来一张几乎以假乱真的图。于是本能地把"会画画"当成一种神秘魔法,遇到更深的问题(为什么会崩、为什么有的模型快有的模型慢)就无从下手。这一章的使命是把这团浆糊摊开——先说生成式AI的数学身份是"学分布再采样",再讲这条路是从噪声到清晰的一套思路,然后横向摆出 GAN、VAE、扩散三类范式,让你在进入扩散细节之前,先拥有一张全图。

第 1 章 · 生成式AI图像技术概述

本章要回答的三个问题:生成式AI和传统的"识别/分类"AI到底差在哪,为什么它能凭空造图?图像生成与编辑是这两年才出现,还是有一条清晰的历史脉络?今天主流的生成模型(GAN、VAE、扩散)放在同一张桌子上的胜负手是什么?

为什么会有这一章

很多人第一次接触生成式AI,是先被结果唬住:输入一句话,出来一张几乎以假乱真的图。于是本能地把"会画画"当成一种神秘魔法,遇到更深的问题(为什么会崩、为什么有的模型快有的模型慢)就无从下手。这一章的使命是把这团浆糊摊开——先说生成式AI的数学身份是"学分布再采样",再讲这条路是从噪声到清晰的一套思路,然后横向摆出 GAN、VAE、扩散三类范式,让你在进入扩散细节之前,先拥有一张全图。你不能在没握过方向盘之前就冲进弯道;同理,也不建议在没建起范式坐标系之前就啃 DDPM 的公式。

本章开头定位:这是一套教程的第一层地基。第二章的扩散原理之所以能讲得顺,依赖你对"分布采样"与"噪声逐步清退"两个直觉有印象。我们全册反复用到的比喻——把画面当作一张被打满噪点、又被一口气一口气擦净的画稿——正是从这里的"分布采样"起步:噪声是分布里的随机点,去噪是从分布回推清晰点的过程。先有这张画室台面的想象,后面讲调度曲线、讲条件注入,你才有地方安放它们。

读完能解决什么

把开篇的三个问题对号入座:

  • 你会准确区分判别式与生成式模型,并能用"学分布再采样"一句话解释生成。
  • 你会把图像生成的历史梳理成 VAE、GAN、以扩散为代表的三个阶段,知道每个阶段解决了上一个阶段的哪个痛点。
  • 你会在同一次对话里说清 GAN 用对抗、VAE 用重构、扩散用"逐步去噪"三套配方各自主攻什么、各自短在哪。
  • 你会为本册后续章节备好关键词库:数据分布、潜在空间、采样、模式崩溃、噪声调度。

各节怎么分工

节号 回答哪个问题 关键产出
1.1 生成式AI基础与图像数字化 生成式和判别式差在哪 分布采样直觉 + 图像数字化与潜在空间概念
1.2 核心生成模型范式对比 三套主线方案怎么 PK GAN/VAE/扩散的对比矩阵与选型直觉

这里的划分很刻意:1.1 负责把"地面"铺平——先说什么是分布、什么是采样、图像在机器里是什么;1.2 才进入"路线之争",把三套主流范式拿出来对质。这样你读第二章时,手里既有概念工具,又有范式坐标,不至于在 DDPM 的公式里迷路。

先决条件

  • 对"神经网络做前向计算、输出一个结果"有一丝基本概念即可,不用会训练。
  • 会看图、能读懂折线——本章用到的调度曲线、对比表都属于这个层面。
  • 不要求任何代码功底;本章代码块只用于直观说明,可跳过不读。

往下走到哪

读完后你的手电就照亮了第二章的门口。第二章会沿着本章"扩散范式"这条支线,把"先加噪、再去噪"展开成马尔可夫链、噪声调度公式、反向去噪网络与训练目标。这一章欠你的每一块拼图,都会在第二章里严丝合缝地嵌回来;而你在本章建立的范式坐标,也将成为第四、五、六章做方案对比时反复调用的一把尺子。

同时,这一章也在教你一种"不被某个模型吓住"的眼光:当别人炫耀某张惊艳的图时,你能在脑子里快速把它归位到"哦,这是一个扩散/GAN/VAE 系的存在",并大致说得出它靠的是哪套配方的强项。这种把热闹还原成本质的能力,是第一层地基真正要交付给你的东西——它不像给出一串术语那么炫,却能让你在后续几十节里每一步都踩得踏实。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U