学习路线图 本页帮你快速找到最适合自己的阅读路径。教程整体围绕「多模态大模型的技术原理」展开,但不同背景的读者关注点不同,下面给出三种推荐路径。 一、前置知识自检 开始本教程前,建议你已具备以下基础: 必备基础 Python 编程基础,能读懂简单的张量运算伪代码 了解神经网络基本组件:全连接层、激活函数、损失函数、反向传播 理解梯度下降与模型训练流程(前向、损失、反向、更新) 强烈建议 接触过注意力机制(Attention)的概念,哪怕是直觉层面 听说过 BERT、GPT、ResNet 等代表性模型名称 用过 PyTorch 或 TensorFlow 跑过简单的训练脚本 如果以上某项完全不熟悉,可先花半天时间补齐对应基础,再回到本教程。
本页帮你快速找到最适合自己的阅读路径。教程整体围绕「多模态大模型的技术原理」展开,但不同背景的读者关注点不同,下面给出三种推荐路径。
开始本教程前,建议你已具备以下基础:
必备基础
强烈建议
如果以上某项完全不熟悉,可先花半天时间补齐对应基础,再回到本教程。第2章会系统回顾 Transformer,但默认读者对神经网络本身不陌生。
适合算法工程师、研究人员,目标是吃透原理、能复现或改造模型。
第1章 → 第2章 → 第3章 → 第4章 → 第5章 → 第6章 → 第7章 → 第8章 → 第9章
按章节顺序通读。第1、2章可能对你而言偏基础,但它们建立了后续章节的术语与符号体系,建议快速浏览即可。预计总阅读时间 10–14 小时。
适合应用开发者、产品工程师,目标是搞清楚多模态大模型能做什么、如何选型。
第1章(1.0、1.2、1.4)→ 第3章(3.0、3.2)→ 第5章(5.0、5.1、5.2) → 第7章(7.0、7.1、7.2)→ 第8章(全部)
跳过大部分数学推导,聚焦架构图与流程图。预计总阅读时间 5–7 小时。
适合已有经验、需要补特定模块的读者。
| 你想搞清楚 | 直接看 |
|---|---|
| CLIP 是怎么工作的 | 第4章 全章 |
| ViT 为什么用 patch | 第3章(3.2、3.3) |
| LLaVA 的视觉 token 怎么进 LLM | 第5章(5.1)+ 第7章(7.1、7.2) |
| 文生图的 Diffusion + LLM 怎么协作 | 第8章(8.2) |
| Sora 的视频生成架构 | 第8章(8.3) |
| RLHF / DPO 在多模态里怎么用 | 第7章(7.3、7.4) |
| 多模态 Agent 是什么 | 第8章(8.4) |
| 章节 | 路径 A 预估 | 路径 B 预估 |
|---|---|---|
| 第1章 导论 | 45 min | 15 min |
| 第2章 Transformer 基石 | 75 min | 略过 |
| 第3章 视觉编码器 | 90 min | 25 min |
| 第4章 对比学习对齐 | 90 min | 略过 |
| 第5章 跨模态融合 | 90 min | 30 min |
| 第6章 预训练范式 | 75 min | 略过 |
| 第7章 指令微调 | 75 min | 30 min |
| 第8章 应用与生成 | 120 min | 120 min |
| 第9章 总结展望 | 30 min | 20 min |
每章都在回答一个层层递进的问题:
如果你读完任何一章后,能用自己的话回答图里对应的问题,那这章就过关了。
教程中反复出现的核心术语(按首次出现章节排序):
更完整的术语表会随各章正文展开。