灏天文库

CLIP·让模型看懂图也读懂字

作者: 灏天 · 收录于 AI与大模型

内容摘要

 CLIP·让模型看懂图也读懂字 灏 灏天文库 · AI 与大模型 第 12 期 · 第二季连载 AI 与大模型 · 第 12 期 · 第二季第 4 期 CLIP, 让模型看懂图也读懂字 对比学习 · 图文对齐到同一空间 一句话结论: CLIP 把图和字塞进同一个向量空间 ,用对比学习拉近匹配的图文对、推开不匹配的。训练完,"一只猫的图"和"一只猫"的文字向量很近。这就是扩散模型能听懂"画猫"的基础——它靠 CLIP 的文本编码器理解条件。 ⏱ 约 9 分钟 🎯 想搞懂多模态对齐的人 📦 源:ai-engineering-from-scratch §13 01 反共识:不是分类,是对齐 传统视觉模型是"给图打标签"——1000 个固定类别。CLIP 不预设类别,它学的是"图和字的关系"。 训练时,一个 batch 拿 N 对(图,描述文字)。图过图像编码器得向量 I,字过文本编码器得向量 T。目标是:让 匹配的 Iᵢ 和 Tᵢ 余弦相似度大 ,不匹配的(Iᵢ 和 Tⱼ, i≠j)相似度小。这就是 InfoNCE 对比损失。

打开完整知识页 返回工坊集