8.5 SOTA 前沿速览 本节速览多模态生成与 Agent 方向的当代 SOTA。这些模型代表了 2024-2026 多模态技术的最前沿。 一、生成模型全景 下面逐一速览。 二、文生图 SOTA Stable Diffusion 3(SD3) Stability AI 在 2024 年发布的 SD3 引入几项关键创新: 创新一:MMDiT 架构 SD3 用 MMDiT(Multimodal Diffusion Transformer) 替代 U-Net: 双流 Transformer:分别处理图像 token 与文本 token 通过注意力让两种模态深度交互 扩展性优于 U-Net 创新二:多模态文本编码器 组合三个文本编码器: CLIP ViT-L OpenCLIP ViT-bigG
本节速览多模态生成与 Agent 方向的当代 SOTA。这些模型代表了 2024-2026 多模态技术的最前沿。
下面逐一速览。
Stability AI 在 2024 年发布的 SD3 引入几项关键创新:
SD3 用 MMDiT(Multimodal Diffusion Transformer) 替代 U-Net:
组合三个文本编码器:
三个编码器互补,让 SD3 对复杂 prompt 理解更深。
SD3 在画面中的文字(招牌、海报)渲染显著改善,是文生图模型的重要突破。
由原 SD 团队成员创立的 Black Forest Labs 在 2024 年发布:
FLUX 的发布让开源文生图达到新高度,被认为是 SD 系列的精神继承者。
DALL-E 3 的最大创新不在生成模型,而在用 GPT-4 重写 prompt:
用户简短 prompt → GPT-4 扩展为详细描述 → Diffusion 生成
这种「LLM + Diffusion」组合让 DALL-E 3 在 prompt 理解上远超同期模型。架构细节未公开。
Midjourney 走「美学优先」路线:
Google 的 Imagen 系列用超大 T5 文本编码器:
第8.3 节已详细介绍 Sora 的 DiT 架构。其核心地位:
Runway 是商业化最早的视频生成公司,Gen-3 Alpha 在 Sora 之后发布:
Pika Labs 的视频生成模型:
国内视频生成的代表:
中国清华系创业公司:
Stability AI 的开源视频模型:
开源社区对 Sora 的复现:
图生视频让一张静态图「动起来」:
输入: 一张静态照片 输出: 一段动态视频
代表:
应用:
OpenAI 的 GPT-4o 支持图像生成(与文本、语音统一):
Google 的 Gemini 系列:
Meta 的 Chameleon 探索「任意模态到任意模态」:
任意模态生成的开源尝试。
让 Claude 直接操作电脑:
OpenAI 的 GUI Agent,类似的浏览器/操作系统自动化能力。
集成在 Copilot 中的视觉 Agent:
具身智能的代表作:
双臂机器人操作系统:
开源的视觉-语言-动作模型:
###特斯拉 Optimus
人形机器人:
| 模型 | 架构 | 文本编码器 | 开源 | 强项 |
|---|---|---|---|---|
| SD3 | MMDiT | CLIP+OpenCLIP+T5 | 是 | 文字渲染 |
| FLUX | DiT | T5+CLIP | 是 | 质量、速度 |
| DALL-E 3 | 未公开 | GPT-4 重写 | 否 | prompt 理解 |
| Midjourney v6 | 未公开 | 未公开 | 否 | 美学 |
| Imagen 3 | 未公开 | T5-XXL | 否 | 长文本 |
| 模型 | 架构 | 时长 | 开源 | 强项 |
|---|---|---|---|---|
| Sora | DiT | 60s | 否 | 综合 |
| Runway Gen-3 | 未公开 | 10s | 否 | 可控 |
| Pika | 未公开 | 5s | 否 | 创意 |
| Kling | 未公开 | 120s | 否 | 中文、长视频 |
| Vidu | U-ViT | 8s | 部分 | 开源 |
| Open-Sora | DiT | 5s | 是 | 复现 Sora |
观察 SOTA,生成模型的演化方向:
DiT(Diffusion Transformer)正在取代 U-Net:
LLM 提供 prompt 理解,Diffusion 提供生成:
视频生成从短视频走向长视频,从单镜头走向多镜头,从无音频走向带音频。
SD、FLUX、Open-Sora 等让开源生态保持活力,但闭源(Sora、DALL-E 3、Midjourney)仍在质量上领先。
用户希望精确控制生成结果:
生成模型的演化给我们的启示:
随着生成模型质量提升,伦理挑战加剧:
生成虚假名人视频、政治人物视频用于欺诈或操纵。
训练数据是否合法?生成内容版权归谁?
模型可能强化性别、种族、文化偏见。
设计师、插画师等职业受到冲击。
「眼见为实」不再成立,社会需要新的信任机制。
OpenAI、Google、Stability 等公司都在研究水印、检测、内容溯源等技术应对这些问题。
未来 5-10 年的生成模型可能:
这些发展将深刻改变创意、娱乐、教育等多个产业。
当代多模态生成以 Stable Diffusion 3、FLUX、Sora、Runway 等为代表,DiT 架构正在取代 U-Net,LLM + Diffusion 组合提升 prompt 理解。文生图已商业化成熟,文生视频仍在快速演进。Agent 与具身智能(Computer Use、PaLM-E、Mobile ALOHA)代表了多模态大模型的最高阶应用。生成模型带来深远的伦理挑战,需要技术与社会的协同应对。
第8章到此结束。下一章(第9章)我们将总结整份教程并展望多模态大模型的未来。