8.5 SOTA 前沿速览
本节速览多模态生成与 Agent 方向的当代 SOTA。这些模型代表了 2024-2026 多模态技术的最前沿。
一、生成模型全景
下面逐一速览。
二、文生图 SOTA
Stable Diffusion 3(SD3)
Stability AI 在 2024 年发布的 SD3 引入几项关键创新:
创新一:MMDiT 架构
SD3 用 MMDiT(Multimodal Diffusion Transformer) 替代 U-Net:
- 双流 Transformer:分别处理图像 token 与文本 token
- 通过注意力让两种模态深度交互
- 扩展性优于 U-Net
创新二:多模态文本编码器
组合三个文本编码器:
- CLIP ViT-L
- OpenCLIP ViT-bigG
- T5-XXL(提供长文本理解)
三个编码器互补,让 SD3 对复杂 prompt 理解更深。
创新三:改进的文字渲染
SD3 在画面中的文字(招牌、海报)渲染显著改善,是文生图模型的重要突破。
FLUX(Black Forest Labs)
由原 SD 团队成员创立的 Black Forest Labs 在 2024 年发布:
- DiT 架构:纯 Transformer,扩展性强
- 开源:FLUX.1-dev、FLUX.1-schnell 等多个版本
- 质量:达到甚至超过 SD3
- 速度:FLUX.1-schnell 只需 4 步即可生成
FLUX 的发布让开源文生图达到新高度,被认为是 SD 系列的精神继承者。
DALL-E 3(OpenAI)
DALL-E 3 的最大创新不在生成模型,而在用 GPT-4 重写 prompt:
用户简短 prompt → GPT-4 扩展为详细描述 → Diffusion 生成
这种「LLM + Diffusion」组合让 DALL-E 3 在 prompt 理解上远超同期模型。架构细节未公开。
Midjourney v6
Midjourney 走「美学优先」路线:
- 强调艺术风格
- 注重画面美感
- 闭源、订阅制
- 在创意工作者社区极受欢迎
Imagen 3(Google)
Google 的 Imagen 系列用超大 T5 文本编码器:
- T5-XXL(11B 参数)提供极强文本理解
- 在长 prompt、复杂 prompt 上表现优异
- 闭源
三、文生视频 SOTA
Sora(OpenAI)
第8.3 节已详细介绍 Sora 的 DiT 架构。其核心地位:
- 引领了 DiT 视频生成路线
- 60 秒长视频一致性
- 物理模拟接近真实
- 完全闭源,仅通过 ChatGPT 等产品使用
Runway Gen-3
Runway 是商业化最早的视频生成公司,Gen-3 Alpha 在 Sora 之后发布:
- 高质量视频生成
- 强调可控性(镜头运动、风格迁移)
- 提供完整的视频编辑工具链
- 闭源、订阅制
Pika
Pika Labs 的视频生成模型:
- 注重创意与风格化
- 用户友好的编辑界面
- Lip Sync(口型同步)等特色功能
- 在社交媒体内容创作中受欢迎
Kling(快手可灵)
国内视频生成的代表:
- 长视频能力(最长 2 分钟)
- 中文场景优化
- 物理模拟质量接近 Sora
- 国内可用,是中文用户的主要选择
Vidu(生数科技)
中国清华系创业公司:
- 基于 U-ViT 架构(U-Net 与 ViT 的混合)
- 长视频一致性
- 部分开源
Stable Video Diffusion
Stability AI 的开源视频模型:
- 基于 U-Net
- 短视频(4-10 秒)
- 质量不如 DiT 系,但开源可用
Open-Sora / Open-Sora-Plan
开源社区对 Sora 的复现:
- 用 DiT 架构
- 模型规模较小
- 验证了 Sora 路线的可行性
- 让小团队也能研究视频生成
四、图生视频(Image-to-Video)
图生视频让一张静态图「动起来」:
输入: 一张静态照片
输出: 一段动态视频
代表:
- Runway Frame Interpolation
- Pika 的图生视频
- Sora 的图生视频模式
- Stable Video Diffusion 的 SVD-XT
应用:
五、统一多模态生成 SOTA
GPT-4o
OpenAI 的 GPT-4o 支持图像生成(与文本、语音统一):
Gemini 2.x
Google 的 Gemini 系列:
- 原生支持图像生成(结合 Imagen)
- 视频理解与生成
- 长上下文处理整部电影
Meta 的 Chameleon 探索「任意模态到任意模态」:
- 图像、文本统一 token
- 端到端早期融合
- 实验性但代表未来方向
Anole
任意模态生成的开源尝试。
六、Agent 与具身智能 SOTA
Computer Use(Anthropic)
让 Claude 直接操作电脑:
Operator(OpenAI)
OpenAI 的 GUI Agent,类似的浏览器/操作系统自动化能力。
Copilot Vision(微软)
集成在 Copilot 中的视觉 Agent:
- 看用户屏幕
- 提供实时建议
- Office 全家桶集成
PaLM-E / RT-2(Google)
具身智能的代表作:
- LLM 直接输出机器人动作 token
- 长 horizon 任务规划
- 多种机器人平台
Mobile ALOHA(斯坦福)
双臂机器人操作系统:
- 模仿学习
- 复杂家庭任务(做饭、清洁)
- 全开源硬件设计
OpenVLA
开源的视觉-语言-动作模型:
- 让开源社区也能研究具身智能
- 7B 参数规模
- 支持多种机器人平台
###特斯拉 Optimus
人形机器人:
- 端到端神经网络控制
- 视觉感知 + 动作生成
- 商业化潜力大
七、当代生成模型对比
文生图对比
| 模型 |
架构 |
文本编码器 |
开源 |
强项 |
| SD3 |
MMDiT |
CLIP+OpenCLIP+T5 |
是 |
文字渲染 |
| FLUX |
DiT |
T5+CLIP |
是 |
质量、速度 |
| DALL-E 3 |
未公开 |
GPT-4 重写 |
否 |
prompt 理解 |
| Midjourney v6 |
未公开 |
未公开 |
否 |
美学 |
| Imagen 3 |
未公开 |
T5-XXL |
否 |
长文本 |
文生视频对比
| 模型 |
架构 |
时长 |
开源 |
强项 |
| Sora |
DiT |
60s |
否 |
综合 |
| Runway Gen-3 |
未公开 |
10s |
否 |
可控 |
| Pika |
未公开 |
5s |
否 |
创意 |
| Kling |
未公开 |
120s |
否 |
中文、长视频 |
| Vidu |
U-ViT |
8s |
部分 |
开源 |
| Open-Sora |
DiT |
5s |
是 |
复现 Sora |
八、生成模型的演化趋势
观察 SOTA,生成模型的演化方向:
趋势一:从 U-Net 到 DiT
DiT(Diffusion Transformer)正在取代 U-Net:
- 更好的扩展性
- 与 LLM 架构统一
- SD3、FLUX、Sora 都用 DiT
趋势二:从单一模型到 LLM + Diffusion 组合
LLM 提供 prompt 理解,Diffusion 提供生成:
- DALL-E 3:GPT-4 + Diffusion
- Sora:GPT 重写 prompt + DiT
- 这种组合让 prompt 理解大幅提升
趋势三:从静态到时序
视频生成从短视频走向长视频,从单镜头走向多镜头,从无音频走向带音频。
趋势四:从闭源到部分开源
SD、FLUX、Open-Sora 等让开源生态保持活力,但闭源(Sora、DALL-E 3、Midjourney)仍在质量上领先。
趋势五:从生成到可控生成
用户希望精确控制生成结果:
- ControlNet:用边缘、姿态控制
- LoRA:个性化风格
- IP-Adapter:身份保持
- 视频镜头控制
九、生成模型的应用现状
商业化最活跃的领域
- 创意设计:广告、海报、插画
- 电商:商品图、虚拟模特
- 影视:特效、概念图
- 社交媒体:短视频、表情包
- 教育:教学插图、可视化
- 游戏:素材、概念设计
商业模式
- 订阅制:Midjourney、Runway、Pika
- API 调用:DALL-E 3 API、Stability API
- 开源 + 服务:FLUX 开源 + Replicate 等托管
- 集成产品:Copilot、Adobe Firefly
十、对未来研究的启示
生成模型的演化给我们的启示:
- Transformer 是通用算子——DiT 证明了 Transformer 也能做 Diffusion 主干
- LLM 是 prompt 理解的关键——单纯 Diffusion 不够,需要 LLM 配合
- 数据是核心壁垒——闭源模型的数据优势难以撼动
- 开源与闭源并存——开源让技术民主化,闭源推动商业创新
- 可控性是下一个战场——不只是生成,而是精确控制生成
十一、生成模型的伦理挑战
随着生成模型质量提升,伦理挑战加剧:
问题一:Deepfake
生成虚假名人视频、政治人物视频用于欺诈或操纵。
问题二:版权
训练数据是否合法?生成内容版权归谁?
问题三:偏见
模型可能强化性别、种族、文化偏见。
问题四:就业冲击
设计师、插画师等职业受到冲击。
问题五:真实性危机
「眼见为实」不再成立,社会需要新的信任机制。
OpenAI、Google、Stability 等公司都在研究水印、检测、内容溯源等技术应对这些问题。
十二、生成模型的未来
未来 5-10 年的生成模型可能:
- 更长:从分钟级到小时级(整部电影)
- 更可控:精确控制每个细节
- 更交互:实时生成、用户参与
- 更真实:物理模拟更准确
- 更统一:与理解模型融合,成为通用多模态模型
这些发展将深刻改变创意、娱乐、教育等多个产业。
小结
当代多模态生成以 Stable Diffusion 3、FLUX、Sora、Runway 等为代表,DiT 架构正在取代 U-Net,LLM + Diffusion 组合提升 prompt 理解。文生图已商业化成熟,文生视频仍在快速演进。Agent 与具身智能(Computer Use、PaLM-E、Mobile ALOHA)代表了多模态大模型的最高阶应用。生成模型带来深远的伦理挑战,需要技术与社会的协同应对。
第8章到此结束。下一章(第9章)我们将总结整份教程并展望多模态大模型的未来。