8.5 SOTA 前沿速览


文档摘要

8.5 SOTA 前沿速览 本节速览多模态生成与 Agent 方向的当代 SOTA。这些模型代表了 2024-2026 多模态技术的最前沿。 一、生成模型全景 下面逐一速览。 二、文生图 SOTA Stable Diffusion 3(SD3) Stability AI 在 2024 年发布的 SD3 引入几项关键创新: 创新一:MMDiT 架构 SD3 用 MMDiT(Multimodal Diffusion Transformer) 替代 U-Net: 双流 Transformer:分别处理图像 token 与文本 token 通过注意力让两种模态深度交互 扩展性优于 U-Net 创新二:多模态文本编码器 组合三个文本编码器: CLIP ViT-L OpenCLIP ViT-bigG

8.5 SOTA 前沿速览

本节速览多模态生成与 Agent 方向的当代 SOTA。这些模型代表了 2024-2026 多模态技术的最前沿。

一、生成模型全景

下面逐一速览。

二、文生图 SOTA

Stable Diffusion 3(SD3)

Stability AI 在 2024 年发布的 SD3 引入几项关键创新:

创新一:MMDiT 架构

SD3 用 MMDiT(Multimodal Diffusion Transformer) 替代 U-Net:

  • 双流 Transformer:分别处理图像 token 与文本 token
  • 通过注意力让两种模态深度交互
  • 扩展性优于 U-Net

创新二:多模态文本编码器

组合三个文本编码器:

  • CLIP ViT-L
  • OpenCLIP ViT-bigG
  • T5-XXL(提供长文本理解)

三个编码器互补,让 SD3 对复杂 prompt 理解更深。

创新三:改进的文字渲染

SD3 在画面中的文字(招牌、海报)渲染显著改善,是文生图模型的重要突破。

FLUX(Black Forest Labs)

由原 SD 团队成员创立的 Black Forest Labs 在 2024 年发布:

  • DiT 架构:纯 Transformer,扩展性强
  • 开源:FLUX.1-dev、FLUX.1-schnell 等多个版本
  • 质量:达到甚至超过 SD3
  • 速度:FLUX.1-schnell 只需 4 步即可生成

FLUX 的发布让开源文生图达到新高度,被认为是 SD 系列的精神继承者。

DALL-E 3(OpenAI)

DALL-E 3 的最大创新不在生成模型,而在用 GPT-4 重写 prompt

用户简短 prompt → GPT-4 扩展为详细描述 → Diffusion 生成

这种「LLM + Diffusion」组合让 DALL-E 3 在 prompt 理解上远超同期模型。架构细节未公开。

Midjourney v6

Midjourney 走「美学优先」路线:

  • 强调艺术风格
  • 注重画面美感
  • 闭源、订阅制
  • 在创意工作者社区极受欢迎

Imagen 3(Google)

Google 的 Imagen 系列用超大 T5 文本编码器

  • T5-XXL(11B 参数)提供极强文本理解
  • 在长 prompt、复杂 prompt 上表现优异
  • 闭源

三、文生视频 SOTA

Sora(OpenAI)

第8.3 节已详细介绍 Sora 的 DiT 架构。其核心地位:

  • 引领了 DiT 视频生成路线
  • 60 秒长视频一致性
  • 物理模拟接近真实
  • 完全闭源,仅通过 ChatGPT 等产品使用

Runway Gen-3

Runway 是商业化最早的视频生成公司,Gen-3 Alpha 在 Sora 之后发布:

  • 高质量视频生成
  • 强调可控性(镜头运动、风格迁移)
  • 提供完整的视频编辑工具链
  • 闭源、订阅制

Pika

Pika Labs 的视频生成模型:

  • 注重创意与风格化
  • 用户友好的编辑界面
  • Lip Sync(口型同步)等特色功能
  • 在社交媒体内容创作中受欢迎

Kling(快手可灵)

国内视频生成的代表:

  • 长视频能力(最长 2 分钟)
  • 中文场景优化
  • 物理模拟质量接近 Sora
  • 国内可用,是中文用户的主要选择

Vidu(生数科技)

中国清华系创业公司:

  • 基于 U-ViT 架构(U-Net 与 ViT 的混合)
  • 长视频一致性
  • 部分开源

Stable Video Diffusion

Stability AI 的开源视频模型:

  • 基于 U-Net
  • 短视频(4-10 秒)
  • 质量不如 DiT 系,但开源可用

Open-Sora / Open-Sora-Plan

开源社区对 Sora 的复现:

  • 用 DiT 架构
  • 模型规模较小
  • 验证了 Sora 路线的可行性
  • 让小团队也能研究视频生成

四、图生视频(Image-to-Video)

图生视频让一张静态图「动起来」:

输入: 一张静态照片 输出: 一段动态视频

代表:

  • Runway Frame Interpolation
  • Pika 的图生视频
  • Sora 的图生视频模式
  • Stable Video Diffusion 的 SVD-XT

应用:

  • 老照片动画化
  • 产品图动态展示
  • 创意艺术

五、统一多模态生成 SOTA

GPT-4o

OpenAI 的 GPT-4o 支持图像生成(与文本、语音统一):

  • 原生多模态输出
  • 图文混合创作
  • 实时交互

Gemini 2.x

Google 的 Gemini 系列:

  • 原生支持图像生成(结合 Imagen)
  • 视频理解与生成
  • 长上下文处理整部电影

Chameleon(Meta)

Meta 的 Chameleon 探索「任意模态到任意模态」:

  • 图像、文本统一 token
  • 端到端早期融合
  • 实验性但代表未来方向

Anole

任意模态生成的开源尝试。

六、Agent 与具身智能 SOTA

Computer Use(Anthropic)

让 Claude 直接操作电脑:

  • 截屏看界面
  • 鼠标键盘控制
  • 完成复杂 GUI 任务

Operator(OpenAI)

OpenAI 的 GUI Agent,类似的浏览器/操作系统自动化能力。

Copilot Vision(微软)

集成在 Copilot 中的视觉 Agent:

  • 看用户屏幕
  • 提供实时建议
  • Office 全家桶集成

PaLM-E / RT-2(Google)

具身智能的代表作:

  • LLM 直接输出机器人动作 token
  • 长 horizon 任务规划
  • 多种机器人平台

Mobile ALOHA(斯坦福)

双臂机器人操作系统:

  • 模仿学习
  • 复杂家庭任务(做饭、清洁)
  • 全开源硬件设计

OpenVLA

开源的视觉-语言-动作模型:

  • 让开源社区也能研究具身智能
  • 7B 参数规模
  • 支持多种机器人平台

###特斯拉 Optimus

人形机器人:

  • 端到端神经网络控制
  • 视觉感知 + 动作生成
  • 商业化潜力大

七、当代生成模型对比

文生图对比

模型 架构 文本编码器 开源 强项
SD3 MMDiT CLIP+OpenCLIP+T5 文字渲染
FLUX DiT T5+CLIP 质量、速度
DALL-E 3 未公开 GPT-4 重写 prompt 理解
Midjourney v6 未公开 未公开 美学
Imagen 3 未公开 T5-XXL 长文本

文生视频对比

模型 架构 时长 开源 强项
Sora DiT 60s 综合
Runway Gen-3 未公开 10s 可控
Pika 未公开 5s 创意
Kling 未公开 120s 中文、长视频
Vidu U-ViT 8s 部分 开源
Open-Sora DiT 5s 复现 Sora

八、生成模型的演化趋势

观察 SOTA,生成模型的演化方向:

趋势一:从 U-Net 到 DiT

DiT(Diffusion Transformer)正在取代 U-Net:

  • 更好的扩展性
  • 与 LLM 架构统一
  • SD3、FLUX、Sora 都用 DiT

趋势二:从单一模型到 LLM + Diffusion 组合

LLM 提供 prompt 理解,Diffusion 提供生成:

  • DALL-E 3:GPT-4 + Diffusion
  • Sora:GPT 重写 prompt + DiT
  • 这种组合让 prompt 理解大幅提升

趋势三:从静态到时序

视频生成从短视频走向长视频,从单镜头走向多镜头,从无音频走向带音频。

趋势四:从闭源到部分开源

SD、FLUX、Open-Sora 等让开源生态保持活力,但闭源(Sora、DALL-E 3、Midjourney)仍在质量上领先。

趋势五:从生成到可控生成

用户希望精确控制生成结果:

  • ControlNet:用边缘、姿态控制
  • LoRA:个性化风格
  • IP-Adapter:身份保持
  • 视频镜头控制

九、生成模型的应用现状

商业化最活跃的领域

  1. 创意设计:广告、海报、插画
  2. 电商:商品图、虚拟模特
  3. 影视:特效、概念图
  4. 社交媒体:短视频、表情包
  5. 教育:教学插图、可视化
  6. 游戏:素材、概念设计

商业模式

  • 订阅制:Midjourney、Runway、Pika
  • API 调用:DALL-E 3 API、Stability API
  • 开源 + 服务:FLUX 开源 + Replicate 等托管
  • 集成产品:Copilot、Adobe Firefly

十、对未来研究的启示

生成模型的演化给我们的启示:

  1. Transformer 是通用算子——DiT 证明了 Transformer 也能做 Diffusion 主干
  2. LLM 是 prompt 理解的关键——单纯 Diffusion 不够,需要 LLM 配合
  3. 数据是核心壁垒——闭源模型的数据优势难以撼动
  4. 开源与闭源并存——开源让技术民主化,闭源推动商业创新
  5. 可控性是下一个战场——不只是生成,而是精确控制生成

十一、生成模型的伦理挑战

随着生成模型质量提升,伦理挑战加剧:

问题一:Deepfake

生成虚假名人视频、政治人物视频用于欺诈或操纵。

问题二:版权

训练数据是否合法?生成内容版权归谁?

问题三:偏见

模型可能强化性别、种族、文化偏见。

问题四:就业冲击

设计师、插画师等职业受到冲击。

问题五:真实性危机

「眼见为实」不再成立,社会需要新的信任机制。

OpenAI、Google、Stability 等公司都在研究水印、检测、内容溯源等技术应对这些问题。

十二、生成模型的未来

未来 5-10 年的生成模型可能:

  1. 更长:从分钟级到小时级(整部电影)
  2. 更可控:精确控制每个细节
  3. 更交互:实时生成、用户参与
  4. 更真实:物理模拟更准确
  5. 更统一:与理解模型融合,成为通用多模态模型

这些发展将深刻改变创意、娱乐、教育等多个产业。

小结

当代多模态生成以 Stable Diffusion 3、FLUX、Sora、Runway 等为代表,DiT 架构正在取代 U-Net,LLM + Diffusion 组合提升 prompt 理解。文生图已商业化成熟,文生视频仍在快速演进。Agent 与具身智能(Computer Use、PaLM-E、Mobile ALOHA)代表了多模态大模型的最高阶应用。生成模型带来深远的伦理挑战,需要技术与社会的协同应对。

第8章到此结束。下一章(第9章)我们将总结整份教程并展望多模态大模型的未来。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U