8.3 文生视频架构:Sora 范式


文档摘要

8.3 文生视频架构:Sora 范式 文生视频(Text-to-Video, T2V)是文生图的时序扩展——输入一段文字,模型生成一段视频。2024 年 OpenAI 发布的 Sora 让这一领域达到新高度:能生成长达一分钟、内容连贯、物理合理的视频。本节梳理文生视频的核心技术,特别是 Sora 引入的 DiT(Diffusion Transformer) 架构。 一、文生视频的挑战 相比文生图,文生视频多了时序维度,难度成倍增加: 挑战一:时序一致性 视频中同一物体在不同帧之间应该保持一致: 模型必须记住前面的帧,才能保持一致。 挑战二:运动合理性 物体的运动要符合物理规律: 球下落应加速 水流应向下 人物行走应有规律步态 不合理的运动会显得「假」。

8.3 文生视频架构:Sora 范式

文生视频(Text-to-Video, T2V)是文生图的时序扩展——输入一段文字,模型生成一段视频。2024 年 OpenAI 发布的 Sora 让这一领域达到新高度:能生成长达一分钟、内容连贯、物理合理的视频。本节梳理文生视频的核心技术,特别是 Sora 引入的 DiT(Diffusion Transformer) 架构。

一、文生视频的挑战

相比文生图,文生视频多了时序维度,难度成倍增加:

挑战一:时序一致性

视频中同一物体在不同帧之间应该保持一致:

第 1 帧: 一只橘色的猫 第 2 帧: 同一只橘色的猫(不能变成黑色) ... 第 60 帧: 同一只橘色的猫

模型必须记住前面的帧,才能保持一致。

挑战二:运动合理性

物体的运动要符合物理规律:

  • 球下落应加速
  • 水流应向下
  • 人物行走应有规律步态

不合理的运动会显得「假」。

挑战三:长视频

短视频(5-10 秒)相对容易,长视频(1 分钟以上)需要模型保持长期一致。早期模型多生成 2-4 秒,Sora 把时长推到 60 秒。

挑战四:计算成本

视频数据量是图像的几十倍:

  • 1 张 512×512 图像:~786K 像素
  • 1 秒 30fps 的 512×512 视频:~23M 像素(30 倍)

训练与推理的计算成本极高。

二、文生视频的早期路线

路线一:基于图像 Diffusion + 时序模块

把文生图模型扩展到视频:

文本 → 文本编码器 → 条件 ↓ 噪声视频帧 → U-Net + 时序注意力 → 去噪视频

在 U-Net 中加入时序注意力层(Temporal Attention),让不同帧之间能通信。

代表:Make-A-Video、Imagen Video、AnimateDiff。

特点:

  • 短视频(2-10 秒)效果好
  • 长视频一致性差
  • 计算量大

路线二:自回归视频生成

把视频当成 token 序列,用类似 LLM 的方式自回归生成:

[文本] + [视频 token 1] → 预测 [视频 token 2] [文本] + [视频 token 1, 2] → 预测 [视频 token 3] ...

代表:VideoGPT、TATS。

特点:

  • 时序一致性好(自回归天然有记忆)
  • 生成慢(逐 token)
  • 质量不如 Diffusion

路线三:Latent Video Diffusion

把 Latent Diffusion 扩展到视频。这是 Sora 之前的主流。

代表:Stable Video Diffusion、ModelScope。

特点:

  • 用 VAE 把视频压缩到潜在空间
  • 在潜在空间做时序 Diffusion
  • 平衡质量与计算

三、Sora 的革命:DiT 架构

OpenAI 在 2024 年 2 月发布的 Sora 引入了**DiT(Diffusion Transformer)**架构,把视频生成推向新高度。

DiT 的核心思想:用 Transformer 替代 U-Net

传统 Diffusion 用 U-Net(基于 CNN)做去噪。DiT 用纯 Transformer

DiT 的核心论点:Transformer 的扩展性(Scaling)比 CNN 更好——堆更多参数、更多数据,效果持续提升,没有饱和。

Sora 的完整架构

Spatiotemporal Patches:视频的 token 化

Sora 借鉴 ViT 的「图像切 patch」思想,把视频切成时空 patch

一段视频: T × H × W × C (时间 × 高 × 宽 × 通道) ↓ 切成 patch 时空 token 序列: N 个 (P_t × P_h × P_w × C) 的 patch

每个 patch 是一个小的时空立方体(如 4 帧 × 8×8 像素)。这种 token 化让 Transformer 能处理任意分辨率、任意时长的视频。

DiT 主干

Sora 的 DiT 主干是一个大型 Transformer

  • 输入:时空 token 序列 + 文本条件 + 时间步
  • 处理:多层 Self-Attention + Cross-Attention(接收文本)
  • 输出:每个 token 的去噪结果

通过堆叠大量层(推测数十到上百层)和参数(推测数十亿),Sora 学到了视频的时空规律

三个关键技术

技术一:原生任意分辨率与时长

Sora 不固定输入分辨率或时长——支持横屏、竖屏、不同分辨率、不同时长。这得益于 spatiotemporal patches 的灵活性。

技术二:GPT 重写 prompt

用 GPT-4 把用户的简短 prompt 扩展为详细描述:

用户: "一只猫在窗台" GPT 扩展: "一只毛茸茸的橘色猫坐在木质窗台上,窗外是下午的阳光,可以看到远处的树木,猫的尾巴轻轻摆动,眼睛半闭着显得很放松..."

详细 prompt 让模型生成更精准的视频。

技术三:大规模训练数据

OpenAI 训练 Sora 用了未公开的海量视频数据(推测数百万小时视频)。数据规模是 Sora 效果的关键。

四、Sora 的能力与意义

Sora 在多个方面超越了之前的视频生成模型:

能力一:长视频一致性

60 秒视频中,物体、场景、风格保持高度一致:

  • 同一只猫的形态不变
  • 同一场景的光影连贯
  • 故事情节有逻辑

能力二:物理模拟

Sora 能模拟简单物理:

  • 物体下落
  • 反弹
  • 阴影变化
  • 流体运动

虽然不完美,但远超之前所有模型。

能力三:复杂场景

Sora 能生成多物体、多场景的复杂视频:

  • 城市街道的人群
  • 自然风景的动物
  • 抽象艺术动画

能力四:文字渲染

相比早期视频模型,Sora 在视频中的文字渲染显著改善(招牌、字幕等)。

Sora 的意义

Sora 不仅是技术突破,更引发了关于「世界模型」的讨论:

  • Sora 是否真的「理解」物理世界?
  • 还是只是从大量数据中学到统计模式

这一问题至今没有定论,但 Sora 展示了用 Transformer 学习世界动态的可能性。

五、Sora 之后的视频生成生态

Sora 发布后,多家公司推出了自己的视频生成模型:

Runway Gen-3

  • 闭源
  • 高质量视频
  • 商业化最早的视频生成产品之一

Pika

  • 闭源
  • 注重创意风格
  • 用户友好的编辑功能

Kling(快手)

  • 国内代表
  • 长视频能力突出
  • 中文场景优化

Vidu(生数科技)

  • 国产开源路线
  • 基于 U-ViT 架构

Open-Sora、Open-Sora-Plan

  • 开源社区对 Sora 的复现
  • 模型规模较小,但验证了 DiT 路线可行性

Stable Video Diffusion

  • Stability AI 的开源视频模型
  • 基于 U-Net,质量不如 DiT

六、文生视频的核心技术细节

时序注意力(Temporal Attention)

无论是 U-Net 还是 DiT,处理视频都需要时序注意力——让不同帧的同一位置能通信:

帧 1 的 patch A ←→ 帧 2 的 patch A ←→ 帧 3 的 patch A

时序注意力让模型学到「同一物体在不同帧的变化」。

3D VAE

视频 VAE 把视频压缩到潜在空间:

  • 输入:T × H × W × C
  • 输出:T' × H' × W' × C'(T < T', H < H', W < W')

3D VAE 同时在时间与空间维度压缩,比 2D VAE 更高效。

帧率与时长控制

模型需要支持不同帧率(fps)与时长:

  • 短视频(4 秒):高质量
  • 中视频(10 秒):质量略降
  • 长视频(60 秒):需要时序一致性优化

Sora 通过 spatiotemporal patches 原生支持任意时长,是关键创新。

七、视频生成的应用

应用一:影视特效

  • 替代昂贵特效
  • 快速生成概念镜头
  • 风格化滤镜

应用二:广告与营销

  • 产品宣传视频
  • 个性化广告
  • 社交媒体内容

应用三:教育

  • 教学动画
  • 历史场景重现
  • 科学过程可视化

应用四:游戏

  • 过场动画
  • 资产生成
  • 程序化内容

应用五:个人创作

  • 短视频创作
  • 艺术表达
  • 故事讲述

八、视频生成的伦理挑战

视频生成带来更严峻的伦理问题:

问题一:Deepfake

生成以假乱真的视频,用于:

  • 政治操纵
  • 名人诽谤
  • 诈骗

问题二:版权

训练视频可能受版权保护(电影、电视节目)。

问题三:虚假信息

生成虚假新闻、虚假事件视频。

问题四:身份盗用

生成他人面部与声音的视频。

OpenAI 等公司在 Sora 发布时采取了分阶段开放策略,逐步扩大访问范围,并加水印标识 AI 生成内容。

九、视频生成的未来方向

方向一:更长视频

当前 60 秒已是顶尖水平,未来可能支持整部电影。

方向二:可控生成

用户精确控制视频中每个元素:

  • 指定演员、服装、动作
  • 控制镜头运动
  • 编辑特定帧

方向三:音频同步

生成视频时同时生成同步音频(对话、配乐、音效)。

方向四:3D 视频

生成可旋转视角的真 3D 视频(类似全息)。

方向五:交互式视频

让用户在视频中做选择,分支生成不同情节(类似互动电影)。

十、视频生成与多模态大模型的关系

视频生成模型(Sora 等)与多模态大模型(GPT-4V 等)虽然都是「多模态」,但属于不同技术路线:

维度 视频生成(Sora) 多模态大模型(GPT-4V)
输入 文本 图像 + 文本
输出 视频 文本
主干 DiT(Diffusion Transformer) LLM
训练目标 去噪 自回归 LM
关键能力 生成 理解与推理

但两者正在融合:

  • GPT-4o:能理解与生成多模态内容(含图像)
  • Gemini:原生支持视频理解与生成
  • 未来:可能统一为「任意模态到任意模态」的模型

这种融合是第9章展望的重要主题。

小结

文生视频的核心挑战是时序一致性与物理合理性。Sora 用 DiT(Diffusion Transformer)+ spatiotemporal patches + 大规模训练数据,把视频生成推向新高度。DiT 相比 U-Net 有更好的扩展性,是视频生成(也是图像生成)的未来方向。视频生成已应用于影视、广告、教育等领域,但带来 deepfake 等严峻伦理挑战。视频生成模型与多模态大模型(理解类)正在融合,未来可能走向统一的多模态模型。

下一节(8.4)我们看多模态大模型的最高阶应用——Agent 与具身智能,让模型不仅生成内容,还能自主行动。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U