8.3 文生视频架构:Sora 范式 文生视频(Text-to-Video, T2V)是文生图的时序扩展——输入一段文字,模型生成一段视频。2024 年 OpenAI 发布的 Sora 让这一领域达到新高度:能生成长达一分钟、内容连贯、物理合理的视频。本节梳理文生视频的核心技术,特别是 Sora 引入的 DiT(Diffusion Transformer) 架构。 一、文生视频的挑战 相比文生图,文生视频多了时序维度,难度成倍增加: 挑战一:时序一致性 视频中同一物体在不同帧之间应该保持一致: 模型必须记住前面的帧,才能保持一致。 挑战二:运动合理性 物体的运动要符合物理规律: 球下落应加速 水流应向下 人物行走应有规律步态 不合理的运动会显得「假」。
文生视频(Text-to-Video, T2V)是文生图的时序扩展——输入一段文字,模型生成一段视频。2024 年 OpenAI 发布的 Sora 让这一领域达到新高度:能生成长达一分钟、内容连贯、物理合理的视频。本节梳理文生视频的核心技术,特别是 Sora 引入的 DiT(Diffusion Transformer) 架构。
相比文生图,文生视频多了时序维度,难度成倍增加:
视频中同一物体在不同帧之间应该保持一致:
第 1 帧: 一只橘色的猫 第 2 帧: 同一只橘色的猫(不能变成黑色) ... 第 60 帧: 同一只橘色的猫
模型必须记住前面的帧,才能保持一致。
物体的运动要符合物理规律:
不合理的运动会显得「假」。
短视频(5-10 秒)相对容易,长视频(1 分钟以上)需要模型保持长期一致。早期模型多生成 2-4 秒,Sora 把时长推到 60 秒。
视频数据量是图像的几十倍:
训练与推理的计算成本极高。
把文生图模型扩展到视频:
文本 → 文本编码器 → 条件 ↓ 噪声视频帧 → U-Net + 时序注意力 → 去噪视频
在 U-Net 中加入时序注意力层(Temporal Attention),让不同帧之间能通信。
代表:Make-A-Video、Imagen Video、AnimateDiff。
特点:
把视频当成 token 序列,用类似 LLM 的方式自回归生成:
[文本] + [视频 token 1] → 预测 [视频 token 2] [文本] + [视频 token 1, 2] → 预测 [视频 token 3] ...
代表:VideoGPT、TATS。
特点:
把 Latent Diffusion 扩展到视频。这是 Sora 之前的主流。
代表:Stable Video Diffusion、ModelScope。
特点:
OpenAI 在 2024 年 2 月发布的 Sora 引入了**DiT(Diffusion Transformer)**架构,把视频生成推向新高度。
传统 Diffusion 用 U-Net(基于 CNN)做去噪。DiT 用纯 Transformer:
DiT 的核心论点:Transformer 的扩展性(Scaling)比 CNN 更好——堆更多参数、更多数据,效果持续提升,没有饱和。
Sora 借鉴 ViT 的「图像切 patch」思想,把视频切成时空 patch:
一段视频: T × H × W × C (时间 × 高 × 宽 × 通道) ↓ 切成 patch 时空 token 序列: N 个 (P_t × P_h × P_w × C) 的 patch
每个 patch 是一个小的时空立方体(如 4 帧 × 8×8 像素)。这种 token 化让 Transformer 能处理任意分辨率、任意时长的视频。
Sora 的 DiT 主干是一个大型 Transformer:
通过堆叠大量层(推测数十到上百层)和参数(推测数十亿),Sora 学到了视频的时空规律。
Sora 不固定输入分辨率或时长——支持横屏、竖屏、不同分辨率、不同时长。这得益于 spatiotemporal patches 的灵活性。
用 GPT-4 把用户的简短 prompt 扩展为详细描述:
用户: "一只猫在窗台" GPT 扩展: "一只毛茸茸的橘色猫坐在木质窗台上,窗外是下午的阳光,可以看到远处的树木,猫的尾巴轻轻摆动,眼睛半闭着显得很放松..."
详细 prompt 让模型生成更精准的视频。
OpenAI 训练 Sora 用了未公开的海量视频数据(推测数百万小时视频)。数据规模是 Sora 效果的关键。
Sora 在多个方面超越了之前的视频生成模型:
60 秒视频中,物体、场景、风格保持高度一致:
Sora 能模拟简单物理:
虽然不完美,但远超之前所有模型。
Sora 能生成多物体、多场景的复杂视频:
相比早期视频模型,Sora 在视频中的文字渲染显著改善(招牌、字幕等)。
Sora 不仅是技术突破,更引发了关于「世界模型」的讨论:
这一问题至今没有定论,但 Sora 展示了用 Transformer 学习世界动态的可能性。
Sora 发布后,多家公司推出了自己的视频生成模型:
无论是 U-Net 还是 DiT,处理视频都需要时序注意力——让不同帧的同一位置能通信:
帧 1 的 patch A ←→ 帧 2 的 patch A ←→ 帧 3 的 patch A
时序注意力让模型学到「同一物体在不同帧的变化」。
视频 VAE 把视频压缩到潜在空间:
3D VAE 同时在时间与空间维度压缩,比 2D VAE 更高效。
模型需要支持不同帧率(fps)与时长:
Sora 通过 spatiotemporal patches 原生支持任意时长,是关键创新。
视频生成带来更严峻的伦理问题:
生成以假乱真的视频,用于:
训练视频可能受版权保护(电影、电视节目)。
生成虚假新闻、虚假事件视频。
生成他人面部与声音的视频。
OpenAI 等公司在 Sora 发布时采取了分阶段开放策略,逐步扩大访问范围,并加水印标识 AI 生成内容。
当前 60 秒已是顶尖水平,未来可能支持整部电影。
用户精确控制视频中每个元素:
生成视频时同时生成同步音频(对话、配乐、音效)。
生成可旋转视角的真 3D 视频(类似全息)。
让用户在视频中做选择,分支生成不同情节(类似互动电影)。
视频生成模型(Sora 等)与多模态大模型(GPT-4V 等)虽然都是「多模态」,但属于不同技术路线:
| 维度 | 视频生成(Sora) | 多模态大模型(GPT-4V) |
|---|---|---|
| 输入 | 文本 | 图像 + 文本 |
| 输出 | 视频 | 文本 |
| 主干 | DiT(Diffusion Transformer) | LLM |
| 训练目标 | 去噪 | 自回归 LM |
| 关键能力 | 生成 | 理解与推理 |
但两者正在融合:
这种融合是第9章展望的重要主题。
文生视频的核心挑战是时序一致性与物理合理性。Sora 用 DiT(Diffusion Transformer)+ spatiotemporal patches + 大规模训练数据,把视频生成推向新高度。DiT 相比 U-Net 有更好的扩展性,是视频生成(也是图像生成)的未来方向。视频生成已应用于影视、广告、教育等领域,但带来 deepfake 等严峻伦理挑战。视频生成模型与多模态大模型(理解类)正在融合,未来可能走向统一的多模态模型。
下一节(8.4)我们看多模态大模型的最高阶应用——Agent 与具身智能,让模型不仅生成内容,还能自主行动。