第8章 前沿应用与生成 章节摘要 经过前七章的逐层铺垫——视觉编码器、文本编码器、对比对齐、跨模态融合、预训练任务、指令微调与对齐——我们终于拥有了能看懂图像、听懂指令、按人类偏好回答的多模态大模型(MLLM)。本章把这些技术能力落地到具体应用,覆盖四大方向:视觉问答(VQA)与图像理解,看模型如何回答关于图像的开放性问题;文生图(Text-to-Image),看 Stable Diffusion、DALL-E、FLUX 等如何用 Diffusion + LLM 把文字变成图像;文生视频(Text-to-Video),看 Sora 范式如何用 DiT(Diffusion Transformer)生成长达一分钟的高质量视频;
经过前七章的逐层铺垫——视觉编码器、文本编码器、对比对齐、跨模态融合、预训练任务、指令微调与对齐——我们终于拥有了能看懂图像、听懂指令、按人类偏好回答的多模态大模型(MLLM)。本章把这些技术能力落地到具体应用,覆盖四大方向:视觉问答(VQA)与图像理解,看模型如何回答关于图像的开放性问题;文生图(Text-to-Image),看 Stable Diffusion、DALL-E、FLUX 等如何用 Diffusion + LLM 把文字变成图像;文生视频(Text-to-Video),看 Sora 范式如何用 DiT(Diffusion Transformer)生成长达一分钟的高质量视频;多模态 Agent 与具身智能,看模型如何作为决策中枢调用工具、操作界面、控制机器人。我们会用 SVG 与 Mermaid 图分别刻画 Diffusion + LLM 架构、Sora 的 DiT 架构、Agent 工作流。章末提供 Sora、Stable Diffusion 3、FLUX、Pika、Runway 等生成模型的 SOTA 速览。掌握本章后,你将理解多模态大模型不只是「能聊天的助手」,而是正在重塑创意、内容、自动化等多个产业的通用智能底座。
完成本章后,你应当能够:
本章共 6 个子节,按「理解 → 静态生成 → 动态生成 → 自主行动 → 前沿」的逻辑展开:
子节之间是「理解(8.1)→ 单帧生成(8.2)→ 时序生成(8.3)→ 自主行动(8.4)」的递进,每一节都比前一节更复杂、更接近通用智能。
前置知识:
后续衔接:
本章是整份教程的应用高潮——前面七章的所有理论,最终在这里变成可以触摸的产品。