源文件:chapter3/multimodal-agent/README.md 支持多种抽取技术的多模态 Agent 一个用于教学的 Agent 框架,在多个 AI 提供商(Gemini、OpenAI、豆包)之间对比不同的多模态内容抽取技术。 特性 三种抽取模式 原生多模态:直接使用模型自带的多模态能力进行处理 Gemini 2.5 Pro:文档(PDF)、图像、音频 GPT-5/GPT-4o:图像(OpenAI 多模态格式) 豆包 1.6:图像(OpenAI 多模态格式) 先抽取为文本:先把多模态内容转为文本,再处理 PDF:使用 Gemini 或 GPT-5 做 OCR 图像:使用 GPT-5 或豆包 1.