CLIP模型:图像-文本对齐BLIP模型:图像描述生成VQA模型:视觉问答
Whisper:OpenAI语音识别SpeechT5:微软TTS合成Wav2Vec:语音特征提取
使用BLIP自动生成图片描述。
模态识别 → 特征提取 → 特征融合 → 任务执行 → 输出生成
FastAPI + Docker容器化,提供REST API。
智能客服、内容审核、教育培训、医疗诊断、电商搜索