本节摘要:AI 与机器学习服务把"训练模型、部署模型、调用模型"这三件重活托管化:机器学习平台提供从数据准备到部署监控的全流程工具,预训练模型让你不必从零训练,NLP 与计算机视觉 API 让应用直接用上语言理解和图像识别能力。本节拆解"训练"与"推理"两个环节、四种接入方式的取舍,帮你判断自己的业务该从哪一层开始用 AI。
阅读完本节,你应当能够:
"让应用会识图、会说话"这件事,十年前意味着养一个算法团队、攒一台 GPU 集群、从头训练模型——门槛高到多数公司直接放弃。今天云厂商把这套流程拆成了现成的服务:想要图片识别,调一个 API 接口就能返回识别结果;想做一个专属推荐模型,平台给你备好训练环境;不想自己训练,直接用预训练模型微调。
为什么云能做到?因为训练模型的成本主要在"海量数据 + 大规模算力",而这两样恰好是云厂商的库存。它们把最贵的部分摊薄到无数用户身上,于是"用 AI"从"造引擎"变成了"买引擎、甚至租引擎"。本节要帮你搞清楚的,不是算法细节,而是"我该买哪一层服务"。
机器学习应用的生命周期分两段。训练(Training):用标注好的数据反复调整模型参数,让模型学会模式,这个过程吃 GPU、耗时以小时到天计。推理(Inference):训练好的模型上线,对真实请求做预测,这个过程要求低延迟、稳定、可扩展。
云上的机器学习平台,就是把这两段都托管掉:训练时给你按需的 GPU 资源,训练完自动部署成推理服务,推理服务根据流量自动扩容。你不再需要"买一台 GPU 机器放着吃灰"——按训练时长和推理用量付费,闲置即零成本。
用 AI 的路径从"省心"到"掌控"可以排成一条谱线:现成 API → 预训练模型微调 → 平台自训 → 自建集群。
现成 API(NLP、计算机视觉等):云厂商训练好的通用能力直接开放成接口。文本分类、翻译、情感分析、图像识别、OCR,调用即得,无需自己准备数据和算力。适合通用需求,价格低、上线快,但能力边界固定,无法深度定制。
预训练模型微调(Fine-tuning):拿大厂开源或开放的基础模型,用自己的业务数据再做少量训练,让模型"懂你的领域"。成本远低于从零训练,又能获得定制能力,是当前最主流的路线。适合有专属数据、需要领域化能力的场景。
平台自训:用机器学习平台从头训练自己的模型。适合有算法团队、业务数据独特、现成模型覆盖不了的场景。成本高、周期长,但掌控力最强。
自建集群:自己管理 GPU 集群。只在数据完全不能出内网、或对算力有极致要求时才值得考虑,运维负担最重。
自然语言处理(NLP)能力包括:文本分类、情感分析、机器翻译、语音识别、问答与对话。计算机视觉能力包括:图像分类、物体检测、人脸识别、OCR 文字识别、图像生成。云厂商把这些能力做成 API,让任何应用都能"用一行代码接入"曾经需要博士团队才能实现的智能。
| 方式 | 成本 | 定制能力 | 数据要求 | 适用场景 |
|---|---|---|---|---|
| 现成 API | 低 | 低 | 无 | 通用能力,快速验证 |
| 预训练微调 | 中 | 中高 | 有领域数据 | 领域专属模型 |
| 平台自训 | 高 | 高 | 大量标注数据 | 独有模型、算法团队 |
| 自建集群 | 最高 | 最高 | 大量数据 + 运维 | 数据不出内网、极致算力 |
⚠️ 常见坑:一上来就"要训练自己的大模型"。多数业务的需求是"识别图片里的产品"或"自动给工单分类",现成 API 或微调已经够用。自己从零训练,成本翻几倍,效果还不一定更好。先问"现成能力够不够",再考虑"要不要自己造"。
💡 关键直觉:AI 服务的接入层级选择,本质是"拿数据换定制,拿钱换省心"。数据越独特、越想要领域差异化,就越往下层走;只是想快速有智能能力,就从最上层开始。
一个 AI 项目值不值得做,先过三道评估:第一,问题是否真的适合用机器学习解决——是"规则能写清楚"还是"模式靠数据学"?规则清楚就别用 AI,快且稳。第二,有没有足够的数据——没有数据的 AI 是空中楼阁,先解决数据采集。第三,效果如何衡量——准确率、召回率、业务指标,没有度量标准,项目永远是"差不多"。三道评估都通过,再谈技术选型,顺序不能反。
模型上线不是终点。真实世界的输入会漂移(概念漂移),模型效果会随时间衰减,所以要持续监控推理效果、定期用新数据重训。云平台提供"模型版本管理、自动回滚、效果监控"这些 MLOps 能力,把"养模型"也变成一种可管理的服务。这和第 3 章讲的监控运维一脉相承——只不过监控对象从服务器换成了模型。
不是。机器学习平台是云平台之上的"应用层服务":它用云的计算、存储能力,包装出"训练、调参、部署、监控"的专用体验。可以理解成云厂商开了一间"AI 车间",机器(算力)、仓库(数据)、工具链都是现成的。
没有固定答案,取决于任务复杂度和基础模型质量。通常几百到几千条高质量标注数据就能让微调产生明显效果,远少于从零训练所需的几十万条。关键不是数量而是质量与覆盖度——数据要能代表线上真实输入。
通用任务(常见物体识别、主流语言翻译)上,大厂的 API 往往优于多数自训模型,因为它背后是海量数据与算力。差异出现在"你的领域很特殊"时——比如行业术语、私有数据、特定方言,这时微调或自训才有优势。
训练阶段几乎是,推理阶段看场景。训练吃 GPU 算力,云上按需租用即可;推理可以用 GPU 加速,但轻量模型也可以用 CPU 跑,成本更低。真正该避免的是"买一块 GPU 机器闲置",按量租用永远更划算。
常见计费维度:API 按调用次数,训练按 GPU 时长,推理按请求数与资源规格,预训练模型按下载或按授权。选型时要把"训练一次性成本 + 推理长期成本"一起算,很多项目训练便宜、推理贵,别只盯着开局费用。
把前面的概念串成一个完整流程,你就能看到 AI 服务在真实项目里怎么被"拼"起来。假设你要做一个"智能工单分类"系统,把客户提交的工单自动分配到正确的处理部门。
第一步是数据准备。把过去一年的工单(标题、正文、最终归属部门)整理成训练数据集,注意类别的均衡与标注的一致性。这一步用到的云服务主要是对象存储和数据库——数据放好,训练才有的吃。
第二步是模型选择。评估现成 NLP API 能否胜任:先拿几十条工单试调用,看分类准确率。如果通用 API 的效果差强人意,就进入微调路线——用云平台的预训练模型,配合你的工单数据做一次领域适配。这一步通常只需要少量 GPU 时长,几百元级别的成本就能完成。
第三步是部署与集成。训练好的模型部署成推理服务,应用侧通过 API 调用;把调用结果接入工单系统的流转逻辑,配上阈值与人工兜底(模型置信度低时转人工)。这一步用的是平台托管能力,自动扩容、按调用量计费。
第四步是监控与迭代。上线后跟踪分类准确率与业务效果(处理时长是否下降),每季度用新数据重训一次,应对工单类型随时间漂移。
这条流程的价值在于:它把"AI 落地"从"要不要养算法团队"简化成了"在云上按流程走一遍"。每一步都有对应的托管服务兜底,真正需要你投入的,是数据整理与业务判断——而不是写模型代码。这也呼应了本节开头那句话:云让"用 AI"从造引擎变成了买引擎、租引擎。
最后泼一盆清醒的冷水。云服务能托管的是"模型训练、部署、调用"这些工程环节,但有三件事外包不了。
第一,业务问题的定义。模型要优化什么指标、误判的代价有多大、规则边界怎么画,这些是业务判断,算法解决不了。第二,训练数据的责任。数据怎么采集、怎么标注、标注质量谁保证、数据合规不合规,责任在你自己——云平台不会为你的数据质量背锅。第三,结果的解释与信任。模型给出推荐,业务方敢不敢用、出问题谁负责,需要配套的治理与人工兜底机制。
换句话说,云把 AI 的"体力活"托管了,但"脑力活"还是你的。这也解释了为什么很多公司买了 AI 服务却用不好——不是工具不行,是把"外包工程"误当成了"外包思考"。买之前先想清楚这三个边界,AI 项目才可能落地而不是烂尾。
数据与智能都有了,但数据从哪来?很多来自海量设备——下一节讲物联网 IoT 服务,看看云怎么连接并消化亿级传感器数据。