4.1 学习范式 本节摘要:学习范式按反馈类型划分。监督学习用标签教映射,适合感知分类、回归、模仿专家行动。无监督学习没有标签,找簇、压缩、异常,常为认知提供表示。强化学习用奖励教策略,适合序列决策、标签昂贵但互动可得。半监督与迁移是数据不足时的组合技。选范式先问:你手里的反馈是标签、是结构,还是奖励?不要先问「哪个模型最火」。 会员。《4.1 学习范式》收录于灏天文库文集《AI 智能体基础:认知、决策与学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。