任务分类考点:给定业务描述判断监督、无监督、强化学习,以及分类与回归、聚类与降维的细分。通关标准:半分钟内完成归类并说出判断依据。本章收官关,产出"任务判别决策卡",直接决定下一编队每道题的入手方向。
关卡一(单选):电商平台根据用户历史购买记录(带商品类目标签)预测用户下一步会买的商品类目,这属于:
A. 无监督学习 B. 监督学习中的分类任务 C. 强化学习 D. 降维任务
关卡二(单选):把数十万条无标签的客户行为日志划分成若干自然群体,供运营分别制定策略,最合适的问题设定是:
A. 回归 B. 聚类 C. 关联规则之外的分类 D. 强化学习
关卡三(多选):下列哪些场景天然属于强化学习?
关卡四(判断):"所有监督学习任务的输出都是离散类别。"这句话对吗?
三条判别轴,按顺序过一遍再落笔:
关卡一选 B。 有历史记录(特征)也有商品类目标签(答案),预测目标"类目"是离散的,属于监督学习中的分类任务。若改成预测"会花多少钱",就滑向回归——同一份业务数据,问法一换任务就换,这是出题人最爱用的手法。
关卡二选 B。 日志无标签、目标又是"找出自然群体",是聚类。D 是强干扰项:虽然运营策略听上去像"决策",但训练过程中不存在环境反馈与奖励信号。
关卡三选 1、2、4。 三者的公共特征:智能体的动作改变环境状态,反馈以标量奖励延迟给出,优化目标是长期累积奖励。3 是纯预测任务,动作不影响世界,属于回归。
关卡四:错。 监督学习输出离散类别是分类,输出连续数值是回归,两者都是监督学习。反例:房价预测有标准答案(成交价),但输出是连续值。
把判别轴固化成可执行的决策函数,以后拿到需求先跑一遍这个流程:
# 任务判别决策卡:三轴定式(伪代码级 Python) def classify_task(has_label, output_type, delayed_reward, action_affects_env): if delayed_reward and action_affects_env: return "强化学习" if has_label: return "监督学习·分类" if output_type == "离散" else "监督学习·回归" return "无监督学习" cases = [ ("邮件垃圾识别", dict(has_label=True, output_type="离散", delayed_reward=False, action_affects_env=False)), ("房价预测", dict(has_label=True, output_type="连续", delayed_reward=False, action_affects_env=False)), ("客户分群", dict(has_label=False, output_type="无", delayed_reward=False, action_affects_env=False)), ("图片压缩去冗余", dict(has_label=False, output_type="无", delayed_reward=False, action_affects_env=False)), ("下围棋", dict(has_label=False, output_type="无", delayed_reward=True, action_affects_env=True)), ] for name, kw in cases: print(f"{name:<8} → {classify_task(**kw)}") # 输出: # 邮件垃圾识别 → 监督学习·分类 # 房价预测 → 监督学习·回归 # 客户分群 → 无监督学习 # 图片压缩去冗余 → 无监督学习 # 下围棋 → 强化学习
注意"图片压缩去冗余"落进了笼统的"无监督学习"——想再细分聚类还是降维,追加一个问题:输出是"分组"还是"更小的坐标"? 分组是聚类,换坐标是降维:
# 无监督细分:分组 or 换坐标 def unsupervised_detail(goal): return "聚类" if goal == "分组" else "降维(如主成分分析)" print(unsupervised_detail("分组")) # 聚类 print(unsupervised_detail("换坐标")) # 降维(如主成分分析)
易错点一:见到"用户行为数据"就条件反射选无监督。行为数据完全可能带标签(是否转化、是否流失),先问标签轴,别被数据类型带跑。
易错点二:把推荐系统一概归为监督学习。离线训练点击率预估模型是监督任务;但"边展示边学习、优化长期留存"的在线设定更接近强化学习(语境决策是标准建模)。同一名词在不同语境下任务类型不同,答题时看清题干设定。
变式一:题干改为"预测用户会买商品类目,但类目有先后的等级结构(如低价到高价的升级路径)"——考序数型目标:本质仍是分类,但损失函数要照顾类别间的次序关系,这会引出第二章的损失函数选型问题。
变式二:面试官追问"半监督学习和自监督学习算哪一类"。高分答法:半监督是"少量标签加大量无标签"的混合训练策略;自监督是从无标签数据里自动构造监督信号(如遮词预测),大模型预训练的基石。两者都是"标签轴"上的工程变通,不打破基本分类框架。
本章通关。任务判别决策卡已经成型,带上它进入机器学习基础编队——那里的每道算法题,第一步都是先亮卡归类。