分类微调:换头


文档摘要

分类微调:换头 本节摘要:预训练语言模型是自注意力块的堆叠,末端接一个 token 预测头。当你想做垃圾短信识别时,头错了,但主体大致没错。本节拆掉 LM 头,在池化表示上粘一个两类线性层,用两种方式训练分类器:只调最后一层(冻体)、全参数微调,共用一个训练循环。评估用留出集上的精确率(precision)、召回率(recall)、F1 加混淆矩阵。你学到每种策略换得什么、付出什么——800 条 SMS 上,只调头训练快、几乎不过拟合;全调慢、易在小数据上过拟合,但当下游领域偏离预训练语料时精度更高。 对应原课程:Phase 19 · Lesson 38 · (原英文 )。本节属「从零构建 GPT」赛道第九节。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U