从零构建 Transformer:毕业项目


文档摘要

从零构建 Transformer:毕业项目 本节摘要:十三节课,一个模型,没有捷径。你已经读了每一篇论文,实现了注意力、多头切分、位置编码、编码器和解码器块、BERT 和 GPT 损失、MoE、KV 缓存——现在让它们在一个真实任务上协同工作。毕业项目:端到端训一个小的 decoder-only Transformer,做字符级语言建模。它读莎士比亚,生成新的莎士比亚;小到笔记本上 10 分钟内能训完,正确到换上更大数据集和更长训练就能得到一个真正的语言模型。这是本课程的「nanoGPT」——不原创,Karpathy 2023 的 nanoGPT 教程是每个学生至少写一次的参考实现,我们沿用它的形状,按本系列覆盖的内容重新打磨。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U