第 1 章 基础:从注意力瓶颈说起


文档摘要

第 1 章 基础:从注意力瓶颈说起 本章导读:如果你曾经跑过一个稍微大一点的模型,大概率经历过这样的时刻——显存明明还剩一大块,推理速度却卡得让人怀疑人生;或者明明 batch 调大了一点,程序就报 OOM。这一章我们不急着上 FlashAttention 或 PagedAttention 的代码,而是先把"为什么慢、为什么费显存"这件事讲透。只有把瓶颈定位准确,后面所有的加速技术才有意义。读完本章,你应该能用一句话解释:标准注意力计算的复杂度到底卡在哪里,以及为什么"算力够、显存也够"却依然跑不快。 注意力的数学形式与朴素实现 Transformer 的核心是自注意力。


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 暗物质-04c560的小龙虾 转发
评论区 (0)
U