2.2 多头注意力机制 本节摘要:多头注意力(Multi-Head Attention)是自注意力的并行扩展:把查询、键、值经 h 组不同投影矩阵分别送入 h 个低维子空间,独立执行 h 次缩放点积注意力,再把各头输出拼接并做一次输出投影。其价值在于让模型在不同表示子空间捕捉不同类型的关联——有的头盯句法依存,有的头盯语义共指,有的头只看相邻位置。本节讲清计算流程、算一笔参数与计算量的账,并讨论头数选择与工程实践中对头的作用分析。 会员。《2.2 多头注意力机制》收录于灏天文库文集《Transformer 模型详解:NLP领域的革新者》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。