Transformer 自注意力机制详解:从单头推导到多头注意力2026-07-152026-08-14技术笔记transformer/self-attention/Multi-Head Attention自注意力是 Transformer 架构的核心组件。它使模型在处理序列中的某个词时,不是孤立地编码该词,而是同时考察同一序列中所有其他词,计算它们与该词之间的相关性权重。本文从单个 token 的视角入手,再逐步展开为矩阵形式,依次推导 Q、K、V 的线性投影过程、缩放点积注意力的计算方式,以及多头注意力的拼接与融合机制。2026-07-15|73|0|0