标签

transformer

从零实现 GPT:Karpathy nanoGPT 学习笔记
跟随 Karpathy 的 nanoGPT 教程,用 PyTorch 从零实现了一个字符级 decoder-only Transformer 语言模型,在莎士比亚数据集上训练出约 5.47M 参数的小模型。文章沿数据流梳理了 token 化、Embedding、位置编码、多头注意力、LayerNorm、FFN 等核心结构,并记录了训练配置与 loss 曲线。最终模型虽远不及现代 LLM,但已能输出拼写正确、颇具"莎士比亚风味"的文本——核心是理解了 GPT 的基本工作机制。
2026-08-10
|
44
|
0
|
0
从零实现 GPT:Karpathy nanoGPT 学习笔记
Transformer 自注意力机制详解:从单头推导到多头注意力
自注意力是 Transformer 架构的核心组件。它使模型在处理序列中的某个词时,不是孤立地编码该词,而是同时考察同一序列中所有其他词,计算它们与该词之间的相关性权重。本文从单个 token 的视角入手,再逐步展开为矩阵形式,依次推导 Q、K、V 的线性投影过程、缩放点积注意力的计算方式,以及多头注意力的拼接与融合机制。
2026-07-15
|
73
|
0
|
0
Transformer 自注意力机制详解:从单头推导到多头注意力