从零实现 GPT:Karpathy nanoGPT 学习笔记
跟随 Karpathy 的 nanoGPT 教程,用 PyTorch 从零实现了一个字符级 decoder-only Transformer 语言模型,在莎士比亚数据集上训练出约 5.47M 参数的小模型。文章沿数据流梳理了 token 化、Embedding、位置编码、多头注意力、LayerNorm、FFN 等核心结构,并记录了训练配置与 loss 曲线。最终模型虽远不及现代 LLM,但已能输出拼写正确、颇具"莎士比亚风味"的文本——核心是理解了 GPT 的基本工作机制。
2026-08-10
|
44
|
0
|
0



