分类

技术笔记

轻译:适用于 Zotero 10 的极简划词翻译器
轻译是作者自研的 Windows 桌面端 + Zotero 插件组合,解决一个具体需求:在 Zotero 10 的 PDF阅读模式里划选文本、右键即可调用自配的 LLM API 完成翻译。文章按三步介绍了安装使用流程(配置桌面端、安装启用连接器插件、划词翻译),并强调工具定位——极简、轻量、快捷,专注覆盖读英文论文时最常见的翻译场景。
2026-08-25
|
24
|
0
|
0
轻译:适用于 Zotero 10 的极简划词翻译器
从零实现 GPT:Karpathy nanoGPT 学习笔记
跟随 Karpathy 的 nanoGPT 教程,用 PyTorch 从零实现了一个字符级 decoder-only Transformer 语言模型,在莎士比亚数据集上训练出约 5.47M 参数的小模型。文章沿数据流梳理了 token 化、Embedding、位置编码、多头注意力、LayerNorm、FFN 等核心结构,并记录了训练配置与 loss 曲线。最终模型虽远不及现代 LLM,但已能输出拼写正确、颇具"莎士比亚风味"的文本——核心是理解了 GPT 的基本工作机制。
2026-08-10
|
44
|
0
|
0
从零实现 GPT:Karpathy nanoGPT 学习笔记
Transformer 自注意力机制详解:从单头推导到多头注意力
自注意力是 Transformer 架构的核心组件。它使模型在处理序列中的某个词时,不是孤立地编码该词,而是同时考察同一序列中所有其他词,计算它们与该词之间的相关性权重。本文从单个 token 的视角入手,再逐步展开为矩阵形式,依次推导 Q、K、V 的线性投影过程、缩放点积注意力的计算方式,以及多头注意力的拼接与融合机制。
2026-07-15
|
73
|
0
|
0
Transformer 自注意力机制详解:从单头推导到多头注意力
自动驾驶数据长尾分布问题:本地部署Wan2.2-TI2V-5B合成数据实践
上篇文章用即梦验证了视频生成模型合成长尾数据的可行性,但商业 API 成本高、数据要上传。这篇文章记录了在 RTX 4090工作站上本地部署 Wan2.2-TI2V-5B 开源图生视频模型的过程。围绕模型搭了一个工具(FastAPI +React),支持对话式单次生成和批量排队合成,生成后自动抽帧。
2026-06-08
|
25
|
0
|
0
自动驾驶数据长尾分布问题:本地部署Wan2.2-TI2V-5B合成数据实践
自动驾驶数据长尾分布问题:利用有世界先验的视频生成模型合成数据实践
本文记录了一次面向自动驾驶长尾数据问题的合成数据实验。针对真实数据中小动物横穿等低频目标样本不足的问题,尝试利用具备世界先验的视频生成模型,从真实道路图像出发生成小狗横穿场景,再通过抽帧构建候选训练样本。实验结果表明,相比传统贴图式合成,视频生成模型在接地关系、尺度、透视和运动连续性上更接近真实采集数据。后续工作将继续探索自动清洗、自动标注和真实验证集上的 Recall / mAP 评估。
2026-06-05
|
25
|
0
|
0
自动驾驶数据长尾分布问题:利用有世界先验的视频生成模型合成数据实践