用300行代码从零搭一个能学莎士比亚的GPT,看完你才真正「懂」大模型
市面上的大模型原理课分两种:一种讲得很浅,听完啥也没记住;一种讲得很深,但听完更迷茫。Karpathy 这个系列的妙处是:他选了一个特别刁钻的切入口——「我们直接写代码」。不写代码,你说你懂注意力机制,那只是听说;写一遍,你就真的懂了。
为什么这个系列地位这么高
- Karpathy 本人就是 OpenAI 创始团队成员、前特斯拉 AI 总监,讲的是他天天在做的事
- 代码量极小——micrograd 全部代码不到 150 行,你能完整看完
- 讲解慢但扎实,每个数学符号和代码行都解释
- 配套 GitHub 仓库完整,有 notebook 可以直接跑
怎么不踩坑地学完
- 1按 micrograd → makemore → build-gpt 的顺序看,不要跳着看
- 2每个视频都配套 GitHub notebook,边看边在 Colab 跑
- 3看不懂某一段就停,翻评论区,通常有详细解释
- 4最后那个 build-gpt 视频 2 小时,但实际要花 6-8 小时消化
- 以为「等数学好了再学」——这套课的妙处就是边写代码边把数学讲清楚
- 以为要懂 PyTorch——前几个视频就是教你不用框架从零写
- 以为看完就能复现 GPT-4——你只能跑一个能学莎士比亚文风的小模型
生活类比
看发动机图纸和亲手拆装一台发动机的区别
对应:看论文是看图纸,跟 Karpathy 写代码是亲手拆装
这个比方在哪会塌:亲手拆装不等于你能设计新发动机,但能让你看懂别人的图纸
它防止的误解:防止停留在「听过 transformer」的层次,从此看任何大模型论文都不再害怕
延伸阅读
- Karpathy:Neural Networks: Zero to Hero 系列(Andrej Karpathy) |主要讲:从零构建 GPT 的原理讲解
最后复核:2026-07-27
AI 领域更新很快,相关工具/价格/规则可能已变化,重要事实请以官方来源为准。