← Recent update
AK
AI & 技术

Andrej Karpathy

AI 研究者 / 教育者

AI写作

前特斯拉 AI 总监、OpenAI 创始成员,AI 时代最会讲课的人

基本介绍

Andrej Karpathy(安德烈·卡帕西,1986– )是深度学习领域最具影响力的研究者与教育者之一。他出生于斯洛伐克,少年时随家庭移居加拿大,后在多伦多大学(师从深度学习脉络)、不列颠哥伦比亚大学求学,最终在斯坦福跟随 Fei-Fei Li 读完计算机视觉方向的博士。他是 OpenAI 的创始成员(2015),随后出任 特斯拉 AI 高级总监(2017–2022),主导 Autopilot 的视觉神经网络与数据引擎;2023–2024 短暂回归 OpenAI,2024 年离开后创办 AI 教育公司 Eureka Labs

他之所以影响巨大,一半在研究、一半在”翻译”:他能把最复杂的深度学习机制讲得异常清楚。斯坦福 CS231n(卷积神经网络视觉识别)是全世界一代人的深度学习入门课;他”从零手写”的系列(micrograd、makemore、minGPT/nanoGPT)让无数工程师第一次真正理解大模型内部在发生什么。在一个充满炒作与黑箱的领域里,他代表着”把事情讲明白、亲手把它造出来”的稀缺气质。

关键时间线

  • 1986:生于捷克斯洛伐克(今斯洛伐克)。
  • 2005–2009:多伦多大学,计算机科学与物理。
  • 2011–2015:斯坦福大学攻读博士,师从 Fei-Fei Li,研究方向为图像识别与图文生成(image captioning)。期间设计并主讲 CS231n,成为深度学习教育的里程碑课程。
  • 2015 年底:作为创始成员加入 OpenAI,任研究科学家。
  • 2017:出任特斯拉 AI 高级总监,负责 Autopilot/FSD 的神经网络、数据标注与”数据引擎”体系。
  • 2017:发表影响深远的博文 《Software 2.0》
  • 2022 年 7 月:离开特斯拉(“Autopilot 五年间从车道保持成长为城市街道自动驾驶”)。
  • 2023 年 2 月回归 OpenAI
  • 2024 年 2 月再次离开 OpenAI,公开澄清”没有戏剧性事件,只是想做别的”。
  • 2024 年 7 月 16 日:创办 Eureka Labs,主打”AI 原生学校”,首个产品是 AI 课程 LLM101n
  • 2025 年 2 月:造词 “vibe coding”;发布 3 小时 31 分的科普长视频《Deep Dive into LLMs like ChatGPT》。
  • 2025 年:开源 nanochat——“100 美元能买到的最好的 ChatGPT”,一套完整的从训练到推理的极简 ChatGPT 复现管线。

核心贡献与理念

  • Software 2.0(软件 2.0):他 2017 年提出的核心框架——软件正从”人一行行写代码(Software 1.0)“转向”用数据训练出神经网络权重(Software 2.0)“。在 2.0 里,“代码”是数据集和优化目标,程序员的工作变成策划数据、设计目标、调训练。这个视角预见了此后十年 AI 工程的范式迁移。
  • Software 3.0 / “英语是最热的新编程语言”:进入大模型时代后,他进一步提出:提示词(自然语言)本身就是在编程。软件栈从此有三层——1.0(代码)、2.0(权重)、3.0(提示)。谁能用自然语言精确地指挥模型,谁就是新的程序员。
  • “Vibe coding”(氛围编程):2025 年他造的词,形容”完全交给 AI、凭感觉迭代、几乎不看代码本身”的新写法。迅速成为全行业热词,也引发关于”这是解放还是失控”的大讨论。他本人的用法偏克制——强调它适合原型和玩具项目,认真的软件仍需要工程纪律。
  • “Context engineering” 胜过 “prompt engineering”:2025 年他为这个词背书——真正决定模型表现的,不是一句巧妙的提示,而是如何把恰当的信息、以恰当的形式、恰当地填进上下文窗口。这是从”魔法咒语”到”系统工程”的认知升级。
  • LLM 是一种新操作系统(“LLM OS”):他把大模型类比为一台新计算机的 CPU/内核,上下文窗口是内存,工具调用是外设——由此推演出一整套”围绕 LLM 构建应用”的心智模型。他也常把大模型形容为”人的灵魂的有损压缩(people spirits)“——既有惊人能力,也有系统性的”锯齿状智能(jagged intelligence)”。
  • AI 教育与”亲手造”哲学:他坚信理解一样东西的最好方式是从零把它重写一遍。micrograd(百行实现反向传播)、makemore、minGPT、nanoGPT、“Neural Networks: Zero to Hero” 视频系列、nanochat,都是这一信念的产物。Eureka Labs 想把这种”AI 原生、师生+AI 助教协同”的学习方式产品化。
  • 务实的 AGI 观:他对时间线保持克制乐观,反复强调工程现实——自动驾驶的”九的进军(march of nines,每多一个 9 的可靠性都要巨大努力)“、RL 信号的稀疏与噪声、评测的困难。他公开与 Richard Sutton 的”苦涩的教训(Bitter Lesson)“式纯 RL 主张对话,代表了”既信规模、也重结构与数据”的中间立场。

争议与批评

  • “Vibe coding” 的双刃:这个词火了之后,被大量新手当作”不用懂工程也能造软件”的许可证,催生了一批不可维护、有安全隐患的代码。批评者认为他(无意中)为”降低对严谨性的要求”提供了话术;他本人则多次澄清其适用边界。
  • 明星研究者的”影响力放大器”效应:他一条推文就能定义一个行业词汇(vibe coding、context engineering)。有人担心这种个人影响力会让行业话语过度围着少数几位明星转,而非扎实的经验证据。
  • 教育理想 vs 商业落地:Eureka Labs 与 LLM101n 备受期待,但”AI 原生学校”能否规模化、能否兑现”世界上最好的 AI 课程”的承诺,仍待验证。
  • 乐观的技术叙事:作为特斯拉 Autopilot 前负责人,他对自动驾驶与 AI 能力的公开表述,也被质疑带有从业者的乐观色彩。

近期动态(2025–2026)

(以下部分基于其公开 X 动态与开源发布)

  • nanochat(2025):开源”100 美元训练一个 ChatGPT”的完整管线,延续 nanoGPT 的极简教育路线,把”人人可复现前沿”往前推了一大步。
  • “内容正在从写给人转向写给 LLM”(2025-03):他提出”99.9% 的注意力即将是 LLM 的注意力,而非人的注意力”,主张文档、库、产品都该开始为大模型的阅读方式而设计。
  • 为 “context engineering” 正名(2025-06):把行业从”提示词玄学”引向”上下文系统工程”。
  • 与 Sutton《苦涩的教训》的对话(2025-10):就”纯 RL/规模 vs 结构与先验”展开公开讨论,是理解他方法论立场的最新窗口。
  • 持续输出科普:《Deep Dive into LLMs like ChatGPT》(3.5 小时)等长视频,继续扮演”全世界的 AI 讲师”。

核心人物关系

  • Fei-Fei Li:斯坦福博士导师,ImageNet → CS231n 的视觉一脉师承与延续。
  • Sam AltmanIlya Sutskever:OpenAI 创始同僚。
  • Elon Musk:特斯拉时期的直接上级,Autopilot 愿景的推动者。
  • Demis Hassabis:同代 AI 前沿的另一极(DeepMind 路线 vs OpenAI/自研教育路线)。
  • Dan Shipper:都在定义”AI 原生”的工作与学习方式(vibe coding / allocation economy 可对读)。
  • Paul Graham 同属”把复杂的事讲到极清楚”的写作/教育典范。
  • 思想上与 Geoffrey Hinton、Yann LeCun 的深度学习谱系一脉相承(未在库内)。

参考资料清单

  • 个人博客:karpathy.github.io / karpathy.ai(《Software 2.0》《A Recipe for Training Neural Networks》等)
  • YouTube:“Neural Networks: Zero to Hero” 系列、《Deep Dive into LLMs like ChatGPT》《The busy person’s intro to LLMs》《State of GPT》
  • GitHub:micrograd、makemore、minGPT、nanoGPT、nanochat、LLM101n
  • Eureka Labs:eurekalabs.ai
  • 斯坦福 CS231n 课程主页与讲义
  • X/Twitter:@karpathy(vibe coding、context engineering、Software 3.0 等观点的一手来源)

总结

Karpathy 的独特之处在于同时站在前沿研究、工业落地、大众教育三个位置:他做过最难的(Tesla 自动驾驶)、定义过范式(Software 2.0/3.0)、又愿意花大量时间把这一切讲给所有人听。他造的词(vibe coding、context engineering)之所以能瞬间成为行业共识,正是因为背后有真功夫和”讲清楚”的诚意。在一个容易被炒作淹没的领域,他代表的是**“亲手把它造一遍、再讲给你听”**的第一性原理气质——这也是他对”AI 时代该如何学习与工作”最深的示范。