---
title: "Karpathy：我如何使用大语言模型（视频导读）"
author: deletexiumu
pubDatetime: 2026-07-20T17:30:00+08:00
featured: false
draft: false
tags:
  - AI 工具
  - 效率
  - 视频导读
description: "Karpathy 两小时 LLM 实用指南：从 zip 文件心智模型讲到 thinking model、联网搜索、Deep Research、Cursor vibe coding、语音多模态与 Memory、custom GPT 日常用法。"
---

这是 Andrej Karpathy（OpenAI 创始成员、前 Tesla AI 总监）面向普通用户的 LLM 实用指南「How I use LLMs」。与他偏理论的「Deep Dive into LLMs」不同，这期视频完全从使用者视角出发：他把 ChatGPT、Claude、Gemini、Grok、Perplexity 挨个打开，用自己生活里的真实查询——查咖啡因含量、选感冒药、调试代码、读《国富论》、分析血检报告、学韩语——演示每类功能该怎么用、什么时候会翻车。看完你会得到一套完整的心智模型：什么问题可以直接问「zip 文件」，什么问题必须开搜索或 thinking，什么结论只能当初稿。本视频为中英双语字幕版，全长约两小时，建议按下方时间戳挑感兴趣的段落跳看。

## 观看视频

<video controls preload="metadata" style="width:100%" src="https://video.deepai.wiki/how-i-use-llms-andrej-karpathy-en-zh.mp4"></video>

视频全长约 2 小时 5 分钟，支持按章节跳看。

## 导读要点

### 00:00 心智模型：你在和一个 1 TB 的 zip 文件对话

Pre-training 把整个互联网有损压缩进约一万亿个 parameters，post-training 再给它装上助手人设。默认状态下它没有计算器、没有 Python、不能上网，知识停在 knowledge cutoff。金句：互联网上被反复提到的东西，它记得比冷门内容清楚得多——所以常识类、非近期的问题可以直接问，但答案本质是「对互联网的概率式回忆」。

### 09:29 两个基本功：勤开新对话、认清你在用哪个模型

Context window 是宝贵的工作记忆：token 堆多了模型会分心、变慢，换话题就新开对话。另外要留意付费档位对应的具体模型——免费档往往是缩水版，能力差距真实存在。Karpathy 自己多家都付费，同一个问题问遍各家，戏称为他的「LLM council」。

### 16:05 Thinking model：难题才值得等它「想」

强化学习让模型学会内心独白式的解题策略。他用一个梯度检查 bug 实测：GPT-4o 没答到点上，切到 o1-pro 思考一分钟后直接命中。建议：先用非 thinking 模型快问快答，答案存疑再切 thinking——旅行建议这类问题不值得等几分钟。

### 24:16 联网搜索：近期的、会变的、冷门的，都该搜

模型发出搜索 token，应用抓回网页塞进 context window 再作答。判断标准就三条：信息是否新（剧集播出时间）、是否随时间变（产品线、股价）、是否冷门（网上提及少）。命中任何一条就主动点搜索按钮，别赌模型的记忆。

### 35:27 Deep Research：十分钟生成定制研究报告，但只能当初稿

搜索加 thinking 的组合，模型跑十几分钟、翻几十个来源写报告。他用保健品成分 CaAKG 实测各家效果，也展示了一个失败案例：让它梳理美国 LLM 实验室，结果表格「半对半错」，居然漏掉了 xAI。结论：citation 才是重点，把报告当论文线索用，别当板上钉钉的事实。

### 44:26 文件上传：别再一个人读书

把 PDF 论文或书的章节丢进 context window，先要摘要再边读边问。他读 1776 年的《国富论》全程带着 Claude，称这样「极大提高记忆留存」，也让专业外的老文本变得可读。金句：我几乎不再独自读书了。

### 52:33 Python interpreter 与数据分析：能干活的「初级分析师」

模型识别出心算不了的题就写代码求解——没有工具的模型（如当时的 Grok 3）会硬算出一个错得很接近的答案。Advanced data analysis 能查数据、画图、拟合趋势线，但他抓到它偷偷把 NA 填成 0.1、又把 20 万亿说成 1.7 万亿：图很漂亮，代码必须自己过目。

### 01:02:39 Artifacts 与 Cursor：从浏览器小应用到 vibe coding

Claude Artifacts 现场生成闪卡应用、用 Mermaid 给书的章节画概念图，适合视觉型思考者。专业编程则该用 Cursor 这类拿到全部文件上下文的应用：Composer 像代码库上的自主 agent，他现场口述几句话就让井字棋加上撒花特效和音效——这就是他造的词「vibe coding」。

### 01:16:16 语音与多模态：一半以上的查询他都是说出来的

区分「假音频」（speech-to-text 转文字，桌面端可用 Super Whisper 系统级触发）和「真音频」（advanced voice mode，模型原生处理 audio token，可以变声、讲故事）。NotebookLM 还能把任意资料生成播客，散步时听小众话题。核心收获：别打字了，用语音，快太多。

### 01:34:18 图像进出：先转录、再核对、后提问

上传营养标签、血检报告、牙膏成分表，让模型先转成文字确认看对了再分析——两步走是他的固定习惯。医疗类结论当「和医生讨论的初稿」。图像生成他主要用来做视频封面和图标。手机端 advanced voice 还能开摄像头实时指认实物。

### 01:47:35 体验增强：Memory、custom instructions、custom GPT

Memory 让 ChatGPT 跨对话积累对你的了解，用得越久越懂你；custom instructions 全局定制说话风格；custom GPT 本质是把常用 prompt 存起来复用——他的韩语词汇提取器和详细翻译器全靠 few-shot prompt 实现，并直言「给例子永远比只给描述准」。

### 02:00:44 总结：功能是个动物园，带着清单去挑

ChatGPT 仍是功能最全的默认选择，但搜索他用 Perplexity、原型用 Claude Artifacts、编程用 Cursor。选应用时盯住几件事：模型档位、有无 thinking、有无工具（搜索/代码）、多模态能力、体验层功能，然后持续试验、形成自己的组合。

## 适合谁看

- 每天都在用 ChatGPT，但只会开一个对话框从头聊到尾的人
- 想搞清楚 thinking model、Deep Research、advanced voice 这些新名词到底值不值得付费的人
- 想借 LLM 提升读书、读论文、学外语效率的学习者
- 需要一套「什么问题该用什么工具」决策框架的效率工具爱好者

---

## 相关阅读

- [吴恩达：2026 如何成为 AI 工程师（视频导读）](/posts/andrew-ng-ai-engineer-2026/) — 同期视频系列：从"会用"进阶到"以此为业"的系统路线图
- [从 Karpathy 的个人知识库到万篇企业文档：规模变了，方法论也得变](/posts/karpathy-kb-to-enterprise/) — Karpathy 个人工作流方法论在企业规模下的延伸实践
