Karpathy 的“第二大脑”:如何构建它

@godofprompt
英语3个月前 · 2026年4月06日
519K
1.9K
264
42
6.7K

TL;DR

本指南提供了 Andrej Karpathy 个人知识库方法的逐步实施方案,利用 LLM 从原始研究资料中自动整理、链接并维护一个结构化的 Markdown 维基。

10 万人收藏了 @karpathy帖子

然后他发布了一个完整的 GitHub Gist。5000+ 星标。1400+ 分叉。两天之内。

大多数人也会收藏它,然后什么都不做。

不是因为它难。而是因为没人给他们精确的提示词。

我来解决这个问题。

我会带你走完整个系统,给你每一步的复制粘贴提示词,并告诉你这个系统在哪儿会失效,这样你就不会浪费一个周末去搭建一个在大规模时就会崩溃的东西。


"人类的工作是筛选来源、指导分析、提出好问题,并思考这一切的意义。LLM 的工作是其他所有事情。" — Andrej Karpathy


概念(60 秒版本)

你的知识散落在各处。文章保存在 4 个应用里。2023 年收藏的书签你再也不会看。会议笔记躺在一个你早已遗忘的文件夹里。

现在,当你向 AI 提问关于你的事情时,它每次都从零开始。上传文档,提问,得到答案。下次对话?它忘光了。这就是 ChatGPT 文件上传、NotebookLM 和大多数 RAG 系统的运作方式。零积累。

Karpathy 的想法扭转了这一切。

AI 不是每次都搜索你的原始文件,而是只读取一次你的来源,然后编译成一个结构化的 wiki。摘要、交叉引用、概念之间的联系、标记出的矛盾。

全部由 AI 维护。全部是简单的 Markdown 文件。

下次你提问时,AI 不会去翻原始文档。它直接读取已经构建好的 wiki。

联系已经在里面了。

综合已经反映了你读过的所有内容。

你每添加一个新来源,wiki 就更丰富。你每问一个问题,答案也可以被归档回去。知识在累积,而不是重置。

他的成果:一个研究主题下约 100 篇文章,约 40 万字。他一个字都没写。AI 编写、链接、分类和维护了所有这些内容。

没有数据库。没有嵌入。没有向量存储。只有文件夹和文本文件。

为什么你应该在意?

三个此刻就相关的用例:

如果你是创作者或营销人员,这是一个内容研究引擎。把竞品分析、热门文章、受众洞察扔进 raw/。wiki 会呈现你手动永远找不到的模式和角度。

如果你是创始人或顾问,这是你用于客户工作、市场研究或竞品分析的第二大脑。你生成的每份报告都会反馈到系统中。到第 3 个月,你的 AI 对领域的了解胜过大多数新员工。

如果你是学生或研究人员,这正是 Karpathy 实际构建它的目的。对几十篇论文进行深度研究,AI 追踪想法如何连接、作者在哪里有分歧、哪些空白仍然存在。

*这也可用于许多商业研发工作流。

在开始构建之前:你需要什么

→ 一个能读取本地文件的 AI 编码工具(Claude Code、Cursor、Codex 或类似工具)

→ 一个文本编辑器(推荐 Obsidian,但 VS Code、记事本等任何工具都行)

→ 10 份以上你关心主题的源文档

→ 30 分钟初始设置,之后每份来源 10 分钟

就这样。没有特殊软件。不需要创建账户。无需插件。


本文的其余部分是构建过程。7 个步骤。每个步骤都有你要粘贴到 AI 中的精确提示词。按顺序操作。


步骤 1:创建文件夹结构(2 分钟)

在你的机器上任意位置创建:

text
1my-knowledge-base/
2├── raw/ # 你的源材料。AI 读取但从不修改。
3│ └── assets/ # 图片、截图、图表
4├── wiki/ # AI 维护的 wiki。你阅读。AI 编写。
5├── outputs/ # 报告、分析、查询答案
6└── CLAUDE.md # 使这一切运转的模式文件

三个文件夹,一个文件。如果在此花费超过 2 分钟,那你在过度思考。

步骤 2:编写你的模式文件(大家都会跳过的步骤。别跳过。)

模式是区分通用聊天机器人和有纪律的 wiki 维护者的关键。

它告诉你的 AI 知识库是关于什么的,如何组织,以及当你添加来源、提问或运行维护时该做什么。

其他所有指南都会给你一个 10 行的模板。以下是完整的生产级模式,基于 Karpathy 的 Gist,为实际使用而设计:

text
1# 知识库模式
2
3## 身份标识
4这是关于 [你的主题] 的个人知识库。
5由 LLM Agent 维护。人类负责策划来源和提问。LLM 负责其他所有事情。
6
7## 架构
8- raw/ 包含不可变的源文档。永远不要修改 raw/ 中的文件。
9- wiki/ 包含编译后的 wiki。LLM 完全拥有此目录。
10- outputs/ 包含生成的报告、分析和查询答案。
11
12## Wiki 约定
13- 每个主题在 wiki/ 中拥有自己的 .md 文件
14- 每个 wiki 文件以 YAML 前置元数据开始:
15 ---
16 title: [主题名称]
17 created: [日期]
18 last_updated: [日期]
19 source_count: [为此页面提供信息的原始来源数量]
20 status: [draft | reviewed | needs_update]
21 ---
22- 前置元数据之后,是一段摘要
23- 使用 [[topic-name]] 作为 wiki 页面之间的内部链接
24- 每个事实性声明引用其来源:[来源:filename.md]
25- 当新内容与现有内容矛盾时,明确标记:
26 > 矛盾:[旧声明] vs [新声明] 来自 [来源]
27
28## 索引与日志
29- wiki/index.md 列出每个页面及其一行描述,按类别分类
30- wiki/log.md 是仅追加的按时间顺序记录
31- 日志条目格式:## [YYYY-MM-DD] 操作 | 描述
32 (操作:ingest, query, lint, update)
33
34## 摄取工作流
35处理新来源时:
361. 完整读取源文档
372. 与用户讨论关键要点
383. 在 wiki/ 中创建或更新摘要页面
394. 更新 wiki/index.md
405. 更新 wiki/ 中所有相关的实体和概念页面
416. 从现有页面添加反向链接到新内容
427. 标记与现有 wiki 内容的任何矛盾
438. 在 wiki/log.md 中追加条目
449. 单个来源应涉及 10-15 个 wiki 页面
45
46## 查询工作流
47回答问题:
481. 首先读取 wiki/index.md 找到相关页面
492. 读取所有相关 wiki 页面
503. 综合答案,附带 [来源:页面名称] 引用
514. 如果答案揭示了新见解,提供将其归档回 wiki/ 的选项
525. 将有价值的答案保存到 outputs/
53
54## Lint 工作流(每月)
55检查:
56- 页面之间的矛盾
57- 被更新来源取代的过时声明
58- 没有入站链接的孤立页面
59- 提到但从未解释的概念
60- 缺少的交叉引用
61- 没有来源归属的声明
62输出:wiki/lint-report-[日期].md,带有严重程度级别
63
64## 关注领域
65[列出该知识库涵盖的 3-5 个主题]

复制这段。自定义关注领域。将其放在项目根目录下,命名为 CLAUDE.md。

步骤 3:填充你的 Raw 文件夹(10 分钟倾倒,零整理)

打开 raw/,把所有东西都丢进去:

→ 将文章复制粘贴为 .md 或 .txt 文件

→ 从你当前使用的任何应用中导出笔记

→ 将截图和图表保存到 raw/assets/

→ 粘贴研究论文、PDF、竞品分析

→ 倾倒你囤积了几个月的书签

不要整理。不要重命名。不要清理。那是 AI 的工作。

来自 Karpathy 的专业提示:Obsidian Web Clipper 浏览器扩展只需一次点击即可将任何网页文章转换为 Markdown。

设置一个快捷键(设置 → 快捷键 → "下载附件")来将所有图片拉取到本地,以便 AI 可以引用它们。

如果你不使用 Obsidian,从浏览器复制粘贴也很好用。

目标是数量。不是完美。

步骤 4:运行你的首次摄取

打开你的 AI Agent。让它指向你的项目文件夹。粘贴以下内容:

摄取提示词:

text
1"读取 CLAUDE.md 中的模式。然后处理 raw/ 中的 [文件名]。完整阅读它,与我讨论关键要点,然后:在 wiki/ 中创建摘要页面,更新 wiki/index.md,更新所有相关的概念和实体页面,添加反向链接,标记任何矛盾,并在 wiki/log.md 中追加条目。"

一次从一个来源开始。Karpathy 也是这么做的。阅读摘要。检查更新。引导 AI 强调什么。这比一次性批量处理所有内容会带来更好的结果。

在 5-10 个来源之后,你的 wiki/ 文件夹将拥有一个索引、一个日志以及 15-30 个相互关联的页面。

那时一切就变得有意义了。

步骤 5:开始查询你的知识库

一旦你有了 10 个以上的 wiki 页面,系统就会变得真正有用。粘贴以下内容:

查询提示词:

text
1"读取 wiki/index.md。基于知识库中的内容,回答:[你的问题]。引用哪些 wiki 页面为你的答案提供了信息。如果这揭示了值得保留的新联系,请在 wiki/ 中创建一个新页面并更新索引。"

最能提取价值的问题:

→ "这个知识库中最大的三个空白是什么?"

→ "哪些来源互相矛盾,在哪方面?"

→ "基于现有内容,我下一步应该研究什么?"

→ "仅使用 wiki 内容写一篇关于 [主题] 的 500 字简报"

→ "[概念 A] 和 [概念 B] 之间有什么联系?"

关键循环:好的答案应该被归档回 wiki。

一个比较、一个分析、你发现的一个联系。

它们和摄入的来源一样在知识库中累积。

每一个问题都会让下一个答案更好。

步骤 6:运行月度健康检查

这是没有人做的步骤。这是防止整个系统慢慢腐烂的步骤。粘贴以下内容:

Lint 提示词:

text
1"根据 CLAUDE.md 中的 lint 工作流,对 wiki/ 进行全面健康检查。输出到 wiki/lint-report-[日期].md,带有严重程度级别(🔴 错误,🟡 警告,🔵 信息)。建议 3 篇文章来填补最大的知识空白。"

为什么这很重要:当 AI 写了稍微错误的内容,你把它保存回去时,下一个答案就建立在错误之上。

两个月后,你有五页都在强化同一个错误。健康检查在它滚雪球之前就抓住了它。

每月检查一次。花费你十分钟时间。如果你希望系统保持可信赖,这一点不可协商。

步骤 7:让它累积

这就是系统体现价值的地方。

在持续使用 4-6 周后,你不再只是搜索笔记。

你在查询一个结构化的知识系统,它比你更了解你的来源之间的联系。

三种加速累积的方法:

将探索输出归档回去:当 AI 生成你认为有价值的比较或分析时,将其保存到 wiki/ 或 outputs/。

Karpathy 说他自己探索和查询"总是会累积"到知识库中。

添加视觉输出:让 AI 将答案渲染为 Markdown 表格、图表或幻灯片(Marp 格式)。

这些成为可重复使用的资产,而不是一次性的聊天消息。

对一切进行版本控制:你的 wiki 只是 Markdown 文件。

初始化一个 git 仓库。你就能获得完整历史、分支,以及撤销 AI 搞砸的任何事情的能力。


好了。构建过程就是这些。现在来看没有人会告诉你的部分。


这个系统在哪里会失效(诚实版)

这是一个新兴的模式,而不是一个成品。Karpathy 自己称其为"一组粗糙的脚本",并说还有真正的产品空间。

在你信任你的知识给它之前,你需要了解以下内容:

上下文窗口上限。

Karpathy 的 wiki 在大约 100 篇文章和 40 万字的情况下工作。但即使是 128K 令牌的上下文窗口也只能容纳约 9.6 万字。AI 通过索引选择性读取,这意味着它可能会遗漏一些内容。研究表明,LLM 存在"迷失在中间"效应,即长输入中间的信息会被降低优先级。你的查询结果会有盲点。接受这一点。

错误累积。

AI 写了一个 wiki 页面,带有一个细微的错误。你针对它进行查询。这个错误进入了你的答案。你把那个答案归档回去。现在两个页面强化了同一个错误。每月的 lint 检查有帮助,但进行 lint 检查的 AI 和制造错误的 AI 有同样的盲点。这是最大的单一风险。Karpathy 的 Gist 上的一条评论一针见血:"当输出被归档回去时,错误也会累积。"

幻觉不会消失。

Wiki 方法减少了幻觉,因为 AI 将答案基于你的来源。但它并没有消除幻觉。AI 仍然可以综合出来源材料中不存在的联系。而且因为 wiki 看起来权威(干净的 Markdown、交叉引用、引用),你更有可能相信错误的信息。不要相信它。

成本并非为零。

每次摄入、每次查询、每次 lint 检查都会消耗令牌。一个触及 10-15 页的单一来源,使用前沿模型可能会花费 2-5 美元的 API 调用。50 个来源仅摄入就需要 100-250 美元。比研究助理便宜。但不是免费的。

它无法扩展到企业级。

Karpathy 说索引文件方法在没有 RAG 的情况下适用于约 100 篇文章。在 10,000+ 来源时,这种模式就会失效。索引变得太大。跨数千页的一致性变得不可能。你需要这个系统旨在避免的基础设施。了解这个天花板。

单一模型的盲点。

你的整个 wiki 是一个模型对你来源的解释。那个模型有偏见和倾向性。对于高风险的决策,一个 Gist 评论者建议独立地通过 4 个以上的模型运行查询,然后比较一致性。更稳健。也要花 4 倍的成本。

该怎么办

→ 错误累积:每月 lint 检查。手动交叉检查关键声明。在高风险决策上永远不要盲目相信 wiki。

→ 上下文限制:保持每个 wiki 专注于一个领域。多个领域?多个知识库。

→ 成本:对摄入和复杂查询使用前沿模型。对简单的更新使用更便宜的模型。

→ 幻觉:上面的模式要求每个声明都有来源引用。如果一个页面在没有 [来源:文件名] 的情况下做出声明,lint 会标记它。

→ 规模:接受这是一个个人工具,而不是企业基础设施。如果你超越了它,那是个好问题。

为什么它仍然重要

尽管有以上所有问题,这仍然是目前可用的最实用的个人知识系统。

原因非常简单:人类放弃 wiki 是因为维护的增长速度超过了价值。

你开始整理,感觉很好两周,然后维护工作扼杀了动机,你再也不会碰它。

LLM 不会感到厌倦。它们不会忘记更新交叉引用。它们可以在一次操作中触及 15 个文件而不抱怨。

Lex Fridman 证实他运行了类似的设置。

他生成交互式 HTML 可视化,并创建"迷你知识库"加载到语音模式中,用于 7-10 英里的跑步。

来自 DAIR.AI 的 Elvis Saravia 一直在为 AI 研究策划构建 LLM 知识库。

Karpathy 的 Gist 发布 48 小时内,多个开源实现出现在 GitHub 上。

这不再是一个实验。

它正在成为任何做严肃研究的人的标准做法。

你的完整提示词库(复制所有内容)

本文中的所有提示词,收集在一起:

模式:步骤 2 中的完整 CLAUDE.md 模板。

摄取(一个来源):

text
1"读取 CLAUDE.md 中的模式。处理 raw/ 中的 [文件名]。完整阅读它,与我讨论关键要点,然后:创建摘要页面,更新索引,更新所有相关页面,添加反向链接,标记矛盾,记录摄入。"

摄取(批量,较少监督):

text
1"读取 CLAUDE.md。按顺序处理 raw/ 中所有未处理的文件。对每个文件:创建摘要,更新索引,更新相关页面,记录摄入。自动进行。"

查询:

text
1"读取 wiki/index.md。回答:[问题]。引用 wiki 页面。如果这个答案值得保留,提议将其作为新的 wiki 页面归档。"

Lint:

text
1"根据 CLAUDE.md 中的 lint 工作流,对 wiki/ 进行全面健康检查。输出到 wiki/lint-report-[日期].md,带有 🔴/🟡/🔵 严重程度。建议 3 篇文章来填补空白。"

探索:

text
1"读取 wiki/index.md,找出现有主题之间 5 个最有趣但尚未探索的联系。对每个联系,解释它可能揭示什么洞见,以及什么来源有助于确认它。"

简报:

text
1"基于 wiki/ 中的所有内容,就 [主题] 写一份 500 字的高管简报。引用来源。结构为:当前状态、关键矛盾、未解决问题、建议下一步行动。"

去构建它

收藏 Karpathy 的 Gist 和从中受益之间的区别,就是一个下午。

选择你的主题。创建文件夹。复制模式。

把你已有的东西放进去。运行你的首次摄入。

然后明天再用另一个来源做一次。

下周再加五个。

Wiki 每次都会变得更聪明。这就是全部意义。

三个文件夹。一个模式。

一个 AI 来做你永远不会自己做的苦力。

停止收集书签。开始积累知识。


将 Claude 变成 20 多个不同的营销和商业专家。

安装真正的专业知识,而不仅仅是提示词。

获取我的 Claude 技能包 👇

https://linktr.ee/alex_prompter

https://x.com/karpathy/status/2039805659525644595

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章