10 万人收藏了 @karpathy 的 帖子:
然后他发布了一个完整的 GitHub Gist。5000+ 星标。1400+ 分叉。两天之内。
大多数人也会收藏它,然后什么都不做。
不是因为它难。而是因为没人给他们精确的提示词。
我来解决这个问题。
我会带你走完整个系统,给你每一步的复制粘贴提示词,并告诉你这个系统在哪儿会失效,这样你就不会浪费一个周末去搭建一个在大规模时就会崩溃的东西。
"人类的工作是筛选来源、指导分析、提出好问题,并思考这一切的意义。LLM 的工作是其他所有事情。" — Andrej Karpathy
概念(60 秒版本)
你的知识散落在各处。文章保存在 4 个应用里。2023 年收藏的书签你再也不会看。会议笔记躺在一个你早已遗忘的文件夹里。
现在,当你向 AI 提问关于你的事情时,它每次都从零开始。上传文档,提问,得到答案。下次对话?它忘光了。这就是 ChatGPT 文件上传、NotebookLM 和大多数 RAG 系统的运作方式。零积累。
Karpathy 的想法扭转了这一切。
AI 不是每次都搜索你的原始文件,而是只读取一次你的来源,然后编译成一个结构化的 wiki。摘要、交叉引用、概念之间的联系、标记出的矛盾。
全部由 AI 维护。全部是简单的 Markdown 文件。
下次你提问时,AI 不会去翻原始文档。它直接读取已经构建好的 wiki。
联系已经在里面了。
综合已经反映了你读过的所有内容。
你每添加一个新来源,wiki 就更丰富。你每问一个问题,答案也可以被归档回去。知识在累积,而不是重置。
他的成果:一个研究主题下约 100 篇文章,约 40 万字。他一个字都没写。AI 编写、链接、分类和维护了所有这些内容。
没有数据库。没有嵌入。没有向量存储。只有文件夹和文本文件。
为什么你应该在意?
三个此刻就相关的用例:
如果你是创作者或营销人员,这是一个内容研究引擎。把竞品分析、热门文章、受众洞察扔进 raw/。wiki 会呈现你手动永远找不到的模式和角度。
如果你是创始人或顾问,这是你用于客户工作、市场研究或竞品分析的第二大脑。你生成的每份报告都会反馈到系统中。到第 3 个月,你的 AI 对领域的了解胜过大多数新员工。
如果你是学生或研究人员,这正是 Karpathy 实际构建它的目的。对几十篇论文进行深度研究,AI 追踪想法如何连接、作者在哪里有分歧、哪些空白仍然存在。
*这也可用于许多商业研发工作流。
在开始构建之前:你需要什么
→ 一个能读取本地文件的 AI 编码工具(Claude Code、Cursor、Codex 或类似工具)
→ 一个文本编辑器(推荐 Obsidian,但 VS Code、记事本等任何工具都行)
→ 10 份以上你关心主题的源文档
→ 30 分钟初始设置,之后每份来源 10 分钟
就这样。没有特殊软件。不需要创建账户。无需插件。
本文的其余部分是构建过程。7 个步骤。每个步骤都有你要粘贴到 AI 中的精确提示词。按顺序操作。
步骤 1:创建文件夹结构(2 分钟)
在你的机器上任意位置创建:
1my-knowledge-base/2├── raw/ # 你的源材料。AI 读取但从不修改。3│ └── assets/ # 图片、截图、图表4├── wiki/ # AI 维护的 wiki。你阅读。AI 编写。5├── outputs/ # 报告、分析、查询答案6└── CLAUDE.md # 使这一切运转的模式文件
三个文件夹,一个文件。如果在此花费超过 2 分钟,那你在过度思考。
步骤 2:编写你的模式文件(大家都会跳过的步骤。别跳过。)
模式是区分通用聊天机器人和有纪律的 wiki 维护者的关键。
它告诉你的 AI 知识库是关于什么的,如何组织,以及当你添加来源、提问或运行维护时该做什么。
其他所有指南都会给你一个 10 行的模板。以下是完整的生产级模式,基于 Karpathy 的 Gist,为实际使用而设计:
1# 知识库模式23## 身份标识4这是关于 [你的主题] 的个人知识库。5由 LLM Agent 维护。人类负责策划来源和提问。LLM 负责其他所有事情。67## 架构8- raw/ 包含不可变的源文档。永远不要修改 raw/ 中的文件。9- wiki/ 包含编译后的 wiki。LLM 完全拥有此目录。10- outputs/ 包含生成的报告、分析和查询答案。1112## Wiki 约定13- 每个主题在 wiki/ 中拥有自己的 .md 文件14- 每个 wiki 文件以 YAML 前置元数据开始:15 ---16 title: [主题名称]17 created: [日期]18 last_updated: [日期]19 source_count: [为此页面提供信息的原始来源数量]20 status: [draft | reviewed | needs_update]21 ---22- 前置元数据之后,是一段摘要23- 使用 [[topic-name]] 作为 wiki 页面之间的内部链接24- 每个事实性声明引用其来源:[来源:filename.md]25- 当新内容与现有内容矛盾时,明确标记:26 > 矛盾:[旧声明] vs [新声明] 来自 [来源]2728## 索引与日志29- wiki/index.md 列出每个页面及其一行描述,按类别分类30- wiki/log.md 是仅追加的按时间顺序记录31- 日志条目格式:## [YYYY-MM-DD] 操作 | 描述32 (操作:ingest, query, lint, update)3334## 摄取工作流35处理新来源时:361. 完整读取源文档372. 与用户讨论关键要点383. 在 wiki/ 中创建或更新摘要页面394. 更新 wiki/index.md405. 更新 wiki/ 中所有相关的实体和概念页面416. 从现有页面添加反向链接到新内容427. 标记与现有 wiki 内容的任何矛盾438. 在 wiki/log.md 中追加条目449. 单个来源应涉及 10-15 个 wiki 页面4546## 查询工作流47回答问题:481. 首先读取 wiki/index.md 找到相关页面492. 读取所有相关 wiki 页面503. 综合答案,附带 [来源:页面名称] 引用514. 如果答案揭示了新见解,提供将其归档回 wiki/ 的选项525. 将有价值的答案保存到 outputs/5354## Lint 工作流(每月)55检查:56- 页面之间的矛盾57- 被更新来源取代的过时声明58- 没有入站链接的孤立页面59- 提到但从未解释的概念60- 缺少的交叉引用61- 没有来源归属的声明62输出:wiki/lint-report-[日期].md,带有严重程度级别6364## 关注领域65[列出该知识库涵盖的 3-5 个主题]
复制这段。自定义关注领域。将其放在项目根目录下,命名为 CLAUDE.md。
步骤 3:填充你的 Raw 文件夹(10 分钟倾倒,零整理)
打开 raw/,把所有东西都丢进去:
→ 将文章复制粘贴为 .md 或 .txt 文件
→ 从你当前使用的任何应用中导出笔记
→ 将截图和图表保存到 raw/assets/
→ 粘贴研究论文、PDF、竞品分析
→ 倾倒你囤积了几个月的书签
不要整理。不要重命名。不要清理。那是 AI 的工作。
来自 Karpathy 的专业提示:Obsidian Web Clipper 浏览器扩展只需一次点击即可将任何网页文章转换为 Markdown。
设置一个快捷键(设置 → 快捷键 → "下载附件")来将所有图片拉取到本地,以便 AI 可以引用它们。
如果你不使用 Obsidian,从浏览器复制粘贴也很好用。
目标是数量。不是完美。
步骤 4:运行你的首次摄取
打开你的 AI Agent。让它指向你的项目文件夹。粘贴以下内容:
摄取提示词:
1"读取 CLAUDE.md 中的模式。然后处理 raw/ 中的 [文件名]。完整阅读它,与我讨论关键要点,然后:在 wiki/ 中创建摘要页面,更新 wiki/index.md,更新所有相关的概念和实体页面,添加反向链接,标记任何矛盾,并在 wiki/log.md 中追加条目。"
一次从一个来源开始。Karpathy 也是这么做的。阅读摘要。检查更新。引导 AI 强调什么。这比一次性批量处理所有内容会带来更好的结果。
在 5-10 个来源之后,你的 wiki/ 文件夹将拥有一个索引、一个日志以及 15-30 个相互关联的页面。
那时一切就变得有意义了。
步骤 5:开始查询你的知识库
一旦你有了 10 个以上的 wiki 页面,系统就会变得真正有用。粘贴以下内容:
查询提示词:
1"读取 wiki/index.md。基于知识库中的内容,回答:[你的问题]。引用哪些 wiki 页面为你的答案提供了信息。如果这揭示了值得保留的新联系,请在 wiki/ 中创建一个新页面并更新索引。"
最能提取价值的问题:
→ "这个知识库中最大的三个空白是什么?"
→ "哪些来源互相矛盾,在哪方面?"
→ "基于现有内容,我下一步应该研究什么?"
→ "仅使用 wiki 内容写一篇关于 [主题] 的 500 字简报"
→ "[概念 A] 和 [概念 B] 之间有什么联系?"
关键循环:好的答案应该被归档回 wiki。
一个比较、一个分析、你发现的一个联系。
它们和摄入的来源一样在知识库中累积。
每一个问题都会让下一个答案更好。
步骤 6:运行月度健康检查
这是没有人做的步骤。这是防止整个系统慢慢腐烂的步骤。粘贴以下内容:
Lint 提示词:
1"根据 CLAUDE.md 中的 lint 工作流,对 wiki/ 进行全面健康检查。输出到 wiki/lint-report-[日期].md,带有严重程度级别(🔴 错误,🟡 警告,🔵 信息)。建议 3 篇文章来填补最大的知识空白。"
为什么这很重要:当 AI 写了稍微错误的内容,你把它保存回去时,下一个答案就建立在错误之上。
两个月后,你有五页都在强化同一个错误。健康检查在它滚雪球之前就抓住了它。
每月检查一次。花费你十分钟时间。如果你希望系统保持可信赖,这一点不可协商。
步骤 7:让它累积
这就是系统体现价值的地方。
在持续使用 4-6 周后,你不再只是搜索笔记。
你在查询一个结构化的知识系统,它比你更了解你的来源之间的联系。
三种加速累积的方法:
将探索输出归档回去:当 AI 生成你认为有价值的比较或分析时,将其保存到 wiki/ 或 outputs/。
Karpathy 说他自己探索和查询"总是会累积"到知识库中。
添加视觉输出:让 AI 将答案渲染为 Markdown 表格、图表或幻灯片(Marp 格式)。
这些成为可重复使用的资产,而不是一次性的聊天消息。
对一切进行版本控制:你的 wiki 只是 Markdown 文件。
初始化一个 git 仓库。你就能获得完整历史、分支,以及撤销 AI 搞砸的任何事情的能力。
好了。构建过程就是这些。现在来看没有人会告诉你的部分。
这个系统在哪里会失效(诚实版)
这是一个新兴的模式,而不是一个成品。Karpathy 自己称其为"一组粗糙的脚本",并说还有真正的产品空间。
在你信任你的知识给它之前,你需要了解以下内容:
上下文窗口上限。
Karpathy 的 wiki 在大约 100 篇文章和 40 万字的情况下工作。但即使是 128K 令牌的上下文窗口也只能容纳约 9.6 万字。AI 通过索引选择性读取,这意味着它可能会遗漏一些内容。研究表明,LLM 存在"迷失在中间"效应,即长输入中间的信息会被降低优先级。你的查询结果会有盲点。接受这一点。
错误累积。
AI 写了一个 wiki 页面,带有一个细微的错误。你针对它进行查询。这个错误进入了你的答案。你把那个答案归档回去。现在两个页面强化了同一个错误。每月的 lint 检查有帮助,但进行 lint 检查的 AI 和制造错误的 AI 有同样的盲点。这是最大的单一风险。Karpathy 的 Gist 上的一条评论一针见血:"当输出被归档回去时,错误也会累积。"
幻觉不会消失。
Wiki 方法减少了幻觉,因为 AI 将答案基于你的来源。但它并没有消除幻觉。AI 仍然可以综合出来源材料中不存在的联系。而且因为 wiki 看起来权威(干净的 Markdown、交叉引用、引用),你更有可能相信错误的信息。不要相信它。
成本并非为零。
每次摄入、每次查询、每次 lint 检查都会消耗令牌。一个触及 10-15 页的单一来源,使用前沿模型可能会花费 2-5 美元的 API 调用。50 个来源仅摄入就需要 100-250 美元。比研究助理便宜。但不是免费的。
它无法扩展到企业级。
Karpathy 说索引文件方法在没有 RAG 的情况下适用于约 100 篇文章。在 10,000+ 来源时,这种模式就会失效。索引变得太大。跨数千页的一致性变得不可能。你需要这个系统旨在避免的基础设施。了解这个天花板。
单一模型的盲点。
你的整个 wiki 是一个模型对你来源的解释。那个模型有偏见和倾向性。对于高风险的决策,一个 Gist 评论者建议独立地通过 4 个以上的模型运行查询,然后比较一致性。更稳健。也要花 4 倍的成本。
该怎么办
→ 错误累积:每月 lint 检查。手动交叉检查关键声明。在高风险决策上永远不要盲目相信 wiki。
→ 上下文限制:保持每个 wiki 专注于一个领域。多个领域?多个知识库。
→ 成本:对摄入和复杂查询使用前沿模型。对简单的更新使用更便宜的模型。
→ 幻觉:上面的模式要求每个声明都有来源引用。如果一个页面在没有 [来源:文件名] 的情况下做出声明,lint 会标记它。
→ 规模:接受这是一个个人工具,而不是企业基础设施。如果你超越了它,那是个好问题。
为什么它仍然重要
尽管有以上所有问题,这仍然是目前可用的最实用的个人知识系统。
原因非常简单:人类放弃 wiki 是因为维护的增长速度超过了价值。
你开始整理,感觉很好两周,然后维护工作扼杀了动机,你再也不会碰它。
LLM 不会感到厌倦。它们不会忘记更新交叉引用。它们可以在一次操作中触及 15 个文件而不抱怨。
Lex Fridman 证实他运行了类似的设置。
他生成交互式 HTML 可视化,并创建"迷你知识库"加载到语音模式中,用于 7-10 英里的跑步。
来自 DAIR.AI 的 Elvis Saravia 一直在为 AI 研究策划构建 LLM 知识库。
Karpathy 的 Gist 发布 48 小时内,多个开源实现出现在 GitHub 上。
这不再是一个实验。
它正在成为任何做严肃研究的人的标准做法。
你的完整提示词库(复制所有内容)
本文中的所有提示词,收集在一起:
模式:步骤 2 中的完整 CLAUDE.md 模板。
摄取(一个来源):
1"读取 CLAUDE.md 中的模式。处理 raw/ 中的 [文件名]。完整阅读它,与我讨论关键要点,然后:创建摘要页面,更新索引,更新所有相关页面,添加反向链接,标记矛盾,记录摄入。"
摄取(批量,较少监督):
1"读取 CLAUDE.md。按顺序处理 raw/ 中所有未处理的文件。对每个文件:创建摘要,更新索引,更新相关页面,记录摄入。自动进行。"
查询:
1"读取 wiki/index.md。回答:[问题]。引用 wiki 页面。如果这个答案值得保留,提议将其作为新的 wiki 页面归档。"
Lint:
1"根据 CLAUDE.md 中的 lint 工作流,对 wiki/ 进行全面健康检查。输出到 wiki/lint-report-[日期].md,带有 🔴/🟡/🔵 严重程度。建议 3 篇文章来填补空白。"
探索:
1"读取 wiki/index.md,找出现有主题之间 5 个最有趣但尚未探索的联系。对每个联系,解释它可能揭示什么洞见,以及什么来源有助于确认它。"
简报:
1"基于 wiki/ 中的所有内容,就 [主题] 写一份 500 字的高管简报。引用来源。结构为:当前状态、关键矛盾、未解决问题、建议下一步行动。"
去构建它
收藏 Karpathy 的 Gist 和从中受益之间的区别,就是一个下午。
选择你的主题。创建文件夹。复制模式。
把你已有的东西放进去。运行你的首次摄入。
然后明天再用另一个来源做一次。
下周再加五个。
Wiki 每次都会变得更聪明。这就是全部意义。
三个文件夹。一个模式。
一个 AI 来做你永远不会自己做的苦力。
停止收集书签。开始积累知识。
将 Claude 变成 20 多个不同的营销和商业专家。
安装真正的专业知识,而不仅仅是提示词。
获取我的 Claude 技能包 👇





