100 000 personnes ont mis en favori le post de @karpathy :
Puis il a publié un GitHub Gist complet. 5 000+ étoiles. 1 400+ forks. Deux jours.
La plupart des gens le mettront aussi en favori. Et ne feront rien.
Pas parce que c'est difficile. Parce que personne ne leur a donné les prompts exacts.
Je vais corriger ça.
Je vais vous guider pas à pas dans le système complet, vous donner les prompts prêts à copier-coller pour chaque étape, et vous dire où ça casse, pour que vous ne perdiez pas un week-end sur quelque chose qui s'effondre à grande échelle.
« Le travail de l'humain est de choisir les sources, diriger l'analyse, poser les bonnes questions et réfléchir à ce que tout cela signifie. Le travail du LLM est tout le reste. » — Andrej Karpathy
Le concept (version 60 secondes)
Vous avez des connaissances éparpillées partout. Des articles sauvegardés dans 4 applis. Des favoris de 2023 que vous ne reverrez jamais. Des notes de réunions qui vivent dans un dossier dont vous avez oublié l'existence.
Actuellement, quand vous posez une question à une IA sur vos propres données, elle repart de zéro à chaque fois. Téléchargez des docs, posez une question, obtenez une réponse. Session suivante ? Elle a tout oublié. C'est comme ça que fonctionnent les téléchargements de fichiers sur ChatGPT, NotebookLM et la plupart des systèmes RAG. Zéro accumulation.
L'idée de Karpathy renverse cela.
Au lieu que l'IA cherche dans vos fichiers bruts à chaque fois, l'IA lit vos sources une fois et compile un wiki structuré. Résumés, références croisées, connexions entre les idées, contradictions signalées.
Le tout maintenu par l'IA. Le tout dans de simples fichiers markdown.
La prochaine fois que vous posez une question, l'IA ne fouille pas dans les documents bruts. Elle lit le wiki qu'elle a déjà construit.
Les connexions sont déjà là.
La synthèse reflète déjà tout ce que vous avez lu.
Chaque nouvelle source que vous ajoutez enrichit le wiki. Chaque question que vous posez peut être réintégrée. Les connaissances s'accumulent au lieu de se réinitialiser.
Son résultat : ~100 articles, ~400 000 mots sur un seul sujet de recherche. Il n'en a pas écrit un mot. L'IA a tout écrit, lié, catégorisé et maintenu.
Pas de base de données. Pas d'embeddings. Pas de vector store. Juste des dossiers et des fichiers texte.
Pourquoi devriez-vous vous y intéresser ?
Trois cas d'usage qui comptent dès maintenant :
Si vous êtes créateur ou marketeur, c'est un moteur de recherche de contenu. Balancez des analyses de concurrents, des articles tendances, des insights sur l'audience dans raw/. Le wiki fait ressortir des motifs et des angles que vous ne trouveriez jamais manuellement.
Si vous êtes fondateur ou consultant, c'est votre deuxième cerveau pour le travail client, l'étude de marché ou l'analyse concurrentielle. Chaque rapport que vous générez alimente le système. Au bout de trois mois, votre IA connaît votre domaine mieux que la plupart des employés.
Si vous êtes étudiant ou chercheur, c'est pour ça que Karpathy l'a construit. Recherche approfondie sur des dizaines d'articles, l'IA suivant comment les idées se connectent, où les auteurs divergent, et quelles lacunes subsistent.
*Cela peut aussi être utilisé pour beaucoup de workflows de R&D en entreprise.
Avant de construire : ce dont vous avez besoin
→ Un outil de codage IA qui lit les fichiers locaux (Claude Code, Cursor, Codex, ou similaire)
→ Un éditeur de texte (Obsidian recommandé, mais VS Code, Notepad, n'importe quoi fonctionne)
→ 10+ documents sources sur un sujet qui vous intéresse
→ 30 minutes pour la configuration initiale, puis 10 minutes par source après
C'est tout. Pas de logiciel spécial. Pas de comptes à créer. Pas de plugins à installer.
La suite de cet article est la construction. 7 étapes. Chaque étape contient le prompt exact que vous collerez dans votre IA. Suivez-les dans l'ordre.
Étape 1 : Créer la structure de dossiers (2 minutes)
Créez ceci n'importe où sur votre machine :
1my-knowledge-base/2├── raw/ # Vos documents sources. L'IA lit mais ne modifie jamais.3│ └── assets/ # Images, captures d'écran, diagrammes4├── wiki/ # Wiki géré par l'IA. Vous lisez. L'IA écrit.5├── outputs/ # Rapports, analyses, réponses aux requêtes6└── CLAUDE.md # Le fichier de schéma qui fait fonctionner tout ça
Trois dossiers, un fichier. Si vous passez plus de 2 minutes ici, vous réfléchissez trop.
Étape 2 : Écrire votre fichier de schéma (l'étape que tout le monde saute. Ne la sautez pas.)
Le schéma est la différence entre un chatbot générique et un mainteneur de wiki discipliné.
Il indique à votre IA de quoi parle la base de connaissances, comment l'organiser et quoi faire lorsque vous ajoutez des sources, posez des questions ou effectuez une maintenance.
Tous les autres guides vous donnent un modèle de 10 lignes. Voici le schéma de production complet, basé sur le gist de Karpathy, conçu pour une utilisation réelle :
1# Schéma de la base de connaissances23## Identité4Ceci est une base de connaissances personnelle sur [VOTRE SUJET].5Maintenue par un agent LLM. L'humain sélectionne les sources et pose les questions. Le LLM fait tout le reste.67## Architecture8- raw/ contient les documents sources immuables. NE JAMAIS modifier les fichiers dans raw/.9- wiki/ contient le wiki compilé. Le LLM possède entièrement ce dossier.10- outputs/ contient les rapports générés, les analyses et les réponses aux requêtes.1112## Conventions du wiki13- Chaque sujet a son propre fichier .md dans wiki/14- Chaque fichier wiki commence par un frontmatter YAML :15 ---16 title: [Nom du sujet]17 created: [Date]18 last_updated: [Date]19 source_count: [Nombre de sources brutes qui ont alimenté cette page]20 status: [draft | reviewed | needs_update]21 ---22- Après le frontmatter, un résumé d'un paragraphe23- Utilisez [[nom-du-sujet]] pour les liens internes entre les pages du wiki24- Chaque affirmation factuelle cite sa source : [Source : nomfichier.md]25- Lorsque de nouvelles informations contredisent le contenu existant, signalez-le explicitement :26 > CONTRADICTION : [ancienne affirmation] vs [nouvelle affirmation] de [source]2728## Index et journal29- wiki/index.md liste chaque page avec une description d'une ligne, par catégorie30- wiki/log.md est un enregistrement chronologique en ajout seul31- Format de l'entrée de journal : ## [AAAA-MM-JJ] action | Description32 (Actions : ingest, query, lint, update)3334## Workflow d'ingestion35Lors du traitement d'une nouvelle source :361. Lire l'intégralité du document source372. Discuter des points clés avec l'utilisateur383. Créer ou mettre à jour une page de résumé dans wiki/394. Mettre à jour wiki/index.md405. Mettre à jour TOUTES les pages d'entités et de concepts concernées dans le wiki416. Ajouter des backlinks depuis les pages existantes vers le nouveau contenu427. Signaler toute contradiction avec le contenu existant du wiki438. Ajouter une entrée dans wiki/log.md449. Une seule source doit toucher 10 à 15 pages wiki4546## Workflow de requête47Pour répondre à une question :481. Lire wiki/index.md d'abord pour trouver les pages pertinentes492. Lire toutes les pages wiki pertinentes503. Synthétiser la réponse avec des citations [Source : nom-de-page]514. Si la réponse révèle de nouvelles perspectives, proposer de la réintégrer dans wiki/525. Sauvegarder les réponses précieuses dans outputs/5354## Workflow de lint (mensuel)55Vérifier :56- Les contradictions entre les pages57- Les affirmations obsolètes remplacées par des sources plus récentes58- Les pages orphelines sans liens entrants59- Les concepts mentionnés mais jamais expliqués60- Les références croisées manquantes61- Les affirmations sans attribution de source62Sortie : wiki/lint-report-[date].md avec niveaux de gravité6364## Domaines d'intervention65[Listez 3 à 5 sujets couverts par cette base de connaissances]
Copiez ceci. Personnalisez les domaines d'intervention. Déposez-le dans la racine de votre projet sous le nom CLAUDE.md.
Étape 3 : Remplir votre dossier raw (10 minutes à déverser, zéro organisation)
Ouvrez raw/ et déversez tout dedans :
→ Copiez-collez des articles dans des fichiers .md ou .txt
→ Exportez les notes de l'application que vous utilisez actuellement
→ Sauvegardez les captures d'écran et diagrammes dans raw/assets/
→ Collez des articles de recherche, des PDF, des analyses de concurrents
→ Déversez les favoris que vous accumulez depuis des mois
Ne l'organisez pas. Ne renommez rien. Ne nettoyez pas. C'est le travail de l'IA.
Astuce de pro de Karpathy : l'extension de navigateur Obsidian Web Clipper convertit n'importe quel article web en markdown en un clic.
Définissez un raccourci clavier (Paramètres → Raccourcis → « Télécharger les pièces jointes ») pour récupérer toutes les images localement afin que l'IA puisse les référencer.
Si vous n'utilisez pas Obsidian, le copier-coller depuis votre navigateur fonctionne très bien.
L'objectif est le volume. Pas la perfection.
Étape 4 : Lancer votre première ingestion
Ouvrez votre agent IA. Pointez-le vers votre dossier de projet. Collez ceci :
PROMPT D'INGESTION :
1« Lis le schéma dans CLAUDE.md. Ensuite, traite [NOM_DU_FICHIER] depuis raw/. Lis-le entièrement, discute des points clés avec moi, puis : crée une page de résumé dans wiki/, mets à jour wiki/index.md, mets à jour toutes les pages de concepts et d'entités pertinentes, ajoute des backlinks, signale toute contradiction, et ajoute une entrée dans wiki/log.md. »
Commencez avec une source à la fois. Karpathy fait de même. Lisez les résumés. Vérifiez les mises à jour. Guidez l'IA sur ce qu'elle doit souligner. Cela donne des résultats nettement meilleurs que de tout traiter en lot d'un coup.
Après 5 à 10 sources, votre dossier wiki/ contiendra un index, un journal et 15 à 30 pages interconnectées.
C'est là que tout prend son sens.
Étape 5 : Interroger votre base de connaissances
Une fois que vous avez 10 pages wiki ou plus, le système devient réellement utile. Collez ceci :
PROMPT D'INTERROGATION :
1« Lis wiki/index.md. En fonction de ce qui se trouve dans la base de connaissances, réponds à : [VOTRE QUESTION]. Cite les pages wiki qui ont informé ta réponse. Si cela révèle de nouvelles connexions qui méritent d'être conservées, crée une nouvelle page dans wiki/ et mets à jour l'index. »
Questions qui extraient le plus de valeur :
→ « Quelles sont les trois plus grandes lacunes de cette base de connaissances ? »
→ « Quelles sources sont en désaccord entre elles, et sur quel point ? »
→ « Que devrais-je rechercher ensuite en fonction de ce qui est ici ? »
→ « Rédige un briefing de 500 mots sur [sujet] en utilisant uniquement le contenu du wiki »
→ « Quelles connexions existent entre [concept A] et [concept B] ? »
La boucle critique : les bonnes réponses doivent être réintégrées dans le wiki.
Une comparaison, une analyse, une connexion que vous avez découverte.
Celles-ci s'accumulent dans la base de connaissances tout comme les sources ingérées.
Chaque question rend la réponse suivante meilleure.
Étape 6 : Effectuer des bilans de santé mensuels
C'est l'étape que personne ne fait. C'est l'étape qui empêche tout le système de pourrir lentement. Collez ceci :
PROMPT DE LINT :
1« Effectue un bilan de santé complet du wiki/ conformément au workflow de lint dans CLAUDE.md. Produis la sortie dans wiki/lint-report-[date].md avec les niveaux de gravité (🔴 erreurs, 🟡 avertissements, 🔵 infos). Suggère 3 articles pour combler les plus grandes lacunes de connaissances. »
Pourquoi c'est important : quand l'IA écrit quelque chose de légèrement incorrect et que vous le sauvegardez, la réponse suivante se base sur cette erreur.
Deux mois plus tard, vous avez cinq pages qui renforcent la même erreur. Les bilans de santé détectent cela avant que ça ne prenne des proportions incontrôlables.
Un bilan par mois. Dix minutes de votre temps. Non négociable si vous voulez que le système reste fiable.
Étape 7 : Laissez la capitalisation opérer
C'est là que le système montre sa valeur.
Après 4 à 6 semaines d'utilisation régulière, vous ne faites pas que rechercher des notes.
Vous interrogez un système de connaissances structuré qui comprend les connexions entre vos sources mieux que vous.
Trois façons d'accélérer la capitalisation :
Réintégrez les résultats d'exploration : lorsque l'IA génère une comparaison ou une analyse que vous trouvez précieuse, sauvegardez-la dans wiki/ ou outputs/.
Karpathy dit que ses propres explorations et requêtes « s'ajoutent toujours » dans la base de connaissances.
Ajoutez des sorties visuelles : demandez à l'IA de rendre les réponses sous forme de tableaux markdown, de graphiques ou de présentations (format Marp).
Ceux-ci deviennent des assets réutilisables, pas des messages de chat jetables.
Versionnez tout : Votre wiki n'est que des fichiers markdown.
Initialisez un dépôt git. Vous obtenez un historique complet, des branches et la possibilité d'annuler tout ce que l'IA pourrait gâcher.
D'accord. Voilà la construction. Maintenant, voici la partie que personne d'autre ne vous dira.
Là où ce système casse (la version honnête)
C'est un modèle naissant, pas un produit fini. Karpathy lui-même l'a qualifié de « collection de scripts bricolés » et a dit qu'il y avait de la place pour un véritable produit.
Voici ce que vous devez savoir avant de lui confier vos connaissances :
Limite de fenêtre de contexte.
Le wiki de Karpathy fonctionne avec ~100 articles et ~400 000 mots. Mais même les fenêtres de contexte de 128 000 jetons ne contiennent que ~96 000 mots. L'IA lit sélectivement via l'index, ce qui signifie qu'elle peut manquer des choses. La recherche montre que les LLM souffrent d'effets de « perdus au milieu » où les informations au centre des longues entrées sont dépriorisées. Vos résultats de requête auront des angles morts. Acceptez-le.
Compounding d'erreurs.
L'IA écrit une page wiki avec une erreur subtile. Vous l'interrogez. L'erreur entre dans votre réponse. Vous réintégrez cette réponse. Maintenant deux pages renforcent la même erreur. Les lints mensuels aident, mais l'IA qui effectue le lint a les mêmes angles morts que celle qui a commis l'erreur. C'est le plus grand risque. Un commentateur sur le gist de Karpathy a mis le doigt dessus : « Quand les sorties sont réintégrées, les erreurs se cumulent aussi. »
Les hallucinations ne disparaissent pas.
L'approche wiki réduit les hallucinations car l'IA ancre les réponses dans vos sources. Mais cela ne les élimine pas. L'IA peut toujours synthétiser des connexions qui n'existent pas dans le matériel source. Et comme le wiki a l'air autoritaire (markdown propre, références croisées, citations), vous êtes plus susceptible de faire confiance à des informations incorrectes. Ne le faites pas.
Le coût n'est pas nul.
Chaque ingestion, chaque requête, chaque lint coûte des jetons. Une seule source qui touche 10 à 15 pages peut coûter entre 2 $ et 5 $ d'appels API avec des modèles de pointe. 50 sources, c'est 100 à 250 $ rien que pour l'ingestion. Moins cher qu'un assistant de recherche. Pas gratuit.
Cela ne passe pas à l'échelle de l'entreprise.
Karpathy dit que l'approche par fichier d'index fonctionne sans RAG pour ~100 articles. Avec plus de 10 000 sources, ce modèle se brise. L'index devient trop volumineux. La cohérence sur des milliers de pages devient impossible. Vous aurez besoin de l'infrastructure que ce système était conçu pour éviter. Connaissez le plafond.
Angles morts d'un seul modèle.
L'intégralité de votre wiki est l'interprétation d'un seul modèle de vos sources. Ce modèle a des biais et des tendances. Pour les décisions à fort enjeu, un commentateur du gist a suggéré d'exécuter les requêtes via 4 modèles ou plus indépendamment, puis de comparer l'accord. Plus robuste. Mais aussi 4 fois plus cher.
Que faire à ce sujet
→ Compounding d'erreurs : lints mensuels. Vérifiez manuellement les affirmations critiques. Ne faites jamais aveuglément confiance au wiki pour des décisions à fort enjeu.
→ Limites de contexte : gardez chaque wiki concentré sur un seul domaine. Plusieurs domaines ? Plusieurs bases de connaissances.
→ Coût : utilisez des modèles de pointe pour l'ingestion et les requêtes complexes. Des modèles moins chers pour les mises à jour simples.
→ Hallucination : le schéma ci-dessus exige des citations de source pour chaque affirmation. Si une page fait une affirmation sans [Source : nomfichier], le lint la signalera.
→ Échelle : acceptez que c'est un outil personnel, pas une infrastructure d'entreprise. Si vous le dépassez, c'est un bon problème.
Pourquoi c'est quand même important
Malgré tout ce qui précède, c'est le système de connaissances personnel le plus pratique disponible actuellement.
La raison est très simple : les humains abandonnent les wikis parce que la maintenance croît plus vite que la valeur.
Vous commencez à organiser, ça fait du bien pendant deux semaines, puis l'entretien tue la motivation et vous n'y touchez plus jamais.
Les LLM ne s'ennuient pas. Ils n'oublient pas de mettre à jour une référence croisée. Ils peuvent toucher 15 fichiers en une seule passe sans se plaindre.
Lex Fridman a confirmé qu'il utilise une configuration similaire.
Il génère des visualisations HTML interactives et crée des « mini-bases de connaissances » qu'il charge en mode vocal pour des courses de 7 à 10 miles.
Elvis Saravia de DAIR.AI construit des bases de connaissances LLM pour la curation de recherche en IA.
Plusieurs implémentations open source sont apparues sur GitHub dans les 48 heures suivant le gist de Karpathy.
Ce n'est plus une expérience.
Cela devient une pratique standard pour quiconque fait de la recherche sérieuse.
Votre bibliothèque de prompts complète (copiez tout)
Tous les prompts de cet article, rassemblés en un seul endroit :
SCHÉMA : Copiez le modèle complet de CLAUDE.md depuis l'étape 2.
INGESTION (une source) :
1« Lis le schéma dans CLAUDE.md. Traite [NOM_DU_FICHIER] depuis raw/. Lis-le entièrement, discute des points clés avec moi, puis : crée une page de résumé, mets à jour l'index, mets à jour toutes les pages pertinentes, ajoute des backlinks, signale les contradictions, enregistre l'ingestion. »
INGESTION (lot, moins supervisé) :
1« Lis CLAUDE.md. Traite séquentiellement tous les fichiers non traités dans raw/. Pour chacun : crée un résumé, mets à jour l'index, mets à jour les pages pertinentes, enregistre l'ingestion. Procède automatiquement. »
INTERROGATION :
1« Lis wiki/index.md. Réponds à : [QUESTION]. Cite les pages wiki. Si cette réponse mérite d'être conservée, propose de la déposer comme nouvelle page wiki. »
LINT :
1« Effectue un bilan de santé complet du wiki/ conformément au workflow de lint dans CLAUDE.md. Produis la sortie dans wiki/lint-report-[date].md avec les niveaux de gravité 🔴/🟡/🔵. Suggère 3 articles pour combler les lacunes. »
EXPLORATION :
1« Lis wiki/index.md et identifie les 5 connexions inexplorées les plus intéressantes entre les sujets existants. Pour chacune, explique quelle perspective elle pourrait révéler et quelle source aiderait à la confirmer. »
BRIEFING :
1« En te basant sur tout ce qui se trouve dans wiki/, rédige un briefing exécutif de 500 mots sur [SUJET]. Cite les sources. Structure-le ainsi : état actuel, tensions clés, questions ouvertes, prochaines étapes recommandées. »
Allez le construire
La différence entre mettre en favori le gist de Karpathy et en bénéficier est un après-midi.
Choisissez votre sujet. Créez les dossiers. Copiez le schéma.
Déposez ce que vous avez déjà. Lancez votre première ingestion.
Puis recommencez demain avec une autre source.
Et la semaine prochaine avec cinq de plus.
Le wiki devient plus intelligent à chaque fois. C'est tout l'intérêt.
Trois dossiers. Un schéma.
Une IA qui fait le travail ingrat que vous ne feriez jamais vous-même.
Arrêtez de collectionner les favoris. Commencez à compiler les connaissances.
Transformez Claude en 20+ spécialistes différents pour le marketing et les affaires.
Installez une expertise réelle, pas seulement des prompts.
Obtenez mon pack de compétences Claude 👇





