Guide de l'IA pour débutants : 66 termes d'IA courants expliqués simplement

@AdrianPunk115
CHINOIS30 août 2026
137K
522
91
18
1.1K

TL;DR

Cet article décrypte 66 termes courants liés à l'IA en utilisant un langage simple et quotidien, aidant les débutants à appréhender facilement des concepts tels que les LLM, les Agents, le RAG et le MCP.

Récemment, j'ai rencontré des anciens collègues et amis hors ligne. Sachant que je travaille sur du contenu lié à l'IA, ils sont tous très intéressés, et nos conversations tournent naturellement autour de l'IA.

Mais en discutant, j'ai remarqué un problème.

Je mentionnais naturellement des termes comme Agent, Skill et MCP, en supposant que tout le monde les connaissait. Cependant, mon interlocuteur marquait une pause et demandait : « C'est quoi exactement un Agent ? » « Qu'est-ce que ça veut dire, Skill ? »

À ce moment-là, j'ai réalisé que j'étais tombé dans la « malédiction de la connaissance ». Quand on voit et utilise trop un mot, on oublie qu'on a aussi été perdu la première fois qu'on l'a vu.

Il y a quelques mois, j'étais moi aussi submergé par ces abréviations anglaises. À cette époque, j'ai publié « Les bases quotidiennes de l'IA pour les débutants », apprenant un mot par jour pendant près de 30 jours, en passant en revue un à un un lot de vocabulaire IA couramment utilisé.

Comme de plus en plus de gens me posent des questions récemment, j'ai décidé de rendre ce contenu encore plus complet.

J'ai compilé 66 termes d'IA que je considère comme très fréquents et je les ai expliqués en langage simple. Pour chaque mot, je vous dirai : ce que c'est, où vous le rencontrerez, et quel scénario de la vie réelle le rend le plus facile à retenir.

Vous n'avez pas besoin de tous les mémoriser d'un coup. Lisez-les simplement une fois pour que la prochaine fois que vous verrez LLM, RAG, Agent, MCP, API ou CLI, vous sachiez au moins à peu près où ils se situent dans le monde de l'IA.

Adrian Punk - inline image

I. Comprendre d'abord l'IA et les grands modèles

Ce groupe répond à deux questions : Qu'est-ce que l'IA, et que traitent les grands modèles de langage quand ils parlent ? Une fois que vous aurez compris cette carte, les termes suivants seront beaucoup plus faciles.

L'IA consiste à faire faire aux machines des tâches qui nécessitent généralement la compréhension, le jugement, la prédiction ou la création humaines. Le déverrouillage du visage sur les téléphones, les prévisions de trafic sur les cartes, les recommandations vidéo sur les plateformes et les chatbots qui répondent aux questions font tous partie de l'IA. C'est un terme générique très large ; les outils de chat ne sont qu'un type d'application.

Un algorithme est un ensemble clair d'étapes pour résoudre un problème, un peu comme une recette de cuisine. Une recette dicte de couper les légumes d'abord, puis de chauffer la poêle, et enfin d'assaisonner ; un algorithme dicte ce que l'ordinateur lit d'abord, comment il compare, et enfin ce qu'il produit. De nombreux algorithmes traditionnels ne peuvent pas du tout discuter ; les algorithmes d'IA ne sont qu'une partie de la famille des algorithmes.

Le TALN (Traitement Automatique du Langage Naturel) est le domaine technique qui permet aux ordinateurs de traiter le langage humain. La traduction, le résumé, la recherche, la reconnaissance vocale et la discussion sont tous liés à cela. Lorsque vous saisissez une question familière et que l'IA comprend le sens général et répond, elle utilise des capacités de traitement du langage naturel.

Adrian Punk - inline image

Les LLM sont des modèles de langage entraînés avec d'énormes quantités de texte et de calcul, spécialisés dans la compréhension et la génération de texte. Les modèles ou familles de modèles courants incluent GPT d'OpenAI, Claude d'Anthropic, Gemini de Google, ainsi que DeepSeek et Qwen. Il est important de distinguer le produit du modèle : ChatGPT est le produit que vous ouvrez et utilisez, tandis que GPT est la famille de modèles qu'il pourrait appeler en arrière-plan.

Les SLM sont des modèles de langage de plus petite taille et aux besoins de calcul réduits. Actuellement, il n'existe pas de limite de paramètres unifiée à l'échelle mondiale. Les exemples courants incluent la série Phi de Microsoft et les versions à petits paramètres de familles de modèles comme Gemma et Qwen. Leur champ de connaissances peut être plus restreint, mais pour des tâches fixes comme le résumé, la classification ou les assistants sur appareil, ils peuvent être plus rapides, moins chers et plus faciles à exécuter sur des téléphones ou des ordinateurs standard.

Adrian Punk - inline image

Les tokens sont les petits morceaux que les modèles utilisent pour lire et écrire du texte. Ils ne correspondent pas exactement à un caractère chinois, un mot anglais ou un signe de ponctuation. Le modèle divise une phrase en plusieurs tokens avant de calculer. La facturation et la capacité du contexte sont également souvent comptées en tokens. Considérez-les simplement comme les « blocs de construction » que l'IA utilise pour traiter le texte.

Le contexte est toutes les informations auxquelles l'IA peut actuellement se référer, y compris votre question, les dialogues précédents, les fichiers téléchargés, les règles système et les résultats des outils. Comme une consultation chez un médecin, la même phrase « Je ne me sens pas bien » conduira à des jugements différents selon qu'il y a l'âge, les symptômes et les résultats d'analyse. Plus le contexte fourni à l'IA est clair, plus sa réponse sera fondée.

La fenêtre de contexte est la quantité maximale d'informations qu'un modèle peut traiter à la fois, généralement exprimée en tokens. C'est comme un bureau de taille limitée : il y a une limite au nombre de documents que l'on peut étaler à la fois. Lorsque le contenu dépasse cette limite, le système doit tronquer, résumer, traiter par lots ou laisser les informations précédentes sortir de la fenêtre.

La longueur du contexte a souvent deux significations : le nombre maximum de tokens qu'un modèle autorise, ou les tokens réellement utilisés dans une requête spécifique. Le premier est comme la surface maximale du bureau ; le second est comme les documents que vous avez réellement étalés cette fois-ci. Quand les produits font de la publicité pour un « contexte ultra-long », ils font généralement référence à la capacité maximale.

Adrian Punk - inline image

Les MLLM peuvent traiter des informations au-delà du texte, comme des images, de l'audio ou de la vidéo. Si vous lui donnez une photo d'un réfrigérateur, il peut voir les ingrédients et recommander un dîner en fonction des exigences textuelles ; si vous téléchargez un enregistrement de réunion, il pourrait organiser les points clés après avoir écouté. « Multimodal » fait ici référence à plusieurs formes d'information.

Le VLM relie spécifiquement la vision et le langage, traitant principalement des tâches comme « regarder une image et comprendre ou répondre avec du texte ». Il peut écrire des légendes pour des photos, identifier le contenu d'un graphique ou trouver des boutons basés sur des captures d'écran. Le VLM met l'accent sur la coordination de la vision et du langage, et sa portée est généralement plus spécifique que le terme général de modèle multimodal.

Le MoE organise plusieurs ensembles d'« experts » à l'intérieur du modèle, ne laissant qu'une partie d'entre eux participer aux calculs à chaque fois. C'est comme un triage à l'hôpital : les problèmes de peau vont en dermatologie, les blessures osseuses en orthopédie, plutôt que de faire consulter tous les médecins en même temps. Cela permet d'étendre la capacité du modèle tout en contrôlant le calcul nécessaire à chaque exécution.

Adrian Punk - inline image

Après avoir lu ce groupe, vous devez juste distinguer : Le LLM traite principalement le langage, le VLM relie les images et le langage, et le MLLM peut gérer plusieurs types d'informations. Les tokens sont des blocs de texte, et le Contexte est le matériau auquel le modèle peut se référer cette fois-ci.

II. Termes les plus courants lors des discussions avec l'IA

Ce groupe est utilisé tous les jours. Les prompts sont chargés d'assigner des tâches, le contexte fournit des documents, et l'IA génère des réponses basées sur ces informations.

Un prompt est l'intégralité de l'entrée que vous donnez à l'IA, qui peut être une phrase, une question, un document ou une image. « Résume ce contrat en cinq risques » est un prompt. Les prompts n'ont pas besoin d'être écrits comme des formules magiques ; tant que l'objectif, les documents, les contraintes et les exigences de sortie sont clairs, l'IA a plus de chances de faire les choses correctement.

L'ingénierie des prompts est la méthode de conception, de test et d'amélioration des prompts. C'est un peu comme assigner du travail à un collègue : si le premier résultat est mauvais, vous vérifiez si la tâche était claire, si les documents étaient complets et si le format était spécifié, puis vous ajustez les instructions. Sa valeur réside dans la réduction des erreurs de communication et des reprises.

Un prompt système est un ensemble de règles à haute priorité définies en arrière-plan dans une application d'IA pour définir l'identité, le ton, le périmètre des capacités et les limites de sécurité. C'est comme le manuel de l'employé d'une entreprise ; les utilisateurs ne le voient généralement pas en entier. Si votre demande entre en conflit avec les règles système, le modèle donnera généralement la priorité au prompt système.

Un prompt utilisateur est la demande actuelle saisie par l'utilisateur — le contenu que vous envoyez dans la boîte de discussion. Le prompt système est comme les règles de fonctionnement du magasin, tandis que le prompt utilisateur est comme « S'il vous plaît, donnez-moi une boisson chaude avec moins de sucre ». Les deux affectent le résultat, c'est pourquoi la même phrase dans différents produits d'IA peut donner des réponses différentes.

Une instruction est une action claire que vous demandez à l'IA d'effectuer dans un prompt, comme résumer, traduire, comparer, classer ou vérifier. Un prompt complet peut également inclure des informations de contexte et des contraintes. Par exemple, « Lis l'e-mail ci-dessous, extrais la date et n'ajoute pas d'informations qui ne sont pas dans le texte original » contient deux instructions.

Adrian Punk - inline image

Le Markdown est un format pour mettre en forme du texte à l'aide de symboles simples.

  • # peut représenter un titre,
  • - peut représenter une liste,
  • \\texte\\ peut représenter du gras.

De nombreuses sorties d'IA semblent clairement structurées car elles utilisent le Markdown ; vous le rencontrerez souvent lorsque vous rédigerez des articles, des documents ou des descriptions de projet.

Le JSON est un format de données structuré couramment utilisé par les programmes, généralement composé d'accolades, de noms de champs et de contenu correspondant. C'est comme un tableur électronique avec des champs fixes que les humains peuvent lire et que les programmes peuvent facilement traiter. Demander à l'IA de « produire en JSON » est souvent fait pour permettre à un autre logiciel d'utiliser automatiquement les résultats.

Adrian Punk - inline image

L'historique de conversation fait référence aux messages qui sont apparus précédemment dans la discussion en cours. L'IA peut continuer un sujet d'il y a cinq minutes généralement parce que l'application renvoie les enregistrements de chat précédents au modèle. Après qu'une discussion est devenue trop longue, le contenu ancien peut être tronqué ou résumé, donc l'IA oublie parfois ce que vous avez dit au tout début.

L'hallucination se produit lorsque l'IA génère un contenu qui semble raisonnable mais qui est en fait erroné ou inexistant, comme inventer des titres de livres, des liens, des données ou des expériences personnelles. C'est comme une personne avec de grandes compétences linguistiques qui refuse d'admettre qu'elle « ne sait pas » et comble les lacunes. Vérifiez toujours les sources originales pour les dates, les chiffres, les citations et les décisions importantes.

Adrian Punk - inline image

Les choses les plus importantes à retenir de ce groupe : Le Prompt détermine comment vous demandez, le Contexte détermine ce à quoi l'IA peut se référer, et l'Hallucination vous rappelle que les réponses ont encore besoin d'être vérifiées.

III. Laisser l'IA lire les données : RAG et Recherche

Quand vous voyez « laisser l'IA lire les fichiers de l'entreprise » ou « construire une base de connaissances personnelle », vous rencontrerez probablement ce groupe de mots. Le chemin complet tient en une phrase : trouver d'abord les documents pertinents, puis laisser le modèle répondre.

Le RAG permet à l'IA de rechercher du contenu pertinent dans des documents spécifiés avant de répondre, puis transmet les extraits trouvés au modèle pour organiser la réponse. C'est comme un examen à livre ouvert : l'étudiant feuillette d'abord le manuel, puis répond en se basant sur celui-ci. Le RAG peut réduire les fabrications, mais il peut aussi rechercher les mauvais documents, donc les citations ont encore besoin d'être vérifiées par un humain.

Une base de connaissances est une collection de documents stockés de manière centralisée, organisés et disponibles pour les requêtes du système. Les manuels de produits, les documents de politique et les FAQ d'une entreprise mis ensemble peuvent devenir une base de connaissances pour le service client ; les notes, articles et enregistrements de lecture d'une personne peuvent également former une base de connaissances. L'exactitude et la mise à jour des documents affectent directement la qualité des réponses.

La recherche (Retrieval) consiste à trouver le contenu le plus pertinent dans un grand lot de documents. Un bibliothécaire qui écoute votre question et apporte les trois livres les plus appropriés parmi des dizaines de milliers, c'est la recherche. Dans le RAG, le modèle ne lit généralement pas toute la base de données d'abord, mais recherche quelques extraits pour répondre.

Adrian Punk - inline image

La recherche par mots-clés cherche principalement si certains mots apparaissent directement. Si vous recherchez « date limite de remboursement », il trouvera en priorité le contenu contenant « remboursement » et « date limite ». Cette méthode est rapide et bonne pour vérifier les numéros de produit, les noms et les termes fixes ; elle peut manquer des réponses si le style de questionnement et la formulation originale diffèrent considérablement.

La recherche sémantique se concentre davantage sur la proximité du sens de deux passages. Si vous recherchez « Je ne veux plus de ça, comment le retourner », il pourrait aussi trouver un document intitulé « Politique de retour ». Elle est adaptée aux questions en langage naturel, mais la compréhension peut dévier, donc les scénarios importants la combinent souvent avec la recherche par mots-clés.

La recherche hybride utilise à la fois la recherche par mots-clés et la recherche sémantique. Les numéros d'identification et les numéros de contrat sont adaptés à la correspondance exacte ; « comment demander un remboursement » nécessite de comprendre le sens. Les résultats des deux sont fusionnés et classés, tenant compte à la fois de la cohérence littérale et du sens similaire, une méthode adoptée par de nombreux systèmes RAG.

Adrian Punk - inline image

IV. Agent, Outils et MCP

C'est le groupe de mots le plus populaire et souvent le plus déroutant récemment. Agent, Skill et MCP, que j'ai le plus mentionnés en discutant avec des amis, sont tous dans ce chapitre.

D'abord, regardez le chemin le plus court :

text
1Vous proposez un objectif
2→ L'Agent décide de la prochaine étape
3→ Appelle des outils pour lire des données ou exécuter des actions
4→ Continue le traitement en fonction des résultats
5→ L'humain vérifie les étapes clés

Un chatbot est un logiciel qui répond principalement aux questions par le dialogue. Les premiers chatbots pouvaient seulement répondre sur la base de mots-clés fixes ; maintenant, de nombreux chatbots se connectent à de grands modèles pour des réponses plus naturelles. Son objectif reste « vous demandez, il répond », et il ne termine généralement pas de manière indépendante une longue série d'opérations externes.

Un Assistant IA ou Copilote est un produit d'IA qui aide les personnes à accomplir des tâches, comme aider à écrire, organiser des réunions, faire des tableurs ou programmer. La métaphore du « copilote » est facile à retenir : il peut observer, rappeler et aider, mais le volant est toujours entre les mains de l'humain, et le résultat final a besoin d'être vérifié par l'humain.

Adrian Punk - inline image

Un workflow est un ensemble d'étapes fixes pré-arrangées. Après avoir reçu une facture, identifier d'abord le montant, puis l'écrire dans un tableau, et enfin notifier la comptabilité, c'est un workflow. Chaque étape est généralement déterminée à l'avance, ce qui le rend stable et facile à vérifier ; il ne décidera pas de manière flexible de la prochaine étape comme un Agent lorsqu'il rencontre des situations imprévues.

Un Agent IA est un système qui peut décider de la prochaine étape autour d'un objectif, appeler des outils, observer les résultats et continuer à agir. Une discussion normale vous dira comment acheter un billet ; un Agent peut ouvrir un service de réservation, interroger les vols et remplir les informations dans les limites autorisées. Il peut agir, donc les autorisations, les erreurs et la confirmation humaine sont très importantes.

Adrian Punk - inline image

L'IA Agentique (Agentic AI) fait référence à une classe de systèmes ou d'approches de conception qui mettent l'accent sur la capacité de l'IA à planifier en continu, utiliser des outils et exécuter des tâches en plusieurs étapes. La portée de ce terme est large, et différentes entreprises utilisent des noms différents. Quand vous voyez un produit étiqueté « Agentique », vous pouvez continuer à demander trois choses : quels outils peut-il utiliser, combien d'étapes peut-il effectuer de lui-même, et où un humain doit-il confirmer.

L'autonomie fait référence au degré auquel un système peut décider et agir par lui-même sans direction humaine étape par étape. Organiser automatiquement une copie d'un fichier a une faible autonomie et un faible risque ; envoyer automatiquement des e-mails, effectuer des paiements ou supprimer des données augmente considérablement le risque. Plus la tâche est importante, plus les autorisations doivent être restreintes et les points de confirmation ajoutés.

La planification consiste à décomposer un objectif en étapes qui peuvent être exécutées en séquence. Comme préparer un voyage en confirmant d'abord les dates, puis en vérifiant le transport, en réservant l'hébergement et en faisant une liste de bagages. Les Agents planifient également lorsqu'ils rencontrent des tâches complexes ; un beau plan ne garantit pas une exécution réussie, et chaque étape accomplie nécessite de vérifier les résultats réels.

Un outil est une capacité externe que l'IA peut appeler, comme la recherche web, une calculatrice, une base de données, un calendrier et un e-mail. Le modèle lui-même est plus comme le cerveau responsable du jugement ; les outils lui donnent des mains et des yeux. Sans outils, le modèle ne peut répondre qu'en se basant sur le contexte existant ; après avoir connecté des outils, il a la chance d'interroger et d'agir.

L'appel d'outil (Tool calling) se produit lorsque le modèle sélectionne un outil selon des formats spécifiés et remplit les paramètres requis, que le programme exécute ensuite et dont il retourne le résultat au modèle. C'est comme un manager qui remplit un bon de travail pour qu'un employé l'opère. Le modèle est responsable de juger « quoi appeler », et le code spécifique est responsable d'effectuer la requête, le calcul ou l'écriture.

Adrian Punk - inline image

Un plugin est un paquet d'extension installé dans un logiciel pour ajouter des fonctionnalités. Un navigateur peut traduire des pages web après avoir installé un plugin de traduction ; une application d'IA pourrait se connecter à des fichiers, des calendriers ou des services tiers après avoir installé un plugin. Les plugins dépendent généralement de produits spécifiques, et ce qu'ils peuvent faire dépend des interfaces et des autorisations fournies par le produit.

Une compétence (Skill) est un ensemble réutilisable d'instructions, de scripts et de ressources qui apprennent à un Agent à accomplir de manière stable un certain type de tâche. C'est comme un manuel d'opérations standard pour un employé : quels documents lire d'abord, quelles étapes suivre et comment vérifier les résultats, tout est clairement écrit. Un prompt résout souvent une tâche ponctuelle, tandis qu'une compétence est plus adaptée pour exécuter de manière répétée le même type de travail.

Le MCP est un protocole ouvert qui permet aux applications d'IA de se connecter à des données et outils externes. La meilleure métaphore est l'USB-C du monde de l'IA : avant, chaque outil devait être adapté individuellement ; maintenant, ils peuvent fournir des capacités selon la même norme de connexion. Il résout « comment se connecter », mais ne décide pas des objectifs de la tâche pour l'Agent.

Un Hôte MCP (MCP Host) est l'application d'IA que l'utilisateur utilise réellement, comme un assistant de bureau, un éditeur de code ou une plateforme Agent. Il est responsable de la gestion des utilisateurs, des modèles, des autorisations de sécurité et des multiples connexions. Considérez l'Hôte comme un ordinateur : c'est l'environnement d'utilisation complet et l'endroit où réside le Client MCP.

Le Client MCP est situé à l'intérieur de l'Hôte et est responsable de l'établissement et du maintien de la communication avec un Serveur MCP spécifique. Il découvre quels outils et documents le Serveur fournit et envoie des demandes d'appel. Comme un ordinateur se connectant à une imprimante, un canal de communication dédié est nécessaire en interne pour gérer cette connexion.

Un Serveur MCP (MCP Server) est un programme qui fournit des outils, des documents ou des modèles de prompts aux applications d'IA selon les spécifications MCP. Avoir « Serveur » dans le nom ne signifie pas qu'il doit être distant ; il peut aussi fonctionner sur votre ordinateur. Par exemple, un Serveur de fichiers local peut permettre à l'IA de lire des fichiers dans des répertoires autorisés.

Adrian Punk - inline image

Un Outil MCP (MCP Tool) est une action spécifique que le Serveur fournit pour que l'IA demande son exécution, comme interroger la météo, créer un rendez-vous, lire une base de données ou envoyer un message. Chaque Outil spécifie les paramètres dont il a besoin. Les actions de requête ont un risque plus faible, tandis que l'envoi, la suppression ou le paiement doivent avoir des autorisations et une confirmation claires.

Une Ressource MCP (MCP Resource) est un contenu fourni via MCP pour que l'IA le lise, comme des fichiers, des enregistrements de base de données, des structures de projet ou des états d'application. C'est plus comme des documents placés sur un bureau, tandis qu'un Outil est plus comme un bouton sur lequel on peut appuyer. La possibilité de lire une ressource dépend toujours des autorisations d'accès définies par l'Hôte et le Serveur.

Un Prompt MCP (MCP Prompt) est un modèle de prompt réutilisable fourni par le Serveur pour aider les utilisateurs à lancer des tâches de manière fixe. C'est comme un modèle de tableau pré-installé, organisant les champs et la structure de la tâche à remplir. Il n'exécute pas automatiquement les actions ; il doit encore être sélectionné par l'utilisateur et traité par le modèle.

Adrian Punk - inline image

La mémoire est une information que le système sauvegarde et réutilise plus tard, qui peut inclure des résumés de la discussion en cours, des préférences utilisateur, des tâches historiques et des données à long terme. Quand une IA « se souvient de vous », cela signifie généralement que cette information est stockée et fournie à nouveau au modèle dans les dialogues suivants. La mémoire affecte l'expérience et nécessite également une attention à la vie privée et aux méthodes de suppression.

Adrian Punk - inline image

L'humain dans la boucle (Human in the loop) signifie que les étapes clés doivent être vérifiées, sélectionnées ou approuvées par une personne. L'IA peut organiser une liste de remboursements et remplir des brouillons, mais le transfert réel est confirmé par la comptabilité. Cela utilise la rapidité de l'IA tout en évitant les conséquences irréparables causées par des informations incomplètes ou un mauvais jugement.

Adrian Punk - inline image

Le multi-agent consiste à laisser plusieurs Agents collaborer, par exemple, l'un récupère des données, l'autre rédige un article, et un troisième vérifie les citations. C'est comme une équipe de projet ; quand la division du travail est raisonnable, elle peut gérer des tâches complexes en parallèle. Cependant, plus de membres augmentent également la communication, le travail redondant et la propagation des erreurs, donc plus d'Agents ne sont pas toujours meilleurs.

L'A2A fait référence à la méthode de communication entre Agents pour échanger des tâches, des statuts et des résultats. Le MCP se concentre davantage sur la façon dont les Agents se connectent aux outils et aux données, tandis que l'A2A se concentre davantage sur la façon dont un Agent transmet une tâche à un autre. Pensez au premier comme « connecter des appareils » et au second comme « passer le travail entre collègues ».

Adrian Punk - inline image

L'Utilisation de l'Ordinateur (Computer Use) consiste à laisser l'IA opérer un logiciel en observant l'écran, en déplaçant la souris, en cliquant et en tapant. C'est comme un opérateur distant qui peut utiliser des applications web et de bureau sans API dédiées. Les changements d'interface peuvent lui faire cliquer au mauvais endroit ; la confirmation humaine est obligatoire pour les paiements, les suppressions et les messages sortants.

Un bac à sable (sandbox) est un environnement isolé qui limite la portée d'activité d'un programme. C'est comme un bac à sable clôturé pour qu'un enfant joue ; il peut essayer des choses, et si quelque chose tourne mal, cela ne touchera pas les fichiers importants ou le système. Quand on laisse un Agent exécuter du code, télécharger des fichiers ou modifier des projets, un bac à sable réduit la portée de l'impact mais ne peut pas remplacer toutes les vérifications de sécurité.

Adrian Punk - inline image

Souvenez-vous d'une seule phrase pour ce chapitre : L'Agent est responsable de décider et d'agir, l'Outil fournit des capacités spécifiques, la Compétence lui apprend comment faire, et le MCP est responsable de connecter l'IA avec les capacités externes.

V. Termes informatiques que vous rencontrerez dans les tutoriels d'IA

Ces mots n'ont pas tous été inventés par le domaine de l'IA, mais ils apparaissent souvent lorsqu'on apprend les Agents, l'automatisation et les modèles locaux. Si vous pouvez les comprendre, de nombreux tutoriels ne sembleront plus être une langue étrangère.

Une API est un point d'entrée pour qu'un logiciel communique selon un accord. Vous n'avez pas à entrer dans la cuisine d'un restaurant ; vous commandez simplement par l'intermédiaire d'un serveur. Une API est comme le serveur du monde logiciel, prenant votre demande en coulisses et ramenant le résultat. Les applications météo, les services de paiement et les grands modèles peuvent tous être appelés par d'autres programmes via des API.

Une Clé API (API Key) est un identifiant secret utilisé lorsqu'un programme accède à un service, utilisé pour identifier qui appelle et souvent lié aux limites d'utilisation et à la facturation. C'est comme le code PIN d'une carte bancaire ; quiconque l'obtient peut consommer votre quota. Ne mettez pas de Clés complètes dans du code public, des captures d'écran, des tutoriels ou des discussions de groupe.

Un SDK est une collection de code, d'instructions, d'exemples et d'outils couramment utilisés lors du développement d'applications pour une plateforme. Alors qu'une API vous dit « comment commander », un SDK prépare le menu, les ustensiles et les plats de démonstration, économisant aux développeurs l'écriture de beaucoup de code de base. Différents langages de programmation ont généralement leurs propres SDK.

Adrian Punk - inline image

Le CLI est une interface pour opérer un ordinateur en tapant des commandes textuelles. Une interface graphique vous permet de cliquer sur « Nouveau dossier », tandis qu'un CLI vous permet de taper une ligne de commande pour faire la même chose. Cela ressemble à une fenêtre noire, mais c'est en fait juste une autre façon d'opérer ; l'installation et l'exécution des outils open source d'IA utilisent souvent le CLI.

Un terminal est la fenêtre dans laquelle les commandes sont affichées et saisies, comme le « Terminal » sur Mac ou Windows Terminal. Considérez-le comme une fenêtre de discussion entre vous et l'ordinateur, où les commandes CLI sont les messages envoyés à l'ordinateur. Le terminal est la fenêtre, la CLI est la méthode d'utilisation par texte ; les deux vont souvent de pair.

Adrian Punk - inline image

Un dépôt, souvent abrégé en Repo, est un endroit où les fichiers d'un projet et l'historique des modifications sont sauvegardés de manière centralisée. C'est comme un dossier de projet avec un historique des versions, où l'on peut placer du code, des instructions, des images et des configurations. Quand quelqu'un dit « cloner le Repo », cela signifie généralement copier ce projet et son historique sur votre propre ordinateur.

Git est un outil pour enregistrer les modifications des versions de fichiers. Il peut vous dire quel contenu a été modifié et par qui, et il peut conserver les versions de différentes étapes. C'est comme sauvegarder chaque révision lors de la rédaction d'un article, mais de manière plus systématique. Git fonctionne localement et n'a pas besoin d'être en ligne en permanence, et il n'est pas la même chose que GitHub.

GitHub est un site web pour héberger des dépôts Git et faciliter la collaboration à plusieurs. Les développeurs y publient du code, rédigent des instructions, signalent des problèmes et modifient des projets conjointement. Git est l'outil de gestion de versions, et GitHub est la plateforme fournissant l'hébergement en ligne et la collaboration ; lorsque vous apprenez les outils open source d'IA, vous commencerez souvent par un lien GitHub.

Adrian Punk - inline image

Ne soyez pas nerveux la première fois que vous voyez la CLI. Avant de copier une commande, vérifiez si elle va lire, modifier, supprimer ou télécharger quoi que ce soit, et entraînez-vous avec une copie lorsqu'il s'agit de fichiers importants.

VI. Termes courants pour les modèles locaux et le matériel

Vous n'avez besoin d'examiner attentivement ce groupe de mots que lorsque vous êtes prêt à exécuter des modèles sur votre propre ordinateur. Si vous utilisez généralement des produits d'IA en ligne, connaître le sens général suffit.

Le déploiement local consiste à exécuter un modèle ou un programme sur votre propre ordinateur, téléphone ou machine d'entreprise. Les données transitent par moins de services externes et peuvent être utilisées hors ligne ; cependant, l'installation, les mises à jour, les performances et la sécurité doivent être gérées par vous-même. Cela convient à ceux qui attachent de l'importance au contrôle des données ou ont besoin d'un environnement fixe, mais cela ne signifie pas que c'est naturellement absolument sûr.

Une API cloud est un modèle qui s'exécute sur un serveur distant d'un fournisseur de services, et les utilisateurs envoient des requêtes et obtiennent des résultats via le réseau. C'est comme aller au restaurant pour commander ; vous n'avez pas besoin d'acheter la cuisinière et les ingrédients vous-même, ce qui facilite le démarrage ; en même temps, cela est affecté par le réseau, le prix, les limites d'appel, les règles de la plateforme et les politiques de données.

L'open source signifie généralement que le code source est public sous une certaine licence, permettant à d'autres de le consulter, de le modifier et de le distribuer dans les limites autorisées par la licence. Le téléchargement public ne signifie pas qu'il peut être utilisé commercialement à volonté ; les différentes licences ont des exigences très différentes. Lorsque vous voyez « IA Open Source », vous devez encore voir quelles parties du code, des données et des poids sont réellement ouvertes.

Les poids ouverts signifient que les paramètres après l'entraînement du modèle peuvent être téléchargés, donnant aux utilisateurs la possibilité de les exécuter ou de les ajuster davantage sur leurs propres appareils. Les données d'entraînement, le code d'entraînement complet et les droits commerciaux ne sont pas nécessairement ouverts en même temps. Par conséquent, les poids ouverts et l'open source complet sont deux choses différentes ; la manière dont ils peuvent être utilisés spécifiquement dépend de la licence du modèle.

Adrian Punk - inline image

Les GPU étaient à l'origine conçus pour traiter des graphiques et sont également très adaptés pour effectuer simultanément de grandes quantités de calculs similaires, ils sont donc largement utilisés pour entraîner et exécuter des modèles d'IA. C'est comme un grand groupe de personnes capables de résoudre des problèmes en parallèle. Lors de l'achat d'un ordinateur pour exécuter des modèles locaux, le modèle de GPU et la taille de la mémoire vidéo sont généralement plus importants que dans les scénarios de bureau normaux.

La VRAM est la mémoire haute vitesse utilisée par le GPU lui-même, où les poids du modèle et les données intermédiaires doivent être placés pendant le fonctionnement. Le modèle est comme un grand jeu de blocs de construction, et la VRAM est comme la surface de la table ; si la table est trop petite, les blocs ne tiendront pas, et le modèle pourrait ne pas se charger ou nécessiter des méthodes plus lentes et plus économes en espace.

Adrian Punk - inline image

Le 7B ou 70B dans les noms de modèles représente généralement environ 7 milliards ou 70 milliards de paramètres. Les paramètres peuvent être compris comme l'énorme quantité de nombres internes que le modèle a appris après l'entraînement. Des nombres plus grands signifient généralement plus de mémoire et de ressources de calcul ; cela ne signifie pas directement une capacité plus forte, car la qualité de l'entraînement et les tâches spécifiques sont tout aussi importantes.

VII. Si vous ne retenez que 10 mots

Vous n'avez pas besoin de mémoriser 66 mots. Après une première lecture, retenez d'abord ces 10 :

  • IA : Faire en sorte que les machines gèrent des tâches nécessitant compréhension, jugement, prédiction ou création.
  • LLM : Grands modèles responsables de la compréhension et de la génération de langage.
  • Token : Petits morceaux utilisés par les modèles lors de la lecture et de l'écriture de texte.
  • Contexte : Informations auxquelles le modèle peut se référer cette fois-ci.
  • Prompt : Exigences et matériel que vous donnez à l'IA.
  • Hallucination : L'IA qui rend un contenu erroné très réaliste.
  • RAG : Récupération à partir de matériel spécifié d'abord, puis organisation de la réponse.
  • Agent : Un système qui peut continuellement décider et agir autour d'un objectif.
  • MCP : Un protocole ouvert connectant l'IA à des données et outils externes.
  • CLI : Une interface pour utiliser un ordinateur via des commandes textuelles.

Il y a quelques mois, j'ai aussi commencé par comprendre un mot par jour. Vous n'avez pas besoin de vous souvenir des 66 mots aujourd'hui ; tant qu'une image générale apparaît dans votre esprit la prochaine fois que vous verrez Agent, Skill ou MCP, ce dictionnaire aura déjà rempli son rôle.

À l'avenir, lorsque vous rencontrerez une abréviation étrange, vous pouvez d'abord demander à quelle catégorie elle appartient : Modèle, Dialogue, Données, Agent, Interface ou Matériel ? Si vous pouvez replacer le mot dans ces six tiroirs, la plupart des articles sur l'IA seront beaucoup plus faciles à lire.

À propos de l'auteur

Adrian Punk - inline image
Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux