La boucle est le nouveau prompt

@kyronis_talks
ANGLAISil y a 1 jour · 25 juil. 2026
141K
102
102
2
24

TL;DR

Ce guide explore le passage du prompting manuel aux boucles d'IA autonomes, en détaillant comment les principaux laboratoires mettent en œuvre des cycles d'auto-correction pour gérer des tâches complexes et multi-étapes.

La méthode manuelle

Chaque grand laboratoire s'est discrètement reconstruit autour de la même idée : une boucle qui continue de fonctionner après que vous ayez arrêté de taper. Voici le guide de terrain sur le fonctionnement réel des boucles au 25 juillet 2026, chez Claude, GPT, Gemini, Grok, Meta's Muse Spark, Mira et la vague open-weight, avec chaque affirmation sourcée.

Regardez quelqu'un utiliser l'IA au travail et vous verrez généralement le même rituel. Tapez une requête. Attendez. Lisez la réponse. Repérez les problèmes. Expliquez les problèmes. Attendez à nouveau. Collez le résultat ailleurs. Revenez le lendemain et recommencez tout depuis zéro.

Voici la partie inconfortable : ce rituel EST une boucle. Demander, vérifier, corriger, répéter. La seule différence entre cela et ce que les laboratoires livrent désormais, c'est qui tourne la manivelle. Quand vous le faites à la main, vous êtes le déclencheur, la mémoire, le vérificateur et la condition d'arrêt, et vous êtes cher.

Au cours de l'année écoulée, tous les laboratoires sérieux ont convergé vers la même solution : intégrer la manivelle dans la machine. Anthropic publie une taxonomie officielle des boucles pour Claude. OpenAI a reconstruit ChatGPT autour d'un mode de travail qui exécute des tâches multi-étapes de manière autonome. Google vend des boucles de recherche que vous louez à la tâche. Meta a entraîné son modèle Muse Spark spécifiquement pour orchestrer des flottes de sous-agents. Même le plus petit acteur de cette histoire, une startup de deux personnes avec un bot Telegram appelé Mira, vend en réalité des boucles à des gens qui n'ouvriront jamais un terminal.

Et le terrain bouge encore pendant que j'écris. Au cours des sept jours précédant cette mise à jour seulement : Anthropic a livré un nouvel Opus conçu pour le travail agentique quotidien, Alibaba a présenté un Qwen de 2,4 billions de paramètres, et le plus grand modèle open-weight jamais publié est à environ 48 heures de la publication de ses poids.

Le résultat est le plus grand changement silencieux dans la façon dont cette technologie est utilisée depuis l'apparition des interfaces de chat : l'unité de travail n'est plus le prompt. C'est la boucle, un cycle de travail qui continue jusqu'à ce qu'une condition que vous avez définie soit remplie.

Cet article est la version longue de cette histoire. Ce qu'est réellement une boucle, sans le battage médiatique. À quoi ressemble la pile de boucles de chaque laboratoire actuellement, y compris les modèles qui n'existaient pas il y a un mois. Ce qui fonctionne réellement, qui s'avère être remarquablement cohérent chez tous les fournisseurs. Et les modes d'échec et les coûts que les articles de lancement ne mentionnent pas.

Une note sur la méthode, car le discours sur l'IA se noie dans des absurdités confiantes : tout ce qui suit est basé sur la documentation et les annonces officielles des laboratoires, ou sur des évaluations indépendantes nommées, vérifiées en direct la semaine se terminant le 25 juillet 2026. Lorsqu'un chiffre est auto-déclaré par un fournisseur, je le dis. Lorsque quelque chose n'est pas vérifié ou est encore en avant-première, je le dis aussi. Liste complète des sources en bas.

Partie 1 : Ce qu'est réellement une boucle

Enlevez le jargon et une boucle, ce sont quatre temps plus une raison de s'arrêter.

L'équipe Claude Code d'Anthropic, qui a publié ce qui se rapproche le plus d'une définition canonique dans ce domaine, le résume en une ligne : les boucles sont "des agents qui répètent des cycles de travail jusqu'à ce qu'une condition d'arrêt soit remplie". Le propre guide des agents d'OpenAI dit la même chose en langage d'ingénieur : "Chaque approche d'orchestration a besoin du concept de 'run', généralement implémenté comme une boucle qui permet aux agents de fonctionner jusqu'à ce qu'une condition de sortie soit atteinte", où les conditions de sortie incluent un résultat final, une erreur ou un nombre maximum de tours.

Les quatre temps, en langage simple :

  1. Déclencheur. Quelque chose démarre l'exécution. Vous, un planning, une alerte, une nouvelle pull request, un email qui arrive.
  2. Travail. Le modèle rassemble le contexte et effectue une action avec des outils : lit les fichiers, exécute la requête, rédige le message, édite le code.
  3. Vérification. Le résultat est vérifié par rapport à quelque chose de réel. Les tests réussissent ou échouent. Le nombre correspond à la source. Un second modèle évalue le brouillon par rapport à vos critères.
  4. Répétition ou arrêt. Si la vérification échoue, la boucle recommence avec ce qu'elle a appris. Si la vérification réussit, ou si une limite est atteinte, elle s'arrête.

C'est toute l'astuce. Un prompt est un seul passage par les temps deux et trois, vous effectuant le temps trois dans votre tête. Une boucle est la même chose, mais la vérification et la répétition sont confiées à la machine, avec deux garde-fous : une condition d'arrêt pour qu'elle ne puisse pas tourner indéfiniment, et un budget pour qu'elle ne puisse pas dépenser indéfiniment.

Les acteurs secondaires

Autour de ces quatre temps, chaque pile de boucles sérieuse livre les cinq mêmes pièces de soutien, quel que soit le nom que le fournisseur leur donne :

  • Mémoire. Des notes qui survivent entre les exécutions, pour que l'exécution quarante sache ce que l'exécution un a appris.
  • État. Où en est la boucle actuellement : ce qui est fait, ce qui a échoué, ce qui est à venir.
  • Vérificateur. La chose qui décide "assez bien". La décision de conception la plus importante que vous prendrez.
  • Condition d'arrêt. "Les tests réussissent", "la file d'attente est vide", "arrêter après cinq tentatives", "il est 9h et le digest a été envoyé".
  • Compteur de coûts. Tokens et dollars par cycle, car les boucles multiplient tout ce qu'elles touchent, y compris votre facture.

Les quatre types de boucles

La taxonomie d'Anthropic mérite d'être apprise car elle correspond parfaitement aux produits de tous les autres fournisseurs, même si les noms diffèrent. Leur équipe classe les boucles par ce que vous déléguez :

  • Boucles à tour de rôle. Vous donnez un prompt, l'agent fait un cycle (rassembler, agir, vérifier, répondre), vous examinez, vous donnez un autre prompt. Vous êtes toujours la condition d'arrêt. C'est par là que tout le monde commence, et Anthropic note que chaque prompt exécute déjà cette micro-boucle en interne.
  • Boucles basées sur un objectif. Vous déléguez la condition d'arrêt. Vous définissez à quoi ressemble le "fait", et l'agent itère jusqu'à ce qu'il y arrive ou atteigne une limite de tours. Dans Claude Code, c'est littéralement une commande /goal, et chaque fois que le modèle essaie de s'arrêter, "un modèle évaluateur vérifie votre condition et le renvoie au travail jusqu'à ce que l'objectif soit atteint". Les critères déterministes fonctionnent le mieux : tests réussis, score atteint, liste de contrôle terminée.
  • Boucles basées sur le temps. Vous déléguez le déclencheur. La boucle s'exécute sur un intervalle ou un planning et réagit à ce qui a changé : résumer Slack chaque matin, vérifier la pull request jusqu'à ce que la CI réussisse.
  • Boucles proactives. Vous déléguez le prompt lui-même. Un événement ou un planning démarre l'exécution sans humain en temps réel : les nouveaux rapports de bugs sont triés à leur arrivée, les dépendances sont mises à niveau chaque semaine, et chaque tâche se termine lorsque son propre objectif est atteint.

Gardez cette échelle en tête (déléguer la vérification, puis la condition d'arrêt, puis le déclencheur, puis le prompt) et le reste de cet article n'est que le spectacle de sept fournisseurs l'escaladant depuis différentes directions.

Partie 2 : L'état des lieux, en un instantané

Avant la visite laboratoire par laboratoire, une orientation, car la frontière a incroyablement accéléré au cours des cinq semaines précédant cet article : Grok 4.5 est sorti le 8 juillet, Meta's Muse Spark 1.1 et GPT-5.6 d'OpenAI sont tous deux sortis le 9 juillet, Thinking Machines a publié son premier modèle le 15 juillet, Kimi K3 de Moonshot est arrivé le 16 juillet, Alibaba a présenté Qwen3.8-Max le 19 juillet, et Anthropic a publié Claude Opus 5 le 24 juillet, la veille de cette mise à jour.

Pour un étalon neutre, l'évaluateur indépendant Artificial Analysis note la capacité générale sur son Intelligence Index. D'après l'instantané de cette semaine (v4.1), le haut du tableau publié se lit comme suit :

  • Claude Fable 5 (Anthropic) : 59.9
  • GPT-5.6 Sol Max (OpenAI) : 58.9
  • Kimi K3 (Moonshot, poids ouverts imminents) : 57.1, quatrième au classement général
  • Avec Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2, et le reste du champ ci-dessous

Deux mises en garde qui méritent leur place. Claude Opus 5 a un jour au moment où j'écris et n'est pas encore indexé. Et un seul indice composite ne peut pas capturer le travail agentique à long horizon, qui est ce que les boucles font réellement, donc lorsqu'un laboratoire a publié des résultats spécifiques aux agents, je les cite dans la section de ce laboratoire, signalés comme auto-déclarés quand ils le sont.

Deux choses à remarquer tout de même. Le haut du tableau est désormais un écart de moins de trois points, ce qui signifie : pour la construction de boucles, le choix du modèle à l'intérieur de cette bande importe moins que la boucle autour de lui. Et un modèle open-weight se trouve désormais à l'intérieur de cette bande pour la première fois.

Claude : la boucle comme primitive de première classe

Les modèles. Claude Fable 5, sorti le 9 juin 2026, est le modèle le plus capable d'Anthropic et celui qui est le plus explicitement construit pour ce style de travail. Le propre cadrage d'Anthropic est que, exécuté à l'intérieur d'un harnais comme Claude Code, il peut "travailler pendant des jours : planifier à travers les étapes, déléguer à des sous-agents et vérifier son propre travail". Sa réflexion est adaptative et toujours active, réglée par un paramètre d'effort, avec une fenêtre de contexte d'un million de tokens. Il trône toujours en tête de l'indice indépendant ci-dessus. Son frère Mythos 5, sorti en même temps, est le spécialiste qu'Anthropic classe comme le plus fort sur les tâches de cybersécurité.

La nouvelle de cette semaine est Claude Opus 5, sorti le 24 juillet : Anthropic le décrit comme s'approchant de l'intelligence de pointe de Fable 5 à la moitié du prix (5 $ par million de tokens d'entrée et 25 $ en sortie), le nouvel état de l'art sur les évaluations de travail de connaissance comme GDPval-AA selon l'annonce, et le nouveau modèle par défaut du plan Max de Claude. Pour les constructeurs de boucles, l'argument est brutal : des cycles proches de la frontière à moitié coût changent ce que vous pouvez vous permettre d'exécuter toute la journée.

La pile de boucles. Ce qui rend Anthropic distinctif, c'est que les boucles ne sont pas une fonctionnalité enfouie dans une application. Ce sont des primitives nommées que vous pouvez taper :

  • /goal définit le "fait" et permet à un modèle évaluateur de renvoyer l'agent au travail jusqu'à ce que la condition soit remplie ou qu'une limite de tours soit atteinte. C'est la boucle basée sur un objectif, littéralement transformée en produit.
  • /loop réexécute un prompt sur un intervalle sur votre machine ; /schedule déplace cette boucle vers le cloud d'Anthropic en tant que routine, où elle continue de s'exécuter avec votre ordinateur portable fermé, déclenchée par des plannings, des appels API ou des événements GitHub.
  • Les workflows dynamiques gèrent l'extrémité complexe : Claude écrit un script d'orchestration réel qui peut coordonner jusqu'à 1 000 sous-agents en une seule exécution. L'anecdote phare est un développeur portant le runtime Bun, environ 750 000 lignes, de Zig à Rust en environ onze jours avec des centaines d'agents parallèles.
  • Les compétences, les hooks et les sous-agents complètent les acteurs secondaires : les compétences encodent comment vérifier le travail, un second agent à contexte frais fait la revue de code, et la mémoire persiste dans des fichiers entre les sessions.

La philosophie. Les conseils d'Anthropic sont inhabituellement explicites sur la retenue : toutes les tâches n'ont pas besoin d'une boucle complexe, commencez par la primitive la plus simple, définissez des critères d'arrêt déterministes, pilotez une petite partie avant une grande exécution, et surveillez l'utilisation avec des commandes intégrées. Leur ligne que tout le domaine redécouvre sans cesse : les agents qui peuvent vérifier et améliorer leur propre production sont fondamentalement plus fiables.

À retenir : le laboratoire de boucles du développeur. La version la plus lisible et la plus composable de chaque type de boucle, et maintenant avec un moteur proche de la frontière moins cher pour fonctionner à l'intérieur.

OpenAI : trois modes et un approbateur séparé

Les modèles. La génération GPT-5.6 d'OpenAI est devenue disponible en général le 9 juillet 2026 en trois niveaux : Sol (phare, 5 $ en entrée / 30 $ en sortie par million de tokens), Terra (le milieu équilibré) et Luna (rapide et bon marché), tous avec une fenêtre de contexte d'environ un million de tokens. Sol occupe la deuxième place sur l'indice indépendant, essentiellement à égalité avec Fable 5. Sa fonctionnalité de boucle phare est un mode ultra qui coordonne quatre agents en parallèle par défaut sur les problèmes difficiles.

La pile de boucles pour le consommateur. L'histoire d'OpenAI ici est une reconstruction. L'"agent ChatGPT" autonome de 2025 a été interrompu ; à sa place, ChatGPT a désormais trois modes : Chat pour la conversation, Work pour les longues tâches multi-étapes qui produisent des livrables finis, et Codex pour le logiciel. Work exécute des jobs dans le cloud, peut faire une pause à des points de contrôle d'approbation, et surtout peut s'exécuter sur des déclencheurs : Scheduled Tasks inclut désormais des tâches de surveillance qui vérifient quelque chose à intervalles réguliers et ne vous informent que lorsqu'il y a quelque chose à signaler. C'est une boucle basée sur le temps vendue aux consommateurs, sans aucun code. Un mode agent vit également à l'intérieur du navigateur Atlas pour les tâches d'action sur le web.

La pile de boucles pour le développeur. La ligne de démarcation est clairement énoncée dans la documentation d'OpenAI : "Utilisez l'API Responses lorsque vous voulez posséder la boucle. Utilisez le SDK Agents lorsque vous voulez que le SDK l'exécute." L'API Responses est agentique par défaut, permettant au modèle d'appeler la recherche web, la recherche de fichiers, l'utilisation de l'ordinateur, l'exécution de code et vos fonctions en une seule requête. Deux ajouts de l'ère GPT-5.6 sont importants spécifiquement pour les boucles : Programmatic Tool Calling, où le modèle écrit un petit programme JavaScript dans un bac à sable pour coordonner ses propres appels d'outils, et une version bêta multi-agent où un agent racine génère et gère une arborescence de sous-agents.

L'idée distinctive : séparer l'exécutant de l'approbateur. La contribution de boucle la plus intéressante d'OpenAI est Auto-review(30 avril 2026) : lorsqu'un agent Codex veut faire quelque chose en dehors de son bac à sable, un modèle de réviseur séparé, pas l'agent lui-même, décide si l'action est cohérente avec ce que l'utilisateur a demandé. Leur raisonnement est brutal : l'agent principal est optimisé pour terminer la tâche, ce qui crée une pression pour traiter une limite d'approbation comme un simple obstacle supplémentaire. Garder la décision d'approbation dans un appel de modèle différent la rend vérifiable. Résultat, selon OpenAI : les sessions demandent à un humain environ 200 fois moins souvent, et le réviseur approuve environ 99 % de ce qui est encore escaladé. Ces chiffres sont auto-déclarés, mais le principe de conception est universel : ne laissez jamais le modèle qui veut terminer être aussi celui qui décide qu'il a terminé.

À retenir : la rampe d'accès à la boucle pour le consommateur, plus une pile sérieuse pour le développeur. Et un memento mori pour les constructeurs de plateformes : OpenAI a déprécié son Agent Builder visuel moins d'un an après son lancement, avec un arrêt définitif au 30 novembre 2026.

Google : des boucles de recherche que vous louez à la tâche

Le modèle. Le modèle phare actuel de Google est Gemini 3.1 Pro (avril 2026), mais la partie intéressante de cette histoire n'est pas le modèle de chat. C'est que Google a transformé une boucle entière en produit.

La pile de boucles. Les agents Deep Research, lancés le 21 avril 2026 en deux versions (standard, pour la rapidité, et Max, pour l'exhaustivité), sont des boucles de recherche basées sur un objectif que vous appelez avec une seule requête API. La documentation décrit le cycle carrément : planifier, chercher, lire, itérer, produire, s'exécutant pendant quelques minutes à une heure en arrière-plan, avec des citations dans le rapport final. Les détails de conception sont une petite masterclass en ingénierie de boucles :

  • L'exécution en arrière-plan est obligatoire. Une boucle de recherche survit à un délai d'attente HTTP, donc vous interrogez pour le résultat. La boucle, pas la requête, est l'unité de travail.
  • La planification collaborative est une porte humaine à l'avant : l'agent propose son plan de recherche, vous l'éditez ou l'approuvez, puis il s'exécute. Orienter avant la boucle au lieu de surveiller pendant.
  • Une condition d'arrêt stricte est intégrée : temps de recherche maximum de 60 minutes, la plupart des tâches se terminant en environ 20 minutes.
  • Les outils sont limités par exécution : Google Search, lecture d'URL, exécution de code par défaut, vos propres serveurs MCP et magasins de fichiers optionnellement, et vous pouvez désactiver entièrement le web ouvert pour ne rechercher que vos données privées.
  • Le coût est fixé par boucle, honnêtement.Les propres estimations de Google : une tâche standard typique consomme environ 80 recherches et environ un quart de million de tokens d'entrée, ce qui revient à un à trois dollars ; une exécution Max peut atteindre 160 recherches et environ 3 à 7 $. Une boucle n'est pas un message de chat, et Google facture en conséquence.

À retenir : la preuve commerciale la plus claire que la boucle, pas l'appel de modèle, devient le produit. Vous n'achetez pas des tokens ; vous achetez une investigation terminée.

Une mise en garde honnête : au moment où j'écris, les agents Deep Research sont en avant-première via l'API Interactions, donc attendez-vous à ce que l'interface change.

Muse Spark 1.1 : le nouveau venu entraîné à orchestrer

Le modèle. Muse Spark 1.1 est le modèle de raisonnement multimodal de Meta Superintelligence Labs, sorti le 9 juillet 2026 en tant que mise à niveau du Muse Spark 1.0 d'avril, et c'est l'un des nouveaux venus les plus importants de cette revue pour trois raisons.

Premièrement, la stratégie : c'est la toute première API de modèle payante de Meta, à 1,25 $ par million de tokens d'entrée et 4,25 $ en sortie, et elle est à poids fermés, une rupture nette avec l'ère ouverte de Llama. Les champions de la gamme Llama sont effectivement cédés à la vague open-weight couverte ci-dessous ; Meta a seulement dit qu'il espère ouvrir les futures versions de Muse.

Deuxièmement, la cible d'entraînement. Là où la plupart des modèles apprennent le comportement agentique comme un sous-produit, Meta dit que celui-ci a été entraîné directement pour l'organigramme : "En tant qu'agent principal, il peut rassembler le contexte, faire un plan et déléguer l'exécution à des sous-agents parallèles. En tant que sous-agent, il adhère à sa tâche, comprend les outils disponibles et sait quand remonter à l'agent principal." Il adopte sans exemple de nouveaux outils, serveurs MCP et compétences personnalisées, gère activement son contexte d'un million de tokens (se souvenant, récupérant et compactant au fur et à mesure qu'il travaille), et gère des workflows d'utilisation d'ordinateur à travers plusieurs applications.

Troisièmement, la position prix-performance. Sur l'indice indépendant, il a bondi de huit points par rapport à la version 1.0 en trois mois, ce qui le place en dessous du trio de pointe mais à une fraction de leur coût par tâche, et il est actuellement en tête du benchmark d'utilisation d'outils MCP Atlas à 88,1 (chiffres proches du fournisseur ; à prendre avec les précautions d'usage).

La note de bas de page pour le constructeur de boucles qui vous dit où tout cela va. La propre documentation développeur de Meta prévient que si vous construisez un agent multi-tours sur l'ancienne API de style Chat Completions, le raisonnement du modèle est jeté entre les tours, donc les boucles dérivent et répètent le travail ; ils vous orientent vers une API de style Responses qui transporte le raisonnement crypté à travers les tours. La plomberie de l'industrie est en train d'être reconstruite autour des boucles, une API dépréciée à la fois.

À retenir : le moteur que vous louez pour les boucles à forte orchestration lorsque le trio de pointe est excessif en termes de coût. Encore jeune ; la pente 1.0 à 1.1 est la raison de prêter attention.

Grok 4.5 : des cycles bon marché et rapides, entraînés sur le tas

Le modèle. Grok 4.5 est sorti le 8 juillet 2026 du xAI de Musk (fonctionnant désormais sous l'égide de SpaceXAI cotée en bourse), présenté comme son modèle le plus intelligent pour le codage, les tâches agentiques et le travail de connaissance. Le positionnement de Musk était inhabituellement direct : un modèle de classe Opus, comparable à Claude Opus 4.7, mais plus rapide et moins cher. La notation indépendante est cohérente avec l'ambiance : au-dessus de la génération Opus précédente, en dessous du trio de pointe.

Pourquoi c'est important spécifiquement pour les boucles. Deux affirmations, toutes deux de xAI et toutes deux pertinentes pour les boucles même après avoir pris en compte le marketing :

  • Il a été entraîné dans des boucles. xAI dit que l'apprentissage par renforcement a couvert des centaines de milliers de tâches d'ingénierie multi-étapes avec une notation automatisée, sur une infrastructure où les déploiements agentiques s'exécutent pendant des heures pendant que l'entraînement continue. Quels que soient les benchmarks, le régime d'entraînement était le travail lui-même.
  • L'économie des boucles est l'argument de vente. À 2 $ en entrée / 6 $ en sortie par million de tokens, environ 80 tokens par seconde, et une efficacité de tokens revendiquée de deux fois (résolvant des tâches en moins de la moitié des étapes des modèles comparables), l'argument n'est pas "cycle le plus intelligent", c'est "le plus de cycles par dollar". Pour les boucles, où le coût est égal au coût par cycle multiplié par les cycles, cette arithmétique est tout le jeu. La documentation le renforce avec une plomberie de boucle sans glamour : mise en cache de prompt épinglée à la conversation pour que les longues boucles ne paient pas les prix de cache froid, et des conseils de compactage de contexte pour les exécutions à forte utilisation d'outils.

La boucle transformée en produit vit dans Grok Build, son agent de codage (entraîné aux côtés de Cursor, où il est disponible sur tous les plans), qui s'étend dans un territoire étrangement pratique : des modèles Excel multi-feuilles avec recherche web, des diagrammes PowerPoint natifs, des documents Word.

À retenir : le cheval de bataille économique pour les boucles à volume élevé, avec la mise en garde habituelle que la plupart des chiffres d'efficacité sont ceux du fournisseur.

Mira : des boucles pour les gens qui n'ouvriront jamais un terminal

Voici l'entrée qui ressemble à une erreur dans une liste de modèles de pointe, et qui est en fait l'une des plus instructives.

Ce qu'est réellement Mira. Mira n'est pas un modèle. C'est un agent IA grand public qui vit entièrement à l'intérieur de Telegram, construit par une startup si petite qu'elle se résume à deux personnes, dirigée par Daria Yakovleva et incubée par The Open Platform, une société de logiciels de l'écosystème Telegram. Il a été lancé discrètement en février 2026 et a déclaré avoir dépassé le million d'utilisateurs mensuels début juin (auto-déclaré, environ 1,17 million). Sous le capot, il est indépendant du modèle : il achemine chaque tâche vers des modèles tiers (GPT, Claude et autres) plutôt que d'en exécuter un.

Pourquoi il a sa place dans cet article. Parce que le produit de Mira, ce sont des boucles, et rien que des boucles, vendues à des gens qui n'entendront jamais le mot. Ses automatisations packagées, appelées Skills, regroupent chacune l'anatomie exacte de la Partie 1 : un déclencheur (un planning, une note vocale, un événement de chat de groupe), une action à travers des applications connectées (calendrier, email, trackers de projet, outils de contenu), et une livraison autonome de retour dans le chat. Surveillez le prix d'un vol et alertez-moi. Transformez mon mémo vocal en publications pour trois plateformes. Résumez ce que ce groupe a décidé aujourd'hui et classez les actions à mener. La ligne de positionnement dans ses propres documents est le résumé le plus clair de toute l'ère des boucles : ChatGPT répond, Mira agit.

Les mises en garde honnêtes. Les nombres d'utilisateurs et de connecteurs (que ses documents mettent entre 200 et plus de 1 000 services) sont auto-déclarés et incohérents entre les pages, l'entreprise ne publie aucune directive d'ingénierie sur la façon dont ses boucles vérifient quoi que ce soit, et qualifier les Skills de "boucles" est une interprétation externe, pas le vocabulaire de Mira. Une minuscule équipe qui enveloppe les modèles d'autres laboratoires est également une base fragile par rapport à tout le reste de cette liste.

À retenir : le signal de demande. Quand un bot Telegram de deux personnes atteint un million d'utilisateurs en regroupant des déclencheurs, des actions et une livraison autonome pour les gens ordinaires, la boucle a cessé d'être un concept de développeur. La distribution et l'absence de configuration battent la capacité pour une énorme partie du travail réel.

La vague open-weight : apportez votre propre boucle

L'histoire la plus retentissante de la mi-2026 est que le monde open-weight a cessé d'accuser un retard de plusieurs années et a commencé à accuser un retard de quelques mois, et au cours des deux dernières semaines, de quelques points. Pour les constructeurs de boucles, cela change complètement le calcul, car un modèle ouvert est le seul moteur de boucle que personne ne peut déprécier sous vos pieds.

La brève visite, dates et licences vérifiées :

  • Kimi K3 de Moonshot est désormais le modèle phare. Lancé le 16 juillet 2026 avec 2,8 billions de paramètres, il est devenu le premier modèle open-weight à franchir la bande « frontier » de l'indice indépendant : 57,1 sur Artificial Analysis (v4.1), quatrième au classement général, derrière seulement Fable 5 et GPT-5.6 Sol Max parmi les scores publiés. Il a également pris la première place sur Arena.ai dans le Frontend Code Arena (vote à l'aveugle), devant Fable 5. Les poids complets devraient être publiés sur HuggingFace le 27 juillet 2026 sous une licence MIT modifiée, ce qui en ferait le premier modèle téléchargeable de sa catégorie ; au 24 juillet, les poids n'avaient pas encore été livrés, donc considérez cette affirmation comme prévue plutôt que réalisée. La démonstration phare de Moonshot est un pur théâtre de boucle : 48 heures de fonctionnement autonome continu pour concevoir une petite puce fonctionnelle, exécutée par un seul agent sur un contexte d'un million de tokens. Un autre chiffre qui compte, issu de la même évaluation indépendante : le taux d'hallucination mesuré de K3 est monté à environ 51 % sur les tâches sensibles aux faits, contre 39 % pour son prédécesseur, même si la précision factuelle s'est améliorée. Meilleur pour les bonnes réponses, pire pour savoir quand il se trompe. Souvenez-vous-en pour la Partie 3.
  • Qwen3.8-Max d'Alibaba, aperçu le 19 juillet 2026 lors de la World AI Conference : un modèle multimodal revendiqué de 2,4 billions de paramètres, le premier du team Qwen au-dessus d'un billion, avec l'auto-description « juste derrière Fable 5 » et la promesse que des poids ouverts arrivent bientôt. L'aperçu est en ligne ; le tableau de benchmarks, la fiche modèle, la licence et les poids ne le sont pas, donc classez chaque affirmation comme « aperçu fournisseur » jusqu'à ce qu'ils soient disponibles.
  • DeepSeek V4 (24 avril 2026, licence MIT) était, selon OpenRouter, le premier modèle ouvert que les équipes ont intégré dans de véritables pipelines agentiques comme substitut plausible de la frontière. La variante Pro domine les classements des agents de codage open-weight sur SWE-bench Verified avec 80,6 % ; la variante Flash conserve presque tout cela à des prix qui se chiffrent en centimes.
  • GLM-5.2 de Z.ai (mi-juin 2026, MIT, 753B mélange d'experts) était le leader en qualité open-weight jusqu'à l'arrivée de K3, décrit par OpenRouter comme le remplacement ouvert le plus proche pour la planification de type Opus et le codage à long horizon. Vice connu : il réfléchit de manière coûteuse, brûlant des tokens de sortie.
  • MiniMax M3 (1er juin 2026, MIT modifié) est la voie multimodale ouverte : compréhension native d'images et de vidéos sur un contexte d'un million de tokens, ce qui compte dès que votre boucle doit lire des captures d'écran ou inspecter des états d'interface.
  • NVIDIA Nemotron 3 Ultra est le plus fort concurrent open-weight construit aux États-Unis, se différenciant par le déploiement et la pile NVIDIA plutôt que par le score maximal.
  • Également sur la liste : Thinking Machines Lab, la société de Mira Murati, a livré son premier modèle, Inkling, le 15 juillet 2026 : un mélange d'experts multimodal open-weight de 975 milliards de paramètres sous Apache 2.0. Un laboratoire de premier plan de plus qui parie que les poids ouverts sont la clé.

Lisez-le comme : si votre boucle est à grand volume, sensible à la vie privée, ou doit survivre aux feuilles de route des fournisseurs, la vague open n'est plus l'option de compromis. L'écart avec la frontière fermée se mesure désormais en quelques points, et il ne s'est pas creusé.

Partie 3 : Ce qui fonctionne réellement

Voici ce qui frappe après des semaines passées dans la documentation de sept fournisseurs : enlevez le branding et ils donnent tous les mêmes conseils. Quand des rivaux acharnés convergent vers des conseils identiques, c'est aussi proche de la vérité terrain que ce domaine peut l'offrir. Sept règles, chacune triangulée entre les laboratoires.

1. Définissez « fini » avant de commencer. Le /goal d'Anthropic existe pour qu'un évaluateur puisse vérifier une condition explicite ; le guide d'OpenAI exige des conditions de sortie sur chaque exécution ; Google limite la recherche à 60 minutes chrono. Une boucle sans condition d'arrêt claire n'est pas de l'automatisation, c'est un abonnement à brûler des tokens. Le déterministe bat les impressions : tests réussis, nombre correspondant, liste de vérification cochée, N tentatives max.

2. Le vérificateur est le produit. Le plafond de qualité de la boucle est son étape de vérification, pas son modèle. Anthropic vous dit d'encoder la vérification comme des compétences et de pointer un second agent (contexte frais) vers les révisions. OpenAI est allé plus loin : l'approbateur est un modèle structurellement séparé de l'exécutant, pour la raison explicite que l'exécutant veut terminer. Google ancre les rapports dans des citations cliquables. Et cette semaine a fourni la meilleure preuve de cette règle : le modèle ouvert le plus impressionnant du tableau s'est amélioré de manière mesurable à produire des bonnes réponses tout en empirant à savoir quand il se trompe. Dans un chat, c'est une note de bas de page. Dans une boucle non vérifiée, c'est une usine à erreurs confiantes. Si vous investissez une heure quelque part, investissez-la dans ce que « vérifié » signifie pour votre tâche.

3. Ne laissez jamais l'exécutant s'évaluer lui-même sur quoi que ce soit d'important. Le même principe vu de l'autre côté, car c'est la leçon que toute l'industrie a payée pour apprendre : un modèle qui exécute des tâches traite chaque barrière comme un obstacle. Modèle vérificateur séparé, agent réviseur séparé, ou un humain à l'étape irréversible.

4. Gérez le contexte comme la ressource rare qu'il est. Les conseils d'ingénierie de contexte d'Anthropic (le plus petit ensemble de tokens à fort signal, fichiers de notes, sous-agents qui retournent des résumés), la compaction active de Meta, les conseils de compaction de Grok, le contre-argument du grand contexte de Kimi : tout le monde répond à la même question, à savoir comment une longue boucle reste cohérente. La réponse consensuelle est la mémoire en dehors de la fenêtre plus la récupération à la demande, pas le bourrage.

5. Élevez le type de boucle seulement lorsque l'échelon précédent échoue. Anthropic dit de commencer par la primitive la plus simple. OpenAI dit de maximiser un seul agent avant de passer au multi-agent. Google vous fait approuver un plan avant une exécution d'une heure. L'échelle de la Partie 1 est aussi une discipline : déléguez la vérification, puis la condition d'arrêt, puis le déclencheur, puis le prompt, dans cet ordre, un échelon à la fois.

6. Tarifiez la boucle, pas le message. Le coût d'une boucle, c'est le coût par cycle multiplié par le nombre de cycles, c'est pourquoi Google tarifie la recherche par tâche (1 $ à 7 $), pourquoi Grok mise sur l'efficacité des tokens, pourquoi Anthropic vient de réduire de moitié le prix des cycles proches de la frontière avec Opus 5, et pourquoi chaque pile sérieuse livre des outils d'inspection d'utilisation. Décidez ce qu'une exécution a le droit de coûter avant de la lancer.

7. Gardez un humain aux portes qui ne peuvent pas être défaites. Argent qui sort, emails qui partent, données qui se suppriment, code fusionné en production. Les points de contrôle d'approbation du mode Work, la planification collaborative, les modes de permission, les escalades d'Auto-review : chaque fournisseur, sans exception, a gardé une porte humaine à l'étape irréversible. Les fournisseurs avec les boucles les plus capables sont aussi ceux qui insistent le plus là-dessus. Cela devrait vous dire quelque chose.

Partie 4 : Ce que personne ne vous dit

Les articles de lancement s'arrêtent ici. L'expérience opérationnelle, non.

Les boucles multiplient tout, y compris les erreurs. Une hypothèse erronée dans un chat donne une mauvaise réponse. La même hypothèse erronée dans une boucle donne cinquante artefacts erronés, cohérents et confiants, d'ici le matin. C'est pourquoi la vérification est la règle numéro un, et pourquoi les boucles sans surveillance devraient commencer en lecture seule jusqu'à ce qu'elles gagnent le droit d'écrire.

La facture s'accumule en silence. Chaque guide de fournisseur a une section de gestion des tokens pour une raison. Les modèles qui réfléchissent beaucoup peuvent brûler des dollars en tokens de sortie sur une seule étape difficile ; une routine qui s'exécute toutes les heures alors que la chose sous-jacente change chaque jour paie 24x pour rien. Adaptez l'intervalle au taux de changement, limitez les tours, et vérifiez le compteur.

L'injection de prompts empire dans une boucle. Dès que votre boucle lit le web ouvert, les boîtes de réception ou les téléchargements d'utilisateurs, supposez que quelqu'un finira par planter des instructions dans ce contenu. Un assistant de chat qui se fait piéger vous embarrasse une fois ; une boucle piégée avec accès aux outils agit dessus, de manière répétée, pendant que vous dormez. Les propres docs de sécurité d'OpenAI disent le non-dit : même avec des mesures d'atténuation, les agents ne seront pas parfaits et peuvent encore être piégés. Traitez tout ce que la boucle ingère comme des données, jamais comme des ordres, et limitez ses permissions comme si vous y croyiez.

L'écart entre démo et production est réel. Une conception de puce autonome de 48 heures est une démonstration magnifique et aussi une démonstration contrôlée. Des multiples d'efficacité auto-déclarés, des benchmarks privés, des comptes de paramètres en aperçu fournisseur annoncés sans fiche modèle : des signaux utiles, aucun ne remplace le fait de faire tourner la boucle sur vos propres tâches avec votre propre vérificateur. Chaque laboratoire en convient en silence, c'est pourquoi ils vous disent tous de construire des évaluations.

Les plateformes bougent sous vos pieds. Dans les douze mois précédant cet article : OpenAI a abandonné son produit agent autonome, retiré Pulse, et programmé la fermeture de son Agent Builder visuel (30 novembre 2026) ; un nouvel Opus a remanié la gamme de plans Claude du jour au lendemain ; les API ont été reconstruites autour de conceptions adaptées aux boucles ; et une directive de contrôle des exportations en juin a même temporairement mis hors ligne les modèles Claude de pointe pour de nombreux utilisateurs. Construisez vos boucles de sorte que la logique (l'objectif, le vérificateur, les notes) vive dans vos fichiers, pas dans l'interface d'un fournisseur, et que le moteur reste interchangeable.

Le fossé n'est pas le modèle. La frontière est désormais un écart de moins de trois points qui se remanie chaque semaine, et un modèle ouvert vient de la rejoindre. Ce qui s'accumule est le vôtre : le jeu d'évaluation construit à partir de vos échecs, le vérificateur qui encode vos standards, les notes que vos boucles ont accumulées. Changer de modèle est un changement de configuration. Reconstruire une année de logique de vérification ne l'est pas.

Quelle pile de boucles est la vôtre ?

La mise en relation honnête, compte tenu de tout ce qui précède :

  • Vous vivez dans un terminal et voulez un contrôle maximal : Claude Code, avec Fable 5 pour les exécutions les plus difficiles et Opus 5 comme nouveau rapport qualité-prix par défaut. Les primitives les plus lisibles (/goal, /schedule, workflows dynamiques) et la philosophie la mieux documentée.
  • Vous voulez des boucles dans un produit que tout le monde utilise déjà : le mode Work de ChatGPT plus les tâches planifiées (les tâches de surveillance sont criminellement sous-utilisées), ou Codex avec Auto-review pour le code.
  • Votre boucle est « enquêtez sur X en profondeur et donnez-moi un rapport cité » : louez Deep Research ou Deep Research Max de Google par tâche et évitez de construire quoi que ce soit.
  • Vous orchestrez de nombreux sous-agents et surveillez les coûts : Muse Spark 1.1 ou Grok 4.5 comme moteur ; les deux sont tarifés et construits pour cela, un cran en dessous du trio de frontière.
  • Vous voulez des automatisations dans votre poche sans configuration : les agents grand public de style Mira dans l'application de chat que vous utilisez déjà.
  • Vous avez besoin de volume, de confidentialité ou de permanence : la vague open. DeepSeek V4 Flash pour le coût, GLM-5.2 pour la qualité de planification, MiniMax M3 pour le multimodal, et Kimi K3 si vous voulez une capacité de niveau frontière que vous pouvez (à partir du 27 juillet, si les poids sont livrés à temps) réellement télécharger. Apportez juste un vrai vérificateur ; les propres chiffres de K3 plaident pour un.

Votre première boucle cette semaine

Une recette honnête, neutre vis-à-vis des fournisseurs :

  1. Choisissez une tâche que vous répétez déjà à la main, où vous êtes le goulot d'étranglement.
  2. Écrivez la condition d'arrêt en premier. Si vous ne pouvez pas écrire « fini signifie X », la tâche n'est pas encore prête pour la boucle.
  3. Écrivez la vérification. Un script, un test, une grille d'évaluation pour un second modèle. C'est l'heure qui compte.
  4. Exécutez-la en mode tour par tour quelques fois, en observant chaque cycle.
  5. Déléguez la condition d'arrêt (une boucle d'objectif avec un plafond de tours). Observez où elle bloque ou dépasse ; resserrez les critères.
  6. Ce n'est qu'alors que vous déléguez le déclencheur (planifiez-la), avec un plafond budgétaire et des permissions en lecture seule pour commencer.
  7. Quand elle échoue, et elle échouera, transformez l'échec en cas de test. C'est la partie auto-améliorante, et c'est vous et la boucle ensemble.

Grimpez un échelon à la fois. Les personnes qui obtiennent des résultats exceptionnels de ces systèmes n'ont pas trouvé un modèle secret. Elles ont trouvé une tâche qui méritait d'être en boucle, défini « fini », et construit une vérification en laquelle elles ont confiance.

Une dernière chose

L'ère du prompt a appris à tout le monde à poser de meilleures questions. L'ère de la boucle vous demande autre chose : définir les résultats avec suffisamment de précision pour qu'une machine puisse les poursuivre pendant que vous êtes ailleurs, et concevoir les vérifications qui maintiennent cette poursuite honnête.

C'est une vraie compétence, et ce n'est pas de l'écriture de prompts. C'est plus proche du management. Un objectif, un standard de « fini », les bons outils, un budget, une vérification en laquelle vous avez confiance, et un chemin d'escalade pour les décisions de jugement. Chaque laboratoire de cet article, d'une entreprise de trois billions de dollars à une startup Telegram de deux personnes, converge vers une machinerie qui récompense exactement cette compétence.

La méthode lente fonctionne encore, si taper, attendre, corriger et redemander est la relation que vous voulez avec cette technologie. Mais la manivelle est désormais optionnelle, et les laboratoires ont collectivement décidé dans quelle direction cela va. L'unité de travail est la boucle. La personne qui définit la boucle, c'est vous.

Commencez par une. Définissez « fini ». Faites confiance, mais vérifiez. Puis lâchez la manivelle.

Sources

Tout ce qui précède a été vérifié par rapport aux sources primaires au cours de la semaine se terminant le 25 juillet 2026. Regroupé par laboratoire :

Le concept de boucle

Anthropic

OpenAI

Google

Meta

xAI

Mira

Vague open-weight

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux