Le 3 septembre 2026, OpenAI a publié GPT-6 Astra.
Beaucoup de gens se contentent de modifier les paramètres de leur modèle Codex pour passer à Astra et s'arrêtent là.
Cependant, OpenAI n'a pas seulement mis à jour le modèle ce jour-là. L'annonce officielle indique explicitement qu'ils ont mis à jour le « Harnais » Codex en même temps qu'Astra (Source : OpenAI « GPT-6 Astra : Une nouvelle génération d'intelligence » https://openai.com/index/gpt-6-astra/ ).
Le cerveau et l'environnement dans lequel ce cerveau fonctionne. OpenAI a reconstruit les deux simultanément.
Cependant, si des instructions peu claires ou des règles contradictoires subsistent, Astra peut s'arrêter en cours de tâche ou demander des clarifications constantes.
Dans cet article, je vais vous fournir ces trois éléments :
- Une explication complète des 8 éléments qui composent le Harnais Codex (avec leurs priorités)
- 4 invites de diagnostic et d'inventaire que vous pouvez copier-coller immédiatement
- Une séquence d'exécution pour savoir par où commencer en seulement 30 minutes aujourd'hui
Il est inutile de retenir quoi que ce soit, je vais donc partager l'invite la plus importante en premier. Cette invite permet à Codex de faire un rapport automatique sur l'état actuel du projet.
▼ Copiez à partir d'ici
Vous êtes un Concepteur de Harnais Codex.
L'objectif est de créer un état dans lequel GPT-6 Astra peut « effectuer des tâches de manière sûre, reproductible et jusqu'au bout sans avoir besoin d'instructions détaillées à chaque fois » dans ce projet.
Tout d'abord, ne faites aucune modification. Passez en revue la configuration actuelle du projet, les fichiers de paramètres et les fonctionnalités disponibles, puis diagnostiquez les points suivants :
- AGENTS.md : Le but, les règles à suivre, les interdictions, les conditions d'achèvement et les références sont-ils clairs ?
- docs / contexte : La structure est-elle organisée pour que vous puissiez trouver les informations nécessaires par vous-même ? Y a-t-il des descriptions obsolètes, redondantes ou contradictoires ?
- Compétences : Quelles tâches répétitives devraient être transformées en Compétences ? Inversement, quelles Compétences sont inutiles ?
- MCP / Plugins : Quels outils externes ou connexions de données manquent-ils ?
- Environnement : Pouvez-vous reproduire les dépendances, la configuration et l'exécution des tests par vous-même ?
- Permissions / Bac à sable : Vous a-t-on accordé des permissions excessives ? Inversement, y a-t-il trop d'approbations en attente qui bloquent le travail ?
- Hooks / Tests : Les vérifications pré-exécution, la détection de secrets, les tests et les vérifications d'achèvement peuvent-ils être automatisés ?
- Utilisation du Navigateur / de l'Ordinateur : Y a-t-il des tâches qui devraient être vérifiées en utilisant réellement le produit fini ?
- Sous-agents : Y a-t-il des tâches comme la recherche, la révision ou les tests qui seraient plus rapides si elles étaient parallélisées ?
- Boucle de Rétroaction : Existe-t-il un mécanisme pour réinjecter les échecs passés ou les instructions de correction dans AGENTS.md / docs / Compétence / Hook / Test ?
Format de sortie : A. Évaluez chaque élément sur une échelle de 5 points B. Les 5 principales lacunes critiques C. Les choses qui peuvent être corrigées en 30 minutes aujourd'hui D. Les choses à systématiser en une semaine E. Les fichiers à créer/modifier et les propositions de changement spécifiques F. Les risques de sécurité/permissions G. La priorité de mise en œuvre
N'inventez pas de paramètres basés sur des spéculations. Vérifiez les fonctionnalités et versions actuelles de Codex disponibles avant de juger. Indiquez clairement si les fonctionnalités sont Expérimentales / Bêta / Obsolètes.
Ne modifiez pas les fichiers, n'étendez pas les permissions et ne vous connectez pas à des services externes avant que j'aie examiné ces résultats de diagnostic.
▲ Copiez jusqu'ici
Exécuter ceci avant de finir de lire vous fera gagner du temps plus tard.
Cible et Utilisation de Cet Article
Cette cible est Codex tel qu'au 7 septembre 2026. Codex se met à jour rapidement, veuillez donc vérifier la date avant de lire.
Sont inclus les 8 composants du harnais, 7 niveaux de maturité et 4 modèles d'invites copiables.
Le public visé est « les personnes qui utilisent Codex mais se sont arrêtées après avoir écrit AGENTS.md ». Je fournirai des annotations pour les termes techniques lors de leur première apparition afin que les non-ingénieurs puissent également lire ceci.
Pour garantir de la valeur même si vous ne lisez pas tout, j'ai inclus une « Priorité » pour chaque élément. Si vous choisissez simplement ceux de haute priorité, cela fonctionnera au moins à un niveau minimum.
Qu'est-ce qu'un « Harnais » Exactement ?
Un harnais est un système qui connecte les modèles, les outils et les humains pour accomplir un travail.
Dans le blog technique d'OpenAI « Dérouler la boucle d'agent Codex » (janvier 2026, Michael Bolin), le harnais Codex est décrit comme « la boucle d'agent centrale et la logique d'exécution qui sert de fondement à toutes les expériences Codex » (https://openai.com/index/unrolling-the-codex-agent-loop/ ).
La boucle d'agent fait référence à cette répétition :
- Recevoir la saisie de l'utilisateur
- Interroger le modèle pour réfléchir
- Exécuter l'outil choisi par le modèle
- Montrer le résultat et le laisser réfléchir à nouveau
C'est le côté Codex, et non le modèle, qui exécute cette boucle.
Pour utiliser une analogie d'entreprise :
Astra = Le cerveau d'un employé extrêmement talentueux. Harnais = L'entreprise elle-même où cet employé travaille. Règles d'emploi, Wiki interne, procédures opérationnelles, droits d'accès aux systèmes internes, règles d'approbation, processus d'inspection et collègues.
Une erreur courante est de résumer paresseusement « AGENTS.md = Harnais ». AGENTS.md n'est qu'une partie du harnais. Tout comme une entreprise ne fonctionne pas uniquement avec un livret de règles distribué.
En pratique, l'effort global de création d'un « environnement de travail confortable » en combinant des éléments comme AGENTS.md, Compétences, MCP, Hooks, les paramètres de permission, les environnements d'exécution, le navigateur et les Sous-agents est appelé Ingénierie du Harnais. Cet article utilise le terme dans ce sens.
Qu'est-ce qui a Changé avec la Sortie d'Astra ?
Il y a trois choses, toutes officiellement déclarées par OpenAI.
- OpenAI a amélioré le cerveau et l'environnement simultanément
Lors de l'annonce d'Astra, OpenAI a explicitement déclaré avoir mis à jour le harnais Codex, rapportant que l'achèvement des tâches était 1,9 fois plus rapide par rapport à l'environnement GPT-5.6 Sol dans le benchmark d'opérations navigateur Mind2Web.
Dans OSWorld 2.0, Astra a obtenu un score de 72,6 % contre 65,7 % pour GPT-5.6 Sol. De plus, les évaluations de simulation pour le temps requis ont rapporté une réduction d'environ 75 minutes à environ 40 minutes par tâche.
La prudence est de mise ici : ce sont des chiffres publiés par OpenAI eux-mêmes et ce sont des résultats de benchmark dans des conditions spécifiques. Il n'y a aucune garantie que ce soit 1,9 fois plus rapide dans votre environnement.
Cependant, le message est clair : les gains de vitesse proviennent de la combinaison du modèle et de l'environnement d'exécution, pas du modèle seul.
- Astra lit beaucoup mieux les « instructions environnantes »
C'est le changement le plus efficace pour le travail pratique.
Les directives du modèle d'OpenAI indiquent que si Astra a des capacités de suivi d'instructions plus fortes, il peut également être plus sensible aux instructions contenues dans des fichiers comme Compétences et AGENTS.md. Il est fortement recommandé d'auditer les Compétences et autres fichiers accessibles au modèle (https://developers.openai.com/api/docs/guides/latest-model ).
Le même document contient un avertissement plus spécifique : des instructions peu claires ou contradictoires dans un fichier de compétence peuvent amener le modèle à s'arrêter et à bloquer le travail à un stade précoce.
La situation est la suivante :
Le cerveau est devenu plus intelligent. Par conséquent, il est devenu plus fidèle aux bonnes comme aux mauvaises règles qu'auparavant.
Supposons qu'une phrase inutile subsiste dans un AGENTS.md auquel vous ajoutez depuis l'année dernière. Sol aurait peut-être pu l'ignorer correctement. Astra la suivra strictement.
- Changements dans la gestion de la délégation et de la mémoire
Selon l'annonce officielle, Astra peut désormais maintenir des notes à travers les fenêtres de contexte dans Codex, évitant ainsi d'avoir à recompresser les détails accumulés en un seul résumé à chaque fois. Cela réduit la perte d'informations lors de longues tâches.
Cependant, au 7 septembre 2026, il s'agit d'une fonctionnalité expérimentale. Elle doit être explicitement activée dans config.toml et est désactivée par défaut. OpenAI a annoncé qu'elle deviendrait une fonctionnalité par défaut d'Astra dans les semaines à venir, mais pour l'instant, elle ne fonctionnera pas à moins que vous n'ajoutiez vous-même le paramètre.
D'un autre côté, les directives du modèle notent également que pour Astra, « la délégation aux Sous-agents pourrait ne pas être aussi fréquente que votre flux de travail ne le souhaite ». Cela signifie que si vous voulez de la parallélisation, vous devez spécifier quand déléguer du côté du harnais.
Les directives mentionnent également qu'Astra a tendance à fournir des réponses détaillées et formatées, vous devez donc spécifier le style et la structure requis.
Tout cela pointe vers : « Ne le laissez pas simplement tranquille parce que le modèle est intelligent », mais plutôt « Parce qu'il est intelligent, il agira exactement comme spécifié, alors corrigez vos spécifications. »
La Carte des 8 Éléments du Harnais
Les 8 éléments listés ici et les 7 niveaux de maturité décrits plus tard ne sont pas des définitions officielles d'OpenAI. Ils sont organisés de manière unique pour cet article sur la base des informations officielles vues jusqu'à présent. Utilisez-les comme un cadre pratique.
Voici la carte avec des analogies d'entreprise et des priorités :
- AGENTS.md | Règles d'Emploi & Politique de Base | Priorité : La plus élevée
- docs / Contexte | Wiki Interne & Manuels | Priorité : Élevée
- Compétences | Procédures Opérationnelles Standard | Priorité : Élevée
- MCP / Plugins | Connexion aux Systèmes Internes | Priorité : Moyenne
- Environnement | PC, Bureau, Environnement de Travail | Priorité : Élevée
- Permissions / Bac à sable | Autorité & Règles d'Approbation | Priorité : La plus élevée
- Hooks / Tests | Vérifications Automatiques & Inspections | Priorité : Moyenne
- Navigateur / Sous-agents | Yeux, Mains, Subordonnés | Priorité : Moyenne
Les débutants devraient commencer par 1 et 6. La raison est simple : rien qu'en organisant ces deux-là, vous solidifiez la base pour les autres éléments. Cependant, cela ne signifie pas que vous ne devriez pas vérifier les autres. Les permissions pour les services externes connectés via MCP, les procédures dans Compétences et les scripts exécutés par Hooks sont tous sujets à vérification de sécurité. Surtout puisque MCP est une connexion vers l'extérieur, vérifiez séparément si la destination est digne de confiance et si les permissions accordées sont minimales.
Vous trouverez ci-dessous une explication de chacun.
Couche d'Instruction et de Connaissance | AGENTS.md, docs, Compétences
Ce que c'est : Un fichier markdown placé à la racine du dépôt. Codex le lit avant de commencer le travail et le traite comme des règles spécifiques au projet.
Ce qu'il fait : Vous pouvez éviter d'écrire des prémisses comme « Exécutez toujours les tests avec cette commande » ou « Ne touchez pas à ce répertoire » dans chaque invite.
L'échec que presque tout le monde fait ici est de le surcharger.
Le blog technique d'OpenAI « Ingénierie du harnais : tirer parti de Codex dans un monde axé sur les agents » (11 février 2026, Ryan Lopopolo) décrit des échecs internes. Essayer un AGENTS.md massif a entraîné une pression sur le contexte, des anciennes règles laissées de côté et une confusion sur ce qui était important (https://openai.com/index/harness-engineering/ ).
L'équipe est passée à l'exploitation d'AGENTS.md comme une « carte » d'environ 100 lignes. Les détails sont placés sous docs, et AGENTS.md pointe simplement vers eux.
Au lieu de faire mémoriser un livret de règles de 1000 pages à une nouvelle recrue talentueuse, vous lui donnez une carte guide disant : « Regarde cette étagère si tu es bloqué. » C'est la différence.
Le contexte est une ressource finie. Les fichiers d'instructions massifs repoussent la tâche elle-même ou l'emplacement du code à lire.
Un AGENTS.md de style carte ressemble généralement à ceci :
▼ Copiez à partir d'ici
AGENTS.md
Qu'est-ce que ce projet ?
(1-3 lignes. Que fabriquez-vous, qui l'utilise ?)
Lisez ceci en premier
- Politique de Conception : docs/architecture.md
- Structure du Répertoire : docs/structure.md
- Glossaire : docs/glossary.md
- Échecs Passés & Corrections : docs/postmortems.md
Règles à suivre
- Tests : Exécutez-les tous avec (commande réelle) et ne signalez pas l'achèvement avec des échecs restants.
- Zones interdites : (Listez les chemins)
- Avant de valider : (commandes linter / formateur)
Définition de Terminé
Signalez « Terminé » uniquement lorsque toutes les conditions suivantes sont remplies :
- Les tests réussissent
- L'intention du changement peut être expliquée en un paragraphe
- Auto-vérifié pour les effets secondaires non intentionnels
En cas de doute
Ne faites pas d'hypothèses ; présentez au moins deux options et demandez-moi.
Priorité des Instructions
- Mes instructions immédiates (utilisateur)
- Ce AGENTS.md
- Procédures dans Compétences Vous pouvez ignorer les instructions de niveau inférieur qui contredisent les instructions de niveau supérieur. Si vous sautez une instruction, signalez son nom.
▲ Copiez jusqu'ici
La « Priorité des Instructions » finale est particulièrement efficace pour Astra et les modèles ultérieurs. Les directives du modèle indiquent explicitement de clarifier si les instructions de l'utilisateur ou les instructions de compétence prévalent.
Ce que c'est : Le référentiel de connaissances réel référencé par AGENTS.md. Documents de conception, diagrammes d'architecture, glossaires, enregistrements de décisions passées, etc.
Ce qu'il fait : Codex ne les lit que lorsque nécessaire, donc ils ne consomment pas constamment du contexte.
Ce qui est frappant dans l'article sur l'Ingénierie du Harnais, c'est l'explication de la lenteur des progrès initiaux. Ce n'était pas parce que Codex manquait de capacités, mais parce que « l'environnement était sous-spécifié ».
Ce qui manquait, c'étaient des outils, des abstractions, des structures internes et des informations sous une forme que Codex pouvait lire.
Ainsi, quand quelque chose échouait, la réaction de l'équipe n'était pas de « lui faire essayer plus fort ». C'était de penser : « Quelle capacité manque-t-il, et comment pouvons-nous la rendre lisible et applicable pour l'agent ? »
C'est l'essence de l'ingénierie du harnais. Corrigez l'environnement, pas l'invite.
Pour clarifier, il s'agit d'une étude de cas interne d'OpenAI. Une équipe de 3 personnes a produit environ 1 million de lignes et 1500 PRs en 5 mois avec 0 ligne de code écrite par un humain ; cela ne signifie pas que les utilisateurs généraux peuvent reproduire les mêmes résultats.
Ce que c'est : Un fichier au format SKILL.md. Il regroupe des instructions, des documents de référence et des scripts si nécessaire pour exécuter des tâches spécifiques avec la même procédure à chaque fois.
Ce qu'il fait : Vous pouvez passer du copier-coller de bonnes invites à la sauvegarde du travail lui-même.
Par exemple, si vous faites de « Création d'Article » une Compétence, le contenu serait :
- Recherche
- Vérification des faits
- Propositions de titres
- Conception de la structure
- Rédaction
- Vérification des expressions interdites
- Révision finale
La mise en garde pour Astra et les modèles ultérieurs est de ne pas en ajouter trop. Les noms et descriptions des Compétences sont chargés dans le contexte, donc si le nombre augmente, les descriptions sont tronquées, ce qui rend difficile de juger laquelle choisir. Si les descriptions se contredisent ou si toutes prétendent « Utilisez-moi », le modèle pourrait charger une Compétence qui ne correspond pas à la tâche.
Les Compétences sont destinées aux « procédures nécessaires uniquement pour des tâches spécifiques », pas aux « instructions nécessaires à chaque fois ». Confondre cela revient à tout écrire dans AGENTS.md.
Couche des Mains et des Pieds | MCP, Plugins, Environnement
Ce que c'est : MCP est une norme pour connecter Codex à des outils et données externes, utilisable à la fois dans les extensions CLI et IDE. Les Plugins sont un mécanisme pour distribuer des Compétences, des Connecteurs et des outils MCP ensemble. Dans Codex, ils sont disponibles dans l'application de bureau ChatGPT et en CLI, mais pas dans les extensions IDE.
Ce qu'il fait : Permet à Codex d'accéder à des documents externes, des navigateurs, des outils de conception, etc.
Peu importe à quel point Astra est intelligent, c'est inutile s'il ne peut pas atteindre les informations nécessaires. C'est comme un employé brillant sans compte de système interne.
Cependant, j'ai défini la priorité à Moyenne. Plus vous ajoutez de MCP, plus les choix d'outils augmentent et le contexte est consommé. La bonne approche est d'ajouter uniquement ce avec quoi vous avez actuellement du mal à entrer en contact.
Ce que c'est : L'échafaudage pour bouger réellement les mains, comme les dépendances, les procédures de configuration, les méthodes d'exécution des tests et les structures de répertoires de travail.
Ce qu'il fait : Codex peut s'auto-conduire jusqu'au point de « exécuter et vérifier ». Si cela manque, Codex revient à n'être qu'un rédacteur de code.
Un moyen simple de vérifier est de lui demander à partir d'un état vierge de « Configurer, réussir les tests et rapporter les résultats ». Là où il s'arrête est exactement ce qui manque.
Utiliser Git worktree pour séparer les répertoires pour chaque tâche rend plus difficile la collision de plusieurs tâches parallèles.
Couche de Sécurité et d'Inspection | Permissions, Bac à sable, Hooks
Ce que c'est : Deux paramètres indépendants qui déterminent combien Codex peut exécuter automatiquement. Le bac à sable détermine la portée des fichiers et des réseaux, tandis que la politique d'approbation détermine où demander une confirmation humaine.
Selon la documentation officielle de Codex, les paramètres initiaux pour les extensions CLI et IDE sont restreints à aucun accès réseau et à l'écriture uniquement dans l'espace de travail actif (https://developers.openai.com/codex/sandbox ).
Le bac à sable a 3 niveaux :
- lecture-seule : Peut lire mais pas écrire. Pour la consultation et la planification.
- écriture-espace-de-travail : Peut écrire dans le dossier de travail et les répertoires temporaires. C'est le standard.
- danger-accès-complet : Peut écrire n'importe où. Supprime effectivement le bac à sable.
Le préréglage Auto couramment utilisé est une combinaison d'écriture-espace-de-travail et de « demander une approbation uniquement lorsque nécessaire ». Codex s'arrêtera et vérifiera lorsqu'il essaiera de modifier en dehors de l'espace de travail ou de toucher au réseau.
Si vous voulez changer en cours de session, vous pouvez utiliser la commande /permissions. Une opération réaliste est lecture-seule pour la phase de planification et Auto pour la phase d'exécution.
Ce que je veux que vous compreniez, c'est que l'autonomie n'équivaut pas à tout permettre.
Passer à danger-accès-complet simplement parce que les approbations sont ennuyeuses est la solution la moins efficace. S'il a juste besoin d'écrire dans un répertoire spécifique, permettez simplement cet emplacement.
▼ Copiez à partir d'ici
【Codex CLI : Exemples de configuration pour la Planification et le Travail】
La cible est Codex CLI 0.134.0 ou ultérieur.
Les paramètres sont enregistrés dans trois fichiers : « Commun », « Planification » et « Travail ».
Ne collez pas cette explication entière dans un seul fichier de configuration. Écrivez uniquement les paramètres correspondants dans chaque destination.
Les destinations sont pour les paramètres Codex standard.
■ 1. Paramètres Communs
Chemin : ~/.codex/config.toml
Ne supprimez pas les paramètres existants ; ajoutez ou modifiez les éléments suivants. Si le même [sandbox_workspace_write] existe, modifiez à l'intérieur pour éviter les en-têtes en double.
[sandbox_workspace_write]
network_access = false
Spécifiez des répertoires approuvés supplémentaires uniquement si nécessaire.
writable_roots = ["/chemin/absolu/vers/repertoire-approuve"]
Uniquement si des destinations d'écriture supplémentaires sont nécessaires, supprimez le # au début de la ligne writable_roots et remplacez le chemin d'exemple par le chemin absolu réel.
■ 2. Paramètres de Planification
Chemin : ~/.codex/plan.config.toml
Enregistrez ces deux lignes dans un fichier séparé des paramètres communs.
approval_policy = "on-request"
sandbox_mode = "read-only"
■ 3. Paramètres de Travail
Chemin : ~/.codex/work.config.toml
Enregistrez ces deux lignes dans un autre fichier séparé.
approval_policy = "on-request"
sandbox_mode = "workspace-write"
■ Comment utiliser
N'écrivez pas la commande de démarrage dans le fichier de configuration ; exécutez-la depuis le terminal dans le dossier du projet.
Pour démarrer pour la planification :
codex --profile plan
Pour démarrer pour le travail :
codex --profile work
Les paramètres du profil sélectionné seront superposés aux paramètres communs.
Étant donné que les paramètres côté projet et les restrictions organisationnelles s'appliquent également, vérifiez les permissions réelles avec /permissions après le démarrage.
Remarque : network_access = false est le paramètre de communication pour les commandes exécutées à l'intérieur du bac à sable. Vérifiez les permissions pour les connexions externes comme MCP séparément.
▲ Copiez jusqu'ici
Étendre une limite d'un cran est complètement différent de jeter la limite elle-même. Il en va de même pour l'accès réseau ; ce n'est un jugement valable que pour les projets qui ont vraiment besoin de récupérer des paquets de dépendances.
Ce que c'est : Un mécanisme pour insérer vos propres scripts ou outils MCP au milieu du traitement de Codex. Il est activé par défaut en tant que fonctionnalité Stable.
Ce qu'il fait : Par exemple, ces automatisations :
- Arrêter les commandes dangereuses juste avant d'exécuter un outil
- Inspecter les secrets comme les clés API
- Exécuter un linter immédiatement après avoir modifié un fichier
- Vérifier que les tests réussissent à la fin du travail
Il s'agit de passer de « faire attention à ne pas faire d'erreurs » à « le système s'arrête s'il y a une erreur ».
Cependant, OpenAI lui-même met en garde de traiter les Hooks comme des garde-fous, et non comme des limites d'application absolues, car Codex pourrait exécuter un travail équivalent via différents chemins d'outils.
Les choses que vous voulez vraiment arrêter doivent être arrêtées au niveau du bac à sable et des permissions, pas des Hooks. Les Hooks sont le deuxième filet posé par-dessus.
Couche des Yeux et de l'Équipe | Navigateur, Sous-agents
Le faire construire un site web et terminer par « J'ai écrit le code, j'ai fini » est un gaspillage.
Remarque : L'Utilisation de l'Ordinateur (opération réelle sur l'écran) décrite ici est actuellement une fonctionnalité pour la version application de bureau de Codex. Le Navigateur intégré / Utilisation de l'Ordinateur traité dans ce chapitre est utilisé dans l'application de bureau ChatGPT. Le Navigateur intégré n'est pas disponible dans les extensions Codex CLI ou IDE. Pour les opérations de navigateur en CLI/IDE, préparez d'autres mécanismes comme MCP ou Playwright.
Vous devriez lui faire faire ceci :
- Ouvrir le navigateur
- Afficher l'écran réel
- Essayer de l'utiliser
- Trouver les parties cassées
- Les corriger
- Vérifier à nouveau
Astra est une génération qui s'est considérablement améliorée dans les benchmarks d'opérations informatiques, donc ce processus vaut la peine d'être délégué. Le rapport sur la réduction du temps de 75 à 40 minutes dans OSWorld 2.0 concerne précisément cela.
Dans l'étude de cas de l'Ingénierie du Harnais, ils ont créé un environnement où Codex pouvait gérer le protocole Chrome DevTools, le DOM, les captures d'écran, les journaux et les métriques pour gérer tout, de la reproduction de bugs à la correction et à la vérification.
Ce que c'est : Un mécanisme par lequel Codex divise le travail entre plusieurs sous-agents. Chacun a un contexte indépendant.
Ce qu'il fait : Parallélise les tâches à forte lecture et indépendantes comme la recherche, les tests, l'analyse de journaux et la synthèse.
Deux mises en garde :
L'une est que plusieurs agents écrivant le même code simultanément entreront en collision. Soyez prudent avec la parallélisation des tâches d'écriture.
L'autre est simplement que la consommation de jetons augmente. Cela devient plus rapide, mais pas moins cher.
Et spécifiquement pour Astra, les directives du modèle disent que la fréquence de délégation pourrait être inférieure à celle attendue. Si vous voulez de la parallélisation, spécifiez explicitement dans AGENTS.md ou les invites : « Vous pouvez diviser les tâches de recherche et les exécuter en parallèle. »
Le Renversement de l'Ère Astra | Inventaire, Pas Ajout
J'ai listé 8 éléments, mais la chose la plus importante que je veux transmettre est le contraire.
La première chose à faire pour Astra est un inventaire des instructions existantes. OpenAI recommande également d'auditer les instructions auxquelles le modèle se réfère, comme Compétences et AGENTS.md. Gardez les instructions nécessaires, comblez les lacunes et corrigez ou réduisez les instructions anciennes/contradictoires après vérification.
Le verbe utilisé dans les directives d'OpenAI est « auditer », pas « ajouter ».
Les rapports des équipes qui ont pré-vérifié Astra vont dans le même sens. Kilo, un fournisseur d'outils de codage IA, a écrit dans une critique qu'Astra nécessite clairement moins d'échafaudage AGENTS.md, et que la plupart des « instructions pour empêcher le modèle de dérailler » accumulées au cours de la dernière année sont désormais inutiles. Ils ont même suggéré que si vous avez un fichier d'agents gonflé, essayez d'en supprimer la moitié et de réessayer (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).
C'est l'impression d'une seule entreprise, pas un point de vue officiel. Cependant, cela correspond parfaitement aux directives officielles indiquant que « des instructions contradictoires peuvent provoquer des arrêts précoces ».
Plus le modèle est intelligent, plus il est gêné par les anciennes instructions. Paradoxal, mais vrai.
L'inventaire est plus rapide lorsqu'il est effectué par Codex lui-même.
▼ Copiez à partir d'ici
Veuillez lire AGENTS.md, tout ce qui se trouve sous docs et tous les fichiers de Compétence chargés dans ce dépôt. Ne faites pas encore de modifications.
En supposant un travail avec GPT-6 Astra, classifiez et rapportez ce qui suit :
【Conserver】 Instructions qui sont toujours valides et améliorent réellement votre jugement. Expliquez pourquoi en une ligne.
【Candidats à la Suppression】 Éléments qui correspondent à l'un des cas suivants. Citez le texte original et fournissez une raison. Ce n'est pas une décision de suppression, mais une liste pour examen humain.
- Instructions écrites pour corriger le cap des modèles de la génération précédente qui sont désormais inutiles.
- Instructions pointant vers des spécifications, des chemins ou des commandes qui ont déjà changé.
- Instructions vous ordonnant de faire des choses que vous faites naturellement sans qu'on vous le dise.
- Instructions qui contredisent d'autres instructions.
Cependant, s'il existe ne serait-ce qu'une légère possibilité que l'instruction ait été ajoutée pour des raisons de sécurité, de sûreté, ou en raison d'accidents/incidents passés, ne la classez pas comme 【Candidat à la Suppression】. Placez-la plutôt dans une catégorie distincte 【Nécessite un Jugement Humain】 et expliquez pourquoi vous pensez que cette possibilité existe. Ne concluez pas qu'elle est "inutile" en vous basant uniquement sur votre propre jugement.
【Réécriture】 Instructions dont l'intention est correcte mais dont le libellé est ambigu, redondant, ou dont la priorité n'est pas claire. Proposez une réécriture.
【Questions】 Descriptions dont vous avez eu du mal à juger le sens en les lisant.
Enfin, assurez-vous de signaler les deux points suivants :
- S'il y avait des instructions qui vous ont effectivement bloqué ou ont provoqué une hésitation, fournissez la ligne exacte et la raison de votre hésitation.
- Si AGENTS.md devait être condensé en un index d'environ 100 lignes, quelle structure utiliseriez-vous ?
▲ Copier jusqu'ici
La liste résultante des "Candidats à la Suppression" ne doit pas être simplement supprimée intégralement. Vérifiez d'abord pourquoi cette instruction a été ajoutée, son historique, et ce qu'elle affecte si elle est supprimée. Les procédures de vérification ajoutées après des accidents passés ne doivent pas être supprimées simplement parce que Codex les juge "inutiles pour son état actuel". Surtout pour les instructions de sécurité ou de sûreté, la personne qui connaît l'historique devrait prendre la décision finale. Ne procédez à la suppression que pour les éléments dont la raison de l'ajout est confirmée et dont l'impact est jugé limité. En cas de doute, conservez l'instruction. Si vous la déplacez vers docs, laissez un chemin clair afin qu'elle puisse être référencée de manière fiable depuis AGENTS.md si nécessaire.
Maturité | Où en êtes-vous ?
Identifiez votre stade.
Nv.0 : Rédiger des instructions à chaque fois. Comme expliquer tout depuis le début à un employé talentueux chaque matin.
Nv.1 : AGENTS.md et docs existent. Comme une entreprise qui a des règles et des manuels.
Nv.2 : Les compétences (Skills) existent. Les procédures pour le travail de routine sont définies.
Nv.3 : MCP et Plugins sont connectés. Peut accéder aux systèmes nécessaires de manière indépendante.
Nv.4 : Les autorisations, Hooks et Tests fonctionnent. L'exécution automatique et l'inspection automatique existent.
Nv.5 : Utilisation du navigateur et des sous-agents. Peut vérifier de manière indépendante et déléguer le travail.
Nv.6 : Une boucle de rétroaction existe. Le système lui-même est mis à jour à chaque échec.
Beaucoup de gens sont au Nv.1. Et ils essaient d'avancer en épaississant AGENTS.md. Ce n'est pas le Nv.2 ; c'est juste un Nv.1 gonflé.
Le Nv.6 est de nature différente. Il ne s'agit pas d'ajouter de nouvelles fonctionnalités. Il s'agit simplement d'avoir une règle opérationnelle : "Si la même erreur est commise deux fois, réintégrer cette correction dans AGENTS.md, Skill, Hook ou Test."
C'est là qu'OpenAI s'est orienté vers une "correction continue plutôt qu'une vérification ponctuelle" dans l'article sur l'ingénierie de la robustesse (Harness Engineering).
Séquence d'Exécution | 30 Minutes, 1 Jour, 1 Semaine
Établissez des priorités. Faites-les dans cet ordre.
30 Premières Minutes
- Exécutez l'invite de diagnostic au début de cet article.
- Vérifiez les paramètres d'autorisation actuels avec
/permissions. Si vous utilisez régulièrementdanger-full-access, revenez d'abord àworkspace-write. - Ouvrez AGENTS.md et lisez-le. Vérifiez la présence de descriptions redondantes, contradictoires ou obsolètes. 100 lignes n'est qu'un exemple interne d'OpenAI, pas une norme absolue. Regardez si le contenu est organisé plutôt que le nombre de lignes.
1 Jour
- Exécutez l'invite d'inventaire. Supprimez les 【Candidats à la Suppression】 uniquement après avoir confirmé la raison de l'ajout et l'impact. Pour les 【Nécessite un Jugement Humain】, décidez après avoir consulté quelqu'un qui connaît l'historique.
- Déplacez les parties précieuses du contenu supprimé vers
docs. - Ajoutez la "Priorité des Instructions" à la fin d'AGENTS.md.
- Demandez à partir d'un état vierge de "Configurer et réussir les tests", et enregistrez où il s'arrête.
1 Semaine
- Choisissez une tâche que vous effectuez plus de deux fois par semaine et transformez-la en Skill.
- S'il existe une source de données externe que vous avez toujours du mal à atteindre, connectez-la via MCP.
- Faites en sorte qu'une vérification d'informations secrètes ou qu'une exécution de linter post-édition devienne un Hook.
- Décidez d'un endroit pour enregistrer les échecs afin d'assurer un retour d'information.
À ce stade, vous atteindrez l'entrée du Nv.4 à partir du Nv.1.
Index Inversé | Par Objectif
Vous voulez arrêter de répéter la même explication → AGENTS.md
Codex fait référence à des informations obsolètes → Inventaire des docs / Contexte
La qualité de la même tâche fluctue → Skills
Impossible d'accéder aux données nécessaires → MCP / Plugins
Peut écrire du code mais ne peut pas passer à la vérification → Environnement
Peur qu'il agisse de lui-même, ou trop d'approbations → Permissions / Sandbox
Même erreur répétée → Hooks / Tests
Vous ne remarquez pas les problèmes de mise en page → Browser / Computer Use
La recherche prend trop de temps → Subagents
A commencé à s'arrêter en milieu de tâche après être passé à Astra → Vérifiez d'abord les notifications d'arrêt, les demandes d'approbation et les erreurs. Si nécessaire, vérifiez les paramètres et l'utilisation avec /status dans le CLI. Si des instructions contradictoires sont suspectées, faites l'inventaire d'AGENTS.md et des Skills.
La Prochaine Compétition, c'est l'Environnement, Pas le Cerveau
Le jeu du choix des modèles est en grande partie terminé.
Astra est assez intelligent et exécute exactement les instructions. C'est pourquoi ce que vous laissez comme instructions détermine le résultat.
Du jeu de la rédaction de bonnes instructions au jeu de la conception de bons environnements de travail. Astra est le modèle qui a finalisé cette transition.
Vous n'avez qu'une seule chose à faire aujourd'hui. Ouvrez AGENTS.md et lisez-le. C'est le point de départ.
Merci d'avoir lu jusqu'ici.
Je partage des exemples concrets de gain de temps et d'activités annexes liées à l'IA utilisant ChatGPT, Claude et Copilot dans un chat ouvert gratuit. Si vous voulez faire partie de ceux qui "savent utiliser l'IA", rejoignez-nous maintenant.





