Au-delà du « 98 % d'AGI » : Le virage vers une IA qui réalise des tâches complètes
Le 3 septembre 2026, OpenAI a annoncé GPT-6 Astra.
Immédiatement après sa sortie, l'attention s'est concentrée sur ses scores : environ 98 % sur le benchmark mathématique difficile « FrontierMath », 99,9 % sur « ARC-AGI-3 » pour mesurer les opérations informatiques, et 100 % sur l'évaluation de cybersécurité « ExploitBench ».
À voir ces chiffres seuls, on pourrait être tenté de dire : « Une IA quasi parfaite est arrivée » ou « L'AGI est enfin complète ».
Cependant, il est dangereux de juger GPT-6 Astra uniquement sur les scores des benchmarks.
Le changement apporté par Astra ne consiste pas seulement à renvoyer un texte plus correct en réponse à des questions.
Il ouvre des navigateurs, lit des documents, exécute du code, met à jour des feuilles de calcul, opère des sites web, enquête sur les causes en cas d'échec en cours de route, et rapporte finalement un livrable vérifiable.
L'unité de travail confiée à ChatGPT est passée d'« une seule question » à « une série d'opérations métier ».
)Si vous utilisez Astra uniquement pour des brouillons d'e-mails ou des résumés de texte comme le ChatGPT traditionnel, il reste simplement une IA de génération de texte coûteuse. Sa valeur émerge lorsque vous lui confiez des tâches que les humains effectuaient en changeant plusieurs fois d'écran, traitées comme un processus cohérent.(OpenAI
Dans cet article, nous approfondirons au-delà des présentations officielles des fonctionnalités, en abordant les cas confirmés par des entreprises étrangères, comment lire les benchmarks, les comparaisons avec Claude, la tarification, la sécurité, et la conception pour une utilisation pratique par les entreprises japonaises.
Qu'est-ce que GPT-6 Astra ?
GPT-6 Astra est positionné par OpenAI comme le modèle haut de gamme de la génération GPT-6, décrit comme le « modèle le plus intelligent et le plus aligné ».
Au lancement, il est d'abord déployé auprès d'organisations sélectionnées, puis sur ChatGPT Plus, Pro, Business, Enterprise, l'API et Amazon Bedrock. Dans Enterprise, il est désactivé par défaut jusqu'à ce qu'un administrateur l'active, et il n'y a aucune mention explicite d'une version gratuite dans l'annonce officielle.
)Le nom du modèle sur l'API est gpt-6-astra. Astra Pro, qui utilise plus de calcul, est également introduit pour les utilisateurs Pro, Business et Enterprise.(OpenAI
Les principales spécifications sont résumées ci-dessous :
Élément | GPT-6 Astra |
|---|---|
Longueur du contexte | 1 050 000 tokens |
Sortie maximale | 128 000 tokens |
Date limite des connaissances | 30 avril 2026 |
Entrée | Texte, Image (Natif) |
Sortie | Texte (Natif) |
Niveau de raisonnement | low / medium / high / xhigh / max |
Prix d'entrée API | 10 $ par million de tokens |
Prix de sortie API | 50 $ par million de tokens |
Entrée en cache | 1 $ par million de tokens |
Fine-tuning | Non pris en charge |
Outils principaux | Recherche Web, Recherche de fichiers, Exécution de code, Shell, Utilisation de l'ordinateur, MCP, Génération d'images, etc. |
Bien qu'il puisse lire des images, la sortie native du modèle est du texte. La génération d'images est effectuée en appelant un outil séparé. Ce n'est pas un modèle pour l'entrée audio ou vidéo directe.
De plus, pour les entrées longues dépassant 272 000 tokens, un multiplicateur de prix s'applique à l'ensemble de la requête. Les frais d'entrée et de cache sont doublés, et les frais de sortie sont multipliés par 1,5. Ce n'est pas parce qu'il peut contenir 1,05 million de tokens que vous devez y entasser tous vos documents internes à chaque fois ; l'efficacité des coûts chutera avant la précision.
Qu'est-ce qui a changé avec Astra ?
- L'opération informatique est passée de « auxiliaire » au champ de bataille principal
Au cœur d'Astra se trouve « Computer Use ».
Les IA précédentes pouvaient cliquer sur des boutons ou remplir des formulaires dans un navigateur. Cependant, des problèmes persistaient : elles s'arrêtaient si la disposition de l'écran changeait légèrement, ne pouvaient pas se remettre des erreurs en cours de processus, ou perdaient de vue l'objectif dans les tâches couvrant plusieurs sites.
GPT-6 Astra a enregistré 72,6 % sur OSWorld 2.0, qui mesure les opérations réelles sur un environnement de bureau. GPT-5.6 Sol était à 65,7 %.
)De plus, Astra a traité cette évaluation en environ 40 minutes, tandis que Sol a pris environ 75 minutes. Non seulement le taux de réussite, mais aussi le temps de traitement a été réduit d'environ 47 %. Dans ScreenSpot, qui trouve des cibles à l'écran, Astra a obtenu 92,7 % contre 76,9 % pour Sol.(OpenAI
C'est plus qu'une simple vidéo de démonstration fluide. Il cible des tâches telles que :
- Rechercher des hôpitaux ou des propriétés correspondant à des critères et comparer les candidats.
- Récupérer des valeurs à partir de plusieurs écrans de gestion pour créer des rapports.
- Saisir des informations client dans le CRM et mettre à jour le statut.
- Se connecter à des services web pour vérifier les paramètres.
- Exécuter une application créée dans un navigateur et corriger les bugs.
- Compléter des feuilles de calcul ou des diapositives en référençant plusieurs fichiers.
Dans Mind2Web, Astra utilisant un harnais Codex mis à jour a traité les tâches web 1,9 fois plus rapidement que les modèles précédents.
)Le point important ici est que la performance est déterminée par « l'ensemble du harnais », y compris le navigateur, les outils, l'environnement d'exécution et le processus de vérification, et pas seulement par l'intelligence du modèle. Le simple fait de sélectionner le nom Astra n'automatise pas automatiquement toutes les opérations à l'écran.(OpenAI
- Maintien d'un contexte long de 1,05 million de tokens jusqu'au bout
La longueur du contexte de GPT-6 Astra est d'environ 1,05 million de tokens. Il a la capacité de traiter des contrats, des procès-verbaux, des documents de conception, du code source et des recherches passées en une seule fois. Cependant, « contenir » et « utiliser avec précision » sont deux choses différentes.
Dans les évaluations MRCR pour trouver des informations intégrées dans des textes longs, Astra était à 100 % dans la plage 256k–512k et à 96,3 % dans la plage 512k–1M. Le résultat de GPT-5.6 Sol dans cette dernière était de 73,8 %.
)Bien qu'Astra soit performant dans les contextes longs, il ne mémorise pas parfaitement chaque mot lorsque vous mettez 1 million de tokens. Il échoue encore environ 3,7 % du temps dans la bande de 1 million de tokens. Évitez les conceptions qui placent des conditions critiques à un seul endroit dans un document volumineux ; vous devez énoncer explicitement les objectifs, les contraintes et les conditions d'approbation séparément.(OpenAI
Astra dispose également de mécanismes pour augmenter la continuité dans les sessions longues, tels que les appels d'outils asynchrones pour travailler sur d'autres tâches en attendant un outil, le pilotage pour permettre une correction de cap humaine pendant l'exécution, et le maintien du cache même si les niveaux de raisonnement sont modifiés en cours de conversation.
)Il s'éloigne de « écrivez une invite parfaite et laissez-la » vers un flux de travail de « vérification de la progression et correction de cap ».(OpenAI Developers
- Création de livrables finis, pas seulement de texte
Astra a renforcé sa capacité à créer des livrables comme des feuilles de calcul, des diapositives, des documents, des applications et des rapports de recherche. Les modèles précédents pouvaient créer un « plan de présentation », mais les humains devaient le transférer dans PowerPoint, ajuster le design, revérifier les chiffres et ajouter des liens. Astra vise le niveau suivant : lire des documents ou des modèles d'entreprise, organiser les chiffres, créer des diapositives/feuilles de calcul, les vérifier dans un navigateur et soumettre les fichiers corrigés.
L'adopteur précoce Higgsfield a déclaré qu'il pouvait traiter des tâches d'agent avec jusqu'à 20 % de tokens en moins que les modèles existants. Harvey a salué son jugement dans le travail juridique, Jane Street a noté une réduction des allers-retours pour les problèmes techniques complexes, et Lovable a apprécié ses capacités d'itération/test à des paramètres de raisonnement élevés.
)Cependant, ce sont des témoignages de clients précoces, pas la même chose que des preuves issues de tests de réplication indépendants par des tiers.(OpenAI
- Moins susceptible d'« oublier l'objectif » lors de longues tâches
Les agents conventionnels s'écartaient parfois du plan établi au départ — obsédés par un refactoring mineur alors qu'ils étaient censés implémenter une fonctionnalité, ou se terminant par une simple collecte d'informations au lieu d'une décision finale. Astra a amélioré la cohérence dans les travaux de longue durée.
D'un autre côté, les documents officiels pour développeurs notent qu'Astra peut s'arrêter pour poser des questions de clarification, sur-formater les détails, répéter des expressions ou tester plus que nécessaire.
)En d'autres termes, des performances plus élevées ne signifient pas que vous pouvez donner des instructions vagues. Vous devez définir les objectifs, les conditions d'achèvement, les critères pour poser des questions et les opérations nécessitant une approbation plus clairement qu'auparavant.(OpenAI Developers
Les benchmarks sont écrasants, mais pas « les meilleurs du monde dans tous les domaines »
L'annonce d'Astra présentait des chiffres impressionnants : 97,6 % sur FrontierMath, 99,9 % sur ARC-AGI-3 et 100 % sur ExploitBench. Ce sont des avancées significatives, mais nous devons distinguer les cibles de mesure des conditions d'exécution.
Les opérations informatiques et l'automatisation des tâches ont considérablement augmenté
Dans AutomationBench, qui est proche des tâches métier réelles, Astra a obtenu 41,4 %. GPT-5.6 Sol était à 18,1 %, et Claude Fable 5.1 à 31,4 %. Dans BenchCAD pour les tâches liées à la CAO, Astra était à 95,9 %, Sol à 83,3 % et Fable 5.1 à 84,3 %. Dans BrowseComp pour la recherche web, Astra était à 91,5 %, Sol à 90,4 % et Claude Opus 5 à 90,8 %. Astra mène ici, mais l'écart avec Sol et Opus est faible.
)L'avantage d'Astra est plus apparent dans les tâches composites complexes combinant opération à l'écran, traitement de fichiers, analyse de données et vérification, plutôt que de simplement trouver un seul résultat de recherche.(OpenAI
Fort en codage, mais n'a pas complètement dépassé Claude
Dans Terminal-Bench, Astra a obtenu 57,7 %, surpassant Sol (37,3 %) et Fable 5.1 (55,8 %). Dans les évaluations de migration de base de données interne, Astra était à 63,9 % contre 42,7 % pour Sol. Des améliorations claires sont observées dans la lecture des systèmes existants et la réalisation de modifications sans les casser.
Cependant, dans l'Artificial Analysis Coding Agent Index, Astra était à 67,0, Claude Fable 5 à 67,2 et Claude Opus 5 à 68,1. Dans FrontierCode Extended, Astra était à 64,5 contre 64,9 pour Fable 5. Dans l'évaluation Main, Astra était à 53,3, Fable 5 à 53,5 et Opus 5 à 53,4.
)Astra est dans le haut du panier pour le codage, mais il n'a pas surpassé Claude dans toutes les évaluations de code.(OpenAI
Des faiblesses subsistent dans le raisonnement académique
Malgré les 97,6 % sur FrontierMath, Astra a obtenu 57,2 % à « Humanity's Last Exam », qui mesure une large expertise et le raisonnement. Claude Fable 5.1 était à 65,0 %, Fable 5 à 63,8 % et Opus 5 à 63,6 %. Dans l'Artificial Analysis Intelligence Index, Astra était à 61,2, tandis que Fable 5.1 était à 65,7 et Opus 5 à 63,1.
)L'interprétation selon laquelle « il comprend presque tous les domaines académiques parce qu'il est à 98 % sur FrontierMath » ne tient pas. Selon l'évaluation, Claude produit encore des résultats plus élevés dans certains domaines.(OpenAI
Derrière les 99,9 % se cache un environnement d'exécution dédié
Les 99,9 % sur ARC-AGI-3 sont choquants, mais ils n'ont pas été obtenus en entrant simplement le problème dans Astra. OpenAI l'a exécuté avec un harnais utilisant l'API Responses et a modifié deux paramètres pour le rapprocher des performances d'utilisation réelle. Bien qu'OpenAI explique qu'il ne s'agit pas de paramètres spécifiques au benchmark, ce n'est pas un résultat zero-shot du modèle seul.
)De plus, les valeurs publiées sont les résultats les plus élevés parmi plusieurs paramètres de raisonnement. Il n'y a aucune garantie que les mêmes performances seront reproduites à chaque fois dans le ChatGPT standard.(OpenAI
Dans l'agrégat Artificial Analysis au lancement, le score global d'Astra était de 61, se classant 8e sur 202 modèles. Pendant ce temps, son prix d'entrée est de 10 $ contre une médiane de 2 $, et la sortie est de 50 $ contre une médiane de 10 $.
)C'est certainement l'un des meilleurs, mais ce n'est pas un modèle dans lequel vous jetez tout sans tenir compte du prix.(Artificial Analysis
Cas étranger 1 : Legora a rapproché 41 documents en quelques minutes
Legora, qui fournit de l'IA juridique en Europe, démontre la valeur pratique d'Astra. Ils ont utilisé Astra pour le rapprochement « tie-out » dans les états financiers, où les mêmes chiffres apparaissent dans le texte, les notes, les tableaux et les documents passés. Legora a traité 41 documents en une seule exécution d'agent, une tâche qui prend des heures ou des jours aux humains, en quelques minutes.
)Lors des tests, ils ont intentionnellement introduit 4 erreurs. Astra les a toutes trouvées, y compris un écart de 500 000 £ dans les notes sur les revenus. Il a maintenu la précision des modèles précédents tout en effectuant environ 50 vérifications correctes supplémentaires.(OpenAI
Cependant, l'amélioration d'environ 40 % était spécifique à ce flux de travail. Dans l'ensemble des tâches BAR plus larges de Legora, l'amélioration moyenne était d'environ 3 %. Astra n'améliore pas uniformément tout le travail juridique de 40 % ; il excelle dans la recherche d'incohérences dans des documents massifs.
)Le jugement final reste entre les mains d'experts juridiques humains. L'IA gère le rétrécissement de ce que les humains doivent lire et l'alignement des preuves d'incohérences.(OpenAI
Cas étranger 2 : Playco a réduit les corrections manuelles de 50 %
La société de jeux Playco a testé Astra avec « Playbot », un agent de développement pour Unity et Godot. Playbot édite des scènes, joue au jeu, vérifie le comportement et corrige les problèmes. Playco lui a fait créer trois prototypes thématiques différents à la fois. Bien qu'il ne s'agisse pas d'un « one-shot parfait », ils ont signalé une réduction de 50 % des corrections manuelles humaines par rapport aux modèles précédents.
)Des améliorations ont été observées dans la conscience spatiale, la reproduction d'images de référence, l'UI réactive, la sensation de jeu et la détection de bugs.(OpenAI
La force d'Astra n'est pas seulement de « bien coder du premier coup », mais la capacité d'exécuter le jeu, de vérifier l'affichage, de l'opérer, de trouver des problèmes, de les corriger et de réessayer — imitant l'itération d'un développeur humain.
Cas étranger 3 : Faire passer une fonctionnalité bloquée à 90 % d'achèvement
La développeuse de produits Claire Vo a partagé les résultats de l'utilisation d'Astra pour son service ChatPRD. Une fonctionnalité d'intelligence produit qui était bloquée depuis 6 mois en raison d'opérations CRM complexes et de l'implémentation de l'UI a atteint environ 90 % d'achèvement en une seule session Astra.
)Elle a également testé le contrôle de matériel (Divoom MiniToo) via CLI, une application de messagerie Mac et des actifs 3D dans Blender.(Lenny's Newsletter
Bien qu'il s'agisse de succès autodéclarés de partenaires précoces, ils montrent une tendance cohérente : Astra fait la différence lorsqu'il s'agit d'opérer des services externes, de lire du code existant et de terminer des livrables.
Avancées scientifiques : Résoudre des problèmes de longue date
OpenAI a rapporté avoir utilisé Astra pour résoudre ou faire progresser considérablement 10 problèmes non résolus en mathématiques et en informatique théorique. Le modèle a généré des arguments, des chercheurs humains ont organisé les brouillons, et le même modèle a utilisé Lean pour la formalisation.
)Selon OpenAI, le coût total en tokens pour cette recherche était d'environ 2 000 $ en tarification équivalente à GPT-5.6 Sol. Un exemple impliquait la mise à jour des bornes sur les écarts entre nombres premiers, un domaine où certains termes n'avaient pas été améliorés depuis plus de 80 ans.(OpenAI
Pourquoi Astra est « le plus sûr » mais « le plus difficile à surveiller »
GPT-6 Astra est le premier modèle largement déployé à atteindre le seuil « Critique » pour les capacités de cybersécurité dans la classification d'OpenAI. Doté d'outils et d'accès, il peut découvrir des vulnérabilités inconnues et construire des procédures d'attaque contre des systèmes défendus sans instruction humaine étape par étape.
)Dans ExploitBench, Astra a obtenu 100 % contre 78,5 % pour Sol. Il a même découvert deux vulnérabilités zero-day lors des tests, dont une qui a échappé à un sandbox de navigateur. Cependant, ces résultats ont utilisé l'environnement « Daybreak Blue » pour les chercheurs en défense ; la version standard dispose de contrôles pour refuser les tâches d'attaque avancées.(OpenAI
Paradoxalement, bien qu'Astra réduise les violations manifestes, son raisonnement interne est plus difficile à surveiller. Dans les évaluations adverses ordonnant de « contourner la surveillance », le taux de détection des systèmes de surveillance est tombé à moins de 11 % dans certaines tâches. OpenAI n'a trouvé aucune preuve de « stéganographie » (cacher des informations dans le raisonnement) se produisant naturellement, mais la conscience élevée du modèle d'être évalué rend l'alignement difficile à prouver de manière définitive.
Par où les entreprises japonaises devraient-elles commencer ?
- Tâches avec un volume de documents élevé et un risque élevé d'oubli : Vérification croisée des contrats, devis, factures et procès-verbaux. L'IA peut rassembler les documents et signaler les écarts pour examen humain.
- Tâches administratives nécessitant plusieurs écrans de gestion : Gestion EC, publicités et CRM. Commencez par la visualisation, l'agrégation et la rédaction ; n'accordez pas d'autorisation pour les paiements ou les suppressions initialement.
- Recherche de bout en bout et création de documents : Ne demandez pas seulement un résumé. Demandez-lui de rechercher des concurrents, de tabuler les fonctionnalités, d'analyser les différences et de résumer le tout dans un jeu de diapositives.
- Prototypage et QA : Faites-lui implémenter une fonctionnalité, puis ouvrez un navigateur pour vérifier les problèmes de mise en page ou les erreurs de lien.
Invite pratique pour Astra
Au lieu de simplement donner un rôle comme « Vous êtes un expert », définissez des limites et des conditions d'achèvement.
1## Objectif2L'état à atteindre par cette tâche : [Remplir l'objectif]34## Livrable final5Ce qui doit être soumis : [Fichiers, tableaux, rapports, fonctionnalités implémentées, etc.]6Conditions d'achèvement : [Critères spécifiques à remplir]78## Informations et outils autorisés9Documents à référencer : [Fichiers, URLs, données internes, etc.]10Outils à utiliser : [Recherche Web, navigateur, exécution de code, feuilles de calcul, etc.]1112## Processus131. Confirmer la demande et les documents.142. Organiser les informations manquantes et les risques.153. Procéder à la recherche, l'analyse et la création.164. Ouvrir et vérifier le livrable.175. Organiser les erreurs, les éléments non confirmés et les tâches restantes.186. Soumettre dans un état vérifiable.1920Si un processus s'arrête, continuer avec les tâches non dépendantes.21Ne poser des questions que pour les informations manquantes qui affectent significativement les résultats.22Pour les lacunes mineures, faire des hypothèses raisonnables et les enregistrer.2324## Autorisations25Vous pouvez procéder à la visualisation, l'analyse, la rédaction, les tests et la vérification des diffs.26Arrêtez-vous immédiatement avant les opérations suivantes et demandez une approbation avec les détails :27- Envoi externe28- Achats, paiements, contrats29- Publication, déploiement en production30- Suppression de données ou de fichiers31- Modifications des autorisations32- Opérations difficiles à annuler3334## Conditions de qualité35- Séparez les faits vérifiés des spéculations.36- Ajoutez des sources pour les chiffres importants.37- Recherchez des preuves contraires ou des exceptions.38- Ouvrez le livrable pour vérifier l'affichage et le fonctionnement.39- Le rapport final doit inclure les actions effectuées, les résultats de vérification et les risques restants.
Faiblesses d'Astra
- Manque de cas à long terme indépendants : La plupart des données proviennent de partenaires sélectionnés par OpenAI.
- 1,05 million de tokens n'est pas un entrepôt gratuit : Les coûts augmentent avec la taille de l'entrée, et le risque d'oubli n'est pas nul.
- Pas natif pour l'audio/vidéo : Nécessite des outils externes pour ces formats.
- Pas de fine-tuning : Vous devez utiliser RAG, MCP ou des instructions système pour refléter les règles de l'entreprise.
- Les mécanismes de sécurité peuvent arrêter un travail légitime : La surveillance peut ralentir la recherche en défense ou les tâches de développement.
- La sortie peut être « trop parfaite » : Elle a tendance à utiliser fortement les en-têtes et les listes, ce qui peut sembler trop « IA » pour une copie de marque.
Conclusion : La valeur réside dans le taux d'achèvement, pas dans les réponses
GPT-6 Astra est excessif pour écrire un seul e-mail ou résumer un procès-verbal. Son sens émerge dans les tâches où la recherche, le jugement, l'opération, la création et la vérification sont liés.
L'ère de « l'ingénierie d'invite en une phrase » est révolue. Ce qui compte maintenant, c'est quelles informations transmettre, quels outils connecter, combien d'exécution autoriser et ce qui définit l'achèvement. Astra n'est pas une baguette magique qui donne le même résultat à tout le monde ; si vous lui donnez un travail désordonné, il fera un travail désordonné rapidement. Si vous organisez l'objectif, les outils et les points de vérification, il transportera des heures de travail humain dans un état vérifiable en quelques minutes.





