Comment fonctionne réellement GPT 6 Astra

@Mikadzyki_NFT
ANGLAIS08 sept. 2026
955K
83
16
16
142

TL;DR

GPT 6 Astra introduit une architecture de transformateur en boucle qui permet au modèle de réutiliser ses poids et de traiter ses états internes à plusieurs reprises avant de produire du texte. Cela dissocie le nombre de paramètres de la profondeur de calcul, permettant ainsi un calcul adaptatif pendant l'inférence.

**

OpenAI décrit GPT 6 Astra comme son modèle le plus performant et le mieux aligné à ce jour.

Greg Brockman est allé plus loin, affirmant qu'il serait raisonnable de considérer Astra comme une forme précoce d'intelligence générale artificielle.

Le modèle est également devenu le premier à franchir le seuil critique d'OpenAI en matière de cybersécurité. Selon l'entreprise, il peut découvrir des vulnérabilités jusqu'alors inconnues et construire des exploits fonctionnels avec un guidage humain limité.

Ces affirmations sont spectaculaires, mais elles ne constituent pas la partie la plus importante de cette sortie.

Le véritable changement est architectural.

Un modèle de langage conventionnel fait passer l'information à travers une séquence fixe de blocs de transformeurs et génère le jeton suivant. Astra peut traiter son état interne à travers les mêmes blocs de calcul plusieurs fois avant d'afficher un seul mot à l'utilisateur.

Il ne génère pas simplement une chaîne de pensée plus longue.

Il passe plus de temps à réfléchir avant de répondre.

1 Comment fonctionnent les modèles de langage modernes

Imaginez que vous tapiez :

L'Everest est...

Le modèle doit prédire la suite.

Son mécanisme d'attention détermine quelles parties du contexte sont importantes. Le mot Everest active des concepts connexes tels que les montagnes, l'altitude, l'Himalaya, le Népal, le Tibet, l'escalade et les expéditions.

Le modèle combine ensuite ces associations avec le contexte environnant. Dans la plupart des cas, une suite comme la plus haute montagne de la Terre devient hautement probable.

À l'intérieur d'un transformeur conventionnel, cette représentation traverse une séquence de blocs. Chaque bloc la transforme une fois et transmet le résultat au suivant.

Si un modèle contient 40 blocs, l'état caché traverse les 40 en séquence. La représentation finale est convertie en une distribution de probabilité pour le jeton suivant.

Plus de blocs signifient généralement une plus grande profondeur de calcul. Un modèle plus profond peut effectuer plus de transformations avant de s'engager sur une réponse.

Mais ajouter des blocs augmente également le nombre de paramètres, les besoins en mémoire et le coût d'entraînement.

L'hypothèse habituelle a toujours été simple : si vous voulez un modèle plus profond, vous devez construire une pile de couches plus grande.

Une architecture en boucle change ce principe.

2 Ce que change une architecture en boucle

Selon un rapport de The Information, GPT 6 Astra utilise une architecture de transformeur en boucle.

OpenAI n'a pas publié de spécification technique complète, donc l'implémentation exacte reste privée. Mais le mécanisme général est déjà bien compris grâce à la recherche publique.

Au lieu d'envoyer l'état caché à travers chaque bloc une seule fois, le modèle peut renvoyer le résultat à un bloc de calcul et le traiter à nouveau.

Considérez-le comme un brouillon interne.

Le modèle produit une représentation préliminaire, l'envoie à travers les mêmes poids, l'affine, et répète le processus plusieurs fois. Ce n'est qu'après la fin de la boucle que le jeton visible suivant apparaît.

Mikadzyki🌙 - inline image

Le nombre de paramètres reste le même. Les poids restent à l'intérieur d'un bloc, le calcul augmente avec le nombre de boucles, et seul le jeton final est émis.

Le détail clé est que le nombre de paramètres n'augmente pas nécessairement.

Les mêmes poids sont réutilisés à chaque passage.

Ce qui augmente, c'est la quantité de calcul.

Dans un transformeur conventionnel, un jeton traverse une séquence de blocs différents. Dans un transformeur en boucle, il peut traverser la même structure partagée plusieurs fois.

Le modèle devient plus profond par le calcul sans devenir plus grand par le nombre de paramètres.

Cela crée un nouveau compromis :

  • Plus de paramètres nécessitent plus de mémoire
  • Plus de boucles nécessitent plus de calcul
  • Un même modèle peut consacrer différentes quantités de calcul à différentes tâches

Le dernier point est particulièrement important. La profondeur de calcul peut changer sans créer un nouveau modèle.

3 Comment la profondeur récurrente est entraînée

Placer simplement un bloc de transformeur à l'intérieur d'une boucle ne suffit pas.

Si un modèle effectue toujours exactement 32 passages pendant l'entraînement, il peut apprendre à se fier à la position de chaque étape. Le premier passage pourrait apprendre une fonction, le dixième une autre, et le trente-deuxième pourrait devenir une couche de sortie fixe.

Le résultat serait un réseau conventionnel de 32 couches déguisé en boucle.

Les chercheurs résolvent ce problème en faisant varier le nombre de passages récurrents pendant l'entraînement.

L'une des démonstrations les plus claires est venue du modèle à profondeur récurrente Huginn. Ses créateurs ont entraîné un réseau de 3,5 milliards de paramètres sur environ 800 milliards de jetons.

À chaque étape d'entraînement, le nombre de boucles était échantillonné à partir d'une distribution avec une moyenne proche de 32. Un exemple pouvait recevoir quatre passages, un autre 17, un autre 40, et un autre près de 90.

Le modèle ne pouvait pas savoir à l'avance quel passage serait le dernier.

Il devait donc apprendre quelque chose de plus général qu'une séquence fixe d'opérations.

Il devait apprendre à améliorer son état interne actuel.

Mikadzyki🌙 - inline image

Résumé de l'article sur la profondeur récurrente sur arXiv

L'entraînement à travers des dizaines d'étapes récurrentes crée un autre problème : la mémoire.

La rétropropagation standard nécessiterait de stocker les activations intermédiaires de chaque boucle. Avec suffisamment de répétitions, le coût en mémoire devient énorme.

Les chercheurs de Huginn ont utilisé un compromis pratique. Le passage avant pouvait s'exécuter pour de nombreuses boucles, mais les gradients n'étaient calculés qu'à travers les huit dernières.

Les passages précédents influençaient toujours le résultat final, mais leur historique d'activation complet n'avait pas à rester en mémoire.

C'est similaire à la rétropropagation tronquée dans le temps. La différence est que la récurrence se produit à travers la profondeur de calcul plutôt qu'à travers les mots d'une séquence.

Mikadzyki🌙 - inline image

Le nombre de boucles est échantillonné à chaque étape d'entraînement, tandis que le gradient n'est calculé qu'à travers les huit derniers passages.

Le modèle n'apprend pas à effectuer une séquence rigide de 32 opérations.

Il apprend à déplacer son état caché vers une réponse utile, quel que soit le moment où le processus est arrêté.

Cela change ce que signifie la profondeur.

La profondeur n'est plus seulement une propriété choisie par les ingénieurs avant l'entraînement. Elle peut devenir une variable pendant l'inférence.

4 Calcul adaptatif pendant l'inférence

La plupart des contrôles de raisonnement actuels opèrent au niveau des jetons visibles.

Si on demande à un modèle de réfléchir plus longtemps, il génère une chaîne de pensée plus longue, utilise plus de jetons de sortie, ou crée du texte intermédiaire supplémentaire.

Une architecture en boucle offre un mécanisme différent.

Le nombre de passages internes peut changer sans modifier les poids et sans forcer le modèle à écrire une explication plus longue.

Une tâche simple pourrait recevoir quatre boucles.

Une preuve mathématique difficile pourrait en recevoir 32.

Un problème de codage complexe pourrait en recevoir 64.

Le modèle reste le même. Seule la quantité de calcul interne change.

Mikadzyki🌙 - inline image

Les poids restent fixes. Seul le nombre de passages internes utilisés pour traiter chaque jeton change.

Les expériences publiques sur la profondeur récurrente montrent déjà le schéma attendu.

La performance s'améliore rapidement pendant les premières boucles. Les gains deviennent ensuite plus petits jusqu'à ce que les courbes approchent un plateau.

Cela suggère que l'état caché converge.

Les premiers passages effectuent de grandes corrections. Les passages ultérieurs affinent des détails plus petits. Finalement, un calcul supplémentaire cesse de produire des améliorations significatives.

Un futur système pourrait détecter ce moment automatiquement.

Au lieu d'attribuer un nombre de boucles fixe à chaque invite, le modèle pourrait continuer à traiter jusqu'à ce que son état caché devienne suffisamment stable. Les jetons faciles seraient peu coûteux. Les jetons difficiles recevraient plus de calcul.

Cela créerait une véritable profondeur de calcul adaptative.

Réfléchir plus longtemps ne signifierait plus écrire davantage.

5 Recherche et premiers résultats pratiques

La réutilisation des couches de transformeurs n'est pas une idée nouvelle.

Les Universal Transformers ont introduit le traitement récurrent en 2018. ALBERT a réduit le nombre de paramètres en partageant les poids entre les couches. Mixture of Recursions a exploré le routage des jetons à travers différentes quantités de calcul.

Le modèle ouvert Nanbeige4.2 3B fournit un exemple particulièrement direct.

Sa configuration contient 22 couches et num_loops : 2. En effet, le modèle traverse ces couches deux fois. Il a approximativement le nombre de paramètres d'un réseau de 22 couches mais environ la profondeur de calcul d'un réseau de 44 couches.

Mikadzyki🌙 - inline image

Configuration de Nanbeige4.2 3B sur Hugging Face

Vingt-deux couches, num_loops : 2, et une licence Apache 2.0. Le mécanisme est déjà visible dans une configuration de modèle ouvert.

Pendant des années, les conceptions de transformeurs récurrents sont restées des idées de recherche intéressantes plutôt que l'approche dominante.

L'ingrédient manquant était des preuves solides de passage à l'échelle.

Le 1er septembre, un groupe de chercheurs a publié SMELT, une étude conçue pour comparer les transformeurs en boucle et conventionnels dans des conditions appariées.

Ils ont contrôlé le nombre de paramètres, le calcul d'entraînement et la taille du cache KV. Sous ces contraintes, les modèles en boucle nécessitaient 6,8 % à 18 % de calcul d'entraînement en moins pour atteindre le même niveau de performance.

Les plus grands gains sont apparus sur le code.

Mikadzyki🌙 - inline image

Résumé de l'article SMELT sur arXiv

Avec le calcul, les paramètres et le cache KV appariés, la boucle économise 6,8 % à 18 % du calcul d'entraînement, avec les gains les plus forts sur le code.

Les chercheurs ont également observé un changement dans le comportement d'attention.

Dans les transformeurs conventionnels, les premiers jetons d'une séquence deviennent souvent des puits d'attention. Ils reçoivent une quantité d'attention disproportionnée même lorsque leur importance sémantique est limitée.

Après un second passage à travers les mêmes blocs, l'attention du modèle s'est déplacée vers des jetons plus pertinents.

La deuxième boucle n'a pas simplement répété la première. Elle a utilisé le résultat du premier passage comme fondation pour un traitement plus sélectif.

SMELT ne prouve pas que tous les futurs modèles devraient être récurrents. Il montre que la boucle reste compétitive après que les principales conditions expérimentales sont appariées.

La question n'est plus de savoir si la profondeur récurrente peut fonctionner.

La question est de savoir jusqu'où elle peut passer à l'échelle.

6 Interprétabilité et contrôle

La même caractéristique architecturale qui rend les boucles attrayantes complique également la surveillance des modèles.

Avec un raisonnement explicite par chaîne de pensée, au moins certaines étapes intermédiaires apparaissent sous forme de texte lisible. Les chercheurs peuvent les inspecter, rechercher des schémas suspects et comparer le raisonnement énoncé avec la réponse finale.

Un modèle récurrent peut effectuer plus de traitement à l'intérieur des activations cachées sans générer de texte.

Buck Shlegeris et Ryan Greenblatt ont soutenu que cela pourrait réduire l'utilité de la surveillance par chaîne de pensée. Si plus de traitement se déplace dans le calcul caché, l'explication visible peut révéler moins sur la façon dont le modèle a atteint son résultat.

Sebastian Raschka a offert un contrepoint important.

La réutilisation des poids ne crée pas automatiquement une cognition secrète ou inaccessible. Les activations internes peuvent toujours être étudiées avec des outils d'interprétabilité. La principale différence est que le modèle peut avoir besoin de moins de jetons intermédiaires visibles parce que plus de calcul se produit avant le début de la génération.

Le scientifique en chef d'OpenAI, Jakub Pachocki, a également déclaré que le graphe de calcul d'Astra reste dans un facteur d'environ deux de la profondeur de GPT 4 et que la boucle a été délibérément limitée pour préserver les capacités de surveillance.

Cela suggère une implémentation restreinte plutôt qu'un processus récurrent illimité.

Une chaîne de pensée n'est de toute façon pas garantie d'être une transcription fidèle du calcul interne d'un modèle. Le système est récompensé pour produire des réponses utiles, pas pour fournir un rapport scientifiquement précis de chaque opération cachée.

Des recherches impliquant OpenAI, Anthropic et Google DeepMind montrent que l'explication d'un modèle peut omettre des facteurs importants, rationaliser une décision après coup, ou présenter un chemin plus propre que celui qui a réellement influencé le résultat.

Une architecture en boucle rend cette distinction plus difficile à ignorer.

Le raisonnement visible peut être une interface.

Le calcul principal peut se produire à l'intérieur du modèle avant qu'aucun texte n'apparaisse.

7 Résultats de GPT 6 Astra

Le résultat de benchmark le plus spectaculaire de GPT 6 Astra est un score de 99,9 % sur ARC AGI 3.

Ce nombre semble presque définitif, mais il dépend fortement de la façon dont le test est exécuté.

Simon Willison a souligné que le résultat de 99,9 % provenait du harnais Provider Adapter personnalisé d'OpenAI. Sous le harnais standard ARC Prize, le même modèle a obtenu 62,7 %.

Le modèle n'a pas changé.

L'environnement d'évaluation, si.

Mikadzyki🌙 - inline image

Le même modèle produit deux scores différents à deux coûts d'exécution différents.

L'exécution OpenAI a coûté environ 19 000 $. L'exécution standard a coûté environ 26 000 $.

Le score significativement plus élevé a également été produit par la configuration la moins chère.

Cela ne rend pas nécessairement le résultat invalide. Un adaptateur personnalisé peut interagir avec le modèle plus efficacement ou exposer des capacités qu'un cadre d'évaluation générique manque.

Mais le chiffre principal ne peut pas être interprété séparément des conditions qui l'ont produit.

Mikadzyki🌙 - inline image

GPT 6 Astra sur ARC AGI 3

Un modèle, deux harnais d'évaluation, et un écart de 37,2 points de pourcentage.

D'autres évaluations sont moins spectaculaires.

Sur l'Artificial Analysis Intelligence Index, Astra obtient des scores à peu près comparables à GPT 5.6 Sol et environ cinq points en dessous de Claude Fable 5.1.

Son avantage plus pratique pourrait être l'efficacité sur les tâches agentiques, où il peut atteindre des performances compétitives à un coût inférieur.

Les benchmarks montrent ce qu'un modèle peut accomplir. L'architecture aide à expliquer d'où viennent ces capacités et comment elles pourraient se développer.

8 Ce que cela signifie pour l'avenir de l'IA

Pendant des années, le passage à l'échelle des modèles de langage signifiait principalement ajouter des paramètres, ajouter des données et construire des piles fixes plus grandes de blocs de transformeurs.

Chaque nouvelle génération devenait plus grande, plus chère et plus exigeante à exécuter.

GPT 6 Astra pointe vers une autre voie.

Un modèle peut réutiliser les mêmes paramètres, allouer plus de calcul aux tâches difficiles et affiner sa représentation interne avant de produire son premier mot.

Cela sépare la taille du modèle de la profondeur de son raisonnement.

Au lieu de suivre un chemin de calcul fixe, le système peut ajuster la quantité de travail à la difficulté d'un problème spécifique.

Cela pourrait changer à la fois les performances du modèle et l'économie de l'utilisation de l'IA. La même intelligence pourrait fonctionner en mode rapide et peu coûteux pour les demandes simples, puis augmenter sa profondeur de calcul lorsqu'une tâche nécessite vraiment plus de raisonnement.

La récurrence revient dans les modèles de langage. Cette fois, elle opère non pas principalement entre les mots, mais à l'intérieur du processus qui les crée.

La prochaine génération de systèmes pourrait ne pas devenir plus puissante seulement parce qu'elle contient plus de paramètres.

Leur avantage déterminant pourrait être de savoir quand une bonne réponse a déjà été trouvée et quand il vaut la peine de faire un tour de boucle interne de plus.

Sources

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux