Présentation de INT21 et de PTX Kernel Factory

@int21_ai
ANGLAIS16 juin 2026
110K
8
0
0
5

TL;DR

INT21 a lancé PTX Kernel Factory, un systÚme d'IA qui automatise la création et l'optimisation des kernels GPU NVIDIA, offrant des gains de performance significatifs par rapport aux références établies par des experts humains.

Nous construisons des systÚmes d'IA auto-améliorants pour le logiciel sous-jacent à l'IA moderne. Notre premier produit génÚre et optimise des logiciels GPU de bas niveau, puis valide son travail par des tests et des benchmarks.

Aujourd'hui, nous lançons INT21 : la premiÚre entreprise à réaliser des essaims d'agents d'IA auto-améliorants, appliqués à l'infrastructure d'IA.

La couche que la plupart des gens ne voient pas

La plupart des discussions sur les progrÚs de l'IA se concentrent sur les modÚles. Mais chaque modÚle dépend d'une couche moins visible : le logiciel qui indique aux GPU comment effectuer chaque opération.

Ce logiciel a un effet considérable sur la vitesse et le coût. Il est également difficile à construire. Atteindre les meilleures performances sur un nouveau GPU nécessite souvent des spécialistes qui comprennent à la fois l'algorithme et le matériel avec une profondeur extraordinaire.

INT21 existe pour rendre ce travail plus évolutif. Nous appelons cette nouvelle catégorie Infrastructure de calcul auto-améliorante.

Notre premier produit : PTX Kernel Factory

PTX Kernel Factory est un systÚme d'IA qui génÚre et améliore les logiciels pour les GPU NVIDIA. Une équipe définit l'opération, les exigences et la mesure du succÚs. L'usine écrit une implémentation, la teste, la mesure sur le matériel cible, apprend du résultat et recommence.

Les quatre premiĂšres implĂ©mentations produites par PTX Kernel Factory sont open source aujourd'hui. Le produit entre Ă©galement en version bĂȘta, avec un accĂšs anticipĂ© disponible sur int21.ai.

Pour les charges de travail d'IA fonctionnant sur les GPU NVIDIA, chaque opération de modÚle devient finalement des instructions exécutées par le matériel. Un noyau GPU est le petit programme spécialisé responsable d'une telle opération, comme la normalisation, l'attention ou le déplacement de données en mémoire. Des milliers de ces noyaux fonctionnent sous chaque tùche d'entraßnement et application d'IA.

PTX est le langage GPU de bas niveau, de type assembleur, de NVIDIA. Il se situe entre le logiciel GPU de plus haut niveau et les instructions machine finales exécutées par le matériel, ce qui en fait l'une des couches programmables les plus proches de la pile NVIDIA.

Travailler à ce niveau permet un contrÎle précis de la façon dont les données se déplacent en mémoire, de la coopération des threads, de la synchronisation du travail et des instructions GPU spécialisées utilisées. Ces choix peuvent déterminer si un GPU coûteux passe son temps à travailler ou à attendre.

TrÚs peu d'ingénieurs savent bien écrire et optimiser le PTX. Ce travail nécessite une combinaison rare de connaissance des algorithmes, d'expertise en architecture GPU, de rigueur numérique et d'intuition des performances. Les outils, bibliothÚques et compilateurs de plus haut niveau rendent le développement GPU accessible à beaucoup plus de personnes, mais lorsqu'une nouvelle opération d'IA n'a pas d'implémentation mature, ou lorsque les abstractions existantes ne peuvent pas atteindre les performances requises, cette expertise de bas niveau, rare, devient un goulot d'étranglement.

C'est aussi exceptionnellement difficile. Un noyau peut sembler correct tout en Ă©chouant sur une entrĂ©e rare. Il peut ĂȘtre rapide pour une forme et lent pour une autre. Il peut utiliser trop de registres, dĂ©placer trop de donnĂ©es, ou bien performer sur Hopper et rĂ©gresser sur Blackwell. MĂȘme les ingĂ©nieurs experts doivent tester de nombreuses idĂ©es, et la plupart de ces idĂ©es ne fonctionnent pas. Chaque gĂ©nĂ©ration de matĂ©riel modifie une partie du problĂšme.

Cette combinaison fait du PTX un premier terrain d'essai idéal pour INT21 : il est techniquement exigeant, économiquement important et objectivement mesurable. Un noyau généré est correct ou ne l'est pas. Il est plus rapide ou ne l'est pas.

PTX Kernel Factory transforme la boucle experte d'écriture, de test, de profilage et de révision du code GPU de bas niveau en un processus qui peut s'exécuter en continu et apprendre de ses résultats.

Comment fonctionne PTX Kernel Factory

L'interface est intentionnellement simple :

  1. Décrivez l'opération. Définissez ce que le noyau doit faire et les entrées qu'il doit prendre en charge.
  2. Définissez les exigences. Fournissez des tests de correction, le matériel cible et toutes les contraintes d'intégration.
  3. Définissez le succÚs. Choisissez la métrique de performance que le systÚme doit optimiser.

À partir de lĂ , l'usine exĂ©cute un processus d'ingĂ©nierie Ă  long horizon. Elle gĂ©nĂšre des implĂ©mentations candidates, les compile, rejette les rĂ©sultats incorrects, benchmarke les candidats valides et utilise les preuves pour guider le tour suivant.

Les implémentations publiées combinent CUDA C++ avec du PTX en ligne, donnant au systÚme un contrÎle sur les détails matériels que les outils de plus haut niveau peuvent intentionnellement cacher. PlutÎt que de s'appuyer sur un seul agent pour produire une réponse unique, PTX Kernel Factory coordonne plusieurs agents d'IA dans cette boucle.

Les ingénieurs humains définissent toujours l'objectif, les contraintes et les critÚres d'acceptation. PTX Kernel Factory automatise la recherche coûteuse entre une spécification claire et une implémentation solide.

Ce que nous entendons par auto-améliorant

Un agent de codage peut produire une réponse. Un systÚme d'ingénierie fiable doit également déterminer si la réponse fonctionne, comprendre pourquoi une tentative a échoué et transporter des connaissances utiles dans la tentative suivante.

C'est ce que nous entendons par auto-améliorant.

La plupart des efforts dans ce domaine se concentrent sur l'auto-amĂ©lioration de l'IA elle-mĂȘme. Nous empruntons une voie fondamentalement diffĂ©rente, oĂč les essaims d'agents auto-amĂ©liorent l'infrastructure sur laquelle ils s'exĂ©cutent, prĂ©servant le contrĂŽle humain tout en cumulant les performances Ă  chaque cycle de production.

Le défi consiste moins à produire un noyau plausible qu'à construire un systÚme capable de rejeter des milliers de tentatives erronées, fragiles ou trompeuses, de préserver les quelques leçons qui comptent et de continuer à s'améliorer sans dévier de la correction.

PTX Kernel Factory ne traite pas chaque génération comme une nouvelle invite. Il préserve les découvertes utiles des expériences réussies et échouées, permettant aux travaux ultérieurs de s'appuyer sur les preuves antérieures. L'objectif est d'améliorer le processus qui produit le code.

C'est ainsi que les performances de l'usine s'accumulent au fil du temps. Chaque gĂ©nĂ©ration commence avec plus de preuves sur ce qui fonctionne, ce qui Ă©choue et les directions qui valent la peine d'ĂȘtre explorĂ©es.

Notre thĂšse plus large est la suivante :

Utilisez le calcul pour améliorer le calcul.

L'intelligence n'est pas seulement ce qu'un modÚle sait. C'est la capacité de chercher, tester, se souvenir, corriger et améliorer. Nous croyons que les systÚmes qui rendent ces capacités cumulatives deviendront une partie importante de l'infrastructure de calcul future et de l'évolution auto-améliorante plus large de l'IA.

Notre premiÚre preuve : deux charges de travail d'IA trÚs différentes

Pour la premiÚre version publique, nous avons choisi deux charges de travail qui testent des capacités différentes.

RMSNorm est une opération courante utilisée dans tous les modÚles de langage modernes. Elle est mature, largement comprise et a déjà des implémentations humaines solides. Elle teste si l'usine peut rivaliser sur un travail établi.

Kimi Delta Attention (KDA) est un mécanisme d'attention plus récent. Il est plus spécialisé et a moins de modÚles d'implémentation établis. Il teste si l'usine peut s'adapter rapidement à une charge de travail de recherche plus récente.

Nous avons comparĂ© les implĂ©mentations gĂ©nĂ©rĂ©es avec des rĂ©fĂ©rences humaines bien optimisĂ©es : QuACK pour RMSNorm et l'implĂ©mentation FlashKDA basĂ©e sur CUTLASS pour KDA. Les comparaisons ont Ă©tĂ© effectuĂ©es sur le mĂȘme matĂ©riel avec des vĂ©rifications de correction avant le chronomĂ©trage.

Points saillants des benchmarks

Ce sont des résultats de benchmark au niveau de l'opérateur, et non des affirmations sur les accélérations de modÚles complets. L'effet sur une application dépend de son modÚle, de sa charge de travail, de ses formes, de sa pile logicielle et du temps total qu'elle passe dans l'opération optimisée.

Nous rapportons également les résultats moins flatteurs. Dans la matrice RMSNorm Hopper, deux autres formats de nombre ont montré de petites régressions ; les cas les plus lents étaient 0,42% et 0,84% derriÚre QuACK. Nous préférons publier la limite du résultat plutÎt que de le cacher derriÚre un seul nombre favorable.

La correction prime sur la vitesse

Un noyau rapide est inutile s'il modifie le résultat ou échoue sur des entrées réelles.

Chaque comparaison de performances commence donc par la correction :

  • L'implĂ©mentation KDA B200 a passĂ© les 580 tests en amont.
  • L'implĂ©mentation KDA Hopper a passĂ© 584 tests en amont et 235 tests de package sur le systĂšme GH200 validĂ©.
  • Les implĂ©mentations RMSNorm ont passĂ© leurs suites de packages complĂštes sur le matĂ©riel validĂ© : 48 tests plus 65 sous-tests sur GH200 et 66 tests sur B200.

Les suites couvrent différents types de données, tailles d'entrée, séquences de longueur fixe et variable, état optionnel, chemins forward et backward (lorsqu'ils sont pris en charge) et des cas limites difficiles.

Les benchmarks peuvent encore ĂȘtre spĂ©cifiques Ă  l'environnement, donc chaque dĂ©pĂŽt inclut la source, les commandes de test, la mĂ©thode de mesure, les versions logicielles et les rapports bruts ou gĂ©nĂ©rĂ©s nĂ©cessaires pour inspecter et reproduire les rĂ©sultats.

Pourquoi commencer ici

Les noyaux GPU sont un premier test utile pour notre approche car le retour d'information est impitoyable.

La sortie est correcte ou ne l'est pas. L'implĂ©mentation est plus rapide ou ne l'est pas. Un changement peut ĂȘtre compilĂ©, testĂ© et mesurĂ©. Le progrĂšs est fondĂ© sur des preuves plutĂŽt que jugĂ© par la crĂ©dibilitĂ© du texte gĂ©nĂ©rĂ©.

L'optimisation des noyaux se situe Ă©galement Ă  un goulot d'Ă©tranglement important. Les modĂšles d'IA Ă©voluent rapidement, le matĂ©riel change Ă  chaque gĂ©nĂ©ration, et l'offre d'expertise en optimisation de bas niveau ne peut pas croĂźtre au mĂȘme rythme.

Transformer une plus grande partie de ce travail en un systÚme reproductible pourrait aider les équipes à :

  • Mettre en production plus rapidement les nouvelles opĂ©rations de modĂšles.
  • Mieux utiliser les nouvelles gĂ©nĂ©rations de GPU.
  • Explorer des idĂ©es d'optimisation qui seraient trop coĂ»teuses Ă  tester manuellement.
  • RĂ©server le temps des experts pour l'architecture, les exigences et les dĂ©cisions au niveau du systĂšme.

Il ne s'agit pas de supprimer des ingénieurs. Il s'agit de donner à un petit nombre d'experts plus de levier.

Open source des quatre premiers artefacts de l'usine

Aujourd'hui, nous publions :

Nous publions le code car les affirmations de performance doivent pouvoir ĂȘtre inspectĂ©es. Les dĂ©veloppeurs doivent pouvoir lire l'implĂ©mentation, exĂ©cuter les tests, reproduire les benchmarks et contester les rĂ©sultats.

Ces versions ne sont pas le produit final. Elles sont la premiÚre preuve publique que l'usine peut produire des logiciels de bas niveau utiles sur des charges de travail établies et émergentes, et sur deux générations de matériel NVIDIA.

À propos de nous

INT21 a Ă©tĂ© fondĂ©e par Bing Xu en avril 2026 en tant qu'entreprise native de l'IA, construite sur une idĂ©e simple : la capacitĂ© d'ingĂ©nierie de l'entreprise elle-mĂȘme doit passer Ă  l'Ă©chelle avec le calcul.

Bing a été co-auteur de l'article original sur les Generative Adversarial Nets, le créateur original du package Python de XGBoost, et un co-créateur de MXNet et AITemplate.

En février 2025, il a co-écrit les premiers travaux de NVIDIA sur la génération agentique de noyaux GPU, en utilisant un modÚle de raisonnement et une mise à l'échelle au moment de l'inférence pour générer et optimiser des noyaux d'attention. Avant INT21, Bing était un ingénieur distingué chez NVIDIA. Il a rejoint NVIDIA aprÚs l'acquisition de HippoML, la startup d'inférence GPU qu'il a co-fondée et dirigée en tant que PDG.

Une nouvelle Ăšre de calcul

PTX Kernel Factory est maintenant en version bĂȘta pour les Ă©quipes qui construisent des modĂšles d'IA, des systĂšmes d'infĂ©rence, des plateformes d'entraĂźnement et d'autres produits gourmands en GPU.

Le point de dĂ©part peut ĂȘtre une opĂ©ration trop lente, une nouvelle architecture sans noyau mature, ou une charge de travail importante qui n'a pas justifiĂ© des semaines de temps spĂ©cialisĂ©. L'Ă©quipe fournit le problĂšme et la dĂ©finition du succĂšs. L'usine prend en charge la recherche.

PTX Kernel Factory est également la premiÚre étape dans une direction plus large pour INT21, et pour l'industrie plus largement.

La plupart des infrastructures de calcul aujourd'hui sont statiques : les gens les écrivent, les optimisent et les revisitent lorsque les exigences ou le matériel changent. Les systÚmes d'IA peuvent générer des sorties impressionnantes, mais les déployer de maniÚre fiable en production, à grande échelle, reste largement non résolu.

Nous croyons qu'une plus grande partie de cette infrastructure deviendra adaptative. Elle testera son propre travail, préservera ce qu'elle apprendra et améliorera la façon dont elle résout le problÚme suivant.

Nous commençons avec l'une des couches les plus difficiles et les plus mesurables de la pile. La connaissance humaine ne passe pas à l'échelle, mais les essaims d'agents peuvent continuer à s'améliorer à chaque exécution. L'infrastructure de calcul auto-améliorante est un changement fondamental dans la façon dont l'IA est construite.

Décrivez le noyau. Définissez le succÚs. Laissez l'usine améliorer l'implémentation.

En savoir plus et demander un accÚs anticipé.

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblĂ©es, rĂ©sumez l’argument et transformez un article viral en notes rĂ©utilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pĂ©nible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prĂȘt Ă  publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux