Stiamo costruendo sistemi di IA auto-miglioranti per il software alla base dell'IA moderna. Il nostro primo prodotto genera e ottimizza software GPU di basso livello, per poi verificarne il lavoro con test e benchmark.
Oggi lanciamo INT21: la prima azienda a realizzare sciami di agenti IA auto-miglioranti, applicati all'infrastruttura dell'IA.
Il Livello che la Maggior Parte delle Persone Non Vede
La maggior parte delle conversazioni sui progressi dell'IA si concentra sui modelli. Ma ogni modello dipende da un livello meno visibile: il software che dice alle GPU come eseguire ogni operazione.
Questo software ha un effetto sproporzionato su velocità e costi. Ed è anche difficile da costruire. Raggiungere le prestazioni migliori su una nuova GPU richiede spesso specialisti che comprendono sia l'algoritmo che l'hardware con una profondità straordinaria.
INT21 esiste per rendere questo lavoro più scalabile. Chiamiamo questa nuova categoria Infrastruttura di Calcolo Auto-Migliorante.
Il Nostro Primo Prodotto: PTX Kernel Factory
PTX Kernel Factory è un sistema di IA che genera e migliora software per GPU NVIDIA. Un team definisce l'operazione, i requisiti e la misura del successo. La factory scrive un'implementazione, la testa, la misura sull'hardware di destinazione, impara dal risultato e ripete.
Le prime quattro implementazioni prodotte da PTX Kernel Factory sono open source oggi. Il prodotto sta anche entrando in beta, con accesso anticipato disponibile su int21.ai.
Per i carichi di lavoro IA in esecuzione su GPU NVIDIA, ogni operazione del modello diventa infine istruzioni eseguite dall'hardware. Un kernel GPU è il piccolo programma specializzato responsabile di una di queste operazioni, come la normalizzazione, l'attenzione o lo spostamento dei dati attraverso la memoria. Migliaia di questi kernel operano sotto ogni lavoro di training e applicazione IA.
PTX è il linguaggio GPU di basso livello, simile all'assembly, di NVIDIA. Si trova tra il software GPU di livello superiore e le istruzioni macchina finali eseguite dall'hardware, rendendolo uno dei livelli programmabili più vicini nello stack NVIDIA.
Lavorare a questo livello offre un controllo preciso su come i dati si muovono attraverso la memoria, come i thread cooperano, quando il lavoro viene sincronizzato e quali istruzioni GPU specializzate vengono utilizzate. Queste scelte possono determinare se una GPU costosa passa il tempo a lavorare o ad aspettare.
Molto pochi ingegneri sanno scrivere e ottimizzare PTX bene. Il lavoro richiede una combinazione rara di conoscenza degli algoritmi, competenza nell'architettura GPU, rigore numerico e intuizione delle prestazioni. Strumenti, librerie e compilatori di livello superiore rendono lo sviluppo GPU accessibile a molte più persone, ma quando una nuova operazione IA non ha un'implementazione matura, o quando le astrazioni esistenti non possono raggiungere le prestazioni richieste, questa scarsa competenza di basso livello diventa un collo di bottiglia.
È anche eccezionalmente difficile. Un kernel può sembrare corretto ma fallire su un input raro. Può essere veloce per una forma e lento per un'altra. Può usare troppi registri, spostare troppi dati o funzionare bene su Hopper e regredire su Blackwell. Anche gli ingegneri esperti devono testare molte idee, e la maggior parte di queste idee non funziona. Ogni generazione hardware cambia parte del problema.
Questa combinazione rende PTX un primo banco di prova ideale per INT21: è tecnicamente impegnativo, economicamente importante e oggettivamente misurabile. Un kernel generato è corretto o non lo è. È più veloce o non lo è.
PTX Kernel Factory trasforma il ciclo esperto di scrittura, test, profilazione e revisione del codice GPU di basso livello in un processo che può funzionare in modo continuo e imparare dai suoi risultati.
Come Funziona PTX Kernel Factory
L'interfaccia è intenzionalmente semplice:
- Descrivi l'operazione. Definisci cosa deve fare il kernel e gli input che deve supportare.
- Imposta i requisiti. Fornisci test di correttezza, hardware di destinazione e eventuali vincoli di integrazione.
- Definisci il successo. Scegli la metrica delle prestazioni che il sistema deve ottimizzare.
Da lì, la factory esegue un processo di ingegneria a lungo termine. Genera implementazioni candidate, le compila, rifiuta i risultati errati, esegue benchmark delle candidate valide e usa le prove per guidare il round successivo.
Le implementazioni rilasciate combinano CUDA C++ con PTX inline, dando al sistema il controllo sui dettagli hardware che gli strumenti di livello superiore possono nascondere intenzionalmente. Invece di affidarsi a un singolo agente per produrre una risposta una tantum, PTX Kernel Factory coordina più agenti IA in questo ciclo.
Gli ingegneri umani definiscono ancora l'obiettivo, i vincoli e i criteri di accettazione. PTX Kernel Factory automatizza la costosa ricerca tra una specifica chiara e un'implementazione solida.
Cosa Intendiamo per Auto-Miglioramento
Un agente di programmazione può produrre una risposta. Un sistema di ingegneria affidabile deve anche determinare se la risposta funziona, capire perché un tentativo è fallito e portare conoscenze utili nel tentativo successivo.
Questo è ciò che intendiamo per auto-miglioramento.
La maggior parte degli sforzi in questo spazio si concentra sull'auto-miglioramento dell'IA stessa. Noi stiamo seguendo un percorso fondamentalmente diverso, in cui gli sciami di agenti auto-migliorano l'infrastruttura su cui operano, preservando il controllo umano mentre continuano a migliorare le prestazioni con ogni ciclo produttivo.
La sfida è meno sulla produzione di un kernel plausibile, e più sulla costruzione di un sistema in grado di rifiutare migliaia di tentativi sbagliati, fragili o fuorvianti, preservare le poche lezioni che contano e continuare a migliorare senza allontanarsi dalla correttezza.
PTX Kernel Factory non tratta ogni generazione come un prompt fresco. Preserva scoperte utili da esperimenti riusciti e falliti, permettendo al lavoro successivo di basarsi su prove precedenti. L'obiettivo è migliorare il processo che produce il codice.
È così che le prestazioni della factory si accumulano nel tempo. Ogni generazione inizia con più prove su cosa funziona, cosa fallisce e quali direzioni vale la pena esplorare.
La nostra tesi più ampia è:
Usa il calcolo per migliorare il calcolo.
L'intelligenza non è solo ciò che un modello sa. È la capacità di cercare, testare, ricordare, correggere e migliorare. Crediamo che i sistemi che rendono queste capacità cumulative diventeranno una parte importante della futura infrastruttura di calcolo e dell'evoluzione auto-migliorante più ampia nell'IA.
La Nostra Prima Prova: Due Carichi di Lavoro IA Molto Diversi
Per il primo rilascio pubblico, abbiamo scelto due carichi di lavoro che testano abilità diverse.
RMSNorm è un'operazione comune utilizzata in tutti i modelli linguistici moderni. È matura, ampiamente compresa e ha già implementazioni umane scritte molto valide. Testa se la factory può competere su lavori consolidati.
Kimi Delta Attention (KDA) è un meccanismo di attenzione più recente. È più specializzato e ha meno schemi di implementazione consolidati. Testa se la factory può adattarsi rapidamente a un carico di lavoro di ricerca più recente.
Abbiamo confrontato le implementazioni generate con baseline umane ben ottimizzate: QuACK per RMSNorm e l'implementazione FlashKDA basata su CUTLASS per KDA. I confronti sono stati eseguiti sullo stesso hardware con controlli di correttezza prima della misurazione dei tempi.
Punti Salienti dei Benchmark
Carico di lavoro
Hardware
Risultato rispetto alla baseline esperta
KDA
NVIDIA GH200, Hopper
Da 1,24x a 1,59x più veloce in sei scenari a lunghezza fissa e variabile
KDA
NVIDIA B200, Blackwell
1,42x più veloce attraverso l'interfaccia pubblica standard e 1,52x più veloce in un'integrazione ottimizzata
RMSNorm
NVIDIA GH200, Hopper
8,17% più veloce in media geometrica su 11 casi forward utilizzando un formato AI comune a 16 bit; dal 15% al 34% più veloce in confronti backward selezionati
RMSNorm
NVIDIA B200, Blackwell
Più veloce in tutti i 126 casi confrontabili nell'intera matrice di benchmark predefinita
Questi sono risultati di benchmark a livello di operatore, non affermazioni su velocizzazioni dell'intero modello. L'effetto su un'applicazione dipende dal suo modello, carico di lavoro, forme, stack software e da quanto tempo totale trascorre nell'operazione ottimizzata.
Riportiamo anche i risultati meno lusinghieri. Nella matrice RMSNorm Hopper, due altri formati numerici includevano piccole regressioni; i casi più lenti erano inferiori dello 0,42% e dello 0,84% rispetto a QuACK. Preferiamo pubblicare il confine del risultato piuttosto che nasconderlo dietro un singolo numero favorevole.
La Correttezza Viene Prima della Velocità
Un kernel veloce è inutile se cambia il risultato o fallisce su input reali.
Ogni confronto delle prestazioni inizia quindi con la correttezza:
- L'implementazione B200 KDA ha superato tutti i 580 test a monte.
- L'implementazione Hopper KDA ha superato 584 test a monte e 235 test del pacchetto sul sistema GH200 validato.
- Le implementazioni RMSNorm hanno superato le loro suite complete di pacchetti sull'hardware validato: 48 test più 65 subtest su GH200 e 66 test su B200.
Le suite coprono diversi tipi di dati, dimensioni di input, sequenze a lunghezza fissa e variabile, stato opzionale, percorsi forward e backward dove supportati e casi limite difficili.
I benchmark possono comunque essere specifici dell'ambiente, quindi ogni repository include il codice sorgente, i comandi di test, il metodo di misurazione, le versioni software e i report grezzi o generati necessari per ispezionare e riprodurre i risultati.
Perché Iniziare Qui
I kernel GPU sono un primo test utile per il nostro approccio perché il feedback è inesorabile.
L'output è corretto o non lo è. L'implementazione è più veloce o non lo è. Una modifica può essere compilata, testata e misurata. Il progresso è basato su prove, non giudicato da quanto convincente suona il testo generato.
L'ottimizzazione dei kernel si trova anche a un collo di bottiglia importante. I modelli IA si stanno evolvendo rapidamente, l'hardware cambia ogni generazione e l'offerta di competenze di ottimizzazione di basso livello non può crescere allo stesso ritmo.
Trasformare più di questo lavoro in un sistema ripetibile potrebbe aiutare i team a:
- Portare più velocemente in produzione le nuove operazioni dei modelli.
- Fare un uso migliore delle nuove generazioni di GPU.
- Esplorare idee di ottimizzazione che sarebbero troppo costose da testare manualmente.
- Riservare il tempo degli esperti per decisioni di architettura, requisiti e a livello di sistema.
Non si tratta di rimuovere gli ingegneri. Si tratta di dare a un piccolo numero di esperti più leva.
Open Source delle Prime Quattro Componenti della Factory
Oggi rilasciamo:
- Int21-AI/KDA-B200: Kimi Delta Attention per Blackwell, validata su NVIDIA B200.
- Int21-AI/KDA-H100: Kimi Delta Attention per Hopper, validata su NVIDIA GH200.
- Int21-AI/RMSNorm-B200: RMSNorm per Blackwell, validata su NVIDIA B200.
- Int21-AI/RMSNorm-H100: RMSNorm per Hopper, validata su NVIDIA GH200.
Pubbliciamo il codice perché le affermazioni sulle prestazioni dovrebbero essere ispezionabili. Gli sviluppatori dovrebbero essere in grado di leggere l'implementazione, eseguire i test, riprodurre i benchmark e sfidare i risultati.
Questi rilasci non sono il prodotto finale. Sono la prima prova pubblica che la factory può produrre software di basso livello utile su carichi di lavoro consolidati ed emergenti, e su due generazioni di hardware NVIDIA.
Chi Siamo
INT21 è stata fondata da Bing Xu nell'aprile 2026 come azienda nativa dell'IA, costruita su un'idea semplice: la capacità ingegneristica dell'azienda dovrebbe scalare con il calcolo.
Bing è stato coautore dell'articolo originale sulle Generative Adversarial Nets, il creatore originale del pacchetto Python di XGBoost e co-creatore di MXNet e AITemplate.
Nel febbraio 2025, ha coautorato il primo lavoro di NVIDIA sulla generazione agentica di kernel GPU, utilizzando un modello di ragionamento e scaling al momento dell'inferenza per generare e ottimizzare kernel di attenzione. Prima di INT21, Bing era un Distinguished Engineer presso NVIDIA. È entrato in NVIDIA dopo l'acquisizione di HippoML, la startup di inferenza GPU che ha cofondato e guidato come CEO.
Una Nuova Era del Calcolo
PTX Kernel Factory è ora in beta per team che costruiscono modelli IA, sistemi di inferenza, piattaforme di training e altri prodotti ad alta intensità GPU.
Il punto di partenza può essere un'operazione troppo lenta, una nuova architettura senza un kernel maturo o un carico di lavoro importante che non ha giustificato settimane di tempo specialistico. Il team fornisce il problema e la definizione di successo. La factory si assume la ricerca.
PTX Kernel Factory è anche il primo passo in una direzione più ampia per INT21 e per il settore più in generale.
La maggior parte dell'infrastruttura di calcolo odierna è statica: le persone la scrivono, la ottimizzano e la revisionano quando i requisiti o l'hardware cambiano. I sistemi IA possono generare output impressionanti, ma distribuirli in modo affidabile in produzione, su larga scala, rimane in gran parte irrisolto.
Crediamo che più di questa infrastruttura diventerà adattiva. I sistemi testeranno il proprio lavoro, preserveranno ciò che imparano e miglioreranno il modo in cui risolvono il problema successivo.
Stiamo iniziando con uno dei livelli più difficili e misurabili dello stack. La conoscenza umana non scala, ma gli sciami di agenti possono continuare a migliorare con ogni esecuzione. L'infrastruttura di calcolo auto-migliorante è un cambiamento fondamentale nel modo in cui viene costruita l'IA.
Descrivi il kernel. Definisci il successo. Lascia che la factory migliori l'implementazione.





